In-Context VLA: Endowing Vision-Language-Action Models with Language via In-Context Post-Training and Agentic Tool Use
Jiarui Yang et al. · 突破传统行为克隆限制,引入上下文后训练和代理工具使用,赋予VLA动态语言理解和任务分解能力。显著提升了长程任务的泛化性和适应性,解决了静态指令无法应对复杂交互的核心瓶颈。
Jiarui Yang et al. · 突破传统行为克隆限制,引入上下文后训练和代理工具使用,赋予VLA动态语言理解和任务分解能力。显著提升了长程任务的泛化性和适应性,解决了静态指令无法应对复杂交互的核心瓶颈。
Jihoon Oh et al. · 提出通过物体中心的可操作供能(affordances)解决人-机器人具身差异,从人类视频中学习操作技能。为跨具身迁移提供了新的中间表示思路,适合研究模仿学习中的人机对齐问题。
Yuhao Pan et al. · 针对细粒度操作,提出预测手腕局部未来状态以弥补主视图与腕部视图的角色差异。该方法增强了VLA对局部接触和精细动作的感知能力,可直接集成到现有双视角VLA架构中提升精度。
Rishik Sathua et al. · 利用大型3D视觉模型对齐不同视角下的场景几何,解决视点变化导致的策略纠缠问题。提升了VLA在视角变换下的鲁棒性,为多视角融合提供了基于3D几何的新解法。
Changyuan Wang et al. · 构建专家引导的技能记忆框架,支持组合式具身操作。通过检索和复用已有技能模块,缓解数据稀缺问题,为VLA的模块化学习和长尾任务处理提供了可复用的架构组件。
He Kong et al. · 提出分层后训练方法,将扁平VLA策略升级为层次化代理,以处理长视界任务。解决了单一策略在复杂任务中的规划局限,为现有VLA模型的低成本升级提供了具体路径。
Hisham Khalil et al. · 结合可变阻抗控制与扩散策略,提升接触丰富操作中的鲁棒性。允许策略根据任务需求动态调整刚度,为需要柔顺控制的精密装配任务提供了有效的改进方案。
Chenghao Gu et al. · 提出基于视觉动作的可泛化交互式世界模型,增强未见环境下的鲁棒性。通过模拟物理交互提升世界模型的预测准确性,为低成本评估和训练提供了新的仿真替代方案。
Junfeng Li et al. · 分离共享动力学先验与具身特定控制,解决异构机器人间的迁移难题。通过解耦表示学习,提升了单一大模型在多平台部署的效率,是跨具身VLA的重要进展。
Zhe Li et al. · 针对人形机器人,提出潜空间预测世界动作模型,实现移动与操作的并发协调。突破了传统解耦控制的局限,为全身协同操作提供了端到端的解决方案。
Jiahui Zhang et al. · 引入强化学习通过“预言”机制修正纯模仿学习的过拟合问题,提升分布外鲁棒性。为VLA的后训练阶段提供了结合RL的有效范式,有助于解决长尾失败案例。
Jiayi Chen et al. · 利用离散流匹配进行迭代动作细化,解决现有解码范式的局限性。提升了动作生成的精度和收敛速度,为基于Token化的VLA模型提供了更高效的推理优化方法。
Jiahao Liu et al. · 提出时间路由动作块和时序相位权威机制,优化接触丰富操作中的决策 horizon。有效处理程序边界跨越问题,提升了长视界任务中动作序列的逻辑一致性。
Ziyang Rao et al. · 提出基于流匹配几何的无成本不确定性代理,用于检测VLA失败。为基于流的VLA模型提供了内置的安全监控机制,无需额外计算开销即可提升部署安全性。
Zehua Fan et al. · 将世界动作模型扩展到移动操作,引入预见链处理场景级动态。填补了WAM在移动机器人领域的空白,为全自主移动操作提供了新的建模视角。
Siyu Wu et al. · 在WAM中引入触觉不对称注意力,捕捉滑动和卡滞等细微接触信号。填补了视觉主导WAM在触觉信息利用上的空白,显著提升接触丰富操作的性能。
Weili Zeng et al. · 将世界模型的想象折叠进预测表示,避免昂贵的生成分支,实现超高效具身控制。大幅降低计算成本,为资源受限设备上的实时VLA部署提供了可行方案。
Yuanruyi et al. · 提出历史证据路由适配器,解决遮挡下的物理预测问题。增强了潜空间世界模型在部分可观测环境下的推理能力,适用于复杂场景的VLA规划。
Jiarui Yang et al. · 从人类视频中学习3D感知潜动作,构建可泛化的机器人世界模型。解决了动作标注稀缺问题,为利用大规模人类视频数据训练VLA提供了新途径。
Xi Zeng et al. · 提出JEPA世界模型的动力学相关表示学习目标,防止全局潜空间崩溃。提升了世界模型对物理状态的保留能力,为基于对比学习的VLA预训练提供了理论支撑。
RA Team · 通过双重动作对齐处理异构数据源(人类视频、仿真、真机)中的标签缺失和不兼容问题。虽涉及数据扩展,但缺乏具体的架构创新或SOTA对比,更多是工程层面的数据清洗策略。
Yixiang Chen et al. · 评估动作条件世界模型在未见识具身上的泛化能力,区分物理动力学学习与视觉模式记忆。作为基准测试和分析论文,有助于理解世界模型的边界,但本身未提出新算法。
Zhixiang Chen et al. · 一种针对Isaac Sim仿真器的模糊测试工具,用于发现物理引擎缺陷。虽服务于Embodied AI基础设施,但属于软件测试领域,与VLA核心算法无直接关联。
Alperen Kenan et al. · 通过手写轨迹学习人类动力学并评估类人程度。实验局限于简单2D轨迹,缺乏通用操作场景验证,属于基础LfD研究,对当前主流VLA架构参考价值有限。
Yang Liu et al. · 提出统一多模态指令和生成的扩散VLA模型,旨在减少层级开销。虽架构新颖,但摘要未展示显著的SOTA超越证据,且类似多模态生成工作较多,需进一步验证实效。
Christo Kurisummoottil Thomas et al. · 探讨全息数字孪生在物理AI网络中的应用,偏向系统架构和概念框架。缺乏具体的VLA算法贡献或实验验证,属于宏观系统设计讨论。
Zhengying Zhu et al. · 关注近传感器计算以降低触觉感知延迟,属于硬件/边缘计算优化。虽对触觉VLA有潜在价值,但未涉及算法层面的VLA集成或性能提升。
Shuai Wang et al. · 提出用于评估仿真引擎和视频世界模型物理保真度的基准。重要但非紧急,为后续研究提供评估标准,本身不贡献新算法。
Jinsong Hong et al. · 通过仿真侧动力学归一化解决并联腿机构的Sim-to-Real差距。针对特定机械结构,通用性较低,且未涉及VLA高层策略。
Wenhao Lin et al. · 为LLM代理提供基于风险感知世界模型的高效运行时护栏。侧重软件安全和LLM代理,而非物理机器人的具身操作安全。
Edward Y. Chang · 提出世界模型的一致性契约,侧重形式化验证和系统可靠性。理论性强,但缺乏直接的VLA算法应用路径。
Deyi Zhu et al. · 无人机图像目标导航的不确定性感知世界模型。侧重空中导航,与地面机器人操作场景差异较大,且未涉及操作任务。
Haoyang Tong (MAIS & NLPR et al. · 像素空间生成模型的能耗引导流匹配,侧重生成质量。虽可用于数据增强,但非VLA核心控制算法,应用路径间接。
Ziqi Cai et al. · 多人环境下的世界模型,解决视图纠缠和冗余计算。虽涉及多智能体,但主要贡献在视频生成效率,对单机器人VLA的直接复用性有限。
Yuang Geng et al. · 端到端视觉控制的形式化验证,侧重安全性分析。理论重要,但非算法性能提升,属于验证与安全范畴。
Zhixiong Yue et al. · 流匹配模型的RL对齐优化,侧重文本到图像生成。虽技术通用,但摘要未明确其在机器人控制中的应用,暂归为相邻领域。
Ruiqi Xian et al. · arXiv:2606.13460v3 Announce Type: replace Abstract: Semantic 3D occupancy provides a voxelized world state for autonomous driving and robot decision making, but object and rare-class errors can affect free-space interpretation, collision checking, and temporal state propagation. We show that a common VLM strategy, aligning 3D voxel or object features with crop-caption embeddings, improves text-space similarity without reliably improving closed-set occupancy mIoU. Motivated by this mismatch, we p
Hailong Jiang et al. · arXiv:2608.05371v1 Announce Type: new Abstract: World models learn latent states that summarize interaction histories, evolve over time, and support prediction, simulation, or planning. Most existing world models represent these states using classical vectors, probability distributions, recurrent hidden states, or transformer activations. In this paper, we introduce Quantum-Structured World Models (QSWMs), a quantum-inspired framework for predictive world modeling with structured latent states,