Cosmos 3: Omnimodal World Models for Physical AI
NVIDIA et al. · NVIDIA发布Cosmos 3,提出全能模态世界模型,统一处理语言、图像、视频、音频及动作序列。显著推进了物理AI的世界建模能力,为VLA提供强大的先验和仿真基础,超越当前SOTA。
NVIDIA et al. · NVIDIA发布Cosmos 3,提出全能模态世界模型,统一处理语言、图像、视频、音频及动作序列。显著推进了物理AI的世界建模能力,为VLA提供强大的先验和仿真基础,超越当前SOTA。
提出InSight框架,通过在基元动作层面引导VLA实现自主技能获取,突破训练数据限制。为VLA的零样本技能扩展提供新路径,具有较高复用价值。
Haeone Lee et al. · 提出SPACE方法以利用跨机器人数据进行策略学习,解决多形态泛化问题。针对Open-X等大规模异构数据场景,为构建通用机器人策略提供数据处理新思路。
Sabrina Bodmer et al. · 结合优化引导扩散模型,确保生成的抓取或轨迹符合物理约束。解决了生成式策略中分布有效但物理不可行的问题,提升了实际部署的可靠性。
Danze Chen et al. · 提出几何引导的VLA适应方法,从合成视频中筛选高质量伪动作进行训练。解决了合成数据噪声大、对齐难的问题,为低成本数据扩充提供可行方案。
Yue Peng et al. · 引入几何归纳偏置到VLA中,将2D图像token映射到3D空间坐标。增强了模型对物理空间的几何理解能力,有助于提升复杂操作任务中的泛化性能。
Ziyan Feng et al. · 提出基于噪声统计的视触觉反射控制方法,实现力敏感操作。填补了触觉VLA在快速响应和精细力控方面的空白,对灵巧操作研究具有重要参考价值。
Jisang Han et al. · 提出几何动作模型(GAM),通过3D物理推理增强通用机器人策略的空间理解。相比传统VLA,更强调几何一致性,为解决长程依赖和空间错位提供新视角。
Yuhang Huang et al. · 构建具备多视图3D一致性的世界基础模型PAIWorld,解决现有WFM单视角局限。为VLA提供更准确的物理状态预测,是迈向具身智能世界模型的重要一步。
Yangtao Chen et al. · 利用生成式世界模型生成第一人称手部操作数据,解决灵巧手数据稀缺问题。为数据驱动的VLA和灵巧策略训练提供了可扩展的数据源,实用性强。
Feng Chen et al. · 提出动态执行承诺机制,优化VLA的动作分块(action chunking)策略。通过自适应调整预测 horizon 平衡推理成本与执行精度,具有直接的工程应用价值。
Soham Patil et al. · 提出仅凭视觉和本体感觉估计接触力的方法,减少对触觉传感器的依赖。为低成本灵巧操作提供新范式,填补了无触觉VLA感知的空白。
Shivani Kamtikar et al. · 提出纯触觉驱动的探索方法TACTFUL,用于受限环境下的物体定位识别。强化了触觉在VLA中的作用,适用于视觉受阻场景,具有独特应用价值。
Kailin Lyu et al. · 提出TouchThinker,通过大规模数据和动作感知表示扩展触觉常识推理。填补了触觉VLA在开放世界推理方面的空白,提升了触觉模态的语义理解能力。
提出基于开放词汇的对象级表示用于室内视觉重定位,提升语义感知能力。属于导航/SLAM领域,虽与Embodied AI相关但非VLA核心操作控制方法。
Davide Corsi et al. · 探讨基础模型在机器人控制中的可验证性与安全性问题,旨在解决黑盒模型的不可解释性。属于安全/形式化验证方向,对VLA部署有参考意义但非直接算法改进。
Xin Liu et al. · 利用推理时模拟器闭环优化来增强布料操作的鲁棒性。针对特定非刚性物体操作,虽有效但缺乏通用VLA架构层面的创新,属于特定任务优化。
Pranjal Mishra et al. · 基于高斯泼溅技术从RGB-D视频重建可交互的数字孪生体。侧重于环境建模与仿真资产生成,为机器人训练提供工具,而非直接的控制策略或VLA模型。
Xinyao Qin et al. · 提出重试监督的价值学习方法,处理模仿学习中包含错误和修正的人类演示数据。改进了IL的数据利用效率,但未涉及VLA架构或多模态对齐的核心创新。
Zhihao Wang et al. · 探索世界价值模型在机器人操作中的应用,强调深度时间理解以准确估计价值。属于世界模型与RL结合的前沿探索,但目前主要停留在理论框架或初步实验阶段。
Xibai Wang · 结合奖励中心与ReST-MCTS框架,提升高不确定性环境下的决策鲁棒性。属于规划与控制算法改进,未直接针对VLA的大模型特性进行优化。
Kai Tang et al. · 针对双臂布料平整任务提出随机到目标的策略。专注于特定非刚性物体操作技巧,缺乏通用性,不属于VLA核心研究方向。
Wei-Cheng Tseng et al. · 提出基于自洽视频生成的评估指标SC3-Eval,用于低成本评估机器人基础模型。属于评估方法论创新,虽重要但不直接贡献于模型性能提升。
Yimeng Qin et al. · 针对软体藤蔓机器人提出全景视觉运动控制方法。属于特殊形态机器人的专用控制策略,与主流刚性机械臂VLA研究关联度较低。
Qiman Wu et al. · 致力于降低SOTA视觉Transformer的训练门槛,使其更易访问。作为底层视觉编码器优化,虽服务于VLA但本身不涉及时序动作预测或多模态对齐核心。
Conventional visual navigation policies often struggle with myopic decision-making and mode collapse in complex environments. While world models offer a promising alternative, existing paradigms typically isolate perception, generation, and control, failing to capture their shared spatio-temporal dynamics. In this paper, we propose NavWM, a unified navigation world model that seamlessly integrates latent world reasoning, multimodal action prediction, and controllable visual generation. At its co
Bin Qiu et al. · 通过对抗姿态正则化使灵巧手弹钢琴动作更像人类。专注于特定任务的运动学逼真度,非通用VLA或操作策略创新。
Yujia Chen et al. · 结合模拟器和E-process理论,提供Sim-to-Real的性能置信序列。属于统计验证方法,虽对机器人安全评估有用,但非核心控制算法。
Qingyang Wang et al. · 提出MinInter方法减少模仿学习数据增强中的轨迹插值误差。改进了数据预处理细节,属于工程优化,对VLA整体架构影响有限。
Haidong Hou et al. · 结合世界模型和动量目标进行动力学感知蒸馏,优化楼梯行走平滑度。专注于足式机器人 locomotion,与操作型VLA研究重点不同。
Jinda Du et al. · 介绍MILE系统,包括外骨骼和视触觉机械手,用于灵巧操作数据采集。侧重硬件平台和数据集构建,虽重要但非算法模型创新。
Pratyaksh Rao et al. · 基于JEPA架构学习四旋翼长视界世界模型,实现零样本Sim-to-Real控制。专注于无人机飞行控制,与地面操作型VLA差异较大。
Yikai Lu et al. · 提出分块世界模型的结构认证方法,分析智能体能力的局限性。属于理论分析工作,对理解世界模型边界有帮助,但非直接的方法论创新。
Xin Wang et al. · 提出具有反事实可控性的自主视频生成方法,用于自我演进的世界模型。侧重于视频生成的控制性,虽与WFM相关,但未明确结合机器人控制闭环。
Bingxuan Li et al. · 关注视觉世界模型评估中的长尾分布问题,提出改进评估方法。属于评估体系完善,对模型本身性能提升无直接贡献。
Yuke Zhao et al. · 提出WorldOlympiad基准,全面诊断视频世界模型的物理忠实度和几何一致性。重要的评估工具,但本身不提供新的模型架构或训练方法。