ViTacWorld: Scaling Visuo-Tactile World Models for Contact-Rich Robot Manipulation
Yunao Huang et al. · 提出ViTacWorld,首个可扩展的视触觉世界模型,专门解决接触丰富操作中的不可见物理线索问题。填补了触觉VLA与世界模型结合的空白,有望显著提升灵巧操作的泛化性与鲁棒性,属战略级突破。
Yunao Huang et al. · 提出ViTacWorld,首个可扩展的视触觉世界模型,专门解决接触丰富操作中的不可见物理线索问题。填补了触觉VLA与世界模型结合的空白,有望显著提升灵巧操作的泛化性与鲁棒性,属战略级突破。
Kun Lei et al. · 提出基于真实世界强化学习的机械臂操作策略,直接解决Sim2Real鸿沟。若提供代码或具体RL算法细节,可作为VLA底层执行器微调或RLHF的重要参考,具有工程复用价值。
Leesai Park et al. · 提出结合扩散策略与MPPI的后验均值估计方法,实现无梯度引导的动作生成。解决了扩散模型中难以处理非微分安全约束的问题,为VLA推理阶段的约束优化提供了可复用的新算子。
Chaoqi Liu et al. · 针对视觉运动策略中的动作Token化问题,提出有序动作Token机制以缩短序列长度并提升效率。直接优化VLA模型的离散化接口,对提升RT-2等基于Transformer架构的推理速度有明确工程价值。
Jan Ole von Hartz et al. · 针对动态环境下的双臂协作,提出多智能体合作策略以提升样本效率。通过建模相对参考帧解决双臂协同难题,为VLA中的复杂多臂操作任务提供了新的训练范式和数据增强思路。
Byungjun Kim et al. · 通过机器人渲染技术解耦世界模型中的机器人运动与环境动力学,提升预测准确性。该方法为构建更精确的Action-Conditioned World Model提供了新的工程路径,有助于改进VLA的长期规划能力。
Masaki Murooka et al. · 提出GuidedAttention框架,使视觉运动策略具备可解释性和可纠正性,提升OOD鲁棒性。允许人类干预注意力机制,为VLA模型的安全部署与人机协作提供了实用的调试与优化手段。
Shilin Ma et al. · 提出SAFE-Pruner,通过语义注意力和未来感知机制修剪VLA模型中的视觉Token。显著降低推理计算量,直接解决VLA实时性瓶颈,具有明确的工程应用价值和代码复用潜力。
Guanxiong Chen et al. · 利用VLA代理自动化Real2Sim流程,恢复几何与物理参数。解决了机器人仿真重建繁琐的痛点,为VLA数据生成和Sim2Real迁移提供了高效的自动化管道,具有极高的工程复用价值。
Jun-Gill Kang et al. · 聚焦四足机器人在野外环境的多技能敏捷运动,属于移动机器人底层控制范畴。虽涉及感知与运动结合,但缺乏VLA核心的语言指令到动作映射或高层语义推理,非VLA核心进展。
Johannes A. Stork · 综述性或概念性文章,探讨超越模仿学习在真实世界的应用。缺乏具体的VLA架构创新或量化Benchmark对比,更多是领域愿景阐述,适合了解趋势但不具备即时技术复用性。
X Square Robot · IEEE Spectrum专栏文章,讨论通用机器人基础软件栈的构建理念。属于行业观点/综述,无具体算法贡献或实验数据,无法作为技术研究直接引用,仅具宏观参考价值。
Liane Galanti et al. · 探讨通过物理代理(Physical Agency)解决通用机器人编排缺口,强调感知、规划与控制的整合。偏向理论框架与系统设计思路,缺乏具体算法实现或Benchmark验证,暂归为值得了解的架构思考。
Suman Navaratnarajah et al. · 引入针对空中MLLM代理的任务级零样本评估基准。虽然涉及MLLM在机器人中的应用,但聚焦于无人机而非地面操作臂,且主要为评估体系而非核心算法创新,对主流VLA研究参考有限。
Francesco Cufino et al. · 研究合规机器人在人群环境中的非预抓取推挤操作,侧重安全控制与物理交互。虽涉及操作,但主要关注底层力学合规性,未结合语言指令或高层语义理解,非VLA核心方向。
Honglu He et al. · 发布面向工业灵巧操作的软硬件基准平台,涵盖线缆布线等任务。作为重要数据集/Benchmark补充,有助于推动VLA在工业场景的落地,但本身无新算法贡献,属基础设施类工作。
Afzal Ahmad et al. · 提出基于任务命令的条件计算跳过机制以加速多任务推理。虽可应用于VLA加速,但主要贡献在于硬件加速器架构或通用AI系统优化,非VLA特有的算法或模型结构创新。
Hoang Le et al. · 从单张图像推断质量、刚度等物理属性,服务于仿真与Embodied AI。虽为VLA提供潜在的状态感知输入,但属于纯视觉/物理推理模块,未涉及动作生成或语言对齐,属相邻领域工具。
Siqi Fan et al. · 针对机器人超声扫描提出动作条件世界模型,用于探头引导。属于高度垂直的医疗机器人应用,缺乏通用性,且未展示在标准VLA Benchmark上的表现,对通用VLA研究参考有限。
Laura Babayeva et al. · 设计并评估覆盖皮肤的机械臂的触觉退缩反射,侧重生物启发控制与安全机制。虽涉及触觉,但属于底层反射弧设计,未结合高层语义或VLA架构,非当前VLA研究热点。
Kaiwen Wang et al. · 提出小波相位扩散方法以实现结构一致的Sim2Real翻译。主要贡献在计算机视觉域适应算法,虽可用于VLA数据增强,但未直接结合机器人控制或语言指令,属辅助性技术。
Zhen Lin · 提出面向生成式世界模型的会话中心运行时,支持状态分叉与回溯。属于系统软件工程层面的优化,旨在提升世界模型作为模拟器的可用性,非VLA核心算法创新。
Edward Y. Chang · 定义世界模型作为物化视图的一致性契约,解决数据管理问题。偏向数据库与系统一致性理论,与VLA模型本身的感知-决策-行动闭环关联较弱,属基础设施层研究。
Shaohao Rui et al. · 通过双向自回归改进开源交互式视频世界模型。虽涉及视频预测,但重点在于生成模型架构优化,未明确展示其在机器人控制或VLA规划中的具体应用效果,属相邻领域进展。
Xiangteng Zhang et al. · 理论分析受控世界模型的可识别性,探讨JEPAs框架下的动力学推断。属于深度学习理论基础研究,虽对理解世界模型有帮助,但缺乏直接的VLA应用路径或实验验证,门槛较高。