Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories
Xiaomi Robotics Team et al. · 小米发布基于 10 万小时真实世界轨迹训练的 VLA 基础模型,具备开箱即用的泛化能力。数据规模巨大且涵盖未见环境,显著推动了 VLA 从仿真到真实世界的迁移 SOTA。
Xiaomi Robotics Team et al. · 小米发布基于 10 万小时真实世界轨迹训练的 VLA 基础模型,具备开箱即用的泛化能力。数据规模巨大且涵盖未见环境,显著推动了 VLA 从仿真到真实世界的迁移 SOTA。
Aileen Liao et al. · 利用 LLM 简化杂乱环境以辅助规划与控制,解决了多物体碰撞和复杂性扩展问题。方法可直接集成到现有 VLA 推理流程中,提升复杂场景下的鲁棒性。
Seonsoo Kim et al. · 提出可修正的去噪机制,允许在时间视界内回溯并修正扩散策略的预测错误。相比标准 Diffusion Policy,显著提升了序列预测的灵活性和准确性,代码易于复用。
Roger Sala Sisó et al. · 针对零售人形机器人提出高效的后训练和经验驱动学习框架,解决实验室到真实商店的分布偏移问题。提供了具体的工程化部署路径和数据增强策略。
Xingyu Ren et al. · 研究 VLA 专家池的动态路由与新专家引入策略,通过分割条件优化部署成本与性能平衡。为大规模 VLA 系统的管理和扩展提供了实用的架构洞见。
Wendi Chen et al. · 提出结合视觉和力觉的端到端扩散策略,利用结构化的慢-快学习机制处理接触丰富操作。填补了触觉 VLA 方向的空白,方法具有明确的复现价值。
Tingzheng Jia et al. · 通过轨迹锚点和残差细化实现全局组织与局部执行的协同,解决 VLA 单空间生成的局限性。提供了提升精密操作精度的具体技术路线。
Yiran Ling et al. · 提出 GTA-VLA 框架,允许用户通过视觉提示引导机器人的空间推理过程。增强了 VLA 的可解释性和人机交互能力,适合需要精细控制的场景。
Dmitriy Poyarkov et al. · 利用离线监督信号提升大规模 VLA 模型的在线 RL 效率和泛化性,解决了 OOD 行为弱的问题。为 VLA 的微调阶段提供了高效的混合训练范式。
Guanxiong Chen et al. · 利用 VLA 代理自动化 Real2Sim 流程,恢复场景几何和物理参数。显著降低了仿真重建的人力成本,为 VLA 的数据闭环提供了关键工程支持。
Fengguan Li et al. · 针对透明物体的灵巧操作,提出基于点云重建的视触预训练策略。解决了深度噪声和自遮挡难题,是触觉 VLA 方向的重要补充。
Hadi Alzayer et al. · 提出掩码视觉动作表示,使视频世界模型能更好地对齐机器人动作。为构建统一的视觉-动作世界模型提供了关键的表征创新,利于 VLA 预训练。
Yuta Oshima et al. · 提出动态帧压缩技术以优化长上下文视频世界模型的效率,解决了显存和计算瓶颈。为 VLA 处理长序列观测提供了高效的工程优化方案。
提出首个室内外连续导航基准 NavVerse,填补了跨域无缝导航评估的空白。虽非 VLA 核心架构创新,但为移动操作提供了重要的仿真测试环境。
Hanjing Ye et al. · 针对具身视觉跟踪任务,提出先指代后跟踪的两阶段框架。虽然涉及 VLA 概念,但主要贡献在于跟踪算法优化,而非通用的 VLA 控制策略。
Ziqin Wang et al. · 提供了一套用于具身世界建模和操作的全息中间表示套件,旨在解决数据集标注粗糙的问题。属于基础设施类工作,对长期研究有价值但非即时算法突破。
Chenyang Li et al. · 研究视觉语言导航系统中的黑盒对抗攻击,揭示了 VLN 系统的安全性漏洞。虽与安全相关,但主要关注导航而非通用的 VLA 操作控制。
Chenduo Ying et al. · 分析 LLM 生成的机器人操作策略代码的不可靠性,揭示了代码生成在具身智能中的潜在风险。属于诊断性研究,未提出新的 VLA 架构或训练方法。
Han Wang et al. · 结合物理动作视觉世界模型与强化学习进行动作探索,旨在减少对真实滚动的依赖。方法较为新颖,但摘要未明确展示其在主流 VLA 基准上的超越性表现。
Zeyu Liu et al. · 提出 KineBench 基准,通过无 IDM 的运动学接地评估具身世界模型的物理一致性。作为评估工具重要,但本身不提供新的 VLA 控制方法。
AlayaWorld Team et al. · 详细报告了交互式长视界世界模型 AlayaWorld 的技术细节,强调从用户输入即时生成环境。属于世界模型领域的深度工作,但与实时 VLA 控制仍有距离。
Yi-Ge Zhang et al. · 在潜在世界模型中分离世界效应与动作影响,试图解决单一监督信号的混淆问题。理论上有意义,但摘要未展示其在具体机器人任务上的应用效果。
Alex N. Wang et al. · 探讨如何提升具身世界模型以支持高维动作空间的规划与控制。侧重于理论框架的扩展,缺乏具体的 VLA 实现细节和基准对比。
Gurp Nijjer · 针对持续强化学习中的灾难性遗忘,提出基于世界模型的记忆重演机制。虽涉及 RL,但主要贡献在算法层面,未特指 VLA 架构。