Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories
Xiaomi Robotics Team et al. · 提出基于10万小时真实世界轨迹训练的VLA基座模型,解决泛化与样本效率瓶颈。在多个移动操作基准上展示显著优于SOTA的性能,确立了数据规模驱动的新范式。
Xiaomi Robotics Team et al. · 提出基于10万小时真实世界轨迹训练的VLA基座模型,解决泛化与样本效率瓶颈。在多个移动操作基准上展示显著优于SOTA的性能,确立了数据规模驱动的新范式。
Xiaojiang Peng et al. · 针对VLA在OOD组合任务中的失败模式,提出组合学习机制提升鲁棒性。方法可直接集成至现有VLA训练流程,改善未见配置下的动作执行能力。
Huixi Technology et al. · 分析VLA部署延迟瓶颈,提出针对边缘硬件的优化方案。提供具体的工程洞见和代码路径,帮助研究者本周内优化VLA推理速度,具备高实用价值。
Zebin Yang et al. · 提出Jetson平台上的前瞻对齐异步推理框架,实现VLA实时控制。提供明确的嵌入式部署方案,解决算力受限场景下的VLA落地难题,本周可复用。
Haoran Sun et al. · 提出面向服务的VLA多租户后训练平台。解决异构机器人数据协同训练的工程痛点,提供明确的云平台/API接入路径,便于团队快速进行领域适配。
Tipu Sultan et al. · 提出基于EEG/EMG的共享自主控制框架,预测执行就绪度以增强辅助操作安全性。虽涉及机器人操作,但侧重脑机接口而非VLA核心架构或通用策略学习。
Anurag Maurya et al. · 发布面向直觉物理推理的机器人操作新基准IMBench。作为数据集贡献重要,但无新算法或架构创新,供后续研究评估使用。
Zhenduo Shang et al. · 结合动力学感知元模仿学习以提升泛化。虽涉及操作,但更偏向传统IL改进,未明确结合VLA多模态对齐或大模型架构,复用路径不如纯VLA方法清晰。
Ruogu Li et al. · 探索灵巧手与人形机器人的统一表征与控制。属具身智能前沿方向,但摘要未详述具体VLA架构创新或基准对比,暂归为值得了解的技术进展。
Jiaxi Jiang et al. · 提出分布式人运动捕捉系统,服务于VR/AR及具身AI数据获取。属数据采集技术,非VLA模型本身,但对构建高质量演示数据有潜在价值。
Zhixian Hu et al. · 提出新型视触觉传感器MuxGel,实现空间复用双模态感知。属硬件传感创新,虽对触觉VLA重要,但非算法或模型层面的直接贡献。
Zhiyang Dou et al. · 通过神经建模解决致动器动力学与sim-to-real误差。虽提升控制精度,但侧重于底层动力学建模,非高层VLA语义决策或策略网络的核心改进。
Ruiming Liang et al. · 改进扩散策略的训练优化方法。虽可用于VLA动作生成,但属于通用决策算法改进,缺乏针对VLA多模态特性的专门设计,复用需额外适配。
Jiayi Tian et al. · 提出具身Agent操作系统,支持长期记忆与工具调用。属系统层架构,虽与Agentic VLA相关,但非核心模型算法,更多是运行时环境创新。
Zhaofeng Shi et al. · 利用第三人称演示指导第一人称手部姿态预测。属感知与姿态估计任务,虽为操作提供输入,但未直接涉及VLA端到端策略学习或动作生成。
Lianghua Huang et al. · 重构视频流处理视角,区分世界上下文与事件流。属计算机视觉基础理论,虽可能间接影响VLA感知模块,但无直接机器人操作应用路径。
Yuhao Zhou et al. · 设计集成指尖与掌心的视触觉灵巧夹爪。属硬件创新,为灵巧操作提供新传感器方案,但非VLA算法或模型层面的直接贡献。
Wenzhe Tong et al. · 开源张拉整体机器人的六轴接触力视触觉传感器。属特定形态机器人的硬件感知创新,通用性有限,非VLA核心算法进展。
Guolei Qi et al. · 提出基于差异的关系学习用于零样本目标导航。属移动机器人导航任务,非机械臂操作,且未结合VLA多模态大模型架构。
Laura E. Butcher et al. · 仿生光纤触觉传感器研究。属硬件传感创新,虽对触觉VLA重要,但非算法或模型层面的直接贡献,暂归为值得了解的硬件进展。
Aditya Kamireddypalli et al. · 提出贝叶斯视触觉位姿估计方法。属感知模块改进,虽提升操作精度,但未涉及VLA高层语义理解或策略生成,复用需集成到完整系统中。
Zhiyuan Wu et al. · 学习视觉点云中的触觉接触定位。属细粒度感知任务,虽为操作提供关键信息,但非端到端VLA策略学习,贡献局限于感知模块。