VLA 週報
基於 VLA-Handbook 7 天系統數據
TL;DR
- VLA RL 训练框架进入工程收敛期:RLinf-VLA 提供统一平台,World Tokens 在训练时嵌入世界建模,RoboHarness 用记忆增强解决 OOD 鲁棒性——三条路线同时指向「VLA 后训练」这个核心瓶颈
- 社区基准复现危机加剧:lerobot Issue #2354 和 #2114 分别报告 SmolVLA 和 π0/π0.5 在 LIBERO 上无法复现论文结果,论文 85.7% vs 实测 62.6% 的差距成为本周最热讨论
- 产业资本密集涌入:Unitree IPO 申购募资 61 亿(20 亿投向大模型)、腾讯混元×Robotics X 开源 10,000 小时操作数据、BYD 宣布 8 月发布首款人形机器人——硬件赛道已红海化
Spotlight
https://arxiv.org/abs/2510.06710" target="_blank" rel="noopener noreferrer">RLinf-VLA: A Unified and Efficient Framework for Reinforcement Learning of VLA Models
哈尔滨工业大学提出的统一 VLA-RL 训练框架,解决当前 RL 微调方案碎片化、无法公平对比的问题。支持多架构多算法的可扩展训练。
这是本周最值得工程团队关注的论文。当前 VLA 后训练领域处于「百家争鸣但无法比较」的状态——每篇论文用自己的训练脚本、自己的评估流程、自己的超参搜索空间。RLinf-VLA 直接瞄准这个痛点,提供统一平台。结合社区数据:lerobot 的 DFI 摩擦集中在 deploy 和 data 维度,openvla 受困于 data,gr00t 受困于 train——说明训练基础设施的标准化确实是社区刚需。论文来自 HIT(哈尔滨工业大学),显示中国团队在 VLA 工程工具链上的投入正在加速。
如果你的团队正在做 VLA RL 微调,这个框架可以省去 3-6 个月的工程搭建时间——但需要验证其对 OpenVLA 之外的架构支持程度。
https://arxiv.org/abs/2608.09730" target="_blank" rel="noopener noreferrer">World Tokens: Enhancing Embodied Policies with Training-Time World Modeling
在 VLA 训练时引入 World Tokens 显式建模物理场景演化,弥补 VLA 缺乏动态世界模型的缺陷,同时避免 WAM 在推理时保留视频骨干网络的计算开销。
这篇论文巧妙地在 VLA 和 WAM 之间找到了中间路线:WAM 推理成本高(需保留视频生成或大视频骨干),纯 VLA 不建模场景演化。World Tokens 方案在训练时注入世界建模能力,推理时只需 VLA 前向传播——这正是产业部署需要的权衡。结合本周理论 Deep Dive 中的 PhyLatent(JEPA 世界模型动力学表示)和 WorldCycle(自验证 RL 用于长视界视频世界模型),可以看出「世界模型+策略」的融合正在从架构层面走向训练细节。社区中 isaaclab 和 genesis 已进入 production 阶段(主导比 67%),说明仿真基础设施的成熟为这类训练时世界建模方法提供了验证土壤。
World Tokens 代表了 VLA 架构演进的一个务实方向:不追求推理时的世界建模,而是在训练时让策略「见过」场景演化。值得在仿真环境中复现验证。
SOTA 變化
- CALVIN ABC-D: MMaDA-VLA 以 4.78 avg_len 登顶,超越 Xiaomi-Robotics-0(+0.03);AVA-VLA 4.65、NS-VLA 4.56 紧随其后
- CALVIN ABC-D 赛道竞争加剧,top 3 差距仅 0.22,说明该基准可能正在逼近天花板——增量改进的边际收益递减
- LIBERO Plus non-standard: CorridorVLA 以 83.21 total 超越 NS-VLA(+3.81),为本周最大单项提升
- LIBERO Plus 上 3.81 的跳跃式提升暗示该基准尚未饱和,长程任务仍是 VLA 的薄弱环节和突破空间
- LIBERO standard-closed / standard-opensource: standard-closed 达 99.1%(PriorVLA),standard-opensource 达 99.8%(LaST-R1)
- LIBERO 标准设置已逼近饱和,99%+ 的成绩使该基准失去区分度——社区需要新的评估维度(如 OOD 鲁棒性、推理延迟)
本週發布
- https://github.com/Genesis-Embodied-AI/genesis-world/releases/tag/v1.3.3" target="_blank" rel="noopener noreferrer">Genesis v1.3.3: 修复 rigid solver 收敛回归,新增 use_deterministic_algorithms 选项确保位级可复现性,Mujoco 兼容模式覆盖范围扩大。三周内从 v1.3.0 迭代到 v1.3.3,开发节奏极快。
- https://github.com/Genesis-Embodied-AI/genesis-world/releases/tag/v1.3.2" target="_blank" rel="noopener noreferrer">Genesis v1.3.2: 改进刚体仿真对 orientation/scale 不变量的合规性,提升质量矩阵数值鲁棒性。为 VLA 训练提供更稳定的物理仿真基础。
產業動態
- 腾讯混元 × Robotics X: 8/6 联合发布 HyVLA-0.5 全栈系统,打通 VLA 模型到实体机器人的完整链路,开源超 10,000 小时高精度操作数据
- 宇树科技 (Unitree): http://finance.sina.com.cn/roll/2026-08-10/doc-inimuvrt8207816.shtml" target="_blank" rel="noopener noreferrer">8/10 正式启动科创板 IPO 申购,募资约 61 亿元,其中超 20 亿元专项投入具身大模型研发
- 比亚迪 (BYD): http://finance.sina.com.cn/roll/2026-08-08/doc-inimqyip4176604.shtml" target="_blank" rel="noopener noreferrer">8/8 宣布将于 8 月发布首款人形机器人,传统汽车制造巨头正式跨界具身智能
下週觀察清單
- BYD 首款人形机器人发布(8 月内)——关注其是否搭载自研 VLA 策略或与现有开源方案合作
- Genesis v1.3.x 迭代节奏极快(3 周三版本),关注是否引入新的机器人模型支持或 Sim2Real 工具
- lerobot 社区基准复现危机(#2354 #2114)——如果 HF 团队下周给出正式回应,可能引发 VLA 评估标准的重新讨论
- Unitree IPO 申购结束后资金流向——20 亿大模型专项投入的具体投向将影响开源 VLA 生态