VLA 週報
基於 VLA-Handbook 7 天系統數據
TL;DR
- Behavior Cloning 微调中的表征退化问题成为本周焦点,Representation Anchoring 与 Agentic RL 提供了抑制误差累积与保留预训练泛化能力的两条工程路径。
- 仿真基础设施迎来触觉原生支持,Genesis v1.2.2 发布高保真触觉传感器与鲁棒碰撞检测,直接补齐 RL 训练灵巧策略的物理反馈短板。
- 产业端量产与资本化双加速:小鹏定调月产千台,逐际动力获 2 亿美元 Pre-IPO 融资,VLA 策略部署的硬件成本拐点与数据飞轮已实质性启动。
Spotlight
https://arxiv.org/abs/2607.13818" target="_blank" rel="noopener noreferrer">Learning Robust Execution in Robotic Manipulation with Agentic Reinforcement Learning
提出 Agentic RL 框架,为 VLA 策略引入显式的执行稳定性评估与偏差恢复机制,解决长程操作中的误差累积问题。
主流 VLA 依赖 BC 训练,缺乏对执行过程中物理不确定性(如打滑、遮挡)的在线修正能力。该工作通过双层架构将高层语义推理与底层鲁棒控制解耦,利用 RL 智能体实时监测轨迹偏差并触发恢复策略。社区实战中常因 Sim2Real 物理参数未校准导致真机抖动,此方法提供不依赖完美仿真的在线自适应路径,显著提升长视界任务的成功率。
为 VLA 补齐在线容错与执行稳定性模块,是突破长程操作瓶颈的关键架构演进。
https://arxiv.org/abs/2607.13429" target="_blank" rel="noopener noreferrer">Generalizable VLA Finetuning via Representation Anchoring and Language-Action Alignment
提出表示锚定与语言-动作对齐方法,防止 BC 微调覆盖 VLM 预训练的视觉与语义泛化结构。
BC 微调极易导致灾难性遗忘,使模型在分布外场景失效。本文通过锚定预训练表征空间并联合优化语言-动作对齐损失,在保留 Web 级泛化能力的同时注入机器人先验。结合社区反馈(OpenVLA 论文 85.7% 实测仅 62.6%),此方法为微调流程提供了可复用的正则化范式,有效缓解数据稀缺下的过拟合问题。
直击 BC 微调泛化性衰减痛点,为 VLA 策略的领域适配提供低遗忘率的标准化训练协议。
SOTA 變化
- CALVIN ABC-D: MMaDA-VLA 以 4.78 avg_len 登顶,AVA-VLA (4.65) 与 NS-VLA (4.56) 紧随其后,头部模型差距缩小至 0.23 以内。
- 基准进入微增量竞争阶段,单纯堆砌数据或参数已触及天花板,架构创新(如解耦表征、触觉融合)将成为破局关键。
- LIBERO standard-opensource: LaST-R1 达到 99.8 平均分,超越 Abot-M0.5 0.40 分,逼近理论极限。
- 开源基准彻底饱和,学术界需加速向真实物理交互与复杂长程任务迁移,摆脱仿真温室的虚假繁荣。
- LIBERO Plus non-standard: CorridorVLA 以 83.21 total 领先 NS-VLA 3.81 分,确立复杂场景新标杆。
- 非标准场景下的策略规划与泛化能力仍有较大提升空间,验证了多视角/多模态融合在复杂环境中的必要性。
本週發布
- https://github.com/Genesis-Embodied-AI/genesis-world/releases/tag/v1.2.2" target="_blank" rel="noopener noreferrer">Genesis v1.2.2: 引入高保真触觉传感器家族与鲁棒非凸碰撞检测,专为 RL 训练灵巧策略优化,大幅降低触觉 VLA 的仿真数据生成门槛。
產業動態
- 小鹏汽车 (XPeng): 7/15 宣布明年全球发布人形机器人,年底目标月产 1000台,标志车企跨界具身智能进入规模化量产倒计时。
- 逐际动力 (LimX Dynamics): 7/14 完成近 2 亿美元 Pre-IPO 轮融资,估值 150 亿人民币,资金专项用于算法迭代与 LimX O 机器人商业化落地。
- 蚂蚁灵波 (Ant Lingbo): https://www.waic.org.cn/" target="_blank" rel="noopener noreferrer">7/13 在 WAIC 发布具身原生世界动作模型 LingBot-VA 2.0,推动 VLA 架构向多模态原生融合与连续物理动力学预测演进。
- UCSD 团队 / 外科医生: http://finance.sina.com.cn/roll/2026-07-13/doc-inihrnpf4268776.shtml" target="_blank" rel="noopener noreferrer">7/13 完成全球首例人形机器人远程手术临床试验,验证 VLA 策略在极高精度医疗场景的实时控制与低延迟力反馈潜力。
观察清单 WATCH LIST
下週觀察清單
- 跟踪 XPeng 与逐际动力的量产/算法迭代进展,预判车企与独角兽的硬件架构是否会采用统一的 VLA 推理接口标准。
- 评估 Genesis v1.2.2 触觉传感器在 RL 训练管线中的实际采样效率,验证触觉模态是否能在 Q3 成为灵巧手策略的标配。
- 观察 Representation Anchoring 方法在主流 BC 微调框架(如 LeRobot/GR00T)中的集成进度,判断其能否成为防止灾难性遗忘的行业基线。