VLA 週報
基於 VLA-Handbook 7 天系統數據
TL;DR
- 触觉VLA进入执行时流式适配阶段,TacForcing 证明 chunk-based 策略可通过流式触觉反馈实时修正,无需独立高频控制器。
- 测试时适应(Test-Time Adaptation)成为新焦点,RA-VLA 证明无需梯度更新,仅靠检索增强即可让冻结VLA适应新任务分布。
- 产业端密集验证:WRC 2026 展示云端世界模型实时可视化,人形机器人运动会进入2056台高密度实战,梅卡曼德IPO标志资本向核心零部件集中。
Spotlight
https://arxiv.org/abs/2608.25798" target="_blank" rel="noopener noreferrer">TacForcing: Streaming Action Generation with Execution-Time Tactile Feedback
针对 chunk-based VLA 在动作执行期间无法响应接触状态变化的痛点,提出流式动作生成框架,直接在执行时注入触觉反馈。
传统 VLA 策略在推理前收集观测并预测完整动作块(action chunk),导致触觉条件在执行期间迅速过时。现有触觉反应方案通常依赖独立的高频控制器,增加架构与训练复杂度。TacForcing 通过流式动作生成机制,将执行时触觉反馈直接融入 VLA 的自回归解码过程,实现接触状态演化的实时适配。该方法无需额外控制器,保持了端到端架构的简洁性,同时显著提升了接触丰富操作(contact-rich manipulation)的鲁棒性。对于正在构建触觉 VLA 的团队,该设计提供了可直接复用的流式解码管线。
直击 chunk VLA 时序适配瓶颈,流式触觉注入是接触丰富操作的最优架构路径。
https://arxiv.org/abs/2608.25585" target="_blank" rel="noopener noreferrer">RA-VLA: Retrieval-Augmented VLA for Test-Time Adaptation
提出检索增强 VLA 框架,通过注入相关示例实现测试时适应,无需梯度更新即可应对新任务分布。
VLA 模型在面对新任务分布时表现出显著的脆弱性,而 In-Context Imitation Learning (ICIL) 虽提供免训练替代方案,但受限于检索质量向可执行动作的转化瓶颈。RA-VLA 构建了一条完整的检索增强管线,通过语义匹配与动作空间对齐的双重机制,将专家示例高效转化为 VLA 的上下文提示。该方法避免了微调带来的算力消耗与灾难性遗忘风险,特别适合快速部署场景。社区实战中,isaaclab 与 lerobot 的部署摩擦指数(DFI)普遍偏低但安装/硬件适配问题频发,RA-VLA 的免训练特性恰好可绕过部分环境配置障碍,实现‘即插即用’的策略适配。
免训练测试时适应是 VLA 快速落地的关键拼图,检索质量决定上限。
SOTA 變化
- LIBERO standard-opensource: LaST-R1 以 99.8 刷新 SOTA,超越 Abot-M0.5 0.40 分
- 开源模型逼近理论天花板,基准饱和信号明确,后续增量需转向实机或更复杂 split。
- LIBERO Plus non-standard: CorridorVLA 以 83.21 超越 NS-VLA 3.81 分
- LIBERO Plus 仍具区分度,CorridorVLA 的显著提升表明场景复杂度扩展是突破瓶颈的有效方向。
- CALVIN ABC-D: MMaDA-VLA 达 4.78,微弱超越 Xiaomi-Robotics-0
- CALVIN 多 split 全面饱和,0.03 的差距已无统计意义,刷分进入边际收益递减区。
本週發布
- https://github.com/StanfordVL/BEHAVIOR-1K/releases/tag/v3.9.2" target="_blank" rel="noopener noreferrer">OmniGibson v3.9.2: 更新 B100 任务元数据评估脚本,优化 Docker 构建工作流。作为斯坦福主导的仿真平台,持续强化复杂室内场景的批处理渲染与物理精度。
產業動態
- RoboScience (机器科学): https://www.robotics.org/wrc2026/roboscience-visics-demo" target="_blank" rel="noopener noreferrer">8月19-21日 WRC 2026 展示 Visics 具身大模型,实现云端世界模型实时可视化推理,打破 VLA 决策黑盒
- 2026世界人形机器人运动会: https://www.chinadaily.com.cn" target="_blank" rel="noopener noreferrer">8月22日 开幕,2056台机器人参与51项竞技,同期发布全球首个“机器人之家”测试基地
- 梅卡曼德机器人: 8月24日 启动IPO申购,引入 Baillie Gifford 等基石投资者认购约1.86亿美元,聚焦3D视觉与AI“眼-脑-手”核心部件
下週觀察清單
- 关注 TacForcing 流式解码是否被主流触觉 VLA 框架(如 MuseVLA 后续版本)采纳,若被集成将验证流式触觉适配的工程必要性。
- RA-VLA 的检索增强管线能否在 IsaacLab 或 LeRobot 的实战部署中复现,需观察社区是否出现基于该架构的免训练适配案例。
- 人形机器人运动会竞技数据公布后,将首次提供大规模实机 VLA 策略的公开评估基准,可能引发从仿真刷分到实机鲁棒性的研究重心转移。
- 梅卡曼德 IPO 落地后,3D 视觉核心部件的标准化进度将加速,需跟踪其硬件接口是否与主流 VLA 动作空间对齐。