VLA 週報
基於 VLA-Handbook 7 天系統數據
TL;DR
- 触觉基础模型 TouchWorld 填补 VLA 隐式接触状态感知空白,策略从“纯视觉猜测”转向“触觉预测+反应”双闭环。
- 基础设施进入重构期:LeRobot v0.6.0 拆分训练依赖,Genesis v1.2.1 实现 CPU 端大规模场景 120FPS 实时渲染,部署摩擦向底层编译栈集中。
- 产业端量产与资本共振:工信部定调 2026 年产量破 10 万台,宇树获 IPO 批准,VLA 策略部署的硬件成本拐点已至。
Spotlight
https://arxiv.org/abs/2607.07287" target="_blank" rel="noopener noreferrer">TouchWorld: A Predictive and Reactive Tactile Foundation Model for Dexterous Manipulation
提出兼具预测与反应能力的触觉基础模型,解决灵巧操作中滑移、错位等隐式接触状态无法被视觉/语言可靠捕获的痛点。
主流 VLA 严重依赖视觉先验,但在高频接触场景中存在物理盲区。TouchWorld 将触觉信号从被动的“误差修正”提升为主动的“接触演化预测”,结合视觉语义引导,实现局部纠错与全局规划的统一。工程价值极高,若能在 LIBERO 等基准上证明其超越纯视觉 VLA 的长程成功率,将直接重塑灵巧手数据采集与策略训练范式,推动触觉从辅助模态跃升为核心决策层。
触觉 VLA 从“辅助模态”跃升为“核心决策层”的标志性架构,具备战略级意义。
https://arxiv.org/abs/2607.07608" target="_blank" rel="noopener noreferrer">Dual Latent Memory in Vision-Language-Action Models for Robotic Manipulation
针对主流 VLA 依赖马尔可夫假设导致长视界任务失败的缺陷,引入双潜在记忆机制,将历史经验直接嵌入 VLA 原生推理潜空间。
现有记忆模块多作为外部策略上下文检索,割裂了时序依赖。该架构突破局限,实现记忆表征与动作生成的深度耦合,显著提升时间依赖型任务的连贯性。社区实战中常因时序断裂导致真机抖动或任务中断,此方法提供即插即用的记忆增强路径,无需大幅增加推理延迟即可改善长程规划。
打破 Markov 假设桎梏,为长程操作提供低开销的时序一致性解法,有望成为标准记忆组件。
SOTA 變化
- CALVIN ABC-D: MMaDA-VLA 登顶 4.78 avg_len,仅领先前代 Xiaomi-Robotics-0 0.03,增量逼近极限。
- 基准已高度饱和,微小分数提升无法转化为真实操作能力的质变,刷榜策略失效。
- LIBERO standard-opensource: LaST-R1 达到 99.8 平均分,逼近理论上限。
- 开源基准彻底饱和,学术界亟需转向真实物理交互验证,摆脱仿真温室。
- LIBERO Plus non-standard: CorridorVLA 以 83.21 total 超越 NS-VLA 3.81 分,成为新 SOTA。
- 复杂场景下的策略规划能力仍有提升空间,但需警惕过拟合特定走廊布局导致泛化下降。
本週發布
- https://github.com/Genesis-Embodied-AI/genesis-world/releases/tag/v1.2.1" target="_blank" rel="noopener noreferrer">Genesis v1.2.1: 优化 CPU 稀疏性与增量 Hessian 更新,百实体/千几何场景实现 120FPS 实时渲染,大幅降低本地高保真仿真门槛。
- https://github.com/huggingface/lerobot/releases/tag/v0.6.0" target="_blank" rel="noopener noreferrer">LeRobot v0.6.0: 重大 Breaking Change,拆分数据集与训练依赖,推动框架从“一体化原型”向“模块化工程栈”演进,降低部署摩擦。
- https://github.com/StanfordVL/BEHAVIOR-1K/releases/tag/v3.9.0" target="_blank" rel="noopener noreferrer">OmniGibson v3.9.0: 新增排行榜列与多机器人支持,持续完善 BEHAVIOR-1K 评估生态,为复杂场景策略验证提供更好基础设施。
產業動態
- 宇树科技 (Unitree Robotics): https://finance.eastmoney.com/a/202607043829963563.html" target="_blank" rel="noopener noreferrer">7/2 获证监会批准 IPO 注册申请,冲刺科创板,有望成为 A 股人形机器人第一股,拓宽 VLA 研发与硬件迭代的资金渠道。
- 工信部 (MIIT): 7/8 在 WAIC 宣布 2026 年中国人形机器人年产量预计突破 10 万台,硬件成本下探与真实场景数据爆发将直接加速 VLA 规模化部署。
- 星尘智能 / 北京大学 / 清华大学: https://new.qq.com/rain/a/20260706A07DQ600" target="_blank" rel="noopener noreferrer">7/6 联合开源 IB-Adapter 架构,过滤视觉噪声提升 VLA 鲁棒性,已在 StableVLA 验证,为真实环境部署提供轻量级抗干扰方案。
观察清单 WATCH LIST
下週觀察清單
- 跟踪 IB-Adapter 在 StableVLA 外的主流框架集成进度,验证其抗噪泛化能力是否具备跨平台普适性。
- 监控 LeRobot v0.6.0 迁移后的 RL Stack 重构 (#3076) 与多语言本地化进展,评估工程链稳定性与社区采纳阻力。
- 观察 TouchWorld 在真实灵巧手平台上的滑移纠正成功率,判断触觉模态是否将在 Q3 成为 VLA 标配。
- 关注宇树 IPO 募资方向及工信部 10 万台产量落地情况,预判 VLA 硬件部署成本拐点与供应链扩张节奏。