VLA 双周深度推理
基于 VLA-Handbook 过去 14 天的 50 次 commit + 全系统分析上下文 | 2026-07-29
本期核心信号
- 方法族范式彻底转向:
world_model是唯一保持稳定动量且加速比最高(1.13)的赛道,彻底取代了衰退的language_grounding(0.48)与rl_finetuning(0.54)。学术界已承认纯语言对齐与试错式强化学习的收益见顶。 - 产学研严重脱钩:14 个核心方法族全部标记为衰退,而产业端正以百万级产能(Tesla 1000 万台/年、XPeng 试产、逐际动力 2 亿美元融资)和万亿参数基座(Kimi K3 2.8T)暴力构建数据飞轮。
- 工程收敛与基准失效:335 篇评级论文中仅 1.5%(5 篇)获得 ⚡ 标记,且全部围绕“Scaling”展开。44 次 SOTA 变动高度集中于已饱和的 CALVIN/LIBERO 基准,暴露出领域陷入“仿真内卷”,纯算法改良已触及物理天花板。
方法族动态
竞争力量对比已不可逆地倒向“模型驱动”与“触觉优先”。在“学习信号”对决中,world_model(62篇,加速1.13)全面压制 rl_finetuning(49篇,加速0.54);“动作头”赛道 flow_matching(20篇)以微弱优势超越 diffusion_policy(16篇),反映工程界对低延迟实时控制的迫切需求;“操作模态”中 tactile(25篇)以近两倍体量碾压 dexterous_hand(13篇),证明解决接触富集任务的核心在于触觉反馈机制,而非单纯机械结构堆砌。cross_embodiment(0.1)与 instruction_tuning(0.05)的断崖式下跌进一步印证,试图通过提示词或跨形态指令实现通用策略的幻想已被打破。
突破论文聚焦
RoboTTT: Context Scaling for Robot Policies (7/18)
该论文聚焦于机器人策略的上下文缩放能力,证明延长策略观测的时间窗口是提升长程执行成功率的首要杠杆,从而绕过了对复杂分层规划器的依赖。它将工程重心从架构复杂性转移到了记忆管理与注意力效率上,为处理超长视界任务提供了可验证的基线。这标志着 VLA 策略正从“离散指令响应”向“连续历史状态建模”演进。
Xiaomi-Robotics-1: Scaling VLA Models with over 100K Hours (7/21/24)
该工作展示了使用超过 10 万小时真实世界数据训练 VLA 模型所带来的巨大泛化飞跃。它明确证明数据规模与物理多样性现在比算法新颖性更为关键,确立了“数据即护城河”的工业新标准。在此基准之下,任何低于 1 万小时数据量的研究在统计意义上都将被视为缺乏说服力。这标志着 VLA 正式迈入以数据吞吐量为核心壁垒的工业化竞赛阶段。
ViTacWorld: Scaling Visuo-Tactile World Models (7/28)
该研究专门针对接触富集操作任务,对视觉-触觉世界模型进行了规模化扩展。它揭示了触觉反馈不仅仅是辅助信号,而是能够大幅降低物理交互不确定性的核心预测模态。这迫使社区重新评估纯视觉管线,标志着纯光学 VLA 统治地位的终结。通过融合触觉进行世界状态预测,策略在复杂接触动力学下的鲁棒性得到了数量级提升。
$N_0$-TWAM: Scaling Tactile-Native World-Action Model (7/29)
该论文引入了一种触觉原生的世界-动作模型,将触觉流原生集成到动作生成过程中,而非后期融合。实验表明,触觉数据的早期融合能产生比晚期融合更稳健的接触策略。这为灵巧操作确立了新的架构标准,优先发展触觉原生设计而非视觉主导的适应性修改。它证明了在物理接触瞬间,触觉先验是维持策略连续性的唯一可靠保障。
跨信号关联
产业资本/数据飞轮 vs 学术算法内卷
产业资本正以百万级产能(Tesla 目标 1000 万台/年、XPeng 试产、逐际动力 2 亿美元 Pre-IPO)和万亿参数基座(Kimi K3 2.8T)构建数据飞轮,直接绕过了学术界对 rl_finetuning 与 diffusion_policy 的边际优化。行业不再需要实验室级别的算法微调,而是渴求能吞吐十万小时真实轨迹、具备原生物理预测能力的系统级架构。学术界的“算法内卷”与产业界的“规模暴力”已彻底脱钩,纯算法改良的价值正在被数据规模指数级稀释。
实体活跃度与平台发布的错位
OpenAI(83 次)与 Anthropic(69 次)的绝对虹吸下,LIBERO 团队与基准仅存 8 次提及。与此同时,Genesis v1.2.3 与 MuJoCo 3.11.0 持续迭代,配合 DenseReward 与 RoboWorld 等深度拆解,揭示社区已放弃在饱和基准上刷分,转而押注神经仿真器与失败合成管线。学术热度正从“静态任务完成度”不可逆地滑向“动态环境可微分建模”,因为唯有高保真仿真才能支撑工业级后训练流水线(如 HELP/UniSteer)的规模化展开。
非显而易见的洞见
主流叙事沉迷于“多模态融合”与“长程规划”,但 language_grounding 与 long_horizon 的同步衰退暴露了语言指令在物理控制中的瓶颈。产业端(蚂蚁 LingBot-VA 2.0、NVIDIA GR00T N1)已悄然转向“世界模型+连续轨迹生成”,语言降维为辅助对齐信号,而非核心控制接口。此外,论文评级中 49% 为文献综述、18.2% 直接淘汰,说明 VLA 已越过“概念验证期”,进入“工程收敛期”。学术界的高淘汰率并非质量下滑,而是创新范式已触及纯算法改良的物理天花板。
技术收敛与分歧
技术栈正加速收敛于“世界模型+触觉原生+Flow Matching”的组合,以此作为解决接触富集与实时控制的唯一可行路径。分歧则彻底撕裂了“语言指令驱动”与“物理状态驱动”两条路线,前者因无法突破长尾分布的泛化瓶颈而被边缘化,后者因契合工业量产需求而成为绝对主流。
Benchmark 动态
44 次 SOTA 变动高度集中于 CALVIN(16 次)与 LIBERO 系列,但所有主流基准均被标记为“饱和”。这暴露出领域正陷入“仿真内卷”:团队在已饱和的 ABC-D/D-D 分割上追逐边际提升,却无力解决真机部署的长尾分布。基准失效倒逼研究向物理世界回归,sim_to_real(12 篇)的逆势存在即是明证,静态任务完成度已无法作为衡量策略泛化能力的有效指标。
如果你是 PI
- 立即停止在 CALVIN/LIBERO 饱和分割上的增量刷榜,将算力与数据管线全面迁移至高保真神经仿真器与失败合成框架。工业界已用产能数据证明,泛化瓶颈的解法是数据规模与仿真保真度,而非更复杂的扩散头或 RL 奖励函数。
- 彻底放弃以语言指令为核心的 VLA 架构设计,转向“世界模型+触觉/物理状态”的原生多模态融合。产业信号已明确显示,连续物理轨迹预测与接触富集控制才是下一代策略的护城河,死守
language_grounding将导致研究成果在 12 个月内彻底丧失产业引用价值。
平台与工具变动
- Genesis v1.2.3 (7/18):持续优化高保真物理仿真管线,支持更复杂的接触动力学模拟,为触觉世界模型提供底层算力支撑。
- MuJoCo 3.11.0 (7/28):发布新版本,进一步强化了多智能体协同与可微分物理引擎的兼容性,顺应了从单体控制向网络化协同演进的学术趋势。
知识缺口
当前缺乏关于“触觉数据规模化采集与合成”的标准化工具链,纯算法团队难以低成本获取十万小时级的接触富集轨迹。同时,神经仿真器(如 RoboWorld)能否真正替代真实世界的 Rollout Segmentation(如 HELP 流水线)进行零样本策略评估,仍缺乏跨物理引擎的基准验证。
本期预测
- Flow Matching 将取代 Diffusion Policy 成为实时控制标准动作头:推理依据为
flow_matching(20篇)已超越diffusion_policy(16篇),且工业界对低延迟控制需求迫切。时间窗口:2026 Q4。 - 纯语言对齐(Language Grounding)论文占比将跌破 5%:推理依据为该族加速比已降至 0.48,且产业端全面转向世界模型与连续轨迹生成。时间窗口:2026 年底。
- 头部实验室将发布 10 万小时级真实轨迹数据集:推理依据为 Xiaomi-Robotics-1 已确立数据规模新基准,后续研究若不匹配该量级将失去 ⚡ 级竞争力。时间窗口:2026 Q3-Q4。
-
FORECASTMoltbot 自动提交:5 次
-
FORECAST手动提交:45 次(涉及:15.14.1 🎓 面试题库(一手考点,question-bank 强化)、4. 工程视角 (Engineering View)、🎥 数采产业链黑话)