Skip to content
雙週報告双周报告 | 2026.08.13 – 08.26

深度分析深度分析 · 2026年8月26日

AI App線AI App线 VLA線VLA线 社交情報社交情报 校準校准

2026-08-13 – 2026-08-26

VLA 双周深度推理

基于 VLA-Handbook 过去 14 天的 50 次 commit + 全系统分析上下文 | 2026-08-26

本期核心信号

  1. 研究重心彻底转向“语言锚定+RL闭环”:仅 language_grounding(66篇,加速比1.29)与 rl_finetuning(39篇,1.26)双加速,其余13个方法族全线减速或衰退。
  2. 基准饱和与实机验证断裂:40次SOTA刷新全部集中在已饱和的CALVIN与LIBERO,而产业端已通过2056台机器人的运动会进入高密度实战验证。
  3. 动作头与后训练范式洗牌:flow_matching(31篇,0.56)碾压 diffusion_policy(13篇,0.31),RL微调(70篇)彻底终结纯监督微调(1篇)幻想。

方法族动态

过去两周VLA研究呈现“双引擎驱动、全面收缩”的结构性转折。语言指令对齐与强化学习策略优化被证明是提升实机成功率的最短路径,language_grounding 与 rl_finetuning 逆势上扬。相反,长程规划(19篇,0.66)、多任务泛化(17篇,0.59)与三维表征(7篇,0.24)因缺乏高质量数据与稳定奖励信号,正被学界集体放弃。竞争格局的撕裂更为彻底:flow_matching 以绝对优势终结了 diffusion_policy 的统治,标志着去噪生成范式在动作序列建模上遭遇瓶颈。更关键的是,world_model 虽以101篇保持高基数,但增速(0.91)已被 RL 反超,“预测即控制”的叙事正在让位于“交互即优化”。触觉(24篇,0.66)凭借更低硬件门槛在感知模态竞争中胜出灵巧手(19篇,0.42)。

突破论文聚焦

  • G0.5: One Autoregressive Stream for Robot Reasoning and Action (8/14-15):提出单一自回归流统一推理与动作生成,打破传统“感知-推理-控制”多模块拼接架构。在算力受限的实机部署中,该设计大幅降低延迟并提升端到端策略的稳定性,为RL微调提供了更紧凑的表征空间。
  • GigaBrain-0.7: Scaling Embodied Foundation Models to Emergent Capabilities (8/19):验证具身基础模型在规模扩展下的涌现能力。数据表明,当参数量与交互数据量突破临界点,模型无需显式编程即可掌握复杂操作序列,这直接挑战了传统长程规划方法族的必要性。
  • Hydra-0: Action Flow for Generalist World Modeling and Control (8/20):将动作流建模与通用世界模型解耦,证明“动作预测”可作为独立模块嵌入任意VLA策略。该架构有效缓解了world_model高基数但低增速的瓶颈,为RL策略提供可微的环境先验。
  • GS-VLA: Plug-and-Play Viewpoint Canonicalization for Frozen VLA Policies via Gau (8/21):利用高斯表征实现视角规范化,使冻结的VLA策略无需重新训练即可适应新相机位姿。直击sim_to_real衰退期的部署痛点,为跨视角泛化提供低成本工程解。

跨信号关联

产业资本与学术路线的“同频共振”正在加速。宇树科技610亿市值科创板IPO与LG基于NVIDIA Isaac GR00T打造人形机器人,明确押注“端到端策略实机部署”,这与学术端 rl_finetuning 的强势完全吻合。产业不再等待架构创新,而是直接采购能在实机上稳定运行的RL策略。与此同时,RoboScience在WRC 2026展示基于VLA的“Visics”模型并实现云端世界模型实时推理,对应 world_model 的高基数。但深层矛盾在于:产业演示强调自然语言指令操作任意物体,而学术端 language_grounding 绝对量仅66篇,远不足以支撑工业级多场景泛化。学术界仍在仿真里卷动作头变体,产业已用工程平台绕过学术难题。

非显而易见的洞见

基准饱和与实机验证的断裂是本期最危险的信号。40次SOTA刷新全部集中在CALVIN(14次)与LIBERO(6次),但这些split已全面饱和。学界仍在刷分,而产业端已通过世界人形机器人运动会(2056台机器人、51个项目)进入高密度实战。另一处错位是 sim_to_real 研究萎缩(8篇,0.28)与仿真平台密集更新的矛盾:Genesis、MuJoCo、OmniGibson 三周连发三版,但学术界对迁移问题的投入却在撤退。产业正用 Isaac GR00T 等工程手段直接填平仿真鸿沟,而非等待理论突破。

技术收敛与分歧

VLA架构正收敛于“语言指令输入+RL策略输出”的极简范式,分歧则集中在世界模型是作为独立预测模块(Hydra-0)还是嵌入动作流(G0.5)。触觉模态与高斯视角规范化成为短期内最具工程价值的增量。

Benchmark 动态

CALVIN(14次SOTA)、LIBERO(6次)与MetaWorld(6次)全面饱和,刷分游戏已无学术价值。RoboCasa-GR1-Tabletop(4次)与RoboChallenge(4次)作为新基准尚未形成规模效应,但代表实机/半实机评估的转移方向。432篇样本中📖(描述性)高达49.5%,⚡(突破性)仅5篇(1.1%),领域已明确滑入平台期内卷期。

如果你是 PI

  1. 立即停止在已饱和基准上的参数调优,将算力转向RL策略的实机鲁棒性评估。世界人形机器人运动会已提供标准化对抗场景,率先部署并参与公开竞技的团队将定义下一代评估标准。
  2. 放弃纯 instruction_tuning 路线(仅1篇),全面构建“语言理解→策略执行→奖励反馈”联合优化管线。在实机上验证语言锚定对RL泛化的提升,比追逐流匹配变体更具双重价值。

平台与工具变动

Genesis (v1.3.3, 8/13)、MuJoCo (3.12.0, 8/20) 与 OmniGibson (v3.9.2, 8/24) 三周内密集发布新版本,强化物理精度与多模态场景支持。尽管学术界对 sim_to_real 的研究在萎缩,但底层仿真基础设施仍在快速迭代,为策略验证提供更逼近真实的测试床。

知识缺口

当前研究极度缺乏“语言指令在真实杂乱环境中的鲁棒性”数据,以及“RL策略在长周期运行中的灾难性遗忘”实证。世界模型如何与RL奖励函数进行可微耦合,仍停留在架构猜想阶段。

本期预测

  1. 未来6周内,纯 instruction_tuning 论文占比将跌破0.5%,RL微调+语言锚定架构将成为VLA顶会标配(依据:本期RL 1.26加速 vs IT 0.0,产业端已全面转向实机RL部署)。
  2. 2026年Q4前,至少2个主流仿真平台将内置“RL策略一键部署到真实机器人”的标准化接口,sim_to_real 学术论文增速将进一步降至0.1以下(依据:三周连发三版仿真更新 vs 学术投入萎缩的产业错位)。
  3. 基于单一自回归流(如G0.5架构)的VLA模型将在LIBERO-Real或类似实机基准上取代传统扩散策略,成为新SOTA(依据:G0.5突破低延迟瓶颈,且flow_matching已证明动作流建模优于去噪范式)。