双周反思 | 2026-08-13 – 2026-08-26
读完没立场 = 这两周在消费而不在研究
本期 language_grounding(66篇,1.29x加速)与 rl_finetuning(39篇,1.26x加速)是唯二加速的方法族,其余13个全线减速或衰退。纯 instruction_tuning 仅1篇,flow_matching(31篇)碾压 diffusion_policy(13篇)。VLA研究真的已经收敛到"语言指令输入 + RL策略输出"的极简范式了吗?还是说这只是因为大部分团队在已饱和的 CALVIN/LIBERO 上刷分刷不出新花样,被迫收缩到两个有数据的方向?如果是后者,下一波发散会从哪里来?
40次SOTA刷新全部集中在 CALVIN(14次)与 LIBERO(6次),但这些 split 已全面饱和。与此同时,世界人形机器人运动会用 2056 台机器人、51 个项目进入高密度实战验证。如果只能投入一个方向——继续刷 LIBERO 分数,还是把算力转向实机鲁棒性评估——你选哪个?给出你的理由,不允许回答"两方面都有道理"。
world_model 以 101 篇保持最高基数但增速仅 0.91x,已被 RL 反超。产业端用 Isaac GR00T 等工程手段直接填平仿真鸿沟,而非等待理论突破。世界模型现在是真机会还是灌水赛道?证据是 Hydra-0 把动作流与世界模型解耦,还是 GigaBrain-0.7 用规模扩展直接绕过了显式世界建模的必要性?
本期 tactile(24篇,0.66x)在感知模态竞争中继续胜出 dexterous_hand(19篇,0.42x),且校准系统检测到 VT-MUSE、ViTacPhys、GhostTac 等多篇触觉相关论文。触觉 VLA 是正在走向工程落地,还是因为硬件门槛低而沦为"容易灌水"的替代方向?区分两者的关键指标是什么?
sim_to_real 研究萎缩至 8 篇(0.28x),但 Genesis、MuJoCo、OmniGibson 三周内密集发布三版更新。学术界在撤退,基础设施在加速。这种错位意味着 sim_to_real 问题已经被工程手段解决,还是学术界集体逃避了一个真正困难的问题?
UniMem(Stanford,8/26)提出统一多模态记忆与控制来解决 VLA 在非马尔可夫长程任务上的记忆缺失,不再依赖额外 VLM 做长期记忆管理。你能说清 UniMem 的记忆机制与 G0.5 的单一自回归流在表征空间上的本质区别吗?如果不能,这是你这两周最该补的课:读 UniMem 的 memory fusion 章节和 G0.5 的 unified stream 设计。
CounterAlign(8/26)为 VLA 引入反事实监督——用违反指令的负样本显式对齐动作选择,弥补纯 BC 无负监督的问题。你能解释清楚反事实监督与 RL 奖励信号在梯度来源上的差异吗?如果 CounterAlign 的负样本生成依赖另一个 LLM,那它和 RLHF 的奖励模型训练在工程复杂度上谁更重?
Pointing-VLA(8/26)用隐状态空间指代接口替代文本坐标/动作 token,Geometry-specific heads 直接预测归一化点、OFG heatmap 和视觉轨迹。你能说清这种"不序列化几何为文本"的设计对自回归生成的 token 效率提升有多大吗?读它的 typed hidden-state readout 架构,然后判断:这是架构突破还是工程 trick?
🔄 上期预测:"纯 instruction_tuning 论文占比将跌破0.5%,RL微调+语言锚定架构将成为VLA顶会标配。"
数据说话:本期 instruction_tuning 仅 1 篇,rl_finetuning 39 篇(1.26x加速),language_grounding 66 篇(1.29x加速)。产业端宇树科技 IPO、LG 基于 Isaac GR00T 打造人形机器人,全部押注端到端 RL 策略实机部署。
基于当前数据,你的判断是:✅ 已验证 / ❌ 落空 / ⏳ 待观察?给出你的理由——不允许回答"两方面都有道理"。