Skip to content
雙週報告双周报告 | 2026.07.16 – 07.29

深度分析深度分析 · 2026年7月29日

AI App線AI App线 VLA線VLA线 社交情報社交情报 校準校准

🤔

双周反思 | 2026-07-16 – 2026-07-29

读完没立场 = 这两周在消费而不在研究

1️⃣

本期 50 篇评级论文中仅 5 篇(1.5%)获得 ⚡ 标记,且全部围绕 "Scaling" 展开。与此同时 CALVIN/LIBERO 上发生了 44 次 SOTA 变动——但所有主流基准都被标记为"饱和"。你认为这 44 次刷榜中有多少是真正的泛化进步,有多少只是过拟合 ABC-D/D-D 分割的幻觉?如果答案是"几乎全是后者",你的实验室明天该停掉哪台跑 CALVIN 的 GPU?

2️⃣

ViTacWorld(ShanghaiTech)和 $N_0$-TWAM(复旦)在同一天(7/28-29)发布,两篇都是"触觉原生世界模型",两篇都拿到了 ⚡。这是触觉+世界模型交叉点的第二次爆发(第一次是校准中 V-002 触觉假设从 0.64→0.79)。但看方法细节:ViTacWorld 用 action-conditioned world model 做接触预测,N₀-TWAM 用 NeoForce 统一触觉表征做动作生成。哪条路线更可能成为触觉 VLA 的默认架构?还是说两者都在回避同一个问题——触觉数据的规模化采集根本没有经济解?

3️⃣

校准系统 16 个假设中 10 个在"strengthening",0 个在"weakening"。V-001 扩散动作头 0.76→0.88,V-007 遥操作数据 0.75→0.87,A-004 推理模型 0.82→0.97(strongly_confirmed)。但 V-005 在线 RL 和 V-010 3D 空间理解连续两个周期 confidence_delta = 0。没有反信号的强化是不是真正的强化?还是说你的假设集已经变成了自我实现的预言?

4️⃣

双周报告指出"14 个核心方法族全部标记为衰退"——包括 rl_finetuning(0.54)、language_grounding(0.48)、cross_embodiment(0.1)。但产业端:Tesla Optimus 7-8 月量产、XPeng 试产、逐际动力 2 亿美元融资、Kimi K3 2.8T 参数。学术界的方法族衰退和产业端的产能扩张是同一个硬币的两面,还是两个完全不同的游戏?如果是后者,你的研究选题应该往哪边倾斜?

5️⃣

RoboTTT(7/18)证明延长策略观测时间窗口是提升长程执行成功率的首要杠杆,绕过了分层规划器的复杂性。VPWEM(7/25)用工作记忆+情景记忆解决非马尔可夫任务。FutureRTC(7/29)用预期条件动作分块解决异步执行错位。三篇论文从三个角度解决同一个问题:VLA 的上下文建模。你认为"上下文缩放"会取代"模型缩放"成为下一阶段的核心杠杆吗?如果是,OpenVLA 这类固定上下文窗口的开源模型还值得跟进吗?

🔬

本期 flow_matching(20 篇)首次超过 diffusion_policy(16 篇),校准 V-001 置信度升至 0.88。但你能说清 flow matching 和 diffusion policy 在策略生成场景下的本质区别吗?——不是"flow matching 训练更快"这种表层回答,而是:在 robot manipulation 的连续动作空间中,flow matching 的 velocity field 参数化相比 diffusion 的 score-based 参数化,到底解决了什么后者解决不了的问题?如果不能,去读 GeCO: Generative Control as Optimization(2603.17834)和 AsyncVLA(2511.14148),这两周最该补的课。

🔬

Genesis v1.2.3(7/18)引入椭圆摩擦锥和高阻抗选项,MuJoCo 3.11.0(7/28)新增 geom/surfacevel 表面速度场。两个物理引擎在同一周窗口内更新,都聚焦接触动力学的精确建模。但看你的触觉论文:ViTacWorld 用仿真数据预训练,N₀-TWAM 用 6 个本体 450 个任务的视触联合数据。问题来了——当物理引擎的接触建模精度逼近真实传感器噪声水平时,sim-to-real 的瓶颈会从"物理不准确"转移到什么?如果答案是"视觉域差",你手上有哪些工具可以缩小它?