Learning to Act While Waiting: RL Finetuning of Generalist Robot Policies Under Inference Latency
Brian Zhu et al. · 提出在 VLA 等大模型推理延迟期间同步执行 RL 更新,将等待时间转化为策略改进机会,化解大模型 RL 精调的高延迟效率瓶颈。做部署期持续学习的团队可复用其编排思路。
Brian Zhu et al. · 提出在 VLA 等大模型推理延迟期间同步执行 RL 更新,将等待时间转化为策略改进机会,化解大模型 RL 精调的高延迟效率瓶颈。做部署期持续学习的团队可复用其编排思路。
Zhi Cao et al. · 提出以 visual tracks(视觉轨迹)作为与具体 embodiment 无关的中间表征,替代动作条件信号桥接机器人控制与世界模型视觉预测,直击动作与图像空间弱对齐的核心问题,对视频预测式世界模型设计有直接参考价值。
Jeffrin Sam et al. · 揭示单 GPU VLA 微调的 seed 彩票问题(同数据同架构跑 13 次结果迥异),提出输出层正则化消除随机种子敏感性;任何 VLA 微调流程都值得直接加这一技巧以提升可复现性。
Zheng Yang et al. · 面向移动操作 VLA 的轨迹引导动作生成+世界模型对齐方法,解决大动作空间与视角变化下基座-手臂协调难题;其世界模型对齐模块可与现有 VLA 直接组合复用。
Fenghao Lei et al. · 对世界-动作模型(WAM)提出范式质疑:视频生成是多余的中间目标,应直接从未来潜在状态预测动作;若实验扎实将大幅降低 WAM 训练与部署成本,影响 WAM 设计取舍。
Jean Pierre Sleiman et al. · 面向竞技运动型机器人(athletic)的零样本技能迁移工作,Science Robotics 论文,摘要未给出方法细节;属运动控制范畴,与操作 VLA 关联弱,可关注其技能泛化思路。
Josua Spisak et al. · 通过让机器人在婴儿床环境中玩耍来研究感觉运动偶然性学习机制,属发展认知机器人学,对自主探索与表征学习有启发,但并非操作策略研究。
Qiayuan Liao et al. · 用引导扩散将人体运动捕捉转化为多功能人形全身控制策略,解决从动作跟踪到通用控制的泛化,属人形运动控制而非抓取操作场景。
Mingshi Chi et al. · 面向人形机器人的会聚双目立体深度感知方法,解决非平行光轴下的近距视差与深度估计问题,属感知前端,不与策略模块直接相关。
Jonathan Hurst · 观点评论文章:主张机械硬件(传动、结构、能效)是 Physical AI 取得突破的关键前提,无具体技术方案,与 VLA 算法无直接关联。
Hae-Won Park · 评论性文章:讨论人形机器人从特技动作走向通用性的技术拐点,梳理现状、瓶颈与开放挑战,属于领域展望而非新方法贡献。
Evan Dallas et al. · 通过耦合动力学桥接人类示教期望与机器人实际学习过程,服务非专家用户部署后定制机器人,属人机教学交互,非 VLA 方法。
Haoran Hao et al. · 用层级技能检索增强 VLA 在小样本新任务上的适配效率,属检索增强 VLA 的粒度改进,与 R+VLM 等已有检索方案方向重叠,创新度有限。
Tong Yang et al. · 提出轨迹级连续动作表示 CAT,解耦动作表征与控制频率/固定时间参数化的耦合以减少重映射成本,对 VLA 动作头与 ACT 类分片策略设计有参考价值。
Suhwan Choi et al. · 用预训练 MLLM 作为 episode 上下文引擎,为 VLA 注入长视觉历史与少样本行为推断能力,缓解机器人局部可观测问题;架构改造思路清晰但被更优候选挤出五强。
Ziyang Ma et al. · 均匀光照视觉触觉传感器上的滑动检测+材料分类方法,采用时空 Transformer,并提供含方向性滑动信息的新数据集,属触觉感知层工具而非触觉策略方法。
F. Richard Cottrell et al. · 耐用视觉触觉指尖硬件,解决现有触觉传感器在磨损与重复集中载荷下的易损问题,延续 GelSight 技术路线面向实际部署,非策略层贡献。
Hanyi Zhang et al. · 在 VLA 中显式编码夹爪状态与感知信息以提升抓取和操作表现,弥补多数 VLA 忽视末端执行器配置的建模缺口,属输入表征层面的工程改进。
Zijian Zhang et al. · 将 3D 高斯场的几何与语义先验蒸馏进世界-动作模型(WAM)的视频 latent,为动作条件视频预测补充显式 3D 监督信号;与已有 WAM 方向深度重叠,属改进型工作。
A. H. G. Overbeek et al. · 一次性示教学习接触丰富操作:显式识别并建模机器人-环境物理交互事件而非直接复制完整轨迹,减少 LfD 对示教数量的需求,属经典 LfD 路线。
Shijia Ge et al. · 用 3D 视觉基础模型 VGGT 替换视觉编码器,提升模仿学习的空间理解与泛化能力,是可直接复现的主干替换型改进,思路直接但方法论纵深有限。
Boyang Cai et al. · 系统性量化多视角演示数据对机器人操作的增益机制与规模规律,并探索多视角数据合成方法;其关于增益是否只是跨视角鲁棒性的结论对数据管线设计有参考价值。
Qi Li et al. · 系统梳理 VLA 带来的新型安全挑战(物理不可逆后果、多模态攻击面等),含威胁模型、评测方法与防护机制综述,重要但不紧急。
Shuoheng Zhang et al. · 接触驱动 flow matching 策略:将力反馈显式纳入生成式模仿学习,改善接触丰富操作中的力控精度,对触觉 VLA 的动作头设计有直接借鉴意义,但自身非 VLA 方法。
Pengzhi Yang et al. · 面向长程操控 RL 的置信门控进度奖励模型,用生成式进度评估缓解稀疏奖励监督弱、手工稠密奖励难设计的矛盾,可迁移到 VLA 的 RL 精调奖励层设计。
Xiao-Ming Wu et al. · 系统性地给出构建强 VLA 的配方(架构、数据、训练策略选择),通过大量消融提炼可靠实践,属 recipes 类工作总结,对自建 VLA 有实践指南价值。
Linhan Wang et al. · 面向世界-动作模型的部署延迟痛点,提出稀疏测试时想象策略,仅对关键帧做视频生成以在控制率内运行;工程配套价值明确,但范式创新不及同批 WAM 挑战论文。
Yumeng He et al. · 从单目图像自动编程生成带物理属性的可交互仿真场景,为 Embodied AI 提供仿真资产生成管线,降低场景构建成本,对 VLA 仿真数据合成有间接价值。
诊断并校准动作条件世界模型:检验生成未来是否真正遵循输入动作而非只拟合专家演示分布,并提出对齐方法,是 WAM 可信度评估的重要评测性工作。
Dingqi Zhang et al. · 用条件 flow matching 将 latent-conditioned 自适应策略的隐变量翻译为可检查、可回滚的物理模型(系统辨识),提升潜变量策略可解释性,非 VLA 场景。
Sibo Tian et al. · 锚点级 flow matching 与安全裕度偏好微调结合的端到端神经运动规划器,面向杂乱环境避障规划,属自主导航规划而非机械臂操作策略。
J. D. Peiffer et al. · 光纤传感数据手套:在遮挡与光照变化下高精度捕捉灵巧操作手部姿态,避免视觉方法遮挡退化与磁手套漂移,对灵巧操作示教数据采集有实用价值。
XPolicyLab Community et al. · 统一机器人策略评测与部署的开放标准生态,将 N 策略×M 环境的 O(NM) 集成降为 O(N+M) 接入成本;对 VLA 基准对比与落地部署是重要基建,但属工程生态而非新方法。
Kevin Murphy · LLM 驱动贝叶斯实验设计,自动发现机理/因果世界模型,属数据高效科学发现工具;作者 Kevin Murphy,思想可借鉴但与机器人操作无直接关联。
Wenhow Li et al. · 实证检验世界模型所学表征是否趋同于共享的柏拉图式表征,揭示多任务世界模型内部表征收敛规律,理论性工作,对理解 WAM 表征有间接启发。
Wenxuan Shen et al. · 从在野游戏视频中解纠缠屏幕交互与游戏世界,为视频世界模型提供大规模训练数据引擎,面向通用视频生成场景,与机器人操作无直接关联。
Hsiang-Wei Huang et al. · 为潜在世界模型提出生成式潜在流规划,将每对状态-目标的迭代轨迹优化变为单步生成,提升规划速度,面向模型预测控制场景。
Alain Bensoussan et al. · 几何监督潜在世界模型在控制中的有限样本学习-控制理论分析,给出样本复杂度与度量不坍缩保证,理论性强,为 latent world model 控制提供基础性保证。