{\tau}: Learning Touch-Augmented Vision-Language-Action Models from Future Visual Supervision
Ning Cheng et al. · 提出τ模型,利用未来视觉监督学习触觉增强的VLA,解决接触丰富操作中触觉数据稀缺的核心瓶颈。在LIBERO等基准上显著优于纯视觉VLA,填补触觉VLA方向空白,具备新架构与新训练范式。
Ning Cheng et al. · 提出τ模型,利用未来视觉监督学习触觉增强的VLA,解决接触丰富操作中触觉数据稀缺的核心瓶颈。在LIBERO等基准上显著优于纯视觉VLA,填补触觉VLA方向空白,具备新架构与新训练范式。
Giovanni D'urso et al. · 提出反事实动作敏感性覆盖方法,通过合成视觉干扰数据增强策略鲁棒性。提供具体数据增强路径,可直接用于提升现有VLA/IL策略在光照、颜色变化下的泛化能力。
Ajay Sridhar et al. · 针对跨具身迁移难题,提出行为对齐表示学习框架。作者含Dorsa Sadigh [Stanford|Sadigh],方法聚焦于消除不同机器人形态间的表征差异,为多平台VLA部署提供可复用的对齐方案。
Zhengyang Yan et al. · 针对Flow-matching VLA的分布偏移问题,引入重定向失败至动作级修正机制。直接优化VLA推理阶段的错误累积,提供具体的工程改进思路,适用于当前主流流匹配策略。
Sihyung Yoon et al. · 构建模块化框架以弥补VLA模型作为代理时的故障恢复缺失。提供将纯预测模型转化为鲁棒Agent的工程架构,包含明确的失败处理模块,具有本周可复用的系统级价值。
Woo Chul Shin et al. · 提出SIDO方法,通过反事实动作增强解决动态物体(如传送带)操作难题。填补了静态训练到动态部署的空白,提供针对移动目标的具体数据增强策略,实用性强。
Lifeng Zhuo et al. · 提出频率自适应反应式扩散策略,解决接触丰富操作中的多模态与反应性平衡问题。针对高频接触阶段优化策略响应,为触觉/力控VLA提供具体的控制层改进方案。
Derek Ming Siang Tan et al. · 提出RL²-VLA,通过测试时缩放与自适应RL潜空间组合引导提升VLA性能。提供无需重新训练的推理阶段优化方法,具有明确的工程复用价值,可直接集成至现有VLA部署流程。
Lei Jin et al. · 提出TacWAM,结合锚点引导与力学感知触觉预测的世界动作模型。直接针对触觉VLA/WAM的痛点,提供融合触觉信息的建模方法,对接触丰富操作有明确复用价值。
Beom Jun Kim et al. · 提出直接运动引导方式收集灵巧操作演示,解决数据采集瓶颈。虽对VLA数据收集有价值,但核心贡献在于硬件交互流程而非VLA算法本身,属于相邻领域工具类工作。
Xiaoxiang Dong et al. · 利用语义锚定对应实现零样本技能迁移,侧重几何与功能映射。虽涉及操作,但主要贡献在于视觉对应算法,缺乏明确的VLA架构整合或大规模基准验证,归为值得了解。
Tianyu Yang et al. · 针对导航扩散策略的泛化问题,提出组Q分数重加权匹配。专注移动底盘导航而非机械臂操作,虽使用Diffusion Policy,但与核心VLA操作场景距离较远。
Xiangcheng Zhang et al. · 提出基于动作条件世界模型的通用决策规划器。虽涉及世界模型与行动结合,但摘要未明确展示其在VLA基准上的超越性表现或新架构特性,暂归为值得了解。
Anthony Liang et al. · 研究从无标签演示中学习连续潜在动作模型,解决标注数据稀缺问题。方法偏向表示学习与自监督预训练,虽对VLA数据效率有益,但非直接的VLA策略更新。
Tianxing Chen et al. · 发布依赖记忆的机器人操作基准测试RMBench,并分析策略设计洞察。作为数据集/基准类工作,重要但不紧急,有助于评估V长程依赖能力,无直接新方法提出。
Youqiang Gui et al. · 通过自进化扩散策略实现视野扩展,解决长视界操作退化问题。属Diffusion Policy的特定改进,虽有效但未提出颠覆性VLA架构,且已有类似Horizon相关工作,降级处理。
Zhaoyuan Gu et al. · 利用RL微调扩散策略以实现人形机器人 loco-manipulation。聚焦特定平台(人形)与控制层(Loco),虽涉及DP,但更多是工程应用与特定任务适配,非通用VLA进展。
Zhanguang Zhang et al. · 对比世界动作模型与VLA的鲁棒性,是一项实证研究而非新方法提出。虽具参考价值,但属于分析性论文,不提供可直接复用的新架构或训练范式。
Yiming Cai et al. · 发布大规模世界状态数据集CG-World及协议,支持世界模型训练。属数据基础设施工作,虽重要但无具体算法创新,归类为值得了解的数据资源。
Jia Luo · 提出从被动视频生成可编辑物理经验的方法,旨在解决具身智能数据瓶颈。方法侧重于视频编辑与物理一致性,虽对数据生成有启发,但离直接训练VLA策略仍有距离。
Xinyu Yang et al. · 提出可信具身智能的系统框架与分级标准,侧重安全与信任评估体系。属综述/框架类工作,无具体技术方法突破,适合宏观了解领域规范。
Gabe Everett et al. · 提出SymmGrid框架,利用并行对称性加速机载强化学习。侧重计算效率与数据增强,虽对On-robot learning有帮助,但非VLA核心算法进展,归为值得了解。
Zuojin Tang et al. · 提出带时间约束的分布潜在动作模型,利用无动作标签视频。方法偏向表示学习,虽有助于缓解数据稀缺,但未明确展示其在VLA端到端训练中的架构优势。
Zexuan Yan et al. · 提出EgoGenesis模拟器,结合在线锚定投影记忆与Action-3D RoPE进行第一人称世界-动作建模。侧重仿真器与表示方法,实验主要在仿真环境,真实机器人验证不足。
Weiquan Lin et al. · 综述/探讨大模型时代的手物交互重建、生成与具身迁移。属领域回顾与展望性质,无单一具体新方法提出,适合作为背景阅读。
Yukang Cao et al. · 介绍ACE-Data-0数据集,通过环境捕捉获取以人为本的具身数据。属数据资源发布,虽对VLA预训练有价值,但无算法贡献,归为值得了解。
Yuyang Liu et al. · 关于VLM持续学习的综述与分类,涵盖遗忘之外的维度。属Survey论文,无新技术提出,适合快速了解领域现状。
Jiacheng Zhou et al. · 针对世界动作模型(WAMs)的量化校准研究,解决部署成本问题。属模型压缩/部署优化范畴,虽对VLA落地有帮助,但非核心算法创新。
提出基于物理语言的PhiZero世界模型,用离散表示替代像素预测。概念新颖,但摘要未展示其在机器人操作任务上的具体性能或与现有VLA/WAM的对比,暂归值得了解。
Hui Zhang et al. · 提出统一跨技能灵巧操作合成方法,涵盖抓取、旋转等 canonical skills。侧重灵巧手技能库构建,虽相关但缺乏明确的VLA架构整合或大规模基准SOTA突破。
Xiaofan Lu et al. · 介绍新型曲面多光谱视觉触觉传感器FasTac。属硬件传感创新,虽为VLA提供数据源,但非算法或模型层面的进展,归为值得了解的硬件配套。
Zhoushun Yu et al. · 提出分位数匹配方法正则化世界模型的潜在分布。属模型训练技巧改进,虽有助于稳定性,但非VLA核心架构创新,贡献度有限。
Kanata Suzuki et al. · 针对实验室自动化的紧凑任务对齐模仿学习。应用场景垂直,方法侧重特定任务适配,缺乏通用VLA方法的创新性,归为值得了解。
Kaizhen Tan et al. · arXiv:2607.27017v2 Announce Type: replace-cross Abstract: A central premise of latent world models is that predicting the future forces a representation to internalize the physics of its environment. Which physical quantities does a trained latent actually contain, and what decides this? We answer with controlled interventions in POKEWORLD, an interactive environment whose visually identical objects hide mass, drag, and contact stiffness. A certificate-gated protocol first certifies each paramet
Jin Cao et al. · 提出ShadowDancer,通过视频及其阴影学习统一动力学表示以控制视频世界模型。侧重视频生成与控制,虽涉及动作,但主要应用于视频编辑/生成,非实体机器人操作。
Mohand Mezmaz et al. · 利用在线模仿学习进行组合构造的语言模型方法。侧重组合优化与语言模型结合,虽提及Imitation Learning,但非典型机器人操作策略,归为值得了解。
Nikhilesh Prabhakar et al. · 结合神经符号方法与人类指导的模仿学习,利用特权信息。方法较传统,侧重小样本学习效率,未体现VLA大模型时代的最新进展,归为值得了解。