{\tau}: Learning Touch-Augmented Vision-Language-Action Models from Future Visual Supervision
Ning Cheng et al. · 提出利用未来视觉监督学习触觉增强VLA的新范式,解决接触丰富操作中视觉信息不足的核心瓶颈,填补触觉VLA方向空白。
Ning Cheng et al. · 提出利用未来视觉监督学习触觉增强VLA的新范式,解决接触丰富操作中视觉信息不足的核心瓶颈,填补触觉VLA方向空白。
Yuewei Sun et al. · 提出环境感知的模型选择框架,动态切换快慢推理系统以平衡VLA的响应速度与长程规划能力。提供可复用的推理加速方案,适合部署端优化。
Yao Wang et al. · 解决跨具身导航中语义可行但物理不可行的问题,通过残差适应机制将VLA的语义先验适配到不同移动底盘的运动约束中。
Guiyu Zhao et al. · 引入持久化的世界-自我状态建模,缓解单目腕部相机在部分可观测和长程任务中的信息缺失,提升VLA对环境的持续理解能力。
Bingqi Huang et al. · 针对场景相机视角变化导致的VLA策略失效问题,提出仅依赖RGB图像的跨视图动作一致性约束,增强策略对相机扰动的鲁棒性。
Jinhe Tang et al. · 针对动作分块模仿学习中的感知误差和执行漂移,提出校准干预机制以修正预测轨迹,提升长序列动作执行的稳定性。
Ziheng Liu et al. · 提出语义-动作解耦的RL后训练方法,解决SFT分布不匹配问题,通过分离高层语义指令与底层动作控制提升VLA微调效果。
Min Lin et al. · 引入协同声明式记忆模块扩展VLA的记忆容量,支持长程移动操作任务,解决现有VLA局限于短视距桌面操作的瓶颈。
Yuhan Xie et al. · 针对多模态扰动(视觉损坏、语言噪声)提出解耦鲁棒性学习方法,提升VLA在复杂干扰环境下的任务成功率与泛化能力。
Yuze Fan et al. · 针对冻结VLA策略在长程操作中的累积误差,提出时域检索与频域校正机制,利用成功 rollout 修正后续动作预测。
Xinyu Wang et al. · 提出复合旋转与逐步缩放量化方法,解决VLA大模型及扩散头在设备端部署的高成本问题,实现高效且鲁棒的模型压缩。
Hao Ren et al. · 研究无需时间顺序视频流或深度传感器的图像目标导航方法,虽属Embodied AI范畴,但未明确结合VLA架构或操作任务,偏向纯导航算法。
Xiangkai Ma et al. · 提出解耦意图与轨迹的世界动作模型表示推导框架,侧重理论分析与生成式运动规划,缺乏明确的VLA下游任务实验验证。
Jie Ren et al. · 从单目视频中重建接触一致的灵巧手演示数据并重定向至机器人,属于数据生成与仿真领域,未直接涉及VLA模型的训练或推理改进。
Yang Shen et al. · 基于OpenArm平台的实验室移动操作场报告,展示语言引导下的自动化流程,主要贡献在于系统集成而非VLA核心算法创新。
Yuehao Huang et al. · 构建带3D场景条件的世界导航模型用于闭环VLN,虽提及VLA政策映射,但核心贡献在于导航模型本身,缺乏通用VLA操作能力的评估。
Borong Zhang et al. · 开源VLA基准测试框架VLA-Arena,旨在量化VLA的能力边界与失败模式,属于重要工具/数据集类工作,非算法创新。
Riccardo Curcio et al. · 基于李雅普诺夫引导的进化优化框架用于Sim-to-Real策略学习,侧重控制理论与安全性保证,未明确结合VLA架构。
Haodong Yan et al. · 探讨JEPA世界模型中前向预测的物理状态 grounding 问题,侧重世界模型原理分析,缺乏具体的VLA应用路径或实验。
Haowen Zheng et al. · 基于6D动态触觉传感检测瞬态外部接触,属于传感器技术与底层感知层工作,未涉及VLA高层决策或策略学习。
SM Mazharul Islam et al. · 提出任务感知的世界模型表示学习方法,过滤无关视觉信息,虽相关但更偏向通用世界模型表征,非VLA特有架构创新。
Ying Chen et al. · 提出以执行为中心的VLM,强调迭代感知与验证,但摘要未明确展示其作为VLA策略在机器人操作任务上的具体性能或架构突破。
Devin Pereira et al. · 分析Transformer在Hanoi塔等规划任务中的局限性,揭示“思考幻觉”,属于基础模型能力分析,非VLA架构或应用创新。
Yujun Wang et al. · 提出记忆增强的文本世界模型,侧重语言层面的状态预测,缺乏视觉-动作闭环的具身智能实验验证。
Jiazhuo Li et al. · 提出对抗式世界模型以拒绝共模干扰,侧重世界模型内部机制改进,未明确关联VLA策略学习或机器人操作任务。
Xuhui Zhou et al. · 研究社会交互中的隐式动态模拟与视角推理,侧重社会AI/多智能体交互,非物理世界的具身操作VLA。
Xindi Wu et al. · 解决视频世界模型中KV缓存的地址性问题,侧重生成式视频模型的内存管理,非具身控制策略。
An Lanji et al. · 提出统一JEPA架构用于任务无关的视觉世界建模,侧重自监督学习框架,缺乏VLA下游任务的具体集成与验证。
Neal Batra · 理论分析从最优动作恢复MDP转移核的可识别性,纯强化学习/控制理论推导,无VLA实证研究。
Xinyi Li et al. · 提出长视界端到端训练的世界模型,直接预测未来状态,虽相关但侧重世界模型训练目标,未明确展示对VLA策略控制的直接提升。