DeCAL: Towards Physically-Grounded Dexterous Vision-Language-Action Models via Contact-Aware Latent Co-Imagination
针对灵巧操作中严重视觉遮挡与复杂接触动力学,提出接触感知的潜空间'协同想象',把触觉与视觉预测耦合进 VLA 潜表示以增强物理接地。可复用其接触潜变量监督与触觉-视觉联合想象模块。
针对灵巧操作中严重视觉遮挡与复杂接触动力学,提出接触感知的潜空间'协同想象',把触觉与视觉预测耦合进 VLA 潜表示以增强物理接地。可复用其接触潜变量监督与触觉-视觉联合想象模块。
AgiBot Research Team et al. · 系统研究 world-action model 的预训练与规模化,而非直接继承现成视频生成器,统一利用无动作视频与带动作交互数据训练可预测未来状态的操作模型。可复用其 WAM 预训练配方与缩放结论。
Zhaohong Mai et al. · 把力/力矩感知与 VLA 结合,指出已有力感知 VLA 缺乏控制感知的柔顺性,提出控制感知的柔顺 VLA 以稳定接触富集操作。可复用于插拔、擦拭等力控任务。
Yanzhe Chen et al. · 指出现有 VLA 经 SFT 后只学到'成功行为在哪'、缺少'何时失效'的信号,提出失败边界学习为策略补充可靠性判据。可直接用于提升现有 VLA 的部署鲁棒性与失败检测。
Songhua Yang et al. · 让 VLA 通过上下文模仿快速适配新操作场景,用时空对齐的演示检索与拼接取代梯度更新,解决任务数据/算力稀缺时的快速部署。可复用其检索-对齐的免训练适配流程。
Jindou Jia et al. · npj Robotics 论文,主张在机器人学习流程中引入物理一致性过滤来提升策略泛化,属于机器人学习的通用归纳偏置方法,摘要未涉及 VLA 架构或操作 benchmark,暂无可直接复用的 VLA 接口。
Anton Bredenbeck et al. · 用仿人手+柔性触觉受体实现空中抓附停靠,触觉硬件设计与信号处理有参考价值,但任务为飞行器停靠而非 VLA 操作策略,与触觉 VLA 的感知-动作耦合路径不同。
Jean Pierre Sleiman et al. · Science Robotics 论文,研究运动型机器人的零样本技能迁移控制,属于腿足/全身运动控制范畴,不涉及视觉-语言-动作策略或操作数据,对 VLA 主线参考有限。
Zhengyi Luo et al. · 通过大规模动作捕捉数据扩展实现自然人形全身控制,是运动跟踪与全身控制的重要工程进展,但属人形运动技能学习,与 VLA 的语义-操作范式无直接交集。
Yushi Wang et al. · 学习视觉驱动的反应式足球技能,属人形机器人敏捷运动与竞技任务,不含语言条件或操作泛化实验,与 VLA 研究主线关联度低。
Josua Spisak et al. · 以婴儿床中的机器人探索感觉运动偶联学习机制,属发展机器人与认知科学方向,方法为行为实验而非可复用策略架构。
Qiayuan Liao et al. · 用引导扩散把动作跟踪扩展为多样化人形控制,扩散生成在运动控制上的应用可借鉴,但任务空间与 VLA 操作策略、动作分块建模差异较大。
Mingshi Chi et al. · 面向人形机器人的汇聚双目立体深度感知设计,属感知硬件与几何标定工作,未涉及策略学习或语言条件操作。
以 3D 一致的 waypoint 作为 VLM 与策略之间的中间表示,提升操作泛化;思路与已有轨迹/waypoint 中间表示工作重叠较多,属可参考的工程改进。
Yifan Han et al. · 把人类演示中的可操作信息表示为面向动作的 4D affordance 并跨本体迁移到机器人控制,跨本体迁移思路有价值,但摘要未给出与 VLA 策略的整合路径或 benchmark 结果。
Long Xu et al. · 用 agentic 流程在仿真中自动生成可交互、功能化的物体组合场景,用于操作模型的评测与数据生成;属数据/场景自动化管线,对 VLA 训练数据扩充有间接价值。
Guangming Wang et al. · 提出脑启发的分层框架做零样本任务推理与执行,把语义意图、几何可行性与物体状态分层衔接;属模块化任务规划路线,与端到端 VLA 范式路线不同。
Lan Wei et al. · 针对杂乱场景中重复物体、指代歧义问题,提出目标-锚点-参考系联合接地的身份感知指代方法;属 VLA 语言接地模块的具体改进,但贡献偏单点。
Truong Thanh Nguyen et al. · 用全局几何与局部 VLA 交互的分层结构处理非结构化环境的长程操作,属全局-局部混合策略的工程方案,摘要未给出与现有 VLA 的量化对比。
Yian Wang et al. · 用图像编辑模型生成兼具语义意义与物理可执行的具身训练数据,缓解演示数据采集成本高的问题;数据增强路线可参考,但到 VLA 训练收益的验证尚不明确。
Chang Song et al. · 针对长程 VLA 执行偏差,提出阶段感知的可观测状态理解与基于提示的闭环恢复;属推理期纠错外挂,与已有 VLA 闭环纠偏工作重叠度较高。
Tan Su et al. · 用成功参考轨迹的反事实对应关系条件化扩散策略,缓解物体位置与相机视角同时变化时的失效;属扩散策略泛化的具体改进,未见 VLA 层面整合。
Jian Ding et al. · 把上下文学习引入操作,用 flow matching 替代离散自回归动作以缓解早期预测误差累积;与同期 in-context 模仿工作在问题设定上高度重叠,可作对照阅读。
Haiyang Sun et al. · 提出过程级记忆 benchmark,评测 VLA 在关键信息已不可见时的操作能力,填补现有记忆 benchmark 只看结果不看过程的空白;属评测工具,重要但不紧急。
Zhenxin Li et al. · 提出全离散的行为策略建模(LDiP),用随机迭代打分替代连续扩散去噪,提升可解释性;属策略表示层面的探索,摘要未展示其与 VLA 骨干结合的效果。
Zhe Li et al. · 用两阶段教师-学生框架与预测式状态空间模型提升人形运动在感知不完美下的稳定性,属运动控制与世界模型交叉,与 VLA 操作策略不直接相关。
Ayoub Kirouane et al. · 研究把希腊语加入开源 VLA 栈时仅用机器改写指令的迁移效果,触及 VLA 多语言泛化这一被忽视的问题,但实验规模有限、结论偏诊断性。
Hongxiang Zhao et al. · 发布手到夹爪迁移数据集并给出基线,覆盖复杂空间运动(超越平面任务);数据集对低成本数据扩展有用,但方法贡献有限。
Boliang Liu et al. · 研究 6G 连接下 VLA 模型的通信感知切分推理,缓解端侧算力不足;属部署/网络协同优化,通信侧假设强,对 VLA 架构本身无改动。
Hengxiang Chen et al. · 面向接触富集移动操作的多模态遥操作与数据采集框架,同时处理全身协调与柔顺性调节;可作为 VLA 数据采集工具参考,但非策略学习方法本身。
Weiwei Gu et al. · 提出评测机器人'观察学习'能力的 benchmark,为 LfO 这一数据扩展路径提供统一评价;属评测基准,与 VLA 数据扩展方向相关但非直接方法。
Jingxuan Zhu et al. · 提供可自建的双臂操作仿真训练场,突破已有管线局限于固定场景的限制,用于规模化生成双臂数据;属仿真数据工具,对双臂 VLA 数据扩充有间接帮助。
Ruiyu Wang et al. · 提出 focus pooling 在特征层面聚合空间局部、控制相关的视觉线索,提升视觉运动策略的数据效率;属视觉编码器层改进,可迁移到 VLA 视觉塔但贡献偏小。
Tinghe Ding et al. · 指出动作分块可跨越多个任务阶段、首步标签只描述当前阶段的问题,提出块对齐语义蒸馏为整段动作生成语义监督;属动作分块监督的细化改进,可小幅复用于 VLA 训练。
Boheng Liu et al. · 针对光学触觉传感器在光学设计、弹性体力学、成像几何差异下难以跨传感器迁移的问题,提出脑启发的少样本触觉自适应;对触觉 VLA 的跨硬件迁移有参考价值,但未与操作策略端到端结合。
Anqi Li et al. · 用全身 VLA 模型做杂乱室内人形导航,把导航从 2D 路径规划提升为几何感知的全身动作生成;属移动/导航侧 VLA 应用,与操作主线距离较远。