Act with Intent: Distilling Behavior Intent for Vision-Language-Action Models
提出在行为克隆之外蒸馏“行为意图”作为训练信号,让 VLA 动作解码器学会指令对应的局部目标。可作为新训练目标接入现有 VLA 流水线。
提出在行为克隆之外蒸馏“行为意图”作为训练信号,让 VLA 动作解码器学会指令对应的局部目标。可作为新训练目标接入现有 VLA 流水线。
Farida Mohsen et al. · 用 Mamba 选择性状态空间替换 SmolVLA 骨干,改善精度-算力折衷并提升策略调用频率。轻量 VLA 部署可直接复用其架构与权重。
Haru Kondoh et al. · 为 VLA 引入反事实监督,用违反指令的负样本显式对齐动作选择,弥补纯 BC 无负监督的问题。可加入主流 VLA 训练目标。
Dongzhou Cheng et al. · 针对双臂 query-based VLA 的动作不连续问题,提出极简的模态掩码增强以提升鲁棒性。方法简单,可直接在双臂 VLA 训练中复现。
Lars Osterberg et al. · 统一多模态记忆与控制,解决 VLA 在非马尔可夫长程任务上的记忆缺失。可迁移到现有 VLA 策略,补齐长期依赖瓶颈。
Jean Pierre Sleiman et al. · Science Robotics 论文,研究运动型机器人(非操作)的零样本技能迁移,可能涉及跨形态或 sim2real。与 VLA 操作主线无直接关联。
用 object-centric 表示的分层系统做长程操作,强调可解释与可靠验证,相对端到端 VLA 数据需求低;未看到具体基准结果。
Blossom Treesa Bastian et al. · 在 NoMaD 导航策略中引入顶视相机方向引导,解决未知环境无目标图/拓扑图时的探索。面向导航,非操作。
Xinyuan Wu et al. · 把诊所图像转成数字孪生场景用于 embodied AI 任务级评测,降低真实环境测试成本。属评测基础设施,非操作算法。
Carl Glen Henshaw (US Naval Research Laboratory) · 利用力/力矩传感器在线适配机器人-工具间的运动学关系,用于接触丰富操作。偏经典控制,非 VLA 方法。
Shuai Zhao et al. · 目标条件自主挖掘控制框架,将空间作业意图转为铲斗运动,面向工程机械特化场景。
Houlin Li et al. · 人类在环的持续交互蒸馏,让真实机器人快速学习并扩展到持续新任务。侧重 RL 训练效率,非 VLA 架构。
Fenghao Lei et al. · 质疑视频生成式世界模型的必要性,提出直接从未来隐状态推断动作,省去密集视频预测。概念有新意,摘要未包含机器人实验证据。
Roman Ibrahimov (Princeton University) et al. · 扩散策略引导自适应控制处理建筑装配的接触丰富操作,零样本应对制造不确定性。面向建筑专用,非通用 VLA。
Jie Yin et al. · 用世界模型学习人形机器人全身视觉移动操作,处理部分可观测和接触动力学。人形全身控制方向,非 VLA 直接贡献。
Annalena Hartmann et al. · 混合事件相机与帧相机实时跟踪变形线状物体,提高鲁棒性与时间一致性。感知层方法,可辅助线缆/软体操作。
Jindou Jia et al. · 从生物物理结构出发,用物理滤波器/反馈提升机器人对新环境的泛化。与 VLA 训练无直接接口。
Mengao Zhao et al. · 构建文本不可或缺的指令跟随操作 benchmark,检查 VLA 是否真遵循语言而非物体先验。评测资源,适合评估部署。
Xiwen Chen et al. · 为 VLA 设计带类型的隐状态空间指代接口,替代文本坐标/动作 token,强化几何推理与执行的连接。接口设计较特化,等实验验证。
Zhiruo Zhou et al. · 针对检索增强 VLA,提出 prompt-authority 控制让外部文本按需介入,避免原始拼接降低表现。推理期方法,适合轻量改进。
Nils Mandischer et al. · 将 SmolVLA 接入 ROS2 工业级轻量机器人,适配小批量产线。偏工程集成,研究创新有限。
Zhesheng Zhang et al. · 同场景指令对比式 embodied AI 安全 benchmark,检测良性指令与安全场景组合后的潜在风险。安全评测数据,非方法。
Abdul Monaf Chowdhury et al. · 用自然语言反馈作为错误推理信号,让语言引导操作智能体从自身失误中学习。改进学习方法,非 VLA 主线。
Salma Mozaffari (Princeton University) et al. · 扩散策略学习木结构榫卯装配,应对制造误差和接触丰富操作。面向建筑自动化专用任务。
Paul Pacaud et al. · 用 VLM 检测规划与执行错误,扩充失败样本覆盖面提升泛化能力。可用于 VLA 部署监控,本身不是操作策略。
Daniel Ruan (Princeton University) et al. · 面向工业机器人 visuomotor 策略的延迟感知训练框架,补偿观测-推理-执行间隙。部署工程,非新算法。
Boyang Cai et al. · 系统量化多视角演示对操作学习的增益与机制,并给出数据合成方法。指导多相机数据采集,属数据研究。
Aggelos Psiris et al. · 机器人基础模型综述,覆盖方法/模型/数据集与挑战,适合入门,非新进展。
Yi Wang et al. · 提出部署中车队级 RL,用分布偏移和人工校正数据持续精调通用策略。训练范式重要,但摘要未给方法细节与基准结果。
Pengfei Zhou et al. · 统一视频-动作世界模型,让操作策略先预测并评估后果再执行。方向与现有 WAM 一致,需见实验验证。