Generalizable VLA Finetuning via Representation Anchoring and Language-Action Alignment
Dwip Dalal et al. · 提出表示锚定与语言-动作对齐方法,解决BC微调覆盖预训练表征的问题。提供可复用的微调策略,提升泛化性。
Dwip Dalal et al. · 提出表示锚定与语言-动作对齐方法,解决BC微调覆盖预训练表征的问题。提供可复用的微调策略,提升泛化性。
Yuan Xu et al. · 通过语义锚点防止VLA微调退化,保持预训练模型的泛化结构。方法直接作用于VLA表征学习,具有明确的工程应用价值。
Yingwei Ji · 实证研究阶段信息接口在VLA微调中的作用,利用分段动作标注作为中间表示。为长程任务分解提供具体工程洞见。
Xiaopeng Zhang et al. · 结合Agentic RL解决VLA在长程操作中的误差累积问题。提供将高层推理与底层鲁棒执行结合的可行路径。
Yongzhong Wang et al. · 提出闭环数据生成框架,通过语义规划和因果环境重置解决数据瓶颈。为VLA训练提供可扩展的数据收集方案。
Charlotte Morissette et al. · 提出TacFiLM轻量级融合模块,将视触觉信号引入VLA。填补触觉VLA方向空白,代码/方法易于集成。
Haoming Xu et al. · 将操作解耦为粗定位和精细接触两阶段,模拟人类行为模式。提供新的VLA策略架构思路,适用于接触丰富任务。
Motubrain Team et al. · 提出统一世界动作模型Motubrain,联合建模视频与动作。探索世界模型在VLA控制中的应用,具有前瞻性。
Ke Rui et al. · 诊断并解决多技能组合中的语义交接失败问题。针对长程任务的Agent编排痛点,提供具体的调试与改进方法。
Yushen Liang et al. · 引入时间条件记忆融合机制,改善VLA的被动反应特性。通过历史状态融合提升时序一致性,方法具体可复用。
Yixian Zhang et al. · 通过记忆引导Agent冻结VLA并导向可靠操作基元。解决端到端VLA在复杂场景下的不可控问题,工程实用性强。
Shaopeng Zhai et al. · 提出基于轨迹分割的人类高效后训练框架,降低VLA适配下游任务的人力成本。优化RLHF/微调流程,具明确应用价值。
Yu Fang et al. · 分析并缓解VLA中视觉压倒语言的假象失败问题。提供评估指标与缓解策略,提升指令遵循的鲁棒性。
Zhixian Xie et al. · 提出分层RL-MPC框架解决几何感知接触操作。虽非端到端VLA,但其Sim-to-Real策略对VLA部署有重要参考。
Byeongguk Jeon et al. · 提出快速可靠的神经仿真器RoboWorld,用于通用机器人策略评估。为VLA大规模评估提供高效工具。
Chang Liu et al. · 提出首个以交互为中心的HRI基准,填补了现有VLA基准缺乏共享代理建模的空白。虽无新算法,但对评估协作能力至关重要。
Huzhenyu Zhang et al. · 针对具身AI中GPU加速仿真器的可扩展性与可靠性进行基准测试。属于基础设施层评估,对大规模训练有参考价值但非核心算法。
Honglu He et al. · 发布工业灵巧操作软硬件基准平台,涵盖线缆布线等真实任务。重要数据集/基准,但无新算法贡献。
Minkyu Ham et al. · 提出用Agentic AI弥合部署间隙的方法,侧重系统架构而非VLA核心模型。属于相邻领域,应用路径尚不明确。
Zhijin Meng et al. · 提出“启动安全性”概念,关注机器人首次不可逆社交动作的安全性。属安全伦理层面探讨,非技术算法突破。
Jiayi Tian et al. · 构建具终身多模态记忆的机器人Agent操作系统。侧重系统架构与运行时管理,非VLA核心模型创新。
Kun Yu et al. · 发布统一具身搜索与跟随基准,解决目标初始不可见设定下的评估难题。重要Benchmark,无新算法。
Giovanni Pezzulo et al. · 探讨生物有机体中的接地世界模型及其对具身AI的启示。理论综述性质,启发性强但无直接技术贡献。
Xian Li et al. · 为仿真就绪3D资产提供统一物理 grounding。属于数据/仿真基础设施,间接支持VLA训练,非核心算法。
Ilias Kazantzidis et al. · 利用世界模型从人类偏好中学习安全Agent行为。侧重安全对齐,方法论较通用,VLA特异性不强。
Fabio Arnez et al. · 从变分自由能角度理论分析JEPA世界模型。纯理论研究,对VLA实践指导意义有限。
David Courtis et al. · 面向ARC-AGI的任务编程世界建模,侧重抽象推理而非具身操作控制。与VLA核心目标距离较远。
Ingmar Posner et al. · 探讨机械世界模型在自主科学发现中的应用。属AI for Science范畴,非机器人操作。
Donna Vakalis · 提出潜在世界模型的规划时诊断方法。属世界模型评估理论,非VLA直接相关。
Zhen Li et al. · 将交互式世界模型重新构想为游戏引擎。概念新颖但偏图形学/仿真,离VLA落地较远。
Xin Wang et al. · 提出具备反事实可控性的自进化世界模型视频生成。侧重视频生成质量,非机器人控制。
Zhishan Zou et al. · 评估UAV具身智能中的自我意识与空间认知。属无人机领域Benchmark,非地面机器人操作。