FlowDAgger: Human-in-the-Loop Adaptation of Generative Robot Policies in Latent Space
Michael Murray et al. · 提出在潜在空间结合流匹配与人类反馈进行策略在线适应的方法,解决预训练生成策略的分布外失效问题。核心亮点是低延迟的人机协同微调机制,可直接用于提升现有 VLA 部署鲁棒性。
Michael Murray et al. · 提出在潜在空间结合流匹配与人类反馈进行策略在线适应的方法,解决预训练生成策略的分布外失效问题。核心亮点是低延迟的人机协同微调机制,可直接用于提升现有 VLA 部署鲁棒性。
Yuri Ishitoya et al. · 通过语言-动作对齐实现从 VLM 到 VLA 的直接适配,无需大规模机器人数据重训。该方法保留了 VLM 语义能力并隔离了架构修改的影响,为快速构建轻量级 VLA 提供了新路径。
Yujie Pang et al. · 针对动作分块 Transformer (ACT) 引入后训练 Actor-Critic 框架,以应对姿态扰动和接触力约束。该方法直接优化现有主流 VLA 骨干网络,具有明确的工程复用价值和性能提升潜力。
Xiaoshen Han et al. · 提出用 B 样条曲线参数化连续动作以加速机器人操作策略,替代离散时间动作块预测。显著降低推理延迟和内存占用,为资源受限边缘设备上的 VLA 部署提供高效解决方案。
Zihan Zhou et al. · 结合任务分解、自动生成数据、模仿学习和 RL 形成混合技能策略,解决长视界操作难题。Animesh Garg 团队工作,提供了从规划到控制的完整闭环方案,具备较高的系统级参考价值。
Yuzhi Huang et al. · 在 VLM 中引入时空推理与记忆机制,解决长视界操作中每步孤立推断的问题。通过维护场景几何和状态记忆,提升了 VLA 在复杂序列任务中的连贯性和准确性,具有明确的架构改进。
Shiyuan Yang et al. · 提出轻量级 VLA 模型 FabriVLA,结合 InternVL3.5 骨干与流匹配动作头及门控自注意力。旨在平衡精度与效率,适合资源受限场景下的多任务操作,具有明确的轻量化工程价值。
Iris Xu et al. · 提出事后强化学习方法以提高 VLA 后训练的样本效率,利用历史 rollout 数据进行回溯更新。直接针对 VLA 训练成本高痛点,提供具体的 RL 精调改进方案,具有高复用价值。
Iaroslav Kolomiets et al. · 提出 AgenticFocus 方法,从人类第一人称视频合成保留物体细节的混合现实数据,用于灵巧人形机器人学习。解决了手部遮挡和数据稀缺问题,为人形 VLA 提供了高质量数据生成路径。
Rishabh Madan et al. · 提出基于触觉和视觉条件的接触中心控制方法,用于整臂操作。突破了传统仅关注末端执行器的假设,为复杂接触场景下的 VLA 控制提供了新的多模态融合思路。
Haohui Huang et al. · 利用刚性几何一致性将生成视频转化为可执行的机器人操作先验,解决生成内容缺乏物理可行性的问题。虽涉及视频到操作的映射,但主要贡献在于仿真/合成数据生成而非核心 VLA 架构创新。
Haohui Huang et al. · 提出可达性门控和语义掩码约束的视频到机器人操作可行性补全方法。侧重于将通用视频先验转化为特定机器人的可执行轨迹,属于数据预处理或中间层转换,非端到端 VLA 核心突破。
Brendan Hertel et al. · 结合力约束弹性地图实现单样本多模态示教学习,强调运动与接触力的联合推理。虽然涉及触觉/力觉,但方法更偏向传统 LfD 改进,未明确展示在主流 VLA 基准上的泛化优势。
Xiaoshen Han et al. · 通过 3D 照片级真实到仿真的转换生成高保真模拟数据,缓解 Sim-to-Real 鸿沟。作为数据集/仿真工具类工作,对 VLA 训练有价值,但本身不涉及新的模型架构或训练范式。
Jialiang Li et al. · 利用大规模第一人称人类数据学习主动感知能力,以解决非结构化环境中的信息不确定性。侧重于感知层面的主动性,虽与 Embodied AI 相关,但未直接涉及 VLA 的动作生成或控制架构。
Trinity Chung et al. · 大规模探索触觉传感器抽象对灵巧操作策略的影响,分析硬件成本与性能权衡。作为系统性实证研究,填补了触觉 VLA 领域的空白,但属于基准/分析性质,非新算法提出。
Sunshine Jiang et al. · 提出基于提示的探索方法以克服 RL 中随机抖动导致的局部采样局限。虽可能应用于机器人,但摘要未明确提及机器人实验或 Embodied AI 场景,暂归为相邻领域方法论。
Junfei Zhan et al. · 揭示边缘设备上 VLM 推理的真实能耗瓶颈,指出语言处理而非视觉处理才是主要耗能点。为 VLA 部署优化提供重要洞见,但属于系统性能分析,非算法或模型架构创新。
Suting Ni et al. · 发布 TactiDex 基准,专注于真实世界中触觉引导的人类般灵巧操作。填补了触觉 VLA 评估空白,但作为数据集/基准论文,其紧急程度低于新算法,故归为值得了解。
Yufan Wei et al. · 提出因果去偏潜在动作模型以改进 Embodied 动作条件世界模型。侧重于世界模型的因果推断能力,虽与规划相关,但尚未明确展示其在端到端 VLA 控制中的直接应用效果。
Eric T. Chang et al. · 介绍 SpikeATac 多模态触觉手指,结合动态压电和静态电容传感。属于硬件传感器创新,虽对灵巧操作至关重要,但非软件/VLA 算法层面的进展。
Maureese Williams et al. · 提出图增强树搜索结合分层世界模型以提高智能体规划效率。侧重于高层规划算法,虽可用于机器人,但摘要未明确指向底层 VLA 控制或具身智能的核心操作任务。
Kehan Guo et al. · 通过噪声空间对齐在流匹配中实现属性控制和奖励传输。属于生成模型理论改进,虽可间接服务于 VLA 动作生成,但缺乏直接的机器人操作实验验证和应用路径说明。
Vardhan Dongre et al. · 通过对话对齐世界模型以实现具身多智能体协作。侧重于多智能体通信与协调,虽属 Embodied AI 范畴,但与单智能体 VLA 的核心操作控制距离较远。
Rajat Ghosh · 论述降阶模型与世界模型的功能解剖关系,属于理论综述/观点文章。虽有助于理解世界模型原理,但无具体新方法或实验,紧急程度低。