Patch Policy: Efficient Embodied Control via Dense Visual Representations
利用 ViT 密集特征替代全局 Token 提升 VLA 空间细节保留能力,解决现有策略压缩信息损失问题。提供基于 Patch 的视觉编码新范式,可直接集成至 RT/ACT 等 backbone 中复用。
利用 ViT 密集特征替代全局 Token 提升 VLA 空间细节保留能力,解决现有策略压缩信息损失问题。提供基于 Patch 的视觉编码新范式,可直接集成至 RT/ACT 等 backbone 中复用。
Yuhan Liu et al. · 引入前瞻残差 RL 解决 VLA 在接触丰富装配任务中的信用分配难题,通过预测未来状态修正动作。提供针对长程接触任务的微调策略,具有明确的工程应用价值。
Zihao He et al. · 解决多模态扩散策略中不同模态延迟不一致问题,提出延迟感知引导融合机制。直接优化 Diffusion Policy 在多传感器异步输入下的表现,代码可复用性强。
Guanghu Xie et al. · 为流匹配策略引入分层接触进度引导,解决多模态动作采样中的价值估计偏差。提供针对接触丰富任务的 Flow Policy 改进方案,具实操价值。
Tuan Duong Trinh et al. · 深入分析推理步骤对 VLA 抗扰动鲁棒性的影响,揭示中间推理可能引入噪声的风险。提供关于 VLA 内部推理模块设计的实证洞见,指导架构优化。
Peng Ren et al. · 为人形机器人 VLA 引入持久化 3D 对象 Token,解决移动操作中的物体跟踪与遮挡问题。填补 VLA 在长程移动操作中状态一致性维护的技术空白。
Ruicheng Li et al. · 将力觉记忆融入 VLA 以增强接触丰富操作的性能,突破纯视觉记忆的局限。提供多模态触觉 VLA 的具体实现路径,契合当前触觉 VLA 研究热点。
Yutai Li et al. · 提出 PrimitiveVLA 通过学习可复用运动基元解决 VLA 数据效率低的问题,替代直接指令映射。提供模块化 VLA 训练新思路,有助于提升泛化性。
Dong Jing et al. · 赋予 VLA 速度可控能力,区分低风险快速移动与高风险精细接触阶段。解决现有 VLA 固定执行速度的缺陷,提升实际操作安全性与效率。
Ziqian Wang et al. · 提出 Q-VGM 算法,通过 Q 值梯度匹配实现 Flow-Matching VLA 的离线 RL 精调。解决流匹配策略强化学习难收敛痛点,具重要理论价值。
提出 ConceptTree 框架以增强机器人长程操作的可解释性,将技能选择映射为语义树结构。虽涉及 VLA 决策过程,但侧重于事后解释而非控制架构改进,缺乏具体 VLA 实验细节。
Zhengfei Lu et al. · 针对连续导航中的灾难性遗忘,提出双曲空间动态聚类记忆回放机制。聚焦移动底盘导航而非机械臂操作,与 VLA 灵巧操作核心目标存在领域偏差。
Yang Liu et al. · 构建解耦认知规划与物理执行的智能体操作系统框架,强调状态共享与语义验证。偏向系统架构设计,缺乏具体的 VLA 模型训练细节或 Benchmark 性能对比。
Zi-Qi Yang et al. · 提出用户驱动的 LfD 方法,同时学习轨迹与阻抗以减少示教负担。传统机器人学习方法,未结合 VLM/VLA 大模型先验,创新点局限于经典控制层面。
Murilo Vinicius da Silva et al. · 结合开放词汇感知与人机共享自主权辅助遥操作,提升工业场景下的操作精度。侧重人机协作接口设计,非端到端 VLA 控制架构的核心突破。
Qianwen Zhao et al. · 利用解析模型引导神经网络预测抓取顺应性,服务于力控工具使用。聚焦底层力学特性预测,未涉及高层语义指令到动作的 VLA 映射。
Kehan Li et al. · 发布多尺度具身基础模型 RynnBrain 1.1,支持感知与定位。虽宣称通用性,但摘要缺乏具体 Benchmark 对比数据,且类似工作较多,需正文验证实质提升。
Jinbang Huang et al. · 提出基于记忆的异构策略编排框架,用于长程任务规划。侧重上层任务分解与策略调度,非底层 VLA 动作生成的核心算法改进。
Matteo Bortolon et al. · 旨在简化机器人抓取感知流程,减少对新物体的重训练需求。标题宏大但摘要缺乏具体技术路线描述,疑似工程工具类工作,学术贡献度不明。 [💧灌水]
Aryaman Gupta et al. · 从部署日志中无监督发现失败分类法,适用于多种机器人系统。属数据分析与运维工具,非 VLA 模型架构或训练范式的核心创新。
Mohamad Al Mdfaa et al. · 使用时空知识图谱作为具身问答的持久场景记忆,解决长视频推理成本问题。聚焦 EQA 任务而非物理操作控制,与 VLA 动作生成目标不同。
Utkarsh A Mishra et al. · 结合组合扩散模型与引导搜索进行长程规划,侧重生成式规划算法。未明确展示在真实机器人操作任务中的应用,与 VLA 直接控制存在差距。
Mu Huang et al. · 提出用于软体机器人操作的 Real-to-Sim 神经模拟器,解决变形体动力学模拟难题。属仿真工具开发,非 VLA 控制策略本身。
Liangwang Ruan et al. · 利用 ADMM 优化提升灵巧抓取的合成质量,满足运动学与动力学约束。属底层抓取规划算法,未结合 VLA 高层语义理解能力。
He Zhang et al. · 报告 HyVLA-0.5 端到端系统,涵盖数据收集到 RL 后训练全流程。属系统工程报告,虽全面但缺乏单一核心算法突破,更多是工程整合。
Ilia Larchenko · 分享 ICRA 2026 衣物折叠比赛获奖方案,基于 VLA 改进。属特定任务解决方案报告,通用性有限,主要价值在于工程实践参考。