TACO: TActile World Model as a Self-COrrector forScalable VLA Post-Training
Shengbang Liu et al. · 引入基于触觉的世界模型作为后训练阶段的自校正模块,解决 VLA 在接触丰富任务中的失败问题。提供了具体的触觉融合与修正机制,具有明确的工程复用价值。
Shengbang Liu et al. · 引入基于触觉的世界模型作为后训练阶段的自校正模块,解决 VLA 在接触丰富任务中的失败问题。提供了具体的触觉融合与修正机制,具有明确的工程复用价值。
Hanchen Cui et al. · 利用潜在世界模型在部署阶段引导冻结的 VLA 策略,无需微调即可应对分布偏移。提供了一种即插即用的推理时增强方案,具备本周复用的工程潜力。
Pengwei Zhang et al. · 针对 VLA 中视觉主导导致的触觉模态坍塌问题,提出残差触觉表示方法 ResTacVLA。有效提升了接触丰富任务的性能,是触觉 VLA 方向的实质性进展。
Li Ji et al. · 设计分层具身记忆机制 HiMe,解决 VLA 在非马尔可夫长程任务中的遗忘问题。通过层次化存储提升长期推理能力,方法清晰且针对核心瓶颈。
Haozhe Zhang et al. · 利用条件路由专家机制 CoRE-VLA 处理传感器异构性和故障鲁棒性。通过 MoE 架构提升 VLA 在真实部署中的可扩展性,具有明确的架构创新。
Xinyi Xie et al. · 将树搜索蒸馏为动作评估器,用于增强冻结 VLA 模型的泛化性而无需重训。提供了一种高效的推理时优化手段,适合快速集成到现有 VLA 流程中。
Iok Tong Lei et al. · 提出 ACE 框架,通过零样本工作流推理实现具身代理控制。强调高层逻辑推理与底层执行的解耦,为 Agentic VLA 提供了新的实现路径。
Dijia Zhan et al. · 提出 SEAM 方法平滑动作块之间的执行不一致性,解决多模态分叉问题。针对 VLA 常见的动作不连续痛点,提供即插即用的后处理优化方案。
提出一种从简单到复杂的结构化演示数据构建方法,旨在提升 VLA 模型对复杂任务的泛化能力。属于数据策略改进,缺乏具体架构创新或显著 SOTA 突破。
发布了一个大规模多视图视触觉数据集,专注于可变形物体的世界模型构建。作为重要资源填补了触觉 VLA 方向的数据空白,但本身非算法论文。
Jin Yang et al. · 受差分放大器启发的 AmpAttention 机制用于处理多视角冗余和遮挡。属于注意力机制的微调优化,未涉及 VLA 核心架构变革或跨模态对齐突破。
Van Huyen Dang et al. · 将 VLA 框架应用于无人机导航,通过专家演示进行训练。虽涉及 VLA,但侧重于特定平台(UAV)的应用适配,而非通用 VLA 方法的本质改进。
Zheng Sun et al. · 提出以物体为中心的语义场表示,替代传统的点云语义,以增强对功能部件的理解。属于感知表征层面的改进,未直接触及 VLA 动作生成核心。
Luis Felipe Casas et al. · 提出统一手部动作空间 UHAS 以促进不同形态机器人的策略迁移。属于动作空间设计的工程优化,虽有价值但未展示超越现有跨平台方法的显著优势。
Rubén de J. Hilario-Cruz et al. · 针对回收场景的双臂协作系统,侧重特定应用领域的系统集成。缺乏通用的 VLA 方法论贡献,主要体现工程实现。
Keke Tang et al. · 研究运动规划的对抗攻击,评估操作的鲁棒性。属于安全性分析范畴,虽相关但不直接提供 VLA 性能提升或新架构。
Yuran Chen et al. · 结合递归校正和对比流匹配实现单步生成式视觉运动策略。虽涉及生成式策略加速,但更多是扩散/流匹配模型的工程变体,VLA 特异性不强。
Jiahao Jiang et al. · 提出以 3D 为中心的世界-空间-动作模型 WSA1。概念较新,但摘要未展示显著的 Benchmark 超越或独特的架构细节,暂归为值得了解。
Jianjie Fang et al. · 构建统一的 MoE 世界模型以支持异构动作控制。侧重于世界模型的扩展性,与 VLA 策略学习间接相关,非直接的动作生成架构。
Stefan Bühler et al. · 探讨开源机器人生态中 VLA 模型面临的数据投毒风险。属于安全与伦理研究,对理解 VLA 部署风险有重要意义,但非技术方法改进。
Lei Iok Tong et al. · 通过粗粒度空间蒸馏和潜在流匹配实现轻量级 VLA XS-VLA。侧重模型压缩与边缘部署,属于工程优化,未触及核心泛化瓶颈。
Bowen Jing et al. · 发布面向可变形物体操作的视触觉安全基准 SoftVTBench。填补了安全约束下触觉操作评估的空白,是重要的评测资源。
Angen Ye et al. · 结合混合注意力和在线 RL 优化世界-动作模型 HALO-WA。主要针对 WA 模型的校准误差,属于特定子领域的算法改进,通用性有限。
ACE-Brain Team et al. · 推出 ACE-Brain-0.5 具身基础模型,整合感知、规划与执行。虽声称统一,但摘要缺乏具体的架构创新细节和超越现有 SOTA 的量化证据,疑似常规迭代。 [💧灌水]
Tianxing Chen et al. · 提出 RoboDojo 仿真与真实统一基准,旨在全面评估通用机器人策略。作为评测工具具有重要价值,但非算法本身。
Xinyu Shao et al. · 从潜在世界模型中提取运动可供性地图 KAM-WM,辅助少样本学习。属于感知先验的提取方法,未直接改变 VLA 的核心训练或推理范式。
Matthew Foutter et al. · 探究 VLA 模型中思维链(CoT)的忠实度,分析语言推理是否真实反映策略行为。属于可解释性与可靠性分析,对理解黑盒模型有启发。
Yunchao Zhang et al. · 引入几何感知运动潜变量 GeoMoLa,从视觉序列中提取更有效的动作抽象。属于表征学习改进,虽有益但尚未证明其在 VLA 基准上的决定性优势。