hint$^2$: Hierarchical World Models for Inference-Time Temporal Logic Guidance
Moritz Zoellner et al. · 提出分层世界模型以解决 VLA 在时序逻辑和安全约束上的不足,通过推理时引导增强策略。为 VLA 提供可复用的时序约束处理模块,提升复杂指令执行能力。
Moritz Zoellner et al. · 提出分层世界模型以解决 VLA 在时序逻辑和安全约束上的不足,通过推理时引导增强策略。为 VLA 提供可复用的时序约束处理模块,提升复杂指令执行能力。
Ming Shang et al. · 针对 VLA 异步控制中的请求-移交间隙问题,提出行为识别延续偏好优化(BICPO)。直接改进 VLA 训练目标,解决动作生成漂移,代码开源可能性高,本周可集成测试。
Yi Ding et al. · 提出 ART 框架,将现有 VLA 模型转化为具备即时工具使用能力的智能体。提供插件式架构,允许 VLA 调用外部工具模块,显著扩展 VLA 在长程任务中的能力,易于集成。
Yuxuan Chen et al. · 针对动态交互场景,提出 Reflex 框架以加速 VLA 推理并引入预测机制。解决 VLA 在反应关键型任务中的延迟瓶颈,提供具体的工程优化路径和预测模块,具有较高实用价值。
Yiwen Pang et al. · 提出 AtomBridge 插件,使 VLA 能自主规划科学实验中的长程任务。针对特定领域(实验室自动化)优化 VLA 推理流程,提供模块化接口,可直接用于提升 VLA 在复杂序列任务中的表现。
Xiao Liu et al. · 提出 StageWAM,通过联合嵌入阶段预测改进世界-动作模型(WAM)。解决 VLA/WAM 中未来状态表示的短视问题,引入阶段感知的世界模型,为 VLA 提供更丰富的上下文预测,具有理论创新和实验价值。
Kailin Wang et al. · 提出基于本体的世界模型 Onto-EV-WM,用于物理 AI 系统的故障诊断和闭环修复。为 VLA 提供错误检测和自修复能力,增强系统在真实环境中的鲁棒性,具有明确的 Agentic 应用路径。
Xinye Li et al. · 提出 ForgeWM,通过渐进因果训练实现少步动作条件视频世界模型。显著降低 VLA 世界模型的推理延迟,提升生成效率,为实时 VLA 提供高效的世界模型组件,具有工程复用价值。
Zhengyi Luo et al. · 提出用于人形机器人全身控制的运动跟踪方法,侧重底层控制与物理仿真。虽涉及具身智能,但非 VLA 架构或高层语义决策核心,属于底层控制优化。
Zhiyue Zhao et al. · 利用对抗学习和关节对齐从人类演示中学习灵巧操作。虽涉及具身操作,但重点在于模仿学习策略而非 VLA 多模态对齐架构,且主要依赖仿真或特定数据,VLA 直接复用性有限。
Xingyu Zhu et al. · 发布针对扁平物体操作的仿真基准和方法论框架。作为数据集/基准有价值,但缺乏新的 VLA 核心算法创新,主要用于评估而非直接提升 VLA 性能。
Chenghao Yin et al. · 发布人形机器人高保真仿真平台 Genie Sim 3.0。作为仿真环境更新,有助于数据生成和评估,但本身非 VLA 算法或训练范式创新,属于基础设施类工作。
Xinghao Zhu et al. · 利用接触力矩引导从人类演示中学习灵巧操作。侧重触觉反馈和模仿学习,未明确结合 VLA 的多模态语言理解架构,属于底层操作策略研究,VLA 直接相关性较弱。
Chenghua Wang et al. · 探讨边缘端实时推理与云端可扩展 Rollout 的系统架构。侧重工程部署和系统优化,虽对 VLA 落地重要,但非算法层面的核心创新,属于基础设施/系统工程范畴。
Alexander Hackett et al. · 分析动作后训练如何影响 VLM 的深度感知解码能力。属于机理分析/探针研究,揭示 VLA 训练中的潜在退化问题,对理解 VLA 内部表征有价值,但非直接的性能提升方法。
Xinpan Meng et al. · 提出触觉增强的亚毫米级精密装配方法。侧重触觉传感器融合和底层控制,未体现 VLA 的语言条件或多模态大模型特性,属于传统机器人学或专用触觉 RL 范畴。
Yang Liu et al. · 对被动对象状态世界模型进行事件条件诊断,分析运动学和接触场。属于世界模型的可解释性/诊断研究,非直接的 VLA 控制算法创新,理论深度大于应用紧迫性。
Yukang Gao et al. · 提出用于人形机器人的姿态流匹配(PFM-HR)方法。侧重底层运动生成的数学方法,未结合 VLA 的视觉-语言-动作端到端架构,属于运动规划/生成模型范畴。
Kaixin Ding et al. · 发布 PlayWorld 基准,用于评估世界模型在长程目标下的表现。作为评估工具重要,但本身非 VLA 算法创新,且侧重于游戏/模拟环境,需等待后续基于此基准的 VLA 论文。