STeP: Signal Temporal Logic for Precise Specifications for Action Generation with Vision Language Models
Kasra Torshizi et al. · 提出将信号时序逻辑(STL)引入 VLA,解决自然语言指令中时空/逻辑约束模糊的问题。通过分层架构增强策略的可解释性与精确性,适合需严格遵循复杂指令的操作场景。
Kasra Torshizi et al. · 提出将信号时序逻辑(STL)引入 VLA,解决自然语言指令中时空/逻辑约束模糊的问题。通过分层架构增强策略的可解释性与精确性,适合需严格遵循复杂指令的操作场景。
Haisheng Su et al. · 在 World Action Models 中引入推理增强记忆机制,扩展时间上下文并细化语言监督。提升了长程任务中的可控性和状态跟踪能力,是对 WAM 范式的实质性改进。
Wendi Chen et al. · 提出结合视觉与力觉的端到端扩散策略,利用结构化的慢-快学习机制融合全局视觉与局部接触动力学。直接针对灵巧操作瓶颈,具有明确的工程复用价值。
Zhiyuan Zhang et al. · 针对双臂操作引入对称等变性先验,显式建模物理对称性以提升样本效率和泛化能力。方法具体且针对双臂协作这一核心难点,具备直接应用潜力。
Tingzheng Jia et al. · 提出‘轨迹锚点+残差修正’的双阶段框架,解耦宏观路径规划与微观执行校正。解决了 VLA 单空间建模精度不足的问题,显著提升精密操作性能。
Yiran Ling et al. · 提出 GTA-VLA 框架,允许用户通过视觉提示引导机器人的空间推理过程。增强了 VLA 的交互性和可解释性,提供了新的推理-行动闭环实现路径。
Han Wang et al. · 结合物理动作视觉世界模型与强化学习,引入动作探索机制以减少真实世界 rollout 依赖。为基于模型的 RL 提供了具体的世界模型改进方案,具有复用价值。
利用 VLA 代理自动化 Real2Sim 流程,恢复场景几何、物理参数及对象状态。解决了仿真重建劳动密集型痛点,为 VLA 数据生成提供了高效工具链。
Hadi Alzayer et al. · 提出掩码视觉动作(MVA)方法,使视频世界模型能更好地对齐动作信号。解决了世界模型中动作表征的关键瓶颈,对提升 VLA 预测能力有直接帮助。
Zihao He et al. · 探索跨形态(Cross-Embodiment)灵巧操作的世界模型共享结构。旨在解决不同机器人形态间的数据共享与控制迁移难题,契合通用具身智能趋势。
Fengguan Li et al. · 针对透明物体操作,提出视触觉预训练策略并结合点云重建解决深度噪声和遮挡问题。填补了透明物体灵巧操作的空白,方法具有针对性创新。
Yi-Ge Zhang et al. · 在潜在世界模型中分离世界效应与动作影响,避免单一学习信号混淆。从理论层面改进了世界模型的表征解耦,有助于提升 VLA 的状态预测准确性。
Alex N. Wang et al. · 提出提升具身世界模型以支持高维动作空间的规划与控制。解决了复杂形态下动作指定困难的问题,为基于世界模型的 VLA 控制提供了新视角。
Ziqin Wang et al. · 发布用于具身世界建模和操作的中间表示套件,旨在解决数据集标注稀疏问题。作为基础设施类工作,对长期研究有价值,但非即时可用的算法改进。
Chenduo Ying et al. · 分析 LLM 生成的机器人策略代码的不可靠性。属于诊断性/评估性工作,虽重要但不提供新的控制方法或架构,归类为值得了解。
Zichao Hu et al. · 针对人形机器人推重物任务,结合视觉目标与力自适应控制。虽涉及具身智能,但更偏向特定任务的控制策略而非通用 VLA 架构,适用面较窄。
Bokai Lin et al. · 整合过去、现在和未来的交互流以优化视觉运动策略。概念新颖但摘要未明确展示超越现有时序建模方法的显著优势或具体基准对比,暂归为了解。
Yao He et al. · 探讨 VLA 的终身学习能力以应对开放环境。标题宏大但摘要侧重于问题陈述,缺乏具体的防遗忘算法或增量学习架构细节,需正文验证其创新性。
Pablo Valle et al. · 专注于评估 VLA 机器人的不确定性和质量。属于评估体系构建,虽重要但不提供新的训练或推理方法,适合作为参考阅读。
Md Rakibul Islam Prince et al. · 介绍一种用于微创手术的新型视触觉传感器硬件。虽涉及触觉,但核心贡献在于传感器设计而非 VLA 算法或控制策略,属硬件层创新。
Shuaijun Wang et al. · 针对边缘突出物体的触觉抓取细化网络。仅使用触觉模态且针对特定物体类型,缺乏多模态 VLA 集成或通用性,属于专用子模块研究。
Humphrey Munn et al. · 为人形机器人部署提供 OOD 检测和故障诊断框架。侧重安全性监控而非核心控制策略,虽实用但非 VLA 算法核心进展。
Yosuke Saka et al. · 针对机器人拆解任务的接触感知触觉学习。应用场景垂直(拆解),且主要强调触觉在特定任务中的作用,通用 VLA 参考价值有限。
AlayaWorld Team et al. · arXiv:2607.18367v1 Announce Type: new Abstract: Unlike conventional video game development, which relies on labor-intensive pipelines for asset production, animation, physics, and programming, video world models generate interactive environments from user inputs instantly. It enable us to create customized, explorable, and continuously evolving virtual world from text, an image, or video. Realizing this vision requires four tightly coupled capabilities: interaction, persistent spatiotemporal con