Towards General Language-Conditioned Latent Safety Filters
Ihab Tabbara et al. · 提出一种针对 VLA 模型的潜在空间安全过滤器,通过语言条件约束确保策略在未知任务中的安全性。亮点在于无需重新训练即可为现有 VLA 添加安全层,本周可集成至 OpenVLA 等框架进行部署测试。
Ihab Tabbara et al. · 提出一种针对 VLA 模型的潜在空间安全过滤器,通过语言条件约束确保策略在未知任务中的安全性。亮点在于无需重新训练即可为现有 VLA 添加安全层,本周可集成至 OpenVLA 等框架进行部署测试。
Rohan Bansal et al. · 解决 VLA 模型大规模部署时的计算瓶颈,提出动作分块调度算法以优化批处理服务效率。核心贡献是显著降低推理延迟并提高吞吐量,为机器人云平台提供可直接复用的工程优化方案。
Qi Luo et al. · 分析无训练 VLA 加速中令牌跳过机制的闭环可靠性,指出门控来源而非缓存是关键瓶颈。提供理论边界和实验验证,帮助开发者理解并优化实时推理中的视觉计算剪枝策略。
Daojie Peng et al. · 提出云边协同 VLA 架构,通过涌现的表征专业化解决网络延迟与控制实时性的冲突。语义推理上云、局部控制留边,为移动操作机器人的分布式部署提供新的系统级解决方案。
Damir Nurtdinov et al. · 展示如何利用 RL 微调将 OpenVLA 适配到形态差异大的新机器人本体,无需大量本体特定演示数据。提供了跨平台迁移的具体实践路径,对拥有定制硬件的研究者具有高复用价值。
Tianyi Zhang et al. · 改进 OC-VLA,引入单目几何引导的跨视图一致性以增强视角鲁棒性。解决了单相机设置下的泛化难题,提供具体的几何约束模块,可直接用于提升现有 VLA 在多变视角下的表现。
Jiaming Jiang et al. · 提出接触感知注意力缩放和触觉掩码机制,提升数据效率下的接触丰富操作性能。填补了触觉 VLA 方向空白,方法具体且可嵌入 Transformer 架构,值得精读。
Qi Lv et al. · 将埃尔米特曲线作为动作块的先验结构,解决 VLA 动作输出弱结构化问题。通过显式几何约束平滑轨迹,易于实现且能直接改善执行稳定性,具有明确的工程应用价值。
Zheng Yang et al. · 结合世界模型对齐与轨迹引导,解决移动操作中基座与机械臂协调的大动作空间问题。提供多阶段任务分解的新思路,适用于 LIBERO 等长视界基准测试。
Carlota Parés-Morlans et al. · 深入分析 VLA 在接触丰富任务中失败的时空原因,并提出修复策略。来自 ETH Jeannette Bohg 团队,提供诊断工具和针对性改进方案,对理解 VLA 物理局限性极具价值。
Dongdong An et al. · 揭示 VLA 模型存在的空间位置盲点,并提出缓解措施。通过细粒度分析发现聚合指标掩盖的空间不均匀性,提供数据增强或架构调整建议,有助于提升泛化能力。
Shiqi Zhang et al. · 通过在线细化触觉预测赋能灵巧操作,解决触觉反馈滞后问题。填补触觉 VLA 方向空白,提供具体的预测修正模块,可集成至现有视触融合策略中。
Jiarui Yang et al. · 提出多视图统一相机场表示,仅用 RGB 多相机输入构建几何感知的动作面向表征。解决遮挡和多视角融合难题,为多相机 VLA 提供高效的特征提取范式。
Jin Cui et al. · 发现 VLA 视觉编码器存在注意力伪影,提出自适应视觉细化机制。通过动态聚焦关键区域提升空间精度,方法轻量且即插即用,可显著提升操作成功率。
Donglin Yang et al. · 利用全身遥操作数据训练全景感知 VLA,解决移动操作中的视野局限问题。提供新的数据收集范式和模型架构,适用于开放世界环境下的长程任务。
Yuzhi Huang et al. · 提出 ChainVLA,通过统一执行状态链式连接 VLA 查询,增强长视界操作的记忆与连贯性。解决动作分块导致的上下文丢失问题,显著提升复杂序列任务成功率。
Zhaokai Yin et al. · 解决 VLA 对指令改写敏感的问题,提出接地语义重绑定机制。通过强化视觉-语言对齐的鲁棒性,无需额外数据即可提升指令泛化能力,具有实用价值。
Filippo Lazzati et al. · Levine 团队深入剖析动作分块提升行为克隆性能的机理。提供理论解释与实证分析,帮助研究者理解超参数选择依据,对优化 VLA 训练策略有指导意义。
Ye Wang et al. · 提出从第一人称人类视频合成大规模机器人演示数据的方法。解决数据稀缺瓶颈,提供自动重定向与渲染 pipeline,可直接扩充 Open-X 等数据集规模。
Renhao Lu et al. · 针对粘性污渍清洁的特定任务方法,使用分段推动轨迹。虽涉及操作但缺乏 VLA 通用性验证,仅仿真或单一场景实验,属于专用技能而非通用 VLA 进展。
Dongfu Yin et al. · 关注无线传感器网络中 VLA 机器人的物理对抗攻击防御。虽涉及 VLA 安全,但侧重于网络安全与对抗鲁棒性评估框架,非核心控制算法或架构创新。
Ziyu Zhu et al. · 针对刚柔耦合交互(如穿衣)的操作方法,结合稀疏与稠密特征。虽具挑战性,但摘要未明确提及 VLA 架构整合或通用基准测试,更偏向特定感知-控制接口研究。
Gaoyuan Wu et al. · 结合动态可供性与扩散策略的学习方法。虽涉及操作,但主要贡献在于感知引导机制,未明确展示其在主流 VLA 基准上的超越性或与现有 VLA 架构的深度整合。
Zhe Liu et al. · 将生物湿实验室协议转化为机器人动作,侧重指令解析与任务规划。属于 Agentic 控制相邻领域,缺乏底层 VLA 视觉-动作对齐的创新,暂归为值得了解。
Takahide Kitamura et al. · 提出一种触觉可穿戴同构手臂系统用于数据采集。重点在于硬件系统与数据收集流程,而非 VLA 算法本身,属于基础设施类工作。
Gaytri Jena et al. · 综述机器人学习从权重预测到技能编写的范式转变。重要但非紧急,提供领域全景视角,适合快速浏览以把握研究方向,无需立即复现。
Yanliang Huang et al. · 基于集合传播的视觉运动策略可达性验证方法。侧重形式化验证与安全保证,非控制性能提升,属于 VLA 安全子领域,应用路径较窄。