ActFovea: Runtime Safeguarding for VLA Policies via Spatiotemporal Visual-Action Consistency
Wenda Yu et al. · 提出运行时安全机制 ActFovea,通过时空视觉-动作一致性检测 VLA 策略的扰动。亮点在于无需重训即可增强部署鲁棒性,本周可集成至现有 VLA 推理流程中作为安全过滤器。
Wenda Yu et al. · 提出运行时安全机制 ActFovea,通过时空视觉-动作一致性检测 VLA 策略的扰动。亮点在于无需重训即可增强部署鲁棒性,本周可集成至现有 VLA 推理流程中作为安全过滤器。
Yuxin Chen et al. · 提出非侵入式闭环迭代微调方法 CLIFT,将闭源基础模型适配为人形机器人专用策略。核心贡献是解决私有数据限制下的设备端适应问题,为使用 Gemini Robotics 等黑盒模型提供了可行的微调路径。
Kasra Sinaei et al. · 结合流匹配与控制屏障函数(CBF)提出模块化安全推理框架。亮点是将形式化安全保证直接嵌入生成过程而非后处理,为 VLA 部署提供了可复用的安全约束实现方案。
Senyu Fei et al. · 提出世界评论家模型 WCM,用于 VLA 的 RL 后训练。通过多帧观察估计价值函数,解决了传统单帧 Critic 的信息缺失问题,为 VLA 强化学习提供了新的架构组件,具有明确的复用价值。
Feng Chen et al. · 提出 VLA 动态执行承诺机制,优化动作分块的推理成本与灵活性。允许模型根据不确定性动态决定提交步数,为 VLA 实时部署提供了重要的工程优化方案,本周可集成测试。
Jiahao Liu et al. · 针对接触丰富操作提出时间路由动作分块 TRACT,引入时序相位权威机制。虽涉及 VLA 核心组件(动作分块),但摘要未展示跨基准对比或显著 SOTA 提升,属于特定场景的方法改进。
BWM Team · 介绍低成本高保真世界模拟器 BWM,旨在降低物理资产构建成本。属于仿真工具类工作,虽对 VLA 训练有价值,但缺乏直接的算法创新或 VLA 架构贡献,归为值得了解。
Dylan Miller et al. · 提出基于历史初始化的动作生成 Temporal Policy,优化扩散/流匹配模型的向量场学习。主要改进生成式策略的训练效率,但未明确在主流 VLA 基准上验证泛化能力,暂归为相关研究。
Li Lin et al. · 利用斐波那契采样优化 VLA 的时间建模效率。标题含 VLA 但贡献偏向工程优化(采样策略),缺乏对核心瓶颈(如泛化、灵巧操作)的突破性解决,且未见显著 SOTA 超越证据。
Qian Wang et al. · 提出射线条件视觉表示 RayViT 以增强视角鲁棒性。主要解决模仿学习中的几何感知缺陷,虽与 VLA 视觉编码相关,但更偏向底层表征学习,未直接体现 VLA 语言-动作对齐的创新。
Yixiao Wang et al. · 诊断顺序机器人任务中的组合泛化问题。属于分析性工作,揭示了稀疏数据集下的挑战,但未提出新的 VLA 架构或训练范式,主要贡献在于理论洞察而非即时可用的方法。
Juyi Sheng et al. · 结合抓取预训练与 Mamba 架构提出 GPA-RAM。虽涉及 VLA 相关组件,但本质是骨干网络替换与预训练策略组合,缺乏在标准 VLA 基准上的全面对比,创新度一般。
Yihao Wu et al. · 揭示边界框引导策略在语义操作中的数据缩放规律。重点在于数据分析与实验发现,而非提出新 VLA 方法,有助于理解数据分布影响,但无直接代码/模型贡献。
Kehan Li et al. · 发布 RynnBrain 1.1 系列具身基础模型。虽规模较大,但摘要强调“统一框架”却未提供具体架构创新细节或跨基准 SOTA 对比,疑似工程堆叠,需正文验证,暂归为值得了解。 [💧灌水]
Chang Liu et al. · 改进 LeWorldModel 的正则化方法 SIGReg,提升多任务学习效果。属于世界模型领域的具体技术改进,与 VLA 间接相关,但未直接作用于 VLA 的动作生成或策略学习核心。
Yiting Mo et al. · 设计基于 3D 打印织物的可变刚度触觉接口 VSTaI。属于硬件传感层创新,虽对触觉 VLA 有潜在价值,但本文侧重机械设计与表征,未涉及 VLA 算法或控制策略。
Yongxi Liu et al. · 提出可穿戴指尖触觉传感器 TacPrint 用于人机接触数据收集。同样属于数据采集硬件,虽支持人类演示范式,但缺乏与 VLA 训练流程的直接整合或算法贡献。
Kaizhen Tan et al. · arXiv:2607.27017v3 Announce Type: replace-cross Abstract: A central premise of latent world models is that predicting the future forces a representation to internalize the physics of its environment. Which physical quantities does a trained latent actually contain, and what decides this? We answer with controlled interventions in POKEWORLD, an interactive environment whose visually identical objects hide mass, drag, and contact stiffness. A certificate-gated protocol first certifies each paramet
Luca Viano et al. · 分析基于价值的模仿学习中在线交互的作用及表征权衡。属于 RL/IL 理论基础研究,虽适用于机器人,但未针对 VLA 特性进行专门优化或验证,归为相关背景知识。