Logic-VLA: A Temporal Logic Conditioned Vision-Language-Action Model
Celina Shiyu Wang et al. · 将时序逻辑形式化需求作为条件引入VLA训练,使策略严格满足安全关键与时空约束,弥补自然语言指令的精度不足。亮点是形式化约束与VLA条件化的统一,可直接用于安全敏感操作任务。
Celina Shiyu Wang et al. · 将时序逻辑形式化需求作为条件引入VLA训练,使策略严格满足安全关键与时空约束,弥补自然语言指令的精度不足。亮点是形式化约束与VLA条件化的统一,可直接用于安全敏感操作任务。
Siyuan Ma et al. · 从世界动作模型蒸馏因果未来token到VLA,使策略预见接触事件以操作传送带上的运动物体。亮点是用WAM蒸馏替代推理期视频生成,兼顾动态操作能力与推理成本,可复用为动态场景VLA微调方案。
Zhuoyuan Li et al. · 将最小可觉差建模用于VLA图像token压缩:按感知阈值决定哪些token可安全丢弃,降低推理成本而不损动作质量。亮点是感知启发式裁剪,工程上即插即用,可直接接入现有VLA推理管线。
Hui Lu et al. · 为VLA策略提供针对物理视觉补丁攻击的可认证防御,处理连续且时间相关的动作输出而非离散标签。亮点是首个面向VLA动作空间的认证鲁棒性框架,可用于安全敏感部署场景。
Congsheng Xu et al. · 提出视觉-触觉多模态统一序列表示学习,将两类观测按时间序编码后再融合,捕捉跨模态细粒度时空对齐。亮点是序列级融合表征,可直接替换VLA编码器用于触觉操作任务。
Chen-Yu Lin et al. · 物理信息探索的Code-as-Policy智能体,在操作中主动感知并推断物体潜在物理属性如质量与摩擦。亮点是物理先验引导主动探索,弥补VLA策略被动观察的局限。
Bernhard Hilpert et al. · 通过实验揭示人类在机器人教学中自然使用的决策逻辑,建模教学意图与学习需求的对齐。亮点是对人机教学过程的认知建模,可为交互式模仿学习设计提供依据。
Varun Giridhar et al. · 提出离线Q-规划机制,让行为克隆策略从自身失败中自改进,无需额外人类演示。亮点是用离线Q估计合成纠正性经验,可直接桥接VLA的RL精调阶段。
Yantao Li et al. · 综述并实证诊断多模态推测解码与扩散式并行起草的成熟度,评估lossless加速在扩散解码中的可行性。亮点是survey与实验结合,为VLA推理加速方案选型提供参考。
Amar Hajj-Ahmad et al. · 协同设计手持数据采集抓爪与机器人抓爪形态以规模化灵巧操作数据,减少人手到机械手的形态域差。亮点是数据采集硬件与部署形态对齐,直接服务Open-X类数据扩展。
Jiazhuo Li et al. · 研究模仿学习中按需删除个人演示数据的遗忘算子,避免删除后全量重训练。亮点是首个系统处理机器人策略数据遗忘的工作,涉及数据合规与隐私需求。
Yiwen Liu et al. · 提出视觉-触觉框架,从人类演示中显式利用物体物理属性(质量/摩擦等)适应抓取策略,并配套数据采集方案。亮点是把物理量直接注入策略条件,区别于隐式特征学习。
Kun Wang et al. · 展示无需物理接触即可伪造触觉传感器输出的攻击方法,揭示触觉感知物理层安全漏洞。亮点是首个触觉对抗攻击研究,对物理感知安全设计有警示意义。
Xu Yang et al. · 提出图算子世界模型,将形态参数(杆长/质量/阻尼等)作为图算子输入以泛化动力学预测。亮点是跨形态泛化的世界模型架构,减少每个形态单独训练成本。
Julien Merand et al. · 用接触拓扑条件规范灵巧手抓取合成,并在规范工作空间中学习,使抓取形态支撑下游功能任务。亮点是任务感知的抓取形态控制而非仅优化物理稳定性。
Manuel Baltieri et al. · 提出按预测对象区分环境、智能体与联合系统三类的世界模型分类视角,讨论各自设计权衡。亮点是澄清model-based RL中世界模型边界的概念框架,对世界模型方向有指导意义。
Donna Vakalis · 论证世界模型的任务相关信息经不同学习路线(重建/状态/时序过滤/任务监督)变得可用,提炼三个问题判定表征内容。亮点是对世界模型表征的系统性理论分析。
Shania Guo et al. · 发布薄物体三维重建的多模态数据集与评测基准,涵盖视觉、触觉与点云,挑战现有模型在细小结构上的短板。亮点是首个多模态薄物体重建benchmark,便于标准化对比。
Airin Akter Tania et al. · 提出按样本难度校准条件流匹配的插值路径,改善训练收敛与生成质量。亮点是对flow-matching进度调度的一般性改进,或可迁移到VLA扩散动作头的训练中。
Nils Morbitzer et al. · 解缠自运动与环境动态,预测动态场景的未来3D结构,迈向3D世界建模。亮点是超越2D视频合成的动态3D预测,对具身agent的世界模型构建有参考价值。