Temporal Forcing: 4D Representation Alignment for Vision-Language-Action Models
Xingyu Ding et al. · 将 VLA 的表征对齐由 3D 几何扩展到 4D 时空:加入时间监督与时间差分建模,区分长程任务中“看着像但状态不同”的观察,缓解状态混淆;该时间对齐监督可直接加进主流 VLA 训练流程。
Xingyu Ding et al. · 将 VLA 的表征对齐由 3D 几何扩展到 4D 时空:加入时间监督与时间差分建模,区分长程任务中“看着像但状态不同”的观察,缓解状态混淆;该时间对齐监督可直接加进主流 VLA 训练流程。
Hanwen Wan et al. · 针对 VLA 物理常识弱的问题给出数据方案:把物理 VQA、第一视角视频与机器人轨迹组成数据金字塔进行共训练,并实证物理认知提升能否传导到操作策略;共训练配方可复制到自有数据上。
Rongze Tang et al. · 提出用注意力图显式建模交互位置,引导动作条件世界模型的训练损失把预测容量集中到物理交互区域,目标是让可控视频预测更贴合真实的物理接触与碰撞。
Émiland Garrabé et al. · 让 QD 算法免去专家编写成功条件与奖励/多样性度量,语言模型自动为技能库提供约束与语义标签,机器人可自主积累多样技能并在部署时零样本适配。
Fu Chen et al. · 面向预训练覆盖不到的真实物理条件,让机器人在部署中从自身交互在线学习因果结构,并用 in-context 方式指导后续操作,实现边运行边适应的泛化机制。
Chuhan Zhang et al. · 在软体机械臂上直接利用整臂大面积接触同时完成感知与操纵,不依赖视觉而是由接触分布推断物体状态并反推控制,是章鱼/象鼻式非视觉本体感操作的路线探索。
Chunyun Ma et al. · 把长程移动操作任务拆成连续技能链做细粒度评测,在整任务成功之外报告每步技能完成度,能让 VLA 开发者准确归因中间失败的具体环节。
G. F. Preziosa et al. · 面向亚厘米级零件缺陷检测,以视触传感器采集高分辨率表面几何并做异常检测,补充光学相机缺失的几何信息;属于工业质检场景,可作触觉感知应用类工作的对照参考。
Botong Zhao et al. · 面向直出动作的 VLA 双管齐下补行为克隆短板:预测头对齐多时间尺度场景演化,同时用价值信号对轨迹加权/筛选出高质量动作,试图减少轨迹质量不均带来的影响。
Hao Wu et al. · 提出紧凑无相机光学触觉传感器,用分布式颜色调制替换相机成像,把传统视触觉的体积、成本与算力降下来;适合手指级集成后作为低成本触觉输入源。
Hongzhe Bi et al. · 将感知、预测、动作、评估与在线学习封装进闭环世界模型,让模型边预测边决策边自我优化,以灵巧操作为设计目标,而非简单给视频预测器加动作头。
Jianjie Fang et al. · 指出时空均匀 MSE 会稀释动作信号,提出按动作实际影响的像素/区域进行因果重加权,使动作条件世界模型更关注干预后果;可作为训练损失的一种轻量替换方案。
Minghan Qin et al. · 端到端可组合地恢复真实室内场景:分割解析物体、生成可编辑资产并按原位摆放,最终给出机器人模拟可直接使用的、物体可单独特化的数字孪生场景。
Xionghao Wu et al. · 用大规模第一视角视频预训练世界动作模型,建立不经动作标注的物理经验表征再迁移到机器人控制,目标是绕过轨迹标注瓶颈做跨平台泛化。
Joonghyuk Shin et al. · 提出动作条件下视频 Shell Game 评测任务:把隐藏状态追踪从视觉渲染中解耦,用来检验视频世界模型是忠实维持未观测世界状态,还是只学会了生成逼真画面。