Sensing Which Modality Matters: Evidence-Gated Regularization for Robust VLA Policies
Yue Yang et al. · 揭示VLA在有限同质数据上习得传感器间虚假关联(模态纠缠)的失败模式,提出证据门控正则化抑制该偏差,增强真实遮挡与干扰下的策略鲁棒性;可直接嵌入VLA微调训练。
Yue Yang et al. · 揭示VLA在有限同质数据上习得传感器间虚假关联(模态纠缠)的失败模式,提出证据门控正则化抑制该偏差,增强真实遮挡与干扰下的策略鲁棒性;可直接嵌入VLA微调训练。
Mingyu Mei et al. · 提出Human-Intent Inception机制,将人类粗粒度意图注入VLA并在长时程执行中随视觉反馈持续调整,弥补高层指令下策略保持与场景自适应不足;可作为长程VLA训练/推理模块复用。
Howard Qian et al. · 构建按查询从互联网检索人类演示的数据引擎RoboTok,为灵巧操作供给跨场景训练数据,针对真机演示昂贵、长尾任务覆盖率低的数据瓶颈。
Theodor Wulff et al. · 提出LAVLA框架,对VLA模型的隐空间做聚类分析,定位语言、视觉与动作信息的表征组织方式,为理解VLA内部工作机制提供分析工具。
Mi Yan et al. · 构建ZETA零样本跨本体VLA迁移受控评测,量化本体构型与动作空间差异对桌面操作迁移成功率的影响,为跨本体泛化研究提供统一基准与实证基线。
Chengxiao He et al. · 构建物理一致性的人机接触交互基准,用物理响应式人体模型评估辅助护理策略在真实接触中的安全性与失败模式,补充传统任务成功率评价的盲区。
Param Thakkar et al. · 提出只预测变化对象的稀疏残差世界模型:每对象变化门决定是否更新,残差delta头避免对静态场景重复建模,降低误差累积,用于以对象为中心的操作预测。
Wenzhuo Xu et al. · 提出VeriPhy可审计物理验证系统,由文本规划器把视频生成指令编译成验证程序,定位画面违反物理规则的具体时刻与条款,用于评测和修正视频世界模型。
Junchao Huang et al. · 开源SolarWM视频世界模型平台,覆盖异构数据整理、混合骨干训练与长时程推理,降低构建交互式视频世界模型的数据与训练门槛,可作为动作预测研究的底座。