GS-VLA: Plug-and-Play Viewpoint Canonicalization for Frozen VLA Policies via Gaussian Splatting
Yechan Park et al. · 提出GS-VLA,利用3D高斯泼溅实现冻结VLA策略的即插即用视点规范化,无需重训即可解决视角偏移导致的泛化失败。这是首个结合3D GS与VLA鲁棒性的工作,显著提升了跨视角泛化能力,直击VLA部署痛点。
Yechan Park et al. · 提出GS-VLA,利用3D高斯泼溅实现冻结VLA策略的即插即用视点规范化,无需重训即可解决视角偏移导致的泛化失败。这是首个结合3D GS与VLA鲁棒性的工作,显著提升了跨视角泛化能力,直击VLA部署痛点。
Haoyu Zhang et al. · 提出从正样本演示中学习过渡对齐奖励模型的方法,解决稀疏奖励问题。该方法可直接用于VLA的RL精调阶段,提升样本效率,具有明确的工程复用价值。
Yaowei Guo et al. · 提出RoboEdit工具,将人类操作视频编辑转换为机器人可用的训练数据。解决了数据稀缺痛点,提供了明确的数据增强路径,本周即可尝试用于扩充VLA训练集。
Michael Zeng et al. · 重新审视动作分块(Action Chunking)中的开环执行问题,提出提高反应性和性能的改进方案。直接优化VLA推理阶段的执行策略,有明确的工程落地价值。
Xinyu Zhou et al. · 提出统一条件-动作建模以实现高精度单步动作生成,旨在降低扩散/流策略的延迟。直接改进VLA的动作解码效率与精度,适合对实时性要求高的部署场景。
Songwei Wu et al. · 提出EATR-Stereo,通过具身感知Token路由处理人形机器人头载立体视觉证据。解决了多视图融合与预训练表示兼容性问题,是VLA感知接口的重要改进。
Perry Dong et al. · 结合世界模型进行离线Q-learning,提升VLA模型的RL精调样本效率。提供了将世界模型预测融入价值学习的清晰路径,可直接应用于现有VLA框架的后训练阶段。
Dhia Naouali et al. · 提出VLCP,通过闭环代码重规划保留VLM推理能力,避免传统微调丢失逻辑。这是一种新颖的VLA推理范式,允许在不破坏预训练知识的前提下实现精确控制,极具复用价值。
Zeyun Deng et al. · 提出Prism-GRPO,通过分割同结果组加速VLA策略的GRPO优化。直接解决RLHF/RLAIF在VLA训练中的采样成本高问题,显著提升训练效率,工程实用性强。
Shahabedin Sagheb et al. · 提出反事实行为克隆,从不完美的演示中学习。有效缓解人类演示噪声和次优性问题,可直接集成到VLA的BC训练流程中,提升数据利用率。
Fan Yang et al. · 提出无需触觉仿真的Tactile Sim2Real方法,通过瓶颈潜重构对齐视觉与触觉。解决了触觉VLA中仿真难建模的核心痛点,方法轻量且易于集成,本周可复用。
Zhengyi Luo et al. · 提出用于人形机器人全身控制的运动跟踪方法,侧重底层控制与物理可行性。虽涉及具身智能,但非VLA高层策略架构或训练范式创新,属于底层控制优化。
Shuangyu Xie et al. · 在Agentic Robotics背景下重新审视经典的Push-T任务。属于对现有基准的再分析或简单应用,缺乏新的核心架构或显著性能突破,作为基准研究值得关注但不紧急。
Yukiyasu Domae et al. · 探讨机器人基础模型中的'具身差距'问题,指出单纯扩展数据/模型未必能解决泛化。属于理论分析或观点类文章,未提出具体可复用的新VLA架构或训练方法。
Hanying Hu et al. · 针对遮挡下的水果采摘任务改进ACT策略,引入显式目标选择。属于特定领域(农业机器人)的应用层微调,通用性有限,非VLA核心架构进展。
Zhipeng Tang et al. · 发布面向实验室灵巧操作的层级基准LabDex。作为新数据集/基准,对推动灵巧操作研究有价值,但本身非方法论创新,归类为值得了解的资源。
Bowen Jing et al. · 发布面向可变形物体操作的视触觉基准SoftVTBench。填补了触觉VLA评估数据的空白,具有重要参考价值,但属于数据资源而非算法架构创新。
Zijian Xiao et al. · 提出基于用途的代码场景生成方法,增强仿真环境的交互性。主要贡献在环境合成与仿真构建,虽服务于Embodied AI,但非直接针对VLA策略本身的改进。
Mohammad Zamani et al. · 综述或探讨第一人称视频中VLM在手物交互及具身AI中的应用。偏向于视觉表征与理解层面的回顾,缺乏具体的VLA控制架构创新或新的训练范式。
Kumal Hewagamage et al. · 提出CL4D进行对比语言-4D预训练以增强动态场景推理。主要贡献在于时空表征学习,虽对具身AI有用,但未直接展示其在VLA控制策略上的端到端应用或性能超越。
Xiuyu Yang et al. · 提出基于4D占据中心的机器人视频生成方法,旨在解决数据稀缺。属于世界模型/数据生成方向,虽重要但当前版本可能更侧重生成质量而非控制闭环的直接集成。
Chang Nie et al. · 提出以代理为中心的学习架构'Teach and Grow',旨在处理未知物体和传感器。概念较宏大,摘要未明确具体的VLA架构改动或Benchmark超越,暂归为值得了解。
分析潜在世界模型中决策指标对齐问题,提出MPC规划的诊断方法。侧重于世界模型的理论分析与损失函数设计,虽相关但更偏向底层优化原理,非直接VLA策略创新。
Ziyang Cheng et al. · 提出用于全身控制的行为世界模型。侧重底层运动控制与环境交互的物理可行性,属于WBC领域,与高层VLA语义决策关联度较低。
Amanuel Ergogo et al. · 构建舀取颗粒食物的虚拟环境并应用模仿学习。仅仿真验证且针对极细分任务,缺乏真实机器人数据支撑,符合'仅仿真验证'降级标准。
Riccardo O. Feingold et al. · 利用分割掩码作为Sim2Real桥梁构建可控灵巧世界模型。侧重世界模型的域适应,虽对VLA数据生成有帮助,但非直接的控制策略创新,且主要贡献在仿真逼真度。
Yang Liu et al. · 探索世界模型中低秩动态有效潜变量载体以进行反事实推演。属于世界模型内部机制的理论分析,离直接的VLA策略应用尚有距离,归为值得了解。
Pardis Taghavi et al. · 提出免训练的稀疏注意力机制加速视频生成和世界模型。虽能提升VLA推理速度,但属于通用Transformer优化技术,非VLA特有架构创新,优先级略低。
Eldad Haber et al. · 提出迭代流匹配以增强生成建模。属于通用生成模型算法改进,虽可间接用于VLA动作生成,但缺乏针对机器人控制的具体适配或实验验证。
Jiaming Fan et al. · 提出Depth Anything V4进行动态4D场景重建。主要贡献在计算机视觉/图形学重建领域,虽可为VLA提供更好感知输入,但非VLA控制本身。
Yuta Oshima et al. · 提出WorldPack进行长上下文视频世界模型的动态帧压缩。侧重视频编码效率,虽有助于处理长序列VLA输入,但属于工程优化而非核心策略创新。
Jack Boylan et al. · 提出无需高斯假设的JEPA世界模型对比逆动力学方法。属于世界模型学习目标的理论改进,离VLA策略的直接应用较远,归为值得了解。
Javier Aguilar Mart\'in · 分析连续代码世界模型中的采样验证危险定律。属于理论风险分析,指出潜在缺陷但未提供具体的VLA解决方案,适合作为背景阅读。
Jiahao Huang et al. · arXiv:2608.16955v1 Announce Type: cross Abstract: Post-disaster damage to terrestrial infrastructure can disrupt wireless coverage,while Uncrewed Aerial Vehicle (UAV) swarms provide a promising solution for rapid restoration.However, due to the limitations in local geometry observations hidden radio impact,and inter-UAV communication,there exists a significant gap between locally visible movement choices and swarm-level coverage outcomes.To combat this gap,we propose a raido World-model-based Op
Isidoro Tamassia et al. · arXiv:2608.17959v1 Announce Type: cross Abstract: State-of-the-art model-based reinforcement learning methods learn neural world models that allow policy improvement by planning in a latent space, without assumptions on the structure of the underlying environment. While expressive, these models are generally task-dependent: they learn uninterpretable latent representations that are tied to the training task and thus hard to generalize to new tasks. In this work, we present a novel world model fo