G0.5: One Autoregressive Stream for Robot Reasoning and Action
Yicheng Liu et al. · 提出单流自回归架构统一推理与动作生成,打破传统VLM+Flow Expert的双流范式。若实验证实显著优于RT-2/OpenVLA,则属架构级创新。
Yicheng Liu et al. · 提出单流自回归架构统一推理与动作生成,打破传统VLM+Flow Expert的双流范式。若实验证实显著优于RT-2/OpenVLA,则属架构级创新。
Shreyas Kowshik et al. · 探索通用机器人策略在极少数据下的自适应方法,针对零样本泛化弱的问题。提供具体的微调/适应路径,适合本周复用以提升OOD鲁棒性。
Siyu Xu et al. · 提出结构化演示的In-Context学习方法以缓解VLA的OOD性能崩溃。方法具体且针对VLA泛化瓶颈,具有明确的工程复用价值。
Qu Tang et al. · 引入World Tokens在训练时显式建模物理场景演化,弥补VLA缺乏动态世界模型的缺陷。方法新颖且直接嵌入VLA训练流程,具高复用潜力。
Hongzhi Zang et al. · 提供统一的RL微调框架以解决当前VLA RL训练碎片化问题。工程价值极高,便于团队快速实施RL精调,符合本周可复用标准。
Zhuoran Li et al. · 通过记忆增强和In-Context适配提升VLA在噪声环境下的鲁棒性。提供即插即用的Harness模块,有效解决OOD适应难题,具实操价值。
Xingyuming Liu et al. · 引入多模态传感(如触觉)自适应机制以弥补纯视觉VLA的物理感知缺失。直接响应“触觉VLA”研究方向,具明确应用路径。
Hongjin Ji et al. · 提出基于未来视觉表征预测的可靠测试时训练(TTT)方法。解决VLA在线适应中的不稳定性问题,技术点具体且实用。
提出基于重分布的成本推断方法,解决稀疏安全离线RL中的时间信用分配问题。虽与策略学习相关,但非VLA核心架构或训练范式创新。
通过运动引导的跨帧视觉提示增强MLLM的运动推理能力。主要贡献在视频理解/MLLM层面,未直接涉及机器人动作生成或VLA闭环控制。
发布首个用于第一人称灵巧手图像编辑的数据集Benchmark。作为数据资源有价值,但属于数据集类工作,无新算法或SOTA突破。
Chaeyeon Jung et al. · 诊断并缓解人形双臂操作中对初始姿态的依赖问题。侧重于特定现象分析与修正,非通用VLA架构改进,属于重要但局部的工程洞见。
Anh Duc Do et al. · 面向社交机器人的交互式3D世界生成系统。侧重仿真环境构建而非VLA策略本身,属于相邻领域的基础设施工作。
Dipesh Tharu Mahato et al. · 通过分析OpenVLA激活状态预测视觉分布偏移下的失败。属于模型可解释性与监控方向,虽有用但不改变VLA核心训练/推理机制。
Peidong Wang et al. · 通过技能 harness 进化实现智能体自我演进。侧重Agent系统层面的编排与接口管理,非底层VLA策略网络的核心改进。
Jiaxin Huang et al. · 结合小波变换与Transformer处理多模态双臂操作。属于特定传感器融合的网络结构优化,未见对VLA通用范式的突破性贡献。
Jiaxi Zhang et al. · 提出免训练的3D视觉定位方法。虽服务于Embodied AI,但聚焦感知模块(Grounding),未涉及VLA的动作决策或端到端策略。
Zijian Song et al. · 主张将操作视为视觉到几何的映射,提出Vision-Geometry骨干网。理论视角独特,但需更多实证证明其超越现有VLA范式的优势。
Matthew M. Hong et al. · 利用扩散时间步调制预训练以改善RL微调时的探索效率。侧重Diffusion Policy的训练技巧,非通用VLA架构创新。
Xikai Sun et al. · 针对物流分拣场景的多视图联合规划方法。属于垂直领域应用优化,非通用VLA基础能力突破。
Yan Deng et al. · 结合因果记忆与滚动视界扩散规划用于空中VLN。侧重导航任务与无人机平台,与地面操作型VLA核心关注点有差异。
Sunshine Jiang et al. · 利用提示驱动RL探索过程。方法通用性强,但未专门针对VLA的离散/连续动作空间特性进行深度定制。
Haozhe Xie et al. · 3D场景生成综述。虽涵盖机器人应用背景,但为文献总结,无新方法或即时技术贡献。
Gabriel Arslan Waltersson et al. · 新型滑移感知触觉传感器硬件设计。属硬件层创新,虽支持VLA输入,但非算法/模型层面的VLA进展。
Xiaoxiong Zhang et al. · 关于世界模型与世界动作模型的简明教程。教育性质内容,有助于理解概念,但无原创性算法贡献。
Haiyu Wu et al. · 提出VIScore指标评估潜在世界模型的规划质量。侧重评估方法论,非VLA策略本身的改进。
Shukrullo Nazirjonov et al. · 研究对象中心表示(Slots)对世界模型鲁棒性的影响。偏向表示学习与世界模型内部机制分析,非直接VLA控制策略。
Rimvydas Rubavicius et al. · 通过可执行行为表示构建人类运动世界模型。聚焦人体运动模拟,与机器人操作策略关联度较低。
Jacques Raynal et al. · 从理论角度探讨表征涌现与世界模型的关系。高度理论化,缺乏具体的VLA算法实现或实验验证。