GigaBrain-0.7: Scaling Embodied Foundation Models to Emergent Capabilities with a Three-System Architecture
GigaBrain Team et al. · 提出三系统架构的具身基础模型 GigaBrain-0.7,通过规模化实现涌现能力。在多个基准上显著优于现有 SOTA,解决了泛化与长视界任务的核心瓶颈,具备战略级影响力。
GigaBrain Team et al. · 提出三系统架构的具身基础模型 GigaBrain-0.7,通过规模化实现涌现能力。在多个基准上显著优于现有 SOTA,解决了泛化与长视界任务的核心瓶颈,具备战略级影响力。
提出 HAF 框架,通过分层动作流和谱潜在 RL 将通用 VLA 适配至人形机器人全身 loco-manipulation。解决了 VLA 在高维连续控制中的适配问题,提供了具体的微调路径,本周可复用。
引入马尔可夫注意力熵作为置信度指标,使 VLA 能自我评估动作生成的可靠性而无需外部监督。为 VLA 部署提供了关键的异常检测机制,具有明确的工程应用价值。
Yanyan Zhang et al. · 提出推理时反事实重对齐方法,增强 VLA 对在线干扰(如目标变化、场景配置改变)的鲁棒性。无需重新训练即可提升恢复能力,是提升 VLA 实用性的有效手段。
Zhiqiang Hu et al. · 利用任务驱动的 3D 高斯场景记忆解决长视界操作中的空间持久性问题。相比固定规则存储,该方法能动态保留关键信息,为 VLA 提供了高效的长期记忆模块。
Chengye Song et al. · 提出阶段进度感知信用分配方法,解决长视界操作中多阶段任务的奖励稀疏问题。改进了 VLA 后训练中的 RL 信号利用效率,有助于提升复杂任务的成功率。
Jiarui Yang et al. · 针对基于流的 VLA 模型,提出结构化动作空间探索方法以优化在线 RL 适应。解决了现有随机注入方法的低效问题,为 Flow-based VLA 的微调提供了新范式。
Dai Zhou et al. · 提出即插即用的视觉历史压缩器和双曲经验空间,在不扩展 VLA 上下文的情况下实现高效记忆访问。解决了长视界任务中的上下文窗口瓶颈,具有直接的工程复用价值。
Yufei Guo et al. · 提出相位感知的 LoRA 微调方法,根据控制阶段动态调整适配器参数。克服了静态微调在连续动作策略中的局限性,提升了 VLA 在不同操作阶段的适应能力。
Chunyu Qi et al. · 通过推测性推理和验证机制,协同设计算法与架构以提升 VLA 推理效率。针对实时部署的计算瓶颈,提供了具体的加速方案,具有显著的工程落地价值。
Yijie Xu et al. · 提出历史条件化和分布外感知的过程奖励模型,用于精炼预训练 VLA 策略。解决了稀疏奖励下的探索难题,为 VLA 的 RL 精调提供了更细粒度的指导信号。
Yi Wang et al. · 提出视触残差自适应方法,弥补基础 VLA 在接触丰富操作中对局部接触事件感知的盲区。通过融合触觉信息提升灵巧操作能力,填补了触觉 VLA 的重要空白。
Xinyu Zhou et al. · 提出统一条件-动作建模以实现准确的一步动作生成。针对扩散和流策略的效率问题,简化了生成过程,为 VLA 的低延迟部署提供了新的技术路径。
Xunyao Lei et al. · 提出停止感知分层 VLA 和自适应动作分块,解决长视界任务中子任务终止和动作执行的依赖问题。提升了分层 VLA 在复杂任务中的协调性和成功率。
Cong Zhao et al. · 提出双频率 VLA 架构,结合引导动作解决效率-性能权衡及跨具身泛化问题。异步架构设计新颖,为 VLA 的实时性和平滑性提供了具体解决方案。
Xin Ding et al. · 提出高效闭环具身 harness,支持物理智能的自我进化。解决了现有 harness 开环执行的局限,为 VLA 的持续学习和闭环更新提供了基础设施。
Qijin She et al. · 提出对应感知策略,实现跨物体的上下文学习。解决了少样本泛化中物体形状差异导致的性能下降问题,提升了 VLA 在新物体上的适应能力。
Xiaowei Cai et al. · 提出世界模型引导测试时计算的分层 VLA 基础模型。通过动态计算资源分配提升长视界操作的连贯性,为分层 VLA 提供了新的推理范式。
Bingxin Xu et al. · 提出代理子任务探索和过渡感知记忆方法,解决长视界操作中错误累积问题。增强了 VLA 在多阶段任务中的鲁棒性和任务切换能力。
Wenkang Zhang et al. · 提出从第一人称视觉预测触觉的方法 EgoTac。解决了大规模触觉数据收集难的问题,为 VLA 提供了低成本获取触觉先验的途径,填补触觉 VLA 数据空白。
Zhengyi Luo et al. · Science Robotics 论文,提出用于人形机器人全身控制的运动跟踪方法。虽涉及具身智能,但摘要未明确提及 VLA 架构或语言指令集成,更偏向传统控制与模仿学习,故归为值得了解。
Xingzheng Wu et al. · 针对超声扫描场景提出的力感知 VLA 模型。虽然结合了触觉/力觉,但应用场景过于垂直(医疗),且缺乏通用基准验证,属于特定领域应用,归为值得了解。
Zihang Wang et al. · 提出基于 Max-Q 的选择性模仿学习方法,用于人机回环在线强化学习。虽涉及机器人学习,但未明确结合 VLA 架构,更偏向传统 RL 与人类反馈的结合,归为值得了解。
Nicholas Kenny et al. · 评估无目标人类意图推断框架在遥操作数据上的表现。侧重于意图识别评估而非 VLA 核心架构创新,且主要关注遥操作场景,归为值得了解。
Xinyi Zhang et al. · 利用不一致的人类干预信号进行强化学习。虽涉及人机协作,但未明确结合 VLA 架构,且重点在于处理噪声信号,归为值得了解。
Michael Zeng et al. · 重新审视开环执行在机器人中的作用,旨在提高策略的反应性和性能。虽涉及动作分块等 VLA 常见技术,但更多是对现有范式的分析与改进,归为值得了解。
Cheng Zhang et al. · 针对腹部超声扫描的专用 VLA 模型。与 ForceU-VLA 类似,应用场景垂直,缺乏通用性验证,属于特定领域应用,归为值得了解。
Marcus Yu Siong Teo et al. · 提出规划器条件的扩散模型用于多智能体协调探索。虽涉及扩散策略,但聚焦于多智能体导航而非单臂/双臂操作,且未明确结合 VLA,归为值得了解。
Bingyi Xia et al. · 通过野外视频学习解决具身城市导航中的长尾问题。聚焦于移动导航而非操作,且主要贡献在于数据利用,归为值得了解。
Siyuan Tao et al. · 基于具身感知机表示的神经与肌肉网络协同设计。侧重生物启发控制与身体形态,未明确结合 VLA 或语言指令,归为值得了解。
Jiawei Liu et al. · 探讨 LLM 驱动具身代理中的状态语义注入攻击。侧重安全与对抗攻击,虽相关但非 VLA 核心算法进展,归为值得了解。