SpeedTuning: Speeding Up Policy Execution with Lightweight Reinforcement Learning
提出通过轻量级RL微调加速模仿学习策略执行速度,解决硬件约束导致的慢速问题。提供提升推理效率的工程路径,适合部署优化。
提出通过轻量级RL微调加速模仿学习策略执行速度,解决硬件约束导致的慢速问题。提供提升推理效率的工程路径,适合部署优化。
Andres Rivas et al. · 利用自动生成的演示数据进行自监督学习,减少对人工标注和校准感知流水线的依赖。提供低成本数据生成方案,本周可复用于数据增强。
Zhewei Zhang et al. · 探索VLM中间特征到动作解码器的路由机制,提出局部跨层信息路由以改善接口效率。针对VLA架构内部模块优化,具有明确的工程复用价值。
Yanping Zhao et al. · 引入几何感知的潜在世界模型以提升VLA在视觉和环境偏移下的鲁棒性。结合几何先验改进世界模型,为跨域泛化提供新视角,方法具体。
Simon Holk et al. · 研究多模态演示数据中指令与轨迹不匹配的审计方法,识别行为正确但标签错误的有害模式。提供数据清洗工具,对提升VLA训练数据质量有直接帮助。
Zikang Wen et al. · 提出世界感知的推测解码以加速VLA自回归生成,通过并行验证草稿动作令牌降低延迟。直接解决VLA推理速度慢的核心瓶颈,工程价值高。
Zhongxi Chen et al. · 提出在线演化记忆机制,使预训练策略能通过真实 rollout 跟踪长程子任务状态。解决非马尔可夫环境下的记忆更新问题,方法新颖且实用。
Junjie He et al. · 为世界-动作模型(WAMs)引入文本接地和空间感知的语义引导,解决现有WAMs过度依赖视觉线索的问题。增强语言指令在预测中的作用,提升可控性。
Yihan Lin et al. · 结合联合嵌入预测架构(JEPA)与世界-动作模型,避免视频生成的计算成本,同时保留状态转换建模能力。平衡效率与性能,是VLA架构的有效变体。
Yunhao Zhao et al. · 提出混合学习框架,将技能固化在权重中,记忆逻辑放在代码中,以应对非马尔可夫操作需求。概念清晰,为解决长程依赖提供新思路。
Hongjin Ji et al. · 提出通过未来视觉表示预测实现可靠的VLA测试时训练(TTT),解决闭环适应中的空间混淆问题。为在线自适应提供稳定方案,具有较高实用价值。
Changhao Li et al. · 提出集中式训练和Critic分解以实现高效的现实世界在线RL,避免Sim2Real差距。为VLA的后训练/精调提供可行的RL路径,工程洞见重要。
Jingkai Wang et al. · 发布0.5B参数的小型VLA模型,学习动作接地的预测潜变量,去除开放域语义冗余。显著降低计算资源需求,适合边缘部署,具有高复用价值。
Dongchi Huang et al. · 探索利用时间距离扩展机器人价值基础模型,解决奖励模型规模化瓶颈。为RLHF或价值函数学习提供新视角,对VLA对齐有潜在影响。
Puzhen Yuan et al. · 提出自我反思和自我演化的多智能体协作框架,用于长程机器人操作。利用多代理机制分解复杂任务,为Agentic VLA提供新范式,值得跟进。
Hyeongjun Heo et al. · 实现VLA模型的零样本相机视角适应,解决微调模型对视角敏感的问题。直接提升VLA在不同部署环境下的鲁棒性,无需额外训练,实用性极强。
Jiuzhou Lei et al. · 提出自适应视觉-扭矩融合机制,动态决定何时依赖视觉、何时依赖触觉进行接触感知操作。填补触觉VLA方向空白,提升灵巧操作能力。
Jiarun Zhu et al. · 探讨VLA模型在真实世界数据上的持续学习能力及抗遗忘机制。针对部署后的长期演进问题,提供实验分析和解决方案,对实际落地至关重要。
诊断动作条件世界模型在具身操作中的仿真忠实度,评估预测过渡的准确性而非仅视觉合理性。属于基础评估工具,非直接VLA架构改进。
Shilin Shan et al. · 综述触觉和力感知机器人学习,涵盖物理交互能力。作为领域概览有价值,但无具体新方法或即时应用路径,归为值得了解。
Jie Huang et al. · 从单张图像生成具备物理属性的仿真就绪3D资产,侧重资产生成而非实时控制策略。虽相关但非VLA核心决策环路,归为值得了解。
Hanxiao Chen · 基于离线LLM的多模态机械臂交互控制,摘要缺乏具体技术细节和创新点描述,且未明确VLA架构贡献,疑似常规应用,归为值得了解。
Amirhosein Chahe et al. · 针对图像目标导航,提出单调规划成本的潜在世界模型。侧重导航而非通用操作,且方法较为特定,归为值得了解。
Mingwu Su et al. · 专注于双臂手术机器人的子任务操作,提出轨迹发散视界决策。领域过于垂直(医疗),且非通用VLA架构,归为值得了解。
Zhaochen Lan et al. · 提出基于单目眼在手相机的在线部件级语义重建系统。侧重感知模块,虽对操作重要但非VLA决策核心,归为值得了解。
Yapeng Liu et al. · 结合能量结构和神经时间场构建潜在世界模型,确保运动规划的物理一致性。方法理论性强,但主要面向规划而非端到端VLA控制,归为值得了解。