Output-Level Regularization Eliminates the Seed Lottery in Single-GPU VLA Fine-Tuning
Jeffrin Sam et al. · 针对单GPU微调VLA时的随机性种子问题,提出输出级正则化方法以提升训练稳定性。该方法工程实用性强,可直接应用于现有VLA微调流程,解决复现难题。
Jeffrin Sam et al. · 针对单GPU微调VLA时的随机性种子问题,提出输出级正则化方法以提升训练稳定性。该方法工程实用性强,可直接应用于现有VLA微调流程,解决复现难题。
Zhiyuan Zhang et al. · 深入分析视觉-触觉世界模型在接触丰富操作中的关键表示属性。填补了触觉VLA理论空白,为构建更稳定的长视界规划模型提供了明确的工程指导方向。
Namai Chandra et al. · 提出PhysVLA,通过在行为模仿数据中显式嵌入物理约束来增强VLA的物理一致性。该方法直接针对VLA泛化瓶颈,提供了可落地的物理 grounding 训练范式。
Duc Minh Nguyen et al. · 提出通过选择扩散噪声来平滑动作,以增强VLA策略对虚假视觉相关性的鲁棒性。该方法直接改进Diffusion Policy推理阶段,具有明确的性能提升和复用价值。
Yanzhao Guo et al. · 通过改进均值流动作生成技术,显著降低扩散VLA的推理延迟,实现快速反应式操作。解决了VLA部署中的实时性瓶颈,代码与方法具备高复用性。
Seoyoon Kim et al. · 提出空间条件扩散策略,仅凭单目RGB相机即可实现高精度操作,摆脱了对腕部相机的依赖。该方法降低了硬件门槛,并在LIBERO等基准上展示了有效性。
Zihao Li et al. · 引入轨迹路由因果记忆模块,解决早期线索消失后的延迟证据模仿学习问题。针对长视界任务中的记忆瓶颈提出了具体的架构改进,具有明确的技术贡献。
Yue Xu et al. · 提出基于第一人称视角引导的高效无机器人演示收集方法,减少冗余数据。该方法优化了VLA数据收集 pipeline,具有显著的样本效率提升潜力。
Qingping Zeng et al. · 诊断发现小尺度VLA验证的最佳编码器在大尺度 backbone 中未必有效,并提出冻结骨干嫁接诊断方法。为VLA模型选型提供了关键的工程洞见,避免盲目迁移。
Haotian He et al. · 提出力感知世界动作模型,将力信号用于建模未来交互动力学而非仅作为观测。填补了触觉VLA中力动态建模的空白,提升了接触丰富操作的闭环控制能力。
Sarvesh Patil et al. · 提出离策略生成策略优化(OGPO),实现生成控制策略的高效全量微调。该方法直接改进VLA的RL后训练阶段,显著提升样本效率,具有高度复用价值。
Haozhe Jiang et al. · 识别并解决扩散策略RL微调中的“双重漂移”不稳定问题,提出改进优化目标。直接提升Diffusion Policy的训练稳定性,是VLA RL精调方向的重要进展。
Chengxuan Lu et al. · 提出分布式异步RL框架AcceRL,解决大规模VLA训练中的同步瓶颈和数据获取成本问题。该框架显著提升了训练效率,具备明确的工程应用价值。
Clinton Enwerem et al. · 提出SE(3)等变生成流模型EquiDexFlow,将接触力约束融入灵巧抓取生成过程。解决了运动学可行但物理不稳定的问题,是灵巧操作VLA的重要算法补充。
Seungjae Lee et al. · 提出基于3D交互轨迹的世界模型,旨在通过捕捉物理变化实现可扩展的机器人学习。属于世界模型方向的重要探索,但摘要未展示具体VLA架构改进或Benchmark对比结果。
Yitao Jiang et al. · 引入物体动量和隐藏环境漂移机制以改进世界模型的预测能力。主要贡献在于仿真环境下的状态预测优化,缺乏真实机器人操作验证及与主流VLA方法的直接关联。
Zhitian Zhang et al. · 研究多模态缺失场景下的鲁棒预测问题,提出基于注意力的处理模型。虽与多模态对齐相关,但侧重于通用预测而非具体的机器人动作生成或VLA架构创新。
Yao-Ting Huang et al. · 介绍一款支持二维方向力反馈的多指触觉手套硬件。属于数据采集/遥操作设备创新,虽对触觉VLA有价值,但本身不涉及算法或模型层面的VLA进展。
Ge Wang et al. · 提出弹性查询RL框架,使VLA能根据任务难度动态调整重规划频率。概念新颖,但摘要未提供充分的Benchmark对比数据证明其优于固定调度策略。
He Zhang et al. · 报告了一个涵盖数据收集到RL后训练的端到端VLA系统栈。属于系统工程报告,虽全面但缺乏单一核心算法突破,更多是工程整合而非理论创新。
Francesco Capuano et al. · 发布开源灵巧手平台ORCA,旨在促进双指夹爪研究。属于硬件平台发布,虽对社区有益,但不包含VLA算法或训练范式的直接创新。
Wei Wu et al. · 宣称提出兼顾泛化与成本效率的实用型VLA基础模型。标题宏大但摘要缺乏具体架构创新细节及跨平台量化对比,疑似常规微调或工程优化。 [💧灌水]
Yi Yu et al. · 在低成本SO-101机械臂上对VLA进行基准测试与失败恢复分析。属于评估与分析类工作,虽重要但无新算法提出,归类为值得了解。
Ruijie Xu et al. · 研究基于记忆的增量式3D场景生成代理,主要用于数字内容创作。虽涉及 embodied AI 仿真场景构建,但核心任务是生成而非机器人操作控制。
Zohar Rimon et al. · 提出局部场景表示以改进触觉成像重建效果。侧重于触觉传感器数据处理,未直接结合VLA决策框架,属于相邻领域的基础感知研究。
Teng Chen et al. · 提出基于JEPA的高效理由检索蒸馏方法。虽提及JEPA(VLA常用架构),但核心贡献在于信息检索效率,未明确展示在机器人操作任务中的应用路径。
Guimin Long et al. · 报道一种基于被动声波导的可扩展动态触觉传感技术。属于新型传感器硬件研发,虽对触觉VLA有潜在价值,但非算法或模型层面的直接贡献。
Yongyan Cao · 提出带扰动估计的阻抗MPC框架用于灵巧手控制。属于传统控制理论与现代优化的结合,未涉及VLA或学习-based策略,归类为相邻领域。
Xiaoxin Lu et al. · 发布基准测试LLM在执行规划中的潜在失败模式。虽涉及世界模型和规划,但侧重于LLM符号规划的评估,而非底层VLA视觉动作策略的直接改进。
Dvir Samuel et al. · 提出时间缓存压缩和稀疏注意力以加速视频扩散模型。虽可用于世界模型加速,但核心贡献在于通用视频生成效率,未针对机器人操作场景进行专门优化或验证。