Output-Level Regularization Eliminates the Seed Lottery in Single-GPU VLA Fine-Tuning
Jeffrin Sam et al. · 针对单GPU微调VLA时的随机性种子问题,提出输出级正则化方法以提升训练稳定性。该方法即插即用,显著降低复现门槛,具有明确的工程复用价值。
Jeffrin Sam et al. · 针对单GPU微调VLA时的随机性种子问题,提出输出级正则化方法以提升训练稳定性。该方法即插即用,显著降低复现门槛,具有明确的工程复用价值。
Zhiyuan Zhang et al. · 深入分析视觉-触觉世界模型中支持长程规划的关键表征属性,填补触觉VLA理论空白。提供关于多模态融合的具体洞见,对构建高鲁棒性接触操作策略有直接指导意义。
Namai Chandra et al. · 通过在VLA训练中显式引入物理约束,解决纯行为克隆导致的物理不一致性问题。该方法增强了模型对动力学变化的泛化能力,是提升VLA物理常识的有效路径。
Duc Minh Nguyen et al. · 提出通过选择扩散噪声来平滑动作并抑制虚假视觉相关性,提升VLA在扰动下的鲁棒性。该方法无需重新训练即可应用于现有Diffusion Policy,具备即时部署潜力。
Yanzhao Guo et al. · 通过改进平均流动作生成机制,显著降低扩散VLA的推理延迟,实现快速反应式操作。解决了VLA实时性瓶颈,代码/方法可直接用于加速现有RT-X或OpenVLA部署。
Seoyoon Kim et al. · 提出空间条件扩散策略,仅凭单目RGB相机即可实现高精度操作,摆脱对腕部相机的依赖。该方法降低了硬件成本要求,为资源受限场景提供了可行的VLA部署方案。
Zihao Li et al. · 引入轨迹路由因果记忆机制,解决早期线索消失后的延迟证据模仿学习问题。提升了VLA在部分可观测环境中的长期依赖建模能力,是对Transformer架构的有效补充。
Yue Xu et al. · 提出第一人称引导方法以优化无机器人演示数据的收集效率,减少冗余数据。该方法可直接集成至UMI等数据流水线,显著提升VLA预训练数据的质量与采集速度。
Qingping Zeng et al. · 诊断发现小尺度VLA验证的最佳编码器在大尺度下未必有效,并提出冻结骨干嫁接诊断方法。该洞见对VLA架构选型至关重要,可避免大规模训练中的无效尝试。
Haotian He et al. · 将力信号深度融入世界模型以指导闭环接触操作,超越简单的多模态拼接。该方法充分利用了触觉动力学信息,为触觉VLA提供了新的建模范式。
Sarvesh Patil et al. · 提出离线生成策略优化(OGPO),实现生成控制策略的高效全量微调。该方法提升了样本效率,可直接应用于扩散策略等VLA模型的后期强化学习精调。
Xirui Kang et al. · 设计专为VLA预训练优化的多模态动作Tokenize器,保留运动几何特征而非仅重建。该方法可直接替换现有离散化模块,提升VLA对精细动作的编码能力。
Yifan Ruan et al. · 提出高效的测试时Q值引导方法,利用 critic 梯度优化流匹配策略的动作采样。无需重新训练即可提升策略性能,是改进现有Flow/Diffusion VLA的实用工具。
Jeongeun Park et al. · 提出测试时检索扩展方法,无需微调即可将VLA适配至新任务。显著降低适应成本,通过RAG思路增强VLA零样本泛化能力,具有极高的工程应用价值。
Jialei Chen et al. · 结合潜在世界模型与动作生成,使VLA具备动力学感知能力。通过隐空间预测提升策略效率,是连接世界模型与VLA控制的有效架构尝试。
Seungjae Lee et al. · 提出基于3D交互轨迹的世界模型,旨在通过像素级视频先验提升机器人学习效率。属于世界模型方向的新探索,但摘要未展示具体VLA架构改进或Benchmark对比,暂归为值得了解。
Yitao Jiang et al. · 引入物体动量和隐藏环境漂移机制以改进世界模型在复杂运动下的预测能力。主要贡献在于仿真环境下的状态预测优化,缺乏真实机器人操作验证及与SOTA VLA的直接对比。
Zhitian Zhang et al. · 研究多模态缺失场景下的注意力预测模型,虽涉及机器人感知鲁棒性,但侧重于通用多模态学习而非特定VLA控制架构。缺乏针对具身智能操作任务的具体实验证据。
Yao-Ting Huang et al. · 介绍一种新型二维力反馈数据手套,用于增强接触丰富操作中的触觉感知。属于硬件创新,虽有助于数据采集,但未涉及VLA算法层面的直接贡献或软件集成方案。
Ge Wang et al. · 提出弹性查询RL框架,使VLA能根据任务难度动态调整重规划频率。概念新颖但摘要未明确说明是否超越固定步长基线,且缺乏具体Benchmark性能数据支撑。
He Zhang et al. · 报告了一个端到端机器人学习栈HyVLA-0.5,涵盖数据收集到RL后训练全流程。作为系统报告,其核心创新点分散于工程整合,缺乏单一突破性算法贡献,适合整体了解。
Francesco Capuano et al. · 发布开源灵巧操作平台ORCA,旨在降低双指夹爪研究门槛。属于基础设施/数据集类贡献,虽重要但不涉及VLA核心算法创新,归类为值得了解。
Wei Wu et al. · 宣称提供一种兼顾泛化与成本效率的实用型VLA基础模型。标题宏大但摘要缺乏具体技术路线细节,且未见显著超越当前SOTA的量化证据,疑似常规迭代。[💧灌水]
Yi Yu et al. · 在低成本SO-101机械臂上对VLA进行基准测试与失败恢复分析。填补了廉价硬件评估空白,但主要为实证分析而非新算法提出,适合作为部署参考。
Cheng Zhang et al. · 综述医疗具身智能在感知、决策与行动方面的进展。属于领域综述,虽重要但不包含具体的VLA算法创新或即时可用的技术方案。
Kairos Team et al. · 提出面向物理AI的原生世界模型栈Kairos,强调异构经验获取与持久状态维护。概念框架性强,但摘要未展示具体VLA应用效果或Benchmark对比,暂归为了解。
Wenhao Lu et al. · 针对无人机空中EQA任务提出双专家VLA模型,侧重主动感知与开放世界问答。应用场景垂直(UAV/EQA),与主流地面操作VLA关联度较低,归为值得了解。
Jiahao Yang et al. · 提出基于遥操作的正向运动学一致性生成逆解方法,解决实时IK瓶颈。虽服务于机器人控制,但属于底层运动学求解器优化,非高层VLA策略网络创新。