ValueFormer: A Causal Transformer Value Function with Stage-Aware Labels for Semi-Autonomous Vision-Language-Action Policies
Inkyu Sa et al. · 提出结合因果Transformer与阶段感知标签的价值函数,解决VLA行为克隆中缺乏进度感知的痛点。为半自主VLA策略提供了可复用的RL辅助评估模块,增强对失败rollout的识别能力。
Inkyu Sa et al. · 提出结合因果Transformer与阶段感知标签的价值函数,解决VLA行为克隆中缺乏进度感知的痛点。为半自主VLA策略提供了可复用的RL辅助评估模块,增强对失败rollout的识别能力。
Yiren Zhao et al. · 系统对比了本体感觉状态在VLA中的不同编码方式(文本序列化、前缀投影、专家输入)。提供了明确的工程洞见和最佳实践指南,研究者本周即可据此优化现有VLA模型的状态输入模块。
Jinquan Zhang et al. · 针对VLA机器人面临的物理注意力劫持攻击,提出结构感知鲁棒微调方法。提供了对抗防御的具体训练策略,增强了VLA部署的安全性,具有明确的工程应用价值。
Weichen Xu et al. · 引入伯努利延续策略学习,使VLA能根据任务进度动态决定继续执行还是重新规划,打破固定时间步限制。该方法即插即用,可显著提升长程任务中VLA的执行效率和适应性。
Zhenyang Feng et al. · 提出统一视觉运动目标,通过监督VLM的高层语义表征而非仅底层动作来训练VLA,缓解表征不匹配问题。为VLA训练提供了新的监督信号思路,有助于提升策略的泛化性和可解释性。
Chenyi Wang et al. · 通过蒸馏世界中心3D追踪器到VLA策略中,利用演示片段中的几何过渡提供额外监督。该方法引入了显式的3D几何约束,有助于提升VLA在复杂空间操作中的精度和鲁棒性。
Ekansh Singh et al. · 展示了在低端Jetson硬件上运行量化ACT双臂策略的工程实现,包括零拷贝传感技术。为VLA的边缘部署提供了宝贵的低资源优化方案和代码参考,极具实操价值。
Yuzhi Huang et al. · 提出ChainVLA,通过统一执行状态链式连接VLA查询,解决长程任务中重复重规划的问题。该方法改进了VLA的时间一致性,适用于需要多步骤协调的复杂操作场景。
Guoyang Xia et al. · 提出VLAFlow统一训练框架,通过共训练和未来潜在对齐解决不同预训练范式的比较难题。为VLA社区提供了标准化的训练基线和消融实验工具,具有高度的可复用性。
Qi Luo et al. · 分析了免训练VLA令牌跳过中门控来源对闭环可靠性的影响,指出缓存门控的缺陷。为VLA加速推理提供了重要的安全性分析和改进方向,具有明确的工程指导意义。
Carlota Parés-Morlans et al. · 深入分析VLA在接触丰富任务中失败的时空原因并提出修复方案。提供了详细的错误分析和针对性的改进策略,填补了VLA触觉/接触操作领域的分析空白,极具参考价值。
Jiayi Luo et al. · 提出解耦视频VAE以改进具身世界模型的效率与控制性。虽涉及具身操作,但侧重于视觉表征学习而非VLA核心架构或策略生成,属于相邻领域的基础设施工作。
Rishabh Shukla et al. · 针对需时变力的拆解任务提出分层模仿学习方法,缓解扩散策略迭代去噪带来的延迟问题。方法特定于接触丰富场景,未展示通用VLA基准测试,属于细分领域的算法改进。
Haoyu Gu et al. · 提出基于解剖单元的手部运动符号化Tokenization方法,替代连续的关节角度表示。主要贡献在于手部动作表征,虽可用于灵巧操作,但未直接整合进VLA端到端框架进行验证。
Fan Yang et al. · 提出轻量级潜在推理世界-动作模型以降低计算开销。虽涉及WAM范式,但摘要未明确其在标准VLA基准上的性能对比及相对于现有SOTA(如Octo/OpenVLA)的实质性架构突破。
Chenghua Wang et al. · 构建了云边协同的物理AI系统,支持边缘实时推理和云端可扩展Rollout。侧重于系统工程架构而非VLA算法创新,虽重要但属于基础设施层,非核心研究进展。
Yihuai Gao et al. · 提出门控记忆策略以处理非马尔可夫任务中的上下文记忆需求。虽涉及VLA的记忆机制,但作为更新版本,需确认其相比初版是否有显著的新实验或理论突破,暂归为值得了解。
Yufei Jia et al. · 发布基于高斯溅射的高吞吐量逼真模拟器GS-Playground。作为仿真数据集/工具,虽对VLA训练有价值,但本身非算法或架构创新,归类为基础设施资源。
Dayu Xia et al. · 推出RoboProcessBench基准,评估VLM在机器人操作中对过程意识的理解能力。作为新的Benchmark,有助于评估VLA的中间状态判断能力,但无新方法论贡献。
Susie Lu et al. · 提出通过漂移加速扩散世界模型的采样过程。专注于世界模型的推理速度优化,虽对VLA规划有用,但未直接结合VLA策略进行端到端评估,属于相邻技术领域。
Yuzhen Chen et al. · 提出世界认知模型以增强人机交互的泛化性。侧重交互层面的认知建模,与核心VLA操作策略关联度较低,且缺乏具体的机器人操作实验细节支撑。
Kaichen Zhou et al. · 提出几何增强的4D视频世界模型,解决生成视频中物理点跟踪不一致的问题。虽提升了世界模型的物理真实性,但未直接证明其对VLA策略性能的显著提升,属基础模型改进。
Daojie Peng et al. · 提出云边协同VLA模型以容忍网络延迟,通过涌现的表征专业化实现分工。侧重分布式系统架构,虽涉及VLA部署,但算法创新有限,更多是系统工程优化。
Dongfu Yin et al. · 提出VLAGuard框架以评估和缓解WSN中VLA机器人的物理注意力劫持。与第6篇论文主题高度重叠,但更侧重网络环境下的安全框架,创新性相对较弱,归为值得了解。
Zhe Liu et al. · 将湿实验室协议转化为机器人可执行动作,侧重特定领域的应用适配。虽展示了VLA的实际应用能力,但缺乏通用方法论创新,属于垂直领域的应用案例。