TouchWorld: A Predictive and Reactive Tactile Foundation Model for Dexterous Manipulation
Jianyi Zhou et al. · 填补触觉 VLA 空白,提出 TouchWorld 模型,兼具接触演化的预测与局部误差的快速反应能力。解决了灵巧操作中触觉反馈滞后与不确定性难题,在多个灵巧手任务上展现 SOTA 性能,极具战略意义。
Jianyi Zhou et al. · 填补触觉 VLA 空白,提出 TouchWorld 模型,兼具接触演化的预测与局部误差的快速反应能力。解决了灵巧操作中触觉反馈滞后与不确定性难题,在多个灵巧手任务上展现 SOTA 性能,极具战略意义。
提出 LEEVLA,通过潜在环境演化机制动态选择关键视觉 token,解决 VLA 在复杂动态场景中的注意力分散问题。提升了模型对任务关键信息的捕捉能力,适合关注长序列推理与效率优化的研究者参考。
Yushen Liang et al. · 针对 VLA 策略的‘反应式’缺陷,引入时间条件记忆融合模块,利用历史观测增强当前动作预测。该方法可直接集成至 OpenVLA/π0.5 等架构,提升长程任务稳定性,具有明确的工程复用价值。
Baoyu Li et al. · 利用野外第一人称人类数据解耦可迁移内容与非迁移因素(如形态),构建超越像素的世界动作模型。为解决 VLA 跨形态泛化难题提供新视角,数据驱动方法值得借鉴。
Yixian Zhang et al. · 通过记忆引导代理冻结并微调 VLA,将其转化为可靠的操作原语。旨在解决端到端 VLA 在长程任务中缺乏精确接触控制的问题,提供了一种无需重新训练大模型的部署优化路径。
Ke Ren et al. · 引入价值引导规划以弥补 VLA 在分布偏移和长程结构下的反应式缺陷。通过结合 VLA 先验与规划搜索,提升执行鲁棒性,为 Agentic VLA 控制提供了可复用的规划框架。
Zeyuan Ding et al. · 提出 Pelican-VLA 0.5,在同一架构内集成视觉语言理解、未来帧生成与动作预测。通过‘先注意后行动’机制提升泛化能力,展示了世界模型辅助 VLA 的有效路径,具备较高关注度。
Guoyang Zhao et al. · 提出 GeoProp 方法,将本体感觉状态显式对齐到视觉特征图,解决传统融合中 kinematics 与 features 脱节问题。为提升 VLA 空间感知精度提供了具体的多模态对齐方案,工程实用性强。
Zhiying Du et al. · 提出分层混合专家(HiMoE)架构处理 VLA 中的异构数据(不同实体/动作空间)。通过层级路由机制提升泛化能力,是对 MoE 在 VLA 中应用的实质性改进,适合关注模型可扩展性的读者。
Tyler Ga Wei Lum et al. · 探究灵巧操作预训练中对精密装配至关重要的因素。通过‘玩’式预训练提升接触丰富任务的泛化,为 VLA 灵巧操作的数据策略提供实证洞见,具有明确的方法论指导意义。
Yufeng Wang et al. · 分析紧凑世界模型中空间关系 grounding 的指令泄露问题,并提出无目标动力学修复方案。深化了对 VLA 世界模型语义对齐机制的理解,具有理论深度与修正价值。
Jiayi Fang · 指出端到端 VLM 注入世界模型的梯度传播局限,提出写保护离散瓶颈结构。从架构层面解决语言符号与连续动力学的对齐难题,为 VLA 世界模型设计提供关键修正。
Zi-han Ding et al. · 提出无监督技能挖掘框架以支持少样本适应。虽然涉及操作策略,但侧重于技能表示学习而非 VLA 核心架构改进,且缺乏大规模 VLA benchmark 验证,作为相关方向了解即可。
Shiyuan Yang et al. · 结合 InternVL3.5 与流匹配动作头构建轻量级 VLA。虽强调多任务精度,但属于现有组件的工程组合,缺乏架构层面的显著创新或 SOTA 突破,适合作为轻量化部署参考。 [💧灌水]
Yunchao Yao et al. · 发布 DexVerse 基准,涵盖多种交互模式、感官条件和机器人实体,旨在系统评估灵巧操作策略。作为重要数据集资源值得关注,但本身非算法进展,归类为值得了解。
Rong Xue et al. · 提出选择性流对齐以加速视觉运动策略学习。主要贡献在于扩散/流策略的训练效率优化,虽与 VLA 动作生成相关,但未直接涉及语言模态或 VLA 核心瓶颈,属相邻领域改进。
Yuchi Zhao et al. · 针对分块动作策略,提出动态执行 horizon 预测机制。虽适用于 VLA 动作输出层,但属于通用策略优化技巧,未深入 VLA 特有的多模态对齐或泛化问题,技术增量有限。
Abhinav Agarwal et al. · 探讨扩散策略中长上下文长度的训练与评估。主要关注视觉历史窗口的扩展,虽对 VLA 有参考价值,但缺乏语言模态整合及 VLA 特定实验,属于基础策略研究的延伸。
Mike Roberts et al. · 发布 SPear 仿真器,旨在解决现有光真实感仿真器的通用性与渲染速度限制。作为工具类贡献,对生成合成数据有价值,但非算法或理论突破,归类为值得了解。
Inkyu Sa et al. · 综述 VLA 在无人与双臂操作中的应用。作为文献梳理有助于快速入门,但无原创性方法贡献,符合综述类论文定位。
Juyi Lin et al. · 通过轨迹集成投票优化 VLA 生成质量,旨在减少 token 冗余并提升准确性。方法本质是推理阶段的集成技巧,未触及模型架构核心,且标题夸大‘统一’概念,贡献有限。 [💧灌水]
Tianxing Chen et al. · 发布 RoboDojo 基准,旨在全面评估通用机器人操作策略的 Sim-to-Real 能力。作为重要评估资源值得关注,但非算法创新,归类为值得了解。
Xiaohan Zhang et al. · 聚焦于合成逼真的人-关节物体交互数据,服务于具身 AI 训练。虽与数据生成相关,但核心贡献在图形学与人体姿态估计,非 VLA 模型本身,作为数据源参考。
Masatoshi Tateno et al. · 分析第一人称视频语言模型在手-物交互识别中的捷径问题。主要贡献在于诊断性分析与数据集构建,虽与 VLA 感知相关,但无新模型提出,属基础研究。
Yuxi Wang et al. · 展示视频扩散模型在手部运动重建中的有效性。属于计算机视觉中的姿态估计任务,未涉及机器人控制或 VLA 决策闭环,与本领域核心目标距离较远。
Viet Vu et al. · 从理论角度分析扩散策略的表达力与统计权衡。虽为 VLA 动作生成提供理论基础,但纯理论推导缺乏具体 VLA 实验验证,适合理论研究者优先阅读。
Chenxi Wang et al. · 提出免校准灵巧手重定向方法,利用少样本人类指导。虽服务于数据采集,但核心是运动学映射算法,非 VLA 策略学习,作为遥操作相关技术了解。
Donna Vakalis · 探讨世界模型所需的最小价值等价性。属于强化学习与世界模型的理论边界探索,虽具启发性,但离 VLA 实际工程应用较远,归类为值得了解。
Zhantao Gong et al. · 定义并评估多模态大模型与世界模型中的‘远见智能’。主要贡献在于概念界定与评估指标,缺乏针对 VLA 控制的具体改进方法,属前沿概念探讨。
Benjamin Poole et al. · 提出反馈操纵正则化以实现离线代理对齐。虽涉及 RL 对齐,但未明确结合 VLA 的多模态特性,主要贡献在 RL 算法层面,与 VLA 核心关联度一般。