TouchWorld: A Predictive and Reactive Tactile Foundation Model for Dexterous Manipulation
Jianyi Zhou et al. · 填补触觉VLA方向空白,提出兼具预测与反应能力的触觉基础模型,解决灵巧操作中滑移和对齐问题。若能在LIBERO等基准上验证其超越纯视觉VLA的性能,具备战略级意义。
Jianyi Zhou et al. · 填补触觉VLA方向空白,提出兼具预测与反应能力的触觉基础模型,解决灵巧操作中滑移和对齐问题。若能在LIBERO等基准上验证其超越纯视觉VLA的性能,具备战略级意义。
提出将本体感知(Proprioception)与视觉Token显式对齐的方法,解决3D运动学与2D特征图缺乏对应的问题。可直接用于改进现有VLA的状态融合模块,提升泛化能力。
Ziye Wang et al. · 针对长视界任务,提出原生内存压缩机制以在保持高频更新的同时保留历史视觉信息。解决了外部记忆管理的效率瓶颈,为VLA处理长序列提供了可复用的工程方案。
Zezeng Li et al. · 提出测试时基元引导方法,增强扩散流策略的适应性。无需重新训练即可提升现有Diffusion Policy性能,具有明确的即插即用价值和实验支撑。
Robert Jomar Malate et al. · 提出实时基于采样的手部运动重定向算法,解决VLA/VAM高质量遥操作数据获取瓶颈。代码/算法可直接用于改善数据采集流程,具有明确的工程复用价值。
Hongyu Qu et al. · 引入双潜在记忆机制克服马尔可夫假设局限,提升长视界任务表现。针对VLA时间依赖性痛点提出具体架构改进,有潜力成为标准记忆模块。
Zhiying Du et al. · 提出分层混合专家架构以处理异构机器人演示数据。有效解决多 embodiemnt 下的异质性问题,为VLA扩展性提供可复用的架构设计思路。
Huixi Technology et al. · 识别视觉和上下文Token为边缘部署延迟主因,并提出优化方案。针对VLA落地痛点提供具体工程洞见和优化路径,对部署团队具有高复用价值。
Juyi Lin et al. · 提出轨迹集成投票机制优化VLA生成,减少Token冗余并提升稳定性。作为一种后处理或推理阶段优化方法,易于集成到现有VLA系统中。
Baolu Li et al. · 通过预测世界模型赋予VLA物理动力学知识,提升安全规划能力。将世界模型与VLA结合,为解决幻觉和提升泛化提供具体技术路径。
Yufeng Wang et al. · 分析紧凑世界模型中空间关系 grounding 的问题,提出指令泄漏修复方案。为VLA中的世界模型构建提供关键错误分析和修正方法,具有较高参考价值。
Shuailei Ma et al. · 针对具身智能缩放MoE视频预训练,解决内容创作与计算效率的域差异。为VLA提供更高效的视觉编码器预训练策略,具有直接应用价值。
Zeyuan Ding et al. · 报告了集成视觉语言理解、未来帧生成和动作预测的VLA模型。虽声称注意力级泛化,但摘要未提供具体架构创新细节或Benchmark对比数据,需阅读全文确认贡献。
Shujie Zhang et al. · 提出从真实场景一键生成物理稳定且视觉保真的仿真环境的方法。虽对数据生成有价值,但属于仿真工具链而非核心VLA算法,且缺乏明确的VLA训练/推理直接应用路径。
Inkyu Sa et al. · 综述无人机双臂操作中的VLA模型应用。作为综述类文章,有助于了解领域现状,但不包含新的算法突破或即时可用的技术贡献。
Yi-Xiang He et al. · 结合LLM推理与多机器人协作框架,解决长视界任务分解。虽涉及具身智能,但重点在于多智能体规划而非单臂VLA策略学习,与核心VLA研究距离较远。
Ahmet Ercan Tekden et al. · 利用对象中心神经场实现组合性运动生成。方法新颖但侧重于表示学习和演示学习,未明确展示其在通用VLA架构中的应用或跨平台迁移能力。
Zhijin Meng et al. · 探讨通用机器人首次社交动作的安全性问题。属于伦理与安全范畴的理论探讨,缺乏具体的技术实现或算法改进,对VLA工程实践指导有限。
Xinjie Wang et al. · 发布新一代具身AI仿真引擎,支持生成可执行环境。作为基础设施工具有价值,但非核心算法论文,且主要服务于仿真数据生成而非VLA模型本身。
Mike Roberts et al. · 介绍高保真具身AI模拟器SPEAR。虽有助于评估,但属于仿真平台建设,非VLA核心算法进展,且通常此类工作需等待实际VLA训练结果验证其有效性。
Kajetan Rachwał et al. · 探索机载VLM在多机器人控制中的应用。侧重部署与多智能体协调,未深入VLA模型本身的架构或训练范式创新,对核心VLA研究者参考价值有限。
Shutong Jin et al. · 发布首个系统变化光照条件的真实机器人操作数据集。重要数据资源,有助于提升VLA鲁棒性研究,但本身不包含新算法,归类为值得了解的数据集。
Shuai Zhou et al. · 解决拥挤空间中多机器人协作的长视界规划问题。侧重传统规划与接触力学,未体现VLA端到端学习的优势,与VLA核心研究方向偏离。
Tianxing Chen et al. · 提出统一仿真与真实的基准评测平台。虽对评估体系有贡献,但属于评测工具而非算法创新,且需观察其是否被社区广泛采纳。
Rodrigo Pérez-Dattari et al. · 研究流匹配动力学系统的稳定性保证。理论性强,但未明确展示在VLA或具体机器人任务中的应用效果,暂归为相邻理论研究。
Zhaowen Fan et al. · 提出事件中心的世界模型框架。虽涉及具身决策,但更偏向于认知架构和检索增强,与主流VLA端到端策略学习有一定距离。
Donna Vakalis · 探讨世界模型所需的价值等价性程度。属于理论分析,虽深刻但缺乏直接的VLA架构改进或实验验证,适合深入阅读原理。
Zhantao Gong et al. · 定义并探讨MLLM和世界模型中的预见智能。概念性工作,旨在建立评估框架,暂无具体VLA算法贡献。
Ruiping Liu et al. · 利用世界模型进行情境推理的模拟仿真。侧重推理能力而非动作执行,与VLA的核心目标(动作生成)存在偏差。
Yilei Chen et al. · 提供离线策略对抗模仿学习的收敛保证。理论贡献显著,但未结合VLA架构或大规模视觉数据进行验证,属于相邻强化学习理论。