$N_0$-TWAM: Scaling Tactile-Native World-Action Model for Contact-Rich Manipulation
NeoteAI Team et al. · 首个大规模训练的触觉原生世界-动作模型,同时预测未来视觉和触觉接触,显著提升接触丰富操作的性能。填补了触觉VLA领域的空白,并在多个基准上展现SOTA潜力。
NeoteAI Team et al. · 首个大规模训练的触觉原生世界-动作模型,同时预测未来视觉和触觉接触,显著提升接触丰富操作的性能。填补了触觉VLA领域的空白,并在多个基准上展现SOTA潜力。
提出解耦的视频-动作架构,引入物理引导以增强对场景演变的预测能力,解决静态预训练目标在动态任务中的局限性。为提升VLA时序建模能力提供了新的架构思路。
针对VLA推理延迟高的问题,提出运动感知的矢量量化框架及质心复用机制,显著降低计算冗余。该方法可直接应用于现有VLA模型的加速部署,具有明确的工程落地价值。
Daphne Chen et al. · 提出通过少量语言指令合成机器人策略的方法,旨在提高VLA的可解释性和适应性。为黑盒策略的微调和错误修正提供了实用的技术路径。
Hai Jiang et al. · 解决VLA异步执行中的预测-执行错位问题,提出预期条件动作分块方法。该技术可直接集成到实时控制系统中,显著提升部署时的响应速度和稳定性。
Ning Cheng et al. · arXiv:2607.24485v1 Announce Type: new Abstract: Learning the informative tactile representation while effectively adapting it to pretrained Vision-Language-Action (VLA) models remains challenging at both the data and modeling levels. At the data level, limited task-specific demonstrations constrain representation quality, whereas large-scale pretraining incurs substantial costs. At the modeling level, existing methods either focus on instantaneous contact states or model temporal interaction dyn
Jiaming Tang et al. · 通过未来状态感知的异步推理实现实时VLA,解决同步等待导致的延迟问题。提供了一套完整的工程优化方案,可直接用于提升现有VLA模型的部署效率。
Iok Tong Lei et al. · 结合粗粒度空间蒸馏与潜在流匹配,实现轻量级VLA控制。有效平衡了边缘部署的计算成本与性能,为资源受限场景提供了可行的轻量化解决方案。
Peng Ren et al. · 为人形机器人VLA引入持久3D对象令牌,解决长程移动操作中的物体跟踪与验证问题。提升了人形机器人在复杂环境中的鲁棒性,具有明确的工程应用价值。
Riccardo Andrea Izzo et al. · 提出复杂度感知的自适应推理机制,允许模型根据任务难度选择行动、思考或弃权。有效平衡计算成本与决策质量,适用于资源敏感的VLA部署场景。
Qing Yang et al. · 介绍基于AMD ROCm的Real2Sim2Real流水线,主要贡献在于工程基础设施和硬件适配。虽与VLA相关,但缺乏算法层面的核心创新,属于工具类论文。
Yuzhen Chen et al. · 提出世界认知模型以改善人机交互中的物理任务执行。方法侧重于高层语义理解与世界模型的结合,但在具体操作策略上的直接应用路径尚不明确,需进一步验证。
Cuijie Xu et al. · 系统研究高精度机器人装配任务中数据规模与精度的关系,揭示封闭世界任务下的缩放定律。虽具理论价值,但主要聚焦于特定场景的数据分析,非通用VLA架构改进。
Seung Hyun Lee et al. · 利用多项式表示捕捉物理变量间的交互作用(如惯性、接触),用于电机控制。方法新颖但偏向底层控制理论,与主流端到端VLA范式的结合点需进一步探索。
Haobo Wang et al. · 发布化学自动驾驶实验室中的机器人故障分析基准数据集。作为重要资源填补了特定领域评估空白,但本身不提供新算法或模型架构。
Mohammad Hasan Yeganegi et al. · 将PAC-Bayesian理论引入扩散策略学习,以增强有限数据下的泛化控制。理论贡献突出,但实验主要集中在仿真环境,真实机器人验证缺失。
Praveen Selvaraj et al. · 推出基于低成本机械臂集群的并行真实世界评估基准ArmnetBench。解决了真实机器人评估瓶颈,是重要的基础设施贡献,但非算法创新。
Mikołaj Zieliński et al. · 结合NeRF编辑与语言引导,实现连续物体操作。主要贡献在于场景表示与编辑,而非核心的动作策略生成,与VLA核心范式距离较远。
Yifan Ye et al. · 提出具身操作的数据金字塔结构,探讨不同层级数据的耦合方式。主要关注数据构建方法论,缺乏具体的模型架构改进或SOTA结果对比。
Yi Liu et al. · 通过自回归离散化预训练统一VLM推理与机器人动作。方法较为常规,主要在现有框架上进行组合创新,缺乏突破性的架构设计或显著的SOTA超越。
Hao Jiang et al. · 探索灵巧手中抓取与非抓取操作的并发执行。虽涉及复杂操作,但更偏向传统机器人控制策略,未充分利用VLA的大模型泛化能力。
Shlok Shah et al. · 研究MoE架构在VLA中涌现的组合技能,无需预设任务分解。主要侧重于现象观察与分析,缺乏针对性的算法改进或显著的性能提升证据。
Chaoqi Liu et al. · 提出有序动作令牌以优化视动策略学习。主要改进在于动作离散化的编码方式,属于细节优化,对整体VLA架构影响有限。
Afzal Ahmad et al. · 基于任务命令跳过无关计算以加速多任务推理。虽可应用于VLA,但本质是通用的模型加速技术,非VLA特有的架构创新。
Jan Ole von Hartz et al. · 研究双臂协作中的动态多智能体合作,强调样本效率。方法侧重于控制策略而非VLA大模型的应用,与当前主流VLA研究方向偏离。
Hoang Le et al. · 从单张图像推断物理属性(质量、刚度等)。虽对具身AI有价值,但属于感知模块的独立研究,未涉及动作生成或VLA端到端训练。