GaussVLA: Geometry-Aware Spatial Reasoning for Vision-Language-Action Model
Md Selim Sarowar et al. · 用3D高斯表征替代平面2D patch token与深度标量,为VLA提供几何感知空间推理,增强对表面朝向/空间关系的利用,直击空间泛化瓶颈。
Md Selim Sarowar et al. · 用3D高斯表征替代平面2D patch token与深度标量,为VLA提供几何感知空间推理,增强对表面朝向/空间关系的利用,直击空间泛化瓶颈。
Sanghwan Jang et al. · 测试时通过检索相关示例注入上下文,无需梯度更新即可让VLA适应新任务分布,弥补ICIL对检索质量的依赖。对快速部署VLA有直接可复用的检索增强管线。
Jianbo Zhou et al. · Chunk式VLA预测整个动作块时无法响应执行期间的接触变化,TacForcing用执行时触觉反馈做流式动作生成,直击接触丰富操作的动作时序适配难题,做触觉VLA值得精读。
Zaibin Zhang et al. · 将语言指令从单全局描述扩展为多臂分工描述,支持双臂独立/协作执行并在协作场景验证组合泛化,对双臂VLA策略设计有直接参考价值。
Xiao-Ming Wu et al. · 系统实证研究VLA各组件的设计配方(backbone、视觉tokenizer、action head、数据配比等),为构建强VLA提供可复用设计准则,对VLA工作流有直接指导意义。
用RL奖励信号训练VLA在操作前生成自然语言推理链,把test-time compute用于分解/约束跟踪类长程任务,探索语言推理能否实质改善操作。对推理强化型VLA方向有参考。
从人类视频以上下文方式建模世界与动作,新任务只需在上下文中指定而无需参数更新,实现零样本跨任务泛化,属WAM+人视频方向。
Yafei Ou et al. · GPU批处理手术仿真引擎,可同时模拟刚体/软组织/流体并带手术传感,面向手术机器人策略训练的数据规模化,属仿真基础设施。
Nina Moorman et al. · 在真实居家环境让非专业照护人员纵向教授机器人技能,评估LfD的长期可用性,偏人机交互与部署研究而非VLA方法。
Sadman Sakib et al. · 系统整理建筑工地工人活动分类学,为VLA在施工部署建立任务-技能清单,属任务数据集/分析类工作,非新方法。
Yuqing Jiang et al. · 用3D高斯世界模型增强VLA对度量几何与短期物理演化的监督,与GaussVLA同属几何/世界模型增强VLA的路线。
Jin Lou et al. · 在通用VLA动作预测基础上并行预测任务进度、事件与不确定性,为长程行为提供可解释的监控与反馈信号,属VLA辅助头设计类工作。
Jiayi Chen et al. · 纯视觉推断空间接触注意力,把遮挡/细微形变下的接触状态显式建模进模仿学习策略,无需额外触觉传感器,对接触丰富操作的视觉表征有借鉴。
Xiaomi Embodied Intelligence Team et al. · 提出以相机为中心的动作几何预训练,试图统一异构形态、相机配置与低级动作空间。标题宏大但摘要片段仅停留在问题陈述,技术细节不足,谨慎看待。
S. Talha Bukhari et al. · 用李群约束的MeanFlow做快速生成式抓取合成,显式编码SE(3)流形结构,输出多模态抓取分布,属生成式抓取子任务而非完整VLA。
Yujie Wei et al. · 自适应视觉token缓存减少VLA推理时的视觉计算量,针对部署延迟瓶颈的推理效率优化,对上线VLA有工程参考价值。
Yirui Sun et al. · 观察到像素空间WAM的最优动作条件并非完全去噪视频,提出按状态自适应控制去噪程度来改善动作生成条件,属WAM训练细节优化。
Soumil Rathi · 新benchmark,评估机器人在多会话经验累积、受干扰时的长上下文记忆能力,填补部署场景机器人记忆评测缺口,属数据集/评测类工作。
Fenghao Lei et al. · 挑战WAM中视频生成是必要中间目标的假设,主张直接从未来潜在状态推断动作,简化世界动作建模管线,对WAM路线有方法论价值。
Brian Zhu et al. · 在推理延迟期间用RL继续改进通用策略,将大模型延迟劣势转化为训练增益,思路新奇的RL fine-tuning工作。
Tong Yang et al. · 提出轨迹级连续动作表示CAT,解耦动作表征与控制频率/固定时间参数化的纠缠,对跨平台动作输出统一有参考。
Chang Liu et al. · 对LeWorldModel的正则化项SIGReg做时间中心化改进,提升像素级世界模型表征稳定性,属规模较小的改进。
Haoran Hao et al. · 分层技能检索把相关技能注入VLA适配过程,缓解少示范场景性能退化,与RA-VLA同属检索增强VLA路线但聚焦小样本适配。
Suhwan Choi et al. · 把预训练MLLM用作episode级上下文引擎,整合长视觉历史并在部分可观测条件下少样本推理来驱动控制,对长上下文VLA设计有借鉴。
Shijia Ge et al. · 用视觉几何基础模型VGGT替换模仿学习策略的视觉骨干,目标改善空间泛化,对VLA视觉编码器选型有参考,但本身非VLA训练方法。
Shuoheng Zhang et al. · 接触驱动流匹配让策略基于接触反馈生成动作,针对高精度力控的接触丰富操作,属触觉/力觉操作方向,可与TacForcing对照阅读。
Pengzhi Yang et al. · 两阶段置信门控的进度奖励模型,为长程操作RL提供稠密进度信号,缓解稀疏奖励与手工reward泛化差问题,对VLA的RL精调有参考。
Jingyang Su et al. · 从可验证注释证据学习点级VLM grounding,输出点坐标作为GUI/机器人操作的可执行接口,偏VLM基础能力而非完整策略方法。