Human2Any: Human-to-Robot Transfer via Constraint-Aware Compositional Planning
Shuo Cheng et al. · 提出约束感知组合规划方法,解决人体演示到机器人的具身差异问题。提供从人类视频提取可执行策略的工程路径,适合处理跨具身迁移任务。
Shuo Cheng et al. · 提出约束感知组合规划方法,解决人体演示到机器人的具身差异问题。提供从人类视频提取可执行策略的工程路径,适合处理跨具身迁移任务。
Yupu Lu et al. · 自动提取关键姿态以简化长视界任务学习,无需手动标注。为跨具身策略迁移提供高效数据预处理工具,可直接集成至现有IL流程。
Mark Van der Merwe et al. · 通过触觉注释提示增强VLA对接触力的感知能力。解决VLA“盲触”痛点,提供融合触觉模态的具体工程方案,适用于精细操作场景。
Hao Wang et al. · 将不安全行为模式蒸馏进策略权重,无需推理时引导即可避免危险动作。为提升BC策略安全性提供新训练范式,代码若开源极具复用价值。
Zhihao Liu et al. · 提出自监督时间集成优势建模,从混合质量数据中提取帧级优势信号。为离线RL精调VLA提供鲁棒的数据过滤机制,直接提升样本效率。
Siyao Chen et al. · 基于置信度的测试时RL微调VLA,无需外部奖励信号。解决VLA部署时的分布外泛化问题,提供即插即用的在线适应模块。
Tengyue Jiang et al. · 引入状态感知Tokenize机制改善离散动作恢复精度。针对VLA动作量化误差提供具体改进方案,易于集成到现有Transformer架构中。
Yulin Zhou et al. · 引入全历史物理信息框架解决非马尔可夫长视界操作问题。弥补VLA短视窗口缺陷,为需要记忆依赖的任务提供新架构思路。
Austin Patel et al. · 将单个人体演示作为Prompt实现零样本新任务执行。赋予VLA即时适应能力,方法直观且具备极高的实际应用潜力和复用价值。
Haoyang Li et al. · 使用密集具身思维链监督训练VLA,显式建模高层认知过程。提升跨具身迁移能力,为VLA的可解释性和逻辑推理提供新训练目标。
Bryce Grant et al. · 提出SPARK神经符号系统,在无训练情况下超越VLA基线。为LIBERO等基准提供高效替代方案,适合资源受限或需高可靠性的场景。
Jiaxin Liu et al. · 融合事件相机数据增强VLA在光照变化下的鲁棒性。针对极端视觉条件提供多模态输入方案,扩展VLA在动态环境中的适用边界。
Guo Ye et al. · DreamTacVLA通过想象未来触觉反馈解决接触丰富操作难题。填补VLA触觉盲区,提供预测性触觉建模的新范式,极具前沿性。
Zhennan Jiang et al. · 利用世界模型作为模拟器进行VLA的RL后训练。解决真实世界RL数据稀缺瓶颈,提供低成本策略精调路径,工程实用性强。
Pengfei Ye et al. · 仅凭单次触觉接触估计6-DoF位姿,填补触觉感知空白。虽属触觉VLA相邻领域,但侧重感知而非端到端控制策略。
Shuai Zhou et al. · 针对杂乱环境中多机器人协作的长视界规划方法。侧重传统规划算法优化,缺乏VLA语义理解或大模型介入,属于经典机器人学范畴。
Ze Huang et al. · 通过动作条件世界模型学习可迁移动力学先验。虽涉及世界模型这一热点,但摘要未明确展示其在VLA决策中的具体应用或性能增益。
Juyi Sheng et al. · 利用无动作的人类视频提取结果规律以辅助模仿学习。方法新颖但依赖特定假设,且未明确说明如何转化为VLA可执行的行动指令。
Haoxu Huang et al. · 提出临界区间MSE指标用于离线策略验证。作为评估工具重要,但不改变VLA训练或推理架构,属于方法论补充。
Iok Tong Lei et al. · 结合空间姿态记忆与流匹配生成高频动作。标题堆砌概念,摘要未清晰阐述相比现有VLA架构的核心突破,疑似工程拼接。 [💧灌水]
Paul Mattes et al. · 构建结构化图像表示以提升策略可解释性。侧重视觉表征分析,未直接涉及VLA的动作生成或多模态对齐核心机制。
Heecheol Kim et al. · 基于单次演示的接触中心Sim2Real方法。侧重仿真参数校准与接触物理,虽有用但非VLA主流架构创新,属于特定场景优化。
Ritwik Sharma et al. · 利用人类运动先验实现跨形态机器人学习。主要面向足式/人形机器人底层控制,与桌面操作VLA关联度较低。
Mathilde Hochedel et al. · 在UR5平台上复现并分析VLA模型的真实性能。提供宝贵的工程落地洞见和失败案例,但无新算法贡献,属经验总结类论文。
Longyu Chen et al. · 构建视觉与参数空间协同的世界模型以评估VLA。侧重仿真器一致性,作为评估工具重要,但未直接推动VLA本体性能提升。
Tianyu Xu et al. · 多视角VLA导航模型。侧重移动机器人导航而非机械臂操作,虽冠以VLA之名,但与当前主流Manipulation VLA研究方向存在偏差。
Mengyuan Liu et al. · 细粒度执行质量评估指标。完善VLA评估体系,但属于度量标准而非算法改进,对日常研发直接影响有限。
Brian Y. Tsui et al. · 纯LLM Agent控制机器人无需演示。虽有趣但缺乏VLA的视觉 grounding 和低级控制闭环,更多是高层规划探索,非核心VLA进展。
Esteban Padilla-Cerdio et al. · arXiv:2603.05377v3 Announce Type: replace Abstract: Open-world navigation requires robots to make decisions in complex everyday environments while adapting to flexible task requirements. Conventional navigation approaches often rely on dense 3D reconstruction and hand-crafted goal metrics, which limits their generalization across tasks and environments. Recent advances in vision-language navigation (VLN) and vision-language-action (VLA) models enable end-to-end policies conditioned on natural la