Skip to content
VLA 線 · DEEP DIVE ARCHIVEVLA 线 · DEEP DIVE ARCHIVE

VLA 深度追蹤VLA 深度追踪

Vision-Language-Action:讓機器人看→想→做的端到端模型Vision-Language-Action:让机器人看→想→做的端到端模型

METHOD FAMILY TRENDS

data thru 2026-09-10 · 850 papers · 53d window · 15 families
high
▼ 5 declining 15 families · 183 papers covered
FAMILY MOM 7d 14d 30d Δ7d Δ14d Δ30d CHART ST
Lang. Grounding 48 86 217 0.95x 0.77x 0.96x
World Model 40 75 187 0.86x 0.73x 1.22x
Long Horizon 17 32 71 0.85x 0.93x 1.07x
RL Fine-tuning 17 34 109 0.75x 0.49x 1.06x
Tactile 13 27 53 0.70x 0.84x 0.80x
Mobile Manip. 11 14 30 0.60x 0.44x 0.45x
Diffusion Policy 7 11 25 0.38x 0.34x 0.38x
Flow Matching 7 28 63 0.25x 0.84x 0.95x
Multi-Task 5 15 52 0.27x 0.42x 0.78x
Cross-Embodiment 4 5 16 0.22x 0.16x 0.24x
Sim-to-Real 4 7 18 0.22x 0.22x 0.27x
Dexterous Hand 3 7 27 0.16x 0.22x 0.41x
Human-Robot 3 14 39 0.16x 0.44x 0.52x
Instr. Tuning 3 4 6 0.16x 0.12x 0.09x
3D Repr. 1 3 14 0.05x 0.09x 0.21x
COMPETITION PAIRS 6 matchups · hover for details
VLA vs WAM
Paradigm war: end-to-end action prediction vs world model planning
Lang. Ground. vs World Model
55%
45%
5.7% · x0.95 ratio 1.20 4.7% · x0.86
Lang. Grounding

Language Grounding: connecting natural language instructions to robot actions; vision-language-action alignment

World Model

World Model: learned environment simulator (Dreamer, UniSim); enables planning via imagination without real-world interaction

Why they compete

The central paradigm war in embodied AI. VLA (Vision-Language-Action) maps observations directly to actions end-to-end — simple, scalable, but needs massive data and generalizes poorly. WAM (World-Action Model) first learns how the world works, then plans actions through mental simulation — better generalization and data efficiency, but world models are often inaccurate. The boundary is blurring: Pi0.5 uses flow matching (generative, WAM-like), GR00T adds video prediction. The winner likely is a hybrid.

ACTION HEAD ROUTE
Continuous action generation: denoising vs optimal transport
Diffusion Pol. vs Flow Matching
50%
50%
0.8% · x0.38 ratio 1.00 0.8% · x0.25
Diffusion Policy

Diffusion Policy: iterative denoising process (DDPM) to generate continuous robot actions; strong on multi-modal action distributions

Flow Matching

Flow Matching: optimal-transport-based generative model (e.g. Pi0); faster inference than diffusion with comparable quality

Why they compete

Both generate continuous actions from the same VLA backbone but take different mathematical routes: diffusion iteratively denoises random noise into actions (slow, expressive), while flow matching uses optimal transport for a direct trajectory (fast, efficient). If flow matching matches diffusion quality, it could replace it as the default action head.

POST-TRAINING ROUTE
Model adaptation: supervised tuning vs reward optimization
Instr. Tuning vs RL Fine-tune
15%
85%
0.4% · x0.16 ratio 0.17 2.0% · x0.75
Instr. Tuning

Instruction Tuning: supervised fine-tuning (SFT) on language-action pairs; simpler but limited to offline data distribution

RL Fine-tuning

RL Fine-tuning: post-training with PPO/DPO/GRPO reward signals; enables online improvement beyond demonstration data

Why they compete

After pretraining a VLA, two competing strategies exist: SFT directly imitates expert demonstrations (simple, stable), while RL fine-tuning (GRPO/DPO) optimizes a reward signal to go beyond the demonstration distribution. RL can discover novel strategies but is harder to stabilize.

LEARNING SIGNAL
Training paradigm: imagination-based vs reward-based
World Model vs RL Fine-tune
70%
30%
4.7% · x0.86 ratio 2.35 2.0% · x0.75
World Model

World Model: learned environment simulator (Dreamer, UniSim); enables planning via imagination without real-world interaction

RL Fine-tuning

RL Fine-tuning: post-training with PPO/DPO/GRPO reward signals; enables online improvement beyond demonstration data

Why they compete

World models learn by predicting the future (imagination-based planning), while RL learns from reward feedback. If world models become accurate enough, they could reduce the need for expensive real-world RL exploration.

MANIPULATION SENSING
Manipulation approach: tactile feedback vs dexterous control
Tactile vs Dext. Hand
81%
19%
1.5% · x0.70 ratio 4.37 0.4% · x0.16
Tactile

Tactile Sensing: force/torque and GelSight contact sensors; provides direct manipulation feedback for delicate tasks

Dexterous Hand

Dexterous Hand: multi-finger manipulation control; achieves fine-grained object interaction without dedicated sensors

Why they compete

Two approaches to dexterous manipulation: tactile sensing adds explicit touch feedback (hardware cost, rich signal), while dexterous hand control relies on proprioception and vision alone (simpler hardware, harder control). The winner depends on sensor cost-to-performance ratio.

TRANSFER APPROACH
Domain bridging: simulation transfer vs cross-embodiment
Sim2Real vs Cross-Embod.
50%
50%
0.5% · x0.22 ratio 1.00 0.5% · x0.22
Sim-to-Real

Sim-to-Real: train in simulation, deploy on real hardware; uses domain randomization to bridge the reality gap

Cross-Embodiment

Cross-Embodiment: transfer policies across different robot morphologies; aims for universal robot foundation models

Why they compete

Sim-to-Real trains one robot in simulation then transfers (cheap data, reality gap risk), while Cross-Embodiment trains across multiple real robots directly (expensive data, natural generalization). The approaches represent different bets on where generalization should happen.

EMERGING SIGNALS

2026-09-10 · 86/213 unmatched · 7d window
15 signals
TERM COUNT AGE VELOCITY STATUS SAMPLE
science robotics
37 26d - x-0.3 CANDIDATE ZEST: Zero-shot embodied skill transfer for athlet...
robotics volume
37 26d - x-0.3 CANDIDATE ZEST: Zero-shot embodied skill transfer for athlet...
volume issue
37 26d - x-0.3 CANDIDATE ZEST: Zero-shot embodied skill transfer for athlet...
issue august
37 26d - x-0.3 CANDIDATE ZEST: Zero-shot embodied skill transfer for athlet...
science robotics volume
37 26d - x-0.3 CANDIDATE ZEST: Zero-shot embodied skill transfer for athlet...
robotics volume issue
37 26d - x-0.3 CANDIDATE ZEST: Zero-shot embodied skill transfer for athlet...
volume issue august
37 26d - x-0.3 CANDIDATE ZEST: Zero-shot embodied skill transfer for athlet...
humanoid robots
21 22d -- x0.0 CANDIDATE Learning vision-driven reactive soccer skills for ...
physics filtering
12 6d ~ x0.0 CANDIDATE Physics filtering favors the generalization of rob...
filtering favors
12 6d ~ x0.0 CANDIDATE Physics filtering favors the generalization of rob...
favors generalization
12 6d ~ x0.0 CANDIDATE Physics filtering favors the generalization of rob...
generalization robot
12 6d ~ x0.0 CANDIDATE Physics filtering favors the generalization of rob...
physics filtering favors
12 6d ~ x0.0 CANDIDATE Physics filtering favors the generalization of rob...
filtering favors generalization
12 6d ~ x0.0 CANDIDATE Physics filtering favors the generalization of rob...
favors generalization robot
12 6d ~ x0.0 CANDIDATE Physics filtering favors the generalization of rob...

TOP INSTITUTIONS

30d window · 20 labs tracked · VLA domain
20 active / 30d
INSTITUTION TOTAL BEST LAST SEEN ACTIVITY
1 Shanghai Jiao Tong University 10 🔧 08-20
2 Stanford University 6 🔧 08-26
3 Harbin Institute of Technology 4 🔧 08-22
Stanford 9 08-30
Tsinghua University 5 🔧 09-05
LIBERO Team 7 🔧 09-05
The Hong Kong University of Science and Technology (Guangzhou) 6 🔧 08-13
Physical Intelligence 5 🔧 08-25
University of Science and Technology of China 4 🔧 09-09
HKU 4 🔧 08-13
UC San Diego 3 🔧 08-30
Fudan University 3 🔧 08-13
Robotics and AI Lab, Technological University of Uruguay 2 🔧 08-13
AI Robot Association (AIRoA) 2 🔧 08-13
The University of Sydney 2 🔧 08-13
The Chinese University of Hong Kong, Shenzhen 2 🔧 08-13
HHCM, Istituto Italiano di Tecnologia 2 🔧 08-13
Institute of Interdisciplinary Information Sciences at Tsinghua University 2 🔧 08-13
Department of Electrical and Computer Engineering, Seoul National University 2 🔧 08-13
J. Mike Walker ’66 Department of Mechanical Engineering, Texas A&M University 2 🔧 08-13

📐 理論文章庫📐 理论文章库

311 查看 GitHub 全庫查看 GitHub 全库
最近 2 週最近 2 周 30
昨天 vla core

知道何时停止:基于 VLA 内部交叉注意力动态的自适应动作分块 (Knowing When to Stop: Adaptive Action Chunking via Internal Cross-Attention Dynamics in VLAs)

在 GitHub 閱讀在 GitHub 阅读
昨天 vla core

RL-VLA³:面向 VLA 训练的灵活异步强化学习框架 (RL-VLA³: A Flexible and Asynchronous Reinforcement Learning Framework for VLA Training)

在 GitHub 閱讀在 GitHub 阅读
昨天 vla core

CF-VLA:高效粗到细动作生成 (CF-VLA: Efficient Coarse-to-Fine Action Generation for Vision-Language-Action Policies)

在 GitHub 閱讀在 GitHub 阅读
昨天 vla core

SCRIPT:面向语言驱动仿真人形控制的可扩展扩散策略 (Scalable Diffusion Policy with Multi-stage Training for Language-driven Physics-Based Humanoid Control)

在 GitHub 閱讀在 GitHub 阅读
昨天 vla core

什么在何时重要?诊断与改进视觉运动模仿策略中的条件视觉定位 (What Matters, When? Diagnosing and Improving Conditional Visual Grounding in Visuomotor Imitation Policies)

在 GitHub 閱讀在 GitHub 阅读
2 天前 tactile

TacPAC:世界-动作模型中的触觉预测与实时动作修正 (Tactile Prediction and Real-Time Action Correction in World-Action Models for Contact-Rich Manipulation)

在 GitHub 閱讀在 GitHub 阅读
2 天前 vla core

CoFreeVLA:短时域无碰撞双臂操作通过VLA与风险估计 (CoFreeVLA: Short-Horizon Collision-Free Dual-Arm Manipulation via Vision-Language-Action Model and Risk Estimation)

在 GitHub 閱讀在 GitHub 阅读
3 天前 vla core

RoboTok:互联网规模的人类演示检索与灵巧操作学习数据引擎 (RoboTok: An Internet-Scale Data Engine for Human Demonstration Retrieval and Dexterous Manipulation Learning)

在 GitHub 閱讀在 GitHub 阅读
3 天前 vla core

WISE:世界模型指导想象调度实现高效 VLA 后训练 (World-model-guided Imagination Scheduling for Efficient Post-training of Vision-Language-Action Models)

在 GitHub 閱讀在 GitHub 阅读
3 天前 vla core

从离散思维到连续动作:隐式对齐的端到端自动驾驶 (Continuous Actions from Discrete Minds: Latent-Aligned Planning for End-to-End Autonomous Driving)

在 GitHub 閱讀在 GitHub 阅读
3 天前 vla core

GIFT:通过动作导向的结构化监督引导中间特征训练 (Guided Intermediate Feature Training via Action-Oriented Structural Supervision for Robotic Manipulation)

在 GitHub 閱讀在 GitHub 阅读
3 天前 foundation

从离散思维到连续动作:隐式对齐规划用于端到端自动驾驶 (Continuous Actions from Discrete Minds: Latent-Aligned Planning for End-to-End Autonomous Driving)

在 GitHub 閱讀在 GitHub 阅读
3 天前 foundation

RoboTok:互联网规模的人类演示检索与灵巧操作学习 (RoboTok: An Internet-Scale Data Engine for Human Demonstration Retrieval and Dexterous Manipulation Learning)

在 GitHub 閱讀在 GitHub 阅读
4 天前 vla core

迈向统一机器人学习:桥接表示、VLA 与世界模型 (Toward Unified Robot Learning: Bridging Representation, Vision-Language-Action, and World Models)

在 GitHub 閱讀在 GitHub 阅读
4 天前 deployment

RoboTok:互联网规模演示检索引擎 (RoboTok: An Internet-Scale Data Engine for Human Demonstration Retrieval and Dexterous Manipulation Learning)

在 GitHub 閱讀在 GitHub 阅读
5 天前 tactile

FWBC-VLA: 力感知全身补偿用于接触丰富型移动操作 (Force-Aware Whole-Body Compensation for Contact-Rich Loco-Manipulation)

在 GitHub 閱讀在 GitHub 阅读
6 天前 vla core

从 1,500 小时演示到在线纠正:双臂家务操作规模化 (Scaling Bimanual Household Manipulation from 1,500 hours of Demonstrations to On-Policy Corrections)

在 GitHub 閱讀在 GitHub 阅读
6 天前 vla core

R2S-Eval:基于 VLM 偏好评估的真实到仿真校准机器人评测框架 (R2S-Eval: Robot Evaluation with Real-to-Sim Calibration via Vision-Language Models)

在 GitHub 閱讀在 GitHub 阅读
6 天前 vla core

FailBench:VLM 判断机器人任务成败有多可靠?(FailBench: How Reliable are VLMs at Judging Robot Task Success?)

在 GitHub 閱讀在 GitHub 阅读
12 天前 vla core

FlashVLA:流式动作解码实现高速异步 VLA 推理 (Streaming Action Decoding for Fast and Asynchronous VLA Inference)

在 GitHub 閱讀在 GitHub 阅读
12 天前 vla core

TemporalFlow-VLA:学习物理接地的执行历史以支持长时程机器人操作 (TemporalFlow-VLA: Learning Physically Grounded Execution History for Long-Horizon Robot Manipulation)

在 GitHub 閱讀在 GitHub 阅读
12 天前 vla core

Riemann-1.0:面向物理 AI 的具身世界动作模型 (Riemann-1.0: An Embodied World Action Model for Physical AI)

在 GitHub 閱讀在 GitHub 阅读
13 天前 vla core

多臂协作的VLA:原子动作分配与组合泛化 (MA-VLA: Multi-Arm Vision-Language-Action Model for Collaboration and Compositional Generalization)

在 GitHub 閱讀在 GitHub 阅读
13 天前 tactile

TacForcing:执行时触觉反馈的流式动作生成 (TacForcing: Streaming Action Generation with Execution-Time Tactile Feedback)

在 GitHub 閱讀在 GitHub 阅读
13 天前 vla core

通过自适应视觉 Token 缓存加速 VLA 模型 (Learning to Accelerate Vision-Language-Action Models through Adaptive Visual Token Caching)

在 GitHub 閱讀在 GitHub 阅读
13 天前 vla core

一个策略,多种形态:统一相机中心动作几何预训练用于异构具身操作 (One Policy, Many Embodiments: Unified Camera-Centric Action Geometry Pre-training for Heterogeneous Embodied Manipulation)

在 GitHub 閱讀在 GitHub 阅读
14 天前 vla core

DreamTrajectory:基于轨迹引导与世界模型对齐的移动操作 VLA (DreamTrajectory: Trajectory-Guided Action Generation with World Model Alignment for Mobile Manipulation)

在 GitHub 閱讀在 GitHub 阅读
14 天前 vla core

GlanceWAM:稀疏测试时想象用于世界-动作模型 (GlanceWAM: Sparse Test-Time Imagination for World-Action Models)

在 GitHub 閱讀在 GitHub 阅读
更多文章 · 全部在 GitHub更多文章 · 全部在 GitHub 281
🏛️ VLA Core  ·  136
超越视角泛化:多视角演示为机器人操作提供了什么,以及如何合成它们 (Beyond Viewpoint Generalization: What Multi-View Demonstrations Offer and How to Synthesize Them for Robot Manipulation?) 按需思考:选择性慢路径干预的 Prompt-Authority 控制 (Think Only When Needed: Prompt-Authority Control for Selective Slow-Path Intervention in Vision-Language-Action Manipulation) LaGEA:语言引导的具身智能体用于机器人操作 (Language Guided Embodied Agents for Robotic Manipulation) 面向工业机器人的延迟感知视觉运动策略学习框架 (A Latency-Aware Framework for Visuomotor Policy Learning on Industrial Robots) CertVLA:面向 VLA 的物理视觉攻击可认证防御 (CertVLA: Certified Defense against Physical Visual Attacks for Vision-Language-Action Models) ForeTime-VLA:从世界动作模型蒸馏因果未来Token到VLA (ForeTime-VLA: Causal Future-Token Distillation from a World Action Model for Conveyor-Belt Manipulation) 最小可觉差建模用于 VLA Token 压缩 (Just Noticeable Difference Modeling for Token Compression in Vision-Language-Action Models) HBVLA:将 VLA 模型推向 1-Bit 后训练量化 (Pushing 1-Bit Post-Training Quantization for Vision-Language-Action Models) 手物交互多视角联合生成:HarmoHOI (Harmonizing Appearance and 3D Motion for Multi-view Hand-Object Interaction Synthesis) EATR-Stereo:具身感知令牌路由的立体视觉人形 VLA 控制 (EATR-Stereo: Embodiment-Aware Token Routing of Paired Stereo Evidence for Humanoid Vision-Language-Action Control) MPCoT:奖励引导多路径潜在推理实现 VLA 测试时扩展 (MPCoT: Reward-Guided Multi-Path Latent Reasoning for Test-Time Scalable Vision-Language-Action) 用运动学路由,用观察执行:MoE 增强 VLA 中的运动学监督专家路由 (Route by Kinematics, Act by Observation: Kinematics-Supervised Expert Routing in MoE-Augmented VLA) GS-VLA:即插即用视点规范化 (GS-VLA: Plug-and-Play Viewpoint Canonicalization for Frozen VLA Policies via Gaussian Splatting) 反事实行为克隆:从不完美人类演示中进行离线模仿学习 (Counterfactual Behavior Cloning: Offline Imitation Learning from Imperfect Human Demonstrations) 别掉棒:基于代理子任务探索与过渡感知记忆的长视界机器人操作 (Don't Drop the BATON: Long-Horizon Robot Manipulation via Agentic Subtask Exploration and Transition-aware Memory) NebulaVLA: 双频率视觉-语言-动作模型 (NebulaVLA: A Dual-Frequency Vision-Language-Action Model With Guide Action for Robotic Manipulation) Zetta ζ:高效闭环具身 Harness 实现物理智能自我进化 (Zetta ζ: An Efficient Closed-Loop Embodied Harness for Self-Evolving Physical Intelligence) ForgeWM:渐进因果训练实现少步动作条件视频世界模型 (ForgeWM: Progressive Causal Training for Few-Step Action-Conditioned Video World Models) Reflex: 面向反应关键型操作的快速预测 VLA (Reflex: Enabling Fast and Predictive Vision-Language-Action Models for Reaction-Critical Manipulation) 基于本体 grounding 的世界模型:物理 AI 系统的故障诊断与闭环修复 (Ontology-Grounded World Models for Failure Diagnosis and Closed-Loop Repair in Physical AI Systems) StageWAM:联合嵌入阶段预测的世界-动作模型 (StageWAM: Joint-Embedding Stage Prediction for World-Action Models in Robot Manipulation) 轨迹优先:发现多样化策略的课程学习 (Trajectory First: A Curriculum for Discovering Diverse Policies) DreamX-Phi 1.0:用于机器人操作的行动条件视频世界模型 (DreamX-Phi 1.0: Action-Conditioned Video World Model for Robotic Manipulation) SEAR:样本高效动作分块强化学习 (Sample Efficient Action Chunking Reinforcement Learning) 从 VLA 表征中解码任务进度 (Decoding Task Progress from VLA Representations) 接触前执行监控:基于动作条件潜在世界模型的 VLA 安全卫士 (ContactGuard: Pre-Contact Execution Monitoring with Action-Conditioned Latent World Models) SpatialVAM: Spatial-Aware Multi-View Video Diffusion as a Data-Efficient Robot Policy (SpatialVAM: Spatial-Aware Multi-View Video Diffusion as a Data-Efficient Robot Policy) 学习真实杂乱场景中的接触表示以实现通用机器人抓取 (Learning Contact Representations in Real-World Clutter for Universal Robotic Grasping) UniTexture:跨任务通用对抗纹理攻击 VLA 模型 (UniTexture: Cross-Task Universal Adversarial Textures for Vision-Language-Action Models) RLinf-VLA:VLA 强化学习的统一高效框架 (RLinf-VLA: A Unified and Efficient Framework for Reinforcement Learning of Vision-Language-Action Models) MuseVLA:自适应多模态感知视觉-语言-动作模型 (MuseVLA: An Adaptive Multimodal Sensing Vision-Language-Action Model for Robotic Manipulation) HoloQ-VLA:均匀 W4A4 量化视觉-语言-动作模型 (HoloQ-VLA: Uniform W4A4 Quantization of Vision-Language-Action Models) 从恢复到崩塌:动作后训练如何削弱 VLM 的深层深度可解码性 (From Recovery to Drop-off: How Action Post-training Reduces a VLM's Late-Layer Depth Decodability) 隐于无形:基于扩散模型的无限制 VLA 机器人攻击 (Hidden in Plain Sight: Diffusion-Based Unrestricted Robotic Attacks on Vision-Language-Action Models) VLA 持续学习:真实世界数据下的抗遗忘实证研究 (Can Vision-Language-Action Models Learn from Real-World Data Continually without Forgetting?) REMAC:自反思与自进化的多智能体协作长程机器人操作 (Self-Reflective and Self-Evolving Multi-Agent Collaboration for Long-Horizon Robot Manipulation) EchoVLA:协同声明式记忆赋能移动操作 (EchoVLA: Robotic Vision-Language-Action Model with Synergistic Declarative Memory for Mobile Manipulation) 按时检索,频域校正:冻结 VLA 的免训练测试时修正框架 (Retrieve in Time, Correct in Frequency) TEMPO:语义-动作解耦的 RL 后训练框架 (TEMPO: Semantic-Action Decoupled RL Post-Training for Vision-Language-Action Models) 以预言强化动作策略 (Reinforcing Action Policies by Prophesying) DFM-VLA:基于离散流匹配的迭代动作细化 (DFM-VLA: Iterative Action Refinement for Robot Manipulation via Discrete Flow Matching) 流匹配不确定性的几何本质:零成本不确定性代理及其在流式 VLA 失败检测中的应用 (The Geometry of Flow-Matching Uncertainty: A Cost-free Uncertainty Proxy and Its Application in Flow-based VLA Failure Detection) PhyLatent:为 JEPA 世界模型学习动力学相关表示 (PhyLatent: Learning Dynamics-Relevant Representations for JEPA World Models) WorldCycle:自验证强化学习用于长视界视频世界模型 (WorldCycle: Self-Verifiable Reinforcement Learning for Long-Horizon Video World Models) 克服动作可控世界模型中的统计偏差 (Overcoming Statistical Bias in Action-Controllable World Models) Deltoris:通过比特级稀疏与推测解码实现 VLA 实时推理 (Deltoris: Enabling Real-time VLA Inference in Embodied AI via Bit-level Sparsity and Speculative Inference) VLAFlow: 通过共训练与未来潜在对齐统一 VLA 训练框架 (VLAFlow: A Unified Training Framework for Vision-Language-Action Models via Co-training and Future Latent Alignment) 统一视觉运动目标:超越物理动作的 VLA 监督 (Unified Visuomotor Targets: Supervising VLAs Beyond Physical Actions) 门控记忆策略:上下文记忆与自适应 (Gated Memory Policy: In-Context Memorization and Adaptation) LiLa-WAM:轻量级潜在推理世界-动作模型用于机器人操作 (Lightweight Latent Reasoning World-Action Model for Robotic Manipulation) 为什么动作分块能提升行为克隆的性能?(Why Does Action Chunking Improve Behavioral Cloning Performance in Robotic Control?) 看哪里才重要:VLA 自适应视觉细化 (Look Where It Matters: Adaptive Visual Refinement for Vision-Language-Action Models) ChainVLA:通过统一执行状态链式连接 VLA 查询以实现长视界操作 (ChainVLA: Chaining Vision-Language-Action Queries through a Unified Execution State for Long-Horizon Manipulation) 世界评论家模型:用世界建模赋能 VLA 强化学习 (WCM: A World Critic Model for Vision-Language-Action Reinforcement Learning) 通过屏障增强流匹配实现安全的视觉语言动作模型 (Safe Vision Language Action Models via Barrier Enhanced Flow Matching) VLA 动态执行承诺:A3 自适应动作接受机制 (Dynamic Execution Commitment of Vision-Language-Action Models) QuantWAMs:在世界动作模型上以正确粒度校准 (QuantWAMs: Calibrating at the Right Granularity for World Action Models) CycleVLA:通过子任务回溯与最小贝叶斯风险解码实现 VLA 主动自我修正 (CycleVLA: Proactive Self-Correcting Vision-Language-Action Models via Subtask Backtracking and Minimum Bayes Risk Decoding) CoTinyVLA:思维链蒸馏压缩 VLA 至十亿参数以下 (Chain-of-Thought Distillation for a Sub-Billion-Parameter Vision-Language-Action Model) 关闭人形 VLA 的闭环:持久化 3D 对象令牌用于可验证的移动操作 (Closing the Loop in Humanoid VLA: Persistent 3D Object Tokens for Verifiable Loco-Manipulation) XS-VLA: 粗粒度空间蒸馏 + 潜在流匹配的轻量级 VLA 控制 (XS-VLA: Coupling Coarse-grained Spatial Distillation with Latent Flow Matching for Lightweight Robotic Control) 机器人因子化解耦世界模型:通过机器人渲染实现动作条件化 (Robot-Factored World Models via Robot Rendering) 一只手注视另一只手:动态环境下的多智能体协作双臂操作 (One Hand Watches The Other: Dynamic Multi-Agent Cooperation for Sample-Efficient Bimanual Manipulation in Dynamic Environments) TOPReward:用 Token 概率作零样本奖励 (Token Probabilities as Hidden Zero-Shot Rewards for Robotics) 策略性扩展数据:通过偏差感知评估与数据采集学习机器人操作的组合泛化 (Scale Up Strategically: Learning Compositional Generalization via Bias-Aware Evaluation and Data Collection for Robotic Manipulation) GuidedAttention:可解释可纠正的视觉注意力,提升 OOD 鲁棒的模仿学习 (GuidedAttention: Interpretable and Correctable Visual Attention for OOD-Robust Robot Manipulation via Imitation Learning) 掩码视觉动作:统一世界建模的像素级控制接口 (Masked Visual Actions for Unified World Modeling) TempoVLA:學習速度可控的視覺語言動作策略 (TempoVLA: Learning Speed-Controllable Vision-Language-Action Policies) Q-VGM: 基于 Q 值梯度匹配的 Flow-Matching VLA 离线强化学习 (Q-VGM: Q-Value-Gradient Matching for Off-Policy Reinforcement Learning of Flow-Matching VLA) 组合扩散与引导搜索用于长程规划 (Compositional Diffusion with Guided Search for Long-Horizon Planning) SoMA:面向软体机器人操作的 Real-to-Sim 神经模拟器 (SoMA: A Real-to-Sim Neural Simulator for Robotic Soft-body Manipulation) RhinoVLA 技术报告 (RhinoVLA Technical Report) 二分扩散策略优化 (Dichotomous Diffusion Policy Optimization) RoboTTT:通过测试时训练将 VLA 上下文扩展至 8K 时间步 (RoboTTT: Context Scaling for Robot Policies) DriftWorld:通过漂移实现快速世界模型 (DriftWorld: Fast World Modeling through Drifting) 迈向类人物理智能:面向机器人操作的终身视觉-语言-动作学习 (Towards Human-like Physical Intelligence: Lifelong Vision-Language-Action Learning for Robotic Manipulation) AeroAct: 动作中心世界-动作模型用于语言条件四旋翼飞行 (AeroAct: Action-Centered World-Action Models for Language-Conditioned Quadrotor Flight) HELP:面向 VLA 后训练的人类高效流水线 (HELP: Human-Efficient Large-Scale Robot Post-Training with Rollout Segmentation) UniSteer:统一噪声引导的高效人类指导 VLA 自适应 (UniSteer: Unified Noise Steering for Efficient Human-Guided VLA Adaptation) 诊断 Agent 编排 VLA 技能组合中的语义交接失败 (Diagnosing Semantic Handoff Failures in Agent-Orchestrated Vision-Language-Action Skill Composition) Harness VLA:通过记忆引导代理将冻结 VLA 转化为可靠操作原语 (Harness VLA: Steering Frozen VLAs into Reliable Manipulation Primitives via Memory-Guided Agents) DenseReward:通过失败合成实现密集奖励学习 (DenseReward: Dense Reward Learning via Failure Synthesis for Robotic Manipulation) 混合帧策略:双臂移动操作的多帧动作去噪 (Mixture of Frames Policy: Multi-Frame Action Denoising for Bimanual Mobile Manipulation) RoboStream:在视觉语言模型中编织时空推理与记忆 (RoboStream: Weaving Spatio-Temporal Reasoning with Memory in Vision-Language Models for Robotics) SeFA-Policy:选择性流对齐视觉运动策略 (SeFA-Policy: Fast and Accurate Visuomotor Policy Learning with Selective Flow Alignment) 第一人称视频语言模型能否同时捕捉手部和物体中心线索?(Do Egocentric Video-Language Models Capture Both Hand- and Object-Centric Cues?) V-VLAPS:价值引导的 VLA 规划 (Value-Guided Planning for Vision-Language-Action Models) 紧凑世界模型中的空间关系 Grounding:指令泄漏与无目标动力学修复 (Grounding Spatial Relations in a Compact World Model: Instruction Leakage and a Goal-Free Dynamics Fix) X-Foresight:通过预测世界模型实现视觉-动作联合因果预测网络 (X-Foresight: A Joint Vision-Action Causal Forecasting Network via Predictive World Modeling) FailSafe:VLA 模型的失败推理与恢复系统 (FailSafe: Reasoning and Recovery from Failures in Vision-Language-Action Models) Lift3D-VLA:将 VLA 模型提升至 3D 几何与动力学感知操作 (Lift3D-VLA: Lifting VLA Models to 3D Geometry and Dynamics-Aware Manipulation) SEAM:动作块平滑执行 (Smooth Execution of Action-Chunked Motion for Vision-Language-Action Policies) 学习语义原子技能用于多任务机器人操作 (Learning Semantic Atomic Skills for Multi-Task Robotic Manipulation) 传输差异作为 VLA 模型的可靠性信号 (Transport Discrepancy as a Reliability Signal for Vision-Language-Action Models) 通过免训练注意力重校准恢复 VLA 模型的语言 grounding (Restoring Linguistic Grounding in VLA Models via Train-Free Attention Recalibration) 运动聚焦潜在动作实现跨具身 VLA 人类视频训练 (Motion-Focused Latent Action Enables Cross-Embodiment VLA Training from Human EgoVideos) VLSA: 即插即用安全约束层的 VLA 模型 (VLSA: Vision-Language-Action Models with Plug-and-Play Safety Constraint Layer) 解耦视频生成世界模型 (DVG-WM: Disentangled Video Generation Enables Efficient Embodied World Model for Robotic Manipulation) 人即人形:从主客体人类视频中零样本学习人形机器人控制 (Human-as-Humanoid: Enabling Zero-Shot Humanoid Learning from Ego-Exo Human Videos with Human-Aligned Embodiments) 通过锚定机器人关键点的序列规划 (Sequential Planning via Anchored Robotic Keypoints — SPARK) 行为提示策略:用单条演示作为操作任务的 Prompt (Behavior Prompting Policy: Demonstrations as Prompts for Manipulation) RouterVLA:将烟雾测试转化为异构 VLA 选择的监督信号 (RouterVLA: Turning Smoke Tests into Supervision for Heterogeneous VLA Selection) Flow Matching 策略的 RL 精调:用 CFM 损失差分替代似然比 (Reinforcement Fine-Tuning of Flow-Matching Policies for Vision-Language-Action Models) TIDAL:时间交错扩散与动作循环实现高频 VLA 控制 (TIDAL: Temporally Interleaved Diffusion and Action Loop for High-Frequency VLA Control) 无接触,无担忧:通过视觉和本体感估计灵巧操作中的接触力 (NoContactNoWorries: Estimating Contact through Vision and Proprioception for In-Hand Dexterous Manipulation) CoRDE:概念先验路由扩散专家 (Concept-Prior Routed Diffusion Experts for Structural Generalization in Robot Manipulation) Wh0: 用生成式世界模型合成第一人称手部操作数据 (Wh0: Generative World Models as Scalable Sources of Egocentric Human Hand Manipulation Data) VQActFlow:向量量化動作流的多任務機器人操控 (VQActFlow: Vector-Quantized Action Mode Steering for Multi-Task Robot Manipulation) 用接地潜在动作世界模型从异构演示中学习 (Imitation from Heterogeneous Demonstrations using Grounded Latent-Action World Models) Bring My Cup! Personalizing Vision-Language-Action Models with Visual Attentive Prompting (Bring My Cup! Personalizing Vision-Language-Action Models with Visual Attentive Prompting) Mix-QVLA:任务证据感知的 VLA 混合精度量化 (Mix-QVLA: Task-Evidence-Aware Mixed-Precision Quantization of Vision-Language-Action Models) ImageWAM:世界动作模型真的需要视频生成吗?还是只需要图像编辑?(ImageWAM: Do World Action Models Really Need Video Generation, or Just Image Editing?) ENPIRE:真实世界中的具身智能体策略自改进 (ENPIRE: Agentic Robot Policy Self-Improvement in the Real World) 域自适应扩散策略 (Domain Adaptive Diffusion Policy) MemoryWAM:高效世界动作建模与持久记忆 (MemoryWAM: Efficient World Action Modeling with Persistent Memory) VLA 连常识都不知道了?测量视觉-语言-动作模型中的常识与世界知识保留 (Does VLA Even Know the Basics? Measuring Commonsense and World Knowledge Retention in Vision-Language-Action Models) 流匹配 VLA 的不确定性量化 (Uncertainty Quantification for Flow-Based Vision-Language-Action Models) GeneralVLA-2:几何感知重建与受控记忆驱动机器人规划 (GeneralVLA-2: Geometry-Aware Reconstruction and Governed Memory for Robot Planning) 检索替代微调:测试时扩展 VLA 至新任务 (Retrieve, Don't Retrain: Extending Vision Language Action Models to New Tasks at Test Time) LaWAM:隐空间世界动作模型 (Latent World Action Models for Efficient Dynamics-Aware Robot Policies) AcceRL:面向 VLA 的分布式异步强化学习与世界模型框架 (AcceRL: A Distributed Asynchronous Reinforcement Learning and World Model Framework for Vision-Language-Action Models) 力感知世界动作模型:闭环接触丰富操作 (FAWAM: Force-Aware World Action Models for Closed-Loop Contact-Rich Manipulation) EquiDexFlow:接触约束的 SE(3) 等变灵巧抓取生成流 (EquiDexFlow: Contact-Grounded SE(3)-Equivariant Dexterous Grasp Generative Flows) GAE: 用通用动作专家释放 VLM 的物理潜能 (Unleashing Physical Potential of VLM with Generalizable Action Expert) 利用共形预测从稀疏人类反馈中学习机器人安全 (Learning Robot Safety from Sparse Human Feedback using Conformal Prediction) 从数字到物理:数字智能体作为物理智能的自主教练 (From Digital to Physical: Digital Agents as Autonomous Coaches for Physical Intelligence) 具身可解释性:因果理解驱动 VLA 泛化 (Embodied Interpretability: Linking Causal Understanding to Generalization in Vision-Language-Action Models) World Pilot:用世界-动作先验引导 VLA 决策 (World Pilot: Steering Vision-Language-Action Models with World-Action Priors) 离散时间高斯过程混合物在机器人策略学习中的不合理有效性 (The Unreasonable Effectiveness of Discrete-Time Gaussian Process Mixtures for Robot Policy Learning) MIND-V:分层世界模型与RL物理对齐的长程机械操作 (MIND-V: Hierarchical World Model for Long-Horizon Robotic Manipulation with RL-based Physical Alignment) LIBERO-Occ:通过视点想象克服场景遮挡的 VLA 框架 (LIBERO-Occ: Evaluating and Improving Vision-Language-Action Models under Scene-Induced Occlusion via Viewpoint Imagination) ORCHID:分层扩散策略的在线自训练共适应 (Online Self-Training for Co-Adaptation in Hierarchical Diffusion Policies) 统一对象中心世界模型与扩散策略:多阶段机器人任务的分层框架 (Unifying Object-Centric World Models and Diffusion Policy: A Hierarchical Framework for Multi-Stage Robotic Tasks) LARA:潜在动作表示对齐 (Latent Action Representation Alignment for Vision-Language-Action Models) AEGIS:物理 AI 的備份反射機制 (A Backup Reflex for Physical AI) 势函数引导的 Flow Matching 用于 VLA 策略优化 (Potential-Guided Flow Matching for Vision-Language-Action Policy Improvement)
🏗️ Foundation & Training  ·  48
部署中学习:面向通用机器人策略的车队级强化学习 (Learning While Deploying: Fleet-Scale Reinforcement Learning for Generalist Robot Policies) RoboEdit:将人类操作视频转化为可扩展机器人经验 (RoboEdit: Turning Human Manipulation Videos into Scalable Robot Experience) Hydra-0:基于动作流的通用世界模型与控制 (Hydra-0: Action Flow for Generalist World Modeling and Control) 动作-效应记忆预训练用于机器人操作 (Action-Effect Memory Pretraining for Robot Manipulation) τ₀-VLA:世界模型引导测试时计算的分层机器人基础模型 (τ₀-VLA: a Hierarchical Robot Foundation Model with World-Model-Guided Test-Time Computation) 机器人操作是视觉到几何的映射:视觉-几何骨干优于语言与视频模型 (Robotic Manipulation is Vision-to-Geometry Mapping: Vision-Geometry Backbones over Language and Video Models) Agentic Real2Sim:用视觉语言代理将真实机器人交互转化为可仿真数字孪生 动作 QFormer:动作监督下的结构化表征塑造 (Action QFormer: Structured Representation Shaping under Action Supervision in Vision-Language-Action Models) 主动式真实世界因子评估框架 (Active Real-World Factor-Based Evaluation for Generalist Robot Policies) RoboWorld:面向通用机器人策略评估的快速可靠神经仿真器 (RoboWorld: Fast and Reliable Neural Simulators for Generalist Robot Policy Evaluation) Embodied-R1.5:通过具身基础模型进化物理智能 (Embodied-R1.5: Evolving Physical Intelligence via Embodied Foundation Models) Embodied-R1.5: Evolving Physical Intelligence via Embodied Foundation Models (Embodied-R1.5: Evolving Physical Intelligence via Embodied Foundation Models) 扩散策略长上下文训练与评估深度拆解 (Training and Evaluating Diffusion Policies with Long Context Lengths) HiMoE-VLA:分层混合专家通用视觉-语言-动作策略 (Hierarchical Mixture-of-Experts for Generalist Vision-Language-Action Policies) StereoVLA:用立体视觉增强 VLA 的空间感知 (Enhancing Vision-Language-Action Models with Stereo Vision) LA4VLA:看不见也能行动——通过语言-动作预训练解耦VLA中的视觉依赖 (Learning to Act without Seeing via Language-Action Pretraining) WAM 自我回放:用世界模型生成伪轨迹实现持续模仿学习 (World Action Models Enable Continual Imitation Learning with Recurrent Generative Replays) 先学会玩,再学会装配:灵巧手 Play Pretraining 的关键设计因素 (Play2Perfect: What Matters in Dexterous Play Pretraining for Precise Assembly?) PAIWorld:多视图3D一致性世界基础模型 (PAIWorld: A 3D-Consistent World Foundation Model for Robotic Manipulation) 拿我的杯子!用视觉注意力提示个性化 VLA 模型 (Bring My Cup! Personalizing Vision-Language-Action Models with Visual Attentive Prompting) DeMaVLA:面向可变形物体操作的通用 VLA 基础模型 (DeMaVLA: A Vision-Language-Action Foundation Model for Generalizable Deformable Manipulation) WEAVER:更好的、更快的、更长的——面向机器人操作的高效世界模型 Mana:铰接工具的灵巧操作 (Dexterous Manipulation of Articulated Tools) 行为模式发现:微调多模态生成策略时防止模式坍塌 (Behavioral Mode Discovery for Fine-tuning Multimodal Generative Policies) LEGS:在高斯泼溅世界微调免遥操作 VLA 实现人形机器人全身操作 (LEGS: Fine-Tuning Teleop-Free VLAs for Humanoid Loco-manipulation in an Embodied Gaussian Splatting World) 离线语义引导的 VLA 策略高效蒸馏 (Offline Semantic Guidance for Efficient Vision-Language-Action Policy Distillation) OxyGen:面向多任务并行的 VLA 统一 KV Cache 管理 (Unified KV Cache Management for VLA Inference under Multi-Task Parallelism) 面向长寿机器人:通过强化微调实现 VLA 持续学习 (Towards Long-Lived Robots: Continual Learning VLA Models via Reinforcement Fine-Tuning) 在相机帧中统一机器人动作 (Unify Robot Actions in Camera Frame) UniJEPA:统一连续与离散表征学习的机器人策略 (UniJEPA: Enhancing Robot Policy via Unified Continuous and Discrete Representation Learning) MotionWAM:迈向实时人形机器人世界动作模型 (MotionWAM: Towards Foundation World Action Models for Real-Time Humanoid Loco-Manipulation) Instant-Fold:单演示驱动的柔性物体折叠学习 (Instant-Fold: In-Context Imitation Learning for Deformable Object Manipulation) SimuScene:从单图重建仿真就绪的组合 3D 场景 (SimuScene: Simulation-Ready Compositional 3D Scene Reconstruction from a Single Image) Dexterity-BEV: 对齐3D世界与动作以增强策略泛化 (Dexterity-BEV: Aligning 3D World and Actions for Generalizable Robot Policies Learning) CrossVLA: 跨范式后训练与推理优化 (Cross-Paradigm Post-Training and Inference Optimization for Vision-Language-Action Models) HEX:跨具身全身操控的类人对齐专家架构 (HEX: Humanoid-Aligned Experts for Cross-Embodiment Whole-Body Manipulation) 通过保守 SFT 保护流匹配 VLA 的基础能力 (Preserving Foundational Capabilities in Flow-Matching VLAs through Conservative SFT) 通过模仿生成视频实现机器人操作(Robotic Manipulation by Imitating Generated Videos Without Physical Demonstrations) RoboEval:机器人操作的结构化与可扩展评估 (RoboEval: Where Robotic Manipulation Meets Structured and Scalable Evaluation) CLAMP: 3D 多视图对比预训练用于机器人操作 (Contrastive Learning for 3D Multi-View Action-Conditioned Robotic Manipulation Pretraining) KERV:运动学校正推测解码用于具身 VLA 模型 (Kinematic-Rectified Speculative Decoding for Embodied VLA Models) 基于基础模型先验的强化学习:让具身智能体自主高效学习 (Reinforcement Learning with Foundation Priors: Let the Embodied Agent Efficiently Learn on Its Own) 人类数据是伪装成另一种形式的机器人数据:Danfei Xu 深度访谈(2026) 潜空间综述:语言模型的"原生思维空间"与具身智能的统一接口 免微调部署 VLA:即插即用推理时策略引导 (Towards Deploying VLA without Fine-Tuning: Plug-and-Play Inference-Time VLA Policy Steering via Embodied Evolutionary Diffusion) VLA 数据工程指南:从采集到训练的完整链路 StarVLA-α:简化视觉 - 语言 - 动作系统的强基线 (StarVLA-α: Reducing Complexity in Vision-Language-Action Systems) HY-Embodied-0.5:具身基础模型实战解析 (HY-Embodied-0.5: Embodied Foundation Models for Real-World Agents)
🔧 Deployment & Hardware  ·  27
Mana:铰接工具的灵巧操作 (Dexterous Manipulation of Articulated Tools) 手在环中:通过无缝手-臂干预改善 VLA 灵巧操作策略 (Hand-in-the-Loop: Improving VLA Policies for Dexterous Manipulation via Seamless Hand-Arm Intervention) 仅凭本体感知实现灵巧手内操作:本体感知 Transformer (Learning Robust Dexterous In-Hand Manipulation from Joint Sensors with Proprioceptive Transformer) MobileEgo Anywhere:用消费级手机采集长视界第一人称数据 (MobileEgo Anywhere: Open Infrastructure for long horizon egocentric data on commodity hardware) HANDFUL:资源感知的序列灵巧操作 (Sequential Grasp-Conditioned Dexterous Manipulation with Resource Awareness) RoboECC: VLA 模型的多因素感知云边协同部署框架 (RoboECC: Multi-Factor-Aware Edge-Cloud Collaborative Deployment for VLA Models) 无需微调部署 VLA:即插即用推理时策略引导 (Towards Deploying VLA without Fine-Tuning: Plug-and-Play Inference-Time VLA Policy Steering via Embodied Evolutionary Diffusion) DockAnywhere: 通过演示生成提升移动操作数据效率 (DockAnywhere: Data-Efficient Visuomotor Policy Learning for Mobile Manipulation via Novel Demonstration Generation) BLaDA:在 3DGS 场中桥接语言与功能性灵巧动作 (BLaDA: Bridging Language to Functional Dexterous Actions within 3DGS Fields) 迭代组合式数据生成用于机器人控制 (Iterative Compositional Data Generation for Robot Control) 🔧 部署与硬件 — 实战落地主线总纲 DexGrasp-Zero:形态对齐的零样本跨本体灵巧抓取策略 (DexGrasp-Zero: A Morphology-Aligned Policy for Zero-Shot Cross-Embodiment Dexterous Grasping) 中金人机系列05(灵巧手)→ VLA/控制/硬件的“可计算约束”框架(理论侧整理) 灵巧手机械学深度解析 (Dexterous Hand Mechanics) — 修订整合版 v2 机器人开可乐/发牌有多难?灵巧手:硬件路线 × 接触数学 × 数据金字塔(访谈摘录整理) EquiBim:双臂操作中的对称等变策略学习 (EquiBim: Learning Symmetry-Equivariant Policy for Bimanual Manipulation) GR-Dexter(ByteDance Seed):把 VLA 扩展到高自由度灵巧手的“硬件-数据-模型”全栈框架 抓取算法与仿真平台 (Grasp Algorithms & Simulation Platforms) House of Dextra: 灵巧手机器人形态 - 控制协同设计 (House of Dextra: Cross-embodied Co-design for Dexterous Hands) 产业视角:通用性与“元学习”路径(从一张路线图说起) Isaac Lab: GPU 加速的多模态机器人学习仿真框架 Lightning Grasp:Contact Field 驱动的超高速灵巧手抓取合成 (Lightning Grasp: Procedural Grasp Synthesis with Contact Fields) NVIDIA 的 AI 五层蛋糕:从能源到机器人应用的基础设施观 (AI Is a 5-Layer Cake) 英伟达物理 AI 的第一刀:为什么先砍向汽车 (Why NVIDIA's First Physical AI Wedge Hits Cars First) Physical Intelligence Layer:机器人基础模型 API 的产品化范式 (The Physical Intelligence Layer) RoboPocket:把“机器人博士”装进口袋的无本体即时策略迭代 (RoboPocket: Improve Robot Policies Instantly with Your Phone) 机械臂运动学、动力学与控制 (Robot Arm Kinematics, Dynamics & Control)
🧠 Planning & Reasoning  ·  19
LaST-R1: 通过自适应物理潜在推理强化机器人操作 (Reinforcing Robotic Manipulation via Adaptive Physical Latent Reasoning) MolmoAct2:面向真实世界部署的动作推理模型 (MolmoAct2: Action Reasoning Models for Real-world Deployment) TAIL-Safe:面向模仿学习策略的任务无关安全监控框架 用文字和图像思考:长程机器人操作的交错视觉-语言推理轨迹 (Thinking in Text and Images: Interleaved Vision-Language Reasoning Traces for Long-Horizon Robot Manipulation) VEGA:视觉编码器接地对齐实现空间感知 VLA (VEGA: Visual Encoder Grounding Alignment for Spatially-Aware Vision-Language-Action Models) 弹性视觉智能体的架构模式语言 (A Pattern Language for Resilient Visual Agents) DeepThinkVLA:增强视觉-语言-动作模型的推理能力 (DeepThinkVLA: Enhancing Reasoning Capability of Vision-Language-Action Models) dWorldEval:基于离散扩散世界模型的-scalable 机器人策略评估 (Scalable Robotic Policy Evaluation via Discrete Diffusion World Model) 行为克隆策略有多脆弱?通用对抗扰动攻击现代BC策略 (How Vulnerable Is My Learned Policy? Universal Adversarial Perturbation Attacks On Modern Behavior Cloning Policies) 长视界操作:轨迹条件化 VLA 规划 (Long-Horizon Manipulation via Trace-Conditioned VLA Planning) 长程记忆赋能 VLA 智能体在开放世界任务执行 (Long-Term Memory for VLA-based Agents in Open-World Task Execution) PRTS:基于对比表示的基元推理与任务系统 (PRTS: A Primitive Reasoning and Tasking System via Contrastive Representations) RAM:給 VLM 外掛一本可檢索的「三維物體知識庫」 (Retrieval-Augmented Manipulation: VLM Spatial Awareness for Object-Centric Robot Manipulation) CodeGraphVLP:當 VLA 不再假設「看當下就夠」(Code-as-Planner Meets Semantic-Graph State for Non-Markovian VLA) ManiDreams:把「預測模糊」顯式建模的不確定性感知操縱規劃框架 (Dream it. Predict it. Constrain it.) 分层时空动作分词器:上下文模仿学习的新范式 (HiST-AT: A Hierarchical Spatiotemporal Action Tokenizer for In-Context Imitation Learning) HazardArena:评估 VLA 模型的语义安全 (HazardArena: Evaluating Semantic Safety in Vision-Language-Action Models) Orion-Lite:将 LLM 推理能力蒸馏至高效纯视觉驾驶模型 (Orion-Lite: Distilling LLM Reasoning into Efficient Vision-Only Driving Models) 可证明概率安全:具身 AI 系统的大规模部署新范式 (Towards Provable Probabilistic Safety for Scalable Embodied AI Systems)
🤚 Tactile Perception  ·  14
VT-MUSE:多模态统一序列视觉触觉表征学习 (VT-MUSE: Multimodal Unified Sequential Visuotactile Representation Learning for Manipulation) 通过瓶颈潜重构实现无需触觉仿真的 Sim2Real (Tactile Sim2Real without Tactile Simulation via Bottlenecked Latent Reconstruction) ReTouch: 在线精炼触觉预测赋能接触密集型灵巧操作 (Empowering Contact-Rich Dexterous Manipulation with Online-Refined Tactile Prediction) τ: 从未来视觉监督学习触觉增强 VLA 模型 (Learning Touch-Augmented Vision-Language-Action Models from Future Visual Supervision) 多视图统一相机场:面向几何感知动作表征的 RGB -only 多相机 VLA 策略 (Multi-View Unified Camera Fields: Geometry-Shaped Action-Facing Representations for RGB-Only Multi-Camera VLA Policies) ViTacWorld:可扩展视触觉世界模型用于接触丰富操作 (ViTacWorld: Scaling Visuo-Tactile World Models for Contact-Rich Robot Manipulation) VPWEM: Non-Markovian Visuomotor Policy with Working and Episodic Memory (VPWEM: Non-Markovian Visuomotor Policy with Working and Episodic Memory) FELT:从视觉生成触觉信号用于视触操作 (Generating Tactile Signals from Vision for Visuo-Tactile Manipulation) TransDex:基于点云重建预训练的视触觉灵巧操作策略 (Pre-training Visuo-Tactile Policy with Point Cloud Reconstruction for Dexterous Manipulation of Transparent Objects) 在哪里触碰,如何接触:分层 RL-MPC 几何感知 Sim-to-Real 操作框架 (Where to Touch, How to Contact: A Hierarchical RL-MPC Framework for Geometry-Aware Sim-to-Real Manipulation) 安全感知视触觉基准:面向可变形物体的物理约束机器人操作 (SoftVTBench: A Safety-Aware Visuo-Tactile Benchmark for Physically Constrained Robotic Manipulation of Deformable Objects) 唤醒触觉!MLLM 中的掩码隔离触觉对齐学习 (Wake up for Touch! Mask-isolated Tactile Alignment Learning in MLLMs) Event-VLA:动作条件化事件融合实现光照鲁棒 VLA (Event-VLA: Action-Conditioned Event Fusion for Robust Vision-Language-Action Model) Mana: Dexterous Manipulation of Articulated Tools
🌊 Diffusion & Flow  ·  14
VLA 的 RL 精调突破:Flow Policy Optimization (FPO) 动作到动作流匹配 (Action-to-Action Flow Matching) AsyncVLA:异步流匹配视觉-语言-动作模型 (AsyncVLA: Asynchronous Flow Matching for Vision-Language-Action Models) 分块自适应缓存加速扩散策略 (Block-wise Adaptive Caching for Accelerating Diffusion Policy) DSSP:基于全历史编码的扩散状态空间策略 (Diffusion State Space Policy with Full-History Encoding) GeCO:时间无条件流匹配用于自适应鲁棒机器人控制 (Generative Control as Optimization: Time Unconditional Flow Matching for Adaptive and Robust Robotic Control) Hyper-DP3:频域感知的3D扩散策略轻量化重构 (Frequency-Aware Right-Sizing of 3D Diffusion Policies for Visuomotor Control) 噪声空间归因与分块边界伪影控制 (Noise-Space Attribution and Control of Chunk-Boundary Artifact) OMP:单步均值流策略与方向对齐 (One-step MeanFlow Policy with Directional Alignment) 集合监督扩散策略:通过修正学习动作分块扩散 (Set-Supervised Diffusion Policy: Learning Action-Chunking Diffusion through Corrections) STEP:时空一致性预测的热启动视觉运动策略 (Warm-Started Visuomotor Policies with Spatiotemporal Consistency Prediction) 力场流匹配:从单演示生成力觉数据学习 3D 顺应性策略 (Flow with the Force Field: Learning 3D Compliant Flow Matching Policies from Force and Demonstration-Guided Simulation Data) X-Diffusion: 跨具身人类演示训练扩散策略 (X-Diffusion: Training Diffusion Policies on Cross-Embodiment Human Demonstrations) SnapFlow:流匹配 VLA 的单步动作生成 (SnapFlow: One-Step Action Generation for Flow-Matching VLAs via Progressive Self-Distillation)
🔬 Frontier Research  ·  13
SpatialVAM: 空间感知多视图视频扩散作为数据高效的机器人策略 (Spatial-Aware Multi-View Video Diffusion as a Data-Efficient Robot Policy) 基于轨迹分割的人类高效大规模机器人后训练框架 (HELP: Human-Efficient Large-Scale Robot Post-Training with Rollout Segmentation) ENPIRE:真实世界中的具身智能体策略自进化 (ENPIRE: Agentic Robot Policy Self-Improvement in the Real World) GAE:释放 VLM 的物理潜能,以通用动作专家解耦推理与执行 (Unleashing Physical Potential of VLM with Generalizable Action Expert) cuRoboV2:高自由度机器人的动力学感知运动生成 (cuRoboV2: Dynamics-Aware Motion Generation with Depth-Fused Distance Fields for High-DoF Robots) 人工三元智能:生物启发的物理 AI 传感器优先架构 (Artificial Tripartite Intelligence: A Bio-Inspired, Sensor-First Architecture for Physical AI) IGen: 从开放世界图像可扩展生成机器人学习数据 (IGen: Scalable Data Generation for Robot Learning from Open-World Images) StaMo:从紧凑状态表示中涌现通用机器人运动 (StaMo: Unsupervised Learning of Generalizable Robot Motion from Compact State Representation) StaMo:从紧凑状态表示中涌现通用机器人运动 (StaMo: Unsupervised Learning of Generalizable Robot Motion from Compact State Representation) 用自由语言指令操控人形机器人:统一运动词汇的大型语言动作模型 (Commanding Humanoid by Free-form Language: A Large Language Action Model with Unified Motion Vocabulary) Déjà Vu:具身智能的经验反馈学习框架 (Dejavu: Towards Experience Feedback Learning for Embodied Intelligence) 你有一张金票:用单个噪声向量提升生成式机器人策略 (You've Got a Golden Ticket: Improving Generative Robot Policies With A Single Noise Vector) RoSHI: 野外便携式全身动捕套装 (RoSHI: A Versatile Robot-oriented Suit for Human Data In-the-Wild)

🏆 SOTA 排行SOTA 排行

Evo-SOTA 完整榜Evo-SOTA 完整榜 30
CALVIN ABCD-D 飽和饱和 avg_len
# Model Score vs Prev Date Paper
1 Xiaomi-Robotics-0 4.8 Flower VLA +0.13 2026-08-28 arxiv →
2 Xiaomi-Robotics-0 4.8 Flower VLA +0.13 2026-08-21 arxiv →
3 MMaDA-VLA 4.78 Xiaomi-Robotics-0 +0.03 2026-08-28 arxiv →
4 MMaDA-VLA 4.78 Xiaomi-Robotics-0 +0.03 2026-08-21 arxiv →
5 EDAR 4.75 NIAF +0.09 2026-08-28 arxiv →
6 EDAR 4.75 NIAF +0.09 2026-08-21 arxiv →
7 AVA-VLA 4.65 NIAF +0.18 2026-08-28 arxiv →
8 AVA-VLA 4.65 NIAF +0.18 2026-08-21 arxiv →
9 NS-VLA 4.56 AtomicVLA +0.29 2026-08-28 arxiv →
10 NS-VLA 4.56 AtomicVLA +0.29 2026-08-21 arxiv →
11 HiMoE-VLA 4.49 Flower VLA +0.14 2026-08-28 arxiv →
12 HiMoE-VLA 4.49 Flower VLA +0.14 2026-08-21 arxiv →
13 MCIL 1.82 2026-08-28 arxiv →
14 MCIL 1.82 2026-08-21 arxiv →
LIBERO standard-opensource 飽和饱和 average
# Model Score vs Prev Date Paper
1 LaST-R1 99.8 Abot-M0.5 +0.40 2026-08-28 arxiv →
2 PLD 99.17 NS-VLA +0.57 2026-08-28 arxiv →
3 PLD 99.17 NS-VLA +0.57 2026-08-21 arxiv →
4 PriorVLA 99.1 VLAFlow +0.00 2026-08-28 arxiv →
5 PriorVLA 99.1 VLAFlow +0.00 2026-08-21 arxiv →
LIBERO Plus standard-closed total
# Model Score vs Prev Date Paper
1 Qwen-RobotManip 91.4 CAC-VLA +1.90 2026-08-28 arxiv →
2 FabriMAE 86.8 ACoT-VLA +0.20 2026-09-05 arxiv →
3 ACoT-VLA 86.6 pi0.5 +0.90 2026-08-28 arxiv →
4 CorridorVLA 83.21 NS-VLA +3.81 2026-08-28 arxiv →
MetaWorld standard-opensource average
# Model Score vs Prev Date Paper
1 FabriVLA 90 SUREFlow +1.68 2026-08-28 arxiv →
2 MPI 86 iRe-VLA +3.00 2026-08-28 arxiv →
3 ALAM 85 EDAR +4.50 2026-08-28 arxiv →
RoboCasa-GR1-Tabletop standard-opensource avg_success_rate
# Model Score vs Prev Date Paper
1 WALA 75.2 DIAL +5.00 2026-08-28 arxiv →
2 ACE-Ego-0 72.8 PhysBrain 1.0 +8.30 2026-08-28 arxiv →
RoboChallenge standard-opensource score
# Model Score vs Prev Date Paper
1 DM0 72.25 Giga-Brain-0.1 +3.91 2026-08-28 arxiv →
2 StarVLA-alpha 54.5 2026-08-28 arxiv →