VLA 線 · Vision-Language-Action
VLA 研究日報VLA 研究日报
VISION-LANGUAGE-ACTION · cs.RO + cs.AI + cs.LG
Vision-Language-Action(VLA)機器人系統 — 整合 cs.RO、cs.AI、cs.LG 三條 arxiv 流。 重點追蹤 flow matching、世界模型、具身推理等前沿方向,每日 09:00 CST 由 Qwen3.5-Plus 自動評級Vision-Language-Action(VLA)机器人系统 — 整合 cs.RO、cs.AI、cs.LG 三条 arxiv 流。 重点追踪 flow matching、世界模型、具身推理等前沿方向,每日 09:00 CST 由 Qwen3.5-Plus 自动评级。
Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories
Open-AoE: An Open Egocentric Manipulation Dataset and Toolchain for Embodied Learning
HRIBench: Benchmarking Interaction-Centric Human-Robot Collaboration
FlowWAM: Optical Flow as a Unified Action Representation for World Action Models
EgoSteer: A Full-Stack System Towards Steerable Dexterous Manipulation from Egocentric Videos
FlowDAgger: Human-in-the-Loop Adaptation of Generative Robot Policies in Latent Space
LEEVLA: Seeing What Matters in Latent Environment Evolution for Vision-Language-Action
GeoProp: Grounding Robot State in Vision for Generalist Manipulation
Learning 4D Geometric Priors for Inference-Efficient World Action Models
Simple-to-Complex Structured Demonstrations for Vision-Language-Action Learning
High-resolution real-time mechanochromic tactile sensors
High-resolution real-time mechanochromic tactile sensors
Neuro-Symbolic Safety Guidance for Vision-Language-Action Models via Constrained Flow Matching
EmbodimentSemantic: A Spatial Scene-Graph Dataset and Benchmark for Vision-Language Models on Embodied Manipulation Trajectories
Position: Vision-Language-Action Models Cannot Be Verified to Perform Physical Reasoning
Human2Any: Human-to-Robot Transfer via Constraint-Aware Compositional Planning
Support-Constrained RL Enables Real-World Policy Improvement without Real-World Experience
Advancing Omnimodal Embodied Agents from Isolated Skills to Everyday Physical Autonomy
E-TTS: A New Embodied Test-Time Scaling Framework for Robotic Manipulation
Memory Retrieval in Visuomotor Policies for Long-Horizon Robot Control
Compact Object-Level Representations with Open-Vocabulary Understanding for Indoor Visual Relocalization
MemoryVAM: Integrating Memory into Video Action Model for Robot Manipulation
WorkBenchMark: A LEGO-Based Assembly Benchmark with an Assembly-by-Disassembly Baseline for the Smart Manufacturing League
Guava: An Effective and Universal Harness for Embodied Manipulation
ACE-Ego-0: Unifying Egocentric Human and Robotic Data for VLA Pretraining
$\mu_0$: A Scalable 3D Interaction-Trace World Model
$\mu_0$: A Scalable 3D Interaction-Trace World Model
MoVerse: Real-Time Video World Modeling with Panoramic Gaussian Scaffold
Learning to Assist: Collaborative VLAs for Implicit Human-Robot Collaboration
Making Foresight Actionable: Repurposing Representation Alignment in World Action Models
Beyond APIs: Probing the Limits of MLLMs in Physical Tool Use
VoLo: A Physical Orchestrator for Open-Vocabulary Long-Horizon Manipulation
Robots Need More than VLA and World Models
Let It Be Simple: One-Step Action Generation for Vision-Language-Action Models
VISTA: Vision-Grounded and Physics-Validated Adaptation of UMI data for VLA Training
See Less, Specify More: Visual Evidence Budgets for Generalizable VLAs
World-Task Factorization for Robot Learning
ELAN4D: Embodiment-Centric 4D Supervision for Vision-Language-Action Models via Plug-and-Play Adaptation
GEM: Generative Supervision Helps Embodied Intelligence
GEM: Generative Supervision Helps Embodied Intelligence
PhyPush: One Push is All You Need for Sensorless Physical Property Estimation with Physics-Guided Transformers
EXPO-FT: Sample-Efficient Reinforcement Learning Finetuning for Vision-Language-Action Models
Agentic-VLA: Efficient Online Adaptation for Vision-Language-Action Models
Bioinspired ionic thermoreceptors with anisotropic architecture for thermotactile perception in robots
Learning Structural Latent Points for Efficient Visual Representations in Robotic Manipulation
Learning Structural Latent Points for Efficient Visual Representations in Robotic Manipulation
Rethinking Muon Beyond Pretraining: Spectral Failures and High-Pass Remedies for VLA and RLVR
Key-Gram: Extensible World Knowledge for Embodied Manipulation
PhysBrain 1.0 Technical Report
SECOND-Grasp: Semantic Contact-guided Dexterous Grasping
StereoPolicy: Improving Robotic Manipulation Policies via Stereo Perception
StereoPolicy: Improving Robotic Manipulation Policies via Stereo Perception
BioProVLA-Agent: An Affordable, Protocol-Driven, Vision-Enhanced VLA-Enabled Embodied Multi-Agent System with Closed-Loop-Capable Reasoning for Biological Laboratory Manipulation
VLA-GSE: Boosting Parameter-Efficient Fine-Tuning in VLA with Generalized and Specialized Experts
From Pixels to Tokens: A Systematic Study of Latent Action Supervision for Vision-Language-Action Models