Scaling Bimanual Household Manipulation from 1,500 hours of Demonstrations to On-Policy Corrections
Jiafeng Xu et al. · 开源 1,500 小时双臂家庭操作演示数据,并给出从大规模人类演示扩展到 on-policy 纠正的训练流程,直接针对双臂灵巧操作的数据瓶颈。数据与流程本周即可用于双臂 VLA 训练。
Jiafeng Xu et al. · 开源 1,500 小时双臂家庭操作演示数据,并给出从大规模人类演示扩展到 on-policy 纠正的训练流程,直接针对双臂灵巧操作的数据瓶颈。数据与流程本周即可用于双臂 VLA 训练。
Howard Qian et al. · 构建互联网规模的演示检索数据引擎,从网络视频中抽取可迁移的人类操作演示用于灵巧操作学习,直接缓解真机数据稀缺问题。对做数据扩展的 VLA 团队本周可复用。
Zhi Cao et al. · 用视觉轨迹作为与具身无关的中间表示,统一机器人动作控制与视觉预测,为机器人世界模型提供更对齐的条件信号。适合做世界模型/策略联合建模的团队参考。
Jindou Jia et al. · npj Robotics 论文,主张在机器人学习中引入物理过滤以提升泛化;仅有标题信息,未见与 VLA 策略或数据的直接接口。
Sheeraz Athar et al. · 提出光纤驱动的气动夹爪,把触觉感知嵌入本体结构;属触觉硬件与传感设计,不含策略学习或 VLA 方法。
Anton Bredenbeck et al. · 用仿人手与柔性触觉受体实现空中接触式抓附停靠;面向飞行机器人接触控制,与操作 VLA 无直接关联。
Jean Pierre Sleiman et al. · Science Robotics 论文,提出零样本具身技能迁移用于高动态运动控制;面向运动技能而非操作策略学习。
Zhengyi Luo et al. · 通过大规模动作数据扩展实现自然人形全身控制;属 humanoid 运动控制,不含语言条件操作。
Yushi Wang et al. · 人形机器人的视觉驱动反应式足球技能学习,属动态运动技能与全身控制方向。
Josua Spisak et al. · 用婴儿床中的玩耍机器人研究感觉运动偶发学习,偏认知科学与发展心理学实验。
Qiayuan Liao et al. · 用引导扩散把动作跟踪扩展为多样化人形全身控制;属人形运动控制,可借鉴扩散生成思路但与 VLA 操作分离。
Mingshi Chi et al. · 面向人形机器人的会聚双目立体深度感知方法,属视觉感知模块。
Hae-Won Park · 观点/评论文章,讨论人形机器人从特技演示转向通用能力的行业转折点,非方法论文。
Yue Yang et al. · arXiv:2609.03142v1 Announce Type: new Abstract: Vision-Language-Action (VLA) policies fuse multimodal sensory inputs, but training on limited and homogeneous robot demonstrations encourages spurious inter-sensor correlations rather than task-relevant signal, a failure we term modality entanglement. Under real-world occlusions and distractors, this manifests as nuisance sensitivity to corruption of uninformative sensors and single-modality insufficiency when only one informative sensor remains in
Yidi Wang et al. · 用 VLM 做真机-仿真标定,为 VLA 策略提供低成本、可复现的真机评测流程;属评测工具链,不改变策略本身。
Shuning Zhang et al. · 空地协同视觉语言导航,UAV 提供鸟瞰图、UGV 提供第一视角,属具身导航而非操作策略。
Zaruhi Navasardyan et al. · 构建 2,197 条机器人失效检测基准,揭示 VLM 判定任务成败时的跨域泛化不足;可用于自动评测,但不涉及策略训练方法。
Chenhao Zhang et al. · arXiv:2609.03681v1 Announce Type: new Abstract: Post-training VLA policies typically rely on supervised fine-tuning with costly expert demonstrations or reinforcement learning with expensive and potentially unstable real-world exploration. World models offer a promising alternative by evaluating candidate behaviors through imagined futures, yet effective post-training requires more than accurate prediction: imagination must be scheduled where it is useful, bounded within reliable horizons, and t
Kohei Sendai et al. · 系统探究在 LIBERO 上求解操作任务所需的最小模型容量,证明极小网络即可达标,质疑十亿参数规模的必要性,适合作为模型规模取舍的参考。
Yutian Zhang et al. · 在 VLA 的语义动作生成与物理交互控制之间加入力感知全身补偿模块,面向接触密集的移动作业。
Shaunak A. Mehta et al. · 统一视角/综述文章,串联表征学习、VLA 与世界模型三条主线,适合作方向梳理而非方法复用。
Kangmai Hu et al. · 多模态扩散策略用于四足机器人复杂地形跑酷导航,属足式运动与导航,非操作 VLA。
Yupeng Zheng et al. · 通过面向动作的结构化监督训练中间特征,弥补 VLM 预训练与视觉预测目标缺失的物理/任务结构,可用于操作策略特征正则。
Sadman Sakib et al. · 为建筑工地机器人构建工人活动分类体系,用于把 VLA 能力映射到具体施工任务,属任务分析与落地调研。
Yintao Ma et al. · 零样本估计箱体 9DoF 位姿(6D 位姿+尺寸),面向仓储抓取与物流,属感知前端模块。
Charlotte Beylier et al. · 通过显著性图定量分析深度 RL 智能体特征依赖的演化,属 RL 可解释性诊断,无机器人操作实验。
Muyuan Liu et al. · 面向目标条件机器人规划的物理接地 JEPA 世界模型,让潜空间预测保留规划相关的物理信息;属规划类世界模型。
Kailang Ma et al. · 反思世界模型的预测似然与视觉保真度并不等价于安全性,提出安全攸关具身系统的评估视角。
Muxing Huang et al. · 用视觉触觉传感从形变与接触力中辨识物体柔顺度与硬度,属触觉感知模块,尚未与 VLA 策略闭环结合。
Yukang Gao et al. · 用姿态流匹配提供人形机器人 RL 运动先验,绕过有序动作片段的时间先验限制,属人形运动控制。
Tommaso Soru · 观点文章,主张知识图谱的确定性断言与基础模型的概率推理需要融合构成语义贝叶斯世界模型;无机器人实验。
Youwei Liu et al. · 让文本世界模型与语言智能体策略协同演化,解决世界模型训练后固定不变的问题;面向 LLM 智能体,无机器人操作验证。
Avinash Kori et al. · 从因果视角梳理世界模型在观测、表征、结构三个抽象层次的工作,属统一视角综述。
Youwei Liu et al. · 用自适应前瞻长度替代固定步数 rollout 的世界模型规划方法,面向通用智能体,缺少机器人操作实验。
Yuandong Pu et al. · 针对视频世界模型提出概率对齐基准,考察模型是否复现多种合法物理演化而非单一轨迹,属世界模型评测。
Wenzhuo Xu et al. · 提出可审计的物理验证系统,定位生成视频在何时、违反何种物理约束,并能反向精炼世界模型。
Haoyu Wang et al. · 基于虚幻引擎构建动作条件视频生成的预训练数据管线,解决真实视频难以获取时间对齐动作监督的问题;对世界模型/VLA 预训练数据构造有参考价值。
Yibin Wang et al. · 为相机条件世界模型设计统一奖励,同时评估动作导致场景变化的正确性与外观、几何、时序一致性。
Phu Pham et al. · arXiv:2609.03294v1 Announce Type: new Abstract: Latent world models support efficient model predictive control from high-dimensional observations, yet optimizing a single learned latent objective can favor action sequences whose decoder-predicted terminal descriptor does not match the goal descriptor. We introduce Latent Energy Action Planning (LEAP), which treats the complete action horizon as a differentiable variable and optimizes it through a frozen LeWorldModel (LeWM). LEAP couples terminal
Junyi Lin et al. · 针对流匹配源-目标耦合易产生路径交叉的问题提出非交叉分位对齐耦合;属通用生成模型理论,可间接影响 flow-matching 策略(如 π0)设计。