具身星图
Embodied AI Atlas
入场中正在打开具身世界
请稍候
Skip to content
DAILY BRIEF

每日论文雷达

今日筛出 7 篇强相关候选,聚焦双向视觉动作接口、长短期记忆 WAM、agentic real-to-sim 与密集具身中间表征。

候选
7
P0
4
已细读
0
更新
07.22

今日信号

04
  1. 01WAM像素动作接口统一正向与逆向世界建模Masked Visual Actions
  2. 02WAM事件记忆让 WAM 追踪长时程任务进度WorldScape Policy 2.0
  3. 03DATA23 万轨迹用中间表征连接 VLA 与世界模型RoboInter1.5
  4. 04SIM视觉语言 agent 自动装配可运行物理孪生Agentic Real2Sim
RESEARCH INBOX显示 332 篇
方向
优先级 / 状态

2026-07-22

编辑建议优先连读 Masked Visual Actions × WorldScape Policy 2.0:前者用统一像素动作接口把视频模型变成正向动力学、逆向策略与候选轨迹评估器,后者用长短期事件记忆补足 WAM 的任务进度跟踪;再以 RoboInter1.5 检查密集中间表征能否同时约束动作与世界 rollout,以 Agentic Real2Sim 观察自动构建可执行物理孪生的数据闭环。

AGENTIC REAL2SIMPHYSICAL TWINCROSS-DOMAINP0待细读

Agentic Real2Sim: Physics-based World Modeling with Vision-Language Agents

让视觉语言 agent 从真实交互视频恢复几何、物体状态、物理参数、相机与轨迹,自动装配可运行的 episodic twin;统一覆盖刚体操作、可变形物体和人形运动,开源权重 VLM 后端以远低于前沿模型的成本取得相近转换成功率。

2026-07-21

编辑建议优先连读 RynnBrain 1.1 × POT-VLA:前者把统一跨本体动作空间、接触点预测和 3D grounding 纳入具身基础模型,后者用持久 3D 物体 token 把人形动作生成与结果验证闭环;再以 FM-VLA 检查力觉历史能否补足视觉记忆,以 Patch Policy 对照大 VLM 与轻量密集视觉策略的效率边界。

2026-07-20

编辑建议优先连读 Xiaomi-Robotics-1 × AC-VLA:前者把 UMI 真机轨迹预训练推到十万小时,后者直指大规模 VLA 仍会出现的组合泛化短板;再以 Data and Learning Where it Matters 检查“关键接触段密集采数”的低成本路线,并用 IMBench 验证物理推理能否真正落到可执行动作。

CONTACT-RICHTARGETED DATAOFFLINE RLP0待细读

Data and Learning Where it Matters for Contact-Rich Manipulation

不再端到端密集采集整条轨迹,而只在接触关键段自动采数并用离线深度强化学习训练,其余自由空间运动交给规划器;四项真机任务仅用 2–2.5 小时数据即达 96% 平均成功率,强基线为 55%。

MANIPULATION EVALPHYSICAL REASONING14K TRAJECTORIESP0待细读

IMBench: A Benchmark for Intuitive Robotic Manipulation

以 35 项任务和 1.4 万条筛选轨迹,把感知、物理推理、动作生成与迭代执行放进同一评测,覆盖接触富集操作、工具使用和多阶段依赖;结果显示 VLM 难产出可执行计划,先进 VLA 也难满足约束并跨场景泛化。

HUMANOIDDEXTEROUS HANDRECONFIGURABLE ROBOTP1待细读

Handroid: Bridging Dexterous Hand and Humanoid

同一套 27 自由度机电本体可重构为 20 自由度灵巧手或桌面人形,统一支持遥操作、抓取、手内操作、行走与动作编辑;真机展示从本体重构、移动、对接到灵巧取放的长时序任务。

HUMAN MOTION DATAEGO-EXOSMART GLASSESP1观察

EgoExoMoCap: Distributed Ego-Exo Human Motion Capture

让两名或更多参与者各戴一副智能眼镜,联合第一视角和互拍视角、头腕追踪及 DINOv3 特征恢复全局人体运动;在两套野外数据上对噪声和遮挡保持稳健,为低门槛真实人类交互数据采集提供新路径。

2026-07-17

编辑建议优先连读 RoboTTT × DriftWorld:前者把 8K 步交互历史压缩进推理期快速权重,打开机器人策略的上下文规模轴;后者用单次前向的 drifting 生成替代扩散迭代,让世界模型真正进入在线搜索。再以 Open-AoE 检查低成本人类视频到 VLA/WAM 的数据链,以 BadWAM × WA-LQR 对照 WAM 的新攻击面与训练外稳健控制。

WORLD MODELONE-STEP GENERATIONPLANNINGP0待细读

DriftWorld: Fast World Modeling through Drifting

训练 action-conditioned drift、推理仅单次前向生成未来帧,在五类机器人基准达到 30+ FPS、平均快于扩散世界模型 17 倍;除在线动作搜索外,rollout 分数与真实策略排名相关性最高达 0.99。

WAM SAFETYADVERSARIAL ATTACKIMAGINATION-ACTION DRIFTP0待细读

BadWAM: When World-Action Models Dream Right but Act Wrong

定义 World-Action Drift Attack:微小视觉扰动可让 WAM 的未来想象保持合理、执行动作却发生有害偏移;统一评测显式 action-only 与更隐蔽的 imagination-preserving 攻击,前者将成功率由 96.5% 降至 43.1%。

VLASTREAMING INFERENCEKV CACHEP0待细读

Reflex: Real-Time VLA Control through Streaming Inference

利用感知编码对 flow timestep 不变的性质,把注意力上下文拆成静态、滑动与动态区,实现固定输入下与全批等价的 O(1) 增量缓存;配合异步流水与算子融合达到 50 Hz,推理加速 2.58 倍。

HUMANOIDBEHAVIOR FOUNDATION MODELSCALINGP0待细读

Scaling Behavior Foundation Model for Humanoid Robots

联合研究全局帧运动跟踪范式、on-policy rollout 数量、参考动作多样性与 Humanoid Transformer 架构的规模配方;仿真和真机均改善全身控制,测试集全局模式 MPKPE 较既有控制器降低 82%。

2026-07-16

编辑建议优先连读 GigaWorld-Policy-0.5 × REAL:前者把 WAM 的未来视觉监督留在训练期、把部署收敛为低延迟动作解码,后者给出无 oracle 感知的开放世界移动操作训练—评测—真机闭环;再以 Anchor-Align × Semantic Anchoring 对照两种 VLA 语义保持机制,以 WANDA 和 PhysClaw-0 观察单示范合成与可记忆语言纠错如何降低数据成本。

VLASEMANTIC MANIFOLDOOD GENERALIZATIONP0待细读

Semantic Anchoring for Robotic Action Representations

系统探测 VLA 微调中动作表征语义结构的退化,并把它与任务成功和 OOD 泛化同步关联;训练期将动作表征拆成共享语义与私有通道并锚定预训练语义流形,部署不增加模块,真机 OOD 最高提升 21.5%。

2026-07-15

编辑建议优先连读 FlowWAM × VistaVLA:前者用光流统一 WAM 的动作预测与世界建模,后者把 3D 高斯中的几何—语义压缩为 VLA 控制 token;再以 ExToken 和 DenseReward 串起高效在线探索与失败感知奖励,以 Jetson-PI 检验 VLA 端侧实时部署。

MANIPULATIONACTION CHUNKINGCONTINUITYP1待细读

ChunkFlow: Towards Continuity-Consistent Chunked Policy Learning

针对 action chunk 边界抖动,把每个 chunk 划为冻结、可编辑与未来区域,并在训练中加入接缝及一、二阶连续性损失;结合历史扰动、scheduled sampling 与 AWAC,在 CALVIN、LIBERO 和真机上改善成功率—稳定性权衡。

EMBODIED VLMPHYSICAL REASONINGEFFICIENT MOEP1待细读

Hy-Embodied-VLM-1.0: Efficient Physical-World Agents

围绕动作相关状态理解、动作转移推理和顺序自适应推理构建数据与训练体系;仅激活 3B 参数的 MoE 模型在 38 项具身感知、物理理解与推理评测中有 19 项达到同规模最佳,并支持多轮长程具身任务。

WORLD MODELHIERARCHICAL PLANNINGLONG HORIZONP1待细读

Mind the Gap: Promises and Pitfalls of Hierarchical Planning in LeWorldModel

冻结 LeWorldModel 低层控制器并增加潜在子目标规划,发现层级化并不会自动改善长程控制,主要瓶颈是高层搜索分布与低层动作空间错配;把搜索约束到训练轨迹宏动作附近后,PushT 长距离成功率提升 14.7 个百分点。

2026-07-14

编辑建议优先连读 Lumo-2 × WALA:前者研究潜在世界动力学、动作与多模态对齐如何形成预测推理,后者把无动作视频的语义—几何变化转成可执行潜在动作;再以 Xiaomi-Robotics-U0 观察世界基础模型作为具身数据引擎的规模路线,以 Robot-Centric Pointmaps 检验低改造成本的跨视角 VLA 泛化。

DEXTEROUSTELEOPERATIONCONTACT TRANSITIONP1待细读

Towards Human-level Dexterous Teleoperation

TeleDexter 用手—物协同跟踪把操作员意图映射为学习到的低层接触执行,以连续子目标和混合奖励覆盖重抓、物内重定位及指步;两种灵巧手、七项长程工具任务真机平均成功率 75%,采集示范还能训练自主策略。

2026-07-13

编辑建议优先连读 CD-LAM × FlowDAgger:前者修正无动作视频中的潜在动作偏差,后者用少量人类介入适配冻结的 VLA/WAM;触觉线重点看 TACTIC × TactiDex,分别覆盖多接触预测控制与接触级评测;再以 CLAP 和 AgenticFocus 观察轻量 VLA 与人形数据路线。

MANIPULATIONRL POST-TRAININGP1待细读

PAC-ACT: Post-training Actor-Critic for Action Chunking Transformers

把 ACT 的在线强化学习后训练改写为 chunk 级 actor-critic,并用混合行为先验约束保持预训练动作分布;在工业精密接触任务中兼顾低延迟、成功率与力安全,Contour 任务中将超过 60 N 的读数比例降低 46 倍。

2026-07-10

编辑建议优先细读 LingBot-VA 2.0 × EgoWAM,比较“原生视频—动作预训练”与“非像素世界目标”两条 WAM 路线;再读 Latent Memory Palace × TFP,区分自适应潜在推理与事件敏感记忆;具身侧重点跟进 ContactMimic 与 DexVerse。

WAMHUMAN-ROBOT TRANSFERP0待细读

EgoWAM

固定策略骨干、动作头与数据配比,只比较 Pixel、DINO 和 3D motion flow 世界预测目标;结果显示抽象外观并分离相机运动的表征更适合把野外第一视角人类视频迁移到双臂机器人。

VLALATENT REASONINGP0待细读

Latent Memory Palace

把连续控制中的推理写成自回归潜变量上的变分推断,并用潜空间强化学习优化;同一框架既形成可自适应分配测试时算力的策略,也产生可变长度动作 tokenizer。

VLAAGENT HARNESSP0待细读

Harness VLA

把 frozen VLA 暴露为可重试的接触丰富 primitive,由带执行记忆的 agent 负责语义重接地、非接触动作与重新 staging,在不微调 VLA 的情况下扩大其部署工作域。

HUMANOIDCONTACT CONTROLP0待细读

ContactMimic

在关键点轨迹之外显式跟踪身体部位二值接触命令,用轨迹增强打破姿态与接触标签的伪相关,使人形机器人能按需产生或抑制接触,并在 5 种动作上完成 sim-to-real。

DEXTEROUSBENCHMARKP0待细读

DexVerse

提供 100 项灵巧操作任务、3 种机械臂、6 种灵巧手、可控视觉变化和 3,180 条多模态 VR 示范,并用 Diffusion Policy、DP3、OpenVLA 与 π0.5 暴露跨任务和跨本体泛化缺口。

VLAEVENT-SENSITIVE MEMORYP1待细读

TFP

用 Liquid Time-Constant 动力学维护 episode-local 任务进度信念,并调制 flow-matching 动作解码器,让记忆在接触、释放和子目标转换附近主动更新,而非仅作为被动历史上下文。

DEXTEROUSRETARGETINGP1待细读

AnyDexRT

以自监督指尖对应、少量人类引导与接触分类器替代手工目标和精确标定,面向不同仿人灵巧手提供 calibration-free 的遥操作重定向与示范采集接口。

VLALIGHTWEIGHTP1待细读

FabriVLA

将 1B 级 InternVL3.5 骨干与带门控动作 token 自注意力、浅层 VLM 特征融合的 flow-matching action head 单阶段联合训练,探索紧凑 VLA 的精细多任务操作上限。

HUMANOIDSURGICAL TELEOPP1待细读

In vivo feasibility study of humanoid robots in surgery

用通用器械建立人形机器人腹腔镜遥操作框架,从台架、干实验用户研究到活体猪实验系统评估精度、控制、安全与临床准备度,是通用人形进入高风险精细操作的少见实证。

HUMANOIDLOCOMOTIONP1待细读

HumoSlope

以斜坡局部支撑面上的 ZMP 正则和生物力学步态适配器抑制蹲伏退化,部署时只用本体感知,在真实户外草坡实现最高 32.1° 的盲走连续穿越。

2026-07-09

编辑建议优先连读 LaMem-VLA × GeoProp × PriGo 理解“记忆—状态—动作”链路;WAM 侧把 LingBot-Video、WAM-TTT 与 world-model admissibility 放在一起看;TouchWorld 则是本期最值得跟踪的接触闭环样本。

VLALATENT MEMORYP0待细读

LaMem-VLA

把历史经验重构成 short/long-term latent memory token,直接编织进 VLA 连续嵌入序列,解决长程任务里仅靠当前观测或外部检索难以参与动作推理的问题。

TACTILEFOUNDATION MODELP0待细读

TouchWorld

把 vision-language 子任务规划、tactile world-model prediction、visuo-tactile action chunk 和高频 tactile residual correction 分层,用触觉同时做接触预测和快速反馈。

DATASIM WORLD ENGINEP0待细读

EmbodiedGen V2

把 sim-ready 3D asset、交互 affordance、任务世界、多房间场景和 stateful vibe coding 统一成可编辑仿真流水线,服务导航、操作和移动操作策略训练。

VLASTATE GROUNDINGP0待细读

GeoProp

把机器人 proprioception 投影到图像平面采样局部视觉特征,形成 grounded state token 并加入短程 look-ahead 坐标,给通用操作策略一个轻量几何归纳偏置。

WAMTEST-TIME ADAPTP0待细读

WAM-TTT

用未标注人类视频在测试时写入 frozen WAM 的轻量 adaptive memory,通过视频预测和 human-robot 对齐让 world-action model 向新任务偏好迁移。

WAMINTERACTIVE WORLDP1待细读

LingBot-World 2.0

把 LingBot-World 扩展到无限交互时长、720p 60fps 实时蒸馏、多样化动作事件和 agentic harness,更偏可交互世界模拟器路线。

QUADRUPEDMOTION DATAP1待细读

ABot-C0

用条件视频生成、动作捕捉、遥操作和人工设计构建 16,074 段物理可行动作片段,训练四足机器人 motion-control foundation 与真实部署栈。

VLATEST-TIME GUIDANCEP1待细读

PriGo

给 diffusion / flow manipulation policies 增加 test-time primitive guidance,通过 PANet 预测 primitive distribution 并可微地修正动作,减少表面动作相关性带来的泛化失效。

VLANAVIGATIONP1待细读

GemNav

用 frozen MLLM 语言塔 LoRA 做短中程视觉导航,把 waypoint 和导航信号统一成离散 token,弱化专用视觉编码器和连续 action head 依赖。

DEXTEROUSRETARGETINGP1待细读

Smooth Operator

提出 sampling-based hand retargeter,面向 VLA/VAM 所需高质量遥操作数据降低 jitter 和操作者负担,并用真实用户实验评估复杂操作成功率。

ROBOT SAFETYINITIATIONP1待细读

Initiation Safety

把 generalist robot safety 中的“是否应该开始第一个难撤销社交动作”单独建模为 initiation authorization,补 motion guardrail 和对话安全之外的许可层。

SOFT ROBOTMANIPULATORP1待细读

ELEANOR

构建 85 cm 连续柔性象鼻式机械臂,通过 3D 打印体素化结构和 tendon actuation 获得全身抓取与高顺应性,对软体大尺度操作硬件有参考价值。

IMITATIONSPECTRAL SKILLP1待细读

SPECTRA

用频域 movement primitive 同时保留 task-space 几何和 joint-space 执行约束,避免事后滤波、裁剪或 time scaling 破坏关键末端轨迹。

2026-07-08

本期判断:今天最值得优先细读四条线:第一是 VLA 从二维视觉动作模型继续补 3D 几何、部署数据和推理效率,Lift3D-VLA、LingBot-VLA 2.0、SIEVE、ActionCache 都值得优先跟;第二是 WAM/4D 世界模型明显升温,RynnWorld-4D、RynnWorld-Teleop、MECo-WAM、RoboTALES 分别覆盖 RGB-D-flow 预测、数字遥操作、机械直觉和任务对齐想象;第三是数据和评测侧开始更重视可生成数据、抓取 SE(3) 质量、人形交互力和 embodied occupancy;第四是人形与灵巧手继续向接触密集操作推进,WristMimic、LAMP、DexTele 都有真实或物理仿真约束。

VLA3D GEOMETRYP0待细读

Lift3D-VLA

把 VLA 显式抬升到点云几何和时序动作空间,通过 2D 模型 lifting 与 temporal action token 建模补现有 3D 编码的信息损失和动态操作不足。

WAM4D WORLD MODELP0待细读

RynnWorld-4D

从单张 RGB-D 图像和语言指令联合生成未来 RGB、depth 与 optical flow,用 RGB-DF 表征把世界预测向低层末端动作需要的 4D 动态靠拢。

WAMDIGITAL TELEOPP0待细读

RynnWorld-Teleop

提出 digital teleoperation,让操作者手部 pose 驱动机器人中心的生成式世界模型合成第一视角视频,再把 pose stream 作为可重定向动作标签扩展模仿学习数据。

VLADATA SELECTIONP1待细读

SIEVE

把示教轨迹拆成可复用 primitive 与 transition interface,按结构覆盖度选择 medoid 轨迹,针对 VLA imitation learning 中的冗余、噪声和长程组成覆盖不足。

HUMANOIDWHOLE-BODYP0待细读

WristMimic

用 wrist 作为全身运动和接触丰富手部操作之间的分界,身体与手腕跟踪人体运动,手指则通过物体轨迹和接触结果学习抓取与操作。

VLAPRACTICAL SCALEP0待细读

LingBot-VLA 2.0

把 LingBot-VLA 扩展到约 60,000 小时预训练数据、20 种机器人配置、双臂/头腰底盘/灵巧手动作空间与预测式动态建模,更偏真实部署工程化。

VLAINFERENCEP1待细读

ActionCache

给 flow-matching VLA 加外部动作缓存,用相似上下文检索历史中间动作 warm-start 去噪过程,目标是在不训练的情况下减少实时部署延迟。

DEXTEROUSREAL-WORLD RLP1待细读

LAMP

为灵巧手学习 history-conditioned latent motion prior,让在线 residual RL 在低维手部 latent action 空间探索,降低真实硬件上接触断裂和高维动作误差。

VLASKILL COMPOSITIONP1待细读

Semantic Handoff Failures

在 BEHAVIOR-1K 中诊断长程 household task 的 skill handoff 问题:单个 VLA skill 达成 postcondition 后,终态可能仍不适合作为下一个 skill 起点。

DATASYNTHETIC NAVP0待细读

Image2Sim

把单张全景图自动转换成可交互 3D 场景并生成 embodied navigation 训练数据,用 VLM、深度、GSplat 和 asset retrieval 串起低成本仿真数据引擎。

HUMANOIDFORCE EVALP1待细读

ThorArena

面向人形物理交互评测,采集带双手交互力的真人全身动作示范,用于衡量 motion-force 条件下的 tracking、稳定性和控制鲁棒性。

WAMSIM FUTURESP0待细读

RoboTALES

用层级 LLM planner 和 VLM critic 约束视频生成模型的 imagined futures,让世界模型想象更贴合任务子目标,再从内部表征训练机器人策略。

WAMDIAGNOSISP1待细读

Imagined Rollouts are Kinematic, Not Dynamic

提出 imagined Kinematic-Consistency Error 诊断长程 world model failure,指出模型常在运动学外观上想象,但没有随物理参数跨 regime 变化出动态响应。

DEXTEROUSTELEOPP1待细读

DexTele

双臂灵巧遥操作系统,结合视觉 motion retargeting、motion-graph encoder、latent optimization 与 VLM+MPC 自适应抓取,处理跨平台和合规接触。

DATASETGRASP SE(3)P1待细读

GraspIT

连接仿真和真实抓取 SE(3) 姿态生成的数据集,用 Isaac Sim slip-test 给候选抓取打连续质量分,并把标签回投到真实 RGB-D 场景。

EMBODIED AI3D SCENEP1待细读

GEM-Occ

为 embodied AI 引入 generative 3D occupancy prediction,从 ego-centric observation 推断语义占据,补齐导航和操作任务中对不可见空间结构的场景理解。

VLAVISUAL PROMPTP0待细读

FORGE

通过 VLM 从视觉提示中推断 object states、目标状态和 functional keypoints,把工具使用与 manipulation generalization 组织成更可解释的 prompt-conditioned 流程。

WAMPHYSICAL INTUITIONP0待细读

MECo-WAM

从机械直觉角度改造 world-action model,把 mass、elasticity、collision 等物理属性作为可解释信号,尝试提升长期操作预测与动作生成的一致性。

2026-07-07

本期判断:今天最值得优先细读四条线:第一是 VLA 部署鲁棒性和组合泛化,CamVLA、InternVLA-A1.5、Cortex、SEAM 分别补自由相机、潜在前瞻、长程规划对齐和 action chunk 平滑;第二是 WAM 继续从视频预测靠近可控操作,DSWAM、KAM-WM、Mask2Real-WM、GeoMoLa 都在把世界模型信号转成动作接口;第三是数据和评测侧出现 Deform360 与 RoboDojo,一个补真实多视角视触觉可变形物体数据,一个补 sim+real 通用操作评测;第四是接触密集操作继续升温,线缆、灵巧手、触觉芯片和人形 WBC 都有新信号。

VLAFREE CAMERAP0待细读

CamVLA

把末端动作先预测到 camera-centric 坐标再转换到机器人控制,目标是在不显式输入相机外参的情况下处理部署时相机重装、移位和自由视角变化。

TACTILEDATASETP0待细读

Deform360

面向可变形物体 world model 的真实多视角视触觉数据集,覆盖 198 个日常物体和 1,980 段交互,适合比较 2D pixel、3D 几何和触觉动态建模路线。

VLALONG HORIZONP0待细读

Cortex

把高层 VLM 规划和低层 VLA 执行做双向对齐,用 32 个规范化 skill primitives 与可执行性原则缩小语义规划和运动执行之间的落差。

TACTILENEUROMORPHICP1待细读

GelNeuro

把 GelSight Mini 光学触觉前端和 Speck2f 神经形态 SoC 直接集成,用 DVS 事件和脉冲卷积网络做低延迟、低功耗纹理识别。

VLANAVIGATIONP1待细读

Green for Go, Red for No

用实时语义分割把可通行区域标绿、不可通行区域标红,评估 visual grounding 对 VLA navigation waypoint error 和场景歧义的影响。

VLAFORESIGHTP0待细读

InternVLA-A1.5

在原生 VLM backbone 上同时保留 VQA/子任务预测和连续动作生成,把未来预测改成 latent querying,用视频生成器先验增强组合泛化。

WAMDUAL SYSTEMP0待细读

DSWAM

把 VLM 式显式子任务分解接到 video-based world/action model 的物理执行能力,并尝试给 VLA 与 WAM 做更公平的真实机器人对比。

DATASYNTHESISP1待细读

PRISM

从单张目标环境图像和自然语言任务生成个性化机器人数据集,把场景重建、运动合成和任务轨迹生成串成面向用户环境适配的数据管线。

HUMANOIDWBCP1待细读

Athena-WBC

面向长尾人形全身控制,用 capability-aligned policy experts 处理高动态转移和平衡关键动作中“多采样仍学不好”的能力错配问题。

VLAACTION CONDITIONP1待细读

CAC-VLA

学习 context-gated action conditioning,让视觉语言表征显式服务于连续动作生成,减少 action expert 独自补齐多模态语义到控制信号的压力。

DIFFUSION POLICYEXECUTIONP1待细读

Spatial Attention

用 action log-likelihood 对观测的梯度敏感度动态调整 diffusion policy 的 action chunk 执行时长,在响应性和计算成本之间自适应折中。

MOTION LATENT3D GEOMETRYP1待细读

GeoMoLa

通过预测 manipulation 中点云随时间的 4D 几何变化来学习离散 motion latent,让动作抽象更关注真实物理运动而不是外观重建。

VLAREASONINGP1待细读

Do VLAs Mean What They Say?

区分 embodied CoT 的 functional reasoning 和 faithful reasoning,质疑 VLA 口头推理是否真实反映动作预测内部因果链。

WAMAFFORDANCEP0待细读

KAM-WM

从冻结 latent video world model 的单步 latent velocity 里抽取 Kinematic Affordance Map,给少样本 manipulation policy 提供交互区域和粗运动方向。

DEFORMABLESIM2REALP1待细读

SILO

用 GPU 并行仿真训练多阶段线缆 routing RL policy,覆盖不同线缆几何和变形模式,目标是减少线性可变形物体任务的数据需求。

EVALROBOT VLMP1待细读

RoboVista

提出 Robot Question Answering 模块化评测框架,从真实机器人应用中拆出可解释的视觉语言决策组件,诊断 VLM 是否适配多样机器人场景。

VLAACTION CHUNKP0待细读

SEAM

针对 flow-matching VLA 的 action chunk 边界不连续问题,提出无需训练的 inference-time 平滑执行方法,减少相邻 chunk 落到不兼容轨迹模态。

WAMSIM2REALP0待细读

Mask2Real-WM

把 action-conditioned dexterous world model 拆成 mask dynamics 与 photorealistic rendering 两段,用分割空间缩小 sim2real gap,再把 mask 转成真实 RGB 未来。

VLALANGUAGE OPTP1待细读

VLA Grounder

不更新黑盒 VLA 权重,而是优化语言条件空间,把人类指令转成更贴合目标物外观、空间关系和 grounding cues 的短命令。

EVALSIM+REALP0待细读

RoboDojo

统一仿真与真实机器人通用 manipulation 评测,包含 42 个仿真任务和 18 个真实任务,覆盖多维能力而不是只测短程或单技能任务。

2026-07-03

本期判断:今天最值得优先细读三条线:第一是 VLA 部署可靠性,Neuro-Symbolic Safety、VLA-Corrector、DiG、VLAFlow 都在补安全、闭环自纠错和动作分布漂移检测;第二是 WAM 从“预测视频”继续靠近动态 3D 操作、视频-触觉联合预测和可控长程世界模拟,PhysMani、Bridge-WA、VT-WAM、WorldDirector 值得优先跟;第三是真实数据/评测侧很强,AutoSERL 用单条示教跑实机 RL,ManipArena 和 VLA-Arena 继续把 VLA/WAM 评测做成更可复现的基准,同时 EAGLE-360 和 ComplexMimic 补上具身主动探索与人-场景交互模仿。

SIM2REALPOLICYP1待细读

BIFROST

用 paired cross-domain data 学共享 history encoder,让视觉导航、接触操作和 visual servoing policy 通过跨域 bisimulation 表征做 zero-shot sim2real。

RLONE DEMOP0待细读

AutoSERL

用单条示教自动化实机 RL 的滑窗干预、安全恢复和干预终止,在插入、悬挂、铰链等接触密集 manipulation 任务上减少人工介入。

TACTILEIMAGINATIONP0待细读

TacImag

从视觉和本体感觉预测触觉表征,让部署时没有触觉硬件的机器人仍能利用接触先验;真实任务中 imagined force field 与 tactile image 分别提升接触/纹理任务。

REWARDVLM FEEDBACKP1待细读

CoRe

把 VLM 反馈拆成 formal reward 的迭代设计和 residual reward 的视频偏好学习,用于十个仿真和五个真实 manipulation 任务的偏好对齐 RL。

VLAACTION CHUNKP0待细读

VLA-Corrector

不改 VLA backbone,用 latent-space vision monitor 检测预测视觉演化与实际观测的偏差,触发 chunk 截断和在线梯度引导重规划。

WAM3D DYNAMICSP0待细读

PhysMani

把 divergence-free Gaussian velocity field 作为 physics-principled 3D world model,再把预测的未来 3D 动态接入 action policy,面向快速运动目标操作。

VLAFLOW POLICYP1待细读

Guided Action Flow

给 flow-matching action policy 加 Guiding Window 和 confidence-aware guidance,在相同数据预算下提升复杂灵巧操作的收敛和轨迹质量。

WAM3D BRIDGEP0待细读

Bridge-WA

用结构化 3D Gaussian 场景和 object-centric action token 把 video/3D world model 接到动作生成,目标是补齐 WAM 里状态预测到控制的接口。

HUMANOIDACTUATORP1待细读

Actuator Reality Shaping

把系统辨识从“复刻硬件”改成“重塑仿真 actuator reality”,减少人形 sim-to-real 中电机/传动误差对全身控制策略的破坏。

NAVIGATIONFLOW FIELDP1待细读

CoFL-S

把低层视觉语言动作表示成局部可查询 sector flow field,用帧级子指令、动作、轨迹和稠密 flow supervision 训练连续时间导航接口。

VLAACTIVE VISIONP1待细读

Moving Eye

把可移动相机/视角选择纳入 VLA 决策,让 policy 在长程操作中主动获取更有用的视觉证据,而不是固定视角被动执行。

HUMANOIDTELEOPP1待细读

HEFT

面向 175cm 全尺寸人形的重载遥操作,用 privileged motion guidance 和 windowed payload curriculum 学习带噪 VR 参考下的稳健全身跟踪。

WAMDATA EFFICIENCYP1待细读

ACID

从 action-conditioned interaction data 中做更高效的 world/action model 学习,关注少数据下预测-控制耦合的样本效率。

ACTIVE VISIONCAMERA MOTIONP1待细读

LIME

从 egocentric video 挖掘多意图相机运动监督,给自由语言意图预测下一视角的相对 SE(3) 目标位姿,把主动观察变成可学习动作。

WAMGENERATIVEP1待细读

WorldSample

用真实 rollout 后训练 world model 生成高保真 synthetic transitions,再通过 Policy-Paced Learning 控制样本选择,降低实机 RL 的交互成本。

VLAPRETRAINP1待细读

TAP

先用廉价无语言交互数据和 inverse dynamics 学可迁移 motor priors,再用少量专家数据做语言 grounding,把 VLA 的“会动”和“会听指令”拆开训练。

VLARUNTIMEP1待细读

Embodied.cpp

面向具身 VLA/robot policy 的轻量运行时与系统实现信号,关注从模型到本地机器人执行栈的部署效率。

TACTILEWAMP0待细读

VT-WAM

把视频-触觉联合预测纳入 world-action model,用视觉和触觉未来状态帮助接触密集任务中的动作选择和失败预判。

WAMWORLD SIMP0待细读

WorldDirector

把 LLM 编排的 3D 轨迹和相机运动作为视频生成控制信号,强调长程事件中的动态对象持久记忆、身份保持和可控视角探索。

EMBODIEDACTIVE SEARCHP1待细读

EAGLE-360

面向 360 度全景环境的具身主动视觉搜索,用全局到局部探索、RoPE Rolling 和 70K+ 轮 VQA 数据提升目标定位与错误恢复。

WAMEGOCENTRICP1待细读

HandsOnWorld

从野外单目第一视角视频重建 3D 手部轨迹,构建 EgoVid-Pro 并用 Plucker Hand Map 解耦相机和手部运动,适合作为手控具身视频世界模型的数据路线参考。

WAMARTICULATEDP1待细读

PWM-ArtGen

把关节物体建模为动态系统,联合学习视觉动态与运动学参数,用 Part World Model 生成/恢复可操作物体的结构先验。

HUMANOIDHSI IMITATIONP1待细读

ComplexMimic

面向复杂 3D 场景中的物理人-场景交互模仿,用 imitation/interaction 双专家和难度感知蒸馏处理 Mocap 不完美与碰撞适应。

VLAFLOWP0待细读

VLAFlow

cross-list 新文,围绕连续动作 VLA 的 flow matching/action generation 建模,适合作为 VLA-Corrector、DiG 等动作流可靠性工作的横向对照。

EVALMANIP BENCHP0待细读

ManipArena

replacement 重要更新:标准化真实机器人 manipulation generalization 评测,覆盖 20 个任务、10,812 条专家轨迹、13.5M frames 和 VLA/WAM policy 对比。

VLARELIABILITYP0待细读

DiG

用 observation feature 到 action representation 的 sliced-Wasserstein transport cost 作为 VLA action chunk 可靠性信号,在分布漂移和长程任务下做 gate/refinement。

VLASAFETY BENCHP1待细读

AEGIS / VLSA

replacement 更新:给 VLA 插入 control-barrier-function 安全约束层,并用 SafeLIBERO 评估 obstacle avoidance 和 task success 的共同提升。

SKILLIMITATIONP1待细读

AtomSkill

从多任务示教里学习语义对齐 atomic skill space,再用 keypose imagination 做长程 skill chaining,适合作为技能抽象/行为分段路线参考。

EVALVLA BENCHP0待细读

VLA-Arena

replacement 更新:开源 VLA benchmark 框架,从任务结构、语言命令和视觉观察三个轴拆解难度,适合和 ManipArena 共同跟踪。

2026-07-02

本期判断:今天最值得优先细读三条线:第一是 VLA 的可组合泛化和少样本部署适配,EmbodimentSemantic、ACT-VLA、DART、FurnitureVLA 分别从空间关系、动作组合、域迁移和长程装配补短板;第二是 WAM 从视频预测转向 3D/4D 结构化世界状态和可用于评测的神经模拟器;第三是触觉/接触数据继续变大,CHORD 和 H-Tac 都把人类示教或人类触觉数据转成机器人可用的接触先验。

VLASPATIAL EVALP0待细读

EmbodimentSemantic

构建面向具身操作轨迹的空间 scene-graph 数据集和 benchmark,用支撑、包含、遮挡、深度等关系诊断 VLM/VLA 的空间 grounding。

DEXCONTACTP0待细读

CHORD

把人类示教转成 object-centric contact wrench guidance,用于长程刚体和 articulated object 灵巧操作 RL,并给出 4,739 个双手任务 benchmark。

WAM3D DYNAMICSP0待细读

3D Point World Models

先补全局部点云再学习 action-conditioned 3D dynamics,缓解视频 world model 的几何漂移,面向 model-based planning 做更可靠 rollout。

SKILLSCODE-AS-POLICYP0待细读

ASPIRE

NVIDIA GEAR 的开放式机器人技能发现系统,通过执行 trace、失败诊断、修复合成和技能库沉淀,让 code-as-policy 技能跨任务复用。

TACTILEMLLMP1待细读

Wake up for Touch!

用 mask-isolated tactile alignment 给多模态 LLM 接入触觉,冻结关键视觉语言参数,只更新 dormant subspace 以减少触觉学习对通用能力的破坏。

VLACOMPOSITIONP0待细读

ACT-VLA

从已有任务的 latent task representation 合成新的物理有效示教,让 VLA 组合已学 sub-skill,降低对额外人工遥操作数据的依赖。

REWARDVLMP1待细读

VLM-AR3L

让 VLM 同时产生 absolute state reward 和 relative progress reward,把语言目标下的视觉观察转成 RL 可用的稳定奖励信号。

VLAONE-SHOT ADAPTP0待细读

DART

用 domain-specific weight vector arithmetic 做 VLA 单样本域适配,覆盖相机位姿变化和相近机器人平台迁移。

WAMMOBILE MANIPP0待细读

ABot-M0.5

面向移动操作的统一 world-action model,用中间 latent action、双层 MoT 和 dream-forcing 处理导航-操作动作混杂与 autoregressive 误差累积。

POLICYSPEEDP1待细读

AutoSpeed

无需阶段或速度标注,让现有 visuomotor policy 学习 stage-adaptive motion speed 和预测 horizon,提升不同难度阶段的执行效率。

WAMEVALP0待细读

RoboWorld

用快速 autoregressive video world model 加 task-progress-aware VLM 打分评估 generalist robot policy,主打替代部分实机评测吞吐瓶颈。

TACTILEPRETRAINP0待细读

H-Tac / TTP

160 小时人类第一视角触觉-动作数据、300+ 任务和 135K episodes,再用统一触觉/动作空间做 human-to-robot tactile pre-training。

POLICYTEST-TIMEP1待细读

FAR

把失败重试变成 test-time recovery 数据,用 failure-contrastive preference adaptation 和轻量动作扰动避免重复同一失败轨迹。

VLABIMANUALP0待细读

FurnitureVLA

真实尺度双臂家具装配 VLA,结合仿真专家数据、VR 双臂示教和 progress signal,处理最多 7 个子任务、1550 步的长程装配。

VLAMEDICALP1待细读

BiliVLA

把胆道内镜导航写成 instruction-conditioned visuomotor learning,结合 scene-aware supervision 与 GRPO 提升真实 phantom 上的动作可靠性。

POLICY3D TOKENSP1待细读

VolumeDP

把图像特征 lift 到 volumetric representation,选择任务相关 voxel 作为空间 token,减少 2D 视觉到 3D 动作的错配。

PHYSICSSENSORLESSP1待细读

PhyPush

只用单次 push 的末端速度估计物体质量和摩擦系数,通过 Newton/Coulomb physics-guided loss 替代特权力觉输入。

HUMANOIDWHOLE-BODYP1待细读

KungfuBot

面向功夫和舞蹈等高动态人形技能,通过动作处理、retargeting 和自适应跟踪容差训练 whole-body control policy。

2026-07-01

本期判断:今天最值得优先细读三条线:第一是 VLA 后训练和推理时扩展,Z-1、SARL、ELASTIC 都把“部署后怎么变强”具体化;第二是触觉/力觉从附加输入变成可迁移表征、未来接触预测和数据基准;第三是人形/具身数据开始围绕 human-present、ego-exo human video、Unitree G1 触觉操作和实验室精密操作扩张。

DEXPRETRAINP1待细读

From Grasps to Dexterity

把 35.5 万条 dexterous grasp 轨迹用于低层控制器预训练,再迁移到 articulated tool use,说明抓取数据可作为接触操作先验。

TACTILEFORCEP0待细读

MuSe

研究如何把有限力觉数据接入预训练 vision-only policy,通过多阶段融合、未来多模态预测和 replay 保住原传感器能力。

HUMANOIDBENCHP0待细读

Labimus

面向有机化学实验室的人形灵巧操作仿真与 benchmark,用精度感知评测区分“完成动作”和“满足实验容差”。

VLATEST-TIMEP0待细读

ELASTIC

给 diffusion/flow 机器人策略学习状态相关的推理时计算分配,在 pi0.5 实机上用更低延迟接近 best-of-10 成功率。

VLAMEMORYP1待细读

MIRTH

给 VLA 加长短期 temporal memory hub、互信息 latent reasoning token 和并行动作解码,主打缓解单帧 VLA 的时序短视。

TACTILETRANSFERP0待细读

TactX

跨 resistive、magnetic、vision-based 触觉传感器学习共享 latent,让一类传感器训练的策略可零样本迁移到另一类传感器。

PLANNINGSYMBOLIC RLP1待细读

Plan Right, Then Plan Tight

用从视频或任务构造的 BDDL 规格作为可验证接口,给 embodied planner 提供毫秒级 dense reward 和长度自适应训练信号。

VLA3D GUIDANCEP0待细读

3D HAMSTER

让层级 VLA 的 planner 直接输出 3D waypoint,避免 2D 轨迹投到点云策略时产生错误深度与几何畸变。

TACTILEGENERATIONP1待细读

UniTac

把触觉理解和触觉生成统一到 multimodal model,同时建模传感器属性与物体属性,面向跨传感器触觉表征。

POLICYFLOWP1待细读

ChronoFlow-Policy

用过去、当前、未来的物体和夹爪稀疏 3D keypoint flow 统一描述交互动态,再与 diffusion policy 联合训练。

SURVEYROBUSTNESSP1待细读

Robustness of Robotic Manipulation

系统整理 manipulation robustness 的定义、概率/控制论表述、评测指标和感知/规划/控制/策略学习/硬件机制。

DATAHRIP0待细读

HABIT

10K+ episodes、160+ 小时的人在场机器人操作数据,把 collaborator、coworker、supervisor 作为数据多样性新轴。

TACTILEDATAP0待细读

RCT

机器人采集的 touch-vision-language 触觉数据集,强调按接触序列和 held-out material 评测,暴露现有 tactile split 泄漏问题。

VLATACTILEP0待细读

UniTacVLA

把 tactile latent、tactile chain-of-thought 与未来触觉预测接入 VLA,再用触觉-动作混合控制器修正低频 action chunk。

HUMANOIDDATAP0待细读

RoboTacDex

Unitree G1 上的视觉-触觉-动作人形灵巧操作数据集,6K trajectories 覆盖双臂灵巧手、多视角 RGB-D、触觉和语义标注。

VLARLP0待细读

Z-1

基于 pi0.5 的 flow-based VLA RL 后训练,用 RoboCasa 公共数据 SFT 后做 task-wise GRPO,主打无私有示教提升策略。

DEXZERO-DEMOP0待细读

CoDex

无需人工示教,由 VLM 推断功能性约束,再用解析优化和 RL 发现 spray bottle、glue gun 等可执行灵巧功能操作。

EVALSAFETYP0待细读

OopsieVerse

给 household manipulation 引入 damage-aware simulator 和 benchmark,把接触力、温度、液体等损伤纳入 VLA/策略安全评估。

HUMANOIDHUMAN VIDEOP0待细读

Human-as-Humanoid

把同步 ego-exo 人类视频恢复并 retarget 成 60-DoF 人形 action chunk,用于高自由度 humanoid VLA 训练和零样本部署。

PREFERENCERLHFP1待细读

Freeform Preference Learning

让标注者用自然语言定义速度、安全、摆放质量等偏好轴,学习 language-conditioned reward 并训练可按偏好 steering 的操作策略。

WAMVIDEOP0待细读

DVG-WM

把 embodied world model 拆成 dynamics learning 与 visual synthesis 两段,用高效级联机制提升 LIBERO 和实机平台上的视频预测速度与质量。

2026-06-30

本期判断:今天最值得盯三条线:VLA 不再只是堆大模型,而是在 action tokenizer、ECoT supervision、test-time RL、事件相机和触觉提示上补闭环短板;WAM 从“生成好看视频”推进到物理诊断、动作一致性、导航规划和可替代 rollout 的模拟器;数据侧则继续围绕人类视频、action-free demo、单次示教和全身 retargeting 扩张。

WAMEVALP0待细读

RoboGaze

用多 agent VLM 对机器人 world model 生成视频做结构化诊断,按物理、时序和任务逻辑定位 glitch,比单一 VLM judge 更像可用评测工具。

WAMDIAGP0待细读

Event-Conditioned Diagnostics

把 free-motion、collision、occlusion 等事件条件拆开,诊断 passive object-state world model 内部是否真的编码运动学、接触与物体恒存。

WAMSLAMP0待细读

J-LAW

把 metric localization 和 action-conditioned latent world model 写进同一个 factor graph,同时优化位姿、latent state 和可规划 landmark。

WAMSIMP0待细读

ViPSim

针对长程 embodied world model 中动作低维、视频高维造成的几何漂移,协同 visual space 与 parameter space 改善 rollout 一致性。

WAMPOLICYP0待细读

A2World

用带真实动作标注的大规模多视角 manipulation 数据预训练 action-conditioned diffusion world model,一份权重同时服务 simulator 和 action prediction。

WAMNAVP1待细读

FutureNav

把 VLN 做成 unified world-action modeling:同时建模未来观测和动作序列,补直接 action generation 缺少未来状态推演的问题。

WAMNAVP1待细读

SWAM

从起点/目标 RGB 直接生成中间 RGB-D 与动作轨迹,把导航 WAM 从候选验证范式推向单次 task-centric joint generation。

VLATACTILEP0待细读

TAP-VLA

不改 VLA 架构,把视触觉传感器 shear field 叠到多视角 RGB 中,让接触力以视觉 annotation 方式进入预训练分布。

VLATEST-TIME RLP0待细读

T²VLA

利用离散动作 VLA 的生成置信度做内生 reward,在测试时自举策略改进,覆盖 OpenVLA-OFT 和 pi 系列范式。

VLATOKENIZERP0待细读

SA-VLA

把 robot state 注入 VQ action tokenizer,让同一离散 token 可按当前关节、物体和接触状态解码为不同连续动作。

VLATOKENIZERP0已细读

X-Tokenizer

自变量把 Wall-OSS-0.5 的动作分词器路线正式独立成论文/代码/权重:SRQ 用 q0 学语义意图,q1-q3 保留运动残差,2.4M 轨迹/2B action frames 预训练,作为混合离散-连续 VLA 的冻结语义动作接口。

VLAECoTP0待细读

ZR-0

用 dense embodied chain-of-thought 监督对齐跨 embodiment 表征,推理时跳过 ECoT 生成,动作专家仍以 flow matching 输出 action chunk。

VLAEVENTP1待细读

Event-VLA

用事件相机补低光、近暗场景下的 RGB 失效,通过 action-query routing 保住 RGB-language 预训练语义并增强动作鲁棒性。

VLASYSTEMP1待细读

VLA on Real-World UR5

围绕 OpenVLA / OpenVLA-OFT 的真实 UR5e 部署复现,把问题从模型能力拆到数据采集、RLDS 转换、坐标系和时序对齐。

VLAGEOMETRYP1待细读

OpenSPM

用 key spatial pose memory + 高频 flow-matching action generation 弥补端到端 VLA 在开放桌面操作里几何约束不足的问题。

DATAHUMAN VIDEOP0待细读

Human2Any

从人类视频学习 object-object interaction priors,再结合机器人侧可达性和运动规划,迁移到不同 embodiment 与任务场景。

DATAACTION-FREEP0待细读

CORE

不转移动作,从 action-free visual demonstrations 抽 terminal object configuration、空间关系与接触约束,作为 visual goal prototype 注入策略。

DATAPROMPTP0待细读

Behavior Prompting Policy

把单条人类示教作为 behavior prompt,当前观察作为 query,用 in-context visuomotor policy 做新任务操作,并强调任务多样性是核心数据变量。

DATAKEYPOSEP1待细读

Keypose Exploration

用 VLM 做语义事件检测 + 轨迹分析自动标注 keypose,再借 reachability map 过滤候选关键位姿,探索跨 embodiment 迁移。

DATABCP1待细读

Behavior Uncloning

把不想要的行为模式从 BC policy 权重中“重定向”出去,避免重新清洗全量数据或上线时增加 steering 开销,还覆盖 Diffusion Policy 与 Pi0.5 VLA。

EVALOFFLINEP1待细读

Critical Interval MSE

只在任务关键片段上算动作误差,并做 rollout-time 行为对齐,试图让 offline validation loss 更接近真实机器人成功率。

RLDATA QUALITYP1待细读

STEAM

用自监督 temporal-offset ensemble 给真实机器人轨迹打 frame-level advantage,从混合质量数据里识别停滞、失败和恢复片段。

HUMANOIDRETARGETP0待细读

WARP

离线把人类姿态 retarget 成唯一、精确的 whole-body mobile manipulation action,目标是减少 embodiment gap 导致的动作多模态。

HUMANOIDCONTROLP1待细读

FADA

少量目标域样本对齐 humanoid dynamics,用 Planner-IDM 三阶段框架解决 terrain、payload、actuator response 带来的控制迁移偏差。

HUMANOIDVLA DATAP1待细读

VLK

在重建场景中合成 egocentric image、language command 与 humanoid-compatible kinematic trajectory,补人形 loco-manipulation 监督缺口。

TACTILEPOLICYP1待细读

Seeing Touch from Motion

统一 optical tactile raw image 与 motion field,建模 tactile motion correlation,面向接触丰富任务里的细粒度接触状态提取。

2026-06-29

本期判断:今天最值得盯三条线:VLA 的状态/空间 grounding 与冗余压缩;WAM/视频世界模拟器的物理一致性与长时记忆;数据侧从 teleop 清洗、real-to-sim 场景生成扩展到云原生仿真基础设施。

VLAP0待细读

S²-VLA

用 belief state 跟踪长程任务阶段,动态融合视觉、语言意图和动作序列,补 VLA 长程操作中的累计误差。

WAMP0待细读

DiM-WAM

给 world-action model 加多尺度历史事件记忆和进度监督,针对长程任务中的遗忘与阶段感知不足。

WAMSIMP0待细读

PhysisForcing

用物理信息区域的像素/语义特征监督强化机器人视频世界模拟器,关注接触与物体运动的一致性。

DATASIMP0待细读

SimFoundry

从视频自动构建 real-to-sim 场景与 digital cousins,用于策略学习、泛化与仿真评测。

DATABCP0待细读

WARP-RM

自监督学习 dense relative progress reward,再用 WARP-BC 上调高优势 action chunk,服务混合质量 teleop 数据清洗。

VLAEFFICIENCYP1待细读

Drop-Then-Recovery

系统测 VLA 模型冗余:语言 backbone 在标准操作任务里高度可删,视觉与 action pathway 则更敏感。

VLAEDGEP1待细读

SpikeVLA

把视觉编码、跨模态推理与动作策略都做成 spiking 架构,面向低功耗实时 embodied navigation/control。

VLMNAVP1待细读

LocalNav

把 frontier VLM 的空间语义推理蒸馏到 4B 本地 VLM,再用 RLVR/量化降低移动机器人 ObjectNav 延迟。

DEXCOMPOSITIONP1待细读

DexCompose

通过 finger-level action ownership 与双残差模块复用已有灵巧手 policy,处理单手多任务组合中的动作冲突。

BIMANUALP1待细读

PA-BiCoop

把双臂动态分成 primary/auxiliary 角色,共享全局 encoder、分工 decoder,面向通用双臂协作操作。

RLDEXP1待细读

SCORE

real-to-sim-to-real policy improvement:用生成式 base policy 的 support 约束仿真 RL,减少 dynamics mismatch 带来的不可迁移动作。

HUMANOIDCONTACTP0待细读

SceneBot

用 per-link contact labels 和 hindsight scene reconstruction 统一 free-space、地形穿越与接触丰富全身操作。

HUMANOIDP1待细读

CWI

把上肢 manipulation MoCap 与下肢稳定 locomotion 解耦,再 distill 成仅依赖双手位姿与速度/高度命令的全身策略。

HUMANOIDDATAP1观察

Booster Lab

数据中心化 humanoid locomotion 管线:motion curation、real-to-sim 适配、AMP RL 与 sim-to-real 部署。

MOTION DATAP1观察

Unleashing Infinite Motion

用 LLM prompt + video diffusion 生成四足机器人动作视频,再 lift 成 3D reference trajectory 训练真实 Go2 tracking policy。

MULTI-AGENTP2观察

LLawCo

从多智能体失败中抽取 cooperation laws,再写入 embodied agents 的 CoT,对应具身集体智能的协作行为建模。

RLSAFETYP2观察

RS-Diffuser

用 distributional value critic 引导 diffusion planner,在 risky robot navigation 等任务里做风险敏感离线规划。

2026-06-26

本期判断:今日新增明显偏“大系统”:ABC 把开放数据/训练/评测打通;WAM 进入 continual IL、触觉和幻觉诊断;VLA 侧集中在路由、test-time scaling、安全、阶段监督与物理反思。

VLAP0待细读

RouterVLA

把上线前 smoke test rollout 变成 frozen VLA experts 的路由监督;适合归入多专家 VLA 部署选择。

VLADATAP0待细读

LA4VLA

Language-action pretraining 不看视觉先学动作先验,用于削弱视觉捷径、补足低层动作语言监督。

VLAP0待细读

E-TTS

Embodied test-time scaling 框架,把 reasoning scaling 与 action scaling 接到历史感知迭代 refine 和 VLM verifier。

VLABENCHP0待细读

ForesightSafety-VLA

13 类安全 taxonomy 的 VLA 诊断基准,把物理交互、指令侧、感知侧风险拆开评测。

DATAHUMANOIDP0待细读

HumanoidUMI

用 VR 与 UMI-like gripper 做 robot-free humanoid whole-body 数据采集,重点在从人类关键点到全身控制的桥接。

WAMTACTILEP1待细读

Tactile-WAM

把触觉未来状态纳入 WAM,并用 tactile asymmetric attention 处理视频 token 对触觉预测的污染。

VLAP1待细读

PhysReflect-VLA

执行时加入物理可行性判断、动作解释与 LLM self-reflection,目标是提高闭环 VLA 的可靠性。

VLAMOEP1待细读

PAMAE

把单一 flow-matching action expert 换成 phase-aware sparse MoE,对应“任务阶段一致性”的动作生成问题。

DATABENCHP1待细读

WatchAct

视频 + 语言 + 对齐仿真场景 + 可执行 LIBERO task,用于“看人类行为再操作”的 behavior-grounded benchmark。

AGENTVLA 相关P1观察

OmniAct

面向 everyday physical autonomy 的异步层级 agent 架构,把 planner、memory、verification 和 cyber-physical action space 组合起来。

WAMDEXP1待细读

DexAC-WM

重新审视高 DoF dexterous action conditioning,避免把异质动作维度做粗糙统一聚合。

MANIPP1观察

CoStream

把复杂接触丰富操作拆成可组合 simple behaviors,对 GPU 插槽等长程装配任务有启发。

HUMANOIDDATAP1观察

Humanoid-DART

用 diffusion trajectory generation + RL tracking 扩展稀疏示范,面向人形 loco-manipulation 技能扩增。

VLACONTROLP2观察

ReStruct

inference-time 通过 task-structure reconfiguration 做机器人行为 steering,不改权重但引入物理可行性约束。

HUMANOIDWAM 相关P2观察

OmniContact

用 contact flow 串联 humanoid loco-manipulation meta-skills,可作为接触表示与恢复策略样本。

2026-06-25

本期判断:VLA 聚焦后训练/跨本体/几何/部署;WAM 扩到导航、人形和价值评估;DATA 标出合成、筛选、动作标签和数据引擎。

VLADATAP0已细读

InSight

可 steer 的 primitive VLA + 自主发现缺失技能,把“补数据”变成按技能缺口闭环。

VLAP0已细读

G³VLA

把相机内参、射线和投影关系显式注入多视角 VLA,补齐“多相机但不懂几何”的短板。

VLAP0已细读

FORCE

VLA reinforcement fine-tuning 候选,把纯模仿学习继续推向在线强化微调。

VLAP0已细读

ROAD-VLA

online post-training + self-distillation,对应部署分布下的持续自适应问题。

VLAP1已细读

Reflective VLA

把 observation-action-consequence 组织进上下文,与记忆增强和反思式策略相邻。

VLAP1已细读

SPACE

用 Cartesian state delta 统一跨机器人动作表示,再通过 adapter 落到具体本体。

WAMP1已细读

NavWM

导航 world model:生成多路径候选并用未来视觉想象做 foresight 评估。

WAMP1已细读

MotionWAM

把 WAM 推向人形实时全身移动操作,与 WOLF-VLA 形成 VLA/WAM 对照。

WAMP1已细读

ω-EVA

Envision-Verify-Act 闭环,在执行前用潜在世界模型设想并验证动作后果。

VLAP2已细读

WOLF-VLA

whole-body humanoid VLA 候选,把 VLA 从桌面操作扩到人形移动操作。

VLA 相关P2已细读

SVP-IL

spatial visual prompts 作为更细的模仿学习接口,与可操控策略和空间接地相关。

具身数据轨道

这里补上数据方向的入口:它们不一定都是“模型范式”论文,但决定数据怎么采、怎么合成、怎么筛、怎么变成可训练监督。完整目录见 具身数据论文索引

DATA · P0

RoboDream

世界模型作数据合成引擎,减少真机数据需求。

arXiv
DATA · WAM · P0

Qwen-RobotWorld

语言条件视频世界模型,服务合成数据、评测和规划。

arXiv
DATA · WAM · P1

GE-Sim 2.0

闭环视频世界模拟器,给策略评估与过滤式 BC 提供数据引擎。

arXiv

队列状态

待细读

已经完成相关性判断、尚未形成站内细读的研究条目。

已细读

已有站内页面,可继续沿引用、复现与上下游模型深入。

观察

方向可能重要,但仍缺项目页、代码或足够证据。

更新口径与可信度说明
  • P0:强相关且可能改变本站主线判断,优先细读。
  • P1:值得收录,可作为短细读或观察级条目。
  • P2:相关方向样本,用于补齐谱系边界。
  • 已细读:已有站内页面,但不代表全部结论已独立复现;定量信息仍以各页核查标注为准。
  • 待细读:已确认值得跟进,但尚未形成完整研究笔记。