具身星图
Embodied AI Atlas
入场中正在打开具身世界
请稍候
Skip to content
SYSTEM ONLINE · EMBODIED-AI ARCHIVE · VLA × WAM · 2022—2026UTC+8 --:--:--

具身星图

> 从经典 VLA 到前沿 WAM,把论文谱系、硬数据与产业生态连成一张可检索的研究地图

88
论文细读
50+
评测基准
57
生态公司
2
研究主线
EMBODIED-UNITVLA · WAM
运行中 · ONLINE

具身星图Embodied AI Atlas

从经典 VLA 到前沿 WAM,把论文谱系、硬数据与产业生态连成一张可检索的研究地图

VLA:按动作生成路线浏览

RESEARCH TRACK 01 · VISION → LANGUAGE → ACTION

VLA 的核心问题是:模型如何把视觉观察与语言指令,转化为可执行、可泛化的机器人动作。下面按“动作如何生成”拆成五条路线。

输入 视觉 + 语言输出 动作序列关注 泛化 + 控制
打开 VLA 完整总览
离散 token

动作即文本 token

如何让语言模型直接预测机器人动作?

输出离散动作生成自回归接口LLM 原生权衡复用 / 误差
连续 · 扩散/流匹配

连续动作生成

如何稳定生成高频、多峰连续动作?

输出连续动作块生成扩散 / 流控制高频灵巧侧重多峰分布
混合 · 连续回归

语义规划与精细控制融合

如何兼顾语义规划与低层控制精度?

输出混合动作规划高层语义控制连续回归权衡泛化 / 精度
分层 · 双系统/推理

快慢分层,推理可控

如何让慢推理与快速闭环协作?

架构双系统策略快慢分层控制快速闭环权衡深度 / 时延
新范式探索

统一基座与经验学习

如何从视频、真机反馈与记忆持续进化?

预训视频基座优化真机 RL记忆长期反思目标持续进化
03 / 05

WAM:按世界—动作建模范式浏览

RESEARCH TRACK 02 · WORLD ↔ ACTION MODELING

WAM 不只回答“下一步做什么”,还显式或隐式预测“做了之后世界会怎样”。下面按级联、联合与跨范式底座组织。

条件 状态 + 指令预测 未来 + 动作关注 闭环 + 长时程
打开 WAM 完整总览
级联 · 显式

先生成像素未来,再抽动作

显式未来能否改善可解释规划?

观测像素未来IDM动作
世界表示像素动作耦合级联核心侧重可解释
级联 · 隐式

潜空间预测 → 隐式逆动力学

不解码像素能否保留可控未来?

观测潜未来隐式 IDM动作
世界表示潜空间动作耦合级联核心侧重实时
联合 · 自回归

Token 化,因果联合生成

如何用统一因果序列建模未来与动作?

状态 token未来 token动作 token
世界表示Token动作耦合联合核心侧重长时程
联合 · 扩散

并行去噪,未来与动作同生

如何并行生成多模态未来与连续动作?

噪声未来 + 动作并行去噪
世界表示多模态动作耦合联合核心侧重高频闭环
联合 · 混合

自回归 + 扩散混合

如何让规划与连续控制各取所长?

AR 长程规划Diffusion连续控制
世界表示混合动作耦合联合核心侧重长时程
跨范式 · 基座/平台/仿真

世界模型基座 · 平台 · 仿真器

如何把世界建模变成可复用基础设施?

视频 / 仿真世界底座规划 · 控制 · 评测
世界表示多源动作耦合平台核心侧重跨任务复用
04 / 05
// ABOUT · 一张持续生长的研究星图

把复杂前沿,整理成一张可验证、可导航的研究地图

沿 VLA(视觉—语言—动作)WAM(世界—动作模型) 两条主线,串联论文细读、知识图谱、硬数据与产业生态。

01多源检索回到论文、项目页与一手资料交叉比对
02对抗核查3 票复核,作者自评不会被当作独立结论
03持续维护跟进论文、模型、数据集与公司动态

第一次来?先看 如何阅读本站;想建立全局坐标,从 VLA 总览WAM 总览 开始。

佩戴霓虹光带视觉装置的未来机器人侧脸
EMBODIED FUTURES感知 · 推理 · 行动
05 / 05