具身智能完全入门:从会聊天的 AI 到会干活的机器人

10117 字
51 分钟
具身智能完全入门:从会聊天的 AI 到会干活的机器人

AI 生成内容声明

引言:一个你可能已经见过、但没系统了解过的领域#

你可能已经刷到过这些视频:特斯拉的 Optimus 人形机器人用灵巧的手指捏起鸡蛋;宇树的机器人去年春晚在台上扭秧歌;Figure 的机器人在仓库里分拣包裹,一干就是 200 小时不间断直播;谷歌 2026 年 7 月发布的 Gemini Robotics 2 让机器人从脚到指尖全身协调地走路、下蹲、捡东西。这些视频背后的技术,属于同一个正在快速膨胀的领域——具身智能(Embodied AI / Embodied Intelligence)

如果你对这个领域完全陌生,这篇是为你写的。我们不预设任何背景,从”具身智能到底是什么”讲起,一路讲到它今天最核心的模型(VLA)、最大的瓶颈(数据)、最重要的基础设施(仿真与世界模型)、最热闹的载体(人形机器人),以及整个产业的现状和争议。读完你不仅能看懂那些演示视频在炫什么,还能大致判断哪些是真实的进步、哪些只是宣传。

先说结论式的一句话定义:具身智能,是让智能体(agent)拥有一副身体,在物理世界里通过”感知—决策—行动—再感知”的闭环与环境交互,从而完成真实任务的研究方向。ChatGPT 是”没有身体的智能”——它只能输出文字;具身智能则要求智能体”看得到、想得明白、动得了手”,并且要为每一个动作承担物理世界的后果。

为什么大模型火了之后,具身智能才跟着火#

具身智能的学术历史其实很长。哲学里的”具身认知”(embodied cognition)主张智能离不开身体——我们人类不是先在大脑里建一个完整的世界模型再行动,而是通过身体与环境持续交互才产生了智能。1991 年,机器人学家 Rodney Brooks 发表《Intelligence without Representation》,用”感知—行动直接耦合”的昆虫级机器人反驳了”先建模型、再推理”的经典 AI 路线,这被公认为现代具身智能的思想源头之一。图灵在 1950 年的经典论文里也提过:与其给机器模拟人脑,不如”给它最好的感官,再教它理解这个世界”。

但过去几十年,机器人的”身体”一直比”大脑”发达。传统工业机器人能精确重复同一条轨迹,但换一个工件、换一个环境就得工程师重新编程;学术界研究了多年的 SLAM、运动规划、最优控制,在实验室里很漂亮,一到开放环境就脆弱不堪。问题的根源是:机器人缺少一个能理解世界的通用”大脑”。每个任务都要人工拆解成”识别物体→判断状态→选择动作”,而这些中间步骤的接口都是人手写的,换一个场景就崩。

2023 年前后,大语言模型(LLM)改变了这个局面。ChatGPT 证明了一件事:互联网规模的文本预训练,可以让一个模型获得惊人的通用语义理解与推理能力。研究者立刻想到:如果把这个”大脑”装进机器人的身体呢?于是出现了一批把大模型与机器人结合的工作:先是用 LLM 做高层任务规划(SayCan,2022 年),再是把视觉、语言、动作全部揉进同一个端到端模型(RT-2,2023 年),最后是高频连续控制的通用模型(π0,2024 年)。到今天,“大模型做大脑、机器人做身体”已经成了整个行业的共识路线。

为什么是这几年爆发,还有三个现实因素:

  • 硬件成熟了:高功率密度电机、谐波减速器、六维力传感器、触觉传感器成本不断下降,宇树的 G1 人形机器人只卖 9.9 万元,实验室买得起、量产有空间。
  • 政策与资本到位了:2025 年 3 月 5 日,李强总理作《政府工作报告》,明确提出”建立未来产业投入增长机制,培育生物制造、量子科技、具身智能、6G 等未来产业”——“具身智能”首次写进政府工作报告。资本随之涌入:2025 年 1 至 10 月,国内具身智能领域融资总额超过 500 亿元、融资事件超 200 起,较 2024 年全年增长超过 400%。
  • 算力与工具链就绪:端侧 GPU(如 NVIDIA Jetson 系列)、仿真平台(MuJoCo、Isaac Sim、Genesis)和开源数据集让研究门槛大幅降低。

一句话概括现状:2026 年的具身智能,处于”大脑刚成型、身体开始量产、数据还远远不够、应用正在从演示走向验收”的阶段

具身智能的全局框架:感知—决策—行动闭环#

要理解这个领域,先掌握它的骨架。任何一个具身智能系统,本质上都在运行一个循环:

  1. 感知(Perception):通过传感器读取环境。最常见的是一到三个摄像头(看物体、看手、看全局),加上本体传感器——关节角度、电机转速、力/力矩、IMU(惯导,用于平衡)。触觉传感器也在快速普及,Figure 03 的指尖就装了触觉阵列。
  2. 决策(Decision):把感知结果和用户指令(自然语言,比如”把抽屉里的苹果放到桌上”)合在一起,决定下一步做什么、动作做到什么程度。
  3. 行动(Action):把决策翻译成电机指令,驱动关节运动。动作往往以”动作块”(action chunk)的形式一次性输出未来几十个时间步的轨迹。
  4. 反馈(Feedback):行动改变了世界,新的传感器读数回到第 1 步。

这个循环有两个关键特征,决定了它和”纯软件 AI”的本质区别:

  • 实时性约束:机器人的控制频率是硬指标。桌面机械臂常见 20–50 Hz,灵巧操作要 50 Hz 以上,全身平衡控制要到 1 kHz 量级。模型想清楚要 2 秒?那机器人已经摔倒了。这与 LLM”慢慢想没关系”完全不同。
  • 后果真实且不可逆:LLM 答错一道题,刷新重来;机器人抓错一个物体,可能打翻杯子、撞到人。所以系统必须分层——高层想慢一点没关系,底层必须在毫秒级兜住安全和稳定。

大脑、小脑与脊髓:三层结构#

把上面的闭环按时间尺度切开,自然得到三层结构,这也是今天所有产品级机器人系统的标准解剖方式:

层次类比职责典型频率典型实现
大脑System 2语义理解、任务分解、长程规划1–10 Hz视觉-语言模型(VLM),如 Helix 的 7B VLM、GR00T N1 的视觉-语言模块
小脑System 1把”意图”变成平滑的关节运动轨迹100–200 Hz小规模动作网络,如 Helix 的 80M 参数 Transformer、GR00T N1 的扩散 Transformer
脊髓System 0关节伺服、全身平衡、安全兜底1 kHz传统控制 + 学习型全身控制器,如 Helix 02 的 1000 万参数神经网络控制器

“System 1 / System 2”这个命名借自丹尼尔·卡尼曼《思考,快与慢》——慢思考负责语义和推理,快系统负责本能反应。2025 年,Figure 的 Helix、NVIDIA 的 GR00T N1、谷歌的 Gemini Robotics 三家互不知情地收敛到了同一套双系统设计,这成了行业的标志性共识;2026 年 Figure 又补上了第三层 System 0(1 kHz 全身控制器),把”脊髓反射”也交给神经网络。

两种路线:模块化流水线 vs 端到端大模型#

在这个框架下,历史上存在两条截然不同的实现路线:

传统模块化路线:感知(目标检测、SLAM 建图)、规划(任务规划、运动规划)、控制(MPC、PID)各自独立开发,用人工定义的接口拼装。优点是每一层都可解释、可调试;缺点是语义信息在层间传递中大量丢失——“把苹果放进抽屉”这句话,需要工程师预先定义”苹果""抽屉”的检测器、抓取姿态、运动约束,任何一环换环境就要重新调。开放世界任务对这条路基本无解。

端到端大模型路线:把”像素 + 语言”直接映射到”动作”,中间不设人工接口。模型的语义理解能力来自互联网规模的预训练,天然”认识”苹果和抽屉。这条路从 2023 年的 RT-2 开始成型,今天主流产品(Helix、GR00T N1、Gemini Robotics、π0)全部走这条路。端到端的代价是:中间过程不可解释、需要海量高质量数据、调试困难。它是”大脑—小脑”分层的,但每一层内部都是端到端训练的。

时间线:具身智能是怎么一步步火起来的#

时间里程碑意义
2022-04SayCan(Google)用 LLM 做任务规划、用技能库打分执行,第一个”大模型指挥机器人”
2022-12RT-1(Google)第一个现代 Transformer 机器人策略,130k 条演示数据,已见任务成功率 97%
2023-03PaLM-E(Google)参数最高达 562B 的具身多模态大模型,把机器人状态也当作”token”
2023-07RT-2(Google DeepMind)“VLA”概念诞生:动作写成文本 token 与互联网数据共同微调,6k 次评估中泛化能力超 RT-1 三倍
2023-10Open X-Embodiment跨机构数据集,22 种机器人本体、100 万+条演示,训练跨本体通用策略
2024-02Genie(DeepMind)从无标注互联网视频学出”可交互世界”,世界模型路线起点之一
2024-10π0(Physical Intelligence)首个流匹配(flow matching)VLA,50 Hz 灵巧操作,代表”连续动作”路线
2024-12Genesis 开源生成式物理仿真平台,比实时快 43 万倍,数据瓶颈的破局尝试
2025-02Helix(Figure)首个板载嵌入式 GPU 的双系统 VLA,35 自由度上半身高频控制,双机协作
2025-03GR00T N1(NVIDIA)/ Gemini Robotics(Google)人形机器人基础模型走向”开源平台”与”通用大脑”两种商业模式
2025-04π0.5(Physical Intelligence)首次在完全陌生的住宅里完成长时程灵巧任务,证明跨本体数据规模化有效
2025-06V-JEPA 2(Meta)自监督世界模型:100 万小时视频预训练,62 小时机器人视频即可零样本规划
2025-10Figure 03 发布面向家庭与商用的消费级人形平台,指尖触觉、2kW 无线充电
2026-07Figure 03 第 1000 台下线;Gemini Robotics 2 发布量产拐点信号;全身端到端控制与多机器人协作成为新战场

下面按”模型—数据—仿真—硬件—产业”五条线分别展开。

核心引擎:VLA 模型是怎样工作的#

今天具身智能的技术核心,是 VLA(Vision-Language-Action,视觉-语言-动作)模型。VLA 的输入是图像(可能多路)和语言指令,输出直接是动作。它把”看、想、动”放进同一个模型里端到端训练,是”大脑+小脑”的主体。

输入:模型”看”什么#

  • 图像:通常 1–3 路摄像头,包括第三人称视角(看桌面/场景)和手腕/手掌视角(看手和抓取对象)。图像送入预训练的视觉编码器(如 CLIP、SigLIP、DINOv2 这类视觉 Transformer),得到视觉 token。
  • 语言指令:如”把蓝色马克杯放进抽屉”,由分词器变成文本 token。
  • 本体状态:关节角度、速度、夹爪开合度等,编码成少量 token 或直接拼进特征。没有这部分,模型不知道自己的手现在在哪。

输出:动作的两种表示方式#

机器人动作是连续的高维向量——每个关节一个角度值,加上频率要求,一个”动作”其实是一串未来若干时间步的轨迹。VLA 之间最大的分歧,就是怎么把连续动作变成模型能输出的东西。目前有两条主流路线。

路线一:离散动作 token(RT-2 开创)。把每个关节的动作值量化成 8 位(256 个桶),变成一个”文本 token”追加到序列末尾,让模型像生成文字一样自回归地生成动作序列。量化公式很朴素:

bin(x)=xxminxmaxxmin×255\text{bin}(x) = \left\lfloor \frac{x - x_{\min}}{x_{\max} - x_{\min}} \times 255 \right\rfloor

其中 xx 是某个自由度的动作值,xminx_{\min}xmaxx_{\max} 是预定义的动作范围,\lfloor \cdot \rfloor 是向下取整。比如关节角 0.5 弧度、范围 [1,1][-1, 1],就映射到 bin 191(约 75%)。RT-2 就是用这个办法,把”动作”和”文字”塞进同一个序列,从而可以直接复用大模型的训练和推理基础设施——这是它最大的工程价值:动作和语言共用同一套 token 生态,互联网知识就能顺理成章地流进机器人控制

但离散化有代价:8 位量化带来动作精度损失;自回归生成一串动作 token 慢(每步一个 token、逐个解码);而且离散分布表达能力有限,难以表示高频平滑轨迹。π0 论文的实验里,基于自回归离散化的 OpenVLA 在需要 50 Hz 高频动作块的任务上明显落后。

路线二:连续动作 + 流匹配(π0 开创)。Physical Intelligence 在 2024 年 10 月发表的 π0 论文中,用**流匹配(flow matching)**直接生成连续动作。直觉如下:生成一个动作轨迹,等价于”把一个纯噪声轨迹逐渐变形为目标动作轨迹”。训练时,在噪声 x0\mathbf{x}_0 和目标轨迹 x1\mathbf{x}_1 之间做线性插值:

xτ=(1τ)x0+τx1,τ[0,1]\mathbf{x}_\tau = (1 - \tau)\,\mathbf{x}_0 + \tau\,\mathbf{x}_1, \quad \tau \in [0, 1]

τ\tau 是插值进度:τ=0\tau=0 时是纯噪声,τ=1\tau=1 时是真实动作轨迹。模型 vθ\mathbf{v}_\theta 的任务是学会”在这一步应该朝哪个方向移动”——即速度场。训练目标是让预测速度逼近真实速度 x1x0\mathbf{x}_1 - \mathbf{x}_0

L=Eτ,x1[vθ(xτ,τ,c)(x1x0)2]\mathcal{L} = \mathbb{E}_{\tau,\,\mathbf{x}_1}\left[\left\| \mathbf{v}_\theta\left(\mathbf{x}_\tau, \tau, \mathbf{c}\right) - \left(\mathbf{x}_1 - \mathbf{x}_0\right) \right\|^2\right]

这里 c\mathbf{c} 是条件——图像、语言、本体状态的融合表征,E\mathbb{E} 表示对随机采样的 τ\tau 和目标轨迹求期望。推理时,从一个随机噪声轨迹出发,让模型沿着学到的速度场迭代(π0 用 10 步)逐步逼近真实动作分布,采样出一条动作轨迹。对比离散 token:流匹配直接输出连续值,无量化误差,一步生成整条轨迹(无需逐个 token 自回归),而且天然能表达多峰分布——同一任务有多种合理解法时(比如可以从左边或右边抓杯子),它不会像均方误差回归那样把多种解法”平均”成一个不可能的动作。这是 π0 选择流匹配的深层原因。

动作块(Action Chunking):一次预测未来 50 步#

无论哪种表示,VLA 都不是”每步推理一次”,而是一次预测未来 H 步的动作块,π0 取 H=50H = 50。原因有三:

  1. 匹配控制频率:灵巧操作要 50 Hz 控制,而一次模型推理要几百毫秒,逐帧推理跟不上。一次输出 50 步(1 秒的动作),按 20 Hz 的机器人每 0.8 秒重新推理一次即可衔接。
  2. 减少复合误差:自回归逐帧预测时,误差会逐帧累积;一次性预测整块轨迹,模型内部可以做全局协调。
  3. 平滑性:块内动作天然平滑,不会出现帧间抖动。

代价是动作块之间可能出现接缝——π0 论文里提到尝试过块间动作平均,反而损害性能,最终选择开环执行(块内不再修正)。

π0 的架构:一个模型,两套专家#

π0 的架构是当前 VLA 设计的代表,值得细看。它基于一个 7B 参数的预训练视觉-语言模型(PaliGemma),图像和语言先经过 VLM backbone 得到融合表征;然后动作由一个**动作专家(action expert)**模块生成——这是一个约 3 亿参数的稀疏 MoE(混合专家)网络,特征维度 1024、MLP 维度 4096,接收融合表征和带噪声的动作块,输出每一步的速度场。

关键设计是Transfusion 式联合训练:同一个模型、同一次前向,语言/图像 token 走交叉熵损失(离散),动作 token 走流匹配损失(连续),两者共享 backbone。这样动作专家能继承 VLM 全部语义知识,同时只为了动作质量单独优化。动作专家刻意做得小(3 亿 vs 70 亿),因为推理时流匹配要迭代 10 次前向,太大则达不到 50 Hz。

下面这张是 π0 论文的框架总览图(Figure 3):左侧是预训练数据混合(自有的灵巧操作数据集 + Open X-Embodiment 等开源数据,合计一万小时、7 种机器人本体),中间是流匹配 VLA 模型本身——大的 VLM 骨干(权重从 PaliGemma 初始化,提供互联网预训练的表征)加一个专门处理机器人状态与动作的小动作专家,右侧是它最终控制的多种机器人平台:

π0 框架总览:数据混合训练流匹配 VLA——大 VLM 骨干加小动作专家,控制多种机器人本体(图片来源:π0 论文 Figure 3)
π0 框架总览:数据混合训练流匹配 VLA——大 VLM 骨干加小动作专家,控制多种机器人本体(图片来源:π0 论文 Figure 3)

π0 的能力上限直接看论文里的演示图(Figure 2)最有说服力:一个带轮子的移动操作机器人(基座 + 机械臂)端到端地完成叠衣服全流程——从烘干机取出衣物、装入衣篮、把衣篮搬到折叠台、再逐件折叠。这类”取—搬—折”的多阶段灵巧任务正是离散 token 类 VLA 此前做不好的场景:

π0 控制移动操作机器人叠衣服:取衣、装篮、搬运、逐件折叠(图片来源:π0 论文 Figure 2)
π0 控制移动操作机器人叠衣服:取衣、装篮、搬运、逐件折叠(图片来源:π0 论文 Figure 2)

RT-2 的架构:把动作变成语言的一部分#

回到 2023 年的开山之作 RT-2,它的设计更简单也更激进:在预训练的视觉-语言模型(PaLI-X 55B / PaLM-E 5B)上,把机器人演示数据和互联网视觉-语言任务数据(如视觉问答)混合微调(co-fine-tune)。动作被量化成文本 token 直接拼进序列,模型对机器人数据学”动作语言”,对互联网数据学”世界知识”,两者在同一个模型里互相增益:

RT-2 共微调架构:机器人轨迹数据与互联网视觉-语言数据混合训练,动作以文本 token 形式输出(图片来源:RT-2 论文 arXiv:2307.15818)
RT-2 共微调架构:机器人轨迹数据与互联网视觉-语言数据混合训练,动作以文本 token 形式输出(图片来源:RT-2 论文 arXiv:2307.15818)

RT-2 的评估数据说明了这条路的价值。下图为论文的总体性能对比(Figure 4):按”已见训练任务”与三类泛化评估(未见物体、未见背景、未见环境)分组,每组又分简单/困难案例,柱高即成功率。RT-2 的两种实例(55B 的 PaLI-X 基座与 PaLM-E 基座)在已见任务上与 RT-1 相当,但在所有泛化类别上明显拉开差距——平均成功率是此前最强基线 RT-1 的 3 倍以上,例如未见物体上约 62%(RT-1 只有 32%):

RT-2 总体性能:已见任务及未见物体/背景/环境三类泛化评估的成功率对比(图片来源:RT-2 论文 Figure 4)
RT-2 总体性能:已见任务及未见物体/背景/环境三类泛化评估的成功率对比(图片来源:RT-2 论文 Figure 4)

RT-1 本身在已见任务上已经达到 97%,但一换场景就掉到 32%——这正是”大模型知识注入动作”前后最鲜明的对比:RT-2 认识”香蕉”和”垃圾桶”不是因为在机器人数据里见过它们,而是因为互联网图片教会了它。

双系统与”大小脑”分工#

单模型 VLA 有一个矛盾:模型越大、语义越强,推理越慢,跟不上控制频率。2025 年三家公司的解法殊途同归——拆成两个模型

  • Figure Helix(2025 年 2 月):System 2 是约 7B 参数的 VLM,7–9 Hz 慢推理,负责理解任务和规划;System 1 是 8000 万参数的 Transformer,200 Hz 快速生成连续动作。两个模型协同,首次实现对整个人形机器人上半身 35 个自由度的连续控制,并只用一套权重同时控制两台机器人协作,且完全跑在嵌入式低功耗 GPU 上。
  • NVIDIA GR00T N1(2025 年 3 月,全球首个开源人形机器人基础模型):System 2 是 10 Hz 的视觉-语言模块,System 1 是 120 Hz 的扩散 Transformer,权重开源。
  • Google Gemini Robotics(2025 年 3 月):在 Gemini 2.0 基础上把动作做成模型的原生模态,同时提供”具身推理”版本(Gemini Robotics-ER)负责规划。

双系统解决了”慢思考+快动作”的矛盾,也让 VLA 从实验室走向产品。2026 年 7 月 30 日,谷歌发布 Gemini Robotics 2,把控制范围从”上半身”扩展到从脚到指尖的全身——走路、下蹲、伸展、抓取一体化,还首次支持不同类型机器人实时协作;同系列的 On-Device 2 轻量版只需几小时数据就能适配新本体。

数据:具身智能最大的瓶颈#

模型架构半年一换,但所有人都承认:具身智能当前最大的瓶颈不是模型,是数据。LLM 有整个互联网做语料,机器人却几乎没有”动作语料”——互联网上没有机器人动作轨迹。这带来一个残酷的数量级对比:一个 VLA 的预训练数据量以”万小时”计,而高质量机器人演示数据的采集,靠的是人拿着遥操作设备一帧一帧地教。

三种数据来源#

1. 遥操作(Teleoperation)数据。人类操作员通过示教器或特制设备(如斯坦福的 ALOHA 低成本双臂系统,2023 年开源)控制机器人演示任务,同时记录全部传感器读数。优点:动作质量高、有明确的”正确答案”;缺点:采集慢、成本高、难以规模化。RT-1 的 130k 条演示就是这样攒出来的。这是目前质量最高的数据,也是各家公司重金自建”数据工厂”的原因(智元机器人在上海就建了数据采集工厂,让工人”教”机器人收拾碗筷、叠衣服)。

2. 人类视频数据。第一人称视频(如 Meta 的 Ego4D,3670 小时)里有人做任务的完整过程,却没有动作标签。近年出现的”潜在动作(latent action)“技术可以从视频里提取隐式的动作表示,让模型从无标签人类视频中学习。优点:规模潜力巨大;缺点:人的身体结构和机器人不同(具身差异,embodiment gap),视角也不同,数据利用率低。

3. 仿真数据。在物理仿真器里大规模并行生成训练数据,速度可以远超实时(见下一节)。优点:便宜、可无限生成、可自由改变场景;缺点:仿真与真实物理有差距(sim2real gap),完全在仿真里练的策略直接上真机往往不行。

重要的公开数据集#

  • Open X-Embodiment(2023 年 10 月,Google 牵头、34 家机构共建):22 种机器人本体、100 万+条演示轨迹,目标就是训练”跨本体”的通用策略——同一个模型换一个机器人也能用。π0 的预训练就大量使用了它。
  • DROID(斯坦福等,2024 年):564 个家庭环境中采集的 7.6 万条演示,是目前最大规模的”真实家庭”操作数据集。
  • AgiBot World(智元机器人,2024 年底):百万级轨迹级别的国产大规模数据集,含多种精细操作。
  • LIBERO:一套基准仿真任务集,VLA 社区事实上的”跑分场”,openpi 等项目都用它验证微调效果。

数据策略:模仿学习为主,跨本体规模化#

当前 VLA 的训练主流程是模仿学习:把演示数据当作监督信号,训练模型”看到同样的输入就输出演示里那样的动作”,本质上就是监督学习。强化学习(RL)在真实机器人上困难重重——采样慢、成本高、奖励函数难设计,所以 RL 主要用在仿真里做提升。

最有说服力的数据实验来自 π0.5(Physical Intelligence,2025 年 4 月)。它的预训练数据里只有 2.4% 来自”目标机器人平台”,其余 97.6% 全部是其他机器人、其他实验室的数据和网络数据;后训练阶段再用少量住宅场景演示微调。结果 π0.5 在三个从未见过的真实住宅里,完成了”清洁厨房、整理卧室”这类长时程、灵巧的开放式任务(把物品放进抽屉、衣服放进洗衣篮、餐具放进水槽)。更关键的是,预训练场景数从 3 个增加到 104 个时,任务平均性能持续提升——这说明跨本体、跨平台的数据规模化是有收益的,具身智能正沿着”数据飞轮”的道路走,只是比 LLM 慢得多。

仿真与世界模型:先在虚拟世界练一万遍#

机器人不能拿真机无限试错,于是仿真成了具身智能的第二根支柱。它承担三个职责:生成训练数据、大规模评测模型、安全地测试危险场景。

Genesis:把仿真加速到 43 万倍实时#

2024 年 12 月,卡内基梅隆、斯坦福、MIT CSAIL、NVIDIA、清华等 20 多家机构的华人团队历时两年打造的开源平台 Genesis 发布,把”生成式仿真”带进了主流视野。它同时是四样东西:一个从零重写的通用物理引擎(刚体、流体、软体、颗粒、布料都支持)、一个纯 Python 的机器人仿真平台、一个光追级照片真实感渲染器、以及一个生成式数据引擎——用自然语言就能让平台自动生成场景、任务、奖励函数、资产、策略和带物理规律的视频。

Genesis 最震撼的是速度:在单张 RTX 4090 上模拟 Franka 机械臂能达到 4300 万 FPS——比真实世界快约 43 万倍,比 Isaac Gym、MuJoCo MJX 等主流 GPU 加速仿真器快 10–80 倍;曾演示在 26 秒内训练出一个可迁移到真机的运动策略。NVIDIA 的 Jim Fan 评价说,一个小时的仿真计算相当于机器人获得十年的训练经验。2025 年 5 月,团队又发布了 Genesis World 1.0,开源了跨平台 GPU 编译器(Quadrants)和写实渲染器(Nyx),并给出了一个很有说服力的评测数据:机器人基础模型在真实世界里评测需要一台真机和操作员连续运行 200 多小时,而在 Genesis 里数万次测试不到 0.5 小时就能跑完,且仿真评测结果与真机 rollout 的相关性达到 0.9(Pearson 相关系数 0.8996)。

Genesis World 全栈:物理引擎、仿真平台、渲染器与生成式数据引擎的架构(图片来源:Genesis 官方文档)
Genesis World 全栈:物理引擎、仿真平台、渲染器与生成式数据引擎的架构(图片来源:Genesis 官方文档)

世界模型:让 AI 先在脑子里推演#

比仿真更进一步的是世界模型(World Model):让模型学会”世界如何演化”——给定当前状态和一个动作,预测接下来会发生什么。有了这种预测能力,机器人就可以”在脑子里试错”:想象几种动作方案各自的后果,选最好的再执行,而不是每件事都靠真实世界试错。

世界模型有三大流派(2024 年前后几乎同时出现):OpenAI 的 Sora 路线是”生成世界”(文本/图像→视频模拟);Meta 的 V-JEPA 是”理解世界”(学视觉表征但不生成像素);DeepMind 的 Genie 是”参与世界”(生成可直接交互的世界——Genie 2 在 2024 年底做到了三维可交互世界,Genie 3 在 2025 年 8 月升级为 24 fps 照片级真实感的实时交互世界,2026 年 2 月 Waymo 甚至用它构建了自动驾驶的专用世界模型)。

Meta 的 V-JEPA 2(2025 年 6 月,1.2B 参数)是理解路线的代表:在超过 100 万小时的互联网视频上用自监督掩码预测训练——遮住视频的一部分,让模型预测缺失内容。它展示了具身应用上的惊人效率:后训练的 V-JEPA 2-AC 模型只看了不到 62 小时的无标注机器人视频,就能零样本部署到两个不同实验室的 Franka 机械臂上完成抓取和搬运——不需要任务专用训练、不需要奖励信号。下图是它的整体框架:视频编码器提取时空表征,预测器学会推演未来状态,控制模块把预测变成动作:

V-JEPA 2 概览:100 万小时视频掩码去噪预训练;下游与 LLM 对齐做动作分类、视频问答等理解任务;冻结编码器后训练动作条件预测器 V-JEPA 2-AC,在模型预测控制(MPC)闭环中驱动机器人(图片来源:V-JEPA 2 论文 Figure 1)
V-JEPA 2 概览:100 万小时视频掩码去噪预训练;下游与 LLM 对齐做动作分类、视频问答等理解任务;冻结编码器后训练动作条件预测器 V-JEPA 2-AC,在模型预测控制(MPC)闭环中驱动机器人(图片来源:V-JEPA 2 论文 Figure 1)

但世界模型远未成熟,一个诚实的证据:V-JEPA 2 在”物理规则违背检测”基准(IntPhys 2)上只比随机水平略好——它能预测”看起来合理”的未来,但还不理解”一个杯子从桌上掉落应该摔碎”这种物理常识。2026 年的综述类文章把**世界行动模型(WAM)**称为下一个前沿:把”预测未来状态”和”生成动作”统一进一个模型,从而能用无标签互联网视频(Ego4D、HowTo100M)来训练——这可能是继模仿学习之后,破解数据瓶颈的下一条路。

身体与硬件:机器人本体#

模型再强,也要有身体承载。机器人本体(embodiment)是具身智能的第三根支柱,形态五花八门:机械臂(Franka、UR5e,适合桌面操作)、四足机器人(宇树 Go2、ANYmal,适合巡检)、灵巧手(多指末端)、以及最受关注的人形机器人。

为什么执着于人形#

人形机器人最大的卖点不是”像人”,而是兼容人类环境:楼梯、门把手、椅子、工具都是为人设计的,人形本体不需要改造环境就能用。代价是难:双足平衡、35+ 个自由度的高维控制、高功率密度的关节执行器,每一项都是硬骨头。所以业内的务实共识是”先有灵巧手和机械臂解决操作,人形解决移动与通用性”。

一台人形机器人由什么组成#

  • 执行器:无框力矩电机 + 谐波减速器,是成本大头——上游核心零部件(减速器、控制器、传感器、AI 芯片)在人形机器人成本里占比高达约 70%。
  • 传感器:双目/全景相机、IMU(平衡)、六维力传感器(感知接触力)、触觉传感器(Figure 03 的指尖触觉阵列让它能捏鸡蛋)。
  • 算力:嵌入式 GPU(如 NVIDIA Jetson Thor)承载 VLA 推理,Helix 这类模型已经能完全板载运行。

几个代表性本体(截至 2026 年年中)#

本体关键参数最新状态
Tesla Optimus 2.522 自由度五指灵巧手2025 年底在弗里蒙特工厂运行;V3 计划 2026 年夏季小批生产,2026 年产量目标 5 万台
Figure 0335 自由度上半身、指尖触觉、手掌摄像头、2kW 无线充电2026 年 7 月第 1000 台下线,时产 1 台、良率 80%+;已批量进驻宝马工厂(全球车企首个规模化付费商用的人形机器人项目)
宇树 G1 / H1G1 售价 9.9 万元,H1 曾上 2025 年春晚扭秧歌国产”价格屠夫”,把研究门槛打了下来
智元远征系列配合 AgiBot World 数据集上海自建数据采集工厂

产业格局:“卖大脑”与”卖整机”两条路线#

2026 年的机器人产业出现了清晰的分野:

  • 垂直整合派:Figure(自研 Helix 模型 + 自建 BotQ 工厂,2026 年 7 月第 1000 台 Figure 03 下线,规划年产能 1.2 万台,创始人目标四年交付 10 万台)、特斯拉(自研 FSD 技术栈迁移到 Optimus)。自己掌控模型、硬件、工厂,闭环最快,但重资产。
  • 平台/大脑派:谷歌明确喊出”不卖本体,只卖大脑”——Gemini Robotics 2 的目标是成为”任何机器人的操作系统”;NVIDIA 走开源生态(GR00T N1 权重开放 + Newton 物理引擎 + Cosmos 数据生成),像为 LLM 卖铲子一样为具身智能卖”模型+仿真+算力”。
  • 中国厂商:宇树、智元、优必选、众擎等以整机硬件见长,同时都在补模型能力;小鹏何小鹏预计 2026 年具备 L3 初阶能力的人形机器人将进入适度规模商业化量产。

产业与政策:一场真实的竞赛#

政策端,除了前面提到的”具身智能”首入 2025 年《政府工作报告》,还有一串配套动作:2025 年 4 月,“人形机器人技术要求”系列国家标准获批立项;2025 年 11 月,国家发改委表示我国具身智能产业正以超过 50% 的增速发展,预计 2030 年达到千亿元市场规模,并将建立健全行业准入和退出机制。地方层面,北京规划 2027 年底前突破百余项关键技术、培育千亿级产业集群;上海张江机器人谷集聚了 90 多家企业,建成了全国首个异构人形机器人训练场;深圳规划落地 50 个十亿级应用场景。

产业端的标志性事件(2026 年上半年):

  • Figure 03 的”验收季”:2026 年 6 月底批量进驻宝马南卡罗来纳工厂(此前 Figure 02 已稳定运行 11 个月、参与 3 万台宝马 X3 的生产、完成超 9 万次零部件装载);2026 年 8 月,Figure 03 在实验室自主攀爬工业梯子——无遥控、无预设动作序列,被认为是”移动与操作耦合”的首次完整呈现。但也有人提醒:爬梯子是实验室演示,时产 1 台才是体系能力,“2026 年最大的叙事风险,是把演示当验收”。
  • Gemini Robotics 2(2026 年 7 月 30 日):全身端到端控制 + 多机器人协作,标志着”大脑”竞争进入下半场。
  • 资本:Figure 2025 年 9 月融资超 10 亿美元、估值 390 亿美元;国内具身智能 2025 年融资超 500 亿元,宇树、乐聚等头部公司进入 IPO 流程。

挑战与开放问题#

把热闹放一边,这个领域公认的硬骨头还有六块:

  1. 数据稀缺与泛化:真实演示数据仍然又少又贵,跨本体迁移(embodiment gap)没有根治;长尾任务(“我的厨房”和”别人的厨房”完全不同)依然吃力。
  2. 物理常识与空间理解:世界模型对物理规律的理解还很浅(V-JEPA 2 在 IntPhys 2 上仅略优于随机);模型普遍缺乏扎实的 3D 空间表征,很多操作靠”猜”。
  3. 长时程任务与记忆:几十秒的任务已经能做了,但”把整个屋子收拾干净”这种需要长期记忆、持续学习、抗遗忘的任务还差得远。
  4. 安全与可靠性:模型会幻觉出危险动作;人机协作场景下,物理安全必须由毫秒级系统兜底(这正是 System 0 存在的原因);目前缺少公认的安全评测标准。
  5. 评测体系缺失:真实世界评测贵(一个模型测一轮要 200 小时真机),仿真评测又怕失真;业界呼吁建立”高复杂度 + 多模态 + 长时程”的统一基准。
  6. 成本与量产:谐波减速器、力矩传感器等核心零部件供给不足、良率有限;千亿市场规模是预期,真金白银的订单还在起步。

给零基础者的学习路径#

如果你对这个领域产生了兴趣,按这条路径走成本最低:

  1. 建立框架:把本文的”感知—决策—行动闭环”和”大脑/小脑/脊髓”三层模型记住,这是理解一切后续文章的地图。
  2. 读三篇论文:RT-1(看演示数据长什么样)、RT-2(看 VLA 和共微调怎么来的)、π0(看连续动作路线怎么做的)。前两篇都不长,π0 的附录值得细看。
  3. 在仿真里动手:先不要买机器人。MuJoCo 免费、入门平缓,适合跑经典控制;想体验最新工具就用 Genesis(纯 Python,文档齐全);跑分用 LIBERO 基准。
  4. 微调一个真 VLA:Physical Intelligence 的 openpi 开源了 π0/π0.5 的 PyTorch 实现和微调配置,一张消费级 GPU 就能在 LIBERO 上跑通微调——这是目前”亲手摸到 VLA”门槛最低的方式。
  5. 关注前沿方向:VLA 架构演进(扩散/流匹配、世界行动模型)、触觉与 3D 空间表征、跨本体数据规模化、板载算力优化。arXiv 的 cs.RO(机器人学)和 cs.LG 两个分类足够用了。

小结#

具身智能 = 大脑(大模型与 VLA)+ 数据(遥操作/人类视频/仿真)+ 身体(机器人本体与传感器)+ 世界模型(在虚拟世界预演),四者缺一不可。用一句话概括它和 ChatGPT 的区别:语言模型学会了”说什么”,具身智能要学会”做什么、怎么做、做错了怎么办”——后者多了真实世界的反馈闭环,也多了真实世界的全部复杂性。

2026 年的具身智能,处在”模型路线已收敛(端到端 VLA + 双系统)、数据飞轮刚开始转、人形机器人开始量产、评测与安全标准还没跟上”的早期阶段。演示视频正在变多,但离”千家万户的机器人管家”还有相当距离。对这个领域最诚实的判断是:它的每一场演示都在被放大,它的每一个瓶颈也都真实存在;但模型、数据、硬件三条曲线同时在快速上升,这是过去几十年机器人研究从未有过的局面

参考资料#

  1. RT-1: Robotics Transformer for Real-World Control at Scale(arXiv)
  2. RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control(arXiv)
  3. PaLM-E: An Embodied Multimodal Language Model(arXiv)
  4. SayCan: Do As I Can, Not As I Say(arXiv)
  5. π0: A Vision-Language-Action Flow Model for General Robot Control(arXiv)
  6. π0.5: Enhancing General Robot Control through Platform-Agnostic Co-Training(arXiv)
  7. openpi:π0/π0.5 的开源实现(GitHub)
  8. Helix 官方博客:A Vision-Language-Action Model for Generalist Humanoid Control(Figure AI)
  9. Accelerate Generalist Humanoid Robot Development with NVIDIA Isaac GR00T N1(NVIDIA 技术博客)
  10. Gemini Robotics brings AI into the physical world(Google DeepMind 博客)
  11. Genie 2: A large-scale foundation world model(Google DeepMind 博客)
  12. V-JEPA 2: Self-Supervised Video Models Enable Understanding, Prediction and Planning(arXiv)
  13. Genesis: 生成式物理仿真平台(GitHub)
  14. Genesis World 官方文档
  15. Open X-Embodiment: Robotic Learning Datasets and RT-X Models(arXiv)
  16. DROID: A Large-Scale In-The-Wild Robot Manipulation Dataset(arXiv)
  17. ALOHA: Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware(arXiv)
  18. 2025 年《政府工作报告》(中国政府网全文)
  19. 当机器人能够”爬梯子”,具身智能的验收季开始了(界面新闻)
  20. 谷歌的机器人赌局:不卖本体,只卖大脑(钛媒体)

文章分享

如果这篇文章对你有帮助,欢迎分享给更多人!

具身智能完全入门:从会聊天的 AI 到会干活的机器人
https://pinghaoyang.com.cn/aigc/posts/embodied-ai-intro/
作者
平昊阳
发布于
2026-08-23
许可协议
CC BY-NC-SA 4.0

评论区

Profile Image of the Author
平昊阳
乘长风,破巨浪, 展鸿图于未央!
--
总访问量
--
访客数
公告
欢迎来到我的个人博客!欢迎关注交流吖!
更多相关公告,见
社交-留言」。
音乐
封面

音乐

暂未播放

0:000:00
暂无歌词
站点统计
文章
66
分类
16
标签
93
总字数
477,284
运行时长
0
最后活动
0 天前

文章目录