音乐
暂未播放
具身智能完全入门:从会聊天的 AI 到会干活的机器人

引言:一个你可能已经见过、但没系统了解过的领域#
你可能已经刷到过这些视频:特斯拉的 Optimus 人形机器人用灵巧的手指捏起鸡蛋;宇树的机器人去年春晚在台上扭秧歌;Figure 的机器人在仓库里分拣包裹,一干就是 200 小时不间断直播;谷歌 2026 年 7 月发布的 Gemini Robotics 2 让机器人从脚到指尖全身协调地走路、下蹲、捡东西。这些视频背后的技术,属于同一个正在快速膨胀的领域——具身智能(Embodied AI / Embodied Intelligence)。
如果你对这个领域完全陌生,这篇是为你写的。我们不预设任何背景,从”具身智能到底是什么”讲起,一路讲到它今天最核心的模型(VLA)、最大的瓶颈(数据)、最重要的基础设施(仿真与世界模型)、最热闹的载体(人形机器人),以及整个产业的现状和争议。读完你不仅能看懂那些演示视频在炫什么,还能大致判断哪些是真实的进步、哪些只是宣传。
先说结论式的一句话定义:具身智能,是让智能体(agent)拥有一副身体,在物理世界里通过”感知—决策—行动—再感知”的闭环与环境交互,从而完成真实任务的研究方向。ChatGPT 是”没有身体的智能”——它只能输出文字;具身智能则要求智能体”看得到、想得明白、动得了手”,并且要为每一个动作承担物理世界的后果。
为什么大模型火了之后,具身智能才跟着火#
具身智能的学术历史其实很长。哲学里的”具身认知”(embodied cognition)主张智能离不开身体——我们人类不是先在大脑里建一个完整的世界模型再行动,而是通过身体与环境持续交互才产生了智能。1991 年,机器人学家 Rodney Brooks 发表《Intelligence without Representation》,用”感知—行动直接耦合”的昆虫级机器人反驳了”先建模型、再推理”的经典 AI 路线,这被公认为现代具身智能的思想源头之一。图灵在 1950 年的经典论文里也提过:与其给机器模拟人脑,不如”给它最好的感官,再教它理解这个世界”。
但过去几十年,机器人的”身体”一直比”大脑”发达。传统工业机器人能精确重复同一条轨迹,但换一个工件、换一个环境就得工程师重新编程;学术界研究了多年的 SLAM、运动规划、最优控制,在实验室里很漂亮,一到开放环境就脆弱不堪。问题的根源是:机器人缺少一个能理解世界的通用”大脑”。每个任务都要人工拆解成”识别物体→判断状态→选择动作”,而这些中间步骤的接口都是人手写的,换一个场景就崩。
2023 年前后,大语言模型(LLM)改变了这个局面。ChatGPT 证明了一件事:互联网规模的文本预训练,可以让一个模型获得惊人的通用语义理解与推理能力。研究者立刻想到:如果把这个”大脑”装进机器人的身体呢?于是出现了一批把大模型与机器人结合的工作:先是用 LLM 做高层任务规划(SayCan,2022 年),再是把视觉、语言、动作全部揉进同一个端到端模型(RT-2,2023 年),最后是高频连续控制的通用模型(π0,2024 年)。到今天,“大模型做大脑、机器人做身体”已经成了整个行业的共识路线。
为什么是这几年爆发,还有三个现实因素:
- 硬件成熟了:高功率密度电机、谐波减速器、六维力传感器、触觉传感器成本不断下降,宇树的 G1 人形机器人只卖 9.9 万元,实验室买得起、量产有空间。
- 政策与资本到位了:2025 年 3 月 5 日,李强总理作《政府工作报告》,明确提出”建立未来产业投入增长机制,培育生物制造、量子科技、具身智能、6G 等未来产业”——“具身智能”首次写进政府工作报告。资本随之涌入:2025 年 1 至 10 月,国内具身智能领域融资总额超过 500 亿元、融资事件超 200 起,较 2024 年全年增长超过 400%。
- 算力与工具链就绪:端侧 GPU(如 NVIDIA Jetson 系列)、仿真平台(MuJoCo、Isaac Sim、Genesis)和开源数据集让研究门槛大幅降低。
一句话概括现状:2026 年的具身智能,处于”大脑刚成型、身体开始量产、数据还远远不够、应用正在从演示走向验收”的阶段。
具身智能的全局框架:感知—决策—行动闭环#
要理解这个领域,先掌握它的骨架。任何一个具身智能系统,本质上都在运行一个循环:
- 感知(Perception):通过传感器读取环境。最常见的是一到三个摄像头(看物体、看手、看全局),加上本体传感器——关节角度、电机转速、力/力矩、IMU(惯导,用于平衡)。触觉传感器也在快速普及,Figure 03 的指尖就装了触觉阵列。
- 决策(Decision):把感知结果和用户指令(自然语言,比如”把抽屉里的苹果放到桌上”)合在一起,决定下一步做什么、动作做到什么程度。
- 行动(Action):把决策翻译成电机指令,驱动关节运动。动作往往以”动作块”(action chunk)的形式一次性输出未来几十个时间步的轨迹。
- 反馈(Feedback):行动改变了世界,新的传感器读数回到第 1 步。
这个循环有两个关键特征,决定了它和”纯软件 AI”的本质区别:
- 实时性约束:机器人的控制频率是硬指标。桌面机械臂常见 20–50 Hz,灵巧操作要 50 Hz 以上,全身平衡控制要到 1 kHz 量级。模型想清楚要 2 秒?那机器人已经摔倒了。这与 LLM”慢慢想没关系”完全不同。
- 后果真实且不可逆:LLM 答错一道题,刷新重来;机器人抓错一个物体,可能打翻杯子、撞到人。所以系统必须分层——高层想慢一点没关系,底层必须在毫秒级兜住安全和稳定。
大脑、小脑与脊髓:三层结构#
把上面的闭环按时间尺度切开,自然得到三层结构,这也是今天所有产品级机器人系统的标准解剖方式:
| 层次 | 类比 | 职责 | 典型频率 | 典型实现 |
|---|---|---|---|---|
| 大脑 | System 2 | 语义理解、任务分解、长程规划 | 1–10 Hz | 视觉-语言模型(VLM),如 Helix 的 7B VLM、GR00T N1 的视觉-语言模块 |
| 小脑 | System 1 | 把”意图”变成平滑的关节运动轨迹 | 100–200 Hz | 小规模动作网络,如 Helix 的 80M 参数 Transformer、GR00T N1 的扩散 Transformer |
| 脊髓 | System 0 | 关节伺服、全身平衡、安全兜底 | 1 kHz | 传统控制 + 学习型全身控制器,如 Helix 02 的 1000 万参数神经网络控制器 |
“System 1 / System 2”这个命名借自丹尼尔·卡尼曼《思考,快与慢》——慢思考负责语义和推理,快系统负责本能反应。2025 年,Figure 的 Helix、NVIDIA 的 GR00T N1、谷歌的 Gemini Robotics 三家互不知情地收敛到了同一套双系统设计,这成了行业的标志性共识;2026 年 Figure 又补上了第三层 System 0(1 kHz 全身控制器),把”脊髓反射”也交给神经网络。
两种路线:模块化流水线 vs 端到端大模型#
在这个框架下,历史上存在两条截然不同的实现路线:
传统模块化路线:感知(目标检测、SLAM 建图)、规划(任务规划、运动规划)、控制(MPC、PID)各自独立开发,用人工定义的接口拼装。优点是每一层都可解释、可调试;缺点是语义信息在层间传递中大量丢失——“把苹果放进抽屉”这句话,需要工程师预先定义”苹果""抽屉”的检测器、抓取姿态、运动约束,任何一环换环境就要重新调。开放世界任务对这条路基本无解。
端到端大模型路线:把”像素 + 语言”直接映射到”动作”,中间不设人工接口。模型的语义理解能力来自互联网规模的预训练,天然”认识”苹果和抽屉。这条路从 2023 年的 RT-2 开始成型,今天主流产品(Helix、GR00T N1、Gemini Robotics、π0)全部走这条路。端到端的代价是:中间过程不可解释、需要海量高质量数据、调试困难。它是”大脑—小脑”分层的,但每一层内部都是端到端训练的。
时间线:具身智能是怎么一步步火起来的#
| 时间 | 里程碑 | 意义 |
|---|---|---|
| 2022-04 | SayCan(Google) | 用 LLM 做任务规划、用技能库打分执行,第一个”大模型指挥机器人” |
| 2022-12 | RT-1(Google) | 第一个现代 Transformer 机器人策略,130k 条演示数据,已见任务成功率 97% |
| 2023-03 | PaLM-E(Google) | 参数最高达 562B 的具身多模态大模型,把机器人状态也当作”token” |
| 2023-07 | RT-2(Google DeepMind) | “VLA”概念诞生:动作写成文本 token 与互联网数据共同微调,6k 次评估中泛化能力超 RT-1 三倍 |
| 2023-10 | Open X-Embodiment | 跨机构数据集,22 种机器人本体、100 万+条演示,训练跨本体通用策略 |
| 2024-02 | Genie(DeepMind) | 从无标注互联网视频学出”可交互世界”,世界模型路线起点之一 |
| 2024-10 | π0(Physical Intelligence) | 首个流匹配(flow matching)VLA,50 Hz 灵巧操作,代表”连续动作”路线 |
| 2024-12 | Genesis 开源 | 生成式物理仿真平台,比实时快 43 万倍,数据瓶颈的破局尝试 |
| 2025-02 | Helix(Figure) | 首个板载嵌入式 GPU 的双系统 VLA,35 自由度上半身高频控制,双机协作 |
| 2025-03 | GR00T N1(NVIDIA)/ Gemini Robotics(Google) | 人形机器人基础模型走向”开源平台”与”通用大脑”两种商业模式 |
| 2025-04 | π0.5(Physical Intelligence) | 首次在完全陌生的住宅里完成长时程灵巧任务,证明跨本体数据规模化有效 |
| 2025-06 | V-JEPA 2(Meta) | 自监督世界模型:100 万小时视频预训练,62 小时机器人视频即可零样本规划 |
| 2025-10 | Figure 03 发布 | 面向家庭与商用的消费级人形平台,指尖触觉、2kW 无线充电 |
| 2026-07 | Figure 03 第 1000 台下线;Gemini Robotics 2 发布 | 量产拐点信号;全身端到端控制与多机器人协作成为新战场 |
下面按”模型—数据—仿真—硬件—产业”五条线分别展开。
核心引擎:VLA 模型是怎样工作的#
今天具身智能的技术核心,是 VLA(Vision-Language-Action,视觉-语言-动作)模型。VLA 的输入是图像(可能多路)和语言指令,输出直接是动作。它把”看、想、动”放进同一个模型里端到端训练,是”大脑+小脑”的主体。
输入:模型”看”什么#
- 图像:通常 1–3 路摄像头,包括第三人称视角(看桌面/场景)和手腕/手掌视角(看手和抓取对象)。图像送入预训练的视觉编码器(如 CLIP、SigLIP、DINOv2 这类视觉 Transformer),得到视觉 token。
- 语言指令:如”把蓝色马克杯放进抽屉”,由分词器变成文本 token。
- 本体状态:关节角度、速度、夹爪开合度等,编码成少量 token 或直接拼进特征。没有这部分,模型不知道自己的手现在在哪。
输出:动作的两种表示方式#
机器人动作是连续的高维向量——每个关节一个角度值,加上频率要求,一个”动作”其实是一串未来若干时间步的轨迹。VLA 之间最大的分歧,就是怎么把连续动作变成模型能输出的东西。目前有两条主流路线。
路线一:离散动作 token(RT-2 开创)。把每个关节的动作值量化成 8 位(256 个桶),变成一个”文本 token”追加到序列末尾,让模型像生成文字一样自回归地生成动作序列。量化公式很朴素:
bin(x)=⌊xmax−xminx−xmin×255⌋其中 x 是某个自由度的动作值,xmin、xmax 是预定义的动作范围,⌊⋅⌋ 是向下取整。比如关节角 0.5 弧度、范围 [−1,1],就映射到 bin 191(约 75%)。RT-2 就是用这个办法,把”动作”和”文字”塞进同一个序列,从而可以直接复用大模型的训练和推理基础设施——这是它最大的工程价值:动作和语言共用同一套 token 生态,互联网知识就能顺理成章地流进机器人控制。
但离散化有代价:8 位量化带来动作精度损失;自回归生成一串动作 token 慢(每步一个 token、逐个解码);而且离散分布表达能力有限,难以表示高频平滑轨迹。π0 论文的实验里,基于自回归离散化的 OpenVLA 在需要 50 Hz 高频动作块的任务上明显落后。
路线二:连续动作 + 流匹配(π0 开创)。Physical Intelligence 在 2024 年 10 月发表的 π0 论文中,用**流匹配(flow matching)**直接生成连续动作。直觉如下:生成一个动作轨迹,等价于”把一个纯噪声轨迹逐渐变形为目标动作轨迹”。训练时,在噪声 x0 和目标轨迹 x1 之间做线性插值:
xτ=(1−τ)x0+τx1,τ∈[0,1]τ 是插值进度:τ=0 时是纯噪声,τ=1 时是真实动作轨迹。模型 vθ 的任务是学会”在这一步应该朝哪个方向移动”——即速度场。训练目标是让预测速度逼近真实速度 x1−x0:
L=Eτ,x1[∥vθ(xτ,τ,c)−(x1−x0)∥2]这里 c 是条件——图像、语言、本体状态的融合表征,E 表示对随机采样的 τ 和目标轨迹求期望。推理时,从一个随机噪声轨迹出发,让模型沿着学到的速度场迭代(π0 用 10 步)逐步逼近真实动作分布,采样出一条动作轨迹。对比离散 token:流匹配直接输出连续值,无量化误差,一步生成整条轨迹(无需逐个 token 自回归),而且天然能表达多峰分布——同一任务有多种合理解法时(比如可以从左边或右边抓杯子),它不会像均方误差回归那样把多种解法”平均”成一个不可能的动作。这是 π0 选择流匹配的深层原因。
动作块(Action Chunking):一次预测未来 50 步#
无论哪种表示,VLA 都不是”每步推理一次”,而是一次预测未来 H 步的动作块,π0 取 H=50。原因有三:
- 匹配控制频率:灵巧操作要 50 Hz 控制,而一次模型推理要几百毫秒,逐帧推理跟不上。一次输出 50 步(1 秒的动作),按 20 Hz 的机器人每 0.8 秒重新推理一次即可衔接。
- 减少复合误差:自回归逐帧预测时,误差会逐帧累积;一次性预测整块轨迹,模型内部可以做全局协调。
- 平滑性:块内动作天然平滑,不会出现帧间抖动。
代价是动作块之间可能出现接缝——π0 论文里提到尝试过块间动作平均,反而损害性能,最终选择开环执行(块内不再修正)。
π0 的架构:一个模型,两套专家#
π0 的架构是当前 VLA 设计的代表,值得细看。它基于一个 7B 参数的预训练视觉-语言模型(PaliGemma),图像和语言先经过 VLM backbone 得到融合表征;然后动作由一个**动作专家(action expert)**模块生成——这是一个约 3 亿参数的稀疏 MoE(混合专家)网络,特征维度 1024、MLP 维度 4096,接收融合表征和带噪声的动作块,输出每一步的速度场。
关键设计是Transfusion 式联合训练:同一个模型、同一次前向,语言/图像 token 走交叉熵损失(离散),动作 token 走流匹配损失(连续),两者共享 backbone。这样动作专家能继承 VLM 全部语义知识,同时只为了动作质量单独优化。动作专家刻意做得小(3 亿 vs 70 亿),因为推理时流匹配要迭代 10 次前向,太大则达不到 50 Hz。
下面这张是 π0 论文的框架总览图(Figure 3):左侧是预训练数据混合(自有的灵巧操作数据集 + Open X-Embodiment 等开源数据,合计一万小时、7 种机器人本体),中间是流匹配 VLA 模型本身——大的 VLM 骨干(权重从 PaliGemma 初始化,提供互联网预训练的表征)加一个专门处理机器人状态与动作的小动作专家,右侧是它最终控制的多种机器人平台:

π0 的能力上限直接看论文里的演示图(Figure 2)最有说服力:一个带轮子的移动操作机器人(基座 + 机械臂)端到端地完成叠衣服全流程——从烘干机取出衣物、装入衣篮、把衣篮搬到折叠台、再逐件折叠。这类”取—搬—折”的多阶段灵巧任务正是离散 token 类 VLA 此前做不好的场景:

RT-2 的架构:把动作变成语言的一部分#
回到 2023 年的开山之作 RT-2,它的设计更简单也更激进:在预训练的视觉-语言模型(PaLI-X 55B / PaLM-E 5B)上,把机器人演示数据和互联网视觉-语言任务数据(如视觉问答)混合微调(co-fine-tune)。动作被量化成文本 token 直接拼进序列,模型对机器人数据学”动作语言”,对互联网数据学”世界知识”,两者在同一个模型里互相增益:

RT-2 的评估数据说明了这条路的价值。下图为论文的总体性能对比(Figure 4):按”已见训练任务”与三类泛化评估(未见物体、未见背景、未见环境)分组,每组又分简单/困难案例,柱高即成功率。RT-2 的两种实例(55B 的 PaLI-X 基座与 PaLM-E 基座)在已见任务上与 RT-1 相当,但在所有泛化类别上明显拉开差距——平均成功率是此前最强基线 RT-1 的 3 倍以上,例如未见物体上约 62%(RT-1 只有 32%):

RT-1 本身在已见任务上已经达到 97%,但一换场景就掉到 32%——这正是”大模型知识注入动作”前后最鲜明的对比:RT-2 认识”香蕉”和”垃圾桶”不是因为在机器人数据里见过它们,而是因为互联网图片教会了它。
双系统与”大小脑”分工#
单模型 VLA 有一个矛盾:模型越大、语义越强,推理越慢,跟不上控制频率。2025 年三家公司的解法殊途同归——拆成两个模型:
- Figure Helix(2025 年 2 月):System 2 是约 7B 参数的 VLM,7–9 Hz 慢推理,负责理解任务和规划;System 1 是 8000 万参数的 Transformer,200 Hz 快速生成连续动作。两个模型协同,首次实现对整个人形机器人上半身 35 个自由度的连续控制,并只用一套权重同时控制两台机器人协作,且完全跑在嵌入式低功耗 GPU 上。
- NVIDIA GR00T N1(2025 年 3 月,全球首个开源人形机器人基础模型):System 2 是 10 Hz 的视觉-语言模块,System 1 是 120 Hz 的扩散 Transformer,权重开源。
- Google Gemini Robotics(2025 年 3 月):在 Gemini 2.0 基础上把动作做成模型的原生模态,同时提供”具身推理”版本(Gemini Robotics-ER)负责规划。
双系统解决了”慢思考+快动作”的矛盾,也让 VLA 从实验室走向产品。2026 年 7 月 30 日,谷歌发布 Gemini Robotics 2,把控制范围从”上半身”扩展到从脚到指尖的全身——走路、下蹲、伸展、抓取一体化,还首次支持不同类型机器人实时协作;同系列的 On-Device 2 轻量版只需几小时数据就能适配新本体。
数据:具身智能最大的瓶颈#
模型架构半年一换,但所有人都承认:具身智能当前最大的瓶颈不是模型,是数据。LLM 有整个互联网做语料,机器人却几乎没有”动作语料”——互联网上没有机器人动作轨迹。这带来一个残酷的数量级对比:一个 VLA 的预训练数据量以”万小时”计,而高质量机器人演示数据的采集,靠的是人拿着遥操作设备一帧一帧地教。
三种数据来源#
1. 遥操作(Teleoperation)数据。人类操作员通过示教器或特制设备(如斯坦福的 ALOHA 低成本双臂系统,2023 年开源)控制机器人演示任务,同时记录全部传感器读数。优点:动作质量高、有明确的”正确答案”;缺点:采集慢、成本高、难以规模化。RT-1 的 130k 条演示就是这样攒出来的。这是目前质量最高的数据,也是各家公司重金自建”数据工厂”的原因(智元机器人在上海就建了数据采集工厂,让工人”教”机器人收拾碗筷、叠衣服)。
2. 人类视频数据。第一人称视频(如 Meta 的 Ego4D,3670 小时)里有人做任务的完整过程,却没有动作标签。近年出现的”潜在动作(latent action)“技术可以从视频里提取隐式的动作表示,让模型从无标签人类视频中学习。优点:规模潜力巨大;缺点:人的身体结构和机器人不同(具身差异,embodiment gap),视角也不同,数据利用率低。
3. 仿真数据。在物理仿真器里大规模并行生成训练数据,速度可以远超实时(见下一节)。优点:便宜、可无限生成、可自由改变场景;缺点:仿真与真实物理有差距(sim2real gap),完全在仿真里练的策略直接上真机往往不行。
重要的公开数据集#
- Open X-Embodiment(2023 年 10 月,Google 牵头、34 家机构共建):22 种机器人本体、100 万+条演示轨迹,目标就是训练”跨本体”的通用策略——同一个模型换一个机器人也能用。π0 的预训练就大量使用了它。
- DROID(斯坦福等,2024 年):564 个家庭环境中采集的 7.6 万条演示,是目前最大规模的”真实家庭”操作数据集。
- AgiBot World(智元机器人,2024 年底):百万级轨迹级别的国产大规模数据集,含多种精细操作。
- LIBERO:一套基准仿真任务集,VLA 社区事实上的”跑分场”,openpi 等项目都用它验证微调效果。
数据策略:模仿学习为主,跨本体规模化#
当前 VLA 的训练主流程是模仿学习:把演示数据当作监督信号,训练模型”看到同样的输入就输出演示里那样的动作”,本质上就是监督学习。强化学习(RL)在真实机器人上困难重重——采样慢、成本高、奖励函数难设计,所以 RL 主要用在仿真里做提升。
最有说服力的数据实验来自 π0.5(Physical Intelligence,2025 年 4 月)。它的预训练数据里只有 2.4% 来自”目标机器人平台”,其余 97.6% 全部是其他机器人、其他实验室的数据和网络数据;后训练阶段再用少量住宅场景演示微调。结果 π0.5 在三个从未见过的真实住宅里,完成了”清洁厨房、整理卧室”这类长时程、灵巧的开放式任务(把物品放进抽屉、衣服放进洗衣篮、餐具放进水槽)。更关键的是,预训练场景数从 3 个增加到 104 个时,任务平均性能持续提升——这说明跨本体、跨平台的数据规模化是有收益的,具身智能正沿着”数据飞轮”的道路走,只是比 LLM 慢得多。
仿真与世界模型:先在虚拟世界练一万遍#
机器人不能拿真机无限试错,于是仿真成了具身智能的第二根支柱。它承担三个职责:生成训练数据、大规模评测模型、安全地测试危险场景。
Genesis:把仿真加速到 43 万倍实时#
2024 年 12 月,卡内基梅隆、斯坦福、MIT CSAIL、NVIDIA、清华等 20 多家机构的华人团队历时两年打造的开源平台 Genesis 发布,把”生成式仿真”带进了主流视野。它同时是四样东西:一个从零重写的通用物理引擎(刚体、流体、软体、颗粒、布料都支持)、一个纯 Python 的机器人仿真平台、一个光追级照片真实感渲染器、以及一个生成式数据引擎——用自然语言就能让平台自动生成场景、任务、奖励函数、资产、策略和带物理规律的视频。
Genesis 最震撼的是速度:在单张 RTX 4090 上模拟 Franka 机械臂能达到 4300 万 FPS——比真实世界快约 43 万倍,比 Isaac Gym、MuJoCo MJX 等主流 GPU 加速仿真器快 10–80 倍;曾演示在 26 秒内训练出一个可迁移到真机的运动策略。NVIDIA 的 Jim Fan 评价说,一个小时的仿真计算相当于机器人获得十年的训练经验。2025 年 5 月,团队又发布了 Genesis World 1.0,开源了跨平台 GPU 编译器(Quadrants)和写实渲染器(Nyx),并给出了一个很有说服力的评测数据:机器人基础模型在真实世界里评测需要一台真机和操作员连续运行 200 多小时,而在 Genesis 里数万次测试不到 0.5 小时就能跑完,且仿真评测结果与真机 rollout 的相关性达到 0.9(Pearson 相关系数 0.8996)。

世界模型:让 AI 先在脑子里推演#
比仿真更进一步的是世界模型(World Model):让模型学会”世界如何演化”——给定当前状态和一个动作,预测接下来会发生什么。有了这种预测能力,机器人就可以”在脑子里试错”:想象几种动作方案各自的后果,选最好的再执行,而不是每件事都靠真实世界试错。
世界模型有三大流派(2024 年前后几乎同时出现):OpenAI 的 Sora 路线是”生成世界”(文本/图像→视频模拟);Meta 的 V-JEPA 是”理解世界”(学视觉表征但不生成像素);DeepMind 的 Genie 是”参与世界”(生成可直接交互的世界——Genie 2 在 2024 年底做到了三维可交互世界,Genie 3 在 2025 年 8 月升级为 24 fps 照片级真实感的实时交互世界,2026 年 2 月 Waymo 甚至用它构建了自动驾驶的专用世界模型)。
Meta 的 V-JEPA 2(2025 年 6 月,1.2B 参数)是理解路线的代表:在超过 100 万小时的互联网视频上用自监督掩码预测训练——遮住视频的一部分,让模型预测缺失内容。它展示了具身应用上的惊人效率:后训练的 V-JEPA 2-AC 模型只看了不到 62 小时的无标注机器人视频,就能零样本部署到两个不同实验室的 Franka 机械臂上完成抓取和搬运——不需要任务专用训练、不需要奖励信号。下图是它的整体框架:视频编码器提取时空表征,预测器学会推演未来状态,控制模块把预测变成动作:

但世界模型远未成熟,一个诚实的证据:V-JEPA 2 在”物理规则违背检测”基准(IntPhys 2)上只比随机水平略好——它能预测”看起来合理”的未来,但还不理解”一个杯子从桌上掉落应该摔碎”这种物理常识。2026 年的综述类文章把**世界行动模型(WAM)**称为下一个前沿:把”预测未来状态”和”生成动作”统一进一个模型,从而能用无标签互联网视频(Ego4D、HowTo100M)来训练——这可能是继模仿学习之后,破解数据瓶颈的下一条路。
身体与硬件:机器人本体#
模型再强,也要有身体承载。机器人本体(embodiment)是具身智能的第三根支柱,形态五花八门:机械臂(Franka、UR5e,适合桌面操作)、四足机器人(宇树 Go2、ANYmal,适合巡检)、灵巧手(多指末端)、以及最受关注的人形机器人。
为什么执着于人形#
人形机器人最大的卖点不是”像人”,而是兼容人类环境:楼梯、门把手、椅子、工具都是为人设计的,人形本体不需要改造环境就能用。代价是难:双足平衡、35+ 个自由度的高维控制、高功率密度的关节执行器,每一项都是硬骨头。所以业内的务实共识是”先有灵巧手和机械臂解决操作,人形解决移动与通用性”。
一台人形机器人由什么组成#
- 执行器:无框力矩电机 + 谐波减速器,是成本大头——上游核心零部件(减速器、控制器、传感器、AI 芯片)在人形机器人成本里占比高达约 70%。
- 传感器:双目/全景相机、IMU(平衡)、六维力传感器(感知接触力)、触觉传感器(Figure 03 的指尖触觉阵列让它能捏鸡蛋)。
- 算力:嵌入式 GPU(如 NVIDIA Jetson Thor)承载 VLA 推理,Helix 这类模型已经能完全板载运行。
几个代表性本体(截至 2026 年年中)#
| 本体 | 关键参数 | 最新状态 |
|---|---|---|
| Tesla Optimus 2.5 | 22 自由度五指灵巧手 | 2025 年底在弗里蒙特工厂运行;V3 计划 2026 年夏季小批生产,2026 年产量目标 5 万台 |
| Figure 03 | 35 自由度上半身、指尖触觉、手掌摄像头、2kW 无线充电 | 2026 年 7 月第 1000 台下线,时产 1 台、良率 80%+;已批量进驻宝马工厂(全球车企首个规模化付费商用的人形机器人项目) |
| 宇树 G1 / H1 | G1 售价 9.9 万元,H1 曾上 2025 年春晚扭秧歌 | 国产”价格屠夫”,把研究门槛打了下来 |
| 智元远征系列 | 配合 AgiBot World 数据集 | 上海自建数据采集工厂 |
产业格局:“卖大脑”与”卖整机”两条路线#
2026 年的机器人产业出现了清晰的分野:
- 垂直整合派:Figure(自研 Helix 模型 + 自建 BotQ 工厂,2026 年 7 月第 1000 台 Figure 03 下线,规划年产能 1.2 万台,创始人目标四年交付 10 万台)、特斯拉(自研 FSD 技术栈迁移到 Optimus)。自己掌控模型、硬件、工厂,闭环最快,但重资产。
- 平台/大脑派:谷歌明确喊出”不卖本体,只卖大脑”——Gemini Robotics 2 的目标是成为”任何机器人的操作系统”;NVIDIA 走开源生态(GR00T N1 权重开放 + Newton 物理引擎 + Cosmos 数据生成),像为 LLM 卖铲子一样为具身智能卖”模型+仿真+算力”。
- 中国厂商:宇树、智元、优必选、众擎等以整机硬件见长,同时都在补模型能力;小鹏何小鹏预计 2026 年具备 L3 初阶能力的人形机器人将进入适度规模商业化量产。
产业与政策:一场真实的竞赛#
政策端,除了前面提到的”具身智能”首入 2025 年《政府工作报告》,还有一串配套动作:2025 年 4 月,“人形机器人技术要求”系列国家标准获批立项;2025 年 11 月,国家发改委表示我国具身智能产业正以超过 50% 的增速发展,预计 2030 年达到千亿元市场规模,并将建立健全行业准入和退出机制。地方层面,北京规划 2027 年底前突破百余项关键技术、培育千亿级产业集群;上海张江机器人谷集聚了 90 多家企业,建成了全国首个异构人形机器人训练场;深圳规划落地 50 个十亿级应用场景。
产业端的标志性事件(2026 年上半年):
- Figure 03 的”验收季”:2026 年 6 月底批量进驻宝马南卡罗来纳工厂(此前 Figure 02 已稳定运行 11 个月、参与 3 万台宝马 X3 的生产、完成超 9 万次零部件装载);2026 年 8 月,Figure 03 在实验室自主攀爬工业梯子——无遥控、无预设动作序列,被认为是”移动与操作耦合”的首次完整呈现。但也有人提醒:爬梯子是实验室演示,时产 1 台才是体系能力,“2026 年最大的叙事风险,是把演示当验收”。
- Gemini Robotics 2(2026 年 7 月 30 日):全身端到端控制 + 多机器人协作,标志着”大脑”竞争进入下半场。
- 资本:Figure 2025 年 9 月融资超 10 亿美元、估值 390 亿美元;国内具身智能 2025 年融资超 500 亿元,宇树、乐聚等头部公司进入 IPO 流程。
挑战与开放问题#
把热闹放一边,这个领域公认的硬骨头还有六块:
- 数据稀缺与泛化:真实演示数据仍然又少又贵,跨本体迁移(embodiment gap)没有根治;长尾任务(“我的厨房”和”别人的厨房”完全不同)依然吃力。
- 物理常识与空间理解:世界模型对物理规律的理解还很浅(V-JEPA 2 在 IntPhys 2 上仅略优于随机);模型普遍缺乏扎实的 3D 空间表征,很多操作靠”猜”。
- 长时程任务与记忆:几十秒的任务已经能做了,但”把整个屋子收拾干净”这种需要长期记忆、持续学习、抗遗忘的任务还差得远。
- 安全与可靠性:模型会幻觉出危险动作;人机协作场景下,物理安全必须由毫秒级系统兜底(这正是 System 0 存在的原因);目前缺少公认的安全评测标准。
- 评测体系缺失:真实世界评测贵(一个模型测一轮要 200 小时真机),仿真评测又怕失真;业界呼吁建立”高复杂度 + 多模态 + 长时程”的统一基准。
- 成本与量产:谐波减速器、力矩传感器等核心零部件供给不足、良率有限;千亿市场规模是预期,真金白银的订单还在起步。
给零基础者的学习路径#
如果你对这个领域产生了兴趣,按这条路径走成本最低:
- 建立框架:把本文的”感知—决策—行动闭环”和”大脑/小脑/脊髓”三层模型记住,这是理解一切后续文章的地图。
- 读三篇论文:RT-1(看演示数据长什么样)、RT-2(看 VLA 和共微调怎么来的)、π0(看连续动作路线怎么做的)。前两篇都不长,π0 的附录值得细看。
- 在仿真里动手:先不要买机器人。MuJoCo 免费、入门平缓,适合跑经典控制;想体验最新工具就用 Genesis(纯 Python,文档齐全);跑分用 LIBERO 基准。
- 微调一个真 VLA:Physical Intelligence 的 openpi 开源了 π0/π0.5 的 PyTorch 实现和微调配置,一张消费级 GPU 就能在 LIBERO 上跑通微调——这是目前”亲手摸到 VLA”门槛最低的方式。
- 关注前沿方向:VLA 架构演进(扩散/流匹配、世界行动模型)、触觉与 3D 空间表征、跨本体数据规模化、板载算力优化。arXiv 的 cs.RO(机器人学)和 cs.LG 两个分类足够用了。
小结#
具身智能 = 大脑(大模型与 VLA)+ 数据(遥操作/人类视频/仿真)+ 身体(机器人本体与传感器)+ 世界模型(在虚拟世界预演),四者缺一不可。用一句话概括它和 ChatGPT 的区别:语言模型学会了”说什么”,具身智能要学会”做什么、怎么做、做错了怎么办”——后者多了真实世界的反馈闭环,也多了真实世界的全部复杂性。
2026 年的具身智能,处在”模型路线已收敛(端到端 VLA + 双系统)、数据飞轮刚开始转、人形机器人开始量产、评测与安全标准还没跟上”的早期阶段。演示视频正在变多,但离”千家万户的机器人管家”还有相当距离。对这个领域最诚实的判断是:它的每一场演示都在被放大,它的每一个瓶颈也都真实存在;但模型、数据、硬件三条曲线同时在快速上升,这是过去几十年机器人研究从未有过的局面。
参考资料#
- RT-1: Robotics Transformer for Real-World Control at Scale(arXiv)
- RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control(arXiv)
- PaLM-E: An Embodied Multimodal Language Model(arXiv)
- SayCan: Do As I Can, Not As I Say(arXiv)
- π0: A Vision-Language-Action Flow Model for General Robot Control(arXiv)
- π0.5: Enhancing General Robot Control through Platform-Agnostic Co-Training(arXiv)
- openpi:π0/π0.5 的开源实现(GitHub)
- Helix 官方博客:A Vision-Language-Action Model for Generalist Humanoid Control(Figure AI)
- Accelerate Generalist Humanoid Robot Development with NVIDIA Isaac GR00T N1(NVIDIA 技术博客)
- Gemini Robotics brings AI into the physical world(Google DeepMind 博客)
- Genie 2: A large-scale foundation world model(Google DeepMind 博客)
- V-JEPA 2: Self-Supervised Video Models Enable Understanding, Prediction and Planning(arXiv)
- Genesis: 生成式物理仿真平台(GitHub)
- Genesis World 官方文档
- Open X-Embodiment: Robotic Learning Datasets and RT-X Models(arXiv)
- DROID: A Large-Scale In-The-Wild Robot Manipulation Dataset(arXiv)
- ALOHA: Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware(arXiv)
- 2025 年《政府工作报告》(中国政府网全文)
- 当机器人能够”爬梯子”,具身智能的验收季开始了(界面新闻)
- 谷歌的机器人赌局:不卖本体,只卖大脑(钛媒体)
文章分享
如果这篇文章对你有帮助,欢迎分享给更多人!
部分内容可能已过时
评论区
分享你的想法,与大家交流讨论
音乐
暂未播放



