具身智能开源模型有哪些?
相关 AI 产品
相关话题
具身智能(Embodied AI)开源模型目前正处于“百家争鸣”的阶段,但要说最值得关注、且已经形成社区影响力的,我建议你优先关注 谷歌的RT-2系列、斯坦福的VoxPoser、英伟达的MimicGen / RoboCasa,以及国内智元机器人(Agibot)的AgiBot World。这些模型从“视觉-语言-动作”的底层范式到具体的操作数据集,基本覆盖了当前开源生态的骨架。
核心开源模型与数据集一览
为了方便你快速建立认知,我先把目前社区最活跃、论文影响力最高的几个项目整理成表格。它们分别代表了不同的技术路线:有的是“端到端”的决策模型,有的是“任务规划器”,有的是“仿真数据生成器”。
| 模型/项目 | 所属机构 | 核心特点 | 适用场景 |
|---|---|---|---|
| RT-2 / RT-1-X | Google DeepMind | 将视觉-语言模型直接“嫁接”到机器人动作输出,具备一定泛化能力 | 桌面操作、抓取、简单移动操作 |
| VoxPoser | Stanford University | 通过大语言模型生成3D值函数,无需训练即可引导机器人动作 | 复杂长序列任务、零样本操作 |
| MimicGen / RoboCasa | NVIDIA Research | 自动生成大规模演示数据,降低真实数据采集成本 | 仿真训练、策略迁移研究 |
| AgiBot World | 智元机器人 (Agibot) | 百万级真实机器人操作数据集,包含多种场景和物体 | 通用操作策略预训练、学术研究 |
| Open X-Embodiment | 多机构联合 (Google, X等) | 统一了22个机器人平台的数据格式,RT-1-X即基于此训练 | 跨形态、跨任务的通用策略学习 |
逐个拆解:这些模型到底能干什么?
1. RT-2 (Robotic Transformer 2) —— 端到端的“大脑”
这是目前最出圈的具身智能模型。它本质上是一个视觉-语言-动作(VLA)模型。你可以把它理解为:把机器人摄像头看到的画面,连同你下达的“把红色杯子放到左边”这样的自然语言指令,一起喂给一个巨大的神经网络,网络直接输出机器人手臂每个关节应该转多少度。
它的厉害之处在于,它利用了互联网上海量的图文数据进行预训练,所以当它看到没见过的物体(比如一个奇怪的玩具)时,能凭借“常识”推断出应该怎么抓。谷歌在官方博客中展示了它“即插即用”的能力,甚至能完成“把苹果放到空碗里”这种需要推理的指令。该项目代码和模型权重在GitHub上开源。
2. VoxPoser —— 无需训练的“规划师”
如果你觉得RT-2训练起来太费资源(需要大量机器人数据),VoxPoser提供了一条完全不同的路径。它不直接输出动作,而是利用大语言模型(LLM)和视觉语言模型(VLM),在3D空间里“画”出一张价值地图。比如,任务要求“把杯子放到盘子旁边”,VoxPoser会生成一个3D体素图,其中“杯子抓取点”区域是吸引子,“盘子边缘”是约束条件。然后使用传统的模型预测控制(MPC)算法顺着这张地图执行动作。
这意味着你不需要任何机器人训练数据,只要有一个现成的LLM和VLM,就能让机器人完成复杂任务。斯坦福团队在Franka Panda机械臂上做了大量演示,成功率非常高。代码和论文在GitHub上完全开源。
3. MimicGen & RoboCasa —— 数据生成的“永动机”
具身智能最大的瓶颈是数据。真实机器人操作数据采集成本极高,一个简单的“抓取”动作可能需要人类遥操作几十次。英伟达的MimicGen解决的就是这个问题:它只需要少量(比如10个)真人演示,就能通过算法自动合成出成千上万个不同场景、不同物体位置的新演示数据。RoboCasa则是配套的、高保真的3D仿真环境,里面有大量可交互的厨房、客厅场景。
这两个工具配合起来,可以让你在仿真里生成海量数据,然后用这些数据训练一个策略,再迁移到真实机器人上。这对于没有实体机器人团队的研究者来说,是极为宝贵的资源。
4. AgiBot World —— 来自中国的“硬核”数据集
智元机器人(由“稚晖君”彭志辉创立)开源的AgiBot World是我认为国内最值得关注的具身智能项目。它包含了100万条以上真实世界机器人操作轨迹,涵盖超过100种物体和多种家庭、厨房场景。数据质量非常高,使用了高精度的6自由度机械臂和灵巧手采集。
与谷歌的Open X-Embodiment不同,AgiBot World的数据全部来自统一硬件平台,这意味着训练出来的模型可以直接在智元的机器人上跑,复现性极强。对于国内的研究者,这是一个可以直接拿来训练自己模型的宝藏。数据集和基线模型代码已在GitHub和Hugging Face上开源。
如何快速上手这些模型?
如果你是初学者,我的建议是:
- 先跑VoxPoser:因为它不依赖机器人硬件,你可以在仿真环境(比如MuJoCo或Isaac Sim)里验证效果。代码库很干净,跟着README走就行。
- 再试MimicGen:用它生成数据,配合扩散策略(Diffusion Policy)训练一个简单的抓取网络。这个过程能让你理解“数据-策略-仿真”的闭环。
- 最后挑战RT-2:如果你有GPU集群,可以尝试用Open X-Embodiment数据集复现RT-1-X。但注意,它的训练成本非常高,普通单卡很难跑起来。
相关项目官方入口:
- RT-2 论文与代码:https://robotics-transformer2.github.io/
- VoxPoser 项目主页:https://voxposer.github.io/
- MimicGen 代码仓库:https://github.com/NVIDIA-Omniverse/robocasa
- AgiBot World 数据集:https://agibot-world.com/
- Open X-Embodiment 项目:https://robotics-transformer-x.github.io/
相关问题
- 具身智能和传统机器人控制有什么区别? 传统机器人依赖精确编程和模型,具身智能则强调让机器人通过视觉和语言理解环境,自主决策并适应变化。
- 训练具身智能模型需要多少数据? 不同模型差距巨大。像VoxPoser零样本即可,而端到端模型如RT-2需要数十万甚至百万级演示数据。
- 目前有哪些好用的仿真环境? 除了英伟达的Isaac Sim,还有MuJoCo、SAPIEN、Habitat 3.0。RoboCasa是最新且专门为操作任务设计的。
- 国内有哪些团队在做具身智能开源? 除了智元机器人,还有清华的GR-MG、北京大学的PKU-Beaver系列,以及上海人工智能实验室的OpenRobot。
- 普通开发者如何参与? 可以从Hugging Face的LeRobot项目开始,它提供了标准化的数据加载和训练代码,支持多种机器人平台。
内容由 AI 生成,产品信息请以官网为准。










