具身智能指令到底指什么?
相关 AI 产品
ZDTaichu5.0-9B
一、紫东太初ZDTaichu5.0-9B评测:9B多模态模型如何搞定机器人空间推理? 1. 产品定位:面向“物理世界”的9B多模态大脑 我把ZDTaichu5.0-9B理解为“轻参数、重空间”的通用多模态模型。它不像超大闭源模型追求全领域全……
查看 ↗Qwen-Robot
Qwen-Robot 使用教程:从 Chat2Robot 零门槛体验到百炼 API 接入 Qwen-Robot Suite 是阿里通义千问团队 2026 年 6 月 16 日正式发布的面向物理世界智能的具身基础模型套件,也是 Qwen 家族……
查看 ↗Seedance 2.5
Seedance 2.5 怎么用?即梦/豆包/火山 API 三入口完整教程 定位:字节跳动旗下、由 Seed 团队自研的下一代 AI 视频生成模型,2026 年 6 月 23 日于火山引擎 FORCE 原动力大会正式发布,7 月初面向企业客……
查看 ↗Odyssey 2 Max世界模型
一、最强世界模型Odyssey 2 Max深度评测:物理仿真性能提升18% Odyssey 2 Max是Odyssey公司于2026年4月发布的最新通用世界模型,代表了AI从"识别"到"理解"物理世界的重大突破。与传统的视频生成模型不同,O……
查看 ↗字节跳动火山引擎Seed3D 2.0
一、字节跳动Seed3D 2.0深度评测:几何纹理双SOTA,3D建模师要失业了吗? 1.1 产品定位:从"可用"到"生产可用"的跨越 Seed3D 2.0是字节跳动Seed团队在2026年4月23日发布的新一代3D生成大模型。与传统的3D……
查看 ↗涂鸦智能
一、涂鸦智能核心功能是什么?为什么选择它作为AI硬件开发平台? 涂鸦智能(纽交所代码:TUYA;港交所代码:2391)是全球领先的AI云平台服务提供商,致力于"将AI应用于生活"。公司从2014年成立初期的"IoT连接器"定位,已成功转型为……
查看 ↗高德四足机器人
一、高德四足机器人的核心功能是什么?为什么选择它作为商用机器人解决方案? 高德四足机器人是阿里巴巴集团旗下高德地图具身业务部推出的首款具身智能硬件产品,标志着阿里正式从数字导航领域跨界切入物理世界的机器人赛道。这款产品并非面向家用消费市场的……
查看 ↗OpenAI Calm Tech
OpenAI携手乔纳森·艾维推出Calm Tech硬件设备,告别数字焦虑:OpenAI Calm Tech如何重塑智能家居交互体验? 1 OpenAI Calm Tech是什么? OpenAI Calm Tech(又称CalmTech)是O……
查看 ↗Convai
对话式 AI API,用于语音识别、语言理解和生成,以及用于设计游戏和支持语音的应用程序的文本转语音。
查看 ↗PhysBrain 1.0
一、PhysBrain 1.0是什么?如何让机器人真正"理解"物理世界? PhysBrain 1.0是北京中关村学院与中关村人工智能研究院孵化的首家具身智能企业——深度机智,于2026年3月27日正式发布的全球首个以人类学习范式构建的具身通……
查看 ↗AInnoGC工业本体智能体平台
一、AInnoGC工业本体智能体平台是什么?如何推动制造业从“感知”到“认知行动”的全面升级? 1.1 产品定位与核心价值 AInnoGC工业本体智能体平台是创新奇智于2026年3月27日正式发布的首款全栈式工业本体智能体平台。该平台以构建……
查看 ↗MiniMax M2.7
一、MiniMax M2.7 vs Claude Opus 4.6:性能接近价格仅1/20的国产替代 MiniMax M2.7是上海稀宇科技(MiniMax)于2026年3月18日发布的新一代Agent旗舰大模型。与传统的AI模型不同,M2……
查看 ↗相关文章
2026桌面Agent使用指南!17款主流Agent工具盘点,巨好用
2026年上半年,AI最大的变化不是又出了个更强的模型,而是AI能开始"动手"干活了。 过去两年,我们习惯了跟豆包、DeepSeek、ChatGPT打字聊天——问问题、写文案、改代码。它像个聪明的顾问,有问必答,但有个问题一直没解决:它只会……
查看 ↗
文章
2026世界人工智能大会观展攻略与购票指南!附展台信息
一、先存这张速览表 2026 世界人工智能大会(WAIC 2026)暨人工智能全球治理高级别会议,7 月 17 日(周五)至 20 日(周一)在上海举办,主题「智能伙伴,共创未来」。今年首次拉成"三地四馆"。 项目信息展期2026 年 7 ……
查看 ↗距 WAIC 2026 还有十天:阶跃 Agent OS 全球首秀,这届为何被叫”智能体落地元年”的验证场
距 2026 世界人工智能大会(WAIC)开幕还有十天。第九届,7 月 17 到 20 日,上海"三地四馆"(世博、张江、西岸,主展馆上海世博展览馆),主题「智能伙伴,共创未来」,官方 App「Hi WAIC」已上线。如果把 2023、20……
查看 ↗从开源“龙虾”到国产“百虾大战”,国内主流OpenClaw工具终极盘点!
从开源“龙虾”到国产“百虾大战”:一场关于AI如何“动手”的生态竞赛已经开始了 如果你在2026年的年初问一个程序员“你最近装了什么新软件”,答案大概率是OpenClaw。这只开源“龙虾”用60天做到了React十多年才达成的事——在Git……
查看 ↗
文章
Kimi以1%资源实现性能超越!AMD一键部署AI工具包,谷歌D4RT重塑视频生成
内容速览: Kimi新模型发布: 月之暗面宣布以1%资源研发新模型,性能超越美国顶尖闭源模型。 AMD发布AI套件: AMD推出集成五大AI工具的Bundle,大幅降低AI应用门槛。 DeepMind发布D4RT: 谷歌发布4D世界模型,视……
查看 ↗相关资讯快讯
传化开放300+场景 押注具身智能
时间:2026-10-05 地点:浙江杭州 人物:徐冠巨(传化集团董事长)、姚晨蓬(传化集团副总裁)、陈德奔(传化具身智能科技联合创始人/总经理)、王兴兴(宇树科技创始人/董事长) 事件:成立 40 年的民营制造业龙头传化集团在场景开放与 ……
查看 ↗优必选U1交付缩水八成 给具身智能泼冷水
时间:2026年9月23日(周三) 地点:中国深圳(优必选总部)/ 上海、北京(首批交付现场) 人物:周剑(优必选董事长兼CEO)、张钜(优必选CFO)、邵天兰(梅卡曼德创始人)、伊泰·科恩(康奈尔大学物理学家,作为对比背景) 事件详情:钛……
查看 ↗大晓机器人×中石油便利店上线首个具身智能项目
时间:2026年9月21日 地点:上海(中国石油振兴店 昆仑好客便利店) 人物:大晓机器人由中国工程院外籍院士陶大程担任首席科学家,王晓刚任董事长;中国石油上海销售公司为合作方 事件详情:大晓机器人今日宣布与中国石油上海销售公司正式达成战略……
查看 ↗智元长隆全球首个具身智能主题乐园9月24日开园
时间:2026年9月20日(开园日9月24日) 地点:中国珠海横琴 人物:智元机器人(AGIBOT)、长隆集团(CHIMELONG) 事件详情:具身智能企业智元与文旅企业长隆集团联手打造的全球首个大型具身智能主题乐园,将于9月24日在横琴长……
查看 ↗相关话题
具身智能指令是一套从模糊人类意图到精确空间指代、再到可执行动作序列的跨层级执行协议,难点在于语义到动作的翻译不断链。ZDTaichu5.0-9B 主打轻参数重空间,Qwen-Robot 提供套件化链路,PhysBrain 1.0 补物理常识。判断系统强弱,看三层之间丢不丢信息。
具身智能指令,说白了不是一句”把桌上的杯子拿给我”那么简单,它是一套把自然语言、空间坐标、动作序列、物理约束打包在一起的执行协议——模型听懂只是第一步,真正难的是让指令落到物理世界里还能被拆成可执行的动作。所以讨论”指令指什么”,本质上是在讨论从语义到动作的那一段翻译由谁来做、做得多细。
先拆一层:具身智能指令的三个层级
和纯软件的 prompt 不同,具身场景里的指令通常要经过三次降维,每一层丢的信息都不一样:
- 任务级指令:人类语言描述的目标,比如”整理一下桌面”。它天然模糊,缺主语、缺顺序、缺成功判据。
- 空间级指令:把目标绑定到具体物体和位置关系上,需要模型理解”左边””上面””那个红色的”到底指哪块像素、哪个三维坐标。
- 动作级指令:最终变成关节角度、末端轨迹、抓取力度、时序节拍。这一层才是机器人真正执行的东西。
所以判断一个具身系统的指令能力强不强,看的不是它能不能接住一句话,而是它能不能把这三层接得不断链。空间推理往往是断链最频繁的地方,这也是为什么现在很多模型把”重空间”当成核心卖点。
指令能力的关键,是模型怎么理解”物理世界”
拿紫东太初的 ZDTaichu5.0-9B 举例,它的定位是”轻参数、重空间”的通用多模态模型,面向物理世界做多模态大脑。9B 这个量级本身就说明一件事:具身指令不一定要靠超大模型硬扛,参数小但空间理解扎实,反而更适合塞进机器人本体侧做实时推理。它评测里被反复提的点就是机器人空间推理——也就是上面说的第二层。
阿里的 Qwen-Robot 走的是另一条路,它是一整套面向物理世界智能的具身基础模型套件,从 Chat2Robot 这种零门槛体验,到百炼 API 接入都覆盖了。套件化的意义在于:指令的解析、规划、执行被拆成可组合的模块,开发者不用从零搭一条链路。对刚上手具身指令的人来说,Chat2Robot 这种”聊天式下发”是理解指令分层最直观的入口。
再往底层看,指令要落地,前提是模型真的”懂物理”。PhysBrain 1.0 是深度机智发布的具身通用模型,主打的是以人类学习范式构建——这条思路和纯数据堆叠不同,它关心的是机器人怎么像人一样建立对物理世界的常识,比如推一下物体会倒、软的抓不住要托底。这类常识恰恰是指令里最容易被省略、也最容易让执行翻车的部分。
指令的上游:世界模型和 3D 生成在补什么
指令要执行,得先有个”世界”可参照。这块有两类产品在做事:
- Odyssey 2 Max 世界模型:通用世界模型,和传统视频生成模型不同,它强调的是从”识别”走向”理解”物理世界,物理仿真性能相比前代有提升。对指令系统来说,世界模型提供的是”如果我这么做,接下来会发生什么”的预演能力。
- 字节跳动火山引擎 Seed3D 2.0:新一代 3D 生成大模型,几何和纹理都做到了 SOTA 级别,定位从”可用”跨到”生产可用”。具身指令里的空间指代,很多时候需要一个可交互的三维场景做锚点,3D 生成就是补这块的。
顺带说一句,同属字节 Seed 团队的 Seedance 2.5 是视频生成模型,虽然不直接做机器人控制,但它对时序和物理合理性的建模思路,和具身指令里”动作序列要连贯”的诉求是相通的。
工业场景里,指令被”本体”约束得更死
消费级机器人可以容忍指令模糊,工业场景不行。AInnoGC 工业本体智能体平台 是创新奇智发布的全栈式工业本体智能体平台,它的思路是用本体(Ontology)把行业知识结构化,推动制造业从”感知”走向”认知行动”。放到指令这个话题里,它的价值是:工业指令不能靠模型自由发挥,必须被本体约束在安全、可解释的范围内。
硬件侧,高德四足机器人 是高德具身业务部推出的首款具身智能硬件产品,定位不是家用消费市场,而是商用机器人解决方案。硬件形态决定了指令集的边界——四足能去的地方、能做的动作,本身就框定了上层指令的设计空间。
支撑指令的”外围”:开发平台、交互层和 Agent 底座
指令不是孤立存在的,它需要一整套配套:
- 涂鸦智能:全球领先的 AI 云平台服务提供商,从早期的 IoT 连接器转型而来,主打”将 AI 应用于生活”。做 AI 硬件开发时,它承担的是设备连接和云端能力这一层。
- OpenAI Calm Tech:OpenAI 与乔纳森·艾维合作推出的硬件设备,方向是重塑智能家居交互体验、告别数字焦虑。它代表的是另一种指令哲学——不是让用户下更精确的指令,而是让设备更少地打扰人。
- Convai:对话式 AI API,覆盖语音识别、语言理解和生成、文本转语音,常用于游戏和语音应用。语音是指令最自然的入口,这类 API 解决的是”说得出、听得准”。
- MiniMax M2.7:新一代 Agent 旗舰大模型,主打性能接近头部闭源模型但成本大幅降低。具身指令里负责规划和推理的那部分,往往就是靠这类 Agent 模型扛的。
一张表看清:不同产品在指令链路上的位置
| 产品 | 在指令链路中的角色 | 关键点 |
|---|---|---|
| ZDTaichu5.0-9B | 空间级指令理解 | 轻参数、重空间,面向物理世界的多模态大脑 |
| Qwen-Robot | 具身基础模型套件 | 从 Chat2Robot 体验到 API 接入的完整链路 |
| PhysBrain 1.0 | 物理常识底座 | 以人类学习范式构建的具身通用模型 |
| Odyssey 2 Max | 动作预演 | 通用世界模型,物理仿真能力提升 |
| Seed3D 2.0 | 三维场景锚点 | 几何纹理双 SOTA,生产可用级 3D 生成 |
| AInnoGC | 工业指令约束 | 工业本体智能体平台,从感知到认知行动 |
| 高德四足机器人 | 硬件执行端 | 商用机器人解决方案 |
| Convai | 语音交互入口 | 对话式 AI API,语音识别与生成 |
| MiniMax M2.7 | 规划推理 | Agent 旗舰大模型 |
所以,回到最初的问题
具身智能指令指的是一套跨层级的执行协议:上层是模糊的人类意图,中层是精确的空间指代,下层是可执行的动作序列,中间还夹着物理常识、安全约束和实时性要求。判断一个系统行不行,看它在这三层之间丢不丢信息。
现在行业里的分工也很清楚——有的做空间理解(ZDTaichu5.0-9B),有的做套件化链路(Qwen-Robot),有的补物理常识(PhysBrain 1.0),有的提供世界预演(Odyssey 2 Max),有的解决三维锚点(Seed3D 2.0),有的把指令锁进工业本体(AInnoGC),还有的负责硬件落地(高德四足机器人)和交互入口(Convai、Calm Tech)。至于收费和具体接入方式,各家差异较大,建议以官网为准。
相关问题
- 具身智能指令和普通 prompt 最大的区别是什么?
普通 prompt 只要模型输出文本,具身指令必须落到物理动作上,多了空间绑定和物理约束两层,容错率也低得多。 - 为什么小参数模型也能做具身指令?
因为具身场景更看重空间推理和实时性,而不是全领域知识。像 ZDTaichu5.0-9B 这种”轻参数、重空间”的定位就是为此设计的。 - 世界模型在指令系统里到底干嘛用?
提供”做了会怎样”的预演,让指令在执行前能被验证,Odyssey 2 Max 这类模型补的就是这块。 - 工业场景的指令为什么不能直接套用通用方案?
工业对安全性和可解释性要求极高,需要像 AInnoGC 那样用本体把指令约束在可控范围内。 - 语音是指令的最终形态吗?
语音是最自然的入口,Convai 这类 API 解决的是听说问题,但指令的难点仍在语义到动作的翻译上。
参考链接
内容由 AI 生成,产品信息请以官网为准。











