时间:2026年10月5日,旧金山 AI 公司 Reka AI 发布 Rho-1 研究预览模型,把文字、图像、视频与机器人控制四种模态首次装进同一个神经网络。
地点:美国旧金山(Reka AI 总部);模型以研究预览形式开放,未公布具体定价或 API 接入渠道。
人物:Reka AI 团队主导发布;公司由 Dani Yogatama 联合 Yi Tay、Steven Hoi 等知名 AI 研究员于 2022 年创办,长期专注多模态与世界模型方向。
事件:Rho-1 是一款 190 亿参数的全能推理模型,单一权重同时承担文本/图像/视频理解与生成,并直接输出机器人控制指令,全程不调用任何外部专家模型或工具。研究团队使用 320 块 H100 GPU 训练约三个月,并配套发布蒸馏版本 Rho-1 Flash,将图像生成的去噪步数从 99 步压缩到 8 步,演示中约 5.3 秒的成片可在 1.11 到 2.01 秒内渲染完成。
背景:当前主流 AI 系统普遍采用"中央模型调度 + 多个专项模型"的智能体管线,每一次模态切换都会带来延迟并损失上下文;Reka AI 2024 年 4 月发布的 Reka Core 已能与 GPT-4、Claude 3、Gemini Ultra 同台较量,本次 Rho-1 进一步把视觉、语言、动作统一为同一上下文窗口中的 token,被业内视为"世界模型"路线的新里程碑。
影响:单网络通吃四模态显著简化了系统架构,对机器人与具身智能团队尤其关键——Rho-1 通过逆动力学模型(inverse dynamics model)从普通互联网视频中挖掘控制信号,绕开稀缺的真机示教数据;行业层面,统一权重有望拉低多模态推理的算力门槛,加速自动驾驶、工业机器人与 AR/VR 端的端侧部署。
总结:Rho-1 把"理解 + 生成 + 行动"压缩进一个 19B 参数的模型,是目前最接近通用世界模型的工程实现之一;但官方也强调目前仍为研究预览,缺第三方基准与独立算力验证,能否在生产环境兑现低算力承诺,将决定这条"坍缩式多模态"路线能否真正走通。
参考来源:
1. Reka AI 官方公告:https://reka.ai/news/rho-1-collapsing-the-multimodal-stack
2. The Decoder 报道:https://the-decoder.com/reka-ais-omni-model-rho-1-handles-text-images-video-and-robot-control-in-a-single-model/
3. Venture Pitch Online:https://venture-pitch-online.com/en/news/reka-ai-launches-rho-1-omni-model
4. Splitfeed AI 编辑分析:https://www.splitfeed.ai/story/reka-ais-omni-model-rho-1-handles-text-images-video-and-robot-control-in-a-singl
5. Hello Marvis AI Today:https://hellomarvisaitoday.com/articles/fbb9f226-f0d2-4d75-88e3-6eff6275c895
6. Superpower Daily 演示评测:https://superpowerdaily.com/posts/reka-releases-rho-1-to-combine-video-creation-and-robot-actions-in-one-model
7. TPS 模型卡:https://tpsreport.news/models/reka-rho-1
8. Reka AI 逆动力学模型论文:https://reka.ai/labs/research/reka-inverse-dynamics-model-for-interactive-world-models







