时间:2026年10月5日
地点:美国(Reka AI 官网与 The Decoder 发布)
人物:Reka AI 团队、CEO Dani Yogev(联合创始人)
事件详情:AI 实验室 Reka AI 发布研究预览版 Rho-1,一个 190 亿参数的"全能推理模型",在一个神经网络内同时处理与生成文本、图像、视频,并直接输出机器人控制指令。模型使用 320 张 H100 GPU 训练约 3 个月,把所有模态视为同一上下文窗口内的 token,无需调用外部工具或专用模型。Rho-1 可实时生成连续视频,并在生成时通过"bank left / bank right"等指令中途调整无人机镜头方向;其核心演示展示了一段 5 轮对话:用户先让 Rho-1 绘制灯塔图像、画框标注、生成无人机接近视频、再改为暴雪版本,最后解释两段视频差异,所有回应都来自同一组权重、共享同一 KV 缓存。Reka 还推出蒸馏变体 Rho-1 Flash,把去噪步数从 99 步压缩到 8 步,在内部测试中以约 1 秒生成 5.3 秒片段。
背景:Reka AI 在 2024 年 4 月就发布过多模态语言模型 Reka Core,与 GPT-4、Claude 3、Gemini Ultra 等基准较量。Rho-1 沿此路线推进,但把"统一多模态"延伸到机器人控制层——同一组预测视频帧的权重,也输出同一组动作指令。机器人训练数据稀缺,Reka 配套推出"逆动力学模型(IDM)",从普通互联网视频中反推控制信号,把网络视频转化为带动作标签的训练样本。
影响:Rho-1 试图以单一模型取代"规划 + 视觉 + 视频 + 行动"的多模型代理流水线,省去跨模型调用延迟,并让跨模态上下文不再被各专家模型切分。如果独立基准能复现其效率与能力,可能显著降低多模态机器人和具身智能系统的构建成本与部署复杂度。但目前所有性能数字均为公司内部测试,无第三方基准验证;机器人控制目前仍属研究预览,距离生产部署尚有距离。
总结:Reka Rho-1 把文本、图像、视频和机器人控制塞进一个 190 亿参数的神经网络,展示了统一多模态架构在机器人领域的新可能,但需要第三方基准和真实机器人测试验证其宣称的效率与能力。
参考来源:
https://reka.ai/news/rho-1-collapsing-the-multimodal-stack
https://the-decoder.com/reka-ais-omni-model-rho-1-handles-text-images-video-and-robot-control-in-a-single-model/
https://superpowerdaily.com/posts/reka-releases-rho-1-to-combine-video-creation-and-robot-actions-in-one-model
https://crazycoderslab.com/reka-rho-1-omni-model-robot-actions-2026
https://xie.infoq.cn/article/0a71536df7f4a496142a6fb24
https://www.splitfeed.ai/story/reka-ais-omni-model-rho-1-handles-text-images-video-and-robot-control-in-a-singl
https://hellomarvisaitoday.com/articles/fbb9f226-f0d2-4d75-88e3-6eff6275c895







