时间:2026年7月24日
地点:德国英戈尔施塔特(奥迪工厂)
人物:Black Forest Labs 与瑞士 mimic robotics 联合团队
事件详情:Black Forest Labs 联合瑞士机器人公司 mimic robotics 于 7 月 24 日发布新一代视频动作模型 FLUX-mimic。该模型基于 FLUX 3 多模态基础模型,将视频预测能力延伸至机器人动作预测,已在奥迪工厂完成测试与实际部署。FLUX-mimic 把视频中的接触、运动、重量、因果等物理过程统一编码为机器人状态表征,实现单模型同时处理图像、视频、音频与机器人动作的物理世界建模。
背景:FLUX 1 与 FLUX 2 只能生成图像,FLUX 3 多模态将能力扩展到视频与音频生成。FLUX-mimic 在此基础上揭示一个核心洞察——要让 AI 生成逼真视频,模型必须学会接触、运动、重量和因果,而这些恰恰是机器人控制所需的物理理解。同一模型既能生成内容,又能操控物理世界,使内容创作与具身智能在基础架构层面真正统一。FLUX 3 视频训练占整体算力成本超 95%,为模型注入物理过程推理提供了天然路径。
影响:
内容生成模型与机器人控制模型首次共用同一基础架构,将显著加速具身智能研发并降低专用模型开发成本
奥迪工厂率先实测,意味着工业机器人的『通用基础模型』路径正在打通,从演示走向量产
BFL 与 mimic 的合作模式可能催生更多 AI 基础模型公司与垂直机器人公司联盟,加速具身智能产业生态成型
总结:FLUX-mimic 的发布标志着 AI 从『看世界』迈向『动世界』的关键一步。其核心价值在于证明同一基础模型既能生成内容又能驱动机器人——这一统一假设若被工业界广泛接受,将重新定义通用人工智能的边界。奥迪工厂的落地验证让该模型成为具身智能从实验室走向规模化的重要里程碑。
参考来源:
https://bfl.ai/blog/flux-3-mimic
https://www.mimicrobotics.com/
https://www.ithome.com/0/981/137.htm
https://the-decoder.com/
https://huggingface.co/papers









