时间:2026年7月26日
地点:德国弗赖堡
人物:Black Forest Labs(BFL)研究团队
事件详情:德国人工智能初创公司黑森林实验室正式发布多模态基础模型FLUX 3。该模型基于BFL自研Self-Flow架构打造,配备专用的图像、视频、音频及动作编解码器,把对物理世界与数字环境的统一理解与生成揽到了一套底座之中。FLUX 3是首个支持原生音频生成的多模态模型,可在单次生成中输出最长20秒的音视频同步片段,能力覆盖文本转视频、图像转视频、视频转视频、基于关键帧的转场、多语言对话以及多镜头串联等多种创作模式。BFL同时联合Mimic Robotics开发了面向机器人领域的动作模型FLUX-mimic,目前已在奥迪工厂跑起生产任务测试,将多模态AI能力延伸到实体制造场景。
背景:自FLUX.1和FLUX.2系列奠定图像生成地位后,行业普遍将图像、视频、音频视作需要不同模型分别处理的任务,跨模态对齐一直是开放难题。Self-Flow方法于2026年3月提出,将流匹配目标与自监督特征重构目标结合,为多种模态在同一架构中训练提供路径。FLUX 3是BFL在这一框架上首次规模化落地的产物,配套专用编解码器让模型能在同一套权重中处理多种感官输入,被官方定位为迈向通用视觉智能的关键节点。
影响:
- 创意工作流被显著压缩:视频制作可一站式产出20秒音视频片段,关键帧转场与多镜头串联让短剧与广告级别的内容可在数分钟内完成
- 多模态竞争升级:FLUX 3对Luma Ray 3.2胜率93%、对Runway Gen-4.5胜率77%、对Grok Imagine Video胜率达69%,进一步抬高多模态视频赛道基准
- 物理AI延伸:通过FLUX-mimic与奥迪工厂合作,BFL把多模态模型用于机器人行为预测,开启从内容生成到具身智能的能力外溢路径
总结:FLUX 3的核心突破在于用单一架构同时处理图像、视频与音频,并原生合成20秒音视频片段,绕过传统模态拼装方案的损失与误差。在各类强手林立的视频赛道中,FLUX 3以93%的胜率压过Luma Ray 3.2,与Grok、Seedance、Gemini Omni Flash的对比同样保持微弱领先。同时,FLUX-mimic把同一套底座推向机器人行为预测,BFL从内容创作出发向物理AI延伸的策略,为行业树立了统一多模态模型的新范式。
参考来源:
- https://bfl.ai/blog/flux-3
- https://github.com/black-forest-labs/Self-Flow
- https://www.marktechpost.com/2026/07/26/black-forest-labs-releases-flux-3-a-multimodal-flow-model-for-image-video-audio-and-robot-action-prediction/
- https://baijiahao.baidu.com/s?id=1871576092328834904
- https://www.chinaz.com/ainews/29874.shtml
- https://baijiahao.baidu.com/s?id=1871589301891900106
- https://baijiahao.baidu.com/s?id=1871579027092415833
- https://baijiahao.baidu.com/s?id=1871523396307181771









