时间:2026年7月22日
地点:上海
人物:小红书dots infra团队
事件详情:2026年7月22日,小红书dots infra团队正式开源一款名为BigMac的多模态大模型流水并行训练范式。该方案从流水线并行的底层设计入手,重构前向传播与反向传播的计算调度,使同一批数据在多卡间的流动更加紧凑,同时将中间激活的显存峰值压低近60%。这意味着原本需要4张80GB显存卡才能运行的百亿参数多模态模型,现在仅用1张同等配置的卡即可完成完整训练,且吞吐量基本持平。在典型图文理解与生成混合任务上,BigMac相比广泛使用的Megatron-LM流水线方案,单次迭代延迟降低28%,每token的训练成本下降34%,而模型精度没有任何损失。项目以PyTorch插件形式发布,兼容HuggingFace主流的视觉-语言模型架构,无需修改模型代码即可直接接入。上线不到24小时,GitHub Star数已突破1800,被开发者称为终于能在单台A100服务器上完整复现多模态SOTA的福音。
背景:随着多模态大模型成为AI研发主战场,视觉编码器、语言模型与跨模态连接器在张量形状、激活分布与计算节奏上差异显著,传统1F1B流水调度虽能平衡计算气泡,却对不规则张量不够友好,导致大量临时缓存在不同stage之间堆积。此前,开发者若想在多模态训练中提升吞吐,几乎必然要忍受更高的显存消耗,算力效率与显存占用长期陷于帕累托权衡。小红书dots infra团队针对这一痛点,提出跨模态对齐的显存复用策略与阶段感知的梯度累积方案,让视觉、语言、跨模态三段中间结果在同一段显存空间里交替存放,省掉了至少三分之一的冗余拷贝,直接重塑了多模态训练的工程范式。
影响:
- 降低多模态训练门槛,加速AI普惠化——BigMac将百亿参数多模态模型的训练显存需求降低60%以上,使原本只能在大厂算力集群上跑通的SOTA复现工作,可由中小型研发团队在单台或数台A100/H100服务器上完成,显著推动学术界与中小企业的多模态创新。
- 倒逼上游框架升级,重塑AI Infra生态——BigMac以插件形式兼容Megatron-LM与HuggingFace,将倒逼主流训练框架在多模态流水线调度、显存复用、阶段感知优化等方面加速迭代,进而抬升整个AI Infra生态对显存效率的关注度。
- 为国产GPU与端侧训练提供新可能——显存占用大幅降低意味着同等模型可以在国产GPU集群甚至单卡高端工作站上完成训练,将进一步推动国产算力在多模态研究中的落地,同时为端侧大模型微调、模型蒸馏等场景打开新的工程路径。
总结:小红书BigMac的开源是2026年AI基础设施领域的一次重要突破。它以流水并行调度的精巧设计,打破了算力效率与显存占用之间长期存在的权衡困局,将多模态大模型训练从大厂专属能力变为普惠工程实践。在AI算力持续紧缺的背景下,这类通过工程创新而非堆砌硬件提升训练效率的方案,对推动多模态AI在更广泛科研与应用场景中的落地具有深远意义。BigMac项目在GitHub上的快速走红也再次印证,开源精神正在成为多模态AI时代最重要的创新加速器之一。
参考来源:
- https://github.com/ (BigMac项目仓库)
- https://mp.weixin.qq.com/s/tNJARtn1jIayL5URg87Row
- https://www.163.com/dy/article/L2G3G17605561FZX.html
- https://baijiahao.baidu.com/s?id=1839702043026628381&wfr=spider&for=pc
- https://hub.baai.ac.cn/
- https://huggingface.co/docs









