时间:2026年8月24日
地点:美国 Meta 官方博客、Meta 工程团队
人物:Meta 工程团队(数据基础设施 & 网络架构)、OCP(开放计算项目)社区;Open Compute Project 2026 全球峰会合作伙伴;AMD Pensando 团队提供首批可编程 NIC 验证硬件
事件详情:Meta 正式发布 MetaRoCE——一套从零设计、面向 AI 规模以太网的新型 RDMA 传输协议,并将规范、DPDK 优化参考实现、生产级一致性测试套件全部贡献给 OCP。MetaRoCE 把智能从网络交换机转移到网卡端,把网络视为"有损"环境而非传统 RoCE 假设的"无损",原生支持乱序包喷洒、每路径状态、精准重传与接收端速率提示。Meta 已在 AMD Pensando 可编程 NIC 上完成原型验证,硬件支持尚处早期。
背景:Meta 已把集群扩展到跨多数据中心、覆盖数十万块 GPU 的规模,无论是训练下一代前沿模型还是为全球推理服务,网络都已进入关键路径。All-reduce、all-to-all 等集合通信同步成千上万颗加速器,最慢的一次传输决定整轮训练速度;推理侧分布式分片之间的低时延通信直接影响数亿用户的响应时间。标准 RoCE 强依赖 PFC(Priority Flow Control)无损网络且抑制包喷洒,在多平面、大规模部署中扩展性受限。
影响:MetaRoCE 一举打破 RoCE 对无损以太网的依赖,让 AI 数据中心可直接采用商用以太网交换机与网卡,硬件成本与供应链弹性显著改善。"网卡端感知意图"的端点设计让 Scale-up(同机柜短消息)、Scale-across(跨建筑长链路)、存储/KV-cache incast 三大场景都有清晰路径。配合同日发布的 MTIA 300(首款内置 NIC 与通信卸载引擎的训练芯片),Meta 完整勾勒出"自研加速器 + 自研传输协议 + 开放生态"的 AI 基础设施栈。
总结:训练与推理前沿模型早已不只是计算问题,更是网络问题。Meta 把 MetaRoCE 开源给 OCP,等于把百万卡 AI 以太网的设计话语权从设备厂商手中拿到云厂商自己手里。10 月 2026 OCP 全球峰会将公布完整规范与参考实现——Meta 是否能以此牵动博通、Arista、AMD Pensando、英伟达 ConnectX 阵营跟进,将决定未来三年 AI 数据中心网络的走向。
参考来源:
1. Meta Engineering 官方博客:https://engineering.fb.com/2026/08/24/networking-traffic/metaroce-rdma-transport-ai-ethernet/
2. MarkTechPost:https://www.marktechpost.com/2026/08/25/meta-ai-introduces-metaroce-a-clean-sheet-rdma-transport-built-for-ai-scale-ethernet/
3. The AI Wrap:https://www.theaiwrap.com/story/meta-ai-introduces-metaroce-a-clean-sheet-rdma-transport-built-for-ai-scale-the
4. Vibekk Blog:https://vibekk.com/archives/meta-mtia-300-metaroce-ai-network-stack
5. OO.NEWS:https://oo.news/news/2853148f7858









