Google TPU Ironwood

## 产品简介 Google TPU Ironwood(TPUv7)是谷歌第七代张量处理单元(Tensor Proce

LLM大模型 部分免费

产品简介

Google TPU Ironwood(TPUv7)是谷歌第七代张量处理单元(Tensor Processing Unit),也是谷歌首款专为大规模 AI 推理负载设计的 TPU 产品,于 2025 年 4 月在 Google Cloud Next 大会上正式发布,2026 年 4 月向云客户开放使用。Ironwood 代号 TPU7x,是谷歌 TPU 家族中面向生成式 AI 推理时代的重要里程碑产品。

作为谷歌自研 AI 芯片路线图的最新成员,Ironwood 由 Google DeepMind 研究团队与 TPU 硬件工程师联合设计,采用 3nm 制程工艺,芯片内部代号体现出其作为「推理时代引擎」的定位。谷歌官方表示,当前最先进的思考型 AI 模型——包括 Gemini 2.5 和诺贝尔奖获奖成果 AlphaFold——均运行在 TPU 集群之上,而 Ironwood 将进一步扩展谷歌在 AI 推理基础设施层面的竞争优势。


核心功能

一、超大规模推理性能

Ironwood 单芯片提供 4,614 TFLOPS 的 FP8 峰值算力,相比上代 Trillium(TPUv6)实现超过 4 倍的每芯片性能提升。这一算力水平使 Ironwood 在高吞吐量推理场景中具备显著优势,能够支持每秒百 token 量级的单用户吞吐基准测试。

二、超大带宽 HBM3e 内存

每颗 Ironwood 芯片配备 192 GB HBM3e 高带宽内存,是上代 Trillium(32 GB)的 6 倍,内存带宽达到 7.37 TB/s,为 Trillium 的 4.5 倍。这一容量突破使 Ironwood 能够在芯片上完整容纳超大规模语言模型的完整权重与上下文缓存,大幅减少频繁数据搬运带来的性能损耗,有效降低推理延迟。

三、超级集群扩展能力(SuperPod)

Ironwood 支持将最多 9,216 颗芯片互联成单一共享内存域的 SuperPod 集群,通过 9.6 Tb/s 高速芯片互联(ICI)网络直连,形成 42.5 ExaFLOPS 的聚合 FP8 算力。集群内共享 1.77 PB HBM3e 内存,创下共享内存超级计算机的全球容量纪录。这一规模使 Ironwood 能够支撑超大规模 MoE(混合专家)模型的实时推理服务。

四、SparseCore 稀疏加速

每颗 Ironwood 芯片集成 2 个 TensorCore 和 4 个 SparseCore(第四代),专门加速推荐系统、大规模嵌入操作和集合通信类负载。SparsecCore 将加速范围从传统 AI 训练/推理扩展至金融、科学计算等领域。

五、能效大幅提升

Ironwood 的能效相比 Trillium 提升 2 倍,相比谷歌 2018 年发布的首代云 TPU 提升约 30 倍。支持动态电压与频率调节(DVFS),可根据负载动态调整功耗。散热方案采用谷歌第三代液冷基础设施,由冷板散热方案支撑,可靠支撑连续重载 AI 工作负载。

六、AI Hypercomputer 集成

Ironwood 是谷歌 AI Hypercomputer 超级计算系统的核心组件。该系统整合计算、网络、存储和软件层,据 IDC 数据,AI Hypercomputer 为企业客户带来平均 353% 的三年投资回报率,IT 支出降低 28%,运营效率提升 55%。

七、TorchTPU 与主流框架支持

Ironwood 配套推出 TorchTPU(基于 PyTorch PrivateUse1 后端),开发者只需将代码中 torch.device('cuda') 替换为 tpu.get_device(),即可将已有 PyTorch 模型迁移至 TPU。vLLM、SGLang 等主流推理框架的调度器与 API 层可直接复用,Pallas 内核可零成本迁移至新环境。TorchTPU 预计于 2026 年 10 月 PyTorch 大会期间正式开源。


特色优势

与英伟达 B200/B300 对比:推理性价比领先

根据第三方评测机构 SemiAnalysis 在 InferenceX 平台独立测评(基准模型:Qwen3.5 397B FP8,FP8 对 FP8 输入 8k token、输出 1k token),在每秒 100 token 单用户吞吐基准下:

  • Ironwood 每百万 token 成本仅 0.181 美元,B200 为 0.222 美元,B300 高达 0.276 美元
  • Ironwood 比 B200 便宜 19%,比 B300 便宜 34%
  • 在每美元性能维度,Ironwood 相对 B200 最高领先 50.4%,相对 B300 高达 96%
  • 在 20 秒中位响应时间下,Ironwood 成本进一步降至 0.098 美元/百万 token

物理吞吐层面,Ironwood 对 B200/B300 的领先幅度约 5%,真正的差距体现在租赁成本与单位时间产出比上。

AlphaChip 自动化芯片设计

Ironwood 是谷歌第三款由 AlphaChip(强化学习驱动的芯片布局 AI)参与设计的 TPU。AlphaChip 使用强化学习生成优于传统 EDA 工具的芯片平面布局,已连续应用于 Trillium、Ironwood 及后续架构,显著缩短设计周期并提升功耗效率。


应用场景

一、大规模语言模型实时推理服务

Ironwood 面向需要低延迟、高吞吐的 LLM 推理场景,支持 Gemini、Claude(通过 Anthropic 采购的百万级 TPU)等模型的线上服务,单集群日均处理请求量可覆盖数亿级用户规模。

二、MoE 模型训练与推理

Ironwood 的 SuperPod 架构特别适合 Mix-of-Experts 混合专家模型的分布式训练与推理,9,216 芯片的 3D torus 互联网络为专家并行提供了高效的通信底座。

三、AI 推荐系统加速

SparsecCore 第四代对推荐引擎类嵌入操作提供硬件级加速,可将抖音/TikTok 级别的大规模推荐模型推理延迟降低数倍,吞吐量提升显著。

四、科学计算与超大规模仿真

1.77 PB 共享 HBM3e 内存打破共享内存超级计算机纪录,适合气候模拟、药物分子动力学、材料仿真等内存密集型科学计算场景。


适用人群

  • AI 研究机构与实验室:需要大规模分布式训练与推理算力的机构(如 Anthropic、DeepMind)
  • 大型云服务与企业客户:通过 Google Cloud 租用 Ironwood 集群,构建自有 LLM 服务的科技企业
  • 超大规模互联网平台:需要支撑日活数亿级别 AI 推理请求的内容平台、电商平台
  • AI 基础设施投资者与算力运营商:评估 AI 推理芯片性价比的投资者

出品方

Google LLC / Alphabet Inc.

谷歌自 2016 年推出首款 TPU 以来,已迭代七代,是全球唯一拥有超过十年大规模 AI 定制芯片研发与部署经验的超大规模云服务商。Ironwood 的研发由 Google DeepMind 提供模型需求输入,Google TPU 团队负责芯片设计与制造。


更新动态

  • 2025 年 4 月:Google Cloud Next 大会上正式发布 Ironwood
  • 2025 年 11 月:Hot Chips 2025 大会公布 Ironwood SuperPod 超级计算机完整技术细节
  • 2026 年 4 月:Ironwood 正式向 Google Cloud 客户开放使用
  • 2026 年 9 月:SemiAnalysis 发布 Ironwood 首个第三方独立推理性能评测,推理性价比全面领先英伟达 B200/B300
  • 2026 年 10 月(预计):TorchTPU 开源,PyTorch 大会期间发布

官网链接

产品主页https://cloud.google.com/tpu/docs/tpu-vm

Google Cloud 官方博客https://cloud.google.com/blog/products/compute/ironwood-tpus-and-new-axion-based-vms

GKE Ironwood 文档https://cloud.google.com/kubernetes-engine/docs/concepts/tpu-ironwood

TPU7x 技术架构文档https://cloud.google.com/tpu/docs/tpu7x

团队信息

由 AI 猎手自动发现

评论与建议

0 条评论