张量处理单元

在专用加速器上训练、调优和部署高级 AI

张量处理单元

在专用加速器上训练、调优和部署高级 AI

专为下一代 AI 设计
AI Hypercomputer
十多年 TPU 创新历程

专为下一代 AI 设计

专为下一代 AI 设计

张量处理单元 (TPU) 是与开放软件协同设计的定制加速器,可为整个 AI 生命周期提供支持,涵盖前沿训练、大规模推理,以及智能体 AI 的多步推理数据需求。

AI Hypercomputer

TPU 由 Google Cloud 的 AI Hypercomputer 提供支持,这是一种突破性的架构,它将专用硬件、开源软件和灵活的使用模式融为一体。

十多年 TPU 创新历程

TPU 专为高级 AI 工作负载而构建,涵盖大语言模型、代码生成以及智能体等各类场景。它们是 Gemini 和 Google 旗舰级十亿用户产品的幕后引擎,包括 Google 搜索、Google 相册和 Google 地图。

专为下一代 AI 设计

专为下一代 AI 设计

张量处理单元 (TPU) 是与开放软件协同设计的定制加速器,可为整个 AI 生命周期提供支持,涵盖前沿训练、大规模推理,以及智能体 AI 的多步推理数据需求。

AI Hypercomputer

TPU 由 Google Cloud 的 AI Hypercomputer 提供支持,这是一种突破性的架构,它将专用硬件、开源软件和灵活的使用模式融为一体。

十多年 TPU 创新历程

TPU 专为高级 AI 工作负载而构建,涵盖大语言模型、代码生成以及智能体等各类场景。它们是 Gemini 和 Google 旗舰级十亿用户产品的幕后引擎,包括 Google 搜索、Google 相册和 Google 地图。

优势

开放、灵活、可靠的运营

TPU 开放、灵活且可靠

利用熟悉的库和工具,在开放式生态系统中构建应用。TPU 为 PyTorch 和 JAX 提供原生、高性能支持,并支持 vLLM 引擎以实现快速推理。使用 Google Kubernetes Engine (GKE) 可在全球集群中可靠地管理和扩缩这些部署。

单个逻辑训练集群中包含超过 100 万个 TPU

将前沿模型的训练时间从数月缩短至数周。单个集群中最多可容纳 100 万个 TPU 芯片,TPU 可最大限度地提高有效吞吐量,确保几乎每个计算周期都用于主动学习。

TPU 开放、灵活且可靠
单个逻辑训练集群中包含超过 100 万个 TPU

优势

开放、灵活、可靠的运营

TPU 开放、灵活且可靠

利用熟悉的库和工具,在开放式生态系统中构建应用。TPU 为 PyTorch 和 JAX 提供原生、高性能支持,并支持 vLLM 引擎以实现快速推理。使用 Google Kubernetes Engine (GKE) 可在全球集群中可靠地管理和扩缩这些部署。

单个逻辑训练集群中包含超过 100 万个 TPU

将前沿模型的训练时间从数月缩短至数周。单个集群中最多可容纳 100 万个 TPU 芯片,TPU 可最大限度地提高有效吞吐量,确保几乎每个计算周期都用于主动学习。

TPU 8t - 专为训练而优化
TPU 8i - 专为推理和强化学习而优化
Ironwood TPU
Trillium TPU
TPU 版本

TPU 8t

TPU 8t - 专为训练而优化

TPU 8t 专为大规模预训练和嵌入密集型工作负载而构建,单个 Superpod 中包含 9,600 个芯片,能为前沿模型提供所需的高密度计算能力,每个 Pod 的计算性能几乎是上一代的 3 倍。

即将推出。

TPU 8i - 专为推理和强化学习而优化

TPU 8i 针对训练后和推理进行了优化,与上一代相比,其性价比提高了 80%,可助力大型 MoE 模型实现低延迟推理。

即将推出。

Ironwood TPU

第 7 代高能效 TPU,专为大规模训练、多步推理和模型推理而设计。每个 Pod 配备 9,216 个液冷芯片,提供 42.5 exaflop(艾级浮点)的算力,每芯片的性能是 Trillium 的 4 倍。

已全面推出。

文档 | 价格

Trillium TPU

第六代 TPU,能效和峰值计算性能均有所提升,可用于训练和推理。与上一代 TPU v5e 相比,能效高出 67%,每个芯片的峰值计算性能提升 4.7 倍。

已全面推出。

文档 | 价格

TPU 版本

TPU 8t

TPU 8t - 专为训练而优化

TPU 8t 专为大规模预训练和嵌入密集型工作负载而构建,单个 Superpod 中包含 9,600 个芯片,能为前沿模型提供所需的高密度计算能力,每个 Pod 的计算性能几乎是上一代的 3 倍。

即将推出。

TPU 8i - 专为推理和强化学习而优化

TPU 8i 针对训练后和推理进行了优化,与上一代相比,其性价比提高了 80%,可助力大型 MoE 模型实现低延迟推理。

即将推出。

Ironwood TPU

第 7 代高能效 TPU,专为大规模训练、多步推理和模型推理而设计。每个 Pod 配备 9,216 个液冷芯片,提供 42.5 exaflop(艾级浮点)的算力,每芯片的性能是 Trillium 的 4 倍。

已全面推出。

文档 | 价格

Trillium TPU

第六代 TPU,能效和峰值计算性能均有所提升,可用于训练和推理。与上一代 TPU v5e 相比,能效高出 67%,每个芯片的峰值计算性能提升 4.7 倍。

已全面推出。

文档 | 价格

Jax
TorchTPU
OpenXLA
MaxText
Tunix
vLLM TPU 推理

TPU 软件栈

TPU 软件堆栈旨在衔接高级机器学习代码与定制芯片,从而实现硬件原始效率的最大化。

JAX

Jax

在 TPU 上以接近原生硬件的速度编译复杂的数学运算。这个用于数值计算和自动微分的开源库使用显式设备网格,可以轻松地跨大规模分布式 TPU 集群进行扩缩。

查看 GitHub 代码库

TorchTPU

使用标准语法直接在 TPU 上运行 PyTorch 工作负载。此原生“动态优先”堆栈由 Meta 构建,只需对现有代码库进行极少更改即可完成迁移,从而释放显著的性价比优势,而无需工程团队学习新框架。

阅读文章

OpenXLA

减少编译瓶颈,充分释放 TPU 硬件的高性能。这款开源机器学习编译器可自动融合算子、优化内存用量并消除框架开销,从而在 TPU 后端执行线性代数计算。

查看 GitHub 代码库

MaxText

大幅缩短超大型基础模型的训练时间。这种基于 JAX 的参考实现提供了一个高度可伸缩的开箱即用蓝图,可在 TPU 上进行 LLM 预训练期间实现硬件的峰值利用率。

查看 GitHub 代码库

Tunix

简化 TPU 基础设施上的 LLM 训练后和对齐流程。这个轻量级的开源 JAX 库提供可伸缩的工作流,用于监督式微调 (SFT) 和强化学习 (RL),可高效地将原始模型转化为可用于生产用途的智能体。

查看 GitHub 代码库

vLLM TPU 推理

最大限度地提高服务并发性,并降低实时 TPU 推理的运营成本。这个高吞吐量的开源引擎利用 PagedAttention 等内存管理技术来减少空间浪费,并在 TPU 架构上提供高效的 LLM 推理服务。

查看 GitHub 代码库

TPU 软件栈

TPU 软件堆栈旨在衔接高级机器学习代码与定制芯片,从而实现硬件原始效率的最大化。

JAX

Jax

在 TPU 上以接近原生硬件的速度编译复杂的数学运算。这个用于数值计算和自动微分的开源库使用显式设备网格,可以轻松地跨大规模分布式 TPU 集群进行扩缩。

查看 GitHub 代码库

TorchTPU

使用标准语法直接在 TPU 上运行 PyTorch 工作负载。此原生“动态优先”堆栈由 Meta 构建,只需对现有代码库进行极少更改即可完成迁移,从而释放显著的性价比优势,而无需工程团队学习新框架。

阅读文章

OpenXLA

减少编译瓶颈,充分释放 TPU 硬件的高性能。这款开源机器学习编译器可自动融合算子、优化内存用量并消除框架开销,从而在 TPU 后端执行线性代数计算。

查看 GitHub 代码库

MaxText

大幅缩短超大型基础模型的训练时间。这种基于 JAX 的参考实现提供了一个高度可伸缩的开箱即用蓝图,可在 TPU 上进行 LLM 预训练期间实现硬件的峰值利用率。

查看 GitHub 代码库

Tunix

简化 TPU 基础设施上的 LLM 训练后和对齐流程。这个轻量级的开源 JAX 库提供可伸缩的工作流,用于监督式微调 (SFT) 和强化学习 (RL),可高效地将原始模型转化为可用于生产用途的智能体。

查看 GitHub 代码库

vLLM TPU 推理

最大限度地提高服务并发性,并降低实时 TPU 推理的运营成本。这个高吞吐量的开源引擎利用 PagedAttention 等内存管理技术来减少空间浪费,并在 TPU 架构上提供高效的 LLM 推理服务。

查看 GitHub 代码库

TPU 正在赋能创新者

Citadel Securities 利用 Ironwood 将工作负载的运行速度最多提高到原来的 4 倍
在金融市场中,每一纳秒都至关重要。Citadel Securities 与 Google Cloud 合作,构建了一个可伸缩的云端定量调查环境,该环境能够以 2 到 4 倍的速度运行工作负载,同时将费用降低 30%。借助基于 Ironwood TPU 构建的基础设施,以前需要数周或数天才能执行的工作负载现在只需数小时甚至数分钟即可完成,帮助全球客户实现投资目标。
使用 TPU 时,速度最多可提高至原来的 4 倍
Nuro 通过 Google Cloud 开辟了一条通向无人驾驶未来的安全之路
Nuro 利用 Google Cloud TPU 和 Google Kubernetes Engine 大幅加快了自动驾驶技术的开发速度,在不增加成本的情况下,AI 模型的训练速度是原来的两倍。通过处理 PB 级的真实道路行驶数据并运行大规模安全模拟,该公司不断改进 Nuro Driver,使其能够安全地引导从乘用车到半挂车等各种车辆在公共道路上行驶。
Nuro 无人驾驶汽车
Lightricks 使用 JAX 在 TPU 上大规模训练视频 diffusion 模型
Lightricks 将其代码库迁移到 Google Cloud TPU 上的 JAX,从而显著加快了其 130 亿参数生成式视频模型的训练速度,每日训练步数增加了 40%。通过克服以往的可伸缩性限制,这一战略转变实现了数千个 TPU 核心的线性扩缩,并将开发者的工作效率翻倍,使 Lightricks 能够更快地为创作者经济带来高性能、高度可控的 AI 视频工具。
Lightricks 视频编辑

其他资源

执行后续操作

Cloud 徽标

常见问题解答

什么是张量处理单元 (TPU)?

TPU 是 Google 开发的定制设计的应用专用集成电路 (ASIC)。它们是专为加速机器学习和人工智能工作负载而从头开始构建的。TPU 专为繁重的矩阵乘法和张量运算进行了优化 - 这些运算构成了神经网络的基本智能模块,为从大语言模型到复杂推理智能体等各类应用提供支持。

TPU 架构的工作原理是什么?

TPU 的核心是专门的矩阵乘法单元 (MXU),可同时处理大量矩阵运算。TPU 采用“脉动阵列”架构,只需读取一次数据,即可让数据在数千个算术逻辑单元 (ALU) 中持续流动,并不断累积结果,而无需频繁地对内存进行读写操作。它们还支持低精度算法(如 16 位或 8 位浮点),从而在不牺牲 AI 模型所需精度的情况下,实现每秒数百万次的计算。

Cloud TPU 支持哪些机器学习框架?

Cloud TPU 为领先的机器学习框架(主要是 TensorFlow、PyTorch 和 JAX)提供原生的高性能支持。使用这些框架编写的代码由加速线性代数 (XLA) 编译器编译,该编译器会自动优化计算图,以便在底层 TPU 硬件上高效运行。

哪些类型的工作负载最适合 TPU?

TPU 擅长处理需要大规模并行矩阵运算的深度学习任务,特别适用于以下场景:

  • 由矩阵计算主导的模型
  • 需要数周或数月才能收敛的训练
  • 大型基础模型和大语言模型 (LLM)
  • 具有超大嵌入的工作负载,例如高级商品推荐引擎
  • 持续强化学习和高容量、低延迟推理


什么是 TPU Pod 和切片?

TPU Pod 是一个由 TPU 芯片组成的庞大物理集群,这些芯片通过专用高速网络(例如 Google 的光路交换或 Virgo 网络)连接在一起。单个超级 Pod 可以包含数千个互连芯片。“切片”是 Pod 的一个较小的专用子集,您可以租用它。这种网络架构使开发者能够以极少甚至无需更改代码的方式,在大量计算资源上扩展其 AI 工作负载,从而有效地将整个切片作为一个统一的机器来运行。


在 TPU 训练的背景下,什么是机器学习“有效吞吐量”?

Goodput 是指基础设施主动训练模型所花费的实际有效时间,而不是空闲时间。训练超大规模基础模型涉及跨数千个芯片的复杂编排,这意味着计算周期很容易因数据传输延迟、硬件重置或检查点保存而白白浪费。Cloud TPU 旨在通过高带宽互连和优化的内存缓存最大限度地提高有效吞吐量,从而确保付费计算周期直接促进模型改进。

如何大规模处理 TPU 的编排?

用户可以使用 Google Kubernetes Engine (GKE) 和 Cluster Director 来支持可靠性、全面监控和管理。通过利用 GKE for TPU,客户可以在云原生生态系统中运行,该生态系统具有用于负载均衡的 Inference Gateway,并且能够将部署扩展到多达 13 万个 GKE 节点。