由 AI Hypercomputer 提供支持
张量处理单元 (TPU) 的十年发展历程

TPU 专为高级 AI 工作负载而构建,涵盖大语言模型、代码生成以及智能体等各类场景。它们是 Gemini 和 Google 旗舰级十亿用户产品的幕后引擎,包括 Google 搜索、Google 相册和 Google 地图。
由 AI Hypercomputer 提供支持
张量处理单元 (TPU) 的十年发展历程

TPU 专为高级 AI 工作负载而构建,涵盖大语言模型、代码生成以及智能体等各类场景。它们是 Gemini 和 Google 旗舰级十亿用户产品的幕后引擎,包括 Google 搜索、Google 相册和 Google 地图。
开放、灵活、可靠的运营

利用熟悉的库和工具,在开放式生态系统中构建应用。TPU 为 PyTorch 和 JAX 提供原生、高性能支持,并支持 vLLM 引擎以实现快速推理。使用 Google Kubernetes Engine (GKE) 可在全球集群中可靠地管理和扩缩这些部署。
性能卓越,自由无阻

将前沿模型的训练时间从数月缩短至数周。单个集群中最多可容纳 100 万个 TPU 芯片,TPU 可最大限度地提高有效吞吐量,确保几乎每个计算周期都用于主动学习。


开放、灵活、可靠的运营

利用熟悉的库和工具,在开放式生态系统中构建应用。TPU 为 PyTorch 和 JAX 提供原生、高性能支持,并支持 vLLM 引擎以实现快速推理。使用 Google Kubernetes Engine (GKE) 可在全球集群中可靠地管理和扩缩这些部署。
性能卓越,自由无阻

将前沿模型的训练时间从数月缩短至数周。单个集群中最多可容纳 100 万个 TPU 芯片,TPU 可最大限度地提高有效吞吐量,确保几乎每个计算周期都用于主动学习。
TPU 8t

TPU 8t 专为大规模预训练和嵌入密集型工作负载而构建,单个 Superpod 中包含 9,600 个芯片,能为前沿模型提供所需的高密度计算能力,每个 Pod 的计算性能几乎是上一代的 3 倍。
即将推出。
TPU 8i

TPU 8i 针对训练后和推理进行了优化,与上一代相比,其性价比提高了 80%,可助力大型 MoE 模型实现低延迟推理。
即将推出。
Ironwood - 第 7 代
TPU 8t

TPU 8t 专为大规模预训练和嵌入密集型工作负载而构建,单个 Superpod 中包含 9,600 个芯片,能为前沿模型提供所需的高密度计算能力,每个 Pod 的计算性能几乎是上一代的 3 倍。
即将推出。
TPU 8i

TPU 8i 针对训练后和推理进行了优化,与上一代相比,其性价比提高了 80%,可助力大型 MoE 模型实现低延迟推理。
即将推出。
Ironwood - 第 7 代
TPU 软件堆栈旨在衔接高级机器学习代码与定制芯片,从而实现硬件原始效率的最大化。
JAX
在 TPU 上以接近原生硬件的速度编译复杂的数学运算。这个用于数值计算和自动微分的开源库使用显式设备网格,可以轻松地跨大规模分布式 TPU 集群进行扩缩。
TorchTPU 和 PyTorch
使用标准语法直接在 TPU 上运行 PyTorch 工作负载。此原生“动态优先”堆栈由 Meta 构建,只需对现有代码库进行极少更改即可完成迁移,从而释放显著的性价比优势,而无需工程团队学习新框架。
OpenXLA
减少编译瓶颈,充分释放 TPU 硬件的高性能。这款开源机器学习编译器可自动融合算子、优化内存用量并消除框架开销,从而在 TPU 后端执行线性代数计算。
MaxText
大幅缩短超大型基础模型的训练时间。这种基于 JAX 的参考实现提供了一个高度可伸缩的开箱即用蓝图,可在 TPU 上进行 LLM 预训练期间实现硬件的峰值利用率。
Tunix
简化 TPU 基础设施上的 LLM 训练后和对齐流程。这个轻量级的开源 JAX 库提供可伸缩的工作流,用于监督式微调 (SFT) 和强化学习 (RL),可高效地将原始模型转化为可用于生产用途的智能体。
vLLM
最大限度地提高服务并发性,并降低实时 TPU 推理的运营成本。这个高吞吐量的开源引擎利用 PagedAttention 等内存管理技术来减少空间浪费,并在 TPU 架构上提供高效的 LLM 推理服务。
TPU 软件堆栈旨在衔接高级机器学习代码与定制芯片,从而实现硬件原始效率的最大化。
JAX
在 TPU 上以接近原生硬件的速度编译复杂的数学运算。这个用于数值计算和自动微分的开源库使用显式设备网格,可以轻松地跨大规模分布式 TPU 集群进行扩缩。
TorchTPU 和 PyTorch
使用标准语法直接在 TPU 上运行 PyTorch 工作负载。此原生“动态优先”堆栈由 Meta 构建,只需对现有代码库进行极少更改即可完成迁移,从而释放显著的性价比优势,而无需工程团队学习新框架。
OpenXLA
减少编译瓶颈,充分释放 TPU 硬件的高性能。这款开源机器学习编译器可自动融合算子、优化内存用量并消除框架开销,从而在 TPU 后端执行线性代数计算。
MaxText
大幅缩短超大型基础模型的训练时间。这种基于 JAX 的参考实现提供了一个高度可伸缩的开箱即用蓝图,可在 TPU 上进行 LLM 预训练期间实现硬件的峰值利用率。
Tunix
简化 TPU 基础设施上的 LLM 训练后和对齐流程。这个轻量级的开源 JAX 库提供可伸缩的工作流,用于监督式微调 (SFT) 和强化学习 (RL),可高效地将原始模型转化为可用于生产用途的智能体。
vLLM
最大限度地提高服务并发性,并降低实时 TPU 推理的运营成本。这个高吞吐量的开源引擎利用 PagedAttention 等内存管理技术来减少空间浪费,并在 TPU 架构上提供高效的 LLM 推理服务。
TPU 正在赋能创新者





TPU 是 Google 开发的定制设计的应用专用集成电路 (ASIC)。它们是专为加速机器学习和人工智能工作负载而从头开始构建的。TPU 专为繁重的矩阵乘法和张量运算进行了优化 - 这些运算构成了神经网络的基本智能模块,为从大语言模型到复杂推理智能体等各类应用提供支持。
TPU 的核心是专门的矩阵乘法单元 (MXU),可同时处理大量矩阵运算。TPU 采用“脉动阵列”架构,只需读取一次数据,即可让数据在数千个算术逻辑单元 (ALU) 中持续流动,并不断累积结果,而无需频繁地对内存进行读写操作。它们还支持低精度算法(如 16 位或 8 位浮点),从而在不牺牲 AI 模型所需精度的情况下,实现每秒数百万次的计算。
Cloud TPU 为领先的机器学习框架(主要是 TensorFlow、PyTorch 和 JAX)提供原生的高性能支持。使用这些框架编写的代码由加速线性代数 (XLA) 编译器编译,该编译器会自动优化计算图,以便在底层 TPU 硬件上高效运行。
TPU 擅长处理需要大规模并行矩阵运算的深度学习任务,特别适用于以下场景:
TPU Pod 是一个由 TPU 芯片组成的庞大物理集群,这些芯片通过专用高速网络(例如 Google 的光路交换或 Virgo 网络)连接在一起。单个超级 Pod 可以包含数千个互连芯片。“切片”是 Pod 的一个较小的专用子集,您可以租用它。这种网络架构使开发者能够以极少甚至无需更改代码的方式,在大量计算资源上扩展其 AI 工作负载,从而有效地将整个切片作为一个统一的机器来运行。
Goodput 是指基础设施主动训练模型所花费的实际有效时间,而不是空闲时间。训练超大规模基础模型涉及跨数千个芯片的复杂编排,这意味着计算周期很容易因数据传输延迟、硬件重置或检查点保存而白白浪费。Cloud TPU 旨在通过高带宽互连和优化的内存缓存最大限度地提高有效吞吐量,从而确保付费计算周期直接促进模型改进。
用户可以使用 Google Kubernetes Engine (GKE) 和 Cluster Director 来支持可靠性、全面监控和管理。通过利用 GKE for TPU,客户可以在云原生生态系统中运行,该生态系统具有用于负载均衡的 Inference Gateway,并且能够将部署扩展到多达 13 万个 GKE 节点。