次世代 AI 向けに設計
AI Hypercomputer を活用
Tensor Processing Unit(TPU)の 10 年

TPU は、大規模言語モデルやコード生成からインテリジェント エージェントまで、高度な AI ワークロード向けに構築されています。これらは、Gemini や、検索、フォト、マップなど、10 億人規模のユーザーを抱える Google の主力プロダクトのエンジンとなっています。
次世代 AI 向けに設計
AI Hypercomputer を活用
Tensor Processing Unit(TPU)の 10 年

TPU は、大規模言語モデルやコード生成からインテリジェント エージェントまで、高度な AI ワークロード向けに構築されています。これらは、Gemini や、検索、フォト、マップなど、10 億人規模のユーザーを抱える Google の主力プロダクトのエンジンとなっています。
オープンで柔軟、信頼性の高い運用

使い慣れたライブラリとツールを使用して、オープンなエコシステム上に構築できます。TPU は、PyTorch と JAX をネイティブに高パフォーマンスでサポートし、高速推論のための vLLM エンジンをサポートします。Google Kubernetes Engine(GKE)を使用して、グローバル クラスタ全体でこれらのデプロイを確実に管理およびスケーリングできます。
妥協のないパフォーマンス

フロンティア モデルのトレーニングを数か月から数週間に短縮します。単一のクラスタに最大 100 万個の TPU チップを搭載した TPU は、グッドプットを最大化し、ほぼすべてのコンピューティング サイクルがアクティブ ラーニングに確実に使用されるようにします。


オープンで柔軟、信頼性の高い運用

使い慣れたライブラリとツールを使用して、オープンなエコシステム上に構築できます。TPU は、PyTorch と JAX をネイティブに高パフォーマンスでサポートし、高速推論のための vLLM エンジンをサポートします。Google Kubernetes Engine(GKE)を使用して、グローバル クラスタ全体でこれらのデプロイを確実に管理およびスケーリングできます。
妥協のないパフォーマンス

フロンティア モデルのトレーニングを数か月から数週間に短縮します。単一のクラスタに最大 100 万個の TPU チップを搭載した TPU は、グッドプットを最大化し、ほぼすべてのコンピューティング サイクルがアクティブ ラーニングに確実に使用されるようにします。
TPU 8t

TPU 8t は、大規模な事前トレーニングとエンベディングを多用するワークロード向けに構築されており、1 つの Superpod に 9,600 個のチップを搭載し、Pod あたり前世代の約 3 倍のコンピューティング パフォーマンスで、フロンティア モデルに必要な高密度のコンピューティングを実現します。
近日提供予定です。
TPU 8i

TPU 8i は、ポスト トレーニングおよび推論に最適化されています。大規模な MoE モデルの低レイテンシ推論において、前世代と比較して 1 ドルあたりのパフォーマンスが 80% 向上しています。
近日提供予定です。
Ironwood - 第 7 世代
TPU 8t

TPU 8t は、大規模な事前トレーニングとエンベディングを多用するワークロード向けに構築されており、1 つの Superpod に 9,600 個のチップを搭載し、Pod あたり前世代の約 3 倍のコンピューティング パフォーマンスで、フロンティア モデルに必要な高密度のコンピューティングを実現します。
近日提供予定です。
TPU 8i

TPU 8i は、ポスト トレーニングおよび推論に最適化されています。大規模な MoE モデルの低レイテンシ推論において、前世代と比較して 1 ドルあたりのパフォーマンスが 80% 向上しています。
近日提供予定です。
Ironwood - 第 7 世代
TPU ソフトウェア スタックは、高レベルの ML コードとカスタム シリコンのギャップを埋め、ハードウェアの効率を最適化するように設計されています。
JAX
TPU で複雑な数学演算をネイティブ ハードウェアに近い速度でコンパイルします。数値計算と自動微分用のこのオープンソース ライブラリは、明示的なデバイス メッシュを使用して、大規模な分散 TPU クラスタ全体に簡単にスケーリングできます。
TorchTPU と PyTorch
標準の構文を使用して、TPU で PyTorch ワークロードを直接実行します。Meta で構築されたこのネイティブな「イーガー ファースト」スタックにより、既存のコードベースを最小限の変更で移行して、費用対効果を大幅に向上させることができます。エンジニアリング チームが新しいフレームワークを学習する必要はありません。
OpenXLA
コンパイルのボトルネックを減らして、TPU ハードウェアから高いパフォーマンスを引き出します。このオープンソースの ML コンパイラは、TPU バックエンド全体で演算を自動的に融合し、メモリ使用量を最適化して、線形代数計算のフレームワーク オーバーヘッドを排除します。
MaxText
大規模な基盤モデルのトレーニング期間を大幅に短縮します。この JAX ベースのリファレンス実装は、TPU での LLM の事前トレーニング中にハードウェアの使用率を最大化するための、スケーラビリティに優れた、すぐに使えるブループリントを提供します。
Tunix
TPU インフラストラクチャ上で LLM のポストトレーニングとアライメントを合理化します。この軽量なオープンソースの JAX ライブラリは、教師ありファインチューニング(SFT)と強化学習(RL)のスケーラブルなワークフローを提供し、未加工のモデルをプロダクション レディなエージェントに効率的に変換します。
vLLM
リアルタイム TPU 推論のサービング同時実行を最大化し、運用コストを削減します。この高スループットのオープンソース エンジンは、PagedAttention などのメモリ管理手法を活用して無駄を排除し、TPU アーキテクチャ上で非常に効率的な LLM サービングを実現します。
TPU ソフトウェア スタックは、高レベルの ML コードとカスタム シリコンのギャップを埋め、ハードウェアの効率を最適化するように設計されています。
JAX
TPU で複雑な数学演算をネイティブ ハードウェアに近い速度でコンパイルします。数値計算と自動微分用のこのオープンソース ライブラリは、明示的なデバイス メッシュを使用して、大規模な分散 TPU クラスタ全体に簡単にスケーリングできます。
TorchTPU と PyTorch
標準の構文を使用して、TPU で PyTorch ワークロードを直接実行します。Meta で構築されたこのネイティブな「イーガー ファースト」スタックにより、既存のコードベースを最小限の変更で移行して、費用対効果を大幅に向上させることができます。エンジニアリング チームが新しいフレームワークを学習する必要はありません。
OpenXLA
コンパイルのボトルネックを減らして、TPU ハードウェアから高いパフォーマンスを引き出します。このオープンソースの ML コンパイラは、TPU バックエンド全体で演算を自動的に融合し、メモリ使用量を最適化して、線形代数計算のフレームワーク オーバーヘッドを排除します。
MaxText
大規模な基盤モデルのトレーニング期間を大幅に短縮します。この JAX ベースのリファレンス実装は、TPU での LLM の事前トレーニング中にハードウェアの使用率を最大化するための、スケーラビリティに優れた、すぐに使えるブループリントを提供します。
Tunix
TPU インフラストラクチャ上で LLM のポストトレーニングとアライメントを合理化します。この軽量なオープンソースの JAX ライブラリは、教師ありファインチューニング(SFT)と強化学習(RL)のスケーラブルなワークフローを提供し、未加工のモデルをプロダクション レディなエージェントに効率的に変換します。
vLLM
リアルタイム TPU 推論のサービング同時実行を最大化し、運用コストを削減します。この高スループットのオープンソース エンジンは、PagedAttention などのメモリ管理手法を活用して無駄を排除し、TPU アーキテクチャ上で非常に効率的な LLM サービングを実現します。
TPU がイノベーターを支援






TPU は、Google が開発したカスタム設計の特定用途向け集積回路(ASIC)です。ML と AI のワークロードを高速化するために、一から専用に構築されています。TPU は、ニューラル ネットワークの基本的な構成要素として機能する、大量の行列乗算とテンソル演算に特化して最適化されており、大規模言語モデルから複雑な推論エージェントまで、あらゆるものを強化します。
TPU の中核となるのは、大量の行列演算を同時に処理する専用の行列乗算ユニット(MXU)です。TPU は「シストリック アレイ」アーキテクチャを利用して、データを一度読み取ると、数千の算術論理ユニット(ALU)に継続的に流し、メモリへの読み取りと書き込みを常に行うことなく結果を蓄積します。また、低精度演算(16 ビットまたは 8 ビット浮動小数点など)をサポートしているため、AI モデルに必要な精度を犠牲にすることなく、1 秒あたり数百万回の計算が可能です。
Cloud TPU は、主要な ML フレームワーク(主に TensorFlow、PyTorch、JAX)をネイティブにサポートし、高いパフォーマンスを実現します。これらのフレームワークで記述されたコードは、Accelerated Linear Algebra(XLA)コンパイラによってコンパイルされます。このコンパイラは、基盤となる TPU ハードウェア上で効率的に実行されるように計算グラフを自動的に最適化します。
TPU は、大規模な並列行列演算を必要とするディープ ラーニング タスクに優れています。次の場合に強くおすすめします。
TPU Pod は、専用の高速ネットワーク(Google の光回路スイッチや Virgo ネットワークなど)で接続された TPU チップの巨大な物理クラスタです。1 つのスーパーポッドには、相互接続された数千個のチップを搭載できます。「スライス」は、レンタルできる Pod の専用の小さなサブセットです。このネットワーキング アーキテクチャにより、デベロッパーはコードをほとんど、あるいはまったく変更することなく、大量のコンピューティングにわたって AI ワークロードをスケーリングし、スライス全体を単一の統合マシンとして効果的に運用できます。
Goodputとは、インフラストラクチャがアイドル状態ではなく、モデルのトレーニングに実際に費やした生産的な時間を指します。大規模な基盤モデルのトレーニングには、数千個のチップにわたる複雑なオーケストレーションが伴います。つまり、データ転送の遅延、ハードウェアのリセット、チェックポイント処理によって、コンピューティング サイクルが簡単に無駄になってしまいます。Cloud TPU は、高帯域幅の相互接続と最適化されたメモリ キャッシュによってグッドプットを最大化するように設計されており、有料のコンピューティング サイクルがモデルの進歩に直接貢献します。
ユーザーは、Google Kubernetes Engine(GKE)と Cluster Director を使用して、信頼性、包括的なモニタリング、管理をサポートできます。TPU 向け GKE を活用することで、お客様は、ロード バランシング用の Inference Gateway と、デプロイを最大 130,000 個の GKE ノードまでスケールする機能を備えたクラウドネイティブなエコシステムで運用できます。