【Next Tokyo】基調講演を含むセッションをアーカイブ公開中!最新の AI フルスタック環境や事例など、注目のテクノロジーをいつでもご視聴いただけます。

Tensor Processing Unit

専用のアクセラレータで高度な AI をトレーニング、チューニング、デプロイ

Tensor Processing Unit

専用のアクセラレータで高度な AI をトレーニング、チューニング、デプロイ

次世代 AI 向けに設計
AI ハイパーコンピュータ
10 年以上にわたる TPU のイノベーション

次世代 AI 向けに設計

次世代 AI 向けに設計

Tensor Processing Unit(TPU)は、オープン ソフトウェアと共同設計されたカスタム アクセラレータで、フロンティア トレーニングや大規模な推論から、エージェント型 AI のマルチステップの推論データの需要まで、AI ライフサイクル全体を強化します。

AI ハイパーコンピュータ

TPU は、専用ハードウェア、オープン ソフトウェア、柔軟な使用量モデルを組み合わせた画期的なアーキテクチャである Google Cloud の AI Hypercomputer を基盤としています。

10 年以上にわたる TPU のイノベーション

TPU は、大規模言語モデルやコード生成からインテリジェント エージェントまで、高度な AI ワークロード向けに構築されています。これらは、Gemini や、検索、フォト、マップなど、10 億人規模のユーザーを抱える Google の主力プロダクトのエンジンとなっています。

次世代 AI 向けに設計

次世代 AI 向けに設計

Tensor Processing Unit(TPU)は、オープン ソフトウェアと共同設計されたカスタム アクセラレータで、フロンティア トレーニングや大規模な推論から、エージェント型 AI のマルチステップの推論データの需要まで、AI ライフサイクル全体を強化します。

AI ハイパーコンピュータ

TPU は、専用ハードウェア、オープン ソフトウェア、柔軟な使用量モデルを組み合わせた画期的なアーキテクチャである Google Cloud の AI Hypercomputer を基盤としています。

10 年以上にわたる TPU のイノベーション

TPU は、大規模言語モデルやコード生成からインテリジェント エージェントまで、高度な AI ワークロード向けに構築されています。これらは、Gemini や、検索、フォト、マップなど、10 億人規模のユーザーを抱える Google の主力プロダクトのエンジンとなっています。

利点

オープンで柔軟、信頼性の高い運用

TPU はオープンで柔軟、高い信頼性

使い慣れたライブラリとツールを使用して、オープンなエコシステム上に構築できます。TPU は、PyTorch と JAX をネイティブに高パフォーマンスでサポートし、高速推論のための vLLM エンジンをサポートします。Google Kubernetes Engine(GKE)を使用して、グローバル クラスタ全体でこれらのデプロイを確実に管理およびスケーリングできます。

単一の論理トレーニング クラスタに 100 万以上の TPU

フロンティア モデルのトレーニングを数か月から数週間に短縮します。単一のクラスタに最大 100 万個の TPU チップを搭載した TPU は、グッドプットを最大化し、ほぼすべてのコンピューティング サイクルがアクティブ ラーニングに確実に使用されるようにします。

TPU はオープンで柔軟、高い信頼性
単一の論理トレーニング クラスタに 100 万以上の TPU

利点

オープンで柔軟、信頼性の高い運用

TPU はオープンで柔軟、高い信頼性

使い慣れたライブラリとツールを使用して、オープンなエコシステム上に構築できます。TPU は、PyTorch と JAX をネイティブに高パフォーマンスでサポートし、高速推論のための vLLM エンジンをサポートします。Google Kubernetes Engine(GKE)を使用して、グローバル クラスタ全体でこれらのデプロイを確実に管理およびスケーリングできます。

単一の論理トレーニング クラスタに 100 万以上の TPU

フロンティア モデルのトレーニングを数か月から数週間に短縮します。単一のクラスタに最大 100 万個の TPU チップを搭載した TPU は、グッドプットを最大化し、ほぼすべてのコンピューティング サイクルがアクティブ ラーニングに確実に使用されるようにします。

TPU 8t - トレーニングに最適化
TPU 8i - 推論と強化学習向けに最適化
Ironwood TPU
Trillium TPU
TPU のバージョン

TPU 8t

TPU 8t - トレーニングに最適化

TPU 8t は、大規模な事前トレーニングとエンベディングを多用するワークロード向けに構築されており、1 つの Superpod に 9,600 個のチップを搭載し、Pod あたり前世代の約 3 倍のコンピューティング パフォーマンスで、フロンティア モデルに必要な高密度のコンピューティングを実現します。

近日提供予定です。

TPU 8i - 推論と強化学習向けに最適化

TPU 8i は、ポスト トレーニングおよび推論に最適化されています。大規模な MoE モデルの低レイテンシ推論において、前世代と比較して 1 ドルあたりのパフォーマンスが 80% 向上しています。

近日提供予定です。

Ironwood TPU

大規模なトレーニングおよび推論用に設計された第 7 世代のエネルギー効率の高い TPU です。Pod あたり 9,216 個の液冷チップを搭載し、42.5 エクサフロップを実現しています。チップあたりのパフォーマンスは Trillium の 4 倍です。

一般提供。

ドキュメント | 料金

Trillium TPU

トレーニングと推論のエネルギー効率とピーク コンピューティング パフォーマンスが向上した第 6 世代の TPU です。前世代の TPU v5e と比較して、エネルギー効率が 67% 向上し、チップあたりのピーク コンピューティング パフォーマンスが 4.7 倍に向上しています。

一般提供。

ドキュメント | 料金

TPU のバージョン

TPU 8t

TPU 8t - トレーニングに最適化

TPU 8t は、大規模な事前トレーニングとエンベディングを多用するワークロード向けに構築されており、1 つの Superpod に 9,600 個のチップを搭載し、Pod あたり前世代の約 3 倍のコンピューティング パフォーマンスで、フロンティア モデルに必要な高密度のコンピューティングを実現します。

近日提供予定です。

TPU 8i - 推論と強化学習向けに最適化

TPU 8i は、ポスト トレーニングおよび推論に最適化されています。大規模な MoE モデルの低レイテンシ推論において、前世代と比較して 1 ドルあたりのパフォーマンスが 80% 向上しています。

近日提供予定です。

Ironwood TPU

大規模なトレーニングおよび推論用に設計された第 7 世代のエネルギー効率の高い TPU です。Pod あたり 9,216 個の液冷チップを搭載し、42.5 エクサフロップを実現しています。チップあたりのパフォーマンスは Trillium の 4 倍です。

一般提供。

ドキュメント | 料金

Trillium TPU

トレーニングと推論のエネルギー効率とピーク コンピューティング パフォーマンスが向上した第 6 世代の TPU です。前世代の TPU v5e と比較して、エネルギー効率が 67% 向上し、チップあたりのピーク コンピューティング パフォーマンスが 4.7 倍に向上しています。

一般提供。

ドキュメント | 料金

Jax
TorchTPU
OpenXLA
Maxtext
Tunix
vLLM TPU 推論

TPU ソフトウェア スタック

TPU ソフトウェア スタックは、高レベルの ML コードとカスタム シリコンのギャップを埋め、ハードウェアの効率を最適化するように設計されています。

JAX

Jax

TPU で複雑な数学演算をネイティブ ハードウェアに近い速度でコンパイルします。数値計算と自動微分用のこのオープンソース ライブラリは、明示的なデバイス メッシュを使用して、大規模な分散 TPU クラスタ全体に簡単にスケーリングできます。

GitHub リポジトリを表示

TorchTPU

標準の構文を使用して、TPU で PyTorch ワークロードを直接実行します。Meta で構築されたこのネイティブな「イーガー ファースト」スタックにより、既存のコードベースを最小限の変更で移行して、費用対効果を大幅に向上させることができます。エンジニアリング チームが新しいフレームワークを学習する必要はありません。

記事を読む

OpenXLA

コンパイルのボトルネックを減らして、TPU ハードウェアから高いパフォーマンスを引き出します。このオープンソースの ML コンパイラは、TPU バックエンド全体で演算を自動的に融合し、メモリ使用量を最適化して、線形代数計算のフレームワーク オーバーヘッドを排除します。

GitHub リポジトリを表示

Maxtext

大規模な基盤モデルのトレーニング期間を大幅に短縮します。この JAX ベースのリファレンス実装は、TPU での LLM の事前トレーニング中にハードウェアの使用率を最大化するための、スケーラビリティに優れた、すぐに使えるブループリントを提供します。

GitHub リポジトリを表示

Tunix

TPU インフラストラクチャ上で LLM のポストトレーニングとアライメントを合理化します。この軽量なオープンソースの JAX ライブラリは、教師ありファインチューニング(SFT)と強化学習(RL)のスケーラブルなワークフローを提供し、未加工のモデルをプロダクション レディなエージェントに効率的に変換します。

GitHub リポジトリを表示

vLLM TPU 推論

リアルタイム TPU 推論のサービング同時実行を最大化し、運用コストを削減します。この高スループットのオープンソース エンジンは、PagedAttention などのメモリ管理手法を活用して無駄を排除し、TPU アーキテクチャ上で非常に効率的な LLM サービングを実現します。

GitHub リポジトリを表示

TPU ソフトウェア スタック

TPU ソフトウェア スタックは、高レベルの ML コードとカスタム シリコンのギャップを埋め、ハードウェアの効率を最適化するように設計されています。

JAX

Jax

TPU で複雑な数学演算をネイティブ ハードウェアに近い速度でコンパイルします。数値計算と自動微分用のこのオープンソース ライブラリは、明示的なデバイス メッシュを使用して、大規模な分散 TPU クラスタ全体に簡単にスケーリングできます。

GitHub リポジトリを表示

TorchTPU

標準の構文を使用して、TPU で PyTorch ワークロードを直接実行します。Meta で構築されたこのネイティブな「イーガー ファースト」スタックにより、既存のコードベースを最小限の変更で移行して、費用対効果を大幅に向上させることができます。エンジニアリング チームが新しいフレームワークを学習する必要はありません。

記事を読む

OpenXLA

コンパイルのボトルネックを減らして、TPU ハードウェアから高いパフォーマンスを引き出します。このオープンソースの ML コンパイラは、TPU バックエンド全体で演算を自動的に融合し、メモリ使用量を最適化して、線形代数計算のフレームワーク オーバーヘッドを排除します。

GitHub リポジトリを表示

Maxtext

大規模な基盤モデルのトレーニング期間を大幅に短縮します。この JAX ベースのリファレンス実装は、TPU での LLM の事前トレーニング中にハードウェアの使用率を最大化するための、スケーラビリティに優れた、すぐに使えるブループリントを提供します。

GitHub リポジトリを表示

Tunix

TPU インフラストラクチャ上で LLM のポストトレーニングとアライメントを合理化します。この軽量なオープンソースの JAX ライブラリは、教師ありファインチューニング(SFT)と強化学習(RL)のスケーラブルなワークフローを提供し、未加工のモデルをプロダクション レディなエージェントに効率的に変換します。

GitHub リポジトリを表示

vLLM TPU 推論

リアルタイム TPU 推論のサービング同時実行を最大化し、運用コストを削減します。この高スループットのオープンソース エンジンは、PagedAttention などのメモリ管理手法を活用して無駄を排除し、TPU アーキテクチャ上で非常に効率的な LLM サービングを実現します。

GitHub リポジトリを表示

TPU がイノベーターを支援

Citadel Securities は Ironwood でワークロードを最大 4 倍高速化
金融市場において、ナノ秒の差がすべてを左右します。Citadel Securities は Google Cloud と提携して、ワークロードを 2~4 倍高速化し、コストを 30% 削減できる、スケーラブルなクラウドベースの量的調査環境を構築しました。Ironwood TPU を基盤とするインフラストラクチャにより、以前は数週間または数日かかっていたワークロードが数時間、場合によっては数分で実行されるようになり、世界中のお客様が投資目標を達成できるようになりました。
TPU で最大 4 倍高速化
Nuro、Google Cloud を利用してドライバーレスの未来を安全に導く
Nuro は、Google Cloud TPU と Google Kubernetes Engine を活用することで、自律走行技術の開発を大幅に加速させ、追加費用なしで AI モデルのトレーニングを 2 倍の速度で実行しています。ペタバイト規模の実際の運転データを処理し、大規模な安全性シミュレーションを実行することで、Nuro Driver を継続的に改善し、乗用車からセミトラックまで、あらゆる車両を公道で安全に走行できるようにしています。
Nuro の無人運転車
Lightricks が TPU 上で JAX を使用して動画拡散モデルを大規模にトレーニング
Lightricks は、コードベースを Google Cloud TPU の JAX に移行することで、130 億パラメータの生成動画モデルのトレーニングを大幅に高速化し、1 日あたりのトレーニング ステップ数を 40% 増加させました。以前のスケーラビリティの制限を克服したこの戦略的転換により、数千の TPU コアにわたるリニア スケーリングが実現し、開発者の生産性が 2 倍になりました。これにより、Lightricks は高性能で高度に制御可能な AI 動画ツールをクリエイター エコノミーに迅速に提供できるようになりました。
Lightricks の動画編集

参考情報

次のステップ

Cloud のロゴ

よくある質問

Tensor Processing Unit(TPU)とは

TPU は、Google が開発したカスタム設計の特定用途向け集積回路(ASIC)です。ML と AI のワークロードを高速化するために、一から専用に構築されています。TPU は、ニューラル ネットワークの基本的な構成要素として機能する、大量の行列乗算とテンソル演算に特化して最適化されており、大規模言語モデルから複雑な推論エージェントまで、あらゆるものを強化します。

TPU アーキテクチャの仕組み

TPU の中核となるのは、大量の行列演算を同時に処理する専用の行列乗算ユニット(MXU)です。TPU は「シストリック アレイ」アーキテクチャを利用して、データを一度読み取ると、数千の算術論理ユニット(ALU)に継続的に流し、メモリへの読み取りと書き込みを常に行うことなく結果を蓄積します。また、低精度演算(16 ビットまたは 8 ビット浮動小数点など)をサポートしているため、AI モデルに必要な精度を犠牲にすることなく、1 秒あたり数百万回の計算が可能です。

Cloud TPU でサポートされている ML フレームワークはどれですか?

Cloud TPU は、主要な ML フレームワーク(主に TensorFlow、PyTorch、JAX)をネイティブにサポートし、高いパフォーマンスを実現します。これらのフレームワークで記述されたコードは、Accelerated Linear Algebra(XLA)コンパイラによってコンパイルされます。このコンパイラは、基盤となる TPU ハードウェア上で効率的に実行されるように計算グラフを自動的に最適化します。

TPU に最適なワークロードのタイプは?

TPU は、大規模な並列行列演算を必要とするディープ ラーニング タスクに優れています。次の場合に強くおすすめします。

  • 行列計算が多くを占めるモデル
  • 収束するまでに数週間から数か月かかるトレーニング実行
  • 大規模な基盤モデルと大規模言語モデル(LLM)
  • 高度なレコメンデーション エンジンなど、極めて大規模なエンベディングを含むワークロード
  • 継続的な強化学習と、大量かつ低レイテンシの推論


TPU Pod とスライスとは

TPU Pod は、専用の高速ネットワーク(Google の光回路スイッチや Virgo ネットワークなど)で接続された TPU チップの巨大な物理クラスタです。1 つのスーパーポッドには、相互接続された数千個のチップを搭載できます。「スライス」は、レンタルできる Pod の専用の小さなサブセットです。このネットワーキング アーキテクチャにより、デベロッパーはコードをほとんど、あるいはまったく変更することなく、大量のコンピューティングにわたって AI ワークロードをスケーリングし、スライス全体を単一の統合マシンとして効果的に運用できます。


TPU トレーニングのコンテキストにおける ML の「グッドプット」とは何ですか?

Goodputとは、インフラストラクチャがアイドル状態ではなく、モデルのトレーニングに実際に費やした生産的な時間を指します。大規模な基盤モデルのトレーニングには、数千個のチップにわたる複雑なオーケストレーションが伴います。つまり、データ転送の遅延、ハードウェアのリセット、チェックポイント処理によって、コンピューティング サイクルが簡単に無駄になってしまいます。Cloud TPU は、高帯域幅の相互接続と最適化されたメモリ キャッシュによってグッドプットを最大化するように設計されており、有料のコンピューティング サイクルがモデルの進歩に直接貢献します。

TPU の大規模なオーケストレーションはどのように処理されますか?

ユーザーは、Google Kubernetes Engine(GKE)と Cluster Director を使用して、信頼性、包括的なモニタリング、管理をサポートできます。TPU 向け GKE を活用することで、お客様は、ロード バランシング用の Inference Gateway と、デプロイを最大 130,000 個の GKE ノードまでスケールする機能を備えたクラウドネイティブなエコシステムで運用できます。

  • Google Cloud プロダクト
  • 100 種類を超えるプロダクトをご用意しています。新規のお客様には、ワークロードの実行、テスト、デプロイができる無料クレジット $300 分を差し上げます。また、すべてのお客様に 25 以上のプロダクトを無料でご利用いただけます(毎月の使用量上限があります)。
Google Cloud