Tensor Processing Unit

透過專用加速器訓練、調整及部署進階 AI

Tensor Processing Unit

透過專用加速器訓練、調整及部署進階 AI

專為新一代 AI 技術打造
AI Hypercomputer
超過十年的 TPU 創新

專為新一代 AI 技術打造

專為新一代 AI 技術打造

Tensor Processing Unit (TPU) 是與開放軟體共同設計的自訂加速器,可支援整個 AI 生命週期,包括前沿訓練、大規模推論,以及代理式 AI 的多步驟推論資料需求。

AI Hypercomputer

TPU 由 Google Cloud 的 AI Hypercomputer 提供支援,這項突破性架構結合專用硬體、開放式軟體和彈性計費模式。

超過十年的 TPU 創新

TPU 專為進階 AI 工作負載打造,從大型語言模型、程式碼生成到智慧代理,統統都能輕鬆應對。TPU 是 Gemini 和 Google 旗艦產品 (包括搜尋、相簿和地圖) 的核心引擎,這些產品擁有數十億使用者。

專為新一代 AI 技術打造

專為新一代 AI 技術打造

Tensor Processing Unit (TPU) 是與開放軟體共同設計的自訂加速器,可支援整個 AI 生命週期,包括前沿訓練、大規模推論,以及代理式 AI 的多步驟推論資料需求。

AI Hypercomputer

TPU 由 Google Cloud 的 AI Hypercomputer 提供支援,這項突破性架構結合專用硬體、開放式軟體和彈性計費模式。

超過十年的 TPU 創新

TPU 專為進階 AI 工作負載打造,從大型語言模型、程式碼生成到智慧代理,統統都能輕鬆應對。TPU 是 Gemini 和 Google 旗艦產品 (包括搜尋、相簿和地圖) 的核心引擎,這些產品擁有數十億使用者。

優點

開放、彈性且可靠的作業

TPU 具備開放性、彈性與可靠性

使用熟悉的程式庫和工具,在開放生態系統中進行建構。TPU 原生支援 PyTorch 和 JAX,效能優異,並支援 vLLM 引擎,可快速推論。透過 Google Kubernetes Engine (GKE),在全域叢集中可靠地管理及擴充這些部署作業。

單一邏輯訓練叢集內有超過 100 萬個 TPU

將前沿模型的訓練時間從數月縮短至數週。單一叢集最多可容納 100 萬個 TPU 晶片,能盡量提高有效處理量,確保幾乎每個運算週期都用於主動學習。

TPU 具備開放性、彈性與可靠性
單一邏輯訓練叢集內有超過 100 萬個 TPU

優點

開放、彈性且可靠的作業

TPU 具備開放性、彈性與可靠性

使用熟悉的程式庫和工具,在開放生態系統中進行建構。TPU 原生支援 PyTorch 和 JAX,效能優異,並支援 vLLM 引擎,可快速推論。透過 Google Kubernetes Engine (GKE),在全域叢集中可靠地管理及擴充這些部署作業。

單一邏輯訓練叢集內有超過 100 萬個 TPU

將前沿模型的訓練時間從數月縮短至數週。單一叢集最多可容納 100 萬個 TPU 晶片,能盡量提高有效處理量,確保幾乎每個運算週期都用於主動學習。

TPU 8t:專為訓練最佳化
TPU 8i:專為推論和強化學習最佳化
Ironwood TPU
Trillium TPU
TPU 版本

TPU 8t

TPU 8t:專為訓練最佳化

TPU 8t 專為大規模預先訓練和嵌入密集型工作負載而打造,單一 Superpod 可容納 9,600 個晶片,每個 Pod 的運算效能幾乎是前一代的 3 倍,可提供前沿模型需要的高密度運算。

即將推出。

TPU 8i:專為推論和強化學習最佳化

TPU 8i 經過最佳化調整,適合用於後訓練和推論作業。與前幾代產品相比,這款晶片在大型 MoE 模型的低延遲推論方面,每單位費用的推論效能提升 80%。

即將推出。

Ironwood TPU

第 7 代高效節能 TPU,專為大規模訓練、推理和推論作業打造。每個 Pod 搭載 9,216 個液冷晶片,提供 4,250 萬兆次浮點運算的能力,且每個晶片的效能是 Trillium 的 4 倍。

通用版。

說明文件 | 定價

Trillium TPU

第 6 代 TPU 提升了能源效率,並提高訓練和推論運算的尖峰效能。與前一代 TPU v5e 相比,能源效率提升 67%,每個晶片的運算尖峰效能提高 4.7 倍。

通用版。

說明文件 | 定價

TPU 版本

TPU 8t

TPU 8t:專為訓練最佳化

TPU 8t 專為大規模預先訓練和嵌入密集型工作負載而打造,單一 Superpod 可容納 9,600 個晶片,每個 Pod 的運算效能幾乎是前一代的 3 倍,可提供前沿模型需要的高密度運算。

即將推出。

TPU 8i:專為推論和強化學習最佳化

TPU 8i 經過最佳化調整,適合用於後訓練和推論作業。與前幾代產品相比,這款晶片在大型 MoE 模型的低延遲推論方面,每單位費用的推論效能提升 80%。

即將推出。

Ironwood TPU

第 7 代高效節能 TPU,專為大規模訓練、推理和推論作業打造。每個 Pod 搭載 9,216 個液冷晶片,提供 4,250 萬兆次浮點運算的能力,且每個晶片的效能是 Trillium 的 4 倍。

通用版。

說明文件 | 定價

Trillium TPU

第 6 代 TPU 提升了能源效率,並提高訓練和推論運算的尖峰效能。與前一代 TPU v5e 相比,能源效率提升 67%,每個晶片的運算尖峰效能提高 4.7 倍。

通用版。

說明文件 | 定價

Jax
TorchTPU
OpenXLA
MaxText
Tunix
vLLM TPU 推論

TPU 軟體堆疊

TPU 軟體堆疊經過精心設計,可彌補高階機器學習程式碼與自訂晶片之間的差距,充分發揮原始硬體效率。

JAX

Jax

在 TPU 上以接近原生硬體的速度編譯複雜的數學運算。這個開放原始碼程式庫適用於數值運算和自動微分,可透過明確的裝置網格,輕鬆擴充至大規模分散式 TPU 叢集。

查看 GitHub 存放區

TorchTPU

使用標準語法,直接在 TPU 上執行 PyTorch 工作負載。這項技術堆疊由 Meta 打造,採用「急切優先」的原生設計,只需極少變更就能遷移現有程式碼集,大幅提升成本效益,且工程團隊無須學習新的框架。

閱讀文章

OpenXLA

減少編譯瓶頸,充分發揮 TPU 硬體的高度效能。這款開放原始碼機器學習編譯器會自動融合運算並最佳化記憶體用量,消除 TPU 後端線性代數運算的框架負擔。

查看 GitHub 存放區

MaxText

大幅縮短大規模基礎模型的訓練時程。這個以 JAX 為基礎的參考實作項目提供可高度擴充的現成藍圖,能在 TPU 上預先訓練 LLM 時,達到硬體使用率高峰。

查看 GitHub 存放區

Tunix

在 TPU 基礎架構上簡化 LLM 後訓練和對齊作業。這個輕量級開放原始碼 JAX 程式庫提供可擴充的監督式微調 (SFT) 和強化學習 (RL) 工作流程,能有效將原始模型轉變為可用於正式環境的代理程式。

查看 GitHub 存放區

vLLM TPU 推論

盡可能提高供應並行,降低即時 TPU 推論的營運成本。這個高處理量開放原始碼引擎採用 PagedAttention 之類的記憶體管理技術,能夠消除浪費,在 TPU 架構上提供高效 LLM 服務。

查看 GitHub 存放區

TPU 軟體堆疊

TPU 軟體堆疊經過精心設計,可彌補高階機器學習程式碼與自訂晶片之間的差距,充分發揮原始硬體效率。

JAX

Jax

在 TPU 上以接近原生硬體的速度編譯複雜的數學運算。這個開放原始碼程式庫適用於數值運算和自動微分,可透過明確的裝置網格,輕鬆擴充至大規模分散式 TPU 叢集。

查看 GitHub 存放區

TorchTPU

使用標準語法,直接在 TPU 上執行 PyTorch 工作負載。這項技術堆疊由 Meta 打造,採用「急切優先」的原生設計,只需極少變更就能遷移現有程式碼集,大幅提升成本效益,且工程團隊無須學習新的框架。

閱讀文章

OpenXLA

減少編譯瓶頸,充分發揮 TPU 硬體的高度效能。這款開放原始碼機器學習編譯器會自動融合運算並最佳化記憶體用量,消除 TPU 後端線性代數運算的框架負擔。

查看 GitHub 存放區

MaxText

大幅縮短大規模基礎模型的訓練時程。這個以 JAX 為基礎的參考實作項目提供可高度擴充的現成藍圖,能在 TPU 上預先訓練 LLM 時,達到硬體使用率高峰。

查看 GitHub 存放區

Tunix

在 TPU 基礎架構上簡化 LLM 後訓練和對齊作業。這個輕量級開放原始碼 JAX 程式庫提供可擴充的監督式微調 (SFT) 和強化學習 (RL) 工作流程,能有效將原始模型轉變為可用於正式環境的代理程式。

查看 GitHub 存放區

vLLM TPU 推論

盡可能提高供應並行,降低即時 TPU 推論的營運成本。這個高處理量開放原始碼引擎採用 PagedAttention 之類的記憶體管理技術,能夠消除浪費,在 TPU 架構上提供高效 LLM 服務。

查看 GitHub 存放區

TPU 為創新者提供強大助力

Citadel Securities 採用 Ironwood 後,工作負載執行速度提升 4 倍
在金融市場中,每奈秒都至關重要。Citadel Securities 與 Google Cloud 合作,打造可擴充的雲端式量性研究環境,不僅能將工作負載執行速度提升 2 至 4 倍,還能降低 30% 的成本。建立在 Ironwood TPU 上的基礎架構可將原本需要數週或數天的作業負載,縮短至數小時甚至數分鐘,協助全球客戶達成投資目標。
使用 TPU 時,速度最多可提升 4 倍
Nuro 運用 Google Cloud 打造安全的自駕車未來
Nuro 運用 Google Cloud TPU 和 Google Kubernetes Engine,大幅加快自動駕駛技術的開發速度,AI 模型訓練速度加倍,且無須負擔額外費用。Nuro 處理數 PB 的實際駕駛資料,並執行大規模安全模擬,持續改良 Nuro Driver,讓各種車輛 (從轎車到半掛式卡車) 都能安全導航,行駛於公共道路。
Nuro 自駕車
Lightricks 在 TPU 使用 JAX,大規模訓練影片擴散模型
Lightricks 將程式碼集遷移至 Google Cloud TPU 上的 JAX,大幅加快了 130 億參數生成式影片模型的訓練速度,每日訓練步驟增加 40%。這項策略轉變克服了先前的擴充性限制,讓數千個 TPU 核心能以線性方式調度資源,開發人員的工作效率也提高了一倍,讓 Lightricks 能更快為創作者經濟提供高效能、高度可控的 AI 影片工具。
Lightricks 影片編輯

其他資源

採取後續步驟

Cloud 標誌

常見問題

什麼是 Tensor Processing Unit (TPU)?

TPU 是 Google 開發的客製化特殊應用積體電路 (ASIC),專為加速機器學習和人工智慧工作負載而設計。TPU 經過最佳化調整,能高效處理大量矩陣乘法與張量運算,這些是類神經網路的基本建構模塊,可支援從大型語言模型到複雜推論代理的各類應用。

TPU 架構如何運作?

TPU 的核心是專門的矩陣乘法單元 (MXU),可同時處理大量矩陣運算。TPU 採用「收縮陣列」架構,資料讀取一次後即可持續流經數千個算術邏輯單元 (ALU),累積運算結果,無需反覆讀寫記憶體。此外,TPU 也支援降低精確度的算術運算 (例如 16 位元或 8 位元浮點數),每秒可執行數百萬次運算,同時維持 AI 模型所需的準確率。

Cloud TPU 支援哪些機器學習框架?

Cloud TPU 原生支援頂尖的機器學習框架,主要包括 TensorFlow、PyTorch 和 JAX,並提供高效能。以這些框架編寫的程式碼會由加速線性代數 (XLA) 編譯器編譯,自動將運算圖最佳化,在底層 TPU 硬體上有效率地執行。

哪種類型的工作負載最適合 TPU?

TPU 非常適合需要大量平行矩陣運算的深度學習工作。強烈建議使用這些工具:

  • 以矩陣運算為主的模型
  • 訓練執行時間長達數週或數月才能收斂
  • 大型基礎模型和大型語言模型 (LLM)
  • 需要超大型嵌入的工作負載,例如進階推薦引擎
  • 持續強化學習和低延遲、高容量的推論


什麼是 TPU Pod 和配量?

TPU Pod 是由 TPU 晶片組成的大型實體叢集,透過專用高速網路 (例如 Google 的光學電路交換或 Virgo 網路) 相互連接。單一超級 Pod 可包含數千個互連晶片,而「配量」則是可租用的 Pod 專屬子集。有了這種網路架構,開發人員幾乎不必修改程式碼,就能在大量運算資源中擴充 AI 工作負載,有效將整個配量視為單一機器運作。


在 TPU 訓練情境中,機器學習的「有效處理量」是指什麼?

Goodput是指基礎架構實際用於主動訓練模型的時間,不包含閒置時間。訓練龐大的基礎模型需要協調數千個晶片,因此資料傳輸延遲、硬體重設或檢查點作業都很容易造成運算週期的浪費。Cloud TPU 經過精心設計,可透過高頻寬互連網路和最佳化記憶體快取,盡可能提高有效處理量,確保付費的運算週期直接用於推動模型進展。

TPU 如何大規模處理自動化調度管理?

使用者可以透過 Google Kubernetes Engine (GKE) 和 Cluster Director,確保可靠性、全面監控及管理。透過 TPU 專用 GKE,客戶能在雲端原生生態系統中運作,使用推論閘道進行負載平衡,並將部署規模擴充至多達 130,000 個 GKE 節點。