專為新一代 AI 技術打造
Tensor Processing Unit (TPU) 十年成就

TPU 專為進階 AI 工作負載打造,從大型語言模型、程式碼生成到智慧代理,統統都能輕鬆應對。TPU 是 Gemini 和 Google 旗艦產品 (包括搜尋、相簿和地圖) 的核心引擎,這些產品擁有數十億使用者。
專為新一代 AI 技術打造
Tensor Processing Unit (TPU) 十年成就

TPU 專為進階 AI 工作負載打造,從大型語言模型、程式碼生成到智慧代理,統統都能輕鬆應對。TPU 是 Gemini 和 Google 旗艦產品 (包括搜尋、相簿和地圖) 的核心引擎,這些產品擁有數十億使用者。
開放、彈性且可靠的作業

使用熟悉的程式庫和工具,在開放生態系統中進行建構。TPU 原生支援 PyTorch 和 JAX,效能優異,並支援 vLLM 引擎,可快速推論。透過 Google Kubernetes Engine (GKE),在全域叢集中可靠地管理及擴充這些部署作業。
效能不打折

將前沿模型的訓練時間從數月縮短至數週。單一叢集最多可容納 100 萬個 TPU 晶片,能盡量提高有效處理量,確保幾乎每個運算週期都用於主動學習。


開放、彈性且可靠的作業

使用熟悉的程式庫和工具,在開放生態系統中進行建構。TPU 原生支援 PyTorch 和 JAX,效能優異,並支援 vLLM 引擎,可快速推論。透過 Google Kubernetes Engine (GKE),在全域叢集中可靠地管理及擴充這些部署作業。
效能不打折

將前沿模型的訓練時間從數月縮短至數週。單一叢集最多可容納 100 萬個 TPU 晶片,能盡量提高有效處理量,確保幾乎每個運算週期都用於主動學習。
TPU 8t

TPU 8t 專為大規模預先訓練和嵌入密集型工作負載而打造,單一 Superpod 可容納 9,600 個晶片,每個 Pod 的運算效能幾乎是前一代的 3 倍,可提供前沿模型需要的高密度運算。
即將推出。
TPU 8i

TPU 8i 經過最佳化調整,適合用於後訓練和推論作業。與前幾代產品相比,這款晶片在大型 MoE 模型的低延遲推論方面,每單位費用的推論效能提升 80%。
即將推出。
Ironwood - 第 7 代
TPU 8t

TPU 8t 專為大規模預先訓練和嵌入密集型工作負載而打造,單一 Superpod 可容納 9,600 個晶片,每個 Pod 的運算效能幾乎是前一代的 3 倍,可提供前沿模型需要的高密度運算。
即將推出。
TPU 8i

TPU 8i 經過最佳化調整,適合用於後訓練和推論作業。與前幾代產品相比,這款晶片在大型 MoE 模型的低延遲推論方面,每單位費用的推論效能提升 80%。
即將推出。
Ironwood - 第 7 代
TPU 軟體堆疊經過精心設計,可彌補高階機器學習程式碼與自訂晶片之間的差距,充分發揮原始硬體效率。
JAX
在 TPU 上以接近原生硬體的速度編譯複雜的數學運算。這個開放原始碼程式庫適用於數值運算和自動微分,可透過明確的裝置網格,輕鬆擴充至大規模分散式 TPU 叢集。
TorchTPU 和 PyTorch
使用標準語法,直接在 TPU 上執行 PyTorch 工作負載。這項技術堆疊由 Meta 打造,採用「急切優先」的原生設計,只需極少變更就能遷移現有程式碼集,大幅提升成本效益,且工程團隊無須學習新的框架。
OpenXLA
減少編譯瓶頸,充分發揮 TPU 硬體的高度效能。這款開放原始碼機器學習編譯器會自動融合運算並最佳化記憶體用量,消除 TPU 後端線性代數運算的框架負擔。
MaxText
大幅縮短大規模基礎模型的訓練時程。這個以 JAX 為基礎的參考實作項目提供可高度擴充的現成藍圖,能在 TPU 上預先訓練 LLM 時,達到硬體使用率高峰。
Tunix
在 TPU 基礎架構上簡化 LLM 後訓練和對齊作業。這個輕量級開放原始碼 JAX 程式庫提供可擴充的監督式微調 (SFT) 和強化學習 (RL) 工作流程,能有效將原始模型轉變為可用於正式環境的代理程式。
vLLM
盡可能提高供應並行,降低即時 TPU 推論的營運成本。這個高處理量開放原始碼引擎採用 PagedAttention 之類的記憶體管理技術,能夠消除浪費,在 TPU 架構上提供高效 LLM 服務。
TPU 軟體堆疊經過精心設計,可彌補高階機器學習程式碼與自訂晶片之間的差距,充分發揮原始硬體效率。
JAX
在 TPU 上以接近原生硬體的速度編譯複雜的數學運算。這個開放原始碼程式庫適用於數值運算和自動微分,可透過明確的裝置網格,輕鬆擴充至大規模分散式 TPU 叢集。
TorchTPU 和 PyTorch
使用標準語法,直接在 TPU 上執行 PyTorch 工作負載。這項技術堆疊由 Meta 打造,採用「急切優先」的原生設計,只需極少變更就能遷移現有程式碼集,大幅提升成本效益,且工程團隊無須學習新的框架。
OpenXLA
減少編譯瓶頸,充分發揮 TPU 硬體的高度效能。這款開放原始碼機器學習編譯器會自動融合運算並最佳化記憶體用量,消除 TPU 後端線性代數運算的框架負擔。
MaxText
大幅縮短大規模基礎模型的訓練時程。這個以 JAX 為基礎的參考實作項目提供可高度擴充的現成藍圖,能在 TPU 上預先訓練 LLM 時,達到硬體使用率高峰。
Tunix
在 TPU 基礎架構上簡化 LLM 後訓練和對齊作業。這個輕量級開放原始碼 JAX 程式庫提供可擴充的監督式微調 (SFT) 和強化學習 (RL) 工作流程,能有效將原始模型轉變為可用於正式環境的代理程式。
vLLM
盡可能提高供應並行,降低即時 TPU 推論的營運成本。這個高處理量開放原始碼引擎採用 PagedAttention 之類的記憶體管理技術,能夠消除浪費,在 TPU 架構上提供高效 LLM 服務。
TPU 為創新者提供強大助力





TPU 是 Google 開發的客製化特殊應用積體電路 (ASIC),專為加速機器學習和人工智慧工作負載而設計。TPU 經過最佳化調整,能高效處理大量矩陣乘法與張量運算,這些是類神經網路的基本建構模塊,可支援從大型語言模型到複雜推論代理的各類應用。
TPU 的核心是專門的矩陣乘法單元 (MXU),可同時處理大量矩陣運算。TPU 採用「收縮陣列」架構,資料讀取一次後即可持續流經數千個算術邏輯單元 (ALU),累積運算結果,無需反覆讀寫記憶體。此外,TPU 也支援降低精確度的算術運算 (例如 16 位元或 8 位元浮點數),每秒可執行數百萬次運算,同時維持 AI 模型所需的準確率。
Cloud TPU 原生支援頂尖的機器學習框架,主要包括 TensorFlow、PyTorch 和 JAX,並提供高效能。以這些框架編寫的程式碼會由加速線性代數 (XLA) 編譯器編譯,自動將運算圖最佳化,在底層 TPU 硬體上有效率地執行。
TPU 非常適合需要大量平行矩陣運算的深度學習工作。強烈建議使用這些工具:
TPU Pod 是由 TPU 晶片組成的大型實體叢集,透過專用高速網路 (例如 Google 的光學電路交換或 Virgo 網路) 相互連接。單一超級 Pod 可包含數千個互連晶片,而「配量」則是可租用的 Pod 專屬子集。有了這種網路架構,開發人員幾乎不必修改程式碼,就能在大量運算資源中擴充 AI 工作負載,有效將整個配量視為單一機器運作。
Goodput是指基礎架構實際用於主動訓練模型的時間,不包含閒置時間。訓練龐大的基礎模型需要協調數千個晶片,因此資料傳輸延遲、硬體重設或檢查點作業都很容易造成運算週期的浪費。Cloud TPU 經過精心設計,可透過高頻寬互連網路和最佳化記憶體快取,盡可能提高有效處理量,確保付費的運算週期直接用於推動模型進展。
使用者可以透過 Google Kubernetes Engine (GKE) 和 Cluster Director,確保可靠性、全面監控及管理。透過 TPU 專用 GKE,客戶能在雲端原生生態系統中運作,使用推論閘道進行負載平衡,並將部署規模擴充至多達 130,000 個 GKE 節點。