Progettato per l'AI di nuova generazione
Basato su AI Hypercomputer
Un decennio di Tensor Processing Unit (TPU)

Le TPU sono progettate appositamente per workload di AI avanzati, dai modelli linguistici di grandi dimensioni alla generazione di codice, fino agli agenti intelligenti. Sono il motore di Gemini e dei prodotti di punta di Google con miliardi di utenti, tra cui la Ricerca, Foto e Maps.
Progettato per l'AI di nuova generazione
Basato su AI Hypercomputer
Un decennio di Tensor Processing Unit (TPU)

Le TPU sono progettate appositamente per workload di AI avanzati, dai modelli linguistici di grandi dimensioni alla generazione di codice, fino agli agenti intelligenti. Sono il motore di Gemini e dei prodotti di punta di Google con miliardi di utenti, tra cui la Ricerca, Foto e Maps.
Operazioni aperte, flessibili e affidabili

Crea su un ecosistema aperto utilizzando librerie e strumenti familiari. Le TPU forniscono supporto nativo e ad alte prestazioni per PyTorch e JAX e supportano il motore vLLM per un'inferenza rapida. Gestisci e scala questi deployment in modo affidabile tra cluster globali con Google Kubernetes Engine (GKE).
Prestazioni senza compromessi

Trasforma mesi di addestramento in settimane per i modelli di frontiera. Con un massimo di 1 milione di chip TPU in un singolo cluster, le TPU massimizzano il goodput, garantendo che quasi ogni ciclo di calcolo sia destinato all'apprendimento attivo.


Operazioni aperte, flessibili e affidabili

Crea su un ecosistema aperto utilizzando librerie e strumenti familiari. Le TPU forniscono supporto nativo e ad alte prestazioni per PyTorch e JAX e supportano il motore vLLM per un'inferenza rapida. Gestisci e scala questi deployment in modo affidabile tra cluster globali con Google Kubernetes Engine (GKE).
Prestazioni senza compromessi

Trasforma mesi di addestramento in settimane per i modelli di frontiera. Con un massimo di 1 milione di chip TPU in un singolo cluster, le TPU massimizzano il goodput, garantendo che quasi ogni ciclo di calcolo sia destinato all'apprendimento attivo.
TPU 8t

TPU 8t è progettato per pre-addestramento su larga scala e carichi di lavoro con molti embedding su una scala di 9600 chip in un singolo superpod, offrendo il computing ad alta densità richiesto per i modelli di frontiera con prestazioni di computing per pod quasi 3 volte superiori rispetto alla generazione precedente.
Disponibile a breve.
TPU 8i

TPU 8i è ottimizzata per la post-formazione e l'inferenza. Offre un miglioramento dell'80% delle prestazioni per dollaro rispetto alle generazioni precedenti per l'inferenza a bassa latenza per modelli MoE di grandi dimensioni.
Disponibile a breve.
Ironwood - 7ª generazione
TPU di settima generazione a efficienza energetica progettata per addestramento, ragionamento e inferenza su larga scala. Dispone di 9216 chip raffreddati a liquido per pod,offre 42, 5 ExaFlops e prestazioni per chip 4 volte migliori rispetto a Trillium.
Generalmente disponibile.
Trillium - 6ª generazione
TPU di sesta generazione con efficienza energetica e prestazioni di calcolo di picco migliorate per l'addestramento e l'inferenza. Funziona con un'efficienza energetica superiore del 67% e offre prestazioni di calcolo di picco per chip 4,7 volte superiori rispetto alla precedente generazione di TPU v5e.
Generalmente disponibile.
TPU 8t

TPU 8t è progettato per pre-addestramento su larga scala e carichi di lavoro con molti embedding su una scala di 9600 chip in un singolo superpod, offrendo il computing ad alta densità richiesto per i modelli di frontiera con prestazioni di computing per pod quasi 3 volte superiori rispetto alla generazione precedente.
Disponibile a breve.
TPU 8i

TPU 8i è ottimizzata per la post-formazione e l'inferenza. Offre un miglioramento dell'80% delle prestazioni per dollaro rispetto alle generazioni precedenti per l'inferenza a bassa latenza per modelli MoE di grandi dimensioni.
Disponibile a breve.
Ironwood - 7ª generazione
TPU di settima generazione a efficienza energetica progettata per addestramento, ragionamento e inferenza su larga scala. Dispone di 9216 chip raffreddati a liquido per pod,offre 42, 5 ExaFlops e prestazioni per chip 4 volte migliori rispetto a Trillium.
Generalmente disponibile.
Trillium - 6ª generazione
TPU di sesta generazione con efficienza energetica e prestazioni di calcolo di picco migliorate per l'addestramento e l'inferenza. Funziona con un'efficienza energetica superiore del 67% e offre prestazioni di calcolo di picco per chip 4,7 volte superiori rispetto alla precedente generazione di TPU v5e.
Generalmente disponibile.
Lo stack software TPU è progettato per colmare il divario tra il codice di machine learning di alto livello e il silicio personalizzato per ottimizzare l'efficienza dell'hardware non elaborato.
JAX
Compila operazioni matematiche complesse a una velocità hardware quasi nativa sulle TPU. Questa libreria open source per il calcolo numerico e la differenziazione automatica si adatta facilmente a enormi cluster TPU distribuiti utilizzando una mesh di dispositivi esplicita.
TorchTPU e PyTorch
Esegui carichi di lavoro PyTorch direttamente sulle TPU utilizzando la sintassi standard. Sviluppato con Meta, questo stack nativo "eager-first" consente la migrazione di codebase esistenti con modifiche minime per sbloccare importanti vantaggi in termini di costi e prestazioni, senza richiedere ai team di progettazione di apprendere un nuovo framework.
OpenXLA
Riduci i colli di bottiglia della compilazione per ottenere prestazioni elevate dall'hardware TPU. Questo compilatore di machine learning open source fonde automaticamente le operazioni, ottimizza la memoria utilizzata ed elimina l'overhead del framework per i calcoli di algebra lineare nei backend TPU.
MaxText
Riduci drasticamente i tempi di addestramento per i foundation model di grandi dimensioni. Questa implementazione di riferimento basata su JAX fornisce un progetto altamente scalabile e pronto all'uso per ottenere il massimo utilizzo dell'hardware durante il pre-addestramento degli LLM sulle TPU.
Tunix
Semplifica la post-formazione e l'allineamento degli LLM sull'infrastruttura TPU. Questa libreria JAX open source leggera offre workflow scalabili per il fine-tuning supervisionato (SFT) e il reinforcement learning (RL) per trasformare in modo efficiente i modelli non elaborati in agenti pronti per la produzione.
vLLM
Massimizza la concorrenza di pubblicazione e riduci i costi operativi per l'inferenza TPU in tempo reale. Questo motore open source ad alto throughput sfrutta tecniche di gestione della memoria come PagedAttention per eliminare gli sprechi e offrire un servizio LLM altamente efficiente sull'architettura TPU.
Lo stack software TPU è progettato per colmare il divario tra il codice di machine learning di alto livello e il silicio personalizzato per ottimizzare l'efficienza dell'hardware non elaborato.
JAX
Compila operazioni matematiche complesse a una velocità hardware quasi nativa sulle TPU. Questa libreria open source per il calcolo numerico e la differenziazione automatica si adatta facilmente a enormi cluster TPU distribuiti utilizzando una mesh di dispositivi esplicita.
TorchTPU e PyTorch
Esegui carichi di lavoro PyTorch direttamente sulle TPU utilizzando la sintassi standard. Sviluppato con Meta, questo stack nativo "eager-first" consente la migrazione di codebase esistenti con modifiche minime per sbloccare importanti vantaggi in termini di costi e prestazioni, senza richiedere ai team di progettazione di apprendere un nuovo framework.
OpenXLA
Riduci i colli di bottiglia della compilazione per ottenere prestazioni elevate dall'hardware TPU. Questo compilatore di machine learning open source fonde automaticamente le operazioni, ottimizza la memoria utilizzata ed elimina l'overhead del framework per i calcoli di algebra lineare nei backend TPU.
MaxText
Riduci drasticamente i tempi di addestramento per i foundation model di grandi dimensioni. Questa implementazione di riferimento basata su JAX fornisce un progetto altamente scalabile e pronto all'uso per ottenere il massimo utilizzo dell'hardware durante il pre-addestramento degli LLM sulle TPU.
Tunix
Semplifica la post-formazione e l'allineamento degli LLM sull'infrastruttura TPU. Questa libreria JAX open source leggera offre workflow scalabili per il fine-tuning supervisionato (SFT) e il reinforcement learning (RL) per trasformare in modo efficiente i modelli non elaborati in agenti pronti per la produzione.
vLLM
Massimizza la concorrenza di pubblicazione e riduci i costi operativi per l'inferenza TPU in tempo reale. Questo motore open source ad alto throughput sfrutta tecniche di gestione della memoria come PagedAttention per eliminare gli sprechi e offrire un servizio LLM altamente efficiente sull'architettura TPU.
Le TPU supportano gli innovatori






Le TPU sono circuiti integrati specifici per le applicazioni (ASIC) progettati su misura e sviluppati da Google. Sono progettate appositamente da zero per accelerare i carichi di lavoro di machine learning e intelligenza artificiale. Le TPU sono ottimizzate specificamente per la moltiplicazione di matrici pesanti e le operazioni sui tensori che fungono da elementi costitutivi fondamentali delle reti neurali, alimentando tutto, dai modelli linguistici di grandi dimensioni agli agenti di ragionamento complessi.
Il cuore di una TPU è un'unità di moltiplicazione a matrice (MXU) specializzata che elabora enormi quantità di operazioni con matrici contemporaneamente. Le TPU utilizzano un'architettura "systolic array" che legge i dati una sola volta e li fa fluire continuamente attraverso migliaia di unità logiche aritmetiche (ALU), accumulando risultati senza la necessità di leggere e scrivere costantemente nella memoria. Supportano anche l'aritmetica a precisione ridotta (come la rappresentazione in virgola mobile a 16 bit o 8 bit), consentendo milioni di calcoli al secondo senza sacrificare l'accuratezza richiesta per i modelli di AI.
Le Cloud TPU offrono un supporto nativo ad alte prestazioni per i principali framework di machine learning, principalmente TensorFlow, PyTorch e JAX. Il codice scritto in questi framework viene compilato dal compilatore Accelerated Linear Algebra (XLA), che ottimizza automaticamente il grafico computazionale per essere eseguito in modo efficiente sull'hardware TPU sottostante.
Le TPU eccellono nelle attività di deep learning che richiedono operazioni parallele su matrici di grandi dimensioni. Sono altamente consigliati per:
Un pod di TPU è un enorme cluster fisico di chip TPU collegati tra loro tramite una rete specializzata ad alta velocità (come la rete Optical Circuit Switching o Virgo di Google). Un singolo superpod può contenere migliaia di chip interconnessi. Una "slice" è un sottoinsieme più piccolo e dedicato di un pod che puoi affittare. Questa architettura di rete consente agli sviluppatori di scalare i propri carichi di lavoro di AI su enormi quantità di calcolo con poche o nessuna modifica al codice, gestendo in modo efficace l'intera sezione come una singola macchina unificata.
Il Goodput si riferisce al tempo effettivo e produttivo che l'infrastruttura dedica all'addestramento attivo del modello, anziché all'inattività. L'addestramento di modelli di base di grandi dimensioni comporta un'orchestrazione complessa su migliaia di chip, il che significa che i cicli di calcolo possono essere facilmente sprecati a causa di ritardi nel trasferimento dei dati, ripristini dell'hardware o creazione di checkpoint. Le Cloud TPU sono progettate per massimizzare il goodput attraverso interconnessioni a larghezza di banda elevata e memorizzazione nella cache ottimizzata, garantendo che i cicli di calcolo a pagamento contribuiscano direttamente all'avanzamento del modello.
Gli utenti possono supportare l'affidabilità, il monitoraggio completo e la gestione utilizzando Google Kubernetes Engine (GKE) e Cluster Director. Sfruttando GKE per TPU, i clienti operano in un ecosistema cloud-native dotato di Inference Gateway per il bilanciamento del carico e della capacità di scalare i deployment fino a 130.000 nodi GKE.