Tensor Processing Unit

Addestra, ottimizza ed esegui il deployment di AI avanzata su acceleratori appositamente progettati

Tensor Processing Unit

Addestra, ottimizza ed esegui il deployment di AI avanzata su acceleratori appositamente progettati

Progettato per l'AI di nuova generazione
AI Hypercomputer
Oltre un decennio di innovazione delle TPU

Progettato per l'AI di nuova generazione

Progettato per l'AI di nuova generazione

Le Tensor Processing Unit (TPU) sono acceleratori personalizzati progettati insieme a software open per alimentare l'intero ciclo di vita dell'AI, dall'addestramento all'inferenza su larga scala fino alle richieste di dati di ragionamento multi-step dell'AI agentica.

AI Hypercomputer

Le TPU sono basate su AI Hypercomputer di Google Cloud, un'architettura innovativa che combina hardware appositamente progettato, software aperto e modelli di consumo flessibili.

Oltre un decennio di innovazione delle TPU

Le TPU sono progettate appositamente per workload di AI avanzati, dai modelli linguistici di grandi dimensioni alla generazione di codice, fino agli agenti intelligenti. Sono il motore di Gemini e dei prodotti di punta di Google con miliardi di utenti, tra cui la Ricerca, Foto e Maps.

Progettato per l'AI di nuova generazione

Progettato per l'AI di nuova generazione

Le Tensor Processing Unit (TPU) sono acceleratori personalizzati progettati insieme a software open per alimentare l'intero ciclo di vita dell'AI, dall'addestramento all'inferenza su larga scala fino alle richieste di dati di ragionamento multi-step dell'AI agentica.

AI Hypercomputer

Le TPU sono basate su AI Hypercomputer di Google Cloud, un'architettura innovativa che combina hardware appositamente progettato, software aperto e modelli di consumo flessibili.

Oltre un decennio di innovazione delle TPU

Le TPU sono progettate appositamente per workload di AI avanzati, dai modelli linguistici di grandi dimensioni alla generazione di codice, fino agli agenti intelligenti. Sono il motore di Gemini e dei prodotti di punta di Google con miliardi di utenti, tra cui la Ricerca, Foto e Maps.

Vantaggi

Operazioni aperte, flessibili e affidabili

Le TPU sono aperte, flessibili e affidabili

Crea su un ecosistema aperto utilizzando librerie e strumenti familiari. Le TPU forniscono supporto nativo e ad alte prestazioni per PyTorch e JAX e supportano il motore vLLM per un'inferenza rapida. Gestisci e scala questi deployment in modo affidabile tra cluster globali con Google Kubernetes Engine (GKE).

Oltre 1 milione di TPU in un singolo cluster di addestramento logico

Trasforma mesi di addestramento in settimane per i modelli di frontiera. Con un massimo di 1 milione di chip TPU in un singolo cluster, le TPU massimizzano il goodput, garantendo che quasi ogni ciclo di calcolo sia destinato all'apprendimento attivo.

Le TPU sono aperte, flessibili e affidabili
Oltre 1 milione di TPU in un singolo cluster di addestramento logico

Vantaggi

Operazioni aperte, flessibili e affidabili

Le TPU sono aperte, flessibili e affidabili

Crea su un ecosistema aperto utilizzando librerie e strumenti familiari. Le TPU forniscono supporto nativo e ad alte prestazioni per PyTorch e JAX e supportano il motore vLLM per un'inferenza rapida. Gestisci e scala questi deployment in modo affidabile tra cluster globali con Google Kubernetes Engine (GKE).

Oltre 1 milione di TPU in un singolo cluster di addestramento logico

Trasforma mesi di addestramento in settimane per i modelli di frontiera. Con un massimo di 1 milione di chip TPU in un singolo cluster, le TPU massimizzano il goodput, garantendo che quasi ogni ciclo di calcolo sia destinato all'apprendimento attivo.

TPU 8t - Ottimizzato per l'addestramento
TPU 8i: ottimizzato per l'inferenza e l'apprendimento per rinforzo
TPU Ironwood
TPU Trillium
Versioni TPU

TPU 8t

TPU 8t - Ottimizzato per l'addestramento

TPU 8t è progettato per pre-addestramento su larga scala e carichi di lavoro con molti embedding su una scala di 9600 chip in un singolo superpod, offrendo il computing ad alta densità richiesto per i modelli di frontiera con prestazioni di computing per pod quasi 3 volte superiori rispetto alla generazione precedente.

Disponibile a breve.

TPU 8i: ottimizzato per l'inferenza e l'apprendimento per rinforzo

TPU 8i è ottimizzata per la post-formazione e l'inferenza. Offre un miglioramento dell'80% delle prestazioni per dollaro rispetto alle generazioni precedenti per l'inferenza a bassa latenza per modelli MoE di grandi dimensioni.

Disponibile a breve.

TPU Ironwood

TPU di settima generazione a efficienza energetica progettata per addestramento, ragionamento e inferenza su larga scala. Dispone di 9216 chip raffreddati a liquido per pod,offre 42, 5 ExaFlops e prestazioni per chip 4 volte migliori rispetto a Trillium.

Generalmente disponibile.

Documentazione | Prezzi

TPU Trillium

TPU di sesta generazione con efficienza energetica e prestazioni di calcolo di picco migliorate per l'addestramento e l'inferenza. Funziona con un'efficienza energetica superiore del 67% e offre prestazioni di calcolo di picco per chip 4,7 volte superiori rispetto alla precedente generazione di TPU v5e.

Generalmente disponibile.

Documentazione | Prezzi

Versioni TPU

TPU 8t

TPU 8t - Ottimizzato per l'addestramento

TPU 8t è progettato per pre-addestramento su larga scala e carichi di lavoro con molti embedding su una scala di 9600 chip in un singolo superpod, offrendo il computing ad alta densità richiesto per i modelli di frontiera con prestazioni di computing per pod quasi 3 volte superiori rispetto alla generazione precedente.

Disponibile a breve.

TPU 8i: ottimizzato per l'inferenza e l'apprendimento per rinforzo

TPU 8i è ottimizzata per la post-formazione e l'inferenza. Offre un miglioramento dell'80% delle prestazioni per dollaro rispetto alle generazioni precedenti per l'inferenza a bassa latenza per modelli MoE di grandi dimensioni.

Disponibile a breve.

TPU Ironwood

TPU di settima generazione a efficienza energetica progettata per addestramento, ragionamento e inferenza su larga scala. Dispone di 9216 chip raffreddati a liquido per pod,offre 42, 5 ExaFlops e prestazioni per chip 4 volte migliori rispetto a Trillium.

Generalmente disponibile.

Documentazione | Prezzi

TPU Trillium

TPU di sesta generazione con efficienza energetica e prestazioni di calcolo di picco migliorate per l'addestramento e l'inferenza. Funziona con un'efficienza energetica superiore del 67% e offre prestazioni di calcolo di picco per chip 4,7 volte superiori rispetto alla precedente generazione di TPU v5e.

Generalmente disponibile.

Documentazione | Prezzi

JAX
TorchTPU
OpenXLA
MaxText
Tunix
Inferenza TPU vLLM

Stack software TPU

Lo stack software TPU è progettato per colmare il divario tra il codice di machine learning di alto livello e il silicio personalizzato per ottimizzare l'efficienza dell'hardware non elaborato.

JAX

JAX

Compila operazioni matematiche complesse a una velocità hardware quasi nativa sulle TPU. Questa libreria open source per il calcolo numerico e la differenziazione automatica si adatta facilmente a enormi cluster TPU distribuiti utilizzando una mesh di dispositivi esplicita.

Visualizza il repository GitHub

TorchTPU

Esegui carichi di lavoro PyTorch direttamente sulle TPU utilizzando la sintassi standard. Sviluppato con Meta, questo stack nativo "eager-first" consente la migrazione di codebase esistenti con modifiche minime per sbloccare importanti vantaggi in termini di costi e prestazioni, senza richiedere ai team di progettazione di apprendere un nuovo framework.

Leggi l'articolo

OpenXLA

Riduci i colli di bottiglia della compilazione per ottenere prestazioni elevate dall'hardware TPU. Questo compilatore di machine learning open source fonde automaticamente le operazioni, ottimizza la memoria utilizzata ed elimina l'overhead del framework per i calcoli di algebra lineare nei backend TPU.

Visualizza il repository GitHub

MaxText

Riduci drasticamente i tempi di addestramento per i foundation model di grandi dimensioni. Questa implementazione di riferimento basata su JAX fornisce un progetto altamente scalabile e pronto all'uso per ottenere il massimo utilizzo dell'hardware durante il pre-addestramento degli LLM sulle TPU.

Visualizza il repository GitHub

Tunix

Semplifica la post-formazione e l'allineamento degli LLM sull'infrastruttura TPU. Questa libreria JAX open source leggera offre workflow scalabili per il fine-tuning supervisionato (SFT) e il reinforcement learning (RL) per trasformare in modo efficiente i modelli non elaborati in agenti pronti per la produzione.

Visualizza il repository GitHub

Inferenza TPU vLLM

Massimizza la concorrenza di pubblicazione e riduci i costi operativi per l'inferenza TPU in tempo reale. Questo motore open source ad alto throughput sfrutta tecniche di gestione della memoria come PagedAttention per eliminare gli sprechi e offrire un servizio LLM altamente efficiente sull'architettura TPU.

Visualizza il repository GitHub

Stack software TPU

Lo stack software TPU è progettato per colmare il divario tra il codice di machine learning di alto livello e il silicio personalizzato per ottimizzare l'efficienza dell'hardware non elaborato.

JAX

JAX

Compila operazioni matematiche complesse a una velocità hardware quasi nativa sulle TPU. Questa libreria open source per il calcolo numerico e la differenziazione automatica si adatta facilmente a enormi cluster TPU distribuiti utilizzando una mesh di dispositivi esplicita.

Visualizza il repository GitHub

TorchTPU

Esegui carichi di lavoro PyTorch direttamente sulle TPU utilizzando la sintassi standard. Sviluppato con Meta, questo stack nativo "eager-first" consente la migrazione di codebase esistenti con modifiche minime per sbloccare importanti vantaggi in termini di costi e prestazioni, senza richiedere ai team di progettazione di apprendere un nuovo framework.

Leggi l'articolo

OpenXLA

Riduci i colli di bottiglia della compilazione per ottenere prestazioni elevate dall'hardware TPU. Questo compilatore di machine learning open source fonde automaticamente le operazioni, ottimizza la memoria utilizzata ed elimina l'overhead del framework per i calcoli di algebra lineare nei backend TPU.

Visualizza il repository GitHub

MaxText

Riduci drasticamente i tempi di addestramento per i foundation model di grandi dimensioni. Questa implementazione di riferimento basata su JAX fornisce un progetto altamente scalabile e pronto all'uso per ottenere il massimo utilizzo dell'hardware durante il pre-addestramento degli LLM sulle TPU.

Visualizza il repository GitHub

Tunix

Semplifica la post-formazione e l'allineamento degli LLM sull'infrastruttura TPU. Questa libreria JAX open source leggera offre workflow scalabili per il fine-tuning supervisionato (SFT) e il reinforcement learning (RL) per trasformare in modo efficiente i modelli non elaborati in agenti pronti per la produzione.

Visualizza il repository GitHub

Inferenza TPU vLLM

Massimizza la concorrenza di pubblicazione e riduci i costi operativi per l'inferenza TPU in tempo reale. Questo motore open source ad alto throughput sfrutta tecniche di gestione della memoria come PagedAttention per eliminare gli sprechi e offrire un servizio LLM altamente efficiente sull'architettura TPU.

Visualizza il repository GitHub

Le TPU supportano gli innovatori

Citadel Securities esegue i workload fino a 4 volte più velocemente con Ironwood
Nei mercati finanziari, ogni nanosecondo è importante. Citadel Securities ha collaborato con Google Cloud per creare un ambiente di ricerca quantitativa scalabile e basato su cloud in grado di eseguire carichi di lavoro da 2 a 4 volte più velocemente con un costo inferiore del 30%. Grazie a un'infrastruttura basata su TPU Ironwood, i carichi di lavoro che prima richiedevano settimane o giorni vengono ora eseguiti in ore o addirittura minuti, aiutando i clienti di tutto il mondo a raggiungere i loro obiettivi di investimento.
fino a 4 volte più veloce con le TPU
Nuro sta creando un percorso sicuro verso un futuro senza driver con Google Cloud
Nuro ha accelerato in modo significativo lo sviluppo della sua tecnologia di guida autonoma sfruttando le TPU Google Cloud e Google Kubernetes Engine, addestrando i modelli di AI due volte più velocemente senza costi aggiuntivi. Elaborando petabyte di dati di guida nel mondo reale ed eseguendo simulazioni di sicurezza su larga scala, Nuro migliora continuamente il proprio Driver per navigare in sicurezza con qualsiasi veicolo, dalle autovetture ai semirimorchi, sulle strade pubbliche.
Veicoli senza conducente Nuro
Lightricks addestra modelli di diffusione video su larga scala con JAX su TPU
Lightricks ha accelerato in modo significativo l'addestramento dei suoi modelli video generativi con 13 miliardi di parametri migrando la codebase a JAX su Google Cloud TPU, aumentando i passaggi di addestramento giornalieri del 40%. Superando i precedenti limiti di scalabilità, questo cambiamento strategico ha sbloccato la scalabilità lineare su migliaia di core TPU e raddoppiato la produttività degli sviluppatori, consentendo a Lightricks di portare strumenti video AI ad alte prestazioni e altamente controllabili nell'economia dei creator molto più velocemente.
Editing video Lightricks

Risorse aggiuntive

Passaggi successivi

Logo Cloud

Domande frequenti

Che cos'è una Tensor Processing Unit (TPU)?

Le TPU sono circuiti integrati specifici per le applicazioni (ASIC) progettati su misura e sviluppati da Google. Sono progettate appositamente da zero per accelerare i carichi di lavoro di machine learning e intelligenza artificiale. Le TPU sono ottimizzate specificamente per la moltiplicazione di matrici pesanti e le operazioni sui tensori che fungono da elementi costitutivi fondamentali delle reti neurali, alimentando tutto, dai modelli linguistici di grandi dimensioni agli agenti di ragionamento complessi.

Come funziona l'architettura TPU?

Il cuore di una TPU è un'unità di moltiplicazione a matrice (MXU) specializzata che elabora enormi quantità di operazioni con matrici contemporaneamente. Le TPU utilizzano un'architettura "systolic array" che legge i dati una sola volta e li fa fluire continuamente attraverso migliaia di unità logiche aritmetiche (ALU), accumulando risultati senza la necessità di leggere e scrivere costantemente nella memoria. Supportano anche l'aritmetica a precisione ridotta (come la rappresentazione in virgola mobile a 16 bit o 8 bit), consentendo milioni di calcoli al secondo senza sacrificare l'accuratezza richiesta per i modelli di AI.

Quali framework di machine learning sono supportati dalle Cloud TPU?

Le Cloud TPU offrono un supporto nativo ad alte prestazioni per i principali framework di machine learning, principalmente TensorFlow, PyTorch e JAX. Il codice scritto in questi framework viene compilato dal compilatore Accelerated Linear Algebra (XLA), che ottimizza automaticamente il grafico computazionale per essere eseguito in modo efficiente sull'hardware TPU sottostante.

Quali tipi di workload sono più adatti alle TPU?

Le TPU eccellono nelle attività di deep learning che richiedono operazioni parallele su matrici di grandi dimensioni. Sono altamente consigliati per:

  • Modelli dominati da calcoli matriciali
  • Esecuzioni di addestramento che richiedono settimane o mesi per convergere
  • Modelli di base di grandi dimensioni e modelli linguistici di grandi dimensioni (LLM)
  • Workload con incorporamenti di dimensioni molto grandi, come i motori di consigli avanzati
  • Apprendimento per rinforzo continuo e inferenza ad alto volume e bassa latenza


Cosa sono i pod e le slice TPU?

Un pod di TPU è un enorme cluster fisico di chip TPU collegati tra loro tramite una rete specializzata ad alta velocità (come la rete Optical Circuit Switching o Virgo di Google). Un singolo superpod può contenere migliaia di chip interconnessi. Una "slice" è un sottoinsieme più piccolo e dedicato di un pod che puoi affittare. Questa architettura di rete consente agli sviluppatori di scalare i propri carichi di lavoro di AI su enormi quantità di calcolo con poche o nessuna modifica al codice, gestendo in modo efficace l'intera sezione come una singola macchina unificata. 


Che cos'è il "goodput" di ML nel contesto dell'addestramento TPU?

Il Goodput si riferisce al tempo effettivo e produttivo che l'infrastruttura dedica all'addestramento attivo del modello, anziché all'inattività. L'addestramento di modelli di base di grandi dimensioni comporta un'orchestrazione complessa su migliaia di chip, il che significa che i cicli di calcolo possono essere facilmente sprecati a causa di ritardi nel trasferimento dei dati, ripristini dell'hardware o creazione di checkpoint. Le Cloud TPU sono progettate per massimizzare il goodput attraverso interconnessioni a larghezza di banda elevata e memorizzazione nella cache ottimizzata, garantendo che i cicli di calcolo a pagamento contribuiscano direttamente all'avanzamento del modello.

Come viene gestita l'orchestrazione su larga scala per le TPU?

Gli utenti possono supportare l'affidabilità, il monitoraggio completo e la gestione utilizzando Google Kubernetes Engine (GKE) e Cluster Director. Sfruttando GKE per TPU, i clienti operano in un ecosistema cloud-native dotato di Inference Gateway per il bilanciamento del carico e della capacità di scalare i deployment fino a 130.000 nodi GKE.

Google Cloud