Tensor Processing Units

Fortschrittliche KI auf speziell entwickelten Beschleunigern trainieren, optimieren und bereitstellen

Tensor Processing Units

Fortschrittliche KI auf speziell entwickelten Beschleunigern trainieren, optimieren und bereitstellen

Entwickelt für KI der nächsten Generation
AI Hypercomputer
Über ein Jahrzehnt TPU-Innovationen

Entwickelt für KI der nächsten Generation

Entwickelt für KI der nächsten Generation

Tensor Processing Units (TPUs) sind benutzerdefinierte Beschleuniger, die gemeinsam mit offener Software entwickelt wurden, um den gesamten KI-Lebenszyklus zu unterstützen – vom Training von Modellen der nächsten Generation und Inferenz im großen Maßstab bis hin zu den Anforderungen an mehrstufige Problemlösungsdaten von agentischer KI.

AI Hypercomputer

TPUs basieren auf dem KI-Hypercomputer von Google Cloud, einer bahnbrechenden Architektur, die speziell entwickelte Hardware, offene Software und flexible Nutzungsmodelle vereint.

Über ein Jahrzehnt TPU-Innovationen

TPUs wurden speziell für anspruchsvolle KI-Arbeitslasten entwickelt – von Large Language Models und Codegenerierung bis hin zu intelligenten Agenten. Sie sind die Engine hinter Gemini und den wichtigsten Google-Produkten, die von Milliarden von Menschen genutzt werden, darunter die Google Suche, Google Fotos und Google Maps.

Entwickelt für KI der nächsten Generation

Entwickelt für KI der nächsten Generation

Tensor Processing Units (TPUs) sind benutzerdefinierte Beschleuniger, die gemeinsam mit offener Software entwickelt wurden, um den gesamten KI-Lebenszyklus zu unterstützen – vom Training von Modellen der nächsten Generation und Inferenz im großen Maßstab bis hin zu den Anforderungen an mehrstufige Problemlösungsdaten von agentischer KI.

AI Hypercomputer

TPUs basieren auf dem KI-Hypercomputer von Google Cloud, einer bahnbrechenden Architektur, die speziell entwickelte Hardware, offene Software und flexible Nutzungsmodelle vereint.

Über ein Jahrzehnt TPU-Innovationen

TPUs wurden speziell für anspruchsvolle KI-Arbeitslasten entwickelt – von Large Language Models und Codegenerierung bis hin zu intelligenten Agenten. Sie sind die Engine hinter Gemini und den wichtigsten Google-Produkten, die von Milliarden von Menschen genutzt werden, darunter die Google Suche, Google Fotos und Google Maps.

Vorteile

Offene, flexible und zuverlässige Abläufe

TPUs sind offen, flexibel und zuverlässig

Auf einem offenen Ökosystem mit vertrauten Bibliotheken und Tools aufbauen. TPUs bieten native, leistungsstarke Unterstützung für PyTorch und JAX sowie die vLLM-Engine für schnelle Inferenzen. Mit der Google Kubernetes Engine (GKE) können Sie diese Bereitstellungen zuverlässig über globale Cluster hinweg verwalten und skalieren.

Über 1 Million TPUs in einem einzigen logischen Trainingscluster

Verkürzen Sie das Training von Frontier-Modellen von Monaten auf Wochen. Mit bis zu 1 Million TPU-Chips in einem einzigen Cluster maximieren TPUs den Durchsatz, sodass fast jeder Rechenzyklus für aktives Lernen genutzt wird.

TPUs sind offen, flexibel und zuverlässig
Über 1 Million TPUs in einem einzigen logischen Trainingscluster

Vorteile

Offene, flexible und zuverlässige Abläufe

TPUs sind offen, flexibel und zuverlässig

Auf einem offenen Ökosystem mit vertrauten Bibliotheken und Tools aufbauen. TPUs bieten native, leistungsstarke Unterstützung für PyTorch und JAX sowie die vLLM-Engine für schnelle Inferenzen. Mit der Google Kubernetes Engine (GKE) können Sie diese Bereitstellungen zuverlässig über globale Cluster hinweg verwalten und skalieren.

Über 1 Million TPUs in einem einzigen logischen Trainingscluster

Verkürzen Sie das Training von Frontier-Modellen von Monaten auf Wochen. Mit bis zu 1 Million TPU-Chips in einem einzigen Cluster maximieren TPUs den Durchsatz, sodass fast jeder Rechenzyklus für aktives Lernen genutzt wird.

TPU 8t – für das Training optimiert
TPU 8i – optimiert für Inferenz und Reinforcement Learning
Ironwood TPU
Trillium-TPU
TPU-Versionen

TPU 8t

TPU 8t – für das Training optimiert

Die TPU 8t wurde für umfangreiches Vortraining und embeddinglastige Arbeitslasten in einem Umfang von 9.600 Chips in einem einzigen Superpod entwickelt. Sie bietet die hohe Rechenleistung, die für zukunftsweisende Modelle erforderlich ist, und fast die dreifache Rechenleistung pro Pod im Vergleich zur vorherigen Generation.

Bald verfügbar.

TPU 8i – optimiert für Inferenz und Reinforcement Learning

TPU 8i ist für Post-Training und Inferenz optimiert. Es bietet eine um 80% bessere Leistung pro Dollar als frühere Generationen für Inferenz mit niedriger Latenz für große MoE-Modelle.

Bald verfügbar.

Ironwood TPU

Energieeffiziente TPU der 7. Generation, die für umfangreiches Training, Problemlösung und Inferenz entwickelt wurde. Mit 9.216 flüssigkeitsgekühlten Chips pro Pod bietet sie 42,5 Exaflops und eine 4-mal bessere Leistung pro Chip als Trillium.

Allgemein verfügbar

Dokumentation | Preise

Trillium-TPU

TPU der 6. Generation mit verbesserter Energieeffizienz und maximaler Rechenleistung für Training und Inferenz. Arbeitet mit 67% mehr Energieeffizienz und bietet eine 4,7-mal höhere Spitzenrechenleistung pro Chip im Vergleich zur vorherigen Generation TPU v5e.

Allgemein verfügbar

Dokumentation | Preise

TPU-Versionen

TPU 8t

TPU 8t – für das Training optimiert

Die TPU 8t wurde für umfangreiches Vortraining und embeddinglastige Arbeitslasten in einem Umfang von 9.600 Chips in einem einzigen Superpod entwickelt. Sie bietet die hohe Rechenleistung, die für zukunftsweisende Modelle erforderlich ist, und fast die dreifache Rechenleistung pro Pod im Vergleich zur vorherigen Generation.

Bald verfügbar.

TPU 8i – optimiert für Inferenz und Reinforcement Learning

TPU 8i ist für Post-Training und Inferenz optimiert. Es bietet eine um 80% bessere Leistung pro Dollar als frühere Generationen für Inferenz mit niedriger Latenz für große MoE-Modelle.

Bald verfügbar.

Ironwood TPU

Energieeffiziente TPU der 7. Generation, die für umfangreiches Training, Problemlösung und Inferenz entwickelt wurde. Mit 9.216 flüssigkeitsgekühlten Chips pro Pod bietet sie 42,5 Exaflops und eine 4-mal bessere Leistung pro Chip als Trillium.

Allgemein verfügbar

Dokumentation | Preise

Trillium-TPU

TPU der 6. Generation mit verbesserter Energieeffizienz und maximaler Rechenleistung für Training und Inferenz. Arbeitet mit 67% mehr Energieeffizienz und bietet eine 4,7-mal höhere Spitzenrechenleistung pro Chip im Vergleich zur vorherigen Generation TPU v5e.

Allgemein verfügbar

Dokumentation | Preise

Jax
TorchTPU
OpenXLA
MaxText
Tunix
vLLM-TPU-Inferenz

TPU-Software-Stack

Der TPU-Softwarestack wurde entwickelt, um die Lücke zwischen High-Level-Code für maschinelles Lernen und benutzerdefinierten Siliziumchips zu schließen und so die Effizienz der Rohhardware zu optimieren.

JAX

Jax

Komplexe mathematische Operationen mit nahezu nativer Hardwaregeschwindigkeit auf TPUs kompilieren. Diese Open-Source-Bibliothek für numerische Berechnungen und automatische Differenzierung lässt sich mithilfe eines expliziten Gerätemeshes mühelos über massive verteilte TPU-Cluster skalieren.

GitHub-Repository ansehen

TorchTPU

PyTorch-Arbeitslasten mit Standardsyntax direkt auf TPUs ausführen. Dieser native, „Eager-First“-Stack wurde mit Meta entwickelt und ermöglicht die Migration bestehender Codebasen mit minimalen Änderungen, um erhebliche Kosten-Leistungs-Vorteile zu erzielen – ohne dass Engineering-Teams ein neues Framework erlernen müssen.

Artikel lesen

OpenXLA

Kompilierungsengpässe reduzieren, um die hohe Leistung der TPU-Hardware zu nutzen. Dieser Open-Source-Compiler für maschinelles Lernen führt automatisch Operationen zusammen, optimiert die Arbeitsspeichernutzung und eliminiert den Framework-Aufwand für lineare Algebra-Berechnungen über TPU-Backends hinweg.

GitHub-Repository ansehen

MaxText

Verkürzen Sie die Trainingszeiten für umfangreiche Foundation Models. Diese JAX-basierte Referenzimplementierung bietet eine hochgradig skalierbare, sofort einsatzbereite Vorlage, um während des LLM-Vortrainings auf TPUs eine maximale Hardwareauslastung zu erreichen.

GitHub-Repository ansehen

Tunix

Optimieren Sie das Post-Training und die Ausrichtung von LLMs auf der TPU-Infrastruktur. Diese schlanke Open-Source-JAX-Bibliothek bietet skalierbare Workflows für überwachte Feinabstimmung (Supervised Fine-Tuning, SFT) und bestärkendes Lernen (Reinforcement Learning, RL), um Rohmodelle effizient in produktionsreife Agenten zu verwandeln.

GitHub-Repository ansehen

vLLM-TPU-Inferenz

Maximieren Sie die Nebenläufigkeit der Bereitstellung und senken Sie die Betriebskosten für die TPU-Inferenz in Echtzeit. Diese Open-Source-Engine mit hohem Durchsatz nutzt Speicherverwaltungstechniken wie PagedAttention, um Verschwendung zu vermeiden und eine hocheffiziente LLM-Bereitstellung auf der TPU-Architektur zu ermöglichen.

GitHub-Repository ansehen

TPU-Software-Stack

Der TPU-Softwarestack wurde entwickelt, um die Lücke zwischen High-Level-Code für maschinelles Lernen und benutzerdefinierten Siliziumchips zu schließen und so die Effizienz der Rohhardware zu optimieren.

JAX

Jax

Komplexe mathematische Operationen mit nahezu nativer Hardwaregeschwindigkeit auf TPUs kompilieren. Diese Open-Source-Bibliothek für numerische Berechnungen und automatische Differenzierung lässt sich mithilfe eines expliziten Gerätemeshes mühelos über massive verteilte TPU-Cluster skalieren.

GitHub-Repository ansehen

TorchTPU

PyTorch-Arbeitslasten mit Standardsyntax direkt auf TPUs ausführen. Dieser native, „Eager-First“-Stack wurde mit Meta entwickelt und ermöglicht die Migration bestehender Codebasen mit minimalen Änderungen, um erhebliche Kosten-Leistungs-Vorteile zu erzielen – ohne dass Engineering-Teams ein neues Framework erlernen müssen.

Artikel lesen

OpenXLA

Kompilierungsengpässe reduzieren, um die hohe Leistung der TPU-Hardware zu nutzen. Dieser Open-Source-Compiler für maschinelles Lernen führt automatisch Operationen zusammen, optimiert die Arbeitsspeichernutzung und eliminiert den Framework-Aufwand für lineare Algebra-Berechnungen über TPU-Backends hinweg.

GitHub-Repository ansehen

MaxText

Verkürzen Sie die Trainingszeiten für umfangreiche Foundation Models. Diese JAX-basierte Referenzimplementierung bietet eine hochgradig skalierbare, sofort einsatzbereite Vorlage, um während des LLM-Vortrainings auf TPUs eine maximale Hardwareauslastung zu erreichen.

GitHub-Repository ansehen

Tunix

Optimieren Sie das Post-Training und die Ausrichtung von LLMs auf der TPU-Infrastruktur. Diese schlanke Open-Source-JAX-Bibliothek bietet skalierbare Workflows für überwachte Feinabstimmung (Supervised Fine-Tuning, SFT) und bestärkendes Lernen (Reinforcement Learning, RL), um Rohmodelle effizient in produktionsreife Agenten zu verwandeln.

GitHub-Repository ansehen

vLLM-TPU-Inferenz

Maximieren Sie die Nebenläufigkeit der Bereitstellung und senken Sie die Betriebskosten für die TPU-Inferenz in Echtzeit. Diese Open-Source-Engine mit hohem Durchsatz nutzt Speicherverwaltungstechniken wie PagedAttention, um Verschwendung zu vermeiden und eine hocheffiziente LLM-Bereitstellung auf der TPU-Architektur zu ermöglichen.

GitHub-Repository ansehen

TPUs unterstützen Innovatoren

Citadel Securities führt Arbeitslasten mit Ironwood bis zu viermal schneller aus
Auf den Finanzmärkten zählt jede Nanosekunde. Citadel Securities hat mit Google Cloud eine skalierbare, cloudbasierte Umgebung für quantitative Forschung entwickelt, in der Arbeitslasten zwei- bis viermal schneller und 30% kostengünstiger ausgeführt werden können. Mit einer Infrastruktur, die auf Ironwood-TPUs basiert, werden Arbeitslasten, die früher Wochen oder Tage dauerten, jetzt in Stunden oder sogar Minuten ausgeführt. So können Kunden auf der ganzen Welt ihre Investitionsziele erreichen.
Bis zu 4-mal schneller mit TPUs
Nuro ebnet mit Google Cloud den sicheren Weg in eine fahrerlose Zukunft
Nuro hat die Entwicklung seiner Technologie für autonomes Fahren durch den Einsatz von Google Cloud TPUs und der Google Kubernetes Engine deutlich beschleunigt. KI-Modelle werden doppelt so schnell trainiert, ohne dass zusätzliche Kosten entstehen. Durch die Verarbeitung von Petabytes an realen Fahrdaten und die Durchführung umfangreicher Sicherheitssimulationen wird der Nuro Driver kontinuierlich verbessert, um jedes Fahrzeug – vom Pkw bis zum Sattelschlepper – sicher auf öffentlichen Straßen zu bewegen.
Fahrerlose Fahrzeuge von Nuro
Lightricks trainiert Videodiffusionsmodelle mit JAX auf TPU in großem Umfang
Lightricks hat das Training seiner generativen Videomodelle mit 13 Milliarden Parametern durch die Migration seiner Codebasis zu JAX auf Google Cloud TPUs deutlich beschleunigt und die täglichen Trainingsschritte um 40 % erhöht. Durch die Überwindung der bisherigen Skalierbarkeitsgrenzen ermöglichte diese strategische Umstellung eine lineare Skalierung über Tausende von TPU-Kernen hinweg und verdoppelte die Produktivität der Entwickler. So konnte Lightricks leistungsstarke, hochgradig kontrollierbare KI-Videotools für die Creator-Branche viel schneller auf den Markt bringen.
Videobearbeitung von Lightricks

Zusätzliche Ressourcen

Empfohlene Vorgehensweise

Logo: Cloud

Häufig gestellte Fragen

Was ist eine Tensor Processing Unit (TPU)?

TPUs sind von Google entwickelte, speziell angepasste anwendungsspezifische integrierte Schaltungen (ASICs). Sie wurden von Grund auf speziell für die Beschleunigung von Arbeitslasten im Bereich Machine Learning und künstliche Intelligenz entwickelt. TPUs sind speziell für die aufwendigen Matrixmultiplikationen und Tensoroperationen optimiert, die als grundlegende Bausteine neuronaler Netzwerke dienen und alles von Large Language Models bis hin zu komplexen Reasoning Agents ermöglichen.

Wie funktioniert die TPU-Architektur?

Das Herzstück einer TPU ist eine spezialisierte Matrix Multiplier Unit (MXU), die riesige Mengen an Matrixoperationen gleichzeitig verarbeitet. TPUs nutzen eine „systolische Array“-Architektur, die Daten einmal liest und sie kontinuierlich durch Tausende von arithmetisch-logischen Einheiten (ALUs) leitet. Dabei werden Ergebnisse akkumuliert, ohne dass ständig in den Speicher gelesen und geschrieben werden muss. Sie unterstützen auch Arithmetik mit reduzierter Genauigkeit (wie 16-Bit- oder 8-Bit-Gleitkomma), was Millionen von Berechnungen pro Sekunde ermöglicht, ohne die für KI-Modelle erforderliche Genauigkeit zu beeinträchtigen.

Welche Frameworks für maschinelles Lernen werden von Cloud TPUs unterstützt?

Cloud TPUs unterstützen native, leistungsstarke führende Frameworks für maschinelles Lernen, vor allem TensorFlow, PyTorch und JAX. Code, der in diesen Frameworks geschrieben wurde, wird vom XLA-Compiler (Accelerated Linear Algebra) kompiliert, der den Berechnungsgraphen automatisch optimiert, damit er effizient auf der zugrunde liegenden TPU-Hardware ausgeführt werden kann.

Für welche Arten von Arbeitslasten eignen sich TPUs am besten?

TPUs eignen sich hervorragend für Deep-Learning-Aufgaben, die massive parallele Matrixoperationen erfordern. Sie werden dringend empfohlen für:

  • Modelle, die von Matrixberechnungen dominiert werden
  • Trainingsläufe, die Wochen oder Monate dauern, bis sie konvergieren
  • Große Foundation Models und Large Language Models (LLMs)
  • Arbeitslasten mit extrem großen Einbettungen, wie z. B. erweiterte Empfehlungs-Engines
  • Kontinuierliches bestärkendes Lernen und Inferenz mit hohem Volumen und niedriger Latenz


Was sind TPU-Pods und ‑Slices?

Ein TPU-Pod ist ein riesiger physischer Cluster von TPU-Chips, die über ein spezielles Hochgeschwindigkeitsnetzwerk (wie das Optical Circuit Switching- oder Virgo-Netzwerk von Google) miteinander verbunden sind. Ein einzelner Superpod kann Tausende miteinander verbundene Chips enthalten. Ein „Slice“ ist eine kleinere, dedizierte Teilmenge eines Pods, die Sie mieten können. Diese Netzwerkarchitektur ermöglicht es Entwicklungsteams, ihre KI-Arbeitslasten mit wenig bis gar keinen Codeänderungen über riesige Mengen an Rechenleistung zu skalieren und den gesamten Slice effektiv als eine einzige einheitliche Maschine zu betreiben. 


Was ist der ML-„Goodput“ im Kontext des TPU-Trainings?

Goodput bezeichnet die tatsächliche, produktive Zeit, während der Ihre Infrastruktur aktiv Ihr Modell trainiert, anstatt im Leerlauf zu sein. Das Training riesiger Foundation Models erfordert eine komplexe Orchestrierung über Tausende von Chips hinweg. Daher können Rechenzyklen leicht durch Verzögerungen bei der Datenübertragung, Hardware-Resets oder Checkpointing verschwendet werden. Cloud TPUs sind so konzipiert, dass der Goodput durch Interconnects mit hoher Bandbreite und optimiertes Speicher-Caching maximiert wird. So wird sichergestellt, dass die bezahlten Rechenzyklen direkt zur Modellentwicklung beitragen.

Wie wird die Orchestrierung für TPUs in großem Umfang gehandhabt?

Nutzer können Zuverlässigkeit, umfassendes Monitoring und Verwaltung mit der Google Kubernetes Engine (GKE) und Cluster Director unterstützen. Durch die Nutzung von GKE für TPU können Kunden in einer cloudnativen Umgebung arbeiten, die Inference Gateway für den Lastenausgleich nutzt und die Möglichkeit bietet, Bereitstellungen auf bis zu 130.000 GKE-Knoten zu skalieren.

Google Cloud