Conçu pour l'IA nouvelle génération
Les Tensor Processing Units (TPU) sont des accélérateurs personnalisés conçus en collaboration avec des logiciels ouverts pour alimenter l'ensemble du cycle de vie de l'IA, de l'entraînement de pointe et de l'inférence à grande échelle aux exigences de données de raisonnement en plusieurs étapes de l'IA agentique.
Optimisé par AI Hypercomputer
Une décennie de Tensor Processing Units (TPU)

Les TPU sont spécialement conçus pour les charges de travail d'IA avancées, des grands modèles de langage à la génération de code en passant par les agents intelligents. Ils sont le moteur de Gemini et des produits phares de Google, comme la recherche, Photos et Maps, qui comptent plus d'un milliard d'utilisateurs.
Conçu pour l'IA nouvelle génération
Les Tensor Processing Units (TPU) sont des accélérateurs personnalisés conçus en collaboration avec des logiciels ouverts pour alimenter l'ensemble du cycle de vie de l'IA, de l'entraînement de pointe et de l'inférence à grande échelle aux exigences de données de raisonnement en plusieurs étapes de l'IA agentique.
Optimisé par AI Hypercomputer
Une décennie de Tensor Processing Units (TPU)

Les TPU sont spécialement conçus pour les charges de travail d'IA avancées, des grands modèles de langage à la génération de code en passant par les agents intelligents. Ils sont le moteur de Gemini et des produits phares de Google, comme la recherche, Photos et Maps, qui comptent plus d'un milliard d'utilisateurs.
Opérations ouvertes, flexibles et fiables

Créez des applications sur un écosystème ouvert à l'aide de bibliothèques et d'outils que vous connaissez déjà. Les TPU offrent une prise en charge native et hautes performances de PyTorch et JAX, et sont compatibles avec le moteur vLLM pour une inférence rapide. Gérez et faites évoluer ces déploiements de manière fiable sur des clusters mondiaux avec Google Kubernetes Engine (GKE).
Des performances sans compromis

Réduisez la durée d'entraînement des modèles de frontière de plusieurs mois à quelques semaines. Avec jusqu'à 1 million de puces TPU dans un seul cluster, les TPU maximisent le débit utile, en veillant à ce que presque chaque cycle de calcul soit consacré à l'apprentissage actif.


Opérations ouvertes, flexibles et fiables

Créez des applications sur un écosystème ouvert à l'aide de bibliothèques et d'outils que vous connaissez déjà. Les TPU offrent une prise en charge native et hautes performances de PyTorch et JAX, et sont compatibles avec le moteur vLLM pour une inférence rapide. Gérez et faites évoluer ces déploiements de manière fiable sur des clusters mondiaux avec Google Kubernetes Engine (GKE).
Des performances sans compromis

Réduisez la durée d'entraînement des modèles de frontière de plusieurs mois à quelques semaines. Avec jusqu'à 1 million de puces TPU dans un seul cluster, les TPU maximisent le débit utile, en veillant à ce que presque chaque cycle de calcul soit consacré à l'apprentissage actif.
TPU 8t

Le TPU 8t est conçu pour le pré-entraînement à grande échelle et les charges de travail intensives en embeddings, avec une capacité allant jusqu'à 9 600 puces dans un seul superpod. Il offre la densité de calcul élevée requise pour les modèles de pointe, avec des performances de calcul par pod presque trois fois supérieures à celles de la génération précédente.
Bientôt disponible.
TPU 8i

Le TPU 8i est optimisé pour le post-entraînement et l'inférence, tout en offrant une amélioration de 80 % des performances par dollar par rapport aux générations précédentes pour l'inférence à faible latence des grands modèles MoE.
Bientôt disponible.
Ironwood – 7e génération
Le TPU de 7e génération économe en énergie, conçu pour l'entraînement, le raisonnement et l'inférence à grande échelle. Chaque pod comporte 9 216 puces à refroidissement liquide, fournit 42,5 exaflops et offre des performances par puce quatre fois supérieures à celles de Trillium.
Disponible pour tous les utilisateurs
Trillium – 6e génération
Le TPU de sixième génération offrant une meilleure efficacité énergétique et des performances de calcul optimales pour l'entraînement et l'inférence. Il offre une efficacité énergétique 67 % supérieure et des performances de calcul optimales par puce 4,7 fois plus élevées par rapport à la génération précédente, TPU v5e.
Disponible pour tous les utilisateurs
TPU 8t

Le TPU 8t est conçu pour le pré-entraînement à grande échelle et les charges de travail intensives en embeddings, avec une capacité allant jusqu'à 9 600 puces dans un seul superpod. Il offre la densité de calcul élevée requise pour les modèles de pointe, avec des performances de calcul par pod presque trois fois supérieures à celles de la génération précédente.
Bientôt disponible.
TPU 8i

Le TPU 8i est optimisé pour le post-entraînement et l'inférence, tout en offrant une amélioration de 80 % des performances par dollar par rapport aux générations précédentes pour l'inférence à faible latence des grands modèles MoE.
Bientôt disponible.
Ironwood – 7e génération
Le TPU de 7e génération économe en énergie, conçu pour l'entraînement, le raisonnement et l'inférence à grande échelle. Chaque pod comporte 9 216 puces à refroidissement liquide, fournit 42,5 exaflops et offre des performances par puce quatre fois supérieures à celles de Trillium.
Disponible pour tous les utilisateurs
Trillium – 6e génération
Le TPU de sixième génération offrant une meilleure efficacité énergétique et des performances de calcul optimales pour l'entraînement et l'inférence. Il offre une efficacité énergétique 67 % supérieure et des performances de calcul optimales par puce 4,7 fois plus élevées par rapport à la génération précédente, TPU v5e.
Disponible pour tous les utilisateurs
La pile logicielle TPU est conçue pour faire le lien entre le code de machine learning de haut niveau et le silicium personnalisé afin d'optimiser l'efficacité brute du matériel.
JAX
Compilez des opérations mathématiques complexes à une vitesse proche de celle du matériel natif sur les TPU. Cette bibliothèque Open Source pour le calcul numérique et la différenciation automatique s'adapte facilement aux clusters TPU distribués massifs à l'aide d'un maillage d'appareils explicite.
TorchTPU et PyTorch
Exécutez des charges de travail PyTorch directement sur des TPU à l'aide de la syntaxe standard. Conçue avec Meta, cette pile "eager-first" native permet de migrer les codebases existantes avec un minimum de modifications pour profiter d'avantages considérables en termes de coût et de performances, sans que les équipes d'ingénierie aient à apprendre un nouveau framework.
OpenXLA
Réduire les goulots d'étranglement de la compilation pour exploiter les performances élevées du matériel TPU Ce compilateur de machine learning Open Source fusionne automatiquement les opérations, optimise l'utilisation de la mémoire et élimine les frais généraux du framework pour les calculs d'algèbre linéaire sur les backends TPU.
MaxText
Réduisez les délais d'entraînement des modèles de fondation volumineux. Cette implémentation de référence basée sur JAX fournit un plan prêt à l'emploi hautement évolutif pour atteindre une utilisation maximale du matériel lors du pré-entraînement de LLM sur des TPU.
Tunix
Simplifiez l'entraînement et l'alignement des LLM sur l'infrastructure TPU. Cette bibliothèque JAX Open Source légère fournit des workflows évolutifs pour l'affinage supervisé (Supervised Fine-Tuning, SFT) et l'apprentissage par renforcement (Reinforcement Learning, RL) afin de transformer efficacement des modèles bruts en agents prêts pour la production.
vLLM
Maximisez la simultanéité de diffusion et réduisez les coûts opérationnels pour l'inférence TPU en temps réel. Ce moteur Open Source à haut débit exploite des techniques de gestion de la mémoire telles que PagedAttention pour éliminer le gaspillage et fournir un service LLM très efficace sur l'architecture TPU.
La pile logicielle TPU est conçue pour faire le lien entre le code de machine learning de haut niveau et le silicium personnalisé afin d'optimiser l'efficacité brute du matériel.
JAX
Compilez des opérations mathématiques complexes à une vitesse proche de celle du matériel natif sur les TPU. Cette bibliothèque Open Source pour le calcul numérique et la différenciation automatique s'adapte facilement aux clusters TPU distribués massifs à l'aide d'un maillage d'appareils explicite.
TorchTPU et PyTorch
Exécutez des charges de travail PyTorch directement sur des TPU à l'aide de la syntaxe standard. Conçue avec Meta, cette pile "eager-first" native permet de migrer les codebases existantes avec un minimum de modifications pour profiter d'avantages considérables en termes de coût et de performances, sans que les équipes d'ingénierie aient à apprendre un nouveau framework.
OpenXLA
Réduire les goulots d'étranglement de la compilation pour exploiter les performances élevées du matériel TPU Ce compilateur de machine learning Open Source fusionne automatiquement les opérations, optimise l'utilisation de la mémoire et élimine les frais généraux du framework pour les calculs d'algèbre linéaire sur les backends TPU.
MaxText
Réduisez les délais d'entraînement des modèles de fondation volumineux. Cette implémentation de référence basée sur JAX fournit un plan prêt à l'emploi hautement évolutif pour atteindre une utilisation maximale du matériel lors du pré-entraînement de LLM sur des TPU.
Tunix
Simplifiez l'entraînement et l'alignement des LLM sur l'infrastructure TPU. Cette bibliothèque JAX Open Source légère fournit des workflows évolutifs pour l'affinage supervisé (Supervised Fine-Tuning, SFT) et l'apprentissage par renforcement (Reinforcement Learning, RL) afin de transformer efficacement des modèles bruts en agents prêts pour la production.
vLLM
Maximisez la simultanéité de diffusion et réduisez les coûts opérationnels pour l'inférence TPU en temps réel. Ce moteur Open Source à haut débit exploite des techniques de gestion de la mémoire telles que PagedAttention pour éliminer le gaspillage et fournir un service LLM très efficace sur l'architecture TPU.
Les TPU au service des innovateurs






Les TPU sont des circuits intégrés propres à une application et conçus sur mesure (ASIC) développés par Google. Ils sont conçus dès le départ pour accélérer les charges de travail de machine learning et d'intelligence artificielle. Les TPU sont optimisés spécifiquement pour les opérations de multiplication matricielle et de tenseurs intensives qui constituent les blocs de base des réseaux de neurones, et qui alimentent tout, des grands modèles de langage aux agents de raisonnement complexes.
Au cœur d'un TPU se trouve une unité de multiplication matricielle (MXU) spécialisée qui traite simultanément d'énormes quantités d'opérations matricielles. Les TPU utilisent une architecture de type "réseau systolique" qui lit les données une seule fois et les fait circuler en continu dans des milliers d'unités logiques et arithmétiques (ULA), accumulant les résultats sans avoir besoin de lire et d'écrire constamment dans la mémoire. Ils prennent également en charge l'arithmétique à précision réduite (comme les nombres à virgule flottante 16 bits ou 8 bits), ce qui permet d'effectuer des millions de calculs par seconde sans sacrifier la précision requise pour les modèles d'IA.
Les Cloud TPU offrent une compatibilité native et hautes performances avec les principaux frameworks de machine learning, principalement TensorFlow, PyTorch et JAX. Le code écrit dans ces frameworks est compilé par le compilateur Accelerated Linear Algebra (XLA), qui optimise automatiquement le graphe de calcul pour qu'il s'exécute efficacement sur le matériel TPU sous-jacent.
Les TPU excellent dans les tâches de deep learning qui nécessitent des opérations matricielles parallèles massives. Ils sont vivement recommandés pour :
Un pod TPU est un cluster physique massif de puces TPU connectées entre elles via un réseau spécialisé à haut débit (comme le réseau Optical Circuit Switching ou Virgo de Google). Un seul superpod peut contenir des milliers de puces interconnectées. Une "tranche" est un sous-ensemble plus petit et dédié d'un pod que vous pouvez louer. Cette architecture de mise en réseau permet aux développeurs de faire évoluer leurs charges de travail d'IA sur d'énormes quantités de ressources de calcul avec peu ou pas de modifications de code, en exploitant efficacement l'ensemble de la tranche comme une seule machine unifiée.
Le débit utile désigne le temps réel et productif que votre infrastructure consacre à l'entraînement actif de votre modèle, plutôt qu'à l'inactivité. L'entraînement de modèles de fondation massifs implique une orchestration complexe sur des milliers de puces, ce qui signifie que des cycles de calcul peuvent facilement être gaspillés en raison de retards de transfert de données, de réinitialisations matérielles ou de points de contrôle. Les Cloud TPU sont conçus pour maximiser le débit utile grâce à des interconnexions à bande passante élevée et à une mise en cache de la mémoire optimisée. Ainsi, les cycles de calcul payants contribuent directement à l'amélioration du modèle.
Les utilisateurs peuvent assurer la fiabilité, la surveillance complète et la gestion à l'aide de Google Kubernetes Engine (GKE) et de Cluster Director. En utilisant GKE pour TPU, les clients opèrent dans un écosystème cloud natif qui inclut Inference Gateway pour l'équilibrage de charge et la possibilité de faire évoluer les déploiements jusqu'à 130 000 nœuds GKE.