TPU (Tensor Processing Unit)

Entraîner, régler et déployer des modèles d'IA avancés sur des accélérateurs conçus à cet effet

TPU (Tensor Processing Unit)

Entraîner, régler et déployer des modèles d'IA avancés sur des accélérateurs conçus à cet effet

Conçu pour l'IA nouvelle génération
AI Hypercomputer
Plus de 10 ans d'innovation dans le domaine des TPU

Conçu pour l'IA nouvelle génération

Conçu pour l'IA nouvelle génération

Les Tensor Processing Units (TPU) sont des accélérateurs personnalisés conçus en collaboration avec des logiciels ouverts pour alimenter l'ensemble du cycle de vie de l'IA, de l'entraînement de pointe et de l'inférence à grande échelle aux exigences de données de raisonnement en plusieurs étapes de l'IA agentique.

AI Hypercomputer

Les TPU sont alimentés par AI Hypercomputer de Google Cloud, une architecture révolutionnaire qui combine du matériel conçu sur mesure, des logiciels ouverts et des modèles de consommation flexibles.

Plus de 10 ans d'innovation dans le domaine des TPU

Les TPU sont spécialement conçus pour les charges de travail d'IA avancées, des grands modèles de langage à la génération de code en passant par les agents intelligents. Ils sont le moteur de Gemini et des produits phares de Google, comme la recherche, Photos et Maps, qui comptent plus d'un milliard d'utilisateurs.

Conçu pour l'IA nouvelle génération

Conçu pour l'IA nouvelle génération

Les Tensor Processing Units (TPU) sont des accélérateurs personnalisés conçus en collaboration avec des logiciels ouverts pour alimenter l'ensemble du cycle de vie de l'IA, de l'entraînement de pointe et de l'inférence à grande échelle aux exigences de données de raisonnement en plusieurs étapes de l'IA agentique.

AI Hypercomputer

Les TPU sont alimentés par AI Hypercomputer de Google Cloud, une architecture révolutionnaire qui combine du matériel conçu sur mesure, des logiciels ouverts et des modèles de consommation flexibles.

Plus de 10 ans d'innovation dans le domaine des TPU

Les TPU sont spécialement conçus pour les charges de travail d'IA avancées, des grands modèles de langage à la génération de code en passant par les agents intelligents. Ils sont le moteur de Gemini et des produits phares de Google, comme la recherche, Photos et Maps, qui comptent plus d'un milliard d'utilisateurs.

Avantages

Opérations ouvertes, flexibles et fiables

Les TPU sont ouverts, flexibles et fiables

Créez des applications sur un écosystème ouvert à l'aide de bibliothèques et d'outils que vous connaissez déjà. Les TPU offrent une prise en charge native et hautes performances de PyTorch et JAX, et sont compatibles avec le moteur vLLM pour une inférence rapide. Gérez et faites évoluer ces déploiements de manière fiable sur des clusters mondiaux avec Google Kubernetes Engine (GKE).

Plus d'un million de TPU dans un seul cluster d'entraînement logique

Réduisez la durée d'entraînement des modèles de frontière de plusieurs mois à quelques semaines. Avec jusqu'à 1 million de puces TPU dans un seul cluster, les TPU maximisent le débit utile, en veillant à ce que presque chaque cycle de calcul soit consacré à l'apprentissage actif.

Les TPU sont ouverts, flexibles et fiables
Plus d'un million de TPU dans un seul cluster d'entraînement logique

Avantages

Opérations ouvertes, flexibles et fiables

Les TPU sont ouverts, flexibles et fiables

Créez des applications sur un écosystème ouvert à l'aide de bibliothèques et d'outils que vous connaissez déjà. Les TPU offrent une prise en charge native et hautes performances de PyTorch et JAX, et sont compatibles avec le moteur vLLM pour une inférence rapide. Gérez et faites évoluer ces déploiements de manière fiable sur des clusters mondiaux avec Google Kubernetes Engine (GKE).

Plus d'un million de TPU dans un seul cluster d'entraînement logique

Réduisez la durée d'entraînement des modèles de frontière de plusieurs mois à quelques semaines. Avec jusqu'à 1 million de puces TPU dans un seul cluster, les TPU maximisent le débit utile, en veillant à ce que presque chaque cycle de calcul soit consacré à l'apprentissage actif.

TPU 8t - Optimisé pour l'entraînement
TPU 8i : optimisé pour l'inférence et l'apprentissage par renforcement
TPU Ironwood
TPU Trillium
Versions de TPU

TPU 8t

TPU 8t - Optimisé pour l'entraînement

Le TPU 8t est conçu pour le pré-entraînement à grande échelle et les charges de travail intensives en embeddings, avec une capacité allant jusqu'à 9 600 puces dans un seul superpod. Il offre la densité de calcul élevée requise pour les modèles de pointe, avec des performances de calcul par pod presque trois fois supérieures à celles de la génération précédente.

Bientôt disponible.

TPU 8i : optimisé pour l'inférence et l'apprentissage par renforcement

Le TPU 8i est optimisé pour le post-entraînement et l'inférence, tout en offrant une amélioration de 80 % des performances par dollar par rapport aux générations précédentes pour l'inférence à faible latence des grands modèles MoE.

Bientôt disponible.

TPU Ironwood

Le TPU de 7e génération économe en énergie, conçu pour l'entraînement, le raisonnement et l'inférence à grande échelle. Chaque pod comporte 9 216 puces à refroidissement liquide, fournit 42,5 exaflops et offre des performances par puce quatre fois supérieures à celles de Trillium.

Disponible pour tous les utilisateurs

Documentation | Tarifs

TPU Trillium

Le TPU de sixième génération offrant une meilleure efficacité énergétique et des performances de calcul optimales pour l'entraînement et l'inférence. Il offre une efficacité énergétique 67 % supérieure et des performances de calcul optimales par puce 4,7 fois plus élevées par rapport à la génération précédente, TPU v5e.

Disponible pour tous les utilisateurs

Documentation | Tarifs

Versions de TPU

TPU 8t

TPU 8t - Optimisé pour l'entraînement

Le TPU 8t est conçu pour le pré-entraînement à grande échelle et les charges de travail intensives en embeddings, avec une capacité allant jusqu'à 9 600 puces dans un seul superpod. Il offre la densité de calcul élevée requise pour les modèles de pointe, avec des performances de calcul par pod presque trois fois supérieures à celles de la génération précédente.

Bientôt disponible.

TPU 8i : optimisé pour l'inférence et l'apprentissage par renforcement

Le TPU 8i est optimisé pour le post-entraînement et l'inférence, tout en offrant une amélioration de 80 % des performances par dollar par rapport aux générations précédentes pour l'inférence à faible latence des grands modèles MoE.

Bientôt disponible.

TPU Ironwood

Le TPU de 7e génération économe en énergie, conçu pour l'entraînement, le raisonnement et l'inférence à grande échelle. Chaque pod comporte 9 216 puces à refroidissement liquide, fournit 42,5 exaflops et offre des performances par puce quatre fois supérieures à celles de Trillium.

Disponible pour tous les utilisateurs

Documentation | Tarifs

TPU Trillium

Le TPU de sixième génération offrant une meilleure efficacité énergétique et des performances de calcul optimales pour l'entraînement et l'inférence. Il offre une efficacité énergétique 67 % supérieure et des performances de calcul optimales par puce 4,7 fois plus élevées par rapport à la génération précédente, TPU v5e.

Disponible pour tous les utilisateurs

Documentation | Tarifs

Jax
TorchTPU
OpenXLA
MaxText
Tunix
Inférence vLLM sur TPU

Pile logicielle TPU

La pile logicielle TPU est conçue pour faire le lien entre le code de machine learning de haut niveau et le silicium personnalisé afin d'optimiser l'efficacité brute du matériel.

JAX

Jax

Compilez des opérations mathématiques complexes à une vitesse proche de celle du matériel natif sur les TPU. Cette bibliothèque Open Source pour le calcul numérique et la différenciation automatique s'adapte facilement aux clusters TPU distribués massifs à l'aide d'un maillage d'appareils explicite.

Voir le dépôt GitHub

TorchTPU

Exécutez des charges de travail PyTorch directement sur des TPU à l'aide de la syntaxe standard. Conçue avec Meta, cette pile "eager-first" native permet de migrer les codebases existantes avec un minimum de modifications pour profiter d'avantages considérables en termes de coût et de performances, sans que les équipes d'ingénierie aient à apprendre un nouveau framework.

Lire l'article

OpenXLA

Réduire les goulots d'étranglement de la compilation pour exploiter les performances élevées du matériel TPU Ce compilateur de machine learning Open Source fusionne automatiquement les opérations, optimise l'utilisation de la mémoire et élimine les frais généraux du framework pour les calculs d'algèbre linéaire sur les backends TPU.

Voir le dépôt GitHub

MaxText

Réduisez les délais d'entraînement des modèles de fondation volumineux. Cette implémentation de référence basée sur JAX fournit un plan prêt à l'emploi hautement évolutif pour atteindre une utilisation maximale du matériel lors du pré-entraînement de LLM sur des TPU.

Afficher le dépôt GitHub

Tunix

Simplifiez l'entraînement et l'alignement des LLM sur l'infrastructure TPU. Cette bibliothèque JAX Open Source légère fournit des workflows évolutifs pour l'affinage supervisé (Supervised Fine-Tuning, SFT) et l'apprentissage par renforcement (Reinforcement Learning, RL) afin de transformer efficacement des modèles bruts en agents prêts pour la production.

Voir le dépôt GitHub

Inférence vLLM sur TPU

Maximisez la simultanéité de diffusion et réduisez les coûts opérationnels pour l'inférence TPU en temps réel. Ce moteur Open Source à haut débit exploite des techniques de gestion de la mémoire telles que PagedAttention pour éliminer le gaspillage et fournir un service LLM très efficace sur l'architecture TPU.

Afficher le dépôt GitHub

Pile logicielle TPU

La pile logicielle TPU est conçue pour faire le lien entre le code de machine learning de haut niveau et le silicium personnalisé afin d'optimiser l'efficacité brute du matériel.

JAX

Jax

Compilez des opérations mathématiques complexes à une vitesse proche de celle du matériel natif sur les TPU. Cette bibliothèque Open Source pour le calcul numérique et la différenciation automatique s'adapte facilement aux clusters TPU distribués massifs à l'aide d'un maillage d'appareils explicite.

Voir le dépôt GitHub

TorchTPU

Exécutez des charges de travail PyTorch directement sur des TPU à l'aide de la syntaxe standard. Conçue avec Meta, cette pile "eager-first" native permet de migrer les codebases existantes avec un minimum de modifications pour profiter d'avantages considérables en termes de coût et de performances, sans que les équipes d'ingénierie aient à apprendre un nouveau framework.

Lire l'article

OpenXLA

Réduire les goulots d'étranglement de la compilation pour exploiter les performances élevées du matériel TPU Ce compilateur de machine learning Open Source fusionne automatiquement les opérations, optimise l'utilisation de la mémoire et élimine les frais généraux du framework pour les calculs d'algèbre linéaire sur les backends TPU.

Voir le dépôt GitHub

MaxText

Réduisez les délais d'entraînement des modèles de fondation volumineux. Cette implémentation de référence basée sur JAX fournit un plan prêt à l'emploi hautement évolutif pour atteindre une utilisation maximale du matériel lors du pré-entraînement de LLM sur des TPU.

Afficher le dépôt GitHub

Tunix

Simplifiez l'entraînement et l'alignement des LLM sur l'infrastructure TPU. Cette bibliothèque JAX Open Source légère fournit des workflows évolutifs pour l'affinage supervisé (Supervised Fine-Tuning, SFT) et l'apprentissage par renforcement (Reinforcement Learning, RL) afin de transformer efficacement des modèles bruts en agents prêts pour la production.

Voir le dépôt GitHub

Inférence vLLM sur TPU

Maximisez la simultanéité de diffusion et réduisez les coûts opérationnels pour l'inférence TPU en temps réel. Ce moteur Open Source à haut débit exploite des techniques de gestion de la mémoire telles que PagedAttention pour éliminer le gaspillage et fournir un service LLM très efficace sur l'architecture TPU.

Afficher le dépôt GitHub

Les TPU au service des innovateurs

Citadel Securities exécute ses charges de travail jusqu'à quatre fois plus vite avec Ironwood
Sur les marchés financiers, chaque nanoseconde compte. Citadel Securities s'est associé à Google Cloud pour créer un environnement d'étude quantitative évolutif basé sur le cloud, capable d'exécuter des charges de travail deux à quatre fois plus rapidement, pour un coût inférieur de 30 %. Grâce à une infrastructure basée sur les TPU Ironwood, les charges de travail qui prenaient auparavant des jours ou des semaines sont désormais exécutées en quelques heures, voire quelques minutes. Les clients du monde entier peuvent ainsi atteindre leurs objectifs d'investissement.
jusqu'à 4 fois plus rapide avec les TPU
Nuro ouvre la voie vers un avenir sans conducteur avec Google Cloud
Nuro a considérablement accéléré le développement de sa technologie de conduite autonome en exploitant les TPU de Google Cloud et Google Kubernetes Engine. L'entreprise entraîne ainsi ses modèles d'IA deux fois plus vite, sans engendrer de coûts supplémentaires. En traitant des pétaoctets de données de conduite réelles et en exécutant des simulations de sécurité à grande échelle, l'entreprise améliore continuellement le Nuro Driver pour que tout véhicule (voitures particulières, semi-remorques, etc.) puisse circuler en toute sécurité sur les routes publiques.
Véhicules autonomes Nuro
Lightricks entraîne des modèles de diffusion vidéo à grande échelle avec JAX sur TPU
Lightricks a considérablement accéléré l'entraînement de ses modèles de vidéo générative à 13 milliards de paramètres en migrant son codebase vers JAX sur les TPU Google Cloud, ce qui a permis d'augmenter de 40 % le nombre d'étapes d'entraînement quotidiennes. En surmontant les limites d'évolutivité précédentes, ce changement stratégique a permis un scaling linéaire sur des milliers de cœurs de TPU et a doublé la productivité des développeurs. Lightricks a ainsi pu proposer beaucoup plus rapidement des outils vidéo d'IA performants et hautement contrôlables à l'économie des créateurs.
Montage vidéo Lightricks

Autres ressources

Passez aux étapes suivantes

Logo Cloud

Questions fréquentes

Qu'est-ce qu'un TPU (Tensor Processing Unit) ?

Les TPU sont des circuits intégrés propres à une application et conçus sur mesure (ASIC) développés par Google. Ils sont conçus dès le départ pour accélérer les charges de travail de machine learning et d'intelligence artificielle. Les TPU sont optimisés spécifiquement pour les opérations de multiplication matricielle et de tenseurs intensives qui constituent les blocs de base des réseaux de neurones, et qui alimentent tout, des grands modèles de langage aux agents de raisonnement complexes.

Comment fonctionne l'architecture TPU ?

Au cœur d'un TPU se trouve une unité de multiplication matricielle (MXU) spécialisée qui traite simultanément d'énormes quantités d'opérations matricielles. Les TPU utilisent une architecture de type "réseau systolique" qui lit les données une seule fois et les fait circuler en continu dans des milliers d'unités logiques et arithmétiques (ULA), accumulant les résultats sans avoir besoin de lire et d'écrire constamment dans la mémoire. Ils prennent également en charge l'arithmétique à précision réduite (comme les nombres à virgule flottante 16 bits ou 8 bits), ce qui permet d'effectuer des millions de calculs par seconde sans sacrifier la précision requise pour les modèles d'IA.

Quels frameworks de machine learning sont compatibles avec les Cloud TPU ?

Les Cloud TPU offrent une compatibilité native et hautes performances avec les principaux frameworks de machine learning, principalement TensorFlow, PyTorch et JAX. Le code écrit dans ces frameworks est compilé par le compilateur Accelerated Linear Algebra (XLA), qui optimise automatiquement le graphe de calcul pour qu'il s'exécute efficacement sur le matériel TPU sous-jacent.

Quels types de charges de travail sont les plus adaptés aux TPU ?

Les TPU excellent dans les tâches de deep learning qui nécessitent des opérations matricielles parallèles massives. Ils sont vivement recommandés pour :

  • Modèles dominés par les calculs matriciels
  • Exécutions d'entraînement qui mettent des semaines ou des mois à converger
  • Grands modèles de fondation et grands modèles de langage (LLM)
  • Charges de travail avec des embeddings très volumineux, comme les moteurs de recommandation avancés
  • Apprentissage par renforcement continu et inférence sur un volume élevé et à faible latence


Que sont les pods et les tranches TPU ?

Un pod TPU est un cluster physique massif de puces TPU connectées entre elles via un réseau spécialisé à haut débit (comme le réseau Optical Circuit Switching ou Virgo de Google). Un seul superpod peut contenir des milliers de puces interconnectées. Une "tranche" est un sous-ensemble plus petit et dédié d'un pod que vous pouvez louer. Cette architecture de mise en réseau permet aux développeurs de faire évoluer leurs charges de travail d'IA sur d'énormes quantités de ressources de calcul avec peu ou pas de modifications de code, en exploitant efficacement l'ensemble de la tranche comme une seule machine unifiée.


Qu'est-ce que le "débit utile" du ML dans le contexte de l'entraînement TPU ?

Le débit utile désigne le temps réel et productif que votre infrastructure consacre à l'entraînement actif de votre modèle, plutôt qu'à l'inactivité. L'entraînement de modèles de fondation massifs implique une orchestration complexe sur des milliers de puces, ce qui signifie que des cycles de calcul peuvent facilement être gaspillés en raison de retards de transfert de données, de réinitialisations matérielles ou de points de contrôle. Les Cloud TPU sont conçus pour maximiser le débit utile grâce à des interconnexions à bande passante élevée et à une mise en cache de la mémoire optimisée. Ainsi, les cycles de calcul payants contribuent directement à l'amélioration du modèle.

Comment l'orchestration est-elle gérée à grande échelle pour les TPU ?

Les utilisateurs peuvent assurer la fiabilité, la surveillance complète et la gestion à l'aide de Google Kubernetes Engine (GKE) et de Cluster Director. En utilisant GKE pour TPU, les clients opèrent dans un écosystème cloud natif qui inclut Inference Gateway pour l'équilibrage de charge et la possibilité de faire évoluer les déploiements jusqu'à 130 000 nœuds GKE.

  • Produits Google Cloud
  • Parcourez plus de 100 produits. Les nouveaux clients bénéficient de 300 $ de crédits gratuits pour exécuter, tester et déployer des charges de travail. Tous les clients peuvent utiliser plus de 25 produits gratuitement, dans les limites mensuelles spécifiées.
Google Cloud