Diseñado para la IA de última generación
Las unidades de procesamiento de tensor (TPUs) son aceleradores personalizados diseñados conjuntamente con software de código abierto para impulsar todo el ciclo de vida de la IA, desde el entrenamiento de vanguardia y la inferencia a gran escala hasta las demandas de datos de razonamiento multipaso de la IA agéntica.
Con la tecnología de AI Hypercomputer
Una década de unidades de procesamiento de tensor (TPUs)

Las TPUs se han diseñado específicamente para cargas de trabajo de IA avanzadas, desde modelos de lenguaje extensos y generación de código hasta agentes inteligentes. Son el motor de Gemini y de los productos estrella de Google con miles de millones de usuarios, como la Búsqueda, Fotos y Maps.
Diseñado para la IA de última generación
Las unidades de procesamiento de tensor (TPUs) son aceleradores personalizados diseñados conjuntamente con software de código abierto para impulsar todo el ciclo de vida de la IA, desde el entrenamiento de vanguardia y la inferencia a gran escala hasta las demandas de datos de razonamiento multipaso de la IA agéntica.
Con la tecnología de AI Hypercomputer
Una década de unidades de procesamiento de tensor (TPUs)

Las TPUs se han diseñado específicamente para cargas de trabajo de IA avanzadas, desde modelos de lenguaje extensos y generación de código hasta agentes inteligentes. Son el motor de Gemini y de los productos estrella de Google con miles de millones de usuarios, como la Búsqueda, Fotos y Maps.
Operaciones abiertas, flexibles y fiables

Desarrolla en un ecosistema abierto con herramientas y bibliotecas que ya conoces. Las TPUs ofrecen compatibilidad nativa y de alto rendimiento con PyTorch y JAX, y admiten el motor vLLM para una inferencia rápida. Gestiona y escala estos despliegues de forma fiable en clústeres globales con Google Kubernetes Engine (GKE).
Rendimiento sin concesiones

Reduce el tiempo de entrenamiento de los modelos fundacionales de meses a semanas. Con hasta 1 millón de chips de TPU en un solo clúster, las TPUs maximizan el goodput, lo que garantiza que casi todos los ciclos de computación se dediquen al aprendizaje activo.


Operaciones abiertas, flexibles y fiables

Desarrolla en un ecosistema abierto con herramientas y bibliotecas que ya conoces. Las TPUs ofrecen compatibilidad nativa y de alto rendimiento con PyTorch y JAX, y admiten el motor vLLM para una inferencia rápida. Gestiona y escala estos despliegues de forma fiable en clústeres globales con Google Kubernetes Engine (GKE).
Rendimiento sin concesiones

Reduce el tiempo de entrenamiento de los modelos fundacionales de meses a semanas. Con hasta 1 millón de chips de TPU en un solo clúster, las TPUs maximizan el goodput, lo que garantiza que casi todos los ciclos de computación se dediquen al aprendizaje activo.
TPU 8t

La TPU 8t se ha diseñado para el preentrenamiento a gran escala y las cargas de trabajo con muchos embeddings a una escala de 9600 chips en un único superpod, y ofrece la computación de alta densidad que necesitan los modelos de vanguardia con casi el triple de rendimiento computacional por pod que la generación anterior.
Disponible próximamente.
TPU 8i

La TPU 8i está optimizada para el posentrenamiento y la inferencia, y ofrece una mejora del 80 % en el rendimiento por dólar en comparación con las generaciones anteriores en lo que respecta a la inferencia de baja latencia para modelos MoE extensos.
Disponible próximamente.
Ironwood - 7.ª generación
TPU de 7.ª generación con eficiencia energética diseñada para el entrenamiento, el razonamiento y la inferencia a gran escala. Cuenta con 9216 chips refrigerados por líquido por pod, y ofrece 42,5 exaflops y un rendimiento por chip 4 veces mejor que el de Trillium.
Disponible de forma general.
Trillium - 6.ª generación
TPU de sexta generación con eficiencia energética y rendimiento computacional máximo mejorados para el entrenamiento y la inferencia. Funciona con un 67 % más de eficiencia energética y ofrece un rendimiento computacional máximo por chip 4,7 veces superior a la generación anterior de TPU v5e.
Disponible de forma general.
TPU 8t

La TPU 8t se ha diseñado para el preentrenamiento a gran escala y las cargas de trabajo con muchos embeddings a una escala de 9600 chips en un único superpod, y ofrece la computación de alta densidad que necesitan los modelos de vanguardia con casi el triple de rendimiento computacional por pod que la generación anterior.
Disponible próximamente.
TPU 8i

La TPU 8i está optimizada para el posentrenamiento y la inferencia, y ofrece una mejora del 80 % en el rendimiento por dólar en comparación con las generaciones anteriores en lo que respecta a la inferencia de baja latencia para modelos MoE extensos.
Disponible próximamente.
Ironwood - 7.ª generación
TPU de 7.ª generación con eficiencia energética diseñada para el entrenamiento, el razonamiento y la inferencia a gran escala. Cuenta con 9216 chips refrigerados por líquido por pod, y ofrece 42,5 exaflops y un rendimiento por chip 4 veces mejor que el de Trillium.
Disponible de forma general.
Trillium - 6.ª generación
TPU de sexta generación con eficiencia energética y rendimiento computacional máximo mejorados para el entrenamiento y la inferencia. Funciona con un 67 % más de eficiencia energética y ofrece un rendimiento computacional máximo por chip 4,7 veces superior a la generación anterior de TPU v5e.
Disponible de forma general.
La pila de software de TPU se ha diseñado para salvar la brecha entre el código de aprendizaje automático de alto nivel y el silicio personalizado, con el objetivo de optimizar la eficiencia del hardware en bruto.
JAX
Compila operaciones matemáticas complejas a una velocidad casi nativa del hardware en las TPUs. Esta biblioteca de código abierto para la computación numérica y la diferenciación automática se escala sin esfuerzo en clústeres de TPUs distribuidas masivas mediante una malla de dispositivos explícita.
TorchTPU y PyTorch
Ejecuta cargas de trabajo de PyTorch directamente en TPUs usando la sintaxis estándar. Esta pila nativa, creada con Meta, permite migrar las bases de código existentes con cambios mínimos para obtener importantes ventajas de coste-rendimiento, sin que los equipos de ingeniería tengan que aprender un nuevo framework.
OpenXLA
Reduce los cuellos de botella de compilación para extraer un alto rendimiento del hardware de TPU. Este compilador de aprendizaje automático de código abierto fusiona operaciones automáticamente, optimiza el uso de memoria y elimina la sobrecarga del framework para los cálculos de álgebra lineal en los backends de TPU.
MaxText
Reduce los plazos de entrenamiento de modelos fundacionales masivos. Esta implementación de referencia basada en JAX proporciona un plan altamente escalable y listo para usar para lograr el máximo aprovechamiento del hardware durante el preentrenamiento de LLMs en TPUs.
Tunix
Optimiza el postentrenamiento y la alineación de LLMs en la infraestructura de TPU. Esta biblioteca de JAX ligera y de código abierto ofrece flujos de trabajo escalables para el afinamiento supervisado (SFT) y el aprendizaje por refuerzo (RL) para convertir de forma eficiente los modelos sin procesar en agentes listos para producción.
vLLM
Maximiza la simultaneidad de las peticiones y reduce los costes operativos de la inferencia en tiempo real con las TPUs. Este motor de código abierto de alto rendimiento aprovecha técnicas de gestión de memoria como PagedAttention para eliminar los residuos y ofrecer un servicio de LLM de alta eficiencia en la arquitectura de TPU.
La pila de software de TPU se ha diseñado para salvar la brecha entre el código de aprendizaje automático de alto nivel y el silicio personalizado, con el objetivo de optimizar la eficiencia del hardware en bruto.
JAX
Compila operaciones matemáticas complejas a una velocidad casi nativa del hardware en las TPUs. Esta biblioteca de código abierto para la computación numérica y la diferenciación automática se escala sin esfuerzo en clústeres de TPUs distribuidas masivas mediante una malla de dispositivos explícita.
TorchTPU y PyTorch
Ejecuta cargas de trabajo de PyTorch directamente en TPUs usando la sintaxis estándar. Esta pila nativa, creada con Meta, permite migrar las bases de código existentes con cambios mínimos para obtener importantes ventajas de coste-rendimiento, sin que los equipos de ingeniería tengan que aprender un nuevo framework.
OpenXLA
Reduce los cuellos de botella de compilación para extraer un alto rendimiento del hardware de TPU. Este compilador de aprendizaje automático de código abierto fusiona operaciones automáticamente, optimiza el uso de memoria y elimina la sobrecarga del framework para los cálculos de álgebra lineal en los backends de TPU.
MaxText
Reduce los plazos de entrenamiento de modelos fundacionales masivos. Esta implementación de referencia basada en JAX proporciona un plan altamente escalable y listo para usar para lograr el máximo aprovechamiento del hardware durante el preentrenamiento de LLMs en TPUs.
Tunix
Optimiza el postentrenamiento y la alineación de LLMs en la infraestructura de TPU. Esta biblioteca de JAX ligera y de código abierto ofrece flujos de trabajo escalables para el afinamiento supervisado (SFT) y el aprendizaje por refuerzo (RL) para convertir de forma eficiente los modelos sin procesar en agentes listos para producción.
vLLM
Maximiza la simultaneidad de las peticiones y reduce los costes operativos de la inferencia en tiempo real con las TPUs. Este motor de código abierto de alto rendimiento aprovecha técnicas de gestión de memoria como PagedAttention para eliminar los residuos y ofrecer un servicio de LLM de alta eficiencia en la arquitectura de TPU.
Las TPUs impulsan a los innovadores






Las TPUs son circuitos integrados para aplicaciones específicas (ASIC) diseñados a medida por Google. Se han diseñado específicamente para agilizar las cargas de trabajo de aprendizaje automático e inteligencia artificial. Las TPUs están optimizadas específicamente para las operaciones de multiplicación de matrices y tensores que constituyen los componentes fundamentales de las redes neuronales, y que impulsan desde modelos de lenguaje extensos hasta agentes de razonamiento complejos.
En el núcleo de una TPU hay una unidad de multiplicador de matriz (MXU) especializada que procesa grandes cantidades de operaciones de matriz de forma simultánea. Las TPUs utilizan una arquitectura de "matriz sistólica" que lee los datos una sola vez y los transmite continuamente a través de miles de unidades aritmético-lógicas (ALUs), acumulando resultados sin necesidad de leer y escribir constantemente en la memoria. También admiten aritmética de precisión reducida (como punto flotante de 16 u 8 bits), lo que permite realizar millones de cálculos por segundo sin sacrificar la exactitud que requieren los modelos de IA.
Las TPUs de Cloud ofrecen compatibilidad nativa y de alto rendimiento con los principales frameworks de aprendizaje automático, principalmente TensorFlow, PyTorch y JAX. El código escrito en estos frameworks se compila con el compilador Accelerated Linear Algebra (XLA), que optimiza automáticamente el gráfico computacional para que se ejecute de forma eficiente en el hardware de TPU subyacente.
Las TPU son excelentes para las tareas de aprendizaje profundo que requieren operaciones de matriz paralelas masivas. Son muy recomendables para:
Un pod de TPU es un clúster físico masivo de chips de TPU conectados entre sí a través de una red especializada de alta velocidad (como la conmutación de circuitos ópticos de Google o la red Virgo). Un solo superpod puede contener miles de chips interconectados. Un "sector" es una parte más pequeña y específica de un pod que puedes alquilar. Esta arquitectura de red permite a los desarrolladores escalar sus cargas de trabajo de IA en grandes cantidades de recursos informáticos con pocos o ningún cambio en el código, lo que hace que todo el segmento funcione como una sola máquina unificada.
Goodput hace referencia al tiempo real y productivo que tu infraestructura dedica a entrenar tu modelo en lugar de estar inactiva. Entrenar modelos fundacionales masivos implica una orquestación compleja de miles de chips, lo que significa que los ciclos de computación se pueden desperdiciar fácilmente en retrasos en la transferencia de datos, reinicios de hardware o puntos de control. Las TPUs de Cloud se han diseñado para maximizar el Goodput mediante interconexiones de gran ancho de banda y almacenamiento en caché de memoria optimizado, lo que garantiza que los ciclos de computación de pago contribuyan directamente al avance del modelo.
Los usuarios pueden mejorar la fiabilidad, la monitorización exhaustiva y la gestión con Google Kubernetes Engine (GKE) y Cluster Director. Al aprovechar GKE para TPU, los clientes operan en un ecosistema nativo de la nube que incluye Inference Gateway para el balanceo de carga y la capacidad de escalar despliegues hasta 130.000 nodos de GKE.