Diseñado para la IA de nueva generación
Las unidades de procesamiento tensorial (TPUs) son aceleradores personalizados diseñados en conjunto con software de código abierto para potenciar todo el ciclo de vida de la IA, desde el entrenamiento de vanguardia y la inferencia a gran escala hasta las demandas de datos de razonamiento de varios pasos de la IA de agentes.
Con la tecnología de AI Hypercomputer
Una década de unidades de procesamiento tensorial (TPU)

Las TPUs están diseñadas específicamente para cargas de trabajo de IA avanzadas, desde modelos de lenguaje grandes y generación de código hasta agentes inteligentes. Son el motor detrás de Gemini y los productos insignia de Google que usan miles de millones de personas, como la Búsqueda, Fotos y Maps.
Diseñado para la IA de nueva generación
Las unidades de procesamiento tensorial (TPUs) son aceleradores personalizados diseñados en conjunto con software de código abierto para potenciar todo el ciclo de vida de la IA, desde el entrenamiento de vanguardia y la inferencia a gran escala hasta las demandas de datos de razonamiento de varios pasos de la IA de agentes.
Con la tecnología de AI Hypercomputer
Una década de unidades de procesamiento tensorial (TPU)

Las TPUs están diseñadas específicamente para cargas de trabajo de IA avanzadas, desde modelos de lenguaje grandes y generación de código hasta agentes inteligentes. Son el motor detrás de Gemini y los productos insignia de Google que usan miles de millones de personas, como la Búsqueda, Fotos y Maps.
Operaciones abiertas, flexibles y confiables

Crea en un ecosistema abierto con bibliotecas y herramientas conocidas. Las TPUs proporcionan compatibilidad nativa de alto rendimiento para PyTorch y JAX, y admiten el motor vLLM para una inferencia rápida. Administra y escala estas implementaciones de manera confiable en clústeres globales con Google Kubernetes Engine (GKE).
Rendimiento sin concesiones

Convierte meses de entrenamiento en semanas para modelos de frontera. Con hasta 1 millón de chips TPU en un solo clúster, las TPUs maximizan el rendimiento útil, lo que garantiza que casi todos los ciclos de procesamiento se dediquen al aprendizaje activo.


Operaciones abiertas, flexibles y confiables

Crea en un ecosistema abierto con bibliotecas y herramientas conocidas. Las TPUs proporcionan compatibilidad nativa de alto rendimiento para PyTorch y JAX, y admiten el motor vLLM para una inferencia rápida. Administra y escala estas implementaciones de manera confiable en clústeres globales con Google Kubernetes Engine (GKE).
Rendimiento sin concesiones

Convierte meses de entrenamiento en semanas para modelos de frontera. Con hasta 1 millón de chips TPU en un solo clúster, las TPUs maximizan el rendimiento útil, lo que garantiza que casi todos los ciclos de procesamiento se dediquen al aprendizaje activo.
TPU 8t

La TPU 8t está diseñada para el entrenamiento previo a gran escala y las cargas de trabajo con muchos embeddings a una escala de 9,600 chips en un solo superpod, lo que proporciona la computación de alta densidad necesaria para los modelos de frontera con casi 3 veces el rendimiento de computación por pod en comparación con la generación anterior.
Disponible próximamente.
TPU 8i

La TPU 8i está optimizada para la inferencia y el entrenamiento posterior, y proporciona una mejora del 80% en el rendimiento por dólar en comparación con las generaciones anteriores para la inferencia de baja latencia para modelos MoE grandes.
Disponible próximamente.
Ironwood: 7ª generación
TPU de 7ª generación con eficiencia energética diseñada para entrenamiento, razonamiento e inferencia a gran escala. Cuenta con 9,216 chips refrigerados por líquido por Pod, proporciona 42.5 ExaFlops y un rendimiento por chip 4 veces mejor que Trillium.
Disponible para el público general
Trillium: 6ª generación
TPU de sexta generación con eficiencia energética mejorada y rendimiento máximo de procesamiento para entrenamiento e inferencia. Funciona con un 67% más de eficiencia energética y proporciona un rendimiento de procesamiento máximo 4.7 veces mayor por chip en comparación con la TPU v5e de la generación anterior.
Disponible para el público general
TPU 8t

La TPU 8t está diseñada para el entrenamiento previo a gran escala y las cargas de trabajo con muchos embeddings a una escala de 9,600 chips en un solo superpod, lo que proporciona la computación de alta densidad necesaria para los modelos de frontera con casi 3 veces el rendimiento de computación por pod en comparación con la generación anterior.
Disponible próximamente.
TPU 8i

La TPU 8i está optimizada para la inferencia y el entrenamiento posterior, y proporciona una mejora del 80% en el rendimiento por dólar en comparación con las generaciones anteriores para la inferencia de baja latencia para modelos MoE grandes.
Disponible próximamente.
Ironwood: 7ª generación
TPU de 7ª generación con eficiencia energética diseñada para entrenamiento, razonamiento e inferencia a gran escala. Cuenta con 9,216 chips refrigerados por líquido por Pod, proporciona 42.5 ExaFlops y un rendimiento por chip 4 veces mejor que Trillium.
Disponible para el público general
Trillium: 6ª generación
TPU de sexta generación con eficiencia energética mejorada y rendimiento máximo de procesamiento para entrenamiento e inferencia. Funciona con un 67% más de eficiencia energética y proporciona un rendimiento de procesamiento máximo 4.7 veces mayor por chip en comparación con la TPU v5e de la generación anterior.
Disponible para el público general
La pila de software de TPU está diseñada para cerrar la brecha entre el código de aprendizaje automático de alto nivel y el chip personalizado para optimizar la eficiencia del hardware sin procesar.
JAX
Compila operaciones matemáticas complejas a una velocidad de hardware casi nativa en TPUs. Esta biblioteca de código abierto para el cálculo numérico y la diferenciación automática se escala sin esfuerzo en clústeres de TPU distribuidos masivos con una malla de dispositivo explícita.
TorchTPU y PyTorch
Ejecuta cargas de trabajo de PyTorch directamente en las TPUs usando sintaxis estándar. Creada con Meta, esta pila nativa de "ejecución inmediata" permite la migración de bases de código existentes con cambios mínimos para obtener importantes beneficios de costo-rendimiento, sin necesidad de que los equipos de ingeniería aprendan un nuevo framework.
OpenXLA
Reduce los cuellos de botella de la compilación para extraer un alto rendimiento del hardware de TPU. Este compilador de aprendizaje automático de código abierto fusiona operaciones automáticamente, optimiza el uso de la memoria y elimina la sobrecarga del framework para los cálculos de álgebra lineal en los backends de TPU.
MaxText
Reduce los plazos de entrenamiento para modelos de base masivos. Esta implementación de referencia basada en JAX proporciona un plano altamente escalable y listo para usar que permite lograr un uso máximo del hardware durante el entrenamiento previo de LLM en TPUs.
Tunix
Optimiza el posentrenamiento y la alineación de LLM en la infraestructura de TPU. Esta biblioteca de JAX ligera y de código abierto ofrece flujos de trabajo escalables para el ajuste supervisado (SFT) y el aprendizaje por refuerzo (RL) y así convertir de forma eficiente modelos sin procesar en agentes listos para producción.
vLLM
Maximiza la simultaneidad de entrega y reduce los costos operativos para la inferencia de TPU en tiempo real. Este motor de código abierto de alta capacidad de procesamiento aprovecha técnicas de administración de memoria como PagedAttention para eliminar el desperdicio y ofrecer una entrega de LLM altamente eficiente en la arquitectura de TPU.
La pila de software de TPU está diseñada para cerrar la brecha entre el código de aprendizaje automático de alto nivel y el chip personalizado para optimizar la eficiencia del hardware sin procesar.
JAX
Compila operaciones matemáticas complejas a una velocidad de hardware casi nativa en TPUs. Esta biblioteca de código abierto para el cálculo numérico y la diferenciación automática se escala sin esfuerzo en clústeres de TPU distribuidos masivos con una malla de dispositivo explícita.
TorchTPU y PyTorch
Ejecuta cargas de trabajo de PyTorch directamente en las TPUs usando sintaxis estándar. Creada con Meta, esta pila nativa de "ejecución inmediata" permite la migración de bases de código existentes con cambios mínimos para obtener importantes beneficios de costo-rendimiento, sin necesidad de que los equipos de ingeniería aprendan un nuevo framework.
OpenXLA
Reduce los cuellos de botella de la compilación para extraer un alto rendimiento del hardware de TPU. Este compilador de aprendizaje automático de código abierto fusiona operaciones automáticamente, optimiza el uso de la memoria y elimina la sobrecarga del framework para los cálculos de álgebra lineal en los backends de TPU.
MaxText
Reduce los plazos de entrenamiento para modelos de base masivos. Esta implementación de referencia basada en JAX proporciona un plano altamente escalable y listo para usar que permite lograr un uso máximo del hardware durante el entrenamiento previo de LLM en TPUs.
Tunix
Optimiza el posentrenamiento y la alineación de LLM en la infraestructura de TPU. Esta biblioteca de JAX ligera y de código abierto ofrece flujos de trabajo escalables para el ajuste supervisado (SFT) y el aprendizaje por refuerzo (RL) y así convertir de forma eficiente modelos sin procesar en agentes listos para producción.
vLLM
Maximiza la simultaneidad de entrega y reduce los costos operativos para la inferencia de TPU en tiempo real. Este motor de código abierto de alta capacidad de procesamiento aprovecha técnicas de administración de memoria como PagedAttention para eliminar el desperdicio y ofrecer una entrega de LLM altamente eficiente en la arquitectura de TPU.
Las TPUs potencian a los innovadores






Las TPUs son circuitos integrados específicos de aplicaciones (ASICs) diseñados a medida y desarrollados por Google. Se diseñaron desde cero para acelerar las cargas de trabajo de aprendizaje automático y de Inteligencia Artificial. Las TPUs están optimizadas específicamente para las exigentes operaciones de multiplicación de matrices y tensores que actúan como los componentes básicos fundamentales de las redes neuronales y hacen posible desde modelos de lenguaje grandes hasta agentes de razonamiento complejos.
En el centro de una TPU, se encuentra una unidad de multiplicación de matrices (MXU) especializada que procesa grandes cantidades de operaciones de matrices de forma simultánea. Las TPU utilizan una arquitectura de "array sistólico" que lee los datos una vez y los hace fluir de forma continua a través de miles de unidades lógicas aritméticas (ALU), acumulando resultados sin necesidad de leer y escribir constantemente en la memoria. También admiten aritmética de precisión reducida (como punto flotante de 8 o 16 bits), lo que permite millones de cálculos por segundo sin sacrificar la exactitud requerida para los modelos de IA.
Las Cloud TPUs ofrecen compatibilidad nativa de alto rendimiento para los principales frameworks de aprendizaje automático, principalmente TensorFlow, PyTorch y JAX. El compilador de álgebra lineal acelerada (XLA) compila el código escrito en estos frameworks, lo que optimiza automáticamente el grafo computacional para que se ejecute de manera eficiente en el hardware de TPU subyacente.
Las TPUs son excelentes para las tareas de aprendizaje profundo que requieren operaciones de matrices paralelas masivas. Se recomiendan para los siguientes casos:
Un pod de TPU es un clúster físico masivo de chips TPU conectados entre sí a través de una red especializada de alta velocidad (como la red de Virgo o de conmutación de circuitos ópticos de Google). Un solo superpod puede contener miles de chips interconectados. Una “porción” es un subconjunto más pequeño y dedicado de un pod que puedes alquilar. Esta arquitectura de red permite que los desarrolladores escalen sus cargas de trabajo de IA en grandes cantidades de procesamiento con pocos o ningún cambio de código, lo que permite operar de manera eficaz toda la porción como una sola máquina unificada.
El rendimiento útil se refiere al tiempo real y productivo que tu infraestructura dedica a entrenar activamente tu modelo, en lugar de estar inactiva. El entrenamiento de modelos de base grandes implica una organización compleja en miles de chips, lo que significa que los ciclos de procesamiento pueden desperdiciarse fácilmente en retrasos en la transferencia de datos, restablecimientos de hardware o creación de puntos de control. Las Cloud TPUs están diseñadas para maximizar el rendimiento útil a través de interconexiones de ancho de banda alto y almacenamiento en caché de la memoria optimizado, lo que garantiza que los ciclos de procesamiento pagados contribuyan directamente al avance del modelo.
Los usuarios pueden respaldar la confiabilidad, la supervisión integral y la administración con Google Kubernetes Engine (GKE) y Cluster Director. Con GKE para TPU, los clientes operan en un ecosistema nativo de la nube que cuenta con la puerta de enlace de inferencia para el balanceo de cargas y la capacidad de escalar implementaciones hasta 130,000 nodos de GKE.