Unidades de procesamiento tensorial

Entrena, ajusta y, luego, implementa IA avanzada en aceleradores creados para un propósito específico

Unidades de procesamiento tensorial

Entrena, ajusta y, luego, implementa IA avanzada en aceleradores creados para un propósito específico

Diseñado para la IA de nueva generación
AI Hypercomputer
Más de una década de innovación en TPU

Diseñado para la IA de nueva generación

Diseñado para la IA de nueva generación

Las unidades de procesamiento tensorial (TPUs) son aceleradores personalizados diseñados en conjunto con software de código abierto para potenciar todo el ciclo de vida de la IA, desde el entrenamiento de vanguardia y la inferencia a gran escala hasta las demandas de datos de razonamiento de varios pasos de la IA de agentes.

AI Hypercomputer

Las TPUs funcionan con AI Hypercomputer de Google Cloud, una arquitectura innovadora que reúne hardware creado para un propósito específico, software de código abierto y modelos de consumo flexibles.

Más de una década de innovación en TPU

Las TPUs están diseñadas específicamente para cargas de trabajo de IA avanzadas, desde modelos de lenguaje grandes y generación de código hasta agentes inteligentes. Son el motor detrás de Gemini y los productos insignia de Google que usan miles de millones de personas, como la Búsqueda, Fotos y Maps.

Diseñado para la IA de nueva generación

Diseñado para la IA de nueva generación

Las unidades de procesamiento tensorial (TPUs) son aceleradores personalizados diseñados en conjunto con software de código abierto para potenciar todo el ciclo de vida de la IA, desde el entrenamiento de vanguardia y la inferencia a gran escala hasta las demandas de datos de razonamiento de varios pasos de la IA de agentes.

AI Hypercomputer

Las TPUs funcionan con AI Hypercomputer de Google Cloud, una arquitectura innovadora que reúne hardware creado para un propósito específico, software de código abierto y modelos de consumo flexibles.

Más de una década de innovación en TPU

Las TPUs están diseñadas específicamente para cargas de trabajo de IA avanzadas, desde modelos de lenguaje grandes y generación de código hasta agentes inteligentes. Son el motor detrás de Gemini y los productos insignia de Google que usan miles de millones de personas, como la Búsqueda, Fotos y Maps.

Ventajas

Operaciones abiertas, flexibles y confiables

Las TPU son abiertas, flexibles y confiables

Crea en un ecosistema abierto con bibliotecas y herramientas conocidas. Las TPUs proporcionan compatibilidad nativa de alto rendimiento para PyTorch y JAX, y admiten el motor vLLM para una inferencia rápida. Administra y escala estas implementaciones de manera confiable en clústeres globales con Google Kubernetes Engine (GKE).

Más de 1 millón de TPU en un solo clúster de entrenamiento lógico

Convierte meses de entrenamiento en semanas para modelos de frontera. Con hasta 1 millón de chips TPU en un solo clúster, las TPUs maximizan el rendimiento útil, lo que garantiza que casi todos los ciclos de procesamiento se dediquen al aprendizaje activo.

Las TPU son abiertas, flexibles y confiables
Más de 1 millón de TPU en un solo clúster de entrenamiento lógico

Ventajas

Operaciones abiertas, flexibles y confiables

Las TPU son abiertas, flexibles y confiables

Crea en un ecosistema abierto con bibliotecas y herramientas conocidas. Las TPUs proporcionan compatibilidad nativa de alto rendimiento para PyTorch y JAX, y admiten el motor vLLM para una inferencia rápida. Administra y escala estas implementaciones de manera confiable en clústeres globales con Google Kubernetes Engine (GKE).

Más de 1 millón de TPU en un solo clúster de entrenamiento lógico

Convierte meses de entrenamiento en semanas para modelos de frontera. Con hasta 1 millón de chips TPU en un solo clúster, las TPUs maximizan el rendimiento útil, lo que garantiza que casi todos los ciclos de procesamiento se dediquen al aprendizaje activo.

TPU 8t: Optimizada para el entrenamiento
TPU 8i: Optimizada para la inferencia y el aprendizaje por refuerzo
TPU Ironwood
TPU Trillium
Versiones de TPU

TPU 8t

TPU 8t: Optimizada para el entrenamiento

La TPU 8t está diseñada para el entrenamiento previo a gran escala y las cargas de trabajo con muchos embeddings a una escala de 9,600 chips en un solo superpod, lo que proporciona la computación de alta densidad necesaria para los modelos de frontera con casi 3 veces el rendimiento de computación por pod en comparación con la generación anterior.

Disponible próximamente.

TPU 8i: Optimizada para la inferencia y el aprendizaje por refuerzo

La TPU 8i está optimizada para la inferencia y el entrenamiento posterior, y proporciona una mejora del 80% en el rendimiento por dólar en comparación con las generaciones anteriores para la inferencia de baja latencia para modelos MoE grandes.

Disponible próximamente.

TPU Ironwood

TPU de 7ª generación con eficiencia energética diseñada para entrenamiento, razonamiento e inferencia a gran escala. Cuenta con 9,216 chips refrigerados por líquido por Pod, proporciona 42.5 ExaFlops y un rendimiento por chip 4 veces mejor que Trillium.

Disponible para el público general

Documentación | Precios

TPU Trillium

TPU de sexta generación con eficiencia energética mejorada y rendimiento máximo de procesamiento para entrenamiento e inferencia. Funciona con un 67% más de eficiencia energética y proporciona un rendimiento de procesamiento máximo 4.7 veces mayor por chip en comparación con la TPU v5e de la generación anterior.

Disponible para el público general

Documentación | Precios

Versiones de TPU

TPU 8t

TPU 8t: Optimizada para el entrenamiento

La TPU 8t está diseñada para el entrenamiento previo a gran escala y las cargas de trabajo con muchos embeddings a una escala de 9,600 chips en un solo superpod, lo que proporciona la computación de alta densidad necesaria para los modelos de frontera con casi 3 veces el rendimiento de computación por pod en comparación con la generación anterior.

Disponible próximamente.

TPU 8i: Optimizada para la inferencia y el aprendizaje por refuerzo

La TPU 8i está optimizada para la inferencia y el entrenamiento posterior, y proporciona una mejora del 80% en el rendimiento por dólar en comparación con las generaciones anteriores para la inferencia de baja latencia para modelos MoE grandes.

Disponible próximamente.

TPU Ironwood

TPU de 7ª generación con eficiencia energética diseñada para entrenamiento, razonamiento e inferencia a gran escala. Cuenta con 9,216 chips refrigerados por líquido por Pod, proporciona 42.5 ExaFlops y un rendimiento por chip 4 veces mejor que Trillium.

Disponible para el público general

Documentación | Precios

TPU Trillium

TPU de sexta generación con eficiencia energética mejorada y rendimiento máximo de procesamiento para entrenamiento e inferencia. Funciona con un 67% más de eficiencia energética y proporciona un rendimiento de procesamiento máximo 4.7 veces mayor por chip en comparación con la TPU v5e de la generación anterior.

Disponible para el público general

Documentación | Precios

Jax
TorchTPU
OpenXLA
MaxText
Tunix
Inferencia de TPU de vLLM

Pila de software de TPU

La pila de software de TPU está diseñada para cerrar la brecha entre el código de aprendizaje automático de alto nivel y el chip personalizado para optimizar la eficiencia del hardware sin procesar.

JAX

Jax

Compila operaciones matemáticas complejas a una velocidad de hardware casi nativa en TPUs. Esta biblioteca de código abierto para el cálculo numérico y la diferenciación automática se escala sin esfuerzo en clústeres de TPU distribuidos masivos con una malla de dispositivo explícita.

Ver repositorio de GitHub

TorchTPU

Ejecuta cargas de trabajo de PyTorch directamente en las TPUs usando sintaxis estándar. Creada con Meta, esta pila nativa de "ejecución inmediata" permite la migración de bases de código existentes con cambios mínimos para obtener importantes beneficios de costo-rendimiento, sin necesidad de que los equipos de ingeniería aprendan un nuevo framework.

Leer el artículo

OpenXLA

Reduce los cuellos de botella de la compilación para extraer un alto rendimiento del hardware de TPU. Este compilador de aprendizaje automático de código abierto fusiona operaciones automáticamente, optimiza el uso de la memoria y elimina la sobrecarga del framework para los cálculos de álgebra lineal en los backends de TPU.

Ver repositorio de GitHub

MaxText

Reduce los plazos de entrenamiento para modelos de base masivos. Esta implementación de referencia basada en JAX proporciona un plano altamente escalable y listo para usar que permite lograr un uso máximo del hardware durante el entrenamiento previo de LLM en TPUs.

Ver repositorio de GitHub

Tunix

Optimiza el posentrenamiento y la alineación de LLM en la infraestructura de TPU. Esta biblioteca de JAX ligera y de código abierto ofrece flujos de trabajo escalables para el ajuste supervisado (SFT) y el aprendizaje por refuerzo (RL) y así convertir de forma eficiente modelos sin procesar en agentes listos para producción.

Ver repositorio de GitHub

Inferencia de TPU de vLLM

Maximiza la simultaneidad de entrega y reduce los costos operativos para la inferencia de TPU en tiempo real. Este motor de código abierto de alta capacidad de procesamiento aprovecha técnicas de administración de memoria como PagedAttention para eliminar el desperdicio y ofrecer una entrega de LLM altamente eficiente en la arquitectura de TPU.

Ver repositorio de GitHub

Pila de software de TPU

La pila de software de TPU está diseñada para cerrar la brecha entre el código de aprendizaje automático de alto nivel y el chip personalizado para optimizar la eficiencia del hardware sin procesar.

JAX

Jax

Compila operaciones matemáticas complejas a una velocidad de hardware casi nativa en TPUs. Esta biblioteca de código abierto para el cálculo numérico y la diferenciación automática se escala sin esfuerzo en clústeres de TPU distribuidos masivos con una malla de dispositivo explícita.

Ver repositorio de GitHub

TorchTPU

Ejecuta cargas de trabajo de PyTorch directamente en las TPUs usando sintaxis estándar. Creada con Meta, esta pila nativa de "ejecución inmediata" permite la migración de bases de código existentes con cambios mínimos para obtener importantes beneficios de costo-rendimiento, sin necesidad de que los equipos de ingeniería aprendan un nuevo framework.

Leer el artículo

OpenXLA

Reduce los cuellos de botella de la compilación para extraer un alto rendimiento del hardware de TPU. Este compilador de aprendizaje automático de código abierto fusiona operaciones automáticamente, optimiza el uso de la memoria y elimina la sobrecarga del framework para los cálculos de álgebra lineal en los backends de TPU.

Ver repositorio de GitHub

MaxText

Reduce los plazos de entrenamiento para modelos de base masivos. Esta implementación de referencia basada en JAX proporciona un plano altamente escalable y listo para usar que permite lograr un uso máximo del hardware durante el entrenamiento previo de LLM en TPUs.

Ver repositorio de GitHub

Tunix

Optimiza el posentrenamiento y la alineación de LLM en la infraestructura de TPU. Esta biblioteca de JAX ligera y de código abierto ofrece flujos de trabajo escalables para el ajuste supervisado (SFT) y el aprendizaje por refuerzo (RL) y así convertir de forma eficiente modelos sin procesar en agentes listos para producción.

Ver repositorio de GitHub

Inferencia de TPU de vLLM

Maximiza la simultaneidad de entrega y reduce los costos operativos para la inferencia de TPU en tiempo real. Este motor de código abierto de alta capacidad de procesamiento aprovecha técnicas de administración de memoria como PagedAttention para eliminar el desperdicio y ofrecer una entrega de LLM altamente eficiente en la arquitectura de TPU.

Ver repositorio de GitHub

Las TPUs potencian a los innovadores

Citadel Securities ejecuta cargas de trabajo hasta 4 veces más rápido con Ironwood
En los mercados financieros, cada nanosegundo cuenta. Citadel Securities se asoció con Google Cloud para crear un entorno de investigación cuantitativa escalable y basado en la nube que puede ejecutar cargas de trabajo de 2 a 4 veces más rápido con un 30% menos de costo. Con una infraestructura basada en TPU Ironwood, las cargas de trabajo que antes tardaban semanas o días ahora se ejecutan en horas o incluso minutos, lo que ayuda a los clientes de todo el mundo a cumplir sus objetivos de inversión.
hasta 4 veces más rápido con TPU
Nuro está creando una ruta segura hacia un futuro sin conductores con Google Cloud
Nuro aceleró significativamente el desarrollo de su tecnología de conducción autónoma aprovechando las TPU de Google Cloud y Google Kubernetes Engine, entrenando modelos de IA dos veces más rápido sin costo incremental. Con el procesamiento de petabytes de datos reales de conducción y la ejecución de simulaciones de seguridad a gran escala, mejoran de forma continua Nuro Driver para que pueda conducir con seguridad cualquier vehículo, desde autos hasta camiones semirremolque, por las vías públicas.
Vehículos sin conductor de Nuro
Lightricks entrena modelos de difusión de video a gran escala con JAX en TPU
Lightricks aceleró significativamente el entrenamiento de sus modelos generativos de video de 13,000 millones de parámetros cuando migró su base de código a JAX en las TPU de Google Cloud, lo que aumentó los pasos de entrenamiento diarios en un 40%. Con este cambio estratégico, se superaron los límites de escalabilidad anteriores, lo que permitió una escalabilidad lineal en miles de núcleos de TPU y duplicó la productividad de los desarrolladores, lo que le permitió a Lightricks llevar herramientas de video de IA de alto rendimiento y altamente controlables a la economía de creadores mucho más rápido.
Edición de video de Lightricks

Recursos adicionales

Dé los siguientes pasos

Logotipo de Cloud

Preguntas frecuentes

¿Qué es una unidad de procesamiento tensorial (TPU)?

Las TPUs son circuitos integrados específicos de aplicaciones (ASICs) diseñados a medida y desarrollados por Google. Se diseñaron desde cero para acelerar las cargas de trabajo de aprendizaje automático y de Inteligencia Artificial. Las TPUs están optimizadas específicamente para las exigentes operaciones de multiplicación de matrices y tensores que actúan como los componentes básicos fundamentales de las redes neuronales y hacen posible desde modelos de lenguaje grandes hasta agentes de razonamiento complejos.

¿Cómo funciona la arquitectura de TPU?

En el centro de una TPU, se encuentra una unidad de multiplicación de matrices (MXU) especializada que procesa grandes cantidades de operaciones de matrices de forma simultánea. Las TPU utilizan una arquitectura de "array sistólico" que lee los datos una vez y los hace fluir de forma continua a través de miles de unidades lógicas aritméticas (ALU), acumulando resultados sin necesidad de leer y escribir constantemente en la memoria. También admiten aritmética de precisión reducida (como punto flotante de 8 o 16 bits), lo que permite millones de cálculos por segundo sin sacrificar la exactitud requerida para los modelos de IA.

¿Qué frameworks de aprendizaje automático admite Cloud TPU?

Las Cloud TPUs ofrecen compatibilidad nativa de alto rendimiento para los principales frameworks de aprendizaje automático, principalmente TensorFlow, PyTorch y JAX. El compilador de álgebra lineal acelerada (XLA) compila el código escrito en estos frameworks, lo que optimiza automáticamente el grafo computacional para que se ejecute de manera eficiente en el hardware de TPU subyacente.

¿Qué tipos de cargas de trabajo son más adecuados para las TPUs?

Las TPUs son excelentes para las tareas de aprendizaje profundo que requieren operaciones de matrices paralelas masivas. Se recomiendan para los siguientes casos:

  • Modelos dominados por cálculos de matrices
  • Ejecuciones de entrenamiento que tardan semanas o meses en converger
  • Modelos de base grandes y modelos de lenguaje grandes (LLM)
  • Cargas de trabajo con embeddings ultragrandes, como motores de recomendaciones avanzados
  • Inferencia de alto volumen y baja latencia, y aprendizaje por refuerzo continuo


¿Qué son las porciones y los pods de TPU?

Un pod de TPU es un clúster físico masivo de chips TPU conectados entre sí a través de una red especializada de alta velocidad (como la red de Virgo o de conmutación de circuitos ópticos de Google). Un solo superpod puede contener miles de chips interconectados. Una “porción” es un subconjunto más pequeño y dedicado de un pod que puedes alquilar. Esta arquitectura de red permite que los desarrolladores escalen sus cargas de trabajo de IA en grandes cantidades de procesamiento con pocos o ningún cambio de código, lo que permite operar de manera eficaz toda la porción como una sola máquina unificada. 


¿Qué es el “procesamiento útil” del AA en el contexto del entrenamiento de TPU?

El rendimiento útil se refiere al tiempo real y productivo que tu infraestructura dedica a entrenar activamente tu modelo, en lugar de estar inactiva. El entrenamiento de modelos de base grandes implica una organización compleja en miles de chips, lo que significa que los ciclos de procesamiento pueden desperdiciarse fácilmente en retrasos en la transferencia de datos, restablecimientos de hardware o creación de puntos de control. Las Cloud TPUs están diseñadas para maximizar el rendimiento útil a través de interconexiones de ancho de banda alto y almacenamiento en caché de la memoria optimizado, lo que garantiza que los ciclos de procesamiento pagados contribuyan directamente al avance del modelo.

¿Cómo se maneja la organización a gran escala para las TPUs?

Los usuarios pueden respaldar la confiabilidad, la supervisión integral y la administración con Google Kubernetes Engine (GKE) y Cluster Director. Con GKE para TPU, los clientes operan en un ecosistema nativo de la nube que cuenta con la puerta de enlace de inferencia para el balanceo de cargas y la capacidad de escalar implementaciones hasta 130,000 nodos de GKE.

Google Cloud