Unidades de procesamiento de tensor

Entrena, ajusta y despliega IA avanzada en aceleradores creados específicamente para ello

Unidades de procesamiento de tensor

Entrena, ajusta y despliega IA avanzada en aceleradores creados específicamente para ello

Diseñado para la IA de última generación
AI Hypercomputer
Más de una década de innovación en TPUs

Diseñado para la IA de última generación

Diseñado para la IA de última generación

Las unidades de procesamiento de tensor (TPUs) son aceleradores personalizados diseñados conjuntamente con software de código abierto para impulsar todo el ciclo de vida de la IA, desde el entrenamiento de vanguardia y la inferencia a gran escala hasta las demandas de datos de razonamiento multipaso de la IA agéntica.

AI Hypercomputer

Las TPUs se basan en AI Hypercomputer de Google Cloud, una arquitectura innovadora que combina hardware diseñado específicamente, software libre y modelos de consumo flexibles.

Más de una década de innovación en TPUs

Las TPUs se han diseñado específicamente para cargas de trabajo de IA avanzadas, desde modelos de lenguaje extensos y generación de código hasta agentes inteligentes. Son el motor de Gemini y de los productos estrella de Google con miles de millones de usuarios, como la Búsqueda, Fotos y Maps.

Diseñado para la IA de última generación

Diseñado para la IA de última generación

Las unidades de procesamiento de tensor (TPUs) son aceleradores personalizados diseñados conjuntamente con software de código abierto para impulsar todo el ciclo de vida de la IA, desde el entrenamiento de vanguardia y la inferencia a gran escala hasta las demandas de datos de razonamiento multipaso de la IA agéntica.

AI Hypercomputer

Las TPUs se basan en AI Hypercomputer de Google Cloud, una arquitectura innovadora que combina hardware diseñado específicamente, software libre y modelos de consumo flexibles.

Más de una década de innovación en TPUs

Las TPUs se han diseñado específicamente para cargas de trabajo de IA avanzadas, desde modelos de lenguaje extensos y generación de código hasta agentes inteligentes. Son el motor de Gemini y de los productos estrella de Google con miles de millones de usuarios, como la Búsqueda, Fotos y Maps.

Ventajas

Operaciones abiertas, flexibles y fiables

Las TPUs son abiertas, flexibles y fiables

Desarrolla en un ecosistema abierto con herramientas y bibliotecas que ya conoces. Las TPUs ofrecen compatibilidad nativa y de alto rendimiento con PyTorch y JAX, y admiten el motor vLLM para una inferencia rápida. Gestiona y escala estos despliegues de forma fiable en clústeres globales con Google Kubernetes Engine (GKE).

Más de 1 millón de TPUs en un único clúster de entrenamiento lógico

Reduce el tiempo de entrenamiento de los modelos fundacionales de meses a semanas. Con hasta 1 millón de chips de TPU en un solo clúster, las TPUs maximizan el goodput, lo que garantiza que casi todos los ciclos de computación se dediquen al aprendizaje activo.

Las TPUs son abiertas, flexibles y fiables
Más de 1 millón de TPUs en un único clúster de entrenamiento lógico

Ventajas

Operaciones abiertas, flexibles y fiables

Las TPUs son abiertas, flexibles y fiables

Desarrolla en un ecosistema abierto con herramientas y bibliotecas que ya conoces. Las TPUs ofrecen compatibilidad nativa y de alto rendimiento con PyTorch y JAX, y admiten el motor vLLM para una inferencia rápida. Gestiona y escala estos despliegues de forma fiable en clústeres globales con Google Kubernetes Engine (GKE).

Más de 1 millón de TPUs en un único clúster de entrenamiento lógico

Reduce el tiempo de entrenamiento de los modelos fundacionales de meses a semanas. Con hasta 1 millón de chips de TPU en un solo clúster, las TPUs maximizan el goodput, lo que garantiza que casi todos los ciclos de computación se dediquen al aprendizaje activo.

TPU 8t: optimizada para el entrenamiento
TPU 8i: optimizada para la inferencia y el aprendizaje por refuerzo
TPU de Ironwood
TPU de Trillium
Versiones de TPU

TPU 8t

TPU 8t: optimizada para el entrenamiento

La TPU 8t se ha diseñado para el preentrenamiento a gran escala y las cargas de trabajo con muchos embeddings a una escala de 9600 chips en un único superpod, y ofrece la computación de alta densidad que necesitan los modelos de vanguardia con casi el triple de rendimiento computacional por pod que la generación anterior.

Disponible próximamente.

TPU 8i: optimizada para la inferencia y el aprendizaje por refuerzo

La TPU 8i está optimizada para el posentrenamiento y la inferencia, y ofrece una mejora del 80 % en el rendimiento por dólar en comparación con las generaciones anteriores en lo que respecta a la inferencia de baja latencia para modelos MoE extensos.

Disponible próximamente.

TPU de Ironwood

TPU de 7.ª generación con eficiencia energética diseñada para el entrenamiento, el razonamiento y la inferencia a gran escala. Cuenta con 9216 chips refrigerados por líquido por pod, y ofrece 42,5 exaflops y un rendimiento por chip 4 veces mejor que el de Trillium.

Disponible de forma general.

Documentación | Precios

TPU de Trillium

TPU de sexta generación con eficiencia energética y rendimiento computacional máximo mejorados para el entrenamiento y la inferencia. Funciona con un 67 % más de eficiencia energética y ofrece un rendimiento computacional máximo por chip 4,7 veces superior a la generación anterior de TPU v5e.

Disponible de forma general.

Documentación | Precios

Versiones de TPU

TPU 8t

TPU 8t: optimizada para el entrenamiento

La TPU 8t se ha diseñado para el preentrenamiento a gran escala y las cargas de trabajo con muchos embeddings a una escala de 9600 chips en un único superpod, y ofrece la computación de alta densidad que necesitan los modelos de vanguardia con casi el triple de rendimiento computacional por pod que la generación anterior.

Disponible próximamente.

TPU 8i: optimizada para la inferencia y el aprendizaje por refuerzo

La TPU 8i está optimizada para el posentrenamiento y la inferencia, y ofrece una mejora del 80 % en el rendimiento por dólar en comparación con las generaciones anteriores en lo que respecta a la inferencia de baja latencia para modelos MoE extensos.

Disponible próximamente.

TPU de Ironwood

TPU de 7.ª generación con eficiencia energética diseñada para el entrenamiento, el razonamiento y la inferencia a gran escala. Cuenta con 9216 chips refrigerados por líquido por pod, y ofrece 42,5 exaflops y un rendimiento por chip 4 veces mejor que el de Trillium.

Disponible de forma general.

Documentación | Precios

TPU de Trillium

TPU de sexta generación con eficiencia energética y rendimiento computacional máximo mejorados para el entrenamiento y la inferencia. Funciona con un 67 % más de eficiencia energética y ofrece un rendimiento computacional máximo por chip 4,7 veces superior a la generación anterior de TPU v5e.

Disponible de forma general.

Documentación | Precios

Jax
TorchTPU
OpenXLA
MaxText
Tunix
Inferencia de vLLM en TPU

Pila de software de TPU

La pila de software de TPU se ha diseñado para salvar la brecha entre el código de aprendizaje automático de alto nivel y el silicio personalizado, con el objetivo de optimizar la eficiencia del hardware en bruto.

JAX

Jax

Compila operaciones matemáticas complejas a una velocidad casi nativa del hardware en las TPUs. Esta biblioteca de código abierto para la computación numérica y la diferenciación automática se escala sin esfuerzo en clústeres de TPUs distribuidas masivas mediante una malla de dispositivos explícita.

Ver repositorio de GitHub

TorchTPU

Ejecuta cargas de trabajo de PyTorch directamente en TPUs usando la sintaxis estándar. Esta pila nativa, creada con Meta, permite migrar las bases de código existentes con cambios mínimos para obtener importantes ventajas de coste-rendimiento, sin que los equipos de ingeniería tengan que aprender un nuevo framework.

Leer el artículo

OpenXLA

Reduce los cuellos de botella de compilación para extraer un alto rendimiento del hardware de TPU. Este compilador de aprendizaje automático de código abierto fusiona operaciones automáticamente, optimiza el uso de memoria y elimina la sobrecarga del framework para los cálculos de álgebra lineal en los backends de TPU.

Ver repositorio de GitHub

MaxText

Reduce los plazos de entrenamiento de modelos fundacionales masivos. Esta implementación de referencia basada en JAX proporciona un plan altamente escalable y listo para usar para lograr el máximo aprovechamiento del hardware durante el preentrenamiento de LLMs en TPUs.

Ver repositorio de GitHub

Tunix

Optimiza el postentrenamiento y la alineación de LLMs en la infraestructura de TPU. Esta biblioteca de JAX ligera y de código abierto ofrece flujos de trabajo escalables para el afinamiento supervisado (SFT) y el aprendizaje por refuerzo (RL) para convertir de forma eficiente los modelos sin procesar en agentes listos para producción.

Ver repositorio de GitHub

Inferencia de vLLM en TPU

Maximiza la simultaneidad de las peticiones y reduce los costes operativos de la inferencia en tiempo real con las TPUs. Este motor de código abierto de alto rendimiento aprovecha técnicas de gestión de memoria como PagedAttention para eliminar los residuos y ofrecer un servicio de LLM de alta eficiencia en la arquitectura de TPU.

Ver repositorio de GitHub

Pila de software de TPU

La pila de software de TPU se ha diseñado para salvar la brecha entre el código de aprendizaje automático de alto nivel y el silicio personalizado, con el objetivo de optimizar la eficiencia del hardware en bruto.

JAX

Jax

Compila operaciones matemáticas complejas a una velocidad casi nativa del hardware en las TPUs. Esta biblioteca de código abierto para la computación numérica y la diferenciación automática se escala sin esfuerzo en clústeres de TPUs distribuidas masivas mediante una malla de dispositivos explícita.

Ver repositorio de GitHub

TorchTPU

Ejecuta cargas de trabajo de PyTorch directamente en TPUs usando la sintaxis estándar. Esta pila nativa, creada con Meta, permite migrar las bases de código existentes con cambios mínimos para obtener importantes ventajas de coste-rendimiento, sin que los equipos de ingeniería tengan que aprender un nuevo framework.

Leer el artículo

OpenXLA

Reduce los cuellos de botella de compilación para extraer un alto rendimiento del hardware de TPU. Este compilador de aprendizaje automático de código abierto fusiona operaciones automáticamente, optimiza el uso de memoria y elimina la sobrecarga del framework para los cálculos de álgebra lineal en los backends de TPU.

Ver repositorio de GitHub

MaxText

Reduce los plazos de entrenamiento de modelos fundacionales masivos. Esta implementación de referencia basada en JAX proporciona un plan altamente escalable y listo para usar para lograr el máximo aprovechamiento del hardware durante el preentrenamiento de LLMs en TPUs.

Ver repositorio de GitHub

Tunix

Optimiza el postentrenamiento y la alineación de LLMs en la infraestructura de TPU. Esta biblioteca de JAX ligera y de código abierto ofrece flujos de trabajo escalables para el afinamiento supervisado (SFT) y el aprendizaje por refuerzo (RL) para convertir de forma eficiente los modelos sin procesar en agentes listos para producción.

Ver repositorio de GitHub

Inferencia de vLLM en TPU

Maximiza la simultaneidad de las peticiones y reduce los costes operativos de la inferencia en tiempo real con las TPUs. Este motor de código abierto de alto rendimiento aprovecha técnicas de gestión de memoria como PagedAttention para eliminar los residuos y ofrecer un servicio de LLM de alta eficiencia en la arquitectura de TPU.

Ver repositorio de GitHub

Las TPUs impulsan a los innovadores

Citadel Securities ejecuta cargas de trabajo hasta 4 veces más rápido con Ironwood
En los mercados financieros, cada nanosegundo cuenta. Citadel Securities se asoció con Google Cloud para crear un entorno de investigación cuantitativa escalable y basado en la nube, capaz de ejecutar cargas de trabajo de 2 a 4 veces más rápido con un coste un 30 % menor. Gracias a una infraestructura basada en TPUs de Ironwood, las cargas de trabajo que antes tardaban semanas o días ahora se ejecutan en horas o incluso minutos, lo que ayuda a clientes de todo el mundo a cumplir sus objetivos de inversión.
hasta 4 veces más rápido con las TPUs
Nuro está creando un camino seguro hacia un futuro sin conductores con Google Cloud
Nuro ha acelerado significativamente el desarrollo de su tecnología de conducción autónoma aprovechando las TPUs de Google Cloud y Google Kubernetes Engine, entrenando modelos de IA el doble de rápido sin costes adicionales. Al procesar petabytes de datos de conducción reales y ejecutar simulaciones de seguridad a gran escala, mejoran continuamente el Nuro Driver para que pueda conducir de forma segura cualquier vehículo, desde turismos hasta camiones, por vías públicas.
Vehículos sin conductor de Nuro
Lightricks entrena modelos de difusión de vídeo a escala con JAX en TPU
Lightricks ha acelerado significativamente el entrenamiento de sus modelos de vídeo generativos de 13.000 millones de parámetros migrando su código base a JAX en las TPUs de Google Cloud, lo que ha aumentado los pasos de entrenamiento diarios en un 40 %. Al superar los límites de escalabilidad anteriores, este cambio estratégico permitió una escalabilidad lineal en miles de núcleos de TPU y duplicó la productividad de los desarrolladores, lo que permitió a Lightricks llevar herramientas de vídeo de IA de alto rendimiento y altamente controlables a la economía de los creadores mucho más rápido.
Edición de vídeo de Lightricks

Recursos adicionales

Sigue estos pasos

Logotipo de Cloud

Preguntas frecuentes

¿Qué es una unidad de procesamiento de tensor (TPU)?

Las TPUs son circuitos integrados para aplicaciones específicas (ASIC) diseñados a medida por Google. Se han diseñado específicamente para agilizar las cargas de trabajo de aprendizaje automático e inteligencia artificial. Las TPUs están optimizadas específicamente para las operaciones de multiplicación de matrices y tensores que constituyen los componentes fundamentales de las redes neuronales, y que impulsan desde modelos de lenguaje extensos hasta agentes de razonamiento complejos.

¿Cómo funciona la arquitectura de TPU?

En el núcleo de una TPU hay una unidad de multiplicador de matriz (MXU) especializada que procesa grandes cantidades de operaciones de matriz de forma simultánea. Las TPUs utilizan una arquitectura de "matriz sistólica" que lee los datos una sola vez y los transmite continuamente a través de miles de unidades aritmético-lógicas (ALUs), acumulando resultados sin necesidad de leer y escribir constantemente en la memoria. También admiten aritmética de precisión reducida (como punto flotante de 16 u 8 bits), lo que permite realizar millones de cálculos por segundo sin sacrificar la exactitud que requieren los modelos de IA.

¿Qué frameworks de aprendizaje automático admiten las TPUs de Cloud?

Las TPUs de Cloud ofrecen compatibilidad nativa y de alto rendimiento con los principales frameworks de aprendizaje automático, principalmente TensorFlow, PyTorch y JAX. El código escrito en estos frameworks se compila con el compilador Accelerated Linear Algebra (XLA), que optimiza automáticamente el gráfico computacional para que se ejecute de forma eficiente en el hardware de TPU subyacente.

¿Qué tipos de cargas de trabajo son más adecuadas para las TPUs?

Las TPU son excelentes para las tareas de aprendizaje profundo que requieren operaciones de matriz paralelas masivas. Son muy recomendables para:

  • Modelos dominados por cálculos de matrices
  • Las rondas de entrenamiento tardan semanas o meses en converger
  • Modelos fundacionales extensos y modelos de lenguaje extenso (LLMs)
  • Cargas de trabajo con incrustaciones de gran tamaño, como motores de recomendaciones avanzados
  • Aprendizaje por refuerzo continuo e inferencia de alto volumen y baja latencia


¿Qué son los pods y los sectores de TPU?

Un pod de TPU es un clúster físico masivo de chips de TPU conectados entre sí a través de una red especializada de alta velocidad (como la conmutación de circuitos ópticos de Google o la red Virgo). Un solo superpod puede contener miles de chips interconectados. Un "sector" es una parte más pequeña y específica de un pod que puedes alquilar. Esta arquitectura de red permite a los desarrolladores escalar sus cargas de trabajo de IA en grandes cantidades de recursos informáticos con pocos o ningún cambio en el código, lo que hace que todo el segmento funcione como una sola máquina unificada. 


¿Qué es el "goodput" del aprendizaje automático en el contexto del entrenamiento de TPUs?

Goodput hace referencia al tiempo real y productivo que tu infraestructura dedica a entrenar tu modelo en lugar de estar inactiva. Entrenar modelos fundacionales masivos implica una orquestación compleja de miles de chips, lo que significa que los ciclos de computación se pueden desperdiciar fácilmente en retrasos en la transferencia de datos, reinicios de hardware o puntos de control. Las TPUs de Cloud se han diseñado para maximizar el Goodput mediante interconexiones de gran ancho de banda y almacenamiento en caché de memoria optimizado, lo que garantiza que los ciclos de computación de pago contribuyan directamente al avance del modelo.

¿Cómo se gestiona la orquestación a gran escala en las TPUs?

Los usuarios pueden mejorar la fiabilidad, la monitorización exhaustiva y la gestión con Google Kubernetes Engine (GKE) y Cluster Director. Al aprovechar GKE para TPU, los clientes operan en un ecosistema nativo de la nube que incluye Inference Gateway para el balanceo de carga y la capacidad de escalar despliegues hasta 130.000 nodos de GKE.

Google Cloud