Unidades de Processamento de Tensor

Treine, ajuste e implante IA avançada em aceleradores criados para essa finalidade

Unidades de Processamento de Tensor

Treine, ajuste e implante IA avançada em aceleradores criados para essa finalidade

Desenvolvido para IA de última geração
Hipercomputador de IA
Mais de uma década de inovação em TPUs

Desenvolvido para IA de última geração

Desenvolvido para IA de última geração

As Unidades de Processamento de Tensor (TPUs) são aceleradores personalizados criados em conjunto com software aberto para potencializar todo o ciclo de vida da IA, desde o treinamento de ponta e a inferência em grande escala até as demandas de dados de raciocínio em várias etapas da IA agêntica.

Hipercomputador de IA

As TPUs são alimentadas pelo Hipercomputador de IA do Google Cloud, uma arquitetura inovadora que reúne hardware criado para fins específicos, software aberto e modelos de consumo flexíveis.

Mais de uma década de inovação em TPUs

As TPUs são criadas especificamente para cargas de trabalho de IA avançadas, desde modelos de linguagem grandes e geração de código até agentes inteligentes. Elas são o motor por trás do Gemini e dos principais produtos do Google, usados por bilhões de pessoas, como a Pesquisa, o Fotos e o Maps.

Desenvolvido para IA de última geração

Desenvolvido para IA de última geração

As Unidades de Processamento de Tensor (TPUs) são aceleradores personalizados criados em conjunto com software aberto para potencializar todo o ciclo de vida da IA, desde o treinamento de ponta e a inferência em grande escala até as demandas de dados de raciocínio em várias etapas da IA agêntica.

Hipercomputador de IA

As TPUs são alimentadas pelo Hipercomputador de IA do Google Cloud, uma arquitetura inovadora que reúne hardware criado para fins específicos, software aberto e modelos de consumo flexíveis.

Mais de uma década de inovação em TPUs

As TPUs são criadas especificamente para cargas de trabalho de IA avançadas, desde modelos de linguagem grandes e geração de código até agentes inteligentes. Elas são o motor por trás do Gemini e dos principais produtos do Google, usados por bilhões de pessoas, como a Pesquisa, o Fotos e o Maps.

Benefícios

Operações abertas, flexíveis e confiáveis

As TPUs são abertas, flexíveis e confiáveis

Crie em um ecossistema aberto usando bibliotecas e ferramentas conhecidas. As TPUs oferecem suporte nativo e de alto desempenho para PyTorch e JAX, além de oferecer suporte ao mecanismo vLLM para inferência rápida. Gerencie e escale essas implantações de forma confiável em clusters globais com o Google Kubernetes Engine (GKE).

Mais de 1 milhão de TPUs em um único cluster de treinamento lógico

Transforme meses de treinamento em semanas para modelos de fronteira. Com até 1 milhão de chips de TPU em um único cluster, as TPUs maximizam o goodput, garantindo que quase todos os ciclos de computação sejam gastos no aprendizado ativo.

As TPUs são abertas, flexíveis e confiáveis
Mais de 1 milhão de TPUs em um único cluster de treinamento lógico

Benefícios

Operações abertas, flexíveis e confiáveis

As TPUs são abertas, flexíveis e confiáveis

Crie em um ecossistema aberto usando bibliotecas e ferramentas conhecidas. As TPUs oferecem suporte nativo e de alto desempenho para PyTorch e JAX, além de oferecer suporte ao mecanismo vLLM para inferência rápida. Gerencie e escale essas implantações de forma confiável em clusters globais com o Google Kubernetes Engine (GKE).

Mais de 1 milhão de TPUs em um único cluster de treinamento lógico

Transforme meses de treinamento em semanas para modelos de fronteira. Com até 1 milhão de chips de TPU em um único cluster, as TPUs maximizam o goodput, garantindo que quase todos os ciclos de computação sejam gastos no aprendizado ativo.

TPU 8t: otimizado para treinamento
TPU 8i: otimizada para inferência e aprendizado por reforço
TPU Ironwood
TPU Trillium
Versões de TPU

TPU 8t

TPU 8t: otimizado para treinamento

A TPU 8t foi criada para pré-treinamento em grande escala e cargas de trabalho com muitos embeddings em uma escala de 9.600 chips em um único superpod, oferecendo a computação de alta densidade necessária para modelos de ponta com quase 3 vezes o desempenho de computação por pod em relação à geração anterior.

Em breve.

TPU 8i: otimizada para inferência e aprendizado por reforço

A TPU 8i é otimizada para pós-treinamento e inferência. Ela oferece uma melhoria de 80% no desempenho por dólar em relação às gerações anteriores para inferência de baixa latência para grandes modelos MoE.

Em breve.

TPU Ironwood

TPU de 7ª geração com eficiência energética projetada para treinamento, raciocínio e inferência em grande escala. Possui 9.216 chips resfriados a líquido por pod, oferece 42,5 ExaFlops e desempenho 4 vezes melhor por chip em comparação com o Trillium.

Disponibilidade geral.

Documentação | Preços

TPU Trillium

TPU de sexta geração com melhor eficiência energética e desempenho máximo de computação para treinamento e inferência. Opera com 67% mais eficiência energética e oferece um desempenho de computação de pico 4,7 vezes maior por chip em comparação com a TPU v5e da geração anterior.

Disponibilidade geral.

Documentação | Preços

Versões de TPU

TPU 8t

TPU 8t: otimizado para treinamento

A TPU 8t foi criada para pré-treinamento em grande escala e cargas de trabalho com muitos embeddings em uma escala de 9.600 chips em um único superpod, oferecendo a computação de alta densidade necessária para modelos de ponta com quase 3 vezes o desempenho de computação por pod em relação à geração anterior.

Em breve.

TPU 8i: otimizada para inferência e aprendizado por reforço

A TPU 8i é otimizada para pós-treinamento e inferência. Ela oferece uma melhoria de 80% no desempenho por dólar em relação às gerações anteriores para inferência de baixa latência para grandes modelos MoE.

Em breve.

TPU Ironwood

TPU de 7ª geração com eficiência energética projetada para treinamento, raciocínio e inferência em grande escala. Possui 9.216 chips resfriados a líquido por pod, oferece 42,5 ExaFlops e desempenho 4 vezes melhor por chip em comparação com o Trillium.

Disponibilidade geral.

Documentação | Preços

TPU Trillium

TPU de sexta geração com melhor eficiência energética e desempenho máximo de computação para treinamento e inferência. Opera com 67% mais eficiência energética e oferece um desempenho de computação de pico 4,7 vezes maior por chip em comparação com a TPU v5e da geração anterior.

Disponibilidade geral.

Documentação | Preços

Jax
TorchTPU
OpenXLA
Maxtext
Tunix
Inferência de TPU do vLLM

Pilha de software da TPU

A pilha de software da TPU foi projetada para preencher a lacuna entre o código de machine learning de alto nível e o silício personalizado para otimizar a eficiência do hardware bruto.

JAX

Jax

Compile operações matemáticas complexas com velocidade de hardware quase nativa nas TPUs. Essa biblioteca de código aberto para computação numérica e diferenciação automática é escalonada sem esforço em clusters de TPU distribuídos usando uma malha de dispositivos explícita.

Ver no repositório do GitHub

TorchTPU

Execute cargas de trabalho do PyTorch diretamente em TPUs usando a sintaxe padrão. Criada com o Meta, essa pilha nativa e "eager-first" permite a migração de bases de código atuais com mudanças mínimas para aproveitar grandes benefícios de custo-performance, sem exigir que as equipes de engenharia aprendam uma nova estrutura.

Leia o artigo

OpenXLA

Reduzir gargalos de compilação para extrair alto desempenho do hardware da TPU. Esse compilador de machine learning de código aberto mescla operações automaticamente, otimiza o uso da memória e elimina a sobrecarga da estrutura para cálculos de álgebra linear em back-ends de TPU.

Ver no repositório do GitHub

Maxtext

Reduza os cronogramas de treinamento para modelos de fundação massivos. Essa implementação de referência baseada em JAX oferece um modelo altamente escalonável e pronto para uso para alcançar o pico de utilização de hardware durante o pré-treinamento de LLMs em TPUs.

Ver no repositório do GitHub

Tunix

Simplifique o pós-treinamento e o alinhamento de LLMs na infraestrutura de TPU. Essa biblioteca JAX leve e de código aberto oferece fluxos de trabalho escalonáveis para ajuste supervisionado (SFT, na sigla em inglês) e aprendizado por reforço (RL, na sigla em inglês) para transformar modelos brutos em agentes prontos para produção com eficiência.

Ver no repositório do GitHub

Inferência de TPU do vLLM

Maximize a simultaneidade de veiculação e reduza os custos operacionais para a inferência de TPU em tempo real. Esse mecanismo de código aberto de alta capacidade de processamento usa técnicas de gerenciamento de memória, como PagedAttention, para eliminar o desperdício e oferecer uma disponibilização de LLM altamente eficiente na arquitetura de TPU.

Ver no repositório do GitHub

Pilha de software da TPU

A pilha de software da TPU foi projetada para preencher a lacuna entre o código de machine learning de alto nível e o silício personalizado para otimizar a eficiência do hardware bruto.

JAX

Jax

Compile operações matemáticas complexas com velocidade de hardware quase nativa nas TPUs. Essa biblioteca de código aberto para computação numérica e diferenciação automática é escalonada sem esforço em clusters de TPU distribuídos usando uma malha de dispositivos explícita.

Ver no repositório do GitHub

TorchTPU

Execute cargas de trabalho do PyTorch diretamente em TPUs usando a sintaxe padrão. Criada com o Meta, essa pilha nativa e "eager-first" permite a migração de bases de código atuais com mudanças mínimas para aproveitar grandes benefícios de custo-performance, sem exigir que as equipes de engenharia aprendam uma nova estrutura.

Leia o artigo

OpenXLA

Reduzir gargalos de compilação para extrair alto desempenho do hardware da TPU. Esse compilador de machine learning de código aberto mescla operações automaticamente, otimiza o uso da memória e elimina a sobrecarga da estrutura para cálculos de álgebra linear em back-ends de TPU.

Ver no repositório do GitHub

Maxtext

Reduza os cronogramas de treinamento para modelos de fundação massivos. Essa implementação de referência baseada em JAX oferece um modelo altamente escalonável e pronto para uso para alcançar o pico de utilização de hardware durante o pré-treinamento de LLMs em TPUs.

Ver no repositório do GitHub

Tunix

Simplifique o pós-treinamento e o alinhamento de LLMs na infraestrutura de TPU. Essa biblioteca JAX leve e de código aberto oferece fluxos de trabalho escalonáveis para ajuste supervisionado (SFT, na sigla em inglês) e aprendizado por reforço (RL, na sigla em inglês) para transformar modelos brutos em agentes prontos para produção com eficiência.

Ver no repositório do GitHub

Inferência de TPU do vLLM

Maximize a simultaneidade de veiculação e reduza os custos operacionais para a inferência de TPU em tempo real. Esse mecanismo de código aberto de alta capacidade de processamento usa técnicas de gerenciamento de memória, como PagedAttention, para eliminar o desperdício e oferecer uma disponibilização de LLM altamente eficiente na arquitetura de TPU.

Ver no repositório do GitHub

As TPUs estão impulsionando os inovadores

A Citadel Securities executa cargas de trabalho até 4 vezes mais rápido com o Ironwood
Nos mercados financeiros, cada nanossegundo é importante. A Citadel Securities fez uma parceria com o Google Cloud para criar um ambiente de pesquisa quantitativa escalonável e baseado na nuvem, capaz de executar cargas de trabalho de 2 a 4 vezes mais rápido com 30% menos custo. Com uma infraestrutura baseada em TPUs Ironwood, cargas de trabalho que costumavam levar semanas ou dias agora são executadas em horas ou até minutos, ajudando clientes do mundo todo a atingir seus objetivos de investimento.
até 4x mais rápida com TPUs
A Nuro está criando um caminho seguro para um futuro sem motoristas com o Google Cloud
A Nuro acelerou significativamente o desenvolvimento da tecnologia de direção autônoma usando as TPUs do Google Cloud e o Google Kubernetes Engine, treinando modelos de IA duas vezes mais rápido sem custos adicionais. Ao processar petabytes de dados de direção do mundo real e executar simulações de segurança em grande escala, eles estão melhorando continuamente o Nuro Driver para navegar com segurança em qualquer veículo, de carros de passeio a caminhões semirreboques, em vias públicas.
Veículos sem motorista da Nuro
A Lightricks treina modelos de difusão de vídeo em escala com JAX na TPU
A Lightricks acelerou significativamente o treinamento dos modelos generativos de vídeo com 13 bilhões de parâmetros ao migrar a base de código para o JAX nas TPUs do Google Cloud, aumentando as etapas diárias de treinamento em 40%. Ao superar os limites de escalonabilidade anteriores, essa mudança estratégica desbloqueou o escalonamento linear em milhares de núcleos de TPU e dobrou a produtividade dos desenvolvedores, permitindo que a Lightricks levasse ferramentas de vídeo de IA de alto desempenho e altamente controláveis para a economia dos criadores muito mais rapidamente.
Edição de vídeo da Lightricks

Outros recursos

Próximas etapas

Logotipo do Cloud

Perguntas frequentes

O que é uma Unidade de Processamento de Tensor (TPU)?

As TPUs são circuitos integrados de aplicação específica (ASICs, na sigla em inglês) personalizados e desenvolvidos pelo Google. Elas foram criadas do zero para acelerar cargas de trabalho de machine learning e inteligência artificial. As TPUs são otimizadas especificamente para as operações pesadas de multiplicação de matrizes e tensores que atuam como os blocos de construção fundamentais das redes neurais, alimentando tudo, desde modelos de linguagem grandes até agentes de raciocínio complexos.

Como funciona a arquitetura da TPU?

No coração de uma TPU está uma Unidade Multiplicadora de Matriz (MXU, na sigla em inglês) especializada que processa grandes quantidades de operações de matriz simultaneamente. As TPUs utilizam uma arquitetura de "matriz sistólica" que lê os dados uma vez e os transmite continuamente por milhares de unidades lógicas aritméticas (ALUs, na sigla em inglês), acumulando resultados sem precisar ler e gravar constantemente na memória. Elas também oferecem suporte a aritmética de precisão reduzida (como pontos flutuantes de 16 ou 8 bits), permitindo milhões de computações por segundo sem sacrificar a acurácia necessária para modelos de IA.

Quais frameworks de machine learning são compatíveis com as Cloud TPUs?

As Cloud TPUs oferecem suporte nativo e de alto desempenho para os principais frameworks de machine learning, principalmente TensorFlow, PyTorch e JAX. O código escrito nesses frameworks é compilado pelo compilador de álgebra linear acelerada (XLA, na sigla em inglês), que otimiza automaticamente o gráfico computacional para ser executado com eficiência no hardware de TPU.

Quais tipos de cargas de trabalho são mais adequados para TPUs?

As TPUs são excelentes em tarefas de aprendizado profundo que exigem operações de matriz paralelas em massa. Elas são altamente recomendados para:

  • modelos com preponderância de computações matriciais
  • execuções de treinamento que levam semanas ou meses para convergir
  • modelos de fundação grandes e modelos de linguagem grandes (LLMs)
  • cargas de trabalho com embeddings ultragrandes, como mecanismos de recomendação avançados
  • aprendizado por reforço contínuo e inferência de alto volume e baixa latência


O que são pods e frações de TPU?

Um Pod de TPU é um grande cluster físico de chips de TPU conectados por uma rede especializada de alta velocidade (como a Optical Circuit Switching ou a rede Virgo do Google). Um único superpod pode conter milhares de chips interconectados. Uma fração é um subconjunto menor e dedicado de um pod que você pode alugar. Essa arquitetura de rede permite que os desenvolvedores escalonem as cargas de trabalho de IA em grandes quantidades de computação com pouca ou nenhuma mudança de código, operando efetivamente toda a fração como uma única máquina unificada. 


O que é o "Goodput" de ML no contexto do treinamento de TPU?

Goodput é o tempo real e produtivo que sua infraestrutura gasta treinando ativamente o modelo, em vez de ficar inativa. O treinamento de modelos de fundação massivos envolve uma orquestração complexa em milhares de chips, o que significa que os ciclos de computação podem ser facilmente desperdiçados em atrasos na transferência de dados, redefinições de hardware ou checkpoints. As Cloud TPUs foram projetadas para maximizar o Goodput com interconexões de alta largura de banda e armazenamento em cache de memória otimizado, garantindo que os ciclos de computação pagos contribuam diretamente para o avanço do modelo.

Como a orquestração é feita em escala para TPUs?

Os usuários podem oferecer confiabilidade, monitoramento abrangente e gerenciamento usando o Google Kubernetes Engine (GKE) e o Cluster Director. Ao usar o GKE para TPU, os clientes operam em um ecossistema nativo da nuvem com o Inference Gateway para balanceamento de carga e a capacidade de escalonar implantações para até 130.000 nós do GKE.

Google Cloud