Desenvolvido para IA de última geração
Com a tecnologia do Hipercomputador de IA
Uma década de unidades de processamento de tensor (TPUs)

As TPUs são criadas especificamente para cargas de trabalho de IA avançadas, desde modelos de linguagem grandes e geração de código até agentes inteligentes. Elas são o motor por trás do Gemini e dos principais produtos do Google, usados por bilhões de pessoas, como a Pesquisa, o Fotos e o Maps.
Desenvolvido para IA de última geração
Com a tecnologia do Hipercomputador de IA
Uma década de unidades de processamento de tensor (TPUs)

As TPUs são criadas especificamente para cargas de trabalho de IA avançadas, desde modelos de linguagem grandes e geração de código até agentes inteligentes. Elas são o motor por trás do Gemini e dos principais produtos do Google, usados por bilhões de pessoas, como a Pesquisa, o Fotos e o Maps.
Operações abertas, flexíveis e confiáveis

Crie em um ecossistema aberto usando bibliotecas e ferramentas conhecidas. As TPUs oferecem suporte nativo e de alto desempenho para PyTorch e JAX, além de oferecer suporte ao mecanismo vLLM para inferência rápida. Gerencie e escale essas implantações de forma confiável em clusters globais com o Google Kubernetes Engine (GKE).
Desempenho sem concessões

Transforme meses de treinamento em semanas para modelos de fronteira. Com até 1 milhão de chips de TPU em um único cluster, as TPUs maximizam o goodput, garantindo que quase todos os ciclos de computação sejam gastos no aprendizado ativo.


Operações abertas, flexíveis e confiáveis

Crie em um ecossistema aberto usando bibliotecas e ferramentas conhecidas. As TPUs oferecem suporte nativo e de alto desempenho para PyTorch e JAX, além de oferecer suporte ao mecanismo vLLM para inferência rápida. Gerencie e escale essas implantações de forma confiável em clusters globais com o Google Kubernetes Engine (GKE).
Desempenho sem concessões

Transforme meses de treinamento em semanas para modelos de fronteira. Com até 1 milhão de chips de TPU em um único cluster, as TPUs maximizam o goodput, garantindo que quase todos os ciclos de computação sejam gastos no aprendizado ativo.
TPU 8t

A TPU 8t foi criada para pré-treinamento em grande escala e cargas de trabalho com muitos embeddings em uma escala de 9.600 chips em um único superpod, oferecendo a computação de alta densidade necessária para modelos de ponta com quase 3 vezes o desempenho de computação por pod em relação à geração anterior.
Em breve.
TPU 8i

A TPU 8i é otimizada para pós-treinamento e inferência. Ela oferece uma melhoria de 80% no desempenho por dólar em relação às gerações anteriores para inferência de baixa latência para grandes modelos MoE.
Em breve.
Ironwood – 7ª geração
TPU de 7ª geração com eficiência energética projetada para treinamento, raciocínio e inferência em grande escala. Possui 9.216 chips resfriados a líquido por pod, oferece 42,5 ExaFlops e desempenho 4 vezes melhor por chip em comparação com o Trillium.
Disponibilidade geral.
Trillium – 6ª geração
TPU de sexta geração com melhor eficiência energética e desempenho máximo de computação para treinamento e inferência. Opera com 67% mais eficiência energética e oferece um desempenho de computação de pico 4,7 vezes maior por chip em comparação com a TPU v5e da geração anterior.
Disponibilidade geral.
TPU 8t

A TPU 8t foi criada para pré-treinamento em grande escala e cargas de trabalho com muitos embeddings em uma escala de 9.600 chips em um único superpod, oferecendo a computação de alta densidade necessária para modelos de ponta com quase 3 vezes o desempenho de computação por pod em relação à geração anterior.
Em breve.
TPU 8i

A TPU 8i é otimizada para pós-treinamento e inferência. Ela oferece uma melhoria de 80% no desempenho por dólar em relação às gerações anteriores para inferência de baixa latência para grandes modelos MoE.
Em breve.
Ironwood – 7ª geração
TPU de 7ª geração com eficiência energética projetada para treinamento, raciocínio e inferência em grande escala. Possui 9.216 chips resfriados a líquido por pod, oferece 42,5 ExaFlops e desempenho 4 vezes melhor por chip em comparação com o Trillium.
Disponibilidade geral.
Trillium – 6ª geração
TPU de sexta geração com melhor eficiência energética e desempenho máximo de computação para treinamento e inferência. Opera com 67% mais eficiência energética e oferece um desempenho de computação de pico 4,7 vezes maior por chip em comparação com a TPU v5e da geração anterior.
Disponibilidade geral.
A pilha de software da TPU foi projetada para preencher a lacuna entre o código de machine learning de alto nível e o silício personalizado para otimizar a eficiência do hardware bruto.
JAX
Compile operações matemáticas complexas com velocidade de hardware quase nativa nas TPUs. Essa biblioteca de código aberto para computação numérica e diferenciação automática é escalonada sem esforço em clusters de TPU distribuídos usando uma malha de dispositivos explícita.
TorchTPU e PyTorch
Execute cargas de trabalho do PyTorch diretamente em TPUs usando a sintaxe padrão. Criada com o Meta, essa pilha nativa e "eager-first" permite a migração de bases de código atuais com mudanças mínimas para aproveitar grandes benefícios de custo-performance, sem exigir que as equipes de engenharia aprendam uma nova estrutura.
OpenXLA
Reduzir gargalos de compilação para extrair alto desempenho do hardware da TPU. Esse compilador de machine learning de código aberto mescla operações automaticamente, otimiza o uso da memória e elimina a sobrecarga da estrutura para cálculos de álgebra linear em back-ends de TPU.
MaxText
Reduza os cronogramas de treinamento para modelos de fundação massivos. Essa implementação de referência baseada em JAX oferece um modelo altamente escalonável e pronto para uso para alcançar o pico de utilização de hardware durante o pré-treinamento de LLMs em TPUs.
Tunix
Simplifique o pós-treinamento e o alinhamento de LLMs na infraestrutura de TPU. Essa biblioteca JAX leve e de código aberto oferece fluxos de trabalho escalonáveis para ajuste supervisionado (SFT, na sigla em inglês) e aprendizado por reforço (RL, na sigla em inglês) para transformar modelos brutos em agentes prontos para produção com eficiência.
vLLM
Maximize a simultaneidade de veiculação e reduza os custos operacionais para a inferência de TPU em tempo real. Esse mecanismo de código aberto de alta capacidade de processamento usa técnicas de gerenciamento de memória, como PagedAttention, para eliminar o desperdício e oferecer uma disponibilização de LLM altamente eficiente na arquitetura de TPU.
A pilha de software da TPU foi projetada para preencher a lacuna entre o código de machine learning de alto nível e o silício personalizado para otimizar a eficiência do hardware bruto.
JAX
Compile operações matemáticas complexas com velocidade de hardware quase nativa nas TPUs. Essa biblioteca de código aberto para computação numérica e diferenciação automática é escalonada sem esforço em clusters de TPU distribuídos usando uma malha de dispositivos explícita.
TorchTPU e PyTorch
Execute cargas de trabalho do PyTorch diretamente em TPUs usando a sintaxe padrão. Criada com o Meta, essa pilha nativa e "eager-first" permite a migração de bases de código atuais com mudanças mínimas para aproveitar grandes benefícios de custo-performance, sem exigir que as equipes de engenharia aprendam uma nova estrutura.
OpenXLA
Reduzir gargalos de compilação para extrair alto desempenho do hardware da TPU. Esse compilador de machine learning de código aberto mescla operações automaticamente, otimiza o uso da memória e elimina a sobrecarga da estrutura para cálculos de álgebra linear em back-ends de TPU.
MaxText
Reduza os cronogramas de treinamento para modelos de fundação massivos. Essa implementação de referência baseada em JAX oferece um modelo altamente escalonável e pronto para uso para alcançar o pico de utilização de hardware durante o pré-treinamento de LLMs em TPUs.
Tunix
Simplifique o pós-treinamento e o alinhamento de LLMs na infraestrutura de TPU. Essa biblioteca JAX leve e de código aberto oferece fluxos de trabalho escalonáveis para ajuste supervisionado (SFT, na sigla em inglês) e aprendizado por reforço (RL, na sigla em inglês) para transformar modelos brutos em agentes prontos para produção com eficiência.
vLLM
Maximize a simultaneidade de veiculação e reduza os custos operacionais para a inferência de TPU em tempo real. Esse mecanismo de código aberto de alta capacidade de processamento usa técnicas de gerenciamento de memória, como PagedAttention, para eliminar o desperdício e oferecer uma disponibilização de LLM altamente eficiente na arquitetura de TPU.
As TPUs estão impulsionando os inovadores






As TPUs são circuitos integrados de aplicação específica (ASICs, na sigla em inglês) personalizados e desenvolvidos pelo Google. Elas foram criadas do zero para acelerar cargas de trabalho de machine learning e inteligência artificial. As TPUs são otimizadas especificamente para as operações pesadas de multiplicação de matrizes e tensores que atuam como os blocos de construção fundamentais das redes neurais, alimentando tudo, desde modelos de linguagem grandes até agentes de raciocínio complexos.
No coração de uma TPU está uma Unidade Multiplicadora de Matriz (MXU, na sigla em inglês) especializada que processa grandes quantidades de operações de matriz simultaneamente. As TPUs utilizam uma arquitetura de "matriz sistólica" que lê os dados uma vez e os transmite continuamente por milhares de unidades lógicas aritméticas (ALUs, na sigla em inglês), acumulando resultados sem precisar ler e gravar constantemente na memória. Elas também oferecem suporte a aritmética de precisão reduzida (como pontos flutuantes de 16 ou 8 bits), permitindo milhões de computações por segundo sem sacrificar a acurácia necessária para modelos de IA.
As Cloud TPUs oferecem suporte nativo e de alto desempenho para os principais frameworks de machine learning, principalmente TensorFlow, PyTorch e JAX. O código escrito nesses frameworks é compilado pelo compilador de álgebra linear acelerada (XLA, na sigla em inglês), que otimiza automaticamente o gráfico computacional para ser executado com eficiência no hardware de TPU.
As TPUs são excelentes em tarefas de aprendizado profundo que exigem operações de matriz paralelas em massa. Elas são altamente recomendados para:
Um Pod de TPU é um grande cluster físico de chips de TPU conectados por uma rede especializada de alta velocidade (como a Optical Circuit Switching ou a rede Virgo do Google). Um único superpod pode conter milhares de chips interconectados. Uma fração é um subconjunto menor e dedicado de um pod que você pode alugar. Essa arquitetura de rede permite que os desenvolvedores escalonem as cargas de trabalho de IA em grandes quantidades de computação com pouca ou nenhuma mudança de código, operando efetivamente toda a fração como uma única máquina unificada.
Goodput é o tempo real e produtivo que sua infraestrutura gasta treinando ativamente o modelo, em vez de ficar inativa. O treinamento de modelos de fundação massivos envolve uma orquestração complexa em milhares de chips, o que significa que os ciclos de computação podem ser facilmente desperdiçados em atrasos na transferência de dados, redefinições de hardware ou checkpoints. As Cloud TPUs foram projetadas para maximizar o Goodput com interconexões de alta largura de banda e armazenamento em cache de memória otimizado, garantindo que os ciclos de computação pagos contribuam diretamente para o avanço do modelo.
Os usuários podem oferecer confiabilidade, monitoramento abrangente e gerenciamento usando o Google Kubernetes Engine (GKE) e o Cluster Director. Ao usar o GKE para TPU, os clientes operam em um ecossistema nativo da nuvem com o Inference Gateway para balanceamento de carga e a capacidade de escalonar implantações para até 130.000 nós do GKE.