Dirancang untuk AI generasi berikutnya
Didukung oleh AI Hypercomputer
Satu dekade Tensor Processing Unit (TPU)

TPU dirancang khusus untuk workload AI tingkat lanjut—mulai dari model bahasa besar dan pembuatan kode hingga agen cerdas. TPU adalah mesin di balik Gemini dan produk unggulan Google yang digunakan oleh miliaran pengguna, termasuk Penelusuran, Foto, dan Maps.
Dirancang untuk AI generasi berikutnya
Didukung oleh AI Hypercomputer
Satu dekade Tensor Processing Unit (TPU)

TPU dirancang khusus untuk workload AI tingkat lanjut—mulai dari model bahasa besar dan pembuatan kode hingga agen cerdas. TPU adalah mesin di balik Gemini dan produk unggulan Google yang digunakan oleh miliaran pengguna, termasuk Penelusuran, Foto, dan Maps.
Operasi yang terbuka, fleksibel, dan andal

Dibangun di ekosistem terbuka menggunakan library dan alat yang familier. TPU memberikan dukungan native dan berperforma tinggi untuk PyTorch dan JAX, serta mendukung mesin vLLM untuk inferensi cepat. Kelola dan skalakan deployment ini secara andal di seluruh cluster global dengan Google Kubernetes Engine (GKE).
Performa tanpa kompromi

Ubah pelatihan berbulan-bulan menjadi hitungan minggu untuk model termutakhir. Dengan hingga 1 juta TPU chip dalam satu cluster, TPU memaksimalkan goodput, sehingga hampir setiap siklus komputasi digunakan untuk pembelajaran aktif.


Operasi yang terbuka, fleksibel, dan andal

Dibangun di ekosistem terbuka menggunakan library dan alat yang familier. TPU memberikan dukungan native dan berperforma tinggi untuk PyTorch dan JAX, serta mendukung mesin vLLM untuk inferensi cepat. Kelola dan skalakan deployment ini secara andal di seluruh cluster global dengan Google Kubernetes Engine (GKE).
Performa tanpa kompromi

Ubah pelatihan berbulan-bulan menjadi hitungan minggu untuk model termutakhir. Dengan hingga 1 juta TPU chip dalam satu cluster, TPU memaksimalkan goodput, sehingga hampir setiap siklus komputasi digunakan untuk pembelajaran aktif.
TPU 8t

TPU 8t dibuat untuk pelatihan awal berskala besar dan workload yang banyak menggunakan embedding dalam skala 9.600 chip dalam satu superpod, serta memberikan komputasi kepadatan tinggi yang diperlukan untuk model terdepan dengan performa komputasi per pod hampir 3 kali lipat dibandingkan generasi sebelumnya.
Segera hadir.
TPU 8i

TPU 8i dioptimalkan untuk inferensi dan pasca-pelatihan. TPU 8i memberikan peningkatan performa per dolar sebesar 80% dibandingkan generasi sebelumnya untuk inferensi latensi rendah untuk model MoE besar.
Segera hadir.
Ironwood - Generasi ke-7
TPU generasi ke-7 yang hemat energi dan direkayasa untuk pelatihan, penalaran, dan inferensi berskala besar. Menampilkan 9.216 chip berpendingin cairan per pod, menyediakan 42,5 ExaFlop dan performa 4 kali lebih baik per chip dibandingkan Trillium.
Tersedia secara umum.
Trillium - generasi ke-6
TPU generasi keenam yang menampilkan peningkatan efisiensi energi dan performa komputasi puncak untuk pelatihan dan inferensi. Beroperasi dengan efisiensi energi 67% lebih tinggi dan memberikan performa komputasi puncak 4,7 kali lebih tinggi per chip dibandingkan dengan TPU v5e generasi sebelumnya.
Tersedia secara umum.
TPU 8t

TPU 8t dibuat untuk pelatihan awal berskala besar dan workload yang banyak menggunakan embedding dalam skala 9.600 chip dalam satu superpod, serta memberikan komputasi kepadatan tinggi yang diperlukan untuk model terdepan dengan performa komputasi per pod hampir 3 kali lipat dibandingkan generasi sebelumnya.
Segera hadir.
TPU 8i

TPU 8i dioptimalkan untuk inferensi dan pasca-pelatihan. TPU 8i memberikan peningkatan performa per dolar sebesar 80% dibandingkan generasi sebelumnya untuk inferensi latensi rendah untuk model MoE besar.
Segera hadir.
Ironwood - Generasi ke-7
TPU generasi ke-7 yang hemat energi dan direkayasa untuk pelatihan, penalaran, dan inferensi berskala besar. Menampilkan 9.216 chip berpendingin cairan per pod, menyediakan 42,5 ExaFlop dan performa 4 kali lebih baik per chip dibandingkan Trillium.
Tersedia secara umum.
Trillium - generasi ke-6
TPU generasi keenam yang menampilkan peningkatan efisiensi energi dan performa komputasi puncak untuk pelatihan dan inferensi. Beroperasi dengan efisiensi energi 67% lebih tinggi dan memberikan performa komputasi puncak 4,7 kali lebih tinggi per chip dibandingkan dengan TPU v5e generasi sebelumnya.
Tersedia secara umum.
Stack software TPU dirancang untuk menjembatani kesenjangan antara kode machine learning tingkat tinggi dan silikon kustom untuk mengoptimalkan efisiensi hardware mentah.
JAX
Mengompilasi operasi matematika yang kompleks dengan kecepatan hardware yang hampir native di TPU. Library open source untuk komputasi numerik dan diferensiasi otomatis ini dapat diskalakan dengan mudah di seluruh cluster TPU terdistribusi yang sangat besar menggunakan mesh perangkat eksplisit.
TorchTPU & PyTorch
Jalankan workload PyTorch langsung di TPU menggunakan sintaksis standar. Dibangun dengan Meta, stack native yang "eager-first" ini memungkinkan migrasi codebase yang ada dengan perubahan minimal untuk mendapatkan manfaat performa biaya yang besar—tanpa mengharuskan tim engineering mempelajari framework baru.
OpenXLA
Mengurangi bottleneck kompilasi untuk mendapatkan performa tinggi dari hardware TPU. Compiler machine learning open source ini secara otomatis menggabungkan operasi, mengoptimalkan penggunaan memori, dan menghilangkan overhead framework untuk komputasi aljabar linier di seluruh backend TPU.
MaxText
Mempercepat linimasa pelatihan untuk model dasar yang besar. Implementasi referensi berbasis JAX ini menyediakan blueprint siap pakai yang sangat skalabel untuk mencapai pemanfaatan hardware puncak selama pra-pelatihan LLM di TPU.
Tunix
Menyederhanakan pasca-pelatihan dan penyelarasan LLM pada infrastruktur TPU. Library JAX open source yang ringan ini menghadirkan alur kerja yang skalabel untuk Supervised Fine-Tuning (SFT) dan Reinforcement Learning (RL) guna mengubah model mentah menjadi agen siap produksi secara efisien.
vLLM
Maksimalkan konkurensi penyajian dan turunkan biaya operasional untuk inferensi TPU real-time. Mesin open source ber-throughput tinggi ini memanfaatkan teknik pengelolaan memori seperti PagedAttention untuk menghilangkan pemborosan dan memberikan inferensi LLM yang sangat efisien pada arsitektur TPU.
Stack software TPU dirancang untuk menjembatani kesenjangan antara kode machine learning tingkat tinggi dan silikon kustom untuk mengoptimalkan efisiensi hardware mentah.
JAX
Mengompilasi operasi matematika yang kompleks dengan kecepatan hardware yang hampir native di TPU. Library open source untuk komputasi numerik dan diferensiasi otomatis ini dapat diskalakan dengan mudah di seluruh cluster TPU terdistribusi yang sangat besar menggunakan mesh perangkat eksplisit.
TorchTPU & PyTorch
Jalankan workload PyTorch langsung di TPU menggunakan sintaksis standar. Dibangun dengan Meta, stack native yang "eager-first" ini memungkinkan migrasi codebase yang ada dengan perubahan minimal untuk mendapatkan manfaat performa biaya yang besar—tanpa mengharuskan tim engineering mempelajari framework baru.
OpenXLA
Mengurangi bottleneck kompilasi untuk mendapatkan performa tinggi dari hardware TPU. Compiler machine learning open source ini secara otomatis menggabungkan operasi, mengoptimalkan penggunaan memori, dan menghilangkan overhead framework untuk komputasi aljabar linier di seluruh backend TPU.
MaxText
Mempercepat linimasa pelatihan untuk model dasar yang besar. Implementasi referensi berbasis JAX ini menyediakan blueprint siap pakai yang sangat skalabel untuk mencapai pemanfaatan hardware puncak selama pra-pelatihan LLM di TPU.
Tunix
Menyederhanakan pasca-pelatihan dan penyelarasan LLM pada infrastruktur TPU. Library JAX open source yang ringan ini menghadirkan alur kerja yang skalabel untuk Supervised Fine-Tuning (SFT) dan Reinforcement Learning (RL) guna mengubah model mentah menjadi agen siap produksi secara efisien.
vLLM
Maksimalkan konkurensi penyajian dan turunkan biaya operasional untuk inferensi TPU real-time. Mesin open source ber-throughput tinggi ini memanfaatkan teknik pengelolaan memori seperti PagedAttention untuk menghilangkan pemborosan dan memberikan inferensi LLM yang sangat efisien pada arsitektur TPU.
TPU mendukung para inovator






TPU adalah sirkuit terintegrasi khusus aplikasi (ASIC) yang dirancang khusus dan dikembangkan oleh Google. TPU dibuat khusus dari awal untuk mempercepat workload machine learning dan kecerdasan buatan. TPU dioptimalkan secara khusus untuk operasi tensor dan perkalian matriks berat yang bertindak sebagai elemen penyusun dasar jaringan neural, yang mendukung segalanya mulai dari model bahasa besar hingga agen penalaran yang kompleks.
Inti dari TPU adalah Matrix Multiplier Unit (MXU) khusus yang memproses operasi matriks dalam jumlah besar secara bersamaan. TPU menggunakan arsitektur "array sistolik" yang membaca data sekali dan mengalirkan data tersebut secara terus-menerus melalui ribuan unit logika aritmetika (ALU), sehingga mengakumulasi hasil tanpa perlu terus-menerus membaca dan menulis ke memori. TPU juga mendukung aritmetika presisi rendah (seperti floating point 16-bit atau 8-bit), sehingga memungkinkan jutaan komputasi per detik tanpa mengorbankan akurasi yang diperlukan untuk model AI.
Cloud TPU menawarkan dukungan native dan berperforma tinggi untuk framework machine learning terkemuka, terutama TensorFlow, PyTorch, dan JAX. Kode yang ditulis dalam framework ini dikompilasi oleh compiler Accelerated Linear Algebra (XLA), yang secara otomatis mengoptimalkan graf komputasi agar berjalan efisien pada hardware TPU yang mendasarinya.
TPU unggul dalam tugas deep learning yang memerlukan operasi matriks paralel yang masif. TPU sangat direkomendasikan untuk:
Pod TPU adalah cluster fisik besar chip TPU yang terhubung bersama melalui jaringan khusus berkecepatan tinggi (seperti Optical Circuit Switching atau jaringan Virgo Google). Satu superpod dapat berisi ribuan chip yang saling terhubung. "Slice" adalah subset pod yang lebih kecil dan khusus yang dapat Anda sewa. Arsitektur jaringan ini memungkinkan developer menskalakan workload AI mereka di sejumlah besar komputasi dengan sedikit atau tanpa perubahan kode, sehingga secara efektif mengoperasikan seluruh slice sebagai satu mesin terpadu.
Goodput merujuk pada waktu produktif aktual yang digunakan infrastruktur Anda untuk melatih model secara aktif, bukan waktu idle. Pelatihan model dasar yang besar melibatkan orkestrasi kompleks di ribuan chip, yang berarti siklus komputasi dapat dengan mudah terbuang karena penundaan transfer data, reset hardware, atau pembuatan checkpoint. Cloud TPU dirancang untuk memaksimalkan Goodput melalui interkoneksi bandwidth tinggi dan cache memori yang dioptimalkan, sehingga memastikan bahwa siklus komputasi berbayar berkontribusi langsung pada kemajuan model.
Pengguna dapat mendukung keandalan, pemantauan komprehensif, serta pengelolaan menggunakan Google Kubernetes Engine (GKE) dan Cluster Director. Dengan memanfaatkan GKE untuk TPU, pelanggan beroperasi dalam ekosistem berbasis cloud yang dilengkapi Inference Gateway untuk load balancing dan kemampuan untuk menskalakan deployment hingga 130.000 node GKE.