Tensor Processing Unit

Latih, sesuaikan, dan deploy AI canggih di akselerator yang dibuat khusus

Tensor Processing Unit

Latih, sesuaikan, dan deploy AI canggih di akselerator yang dibuat khusus

Dirancang untuk AI generasi berikutnya
AI Hypercomputer
Lebih dari satu dekade inovasi TPU

Dirancang untuk AI generasi berikutnya

Dirancang untuk AI generasi berikutnya

Tensor Processing Unit (TPU) adalah akselerator kustom yang dirancang bersama software terbuka untuk mendukung seluruh siklus proses AI—mulai dari pelatihan terdepan dan inferensi skala besar hingga permintaan data penalaran multi-langkah dari AI Agentic.

AI Hypercomputer

TPU didukung oleh AI Hypercomputer Google Cloud, sebuah arsitektur inovatif yang menyatukan hardware yang dibuat khusus, software terbuka, dan model konsumsi yang fleksibel.

Lebih dari satu dekade inovasi TPU

TPU dirancang khusus untuk workload AI tingkat lanjut—mulai dari model bahasa besar dan pembuatan kode hingga agen cerdas. TPU adalah mesin di balik Gemini dan produk unggulan Google yang digunakan oleh miliaran pengguna, termasuk Penelusuran, Foto, dan Maps.

Dirancang untuk AI generasi berikutnya

Dirancang untuk AI generasi berikutnya

Tensor Processing Unit (TPU) adalah akselerator kustom yang dirancang bersama software terbuka untuk mendukung seluruh siklus proses AI—mulai dari pelatihan terdepan dan inferensi skala besar hingga permintaan data penalaran multi-langkah dari AI Agentic.

AI Hypercomputer

TPU didukung oleh AI Hypercomputer Google Cloud, sebuah arsitektur inovatif yang menyatukan hardware yang dibuat khusus, software terbuka, dan model konsumsi yang fleksibel.

Lebih dari satu dekade inovasi TPU

TPU dirancang khusus untuk workload AI tingkat lanjut—mulai dari model bahasa besar dan pembuatan kode hingga agen cerdas. TPU adalah mesin di balik Gemini dan produk unggulan Google yang digunakan oleh miliaran pengguna, termasuk Penelusuran, Foto, dan Maps.

Manfaat

Operasi yang terbuka, fleksibel, dan andal

TPU bersifat terbuka, fleksibel, dan andal

Dibangun di ekosistem terbuka menggunakan library dan alat yang familier. TPU memberikan dukungan native dan berperforma tinggi untuk PyTorch dan JAX, serta mendukung mesin vLLM untuk inferensi cepat. Kelola dan skalakan deployment ini secara andal di seluruh cluster global dengan Google Kubernetes Engine (GKE).

1 juta+ TPU dalam satu cluster pelatihan logis

Ubah pelatihan berbulan-bulan menjadi hitungan minggu untuk model termutakhir. Dengan hingga 1 juta TPU chip dalam satu cluster, TPU memaksimalkan goodput, sehingga hampir setiap siklus komputasi digunakan untuk pembelajaran aktif.

TPU bersifat terbuka, fleksibel, dan andal
1 juta+ TPU dalam satu cluster pelatihan logis

Manfaat

Operasi yang terbuka, fleksibel, dan andal

TPU bersifat terbuka, fleksibel, dan andal

Dibangun di ekosistem terbuka menggunakan library dan alat yang familier. TPU memberikan dukungan native dan berperforma tinggi untuk PyTorch dan JAX, serta mendukung mesin vLLM untuk inferensi cepat. Kelola dan skalakan deployment ini secara andal di seluruh cluster global dengan Google Kubernetes Engine (GKE).

1 juta+ TPU dalam satu cluster pelatihan logis

Ubah pelatihan berbulan-bulan menjadi hitungan minggu untuk model termutakhir. Dengan hingga 1 juta TPU chip dalam satu cluster, TPU memaksimalkan goodput, sehingga hampir setiap siklus komputasi digunakan untuk pembelajaran aktif.

TPU 8t - Dioptimalkan untuk pelatihan
TPU 8i - Dioptimalkan untuk inferensi dan reinforcement learning
TPU Ironwood
TPU Trillium
Versi TPU

TPU 8t

TPU 8t - Dioptimalkan untuk pelatihan

TPU 8t dibuat untuk pelatihan awal berskala besar dan workload yang banyak menggunakan embedding dalam skala 9.600 chip dalam satu superpod, serta memberikan komputasi kepadatan tinggi yang diperlukan untuk model terdepan dengan performa komputasi per pod hampir 3 kali lipat dibandingkan generasi sebelumnya.

Segera hadir.

TPU 8i - Dioptimalkan untuk inferensi dan reinforcement learning

TPU 8i dioptimalkan untuk inferensi dan pasca-pelatihan. TPU 8i memberikan peningkatan performa per dolar sebesar 80% dibandingkan generasi sebelumnya untuk inferensi latensi rendah untuk model MoE besar.

Segera hadir.

TPU Ironwood

TPU generasi ke-7 yang hemat energi dan direkayasa untuk pelatihan, penalaran, dan inferensi berskala besar. Menampilkan 9.216 chip berpendingin cairan per pod, menyediakan 42,5 ExaFlop dan performa 4 kali lebih baik per chip dibandingkan Trillium.

Tersedia secara umum.

Dokumentasi | Harga

TPU Trillium

TPU generasi keenam yang menampilkan peningkatan efisiensi energi dan performa komputasi puncak untuk pelatihan dan inferensi. Beroperasi dengan efisiensi energi 67% lebih tinggi dan memberikan performa komputasi puncak 4,7 kali lebih tinggi per chip dibandingkan dengan TPU v5e generasi sebelumnya.

Tersedia secara umum.

Dokumentasi | Harga

Versi TPU

TPU 8t

TPU 8t - Dioptimalkan untuk pelatihan

TPU 8t dibuat untuk pelatihan awal berskala besar dan workload yang banyak menggunakan embedding dalam skala 9.600 chip dalam satu superpod, serta memberikan komputasi kepadatan tinggi yang diperlukan untuk model terdepan dengan performa komputasi per pod hampir 3 kali lipat dibandingkan generasi sebelumnya.

Segera hadir.

TPU 8i - Dioptimalkan untuk inferensi dan reinforcement learning

TPU 8i dioptimalkan untuk inferensi dan pasca-pelatihan. TPU 8i memberikan peningkatan performa per dolar sebesar 80% dibandingkan generasi sebelumnya untuk inferensi latensi rendah untuk model MoE besar.

Segera hadir.

TPU Ironwood

TPU generasi ke-7 yang hemat energi dan direkayasa untuk pelatihan, penalaran, dan inferensi berskala besar. Menampilkan 9.216 chip berpendingin cairan per pod, menyediakan 42,5 ExaFlop dan performa 4 kali lebih baik per chip dibandingkan Trillium.

Tersedia secara umum.

Dokumentasi | Harga

TPU Trillium

TPU generasi keenam yang menampilkan peningkatan efisiensi energi dan performa komputasi puncak untuk pelatihan dan inferensi. Beroperasi dengan efisiensi energi 67% lebih tinggi dan memberikan performa komputasi puncak 4,7 kali lebih tinggi per chip dibandingkan dengan TPU v5e generasi sebelumnya.

Tersedia secara umum.

Dokumentasi | Harga

Jax
TorchTPU
OpenXLA
Maxtext
Tunix
Inferensi TPU vLLM

Stack software TPU

Stack software TPU dirancang untuk menjembatani kesenjangan antara kode machine learning tingkat tinggi dan silikon kustom untuk mengoptimalkan efisiensi hardware mentah.

JAX

Jax

Mengompilasi operasi matematika yang kompleks dengan kecepatan hardware yang hampir native di TPU. Library open source untuk komputasi numerik dan diferensiasi otomatis ini dapat diskalakan dengan mudah di seluruh cluster TPU terdistribusi yang sangat besar menggunakan mesh perangkat eksplisit.

Lihat repositori GitHub

TorchTPU

Jalankan workload PyTorch langsung di TPU menggunakan sintaksis standar. Dibangun dengan Meta, stack native yang "eager-first" ini memungkinkan migrasi codebase yang ada dengan perubahan minimal untuk mendapatkan manfaat performa biaya yang besar—tanpa mengharuskan tim engineering mempelajari framework baru.

Baca artikelnya

OpenXLA

Mengurangi bottleneck kompilasi untuk mendapatkan performa tinggi dari hardware TPU. Compiler machine learning open source ini secara otomatis menggabungkan operasi, mengoptimalkan penggunaan memori, dan menghilangkan overhead framework untuk komputasi aljabar linier di seluruh backend TPU.

Lihat repositori GitHub

Maxtext

Mempercepat linimasa pelatihan untuk model dasar yang besar. Implementasi referensi berbasis JAX ini menyediakan blueprint siap pakai yang sangat skalabel untuk mencapai pemanfaatan hardware puncak selama pra-pelatihan LLM di TPU.

Lihat repositori GitHub

Tunix

Menyederhanakan pasca-pelatihan dan penyelarasan LLM pada infrastruktur TPU. Library JAX open source yang ringan ini menghadirkan alur kerja yang skalabel untuk Supervised Fine-Tuning (SFT) dan Reinforcement Learning (RL) guna mengubah model mentah menjadi agen siap produksi secara efisien.

Lihat repositori GitHub

Inferensi TPU vLLM

Maksimalkan konkurensi penyajian dan turunkan biaya operasional untuk inferensi TPU real-time. Mesin open source ber-throughput tinggi ini memanfaatkan teknik pengelolaan memori seperti PagedAttention untuk menghilangkan pemborosan dan memberikan inferensi LLM yang sangat efisien pada arsitektur TPU.

Lihat repositori GitHub

Stack software TPU

Stack software TPU dirancang untuk menjembatani kesenjangan antara kode machine learning tingkat tinggi dan silikon kustom untuk mengoptimalkan efisiensi hardware mentah.

JAX

Jax

Mengompilasi operasi matematika yang kompleks dengan kecepatan hardware yang hampir native di TPU. Library open source untuk komputasi numerik dan diferensiasi otomatis ini dapat diskalakan dengan mudah di seluruh cluster TPU terdistribusi yang sangat besar menggunakan mesh perangkat eksplisit.

Lihat repositori GitHub

TorchTPU

Jalankan workload PyTorch langsung di TPU menggunakan sintaksis standar. Dibangun dengan Meta, stack native yang "eager-first" ini memungkinkan migrasi codebase yang ada dengan perubahan minimal untuk mendapatkan manfaat performa biaya yang besar—tanpa mengharuskan tim engineering mempelajari framework baru.

Baca artikelnya

OpenXLA

Mengurangi bottleneck kompilasi untuk mendapatkan performa tinggi dari hardware TPU. Compiler machine learning open source ini secara otomatis menggabungkan operasi, mengoptimalkan penggunaan memori, dan menghilangkan overhead framework untuk komputasi aljabar linier di seluruh backend TPU.

Lihat repositori GitHub

Maxtext

Mempercepat linimasa pelatihan untuk model dasar yang besar. Implementasi referensi berbasis JAX ini menyediakan blueprint siap pakai yang sangat skalabel untuk mencapai pemanfaatan hardware puncak selama pra-pelatihan LLM di TPU.

Lihat repositori GitHub

Tunix

Menyederhanakan pasca-pelatihan dan penyelarasan LLM pada infrastruktur TPU. Library JAX open source yang ringan ini menghadirkan alur kerja yang skalabel untuk Supervised Fine-Tuning (SFT) dan Reinforcement Learning (RL) guna mengubah model mentah menjadi agen siap produksi secara efisien.

Lihat repositori GitHub

Inferensi TPU vLLM

Maksimalkan konkurensi penyajian dan turunkan biaya operasional untuk inferensi TPU real-time. Mesin open source ber-throughput tinggi ini memanfaatkan teknik pengelolaan memori seperti PagedAttention untuk menghilangkan pemborosan dan memberikan inferensi LLM yang sangat efisien pada arsitektur TPU.

Lihat repositori GitHub

TPU mendukung para inovator

Citadel Securities menjalankan workload hingga 4x lebih cepat dengan Ironwood
Di pasar keuangan, setiap nanodetik sangat penting. Citadel Securities berpartner dengan Google Cloud untuk membangun lingkungan riset kuantitatif berbasis cloud yang skalabel dan mampu menjalankan workload 2 hingga 4 kali lebih cepat dengan biaya 30% lebih rendah. Dengan infrastruktur yang dibangun di atas TPU Ironwood, workload yang biasanya memerlukan waktu berminggu-minggu atau berhari-hari kini dapat diselesaikan dalam hitungan jam atau bahkan menit, sehingga membantu pelanggan di seluruh dunia mencapai tujuan investasi mereka.
hingga 4x lebih cepat dengan TPU
Nuro menciptakan jalur aman menuju masa depan tanpa pengemudi dengan Google Cloud
Nuro telah mempercepat pengembangan teknologi mengemudi otonomnya secara signifikan dengan memanfaatkan Google Cloud TPU dan Google Kubernetes Engine, melatih model AI dua kali lebih cepat tanpa biaya tambahan. Dengan memproses data mengemudi di dunia nyata dalam skala petabyte dan menjalankan simulasi keselamatan berskala besar, mereka terus meningkatkan Nuro Driver untuk menavigasi kendaraan apa pun dengan aman—mulai dari mobil penumpang hingga semitruk—di jalan umum.
Kendaraan tanpa pengemudi Nuro
Lightricks melatih model diffusion video dalam skala besar dengan JAX di TPU
Lightricks telah mempercepat pelatihan model video generatifnya yang memiliki 13 miliar parameter secara signifikan dengan memigrasikan codebase-nya ke JAX di Google Cloud TPU, sehingga meningkatkan langkah pelatihan harian sebesar 40%. Dengan mengatasi batasan skalabilitas sebelumnya, perubahan strategis ini membuka penskalaan linear di ribuan core TPU dan menggandakan produktivitas developer, sehingga memungkinkan Lightricks menghadirkan alat video AI berperforma tinggi dan sangat terkontrol ke ekonomi kreator dengan lebih cepat.
Pengeditan video Lightricks

Referensi lainnya

Langkah berikutnya

Logo Cloud

Pertanyaan Umum (FAQ)

Apa itu Tensor Processing Unit (TPU)?

TPU adalah sirkuit terintegrasi khusus aplikasi (ASIC) yang dirancang khusus dan dikembangkan oleh Google. TPU dibuat khusus dari awal untuk mempercepat workload machine learning dan kecerdasan buatan. TPU dioptimalkan secara khusus untuk operasi tensor dan perkalian matriks berat yang bertindak sebagai elemen penyusun dasar jaringan neural, yang mendukung segalanya mulai dari model bahasa besar hingga agen penalaran yang kompleks.

Bagaimana cara kerja arsitektur TPU?

Inti dari TPU adalah Matrix Multiplier Unit (MXU) khusus yang memproses operasi matriks dalam jumlah besar secara bersamaan. TPU menggunakan arsitektur "array sistolik" yang membaca data sekali dan mengalirkan data tersebut secara terus-menerus melalui ribuan unit logika aritmetika (ALU), sehingga mengakumulasi hasil tanpa perlu terus-menerus membaca dan menulis ke memori. TPU juga mendukung aritmetika presisi rendah (seperti floating point 16-bit atau 8-bit), sehingga memungkinkan jutaan komputasi per detik tanpa mengorbankan akurasi yang diperlukan untuk model AI.

Framework machine learning mana yang didukung Cloud TPU?

Cloud TPU menawarkan dukungan native dan berperforma tinggi untuk framework machine learning terkemuka, terutama TensorFlow, PyTorch, dan JAX. Kode yang ditulis dalam framework ini dikompilasi oleh compiler Accelerated Linear Algebra (XLA), yang secara otomatis mengoptimalkan graf komputasi agar berjalan efisien pada hardware TPU yang mendasarinya.

Jenis workload apa yang paling cocok untuk TPU?

TPU unggul dalam tugas deep learning yang memerlukan operasi matriks paralel yang masif. TPU sangat direkomendasikan untuk:

  • Model yang didominasi oleh komputasi matriks
  • Menjalankan pelatihan yang memerlukan waktu berminggu-minggu atau berbulan-bulan untuk konvergensi
  • Model dasar besar dan model bahasa besar (LLM)
  • Workload dengan embedding yang sangat besar, seperti mesin rekomendasi canggih
  • Reinforcement learning berkelanjutan dan inferensi volume tinggi dengan latensi rendah


Apa itu pod dan slice TPU?

Pod TPU adalah cluster fisik besar chip TPU yang terhubung bersama melalui jaringan khusus berkecepatan tinggi (seperti Optical Circuit Switching atau jaringan Virgo Google). Satu superpod dapat berisi ribuan chip yang saling terhubung. "Slice" adalah subset pod yang lebih kecil dan khusus yang dapat Anda sewa. Arsitektur jaringan ini memungkinkan developer menskalakan workload AI mereka di sejumlah besar komputasi dengan sedikit atau tanpa perubahan kode, sehingga secara efektif mengoperasikan seluruh slice sebagai satu mesin terpadu. 


Apa yang dimaksud dengan "Goodput" ML dalam konteks pelatihan TPU?

Goodput merujuk pada waktu produktif aktual yang digunakan infrastruktur Anda untuk melatih model secara aktif, bukan waktu idle. Pelatihan model dasar yang besar melibatkan orkestrasi kompleks di ribuan chip, yang berarti siklus komputasi dapat dengan mudah terbuang karena penundaan transfer data, reset hardware, atau pembuatan checkpoint. Cloud TPU dirancang untuk memaksimalkan Goodput melalui interkoneksi bandwidth tinggi dan cache memori yang dioptimalkan, sehingga memastikan bahwa siklus komputasi berbayar berkontribusi langsung pada kemajuan model.

Bagaimana orkestrasi ditangani dalam skala besar untuk TPU?

Pengguna dapat mendukung keandalan, pemantauan komprehensif, serta pengelolaan menggunakan Google Kubernetes Engine (GKE) dan Cluster Director. Dengan memanfaatkan GKE untuk TPU, pelanggan beroperasi dalam ekosistem berbasis cloud yang dilengkapi Inference Gateway untuk load balancing dan kemampuan untuk menskalakan deployment hingga 130.000 node GKE.

Google Cloud