차세대 AI를 위해 설계됨
AI 하이퍼컴퓨터 기반
Tensor Processing Unit(TPU)의 10년

TPU는 대규모 언어 모델과 코드 생성부터 지능형 에이전트에 이르기까지 고급 AI 워크로드를 위해 특별히 설계되었습니다. TPU는 Gemini와 Google의 대표적인 10억 명 사용자 제품인 Google 검색, 포토, 지도 등의 엔진입니다.
차세대 AI를 위해 설계됨
AI 하이퍼컴퓨터 기반
Tensor Processing Unit(TPU)의 10년

TPU는 대규모 언어 모델과 코드 생성부터 지능형 에이전트에 이르기까지 고급 AI 워크로드를 위해 특별히 설계되었습니다. TPU는 Gemini와 Google의 대표적인 10억 명 사용자 제품인 Google 검색, 포토, 지도 등의 엔진입니다.
개방적이고 유연하며 신뢰할 수 있는 운영

친숙한 라이브러리와 도구를 사용하여 개방형 생태계를 기반으로 빌드합니다. TPU는 PyTorch 및 JAX를 기본적으로 고성능으로 지원하며 빠른 추론을 위한 vLLM 엔진을 지원합니다. Google Kubernetes Engine(GKE)을 사용하면 전역 클러스터 전반에서 이러한 배포를 안정적으로 관리하고 확장할 수 있습니다.
성능 저하 없는 우수한 성능

프런티어 모델의 학습 기간을 몇 달에서 몇 주로 단축하세요. 단일 클러스터에 최대 100만 개의 TPU 칩을 갖춘 TPU는 굿풋을 극대화하여 거의 모든 컴퓨팅 주기가 능동적 학습에 사용되도록 보장합니다.


개방적이고 유연하며 신뢰할 수 있는 운영

친숙한 라이브러리와 도구를 사용하여 개방형 생태계를 기반으로 빌드합니다. TPU는 PyTorch 및 JAX를 기본적으로 고성능으로 지원하며 빠른 추론을 위한 vLLM 엔진을 지원합니다. Google Kubernetes Engine(GKE)을 사용하면 전역 클러스터 전반에서 이러한 배포를 안정적으로 관리하고 확장할 수 있습니다.
성능 저하 없는 우수한 성능

프런티어 모델의 학습 기간을 몇 달에서 몇 주로 단축하세요. 단일 클러스터에 최대 100만 개의 TPU 칩을 갖춘 TPU는 굿풋을 극대화하여 거의 모든 컴퓨팅 주기가 능동적 학습에 사용되도록 보장합니다.
TPU 8t

TPU 8t는 단일 슈퍼포드에서 9,600개의 칩 규모로 대규모 사전 학습 및 임베딩 집약적 워크로드를 위해 빌드되었으며, 이전 세대 대비 포드당 컴퓨팅 성능이 거의 3배에 달하는 프런티어 모델에 필요한 고밀도 컴퓨팅을 제공합니다.
제공 예정
TPU 8i

TPU 8i는 사후 학습 및 추론에 최적화되어 있으며, 대규모 MoE 모델의 지연 시간이 짧은 추론을 위해 이전 세대 대비 달러당 성능이 80% 향상되었습니다.
제공 예정
Ironwood - 7세대
TPU 8t

TPU 8t는 단일 슈퍼포드에서 9,600개의 칩 규모로 대규모 사전 학습 및 임베딩 집약적 워크로드를 위해 빌드되었으며, 이전 세대 대비 포드당 컴퓨팅 성능이 거의 3배에 달하는 프런티어 모델에 필요한 고밀도 컴퓨팅을 제공합니다.
제공 예정
TPU 8i

TPU 8i는 사후 학습 및 추론에 최적화되어 있으며, 대규모 MoE 모델의 지연 시간이 짧은 추론을 위해 이전 세대 대비 달러당 성능이 80% 향상되었습니다.
제공 예정
Ironwood - 7세대
TPU 소프트웨어 스택은 고수준 머신러닝 코드와 커스텀 실리콘 간의 격차를 해소하여 원시 하드웨어 효율성을 최적화하도록 설계되었습니다.
JAX
TPU에서 거의 네이티브 수준의 하드웨어 속도로 복잡한 수학 연산을 컴파일합니다. 수치 연산 및 자동 미분을 위한 이 오픈소스 라이브러리는 명시적 기기 메시를 사용하여 대규모 분산 TPU 클러스터 전반에서 손쉽게 확장됩니다.
TorchTPU 및 PyTorch
표준 문법을 사용하여 TPU에서 직접 PyTorch 워크로드를 실행합니다. Meta로 빌드된 이 네이티브 '즉시 실행 우선' 스택을 사용하면 기존 코드베이스를 최소한의 변경으로 마이그레이션하여 주요 비용 대비 성능 이점을 누릴 수 있으며, 엔지니어링팀이 새로운 프레임워크를 배울 필요가 없습니다.
OpenXLA
컴파일 병목 현상을 줄여 TPU 하드웨어에서 높은 성능을 끌어냅니다. 이 오픈소스 머신러닝 컴파일러는 TPU 백엔드 전반에서 선형 대수 계산을 위한 연산을 자동으로 융합하고, 메모리 사용량을 최적화하며, 프레임워크 오버헤드를 제거합니다.
MaxText
대규모 파운데이션 모델의 학습 기간을 단축합니다. 이 JAX 기반 참조 구현은 TPU에서 LLM 사전 학습 중에 최대 하드웨어 사용률을 달성하기 위한 확장성이 뛰어난 즉시 사용 가능한 청사진을 제공합니다.
Tunix
TPU 인프라에서 LLM 사후 학습 및 정렬을 간소화합니다. 이 경량 오픈소스 JAX 라이브러리는 지도 미세 조정(SFT) 및 강화 학습(RL)을 위한 확장 가능한 워크플로를 제공하여 원시 모델을 프로덕션에 즉시 사용 가능한 에이전트로 효율적으로 전환합니다.
vLLM
실시간 TPU 추론을 위한 서빙 동시 실행을 극대화하고 운영 비용을 절감하세요. 이 고처리량 오픈소스 엔진은 PagedAttention과 같은 메모리 관리 기법을 활용하여 낭비를 없애고 TPU 아키텍처에서 매우 효율적인 LLM 서빙을 제공합니다.
TPU 소프트웨어 스택은 고수준 머신러닝 코드와 커스텀 실리콘 간의 격차를 해소하여 원시 하드웨어 효율성을 최적화하도록 설계되었습니다.
JAX
TPU에서 거의 네이티브 수준의 하드웨어 속도로 복잡한 수학 연산을 컴파일합니다. 수치 연산 및 자동 미분을 위한 이 오픈소스 라이브러리는 명시적 기기 메시를 사용하여 대규모 분산 TPU 클러스터 전반에서 손쉽게 확장됩니다.
TorchTPU 및 PyTorch
표준 문법을 사용하여 TPU에서 직접 PyTorch 워크로드를 실행합니다. Meta로 빌드된 이 네이티브 '즉시 실행 우선' 스택을 사용하면 기존 코드베이스를 최소한의 변경으로 마이그레이션하여 주요 비용 대비 성능 이점을 누릴 수 있으며, 엔지니어링팀이 새로운 프레임워크를 배울 필요가 없습니다.
OpenXLA
컴파일 병목 현상을 줄여 TPU 하드웨어에서 높은 성능을 끌어냅니다. 이 오픈소스 머신러닝 컴파일러는 TPU 백엔드 전반에서 선형 대수 계산을 위한 연산을 자동으로 융합하고, 메모리 사용량을 최적화하며, 프레임워크 오버헤드를 제거합니다.
MaxText
대규모 파운데이션 모델의 학습 기간을 단축합니다. 이 JAX 기반 참조 구현은 TPU에서 LLM 사전 학습 중에 최대 하드웨어 사용률을 달성하기 위한 확장성이 뛰어난 즉시 사용 가능한 청사진을 제공합니다.
Tunix
TPU 인프라에서 LLM 사후 학습 및 정렬을 간소화합니다. 이 경량 오픈소스 JAX 라이브러리는 지도 미세 조정(SFT) 및 강화 학습(RL)을 위한 확장 가능한 워크플로를 제공하여 원시 모델을 프로덕션에 즉시 사용 가능한 에이전트로 효율적으로 전환합니다.
vLLM
실시간 TPU 추론을 위한 서빙 동시 실행을 극대화하고 운영 비용을 절감하세요. 이 고처리량 오픈소스 엔진은 PagedAttention과 같은 메모리 관리 기법을 활용하여 낭비를 없애고 TPU 아키텍처에서 매우 효율적인 LLM 서빙을 제공합니다.
TPU는 혁신가를 지원합니다






TPU는 Google에서 개발한 커스텀 설계 특정 용도 전용 집적 회로(ASIC)입니다. 머신러닝 및 인공지능 워크로드를 가속화하기 위해 처음부터 특수 제작되었습니다. TPU는 신경망의 기본 구성 요소 역할을 하는 대규모 행렬 곱셈과 텐서 연산에 특별히 최적화되어 있어 대규모 언어 모델부터 복잡한 추론 에이전트에 이르기까지 모든 것을 지원합니다.
TPU의 핵심은 대량의 행렬 연산을 동시에 처리하는 특수 MXU(Matrix Multiplier Unit)입니다. TPU는 데이터를 한 번 읽고 수천 개의 산술 논리 장치(ALU)를 통해 지속적으로 흐르게 하는 '시스톨릭 배열' 아키텍처를 활용하여 메모리에 지속적으로 읽고 쓸 필요 없이 결과를 누적합니다. 또한 16비트 또는 8비트 부동 소수점과 같은 정밀도가 낮은 산술을 지원하여 AI 모델에 필요한 정확성을 희생하지 않고도 초당 수백만 건의 연산을 수행할 수 있습니다.
Cloud TPU는 주요 머신러닝 프레임워크, 특히 TensorFlow, PyTorch, JAX를 기본적으로 고성능으로 지원합니다. 이러한 프레임워크로 작성된 코드는 XLA(Accelerated Linear Algebra) 컴파일러로 컴파일되며, 이 컴파일러는 계산 그래프를 자동으로 최적화하여 기본 TPU 하드웨어에서 효율적으로 실행합니다.
TPU는 대규모 병렬 행렬 연산이 필요한 딥 러닝 작업에 탁월합니다. 다음과 같은 경우에 적극 권장됩니다.
TPU Pod는 특수 고속 네트워크(예: Google의 광회선 교환 또는 Virgo 네트워크)를 통해 함께 연결된 TPU 칩의 대규모 물리적 클러스터입니다. 단일 슈퍼포드에는 상호 연결된 수천 개의 칩이 포함될 수 있습니다. '슬라이스'는 임대할 수 있는 포드의 더 작은 전용 하위 집합입니다. 이 네트워킹 아키텍처를 통해 개발자는 코드를 거의 또는 전혀 변경하지 않고도 대규모 컴퓨팅에서 AI 워크로드를 확장하여 전체 슬라이스를 단일 통합 머신으로 효과적으로 운영할 수 있습니다.
굿풋은 인프라가 유휴 상태가 아니라 모델을 적극적으로 학습시키는 데 사용하는 실제 생산적인 시간을 의미합니다. 대규모 파운데이션 모델을 학습시키려면 수천 개의 칩에 걸쳐 복잡한 조정이 필요합니다. 즉, 데이터 전송 지연, 하드웨어 재설정 또는 체크포인트로 인해 컴퓨팅 주기가 쉽게 낭비될 수 있습니다. Cloud TPU는 고대역폭 상호 연결과 최적화된 메모리 캐싱을 통해 굿풋을 극대화하도록 설계되어 유료 컴퓨팅 주기가 모델 발전에 직접적으로 기여하도록 보장합니다.
사용자는 Google Kubernetes Engine(GKE)과 Cluster Director를 사용하여 안정성, 포괄적인 모니터링, 관리를 지원할 수 있습니다. 고객은 TPU용 GKE를 활용하여 부하 분산을 위한 추론 게이트웨이와 최대 130,000개의 GKE 노드로 배포를 확장할 수 있는 기능을 갖춘 클라우드 네이티브 생태계에서 운영할 수 있습니다.