콘텐츠로 이동하기
컨테이너 및 Kubernetes

GKE 인퍼런스 게이트웨이(Inference Gateway), 프리픽스 캐싱으로 AI 추론 가속화

2026년 7월 1일
Bob Tian

Software Engineer

Susan Wu

Outbound Product Manager

지금 Gemini Enterprise Business Edition을 사용해 보세요

비즈니스 현장에서 Google AI를 만나기 위한 첫걸음

지금 시작하기

*본 아티클의 원문은 2026년 6월 10일 Google Cloud 블로그(영문)에 게재되었습니다. 

생성형 AI가 실험적인 파일럿 단계를 넘어 대규모 운영 환경으로 확장되면서, 이제 인프라의 효율성이 핵심 경쟁력으로 자리 잡고 있습니다. 인프라 활용도를 극대화하고 리소스 소모가 큰 액셀러레이터의 대기 시간을 줄이는 가장 효과적인 방법 중 하나는, 실시간 모델 서버 메트릭을 기반으로 생성형 AI 워크로드를 지능적으로 분산하는 GKE 인퍼런스 게이트웨이(GKE Inference Gateway)를 도입하는 것입니다.

기존의 단순한 라운드 로빈(Round-robin) 로드 밸런싱은 액셀러레이터의 불필요한 재연산(Recomputation)을 자주 유발하고 사용자 지연 시간을 늘리는 단점이 있습니다. 반면, GKE 게이트웨이(GKE Gateway)의 자체 확장 기능은 프리픽스 캐싱(Prefix caching)모델 기반 라우팅(Model-aware routing) 같은 고급 기술을 제공합니다. 이 기능을 활용하면 대기 중인 액셀러레이터로 요청이 즉시 매핑되므로, 우수한 하드웨어 효율성(Hardware utilization)과 빠른 응답 속도로 대규모 언어 모델(LLM) 서비스를 구현할 수 있습니다.

실제로 발표된 독립 벤치마크 보고서에 따르면, GKE 인퍼런스 게이트웨이는 타사 관리형 쿠버네티스 서비스와 비교했을 때 처리량(Throughput)은 15.7% 높고, 첫 번째 토큰 대기 시간은 92.8% 짧으며, 토큰 간 지연 시간(Inter-token latency)은 62.6% 더 낮아 압도적인 성능 우위를 보였습니다. 덕분에 지연 시간이 길고 운영 비용이 부담스럽던 기존 LLM 기반 애플리케이션을 즉각적인 응답 속도를 갖춘 운영 수준(Production-grade)으로 향상시킬 수 있습니다.

이와 같은 뛰어난 성능은 Snap이 GKE 인퍼런스 게이트웨이를 도입한 실무 사례에서도 확인됩니다.

“Snap에서는 대규모 고성능 추론 환경을 안정적으로 구축하고자 llm-d를 프로덕션 AI 인프라에 통합하여 운영 중입니다. 프리픽스 캐시 기반 라우팅(Prefix-cache-aware routing)을 적용한 결과, 프리픽스 캐시 적중률(Prefix cache hit rates)을 최대 75~80%까지 끌어올렸습니다. 특히 llm-d의 유연한 오픈소스 특성 덕분에 Envoy 기반의 서비스 메시(Service Mesh) 환경과도 매끄럽게 통합되었습니다.” - Vinay Kola, Snap Inc. 소프트웨어 엔지니어링 부문 시니어 매니저

본 블로그에서는 구체적인 활용 사례와 함께 GKE 인퍼런스 게이트웨이의 프리픽스 캐싱 작동 원리를 살펴보고, 최근 진행된 벤치마크 평가 결과를 상세히 공유해 드립니다.

지연 시간 단축의 핵심: 프리픽스 캐싱 (Prefix caching)

프리픽스 캐싱은 자주 반복되는 프롬프트 앞부분(Prefix)의 KV 캐시(활성화 상태, KV cache)를 메모리에 미리 저장하여 LLM 성능을 최적화하는 기술입니다. 여러 사용자 요청이 동일한 시스템 지침(System instructions)이나 기본 컨텍스트, 문서 데이터를 공유할 때, 모델은 해당 영역의 토큰 연산을 완전히 생략하고 바로 다음 단계로 넘어갑니다. GKE 인퍼런스 게이트웨이는 유입되는 요청의 프리픽스를 분석해 해당 데이터를 이미 캐싱해 둔 특정 포드(Pod)로 연결해 줍니다. 따라서 GPU와 TPU의 불필요한 중복 연산 비용(Thinking tax)을 없애고, 무거운 추론 과정을 실시간에 가까운 응답 속도로 전환합니다.

활용 사례 1: 검색 증강 생성(RAG) 기반 문서 및 코드베이스 Q&A

RAG 패턴으로 방대한 엔터프라이즈 코드 저장소나 문서를 조회할 때, 전체 데이터셋을 정적 캐시 프리픽스로 고정해 두면 지연 시간 없이 정확한 실시간 응답을 생성(Grounding)할 수 있습니다.

사용자가 질문을 보낼 때마다 LLM이 매번 수천 줄에 달하는 API 레퍼런스나 사내 위키 문서를 처음부터 다시 분석할 필요가 없습니다. GKE 인퍼런스 게이트웨이가 관련 컨텍스트를 이미 KV 캐시에 로드(Warm-up)해 둔 포드로 사용자의 질문을 즉시 라우팅하기 때문입니다. LLM은 사용자가 새로 입력한 질문 내용만 연산하므로, 불필요한 문서 재연산 프로세스를 완전히 우회합니다.

로드 중...

Figure 1: 캐시된 정적 프리픽스와 요청별로 달라지는 동적 접미사의 구성을 보여주는 소프트웨어 문제 해결 프롬프트 예시

활용 사례 2: 다중 대화형 챗봇 (Multi-turn chat)

프리픽스 캐싱을 이용하면 트래픽이 집중되더라도 컴퓨팅 인프라 비용 부담 없이 수천 명의 사용자와 동시에 매끄러운 상담 세션을 유지할 수 있습니다. 고정된 챗봇 페르소나 및 핵심 비즈니스 로직 설정을 LLM 서버 내에 영구적으로 캐싱하는 방식을 사용합니다.

기업용 고객 상담 서비스에서 사용되는 기본 시스템 프롬프트와 안내 정보는 수백만 명의 사용자가 유입되어도 완전히 동일합니다. GKE 인퍼런스 게이트웨이는 컨텍스트 기반 라우팅(Context-aware routing)으로 다중 대화 세션을 관리하여 반복적인 기본 토큰 연산을 최소화하므로, 동시 접속자가 급증해도 지연 없는 대화 환경을 지원합니다.

로드 중...

Figure 2: 금융 상담 챗봇 시나리오의 정적 프리픽스와 동적으로 처리되는 사용자 입력부의 예시

GKE, 타사 관리형 쿠버네티스 대비 뛰어난 성능 우위 입증

이와 같은 아키텍처 관점의 강점을 객관적으로 확인하고자, Principled Technologies에서는 최근 GKE 인퍼런스 게이트웨이를 적용한 GKE 환경과 기존의 라운드 로빈 HTTP 로드 밸런싱을 쓰는 표준 타사 관리형 쿠버네티스 서비스를 비교 검증한 독립 벤치마크 평가 결과를 발표했습니다.

두 서비스 모두 동일한 하드웨어(NVIDIA A100 40GB GPU 8개)와 Llama 3.1 8B Instruct 공유 프리픽스 워크로드를 사용해 공정하게 테스트되었습니다. 측정 결과 GKE는 단순히 우위를 점하는 수준을 넘어, 아래의 3대 핵심 메트릭에서 압도적인 격차로 인프라 성능 차이를 입증했습니다.

  • 높은 처리량(Throughput): 초당 토큰 처리량이 15.7% 증가하여 동일 규모의 인프라에서 더 많은 동시 요청을 소화하거나 하드웨어 투자 비용을 대폭 아낄 수 있습니다.

  • 첫 번째 토큰 생성 시간(TTFT) 단축: 첫 토큰 출력 대기 시간이 무려 92.8% 줄어들어 사용자가 느끼는 체감 반응 시작 속도가 비약적으로 향상됩니다.

  • 낮은 토큰 간 지연 시간(ITL): 62.6% 더 낮아져 첫 토큰이 출력된 이후 실시간 스트리밍이 끊김 없이 매끄럽게 흐릅니다.
https://storage.googleapis.com/gweb-cloudblog-publish/images/1_-_Updated_Doc_chart.max-2200x2200.jpg

Figure 3: 공유 프리픽스 테스트 환경에서 Llama 3.1-8B Instruct LLM을 구동했을 때 GKE 인퍼런스 게이트웨이를 적용한 GKE와 타사 관리형 쿠버네티스 서비스의 평균 지연 시간(출력 토큰당 정규화된 시간) 비교. 동일 사양의 하드웨어 기준. 출처: Principled Technologies

성능 측정 메트릭

GKE

타사 관리형 쿠버네티스 서비스

GKE 적용 효과

평균 출력 토큰 처리량

초당 7,169.21 토큰

초당 6,042.05 토큰

15.7% 처리량 향상

평균 첫 번째 토큰 생성 시간 (TTFT)

188.36 ms

2624.73 ms

92.8% 대기 시간 단축

평균 토큰 간 지연 시간 (ITL)

30.20 ms

81.03 ms

62.6% 지연 감소

Figure 4: 일반 HTTP 로드 밸런싱 방식의 타사 관리형 쿠버네티스 대비 GKE 인퍼런스 게이트웨이를 활성화한 GKE의 AI 추론 효율성 비교.

실무 환경에서 생성형 AI 추론 서비스 가속화하기

실시간 챗봇 상담 에이전트, 실시간 코드 작성 도구, 고성능 금융 사기 방지 필터링 등의 워크로드를 운영할 때 인프라의 응답 속도는 곧 사용자 경험의 만족도를 결정하는 핵심 요인입니다. GKE 인퍼런스 게이트웨이는 공유 프롬프트 프리픽스 캐시의 적중률을 사실상 100%에 가깝게 유지해 줍니다. 이로 인해 반응이 더디고 고비용 구조를 가졌던 기존 LLM 시스템을 고효율, 초저지연의 운영급 시스템으로 즉시 업그레이드시켜 줍니다.

GKE 인퍼런스 게이트웨이가 보유한 성능상의 메리트를 직접 실무 워크로드에 적용해 보세요. 상세 분석 자료가 포함된 벤치마크 보고서 원본은 여기(영문)에서, 시연을 담은 설명 영상은 유튜브에서 확인하실 수 있습니다.


벤치마크 평가를 면밀하게 진행해 주신 Principled Technologies의 시니어 성능 분석 설계자 Dan Sullivan에게 깊은 감사를 드립니다.

게시 위치