콘텐츠로 이동하기
개발 및 IT운영

강화 학습(RL)을 활용한 Gemini 모델 맞춤설정 권장사항 가이드

2026년 10월 7일
Jiaqi Pan

Senior Software Engineer, Google

Kunal Jha

Senior Product Manager, Google

지금 Gemini 을 사용해 보세요

비즈니스 현장에서 Google AI를 만나기 위한 첫걸음

지금 시작하기

*이 콘텐츠는 AI 번역 도구를 사용하여 번역되었습니다. 정확성을 기하기 위해 노력하고 있으나, 자동 번역에는 오류나 누락이 포함될 수 있습니다. 정확한 정보는 영문 원본을 참고해 주시기 바랍니다.


강화 학습(RL)은 현대적인 LLM 사후 학습의 핵심 요소이지만, 대규모 학습 클러스터가 필요할 뿐만 아니라 Gemini와 같은 독점 모델의 경우 외부 고객이 모델 내부 구조에 접근할 수 없다는 한계가 있습니다. 이에 Google Cloud에서는 이를 관리형 RL 파인 튜닝 서비스(RLFT 서비스)로 구현했습니다. 사용자가 프롬프트와 보상 함수를 제공하면, Google Cloud에서 인프라와 독점 모델의 내부 구조를 직접 관리합니다. 

이제 이 서비스를 통해 Gemini를 최적화할 수 있습니다. 라벨이 지정된 정답 세트를 단순히 학습시키는 것이 아니라, 사용자가 직접 정의한 보상 신호를 통해 모델을 가르칠 수 있습니다. 이 덕분에 지도 미세 조정(SFT)으로는 해결하기 어려운 문제들, 즉 직접 시연하기는 어렵지만 결과에 점수를 매기기는 쉬운 작업들을 처리할 수 있게 됩니다.  

이 가이드에서는 RL 미세 조정 서비스를 사용하기 위한 실용적인 권장사항을 살펴봅니다. 먼저 RL 학습 루프를 간단히 살펴보고, RL 사용 여부와 시점을 결정하는 방법을 알아보고, 이 접근 방식을 통해 가치를 극대화하는 방법을 소개합니다.

RLFT란? 

RLFT는 라벨이 지정된 정답이 아닌 사용자가 정의한 보상 신호를 통해 Gemini를 최적화합니다. 수많은 정답 데이터를 직접 만드는 대신, 응답을 채점하는 프로그램 하나만 작성하면 서비스가 이를 바탕으로 모델을 개선합니다. 이를 통해 직접 보여주기는 어렵지만 검증하기는 쉬운 작업들을 수행할 수 있습니다. 예를 들어, 모든 스키마에 맞는 완벽한 SQL을 일일이 작성하기는 힘들지만, 쿼리를 실행해 보고 그 결과가 맞는지 확인하는 것은 간단한 것과 같습니다.

https://storage.googleapis.com/gweb-cloudblog-publish/images/1_-_Single-Step_RL_Training_Loop.max-900x900.png

각 학습 단계에서 서비스는 프롬프트에 대한 여러 후보 대답을 생성하고, 사용자가 정의한 보상으로 점수를 매깁니다. 이를 통해 모델은 기존 Gemini의 특성을 유지하면서도 높은 점수를 받은 대답을 생성할 확률이 높아지도록 개선됩니다. 이 모든 과정을 가능하게 하는 강화 학습은 완전 관리형으로 제공되므로, 사용자가 직접 설정할 필요가 없습니다. 사용자가 직접 제어할 수 있는 유일한 요소이자 결과에 가장 결정적인 영향을 미치는 것은 바로 보상입니다.

RLFT의 가능성과 한계를 결정짓는 세 가지 특징은 다음과 같습니다.

  1. 모델 자체의 출력으로부터 학습: 외부 대상을 복제하는 대신 모델이 이미 생성한 결과물을 정교하게 다듬는 방식이므로, SFT보다 관련 없는 기존 역량을 저해할 가능성이 적습니다. 

  2. 과정이 아닌 결과에 보상: 좋은 결과에 도달하는 모든 응답에 보상을 제공하므로, 정답이 여러 개인 개방형 작업에 적합합니다. 

  3. 기존 역량 강화:   어쩌다 한 번 성공하던 작업을 안정적으로 실행하도록 만들지만, 모델이 원래 할 줄 모르는 기술을 새롭게 가르칠 수는 없습니다.

RLFT 사용 시점

https://storage.googleapis.com/gweb-cloudblog-publish/images/2_-_RLFT_Approaches_-_Direct_RL_or_SFT_War.max-1400x1400.png

프롬프팅과 SFT만으로도 대부분의 최적화가 가능하므로, RLFT를 고려하기 전에 이 방법들을 먼저 충분히 시도해 보세요. RLFT는 응답을 평가할 수는 있지만 직접 작성하기에는 비용이 많이 드는 경우, (충실도, 스키마 유효성, 어조 등) 중요한 지표에서 SFT가 정체기에 도달한 경우, 단일 참조 정답만으로는 동일하게 유효한 여러 정답에 잘못된 페널티를 줄 수 있는 작업에서 진가를 발휘합니다. 

SFT와 RLFT는 경쟁 관계가 아니라 상호 보완적인 관계입니다.

  • 기본 모델이 이미 어느 정도 성공적인 결과를 내놓고 있다면 직접 RLFT를 사용하세요. 보상을 통해 더 나은 답변과 그렇지 못한 답변을 충분히 구분해낼 수 있습니다.

  • SFT 데이터가 있거나 기본 성공률이 너무 낮아 RL만으로는 효과를 보기 어려운 경우에는 SFT → RLFT 2단계 방식을 사용하세요. SFT를 짧고 비용 효율적인 웜 스타트로 활용하세요. 시연 데이터에 과적합되면 RL을 통해 성능을 개선할 여지가 줄어들므로 가볍게 적용하는 것이 좋습니다. 그런 다음 SFT 체크포인트에서 RL을 초기화하는 지속적 조정을 통해 RL 단계로 넘어가세요.

얼리 어답터들의 사례를 보면 이러한 패턴을 통해 RLFT가 가장 큰 가치를 창출하는 영역을 파악할 수 있습니다. 각 패턴은 비즈니스 측면에서 중요하지만, 적은 비용으로는 증명하기 어려웠던 성과들을 스코어링을 통해 입증해 줍니다.

RLFT 사용 사례

게임 내 AI 기반 NPC

  • 개요: 다국어로 진행되는 긴 멀티턴 대화에서도 캐릭터의 개성과 브랜드의 정체성을 유지하는 대화 기능입니다.

  • 문제: 기존 모델을 그대로 사용하면 부적절한 언어 선택, 아이템 할루시네이션, 플레이어 무시, 답변 반복 등의 현상이 발생해 몰입감을 해칩니다.

  • 목표 및 보상: Gemini 자동 평가자(LLM-as-a-judge)가 페르소나, 흐름, 게임 상태 문법을 기준으로 각 턴의 점수를 매기며, 형식 및 언어 오류에는 감점을 부여합니다.

  • 결과: 반복되는 루프와 언어 이탈 현상이 사라지고 상태 문법이 안정적으로 유지됨에 따라, 실제 서비스에 바로 투입할 수 있는 수준의 인게임 캐릭터를 대규모로 구현할 수 있게 되었습니다.

정형 항목 추출

  • 내용: 공급업체 인보이스나 배송 명세서 같은 비정형 문서에서 여러 항목을 추출하여 정형 레코드로 자동 변환하는 작업입니다.

  • 문제: SFT가 정체기에 머무는 롱테일 현상 — 필수 필드가 누락되거나(재현율), 데이터에 없는 필드를 억지로 만들어냄(정밀도).

  • 목표 및 보상: 규칙 기반 정밀도/재현율 보상은 모든 필드가 하나의 정답을 모방하는 것이 아니라 소스 텍스트에 기반하도록 합니다.

  • 결과: 조정이 중단되었던 노이즈 많은 실제 문서에서 필드 수준 정확도가 향상되어 수동 검토 단계를 자동화 프로세스로 전환할 수 있었습니다.

콘텐츠 검토

  • 내용: 복잡한 정책과 결정 트리를 대규모로 적용하는 작업입니다.

  • 문제: 모델이 평가를 회피하기 위해 오탐을 생성하는 할루시네이션을 일으키거나, 잘못된 형식을 사용하는 방식으로 보상 해킹을 시도합니다.

  • 목표 및 보상: Cloud Run 보상은 형식 검증과 결정론적 채점기를 결합하여 다단계 정책 준수를 강제합니다.

  • 결과: 모델은 복잡한 예외 조항을 처리하고 오탐을 획기적으로 줄였으며, 보상 해킹을 차단했습니다. 이를 통해 운영 비용 상승의 원인이 되는 수동 검토 업무량을 줄이는 성과를 거두었습니다.

실행 결과로 평가하는 코드

  • 내용: SQL 또는 API 호출이 고객 데이터에 대해 실제로 실행되는지를 기준으로 평가됩니다.

  • 문제: SFT는 단일 참조 쿼리를 모방하는 방식이라, 학습 시 보지 못한 고유 스키마에서는 제대로 작동하지 않습니다.

  • 목표 및 보상: 코드 실행 보상은 안전한 샌드박스 환경에서 코드를 실행하며, 코드가 정상적으로 컴파일 및 실행되어 올바른 결과가 반환될 때만 보상을 지급합니다.

  • 결과: 이 모델은 폐쇄형 프런티어 모델급의 품질을 유지하면서도 더 낮은 추론 비용으로 첫 시도에 바로 실행 가능한 쿼리를 생성해 냈습니다. 덕분에 기술 지식이 없는 사용자도 자연어만으로 기업 고유 데이터를 조회할 수 있게 되었습니다.

HTML을 활용한 프레젠테이션 슬라이드 생성

  • 정의: HTML/CSS로 작성된 멀티 슬라이드 자료입니다.

  • 문제: 텍스트만으로 학습하면 시각적 품질을 파악할 수 없습니다. 그 결과 오버플로, 요소 잘림, 스타일 불일치 등의 문제가 해결되지 않은 채 그대로 방치될 수 있습니다.

  • 목표 및 보상: 코드 실행 보상은 슬라이드를 렌더링하고 시각적 디자인, 레이아웃의 무결성, 구조적 완성도 및 평가 기준 준수 여부를 채점합니다.

  • 결과: 모델은 테마의 통일성을 유지하면서 레이아웃이 깨지지 않는, 모듈화된 세련된 디자인의 슬라이드 덱을 생성했습니다.

어디서 시작해야 할까요?

  • 데이터 세트부터 시작하세요. 첫 번째 실행에는 별도의 검증 데이터 세트가 포함된 다양한 프롬프트 세트만으로도 충분합니다. 루프가 안정적으로 수렴하고 보상이 의도한 방향으로 움직이는지 확인한 후 규모를 확장하세요. 학습 데이터와 평가 데이터를 엄격히 분리하세요. 평가 데이터가 오염되면 과적합을 파악하기 어려워집니다.

  • 보상 함수부터 시작하세요. 코드 또는 설정의 형태로 작성되는 작업 사양이며, 품질을 결정짓는 가장 핵심적인 요소입니다. 좋은 보상은 인간의 선호도와 상관관계가 있어야 하며, 잘못된 형식의 출력에도 견고해야 하고(파싱 실패를 포착하여 시스템이 다운되는 대신 명확한 부정적 점수를 반환), 보상 해킹에 저항할 수 있어야 합니다. 이를 위해 앙상블 판단을 활용하고, 길이에 페널티를 부여하며, 비정상적인 출력에는 하한선을 설정하고, 모델의 의견보다는 검증 가능한 확인 절차를 우선시하는 것이 좋습니다. 출시 전에 오프라인에서 먼저 검증을 거치세요.

그 외의 과정은 서비스가 알아서 처리합니다. 기본값으로 시작해 콘솔에서 보상 및 평가 곡선을 모니터링하고, 마지막 단계가 아닌 검증 보상이 포화 상태에 도달한 시점의 체크포인트를 선택하세요.

https://storage.googleapis.com/gweb-cloudblog-publish/original_images/3_-_rlft_tutorial.gif

지금 시작하기

여러분은 무엇을 빌드해야 하나요? 원하는 것을 만들 수 있는 도구가 준비되어 있습니다. 

게시 위치