콘텐츠로 이동하기
보안 & 아이덴티티

AI 애플리케이션 레드팀(Red Teaming) 수행에서 얻은 5가지 교훈

2026년 6월 13일
https://storage.googleapis.com/gweb-cloudblog-publish/images/GettyImages-2195455476.max-2600x2600.jpg
Brice Daniels

Head of Northeast Offensive Security Services, Mandiant, Google Cloud

Muhammad Muneer

Principal Security Consultant, Mandiant, Google Cloud

Get original CISO insights in your inbox

The latest on security from Google Cloud's Office of the CISO, twice a month.

Subscribe

해당 블로그의 원문은 2026년 6월 13일 Google Cloud 블로그(영문)에 게재되었습니다. 

AI 혁신의 빠른 속도로 인해 기업들은 보안 강화보다 기능 개발과 빠른 시장 출시(time-to-market)를 우선시해야 한다는 엄청난 압박을 받고 있습니다. 이 두 가지가 서로 양립할 수 없는 것처럼 보일 수 있지만, 우리는 AI 애플리케이션을 안전하게 구축하는 것이 개발 및 시장 출시 프로세스의 매우 핵심적인 구성 요소라고 굳게 믿고 있습니다.

"AI에 대한 신뢰와 그 신뢰를 가능하게 하는 책임감 있는 AI(RAI) 관행은 더 이상 부차적인 관심사가 아니라 기술의 잠재력을 온전히 실현하기 위한 기초적인 요구 사항입니다"라고 맥킨지(McKinsey)는 자사의 2026 AI 신뢰 성숙도 조사(2026 AI Trust Maturity Survey)에서 밝혔습니다.

올바른 가드레일을 준수하는 것은 개발 경쟁력을 크게 높여줄 수 있습니다. 여러분이 AI를 안전하게 구축할 수 있도록 돕기 위해, 맨디언트(Mandiant)는 자사의 신규 보고서인 생성형 AI 애플리케이션의 안전한 개발: 선제적 접근 방식(Secure Development of Generative AI Applications: A Proactive Approach)에 서술된 GAIA(Good AI Assessment) Top 10을 중심으로 한 선제적이고 위험 기반의 접근 방식을 개발했습니다.

맨디언트 오펜시브 시큐리티(레드) 팀은 최전선에서 AI 시스템의 고유한 취약점을 파악하기 위해 실전 스트레스 테스트를 수행하고 있습니다. 이러한 실전 경험은 기본 설계 단계부터 안전한 AI 애플리케이션을 구축하기 위한 구글의 포괄적인 로드맵을 형성하는 든든한 밑거름이 되었습니다. 우리는 기업들이 AI 애플리케이션을 보다 안전하게 설계하고 배포할 수 있도록 지원하기 위해, 최근 발견된 핵심 통찰력들을 5가지 중요 교훈으로 정제해 제시합니다.

케이스 스터디: 과거 대화 기록에 의존하는 챗봇

귀사가 마주한 복잡한 과제들을 깊이 이해하기 위한 노력의 일환으로, 맨디언트 레드팀은 실제 비즈니스 시나리오 상의 취약점을 증명하기 위해 AI 애플리케이션에 대한 공격자 시뮬레이션 평가를 진행했습니다.

그중 매우 시사점 높은 실전 사례는 프로동(pre-production) 개발 단계에 있던 금융 뱅킹 챗봇이었습니다. 신속하게 프로토타입 단계로 개발된 여타 일반적인 AI 애플리케이션과 마찬가지로, 이 챗봇은 사용자에게 고도화된 선진 기능들을 제공했으나 시스템 전반의 보안 태세 수준은 '낮음에서 보통' 단계에 머물러 있었습니다.

맨디언트 레드팀은 외부망에 노출된 취약한 API 엔드포인트를 즉각 식별해 냈으며, 이를 통해 데이터베이스 서버에 대한 SQL 인젝션 공격 및 완전한 원격 제어 권한을 획득하는 데 성공했습니다. 더 나아가, 쉽게 수정 가능한 JSON 포맷 형식으로 서버에 전송되고 있던 과거 채팅 히스토리 데이터를 가로채(intercepting), 개발자가 미처 정의하지 않은 정교한 가짜 "시스템(system)" 메시지를 인젝션(주입)하여 전체 대화 흐름을 장악했습니다.

생성형 AI 파이프라인은 모델 자체를 넘어 명확한 취약점을 유발합니다. 보안은 최종 레이어가 아닙니다. 데이터 수집 및 처리부터 배포에 이르기까지 SDLC의 모든 단계에 통합되어야 합니다.

과거의 대화에 크게 의존하던 대형 언어 모델(LLM)은 이 조작된 히스토리를 사실로 수용했고, 주요 지침(primary instructions)을 우회했으며, 맨디언트 레드팀이 승인되지 않은 계정 변경을 수행하도록 허용했습니다.

우리 레드팀이 모델을 비교적 쉽게 공략할 수 있었다는 점을 감안할 때, 단순한 모델 프롬프트 보안을 넘어서 전체 AI 애플리케이션을 보호하는 것을 비즈니스 크리티컬(mission-critical)한 과제로 여겨야 합니다.

1. AI 파이프라인의 엔드투엔드 방어

생성형 AI 파이프라인은 모델 자체를 넘어 독특한 취약점들을 유발합니다. 보안은 마지막 단계에 덧씌우는 레이어가 아닙니다. 데이터 인입 및 처리부터 배포에 이르기까지 SDLC(소프트웨어 개발 수명 주기)의 모든 단계에 걸쳐 통합되어야 합니다. 단순히 강력한 시스템 프롬프트에만 의존하는 것은 기반 인프라와 데이터 파이프라인이 조작에 취약할 경우 애플리케이션을 무방비 상태로 노출시킵니다.

2. 프론트엔드 데이터를 있는 그대로 신뢰하지 말 것

위협 행위자들은 간접적인 프롬프트 주입(indirect prompt injection)을 실행하기 위해 JSON 페이로드 및 채팅 로그와 같은 클라이언트 사이드 데이터 구조를 적극적으로 가로채고 수정하려고 시도할 것입니다. 제로 트러스트(Zero Trust) 관점에서 애플리케이션을 설계하고, 사용자 인터페이스에서 전달되는 대화 히스토리가 절대 진짜라고 가정해서는 안 됩니다.

공격자가 히스토리를 재작성하거나 악성 프롬프트를 임베딩하는 것을 방지하려면, 사용자 입력을 신뢰하는 것에서 지속적으로 검증하는 방향으로 전환하십시오. HMAC과 같은 암호학적 서명을 사용하여 대화 컨텍스트가 모델에 도달하기 전에 무결성을 확인하십시오.

3. 시스템 레벨 프롬프트의 관문 단속

데이터 무결성을 검증하는 것은 절반의 승리에 불과합니다. 사용자가 모델에 요청할 수 있는 명령어도 제한해야 합니다. 애플리케이션 레이어에서 권한 상승(privilege escalation)을 차단하는 것이 매우 중요합니다.

데이터를 위생화(sanitize)하고 사용자 인터페이스에서 발생하는 권한 있는 시스템 메시지를 자동으로 삭제하거나 차단하도록 애플리케이션 로직을 구성하는 것을 권장합니다. 엄격한 경계를 설정함으로써, 공격자가 보안 정책을 우회하거나 AI의 핵심 지침을 파괴하기 위해 스스로에게 관리자 역할을 할당하는 것을 방지할 수 있습니다.

4. 애플리케이션 보안의 기본 원칙 준수

AI 애플리케이션은 서드파티 라이브러리, 오케스트레이터 및 구성 요소에 크게 의존하므로 기존의 애플리케이션 보안 및 공급망 위험을 수반합니다. 적들이 AI를 사용해 취약점 발견을 가속화함에 따라, 기업은 취약점 관리 역량을 강화하고 확장해야 합니다.

단순히 모델을 보안하는 것만으로는 충분하지 않습니다. 개발자는 전체 AI 기술 스택에 애플리케이션 보안 테스트 및 취약점 스캔을 적용해야 합니다.

5. 조기 경보 시스템 구축

애플리케이션 및 인프라 로그를 중앙 집중식 보안 모니터링 도구와 통합하십시오. 이를 통해 데이터베이스, 인프라 및 AI 자체를 겨냥한 공격에 대한 실시간 탐지 및 대응이 가능해집니다.

선제적인 모니터링은 조기 경보 시스템 역할을 수행하여 모델 오염(model poisoning), 데이터 유출, 적대적 공격(adversarial attacks) 및 AI 구성 요소 특유의 공급망 취약점과 같은 위협을 빠르게 식별하고 완화할 수 있도록 지원합니다.

맨디언트가 선제적 접근 방식을 도울 수 있습니다

오펜시브 보안 테스트와 GAIA Top 10과 같은 포괄적인 리스크 기반 접근 방식을 근간으로 하는 선제적 접근 방식이 필수적입니다. 맨디언트는 신뢰를 구축하고, 책임감 있는 혁신을 장려하며, 차세대 위협에 대응하는 데 필요한 통찰력과 전략을 제공하여 생성형 AI 애플리케이션의 보안을 확보하는 최전선에 서 있습니다.

AI 애플리케이션을 안전하게 보호하는 방법에 대해 자세히 알아보려면, 보고서 전체 읽기를 확인해 보시기 바랍니다.

게시 위치