스포츠카를 통해 배우는 AI 토큰 지출 최적화 (Q&A)

Mike Clark
Director of Product Management, Gemini Enterprise Agent Platform
Natasha Balasubramanian
Product Marketing Manager, Google Cloud
*이 콘텐츠는 AI 번역 도구를 사용하여 번역되었습니다. 정확성을 기하기 위해 노력하고 있으나, 자동 번역에는 오류나 누락이 포함될 수 있습니다. 정확한 정보는 영문 원본을 참고해 주시기 바랍니다.
AI 분야에 종사하는 많은 사람들이 '토큰맥싱'이라는 트렌드를 들어봤을 것입니다. 이는 단순히 토큰 소비를 늘리면 어떻게든 더 나은 AI로 이어질 것이라는 믿음을 의미합니다.
Gemini Enterprise Agent Platform의 제품 관리 부문 책임자인 마이크 클라크는 다른 의견을 가지고 있습니다. 그는 AI의 진정한 잠재력을 실현하기 위해서는 토큰이 아닌 효율성을 극대화하는 전략이 필요하다고 생각합니다.
Photobucket, VSCO와 같은 초기 소셜 웹 선구자부터 생성형 AI의 기반이 되는 인프라에 이르기까지 인터넷에서 가장 잘 알려진 플랫폼을 확장하는 데 경력을 쌓은 Mike는 이제 우리가 일하는 방식을 미래에 맞게 조정하는 데 집중하고 있습니다.
마이크와 함께 AI에서 '많을수록 좋다'는 과장된 주장이 기업에 실패를 안겨주는 이유와 Gemini Enterprise가 리더의 AI 지출 관리를 어떻게 돕고 있는지에 대해 이야기를 나눴습니다. 다음은 두 사람의 대화 내용을 정리한 것입니다.
Q: 본인에 대한 소개와 경력 여정, 그리고 Google에 입사하게 된 계기를 말씀해 주시겠어요?
마이크: 저는 Philips Electronics에서 경력을 시작한 후 스타트업으로 옮겼습니다. 수년 동안 Photobucket을 수억 명의 사용자를 확보한 서비스로 확장하는 데 기여했고, 부모가 자녀의 온라인 안전을 관리하는 데 도움이 되는 Safety Web을 구축했으며, VSCO에서 엔지니어링팀을 이끌었습니다.
최근에는 대규모 파운데이션 모델 출시를 위한 생성형 AI 데이터 관행을 수립하기 전에 개인 정보 보호 인프라에 집중했으며, 결국 AI 에이전트를 빌드하는 연구에 시간을 할애했습니다.
결국 Google Cloud에 합류한 이유는 강력한 리더십을 중시하고 업계 최고의 인재들과 협업하고 싶었기 때문입니다. 현재 Google Cloud가 진행 중인 AI 관련 작업은 사람들의 업무 방식과 소통 방식의 미래를 적극적으로 형성하고 있습니다. 저는 이러한 변화의 최전선에서 세상을 긍정적이고 확장 가능한 방식으로 변화시키는 데 기여하고 싶습니다.
Q: AI 컴퓨팅 비용 관리를 'S' (스포츠) 버튼과 'E' (이코노미) 버튼이 있는 스포츠카를 운전하는 것에 비유하셨습니다. 이 비유를 자세히 설명해 주시겠어요?
마이크: 스포츠카의 대시보드라고 생각하면 됩니다. 'Economy' 또는 'Sport' 모드 간에 전환하면 대시보드의 연비 게이지가 실시간으로 변경되는 것을 확인할 수 있습니다. 예를 들어 갤런당 30마일에서 12마일로 변경됩니다. 스포츠 모드에서는 확실히 더 강력한 성능을 느낄 수 있지만, 그에 따른 단점도 있습니다. 연료 탱크 하나로 300마일이 아닌 100마일 정도밖에 주행할 수 없다는 점입니다. 하지만 산을 오르거나 빠르게 가속해야 하는 상황이라면 연료를 소모하는 대신 더 강력한 성능을 얻는 것이 합리적인 선택입니다.
엔터프라이즈 AI 환경에서 리더는 동일한 대시보드를 필요로 합니다. 사용자는 '연료' 즉 토큰 예산을 무엇과 교환하는지 정확히 파악하고, 당면한 작업에 따라 모드를 전환할 수 있는 제어 기능을 갖춰야 합니다.
Q: 에이전트를 실행하는 엔터프라이즈에서 '경제' 버튼을 누르면 어떤 일이 발생하나요?
마이크: 모든 에이전트 작업에 실시간 저지연 처리가 필요한 것은 아니라는 점을 인식하는 것에서 시작합니다.
예를 들어 고객 대면 챗봇과 상호작용하는 사용자는 몇 초 안에 응답을 받아야 합니다. 바로 스포츠 모드입니다. 하지만 에이전트가 대규모 야간 데이터 조정이나 심층 코드 저장소 리팩터링 스윕과 같은 백그라운드 작업을 실행 중이라면 로딩 화면을 기다리는 사람은 아무도 없습니다.
이러한 백그라운드 프로세스의 경우 '절전' 버튼을 누를 수 있습니다. 즉, 에이전트 워크로드를 사용량이 적은 시간으로 연기하거나 한 번에 여러 날에 걸쳐 더 넓은 기간 동안 점진적으로 처리하도록 설정할 수 있습니다. 최고의 모델을 사용하면서도 연료를 가득 채우지 않고도 훨씬 저렴한 비용으로 사용할 수 있습니다.
또 다른 레버는 조정 수준에서의 토큰 최적화입니다. 이러한 접근방식의 좋은 예는 대부분의 작업에 더 빠르고 기능이 낮은 모델을 사용하되, 필요할 때만 가장 강력한 모델을 참조하는 것입니다. 이 경우에도 최상의 결과를 얻을 수 있지만 토큰 사용량은 매우 최적화되어 있습니다.
Q: 현재 업계에는 '토큰맥싱'이라는 거대한 트렌드가 있습니다. 이 접근방식이 잘못되었다고 생각하는 이유는 무엇인가요?
마이크: 일부 기업에서는 단순히 토큰이 더 많은 직원으로 교체할 수 있다는 생각과 같이 사실이 아닌 매우 광범위한 가정을 하고 있습니다. AI가 모든 것을 해결해 줄 것이라는 생각에 사로잡혀서 더 많은 토큰을 소비하는 방식으로 이를 달성하려고 하는 것과 같습니다.
하지만 실제로는 그렇지 않습니다. 작업에 더 많은 토큰을 투입한다고 해서 AI를 최대한 활용할 수 있는 것은 아닙니다. 결과에 집중해야 합니다.
Q: '토큰맥싱'이 답이 아니라면 기업은 대신 무엇을 해야 할까요?
마이크: 같은 비유와 정신을 따라 저는 '효율성 최대화'를 옹호하겠습니다. 지출하는 모든 비용에서 최고 품질의 비즈니스 성과를 얻는 것이 중요합니다. 모델에 원하는 결과를 명확하게 표현할수록 더 나은 계획과 결과를 얻을 수 있습니다.
이러한 기반을 구축하기 위해 저는 기업 비용 관리를 세 가지 기본 목표를 중심으로 구성합니다. 지출할 금액을 예측하고, 실제로 지출하는 금액을 관리하며, 사후에 청구서를 이해하여 얻은 가치를 파악하는 것입니다.
기업은 이미 보유한 직원들의 역량과 최적화된 에이전트형 워크플로를 결합할 때 진정한 마법이 일어난다는 사실을 깨닫고 있습니다. 직원들의 역량이 크게 향상되는 동시에 비즈니스 성장을 실제로 이끄는 일에 집중할 수 있게 되기 때문입니다.
Q: Gemini Enterprise는 어떤 도움이 될 수 있나요?
마이크: Gemini Enterprise에서는 이러한 과제를 두 가지 방식으로 해결하고 있습니다. 첫째, 팀이 지출을 계획, 시행, 이해하는 데 도움이 되도록 비용 관리 기능을 핵심 플랫폼 아키텍처에 직접 빌드하고 있습니다.
둘째, 워크로드 지연 옵션 또는 지능형 오케스트레이션 수준 토큰 라우팅 등 앞서 언급한 효율성 선택지를 제품에 직접 빌드하고 있습니다. 따라서 조직은 출력 품질을 저하시키지 않고도 더 높은 효율성을 추구할 수 있습니다.
Q: 오늘날 에이전트 출시를 통해 비용 투명성과 제어를 개선하려는 기업에 어떤 조언을 해주고 싶으신가요?
마이크: 저는 항상 비즈니스의 명확한 성과를 정의하는 것부터 시작하라고 말합니다. 핵심적으로 달성하려는 목표는 무엇인가요? 이러한 내용을 더 잘 설명할수록 에이전트의 성능이 향상됩니다.
먼저 토큰 지출과 인프라의 균형을 맞추기 위해 예산을 미리 계획합니다. 다음으로, 지출 한도와 같은 경계를 적용하기 위해 엄격한 제어를 구현하여 가치를 창출하지 않는 프로세스에 과도하게 투자하지 않도록 합니다. 마지막으로, 에이전트가 실제로 제공한 결과를 이해하기 위해 항상 에이전트를 감사하세요.
이러한 수준의 엄격함으로 에이전트 계획을 처리하면 기존 작업을 약간 더 빠르게 실행하는 데 그치지 않습니다. 차별화되지 않은 반복 업무를 없애고, 직원들이 최고의 성과를 낼 수 있는 여유를 제공하며, 비즈니스의 역량을 근본적으로 변화시킬 수 있습니다.



