콘텐츠로 이동하기
데이터 분석

BigQuery의 TabFM 소개: 완전히 새로워진 예측 분석

2026년 9월 8일
Vaibhav Sethi

Group Product Manager

Xi Cheng

Engineering Manager

지금 Gemini Enterprise Business Edition을 사용해 보세요

비즈니스 현장에서 Google AI를 만나기 위한 첫걸음

지금 시작하기

*이 콘텐츠는 AI 번역 도구를 사용하여 번역되었습니다. 정확성을 기하기 위해 노력하고 있으나, 자동 번역에는 오류나 누락이 포함될 수 있습니다. 정확한 정보는 영문 원본을 참고해 주시기 바랍니다.


기존에는 이탈 가능성, 구매 의도 예측, 사기 위험 점수 산정과 같은 엔터프라이즈 예측 분석 작업을 수행하려면 XGBoost, Random Forest, 심층 신경망(DNN) 등의 라이브러리를 활용해 커스텀 모델을 구축해야 했습니다. 기존의 학습-조정-배포-재학습 주기는 효과적이긴 하지만 복잡하고 시간이 많이 걸릴 수 있습니다. 또한 수동 특성 추출, 하이퍼파라미터 조정, 장시간이 소요되고 비용이 많이 드는 학습, 전문 데이터 과학 기술의 필요성으로 인한 오버헤드 때문에 기업이 의사 결정 과정에서 예측 모델을 충분히 활용하지 못하는 경우가 있습니다. 

오늘은 BigQuery의 새로운 TabFM 모델 출시 소식을 전해드립니다. Google 연구팀에서 개발한 TabFM은 테이블 형식 데이터의 회귀 및 분류를 위한 최첨단 사전 학습 파운데이션 모델입니다. TabFM은 컨텍스트 내 학습(ICL)을 활용해 별도의 학습이나 배포 과정 없이 단일 SQL 문만으로 테이블 형식 데이터 세트에서 즉각적이고 정확한 예측 결과를 도출합니다. BigQuery용 TabFM은 현재 프리뷰 단계이며 

BigQuery 분석에 다음과 같은 기능을 제공합니다.

  • 제로샷 예측: 모델 학습, 조정, 아티팩트 배포 과정을 건너뛸 수 있습니다. 라벨이 지정된 과거 데이터와 새 예측 테이블을 단일 SQL 함수에 전달하기만 하면 즉시 고품질 예측 결과를 얻을 수 있습니다.

  • 에이전트형 애플리케이션을 위한 예측 ML: 비즈니스 용도의 에이전트를 구축하고 있나요? TabFM과 BigQuery MCP 서버를 함께 사용하여 예측 기능을 추가하세요. 별도의 런타임이나 인프라를 관리할 필요 없이 데이터를 입력하는 즉시 예측 결과가 출력됩니다.

  • 현존 최고 수준(SOTA)의 정확도: 복잡한 데이터 세트에서 학습한 기존의 커스텀 학습 모델이나 기성 모델을 능가하는 성능을 발휘하며 업계 벤치마킹에서 우수한 정확도 점수를 기록합니다.

  • 간편한 개발자 환경: BigQuery에서 기본적으로 실행되며 간단한 SQL 문법을 통해 액세스할 수 있습니다. 결측값 처리, 범주형 인코딩과 같은 특성화 작업을 자동으로 처리하므로 복잡한 특성 추출 파이프라인을 직접 관리할 필요가 없습니다.

  • 확장성: BigQuery의 분산 추론 아키텍처를 사용하여 수백만 행 규모의 대규모 추론 테이블도 몇 분 만에 처리합니다.

테이블 형식 예측을 위한 선도적인 모델

Google의 TabFM은 다양한 테이블 형식 데이터에서 업계 최고 수준의 정확도를 제공합니다. TabArena 벤치마크 평가에서 TabFM은 기존 머신러닝 모델과 다른 테이블 형식 파운데이션 모델을 모두 지속적으로 능가했습니다.

https://storage.googleapis.com/gweb-cloudblog-publish/images/image1_vsRpJjZ.max-2000x2000.png

TabArena 분류(위) 및 회귀(아래) 상위 10개 모델의 ELO 평점(↑) (D) = 기본값, (T+E) = 조정 + 앙상블. 점수가 높을수록 성능이 우수합니다.

여기에서 TabFM 모델에 대해 자세히 알아보세요.

BigQuery에서 TabFM 시작하기

TabFM은 간단하게 사용할 수 있습니다. 이 기능은 새로운 기본 제공 SQL 함수인 AI.PREDICT와 AI.EVALUATE를 통해 직접 사용할 수 있습니다.

1. AI.PREDICT로 즉각적인 예측 결과 얻기예측을 수행하려면 학습 데이터와 예측 데이터를 전달하는 단일 쿼리를 작성하면 됩니다. 모델은 타겟 라벨의 데이터 유형을 기준으로 해당 작업이 분류 문제인지 회귀 문제인지 자동으로 추론합니다.

로드 중...

이 예시의 출력 결과에는 예측 테이블의 모든 기존 열과 함께 예측된 라벨 및 확률 열(예: predicted_is_fraud)이 포함됩니다. 별도의 수동 특성 추출이나 모델 생성 과정이 전혀 필요하지 않았습니다.

2. AI.EVALUATE로 모델 평가하기

AI.EVALUATE 함수를 사용하여 테스트 세트에 대한 예측 성능을 신속하게 확인할 수 있습니다. 이를 통해 표준 평가 측정항목을 한 단계로 생성할 수 있습니다.

로드 중...

AI.EVALUATE는 회귀 문제의 경우 r2_score, mean_absolute_error 등의 다양한 측정항목을 반환하고, 분류 문제의 경우 precision, recall, f1과 같은 측정항목을 반환합니다.

BigQuery의 TabFM 내부 작동 방식

기존 머신러닝 방식에서는 학습 데이터 세트에 모델 파라미터를 맞추는 과정이 필요합니다. 반면 TabFM은 컨텍스트 내 학습을 사용합니다. 대규모 언어 모델(LLM)이 프롬프트의 퓨샷 예시를 통해 작업을 학습하는 방식과 유사하게 TabFM은 학습 테이블을 컨텍스트 내 예시로 읽어 한 번의 정방향 전달만으로 타겟 테이블에 대한 예측을 생성합니다.

테이블 형식 파운데이션 모델의 연산 복잡성과 메모리 사용량을 처리하기 위해 BigQuery는 데이터에 대해 분산 병렬 추론을 수행합니다. 또한 성능과 리소스 활용을 최적화하기 위해 지능형 학습 데이터 샘플링과 분산 실행을 사용합니다. 이를 통해 BigQuery는 대량의 학습 데이터 입력 행을 처리하면서도 수백만 행 규모의 추론 데이터에 대해 빠르고 효율적으로 예측을 실행할 수 있습니다.

작업에 적합한 도구 선택하기

TabFM은 BigQuery에 획기적인 제로샷 기능을 추가하며 XGBoost 모델과 같은 기존 기능을 보완합니다. TabFM과 다른 모델 중 어떤 것을 선택할지는 다음 기준을 참고하세요.

  • 머신러닝 전문 지식 없이 신속하게 고품질 예측 인사이트를 얻고 싶을 때, 과거 데이터 세트가 중소 규모이거나 데이터가 자주 변경되는 경우, 그리고 정확도 유지를 위해 모델을 빈번하게 재학습해야 할 때 TabFM을 사용하세요. 필요할 때마다 예측 분석을 수행해야 하는 대화형 워크플로 또는 에이전트형 워크플로에도 적합합니다.

  • 과거 데이터 세트가 매우 방대하거나, 커스텀 하이퍼파라미터 조정에 대한 완전한 제어권이 필요할 때, 또는 특성 수가 TabFM의 현재 제한을 초과하거나, 어떤 입력 특성이 예측에 가장 크게 기여했는지 파악하는 특성 중요도 기반의 설명 가능성이 필요한 경우에는 XGBoost와 같은 기존 모델을 사용하세요.

더 간편해진 예측 머신러닝

TabFM이 BigQuery에 기본 통합되면서 이제 일반적인 SELECT 쿼리를 실행하는 것만큼이나 쉽게 예측 ML을 활용할 수 있게 되었습니다. 모델 학습, 조정, 관리에 따르는 번거로운 수동 오버헤드를 제거한 TabFM 덕분에 개발자와 데이터 과학자, 분석가는 몇 초 만에 원시 데이터에서 풍부한 예측 인사이트를 도출할 수 있습니다.

지금 시작하려면 공개 문서를 참조하세요. 궁금한 점이나 의견은 bqml_feedback@google.com으로 Google팀에 문의해 주세요. 여러분이 만들어나갈 멋진 결과물을 기대하고 있겠습니다.

게시 위치