개방형 지식 형식 소개
Sam McVeety
Tech Lead, Data Analytics
Amir Hormati
Tech Lead, BigQuery, Engineering, Data Cloud
*이 콘텐츠는 AI 번역 도구를 사용하여 번역되었습니다. 정확성을 기하기 위해 노력하고 있으나, 자동 번역에는 오류나 누락이 포함될 수 있습니다. 정확한 정보는 영문 원본을 참고해 주시기 바랍니다.
파운데이션 모델이 계속 개선됨에 따라 관련 컨텍스트의 부족은 특히 에이전트 시스템을 빌드하는 데 사용될 때 모델이 수행할 수 있는 작업을 제한하는 경우가 많습니다. 이러한 모델은 코드를 작성하거나, 문서를 요약하거나, 데이터 세트를 분석하는 데 도움이 될 수 있지만, 정확하고 실행 가능한 결과를 생성하려면 여전히 올바른 정보가 필요합니다.
따라서 오늘 LLM-위키 패턴을 휴대 가능하고 상호 운용 가능한 형식으로 공식화하는 개방형 사양인 Open Knowledge Format (OKF)을 소개합니다. 이는 최신 AI 시스템에 필요한 메타데이터, 컨텍스트, 선별된 지식을 표현하기 위한 에이전트 및 인간 친화적인 벤더 중립 표준입니다.
발표된 바와 같이 OKF v0.1은 YAML 프런트매터가 있는 Markdown 파일의 디렉터리로 지식을 나타내며, 서로 다른 제작자가 작성한 위키를 서로 다른 에이전트가 번역 없이 사용할 수 있도록 하는 합의된 규칙이 소량 포함되어 있습니다.
이상입니다. 복잡한 압축 방식, 새로운 런타임, 필수 SDK가 필요하지 않습니다. OKF 문서 번들은 다음과 같습니다.
-
단순 마크다운 — 모든 편집기에서 읽을 수 있고, GitHub에서 렌더링할 수 있으며, 모든 검색 도구에서 색인화할 수 있습니다.
-
파일만 — tarball로 배포 가능, 모든 git 저장소에서 호스팅 가능, 모든 파일 시스템에 마운트 가능
-
YAML 프런트매터만 사용 — 쿼리할 수 있어야 하는 작은 구조화된 필드 집합(유형, 제목, 설명, 리소스, 태그, 타임스탬프)
Obsidian, Notion, Hugo 또는 지난 1년 동안 등장한 LLM 위키 패턴을 사용해 본 적이 있다면 이 형태가 익숙할 것입니다. OKF는 이러한 패턴을 상호 운용 가능하게 만드는 데 필요한 작은 규칙 집합을 공식화합니다.
이제 OKF가 조직의 문제를 어떻게 해결하는지, 어떻게 작동하는지, 어떻게 시작하는지, 다음 단계는 무엇인지 살펴보겠습니다.
분산된 컨텍스트 환경
대부분의 조직에서 파운데이션 모델이 사용하는 정보는 압도적으로 내부 지식입니다. 테이블의 스키마, 비즈니스의 측정항목 의미, 사고에 대한 런북, 두 시스템 간의 조인 경로, 이전 API에 대한 지원 중단 공지 등이 그 예입니다.
오늘날 이러한 지식의 원자는 매우 세분화된 다양한 시스템에 존재합니다.
-
자체 API가 있는 메타데이터 카탈로그
-
위키, 서드 파티 시스템 또는 공유 드라이브
-
코드 주석, 독스트링 또는 노트북 셀
-
몇몇 선임 엔지니어의 머리
AI 에이전트가 "이벤트 스트림에서 주간 활성 사용자 수를 어떻게 계산해야 해?"라는 질문에 답해야 할 때, 흩어져 있고 서로 호환되지 않는 이러한 표면에서 답을 모아야 합니다. 모든 공급업체는 자체 카탈로그, 자체 SDK, 자체 기술 그래프 스키마를 제공하며, 이러한 기술은 제품이나 조직 간에 쉽게 이전할 수 없습니다.
그 결과, 모든 에이전트 빌더가 동일한 컨텍스트 어셈블리 문제를 처음부터 해결하고, 모든 카탈로그 공급업체가 동일한 데이터 모델을 재창조하며, 지식 자체가 지식을 생성한 표면 뒤에 잠겨 있습니다.
살아있는 위키로서의 지식
개발자팀은 AI 에이전트를 빌드하는 방식을 바꾸고 있습니다. 모델을 사용하여 동일한 문서에서 동일한 사실을 반복해서 검색하는 대신, 에이전트에게 시간이 지날수록 유용해지는 공유 마크다운 라이브러리를 제공할 수 있습니다. 이를 통해 에이전트는 자체 파일을 읽고 업데이트하는 지루한 작업을 수행할 수 있으며, 팀은 콘텐츠를 선별하고 코드처럼 관리할 수 있습니다.
저명한 AI 연구자이자 교육자인 Andrej Karpathy는 LLM Wiki gist에서 이 아이디어를 가장 명확하게 설명합니다. "LLM은 지루해하지 않고, 교차 참조를 업데이트하는 것을 잊지 않으며, 한 번에 15개의 파일을 처리할 수 있습니다."라고 그는 말합니다. 인간이 개인 위키를 포기하게 만드는 바로 그 장부가 LLM이 잘하는 일입니다.
이와 유사한 위키 기반 지식 패턴은 코딩 에이전트에 연결된 Obsidian 보관함, AGENTS.md / CLAUDE.md 계열의 규칙 파일, 에이전트가 실제 작업을 수행하기 전에 참조하는 index.md 및 log.md 아티팩트로 가득한 저장소, 데이터팀 내의 '코드로서의 메타데이터' 저장소 등 다양한 이름으로 계속해서 등장하고 있습니다.
이 패턴은 강력하고 설득력이 있지만 각 인스턴스는 맞춤형입니다. Karpathy의 위키, 팀의 위키, 공급업체의 카탈로그 내보내기는 모두 비슷해 보일 수 있지만 (마크다운, 프런트매터, 교차 링크) 협업을 위해 의도적으로 설계된 것은 아닙니다. 모든 문서에 어떤 필드가 있어야 하는지 또는 파일 이름이 무엇을 의미하는지에 대해 합의된 답은 없습니다. 그 결과 위키에 인코딩된 지식이 원래 팀 내에만 사일로화되어 새로운 에이전트를 빌드할 때마다 중복된 노력이 발생합니다.
필요한 것은 또 다른 서비스가 아니라 형식입니다.
이 문제의 해결책은 또 다른 지식 서비스가 아닙니다. 형식, 즉 다음과 같은 지식을 표현하는 방법이 필요합니다.
-
SDK 없이 누구나 제작 가능
-
통합 없이 누구나 소비 가능
-
시스템, 조직, 도구 간 이동 시에도 유지됨
-
설명하는 코드와 함께 버전 제어에 저장됨
-
사람이 읽을 수 있고 에이전트가 파싱할 수 있음: 동일한 파일, 번역 레이어 없음
OKF는 이러한 형식을 따르도록 설계되었습니다.
OKF 작동 방식: 한 화면에 담긴 디자인
OKF 번들은 개념 을 나타내는 Markdown 파일의 디렉터리입니다. 여기에는 테이블, 데이터 세트, 측정항목, 플레이북, 런북, API 등 캡처하려는 모든 것이 포함됩니다. 각 개념은 하나의 파일입니다. 파일 경로는 개념의 ID입니다.
각 개념 문서에는 구조화된 필드를 위한 작은 YAML 프런트매터 블록과 그 외 모든 것을 위한 마크다운 본문이 있습니다.
개념은 일반적인 Markdown 링크로 서로 연결되어 디렉터리를 파일 시스템에서 암시하는 상위/하위 링크보다 풍부한 관계의 그래프로 전환합니다. 번들에는 선택적으로 index.md 파일 (에이전트가 계층 구조를 탐색할 때 점진적 공개용)과 log.md 파일 (변경사항의 시간순 기록용)이 포함될 수 있습니다.
전체 v0.1 사양 (적합성 기준, 상호 링크 규칙, 소수의 예약된 파일 이름 포함)은 단일 페이지에 맞습니다.
설계의 3가지 원칙
1. 최소한의 의견만 제시합니다. OKF는 모든 개념에 대해 유형 필드라는 단 한 가지를 요구합니다. 다른 모든 것 (예: 어떤 유형이 있는지, 어떤 다른 필드를 포함할지, 본문에 어떤 섹션이 있는지)은 제작자에게 맡겨져 있습니다. 사양은 콘텐츠 모델이 아닌 상호 운용성 표면을 정의합니다.
2. 생산자/소비자 독립성 OKF는 지식을 작성하는 사람과 지식을 소비하는 사람을 명확하게 분리합니다. 사람이 직접 작성한 번들을 AI 에이전트가 사용할 수 있습니다. 메타데이터 내보내기 파이프라인에서 생성된 번들은 시각화 도구에서 탐색할 수 있습니다. 하나의 LLM이 합성한 번들을 다른 LLM이 쿼리할 수 있습니다. 형식은 계약이며, 각 끝의 도구는 독립적으로 교체할 수 있습니다.
3. 플랫폼이 아닌 형식 OKF는 특정 클라우드, 데이터베이스, 모델 제공업체 또는 에이전트 프레임워크에 종속되지 않습니다. 읽기, 쓰기 또는 제공을 위해 독점 계정이나 SDK를 요구하지 않습니다. 지식 형식의 가치는 소유자가 누구인지가 아니라 얼마나 많은 당사자가 이를 사용하는지에 달려 있기 때문에 개방형 표준으로 게시하고 있습니다.
사양과 함께 제공되는 기능
형식을 구체화하기 위해 생산자와 소비자 모두를 위한 참조 구현을 게시하고 있습니다.
-
BigQuery 데이터 세트를 탐색하고, 모든 테이블과 뷰에 대한 OKF 개념 문서를 작성한 다음, 신뢰할 수 있는 문서를 크롤링하고 인용, 스키마, 조인 경로로 각 개념을 보강하는 두 번째 LLM 패스를 실행하는 보강 에이전트
-
모든 OKF 번들을 단일 독립형 파일의 대화형 그래프 뷰로 전환하는 정적 HTML 시각화 도구입니다. 백엔드, 뷰어 측 설치, 페이지에서 데이터 유출이 없습니다.
-
3개의 탐색 가능한 샘플 번들: Google 애널리틱스 4 이커머스, Stack Overflow, Bitcoin 공개 데이터 세트는 참조 에이전트가 생성하고 저장소에 커밋한 것으로, 규정을 준수하는 OKF의 실제 예시입니다.
이러한 예시는 의도적으로 개념 증명에 초점을 맞추고 있습니다. 에이전트는 OKF를 생성하는 한 가지 방법을 보여줍니다. 형식에 관해서는 특정 에이전트 프레임워크나 LLM이 필요하지 않습니다. 시각화 도구는 이를 소비하는 한 가지 방법을 보여줍니다. 형식에 HTML이나 그래프 뷰가 필요한 것은 아닙니다. Google은 생산자와 소비자로 이루어진 생태계가 Google이 제공한 것보다 훨씬 더 크게 성장할 것으로 기대하며, 그렇게 되기를 바랍니다.
앞으로 나아갈 길
OKF v0.1은 시작점이며 완성된 표준이 아닙니다. 더 많은 생산자와 소비자가 등장하고 에이전트가 실제로 필요로 하는 지식 표현이 무엇인지 집단적으로 학습함에 따라 형식은 진화할 것입니다.
지식 카탈로그, 보강 파이프라인, AI 에이전트에 맞게 조정된 위키 또는 AI 지식 도메인의 그 어떤 것을 빌드하든, 지식 형식은 처음부터 공개적으로 게시해야만 그 이름에 걸맞은 역할을 할 수 있습니다.
여기에서 다음 작업을 수행하는 것이 좋습니다.
-
사양 읽기 (짧습니다!)
-
소스 시스템, 데이터베이스, 문서 사이트에 대한 프로듀서 작성
-
소비자 작성: 뷰어, 검색 색인, 번들에 대해 추론하는 에이전트
-
자체 데이터에 대해 참조 구현을 사용해 보세요
-
문제 제기, PR 전송 또는 확장 프로그램 제안: 사양은 버전이 지정되어 있으며 이전 버전과 호환되는 성장을 위해 명시적으로 설계되었습니다.
저장소, 사양, 샘플 번들은 GitHub에서 확인할 수 있습니다. 또한 Google Cloud의 Knowledge Catalog를 업데이트하여 개방형 지식 형식을 수집하고 에이전트에 제공할 수 있게 되었습니다. 관련 코드와 예는 여기에서 확인할 수 있습니다.
형식 자체가 기여입니다. Google이 출시한 도구는 이러한 기능을 실제로 구현하고 사용해 보는 데 드는 비용을 낮추기 위해 존재합니다. 오늘날 지식이 어떤 형태를 띠든 OKF는 내일 교환할 수 있는 공용어가 되도록 설계되었습니다.
Google Cloud 데이터 클라우드팀에서 게시 Open Knowledge Format은 개방형 사양이며, Google 제품 이외의 기여, 대체 구현, 채택을 모두 명시적으로 환영합니다.
이 백서는 저자 외에도 Google의 많은 분들이 제공해 주신 핵심 아이디어를 바탕으로 작성되었습니다. 이 자리를 빌려 도움을 주신 모든 분께 감사의 말씀을 전합니다.



