이 문서는 AI/BI 섹션의 일부입니다.
1. 왜 Compound AI System인가 — 단일 LLM의 한계
Databricks AI/BI가 단일 LLM이 아니라 Compound AI System(복합 AI 시스템) 으로 설계된 데에는 명확한 이유가 있습니다.단일 LLM만으로는 부족한 이유
이러한 한계를 극복하기 위해, AI/BI는 각각의 역할에 특화된 여러 컴포넌트가 협력하는 파이프라인 구조를 채택합니다. 각 단계에서 검증과 보정이 이루어지기 때문에, 단일 LLM 대비 훨씬 높은 신뢰성과 정확도를 달성할 수 있습니다.
2. Compound AI System 아키텍처 상세
Databricks AI/BI는 아래 컴포넌트들이 순차적으로 협력하는 파이프라인입니다.3. NL→SQL 변환 파이프라인 상세
정상 처리 흐름
Genie가 사용자의 질문을 SQL로 변환하는 과정을 단계별로 살펴보겠습니다. 사용자: “지난 달 서울 매출 상위 5개 제품을 알려줘”실패 케이스 처리와 Self-correction 메커니즘
모든 질문이 깔끔하게 처리되는 것은 아닙니다. AI/BI는 다음과 같은 실패 상황에서 자동 복구를 시도합니다.Self-correction 이란 SQL Validator가 오류를 감지하면, 오류 메시지와 원래 질문을 다시 SQL Generator에 피드백하여 수정된 SQL을 재생성하는 루프입니다. 이 과정이 내부적으로 자동화되어 있어 사용자는 대부분 오류 없이 결과를 받게 됩니다.
4. Certified Answers(인증된 답변)
개념과 필요성
Certified Answers(인증된 답변) 는 관리자(또는 데이터 큐레이터)가 특정 질문에 대한 정답 SQL을 미리 등록해 두는 기능입니다. 기업 환경에서는 “이번 달 KPI는?” 또는 “월간 활성 사용자(MAU)가 몇 명이야?”처럼 반복적으로 물어보는 핵심 질문이 있습니다. 이런 질문에 대해 AI가 매번 새로 SQL을 생성하면 다음과 같은 문제가 발생합니다:- 정의가 다른 컬럼을 선택해 결과가 달라질 수 있습니다
- 복잡한 비즈니스 로직(예: MAU 산정 기준)을 LLM이 정확히 추론하지 못할 수 있습니다
- 결과에 대한 신뢰도가 낮아집니다
동작 방식
- 관리자가 Genie Space의 Instructions 탭에서 자주 묻는 질문과 정답 SQL을 등록합니다.
- 사용자가 유사한 질문을 입력하면, NLU가 해당 질문을 인증된 답변 목록과 매칭합니다.
- 매칭 성공 시, SQL Generator를 거치지 않고 등록된 검증 SQL을 직접 실행합니다.
- 결과에 “인증된 답변” 배지가 표시되어 사용자가 신뢰할 수 있음을 확인할 수 있습니다.
5. 메타데이터가 품질을 결정한다
AI/BI의 SQL 생성 정확도는 Unity Catalog에 등록된 메타데이터(metadata) 품질 에 직접적으로 의존합니다. 좋은 메타데이터 없이는 좋은 AI 응답도 없습니다.COMMENT의 역할
Unity Catalog에서 테이블과 컬럼에 작성하는COMMENT는 Schema Understanding 컴포넌트가 의미적 매칭을 수행할 때 핵심 입력으로 사용됩니다.
region 컬럼의 COMMENT에 “광역시도”라는 설명이 있으면 AI가 올바르게 region = '서울'로 매핑할 수 있습니다.
Metric View (메트릭 뷰)
Metric View 는 비즈니스 지표를 SQL로 공식 정의해 두는 기능입니다. “MAU”, “리텐션율” 같은 복잡한 개념을 정확하게 계산하는 SQL 스니펫을 사전 등록하면, AI/BI가 해당 지표를 질문받을 때 이 정의를 우선 사용합니다.테이블/컬럼 명명 규칙
실제 운영 환경에서 AI/BI 도입 시 메타데이터 정비 를 선행 작업으로 반드시 수행해야 합니다. COMMENT 작성률이 낮은 테이블은 AI 응답 품질이 현저히 떨어집니다.
6. Photon 엔진 — JVM vs Native 성능 차이
개요
AI/BI의 쿼리는 Serverless SQL Warehouse 에서 실행되며, 내부적으로 Photon 엔진 이 핵심 역할을 합니다.Photon 은 Databricks가 C++로 작성한 네이티브 벡터화 쿼리 엔진 입니다. JVM 기반 Spark SQL 엔진을 대체하여 BI 쿼리에서 2~8배의 성능 향상을 제공합니다.
JVM 기반 엔진 vs Photon 비교
AI/BI에서 Photon 최적화의 효과
7. 보안과 거버넌스 — Unity Catalog 기반 권한 제어
AI/BI에서 보안이 적용되는 방식
AI/BI는 독자적인 권한 시스템을 갖지 않습니다. 모든 데이터 접근은 Unity Catalog 의 권한 정책을 그대로 따릅니다. 이는 AI를 통한 우회 접근이 구조적으로 불가능함을 의미합니다.Row-level Security (행 수준 보안)
Unity Catalog의 Row Filter 를 설정하면, 사용자 속성(예: 소속 부서, 국가)에 따라 자동으로 WHERE 조건이 추가됩니다.Column-level Security (열 수준 보안)
Column Mask 를 통해 민감 컬럼(예: 주민번호, 이메일)을 마스킹할 수 있습니다. Genie가 해당 컬럼을 포함한 SQL을 생성하더라도, 마스킹 규칙이 자동 적용됩니다.8. 한계점과 개선 방향
현재 AI/BI(Genie)가 잘 다루지 못하는 영역을 솔직하게 이해하는 것이 중요합니다.현재 한계
향후 발전 방향
Databricks는 AI/BI의 다음과 같은 개선을 지속적으로 진행하고 있습니다:- 멀티턴 대화 개선: 이전 대화 컨텍스트를 더 오래, 더 정확하게 기억하는 능력 강화
- 자동 메타데이터 보강: AI가 테이블을 분석하여 COMMENT를 자동 추천하는 기능
- Agent 통합: Mosaic AI Agent와 연동하여 단순 SQL 쿼리를 넘어 다단계 분석 워크플로우 실행
- 예측 분석: 과거 데이터 기반 트렌드 예측 및 이상 탐지를 자연어로 요청 가능
- 더 넓은 데이터 소스: 외부 DB(PostgreSQL, MySQL 등) 연결 시에도 동일한 NL→SQL 품질 제공
참고 링크
- Databricks Docs: AI/BI Overview
- Databricks Docs: Genie — AI/BI Conversations
- Databricks Docs: Certified Answers (Instructions)
- Databricks Docs: Photon Engine
- Databricks Docs: Unity Catalog Row Filters and Column Masks
- Databricks Docs: Metric Views
- Databricks Docs: Table & Column Comments
- Compound AI Systems — The Shift from Models to Systems (Berkeley Blog)