Skip to main content
이 문서는 AI/BI 섹션의 일부입니다.

1. 왜 Compound AI System인가 — 단일 LLM의 한계

Databricks AI/BI가 단일 LLM이 아니라 Compound AI System(복합 AI 시스템) 으로 설계된 데에는 명확한 이유가 있습니다.

단일 LLM만으로는 부족한 이유

이러한 한계를 극복하기 위해, AI/BI는 각각의 역할에 특화된 여러 컴포넌트가 협력하는 파이프라인 구조를 채택합니다. 각 단계에서 검증과 보정이 이루어지기 때문에, 단일 LLM 대비 훨씬 높은 신뢰성과 정확도를 달성할 수 있습니다.

2. Compound AI System 아키텍처 상세

Databricks AI/BI는 아래 컴포넌트들이 순차적으로 협력하는 파이프라인입니다.

3. NL→SQL 변환 파이프라인 상세

정상 처리 흐름

Genie가 사용자의 질문을 SQL로 변환하는 과정을 단계별로 살펴보겠습니다. 사용자: “지난 달 서울 매출 상위 5개 제품을 알려줘”

실패 케이스 처리와 Self-correction 메커니즘

모든 질문이 깔끔하게 처리되는 것은 아닙니다. AI/BI는 다음과 같은 실패 상황에서 자동 복구를 시도합니다.
Self-correction 이란 SQL Validator가 오류를 감지하면, 오류 메시지와 원래 질문을 다시 SQL Generator에 피드백하여 수정된 SQL을 재생성하는 루프입니다. 이 과정이 내부적으로 자동화되어 있어 사용자는 대부분 오류 없이 결과를 받게 됩니다.

4. Certified Answers(인증된 답변)

개념과 필요성

Certified Answers(인증된 답변) 는 관리자(또는 데이터 큐레이터)가 특정 질문에 대한 정답 SQL을 미리 등록해 두는 기능입니다. 기업 환경에서는 “이번 달 KPI는?” 또는 “월간 활성 사용자(MAU)가 몇 명이야?”처럼 반복적으로 물어보는 핵심 질문이 있습니다. 이런 질문에 대해 AI가 매번 새로 SQL을 생성하면 다음과 같은 문제가 발생합니다:
  • 정의가 다른 컬럼을 선택해 결과가 달라질 수 있습니다
  • 복잡한 비즈니스 로직(예: MAU 산정 기준)을 LLM이 정확히 추론하지 못할 수 있습니다
  • 결과에 대한 신뢰도가 낮아집니다

동작 방식

  1. 관리자가 Genie Space의 Instructions 탭에서 자주 묻는 질문과 정답 SQL을 등록합니다.
  2. 사용자가 유사한 질문을 입력하면, NLU가 해당 질문을 인증된 답변 목록과 매칭합니다.
  3. 매칭 성공 시, SQL Generator를 거치지 않고 등록된 검증 SQL을 직접 실행합니다.
  4. 결과에 “인증된 답변” 배지가 표시되어 사용자가 신뢰할 수 있음을 확인할 수 있습니다.

5. 메타데이터가 품질을 결정한다

AI/BI의 SQL 생성 정확도는 Unity Catalog에 등록된 메타데이터(metadata) 품질 에 직접적으로 의존합니다. 좋은 메타데이터 없이는 좋은 AI 응답도 없습니다.

COMMENT의 역할

Unity Catalog에서 테이블과 컬럼에 작성하는 COMMENT는 Schema Understanding 컴포넌트가 의미적 매칭을 수행할 때 핵심 입력으로 사용됩니다.
“서울 매출”이라는 질문이 들어왔을 때, region 컬럼의 COMMENT에 “광역시도”라는 설명이 있으면 AI가 올바르게 region = '서울'로 매핑할 수 있습니다.

Metric View (메트릭 뷰)

Metric View 는 비즈니스 지표를 SQL로 공식 정의해 두는 기능입니다. “MAU”, “리텐션율” 같은 복잡한 개념을 정확하게 계산하는 SQL 스니펫을 사전 등록하면, AI/BI가 해당 지표를 질문받을 때 이 정의를 우선 사용합니다.

테이블/컬럼 명명 규칙

실제 운영 환경에서 AI/BI 도입 시 메타데이터 정비 를 선행 작업으로 반드시 수행해야 합니다. COMMENT 작성률이 낮은 테이블은 AI 응답 품질이 현저히 떨어집니다.

6. Photon 엔진 — JVM vs Native 성능 차이

개요

AI/BI의 쿼리는 Serverless SQL Warehouse 에서 실행되며, 내부적으로 Photon 엔진 이 핵심 역할을 합니다.
Photon 은 Databricks가 C++로 작성한 네이티브 벡터화 쿼리 엔진 입니다. JVM 기반 Spark SQL 엔진을 대체하여 BI 쿼리에서 2~8배의 성능 향상을 제공합니다.

JVM 기반 엔진 vs Photon 비교

AI/BI에서 Photon 최적화의 효과


7. 보안과 거버넌스 — Unity Catalog 기반 권한 제어

AI/BI에서 보안이 적용되는 방식

AI/BI는 독자적인 권한 시스템을 갖지 않습니다. 모든 데이터 접근은 Unity Catalog 의 권한 정책을 그대로 따릅니다. 이는 AI를 통한 우회 접근이 구조적으로 불가능함을 의미합니다.

Row-level Security (행 수준 보안)

Unity Catalog의 Row Filter 를 설정하면, 사용자 속성(예: 소속 부서, 국가)에 따라 자동으로 WHERE 조건이 추가됩니다.
Genie에서 “전체 매출”을 물어봐도, Row Filter가 적용된 사용자는 자신의 지역 데이터만 조회됩니다.

Column-level Security (열 수준 보안)

Column Mask 를 통해 민감 컬럼(예: 주민번호, 이메일)을 마스킹할 수 있습니다. Genie가 해당 컬럼을 포함한 SQL을 생성하더라도, 마스킹 규칙이 자동 적용됩니다.

8. 한계점과 개선 방향

현재 AI/BI(Genie)가 잘 다루지 못하는 영역을 솔직하게 이해하는 것이 중요합니다.

현재 한계

향후 발전 방향

Databricks는 AI/BI의 다음과 같은 개선을 지속적으로 진행하고 있습니다:
  • 멀티턴 대화 개선: 이전 대화 컨텍스트를 더 오래, 더 정확하게 기억하는 능력 강화
  • 자동 메타데이터 보강: AI가 테이블을 분석하여 COMMENT를 자동 추천하는 기능
  • Agent 통합: Mosaic AI Agent와 연동하여 단순 SQL 쿼리를 넘어 다단계 분석 워크플로우 실행
  • 예측 분석: 과거 데이터 기반 트렌드 예측 및 이상 탐지를 자연어로 요청 가능
  • 더 넓은 데이터 소스: 외부 DB(PostgreSQL, MySQL 등) 연결 시에도 동일한 NL→SQL 품질 제공

참고 링크