원문: Why Our Frontier Data Agent Outperforms General Coding Agents on Quality and Cost 저자: The Databricks AI Research Team 게시일: 2026년 7월 23일
요약
- Genie Code 는 Databricks의 데이터 에이전트로, 기본 데이터 분석부터 워크스페이스 전반의 데이터 탐색, 파이프라인 구축·장애 디버깅·대시보드 배포 같은 데이터 엔지니어링 작업까지 데이터 업무의 전 영역을 다룹니다.
- 실제 내부 사용 사례에서 뽑은 400여 개 작업에서 Genie Code는 가장 높은 정확도를 내면서 가장 낮은 비용을 유지했습니다 — 경쟁 에이전트의 절반 미만 비용으로 정답을 제공했습니다.
- 이 우위는 기업 컨텍스트에 대한 의미론적 이해에서 비롯됩니다. Genie Code는 다른 에이전트가 겪는 비효율적인 스키마 탐색을 건너뛰어, 더 높은 정확도와 훨씬 낮은 비용을 동시에 달성합니다.
에이전트 AI의 경제학에 대한 통념은 이렇습니다 — 토큰 지출과 정확도는 양의 상관관계를 가지며, 탐색과 검증을 늘릴수록 결과가 자연히 좋아진다는 것입니다. 그러나 우리의 정면 비교(head-to-head) 평가는 이 가정을 뒤집습니다. Genie Code는 벤치마크에서 가장 높은 정확도를 내면서 동시에 가장 비용 효율적이었습니다.
문제의 맥락
데이터 에이전트는 일반 코딩 에이전트와는 뚜렷이 다른 패러다임에서 동작합니다. 데이터 에이전트는 다음과 같은 고유한 어려움을 헤쳐가야 합니다.- 수십만 개의 테이블·노트북·대시보드·문서를 담은 동적인 워크스페이스에서 적절한 자산(asset) 찾기
- 메타데이터와 문서가 오래됐거나 서로 모순될 수 있는 상황에서 권위 있는(authoritative) 출처 판별하기
- 전통적인 코딩 에이전트가 의존하는 검증 가능한 테스트(verifiable test) 없이 동작하기
Genie Code의 접근
이 난제들을 해결하기 위해, Databricks는 Genie Code에 다음과 같은 특화 기능을 부여했습니다.- 카탈로그와 워크스페이스 자산 전반에 대한 의미론적 검색(semantic search)
- 사용자가 의존하는 테이블과 비즈니스 로직에 대한 지속 메모리(persistent memory)
- 기업 컨텍스트에 대한 깊은 의미론적 이해
위 예시는 이를 보여줍니다. Genie Code는 의미론적 검색과 메타데이터로 올바른 테이블을 곧바로 찾아 단 한 번의 SQL 쿼리를 실행하고, 5번의 도구 호출 만에 정답에 도달합니다. 반면 세 가지 범용 에이전트는 모두 자신들의 탐색 시도에서 회복하지 못하고 실패합니다.
평가 방법론
연구 팀은 Databricks 내부의 실제 사용 패턴에서 401개의 자기 완결적(self-contained) 작업을 추출했습니다. 이 데이터셋은 다양한 유형을 포괄합니다 — 탐색(discovery) 과제, 코드 작성·수정, 디버깅, 코드 이해, 그리고 표에서 정확한 수치를 뽑아내야 하는 정밀 데이터 조회입니다.
작업 분포를 나타낸 그림은, 이 범주들이 플랫폼의 파워 유저들이 일상적으로 마주하는 현실 시나리오임을 보여줍니다.
결과
Genie Code는 가장 높은 정확도를 내면서 작업당 비용은 가장 낮았습니다 — 가장 가까운 경쟁자의 약 절반, 정답당 비용으로는 절반 미만이었습니다.
비용 분포 분석
연구 팀은 Genie Code의 작업 비용 중앙값이 2.72 임을 기록했습니다. 관측된 최대 비용은 2를 넘겼습니다. 경쟁 에이전트는 작업의 33~40% 가 9.49 에 이르렀습니다.