> ## Documentation Index
> Fetch the complete documentation index at: https://docs.sifi.life/llms.txt
> Use this file to discover all available pages before exploring further.

# 프런티어 데이터 에이전트가 일반 코딩 에이전트를 품질과 비용 모두에서 이기는 이유

> 400여 개 실제 데이터 작업에서 Genie Code가 최고 정확도와 최저 비용을 동시에 달성한 근거

> **원문**: [Why Our Frontier Data Agent Outperforms General Coding Agents on Quality and Cost](https://www.databricks.com/blog/why-frontier-data-agent-outperforms-general-coding-agents-quality-and-cost)
> **저자**: The Databricks AI Research Team
> **게시일**: 2026년 7월 23일

## 요약

* **Genie Code** 는 Databricks의 데이터 에이전트로, 기본 데이터 분석부터 워크스페이스 전반의 데이터 탐색, 파이프라인 구축·장애 디버깅·대시보드 배포 같은 데이터 엔지니어링 작업까지 데이터 업무의 전 영역을 다룹니다.
* 실제 내부 사용 사례에서 뽑은 **400여 개 작업**에서 Genie Code는 **가장 높은 정확도**를 내면서 **가장 낮은 비용**을 유지했습니다 — 경쟁 에이전트의 절반 미만 비용으로 정답을 제공했습니다.
* 이 우위는 **기업 컨텍스트에 대한 의미론적 이해**에서 비롯됩니다. Genie Code는 다른 에이전트가 겪는 비효율적인 스키마 탐색을 건너뛰어, 더 높은 정확도와 훨씬 낮은 비용을 동시에 달성합니다.

***

에이전트 AI의 경제학에 대한 통념은 이렇습니다 — 토큰 지출과 정확도는 양의 상관관계를 가지며, 탐색과 검증을 늘릴수록 결과가 자연히 좋아진다는 것입니다.

그러나 우리의 정면 비교(head-to-head) 평가는 이 가정을 뒤집습니다. **Genie Code는 벤치마크에서 가장 높은 정확도를 내면서 동시에 가장 비용 효율적**이었습니다.

![Genie Code는 400여 개 실제 데이터 작업에서 코딩 에이전트를 능가한다](https://www.databricks.com/sites/default/files/inline-images/chart1_frontier_style.png?v=1784914909)

## 문제의 맥락

데이터 에이전트는 일반 코딩 에이전트와는 뚜렷이 다른 패러다임에서 동작합니다. 데이터 에이전트는 다음과 같은 고유한 어려움을 헤쳐가야 합니다.

* 수십만 개의 테이블·노트북·대시보드·문서를 담은 동적인 워크스페이스에서 적절한 자산(asset) 찾기
* 메타데이터와 문서가 오래됐거나 서로 모순될 수 있는 상황에서 권위 있는(authoritative) 출처 판별하기
* 전통적인 코딩 에이전트가 의존하는 검증 가능한 테스트(verifiable test) 없이 동작하기

## Genie Code의 접근

이 난제들을 해결하기 위해, Databricks는 Genie Code에 다음과 같은 특화 기능을 부여했습니다.

* 카탈로그와 워크스페이스 자산 전반에 대한 **의미론적 검색(semantic search)**
* 사용자가 의존하는 테이블과 비즈니스 로직에 대한 **지속 메모리(persistent memory)**
* 기업 컨텍스트에 대한 **깊은 의미론적 이해**

이 기능들 덕분에 Genie Code는, 범용 에이전트가 불확실성에 부딪혔을 때 빠지는 "무작위 탐색(random walk)"을 건너뛸 수 있습니다.

![Genie Code는 무작위 탐색을 건너뛴다](https://www.databricks.com/sites/default/files/inline-images/chart5_lookup_anatomy-1.png?v=1784914909)

위 예시는 이를 보여줍니다. Genie Code는 의미론적 검색과 메타데이터로 올바른 테이블을 곧바로 찾아 단 한 번의 SQL 쿼리를 실행하고, **5번의 도구 호출** 만에 정답에 도달합니다. 반면 세 가지 범용 에이전트는 모두 자신들의 탐색 시도에서 회복하지 못하고 실패합니다.

## 평가 방법론

연구 팀은 Databricks 내부의 실제 사용 패턴에서 **401개의 자기 완결적(self-contained) 작업**을 추출했습니다. 이 데이터셋은 다양한 유형을 포괄합니다 — 탐색(discovery) 과제, 코드 작성·수정, 디버깅, 코드 이해, 그리고 표에서 정확한 수치를 뽑아내야 하는 정밀 데이터 조회입니다.

![평가 작업의 분포](https://www.databricks.com/sites/default/files/inline-images/chart3_task_mix-1.png?v=1784779657)

작업 분포를 나타낸 그림은, 이 범주들이 플랫폼의 파워 유저들이 일상적으로 마주하는 현실 시나리오임을 보여줍니다.

## 결과

| 에이전트           | 정확도   | 평균 작업당 비용(\$) |
| -------------- | ----- | ------------- |
| Genie Code     | 76.6% | \$0.55        |
| Coding Agent 1 | 72.1% | \$1.09        |
| Coding Agent 2 | 55.9% | \$0.91        |
| Coding Agent 3 | 56.1% | \$1.16        |

Genie Code는 가장 높은 정확도를 내면서 작업당 비용은 가장 낮았습니다 — 가장 가까운 경쟁자의 약 절반, 정답당 비용으로는 절반 미만이었습니다.

![Genie Code는 다른 에이전트의 약 절반 비용이 든다](https://www.databricks.com/sites/default/files/inline-images/chart2_cost_per_task-1.png?v=1784914909)

## 비용 분포 분석

연구 팀은 Genie Code의 작업 비용 중앙값이 **$0.34**, 99번째 백분위수가 **$2.72** 임을 기록했습니다. 관측된 최대 비용은 **$3.87** 이었고, 작업의 **4%** 만이 $2를 넘겼습니다. 경쟁 에이전트는 작업의 **33\~40%** 가 $1을 넘겼으며(Genie Code는 16%), 한 에이전트는 가장 비싼 실행에서 **$9.49** 에 이르렀습니다.

![Genie Code는 전체 작업 분포에 걸쳐 효율을 유지한다](https://www.databricks.com/sites/default/files/inline-images/chart4_cost_distribution-1.png?v=1784914909)

## 성능 동인: 자산 탐색

성능 격차는 자산이 명시적으로 지정되지 않아, 에이전트가 적절한 테이블·노트북·대시보드와 관련 비즈니스 로직을 스스로 찾아야 하는 상황에서 주로 벌어집니다. 범용 에이전트는 비효율적인 워크스페이스 탐색에 의존하게 되고, 그 결과 정확도가 떨어지면서 비용은 높아집니다.

Genie Code는 작업당 평균 **8.3번**의 도구 호출만 사용했습니다 — 테스트한 어떤 경쟁자보다도 적습니다. 저자들은 모든 에이전트에서 비싼 실행이 탐색이 많은(discovery-heavy) 작업에 집중된다는 점, 그리고 그중에서도 Genie Code가 가장 짧은 비용 꼬리(cost tail)를 유지한다는 점을 지적합니다.

## 향후 최적화 여지

연구 팀은 테스트 중에 **Genie Ontology** 를 비활성화했습니다. 아직 모든 고객에게 전역 가용성(global availability)이 확보되지 않았기 때문입니다. 이는 앞으로 성능이 더 향상될 여지가 있음을 시사합니다.

## 결론

초기 기대와 달리, 이 평가는 정확도와 비용 사이의 트레이드오프가 없다는 것을 드러냈습니다. Genie Code는 우월한 정확도를 내면서 비용 효율도 유지합니다. 동적이고 모호한 기업 환경에 대한 프런티어 데이터 에이전트의 깊은 의미론적 이해는, 이미 특화 에이전트에게 주어진 컨텍스트를 다시 발견하느라 토큰을 소모하는 범용 코딩 에이전트를 능가합니다. 이 이점은 범용 능력을 희생하지 않으면서 정확도·속도·비용의 개선으로 동시에 응축됩니다.
