Skip to main content
이 문서는 Agent Bricks 섹션의 일부입니다.

MLflow 기반 평가

Agent Bricks는 MLflow와 긴밀하게 통합되어 에이전트 품질을 체계적으로 평가합니다.

MLflow Tracing으로 에이전트 동작 추적

Tracing은 에이전트의 각 단계(검색, LLM 호출, 도구 실행 등)를 시각적으로 추적합니다.

활성화 방법

  1. 워크스페이스에서 Production Monitoring for MLflow 활성화
  2. 에이전트 Build 탭에서 질문 입력 후 View Trace 클릭

Trace에서 확인할 수 있는 정보

참고 디버깅 팁: 에이전트가 엉뚱한 답변을 하면, Trace에서 Retrieval 단계를 먼저 확인하세요. 관련 없는 문서가 검색되고 있다면 Knowledge Source의 Content Description을 조정해야 합니다.

AI Judge (LLM-as-Judge) 설정

AI Judge는 LLM을 평가자로 사용하여 에이전트 응답의 품질을 자동으로 판정합니다.

평가 메트릭

설정 방법

  1. Examples 탭 에서 라벨링된 질문-답변 쌍 추가 (최소 20개 권장)
  2. Evaluate 버튼 클릭
  3. 각 메트릭별 점수와 세부 피드백 확인
  4. 점수가 낮은 항목의 Trace를 분석하여 원인 파악

Synthetic Task Generation — 자동 평가 데이터셋 생성

수동으로 수백 개의 테스트 질문을 작성하는 것은 비현실적입니다. Synthetic Task Generation은 Knowledge Source를 분석하여 자동으로 질문-답변 쌍을 생성합니다.

사용 방법

  1. Examples 탭에서 Generate synthetic tasks 클릭
  2. Knowledge Source 기반으로 다양한 질문이 자동 생성됨
  3. 생성된 질문을 검토하고 필요에 따라 수정
  4. AI Judge로 자동 평가 실행
주의 주의: Synthetic Task는 출발점일 뿐입니다. 반드시 도메인 전문가(SME)가 생성된 질문의 품질을 검토하고, 실제 사용자 질문 패턴을 반영하여 보완해야 합니다.

평가 데이터셋 관리

  • 생성된 데이터셋은 Unity Catalog 테이블 로 Export하여 버전 관리
  • 여러 버전의 에이전트를 동일한 데이터셋으로 비교 평가
  • 프로덕션에서 수집된 사용자 질문을 Import하여 데이터셋 보강

평가 워크플로우


프로덕션 모니터링 포인트

배포 후 지속적으로 모니터링해야 할 항목:
참고 알림 설정: Databricks SQL Alert 또는 외부 모니터링 도구(Datadog, PagerDuty 등)와 연동하여 임계값 초과 시 자동 알림을 받도록 설정하세요.

배포 절차: Review App → Model Serving → REST API

Step 1: Review App으로 SME 검증

  1. 에이전트 설정 페이지에서 Share 클릭
  2. 공유 링크를 도메인 전문가에게 전달
  3. SME가 직접 질문하고 피드백 제출
  4. 피드백을 반영하여 에이전트 개선

Step 2: Model Serving 엔드포인트 배포

  1. 에이전트 페이지에서 Deploy 클릭
  2. 엔드포인트 이름, 컴퓨트 사이즈 설정
  3. 배포 완료 후 엔드포인트 상태가 Ready인지 확인

Step 3: REST API로 연동

REST API (curl) 예시:
Python SDK 예시:

배포 아키텍처


워크스페이스 간 마이그레이션

Knowledge Assistant를 다른 워크스페이스로 복제해야 할 경우:
  1. 타겟 워크스페이스에 필요한 리소스를 먼저 생성 (Vector Search Index, Volume 등)
  2. 소스 워크스페이스에서 SDK로 설정 정보 조회
  3. 타겟 워크스페이스에서 create_knowledge_source API로 재생성
  4. Instructions, Examples 데이터도 Export/Import하여 이전
  5. 타겟 워크스페이스에서 AI Judge로 동일한 품질 수준인지 검증

평가가 Agent Bricks에서 특히 중요한 이유

일반적인 소프트웨어에서는 유닛 테스트와 통합 테스트로 품질을 보장합니다. 하지만 AI 에이전트는 비결정적(non-deterministic) 시스템이므로, 동일한 입력에도 다른 출력이 나올 수 있습니다. 이 특성이 Agent Bricks에서 평가를 특히 중요하게 만드는 이유입니다.

AI 에이전트 평가의 고유한 어려움

평가하지 않으면 발생하는 문제

위험 평가 없이 배포하는 것은 테스트 없이 코드를 프로덕션에 배포하는 것과 같습니다. Agent Bricks의 AI Judge는 이 과정을 자동화해주므로, 반드시 활용하세요. 최소 50개 이상의 테스트 케이스로 평가한 후 배포하는 것을 권장합니다.

평가 데이터셋 설계 전략

평가의 품질은 평가 데이터셋의 품질 에 의해 결정됩니다. 좋은 평가 데이터셋을 설계하는 전략을 상세히 알아봅니다.

데이터셋 구성 원칙

질문 카테고리별 비율 권장사항

Synthetic Task Generation 활용 전략

Synthetic Task Generation은 Knowledge Source를 분석하여 질문을 자동 생성합니다. 그러나 이것만으로는 충분하지 않습니다. 효과적인 활용 방법:

Guidelines 작성 가이드

Guidelines는 AI Judge가 응답을 평가할 때 사용하는 도메인 특화 기준 입니다. 잘 작성된 Guidelines는 평가의 정확도를 크게 높입니다.

MLflow Evaluate 통합 패턴

Agent Bricks의 내장 평가 기능 외에, MLflow Evaluate API 를 직접 사용하면 더 세밀하고 자동화된 평가 파이프라인을 구축할 수 있습니다.

Agent Bricks UI vs MLflow Evaluate API

MLflow Evaluate를 활용한 자동 평가 파이프라인

CI/CD 연동 패턴

에이전트 설정 변경(Instructions, Knowledge Source 등) 시 자동으로 평가를 실행하는 파이프라인입니다.
참고 임계값 설정 팁: 처음에는 낮은 임계값(예: Correctness 0.70)으로 시작하고, 에이전트 품질이 개선됨에 따라 점진적으로 높이세요. 처음부터 높은 임계값을 설정하면 배포가 계속 차단되어 팀의 개발 속도가 저하됩니다.

에이전트 유형별 평가 전략

각 에이전트 유형에 따라 중점적으로 평가해야 할 메트릭과 전략이 다릅니다.

Knowledge Assistant 평가 전략

KA 특화 평가 시나리오:
  • 문서에 있는 내용에 대한 직접 질문 → Correctness + Groundedness
  • 문서에 없는 내용에 대한 질문 → 거부 응답 생성 여부
  • 여러 문서에 걸친 종합 질문 → 올바른 소스 인용 여부
  • 최신 문서 vs 구버전 문서 → 최신 정보 우선 검색 여부

Genie Space 평가 전략

Supervisor Agent 평가 전략


평가 결과 분석 및 개선 루프

평가 결과를 분석하고 에이전트를 개선하는 체계적인 프로세스입니다.

점수가 낮은 항목 분석 흐름

평가 이력 관리와 트렌드 분석

정기적인 평가를 통해 에이전트 품질의 트렌드를 추적합니다.