이 문서는 머신러닝 섹션의 일부입니다.
왜 체계적인 평가가 필요한가요?
AI 에이전트와 LLM 애플리케이션은 비결정적(같은 입력에도 매번 다른 출력)이므로, “잘 동작하는 것 같다”라는 주관적 판단만으로는 품질을 보장할 수 없습니다. MLflow Evaluate는 자동화된 체계적 평가 를 제공합니다.MLflow Evaluate 개요
평가 데이터셋
평가 데이터셋은 질문(입력) 과 기대 답변(선택) 으로 구성됩니다.데이터셋 소스
내장 Scorer (평가 기준)
LLM Judge Scorer
LLM을 심판(Judge) 으로 사용하여 답변 품질을 자동 평가합니다.사용 예시
커스텀 Scorer
내장 Scorer로 부족한 경우, 직접 Scorer를 작성 할 수 있습니다.평가 결과 분석
평가 워크플로우
MLflow 3.0 Scorer 아키텍처 심화
Scorer 유형 분류
MLflow 3.0에서 Scorer는 크게 세 가지 유형으로 나뉩니다.Built-in Scorer 동작 원리
각 Built-in Scorer는 내부적으로 전문화된 프롬프트 템플릿 과 판단 기준 루브릭(Rubric) 을 사용합니다.Correctness (정확도)
RetrievalGroundedness (근거성)
RetrievalRelevance (검색 관련성)
Safety (안전성)
Guidelines (가이드라인)
LLM-as-Judge 동작 원리
LLM Judge Scorer는 내부적으로 다음과 같은 과정으로 동작합니다.- LLM 호출 | 2. Judge LLM 호출 | Databricks Foundation Model (기본: databricks-meta-llama-3-3-70b-instruct) | 또는 사용자 지정 모델
- 결과 파싱 | 3. 결과 파싱 | score: yes/no 또는 0.0~1.0 | | | justification: 판단 근거 (자연어) |