Skip to main content
이 문서는 GenAI 개념 섹션의 일부입니다.

Human Evaluation vs LLM-as-Judge 비교

성공 권장 조합: LLM-as-Judge로 대량 자동 평가 → 낮은 점수의 응답만 Human Evaluation으로 정밀 검토. 이 조합이 비용 대비 가장 효과적입니다.

LLM-as-Judge 패턴

사람 대신 다른 LLM을 평가자로 활용 하는 패턴입니다. 대량 평가를 자동화할 수 있어 실무에서 가장 많이 사용됩니다.

동작 원리

참고 : Judge 모델은 평가 대상 모델보다 같거나 더 강력한 모델 을 사용하세요. 약한 모델이 강한 모델을 평가하면 신뢰도가 낮습니다.

LLM-as-Judge의 한계

  • Judge 모델 자체의 편향이 평가에 영향
  • 위치 편향(Position Bias): 먼저 제시된 응답에 높은 점수 경향
  • 장문 편향: 긴 응답에 높은 점수를 주는 경향
  • 해결책: 여러 Judge를 사용하거나, 인간 평가와 병행

Databricks MLflow Evaluate

MLflow Evaluate는 Databricks에서 제공하는 LLM 평가 통합 도구입니다.

기본 사용 예시

커스텀 메트릭 추가 예시


최신 API: MLflow 3 Scorer 패턴

MLflow 3에서는 Scorer API를 통해 더 직관적으로 평가를 구성할 수 있습니다. 내장 scorer와 커스텀 scorer를 조합하여 사용합니다.
참고 MLflow 3 변경사항: 기존 mlflow.evaluate()model_type="databricks-agent" 방식은 계속 사용 가능하지만, 새 프로젝트에서는 mlflow.genai.evaluate() + Scorer 패턴을 권장합니다. @scorer 데코레이터로 비즈니스 로직에 맞는 평가 기준을 자유롭게 정의할 수 있습니다.