Skip to main content
이 문서는 Agent Bricks 섹션의 일부입니다.
평가 데이터셋 설계 전략, MLflow Evaluate 통합 패턴, 에이전트 유형별 평가 전략, 결과 분석 및 개선 루프를 다룹니다.

평가 데이터셋 설계 전략

데이터셋 구성 원칙

질문 카테고리별 비율 권장사항

Synthetic Task Generation 활용 전략


MLflow Evaluate 통합 패턴

Agent Bricks UI vs MLflow Evaluate API

자동 평가 파이프라인

CI/CD 연동 패턴

참고 처음에는 낮은 임계값(Correctness 0.70)으로 시작하고 점진적으로 높이세요.

에이전트 유형별 평가 전략

Knowledge Assistant

최우선: Groundedness (환각 방지가 핵심), Correctness, Chunk Relevance

Genie Space

최우선: SQL 정확도, 결과 정확도, 에러율

Supervisor Agent

최우선: 라우팅 정확도, 종합 응답 품질, 권한 준수

평가 결과 분석 및 개선 루프

평가 이력 관리