이 문서는 Agent Bricks 섹션의 일부입니다.평가 데이터셋 설계 전략, MLflow Evaluate 통합 패턴, 에이전트 유형별 평가 전략, 결과 분석 및 개선 루프를 다룹니다.
평가 데이터셋 설계 전략
데이터셋 구성 원칙
질문 카테고리별 비율 권장사항
Synthetic Task Generation 활용 전략
MLflow Evaluate 통합 패턴
Agent Bricks UI vs MLflow Evaluate API
자동 평가 파이프라인
CI/CD 연동 패턴
참고 처음에는 낮은 임계값(Correctness 0.70)으로 시작하고 점진적으로 높이세요.