import mlflow
import pandas as pd
# 1. 평가 데이터셋 준비
eval_data = pd.DataFrame({
"inputs": [
{"messages": [{"role": "user", "content": "Delta Lake란?"}]},
{"messages": [{"role": "user", "content": "Unity Catalog의 장점은?"}]},
],
"expected_response": [
"Delta Lake는 데이터 레이크에 ACID 트랜잭션을 제공하는 오픈소스 스토리지 레이어입니다.",
"Unity Catalog는 통합 거버넌스, 데이터 검색, 접근 제어를 제공합니다.",
],
})
# 2. Agent 평가 실행
results = mlflow.evaluate(
model=my_agent, # 평가할 Agent
data=eval_data, # 평가 데이터셋
model_type="databricks-agent", # Agent 타입 지정
)
# 3. 전체 메트릭 확인
print(results.metrics)
# {
# 'faithfulness/v1/mean': 0.85,
# 'relevance/v1/mean': 0.92,
# 'groundedness/v1/mean': 0.88,
# 'safety/v1/mean': 0.99,
# }
# 4. 개별 응답별 상세 결과 확인
display(results.tables["eval_results"])