# MLflow Evaluate를 활용한 에이전트 품질 평가
import mlflow
eval_data = [
{"input": "지난 달 매출 알려줘", "expected_tool": "get_sales_data", "expected_contains": "매출"},
{"input": "서울 날씨 어때?", "expected_tool": "get_weather", "expected_contains": "온도"},
]
results = mlflow.evaluate(
model=agent_model_uri,
data=eval_data,
model_type="databricks-agent",
evaluator_config={
"databricks-agent": {
"metrics": ["toxicity", "groundedness", "relevance", "tool_accuracy"]
}
}
)
# 결과 확인
print(f"Tool 정확도: {results.metrics['tool_accuracy/mean']:.2%}")
print(f"Groundedness: {results.metrics['groundedness/mean']:.2%}")
print(f"Relevance: {results.metrics['relevance/mean']:.2%}")