使用LLM评判器准确评估自由格式语言输出
预构建的LLM评判器
快速开始使用内置的LLM评估器,用于安全性、幻觉、检索质量和相关性评估。我们基于研究的评估器提供与人类专业知识相符的准确可靠的质量评估。

定制化LLM评判器
调整我们的基础模型,以创建符合您业务需求的定制化LLM评判器,使其与人类专家的判断保持一致。

通过评估迭代提升质量
测试新应用/提示变体
MLflow的GenAI评估API允许您针对评估和回归数据集测试新的应用程序变体(提示、模型、代码)。每个变体都与其评估结果相关联,从而能够跟踪随时间推移的改进。

使用基于代码的指标进行自定义
使用我们的自定义指标API,定制评估以衡量应用质量或性能的任何方面。将任何Python函数——从正则表达式到自定义逻辑——转化为指标。

通过评估审查界面识别根本原因
使用 MLflow 的评估界面可视化您的评估摘要,并逐条查看结果,以快速识别根本原因和进一步改进的机会。

并排比较版本
比较两个应用变体的评估结果,以了解您的更改是提升了质量还是导致了退化。在Trace Comparison UI中并排查看各个问题,以发现差异、调试回归情况,并为您的下一个版本提供参考。

开始使用 MLflow
根据您的需求从两个选项中选择
参与进来
Connect with the open source community
加入数百万MLflow用户的行列
