MLflow 实验数据模型(用于生成式 AI)
概览
The Experiment as Organizational Foundation
🎯 单一应用聚焦
每个 Experiment 代表一个独立的生成式 AI 应用或服务。无论你是在构建聊天机器人、文档摘要器还是代码助手,所有相关工作都在单个 Experiment 容器中进行。
🔗 统一实体管理
📊 生命周期连续性
从开发到生产,您的 Experiment 在应用生命周期的各个阶段保持连续性。
Traces 捕获您 GenAI 应用程序的各次运行,并且始终与一个 Experiment 相关联。
与实验的关系:
🤖 模型:AI 系统定义
模型表示在您的 GenAI 应用中使用的人工智能系统和配置。
与实验的关系:
- 跟踪记录引用特定的模型版本以实现可复现性
📋 数据集:评估集合
数据集包含用于测试和评估您的生成式AI应用的精心挑选示例。
与实验的关系:
- 在模型版本之间启用一致的评估
- 支持系统化的测试和验证工作流
🚀 评估运行:系统化测试
评估运行编排使用数据集和评分函数对你的生成式 AI 应用进行系统性测试。
与实验的关系:
- 评估运行属于特定的实验
- 生成新的 Traces,并将其作为实验的一部分
- 实现对不同模型和版本之间的系统性比较
📊 Assessments: Quality Judgments
评估会捕获您在 Experiment 中对 Traces 的质量评估和性能判断。
与实验的关系:
- 评估附加到实验中的跟踪记录
- 在应用程序版本之间启用质量跟踪
- 支持以数据驱动的改进决策
🏷️ 标注会话:人工审核
与实验的关系:
- 标注会话在实验中的跟踪(Traces)上运行
- 生成评估以丰富实验数据
- 允许专家对自动化评估进行验证
完整的实验生态系统
所有 GenAI 实体在 Experiment 中协同工作,以创建一个全面的开发和生产环境:
以实验为中心的组织的好处
🎯 统一上下文
- 所有相关实体共享通用元数据和设置
- 在开发和生产环境中保持一致的组织结构
📊 全面跟踪
🔄 简化的工作流程
- 开发、测试和生产之间的自然集成
- 实体之间的自动化关系管理
- 简化了对相关组件的导航与发现
📈 数据驱动洞察
- 对应用程序性能和质量的整体视图
- 对模型、版本和部署进行系统性比较
- Foundation for continuous improvement processes
实验管理最佳实践
🏗️ 组织结构
- 评估策略: 实施系统化的质量衡量方法
- CI/CD 集成:将部署流水线连接到实验跟踪
- 自动化评估: 使用 Evaluation Runs 设置系统化测试
- 持续监控: 对生产性能进行持续评估
为您的 GenAI 应用设置实验可为全面跟踪和分析奠定基础:
- 🧪 创建实验: 为你的 GenAI 应用建立容器
- 📝 启用追踪: 从您的应用运行中捕获执行数据
- 📋 添加数据集:为系统化测试创建评估集合
- 🚀 运行评估: 实施系统化的质量和性能测试
- 📊 分析结果: 使用统一视图来推动改进
Experiment 提供了使所有其他 MLflow GenAI 功能成为可能的组织骨干,为开发、测试和维护高质量 GenAI 应用创建了结构化的方法。
下一步
- MLflow UI Navigation: 掌握用于探索实验数据和洞察的界面
MLflow Experiments 提供了统一的组织框架,整合了生成式 AI(GenAI)应用开发的各个方面,使您能够系统地跟踪、评估并改进您的 AI 系统。