跳至主内容

MLflow 实验数据模型(用于生成式 AI)

概览

The Experiment as Organizational Foundation

🎯 单一应用聚焦

每个 Experiment 代表一个独立的生成式 AI 应用或服务。无论你是在构建聊天机器人、文档摘要器还是代码助手,所有相关工作都在单个 Experiment 容器中进行。

🔗 统一实体管理

📊 生命周期连续性

从开发到生产,您的 Experiment 在应用生命周期的各个阶段保持连续性。

Traces 捕获您 GenAI 应用程序的各次运行,并且始终与一个 Experiment 相关联。

与实验的关系:

🤖 模型:AI 系统定义

模型表示在您的 GenAI 应用中使用的人工智能系统和配置。

与实验的关系:

  • 跟踪记录引用特定的模型版本以实现可复现性

📋 数据集:评估集合

数据集包含用于测试和评估您的生成式AI应用的精心挑选示例。

与实验的关系:

  • 在模型版本之间启用一致的评估
  • 支持系统化的测试和验证工作流

🚀 评估运行:系统化测试

评估运行编排使用数据集和评分函数对你的生成式 AI 应用进行系统性测试。

与实验的关系:

  • 评估运行属于特定的实验
  • 生成新的 Traces,并将其作为实验的一部分
  • 实现对不同模型和版本之间的系统性比较

📊 Assessments: Quality Judgments

评估会捕获您在 Experiment 中对 Traces 的质量评估和性能判断。

与实验的关系:

  • 评估附加到实验中的跟踪记录
  • 在应用程序版本之间启用质量跟踪
  • 支持以数据驱动的改进决策

🏷️ 标注会话:人工审核

与实验的关系:

  • 标注会话在实验中的跟踪(Traces)上运行
  • 生成评估以丰富实验数据
  • 允许专家对自动化评估进行验证

完整的实验生态系统

所有 GenAI 实体在 Experiment 中协同工作,以创建一个全面的开发和生产环境:

以实验为中心的组织的好处

🎯 统一上下文

  • 所有相关实体共享通用元数据和设置
  • 在开发和生产环境中保持一致的组织结构

📊 全面跟踪

🔄 简化的工作流程

  • 开发、测试和生产之间的自然集成
  • 实体之间的自动化关系管理
  • 简化了对相关组件的导航与发现

📈 数据驱动洞察

  • 对应用程序性能和质量的整体视图
  • 对模型、版本和部署进行系统性比较
  • Foundation for continuous improvement processes

实验管理最佳实践

🏗️ 组织结构

  • 评估策略: 实施系统化的质量衡量方法
  • CI/CD 集成:将部署流水线连接到实验跟踪
  • 自动化评估: 使用 Evaluation Runs 设置系统化测试
  • 持续监控: 对生产性能进行持续评估

为您的 GenAI 应用设置实验可为全面跟踪和分析奠定基础:

  1. 🧪 创建实验: 为你的 GenAI 应用建立容器
  2. 📝 启用追踪: 从您的应用运行中捕获执行数据
  3. 📋 添加数据集:为系统化测试创建评估集合
  4. 🚀 运行评估: 实施系统化的质量和性能测试
  5. 📊 分析结果: 使用统一视图来推动改进

Experiment 提供了使所有其他 MLflow GenAI 功能成为可能的组织骨干,为开发、测试和维护高质量 GenAI 应用创建了结构化的方法。

下一步

MLflow Experiments 提供了统一的组织框架,整合了生成式 AI(GenAI)应用开发的各个方面,使您能够系统地跟踪、评估并改进您的 AI 系统。