一句话介绍
Evidently AI是一套开源AI评测与可观测性框架,可在实验、回归测试和生产监控中检查LLM、RAG、AI智能体、数据管道及传统机器学习模型的质量。
工具简介
Evidently AI由Evidently AI, Inc.维护,核心产品是可安装到Python环境的Evidently库,并附带可以自行部署的轻量监控平台。
它不负责训练基础模型,而是把输入、输出、标签和参考数据转成指标、报告、测试结果与趋势面板,帮助团队发现幻觉、检索质量下降、数据漂移、性能回归和数据质量问题。
当前产品组成
| 组成部分 | 当前状态 | 主要用途 | 许可证或交付方式 |
|---|---|---|---|
| Evidently Python库 | 正式可用 | 运行评测、生成报告和测试套件 | Apache 2.0开源 |
| Evidently开源平台 | 正式可用 | 自托管项目、数据集、报告、追踪和监控界面 | 随开源库提供基础版本 |
| Tracely | 正式可用 | 基于OpenTelemetry采集LLM应用的近实时追踪数据 | Apache 2.0开源 |
| Evidently Enterprise | 商业提供 | 高级无代码评测、协作、安全和规模化部署 | 联系销售并私有部署 |
| Evidently Cloud | 已停止SaaS服务 | 历史上的托管平台 | 不应再按免费云套餐介绍 |
主要功能
1. Reports评测报告
Reports用于计算并汇总数据、机器学习和LLM质量指标,适合实验分析、调试、基线比较和生产批量检查。
- 使用预设快速组合一组常见评测指标。
- 按任务添加单项指标或自定义Python指标。
- 在Notebook中查看交互结果,或导出为JSON、Python字典和HTML文件。
- 把当前数据与参考数据比较,分析分布、质量和模型表现变化。
2. Test Suites测试套件
Test Suites在报告指标上增加通过或失败条件,可用于数据验证、模型回归测试和持续集成质量门禁。
- 为指标设置大于、小于或其他阈值条件。
- 根据参考数据自动生成部分测试条件,减少首次配置工作。
- 把测试结果用于发布判断,而不只是展示图表。
- 在模型、提示词或检索链路更新后重复运行相同测试。
3. LLM、RAG与智能体评测
Evidently可分析聊天机器人、RAG、Copilot、AI智能体和其他生成式应用。团队可以组合规则、分类器、相似度方法和LLM评审器。
| 评测方向 | 可检查内容 | 典型用途 |
|---|---|---|
| 事实与幻觉 | 事实性、声明一致性和可疑回答 | 减少无依据输出 |
| 检索质量 | 上下文相关性、回答与检索材料的关系 | 评估RAG链路 |
| 安全与隐私 | PII、毒性、敏感词和危险输出 | 建立上线安全门槛 |
| 格式与规则 | 长度、正则、关键词、语气和结构 | 检查业务规范遵循情况 |
| 语义与语言 | 语义相似度、情感、语言和文本特征 | 比较多个模型或提示词 |
| 自定义评价 | 任意提示、模型、规则或Python逻辑 | 实现业务专属评分标准 |
4. 传统机器学习评测
除生成式AI外,Evidently还支持分类、回归、排序、推荐和表格数据质量分析,适合把实验评估与生产监控连接起来。
| 任务类型 | 代表指标或检查 | 需要的数据 |
|---|---|---|
| 分类 | 准确率、精确率、召回率、ROC AUC和混淆矩阵 | 预测、标签及可选参考数据 |
| 回归 | MAE、ME、RMSE、误差分布和偏差 | 数值预测与真实标签 |
| 排序与RAG | NDCG、MAP、MRR和命中率 | 查询、排序结果与相关性信息 |
| 推荐系统 | 新颖性、多样性、流行度偏差等 | 推荐列表和用户交互数据 |
| 数据质量 | 缺失、重复、范围、类别和相关性 | 当前数据集及可选参考集 |
| 数据漂移 | 统计检验和分布距离 | 当前批次与基准批次 |
5. 数据漂移与数据质量
平台可比较当前数据与参考数据,识别字段分布变化、缺失值、重复值、新类别和异常范围。漂移本身不等于模型失效,仍需结合标签、业务指标和模型质量解释。
6. 监控面板
自托管UI可以按项目保存评测快照,并把指标和测试结果画成随时间变化的监控面板。开源版适合轻量部署,团队需要自行负责访问控制、备份、升级和扩容。
7. 追踪与生产评测
Tracely用于采集LLM应用的输入、输出和中间步骤,便于把生产追踪转成可分析的数据集。高级定时评测、告警和无代码工作流属于商业平台能力。
8. 合成数据与提示词优化
当前生态包含合成数据生成和提示词优化能力,可用于构造正常、边界或对抗样例,再比较不同提示词、模型和参数组合。生成样例不能替代真实用户数据与人工红队测试。
从实验到生产的工作流
- 明确要验证的风险,例如幻觉、检索相关性、数据漂移或分类性能下降。
- 准备当前数据、参考数据、预测结果、标签或LLM交互记录,并定义字段含义。
- 选择预设与指标生成Report,先观察分布、失败样例和异常分组。
- 将关键指标转成带阈值的Test Suite,形成可以重复运行的质量门禁。
- 在提示词、模型、数据或代码变更后重新评测,并比较结果差异。
- 将报告写入自托管Workspace,通过Dashboard持续观察趋势与测试状态。
- 把失败结果连接到排查、回滚、重训或人工审核流程。
开源版安装与入门
当前项目要求Python 3.10或更高版本,可通过Python包管理方式安装。正式项目应锁定版本,并在升级前阅读变更说明和回归测试。
- 建立独立Python环境,并准备Pandas数据表或可以转换为表格的数据。
- 安装Evidently包;需要LLM评测、Spark或云存储时,再选择对应的可选依赖。
- 定义数据字段、当前数据和可选参考数据,选择预设或单项指标。
- 运行Report并在Notebook查看,或保存为HTML、JSON和Python字典。
- 为关键指标增加测试条件,把Test Suite加入持续集成或批处理任务。
- 先在样例数据验证计算成本和字段映射,再接入生产数据。
自托管监控教程
- 创建Workspace,决定使用本地目录、SQL类数据库或兼容S3的对象存储。
- 在评测任务中把Report快照、追踪或数据集写入指定Workspace。
- 启动Evidently UI服务,并确认它可以读取Workspace中的项目数据。
- 创建项目和Dashboard面板,选择需要持续跟踪的指标与测试。
- 在生产环境增加反向代理、认证、加密、备份、日志和资源限制。
- 按小时、每日或新标签到达时运行批量评测,并把异常接入团队响应流程。
适合哪些用户
- 数据科学家:比较数据、模型和特征变化,并生成可共享的分析报告。
- 机器学习工程师:把质量测试接入训练、部署和批处理管道。
- LLM应用开发者:评测聊天机器人、RAG、智能体和Copilot的输出质量。
- MLOps与平台团队:自托管统一的评测结果、追踪和监控面板。
- AI产品经理与质量团队:定义质量维度、查看失败样例并跟踪版本回归。
- 受监管企业:在私有环境中部署,并通过商业版补充权限和协作能力。
典型使用场景
- 在发布新提示词或模型前运行固定评测集,阻止明显回归。
- 比较多个RAG检索方案的上下文相关性、事实性和回答质量。
- 监控生产数据分布、缺失率和模型性能随时间的变化。
- 检查LLM回答中的个人信息、毒性、敏感词和格式违规。
- 为分类、回归、排序或推荐系统建立批量质量报告。
- 生成边界和对抗测试输入,扩大传统人工测试集的覆盖面。
- 把评测快照集中到自托管面板,供开发、产品和治理团队复盘。
产品优势
- 同一套框架同时覆盖生成式AI、传统机器学习和数据质量。
- 提供100多项内置评测,并允许使用Python实现业务专属指标。
- Report适合探索,Test Suite适合自动化门禁,两种模式可以衔接。
- 核心库和基础平台采用宽松的Apache 2.0许可证,可在本地和私有环境运行。
- 报告可以保留在Python环境,也可导出为结构化数据或HTML。
- 批量监控默认可以只保存聚合摘要和测试结果,避免重复保存全部原始预测。
- 官方仓库、文档、示例和社区资源较完整,便于开发者排查与扩展。
使用限制与注意事项
- Evidently提供评测工具而非正确答案,指标、阈值和参考数据设计不当会产生误导。
- LLM评审器本身可能存在偏差、随机性和额外模型费用,需要用人工标注校准。
- 数据漂移只表示分布变化,不能单独证明模型表现已经下降。
- 开源平台不包含商业版的认证、角色权限、告警、定时任务和完整无代码能力。
- 原Evidently Cloud已不再作为SaaS提供,旧博客、旧登录入口和部分文档残留可能造成混淆。
- 自托管团队需要自行处理基础设施、安全、备份、升级、可用性和扩容成本。
- Python库适合技术人员,非技术团队若没有商业平台支持,配置和解释指标会有门槛。
- 处理生产提示、回复和个人数据前,应完成最小化、脱敏、访问控制和保存期限设计。
价格与版本
截至2026年8月22日,官方文档明确说明Evidently Cloud已经停止作为SaaS产品提供,因此不能继续引用历史免费云套餐或旧付费额度。
| 版本 | 价格 | 部署方式 | 主要能力 | 适合用户 |
|---|---|---|---|---|
| Evidently Python库 | 免费 | 本地或自有基础设施 | 100多项评测、Reports、Test Suites和自定义指标 | 个人开发者与技术团队 |
| Evidently开源平台 | 软件免费,基础设施自理 | 自托管 | 基础项目、数据集、追踪、结果存储和监控面板 | 可自行运维的团队 |
| Tracely | 免费 | 集成到应用并自托管数据 | 基于OpenTelemetry的LLM追踪 | LLM应用开发团队 |
| Evidently Enterprise | 联系销售 | 私有云或本地部署 | 无代码评测、告警、计划任务、权限、扩展后端和专属支持 | 重视安全、协作与规模化的企业 |
| Evidently Cloud | 不再提供 | 历史托管服务 | 旧页面中的云端能力不能视为当前可购买套餐 | 不适用 |
开源软件不收许可证费用,但数据库、对象存储、计算、日志、备份和维护人员都会产生成本。商业版没有公开统一报价,需根据部署规模、支持与安全要求联系销售。
开源版与商业版对比
| 能力 | 开源版 | 商业Enterprise |
|---|---|---|
| 追踪、100多项评测、报告和测试 | 支持 | 支持 |
| 监控Dashboard与自定义指标 | 支持 | 支持 |
| JSON报告、原始数据、追踪和数据集管理 | 支持 | 支持 |
| 合成数据与提示词优化 | 支持 | 支持 |
| 无代码数据生成、评测和Dashboard | 不支持 | 支持 |
| 并排结果比较与告警 | 不支持 | 支持 |
| 计划任务 | 不支持 | 支持 |
| 认证与角色权限 | 不支持 | 支持 |
| 专属支持、上线培训与规模化后端 | 社区支持和自行运维 | 按商业方案提供 |
支持环境与输入输出
| 项目 | 支持情况 | 说明 |
|---|---|---|
| Python | 3.10及以上 | 主库、评测与自定义指标的核心环境 |
| Jupyter Notebook | 支持 | 交互查看Reports和调试指标 |
| 命令行与Web UI | 支持 | 启动自托管监控平台和演示项目 |
| Windows、macOS与Linux | 依赖Python环境 | 生产部署更需自行验证依赖与容器环境 |
| SQL类存储 | 支持 | 可使用SQLite、Postgres等Workspace后端 |
| 兼容S3的对象存储 | 支持 | 可连接Amazon S3、GCS或MinIO等 |
| 移动端原生应用 | 未提供 | 可通过浏览器查看自建服务,但不是移动应用 |
| 输入 | 输出 | 说明 |
|---|---|---|
| Pandas表格与文本数据 | 带指标的数据集和Report | 适合离线实验与批量评测 |
| 当前集与参考集 | 漂移、质量和差异分析 | 需保证字段定义和时间窗口可比 |
| 预测与标签 | 分类、回归、排序和推荐指标 | 标签延迟时应分开监控代理指标 |
| LLM提示、回复、上下文和追踪 | 质量、安全和检索评测 | 敏感内容应先脱敏 |
| Report结果 | JSON、Python字典、HTML和平台快照 | 可用于自动化判断或人工查看 |
| Test Suite | 通过或失败结果 | 适合持续集成和发布门禁 |
API与集成能力
Evidently首先是Python库API,可在Notebook、脚本、持续集成、Airflow等编排任务和自定义评测管道中调用。自托管平台也提供用于写入和读取评测结果的接口。
- 将Report和Test Suite放入训练、验证或部署流水线。
- 通过定时脚本、任务调度器或标签到达事件触发批量监控。
- 把结构化结果发送到已有日志、告警、仪表盘或治理系统。
- 使用Tracely采集LLM应用的输入、输出和中间调用。
- 借助兼容文件系统接口连接对象存储和远程Workspace。
- 通过自定义Python指标封装企业内部规则、分类器或外部评审模型。
GitHub与开源情况
Evidently核心仓库公开维护,采用Apache License 2.0。2026年8月核验时仓库约有7,800个星标,最新正式版本为0.7.21,发布时间为2026年3月10日。
Apache 2.0允许使用、修改和分发,但再发布时需要保留许可证和相关版权、专利及归属声明,并标明修改过的文件。商标权不随开源许可证自动授予。
| 官方开源项目 | 用途 | 许可证 |
|---|---|---|
| evidently | ML与LLM评测、测试和监控核心框架 | Apache 2.0 |
| tracely | 基于OpenTelemetry的LLM应用追踪 | Apache 2.0 |
| community-examples | 评测与监控示例 | Apache 2.0 |
| aws_alerting | 与AWS告警相关的示例集成 | Apache 2.0 |
| ml_observability_course | 机器学习可观测性课程材料 | Apache 2.0 |
隐私、遥测与安全
只使用Python库在Notebook或脚本中生成Report时,官方说明不会收集开源产品遥测。启动自托管Monitoring UI时,匿名使用情况遥测默认开启,但可以通过DO_NOT_TRACK环境变量关闭。
- UI遥测包含操作系统、Python和工具版本、时间、匿名用户标识及功能使用事件。
- 官方称不会收集数据集内容、字段名称、参数、代码或数据模式。
- 自托管不等于自动安全,开源基础平台缺少内置认证和角色权限,需要团队自行补齐。
- 保存原始LLM追踪时可能包含客户文本、个人信息和业务秘密,应设置脱敏、权限与删除规则。
- 官网和历史云服务的隐私政策还涉及邮箱、姓名、公司、Cookie、使用数据及经许可的位置数据。
- 企业部署应核对数据处理协议、子处理商、日志、加密、备份、漏洞响应和支持边界。
基本信息
| 项目 | 内容 |
|---|---|
| 工具名称 | Evidently AI |
| 开发公司 | Evidently AI, Inc. |
| 工具类型 | AI评测、LLM可观测性与机器学习监控 |
| 核心语言 | Python |
| 数据类型 | 表格数据与文本数据 |
| 核心能力 | Reports、Test Suites、100多项指标、追踪和监控UI |
| 价格模式 | 开源免费与Enterprise定制报价 |
| 是否需要注册 | 开源版不需要;商业沟通需要联系官方 |
| 是否开源 | 是,核心库采用Apache 2.0 |
| 云端SaaS | 已停止提供 |
| 主要部署 | 本地、自有服务器、私有云或企业本地环境 |
推荐指数
推荐指数:4.6 / 5。Evidently覆盖LLM与传统机器学习,指标、报告、测试和监控之间衔接完整,适合希望掌控数据与评测逻辑的技术团队。
主要不足是开源部署需要工程与运维投入,非技术用户可直接使用的无代码和协作功能集中在商业版。Cloud退出SaaS后,团队也需要重新评估托管成本与迁移方案。
常见问题
Evidently AI免费吗?
核心Python库、Tracely和基础平台可以免费使用,许可证为Apache 2.0。自托管仍会产生服务器、存储、维护和安全成本。
Evidently Cloud还能注册使用吗?
最新版官方文档明确说明Cloud已不再作为SaaS产品提供。旧页面或旧文章中的免费云套餐不应再视为当前方案。
可以评测LLM和RAG吗?
可以。平台支持事实性、检索相关性、语义相似度、PII、毒性、格式和自定义LLM评审等方向,也可以比较不同模型和提示词。
可以监控传统机器学习模型吗?
可以。Evidently支持分类、回归、排序、推荐、数据质量和数据漂移,并能把批量结果保存到自托管Dashboard。
是否需要上传数据到外部云端?
开源库和平台可以完全在自有环境运行。是否调用外部LLM评审器、远程数据库或对象存储取决于团队自己的配置。
开源监控界面有登录和权限管理吗?
官方对比表显示开源版不包含认证与角色权限。对外或多人部署时,需要使用网关、身份服务和网络策略补齐访问控制。
Evidently会收集模型数据吗?
官方称自托管UI遥测不收集数据集内容、字段名、参数或代码,单独使用Python库生成报告也不会发送遥测。UI匿名遥测默认开启,可配置关闭。
Evidently可以作为持续集成质量门禁吗?
可以。将关键指标写入Test Suite并设置阈值,就能在模型、提示词或数据更新时输出通过或失败结果。
商业Enterprise版增加了什么?
商业版主要增加无代码数据生成与评测、无代码Dashboard、并排比较、告警、计划任务、认证、角色权限、扩展后端和专属支持。价格需要联系销售。
总结
Evidently AI适合希望用代码定义AI质量、把离线评测转成回归测试,并在自有环境持续监控LLM和机器学习系统的团队。
当前选型应以开源自托管或Enterprise私有部署为主,不再按历史Cloud套餐规划。落地时需要同时设计指标有效性、人工校准、数据治理和运维安全。
桂公网安备45132202000164号