一句話介紹
顯然,AI是一套開源的AI評測與可觀測性框架,可用於在實驗、回歸測試及生產監控中,檢查LLM、RAG、AI智能體、資料管道以及傳統機器學習模型的品質。
工具簡介
顯然,Evidently AI是由Evidently AI, Inc.所維護的,其核心產品為可安裝在Python環境中的Evidently函式庫,同時還附有可自行部署的輕量級監控平台。
它不負責訓練基礎模型,而是將輸入、輸出、標籤和參考數據轉換成指標、報告、測試結果與趨勢面板,協助團隊發現幻覺、檢索品質下降、資料漂移、性能回退以及資料品質問題。
當前產品組成
| 組成部分 | 當前狀態 | 主要用途 | 許可證或交付方式 |
|---|---|---|---|
| 顯然 Python函式庫 | 正式可用 | 運行評測、生成報告和測試套件 | Apache 2.0開源 |
| 顯然開源平台 | 正式可用 | 自託管專案、資料集、報告、追蹤和監控介面 | 隨開源庫提供基礎版本 |
| Tracely | 正式可用 | 基於OpenTelemetry採集LLM應用的近即時追蹤數據 | Apache 2.0開源 |
| Evidently Enterprise | 商業提供 | 高級無代碼評測、協作、安全與規模化部署 | 聯繫銷售並私有部署 |
| Evidently Cloud | 已停止SaaS服務 | 歷史上的託管平台 | 不應再按免費雲套餐介紹 |
主要功能
1. 報告評測報告
Reports用於計算並彙總數據、機器學習及LLM的品質指標,適合用於實驗分析、除錯、基線比較以及大量產品的檢查。
- 使用預設快速組合一組常見評測指標。
- 按任務添加單項指標或自訂Python指標。
- 在Notebook中查看互動結果,或導出為JSON、Python字典和HTML檔案。
- 將當前數據與參考數據比較,分析分布、品質及模型表現的變化。
2. Test Suites測試套件
Test Suites在報告指標上增加通過或失敗條件,可用於數據驗證、模型回歸測試和持續集成品質門禁。
- 為指標設定大於、小於或其他閾值條件。
- 根據參考數據自動生成部分測試條件,減少首次配置工作。
- 把測試結果用於發布判斷,而不只是展示圖表。
- 在模型、提示詞或檢索鏈路更新後重複運行相同測試。
3. LLM、RAG與智能體評測
顯然可分析聊天機器人、RAG、Copilot、AI智能體及其他生成式應用。團隊可以組合規則、分類器、相似度方法與LLM評審器。
| 評測方向 | 可檢查內容 | 典型用途 |
|---|---|---|
| 事實與幻覺 | 事實性、聲明一致性與可疑回答 | 減少無依據輸出 |
| 檢索品質 | 上下文相關性、回答與檢索材料的關係 | 評估RAG鏈路 |
| 安全與隱私 | PII、毒性、敏感詞和危險輸出 | 建立上線安全門檻 |
| 格式與規則 | 長度、正則、關鍵字、語氣和結構 | 檢查業務規範遵循情況 |
| 語義與語言 | 語義相似度、情感、語言和文本特徵 | 比較多個模型或提示詞 |
| 自訂評價 | 任意提示、模型、規則或Python邏輯 | 實現業務專屬評分標準 |
4. 傳統機器學習評測
除生成式AI外,Evidently還支援分類、回歸、排序、推薦以及表格資料品質分析,適合將實驗評估與生產監控相連結。
| 任務類型 | 代表指標或檢查 | 需要的數據 |
|---|---|---|
| 分類 | 準確率、精確率、召回率、ROC AUC和混淆矩陣 | 預測、標籤及可選參考數據 |
| 回歸 | MAE、ME、RMSE、誤差分佈和偏差 | 數值預測與真實標籤 |
| 排序與RAG | NDCG、MAP、MRR和命中率 | 查詢、排序結果與相關性資訊 |
| 推薦系統 | 新穎性、多樣性、流行度偏差等 | 推薦列表和用戶互動數據 |
| 數據品質 | 缺失、重複、範圍、類別和相關性 | 當前資料集及可選參考集 |
| 數據漂移 | 統計檢驗和分配距離 | 當前批次與基準批次 |
5. 數據漂移與數據品質
平台可比較當前數據與參考數據,識別字段分布變化、缺失值、重複值、新類別和異常範圍。漂移本身不等於模型失效,仍需結合標籤、業務指標和模型品質來解釋。
6. 監控面板
自託管UI可以按專案保存評測快照,並將指標與測試結果呈現為隨時間變化的監控面板。開源版適合輕量級部署,團隊需自行負責訪問控制、備份、升級和擴容。
7. 追蹤與生產評測
Tracely用於收集LLM應用的輸入、輸出及中間步驟,便於將生產過程轉換為可分析的資料集。進階的定時評估、告警功能以及無代碼工作流,則屬於商業平台的功能。
8. 合成數據與提示詞優化
當前生態系包含合成數據生成與提示詞優化能力,可用於構造正常、邊界或對抗樣例,再比較不同提示詞、模型和參數組合。生成的樣例無法取代真實用戶數據與人工紅隊測試。
從實驗到生產的工作流
- 明確要驗證的風險,例如幻覺、檢索相關性、資料漂移或分類性能下降。
- 準備當前數據、參考數據、預測結果、標籤或LLM互動記錄,並定義欄位含義。
- 選擇預設與指標生成報告,先觀察分佈、失敗樣例和異常分組。
- 將關鍵指標轉成帶閾值的Test Suite,形成可以重複運行的品質門禁。
- 在提示詞、模型、數據或代碼變更後重新評測,並比較結果差異。
- 將報告寫入自託管Workspace,透過Dashboard持續觀察趨勢與測試狀態。
- 將失敗結果連接到排查、回滾、重訓或人工審核流程。
開源版安裝與入門
目前該專案要求使用 Python 3.10 或更高版本,可透過 Python 套件管理工具來安裝。正式的專案應固定版本號,且在升級之前必須閱讀變更說明及回歸測試內容。
- 建立獨立的Python環境,並準備Pandas資料表或可轉換為表格的資料。
- 安裝Evidently套件;若需要LLM評測、Spark或雲端儲存,則再選擇對應的可選依賴項目。
- 定義資料欄位、當前資料及可選參考資料,選擇預設或單項指標。
- 運行Report並在Notebook查看,或保存為HTML、JSON和Python字典。
- 為關鍵指標增加測試條件,把Test Suite加入持續集成或批次處理任務。
- 先在樣本數據驗證計算成本和字段映射,再接入生產數據。
自託管監控教學
- 建立Workspace時,可選擇使用本機目錄、SQL類型資料庫,或相容S3的物件儲存。
- 在評測任務中把Report快照、追蹤或資料集寫入指定Workspace。
- 啟動Evidently UI服務,並確認它能夠讀取Workspace中的項目數據。
- 建立專案和儀表板面板,選擇需要持續追蹤的指標與測試。
- 在生產環境中增加反向代理、認證、加密、備份、日誌和資源限制。
- 按小時、每日或新標籤到達時運行批量評測,並把異常接入團隊響應流程。
適合哪些用戶
- 資料科學家:比較資料、模型和特徵的變化,並產生可共享的分析報告。
- 機器學習工程師:將品質測試整合到訓練、部署和批次處理流程中。
- LLM應用開發者:評測聊天機器人、RAG、智能體和Copilot的輸出品質。
- MLOps與平台團隊:自託管統一的評測結果、追蹤和監控面板。
- AI產品經理與品質團隊:定義品質維度、查看失敗樣本並追蹤版本回歸。
- 受監管企業:在私有環境中部署,並透過商業版補充權限和協作能力。
典型使用場景
- 在發布新提示詞或模型前運行固定評測集,阻止明顯回歸。
- 比較多個RAG檢索方案的上下文相關性、事實性與回答品質。
- 監控生產數據分佈、缺失率及模型性能隨時間的變化。
- 檢查LLM回答中的個人資訊、毒性、敏感詞和格式違規。
- 為分類、回歸、排序或推薦系統建立批次品質報告。
- 生成邊界和對抗測試輸入,擴大傳統人工測試集的覆蓋面。
- 將評測快照集中到自託管面板,供開發、產品和治理團隊復盤。
產品優勢
- 同一套框架同時覆蓋生成式AI、傳統機器學習和數據品質。
- 提供100多項內建評測,並允許使用Python實現業務專屬指標。
- Report適合探索,Test Suite適合自動化門禁,兩種模式可以銜接。
- 核心庫和基礎平台採用寬鬆的Apache 2.0許可證,可在本地和私有環境運行。
- 報告可以保留在Python環境,也可導出為結構化數據或HTML。
- 批次監控預設可以只保存聚合摘要和測試結果,避免重複保存全部原始預測。
- 官方倉庫、文件、範例和社群資源較完整,便於開發者排查與擴展。
使用限制與注意事項
- 顯然,Evidently提供的是評測工具而非正確答案,指標、閾值和參考數據設計不當會產生誤導。
- LLM評審器本身可能存在偏差、隨機性及額外模型費用,需要用人工標註校準。
- 數據漂移只表示分布變化,不能單獨證明模型表現已經下降。
- 開源平台不包含商業版的認證、角色權限、告警、定時任務和完整無代碼能力。
- 顯然,Evidently Cloud已不再作為SaaS服務提供,舊版部落格、舊登入入口及部分殘留文件可能會造成混淆。
- 自託管團隊需要自行處理基礎設施、安全、備份、升級、可用性及擴容成本。
- Python函式庫適合技術人員,非技術團隊若沒有商業平台支援,配置和解讀指標會有門檻。
- 在處理生產提示、回覆及個人資料之前,應先完成最小化、脫敏、訪問控制及保存期限的設計。
價格與版本
截至2026年8月22日,官方文件明確說明Evidently Cloud已經停止作為SaaS產品提供,因此無法再使用過去的免費雲套餐或舊的付費額度。
| 版本 | 價格 | 部署方式 | 主要能力 | 適合用戶 |
|---|---|---|---|---|
| 顯然 Python函式庫 | 免費 | 本地或自有基礎設施 | 100多項評測、報告、測試套件及自訂指標 | 個人開發者與技術團隊 |
| 顯然開源平台 | 軟體免費,基礎設施自理 | 自託管 | 基礎項目、資料集、追蹤、結果儲存和監控面板 | 可自行運維的團隊 |
| Tracely | 免費 | 集成到應用並自託管數據 | 基於OpenTelemetry的LLM追蹤 | LLM應用開發團隊 |
| Evidently Enterprise | 聯絡銷售 | 私有雲或本地部署 | 無代碼評測、告警、計劃任務、權限、擴展後端及專屬支援 | 重視安全、協作與規模化的企業 |
| Evidently Cloud | 不再提供 | 歷史託管服務 | 舊頁面中的雲端能力不能視為當前可購買套餐 | 不受適用 |
開源軟體不需要支付許可證費用,但資料庫、對象儲存、運算、日誌、備份以及維護等工作都會產生成本。商業版則沒有公開的統一報價,需根據部署規模、支援與安全需求與銷售人員聯繫。
開源版與商業版對比
| 能力 | 開源版 | 商業Enterprise |
|---|---|---|
| 追蹤、100多項評測、報告和測試 | 支持 | 支持 |
| 監控Dashboard與自訂指標 | 支持 | 支持 |
| JSON報告、原始數據、追蹤和資料集管理 | 支持 | 支持 |
| 合成數據與提示詞優化 | 支持 | 支持 |
| 無代碼數據生成、評測和Dashboard | 不支援 | 支持 |
| 並排結果比較與告警 | 不支援 | 支持 |
| 計劃任務 | 不支援 | 支持 |
| 認證與角色權限 | 不支援 | 支持 |
| 專屬支援、上線培訓與規模化後端 | 社區支持與自行運維 | 按商業方案提供 |
支援環境與輸入輸出
| 項目 | 支持情況 | 說明 |
|---|---|---|
| Python | 3.10及以上 | 主庫、評測與自訂指標的核心環境 |
| Jupyter Notebook | 支持 | 互動查看Reports和調試指標 |
| 命令行與Web UI | 支持 | 啟動自託管監控平台與演示項目 |
| Windows、macOS與Linux | 依賴Python環境 | 生產部署更需自行驗證依賴與容器環境 |
| SQL類儲存 | 支持 | 可使用SQLite、Postgres等Workspace後端 |
| 相容S3的對象儲存 | 支持 | 可連接Amazon S3、GCS或MinIO等 |
| 行動端原生應用 | 未提供 | 可透過瀏覽器查看自建服務,但不是行動應用 |
| 輸入 | 輸出 | 說明 |
|---|---|---|
| Pandas表格與文本數據 | 帶指標的資料集和報告 | 適合離線實驗與批量評測 |
| 當前集與參考集 | 漂移、質量和差異分析 | 需保證字段定義和時間窗口可比 |
| 預測與標籤 | 分類、回歸、排序和推薦指標 | 標籤延遲時應分開監控代理指標 |
| LLM提示、回覆、上下文和追蹤 | 品質、安全與檢索評測 | 敏感內容應先脫敏 |
| 報告結果 | JSON、Python字典、HTML和平台快照 | 可用於自動化判斷或人工查看 |
| Test Suite | 通過或失敗結果 | 適合持續集成和發布門禁 |
API與整合能力
顯然,首先就是Python函式庫的API,它可以在Notebook、腳本、持續整合工具、Airflow等排程任務,以及自訂的評分流程中被調用。此外,自托管平台也提供了用於寫入和讀取評分結果的接口。
- 將Report和Test Suite放入訓練、驗證或部署流水線。
- 透過定時腳本、任務排程器或標籤到達事件觸發批量監控。
- 將結構化結果發送到已有日誌、告警、儀表盤或治理系統。
- 使用Tracely採集LLM應用的輸入、輸出和中介調用。
- 藉助相容的檔案系統介面連接對象儲存與遠端Workspace。
- 透過自訂Python指標封裝企業內部規則、分類器或外部評審模型。
GitHub與開源情況
顯然,該核心倉庫是公開維護的,採用Apache License 2.0授權協議。在2026年8月的檢查中,該倉庫有約7,800個星標,最新的正式版本為0.7.21,發布時間為2026年3月10日。
Apache 2.0允許使用、修改和分發,但在再次發布時必須保留許可證以及相關的版權、專利和權屬聲明,並標明經過修改的檔案。商標權則不會隨著開源許可證而自動授予。
| 官方開源專案 | 用途 | 許可證 |
|---|---|---|
| evidently | ML與LLM評測、測試和監控核心框架 | Apache 2.0 |
| tracely | 基於OpenTelemetry的LLM應用追蹤 | Apache 2.0 |
| community-examples | 評測與監控示例 | Apache 2.0 |
| aws_alerting | 與AWS告警相關的示範整合 | Apache 2.0 |
| ml_observability_course | 機器學習可觀測性課程材料 | Apache 2.0 |
隱私、遙測與安全
僅在 Notebook 或腳本中使用 Python 函式庫來產生報告時,官方說明指出不會收集開源產品的遙測資料。當啟動自托管的 Monitoring UI 時,匿名使用狀況的遙測功能會預設開啟,但可以透過 DO_NOT_TRACK 環境變數來關閉它。
- UI遙測包含操作系統、Python和工具版本、時間、匿名用戶識別及功能使用事件。
- 官方稱不會收集資料集內容、欄位名稱、參數、代碼或資料模式。
- 自託管不等於自動安全,開源基礎平台缺乏內建認證和角色權限,需要團隊自行補齊。
- 保存原始LLM追蹤時可能包含客戶文本、個人資訊和業務秘密,應設定脫敏、權限與刪除規則。
- 官網和歷史雲服務的隱私政策還涉及電子郵件地址、姓名、公司名稱、Cookie、使用數據以及經許可的位置數據。
- 企業部署應核對資料處理協議、子處理商、日誌、加密、備份、漏洞回應與支援邊界。
基本資訊
| 項目 | 內容 |
|---|---|
| 工具名稱 | Evidently AI |
| 開發公司 | Evidently AI, Inc. |
| 工具類型 | AI評測、LLM可觀測性與機器學習監控 |
| 核心語言 | Python |
| 資料類型 | 表格數據與文本數據 |
| 核心能力 | 報告、測試套件、100多項指標、追蹤與監控UI |
| 價格模式 | 開源免費與Enterprise訂製報價 |
| 是否需要註冊 | 開源版不需要;商業溝通需要聯絡官方 |
| 是否開源 | 是,核心庫採用Apache 2.0 |
| 雲端SaaS | 已停止提供 |
| 主要部署 | 本地、自有伺服器、私有雲或企業本地環境 |
推薦指數
推薦指數:4.6 / 5。Evidently涵蓋LLM與傳統機器學習,指標、報告、測試和監控之間的銜接十分完整,適合希望掌控數據與評測邏輯的技術團隊。
主要不足是開源部署需要工程與運維投入,非技術用戶可直接使用的無代碼和協作功能則集中在商業版中。Cloud退出SaaS後,團隊也需要重新評估託管成本與遷移方案。
常見問題
顯然AI免費嗎?
核心Python函式庫、Tracely以及基礎平台可免費使用,其授權條款為Apache 2.0。不過,若自行託管,仍需承擔伺服器、儲存空間、維護及安全方面的成本。
顯然 Cloud還能註冊使用嗎?
最新版的官方文件明確說明,Cloud已不再作為SaaS產品提供。舊頁面或舊文章中的免費雲套餐,不應再視為現行的選項。
可以評測LLM和RAG嗎?
可以。平台支援事實性、檢索相關性、語意相似度、PII、毒性、格式以及自訂LLM評審等面向,也能比較不同的模型與提示詞。
可以監控傳統機器學習模型嗎?
可以。Evidently支援分類、回歸、排序、推薦、資料品質及資料漂移,並能將批次結果儲存到自托管的儀表板中。
是否需要上傳數據到外部雲端?
開源函式庫和平台可以完全在自有環境中運行。是否需要調用外部的LLM評審器、遠端資料庫或對象儲存,則取決於團隊自身的設定。
開源監控介面有登入和權限管理嗎?
官方對比表顯示開源版不包含認證與角色權限。對外或多人部署時,需要使用網關、身份服務和網路策略補齊訪問控制。
Evidently會收集模型數據嗎?
官方稱,自托管UI的遙測功能並不會收集資料集的內容、欄位名稱、參數或代碼,單獨使用Python函式庫來產生報告時,也不會傳送遙測資料。UI的匿名遙測功能預設是開啟的,但也可以自行設定為關閉。
Evidently可以作為持續集成品質門禁嗎?
可以。將關鍵指標寫入Test Suite並設定閾值,就能在模型、提示詞或數據更新時輸出通過或失敗結果。
商業Enterprise版增加了什麼?
商業版主要增加無代碼資料生成與評測、無代碼儀表板、並排比較、告警、計劃任務、認證、角色權限、擴展後端及專屬支援。價格需聯繫銷售。
總結
顯然,AI適合那些希望以程式碼來定義AI品質、將離線評測轉換為回歸測試,並在自有環境中持續監控LLM與機器學習系統的團隊。
目前之選型應以開源自託管或Enterprise私有部署為主,不再依循過去的Cloud套餐規劃。在實際應用時,需同時考慮指標的有效性、人工校準、資料治理以及運維安全。
桂公網安備45132202000164號