Cleanlab 是什麼
Cleanlab是一組用於提升資料品質及AI輸出可靠性的技術,包含開源的Python函式庫、Cleanlab Studio資料整理服務、Trustworthy Language Model,以及企業級AI Agent控制平台。它不但能在訓練前發現有問題的資料,還能在生成式AI運作時識別出可能錯誤的回答。
Cleanlab 於 2026 年 1 月 28 日被 Handshake 收購,團隊宣布將重點放在前沿模型訓練所需的高品質數據研究上。收購公告明確承諾會繼續維護開源數據中心 AI 套件,但對於商業平台的長期獨立發展路線則沒有給出同樣明確的承諾。
產品組成與開源邊界
| 組件 | 主要用途 | 運行方式 | 開源狀態 |
|---|---|---|---|
| cleanlab Python 函式庫 | 發現標籤錯誤、異常值、重複項、漂移和標註品質問題 | 本地 Python 環境 | Apache-2.0 |
| Cleanlab Studio | 自動分析、整理和修正文本、圖像及表格數據 | 網頁、Python API、命令列 | 託管服務不等同於開源 |
| cleanlab-studio 客戶端 | 上傳數據、建立專案、下載整理結果 | 本地 Python 或命令行 | MIT |
| TLM | 生成或評估大模型輸出並返回可信度分數 | API 與 Python 客戶端 | 商業服務 |
| Agent Detect 與 Remediate | 實時攔截低品質回答,組織專家修復與知識庫改進 | SaaS、單租戶或 VPC | 商業平台 |
公開客戶端代碼並不代表後端服務、評分技術或企業平台都已經開源。若需離線使用時,應先確認目標功能是否真的包含在 Apache-2.0 的 cleanlab 套件中。
開源數據品質檢測
- Datalab 會接收數據、標籤、模型預測概率或特徵向量,並自動檢查標籤錯誤、離群點、近似重複、類別不平衡以及其他數據問題。
- CleanLearning 可包裝現有分類器,在雜訊標籤條件下識別可疑樣本並訓練更穩健的模型。
- 多標註者工具可估計共識標籤和標註者品質,幫助決定哪些樣本需要重新標註。
- 主動學習能力可排序下一批最值得標註或複核的數據,減少人工預算浪費。
- 專用介面覆蓋二分類、多分類、多標籤、實體識別、回歸、圖像分割、目標檢測和分佈外檢測。
開源庫通常依賴現有模型來提供樣本外的預測概率或特徵表示,它並非不需要模型與資料準備就能立即解決問題的工具。檢測結果僅具有參考價值,不得在未經人工判斷的情況下批量刪除資料。
Cleanlab Studio 數據整理
- 網頁介面適合無代碼瀏覽問題樣本、理解自動生成的數據品質欄位並執行修正。
- Python API 支援檔案、Pandas DataFrame 與 PySpark DataFrame,可自動化上傳、執行專案並下載整理後的結果。
- 命令行適合在資料管線中進行認證、上傳資料、建立專案以及導出 cleanset。
- 可處理文本、圖像、結構化表格、文件、多標籤數據、多註解者數據及合成數據品質任務。
- 文件列出了 Databricks、Snowflake 與 BigQuery 的整合流程,實際的權限與資料移動方式需依部署設定確認。
常見輸入與輸出
| 輸入 | 常用格式或內容 | 輸出 | 使用價值 |
|---|---|---|---|
| 文本或表格 | CSV、JSON、XLS、XLSX、DataFrame | 問題類型、品質分數、建議標籤和整理列 | 發現錯誤記錄、錯標與異常 |
| 圖像 | ZIP 或表格中引用的媒體 | 圖像問題、標籤品質和異常樣本 | 減少視覺數據集中的壞樣本 |
| 模型結果 | 預測概率、特徵向量或預測標籤 | 樣本級與類別級品質信號 | 定位模型和數據共同暴露的問題 |
| 多標註者記錄 | 同一樣本的多個人工標籤 | 共識、標註者品質和複核排序 | 改善眾包或專家標註流程 |
TLM 可信度評分
TLM 的核心輸出是 0 到 1 的可信度分數。它既可以自行生成回答並同時進行評分,也可以僅評估來自任何大型模型或人工編寫的現有回覆。
- RAG:同時考慮用戶問題、系統指令與檢索上下文,識別無關上下文、事實錯誤及不充分的回答。
- AI Agent:可評估最終回答,也可檢查內部模型調用和工具調用,在低分動作前觸發人工批准。
- 結構化提取:對文件、資料庫或轉錄中抽取的欄位進行評分,將可信度低的結果送去重新核驗。
- 分類與標註:限制候選類別、評估自動標籤,並發現與人工標籤有顯著衝突的樣本。
- 離線評測:批量掃描生產日誌或微調數據,優先查看最不可靠的回答,而不是隨機抽樣。
TLM 分數並非事實的證明,也不是固定的及格標準。一般而言,分數低於 0.7 被視為低分,而高於 0.9 則被視為高分,不過 0.7 到 0.9 之間的區間如何解釋則取決於具體任務,且這個閾值必須根據實際的錯誤率及業務上的影響來調整。
AI Agent 檢測與修復閉環
- Detect 在現有 Agent 和知識庫外增加獨立控制層,檢查幻覺、檢索錯誤、文件缺口、政策違規與惡意使用。
- 低可信回答可被隱藏、替換為保守回復、要求補充資訊、升級到更強模型或轉人工處理。
- Remediate會將失敗的案例交給業務專家,專家可以修正答案、補充知識或調整規則,無需直接修改模型代碼。
- 修復內容可再次用於回應類似問題,形成運行日誌、專家判斷與知識庫更新的迭代流程。
- 與任意 AI 系統相容的說法仍需實際整合驗證,包括消息格式、流式回應、工具調用以及身分權限。
TLM 快速接入流程
- 建立 Cleanlab 帳戶並取得 TLM API 金鑰,將金鑰置於伺服器環境變數中。
- 安裝 TLM Python 用戶端,在小規模真實樣本上調用生成加分數方法,或僅調用現有的回覆評分方法。
- 將完整系統指令、使用者問題、檢索內容及歷史訊息,依原應用實際輸入的方式傳給 TLM,避免遺漏影響判斷的上下文。
- 人工標註正確與錯誤樣本,比較不同基礎模型、品質預設、推理強度和相似度設定。
- 根據錯誤成本選擇閾值,並設計轉人工、拒答、補充檢索、重新生成或升級模型等回退策略。
- 上線後監控低分率、誤攔截、漏檢、延遲與 token 成本,定期重新校準而不是永久固定閾值。
開源庫使用流程
- 安裝 cleanlab,並準備原始數據、標籤以及與任務匹配的模型。
- 透過交叉驗證生成樣本外預測概率,或提取能表示樣本相似性的特徵向量。
- 運行 Datalab 的問題檢測與報告,按問題類型、分數與類別檢查最可疑樣本。
- 讓領域人員確認錯標、重複、異常或分佈外樣本,記錄保留、修正、重標或刪除決定。
- 用整理後的數據重新訓練同一模型,並在獨立且已複核的測試集上比較表現。
- 將數據檢查放入持續管線,監測新批次、漂移和標註者品質變化。
適合用戶與場景
- 數據科學家:在不更換模型框架的情況下發現訓練集和測試集問題。
- 機器學習工程師:為文本、圖像、音頻和表格任務建立持續的數據品質控制機制。
- LLM 與 RAG 團隊:評估回答的可靠性、檢索上下文以及結構化提取結果。
- 客服與員工助手團隊:攔截高風險回答,並將失敗樣本交給業務專家修復。
- 受監管企業:透過單租戶或自管 VPC 控制資料區域、網路及運維責任。
價格與方案
現行的公開網站已不再提供完整的價格頁面,因此無法沿用過去的套餐金額。根據 TLM 文件的說明,可以獲得免費的 token,用完之後則需按 token 的數量來計算費用,不過免費的 token 數量以及具體單價,都只會顯示在帳戶的 Usage 與 Billing 頁面上。
| 套餐或版本 | 價格 | 計費週期 | 核心權益或額度 | 適合用戶 |
|---|---|---|---|---|
| cleanlab 開源庫 | 免費 | 無訂閱 | 本地資料品質算法;自行承擔計算與運維 | 研究、個人與工程團隊 |
| TLM 免費額度 | 0 美元起 | 一次性或帳戶額度,數量未公開 | API 金鑰和免費 token | 原型與小規模驗證 |
| TLM 按量 | 帳戶內顯示 | 按 token | 多種基礎模型和品質預設 | 持續 API 呼叫 |
| Cleanlab Studio | 暫未公開 | 暫未公開 | 網頁、Python API、命令列與資料整理 | 數據分析與模型團隊 |
| Enterprise | 聯絡銷售 | 訂製合約 | 批量折扣、私有部署及更多企業功能 | 高用量和受監管組織 |
不同的基礎模型、品質預設、候選回答數量以及推理設定,都會影響 TLM 的成本與延遲時間。公開資料中並未說明退款規定、免費 token 的有效期,或是收購後的長期價格承諾,因此在付款前應以帳戶結算頁面及合約內容為準。
部署與平台
| 部署方式 | 管理模式 | 數據控制特點 | 適合用戶 |
|---|---|---|---|
| 多租戶 SaaS | Cleanlab 托管服務 | 自動更新、租戶隔離、靜態與傳輸加密 | 希望快速上線的團隊 |
| 單租戶 SaaS | 獨立託管環境 | 可訂製配置與區域控制 | 有更嚴格隔離要求的企业 |
| 自管 VPC | 部署在客戶雲環境 | 客戶控制網路、基礎設施和合規邊界 | 數據駐留和監管要求較高的組織 |
| 本地開源庫 | 客戶自行運行 | 數據無需發送到商業服務 | 只需要數據品質算法的團隊 |
能力邊界
- 可信度分數是錯誤風險信號,可能對正確回答給低分,也可能漏掉錯誤;高風險決策不能取消人工複核。
- 同一提示的評分可能非確定,快取通常可讓重複請求暫時得到相同結果,但文件稱快取會在約 30 天或內部更新時刷新。
- 開源庫的品質取決於模型預測概率、特徵表示、交叉驗證以及任務假設;輸入信號品質差會降低診斷價值。
- 自動修正標籤可能把少數但真實的邊緣樣本當作錯誤,刪除前需保留審計記錄和可恢復副本。
- 被 Handshake 收購後,開源套件的持續維護已明確,但商業產品、帳戶入口及企業路線仍應在採購前確認。
隱私、安全與條款
- 隱私政策列出註冊資料、上傳的數據與代碼、使用記錄、設備、推斷位置、通訊及第三方帳戶資訊。
- 付款由 Stripe 處理,網站分析則可能使用 Google Analytics;而上傳到 SaaS、Studio 或 TLM 的內容,則會由相關服務來處理。
- 隱私政策允許為了維護、改進、開發新產品、分析以及用於聚合用途而處理資訊,但並未在公開文本中說明上傳內容的固定保存期,也未列出明確的模型訓練排除規則。
- 安全頁面稱已通過 SOC 2 審計,並進行獨立滲透測試、靜態分析、動態分析及持續安全審計。
- 服務條款禁止在未獲書面同意的情況下進行競爭性訪問及商業性基準測試;對於非商業性的基準測試,則要求公開可重複運行的實驗代碼與數據。
- 條款及隱私政策之生效日期皆為 2022 年 2 月 18 日,早於目前的商業平台以及 2026 年的收購行動。企業用戶應要求獲得最新的訂單、資料處理協議以及分包商名單。
總結
Cleanlab 的獨特之處在於,它將訓練數據的診斷、LLM 的輸出評分以及人工修復流程結合在一起,同時還保留了可本地運行的 Apache-2.0 數據品質庫。目前最穩妥的做法是,根據需求來區分開源庫、TLM、Studio 以及企業控制平台,並在收購之後重新確認服務的持續性、價格及數據相關條款。
桂公網安備45132202000164號