ClearML是什麼
ClearML是一套針對機器學習、生成式AI及基礎設施團隊的端到端MLOps與LLMOps平台。它涵蓋實驗追蹤、資料與模型版本管理、訓練任務處理、流水線架構、GPU調度、模型服務,以及企業級部署管理等功能。
該平台由基礎設施控制層、AI開發中心以及GenAI應用引擎這三個層次所構成。使用者既可以使用ClearML的託管服務,也可以自行託管公開代碼;此外,還可以購買VPC、本地網路、隔離式網路以及混合式環境等商業解決方案。
一句話介紹
ClearML將AI實驗、資料、模型、運算資源以及生產端點整合至同一個可追蹤的系統中,並透過GenAI App Engine將開源或經過微調的大型模型部署到GPU集群上,從而統一處理網路、認證、流量及監控等相關事務。
平台三層架構
| 平台層 | 主要職責 | 適合團隊 |
|---|---|---|
| Infrastructure Control Plane | GPU資源、隊列、調度、自動擴縮和多集群治理 | 平台工程、DevOps與IT |
| AI Development Center | 實驗、數據、訓練、模型、流水線和協作 | 數據科學家與機器學習工程師 |
| GenAI App Engine | LLM、RAG、AI智能體和生成式應用部署 | LLM工程、應用開發與業務團隊 |
| Platform Management Center | 跨租戶活動、用量和成本管理 | 大型企業和服務供應商 |
主要功能
實驗追蹤與可重現
ClearML Python SDK能自動記錄程式碼版本、未提交的修改內容、依賴項目、參數、控制台輸出、指標以及系統資源。它還支援模型快照、圖表、圖片、音頻、影片以及各種產品。
- 按項目和子項目組織實驗、模型、資料集和報告。
- 比較多次運行的參數、指標、環境和輸出。
- 關聯Git版本、依賴套件和實際執行命令。
- 記錄CPU、GPU、溫度、磁盤、網路及其他運行狀態。
- 從已有實驗創建遠端任務或可重複使用的模板。
資料集版本管理
ClearML Dataset在對象儲存上維護可差分的多個資料版本以及其來源關係。使用者可以將資料儲存在S3、Google Cloud Storage、Azure、NAS或共享儲存中,並在程式碼中依據版本來取得相應的資料。
模型倉庫與血緣
模型倉庫用於集中管理模型檔案、狀態、標籤、專案以及元資料,並將模型與用於生成它的實驗相關聯。團隊可以根據模型的發布狀態或變化來觸發後續動作。
任務隊列與ClearML Agent
ClearML Agent會從本地伺服器、雲端主機、容器或Kubernetes中取得任務,並根據記錄下的程式碼與環境來重新執行該任務。透過隊列和工作節點的設計,開發人員不必手動登入GPU伺服器來執行每個實驗。
流水線與自動化
使用者可以將資料處理、訓練、評估和發布等步驟組合成可調整的流程線,亦可根據資料集來建立模型、發布模型,或是依據指標變化來觸發任務。Community版本具備基礎的流程線,而Pro版本則增加了觸發器與自動化介面。
雲資源自動擴縮
Pro版本支援在AWS、Google Cloud和Azure上,根據隊列需求來啟動或關閉計算資源。而Scale與Enterprise版本則進一步提供了與硬體無關的調度功能、多集群管理、資源策略設定,以及更細粒度的GPU管理功能。
遠端開發與應用
付費方案提供遠端IDE啟動功能以及ClearML應用程式,可用於在受管理的運算資源上執行互動式開發環境、儀表板或業務應用程式。應用程式的執行時間可能會產生額外費用。
GenAI App Engine功能
一鍵部署LLM
GenAI App Engine可以從Hugging Face或ClearML模型倉庫中選擇開源、自訂或經過微調的模型,並透過介面或CLI來進行部署。官網上列出了vLLM、Llama.cpp和Triton等服務引擎。
安全模型端點
平台會為部署後的模型建立經過認證的端點,並負責處理網路、存取控制以及流量路由等相關事務。企業可以透過 RBAC 來限制不同團隊、應用程式和業務單元能夠調用的模型與資料。
動態路由與水平擴縮
請求可在模型副本和計算節點之間動態路由,並根據負載水平擴展。這樣可以在高峰期增加可用容量,在低負載時減少閒置GPU。
統一記憶體與成本優化
ClearML公開介紹的Unified Memory會將閒置的模型保留在CPU記憶體中,並為正在運作的模型釋出GPU空間。實際能節省的空間則取決於模型的大小、節點的記憶體容量、啟動延遲以及呼叫模式。
端點監控
管理員可以查看請求量、延遲、CPU、GPU、記憶體、輸入輸出以及網路資源的狀況。在實際運作中,還應加入業務品質、錯誤率、安全性以及使用者回饋等應用層面的指標。
RAG與向量資料庫
GenAI App Engine支援用於增強生成工作的檢索功能,而Scale與Enterprise版本則提供Hyper-Datasets及向量資料庫的整合功能。團隊可以部署嵌入式模型,並將文件處理、索引建立、檢索以及回應等步驟組合成一個流水線。
AI智能體與自訂應用
平台可以部署AI智能體,追蹤其呼叫次數與效能表現,並為內部用戶打造自訂的啟動向導與介面。Custom Apps屬於Enterprise功能,一般的開源組件及託管方案不應被視為已包含此功能。
完整MLOps工作流程
- 選擇託管服務或搭建ClearML Server,並創建工作區憑證。
- 安裝Python SDK,在訓練代碼中初始化ClearML Task。
- 運行小型實驗,檢查代碼、參數、指標、模型和製品是否完整記錄。
- 將數據整理為帶版本的資料集,並配置對象儲存與訪問權限。
- 建立Agent與隊列,讓訓練任務在指定的CPU或GPU資源上遠端執行。
- 將預處理、訓練、評估和註冊模型組成流水線。
- 透過模型倉庫審批待發布版本,並部署到測試端點。
- 驗證性能、安全與回滾後進入生產,持續監控資源與模型表現。
使用教學
接入第一個Python實驗
- 建立ClearML工作區並產生存取憑證。
- 在開發環境安裝clearml Python套件。
- 運行clearml-init並將SDK連接到目標Server。
- 在代碼入口處建立任務,填入專案名稱和任務名稱。
- 執行訓練腳本,確認控制台、參數、指標和資源監控自動出現。
- 上傳一個測試模型和製品,並檢查能否從任務頁面追溯。
- 驗證無敏感環境變數或金鑰被記錄後,再擴展到正式專案。
部署一個LLM端點
- 在受管集群中註冊GPU節點,並為推理任務建立獨立隊列。
- 選擇模型渠道,核對權重許可證、顯存需求和量化方式。
- 選擇vLLM、Llama.cpp、Triton或適合模型的服務引擎。
- 設定GPU、CPU、記憶體、副本、擴縮範圍和閒置策略。
- 配置認證、RBAC、網路入口以及允許訪問的用戶或服務。
- 用測試請求檢查輸出、延遲、併發、錯誤與資源佔用。
- 設定監控與告警,再透過灰度流量逐步開放生產使用。
搭建自託管Server
- 準備獨立主機或Kubernetes環境,並先閱讀對應版本的部署文件。
- 為Web、API和檔案服務規劃網路、域名、憑證和儲存。
- 部署ClearML Server組件並創建可靠的名稱空間與備份。
- 關閉不需要的公網入口,配置登入認證和最小權限。
- 讓SDK與Agent連接內部Server,並運行無敏感數據的測試任務。
- 驗證備份恢復、升級流程、日誌保留和金鑰輪換。
- 再遷移正式實驗、模型和數據,並持續更新安全補丁。
適合哪些用戶
- 個人研究人員與高校團隊:免費託管或自託管實驗追蹤與數據版本。
- 機器學習工程師:管理訓練任務、模型、數據及可重複的環境。
- MLOps團隊:建構流水線、遠端執行、自動化以及模型發布流程。
- LLM工程師:部署開源或微調模型、RAG和AI智能體。
- 平台工程團隊:統一調度本地、雲端和Kubernetes中的GPU資源。
- 大型企業:在VPC、本地、隔離網路或混合環境中運行AI平台。
- AI服務供應商:具備多租戶管理、用量、配額及成本控制功能。
典型使用場景
- 追蹤深度學習實驗並比較參數、指標和代碼差異。
- 將訓練從筆記型電腦遷移到遠端GPU隊列。
- 維護資料集、模型版本和完整血緣。
- 在數據更新或模型發布後自動執行流水線。
- 部署內部大模型服務並按團隊控制訪問。
- 為企業知識庫構建文件處理、向量檢索和RAG回答鏈路。
- 根據請求負載擴縮推理副本並監控GPU利用率。
- 在隔離網絡中運行不允許外發數據的AI工作負載。
產品優勢
- 從實驗到模型服務的覆蓋較完整,減少多個獨立工具之間的拼接。
- Python代碼通常只需少量接入即可自動記錄大量運行資訊。
- 支援託管、自託管、VPC、本地、隔離網路及混合部署。
- ClearML Agent可以在裸機、雲端和Kubernetes之間重複執行任務。
- GenAI App Engine將模型引擎、網路、認證、路由和監控集中管理。
- 開放SDK、Agent、Serving和Web組件,便於審計與擴展。
- Community託管方案對3人以內團隊免費,並包含明確基礎額度。
- Enterprise提供高級調度、配額、RBAC、LDAP以及專業服務。
使用限制與注意事項
- ClearML並非免配置的聊天機器人,部署與運維需要Python、容器、網路及GPU的相關知識。
- 免費託管僅適合3人以內的團隊,並受儲存空間、指標事件及API呼叫次數的限制。
- Pro依席位收費,超出贈送容量後還會產生儲存、指標、調用和應用小時費。
- Scale和Enterprise沒有公開固定價格,需要根據GPU規模、部署和支持來詢價。
- GenAI App Engine的所有企業級功能,並不包含在Community或Pro版本中。
- 自託管需要自行負責資料庫、對象儲存、備份、升級、認證、憑證和安全補丁。
- 實驗自動記錄可能意外擷取代碼差異、參數、路徑或控制台中的敏感資訊。
- 第三方模型和資料集仍受各自許可證、隱私與出口限制。
- 動態擴縮和CPU卸載會在成本、吞吐和冷啟動延遲之間產生權衡。
- 模型端點監控不等於輸出品質、安全與合規已經得到保證。
- 不同代碼倉庫使用Apache-2.0與SSPL等不同許可證,不能用一個標籤概括。
- 官網將自託管稱為100% Open Source,但伺服器實際採用SSPL v1.0,採購與分發前應逐倉庫核對。
價格與套餐
以下價格於2026年8月21日核驗,幣種為美元。ClearML託管AI Development Center提供Community和Pro兩種方案,而私人環境則可選擇Scale或Enterprise;自託管軟體本身可免費部署,但基礎設施及運維成本則由使用者承擔。
| 套餐 | 價格 | 團隊或規模 | 核心額度 | 適合場景 |
|---|---|---|---|---|
| Community Hosted | 0美元,無需信用卡 | 最多3人 | 100GB製品、1GB指標事件、每月100萬次API呼叫 | 個人、研究、高校和小團隊 |
| Pro Hosted | 15美元/用戶/月加用量費 | 最多10人 | 120GB製品、1.2GB指標事件、每月120萬次API調用 | 需要自動擴縮與高級自動化的團隊 |
| Scale | 訂製報價 | 8至48塊GPU,VPC | 按合約 | 需要向量、Kubernetes、SSO和基礎設施控制的組織 |
| Enterprise | 訂製報價 | 多個大型項目 | 按合約 | 本地、VPC、隔離網路、多雲或混合部署 |
| Self-hosted | 軟體許可不收訂閱費 | 自行規劃 | 受自有硬件與儲存限制 | 願意自行運維的團隊 |
Pro額外用量價格
| 計費項目 | 包含額度 | 超出價格 |
|---|---|---|
| Artifact Storage | 120GB | 每增加1GB收0.10美元 |
| Metric Events | 1.2GB | 每增加1MB收0.01美元 |
| API Calls | 每月120萬次 | 每增加10萬次收1美元 |
| 應用程式運行 | 按應用實際運行 | 每個應用每小時0.04美元 |
| 計算資源 | 不包含在標準席位價中 | 由用戶雲帳戶或私有硬體承擔 |
Community與Pro主要是託管AI Development Center的價格,並不包含所有的Scale和Enterprise基礎設施控制功能或GenAI能力。購買前應將席位、託管用量、GPU、對象儲存、網路及支援服務一起計算。
部署方式與平台
| 方式 | 支持情況 | 主要特點 |
|---|---|---|
| ClearML Hosted | 支持 | 快速註冊,平台代管Server |
| Self-hosted | 支持 | Docker、虛擬機或Kubernetes,自行運維 |
| VPC | Scale與Enterprise | 部署在客戶雲網絡中 |
| On-premises | Enterprise | 運行在企業本地集群 |
| Air-gapped | Enterprise | 面向隔離網路環境 |
| Hybrid與Multi-cloud | Enterprise | 統一管理多種計算資源 |
| 開發系統 | Windows、macOS和Linux | SDK與開發工具可在常見系統運行 |
| 計算環境 | 裸機、容器、Kubernetes和雲主機 | 由Agent與控制平面編排 |
API、SDK與整合
ClearML提供Python SDK、REST API和CLI,用於處理任務、專案、資料集、模型、隊列、流水線以及自動化相關的功能。Python套件可透過常見的套件管理器來安裝,之後再使用clearml-init來設定目標伺服器。
- 機器學習框架包括PyTorch、TensorFlow、Keras、XGBoost、LightGBM和Scikit-learn等。
- 代碼與環境可關聯Git、Jupyter Notebook和遠端IDE工作流。
- 儲存可支援S3、Google Cloud Storage、Azure、NAS及共享檔案系統。
- 編排支援裸機、Docker、Kubernetes以及主流雲平台。
- 模型服務可結合vLLM、Llama.cpp和Triton等引擎。
- 企業身份與權限可使用SSO、SAML、LDAP和RBAC,具體取決於方案。
開源情況與許可證
ClearML並非所有的組件都使用相同的授權條款。核心的Python SDK、ClearML Agent、ClearML Serving以及ClearML Web的公開倉庫均採用Apache License 2.0,只要遵守該授權條款,就可以自由使用及修改這些組件。
ClearML Server後端倉庫採用Server Side Public License v1.0。企業專有技術、託管服務和商業支援並不會因基礎組件的公開而自動開放,使用前必須根據所需組件逐一核對許可證。
| 組件 | 公開情況 | 許可證或授權 |
|---|---|---|
| ClearML Python SDK | 公開源碼 | Apache-2.0 |
| ClearML Agent | 公開源碼 | Apache-2.0 |
| ClearML Serving | 公開源碼 | Apache-2.0 |
| ClearML Web | 公開源碼 | Apache-2.0 |
| ClearML Server | 公開源碼 | SSPL v1.0 |
| Scale與Enterprise增強功能 | 非完整公開 | 商業合約 |
隱私與安全
自託管開源版的資料存放位置及存取路徑由部署者掌控,ClearML的開源隱私說明中指出,它不會從終端用戶那裡收集個人資料、使用這些資料或 Cookie,也不會定期存取部署環境中的個人資料。至於託管服務,則由 ClearML 及其服務供應商負責處理帳號、日誌以及平台相關的資料。
- 敏感模型、數據和製品優先使用客戶控制的儲存和私有網路。
- 實驗參數、控制台輸出和未提交代碼可能包含金鑰,接入前應進行過濾。
- 生產端點需要認證、RBAC、網路隔離、限流和審計。
- Enterprise支援SSO、LDAP、配置Vault以及更細粒度的權限控制。
- 隔離網路部署可以減少資料外發,但模型、鏡像和更新需要離線供應流程。
- 自託管團隊必須自行備份資料庫、檔案與對象儲存,並驗證恢復。
- 使用託管服務前應查看當前隱私政策、數據地區和子處理方。
- 不要把官網安全能力描述直接當作企業已經滿足某項監管認證。
基本資訊
| 字段 | 內容 |
|---|---|
| 工具名稱 | ClearML |
| 工具類型 | MLOps、LLMOps、GPU基礎設施與GenAI部署平台 |
| 核心層 | 基礎建設控制平面、AI開發中心、生成式AI應用引擎 |
| 價格模式 | 免費託管、按席位加用量、企業詢價和自託管 |
| 免費託管 | 最多3人、100GB製品、每月100萬次API呼叫 |
| Pro起價 | 15美元/用戶/月加額外用量 |
| 部署方式 | 託管、自託管、VPC、本地、隔離網路及混合 |
| 主要SDK | Python |
| REST API | 有 |
| 官方GitHub | 有 |
| 是否開源 | 部分核心組件公開,許可證不統一 |
| SDK許可證 | Apache-2.0 |
| 伺服器許可證 | SSPL v1.0 |
推薦指數
推薦指數為4.7分,滿分為5分。ClearML的功能從實驗、資料及模型管理,延伸至GPU控制與GenAI部署,適合希望在同一平台上整合研發與生產流程的工程團隊。
主要門檻在於部署與治理十分複雜,GenAI及企業基礎設施的能力需要進行詢價,而且開源組件的許可證也並不統一。小團隊可以先透過社群或獨立實驗項目進行驗證,再決定是否要擴大規模。
常見問題
ClearML免費嗎?
有Community Hosted免費方案,最多3名團隊成員,並提供100GB的製品儲存空間、1GB的指標事件容量,以及每月100萬次的API呼叫次數。自托管組件也可以免費部署,但硬體及運維工作則需自行負責。
ClearML是開源工具嗎?
核心組件公開,但許可證不同。Python SDK、Agent和Serving採用Apache-2.0,Server採用SSPL v1.0,商業Enterprise功能並非全部公開。
ClearML可以部署LLM嗎?
可以,GenAI App Engine支援從模型倉庫或Hugging Face部署開源與微調模型,並可使用vLLM、Llama.cpp、Triton等引擎。完整功能與部署方式需按套餐確認。
ClearML支援RAG嗎?
支援RAG工作負載、嵌入式模型以及向量資料庫的整合。Scale與Enterprise還提供Hyper-Datasets等資料相關功能,至於具體的向量資料庫與架構則由專案需求來決定。
Pro方案只有15美元席位費嗎?
不是,15美元是每用戶的月費,還可能產生製品儲存、指標事件、API呼叫、應用程式運行以及實際計算資源的費用。
可以完全在企業內網運行嗎?
可自托管,Enterprise還提供本地、隔離網路及混合部署。企業版的支援、RBAC、LDAP、配置Vault以及進階排程功能,則需要簽訂商業合約。
需要修改大量訓練代碼嗎?
基礎實驗追蹤通常只需初始化任務即可自動記錄大量資訊。複雜的數據、流水線、模型服務以及資源調度則仍需進一步配置。
ClearML提供API嗎?
提供REST API、Python SDK和CLI,可用於管理任務、專案、資料集、模型以及自動化流程。託管方案受到每月API呼叫次數的限制。
自託管數據會發送給ClearML嗎?
開源隱私說明指出,ClearML並不會隨意存取使用者自行管理的資料。部署者仍需檢查鏡像、更新內容、遙測設定,以及所使用的第三方雲端服務。
適合沒有DevOps經驗的團隊嗎?
託管型 Community 和 Pro 模式較容易上手,但 GPU 集群、私人部署以及生產環境的設定,仍需要相關的平台工程能力。對於那些沒有容器、儲存、網路及備份相關經驗的團隊來說,完全自託管的方式並不適合他們。
總結
ClearML適合將零散的實驗、資料、模型以及GPU資源整合為可追蹤、可調度且可部署的AI工程體系。GenAI App Engine則進一步將LLM、RAG和智能體納入同一個基礎設施控制面中。
選型時應同時核對功能層、部署方式、許可證和總成本。最穩妥的路線是先以免費託管或小型自託管的方式進行驗證與測試,再逐步引入隊列、流水線和生產模型服務。
桂公網安備45132202000164號