ClearML是什么
ClearML是一套面向机器学习、生成式AI和基础设施团队的端到端MLOps与LLMOps平台。它覆盖实验跟踪、数据和模型版本、训练任务、流水线、GPU调度、模型服务以及企业级部署管理。
平台由Infrastructure Control Plane、AI Development Center和GenAI App Engine三层组成。用户既可以使用ClearML托管服务,也可以自托管公开代码,或购买VPC、本地、隔离网络和混合环境的商业方案。
一句话介绍
ClearML把AI实验、数据、模型、计算资源和生产端点纳入同一可追踪系统,并通过GenAI App Engine将开源或微调后的大模型部署到GPU集群,统一处理网络、认证、流量和监控。
平台三层架构
| 平台层 | 主要职责 | 适合团队 |
|---|---|---|
| Infrastructure Control Plane | GPU资源、队列、调度、自动扩缩和多集群治理 | 平台工程、DevOps与IT |
| AI Development Center | 实验、数据、训练、模型、流水线和协作 | 数据科学家与机器学习工程师 |
| GenAI App Engine | LLM、RAG、AI智能体和生成式应用部署 | LLM工程、应用开发与业务团队 |
| Platform Management Center | 跨租户活动、用量和成本管理 | 大型企业和服务提供商 |
主要功能
实验跟踪与可复现
ClearML Python SDK可以自动记录代码版本、未提交修改、依赖、参数、控制台输出、指标和系统资源。它还支持模型快照、图表、图片、音频、视频与任意制品。
- 按项目和子项目组织实验、模型、数据集和报告。
- 比较多次运行的参数、指标、环境和输出。
- 关联Git版本、依赖包和实际执行命令。
- 记录CPU、GPU、温度、磁盘、网络和其他运行状态。
- 从已有实验创建远程任务或可复用模板。
数据集版本管理
ClearML Dataset在对象存储之上维护可差分的数据版本和血缘关系。用户可以把数据放在S3、Google Cloud Storage、Azure、NAS或共享存储,并在代码中按版本获取。
模型仓库与血缘
模型仓库集中管理模型文件、状态、标签、项目和元数据,并把模型与生成它的实验关联。团队可以根据模型发布或状态变化触发后续动作。
任务队列与ClearML Agent
ClearML Agent在本地服务器、云主机、容器或Kubernetes中拉取任务,并按记录的代码与环境重建运行。队列和工作节点让开发人员无需手工登录GPU服务器执行每个实验。
流水线与自动化
用户可以把数据处理、训练、评估和发布步骤组成可调试流水线,也能基于数据集创建、模型发布或指标变化触发任务。Community具备基础流水线,Pro增加触发器与自动化界面。
云资源自动扩缩
Pro支持在AWS、Google Cloud和Azure中按队列需求启动或关闭计算资源。Scale与Enterprise进一步提供硬件无关调度、多集群、资源策略与更细粒度GPU管理。
远程开发与应用
付费方案提供远程IDE启动和ClearML Applications,用于在受管计算资源上运行交互式开发环境、仪表板或业务应用。应用实例可能按运行小时产生额外费用。
GenAI App Engine功能
一键部署LLM
GenAI App Engine可以从Hugging Face或ClearML模型仓库选择开源、定制或微调模型,并通过界面或CLI部署。官网列出vLLM、Llama.cpp和Triton等服务引擎。
安全模型端点
平台为部署后的模型建立受认证端点,并处理网络、访问控制和流量路由。企业可以通过RBAC限制不同团队、应用和业务单元能够调用的模型与数据。
动态路由与水平扩缩
请求可在模型副本和计算节点之间动态路由,并根据负载水平扩展。这样可以在高峰期增加可用容量,在低负载时减少闲置GPU。
统一内存与成本优化
ClearML公开介绍的Unified Memory会把闲置模型保留在CPU内存,并为活跃模型释放GPU空间。实际节省取决于模型大小、节点内存、启动延迟和调用模式。
端点监控
管理员可以查看请求量、延迟、CPU、GPU、内存、输入输出和网络资源。生产使用还应增加业务质量、错误率、提示安全和用户反馈等应用层指标。
RAG与向量数据库
GenAI App Engine支持检索增强生成工作负载,Scale与Enterprise提供Hyper-Datasets和向量数据库集成。团队可以部署嵌入模型,并把文档处理、索引、检索和回答组织成流水线。
AI智能体与自定义应用
平台可以部署AI智能体,跟踪其调用与性能,并为内部用户创建定制启动向导和界面。Custom Apps属于Enterprise能力,普通开源组件和托管套餐不应默认视为全部包含。
完整MLOps工作流程
- 选择托管服务或搭建ClearML Server,并创建工作区凭证。
- 安装Python SDK,在训练代码中初始化ClearML Task。
- 运行小型实验,检查代码、参数、指标、模型和制品是否完整记录。
- 把数据整理为带版本的数据集,并配置对象存储和访问权限。
- 创建Agent与队列,让训练任务在指定CPU或GPU资源上远程执行。
- 将预处理、训练、评估和注册模型组成流水线。
- 通过模型仓库审批待发布版本,并部署到测试端点。
- 验证性能、安全和回滚后进入生产,持续监控资源与模型表现。
使用教程
接入第一个Python实验
- 创建ClearML工作区并生成访问凭证。
- 在开发环境安装clearml Python包。
- 运行clearml-init并将SDK连接到目标Server。
- 在代码入口创建Task,填写项目名和任务名。
- 执行训练脚本,确认控制台、参数、指标和资源监控自动出现。
- 上传一个测试模型和制品,并检查能否从任务页面追溯。
- 验证无敏感环境变量或密钥被记录后,再扩展到正式项目。
部署一个LLM端点
- 在受管集群中注册GPU节点,并为推理任务建立独立队列。
- 选择模型渠道,核对权重许可证、显存需求和量化方式。
- 选择vLLM、Llama.cpp、Triton或适合模型的服务引擎。
- 设置GPU、CPU、内存、副本、扩缩范围和闲置策略。
- 配置认证、RBAC、网络入口和允许访问的用户或服务。
- 用测试请求检查输出、延迟、并发、错误与资源占用。
- 设置监控与告警,再通过灰度流量逐步开放生产使用。
搭建自托管Server
- 准备独立主机或Kubernetes环境,并先阅读对应版本的部署文档。
- 为Web、API和文件服务规划网络、域名、证书和存储。
- 部署ClearML Server组件并创建可靠的数据目录与备份。
- 关闭不需要的公网入口,配置登录认证和最小权限。
- 让SDK与Agent连接内部Server,并运行无敏感数据的测试任务。
- 验证备份恢复、升级流程、日志保留和密钥轮换。
- 再迁移正式实验、模型和数据,并持续更新安全补丁。
适合哪些用户
- 个人研究者与高校团队:免费托管或自托管实验跟踪和数据版本。
- 机器学习工程师:管理训练任务、模型、数据和可复现环境。
- MLOps团队:构建流水线、远程执行、自动化和模型发布流程。
- LLM工程师:部署开源或微调模型、RAG和AI智能体。
- 平台工程团队:统一调度本地、云端和Kubernetes中的GPU资源。
- 大型企业:在VPC、本地、隔离网络或混合环境运行AI平台。
- AI服务提供商:使用多租户管理、用量、配额和成本控制能力。
典型使用场景
- 跟踪深度学习实验并比较参数、指标和代码差异。
- 将训练从笔记本迁移到远程GPU队列。
- 维护数据集、模型版本和完整血缘。
- 在数据更新或模型发布后自动执行流水线。
- 部署内部大模型服务并按团队控制访问。
- 为企业知识库构建文档处理、向量检索和RAG回答链路。
- 根据请求负载扩缩推理副本并监控GPU利用率。
- 在隔离网络中运行不允许外发数据的AI工作负载。
产品优势
- 从实验到模型服务覆盖较完整,减少多个独立工具之间的拼接。
- Python代码通常只需少量接入即可自动记录大量运行信息。
- 支持托管、自托管、VPC、本地、隔离网络和混合部署。
- ClearML Agent可以在裸机、云和Kubernetes之间复现任务。
- GenAI App Engine把模型引擎、网络、认证、路由和监控集中管理。
- 开放SDK、Agent、Serving和Web组件,便于审计与扩展。
- Community托管方案对3人以内团队免费,并包含明确基础额度。
- Enterprise提供高级调度、配额、RBAC、LDAP和专业服务。
使用限制与注意事项
- ClearML不是免配置的聊天机器人,部署和运维需要Python、容器、网络和GPU知识。
- 免费托管仅适合3人以内团队,并受存储、指标事件和API调用额度限制。
- Pro按席位收费,超出赠送容量后还会产生存储、指标、调用和应用小时费。
- Scale和Enterprise没有公开固定价格,需要根据GPU规模、部署和支持询价。
- GenAI App Engine的全部企业能力并不包含在Community或Pro中。
- 自托管需要自行负责数据库、对象存储、备份、升级、认证、证书和安全补丁。
- 实验自动记录可能意外捕获代码差异、参数、路径或控制台中的敏感信息。
- 第三方模型和数据集仍受各自许可证、隐私与出口限制。
- 动态扩缩和CPU卸载会在成本、吞吐和冷启动延迟之间产生权衡。
- 模型端点监控不等于输出质量、安全和合规已经得到保证。
- 不同代码仓库使用Apache-2.0与SSPL等不同许可证,不能用一个标签概括。
- 官网把自托管称为100% Open Source,但Server实际采用SSPL v1.0,采购与分发前应逐仓库核对。
价格与套餐
以下价格于2026年8月21日核验,币种为美元。ClearML托管AI Development Center提供Community和Pro,私有环境使用Scale或Enterprise;自托管软件本身可免费部署,但基础设施和运维成本由用户承担。
| 套餐 | 价格 | 团队或规模 | 核心额度 | 适合场景 |
|---|---|---|---|---|
| Community Hosted | 0美元,无需信用卡 | 最多3人 | 100GB制品、1GB指标事件、每月100万次API调用 | 个人、研究、高校和小团队 |
| Pro Hosted | 15美元/用户/月加用量费 | 最多10人 | 120GB制品、1.2GB指标事件、每月120万次API调用 | 需要自动扩缩与高级自动化的团队 |
| Scale | 定制报价 | 8至48块GPU,VPC | 按合同 | 需要向量、Kubernetes、SSO和基础设施控制的组织 |
| Enterprise | 定制报价 | 多个大型项目 | 按合同 | 本地、VPC、隔离网络、多云或混合部署 |
| Self-hosted | 软件许可不收订阅费 | 自行规划 | 受自有硬件与存储限制 | 愿意自行运维的团队 |
Pro额外用量价格
| 计费项目 | 包含额度 | 超出价格 |
|---|---|---|
| Artifact Storage | 120GB | 每增加1GB收0.10美元 |
| Metric Events | 1.2GB | 每增加1MB收0.01美元 |
| API Calls | 每月120万次 | 每增加10万次收1美元 |
| Application运行 | 按应用实际运行 | 每个应用每小时0.04美元 |
| 计算资源 | 不包含在标准席位价中 | 由用户云账户或私有硬件承担 |
Community与Pro主要是托管AI Development Center价格,不代表包含全部Scale和Enterprise基础设施控制或GenAI能力。购买前应把席位、托管用量、GPU、对象存储、网络和支持一起计算。
部署方式与平台
| 方式 | 支持情况 | 主要特点 |
|---|---|---|
| ClearML Hosted | 支持 | 快速注册,平台代管Server |
| Self-hosted | 支持 | Docker、虚拟机或Kubernetes,自行运维 |
| VPC | Scale与Enterprise | 部署在客户云网络中 |
| On-premises | Enterprise | 运行在企业本地集群 |
| Air-gapped | Enterprise | 面向隔离网络环境 |
| Hybrid与Multi-cloud | Enterprise | 统一管理多种计算资源 |
| 开发系统 | Windows、macOS和Linux | SDK与开发工具可在常见系统运行 |
| 计算环境 | 裸机、容器、Kubernetes和云主机 | 由Agent与控制平面编排 |
API、SDK与集成
ClearML提供Python SDK、REST API和CLI,覆盖任务、项目、数据集、模型、队列、流水线和自动化。Python包可通过常用包管理器安装,随后使用clearml-init配置目标Server。
- 机器学习框架包括PyTorch、TensorFlow、Keras、XGBoost、LightGBM和Scikit-learn等。
- 代码与环境可关联Git、Jupyter Notebook和远程IDE工作流。
- 存储支持S3、Google Cloud Storage、Azure、NAS和共享文件系统。
- 编排支持裸机、Docker、Kubernetes以及主流云平台。
- 模型服务可结合vLLM、Llama.cpp和Triton等引擎。
- 企业身份与权限可使用SSO、SAML、LDAP和RBAC,具体取决于方案。
开源情况与许可证
ClearML不是所有组件都使用同一许可证。核心Python SDK、ClearML Agent、ClearML Serving和ClearML Web公开仓库采用Apache License 2.0,允许在遵守许可证条件下使用和修改。
ClearML Server后端仓库采用Server Side Public License v1.0。企业专有能力、托管服务和商业支持不因基础组件公开而自动开放,使用前必须按所需组件逐项核对许可证。
| 组件 | 公开情况 | 许可证或授权 |
|---|---|---|
| ClearML Python SDK | 公开源码 | Apache-2.0 |
| ClearML Agent | 公开源码 | Apache-2.0 |
| ClearML Serving | 公开源码 | Apache-2.0 |
| ClearML Web | 公开源码 | Apache-2.0 |
| ClearML Server | 公开源码 | SSPL v1.0 |
| Scale与Enterprise增强功能 | 非完整公开 | 商业合同 |
隐私与安全
自托管开源版的数据存放位置和访问路径由部署者控制,ClearML开源隐私说明表示不会从终端用户常规收集个人数据、使用数据或Cookie,也没有例行访问部署内个人数据。托管服务则由ClearML及其服务商处理账号、日志和平台数据。
- 敏感模型、数据和制品优先使用客户控制的存储和私有网络。
- 实验参数、控制台输出和未提交代码可能包含密钥,接入前应进行过滤。
- 生产端点需要认证、RBAC、网络隔离、限流和审计。
- Enterprise支持SSO、LDAP、配置Vault和更细粒度权限。
- 隔离网络部署可以减少数据外发,但模型、镜像和更新需要离线供应流程。
- 自托管团队必须自行备份数据库、文件与对象存储,并验证恢复。
- 使用托管服务前应查看当前隐私政策、数据地区和子处理方。
- 不要把官网安全能力描述直接当作企业已经满足某项监管认证。
基本信息
| 字段 | 内容 |
|---|---|
| 工具名称 | ClearML |
| 工具类型 | MLOps、LLMOps、GPU基础设施与GenAI部署平台 |
| 核心层 | Infrastructure Control Plane、AI Development Center、GenAI App Engine |
| 价格模式 | 免费托管、按席位加用量、企业询价和自托管 |
| 免费托管 | 最多3人、100GB制品、每月100万次API调用 |
| Pro起价 | 15美元/用户/月加额外用量 |
| 部署方式 | Hosted、Self-hosted、VPC、本地、隔离网络和混合 |
| 主要SDK | Python |
| REST API | 有 |
| 官方GitHub | 有 |
| 是否开源 | 部分核心组件公开,许可证不统一 |
| SDK许可证 | Apache-2.0 |
| Server许可证 | SSPL v1.0 |
推荐指数
推荐指数为4.7分,满分5分。ClearML从实验、数据和模型管理延伸到GPU控制与GenAI部署,适合希望在同一平台贯通研发和生产的工程团队。
主要门槛是部署与治理复杂,GenAI和企业基础设施能力需要询价,并且开源组件许可证并不统一。小团队可以先从Community或独立实验项目验证,再决定是否扩大。
常见问题
ClearML免费吗?
有Community Hosted免费方案,最多3名团队成员,并提供100GB制品存储、1GB指标事件和每月100万次API调用。自托管组件也可以免费部署,但硬件和运维需要自行承担。
ClearML是开源工具吗?
核心组件公开,但许可证不同。Python SDK、Agent和Serving采用Apache-2.0,Server采用SSPL v1.0,商业Enterprise能力不全部公开。
ClearML可以部署LLM吗?
可以,GenAI App Engine支持从模型仓库或Hugging Face部署开源与微调模型,并可使用vLLM、Llama.cpp、Triton等引擎。完整能力与部署方式需按套餐确认。
ClearML支持RAG吗?
支持RAG工作负载、嵌入模型和向量数据库集成。Scale与Enterprise还提供Hyper-Datasets等数据能力,具体向量数据库和架构由项目选择。
Pro方案只有15美元席位费吗?
不是,15美元是每用户月费,还可能产生制品存储、指标事件、API调用、Application运行和实际计算资源费用。
可以完全在企业内网运行吗?
可以自托管,Enterprise还提供本地、隔离网络和混合部署。企业版的支持、RBAC、LDAP、配置Vault和高级调度需要商业合同。
需要修改大量训练代码吗?
基础实验跟踪通常只需初始化Task即可自动记录大量信息。复杂数据、流水线、模型服务和资源调度仍需要进一步配置。
ClearML提供API吗?
提供REST API、Python SDK和CLI,可管理任务、项目、数据集、模型和自动化。托管方案受每月API调用额度限制。
自托管数据会发送给ClearML吗?
开源隐私说明表示ClearML没有常规访问自托管终端用户数据。部署者仍需检查镜像、更新、遥测配置和所使用的第三方云服务。
适合没有DevOps经验的团队吗?
托管Community和Pro更容易开始,但GPU集群、私有部署和生产端点仍需要平台工程能力。完全自托管不适合没有容器、存储、网络和备份经验的团队。
总结
ClearML适合把零散实验、数据、模型和GPU资源收敛为可追踪、可调度和可部署的AI工程体系。GenAI App Engine进一步把LLM、RAG和智能体放入同一基础设施控制面。
选型时应同时核对功能层、部署方式、许可证和总成本。最稳妥的路线是先用免费托管或小型自托管验证实验追踪,再逐步引入队列、流水线和生产模型服务。
桂公网安备45132202000164号