Cleanlab 是什么
Cleanlab 是一组面向数据质量和 AI 输出可靠性的技术,包括开源 Python 库、Cleanlab Studio 数据整理服务、Trustworthy Language Model 与企业 AI Agent 控制平台。它既能在训练前发现脏数据,也能在生成式 AI 运行时识别可能错误的回答。
Cleanlab 于 2026 年 1 月 28 日被 Handshake 收购,团队宣布把重点放到前沿模型训练所需的高质量数据研究。收购公告明确承诺开源数据中心 AI 包继续维护,商业平台的长期独立路线则没有给出同等明确的承诺。
产品组成与开源边界
| 组件 | 主要用途 | 运行方式 | 开源状态 |
|---|---|---|---|
| cleanlab Python 库 | 发现标签错误、异常值、重复项、漂移和标注质量问题 | 本地 Python 环境 | Apache-2.0 |
| Cleanlab Studio | 自动分析、整理和修正文本、图像及表格数据 | 网页、Python API、命令行 | 托管服务不等同于开源 |
| cleanlab-studio 客户端 | 上传数据、创建项目、下载整理结果 | 本地 Python 或命令行 | MIT |
| TLM | 生成或评估大模型输出并返回可信度分数 | API 与 Python 客户端 | 商业服务 |
| Agent Detect 与 Remediate | 实时拦截低质量回答,组织专家修复与知识库改进 | SaaS、单租户或 VPC | 商业平台 |
公开客户端代码不代表后端服务、评分技术或企业平台全部开源。需要离线使用时,应优先确认目标功能是否真的包含在 Apache-2.0 的 cleanlab 包中。
开源数据质量检测
- Datalab 接收数据、标签、模型预测概率或特征向量,自动检查标签错误、离群点、近似重复、类别不平衡和其他数据问题。
- CleanLearning 可包装现有分类器,在噪声标签条件下识别可疑样本并训练更稳健的模型。
- 多标注者工具可估计共识标签和标注者质量,帮助决定哪些样本需要重新标注。
- 主动学习能力可排序下一批最值得标注或复核的数据,减少人工预算浪费。
- 专用接口覆盖二分类、多分类、多标签、实体识别、回归、图像分割、目标检测和分布外检测。
开源库通常依赖现有模型提供样本外预测概率或特征表示,它不是无需模型和数据准备的一键修复器。检测结果是复核优先级,不能不经人工判断就批量删除数据。
Cleanlab Studio 数据整理
- 网页界面适合无代码浏览问题样本、理解自动生成的数据质量字段并执行修正。
- Python API 支持文件、Pandas DataFrame 和 PySpark DataFrame,可自动化上传、项目运行与整理结果下载。
- 命令行适合在数据管线中认证、上传数据、创建项目和导出 cleanset。
- 可处理文本、图像、结构化表格、文档、多标签数据、多标注者数据和合成数据质量任务。
- 文档列出 Databricks、Snowflake 与 BigQuery 集成流程,实际权限和数据移动方式需按部署配置确认。
常见输入与输出
| 输入 | 常用格式或内容 | 输出 | 使用价值 |
|---|---|---|---|
| 文本或表格 | CSV、JSON、XLS、XLSX、DataFrame | 问题类型、质量分数、建议标签和整理列 | 发现错误记录、错标与异常 |
| 图像 | ZIP 或表格中引用的媒体 | 图像问题、标签质量和异常样本 | 减少视觉数据集中的坏样本 |
| 模型结果 | 预测概率、特征向量或预测标签 | 样本级与类别级质量信号 | 定位模型和数据共同暴露的问题 |
| 多标注者记录 | 同一样本的多个人工标签 | 共识、标注者质量和复核排序 | 改善众包或专家标注流程 |
TLM 可信度评分
TLM 的核心输出是 0 到 1 的 trustworthiness score。它可以自己生成回答并同时评分,也可以只评估来自任意大模型或人工编写的现有回复。
- RAG:同时考虑用户问题、系统指令与检索上下文,识别无关上下文、事实错误和不充分回答。
- AI Agent:可评估最终回答,也可检查内部模型调用和工具调用,在低分动作前触发人工批准。
- 结构化提取:对文档、数据库或转录中抽取的字段评分,把低可信结果送去复核。
- 分类与标注:限制候选类别、评估自动标签,并发现与人工标签显著冲突的样本。
- 离线评测:批量扫描生产日志或微调数据,优先查看最不可靠的回答,而不是随机抽样。
TLM 分数不是事实证明,也不是固定的合格线。文档提示低于 0.7 常被视为低分、高于 0.9 常被视为高分,但 0.7 到 0.9 的解释依任务而异,阈值必须用真实错误和业务代价校准。
AI Agent 检测与修复闭环
- Detect 在现有 Agent 和知识库外增加独立控制层,检查幻觉、检索错误、文档缺口、政策违规与恶意使用。
- 低可信回答可被隐藏、替换为保守回复、要求补充信息、升级到更强模型或转人工处理。
- Remediate 将失败案例交给业务专家,专家可修正答案、补充知识或调整规则,无需直接修改模型代码。
- 修复内容可再次用于响应相似问题,形成运行日志、专家判断与知识库更新的迭代流程。
- 与任意 AI 系统兼容的表述仍需要实际集成验证,包括消息格式、流式响应、工具调用和身份权限。
TLM 快速接入流程
- 创建 Cleanlab 账户并取得 TLM API 密钥,将密钥放在服务端环境变量中。
- 安装 TLM Python 客户端,在小规模真实样本上调用生成加评分方法,或只调用现有回复评分方法。
- 把完整系统指令、用户问题、检索内容和历史消息按原应用实际输入传给 TLM,避免遗漏影响判断的上下文。
- 人工标注正确与错误样本,比较不同基础模型、质量预设、推理强度和相似度设置。
- 根据错误成本选择阈值,并设计转人工、拒答、补充检索、重新生成或升级模型等回退策略。
- 上线后监控低分率、误拦截、漏检、延迟与 token 成本,定期重新校准而不是永久固定阈值。
开源库使用流程
- 安装 cleanlab,并准备原始数据、标签和与任务匹配的模型。
- 通过交叉验证生成样本外预测概率,或提取能表示样本相似性的特征向量。
- 运行 Datalab 的问题检测和报告,按问题类型、分数与类别检查最可疑样本。
- 让领域人员确认错标、重复、异常或分布外样本,记录保留、修正、重标或删除决定。
- 用整理后的数据重新训练同一模型,并在独立且已复核的测试集上比较表现。
- 将数据检查放进持续管线,监测新批次、漂移和标注者质量变化。
适合用户与场景
- 数据科学家:在不更换模型框架的情况下发现训练集和测试集问题。
- 机器学习工程师:为文本、图像、音频和表格任务建立持续数据质量门禁。
- LLM 与 RAG 团队:评估回答可靠性、检索上下文和结构化提取结果。
- 客服与员工助手团队:拦截高风险回答,并把失败样本交给业务专家修复。
- 受监管企业:通过单租户或自管 VPC 控制数据区域、网络和运维责任。
价格与方案
现行公开站点不再提供完整价格页,不能沿用历史套餐金额。TLM 文档确认可以领取免费 token,用完后按 token 计费,但免费数量和具体单价只在账户的 Usage 与 Billing 页面显示。
| 套餐或版本 | 价格 | 计费周期 | 核心权益或额度 | 适合用户 |
|---|---|---|---|---|
| cleanlab 开源库 | 免费 | 无订阅 | 本地数据质量算法;自行承担计算与运维 | 研究、个人与工程团队 |
| TLM 免费额度 | 0 美元起 | 一次性或账户额度,数量未公开 | API 密钥和免费 token | 原型与小规模验证 |
| TLM 按量 | 账户内显示 | 按 token | 多种基础模型和质量预设 | 持续 API 调用 |
| Cleanlab Studio | 暂未公开 | 暂未公开 | 网页、Python API、命令行与数据整理 | 数据分析和模型团队 |
| Enterprise | 联系销售 | 定制合同 | 批量折扣、私有部署及更多企业功能 | 高用量和受监管组织 |
不同基础模型、质量预设、候选回答数和推理设置会改变 TLM 成本与延迟。公开材料没有给出退款、免费 token 有效期或收购后的长期价格承诺,付款前应以账户结算页和合同为准。
部署与平台
| 部署方式 | 管理模式 | 数据控制特点 | 适合用户 |
|---|---|---|---|
| 多租户 SaaS | Cleanlab 托管 | 自动更新、租户隔离、静态与传输加密 | 希望快速上线的团队 |
| 单租户 SaaS | 独立托管环境 | 可定制配置与区域控制 | 有更严格隔离要求的企业 |
| 自管 VPC | 部署在客户云环境 | 客户控制网络、基础设施和合规边界 | 数据驻留和监管要求较高的组织 |
| 本地开源库 | 客户自行运行 | 数据无需发送到商业服务 | 只需要数据质量算法的团队 |
能力边界
- 可信度分数是错误风险信号,可能对正确回答给低分,也可能漏掉错误;高风险决策不能取消人工复核。
- 同一提示的评分可能非确定,缓存通常可让重复请求暂时得到相同结果,但文档称缓存会在约 30 天或内部更新时刷新。
- 开源库的质量取决于模型预测概率、特征表示、交叉验证和任务假设;输入信号差会降低诊断价值。
- 自动修正标签可能把少数但真实的边缘样本当作错误,删除前需保留审计记录和可恢复副本。
- 被 Handshake 收购后,开源包的继续维护已明确,但商业产品、账户入口和企业路线仍应在采购前确认。
隐私、安全与条款
- 隐私政策列出注册资料、上传的数据与代码、使用记录、设备、推断位置、通信和第三方账户信息。
- 支付由 Stripe 处理,站点分析可能使用 Google Analytics;上传到 SaaS、Studio 或 TLM 的内容会由服务处理。
- 隐私政策允许为维护、改进、开发新产品、分析和去标识聚合用途处理信息,但未在公开文本中给出上传内容的固定保存期或清晰的模型训练排除规则。
- 安全页面称已通过 SOC 2 审计,并进行独立渗透测试、静态分析、动态分析和持续安全审计。
- 服务条款禁止未经书面同意的竞争性访问和商业基准测试;非商业基准还要求公开可复现实验代码和数据。
- 条款和隐私政策生效日期均为 2022 年 2 月 18 日,早于当前商业平台和 2026 年收购,企业用户应要求最新订单、数据处理协议和分包商清单。
总结
Cleanlab 的独特之处是把训练数据诊断、LLM 输出评分和人工修复工作流连接起来,同时保留可本地运行的 Apache-2.0 数据质量库。当前最稳妥的选择是按需求区分开源库、TLM、Studio 与企业控制平台,并在收购后的采购中重新确认服务持续性、价格和数据条款。
桂公网安备45132202000164号