Cleanlab
Cleanlab : pour faire fonctionner les modèles d’IA de manière plus efficace et plus simple
Étiquettes :Modèle d’entraînement d’IAQu’est-ce que Cleanlab ?
Cleanlab est un ensemble de technologies axées sur la qualité des données et la fiabilité des résultats générés par l’IA, comprenant des bibliothèques Python open source, le service de nettoyage de données Cleanlab Studio, un modèle de langage fiable ainsi qu’une plateforme de contrôle pour les agents d’IA d’entreprise. Il permet de détecter les données contaminées avant l’entraînement, ainsi que d’identifier des réponses potentiellement erronées en temps réel lors du fonctionnement de l’IA générative.
Le 28 janvier 2026, Cleanlab a été racheté par Handshake ; l’équipe a annoncé qu’elle se concentrerait sur la recherche de données de haute qualité nécessaires à l’entraînement de modèles de pointe. L’annonce de l’acquisition a clairement promis la poursuite de la maintenance des packages AI pour les centres de données open source, mais aucune promesse tout aussi claire n’a été faite concernant une voie indépendante à long terme pour la plateforme commerciale.
Composition du produit et limites du logiciel open source
| Composant | Utilisation principale | Mode de fonctionnement | Statut open source |
|---|---|---|---|
| bibliothèque CleanLab Python | Détecter les étiquettes erronées, les valeurs aberrantes, les doublons, le dérive et les problèmes de qualité des annotations | Environnement Python local | Apache-2.0 |
| Cleanlab Studio | Analyse, organisation et correction automatiques de textes, d’images et de données de tableaux | Pages web, API Python, ligne de commande | Les services de hébergement ne sont pas équivalents au logiciel open source |
| client cleanlab-studio | Télécharger des données, créer des projets, télécharger les résultats organisés | Python local ou ligne de commande | MIT |
| TLM | Générer ou évaluer les sorties des grands modèles et retourner un score de fiabilité | API et client Python | Services commerciaux |
| Agent Detect et Remediate | Interception en temps réel des réponses de faible qualité, organisation de la correction par des experts et amélioration de la base de connaissances | SaaS, unique locataire ou VPC | Plateforme commerciale |
La publication du code client ne signifie pas que les services backend, les techniques de notation ou la plateforme d’entreprise soient entièrement open source. Lorsqu’une utilisation hors ligne est nécessaire, il convient avant tout de vérifier si la fonctionnalité visée fait réellement partie du paquet cleanlab d’Apache-2.0.
Vérification de la qualité des données open source
- Datalab reçoit des données, des étiquettes, des probabilités de prédiction de modèles ou des vecteurs de caractéristiques, et vérifie automatiquement les erreurs d’étiquetage, les points aberrants, les doublons approximatifs, le déséquilibre des catégories et d’autres problèmes de données.
- CleanLearning peut emballer des classificateurs existants pour identifier des échantillons suspects en présence d’étiquettes bruitées et entraîner des modèles plus robustes.
- Outil à plusieurs annotateurs permet d’évaluer les étiquettes de consensus et la qualité des annotateurs, afin de déterminer quels échantillons nécessitent une re-annotation.
- La capacité d’apprentissage actif permet de classer le prochain lot de données les plus nécessitant une annotation ou une vérification, réduisant ainsi le gaspillage des ressources humaines.
- Les interfaces dédiées couvrent la classification binaire, la classification multiclasse, les multiples étiquettes, la reconnaissance d’entités, la régression, la segmentation d’images, la détection de cibles et la détection hors distribution.
Les bibliothèques open source dépendent généralement de modèles existants pour fournir des probabilités de prédiction hors échantillon ou des représentations de caractéristiques ; ce ne sont pas des solutions clés en main qui n’exigent ni modèle ni préparation des données. Les résultats de détection ont une priorité de révision, et il est impossible de supprimer des données en masse sans jugement humain.
Organisation des données Cleanlab Studio
- L’interface web permet de consulter des échantillons de problèmes sans code, de comprendre les champs de qualité des données générés automatiquement et d’apporter des corrections.
- L’API Python prend en charge les fichiers, les DataFrames de Pandas et les DataFrames de PySpark, permettant d’automatiser le téléchargement, l’exécution des projets et le téléchargement des résultats.
- La ligne de commande convient pour l’authentification dans les pipelines de données, le téléchargement de données, la création de projets et l’exportation de cleanset.
- Il peut gérer des tâches de qualité pour du texte, des images, des tableaux structurés, des documents, des données à plusieurs étiquettes, des données annotées par plusieurs personnes et des données synthétiques.
- Le document liste les processus d’intégration avec Databricks, Snowflake et BigQuery ; les droits réels et les modes de transfert des données doivent être confirmés en fonction des paramètres de déploiement.
Entrées et sorties courantes
| Entrée | Format ou contenu couramment utilisé | Sortie | Valeur d’usage |
|---|---|---|---|
| Texte ou tableau | CSV, JSON, XLS, XLSX, DataFrame | Type de question, pourcentage de qualité, étiquettes de recommandation et colonne de tri | Détecter les enregistrements erronés, les étiquetages incorrects et les anomalies |
| Image | Médias cités dans ZIP ou le formulaire | Problèmes d’images, qualité des étiquettes et échantillons anormaux | Réduire les échantillons défectueux dans le jeu de données visuelles |
| Résultats du modèle | Probabilité de prédiction, vecteur de caractéristiques ou étiquette de prédiction | Signaux de qualité au niveau de l’échantillon et au niveau de la catégorie | Problèmes exposés conjointement par le modèle de localisation et les données |
| Enregistrement à plusieurs annotateurs | Plusieurs étiquettes manuelles pour le même échantillon | Consensus, qualité des annotateurs et tri de la révision | Améliorer les processus de marquage par le crowdsourcing ou par des experts |
Score de fiabilité TLM
La sortie principale du TLM est un score de fiabilité allant de 0 à 1. Il peut générer des réponses et les évaluer en même temps, ou bien se contenter d’évaluer des réponses existantes provenant de n’importe quel grand modèle ou écrites manuellement.
- RAG : En tenant compte à la fois des questions de l’utilisateur, des instructions du système et du contexte de recherche, il identifie les contextes non pertinents, les erreurs factuelles et les réponses insuffisantes.
- Agent IA : Peut évaluer la réponse finale, vérifier les appels aux modèles internes et aux outils, et déclencher une approbation manuelle avant de lancer des actions à faible score.
- Extraction structurée : Évaluation des champs extraits de documents, de bases de données ou de transcriptions, et envoi des résultats peu fiables pour révision.
- Classification et annotation : restreindre les catégories candidates, évaluer les étiquettes automatiques, et identifier les échantillons en conflit significatif avec les étiquettes manuelles.
- Évaluation hors ligne : balayage en masse des journaux de production ou des données de fine-tuning, en se concentrant d’abord sur les réponses les moins fiables, plutôt qu’une sélection aléatoire.
Le score TLM n’est ni une preuve factuelle, ni un seuil de qualification fixe. En général, un score inférieur à 0,7 est considéré comme bas, et un score supérieur à 0,9 comme élevé, mais l’interprétation entre 0,7 et 0,9 varie en fonction de la tâche ; le seuil doit être calibré en fonction des erreurs réelles et du coût opérationnel.
Détection et correction en boucle fermée par l’agent IA
- Detect ajoute une couche de contrôle indépendante en dehors des agents et de la base de connaissances existants, afin de détecter les hallucinations, les erreurs de recherche, les lacunes dans les documents, les violations des politiques ainsi que l’utilisation malveillante.
- Les réponses à faible crédibilité peuvent être cachées, remplacées par des réponses plus prudentes, des informations supplémentaires peuvent être demandées, le modèle peut être mis à niveau vers un modèle plus puissant ou le traitement peut être transféré à un intervenant humain.
- Remediate transmet les cas d’échec aux experts métier, qui peuvent corriger les réponses, ajouter des connaissances ou ajuster les règles, sans avoir à modifier directement le code du modèle.
- Les corrections apportées peuvent être réutilisées pour répondre à des problèmes similaires, créant ainsi un processus itératif d’élaboration de journaux de fonctionnement, de jugements d’experts et de mise à jour de la base de connaissances.
- L’affirmation selon laquelle elle est compatible avec n’importe quel système d’IA nécessite encore une validation par intégration pratique, y compris le format des messages, les réponses en flux continu, les appels d’outils et les droits d’accès.
Processus d’accès rapide TLM
- Créez un compte Cleanlab et obtenez la clé API TLM ; placez cette clé dans une variable d’environnement du serveur.
- Installez le client Python TLM, appelez la méthode de génération et de notation sur des échantillons réels à petite échelle, ou appelez uniquement la méthode existante de notation des réponses.
- Transmettre aux TLM les instructions complètes du système, les questions des utilisateurs, le contenu des recherches et les messages historiques tels qu’ils ont été réellement saisis dans l’application, afin d’éviter tout oubli de contexte pouvant affecter le jugement.
- Marquer manuellement les échantillons corrects et incorrects, et comparer différents modèles de base, paramètres de qualité, niveaux d’inférence et réglages de similarité.
- Choisir le seuil en fonction du coût des erreurs, et concevoir des stratégies de fallback telles que le transfert à un opérateur humain, le refus de réponse, une recherche complémentaire, une génération répétée ou l’amélioration du modèle.
- Après mise en ligne, surveillez le taux de scores bas, les blocages erronés, les manquements aux détections, les retards et les coûts de tokens ; réajustez régulièrement plutôt que de fixer des seuils de manière permanente.
Processus d'utilisation des bibliothèques open source
- Installez CleanLab, et préparez les données brutes, les étiquettes ainsi que le modèle correspondant à la tâche.
- Générer des probabilités de prédiction hors échantillon par validation croisée, ou extraire des vecteurs de caractéristiques capables de représenter la similarité entre les échantillons.
- Exécuter la détection et la génération de rapports des problèmes dans Datalab, afin d’analyser les échantillons les plus suspects par type de problème, score et catégorie.
- Faire en sorte que les spécialistes du domaine identifient les échantillons mal étiquetés, dupliqués, anormaux ou hors distribution, et enregistrent les décisions de conservation, de correction, de réétiquetage ou de suppression.
- Entraîner à nouveau le même modèle avec les données organisées, et comparer ses performances sur un ensemble de test indépendant et vérifié.
- Intégrer la vérification des données dans le pipeline continu pour surveiller les nouvelles batches, la dérive et les variations de qualité des annotateurs.
Adapté aux utilisateurs et aux scénarios
- Scientifique des données : Détecter les problèmes sur l’ensemble d’entraînement et l’ensemble de test sans changer le cadre du modèle.
- Ingénieur en apprentissage automatique : Met en place des contrôles continus de qualité des données pour les tâches liées au texte, aux images, à l’audio et aux tableaux.
- Équipes LLM et RAG : évaluation de la fiabilité des réponses, recherche de contexte et extraction structurée des résultats.
- Équipe d’assistance client et d’aide au personnel : intercepter les réponses à haut risque et transmettre les échantillons défaillants aux experts métier pour correction.
- Entreprises régulées : contrôle des zones de données, du réseau et des responsabilités de maintenance via une VPC à un seul locataire ou gérée en interne.
Prix et forfaits
Les sites publics actuels ne proposent plus de page de prix complète, et il n’est pas possible d’utiliser les montants des forfaits antérieurs. Les documents TLM confirment qu’il est possible d’obtenir des tokens gratuits, et que le paiement s’effectue ensuite en fonction du nombre de tokens utilisés ; cependant, la quantité gratuite et le prix unitaire précis ne sont affichés que sur les pages Usage et Billing du compte.
| Forfait ou version | Prix | Période de facturation | Droits ou crédit principal | Adéquat pour les utilisateurs |
|---|---|---|---|---|
| bibliothèque open source CleanLab | Gratuit | Pas de abonnement | Algorithmes de qualité des données locales ; assumer soi-même le calcul et l’exploitation | Recherche, individus et équipes d’ingénierie |
| Limite gratuite TLM | À partir de 0 dollar | Une seule fois ou selon le plafond du compte, la quantité n’est pas divulguée | Clé API et jeton gratuit | Prototype et validation à petite échelle |
| TLM à la consommation | Affiché dans le compte | Par token | Divers modèles de base et paramètres de qualité prédéfinis | Appels API continus |
| Cleanlab Studio | Pas encore rendu public | Pas encore rendu public | Pages web, API Python, ligne de commande et organisation des données | Équipe d’analyse de données et de modélisation |
| Enterprise | Contacter le service des ventes | Contrat sur mesure | Remises par volume, déploiement privé et plus de fonctionnalités d’entreprise | Hautes doses et organisations réglementées |
Les différents modèles de base, les paramètres de qualité, le nombre de réponses candidates et les réglages de raisonnement influencent le coût et le délai du TLM. Les documents publics ne précisent ni remboursement, ni durée de validité des tokens gratuits, ni engagements de prix à long terme après acquisition ; il convient de se référer à la page de règlement du compte et au contrat avant de payer.
Déploiement et plateforme
| Mode de déploiement | Mode de gestion | Caractéristiques du contrôle des données | Adéquat pour les utilisateurs |
|---|---|---|---|
| SaaS multi-locataires | Hébergement Cleanlab | Mise à jour automatique, isolation des locataires, chiffrement statique et en transit | Équipe souhaitant un lancement rapide |
| SaaS à un seul locataire | Environnement de hébergement indépendant | Configuration personnalisable et contrôle régional | Entreprises ayant des exigences de quarantaine plus strictes |
| Gestion autonome VPC | Déployé dans l’environnement cloud du client | Le client contrôle le réseau, l’infrastructure et les limites de conformité | Organisations avec des exigences élevées en matière de résidence des données et de réglementation |
| Bibliothèque open source locale | Le client exécute lui-même | Les données n’ont pas besoin d’être envoyées à des services commerciaux. | Équipe ayant uniquement besoin d’algorithmes de qualité des données |
Limites des capacités
- Le score de fiabilité est un indicateur du risque d’erreur : il peut attribuer un faible score aux réponses correctes ou passer à côté des erreurs ; les décisions à haut risque ne peuvent pas être soumises à une révision manuelle.
- La note d’une même requête peut être incertaine ; le cache permet généralement aux requêtes répétées d’obtenir temporairement les mêmes résultats, mais selon le document, le cache est mis à jour tous les 30 jours environ ou lors d’une mise à jour interne.
- La qualité des bibliothèques open source dépend de la probabilité de prédiction du modèle, de la représentation des caractéristiques, de la validation croisée et des hypothèses relatives à la tâche ; une qualité médiocre des signaux d’entrée réduit la valeur diagnostique.
- La correction automatique des étiquettes peut considérer comme erronées un petit nombre d’échantillons marginaux mais réels ; il convient de conserver des traces d’audit et des copies restaurables avant de les supprimer.
- Après l’acquisition par Handshake, la maintenance continue des paquets open source est désormais assurée, mais les produits commerciaux, les points d’accès aux comptes et la stratégie entreprise doivent encore être confirmés avant l’achat.
Confidentialité, sécurité et conditions
- La politique de confidentialité énumère les informations d’inscription, les données et codes téléchargés, les historiques d’utilisation, les appareils, la localisation déduite, les communications et les informations relatives aux comptes tiers.
- Les paiements sont gérés par Stripe, l’analyse du site peut utiliser Google Analytics ; le contenu téléchargé sur SaaS, Studio ou TLM est traité par les services correspondants.
- La politique de confidentialité autorise le traitement des informations pour la maintenance, l’amélioration, le développement de nouveaux produits, ainsi que pour des analyses et des utilisations agrégées déidentifiées, mais ne précise pas dans le texte public une durée de conservation fixe pour les contenus téléchargés ni des règles claires d’exclusion pour l’entraînement des modèles.
- La page de sécurité indique avoir été auditée selon SOC 2, et avoir fait l’objet de tests d’infiltration indépendants, d’analyses statiques, d’analyses dynamiques et d’audits de sécurité continus.
- Les conditions d’utilisation interdisent les accès concurrentiels et les tests de référence commerciaux sans consentement écrit ; les tests de référence non commerciaux exigent en outre que le code d’essai et les données soient accessibles au public.
- Les dates d’entrée en vigueur des conditions générales et de la politique de confidentialité sont toutes deux le 18 février 2022, avant la plateforme commerciale actuelle et l’acquisition de 2026 ; les utilisateurs professionnels doivent demander les dernières versions des commandes, des accords de traitement des données et de la liste des sous-traitants.
Résumé
Ce qui rend Cleanlab unique, c’est qu’il relie le diagnostic des données d’entraînement, l’évaluation des sorties des LLM et le flux de travail de correction manuelle, tout en conservant une base de connaissances sur la qualité des données sous licence Apache-2.0 pouvant être exécutée localement. Pour l’instant, la solution la plus sûre consiste à distinguer selon les besoins les bibliothèques open source, TLM, Studio et les plateformes de contrôle d’entreprise, puis à réaffirmer après l’acquisition la continuité des services, les prix et les conditions relatives aux données.
Numéro d’enregistrement de sécurité publique du Guangxi : 45132202000164