Cleanlab
Cleanlab – damit KI-Modelle effizienter und einfacher arbeiten können
Tags:KI-TrainingsmodelleWas ist Cleanlab?
Cleanlab ist eine Reihe von Technologien zur Gewährleistung der Datenqualität und der Zuverlässigkeit der AI-Ergebnisse. Dazu gehören Open-Source-Python-Bibliotheken, der Cleanlab Studio für die Datenbereinigung, ein Trustworthy Language Model sowie eine Steuerungsplattform für Unternehmens-AI-Agenten. Cleanlab kann sowohl vor dem Training unzureichende Daten erkennen als auch während des Betriebs generativer KI möglicherweise fehlerhafte Antworten identifizieren.
Cleanlab wurde am 28. Januar 2026 von Handshake übernommen. Das Team kündigte an, sich auf die Erforschung hochwertiger Daten zu konzentrieren, die für den Trainings fortgeschrittener Modelle benötigt werden. In der Übernahmenerklärung wurde ausdrücklich zugesichert, dass die Open-Source-Datenbanken für KI weiterhin gepflegt werden. Für einen langfristig unabhängigen Weg für die kommerzielle Plattform gab es hingegen keine ähnlich klaren Zusagen.
Produktezusammensetzung und Open-Source-Grenzen
| Komponenten | Hauptverwendungszweck | Arbeitsweise | Open-Source-Zustand |
|---|---|---|---|
| CleanLab Python-Bibliothek | Fehlerhafte Etiketten, Ausreißer, Duplikate, Drift und Qualitätsprobleme bei den Beschriftungen feststellen | Lokales Python-Umfeld | Apache-2.0 |
| Cleanlab Studio | Automatische Analyse, Organisation und Korrektur von Texten, Bildern sowie Tabellendaten | Webseiten, Python-API, Kommandozeile | Hosted Services sind nicht dasselbe wie Open Source. |
| CleanLab-Studio-Klient | Daten hochladen, Projekte erstellen, Ergebnisse herunterladen und organisieren | Lokaler Python oder Kommandozeile | MIT |
| TLM | Erstellen oder bewerten von Ausgaben großer Modelle und Rückgabe eines Zuverlässigkeitswerts | API und Python-Client | Wirtschaftsdienstleistungen |
| Agent Detect und Remediate | Echtzeit-Blockierung von Antworten niedriger Qualität, Organisation von Experten zur Behebung sowie Verbesserung der Wissensdatenbank | SaaS, Einzelmieter oder VPC | Wirtschaftsplattformen |
Die Veröffentlichung des Client-Codes bedeutet nicht, dass auch die Backend-Dienste, die Bewertungstechnologien oder die Unternehmensplattformen vollständig open source sind. Wenn eine Nutzung offline erforderlich ist, sollte zunächst überprüft werden, ob die gewünschten Funktionen tatsächlich im Apache-2.0 CleanLab-Paket enthalten sind.
Open-Source-Datenqualitätsprüfung
- Datalab nimmt Daten, Labels, Wahrscheinlichkeiten von Modellvorhersagen oder Feature-Vektoren entgegen und überprüft automatisch auf Fehler in den Labels, Ausreißer, nahezu identische Werte, Klassendisbalancen und andere Datenprobleme.
- CleanLearning kann bestehende Klassifikatoren umhüllen, um unter Bedingungen von rauschenden Labels verdächtige Beispiele zu erkennen und robustere Modelle zu trainieren.
- Werkzeuge mit mehreren Annotatoren können Konsensetiketten und die Qualität der Annotatoren bewerten, um zu entscheiden, welche Beispiele erneut annotiert werden müssen.
- Die Fähigkeit zum aktiven Lernen ermöglicht es, die nächsten Daten zu ordnen, die am meisten annotiert oder überprüft werden müssen, wodurch Ressourcenverschwendung vermieden wird.
- Die speziellen Schnittstellen umfassen binäre Klassifizierung, mehrklassige Klassifizierung, Mehrfachlabeln, Entity-Recognition, Regression, Bildsegmentierung, Objekterkennung und Out-of-Distribution-Erkennung.
Offene Bibliotheken sind in der Regel auf vorhandene Modelle angewiesen, um Wahrscheinlichkeiten für Vorhersagen außerhalb des Trainingsdatensatzes oder Eigenschaftsrepräsentationen bereitzustellen; sie sind kein „One-Click-Lösungsmittel“, das keine Vorbereitung von Modellen und Daten erfordert. Die Ergebnisse der Erkennung haben eine bestimmte Priorität bei der Überprüfung, und Daten dürfen nicht ohne menschliche Beurteilung in Massen gelöscht werden.
Datenbereinigung im Cleanlab Studio
- Die Web-Oberfläche eignet sich zum Ansehen von Problembefunden ohne Programmierung, zum Verstehen der automatisch erzeugten Felder zur Datenqualität sowie zur Durchführung von Korrekturen.
- Die Python-API unterstützt Dateien, Pandas DataFrames sowie PySpark DataFrames und ermöglicht die automatische Hochladen, Ausführung von Projekten sowie das Herunterladen der Ergebnisse.
- Die Kommandozeile eignet sich zur Authentifizierung in Datenpipelines, zum Hochladen von Daten, zur Erstellung von Projekten und zum Exportieren von Cleansets.
- Es kann Aufgaben zur Verarbeitung von Texten, Bildern, strukturierten Tabellen, Dokumenten, Daten mit mehreren Tags, Daten mit mehreren annotierenden Personen sowie synthetischen Daten bewältigen.
- Das Dokument listet die Integrationsschritte für Databricks, Snowflake und BigQuery auf; die tatsächlichen Berechtigungen sowie die Art der Datenübertragung müssen je nach Implementierungskonfiguration festgelegt werden.
Häufige Eingaben und Ausgaben
| Eingabe | Häufig verwendete Formatierungen oder Inhalte | Ausgabe | Nutzwert |
|---|---|---|---|
| Text oder Tabelle | CSV, JSON, XLS, XLSX, DataFrame | Problemtyp, Qualitätsgrad, Empfehlungsschlüssel und Organisierungsspalte | Fehlerhafte Einträge, falsche Kennzeichnungen und Anomalien feststellen |
| Bilder | Medien, die in ZIP-Dateien oder Tabellen referenziert werden | Bildprobleme, Qualität der Labels und abweichende Beispiele | Verringerung der schlechten Beispiele in den visuellen Datensätzen |
| Modellergebnisse | Prognosewahrscheinlichkeiten, Eigenvektoren oder Prognoseetiketten | Qualitätssignale auf Probe- und Kategorieebene | Probleme, die durch das Positionierungsmodell und die Daten gemeinsam auftreten |
| Mehrfach-Anmerkungen | Mehrere manuelle Etiketten für dasselbe Sample | Konsens, Qualität der Annotatoren und Reihenfolge der Überprüfung | Verbesserung der Prozesse für Crowdsourcing oder Experten-Anmerkungen |
TLM-Glaubwürdigkeitsbewertung
Die Hauptausgabe von TLM ist eine Zuverlässigkeitsbewertung im Bereich von 0 bis 1. Es kann eigene Antworten erstellen und diese gleichzeitig bewerten, oder es kann nur bereits vorhandene Antworten von beliebigen großen Modellen oder von Menschen verfasste Antworten bewerten.
- RAG: Berücksichtigt gleichzeitig die Anfragen der Benutzer, die Systemanweisungen sowie den Suchkontext, um irrelevante Kontexte, faktische Fehler und unzureichende Antworten zu erkennen.
- AI-Agent: Kann die endgültige Antwort bewerten sowie interne Modellaufrufe und Toolaufrufe überprüfen und eine manuelle Freigabe vor der Ausführung von Aktionen mit niedrigem Score auslösen.
- Strukturierte Extraktion: Bewertung der aus Dokumenten, Datenbanken oder Transkripten extrahierten Felder, wobei Ergebnisse mit geringer Glaubwürdigkeit zur Überprüfung weitergeleitet werden.
- Klassifizierung und Annotation: Einschränkung der Kandidatenkategorien, Bewertung automatischer Etiketten sowie Erkennung von Beispielen mit erheblichen Konflikten zu manuellen Etiketten.
- Offline-Bewertung: Massenscan der Produktionsprotokolle oder Feinabstimmung der Daten, wobei vorrangig die am unzuverlässigstenen Antworten betrachtet werden, anstatt zufällige Stichproben.
Der TLM-Score ist weder ein Beweis für etwas noch eine feste Qualifikationsgrenze. In den Dokumentationen gilt ein Wert unter 0,7 in der Regel als niedrig, ein Wert über 0,9 als hoch. Die Interpretation von Werten zwischen 0,7 und 0,9 hängt jedoch von der jeweiligen Aufgabe ab. Die Schwellenwerte müssen anhand der tatsächlichen Fehler und der damit verbundenen Geschäftsfolgen festgelegt werden.
AI-Agent zur Erkennung und Behebung von Schleifen
- Detect fügt über die vorhandenen Agenten und Wissensdatenbanken hinaus eine eigenständige Kontrollschicht hinzu, um Halluzinationen, Suchfehler, Dokumentlücken, Verstöße gegen Richtlinien sowie missbräuchliche Nutzung zu überprüfen.
- Antworten mit geringer Glaubwürdigkeit können versteckt werden, durch konservativere Antworten ersetzt werden, es kann um zusätzliche Informationen gebeten werden, auf leistungsstärkere Modelle umgestellt werden oder die Bearbeitung an einen Menschen übertragen werden.
- Remediate übermittelt die fehlerhaften Fälle an Business-Experten, die die Antworten korrigieren, zusätzliches Wissen hinzufügen oder Regeln anpassen können, ohne den Modellcode direkt ändern zu müssen.
- Die reparierten Inhalte können erneut zur Beantwortung ähnlicher Fragen verwendet werden, wodurch ein iterativer Prozess zur Erstellung von Betriebsprotokollen, Expertenmeinungen und Aktualisierungen der Wissensdatenbank entsteht.
- Die Kompatibilität mit jedem AI-System muss weiterhin durch praktische Integrationstests überprüft werden, einschließlich des Nachrichtenformats, der fließenden Antwortverarbeitung, der Aufrufe von Tools sowie der Authentifizierungs- und Berechtigungsmechanismen.
TLM-Schnellzugangsprozess
- Erstellen Sie ein Cleanlab-Konto und holen Sie sich den TLM-API-Schlüssel. Legen Sie den Schlüssel in eine Umgebungsvariable auf der Serverseite.
- Installieren Sie den TLM-Python-Client, rufen Sie die Erstellungs- und Bewertungsmethode auf kleinem Umfang anhand echter Beispiele auf, oder rufen Sie nur die vorhandene Antwortbewertungsmethode auf.
- Übergeben Sie die vollständigen Systemanweisungen, die Anfragen der Benutzer, die Suchergebnisse sowie die historischen Nachrichten genau so an den TLM, wie sie ursprünglich eingegeben wurden, um zu vermeiden, dass Kontexte, die für die Beurteilung wichtig sind, übersehen werden.
- Manuell korrekte und fehlerhafte Beispiele annotieren, um verschiedene Basismodelle, Qualitäts-Einstellungen, Inferenzstärken und Ähnlichkeits-Einstellungen zu vergleichen.
- Wählen Sie den Schwellenwert anhand der Kosten von Fehlern aus und entwerfen Sie Rückfallstrategien wie Übertragung an einen Menschen, Ablehnung der Anfrage, erweiterte Suche, Neugenerierung oder Modulverbesserung.
- Nach dem Go-Live werden die Rate der niedrigen Bewertungen, Fehlblockierungen, übersehene Fälle, Verzögerungen sowie die Kosten für Tokens überwacht. Die Schwellenwerte werden regelmäßig neu kalibriert, anstatt sie dauerhaft festzulegen.
Verwendung von Open-Source-Bibliotheken
- Installieren Sie CleanLab und bereiten Sie die Rohdaten, Etiketten sowie die dem Auftrag entsprechenden Modelle vor.
- Durch Kreuzvalidierung werden Wahrscheinlichkeiten für Vorhersagen außerhalb der Stichprobe erzeugt, oder es werden Merkmalsvektoren extrahiert, die die Ähnlichkeit der Stichproben darstellen können.
- Führen Sie die Fehlererkennung und -berichterstattung in Datalab durch, um die verdächtigsten Beispiele nach Fehlerart, Score und Kategorie zu überprüfen.
- Lassen Sie die Fachleute fehlerhaft beschriftete, doppelte, abweichende oder außerhalb der Verteilung liegende Proben überprüfen und dokumentieren Sie die Entscheidungen bezüglich der Aufbewahrung, Korrektur, Neubeschriftung oder Löschung.
- Den gleichen Modell mit den bereinigten Daten erneut trainieren und die Leistung auf einem unabhängigen und überprüften Testdatensatz vergleichen.
- Die Datenprüfung in den kontinuierlichen Pipeline-Fluss einbinden, um neue Chargen, Drifts sowie Veränderungen in der Qualität der Anreicherer zu überwachen.
Passend für Nutzer und Szenarien
- Datenwissenschaftler: Erkennung von Problemen im Trainings- und Testdatensatz ohne Änderung des Modellrahmens.
- Maschinelles Lerningenieur: Etablierung kontinuierlicher Qualitätskontrollen für Text-, Bild-, Audio- und Tabellenaufgaben.
- LLM- und RAG-Teams: Bewertung der Zuverlässigkeit der Antworten, Abruf des Kontexts und strukturierte Extraktion von Ergebnissen.
- Kundenservice- und Mitarbeiter-Hilfeteam: Es werden risikoreiche Antworten blockiert, und die fehlerhaften Beispiele werden an Fachleute weitergeleitet, um sie zu beheben.
- Geregelt Unternehmen: Kontrolle der Datengebiete, Netzwerke und Wartungspflichten über eine einzelne Mieter- oder selbstverwaltete VPC.
Preise und Angebote
Die aktuellen öffentlichen Seiten bieten keine vollständigen Preislisten mehr an, sodass die bisherigen Paketpreise nicht mehr verwendet werden können. In den TLM-Dokumenten wird bestätigt, dass kostenlose Token erhalten werden können; nach deren Verbrauch wird nach dem Token-System abgerechnet. Die Anzahl der kostenlosen Tokens sowie der genaue Preis pro Token werden jedoch nur auf den Seiten „Usage“ und „Billing“ des Kontos angezeigt.
| Paket oder Version | Preis | Abrechnungszeitraum | Kernrechte oder -beträge | Für Nutzer geeignet |
|---|---|---|---|---|
| CleanLab-Open-Source-Bibliothek | Kostenlos | Keine Abonnementgebühr | Algorithmen zur Qualitätssicherung lokaler Daten; eigene Verantwortung für Berechnungen und Wartung | Forschung, Einzelpersonen und Ingenieurteams |
| TLM-Kostenlos-Volume | Ab 0 US-Dollar | Einmalige Menge oder Kontogrenze, die Menge ist nicht öffentlich bekannt. | API-Schlüssel und kostenlose Token | Prototyp und kleine Skalennachweise |
| TLM nach Verbrauch | Im Konto angezeigt | Nach Token | Mehrere Basismodelle und Qualitätsvorlagen | Anhaltende API-Aufrufe |
| Cleanlab Studio | Noch nicht veröffentlicht | Noch nicht veröffentlicht | Webseiten, Python-API, Kommandozeile und Datenbereinigung | Datenauswertungs- und Modellierungsteam |
| Enterprise | Kontaktieren Sie den Verkauf | Maßgeschneiderte Verträge | Gruppennachlässe, private Bereitstellung und weitere Unternehmensfunktionen | Hohe Mengen und regulierte Organisationen |
Verschiedene Grundmodelle, Qualitäts-Einstellungen, die Anzahl der möglichen Antworten sowie die Einstellungen zur Logikverarbeitung beeinflussen die Kosten und Verzögerungen bei TLM. In den öffentlich verfügbaren Informationen werden weder Rückerstattungen noch eine Gültigkeitsdauer für kostenlose Token oder langfristige Preisgarantien nach dem Kauf angegeben. Vor der Zahlung sollten die Angaben auf der Kontoauszugsseite sowie im Vertrag herangezogen werden.
Einsatz und Plattform
| Einrichtungsmethode | Führungsmode | Eigenschaften der Datensicherung | Für Nutzer geeignet |
|---|---|---|---|
| Mehrfachnutzer-SaaS | Cleanlab-Hosting | Automatische Aktualisierung, Tenant-Isolation, statische und transportbezogene Verschlüsselung | Teams, die schnell online gehen möchten |
| Einzelmieter-SaaS | Unabhängige Hostumgebung | Anpassbare Konfiguration und Bereichskontrolle | Unternehmen mit strengeren Isolierungsanforderungen |
| Selbstverwalteter VPC | Einsatz in der Cloud-Umgebung des Kunden | Kundenkontrolle über Netzwerke, Infrastruktur und Konformitätsgrenzen | Organisationen mit hohen Anforderungen an die Speicherung von Daten und an die Regulierung |
| Öffentliche Bibliotheken vor Ort | Kunde betreibt selbst | Die Daten müssen nicht an Dienstleister gesendet werden. | Nur ein Team für Algorithmen zur Qualität der Daten |
Fähigkeitsgrenzen
- Der Zuverlässigkeitswert ist ein Indikator für das Risiko von Fehlern – er kann zu niedrigen Bewertungen für richtige Antworten führen oder Fehler übersehen. Bei Entscheidungen mit hohem Risiko kann eine manuelle Überprüfung nicht ausgeschlossen werden.
- Die Bewertung derselben Anfrage kann ungewiss sein; der Cache ermöglicht es in der Regel, dass wiederholte Anfragen vorübergehend das gleiche Ergebnis liefern, doch laut den Dokumenten wird der Cache alle etwa 30 Tage oder bei internen Aktualisierungen erneuert.
- Die Qualität von Open-Source-Bibliotheken hängt von den Wahrscheinlichkeiten der Modellvorhersagen, der Darstellung der Merkmale, der Kreuzvalidierung sowie den Annahmen bezüglich der Aufgabe ab; schlechte Eingangssignale verringern den diagnostischen Wert.
- Die automatische Korrektur von Metadaten könnte wenige, aber echte Randbeispiele fälschlicherweise als fehlerhaft einstufen; vor der Löschung sollten Audit-Protokolle sowie wiederherstellbare Kopien aufbewahrt werden.
- Nach der Übernahme durch Handshake ist die weitere Wartung der Open-Source-Pakete klar geregelt, doch kommerzielle Produkte, Zugangsmöglichkeiten für Konten sowie das Unternehmenskonzept müssen vor dem Kauf noch bestätigt werden.
Privatsphäre, Sicherheit und Bedingungen
- Die Datenschutzerklärung listet die Registrierungsdaten, hochgeladene Daten und Code, Nutzungsnachweise, Geräte, geschätzte Standorte, Kommunikationsdaten sowie Informationen zu Drittanbieterkonten auf.
- Die Zahlungen werden von Stripe abgewickelt, die Analyse der Website kann Google Analytics verwenden; Inhalte, die in SaaS, Studio oder TLM hochgeladen werden, werden von den jeweiligen Diensten verarbeitet.
- Die Datenschutzrichtlinie erlaubt die Verarbeitung von Informationen zur Wartung, Verbesserung und Entwicklung neuer Produkte sowie zur Analyse und für aggregierte Zwecke ohne Identifizierung der Betroffenen, gibt jedoch im offiziellen Text weder eine feste Speicherdauer für hochgeladene Inhalte noch klare Regeln zur Ausschließung des Trainings von Modellen an.
- Auf der Sicherheitsseite wird angegeben, dass die Seite eine SOC 2-Auditorie bestanden hat und zudem unabhängige Penetrationstests, statische Analysen, dynamische Analysen sowie kontinuierliche Sicherheitsaudits durchgeführt wurden.
- Die Nutzungsbedingungen verbieten einen wettbewerbsmäßigen Zugang sowie kommerzielle Benchmark-Tests ohne schriftliche Genehmigung; für nicht-kommerzielle Benchmarks ist außerdem die Offenlegung von experimentellem Code und Daten, die reproduziert werden können, erforderlich.
- Sowohl die Bedingungen als auch die Datenschutzrichtlinien treten am 18. Februar 2022 in Kraft – das ist früher als der Zeitpunkt der Übernahme der aktuellen Geschäftsplattform im Jahr 2026. Unternehmen sollten um eine aktuelle Liste der Bestellungen, der Datenverarbeitungsvereinbarungen sowie der Zulieferer bitten.
Zusammenfassung
Das Besondere an Cleanlab ist, dass es die Diagnose von Trainingsdaten, die Bewertung der Ausgaben von LLMs sowie den Prozess der manuellen Korrektur miteinander verbindet – und gleichzeitig eine lokal ausführbare Datenqualitätsdatenbank nach Apache-2.0 beibehält. Derzeit ist die sicherste Vorgehensweise, offene Quellcode-Bibliotheken, TLM, Studio sowie Unternehmenskontrollplattformen je nach Bedarf voneinander zu trennen und nach der Übernahme erneut die Kontinuität der Dienste, die Preise sowie die Datenbedingungen zu überprüfen.
Guigong-Netzwerk-Sicherheitsnummer: 45132202000164