Evidently AI
Offensichtlich AI – intelligente Tools, die sich auf die Programmierung mit KI konzentrieren.
Tags:AI-ProgrammierwerkzeugeEine kurze Beschreibung
Offensichtlich ist AI ein Open-Source-Framework für die Bewertung und Überwachbarkeit von KI-Systemen, mit dem die Qualität von LLMs, RAG-, AI-Agenten-, Datenpipelines sowie herkömmlichen Machine-Learning-Modellen in Experimenten, Regressionstests und Produktüberwachungen geprüft werden kann.
Einführung in die Tools
Offensichtlich wird Evidently von Evidently AI, Inc. gewartet. Das Kernprodukt ist die Bibliothek Evidently, die in eine Python-Umgebung eingebettet werden kann, sowie eine leichte Überwachungsplattform, die selbst implementiert werden kann.
Es ist nicht dafür zuständig, Grundmodelle zu trainieren, sondern wandelt Eingaben, Ausgaben, Labels und Referenzdaten in Kennzahlen, Berichte, Testergebnisse sowie Trendtabellen um, um dem Team dabei zu helfen, Illusionen, einen Rückgang der Suchqualität, Datendrift, Leistungsrückgänge sowie Probleme mit der Datenqualität zu erkennen.
Aktuelle Produktzusammensetzung
| Bestandteile | Aktueller Zustand | Hauptverwendungszweck | Lizenz oder Lieferart |
|---|---|---|---|
| Offensichtlich die Python-Bibliotheken | Offiziell verfügbar | Ausführen von Tests, Erstellen von Berichten und Testsets | Apache 2.0 Open Source |
| Offensichtlich Open-Source-Plattformen | Offiziell verfügbar | Selbstverwaltete Projekte, Datensätze, Berichte sowie Interfaces für Tracking und Überwachung | Basiskonfiguration mit der Open-Source-Bibliothek enthalten |
| Tracely | Offiziell verfügbar | Nahezu Echtzeit-Tracking-Daten von LLM-Anwendungen auf Basis von OpenTelemetry | Apache 2.0 Open Source |
| Evidently Enterprise | Wirtschaftliche Angebote | Erweiterte codefreie Bewertung, Zusammenarbeit, Sicherheit und skalierbare Bereitstellung | Kontaktieren Sie den Verkauf für eine private Bereitstellung |
| Evidently Cloud | Der SaaS-Service wurde eingestellt. | Historische Treuhandplattformen | Es sollte nicht mehr unter den kostenlosen Cloud-Paketen vorgestellt werden. |
Hauptfunktionen
1. Bewertungsberichte
Reports werden zur Berechnung und Zusammenfassung von Daten sowie zur Messung von Qualitätsindikatoren für maschinelles Lernen und LLMs eingesetzt und eignen sich für experimentelle Analysen, Debugging, Vergleiche mit Baseline-Werten sowie Prüfungen in der Serienproduktion.
- Verwenden Sie voreingestellte Schnellkombinationen für eine Reihe gängiger Bewertungskriterien.
- Fügen Sie nach Aufgabe einzelne Indikatoren oder benutzerdefinierte Python-Indikatoren hinzu.
- Die Interaktionsergebnisse können im Notebook angezeigt werden oder als JSON-, Python-Dictionary- und HTML-Dateien exportiert werden.
- Vergleichen Sie die aktuellen Daten mit den Referenzdaten, um Veränderungen in der Verteilung, Qualität und Leistung des Modells zu analysieren.
2. Test Suites – Testpakete
Test Suites fügen zu den Berichtsindikatoren Bedingungen für Erfolg oder Misserfolg hinzu und können zur Datenvalidierung, für Regressionstests von Modellen sowie als Qualitätskontrollmechanismus im kontinuierlichen Integrationssystem eingesetzt werden.
- Legen Sie für die Indikatoren Bedingungen von größer als, kleiner als oder anderen Schwellenwerten fest.
- Teilweise Testbedingungen werden auf der Grundlage von Referenzdaten automatisch erzeugt, um die Erstkonfiguration zu vereinfachen.
- Verwenden Sie die Testergebnisse zur Entscheidungsfindung, und nicht nur zur Darstellung von Diagrammen.
- Führen Sie nach der Aktualisierung des Modells, der Prompt-Wörter oder der Suchpfade denselben Test erneut aus.
3. Bewertung von LLM, RAG und Agenten
Offensichtlich können Chatbots, RAG, Copilot, KI-Agenten und andere generative Anwendungen analysiert werden. Teams können Regeln, Klassifikatoren, Ähnlichkeitsmethoden sowie LLM-Bewerter kombinieren.
| Bewertungskriterien | Inhalt prüfbar | Typische Anwendungen |
|---|---|---|
| Fakten und Illusionen | Faktische Richtigkeit, Konsistenz der Aussagen und zweifelhafte Antworten | Reduzierung von unbegründeten Ausgaben |
| Suchqualität | Kontextbezogene Relevanz, Beziehung zwischen Antwort und Suchmaterial | Bewertung der RAG-Verbindung |
| Sicherheit und Privatsphäre | PII, Toxizität, sensible Wörter und gefährliche Ausgaben | Einführung von Sicherheitsanforderungen für den Online-Betrieb |
| Format und Regeln | Länge, Regeln, Schlüsselwörter, Tonfall und Struktur | Überprüfung der Einhaltung der Geschäftsrichtlinien |
| Semantik und Sprache | Semantische Ähnlichkeit, Emotionen, sprachliche und textbezogene Merkmale | Vergleich mehrerer Modelle oder Prompte |
| Eigene Bewertungen | Willkürliche Hinweise, Modelle, Regeln oder Python-Logik | Einführung von speziellen Bewertungskriterien für das Unternehmen |
4. Traditionelle Bewertungsmethoden im maschinellen Lernen
Neben generativer KI unterstützt Evidently auch Klassifizierung, Regression, Sortierung, Empfehlungen sowie die Analyse der Datenqualität in Tabellen – ideal, um experimentelle Bewertungen mit der Produktionsüberwachung zu verbinden.
| Aufgabentypen | Indikatoren oder Überprüfungen | Benötigte Daten |
|---|---|---|
| Klassifizierung | Genauigkeit, Präzision, Recall-Rate, ROC-AUC und Verwirrungsmatrix | Prognosen, Etiketten und optionale Referenzdaten |
| Rückkehr | MAE, ME, RMSE, Fehlerverteilung und Abweichung | Numerische Vorhersagen und echte Etiketten |
| Sortierung und RAG | NDCG, MAP, MRR und Trefferquote | Abfragen, Sortierung der Ergebnisse und Relevanzinformationen |
| Empfehlungssysteme | Neuheit, Vielfalt, Abweichungen in der Beliebtheit usw. | Empfehlungslisten und Nutzerinteraktionsdaten |
| Datenqualität | Fehlende Elemente, Duplikate, Bereich, Kategorien und Zusammenhänge | Aktueller Datensatz und optionaler Referenzdatensatz |
| Datendrift | Statistische Tests und Distanzen zwischen Verteilungen | Aktuelle Charge und Referenzcharge |
5. Datendrift und Datenqualität
Die Plattform kann aktuelle Daten mit Referenzdaten vergleichen, um Veränderungen in der Verteilung der Felder, fehlende Werte, duplizierte Werte, neue Kategorien sowie abweichende Werte zu erkennen. Drift an sich bedeutet noch nicht, dass das Modell versagt hat; es muss weiterhin im Zusammenhang mit Labels, Geschäftsindikatoren und der Modellqualität interpretiert werden.
6. Überwachungspanel
Die selbst verwaltete UI ermöglicht es, Bewertungssnapshots pro Projekt zu speichern und Metriken sowie Testergebnisse in über Zeit veränderlichen Überwachungsboards darzustellen. Die Open-Source-Version eignet sich für eine einfache Implementierung; das Team ist dafür verantwortlich, den Zugriffskontrollen, Backups, Updates und Skalierungen selbst nachzukommen.
7. Tracking und Produktbewertung
Tracely wird verwendet, um Eingaben, Ausgaben sowie Zwischenschritte von LLM-Anwendungen zu erfassen, wodurch die Produktionsverfolgung in analysierbare Datensätze umgewandelt werden kann. Fortgeschrittene Zeitmessungen, Alarmfunktionen sowie codefreie Workflows gehören zu den Funktionen der Business-Plattform.
8. Synthetische Daten und Optimierung von Prompten
Die aktuelle Ökologie umfasst die Fähigkeit zur Erzeugung synthetischer Daten sowie zur Optimierung von Prompten. Damit können normale, Grenz- oder Angriffsbeispiele erstellt werden, um anschließend verschiedene Kombinationen aus Prompten, Modellen und Parametern zu vergleichen. Die erzeugten Beispiele können jedoch keine echten Benutzerdaten oder manuelle Red-Team-Tests ersetzen.
Der Workflow von der Experimentierung bis zur Produktion
- Die zu überprüfenden Risiken müssen klar definiert werden, wie z. B. Halluzinationen, Relevanz der Suchergebnisse, Datendrift oder ein Rückgang der Klassifizierungsleistung.
- Vorbereiten Sie die aktuellen Daten, Referenzdaten, Prognoseergebnisse, Labels oder Protokolle der LLM-Interaktionen und definieren Sie die Bedeutung der Felder.
- Wählen Sie eine Voreinstellung aus und erstellen Sie einen Bericht mit Kennzahlen; betrachten Sie zunächst die Verteilung, die fehlerhaften Beispiele sowie die abweichenden Gruppen.
- Die Schlüsselindikatoren werden in eine Test-Suite mit Schwellenwerten umgewandelt, die als wiederholbar lauffähige Qualitätskontrolle dient.
- Nach Änderungen an den Prompten, Modellen, Daten oder Code wird erneut bewertet und die Unterschiede in den Ergebnissen verglichen.
- Schreiben Sie den Bericht in einen selbst verwalteten Workspace und überwachen Sie kontinuierlich Trends sowie den Teststatus über das Dashboard.
- Verbinden Sie die Ergebnisse von Fehlern mit Prozessen zur Fehlerbehebung, zum Rollback, zur erneuten Schulung oder zur manuellen Überprüfung.
Installation und Einführung in die Open-Source-Version
Für das aktuelle Projekt ist Python 3.10 oder eine neuere Version erforderlich, die über das Python-Paketverwaltungstool installiert werden kann. In offiziellen Projekten sollte die Version festgelegt werden, und vor einem Upgrade sollten die Änderungsbeschreibungen sowie die Regressionstests gelesen werden.
- Erstellen Sie eine eigenständige Python-Umgebung und bereiten Sie Tabellen mit Pandas oder Daten vor, die in Tabellen umgewandelt werden können.
- Installieren Sie das Evidently-Paket; bei Bedarf an LLM-Bewertungen, Spark oder Cloud-Speicher wählen Sie anschließend die entsprechenden optionalen Abhängigkeiten aus.
- Definieren Sie Datenspalten, aktuelle Daten sowie optional Referenzdaten und wählen Sie voreingestellte oder individuelle Indikatoren aus.
- Führen Sie den Bericht aus und sehen Sie ihn im Notebook an, oder speichern Sie ihn als HTML, JSON und Python-Dictionary.
- Fügen Sie Testbedingungen für die Schlüsselindikatoren hinzu und integrieren Sie die Testsuite in kontinuierliche Integration oder Batch-Aufgaben.
- Zuerst werden die Berechnungskosten und die Feldzuordnung anhand von Beispieldaten überprüft, anschließend werden die Produktionsdaten eingeführt.
Tutorial zur selbstverwalteten Überwachung
- Erstellen Sie einen Workspace und entscheiden Sie sich dafür, einen lokalen Ordner, eine SQL-Datenbank oder ein S3-kompatibles Objektspeichersystem zu verwenden.
- Bei der Bewertungsaufgabe werden Report-Snaps, Verfolgungsdaten oder Datensätze in den angegebenen Workspace geschrieben.
- Starten Sie den Evidently UI-Dienst und überprüfen Sie, ob er die Projektdaten im Workspace lesen kann.
- Erstellen Sie Projekte und Dashboard-Panelle, und wählen Sie die Kennzahlen sowie Tests aus, die kontinuierlich überwacht werden sollen.
- Im Produktionsumfeld werden Reverse-Proxy, Authentifizierung, Verschlüsselung, Backups, Protokollierung sowie Ressourcenbeschränkungen hinzugefügt.
- Führen Sie Batch-Bewertungen stündlich, täglich oder bei Ankunft neuer Labels durch und leiten Sie Abweichungen in den Team-Reaktionsprozess weiter.
Für welche Benutzer geeignet
- Datenwissenschaftler: Vergleicht Daten, Modelle und Merkmalsschwankungen und erstellt teilebare Analyseberichte.
- Maschinelles-Lernen-Ingenieur: Integration von Qualitätsprüfungen in die Pipelines für Training, Bereitstellung und Batchverarbeitung.
- LLM-Anwendungsentwickler: Bewertung der Ausgabequalität von Chatbots, RAG, Agenten und Copilot.
- MLOps und Plattformteam: Selbstverwaltete, einheitliche Bewertungsergebnisse sowie Überwachungs- und Monitoring-Panel.
- AI-Produktmanager und Qualitätsteam: Definition der Qualitätsdimensionen, Prüfung von Fehlern und Überwachung von Versionsrückfällen.
- Geregelte Unternehmen: Sie werden in einem privaten Umfeld eingesetzt und erhalten durch die Business-Version zusätzliche Berechtigungen sowie Kooperationsfunktionen.
Typische Anwendungsszenarien
- Bevor neue Prompte oder Modelle veröffentlicht werden, wird ein festes Bewertungsset ausgeführt, um offensichtliche Rückschritte zu verhindern.
- Vergleichen Sie die Kontextrelevanz, Faktizität und Antwortqualität mehrerer RAG-Suchansätze.
- Überwachen der Verteilung der Produktionsdaten, der Ausfallraten sowie der Leistung des Modells im Laufe der Zeit.
- Überprüfen Sie persönliche Informationen, Toxizität, sensible Wörter und Formatierungsfehler in den Antworten der LLMs.
- Erstellen von Massenqualitätsberichten für Klassifizierungs-, Regressions-, Sortier- oder Empfehlungssysteme.
- Erstellen von Grenzwerten und adversativen Testeingaben, um die Abdeckung der herkömmlichen manuellen Testdatensätze zu erweitern.
- Zentralisieren Sie die Bewertungssnaps in einem self-hosted Panel, damit Entwicklungs-, Produkt- und Governance-Teams sie analysieren können.
Vorteile des Produkts
- Derselbe Rahmen umfasst gleichzeitig generative KI, traditionelles maschinelles Lernen und Datenqualität.
- Mehr als 100 eingebaute Bewertungsmethoden stehen zur Verfügung, und es ist möglich, mit Python eigene Geschäftsindikatoren zu implementieren.
- Report eignet sich zum Erkunden, Test Suite eignet sich für die automatisierte Zutrittskontrolle – die beiden Modi können miteinander kombiniert werden.
- Die Kernbibliotheken und die Grundplattformen werden unter der liberalen Apache 2.0-Lizenz bereitgestellt und können in lokalen sowie privaten Umgebungen ausgeführt werden.
- Berichte können im Python-Umfeld gespeichert werden oder als strukturierte Daten bzw. HTML exportiert werden.
- Bei der Batch-Überwachung werden standardmäßig nur aggregierte Zusammenfassungen und Testergebnisse gespeichert, um das erneute Speichern aller ursprünglichen Prognosen zu vermeiden.
- Offizielle Lager, Dokumentationen, Beispiele und Community-Ressourcen sind recht umfassend vorhanden, was Entwicklern die Fehlerbehebung und Erweiterung erleichtert.
Einsatzbeschränkungen und Hinweise
- Offensichtlich bietet Evidently Bewertungstools statt richtiger Antworten, und eine unsachgemäße Gestaltung von Indikatoren, Schwellenwerten und Referenzdaten kann zu Fehlinformationen führen.
- Die LLM-Bewertungsgeräte selbst können Verzerrungen, Zufälligkeiten sowie zusätzliche Modellkosten aufweisen und müssen durch manuelle Annotationen kalibriert werden.
- Datendrift zeigt lediglich eine Veränderung der Verteilung an und kann allein nicht beweisen, dass die Leistung des Modells nachgelassen hat.
- Offene Plattformen enthalten keine Zertifizierungen für die kommerzielle Version, keine Rollenrechte, keine Alarmfunktionen, keine zeitgesteuerten Aufgaben sowie keine vollständigen kodelosen Funktionen.
- Offensichtlich wird Evidently Cloud nicht mehr als SaaS angeboten. Alte Blogs, alte Anmelde-Seiten sowie einige verbleibende Dokumente können zu Verwirrung führen.
- Selbstverwaltete Teams müssen die Kosten für Infrastruktur, Sicherheit, Backups, Updates, Verfügbarkeit und Skalierbarkeit selbst tragen.
- Python-Bibliotheken eignen sich für Techniker; für nicht-technische Teams stellt die Konfiguration und Interpretation von Kennzahlen ohne Unterstützung durch eine Business-Plattform ein Hindernis dar.
- Bevor Produktionshinweise, Antworten und personenbezogene Daten verarbeitet werden, müssen Minimierung, Maskierung, Zugriffskontrolle sowie eine Speicherdauer festgelegt werden.
Preis und Version
Stand dem 22. August 2026 geben die offiziellen Dokumente klar an, dass Evidently Cloud nicht mehr als SaaS-Produkt angeboten wird. Daher können weder die früheren kostenlosen Cloud-Pakete noch die alten Zahlungspläne weiterhin genutzt werden.
| Version | Preis | Einrichtungsmethode | Hauptfähigkeiten | Für Nutzer geeignet |
|---|---|---|---|---|
| Offensichtlich die Python-Bibliotheken | Kostenlos | Lokale oder eigene Infrastruktur | Mehr als 100 Bewertungen, Berichte, Test-Sets und benutzerdefinierte Kennzahlen | Einzelne Entwickler und Technikteams |
| Offensichtlich Open-Source-Plattformen | Die Software ist kostenlos, die Infrastruktur muss selbst bereitgestellt werden. | Selbstverwaltung | Grundlegende Projekte, Datensätze, Tracking, Speicherung der Ergebnisse und Überwachungspanel | Team, das selbstständig betrieben werden kann |
| Tracely | Kostenlos | In die Anwendung integriert und selbst gehostete Daten | LLM-Tracking basierend auf OpenTelemetry | LLM-Anwendungsentwicklerteam |
| Evidently Enterprise | Kontaktieren Sie den Verkauf | Private Cloud oder lokale Implementierung | Codefreie Bewertung, Alarme, geplante Aufgaben, Berechtigungen, erweiterter Backend sowie exklusiver Support | Unternehmen, die Sicherheit, Zusammenarbeit und Skalierbarkeit in den Vordergrund stellen |
| Evidently Cloud | Nicht mehr angeboten | Historische Treuhanddienste | Die Cloud-Funktionen auf den alten Seiten können nicht als Pakete angesehen werden, die derzeit gekauft werden können. | Nicht anwendbar |
Für Open-Source-Software fallen keine Lizenzgebühren an, doch Datenbanken, Objektspeicher, Rechenleistung, Protokollierung sowie Wartung und Support verursachen Kosten. Für die kommerzielle Version gibt es keinen offiziellen Festpreis; es ist notwendig, sich aufgrund der Umfang der Implementierung sowie der Anforderungen an Support und Sicherheit an den Vertrieb zu wenden.
Vergleich der Open-Source-Version und der kommerziellen Version
| Fähigkeiten | Open-Source-Version | Unternehmen |
|---|---|---|
| Verfolgung, über 100 Bewertungen, Berichte und Tests | Unterstützung | Unterstützung |
| Überwachungs-Dashboard und benutzerdefinierte Kennzahlen | Unterstützung | Unterstützung |
| JSON-Berichte, Rohdaten, Tracking und Datensatzverwaltung | Unterstützung | Unterstützung |
| Synthetische Daten und Optimierung von Prompten | Unterstützung | Unterstützung |
| Codefreie Datengenerierung, Bewertung und Dashboard | Nicht unterstützt | Unterstützung |
| Vergleich der Ergebnisse nebeneinander und Alarme | Nicht unterstützt | Unterstützung |
| Geplante Aufgaben | Nicht unterstützt | Unterstützung |
| Zertifizierung und Rollenrechte | Nicht unterstützt | Unterstützung |
| Exklusiver Support, Einarbeitungstraining und skalierbarer Backend | Gemeinschaftliche Unterstützung und eigenständige Wartung | Nach dem Geschäftsplan zur Verfügung gestellt |
Unterstützung für Umwelt sowie Eingabe/Ausgabe
| Projekt | Unterstützungszustand | Erklärung |
|---|---|---|
| Python | 3.10 und höher | Das Kernumfeld für die Hauptdatenbank, Bewertungen und benutzerdefinierte Kennzahlen |
| Jupyter Notebook | Unterstützung | Interaktive Ansicht von Berichten und Debugging-Metriken |
| Befehlszeile und Web-UI | Unterstützung | Starten der selbst gehosteten Überwachungsplattform und des Demonstrationsprojekts |
| Windows, macOS und Linux | Abhängigkeit von der Python-Umgebung | Bei der Produktionsbereitstellung ist es zudem notwendig, die Abhängigkeiten sowie die Containerumgebung selbst zu überprüfen. |
| SQL-ähnliche Speicherung | Unterstützung | Man kann Workspace-Backends wie SQLite, Postgres usw. verwenden. |
| Objektspeicher, kompatibel mit S3 | Unterstützung | Kann mit Amazon S3, GCS oder MinIO usw. verbunden werden. |
| Native Mobile-Apps | Nicht bereitgestellt | Eigene Dienste können über einen Browser abgerufen werden, aber es handelt sich dabei nicht um eine Mobile-App. |
| Eingabe | Ausgabe | Erklärung |
|---|---|---|
| Pandas-Tabellen und Textdaten | Datensätze mit Indikatoren und Berichte | geeignet für Offline-Experimente und Batch-Bewertungen |
| Aktuelle Menge und Referenzmenge | Drift, Masse und Differenzanalyse | Es muss sichergestellt werden, dass die Felddefinitionen und Zeitfenster vergleichbar sind. |
| Prognosen und Labels | Klassifizierung, Regression, Sortierung und Empfehlungsindikatoren | Bei Verzögerungen der Tags sollten die Proxy-Metriken getrennt überwacht werden. |
| LLM-Hinweise, Antworten, Kontext und Tracking | Qualität, Sicherheit und Suchleistungsbewertung | Sensible Inhalte sollten zunächst gedämpft werden. |
| Berichtsergebnisse | JSON, Python-Dictionaries, HTML und Plattform-Snapshots | Kann zur automatisierten Entscheidungsfindung oder zur manuellen Überprüfung verwendet werden. |
| Test Suite | Ergebnis: Erfolg oder Misserfolg | geeignet für kontinuierliche Integration und Veröffentlichungskontrollen |
APIs und Integrationsmöglichkeiten
Offensichtlich handelt es sich zunächst um die API der Python-Bibliothek, die in Notebooks, Skripten, für Aufgaben im Bereich kontinuierlicher Integration sowie in Airflow und anderen Orchestrierungstools sowie in benutzerdefinierten Bewertungsworkflows verwendet werden kann. Auch Plattformen zum Selbsthosting bieten Schnittstellen zum Schreiben und Lesen von Bewertungsergebnissen.
- Fügen Sie den Report und die Testsuite der Trainings-, Validierungs- oder Bereitstellungs-Pipeline hinzu.
- Massenüberwachung wird durch Zeitplan-Skripte, Task-Scheduler oder Ereignisauslösungen mit Tags in Gang gesetzt.
- Senden Sie die strukturierten Ergebnisse an vorhandene Logs, Alarme, Dashboards oder Governance-Systeme.
- Verwenden Sie Tracely, um Eingaben, Ausgaben und Zwischenanrufe von LLM-Anwendungen aufzunehmen.
- Verbinden Sie Object Storage und entfernte Workspaces mithilfe einer kompatiblen Dateisystem-Schnittstelle.
- Individuelle Python-Metriken werden verwendet, um interne Unternehmensregeln, Klassifikatoren oder externe Bewertungsmodelle zu verpacken.
GitHub und Open Source
Offensichtlich wird der Haupt-Repository öffentlich gewartet und unterliegt der Apache License 2.0. Bei der Überprüfung im August 2026 hatte das Repository etwa 7.800 Sternchen. Die neueste offizielle Version ist 0.7.21, veröffentlicht am 10. März 2026.
Apache 2.0 erlaubt die Nutzung, Änderung und Verteilung, doch bei erneuter Veröffentlichung müssen Lizenz sowie relevante Urheberrechte, Patente und Eigentumsangaben beibehalten werden, und das geänderte Dokument muss gekennzeichnet sein. Markenrechte werden durch eine Open-Source-Lizenz nicht automatisch übertragen.
| Offizielle Open-Source-Projekte | Verwendung | Lizenz |
|---|---|---|
| evidently | Kernframeworke für die Bewertung, Tests und Überwachung von ML und LLM | Apache 2.0 |
| tracely | LLM-Anwendungsverfolgung auf Basis von OpenTelemetry | Apache 2.0 |
| community-examples | Beispiele für Bewertung und Überwachung | Apache 2.0 |
| aws_alerting | Beispiele für die Integration mit AWS-Alarmen | Apache 2.0 |
| ml_observability_course | Lernmaterialien zu Observierbarkeit im maschinellen Lernen | Apache 2.0 |
Privatsphäre, Telemetrie und Sicherheit
Wenn Berichte ausschließlich mit Python-Bibliotheken in Notebooks oder Skripten erstellt werden, sammelt die offizielle Dokumentation keine Telemetriedaten zu Open-Source-Produkten. Bei der Aktivierung der selbst gehosteten Monitoring-Oberfläche ist die anonyme Nutzungs-Telemetrie standardmäßig aktiv, kann jedoch über die Umgebungsvariable DO_NOT_TRACK deaktiviert werden.
- Die UI-Telemetrie umfasst den Betriebssystem-, Python- und Tool-Version, die Zeit, die Identifizierung anonymer Benutzer sowie Ereignisse zur Nutzung der Funktionen.
- Offiziell wird mitgeteilt, dass weder der Inhalt der Datensätze noch die Namen der Felder, Parameter, Code oder Datenmuster erfasst werden.
- Selbstverwaltung bedeutet nicht automatische Sicherheit – Open-Source-Plattformen verfügen über keine eingebauten Authentifizierungs- und Rollenberechtigungen, die vom Team selbst ergänzt werden müssen.
- Die Speicherung der ursprünglichen LLM-Protokolle kann Kundentexte, persönliche Daten und Geschäftsgeheimnisse enthalten; daher sollten Regeln für Maskierung, Berechtigungen und Löschung festgelegt werden.
- Die Datenschutzrichtlinien der offiziellen Website sowie der Cloud-Dienste beziehen sich außerdem auf E-Mail-Adressen, Namen, Unternehmen, Cookies, Nutzungsdaten sowie genehmigte Standortdaten.
- Bei der Implementierung in einem Unternehmen müssen die Datenverarbeitungsprotokolle, die Unterauftragnehmer, die Protokollierung, die Verschlüsselung, die Backups, die Reaktion auf Sicherheitslücken sowie die Support-Mechanismen überprüft werden.
Grundlegende Informationen
| Projekt | Inhalt |
|---|---|
| Name des Tools | Evidently AI |
| Entwicklungsunternehmen | Evidently AI, Inc. |
| Arten von Werkzeugen | KI-Bewertung, Überwachbarkeit von LLMs und Überwachung des maschinellen Lernens |
| Kernsprache | Python |
| Datentypen | Tabellendaten und Textdaten |
| Kernkompetenzen | Berichte, Test-Suiten, über 100 Indikatoren, UI für Tracking und Überwachung |
| Preismuster | Open-Source-Kostenlos und Enterprise-Anpassungsangebote |
| Ist eine Registrierung erforderlich? | Die Open-Source-Version benötigt das nicht; für kommerzielle Kommunikation ist es notwendig, sich an die offiziellen Stellen zu wenden. |
| Ob Open Source | Ja, die Kernbibliothek verwendet Apache 2.0. |
| Cloud-SaaS | Die Bereitstellung wurde eingestellt. |
| Hauptverteilung | Lokale Server, eigene Server, Private Cloud oder unternehmensinterne Umgebungen |
Empfehlungswert
Empfehlungswert: 4,6 / 5. Evidently umfasst sowohl LLMs als auch herkömmliches Maschinelles Lernen; es gibt eine nahtlose Verbindung zwischen Indikatoren, Berichten, Tests und Überwachung – ideal für technische Teams, die die Kontrolle über Daten und Bewertungsmethoden wünschen.
Der Hauptnachteil ist, dass eine Open-Source-Einsatzmöglichkeit ingenieurtechnische sowie wartungsbezogene Anstrengungen erfordert. Codefreie Funktionen sowie Kooperationsmöglichkeiten, die auch Nicht-Technikern zur direkten Nutzung zur Verfügung stehen, sind hauptsächlich in der Business-Version enthalten. Nach dem Ausstieg von Cloud aus dem SaaS-Bereich muss das Team außerdem die Hostingkosten sowie Migrationsoptionen neu bewerten.
Häufige Fragen
Ist KI offensichtlich kostenlos?
Die Kern-Python-Bibliotheken, Tracely sowie die grundlegende Plattform können kostenlos genutzt werden; die Lizenz ist Apache 2.0. Die Selbstverwaltung birgt jedoch weiterhin Kosten für Server, Speicher, Wartung und Sicherheit.
Offensichtlich kann Cloud auch weiterhin registriert und genutzt werden?
Die neuesten offiziellen Dokumente machen klar, dass Cloud nicht mehr als SaaS-Produkt angeboten wird. Die kostenlosen Cloud-Pakete aus alten Seiten oder Artikeln sollten nicht mehr als aktuelle Optionen angesehen werden.
Kann man LLMs und RAG bewerten?
Ja. Die Plattform unterstützt Bewertungen hinsichtlich Faktizität, Suchrelevanz, semantischer Ähnlichkeit, PII, Toxizität, Format sowie benutzerdefinierte Kriterien für LLMs. Zudem ist es möglich, verschiedene Modelle und Prompte miteinander zu vergleichen.
Kann man traditionelle Machine-Learning-Modelle überwachen?
Ja. Evidently unterstützt Klassifizierung, Regression, Sortieren, Empfehlungen, Datenqualität sowie Datendrift und kann die Ergebnisse in einer selbst gehosteten Dashboard-Plattform speichern.
Ist es notwendig, Daten in eine externe Cloud hochzuladen?
Open-Source-Bibliotheken und -Plattformen können vollständig in der eigenen Umgebung ausgeführt werden. Ob externe LLM-Bewerter, entfernte Datenbanken oder Objektspeicher genutzt werden, hängt von der Konfiguration des Teams ab.
Bietet die Open-Source-Überwachungs-Oberfläche eine Anmeldemöglichkeit sowie eine Verwaltung von Berechtigungen?
Die offizielle Vergleichstabelle zeigt, dass die Open-Source-Version keine Zertifizierung sowie Rollenrechte beinhaltet. Bei Nutzung im Außenbereich oder bei mehreren Benutzern sind Gateways, Identitätsdienste und Netzwerkrichtlinien erforderlich, um den Zugriff zu steuern.
Sammelt Evidently offensichtlich Modelldaten?
Offiziell wird angegeben, dass die selbstverwaltete UI-Telemetrie weder den Inhalt von Datensätzen, noch die Namen der Felder, Parameter oder Code sammelt. Auch die Erstellung von Berichten mithilfe von Python-Bibliotheken führt nicht zur Übermittlung von Telemetriedaten. Die anonyme UI-Telemetrie ist standardmäßig aktiv und kann deaktiviert werden.
Kann Evidently offensichtlich als Qualitätskontrolle für kontinuierliche Integration dienen?
Ja. Indem man die Schlüsselindikatoren in die Testsuite einträgt und Schwellenwerte festlegt, kann man bei Aktualisierungen des Modells, der Anweisungen oder der Daten ein Ergebnis von „Erfolgreich“ oder „Nicht erfolgreich“ ermitteln.
Was wird in der Business Enterprise-Version hinzugefügt?
Die Business-Version bietet vor allem die Möglichkeit zur kodenlosen Datenerstellung und -bewertung, ein kodenloses Dashboard, Vergleiche nebeneinander, Alarmfunktionen, geplante Aufgaben, Authentifizierung, Rollenrechte, eine erweiterte Backend-Struktur sowie exklusiven Support. Für die Preise ist bitte der Verkauf kontaktiert werden.
Zusammenfassung
Offensichtlich eignet sich KI für Teams, die die Qualität von KI mithilfe von Code definieren möchten, Offline-Bewertungen in Regressionstests umwandeln wollen und ihre LLM- sowie Machine-Learning-Systeme in ihrem eigenen Umfeld kontinuierlich überwachen möchten.
Die aktuelle Auswahl sollte hauptsächlich auf Open-Source-Lösungen für selbstverwaltete Umgebungen oder auf Enterprise-Lösungen für private Implementierungen ausgerichtet sein – anstelle von Planungen auf der Grundlage früherer Cloud-Pakete. Bei der Umsetzung müssen gleichzeitig Aspekte wie die Wirksamkeit der Metriken, die manuelle Kalibrierung, die Datenverwaltung sowie die Sicherheit in der Betriebsführung berücksichtigt werden.
Guigong-Netzwerk-Sicherheitsnummer: 45132202000164