Arize AI
Arize AI – ein intelligentes Tool, das sich auf die Bewertung von KI-Modellen konzentriert.
Tags:Bewertung von KI-ModellenWas ist Arize AI?
Arize AI ist eine Plattform für Teams, die mit KI arbeiten, und dient zur Überwachung, Bewertung sowie kontinuierlichen Verbesserung. Sie wird dazu eingesetzt, Aufrufe großer Modelle zu verfolgen, das Verhalten von Agenten zu analysieren, Muster von Fehlern aufzudecken sowie die Wirkung von Änderungen zu überprüfen.
Die Produkte sind in die Managed-Dienstlösung Arize AX und den lokal priorisierten Open-Source-Option Phoenix unterteilt; beide basieren auf den Standards OpenTelemetry und OpenInference.
Unterschiede zwischen Arize AX und Phoenix
| Produkte | Positionierung | Einsatz | Zielgruppe | Open-Source-Zustand |
|---|---|---|---|---|
| Arize AX | Gemanagte AI-Entwicklungsplattform | SaaS – Unternehmen können es selbst hosten. | Produktionsteam und großangelegte Unternehmen | Kommerzielle Produkte |
| Arize Phoenix | Lokale Tools zur Priorisierung von Beobachtungen und Bewertungen | Lokaler, kontenebasiert oder selbst erstellter Umgebungen | Entwickler, Forschungs- und Prototypenteams | Elastic License 2.0 |
Kernfunktionen
LLM und Agent-Tracking
- Aufzeichnung von Modellen, Werkzeugen, Suchmechanismen und Aufrufketten von Agenten
- Überprüfen Sie Eingang, Ausgang, Verzögerung, Token und Kosten
- Verhalten nach Trace, Span und Session analysieren
- Unterstützung für multimodales Tracking von Text, Bildern, Sprache und PDFs
- Zeigt den Pfad und die Graphstruktur der Agentenbahnen
- Anbindung bestehender Systeme über OpenTelemetry
Online- und Offline-Bewertung
- Online-Bewertung der Erstellung von Trace- und Span-Daten
- Offline-Bewertung von Datensätzen und Experimenten
- Verwendung von LLM-as-a-Judge zur Bewertung der Qualität
- Verifizierung deterministischer Regeln mit einem Code-Evaluator
- Bewertung der Relevanz, Korrektheit und Illusionen von RAG
- Bewertung mehrerer Sitzungen und des vollständigen Verlaufs des Agents
- Unterstützung für manuelle Anmerkungen und Feedback-Warteschlangen
Datensätze und Experimente
Das Team kann echte Anfragen, Fehlfallbeispiele und Grenzbeispiele zu Datensätzen zusammenfassen, um anschließend wiederholbare Experimente mit Prompten, Modellen oder Agentenlogiken durchzuführen.
- Testeingaben und erwartete Ergebnisse speichern
- Vergleich der Bewertungsscores verschiedener Experimente
- Berechnung von Genauigkeit, Präzision, Recall und F1
- Wiedergabe der Produktion Trace im Playground
- Mehrere Prompt-Sätze nebeneinander
- Versionierung und Optimierung von Prompten
Produktionsüberwachung und Signal
Signal analysiert kontinuierlich die Produktionsdaten und erkennt automatisch Muster von Agent-Fehlern, wodurch dem Team geholfen wird, unter der Vielzahl an Trace-Daten die am stärksten beeinträchtigenden Probleme zu identifizieren.
- Automatische Clusterbildung und Erkennung von Fehlmustern
- Überwachung nach Qualität, Verzögerung und Kosten erstellen
- Trends über das Dashboard beobachten
- Abweichungen mit bestimmten Sitzungen und Aufrufen verknüpfen
- Unternehmenslösungen können mit Code-Repositories verbunden werden und Korrektur-PRs erstellen.
- Unterstützung für gehostete Debugging-Proxye sowie Überwachung von Agenten-Gruppen
Schutzzäune und Sicherheitsbewertung
Die Plattform kann Eingangs- und Ausgangsdaten überwachen, Ausbrüche, Nachrichten mit geringer Relevanz sowie Nachrichten, die nicht den Richtlinien entsprechen, erkennen und den Prozess der Blockierung oder Neuerstellung aufzeichnen.
Unterstützte Technologie-Ökosysteme
- OpenTelemetry und OpenInference
- OpenAI und Anthropic
- LangChain und LangGraph
- LlamaIndex und CrewAI
- OpenAI Agents SDK
- Häufige Vektor-Datenbanken und RAG-Frameworks
- Python, TypeScript und CLI-Workflows
Für welche Anwendungsszenarien geeignet
- Überwachung der Qualität mehrerer Gespräche mit dem Kundenservice-Agenten
- Bewertung der Relevanz der RAG-Suche und der Richtigkeit der Antworten
- Fehler bei der Aufrufung von Analysetools und zyklisches Verhalten
- Vergleich von Modell- und Prompt-Versionen
- Verfolgung von Tokens, Verzögerungen und Aufrufkosten
- Erstellung eines Regressionstests aus Produktionsfehlern
- Erstellung einer Kennzeichnungs-Warteschlange für menschliche Prüfer
- Prototypen mit Phoenix vor Ort debuggen
- Einführung von kontinuierlichen Qualitätskontrollen für Unternehmens-IA-Systeme
Hauptvorteile
- Beobachtung, Bewertung, Experimente und Verbesserungen bilden einen Schließkreis.
- Verwendung offener Tracking-Standards zur Verringerung der Framework-Bindungen
- Unterstützung der einheitlichen Analyse in der Entwicklungs- und Produktionsphase
- Es gibt spezielle Ansichten für die Agentenbahnen und mehrfache Dialoge.
- Das kostenlose Paket bietet einen vollständigen Grundwerkflauf.
- Die Anzahl der Benutzer sowie die Anzahl der Bewertungen sind in allen Optionen unbegrenzt.
- Phoenix kann lokal ausgeführt werden und Daten steuern.
- Unterstützung für SaaS- sowie selbst gehostete Unternehmenslösungen
Einsatzbeschränkungen und Hinweise
- Free beinhaltet monatlich nur 25.000 Span.
- Pro Monat sind nur 50.000 Span enthalten.
- Ein komplexer Agent kann bei einer Anfrage eine große Anzahl an Spans erzeugen.
- Die Bewertung durch LLM verursacht zusätzliche Kosten für Model-Token.
- Trace kann Benutzereingaben sowie sensible Geschäftsdaten enthalten.
- Eine Aufbewahrungsfrist von 15 oder 30 Tagen reicht möglicherweise nicht aus, um langfristige Prüfungen zu ermöglichen.
- Selbstverwaltung, SSO und Audit-Logs gehören zu den Unternehmensfähigkeiten.
- Auch der Bewertungsalgorithmus selbst kann zu Fehlern und falschen Entscheidungen führen.
- Phoenix verwendet ELv2, es handelt sich dabei nicht um eine lizenzfreie, uneingeschränkte Lizenz.
- Teams mit hohem Datenaufkommen müssen im Voraus die Speicher- und Span-Nachfrage abschätzen.
Preis für das Arize AX-Paket
| Plan | Preis | Span/Monat | Speichern | Aufbewahrungsfrist | Einsatz |
|---|---|---|---|---|---|
| AX Free | Kostenlos | 25,000 | 1GB | 15 Tage | SaaS |
| AX Pro | 50 US-Dollar pro Monat | 50,000 | 10GB | 30 Tage | SaaS |
| AX Enterprise | Individuelle Kostenschätzung | Maßanfertigung | Maßanfertigung | Maßanfertigung | SaaS oder selbst gehostet |
Alle Angebote bieten unbegrenzte Anzahl an Benutzern, Bewertungen, Experimente, manuelle Annotationen sowie Annotationskolonnen; Preise und Limits können sich ändern.
Vergleich der Funktionsversionen
| Fähigkeiten | Free | Pro | Enterprise |
|---|---|---|---|
| OpenTelemetry-Tracking | Unterstützung | Unterstützung | Unterstützung |
| Signal-Probleme/Monat | 10 Stück | 25 Stück | Unbegrenzt |
| GDPR | Nicht aufgeführt | Unterstützung | Unterstützung |
| SOC 2 Type II | Nicht aufgeführt | Unterstützung | Unterstützung |
| Selbstverwaltung | Nicht unterstützt | Nicht unterstützt | Unterstützung |
| Unternehmens-SSO und Audit-Logs | Nicht unterstützt | Nicht unterstützt | Unterstützung |
| Benutzerdefinierter Code-Bewerter | Nicht unterstützt | Nicht unterstützt | Unterstützung |
| Verwalteter Debugging-Proxy | Nicht unterstützt | Nicht unterstützt | Unterstützung |
| Unterstützungsformen | Gemeinschaft | Exklusiver Support |
Wichtige Punkte bei der Kostenschätzung
- Erstellen Sie eine Statistik über die durchschnittliche Anzahl an Spans pro Benutzeranfrage.
- Schätzung von Toolaufrufen, Wiederholungen und Verbreitung von Unteragenten
- Unterschied zwischen den Speicherkosten für Trace-Daten und den Kosten für die Bewertung der Modelle mit Tokens
- Berechnung des durch multimodale Lasten verursachten Speicherzuwachses
- Bestätigung des Zeitraums, in dem die Daten aufbewahrt werden müssen
- Bewertung, ob die Anzahl der Nutzer die internen Betriebskosten beeinflusst
- Testen des Obergrenzwerts mit echten Produktproben
Arize AX – Schnelle Einführung
- Erstellen Sie ein kostenloses Konto und einen neuen Space.
- Wählen Sie die für die Anwendung zu verwendende Sprache sowie das Agentenframework aus.
- Installieren Sie die entsprechenden OpenInference-Instrumentierungskomponenten.
- Konfigurieren Sie den Arize-Endpunkt, die Space-ID und den API-Schlüssel.
- Führen Sie mehrere Testanfragen aus und öffnen Sie die Trace-Ansicht.
- Überprüfen Sie, ob die Modelle, Suchfunktionen, Tools sowie Agent Span vollständig sind.
- Fügen Sie Verzögerungs-, Kosten- und Qualitätsbewerter hinzu.
- Erst nach dem Aufbau von Dashboards und der Überwachung von Abweichungen soll die Produktion in Betrieb genommen werden.
RAG-Bewertungstrainingsmaterialien
- Aktivieren Sie die Überwachung für die Schritte LLM, Retriever und Embedding.
- Führen Sie eine Reihe repräsentativer Abfragen aus.
- Stellen Sie sicher, dass die gesuchten Abschnitte und die endgültige Antwort im richtigen Span liegen.
- Fügen Sie einen Bewertungsfaktor für die Relevanz der Suche hinzu.
- Fügen Sie einen Bewertungsfunktion für die Richtigkeit der Antworten sowie einen Illusionsbewerter hinzu.
- Speichern Sie die fehlgeschlagenen Trace als Datensatzbeispiele.
- Ändern Sie die Suchparameter, die Prompte oder das Modell.
- Führen Sie Experimente durch und vergleichen Sie die jeweiligen Werte sowie Kosten.
Leitfaden zur Verbesserung von Produktionsagenten
- Verfolgen Sie den vollständigen Agentenverlauf nach Sitzung.
- Aktivierung von Signal führt zu wiederholten Fehlern bei der Erkennung.
- Zufällig ausgewählte, hochwirksame Probleme werden manuell annotiert.
- Erstellen Sie Bewertungsfunktionen für die Auswahl der Werkzeuge, die endgültige Lösung und den Pfad.
- Typische Fehlschläge in den Regressionssatz aufnehmen.
- Wiedergeben und Anweisungen oder Logik im Playground ändern.
- Führen Sie Kontrollversuche durch, um zu überprüfen, ob die Änderungen eine Verbesserung bringen.
- Überwachen Sie nach dem Go-Live, ob dasselbe Fehlermuster erneut auftritt.
Privatsphäre und Sicherheit
Eine Spur enthält in der Regel Hinweise, Modellausgaben, abgerufenen Text, Tool-Parameter sowie Nutzerfeedback. Daher muss vor der Einbindung in eine Überwachungsplattform eine Klassifizierung und Maskierung der Daten erfolgen.
- Vermeiden Sie das Speichern von Passwörtern, Tokens und vollständigen Anmeldeinformationen.
- Entsperren von personenbezogenen Daten und Geschäftsgeheimnissen
- Einstellen von Space und Organisationsrechten nach Team
- Wählen Sie je nach regionalen Anforderungen die Datenregion USA, EU oder Kanada aus.
- Bewertung von Self-Hosting, SSO und Audit-Logs für Unternehmenskunden
- Klare Strategien für Löschung, Beibehaltung und Backup
- Einschränkung des Zugriffs des Bewertungsmodells auf sensible Spuren
Open-Source-Status von Phoenix
Der Code von Arize Phoenix ist auf GitHub veröffentlicht und ermöglicht das Tracking, die Bewertung, Experimente sowie die Iteration von Prompten. Er kann lokal oder auf eigener Infrastruktur ausgeführt werden.
| Projekt | Status | Erklärung |
|---|---|---|
| Arize AX | Kommerzielle Produkte | Hostingsplattformen und Unternehmensfunktionen |
| Arize Phoenix | Quellcode ist öffentlich zugänglich | Verwendung der Elastic License 2.0 |
| OpenInference | Offene Standards und Tools | Einheitliche semantische Konventionen für generative KI |
| Phoenix Evals | Open-Source-Bewertungsbibliothek | Angebote für Code und Workflows zur Bewertung von LLMs |
ELv2 erlaubt eine weitgehende Nutzung und Anpassung, beinhaltet jedoch Einschränkungen für Zwecke wie gehostete Dienste; vor der kommerziellen Weiterverbreitung sollte die Lizenz gelesen werden.
Grundlegende Informationen
| Projekt | Inhalt |
|---|---|
| Name des Tools | Arize AI |
| Kernprodukte | Arize AX und Arize Phoenix |
| Arten von Werkzeugen | Plattform für die Überwachung, Bewertung von KI sowie die Verbesserung von Agenten |
| Hauptnutzer | KI-Ingenieure, Machine-Learning-Ingenieure und Plattformteams |
| Standard | OpenTelemetry und OpenInference |
| Kostenloses Angebot | 25.000 Span/Monat, 1 GB Speicher, 15 Tage Aufbewahrung |
| Mindestpreis für die Bezahlung | AX Pro 50 US-Dollar pro Monat |
| Ist eine Registrierung erforderlich? | AX ist erforderlich, für die lokale Verwendung in Phoenix ist kein AX-Konto notwendig. |
| Wird Self-Hosting unterstützt? | Phoenix-Unterstützung, AX-Unternehmenslösungen-Unterstützung |
| Ob Open Source | AX ist nicht open source, Phoenix verwendet ELv2. |
Empfehlungswert
Der Gesamtbewertungsindex beträgt 4,8 von 5 möglichen Punkten. Arize AI eignet sich für Teams, die die Überwachung der Produktion, die Offline-Bewertung sowie die Verbesserung der Agenten zu einem geschlossenen Kreislauf zusammenführen möchten. Phoenix bietet Entwicklern, die eine lokale Installation bevorzugen, ebenfalls eine ausgereifte Lösung.
Häufige Fragen
Welche Probleme löst Arize AI hauptsächlich?
Es wird verwendet, um KI-Anwendungen zu überwachen, die Qualität der Ausgaben zu bewerten, Produktionsfehler aufzudecken und die Wirksamkeit von Verbesserungen zu überprüfen.
Was ist der Unterschied zwischen Arize AX und Phoenix?
AX ist eine gehostete Geschäftsplattform, während Phoenix ein open-source-Tool zur Überwachung und Bewertung ist, das lokal eingesetzt werden kann.
Ist Arize AX kostenlos?
Das Free-Paket ist kostenlos und beinhaltet monatlich 25.000 Spans, 1 GB Speicherplatz sowie eine Aufbewahrungsfrist von 15 Tagen.
Wie viel kostet Pro?
AX Pro kostet derzeit 50 US-Dollar pro Monat und beinhaltet 50.000 Spans, 10 GB Speicherplatz sowie eine Aufbewahrungsfrist von 30 Tagen.
Gibt es Beschränkungen bei der Anzahl der Bewertungen?
Die offizielle Bewertungstabelle gibt an, dass keine Beschränkungen gelten, doch die Verwendung externer Modelle zur Bewertung führt dennoch zu Kosten für die Modell-Tokens.
Wird die Überwachung durch Agenten unterstützt?
Unterstützung: Es ist möglich, die Spuren der Agenten, die Aufrufe der Tools sowie die Sessions anzusehen und mithilfe von Signal fehlerhafte Muster zu erkennen.
Kann man es selbst hosten?
Phoenix kann eigenständig implementiert werden, während Arize AX als Self-Hosting-Lösung zur Enterprise-Klasse gehört.
Was ist die Lizenz von Phoenix?
Phoenix verwendet die Elastic License 2.0 und nicht eine lockere Lizenz wie MIT oder Apache.
Kann man traditionelle Machine-Learning-Modelle überwachen?
Ja, Arize bietet auch Funktionen für Klassifizierung, Regression, Computervision sowie die Überwachung traditioneller Modelle.
Guigong-Netzwerk-Sicherheitsnummer: 45132202000164