Arize AI
Kostenloser Mehrwert
Komplette Liste an KI-Tools Bewertung von KI-Modellen

Arize AI

Arize AI – ein intelligentes Tool, das sich auf die Bewertung von KI-Modellen konzentriert.

Tags:

Was ist Arize AI?

Arize AI ist eine Plattform für Teams, die mit KI arbeiten, und dient zur Überwachung, Bewertung sowie kontinuierlichen Verbesserung. Sie wird dazu eingesetzt, Aufrufe großer Modelle zu verfolgen, das Verhalten von Agenten zu analysieren, Muster von Fehlern aufzudecken sowie die Wirkung von Änderungen zu überprüfen.

Die Produkte sind in die Managed-Dienstlösung Arize AX und den lokal priorisierten Open-Source-Option Phoenix unterteilt; beide basieren auf den Standards OpenTelemetry und OpenInference.

Unterschiede zwischen Arize AX und Phoenix

ProduktePositionierungEinsatzZielgruppeOpen-Source-Zustand
Arize AXGemanagte AI-EntwicklungsplattformSaaS – Unternehmen können es selbst hosten.Produktionsteam und großangelegte UnternehmenKommerzielle Produkte
Arize PhoenixLokale Tools zur Priorisierung von Beobachtungen und BewertungenLokaler, kontenebasiert oder selbst erstellter UmgebungenEntwickler, Forschungs- und PrototypenteamsElastic License 2.0

Kernfunktionen

LLM und Agent-Tracking

  • Aufzeichnung von Modellen, Werkzeugen, Suchmechanismen und Aufrufketten von Agenten
  • Überprüfen Sie Eingang, Ausgang, Verzögerung, Token und Kosten
  • Verhalten nach Trace, Span und Session analysieren
  • Unterstützung für multimodales Tracking von Text, Bildern, Sprache und PDFs
  • Zeigt den Pfad und die Graphstruktur der Agentenbahnen
  • Anbindung bestehender Systeme über OpenTelemetry

Online- und Offline-Bewertung

  • Online-Bewertung der Erstellung von Trace- und Span-Daten
  • Offline-Bewertung von Datensätzen und Experimenten
  • Verwendung von LLM-as-a-Judge zur Bewertung der Qualität
  • Verifizierung deterministischer Regeln mit einem Code-Evaluator
  • Bewertung der Relevanz, Korrektheit und Illusionen von RAG
  • Bewertung mehrerer Sitzungen und des vollständigen Verlaufs des Agents
  • Unterstützung für manuelle Anmerkungen und Feedback-Warteschlangen

Datensätze und Experimente

Das Team kann echte Anfragen, Fehlfallbeispiele und Grenzbeispiele zu Datensätzen zusammenfassen, um anschließend wiederholbare Experimente mit Prompten, Modellen oder Agentenlogiken durchzuführen.

  • Testeingaben und erwartete Ergebnisse speichern
  • Vergleich der Bewertungsscores verschiedener Experimente
  • Berechnung von Genauigkeit, Präzision, Recall und F1
  • Wiedergabe der Produktion Trace im Playground
  • Mehrere Prompt-Sätze nebeneinander
  • Versionierung und Optimierung von Prompten

Produktionsüberwachung und Signal

Signal analysiert kontinuierlich die Produktionsdaten und erkennt automatisch Muster von Agent-Fehlern, wodurch dem Team geholfen wird, unter der Vielzahl an Trace-Daten die am stärksten beeinträchtigenden Probleme zu identifizieren.

  • Automatische Clusterbildung und Erkennung von Fehlmustern
  • Überwachung nach Qualität, Verzögerung und Kosten erstellen
  • Trends über das Dashboard beobachten
  • Abweichungen mit bestimmten Sitzungen und Aufrufen verknüpfen
  • Unternehmenslösungen können mit Code-Repositories verbunden werden und Korrektur-PRs erstellen.
  • Unterstützung für gehostete Debugging-Proxye sowie Überwachung von Agenten-Gruppen

Schutzzäune und Sicherheitsbewertung

Die Plattform kann Eingangs- und Ausgangsdaten überwachen, Ausbrüche, Nachrichten mit geringer Relevanz sowie Nachrichten, die nicht den Richtlinien entsprechen, erkennen und den Prozess der Blockierung oder Neuerstellung aufzeichnen.

Unterstützte Technologie-Ökosysteme

  • OpenTelemetry und OpenInference
  • OpenAI und Anthropic
  • LangChain und LangGraph
  • LlamaIndex und CrewAI
  • OpenAI Agents SDK
  • Häufige Vektor-Datenbanken und RAG-Frameworks
  • Python, TypeScript und CLI-Workflows

Für welche Anwendungsszenarien geeignet

  • Überwachung der Qualität mehrerer Gespräche mit dem Kundenservice-Agenten
  • Bewertung der Relevanz der RAG-Suche und der Richtigkeit der Antworten
  • Fehler bei der Aufrufung von Analysetools und zyklisches Verhalten
  • Vergleich von Modell- und Prompt-Versionen
  • Verfolgung von Tokens, Verzögerungen und Aufrufkosten
  • Erstellung eines Regressionstests aus Produktionsfehlern
  • Erstellung einer Kennzeichnungs-Warteschlange für menschliche Prüfer
  • Prototypen mit Phoenix vor Ort debuggen
  • Einführung von kontinuierlichen Qualitätskontrollen für Unternehmens-IA-Systeme

Hauptvorteile

  • Beobachtung, Bewertung, Experimente und Verbesserungen bilden einen Schließkreis.
  • Verwendung offener Tracking-Standards zur Verringerung der Framework-Bindungen
  • Unterstützung der einheitlichen Analyse in der Entwicklungs- und Produktionsphase
  • Es gibt spezielle Ansichten für die Agentenbahnen und mehrfache Dialoge.
  • Das kostenlose Paket bietet einen vollständigen Grundwerkflauf.
  • Die Anzahl der Benutzer sowie die Anzahl der Bewertungen sind in allen Optionen unbegrenzt.
  • Phoenix kann lokal ausgeführt werden und Daten steuern.
  • Unterstützung für SaaS- sowie selbst gehostete Unternehmenslösungen

Einsatzbeschränkungen und Hinweise

  • Free beinhaltet monatlich nur 25.000 Span.
  • Pro Monat sind nur 50.000 Span enthalten.
  • Ein komplexer Agent kann bei einer Anfrage eine große Anzahl an Spans erzeugen.
  • Die Bewertung durch LLM verursacht zusätzliche Kosten für Model-Token.
  • Trace kann Benutzereingaben sowie sensible Geschäftsdaten enthalten.
  • Eine Aufbewahrungsfrist von 15 oder 30 Tagen reicht möglicherweise nicht aus, um langfristige Prüfungen zu ermöglichen.
  • Selbstverwaltung, SSO und Audit-Logs gehören zu den Unternehmensfähigkeiten.
  • Auch der Bewertungsalgorithmus selbst kann zu Fehlern und falschen Entscheidungen führen.
  • Phoenix verwendet ELv2, es handelt sich dabei nicht um eine lizenzfreie, uneingeschränkte Lizenz.
  • Teams mit hohem Datenaufkommen müssen im Voraus die Speicher- und Span-Nachfrage abschätzen.

Preis für das Arize AX-Paket

PlanPreisSpan/MonatSpeichernAufbewahrungsfristEinsatz
AX FreeKostenlos25,0001GB15 TageSaaS
AX Pro50 US-Dollar pro Monat50,00010GB30 TageSaaS
AX EnterpriseIndividuelle KostenschätzungMaßanfertigungMaßanfertigungMaßanfertigungSaaS oder selbst gehostet

Alle Angebote bieten unbegrenzte Anzahl an Benutzern, Bewertungen, Experimente, manuelle Annotationen sowie Annotationskolonnen; Preise und Limits können sich ändern.

Vergleich der Funktionsversionen

FähigkeitenFreeProEnterprise
OpenTelemetry-TrackingUnterstützungUnterstützungUnterstützung
Signal-Probleme/Monat10 Stück25 StückUnbegrenzt
GDPRNicht aufgeführtUnterstützungUnterstützung
SOC 2 Type IINicht aufgeführtUnterstützungUnterstützung
SelbstverwaltungNicht unterstütztNicht unterstütztUnterstützung
Unternehmens-SSO und Audit-LogsNicht unterstütztNicht unterstütztUnterstützung
Benutzerdefinierter Code-BewerterNicht unterstütztNicht unterstütztUnterstützung
Verwalteter Debugging-ProxyNicht unterstütztNicht unterstütztUnterstützung
UnterstützungsformenGemeinschaftE-MailExklusiver Support

Wichtige Punkte bei der Kostenschätzung

  • Erstellen Sie eine Statistik über die durchschnittliche Anzahl an Spans pro Benutzeranfrage.
  • Schätzung von Toolaufrufen, Wiederholungen und Verbreitung von Unteragenten
  • Unterschied zwischen den Speicherkosten für Trace-Daten und den Kosten für die Bewertung der Modelle mit Tokens
  • Berechnung des durch multimodale Lasten verursachten Speicherzuwachses
  • Bestätigung des Zeitraums, in dem die Daten aufbewahrt werden müssen
  • Bewertung, ob die Anzahl der Nutzer die internen Betriebskosten beeinflusst
  • Testen des Obergrenzwerts mit echten Produktproben

Arize AX – Schnelle Einführung

  1. Erstellen Sie ein kostenloses Konto und einen neuen Space.
  2. Wählen Sie die für die Anwendung zu verwendende Sprache sowie das Agentenframework aus.
  3. Installieren Sie die entsprechenden OpenInference-Instrumentierungskomponenten.
  4. Konfigurieren Sie den Arize-Endpunkt, die Space-ID und den API-Schlüssel.
  5. Führen Sie mehrere Testanfragen aus und öffnen Sie die Trace-Ansicht.
  6. Überprüfen Sie, ob die Modelle, Suchfunktionen, Tools sowie Agent Span vollständig sind.
  7. Fügen Sie Verzögerungs-, Kosten- und Qualitätsbewerter hinzu.
  8. Erst nach dem Aufbau von Dashboards und der Überwachung von Abweichungen soll die Produktion in Betrieb genommen werden.

RAG-Bewertungstrainingsmaterialien

  1. Aktivieren Sie die Überwachung für die Schritte LLM, Retriever und Embedding.
  2. Führen Sie eine Reihe repräsentativer Abfragen aus.
  3. Stellen Sie sicher, dass die gesuchten Abschnitte und die endgültige Antwort im richtigen Span liegen.
  4. Fügen Sie einen Bewertungsfaktor für die Relevanz der Suche hinzu.
  5. Fügen Sie einen Bewertungsfunktion für die Richtigkeit der Antworten sowie einen Illusionsbewerter hinzu.
  6. Speichern Sie die fehlgeschlagenen Trace als Datensatzbeispiele.
  7. Ändern Sie die Suchparameter, die Prompte oder das Modell.
  8. Führen Sie Experimente durch und vergleichen Sie die jeweiligen Werte sowie Kosten.

Leitfaden zur Verbesserung von Produktionsagenten

  1. Verfolgen Sie den vollständigen Agentenverlauf nach Sitzung.
  2. Aktivierung von Signal führt zu wiederholten Fehlern bei der Erkennung.
  3. Zufällig ausgewählte, hochwirksame Probleme werden manuell annotiert.
  4. Erstellen Sie Bewertungsfunktionen für die Auswahl der Werkzeuge, die endgültige Lösung und den Pfad.
  5. Typische Fehlschläge in den Regressionssatz aufnehmen.
  6. Wiedergeben und Anweisungen oder Logik im Playground ändern.
  7. Führen Sie Kontrollversuche durch, um zu überprüfen, ob die Änderungen eine Verbesserung bringen.
  8. Überwachen Sie nach dem Go-Live, ob dasselbe Fehlermuster erneut auftritt.

Privatsphäre und Sicherheit

Eine Spur enthält in der Regel Hinweise, Modellausgaben, abgerufenen Text, Tool-Parameter sowie Nutzerfeedback. Daher muss vor der Einbindung in eine Überwachungsplattform eine Klassifizierung und Maskierung der Daten erfolgen.

  • Vermeiden Sie das Speichern von Passwörtern, Tokens und vollständigen Anmeldeinformationen.
  • Entsperren von personenbezogenen Daten und Geschäftsgeheimnissen
  • Einstellen von Space und Organisationsrechten nach Team
  • Wählen Sie je nach regionalen Anforderungen die Datenregion USA, EU oder Kanada aus.
  • Bewertung von Self-Hosting, SSO und Audit-Logs für Unternehmenskunden
  • Klare Strategien für Löschung, Beibehaltung und Backup
  • Einschränkung des Zugriffs des Bewertungsmodells auf sensible Spuren

Open-Source-Status von Phoenix

Der Code von Arize Phoenix ist auf GitHub veröffentlicht und ermöglicht das Tracking, die Bewertung, Experimente sowie die Iteration von Prompten. Er kann lokal oder auf eigener Infrastruktur ausgeführt werden.

ProjektStatusErklärung
Arize AXKommerzielle ProdukteHostingsplattformen und Unternehmensfunktionen
Arize PhoenixQuellcode ist öffentlich zugänglichVerwendung der Elastic License 2.0
OpenInferenceOffene Standards und ToolsEinheitliche semantische Konventionen für generative KI
Phoenix EvalsOpen-Source-BewertungsbibliothekAngebote für Code und Workflows zur Bewertung von LLMs

ELv2 erlaubt eine weitgehende Nutzung und Anpassung, beinhaltet jedoch Einschränkungen für Zwecke wie gehostete Dienste; vor der kommerziellen Weiterverbreitung sollte die Lizenz gelesen werden.

Grundlegende Informationen

ProjektInhalt
Name des ToolsArize AI
KernprodukteArize AX und Arize Phoenix
Arten von WerkzeugenPlattform für die Überwachung, Bewertung von KI sowie die Verbesserung von Agenten
HauptnutzerKI-Ingenieure, Machine-Learning-Ingenieure und Plattformteams
StandardOpenTelemetry und OpenInference
Kostenloses Angebot25.000 Span/Monat, 1 GB Speicher, 15 Tage Aufbewahrung
Mindestpreis für die BezahlungAX Pro 50 US-Dollar pro Monat
Ist eine Registrierung erforderlich?AX ist erforderlich, für die lokale Verwendung in Phoenix ist kein AX-Konto notwendig.
Wird Self-Hosting unterstützt?Phoenix-Unterstützung, AX-Unternehmenslösungen-Unterstützung
Ob Open SourceAX ist nicht open source, Phoenix verwendet ELv2.

Empfehlungswert

Der Gesamtbewertungsindex beträgt 4,8 von 5 möglichen Punkten. Arize AI eignet sich für Teams, die die Überwachung der Produktion, die Offline-Bewertung sowie die Verbesserung der Agenten zu einem geschlossenen Kreislauf zusammenführen möchten. Phoenix bietet Entwicklern, die eine lokale Installation bevorzugen, ebenfalls eine ausgereifte Lösung.

Häufige Fragen

Welche Probleme löst Arize AI hauptsächlich?

Es wird verwendet, um KI-Anwendungen zu überwachen, die Qualität der Ausgaben zu bewerten, Produktionsfehler aufzudecken und die Wirksamkeit von Verbesserungen zu überprüfen.

Was ist der Unterschied zwischen Arize AX und Phoenix?

AX ist eine gehostete Geschäftsplattform, während Phoenix ein open-source-Tool zur Überwachung und Bewertung ist, das lokal eingesetzt werden kann.

Ist Arize AX kostenlos?

Das Free-Paket ist kostenlos und beinhaltet monatlich 25.000 Spans, 1 GB Speicherplatz sowie eine Aufbewahrungsfrist von 15 Tagen.

Wie viel kostet Pro?

AX Pro kostet derzeit 50 US-Dollar pro Monat und beinhaltet 50.000 Spans, 10 GB Speicherplatz sowie eine Aufbewahrungsfrist von 30 Tagen.

Gibt es Beschränkungen bei der Anzahl der Bewertungen?

Die offizielle Bewertungstabelle gibt an, dass keine Beschränkungen gelten, doch die Verwendung externer Modelle zur Bewertung führt dennoch zu Kosten für die Modell-Tokens.

Wird die Überwachung durch Agenten unterstützt?

Unterstützung: Es ist möglich, die Spuren der Agenten, die Aufrufe der Tools sowie die Sessions anzusehen und mithilfe von Signal fehlerhafte Muster zu erkennen.

Kann man es selbst hosten?

Phoenix kann eigenständig implementiert werden, während Arize AX als Self-Hosting-Lösung zur Enterprise-Klasse gehört.

Was ist die Lizenz von Phoenix?

Phoenix verwendet die Elastic License 2.0 und nicht eine lockere Lizenz wie MIT oder Apache.

Kann man traditionelle Machine-Learning-Modelle überwachen?

Ja, Arize bietet auch Funktionen für Klassifizierung, Regression, Computervision sowie die Überwachung traditioneller Modelle.

©️ Urheberrechtshinweis: Sofern nicht anders angegeben, liegen die Urheberrechte an allen Artikeln auf dieser Website beiTeilen von AI-ToolsAlle Urheberrechte liegen bei uns. Ohne Genehmigung darf keine Person, kein Medienunternehmen, keine Website oder irgendeine Gruppe den Inhalt dieser Website kopieren, nachahmen oder auf andere Weise verbreiten. Ebenso ist es nicht gestattet, Spiegelseiten auf Servern zu erstellen, die nicht uns gehören. Andernfalls behalten wir uns das Recht vor, rechtliche Schritte gegen die Verantwortlichen einzuleiten.

Tools, die dem Arize AI ähneln