HoneyHive
HoneyHive – ein intelligentes Tool, das sich auf die Bewertung von KI-Modellen konzentriert.
Tags:Bewertung von KI-ModellenEine kurze Beschreibung
HoneyHive ist eine Plattform für die Überwachung und Bewertung von AI-Agenten im Produktivumfeld, die Entwicklerteams dabei unterstützt, Modelle, Tools, Kommunikationswege sowie den Betrieb mehrerer Agenten zu verfolgen. Mithilfe automatischer und manueller Bewertungen können Probleme aufgedeckt werden, wobei tatsächliche Fehler in kontinuierliche Regressionstests umgewandelt werden.
Einführung in die Tools
HoneyHive bringt Observabilität, Bewertung, Datensätze, Prompts und kontinuierliche Integration in denselben Entwicklungslebenszyklus zusammen. Es ist kein Modellanbieter und erstellt auch keine Geschäftsagenten für die Nutzer – stattdessen protokolliert es, was die Agenten tatsächlich tun, misst die Qualität der Ergebnisse und hilft dem Team, die Ursachen für Leistungsabfälle zu ermitteln.
Die Plattform verwendet OpenTelemetry als Grundlage für die Überwachung und bietet Unterstützung für Python, TypeScript, offene Schnittstellen, die Kommandozeile sowie verschiedene Methoden zur automatischen Einfügung von Code. Entwickler können die kostenlose Cloud-Version nutzen, während Unternehmen zwischen mehreren Nutzern, einem einzigen Nutzer, einer hybriden oder selbst gehosteten Implementierung wählen können.
Kerndatenmodell
| Objekt | Bedeutung | Typischer Inhalt | Hauptverwendungszweck |
|---|---|---|---|
| Event | Eine Kombination aus Zeitraum oder Indikator-Label | Modelle, Werkzeuge, Schrittfolgen oder Kennzahlen | Die Grundeinheiten für die Abrechnung, das Filtern und die Bewertung |
| Span | Einzelner Ausführungsschritt | Eingabe, Ausgabe, Fehler, Laufzeit und Eigenschaften | Ermittlung des spezifischen Versagenspunkts |
| Session | Vollständiger Antrag oder mehrere Ausführungen | Mehrere Modelle, Werkzeuge und Link-Ereignisse | Restaurierung der End-zu-End-Proxy-Verfolgung |
| Trace | Distributed Ausführungspfad | Vater-Sohn-Beziehung, Wiederholung, Schleifen und Übergabe | Beobachtung von langfristigen und mehragentigen Aufgaben |
| Datapoint | Ein Testprobenstück | Eingabe, Standardantwort, Historie und Metadaten | Experimente und Regressionstests |
| Dataset | Strukturierte Testdatensammlung | Produktionsfehler, Randfälle und Referenzdatensätze | Vergleich von Hinweisen, Modellen oder RAG-Konfigurationen |
| Evaluator | Funktion zur Bewertung der Ausgabe oder des Verlaufs | Boolesch, numerisch, kategorisiert oder interpretiert | Qualitätskontrolle und Veröffentlichungshürden |
| Prompt Config | Kombinationen von Versionen von Hinweisen, Modellen und Parametern | Vorlagen, Modelle, Werkzeuge und Hyperparameter | Experimente, Versionsverwaltung und Bereitstellung |
Hauptfunktionen
Distributed Link Tracking
HoneyHive kann die Modellableitungen, externe Tools, Suchvorgänge, geschachtelte Schritte sowie gesamte Benutzersitzungen aufzeichnen und dabei die Eltern-Kind-Beziehungen beibehalten. Ingenieure können einen Ablauf in chronologischer Reihenfolge abspielen und direkt zu den Stellen springen, an denen Fehler, Zeitüberschreitungen oder ungewöhnliches Verhalten auftraten.
Langzeit-Proxy-Debugging
Die Plattform zeigt für die Aktivitäten der Agenten über mehrere Stunden oder Tage hinweg Wiederholungsversuche, Schleifen, den Übergang an Unteragenten sowie Toolaufrufe an. Sie eignet sich dazu, herauszufinden, an welcher Stelle der Agent vom Ziel abweicht – anstatt nur zu prüfen, ob die endgültige Antwort korrekt ist.
Mehr-Agenten-Überwachung
Mehrere Agenten oder Unteragenten können ein einheitliches Ereignismodell nutzen, um Entscheidungen, Werkzeuge, Zustände und Übergaben zu erfassen. Das Team benötigt stabile Tracking-Identifikatoren sowie Kontextinformationen – andernfalls kann die Ablaufsteuerung zwischen verschiedenen Prozessen in unverknüpfbare Teile zerfallen.
Automatische Pfahlsetzung
Die Python- und TypeScript-Tools basieren auf OpenTelemetry und können automatisch häufig verwendete Modellframeworks, Proxy-Frameworks sowie externe Aufrufe erfassen. Laut Angaben der Plattform werden mehr als 50 gängige Bibliotheken abgedeckt, darunter LangChain, LangGraph, AWS Strands, Google ADK und OpenAI Agents SDK.
Custom Span
Für Funktionen, die nicht automatisch erkannt werden, können Entwickler mit Decoratoren oder manuell Eingaben, Ausgaben, Fehler, Dauer, Metadaten, Feedback und Kennzahlen erfassen. Je feiner die Überwachung ist, desto besser ist die Fähigkeit zur Fehlersuche – doch dadurch steigen auch der Ressourcenverbrauch, die Verzögerungen sowie das Risiko im Umgang mit sensiblen Daten.
Qualitätskontrolle in der Produktion
Das Team kann Tests unter realen Datenströmen durchführen und die Ergebnisse mit Nutzerfeedback, Geschäftsergebnissen sowie bestimmten Versionen in Verbindung bringen. Bei der Überwachung der Produktion sollten Abtastgrenzen sowie Kostengrenzen festgelegt werden, um zu vermeiden, dass bei jedem Ausführungsversuch eines komplexen Prozesses teure Modellbewertungen ausgelöst werden.
Anpassbares Dashboard
Tracking-Daten, Metadaten und Bewertungskennzahlen können nach Modell, Version, Benutzergruppe, Umgebung oder Funktion gruppiert und in Diagramme dargestellt werden. Boolesche Kennzahlen ermöglichen es, die Erfolgsrate anzusehen, numerische Kennzahlen lassen es zu, Durchschnitte, Quartile und Extremwerte zu berechnen, während Zeichenketten zur Klassifizierung und Filterung geeignet sind.
Alarme und Drifterkennung
Die Plattform kann Überwachungssysteme für Fehler, Verzögerungen, Kosten, Qualität sowie Veränderungen in der Verteilung einrichten, um dem Team zu helfen, einen Rückgang der Leistung der Agenten frühzeitig zu erkennen. Die Alarmschwellenwerte müssen an den Datenverkehr und die Geschäftsrisiken angepasst werden – zu hohe Sensitivität führt zu Fehlalarmen, während zu niedrige Schwellenwerte dazu führen, dass echte Störungen übersehen werden.
Kundenbewertung
Die Anwendung kann in ihrer eigenen Laufumgebung Kennzahlen zu Format, Sicherheit, persönlichen Daten oder Geschäftsregeln berechnen und die Ergebnisse in Tracking- oder Zeitraumdaten aufnehmen. Die Client-Bewertung eignet sich dazu, sensible Überprüfungen vor dem Verlassen der Daten aus dem System durchzuführen, wobei dieselben Kennzahlen nicht von der Server-Seite überprüft werden.
Bewertung des Server-Code
Entwickler können in HoneyHive die Codebewertung konfigurieren, um für hochgeladene Protokolle, Zeitintervalle oder vollständige Sitzungen deterministische Kennzahlen zu berechnen. Die Codebewertung eignet sich für Format, Felder, Reihenfolge der Tools sowie überprüfbare Geschäftsregeln, und die Ergebnisse sind stabiler als die von Modellrichtern.
LLM-Bewertung durch Schiedsrichter
Der LLM-Evaluator bewertet unstrukturierte Antworten, Suchergebnisse oder Agentenverläufe anhand von benutzerdefinierten Kriterien und kann Erklärungen liefern. Die aktuellen Dokumentationen besagen, dass für die Bewertung durch das Server-Modell GPT-4o verwendet wird; sensible Daten sowie Kosten müssen unter Berücksichtigung von Stichprobenverfahren, Vertragsbedingungen und Implementierungsweisen bewertet werden.
Manuelle Bewertung und Annotationskollektiv
Fachleute können in der Benutzeroberfläche nach individuellen Skalen bewerten, Kommentare abgeben und Markierungsreihen erstellen – was sich besonders für Aufgaben eignet, bei denen eine vollständig automatische Beurteilung schwierig ist, wie beispielsweise im Gesundheitswesen, im Rechtswesen, in der Finanzbranche oder bei der Gestaltung des Marktonstons. Die menschlichen Bewertungskriterien müssen zunächst abgestimmt werden, da sonst unterschiedliche Bewertende unvergleichbare Ergebnisse liefern würden.
Prüfer-Überprüfung
Die Plattform ermöglicht es, den Bewertungsalgorithmus zunächst mit aktuellen Ereignissen oder manuellen Beispielen zu testen, bevor eine Entscheidung über die Einsatz in der Produktion getroffen wird. Modelle sind nicht von Natur aus zuverlässig; ihre Ergebnisse sollten mit der Einschätzung von Experten abgeglichen werden, um Abweichungen, Manipulationen, Standortpräferenzen sowie Stabilität der Bewertungen zu überprüfen.
Online-Bewertungs-Sampling
Die Bewertung auf der Serverseite kann nur bei einem bestimmten Prozentsatz der Produktions- oder Voreilab-Ereignisse durchgeführt werden, um Kosten und Durchsatz zu kontrollieren. Bei Offline-Experimenten wird in der Regel keine gleiche Stichprobenlogik verwendet, um sicherzustellen, dass verschiedene Konfigurationen auf derselben vollständigen Datensammlung verglichen werden können.
Datensatzverwaltung
Das Datensatz setzt sich aus Eingaben, Standardantworten, Dialoghistorien und Metadaten zusammen. Er kann aus der Produktverfolgung ausgewählt werden oder über eine Benutzeroberfläche bzw. ein SDK hochgeladen werden. Das Team kann echte Fehler sowie Randfälle kontinuierlich in den Referenzdatensatz aufnehmen, um so Testressourcen zu schaffen, die der Geschäftswelt besser entsprechen.
Import und Export von Datensätzen
Die Benutzeroberfläche unterstützt JSON-, JSONL- und CSV-Dateien. Das SDK ermöglicht außerdem die Massenerstellung und -lesung von Datensätzen. Datensätze können zur externen Bewertung, Archivierung oder Feinabstimmung exportiert werden, wobei vor dem Export Benutzeridentitäten sowie vertrauliche Inhalte entfernt werden sollten.
Offline-Experimente
Das Experiment kombiniert die zu testenden Funktionen, ein einheitliches Datensatz sowie eine Reihe von Bewertungsmethoden – dies eignet sich zur Vergleichbarkeit von Prompten, Modellen, Suchstrategien, Blockierungsverfahren oder ganzen Agentenarchitekturen. Jeder Durchlauf speichert Metriken und Verfolgungsdaten, um eine Stück für Stück-Vergleich der Verbesserungen und Verschlechterungen pro Beispiel zu ermöglichen.
Parallelversuche
Das Bewertungsframework kann Datenpunkte parallel verarbeiten und die Anzahl der Arbeits Threads steuern, wodurch die Laufzeit für große Testmengen verkürzt wird. Die Parallelisierungsrate ist dennoch durch Beschränkungen seitens des Modellanbieters, Budgetrestriktionen, gemeinsam genutzte Zustände sowie die Kapazität des Zielsystems eingeschränkt.
Git-Kontext
Beim Ausführen von Experimenten aus dem Code-Repository kann das SDK Änderungen, Branches, Autoren, Remote-Adressen sowie ungeprüfte Änderungen im Arbeitsbereich aufzeichnen. Diese Informationen helfen dabei, die Ergebnisse mit den jeweiligen Code-Versionen in Verbindung zu bringen. Gleichzeitig können sie jedoch auch interne Repository-Metadaten preisgeben; daher sollte entschieden werden, ob diese Informationen je nach Umgebung und Berechtigungen gespeichert werden sollen oder nicht.
Einstiegshürden für kontinuierliche Integration
Das Team kann bei Code-Änderungen Tests ausführen, Qualitätsschwellwerte festlegen und die Veröffentlichung verhindern, wenn die Kennzahlen nachlassen. Der Testdatensatz sollte kritische Geschäftsfehler umfassen und nicht nur einfache Beispiele, da andernfalls ein grüner Status noch keine Zuverlässigkeit in der Produktion beweist.
Online-Experimente und A/B-Tests
Die Anwendung kann Experiment-IDs, Konfigurationsversionen sowie Nutzerfeedback in die Überwachung aufnehmen und anschließend im Dashboard die Kontrollgruppe mit der Versuchsgruppe vergleichen. HoneyHive ist für das Erfassen und Analysieren zuständig; die Verteilung des Datenverkehrs wird in der Regel weiterhin durch vorhandene Schalter oder das Experimentiersystem erledigt.
Tipps Playground
Playground dient dazu, Hinweise, Modelle, Funktionen und externe Tools schnell auszuprobieren, und es ermöglicht es, von den Protokollen aus fehlerhafte Vorgänge zu öffnen, um weiter zu iterieren. Es eignet sich zum Erkunden und Nachstellen von Problemen und sollte nicht dazu verwendet werden, direkt Produktionshinweise ohne formelle Datensätze, Bewertungen und Code-Reviews zu ändern.
Prompt-Versionen-Verwaltung
Jede Hinweiskonfiguration enthält Vorlagen, Modelle, Hyperparameter und Tools; sie ermöglicht das Speichern von Historien sowie die Bereitstellung in Anwendungen. Versionierung verringert manuelle Kopierfehler, doch Updates der Modellanbieter, Änderungen externer Kenntnisse sowie Veränderungen der Laufzeittools können dennoch die Ergebnisse beeinflussen.
Produktionsfehler in Datensatz umwandeln
Ingenieure können aus den Protokollen Fehler, Abläufe mit niedrigem oder hohem Wert auswählen und diese zu Datensätzen zusammenfassen. Anschließend werden mithilfe derselben Beispiele die Hinweise, Modelle und Code vor und nach der Korrektur verglichen, wodurch ein Kreislauf von Beobachtung bis zur Verbesserung entsteht.
Vergleich der Bewertungsmethoden
| Bewertungsmethode | Ausführungsort | geeignete Indikatoren | Vorteile | Hauptbeschränkungen |
|---|---|---|---|---|
| Client-Code | In der Benutzeranwendung | Format, Sicherheit, personenbezogene Daten und Geschäftsregeln | Die Daten können lokal überprüft werden, um das Ergebnis zu bestimmen. | Code muss entwickelt und gewartet werden. |
| Servercode | HoneyHive oder private Bereitstellung | Struktur, Felder, Reihenfolge der Werkzeuge und Berechnungsindikatoren | Zentrale Verwaltung und wiederholbare Ausführung | Es muss sichergestellt werden, dass die Laufumgebung sowie die Abhängigkeiten sicher sind. |
| LLM-Richter | Aufruf des Server-Modells | Relevanz, Treue, Tonfall und Konstanz der Entwicklung | geeignet für unstrukturierte, komplexe Standards | Kosten, Abweichungen und Instabilität |
| Manuelle Annotation | Plattform-Anzeigefläche | Professionelle Qualität, Risiken und subjektive Erfahrungen | Die Bereichsbewertung ist am engsten mit dem Geschäft verbunden. | Langsame Geschwindigkeit und Standardausrichtung erforderlich |
| Kundenfeedback | Interaktive Produktion | Gefallen, Erfolg, Beschwerden und echte Ergebnisse | Direkte Verbindung zur Benutzererfahrung | Die Signale sind spärlich und können einen selektiven Verzerrungseffekt aufweisen. |
Von der Überwachung bis zur Verbesserung des Workflows
- Erstellen Sie separate Projekte und API-Schlüssel für die Produktions-, Vorab-Veröffentlichungs- und Entwicklungsumgebungen.
- Verbinden Sie Modelle, Tools, Suchfunktionen und Proxy-Schritte über OpenTelemetry oder das offizielle SDK.
- Zuerst wird in der Testumgebung die Brückenstruktur, die Eltern-Kind-Beziehungen, die Felder sowie sensible Daten überprüft.
- Grundlegende Kennzahlen für Verzögerungen, Fehler, Kosten, Genauigkeit der Werkzeuge und Qualität der Ausgabe festlegen.
- Aus dem tatsächlichen Datenverkehr werden fehlgeschlagene Fälle, Fälle mit niedrigem Score, Beschwerden sowie wertvolle Randfälle ausgewählt.
- Strukturieren Sie die Fälle als versionierte Datensätze mit Eingaben, Standardantworten und Metadaten.
- Mit Code, Modellen und Branchenexperten werden komplementäre Bewertungstools erstellt und kalibriert.
- Ausführen von Hinweisen, Modell- oder Architektur-Experimenten, um Verbesserungen und Verschlechterungen pro Beispiel zu vergleichen.
- Fügen Sie die wichtigen Bewertungen der kontinuierlichen Integration hinzu sowie Sampling und Alarme in den Produktionsbetrieb.
- Durch die ständige Hinzufügung neuer Fehler zum Datensatz entwickeln sich die Zuverlässigkeitsstandards im Einklang mit der tatsächlichen Geschäftsentwicklung.
Anschlussschritte
- Erstellen Sie einen HoneyHive-Arbeitsbereich und Projekte sowie generieren Sie für die Projekte eigene API-Schlüssel.
- Installieren Sie die Python- oder TypeScript-Tools entsprechend dem Technologiestack, oder verwenden Sie OpenTelemetry zur Übermittlung von Tracking-Daten.
- Initialisieren Sie den Tracker und geben Sie den Projekt-, Umgebungs-, Sitzungsnamen sowie eine optionalen privaten Service-Adresse an.
- Führen Sie eine minimale Anfrage aus, um zu überprüfen, ob Modell, Werkzeuge, Verbindungen und Sitzungsebene korrekt sind.
- Fügen Sie für benutzerdefinierte Funktionen einen Zeitrahmen hinzu, um notwendige Fehler, Laufzeiten, Rückmeldungen sowie Geschäftsmetadaten aufzuzeichnen.
- Verschließen Sie Passwörter, Token, persönliche Informationen, Dokumentinhalte und andere Daten, die nicht hochgeladen werden sollten.
- Führen Sie die Ausführung im Log-Lager erneut durch, um Suchfunktionen, Filter, Diagramme sowie Teamrechte zu überprüfen.
- Erstellen Sie kleine Datensätze und deterministische Bewertungswerkzeuge, fügen Sie anschließend schrittweise Modellrichter hinzu.
- Einstellen von Ereignisbudgets, Anfragedichten, Retentionsstrategien, Sampling sowie Produktionswarnungen.
- Vor einer offiziellen Erweiterung des Datenverkehrs müssen Sicherheits-, DPA-, BAA- oder Evaluierungen für eine private Bereitstellung abgeschlossen werden.
Preise und Pakete
Die Preisangaben wurden am 23. August 2026 überprüft. Die tatsächlichen Beträge, Steuern, Wechselkurse sowie Rabatte können sich ändern; es gilt letztendlich das, was auf der Zahlelseite angezeigt wird.
HoneyHive bietet derzeit eine kostenlose Developer-Version sowie maßgeschneiderte Enterprise-Lösungen an. Die kostenlose Version erfordert keine Kreditkarte und eignet sich für die Entwicklung sowie zur Überprüfung in kleinem Maßstab; die Enterprise-Version bietet mehr Flexibilität hinsichtlich Nutzungsmenge, Authentifizierung, Support, Archivierung, Konformität und Deployment.
| Paket | Preis | Ereignisse und Geschwindigkeiten | Benutzer und Arbeitsbereiche | Beibehaltung und Bereitstellung | Für Nutzer geeignet |
|---|---|---|---|---|---|
| Developer | Kostenlos | 10.000 Ereignisse pro Monat; maximal 1.000 Anfragen pro Minute | Maximal 5 Benutzer; 1 Arbeitsbereich; unbegrenzte Anzahl an Projekten | 30 Tage Aufbewahrung; Mehrbenutzer-Cloud im Westen der USA; logische Trennung | Einzelentwickler, kleine Teams und Konzeptprüfungen |
| Enterprise | Individuelle Kostenschätzung | Ereignisse, Anfragenrate und Verbrauch anpassen | Keine Beschränkungen bezüglich Benutzer und Arbeitsbereiche; unbeschränkte Anzahl an Projekten | Anpassbare Speicherung; Mehr-Mieter-, Ein-Mieter-, Hybrid- oder Self-Hosting; regionale Anpassung möglich | Herstellung von Schlüsselagenten und regulierten Unternehmen |
| Startup-Plan | Kontaktieren Sie das Team für einen Rabatt. | Es gilt das ausgewählte Paket. | Für Unternehmen mit einer gesamten Finanzierung von weniger als 5 Millionen US-Dollar | Konkrete Rechte sind nicht öffentlich gemacht worden. | Eignende Frühphasen-Gründerteams |
Wie werden Ereignisse gezählt
Ein Ereignis bezeichnet einen einzelnen Tracking-Intervall oder eine Gruppe von Metrik-Taggen; die monatliche Gesamtzahl entspricht der Summe aus der Anzahl der Intervalle und der Anzahl der Metriken. Ein komplexer Agentenbetrieb kann zahlreiche Modelle, Tools, Wiederholungsversuche sowie Metriken umfassen; daher entsprechen 10.000 Ereignisse nicht 10.000 Benutzeranfragen.
Was enthält die kostenlose Version?
Der Developer umfasst automatische und manuelle Bewertungen, umfassende Überwachungsfunktionen, Versionierung und Bereitstellung von Prompten, kontinuierliche Integration, 30 Tage Datenspeicherung sowie Community-Unterstützung. Soziales Single-Sign-On und grundlegende Rollenkontrollen sind verfügbar, es gibt jedoch keine Unternehmens-SAML-Funktionen, benutzerdefinierte Rollen oder exklusive Unterstützung.
Was fügt Enterprise hinzu?
Enterprise bietet anpassbare Nutzungsgebühren, unbegrenzte Anzahl an Benutzern und Arbeitsbereichen, SAML oder eine maßgeschneiderte Single-Sign-On-Lösung, individuelle Speicherlösungen, SLAs sowie Servicegrenzen, DPA, BAA, einen persönlichen technischen Kundenservice sowie quartalsweise Geschäftsüberprüfungen. Für genaue Preise und Vertragslaufzeiten ist es notwendig, sich an den Vertrieb zu wenden.
Vergleich der Bereitstellungsmethoden
| Einrichtungsmethode | Steuerungsfläche | Datenfläche | Hauptvorteile | Passende Szenarien |
|---|---|---|---|---|
| Mehrfachmieter-SaaS | HoneyHive-Verwaltung | HoneyHive-Cloud-Umgebung | Schnellste Inbetriebnahme, minimale Wartung | Entwickler und gewöhnliche Unternehmen |
| Einzelmieter-SaaS | HoneyHive-Verwaltung | Unabhängige Umgebung für Kunden | Höherer Isolierungsgrad | Unternehmen, die eine eigene Infrastruktur benötigen |
| Hybrid | HoneyHive-Verwaltung | Kundeneigene Verwaltung | Beibehaltung der Datenflächensteuerung | Organisationen mit hohen Anforderungen an die Datengrenzen |
| Self-hosted | Kunden-Infrastruktur | Kunden-Infrastruktur | Sowohl die Kontrollebene als auch die Datenebene sind privat. | Strenge Regulierung oder interne Netzwerkkonfiguration |
Self-Hosting ist ausschließlich für Enterprise verfügbar und bedeutet nicht, dass Benutzer den vollständigen Plattformcode kostenlos erhalten. Unternehmen müssen die Verantwortlichkeiten für Deployment-Pakete, Updates, Telemetrie, Offline-Abhängigkeiten, Backups, Katastrophenwiederherstellung und Support übernehmen.
SDK, CLI und offene Schnittstellen
| Komponenten | Aktueller Zustand | Verwendung | Lizenz oder Hinweise |
|---|---|---|---|
| Python SDK | Offen und ständig aktualisiert | Verfolgung, Bewertung, Datensätze und Bedienung von offenen Schnittstellen | Im Lager wurde keine eindeutige Open-Source-Lizenz festgestellt; prüfen Sie die Lizenz vor der Verwendung. |
| TypeScript API Client | Offen und ständig aktualisiert | Verarbeitung der HoneyHive-Daten-Schnittstelle | MIT-Lizenz |
| Altes TypeScript SDK | Öffentlich, aber archiviert | Historische TypeScript-Cliente und MCP-Dienste | Die MIT-Lizenz eignet sich nicht als erste Wahl für neue Projekte auf lange Sicht. |
| OpenAPI-Spezifikation | Offen und ständig aktualisiert | Erstellung von Clients in anderen Sprachen | MIT-Lizenz |
| HoneyHive CLI | Offen und ständig aktualisiert | Befehlszeilen-Management der offenen Schnittstelle | MIT-Lizenz |
| Cookbook | Offen und ständig aktualisiert | Beispiele und Anwendungen für die Integration | Keine klare Lizenz erkannt. |
| HoneyHive Daemon | Offen und ständig aktualisiert | Kodierung von Proxy-Telemetrie und Export | Im Lager wurde keine klare Lizenz erkannt. |
| Skills | Offen und ständig aktualisiert | Fähigkeitsdokument des Agenten zur Verwendung von HoneyHive | MIT-Lizenz |
| Realign | Archiviert | Test- und Simulationsframeworks für KI-Anwendungen | MIT-Lizenz, geeignet nur für die Wartung alter Projekte oder als Referenz |
Python SDK
Das Python-Toolkit unterstützt OpenTelemetry, synchrone und asynchrone Decoratoren, manuelle Spans, Kontextweitergabe, Experimente sowie mehrere Model-Patching-Methoden. Die öffentliche Veröffentlichung des Code-Repos bedeutet nicht automatisch ein Open-Source-Recht; bei fehlender ausdrücklicher Lizenz sollte es als urheberrechtlich geschützt betrachtet werden.
TypeScript und MCP
Der derzeit aktive TypeScript API Client wird für die Verarbeitung von Datenanschlüssen verwendet; das alte TypeScript SDK-Repository enthält zwar MCP-Funktionalitäten, ist jedoch archiviert. Neue Projekte sollten gemäß den aktuellen Dokumentationen den aktiven Paket sowie eine feste Version auswählen, um Abhängigkeiten von Clients zu vermeiden, deren Wartung eingestellt wurde.
Offene Schnittstellen und andere Sprachen
Abgesehen von Python und TypeScript können auch andere Sprachen OpenTelemetry-Daten direkt senden, offene Schnittstellen aufrufen oder typisierte Clients gemäß den OpenAPI-Spezifikationen erstellen. Auch bei selbst erstellten Clients müssen Authentifizierung, Rate Limiting, Wiederholungsversuche, Paginierung sowie Versionskompatibilität berücksichtigt werden.
HoneyHive Daemon
Daemon wird verwendet, um Telemetriedaten von Kompilierungsagenten wie Claude Code zu sammeln und in HoneyHive zu exportieren – geeignet zur Überwachung von Toolaufrufen und Agentenausführungen. Die Kompilierungsprotokolle können Repository-Pfade, Code, Hinweise und Befehle enthalten; vor der Aktivierung sollten Ausnahmen und Desensibilisierungen konfiguriert werden.
Open-Source-Zustand
Die HoneyHive-Plattform selbst ist kein vollständig open-source-Projekt – die Cloud-Konsole, die Unternehmensdienste sowie die self-hosted Deployment-Möglichkeiten unterliegen weiterhin den Bedingungen der kommerziellen Pakete und Verträge. Einige SDKs, CLI-Tools, OpenAPI-Dokumentationen sowie Komponenten für bestimmte Funktionen werden unter der MIT-Lizenz bereitgestellt; das bedeutet lediglich, dass diese spezifischen Bibliotheken gemäß dieser Lizenz verwendet werden dürfen.
Realign wurde ursprünglich als unabhängiges AI-Test- und Simulationsframework veröffentlicht, ist jedoch nun als nur für den Lesen zugänglich archiviert. Die Trennung zwischen öffentlichen Tools und geschlossenen Plattformen verhindert, dass man fälschlicherweise annimmt, ein kostenloser Klon des Repositoriums würde den vollständigen HoneyHive-Service bereitstellen.
Für welche Benutzer geeignet
- Ingenieurteams, die mehrstufige AI-Agenten, RAG oder Tools zur Aufrufung von Anwendungen entwickeln.
- Es sind Plattform-Teams für Debugging, Wiederholungsversuche, Schleifen, Übergabe an Unterpartner sowie für langfristige Laufzeiten erforderlich.
- Ein AI-Produktteam, das die tatsächlichen Produktionsfehler kontinuierlich in ein Regressionssammlung umwandelt.
- Organisationen, die eine Kombination aus Code, Modellbewertung, manueller Annotation und Nutzerfeedback für die Bewertung benötigen.
- Entwicklerteams, die in der kontinuierlichen Integration Schwellenwerte für die AI-Qualität bei der Veröffentlichung festlegen möchten.
- Unternehmen, die SAML, DPA, BAA, SLA, maßgeschneiderte Speicherlösungen sowie eine private Implementierung benötigen.
- Infrastrukturteams, die bereits OpenTelemetry verwenden und Standards für die Telemetrie von KI vereinheitlichen möchten.
- Es sind die technischen Verantwortlichen für die Encoding-Proxye sowie die internen AI-Plattformen des Unternehmens, die überwacht werden müssen.
Für welche Nutzer es nicht geeignet ist
- Einfache Nutzer, die nur einen allgemeinen Chatbot verwenden möchten und keine KI-Anwendungen entwickeln wollen.
- Es werden lediglich ein Betriebsteam für die Überwachung der CPU, des Speichers und des Netzwerks sowie herkömmliche Server benötigt.
- Organisationen, die verlangen, dass der gesamte Quellcode einer Plattform unter einer Open-Source-Lizenz bereitgestellt wird.
- Sensible Geschäftsabteilungen, bei denen es nicht möglich ist, die Tracking-Daten zu anonymisieren und eine angemessene Zugriffskontrolle durchzuführen.
- Teams, deren monatliche Agenten-Ausführungen weit über 10.000 Ereignisse liegen und dennoch kein Unternehmenspaket kaufen möchten.
- Es wird gehofft, dass das Modell als Schiedsrichter automatisch alle Experten aus verschiedenen Bereichen sowie die Rückmeldungen echter Nutzer ersetzen kann.
- Organisationen, die es nicht akzeptieren können, dass die Cloud-Daten im Westen der USA liegen und keine private Implementierung erworben wird.
Typische Anwendungsszenarien
- Wiederholen Sie einen fehlgeschlagenen Ablauf des Kundenservice-Agenten, um die konkreten Schritte des Tools zu ermitteln, bei denen die Richtlinienabfrage übersehen wurde.
- Vergleichen Sie die Treue und die Richtigkeit des Tools für zwei Versionen der Hinweise auf demselben Beschwerdedatensatz.
- Überwachen Sie die Trends bei der Relevanz der Suchergebnisse, der Treue der Antworten, der Verzögerungen sowie der Kosten bei RAG-Anwendungen.
- Lassen Sie Fachleute aus dem jeweiligen Bereich die medizinischen oder finanziellen Antworten in der Überprüfungsqueue bewerten.
- Erstellen Sie Regressionssamples aus der Nachverfolgung niedriger Bewertungen und integrieren Sie sie in die kontinuierliche Integration.
- Parallelisierte Offline-Experimente mit verschiedenen Modellen, Blockierungsstrategien und Umordnern.
- Führen Sie Online-A/B-Tests nach Agenturversion und Nutzergruppe durch und verknüpfen Sie die tatsächlichen Ergebnisse.
- Im privaten Umfeld des Unternehmens wird die Datenebene bereitgestellt, während gleichzeitig eine gehostete Steuerungsebene genutzt wird.
- Sammeln Sie Aufrufe und Fehler von kodierenden Proxy-Tools, um die Zuverlässigkeit der Entwicklungsautomatisierung zu überwachen.
Vorteile des Produkts
- Verbinden Sie die Produktionsverfolgung, Offline-Experimente, Online-Bewertungen und manuelle Annotationen zu einem geschlossenen Kreislauf.
- Das Ereignismodell umfasst Modelle, Werkzeuge, Pfade, vollständige Sitzungen sowie Mehr-Agenten-Verläufe.
- Basierend auf OpenTelemetry kann es mit bestehender Observability-Infrastruktur verwendet werden.
- Gleichzeitig werden Code-Bewertungen, Modellbewertungen, manuelle Skalen und Nutzerfeedback unterstützt.
- Datensätze können direkt aus tatsächlichen Produktionsfehlern kontinuierlich erfasst und versioniert werden.
- Die Versionen der Prompte, die Bereitstellung sowie die Experimente und das Tracking der Ergebnisse befinden sich im selben Projekt.
- Die kostenlose Version erfordert keine Kreditkarte und bietet 10.000 Ereignisse sowie bis zu 5 Benutzer.
- Unternehmen können zwischen Mehr-Mieter-, Ein-Mieter-, Hybrid- und vollständig selbst gehosteten Lösungen wählen.
- Offene OpenAPI-, CLI- und verschiedene SDKs zur einfachen Integration und Automatisierung.
Einsatzbeschränkungen und Hinweise
- Die kostenlose Version zählt nach Ereignissen und nicht nach Benutzeranfragen, wodurch komplexe Proxy-Server den Limit schnell aufbrauchen.
- Der Entwickler speichert nur 30 Tage lang Daten, was für eine langfristige Konformitätsprüfung nicht geeignet ist.
- Kostenlose Cloud-Daten befinden sich im AWS-Region West USA; grenzüberschreitende Anforderungen müssen im Voraus bewertet werden.
- Detaillierte Überwachung kann Hinweise, Dokumente, persönliche Informationen, Schlüssel und interne Codes aufzeichnen.
- Automatisches Einfügen von Einträgen erhöht die Anzahl der Ereignisse und kann sich auf die Leistung sowie die Kosten für die Protokollierung auswirken.
- LLM-Richter machen selbst Fehler, sind anfechtbar und verursachen zusätzliche Modellkosten.
- Im Dokument wird für das Server-Modell-Gericht GPT-4o verwendet; bei sensiblen Aufgaben muss der Datenpfad bestätigt werden.
- Selbstverwaltung und Ein-Mieter-Modus sind nur in Enterprise verfügbar, die Preise sind nicht öffentlich bekannt.
- Die Plattform ist nicht vollständig open source; das öffentliche SDK kann die kommerzielle Konsole und den Backend-Einsatz nicht ersetzen.
- Einige Lagerhäuser sind archiviert oder verfügen über keine klaren Lizenzen; neue Projekte sollten ihren Wartungszustand überprüfen.
- Dashboards und Bewertungen in Grün können Sicherheitstests, Red-Team-Tests sowie tatsächliche Geschäftsresultate nicht ersetzen.
- Die Qualitätsstandards für die Produktion müssen ständig aktualisiert werden, da feste Testmengen allmählich an Repräsentativität verlieren können.
Sicherheit, Privatsphäre und Konformität
Die Verfolgung kann Benutzereingaben, Modellantworten, abgerufene Dokumente, Tool-Parameter, Geschäftsidentifikatoren, Feedback sowie Codekontext umfassen. Das Team sollte vor dem Versand eine Feldweite Maskierung durchführen, eine eigenständige Projekt-Schlüssel verwenden und die Daten nach Produktions-, Test- und Entwicklungsumgebungen trennen.
| Risikobereiche | Mögliche Probleme | Es wird empfohlen, Kontrolle auszuüben. |
|---|---|---|
| Automatische Pfahlsetzung | Kein Aufzeichnen von Tokens, Anfrageinhalt und persönlichen Informationen | Weißliste-Felder, Filter und Maskierungstests |
| Modellschiedsrichter | Die Daten werden an ein externes Modell gesendet. | Verwendung von hypoallergenen Proben, privater Implementierung oder alternativer Bewertungsmethoden |
| Projektrechte | Mitglieder des Arbeitsbereichs greifen versehentlich auf Produktionsdaten zu | Unabhängige Projekte, minimale Rollen und regelmäßige Überprüfungen |
| API-Schlüssel | Nach dem Leaken kann es zur Übertragung oder zum Abrufen von Telemetriedaten verwendet werden. | Speicherung, Rotation und Isolierung der Schlüsselspeicher |
| Datenhaltung | Die kostenlose Version ist 30 Tage lang gültig – das entspricht nicht den Anforderungen an eine Prüfung. | Unternehmensspezifische Aufbewahrung oder externe Archivierung |
| Datenüber Grenzen hinweg | Standardmäßig Westamerika-Region | Bewertung von Regionen, DPA-Optionen und Unternehmensstandortmöglichkeiten |
| Kodierungsagent | Speichern von Lagercodes, Dateien und Befehlen | Sensible Pfade ausschließen und den Telemetrie-Bereich begrenzen |
| Manuelle Annotation | Experten sehen sensible Kundengespräche | Desensibilisierung, Berechtigungen, Vertraulichkeit und Audit-Logs |
| Datensatz exportieren | Datenverbreitung für Training oder Bewertung | Freigabe der Exportierung, Verschlüsselung und Löschung bei Ablauf |
Erklärung zu Sicherheit und Konformität
HoneyHive behauptet, dass sowohl die Daten selbst als auch der Übertragungsprozess verschlüsselt werden. Zudem besitzt das Unternehmen die notwendigen Zertifizierungen nach SOC 2 Type II sowie die Konformität mit den Vorgaben von GDPR und HIPAA. Außerdem werden Penetrationstests durch Dritte durchgeführt. Kunden, die einer Regulierung unterliegen, sollten weiterhin aktuelle Berichte, Angaben zum Umfang der Dienstleistungen, Ausnahmen, DPA-, BAA-Dokumente sowie Informationen zu den Unterauftragnehmern anfordern.
Unternehmensidentität und Zugriff
Der Developer bietet soziales Single-Sign-On sowie grundlegende Rollensteuerung; Enterprise fügt SAML, anpassbares Single-Sign-On sowie benutzerdefinierte Rollen und Berechtigungsgruppen hinzu. Der Zugriff auf Projekte und Arbeitsbereiche wird getrennt verwaltet, wobei Mitglieder weiterhin explizit einem Projekt hinzugefügt werden müssen.
Angebotsanbieter-Schlüssel
Playground benötigt eine Verbindung zum Modellanbieter. In den aktuellen Dokumentationen wird erklärt, dass die Schlüssel des Anbieters verschlüsselt im Browser-Cache gespeichert werden. Unternehmen sollten überprüfen, ob die Verwaltung des Browsers, der gemeinsame Zugriff auf Geräte, das Löschnen des Caches sowie der Wechsel der Schlüssel den internen Richtlinien entsprechen.
Grundlegende Informationen
| Projekt | Inhalt |
|---|---|
| Name des Tools | HoneyHive |
| Arten von Werkzeugen | Plattform zur Überwachung, Bewertung und Verwaltung von Prompten für KI-Agenten |
| Hauptnutzer | Teams für die Bewertung von KI-Technologien, Plattformen, Produkten und Bereichen |
| Kernstandards | OpenTelemetry |
| Kostenlose Version | 10.000 Ereignisse pro Monat, maximal 5 Personen, 30 Tage Speicherung |
| Unternehmensversion | Individuelle Kostenschätzung |
| Wolkenregionen | Entwickler für den AWS-West-Region in den USA |
| Einsatz | Mehrfachmieter, Einzelmieter, gemischt und selbstverwaltet |
| SDK | Python, TypeScript und Clients mit offenen Schnittstellen |
| API | Anbieten |
| MCP und CLI | Verfügung von relevanten öffentlichen Komponenten |
| Offene Plattform | Nein |
| Einige Komponenten sind open source. | Ja, die Lizenzen unterscheiden sich je nach Lager. |
| Hauptdaten | Verfolgung, Spannweite, Bewertung, Datensätze, Hinweise und Indikatoren |
Häufige Fragen
Was ist HoneyHive?
Es handelt sich um eine Plattform zur Überwachung und Bewertung von KI-Agenten, die dazu dient, den Verlauf von Modellen und Tools zu dokumentieren, die Produktqualität zu überwachen, Experimente durchzuführen, Datensätze zu verwalten sowie manuelle Anmerkungen und Versionen der Anweisungen zu organisieren.
Ist HoneyHive kostenlos?
Die Developer-Version ist kostenlos und erfordert keine Kreditkarte. Sie beinhaltet 10.000 Ereignisse pro Monat, bis zu 5 Benutzer, 1 Arbeitsbereich, unbegrenzte Projekte sowie eine Datenspeicherung von 30 Tagen.
Wie viele Anfragen entsprechen 10.000 Ereignissen?
Es gibt keinen festen Umrechnungsfaktor. Jeder Zeitraum und jeder Indikator wird als Ereignis gezählt; eine Proxy-Anfrage, die mehrere Tools, Wiederholungsversuche sowie Indikatoren umfasst, kann Dutzende oder sogar noch mehr Ereignisse verbrauchen.
Welche Bewertungen werden unterstützt?
Es unterstützt die Bewertung von Client- und Servercode, LLM-Bewertungen, manuelle Annotationen sowie Nutzerfeedback und kann für Relevanz, Treue, Verlauf, Richtigkeit der Tools, Sicherheit sowie Geschäftsindikatoren verwendet werden.
Kann man es selbst hosten?
Ja, aber nur für Enterprise. Unternehmen können zwischen vollständiger Self-Hosting-Lösung, einer Kombination aus gehostetem Control Plane und privatem Data Plane oder einer SaaS-Lösung für einen einzigen Nutzer wählen.
Wird Python und TypeScript unterstützt?
Unterstützung. Python wird zur Überwachung und Bewertung verwendet, während der aktive TypeScript API-Client für die Plattformschnittstellen dient; andere Sprachen können OpenTelemetry-Daten senden oder Clients basierend auf OpenAPI erstellen.
Ist HoneyHive Open Source?
Die Plattform selbst ist kein vollständig open source-Produkt. OpenAPI, die CLI, einige TypeScript-Clients sowie bestimmte Funktionen sind unter der MIT-Lizenz verfügbar; für die anderen Komponenten muss man separat nachschauen.
Wird Realign noch gewartet?
Keine aktive Wartung mehr. Der Realign-Shop wurde im Dezember 2025 als nur noch für Leszwecke zugänglich archiviert; neue Projekte sollten vorrangig das aktuelle HoneyHive-Bewertungssystem verwenden.
Kann man mehrere Agentensysteme überwachen?
Ja. Die Plattform kann Sub-Agenten, Tools, Schleifen, Wiederholungsversuche sowie Übergaben wiederherstellen, doch es ist notwendig, den Tracking-Context und die Identifikatoren korrekt weiterzuleiten.
Sind LLM-Richter zuverlässig?
Man kann nicht einfach davon ausgehen, dass es zuverlässig ist. Es sollten repräsentative Stichproben sowie Expertenbewertungen zur Kalibrierung verwendet werden, und außerdem muss auf die Verbesserung des Modells, auf das Einfügen von Anweisungen, auf Abweichungen, Stabilität und Kosten geachtet werden.
Eignet es sich zur Verarbeitung von medizinischen Daten?
Die Unternehmenslösungen bieten eine BAA an und behaupten, HIPAA-konform zu sein, doch der Kunde muss weiterhin überprüfen, ob die Implementierungsmethode, die Modellbewertung, die Unterauftragnehmer sowie die Tracking-Felder vollständig abgedeckt sind.
Kann man von Langfuse migrieren?
Das Dokument gibt Anleitungen zur Überwachung der Migration, zur Bewertung sowie zu den historischen Daten und bietet Unternehmen Optionen für proprietäre Clouds sowie selbst gehostete Lösungen. Vor der Migration sollten Feldzuordnungen, Anhänge, Metriken und Speicherstrategien verglichen werden.
Zusammenfassung
HoneyHive eignet sich für Teams, die bereits KI-Agenten in der praktischen Entwicklung oder Produktion einsetzen und wissen müssen, warum diese Agenten versagen, wie die Qualität gemessen werden kann sowie wie Rückfälle verhindert werden. Sein wesentlicher Vorteil besteht darin, dass er Produktionsprozesse, Fachexperten und ingenieurwissenschaftliche Experimente in einen einzigen Kreislauf des kontinuierlichen Lernens bringt.
Kleine Teams können die Event-Modelle sowie die Bewertungsprozesse mit der kostenlosen Version überprüfen. Hersteller hingegen sollten sich auf die Bewertung der Kosten für solche Ereignisse, der 30-tägigen Speicherung, der Datenanonymisierung, der Entscheidungswege bezüglich der Modelle, der Identitätsverwaltung sowie der Bereitstellungsbedingungen konzentrieren. Nur wenn die Bewertungen mit den tatsächlichen Geschäftsergebnissen sowie mit den Aktivitäten des „Red Teams“ und der menschlichen Verantwortlichkeiten in Einklang gebracht werden, kann das Überwachungsdashboard nicht fälschlicherweise als ausreichender Beweis für die Zuverlässigkeit des Systems angesehen werden.
Guigong-Netzwerk-Sicherheitsnummer: 45132202000164