HoneyHive
HoneyHive, outil intelligent spécialisé dans l’évaluation des modèles d’IA
Étiquettes :Évaluation des modèles d’IAUne phrase pour présenter
HoneyHive est une plateforme d’observation et d’évaluation conçue pour des agents d’IA de niveau production, qui aide les équipes d’ingénierie à suivre le fonctionnement des modèles, outils, chaînes de traitement et multiples agents. Elle permet de détecter les problèmes grâce à des évaluations automatiques et manuelles, et transforme les pannes réelles en tests de régression continus.
Présentation des outils
HoneyHive regroupe l’observabilité, l’évaluation, les ensembles de données, les prompts et l’intégration continue au sein du même cycle de vie du développement. Ce n’est pas un fournisseur de modèles, ni ne crée de agents commerciaux pour les utilisateurs ; il enregistre plutôt ce que font réellement ces agents, évalue la qualité des résultats et aide les équipes à identifier les causes de dégradation.
La plateforme utilise OpenTelemetry comme base principale pour le suivi, et offre des solutions en Python, TypeScript, des interfaces ouvertes, une ligne de commande ainsi que diverses méthodes d’insertion automatique. Les développeurs peuvent utiliser la version gratuite en cloud, tandis que les entreprises peuvent choisir entre des déploiements multi-locataires, single-locataire, hybrides ou auto-hébergés.
Modèle de données central
| objet | Signification | Contenu typique | Utilisation principale |
|---|---|---|---|
| Event | Une combinaison de plage ou d’étiquette d’indicateur | Modèles, outils, étapes de liaison ou indicateurs | Unité de base pour la facturation, le filtrage et l’évaluation |
| Span | Étape d’exécution unique | Entrée, sortie, erreur, temps d’exécution et attributs | Identifier l’étape spécifique où l’échec s’est produit |
| Session | Demande complète ou plusieurs exécutions | Plusieurs modèles, outils et événements de liaison | Restaurer le parcours du proxy bout en bout |
| Trace | Parcours d’exécution distribué | Relation père-fils, tentative de réessai, boucle et transfert | Observation de tâches à long terme et avec plusieurs agents |
| Datapoint | Un échantillon de test | Entrée, réponse standard, historique et métadonnées | Tests expérimentaux et de régression |
| Dataset | Ensemble d’échantillons de tests structurés | Défaillances de production, cas limites et ensemble de référence | Comparaison des suggestions, des modèles ou des configurations RAG |
| Evaluator | Fonction pour évaluer la sortie ou la trajectoire | Bouleur, numérique, catégoriel ou explicatif | Contrôle de qualité et seuils de publication |
| Prompt Config | Combinaisons de versions de suggestions, de modèles et de paramètres | Modèles de template, modèles, outils et hyperparamètres | Expérimentation, gestion des versions et déploiement |
Fonction principale
Suivi de liens distribué
HoneyHive peut enregistrer l’inférence des modèles, les outils externes, les recherches, les étapes en chaîne et les sessions utilisateur complètes, tout en conservant les relations parent-enfant. Les ingénieurs peuvent rejouer une exécution dans l’ordre chronologique et sauter directement vers les sections où se produisent des erreurs, des délais d’exécution ou un comportement anormal.
Débogage par proxy sur une longue période
La plateforme affiche, pour les trajectoires des agents qui durent plusieurs heures ou jours, des tentatives de réessai, des boucles, des transferts de sous-agents et des appels d’outils. Elle permet de déterminer à quel stade l’agent a dévié de l’objectif, plutôt que de se contenter de vérifier si la réponse finale est correcte.
Observabilité multi-agents
Plusieurs agents ou sous-agents peuvent utiliser un modèle d’événements unifié pour enregistrer les décisions, les outils, l’état et les transferts. L’équipe a besoin de transmettre des identifiants de suivi stables ainsi que du contexte, sinon le fonctionnement entre processus risque encore d’être divisé en fragments non liés entre eux.
Enfoncement automatique
Les outils Python et TypeScript sont basés sur OpenTelemetry et permettent de capturer automatiquement les frameworks de modèles courants, les frameworks d’intermédiation et les appels externes. La plateforme prétend couvrir plus de 50 bibliothèques populaires, y compris LangChain, LangGraph, AWS Strands, Google ADK et OpenAI Agents SDK, entre autres.
Portée personnalisée
Pour les fonctions qui ne sont pas automatiquement identifiées, les développeurs peuvent utiliser des décorateurs ou enregistrer manuellement les entrées, sorties, erreurs, durée, métadonnées, retours d’information et indicateurs. Plus la granularité du suivi est fine, plus les capacités de débogage sont importantes, mais la consommation d’événements, les retards et les risques liés aux données sensibles augmentent également.
Contrôle de la qualité de production
L’équipe peut exécuter des évaluations en temps réel sur le trafic et associer les scores aux retours des utilisateurs, aux résultats commerciaux et à des versions spécifiques. La surveillance en production doit définir des limites de prélèvement et de coût afin d’éviter que chaque exécution d’un agent complexe ne déclenche l’utilisation coûteuse de modèles d’arbitrage.
Tableau de bord personnalisé
Le suivi, les métadonnées et les indicateurs d’évaluation peuvent être regroupés par modèle, version, groupe d’utilisateurs, environnement ou fonction pour former des graphiques. Les indicateurs booléens permettent de visualiser le taux de réussite, les indicateurs numériques permettent de calculer la moyenne, les quantiles et les valeurs extrêmes, tandis que les chaînes de caractères conviennent à la classification et au filtrage.
Alertes et détection de dérive
La plateforme peut mettre en place un suivi basé sur les erreurs, les retards, les coûts, la qualité et les variations de distribution, afin d’aider l’équipe à détecter en temps opportun la dégradation des agents. Les seuils d’alerte doivent être calibrés en fonction du volume de trafic et des risques métier ; une sensibilité excessive génère du bruit, tandis qu’une sensibilité insuffisante fait passer à côté des pannes réelles.
Évaluation par le client
L’application peut calculer dans son propre environnement d’exécution des indicateurs de format, de sécurité, de données personnelles ou de règles commerciales, puis enregistrer les résultats dans le suivi ou l’horizon temporel. L’évaluation côté client convient pour effectuer des vérifications sensibles avant que les données ne quittent le système, et les indicateurs du même nom ne seront pas recouverts par l’évaluation côté serveur.
Évaluation du code serveur
Les développeurs peuvent configurer l’évaluation du code dans HoneyHive pour calculer des indicateurs de déterminisme sur les journaux, les intervalles ou les sessions complètes téléchargés. L’évaluation du code convient au format, aux champs, à l’ordre des outils et aux règles métier vérifiables, et ses résultats sont plus stables que ceux des arbitres de modèle.
Évaluation des juges LLM
LLM Evaluator attribue des notes aux réponses non structurées, aux résultats de recherche ou aux trajectoires d’agent en fonction de critères personnalisés, et peut fournir des explications. La documentation actuelle indique que les modèles serveur utilisés pour l’évaluation sont GPT-4o ; les données sensibles et les coûts doivent être évalués en tenant compte du tirage aléatoire, des contrats et des modalités de déploiement.
File d’évaluation et d’annotation manuelle
Les experts du domaine peuvent noter, commenter et créer des files d’annotation dans l’interface selon des échelles personnalisées, ce qui convient aux tâches où il est difficile de prendre des décisions entièrement automatisées, comme en médecine, en droit, en finance ou pour le ton de la marque. Les normes manuelles doivent d’abord être harmonisées, sinon différents annotateurs produiront des résultats incomparables.
Vérification par l’évaluateur
La plateforme permet de tester le juge d’évaluation à l’aide d’événements récents ou de exemples manuels avant de décider s’il doit être déployé en production. Les modèles de jugement ne sont pas naturellement fiables ; ils doivent être alignés avec le jugement des experts, afin de vérifier les écarts, l’injection de suggestions, les préférences de positionnement et la stabilité des scores.
Échantillonnage d’évaluations en ligne
Les évaluations du côté serveur peuvent être exécutées uniquement sur un pourcentage donné d’événements en production ou en pré-publication, afin de contrôler les coûts et le débit. Les expériences hors ligne n’utilisent généralement pas la même logique d’échantillonnage, afin de garantir que des configurations différentes puissent être comparées sur le même ensemble de données complet.
Gestion des ensembles de données
L’ensemble de données se compose des entrées, des réponses correctes, de l’historique des dialogues et des métadonnées ; il peut être filtré à partir du suivi de la production ou téléchargé via une interface ou un SDK. L’équipe peut continuer d’ajouter des pannes réelles et des cas limites au jeu de référence, afin de créer des actifs de test plus proches des besoins métier.
Import et export de jeux de données
L’interface prend en charge les fichiers JSON, JSONL et CSV, et le SDK permet également de créer et de lire des points de données en masse. Les ensembles de données peuvent être exportés pour des évaluations externes, l’archivage ou le fine-tuning, mais il convient de supprimer les identifiants des utilisateurs ainsi que les contenus confidentiels avant l’exportation.
Expérience hors ligne
L’expérience combine la fonction à tester, un ensemble de données uniforme et un ensemble d’évaluateurs, ce qui permet de comparer les prompts, les modèles, les stratégies de recherche, les méthodes de partitionnement ou les architectures d’agent complètes. Chaque exécution conserve des indicateurs et un suivi, facilitant la comparaison de la dégradation et des améliorations échantillon par échantillon.
Expériences parallèles
Le cadre d’évaluation peut exécuter en parallèle des points de données et contrôler le nombre de threads de travail, ce qui réduit le temps de traitement de grands ensembles de test. Le niveau de parallélisme reste cependant limité par les restrictions imposées par le fournisseur du modèle, le budget, les états partagés et la capacité du système cible.
Contexte Git
Lorsqu’on exécute des expériences depuis un dépôt de code, le SDK peut enregistrer les commits, les branches, les auteurs, les adresses distantes et la présence de modifications non soumises dans l’espace de travail. Ces informations aident à relier les résultats aux versions du code, mais elles peuvent également révéler des métadonnées internes du dépôt ; il convient donc de décider s’il faut les conserver en fonction de l’environnement et des droits d’accès.
Porte d’entrée de l’intégration continue
L’équipe peut exécuter des évaluations lors des modifications de code, définir des seuils de qualité et empêcher la publication en cas de dégradation des indicateurs. L’ensemble de test doit inclure des cas d’échec commerciaux critiques plutôt que seulement des exemples simples, sinon un statut vert ne peut pas prouver la fiabilité en production.
Expériences en ligne et tests A/B
L’application peut intégrer l’identifiant de l’expérience, la version de configuration et les retours des utilisateurs dans le suivi, puis comparer le groupe de contrôle et le groupe d’expérience sur le tableau de bord. HoneyHive est chargé de l’enregistrement et de l’analyse, tandis que l’affectation du trafic est généralement encore assurée par les interrupteurs de fonctionnalités existants ou par le système d’expérimentation.
Mot de suggestion Playground
Playground sert à tester rapidement des prompts, des modèles, des fonctions et des outils externes, et permet de reprendre l’itération à partir des événements d’échec enregistrés. Il est adapté pour explorer et reproduire des problèmes, mais il ne faut pas modifier directement les prompts de production en contournant les ensembles de données officiels, les évaluations et les revues de code.
Gestion des versions des prompts
Chaque configuration de suggestion comprend un modèle de template, un modèle, des hyperparamètres et des outils ; il est possible d’enregistrer l’historique et de le déployer dans une application. La versionnement permet de réduire les erreurs de copie manuelle, mais les mises à jour des fournisseurs de modèles, les connaissances externes et les changements des outils en temps de exécution peuvent encore affecter les résultats.
Ensemble de données pour les pannes de production
Les ingénieurs peuvent filtrer dans le registre les erreurs, les exécutions à faible score ou à haute valeur, et les organiser en ensembles de données. Ensuite, ils utilisent le même cas pour comparer les suggestions, le modèle et le code avant et après la correction, créant ainsi un cycle fermé allant de l’observation à l’amélioration.
Comparaison des méthodes d’évaluation
| Méthode d’évaluation | Emplacement d’exécution | Indicateurs adaptés | Avantage | Principales restrictions |
|---|---|---|---|---|
| Code client | Dans l’application par l’utilisateur | Format, sécurité, informations personnelles et règles commerciales | Les données peuvent être vérifiées localement, les résultats sont définitifs. | Il est nécessaire de développer et de maintenir le code |
| Code du serveur | HoneyHive ou déploiement privé | Structure, champs, ordre des outils et indicateurs de calcul | Gestion centralisée et exécution répétable | Il faut garantir que l’environnement de fonctionnement et les dépendances soient sécurisés. |
| Juge LLM | Appel du modèle serveur | Corrélation, fidélité, ton et cohérence des trajectoires | Adapté aux normes complexes non structurées | Coûts, écarts et instabilité |
| Annotation manuelle | Interface d’étiquetage de la plateforme | Qualité professionnelle, risque et expérience subjective | Le jugement de domaine est le plus proche des activités commerciales. | Vitesse lente et nécessite un alignement standard |
| Retour des utilisateurs | Production interactive | Aimer, réussir, se plaindre et résultats réels | Connexion directe à l’expérience utilisateur | Les signaux sont rares et peuvent présenter un biais de sélection |
Du suivi à l’amélioration du flux de travail
- Créer des projets et des clés API distincts pour les environnements de production, de pré-déploiement et de développement.
- Intégrez les modèles, outils, recherches et étapes de proxy à l’aide d’OpenTelemetry ou du SDK officiel.
- Vérifiez d’abord dans l’environnement de test la structure des ensembles, les relations parent-enfant, les champs et les données sensibles.
- Établir des indicateurs de base pour le retard, les erreurs, les coûts, la fiabilité des outils et la qualité du résultat.
- Filtrer les cas d’échec, à faible score, de plaintes et les cas marginaux à forte valeur à partir du trafic réel.
- Organiser les cas en ensembles de données versionnés contenant des entrées, des réponses correctes et des métadonnées.
- Créer un évaluateur complémentaire à l’aide de codes, de modèles et d’experts du domaine pour effectuer la calibration.
- Exécuter des suggestions de fonctionnement, des expériences sur les modèles ou les architectures, et comparer étape par étape les améliorations et les dégradations.
- Intégrer les évaluations clés dans l’intégration continue, ainsi que l’échantillonnage et les alertes en environnement de production.
- Ajouter continuellement de nouvelles pannes au jeu de données afin que les normes de fiabilité évoluent avec les activités réelles.
Étapes d’accès
- Créer un espace de travail et un projet HoneyHive, et générer une clé API indépendante pour le projet.
- Installer les outils Python ou TypeScript en fonction de la pile technologique, ou utiliser OpenTelemetry pour envoyer des traces.
- Initialiser le suiveur et définir le nom du projet, de l’environnement, de la session ainsi que l’adresse du service privé facultatif.
- Exécutez une requête minimale pour confirmer que le modèle, les outils, les liens et les niveaux de session sont corrects.
- Ajoutez des en-têtes pour les fonctions personnalisées afin de consigner les erreurs, le temps d’exécution, les retours et les métadonnées métier nécessaires.
- Masquer les mots de passe, les tokens, les informations personnelles, le corps des documents et autres données qui ne doivent pas être téléchargées.
- Exécuter une relecture dans le entrepôt de journaux pour valider la recherche, le filtrage, les graphiques et les permissions d’équipe.
- Créer de petits ensembles de données et des évaluateurs déterministes, puis ajouter progressivement des arbitres de modèle.
- Définir le budget d’événements, le débit de demande, la stratégie de conservation, l’échantillonnage et les alertes de production.
- Effectuer une évaluation de la sécurité, du DPA, du BAA ou d’un déploiement privé avant d’augmenter officiellement le trafic.
Prix et forfaits
Les informations sur les prix ont été vérifiées le 23 août 2026 ; les montants réels, les taxes, les taux de change et les remises peuvent varier. Les données finales seront celles affichées sur la page de paiement.
HoneyHive propose actuellement une version gratuite pour les développeurs et des solutions sur mesure pour les entreprises. La version gratuite ne nécessite pas de carte de crédit et convient au développement ainsi qu’à la validation en petite échelle ; la version entreprise ajoute des fonctionnalités liées à la quantité d’utilisation, à l’identification, au support, à la conservation, à la conformité et à la flexibilité de déploiement.
| forfait | Prix | Événements et taux | Utilisateurs et espaces de travail | Réservation et déploiement | Adéquat pour les utilisateurs |
|---|---|---|---|---|---|
| Developer | Gratuit | 10 000 événements par mois ; jusqu’à 1 000 requêtes par minute | Jusqu’à 5 utilisateurs ; 1 espace de travail ; nombre illimité de projets | Conservation de 30 jours ; cloud multi-locataires en Amérique du Nord ; isolation logique | Développeurs individuels, petites équipes et validation de concept |
| Enterprise | Cotation sur mesure | Personnalisation des événements, du débit de demande et de la consommation | Pas de limite en matière d’utilisateurs et d’espaces de travail ; pas de limite au nombre de projets | Réservation personnalisée ; multi-locataires, single-locataire, hybride ou self-hébergé ; personnalisable par région | Production d’agents clés et d’entreprises régulées |
| Programme Startup | Contactez l’équipe pour obtenir une remise | Selon le forfait sélectionné | Destiné aux entreprises ayant un financement cumulé inférieur à 5 millions de dollars | Les droits spécifiques ne sont pas divulgués. | Équipes de start-ups précoces répondant aux critères |
Comment compter les événements
Un événement désigne une seule plage de suivi ou un ensemble d’étiquettes d’indicateurs ; la somme mensuelle équivaut à la somme du nombre de plages et du nombre d’indicateurs. Une exécution complexe d’agent peut comprendre de nombreux modèles, outils, tentatives de réessai et indicateurs ; par conséquent, 10 000 événements ne correspondent pas à 10 000 requêtes utilisateur.
Qu’est-ce que la version gratuite inclut ?
Developer comprend des évaluations automatiques et manuelles, des fonctionnalités d’observabilité complètes, la gestion des versions et du déploiement des prompts, l’intégration continue, une conservation des données sur 30 jours et un support communautaire. Un authentification unique sociale et un contrôle de rôles de base sont disponibles, mais il n’y a pas de SAML d’entreprise, de rôles personnalisés ni de support dédié.
Qu’est-ce que Enterprise ajoute ?
Enterprise propose des volumes d’utilisation personnalisables, un nombre illimité d’utilisateurs et d’espaces de travail, SAML ou connexion unique personnalisée, conservation personnalisée, SLA et quotas de service, DPA, BAA, un gestionnaire client technique dédié et des revues commerciales trimestrielles. Les prix spécifiques et la durée du contrat doivent être demandés au service des ventes.
Comparaison des méthodes de déploiement
| Mode de déploiement | Plan de contrôle | Plan de données | Avantages principaux | Scénarios adaptés |
|---|---|---|---|---|
| SaaS multi-locataires | Gestion HoneyHive | Environnement cloud HoneyHive | Mise en ligne la plus rapide, maintenance minimale | Développeur et entreprise ordinaire |
| SaaS à un seul locataire | Gestion HoneyHive | Environnement indépendant du client | Niveau d’isolement plus élevé | Entreprises ayant besoin d’infrastructures indépendantes |
| Hybrid | Gestion HoneyHive | Hébergement self-managed par le client | Préservation du contrôle du plan de données | Organisations ayant des exigences élevées en matière de limites de données |
| Self-hosted | Infrastructure client | Infrastructure client | Le plan de contrôle et le plan de données sont tous deux privés | Régulation stricte ou environnement réseau interne |
Le self-hosting n’est réservé qu’à Enterprise, ce qui ne signifie pas que les utilisateurs peuvent obtenir gratuitement le code complet de la plateforme. Les entreprises doivent prendre en charge les paquets de déploiement, les mises à jour, la télémétrie, les dépendances hors ligne, les sauvegardes, la reprise après sinistre et les responsabilités de support.
SDK, CLI et interfaces ouvertes
| Composant | État actuel | Utilisation | Licence ou précautions |
|---|---|---|---|
| Python SDK | Public et mis à jour en continu | Suivi, évaluation, ensembles de données et opérations d’interfaces ouvertes | Aucune licence open source claire n’a été identifiée dans l’entrepôt ; vérifiez la licence avant utilisation. |
| TypeScript API Client | Public et mis à jour en continu | Utiliser l’interface de données HoneyHive | Licence MIT |
| Ancien SDK TypeScript | Public mais archivé | Clients historiques TypeScript et services MCP | La licence MIT n’est pas idéale comme choix préférable pour de nouveaux projets à long terme. |
| Spécification OpenAPI | Public et mis à jour en continu | Générer des clients pour d’autres langues | Licence MIT |
| HoneyHive CLI | Public et mis à jour en continu | Interface ouverte de gestion en ligne de commande | Licence MIT |
| Cookbook | Public et mis à jour en continu | Exemples et pratiques d’intégration | Aucune licence explicite identifiée |
| HoneyHive Daemon | Public et mis à jour en continu | Télémétrie d’agent de codage et exportation | Aucune licence explicite n’a été détectée dans l’entrepôt. |
| Skills | Public et mis à jour en continu | Fichier de compétences utilisant les capacités de HoneyHive par l’agent | Licence MIT |
| Realign | Archivé | Framework de test et de simulation des applications d’IA | Licence MIT, uniquement adaptée à la maintenance de projets anciens ou à des fins de référence |
Python SDK
Le package Python prend en charge OpenTelemetry, des décorateurs synchrones et asynchrones, des spans manuels, la propagation du contexte, des expérimentations et plusieurs injecteurs de modèles. Le fait que le dépôt de code soit public ne signifie pas automatiquement qu’il bénéficie d’une licence open source ; en l’absence de licence claire, il doit être traité comme étant protégé par des droits d’auteur.
TypeScript et MCP
Le client API TypeScript actif est utilisé pour les opérations sur les interfaces de données ; l’ancien dépôt du SDK TypeScript comprend des fonctionnalités de service MCP, mais a été archivé. Les nouveaux projets doivent choisir le paquet actif en se référant à la documentation actuelle et fixer une version, afin d’éviter de dépendre de clients de génération dont la maintenance a été interrompue.
Interfaces ouvertes et autres langages
En dehors de Python et TypeScript, d’autres langages peuvent envoyer directement des données OpenTelemetry, appeler des interfaces ouvertes, ou générer des clients typés conformément aux spécifications OpenAPI. Les clients générés manuellement doivent néanmoins gérer l’authentification, le throttling, les tentatives de réessai, la pagination et la compatibilité des versions.
HoneyHive Daemon
Daemon est utilisé pour collecter la télémétrie des agents de codage tels que Claude Code et l’exporter vers HoneyHive, ce qui permet d’observer les appels d’outils et l’exécution des agents. Les traces de codage peuvent contenir des chemins de répertoires, du code, des suggestions et des commandes ; il convient de configurer des exclusions et un masquage avant de l’activer.
Statut open source
La plateforme HoneyHive n’est pas en elle-même un projet open source complet ; la console cloud, les services d’entreprise et les déploiements auto-hébergés restent soumis à des forfaits commerciaux et à des contrats. Certains SDK, CLI, OpenAPI et composants de compétences sont rendus publics sous licence MIT, ce qui signifie uniquement que ces répertoires spécifiques peuvent être utilisés conformément à cette licence.
Realign a été publié à l’origine en tant que framework indépendant de test et de simulation d’IA, mais il a depuis été archivé en mode lecture seule. Distinguer les outils publics des plateformes propriétaires permet d’éviter la confusion selon laquelle un dépôt de clonage gratuit fournirait un service HoneyHive complet.
À qui s’adresse-t-il
- Équipes d’ingénierie en train de développer des agents IA à plusieurs étapes, RAG ou des applications de appel d’outils.
- Il est nécessaire de déboguer les tentatives de réessai, les boucles, le transfert de sous-agents et les équipes de plateforme fonctionnant sur de longues périodes.
- Équipe de produits d’IA qui souhaite transformer en continu les pannes réelles de production en ensembles de données de regression.
- Organisations qui nécessitent une évaluation combinée de code, d’arbitrage de modèles, d’annotation manuelle et de retours utilisateurs.
- Équipes de développement souhaitant définir des seuils de qualité pour les déploiements via l’intégration continue à l’aide de l’IA.
- Les entreprises ayant besoin de SAML, DPA, BAA, SLA, de conservation sur mesure et d’un déploiement privé.
- Les équipes d’infrastructure qui utilisent déjà OpenTelemetry et souhaitent unifier les normes de telemétrie pour l’IA.
- Les responsables techniques chargés de surveiller les agents d’encodage et les plateformes d’IA internes à l’entreprise.
Pas vraiment adapté à quels utilisateurs
- Utilisateurs ordinaires qui souhaitent simplement utiliser des robots de chat universels sans développer d’applications d’IA.
- Il suffit d’une équipe d’exploitation pour la surveillance de la CPU, de la mémoire et du réseau des serveurs traditionnels.
- Organisations qui exigent que tout le code de la plateforme soit sous licence open source.
- Équipes métier sensibles pour lesquelles il est impossible de masquer les données de suivi ni d’appliquer une gouvernance des droits d’accès.
- Les équipes qui génèrent plus de 10 000 événements par mois grâce à l’agence et qui refusent d’acheter une solution entreprise.
- Espérer que le juge de modèle remplacera automatiquement tous les experts du domaine et les retours des utilisateurs réels.
- Les organisations qui ne peuvent pas accepter que les données cloud soient situées dans l’ouest des États-Unis et qui ne procèdent pas à un déploiement privé.
Scénarios d'utilisation typiques
- Rejouer une exécution échouée d’un agent client pour identifier les étapes spécifiques de l’outil où la consultation de la politique a été manquée.
- Comparer la fidélité et la justesse de l’outil pour deux versions de suggestions sur le même ensemble de données de plaintes.
- Surveiller les tendances en matière de pertinence des recherches, de fidélité des réponses, de délais et de coûts pour les applications RAG.
- Laissez les experts du domaine examiner les réponses médicales ou financières dans la file d’annotation.
- Créer des échantillons de régression à partir du suivi des scores bas et les intégrer à l’intégration continue.
- Des expériences en ligne parallèle sont menées sur différents modèles, stratégies de blocage et réordonneurs.
- Mener des tests A/B en ligne selon la version du proxy et le groupe d’utilisateurs, et relier les résultats réels.
- Déployer le plan de données dans un environnement privé d’entreprise, tout en utilisant un plan de contrôle géré.
- Collecter les appels et erreurs des outils d’agent de codage pour observer la fiabilité de l’automatisation du développement.
Avantages du produit
- Relier le suivi de la production, les expériences hors ligne, l’évaluation en ligne et l’annotation manuelle en un cycle fermé.
- Le modèle d’événements couvre les modèles de couverture, les outils, les liens, les sessions complètes et les trajectoires multi-agents.
- Basé sur OpenTelemetry, il peut être utilisé avec l’infrastructure d’observabilité existante.
- Prend en charge simultanément l’évaluation du code, l’arbitrage des modèles, les échelles manuelles et les retours des utilisateurs.
- Les ensembles de données peuvent être directement compilés et versionnés en continu à partir des pannes réelles en production.
- La version des prompts, le déploiement, les expériences et le suivi des résultats se trouvent dans le même projet.
- La version gratuite ne nécessite pas de carte de crédit et offre 10 000 événements ainsi que jusqu’à 5 utilisateurs.
- Les entreprises peuvent choisir multi-locataires, single-locataire, hybride et entièrement auto-hébergé.
- OpenAPI, CLI et divers SDKs sont disponibles en public, facilitant l’intégration et l’automatisation.
Restrictions d'utilisation et précautions
- La version gratuite compte les événements plutôt que les demandes des utilisateurs, et les agents complexes épuisent rapidement le quota.
- Le développeur ne conserve les données que pendant 30 jours, ce qui n’est pas adapté aux audits de conformité à long terme.
- Les données cloud gratuites se trouvent dans la région Ouest des États-Unis d’AWS ; les exigences transfrontalières doivent être évaluées à l’avance.
- Le suivi détaillé peut enregistrer des indications, des documents, des informations personnelles, des clés et du code interne.
- L’insertion automatique de jalons augmente le nombre d’événements et peut avoir un impact sur les performances et les coûts de journalisation.
- Les juges LLM peuvent eux-mêmes commettre des erreurs, être influencés par l’insertion de prompts et engendrer des frais supplémentaires pour le modèle.
- Le modèle serveur utilisé pour l’arbitrage dans le document est GPT-4o ; pour les tâches sensibles, il est nécessaire de confirmer le chemin des données.
- L’hébergement auto-géré et le single-tenant ne sont disponibles qu’en Enterprise, et les prix ne sont pas divulgués.
- La plateforme n’est pas entièrement open source ; le SDK public ne peut pas remplacer la console commerciale et le backend.
- Certains entrepôts ont été archivés ou ne disposent pas de licences claires ; les nouveaux projets doivent vérifier leur état de maintenance.
- Les tableaux de bord et les évaluations en vert ne peuvent pas remplacer les tests de sécurité, l’équipe rouge et les résultats réels du business.
- Les normes de qualité de production doivent être mises à jour en permanence, car un ensemble de tests fixe peut progressivement perdre sa représentativité.
Sécurité, confidentialité et conformité
Le suivi peut inclure des indications utilisateur, des réponses du modèle, des documents de recherche, des paramètres d’outil, des identifiants métier, des retours et un contexte de code. L’équipe doit effectuer un masquage au niveau des champs avant envoi, utiliser une clé de projet distincte, et isoler les données selon les environnements de production, de test et de développement.
| Domaines de risque | Problème possible | Il est recommandé de contrôler |
|---|---|---|
| Enfoncement automatique | Ne pas enregistrer intentionnellement les jetons, le corps de la demande et les informations personnelles | Champs de liste blanche, filtres et tests de masquage |
| Juge modèle | Les données sont envoyées à un modèle externe | Utilisation d’échantillons hypoallergéniques, déploiement privé ou évaluation alternative |
| Permissions du projet | Les membres de l’espace de travail accèdent par erreur aux données de production | Projets indépendants, rôles minimaux et examens périodiques |
| Clé API | Après fuite, il est possible d’écrire ou de lire la télémétrie | Stockage, rotation et isolation d’environnement des clés |
| Conservation des données | La version gratuite de 30 jours ne correspond pas aux exigences d’audit. | Conservation sur mesure par l’entreprise ou archivage externe |
| Données transfrontalières | Région Ouest des États-Unis par défaut | Évaluation des régions, des DPA et des options de présence d’entreprise |
| Agent d’encodage | Enregistrer le code du entrepôt, les fichiers et les commandes | Éliminer les chemins sensibles et limiter la portée de la télémétrie |
| Annotation manuelle | Les experts consultent les conversations de clients sensibles | Désensibilisation, permissions, confidentialité et journaux d’audit |
| Export du jeu de données | Diffusion des fichiers d’entraînement ou d’évaluation | Approuver l’export, le chiffrement et la suppression à expiration |
Déclaration de sécurité et de conformité
HoneyHive affirme que les données, tant au repos qu’en cours de transmission, sont chiffrées, et qu’elle respecte les normes SOC 2 Type II, GDPR et HIPAA, tout en subissant des tests d’infiltration par des tiers. Les clients soumis à une réglementation stricte doivent néanmoins demander les rapports actuels, la portée des services, les exceptions, le DPA, le BAA ainsi que les informations relatives aux sous-traitants.
Identité de l’entreprise et accès
Developer offre un accès unique socialisé et un contrôle de rôles de base ; Enterprise ajoute SAML, un accès unique personnalisé, ainsi que des rôles et des groupes d’accès personnalisés. L’accès aux projets et l’accès aux espaces de travail sont gérés séparément, et les membres doivent être explicitement ajoutés aux projets.
Clé fournisseur de prompts
Playground nécessite une connexion au fournisseur de modèles ; la documentation actuelle indique que la clé du fournisseur est stockée de manière chiffrée dans le cache du navigateur. L’entreprise doit s’assurer que la gestion des navigateurs, le partage d’appareils, le nettoyage du cache et le renouvellement des clés sont conformes aux politiques internes.
Informations de base
| Projet | Contenu |
|---|---|
| Nom de l’outil | HoneyHive |
| Type d’outil | Plateforme de gestion de l’observabilité, de l’évaluation et des prompts pour les agents IA |
| Utilisateurs principaux | Équipes d’évaluation des ingénieries, plateformes, produits et domaines de l’IA |
| Normes fondamentales | OpenTelemetry |
| Version gratuite | 10 000 événements par mois, jusqu’à 5 personnes, conservation sur 30 jours |
| Édition entreprise | Cotation sur mesure |
| Région nuageuse | Développeur pour la région Ouest des États-Unis d’AWS |
| Déploiement | Multilocataire, unilocataire, hybride et auto-hébergé |
| SDK | Python, TypeScript et clients avec des interfaces ouvertes |
| API | Fournir |
| MCP et CLI | Fournir des composants publics pertinents |
| Plateforme open source | Non |
| Certains composants sont open source | Oui, les licences varient selon l’entrepôt. |
| Données principales | Suivi, portée, évaluation, ensemble de données, suggestions et indicateurs |
Questions fréquentes
Qu’est-ce que HoneyHive ?
Il s’agit d’une plateforme d’observation et d’évaluation d’agents IA, utilisée pour enregistrer les trajectoires des modèles et des outils, surveiller la qualité de production, exécuter des expériences, gérer des ensembles de données, organiser l’annotation manuelle et contrôler les versions des prompts.
HoneyHive est-il gratuit ?
La version Developer est gratuite et ne nécessite pas de carte de crédit ; elle inclut 10 000 événements par mois, jusqu’à 5 utilisateurs, 1 espace de travail, une quantité illimitée de projets et un archivage des données sur 30 jours.
10 000 événements équivalent à combien de requêtes ?
Il n’y a pas de conversion fixe. Chaque portée et chaque indicateur est compté comme un événement ; une requête d’agent contenant plusieurs outils, tentatives de réessai et indicateurs peut consommer des dizaines, voire plus, d’événements.
Quelles évaluations sont prises en charge ?
Prend en charge l’évaluation du code côté client et côté serveur, les arbitrages par LLM, l’annotation manuelle et les retours des utilisateurs, et peut être utilisée pour les indicateurs de pertinence, de fidélité, de trajectoire, de correction des outils, de sécurité et commerciaux.
Peut-on l’héberger soi-même ?
C’est possible, mais uniquement pour Enterprise. Les entreprises peuvent choisir un hébergement entièrement auto-géré, un modèle hybride avec un plan de contrôle hébergé et un plan de données privé, ou SaaS single-tenant.
Est-ce que cela prend en charge Python et TypeScript ?
Soutien. Python est utilisé pour le suivi et l’évaluation, tandis que le client API TypeScript actif sert aux interfaces de la plateforme ; d’autres langages peuvent envoyer des données OpenTelemetry ou générer des clients en se basant sur OpenAPI.
HoneyHive est-il open source ?
La plateforme elle-même n’est pas un produit entièrement open source. OpenAPI, la CLI, certains clients TypeScript et les compétences sont sous licence MIT ; il faut vérifier séparément les autres dépôts.
Realign est-il encore maintenu ?
Plus de maintenance proactive. Le dépôt Realign a été archivé en mode lecture seule en décembre 2025 ; les nouveaux projets doivent privilégier le cadre d’évaluation HoneyHive actuel.
Est-il possible de surveiller un système à plusieurs agents ?
Oui. La plateforme peut restituer les sous-agents, les outils, les boucles, les tentatives de réessai et la transmission, mais il est nécessaire que l’application diffuse correctement le contexte de suivi et les identifiants.
Les arbitres LLM sont-ils fiables ?
On ne peut pas supposer directement qu’il est fiable. Il convient d’utiliser un échantillon représentatif et de le calibrer avec des évaluations d’experts, tout en surveillant les mises à jour du modèle, l’injection de prompts, les biais, la stabilité et les coûts.
Est-il adapté au traitement de données médicales ?
Les solutions professionnelles fournissent un BAA et affirment disposer de la conformité HIPAA, mais le client doit néanmoins s’assurer que les méthodes de déploiement, l’évaluation des modèles, les sous-traitants et les champs de suivi sont tous couverts.
Est-il possible de migrer depuis Langfuse ?
Le document fournit des étapes pour le suivi de la migration, l’évaluation et les données historiques, et propose aux entreprises des options de cloud propriétaire et de self-hébergement. Avant la migration, il convient de comparer la mise en correspondance des champs, les pièces jointes, les indicateurs et les stratégies de conservation.
Résumé
HoneyHive est adapté aux équipes qui ont déjà mis en œuvre des agents IA dans un développement ou une production réels et qui souhaitent comprendre pourquoi ces agents échouent, mesurer leur qualité et éviter les dérives. Sa valeur fondamentale réside dans le fait de faire entrer les comportements en production, les experts du domaine et les expérimentations techniques dans un même cycle d’apprentissage continu.
De petites équipes peuvent utiliser la version gratuite pour valider le modèle d’événements et le processus d’évaluation, tandis que les entreprises de production doivent se concentrer sur l’évaluation des coûts liés aux événements, de la conservation sur 30 jours, du masquage des données, des chemins de décision du modèle, de la gestion des identités et des limites de déploiement. Ce n’est qu’en associant l’évaluation aux résultats réels du business, ainsi qu’aux équipes rouge et aux responsabilités humaines, que l’on évitera de confondre les tableaux de bord d’observation avec une preuve suffisante de la fiabilité du proxy.
Numéro d’enregistrement de sécurité publique du Guangxi : 45132202000164