LangWatch
LangWatch, outil intelligent spécialisé dans l’évaluation des modèles d’IA
Étiquettes :Évaluation des modèles d’IAQu’est-ce que LangWatch ?
LangWatch est une plateforme LLMOps open source destinée aux applications de grands modèles de langage et aux agents IA, gérée par Reasoning Engine B.V. Elle relie l’observabilité, l’évaluation, la simulation d’agents, la gestion des prompts, l’AI Gateway et les capacités de gouvernance, afin d’aider les équipes depuis le développement et les tests jusqu’à la gestion en environnement de production.
La plateforme utilise OpenTelemetry pour recevoir et organiser les données de suivi, et prend en charge le cloud géré, l’autogestion complète, le cloud privé d’entreprise ainsi que le déploiement hybride. Les développeurs peuvent identifier les problèmes à partir des appels de modèles, de l’utilisation des outils et des sessions des utilisateurs, puis transformer des cas réels en tests d’évaluation et de scénarios.
Aperçu des principales compétences
| Module de compétences | Problèmes résolus | Résultat typique |
|---|---|---|
| Observability | Comprendre comment les modèles, les outils et les agents fonctionnent | Suivi, Span, indicateurs, coûts et alertes |
| Evaluations | Évaluer la qualité, la sécurité et la fiabilité | Scores d’essai, évaluations en ligne, Guardrails et résultats de régression |
| Agent Simulations | Tester les dialogues et comportements complets avant la mise en ligne | Exécution de scénarios, simulation d’utilisateurs, raisons d’échec et rapport de test |
| Prompt Management | Gestion centralisée des suggestions et des versions | Modèles de suggestions, variables, versions, Playground et résultats d’optimisation |
| AI Gateway | Appel de modèle unifié, budget et routage | Clés virtuelles, routage, cache, quotas et protections |
| AI Governance | Contrôler l’accès des équipes et les risques de production | Autorisations, audit, dépenses et gouvernance organisationnelle |
LLM et observabilité des agents
LangWatch enregistre automatiquement les appels aux grands modèles de langage, l’utilisation des outils, les recherches, les erreurs et les interactions avec les utilisateurs, et présente la chaîne d’exécution complète dans le suivi. Les équipes peuvent consulter les entrées/sorties, les tokens, les coûts, les délais, les modèles, les utilisateurs ainsi que des métadonnées personnalisées.
- Filtrer le suivi par projet, utilisateur, modèle, prompt ou version.
- Voir l’ordre d’exécution multi-étapes des Span imbriqués et des agents.
- Échec de l’outil de localisation, appels lents et coûts anormaux.
- Créer des tableaux de bord pour la qualité de production et les indicateurs commerciaux.
- Relier les retours aux suivi concret par le biais d’événements utilisateur.
- Exporter les données d’analyse vers un système externe.
- La qualité de l’utilisation des alertes et des réponses automatisées diminue.
OpenTelemetry et intégration
La couche de suivi est basée sur OpenTelemetry, ce qui permet d’utiliser le SDK LangWatch ainsi que de recevoir des données générées par d’autres bibliothèques compatibles. L’intégration directe couvre les frameworks d’agent courants, les fournisseurs de modèles et les plateformes d’automatisation.
| Catégories intégrées | Projet représentatif | Utilisation |
|---|---|---|
| Frameworks d’agent et d’application | LangChain, LangGraph, Mastra, CrewAI et Google ADK | Capture automatique de modèles, d’outils et d’agents Span |
| Fournisseur de modèles | OpenAI, Anthropic, Azure, Google Cloud, AWS et Groq | Enregistrer les demandes de modèle, les réponses, les tokens et les coûts |
| Modèle local | Ollama | Observer les processus de raisonnement privés ou locaux |
| Plateforme low-code | LangFlow, Flowise et n8n | Ajouter le suivi et l’évaluation pour visualiser le processus |
| Protocole standard | OTLP | Se connecter à d’autres services compatibles avec OpenTelemetry |
Expérience hors ligne
Experiments est utilisé pour exécuter des versions de modèles, d’indications ou d’agents sur un ensemble de données fixe avant mise en ligne, et pour enregistrer les résultats et les scores de chaque échantillon. L’équipe peut exécuter des expériences via l’interface, Python ou TypeScript, puis comparer la qualité, le coût et le délai de différentes configurations.
- Créer un ensemble de données représentant des tâches réelles.
- Choisir la version en production actuelle comme ligne de base.
- Définir les configurations de prompts, de modèles ou d’agents à comparer.
- Configurer un évaluateur intégré ou personnalisé pour la sortie.
- Exécuter tous les échantillons en parallèle et enregistrer le suivi.
- Comparer les scores, les erreurs, les retards et les coûts.
- Ajouter les échantillons échoués au jeu de données de régression.
- Intégrer les exigences de qualité minimale au contrôle d’accès de l’intégration continue.
Évaluation en ligne
L’évaluation en ligne exécute automatiquement levaluateur spécifié dès l’arrivée du suivi de production, afin d’observer en continu la fiabilité, la pertinence, la sécurité, les PII ou des indicateurs métier personnalisés. Elle est adaptée pour détecter les déviations de qualité qui apparaissent avec les changements d’utilisateurs, de modèles et de données.
| Méthode d’évaluation | Moment d’exécution | Utilisations adaptées |
|---|---|---|
| Expérience hors ligne | Avant la publication, pour un ensemble de données fixe | Comparaison des suggestions, des modèles et des versions d’agent |
| Online Evaluation | Suivi de la production une fois arrivé | Surveiller les tendances de qualité et les échantillons anormaux |
| Guardrail | Exécution synchronisée avant et après l’appel du modèle | Bloquer en temps réel les évasions, les PII ou le contenu illicite |
| Annotation manuelle | Vérification des points de suivi ou des données sélectionnés | Étiquettes d’experts, préférences et cas controversés |
Guardrails barrières de sécurité en temps réel
L’évaluateur peut être exécuté en synchronie avec Guardrail dans le code de l’application, et autoriser ou bloquer en fonction de la décision de validation. Il convient à la détection des jailbreaks à l’entrée, aux vérifications de sécurité à la sortie et à la validation des règles métier clés, mais il augmente le délai d’appel et la consommation d’événements.
- Détection des évasions et des injections de suggestions.
- Identifier les PII et les informations sensibles.
- Vérifier la présence de contenus toxiques, nocifs ou illégaux.
- Vérifier la fidélité et la pertinence des réponses RAG.
- Exécuter LLM-as-a-judge ou évaluer avec du code personnalisé.
- Retourner un message de sécurité en cas d’échec ou passer à un traitement manuel.
Évaluateur et flux de travail
LangWatch propose des évaluateurs intégrés tels que RAGAS, hallucinations, toxicité, PII et arbitrage de modèles, et permet également aux équipes de créer des évaluateurs réutilisables au niveau de l’organisation. Les évaluations complexes peuvent combiner plusieurs étapes et jugements via des workflows, et ajouter des scores personnalisés aux traces ou aux spans.
Ensembles de données et annotations
Les ensembles de données peuvent être gérés via des SDK et des API, être extraits du suivi en production ou générés avec l’aide de l’IA. Annotation Inbox sert à attribuer les échantillons aux examinateurs humains, ce qui convient aux experts métier pour ajouter des étiquettes, des réponses cibles et des évaluations subjectives de qualité.
- Créer un ensemble d’expériences d’échec à partir du suivi réel.
- Enregistrer les entrées d’évaluation telles que le texte et les images.
- Créer et consulter des ensembles de données en masse à l’aide de code.
- Permettre à l’IA de générer rapidement des échantillons de test initiaux.
- Enregistrer séparément les étiquettes manuelles et l’évaluation automatique.
- Utiliser les résultats de l’audit pour les tests de régression ultérieurs.
Agent Simulations
Agent Simulations vérifie si l’agent est capable d’atteindre ses objectifs, de respecter les règles et d’utiliser correctement les outils dans des conversations réelles en simulant plusieurs rounds d’interactions entre l’utilisateur et l’agent à tester. Il convient mieux que l’évaluation à un seul round d’entrée/sortie pour tester l’état, la mémoire, les appels d’outils et le comportement dans les conversations longues.
Structure de la scène
| Composition | Contenu | effet |
|---|---|---|
| Scenario | Conditions initiales, objectifs de l’utilisateur et contraintes | Définir les tâches métier réelles à valider |
| Agent Adapter | Se connecter à des proxies locaux, distants ou hébergés | Envoyer un message de test au système à tester |
| User Simulator | Générer plusieurs tours de comportement utilisateur selon le rôle et l’objectif | Couvrir différentes expressions, questions et résistances |
| Criteria | Évaluation du succès, de l’échec et de la sécurité | Décider si la scène est validée |
| Run Parameters | Concurrentiel, tentatives de réessai, nombre de modèles et de tests | Contrôler les coûts et la portée |
Formes d’agents pris en charge
- Agent de chat de texte.
- Proxy distant nécessitant un accès ou un jeton.
- Fonctions proxy dans le développement local.
- Des agents en temps réel tels que OpenAI Realtime.
- Des agents vocaux tels qu’ElevenLabs, Twilio et Pipecat.
- Des agents multimodaux en temps réel tels que Gemini Live.
Équipe rouge et scénario de sécurité
Les tests de scénarios peuvent être utilisés pour générer des utilisateurs adverses, des demandes hors limites et des processus d’injection de prompts, afin d’observer les capacités défensives du proxy au cours de multiples interactions. Les résultats de l’équipe rouge doivent servir de base à des améliorations ; on ne doit pas en déduire que la sécurité est assurée de manière permanente après un seul test.
Bibliothèque open source Scenario
Le dépôt Scenario indépendant fournit des outils de test d’agent pour Python et TypeScript, et est soumis à la licence Apache 2.0. Il peut fonctionner localement ainsi que dans des environnements d’intégration continue, sans exiger que tous les tests soient effectués dans le cloud via LangWatch.
Gestion des suggestions
Prompt Management permet de stocker de manière centralisée les modèles de prompts, les variables, les versions et l’état de publication, évitant ainsi que les prompts soient dispersés dans le code, les tableaux et les interfaces. Les développeurs peuvent synchroniser les prompts via un SDK ou une CLI, et remplacer les modèles et paramètres dans le Playground pour effectuer des comparaisons.
| Fonctionnalité | effet | Utilisateur typique |
|---|---|---|
| Prompt Registry | Conserver de manière centralisée les suggestions de nommage et les versions | Équipe de développement et de produits |
| Variables | Remplir les données métier en temps de exécution | Développeur d’applications |
| Playground | Indications de test, modèles et paramètres | Conseil pour les experts en ingénierie et en affaires |
| CLI Sync | Intégrer la configuration des suggestions dans le dépôt de code | Ingénierie de plateforme et intégration continue |
| Optimization Studio | Amélioration des suggestions basée sur l’échantillon et la cible | Équipes nécessitant une optimisation systématique |
| DSPy Optimization | Rechercher des suggestions plus optimales par méthode programmée | Équipe de recherche et d’évaluation avancée |
AI Gateway
AI Gateway permet d’accéder de manière unifiée à plusieurs fournisseurs de modèles, et gère au sein des limites de l’organisation les clés virtuelles, le routage, le budget, le cache et Guardrails. Lors de l’hébergement auto-géré, il est possible de choisir de faire terminer le trafic des modèles à la frontière du propre réseau.
- Isoler les applications et les équipes à l’aide de clés virtuelles.
- Acheminer entre plusieurs modèles ou fournisseurs.
- Définir des budgets hiérarchisés pour les organisations, projets ou utilisateurs.
- Utiliser le cache des suggestions pour réduire les raisonnements répétitifs.
- Mettre en œuvre des barrières de sécurité en temps réel à l’entrée unique.
- Enregistrer de manière centralisée les coûts, les échecs et la consommation des modèles.
MCP, CLI et compétences
LangWatch propose MCP, des outils en ligne de commande et des compétences destinées aux assistants de programmation, permettant aux assistants IA d’aider au suivi de l’accès, à la création d’évaluations, à l’exécution de simulations et à la gestion des suggestions. Les modifications automatisées doivent néanmoins faire l’objet d’une révision manuelle, en particulier pour les clés de production, les protections et les paramètres de déploiement.
Prix en cloud
Les informations sur les prix ont été vérifiées le 23 août 2026 ; les montants réels, les taxes, les taux de change et les remises peuvent varier. Les données finales seront celles affichées sur la page de paiement.
LangWatch Cloud facture en fonction des postes principaux et de l’utilisation des événements ; Growth applique en outre un frais de stockage pour les données conservées plus de 30 jours. Les utilisateurs Lite peuvent consulter et collaborer, mais les droits d’édition spécifiques dépendent des indications des permissions actuelles.
| Forfait ou version | Prix | Période de facturation | Droits ou crédit principal | Adéquat pour les utilisateurs |
|---|---|---|---|---|
| Developer | Gratuit | Gratuit à vie, le quota est renouvelé chaque mois | Incident de 50 000, accès aux données sur 14 jours, 2 utilisateurs, 3 scénarios, 3 simulations et 3 évaluations personnalisées | Développeurs individuels et prototypes préliminaires |
| Growth | 29 euros par siège par cœur | Chaque mois | Inclut 200 000 événements et conservation sur 30 jours, utilisateurs Lite illimités, simulation, évaluation et conseils | L’équipe qui met en production les applications d’IA |
| Enterprise | Cotation sur mesure | Dispositions contractuelles | Mixte, auto-hébergé ou déployé localement, avec conservation personnalisée, SSO, RBAC, audit, SLA et support technique dédié | Régulation et grandes organisations |
Événements et facturation de stockage
Chaque appel au modèle, chaque utilisation d’outil, chaque recherche, évaluation ou étape de simulation est comptée comme un événement ; par conséquent, une conversation utilisateur comprend généralement plusieurs événements facturables. Les 200 000 premiers événements par mois sont inclus dans le tarif de l’abonnement, puis 5 euros sont facturés pour chaque 100 000 événements supplémentaires.
| Élément de facturation | Quantité incluse dans la croissance | Prix excessif | Précautions à prendre |
|---|---|---|---|
| Siège clé | Tarification indépendante par siège | 29 euros par place et par mois | Le nombre de places est adaptable ; pour plus de 20 personnes, des remises sur le prix et la quantité sont possibles. |
| Événement | 200 000 par mois | 5 euros pour 100 000 événements | Les modèles, les outils, la recherche, l’évaluation et les étapes de simulation peuvent tous faire l’objet d’une facturation. |
| Accès aux données | 30 jours | Prix supplémentaire de 3 euros par Go | Facturation uniquement si la conservation dépasse la période incluse |
| Utilisateurs Lite | Infini | Contient | La portée des droits diffère de celle des sièges principaux |
| Inférence de modèle | Non inclus | Perçu par le fournisseur du modèle | Les simulations et l’évaluation des LLM peuvent entraîner de nombreuses appels au modèle. |
Méthode d’estimation de la facture
- Compter le nombre d’interactions des utilisateurs finaux par mois.
- Mesurer le nombre de modèles, d’outils et d’événements de recherche inclus dans une interaction typique.
- Ajouter les évaluations en ligne et les événements générés par Guardrail.
- Estimer la charge de travail supplémentaire des expériences hors ligne et des simulations par proxy.
- Déterminer le nombre de postes clés nécessitant des droits d’accès complets.
- Calculer les GB de données qui nécessitent encore un accès après plus de 30 jours.
- Il convient d’ajouter séparément les frais de modèles, de stockage cloud et d’infrastructure auto-hébergée.
- Réserver un budget pour la croissance, le comblement et les flux anormaux.
Logiciels libres et licences
LangWatch adopte un modèle à noyau ouvert ; le code de la plateforme principale est soumis à la licence Apache 2.0, tandis que les SDK Python et TypeScript ainsi que le service MCP utilisent la licence MIT. Les modules d’entreprise tels que SCIM, les journaux d’audit, la gestion des licences et de la facturation se trouvent dans des répertoires séparés, et une licence commerciale est requise pour une utilisation en production.
| Composant | Licence | Que peut-on faire | Restrictions |
|---|---|---|---|
| Plateforme centrale LangWatch | Apache version 2 | Voir, modifier et héberger soi-même les fonctionnalités principales | Les modules du répertoire d’entreprise ne sont pas soumis à la même licence. |
| Python SDK | MIT | Suivi, évaluation et accès aux données | Il reste nécessaire de se connecter à un service cloud ou self-hébergé. |
| TypeScript SDK | MIT | Intégrer une plateforme dans les projets Node et Web | Sans infrastructure de hébergement |
| MCP Server | MIT | Permettre à l’application client IA d’utiliser les fonctionnalités de LangWatch | Il est nécessaire d’attribuer de manière appropriée les permissions et les identifiants. |
| Scenario | Apache version 2 | Test de scénario d’agent en exécution locale | Les frais de modèles et d’agents cibles sont à la charge du client. |
| Module Enterprise | Licence commerciale | SSO, SCIM, audit et gestion d’entreprise | L'utilisation en production nécessite l’achat d’une autorisation. |
Version auto-hébergée
En l’absence de licence d’entreprise, LangWatch auto-hébergé permet toujours un nombre illimité de membres, d’équipes, de projets et de contenus personnalisés, et exécute le même logiciel principal que dans le cloud. La licence d’entreprise déverrouille, au sein de la même installation, SSO, RBAC, SCIM, les journaux d’audit et le support, sans nécessiter de version du produit distincte.
Comparaison des modes de déploiement
| Mode de déploiement | Qui gère l’application | Emplacement de stockage des données | Scénarios adaptés |
|---|---|---|---|
| LangWatch Cloud | LangWatch | Cloud géré | Début rapide et sans maintenance |
| Self-Managed | client | Infrastructure client | Souveraineté des données complète et gestion autonome |
| Cloud Enterprise | LangWatch | Instance exclusive dans la région spécifiée par le client | Nécessite une isolation et ne souhaite pas en assurer la maintenance soi-même |
| Hybrid | Plan de contrôle de gestion LangWatch | ClickHouse et le stockage d’objets se trouvent dans le réseau du client | Les données de suivi ne peuvent pas quitter le réseau de l’entreprise. |
Infrastructure auto-hébergée
Le schéma de production actuel v3 repose principalement sur Kubernetes Helm, utilise ClickHouse comme stockage d’analyse central, et conserve les données froides par strates via le stockage objet. La solution rapide Docker Compose est encore principalement destinée à v2 ; lors de la préparation du déploiement de v3, il ne faut pas suivre les anciens tutoriels.
- Utiliser ClickHouse pour enregistrer et interroger les événements de suivi et d’évaluation.
- Assurer le suivi et l’évaluation de l’ordre de traitement par le traçage des événements.
- Hiérarchiser les données anciennes dans un stockage d’objets compatible.
- Utiliser les mécanismes de sauvegarde et de restauration natifs de ClickHouse.
- Ajuster les déploiements de différentes tailles via Helm Overlay.
- Il est possible d’activer le sous-graphique AI Gateway.
- Il est nécessaire de gérer soi-même les clés, le réseau, les sauvegardes, les mises à jour et la surveillance.
Sécurité et conformité
LangWatch indique publiquement qu’elle est conforme au RGPD et a obtenu la certification ISO 27001 ; les clients professionnels peuvent demander les rapports correspondants ainsi que des accords de traitement des données. Étant donné que la plateforme peut avoir accès aux prompts, aux résultats, aux paramètres des outils et aux données des utilisateurs, l’équipe doit néanmoins effectuer sa propre classification des données et concevoir son propre système d’accès.
- Supprimez les données personnelles et les clés non nécessaires avant d’installer les points de suivi.
- Restreindre qui peut consulter le suivi original et les ensembles de données.
- Définir les permissions minimales pour l’export, MCP et l’API.
- Vérifier la région cloud, le sous-traitant et la durée de conservation.
- L’environnement self-hosté active le chiffrement des transferts et statique.
- Élaborer des processus pour l’audit, la suppression, la sauvegarde et la réponse aux incidents.
- Les activités réglementées doivent définir les responsabilités de conformité par le biais de contrats d’entreprise.
À qui s’adresse-t-il
- Équipe d’ingénierie chargée du développement d’applications de grands modèles de langage et d’agents IA.
- L’équipe responsable de la qualité du modèle, des tests de régression et de sécurité.
- Équipes de produits qui ont besoin d’imiter le comportement d’agents lors de plusieurs tours de tests utilisateurs.
- Organisations qui souhaitent impliquer des experts métier pour les suggestions et l’annotation manuelle.
- Équipes de plateforme nécessitant une unification des passerelles de modèles, des budgets et de la gouvernance.
- Les entreprises qui souhaitent un hébergement auto-géré et open source, avec un contrôle des données de suivi.
- Développeurs qui utilisent des outils low-code tels que n8n pour créer des processus d’IA.
Avantages du produit
- La surveillance, l’évaluation, la simulation et la gestion des suggestions forment un cycle complet.
- Agent Simulations convient pour valider les agents à plusieurs tours et les agents instrumentaux.
- Prend en charge les expériences hors ligne, le suivi en ligne et les Guardrails synchronisés.
- OpenTelemetry réduit la dépendance vis-à-vis d’un seul SDK.
- Les prix en cloud offrent à la fois un accès gratuit et des extensions d’événements à bas coût.
- Avec l’hébergement auto-géré, il n’y a pas de limite de membres ni de projets.
- Les limites de la licence open core sont plus clairement définies.
Restrictions et précautions
- Une interaction utilisateur peut donner naissance à plusieurs événements de facturation.
- La simulation, les évaluations en ligne et Guardrail augmentent les coûts de modèle et d’événement.
- Les évaluateurs LLM et les utilisateurs simulés peuvent commettre des erreurs de jugement.
- Un système de qualité complet nécessite des ensembles de données à maintenir, des normes et une vérification manuelle.
- L’hébergement auto-géré v3 repose principalement sur Kubernetes, ce qui rend sa gestion plus complexe que celle des outils à un seul conteneur.
- Bien que les modules d’entreprise se trouvent dans le même entrepôt, ils ne sont pas soumis à la licence open source Apache.
- Le contenu suivi peut contenir des données commerciales sensibles et des indications de modèles.
- Le nombre de scénarios, de simulations et d’évaluations personnalisées dans la version Développeur est limité.
Processus de mise en œuvre
- Choisissez LangWatch Cloud ou planifiez un environnement auto-hébergé.
- Créer un projet et l’intégrer à OpenTelemetry ou au SDK officiel.
- Vérifier les Span, les coûts et la métadonnée des utilisateurs à l’aide de demandes de test.
- Établir des indicateurs de qualité clés et une classification des échecs.
- Créer le premier ensemble de données de test à partir du suivi réel.
- Définir des expériences en ligne hors ligne pour les indications et les modifications de modèle.
- Utiliser des simulations de scénarios pour tester le comportement des agents et outils à plusieurs reprises.
- Ajouter des garde-fous pour les entrées/sorties à haut risque.
- Configurer l’évaluation en ligne de la production, les alertes et le budget.
- Analyser les coûts réels en fonction des événements, des places, du stockage et des frais de modèles.
Questions fréquentes
LangWatch est-il gratuit ?
L’abonnement cloud pour développeurs est gratuit à vie et comprend 50 000 événements par mois, un accès aux données pendant 14 jours, 2 utilisateurs ainsi qu’un nombre limité de scénarios, de simulations et d’évaluations personnalisées. La version open source auto-hébergée ne limite pas non plus le nombre de membres, d’équipes et de projets, mais les coûts d’infrastructure sont à la charge de l’utilisateur.
Qu’est-ce qu’un événement de facturation ?
Les appels de modèles, les appels d’outils, la recherche, l’évaluation et les étapes de simulation peuvent tous donner naissance à des événements. Une session utilisateur complète contient généralement plusieurs événements ; il convient donc de se baser sur des mesures de suivi réelles plutôt que d’estimer directement en fonction du nombre de sessions.
LangWatch est-il open source ?
La plateforme principale est soumise à la licence Apache Version 2, tandis que le SDK et le MCP utilisent la licence MIT. Les modules d’entreprise bénéficient d’une licence commerciale distincte ; il est donc plus précis de parler de plateforme au noyau ouvert.
Peut-on l’héberger soi-même ?
Oui, pour la version v3, il est recommandé d’utiliser Kubernetes et les charts Helm officiels. Les fonctionnalités principales de la plateforme peuvent être utilisées sans licence, tandis que l’SSO, SCIM, RBAC, l’audit et le support entreprise nécessitent une licence commerciale.
Quelle est la différence entre Agent Simulation et les évaluations ordinaires ?
Les évaluations ordinaires vérifient généralement des entrées et sorties fixes, tandis que l’Agent Simulation permet à des utilisateurs simulés d’interagir à plusieurs reprises avec l’agent. Cette dernière méthode convient mieux pour tester les états, les outils, la voix, les refus de réponse ainsi que le processus complet pour atteindre les objectifs métier.
Est-il possible de bloquer en temps réel le contenu nocif ?
Le évaluateur peut être utilisé comme Guardrail pour s’exécuter de manière synchronisée avant et après l’appel du modèle, et bloquer ou revenir en arrière en fonction des résultats. Avant le déploiement, il convient de tester les délais, les faux positifs, la logique de dégradation et le traitement des exceptions.
Résumé
LangWatch ne se contente pas de enregistrer le suivi des LLM ; il combine également des expériences hors ligne, des évaluations en ligne, des garde-fous en temps réel, des simulations de scénarios d’agent et une gestion des prompts pour former un processus d’ingénierie IA complet. Il est particulièrement adapté aux équipes qui ont besoin de valider systématiquement plusieurs tours avec des agents, plutôt que de se contenter d’observer les réponses d’un modèle unique.
Le Cloud Growth commence à 29 euros par cœur, avec un tarif supplémentaire pour les événements en surcharge et le stockage prolongé ; la version open source auto-hébergée offre un contrôle des données plus poussé, mais le déploiement en production v3 nécessite des compétences en gestion de Kubernetes. Avant d’adopter officiellement ce service, il convient d’évaluer le taux d’événements, les coûts des modèles et les besoins de conservation en fonction du trafic réel.
Numéro d’enregistrement de sécurité publique du Guangxi : 45132202000164