LangWatch
Valeur ajoutée gratuite
Guide complet des outils d’IA Évaluation des modèles d’IA

LangWatch

LangWatch, outil intelligent spécialisé dans l’évaluation des modèles d’IA

Étiquettes :

Qu’est-ce que LangWatch ?

LangWatch est une plateforme LLMOps open source destinée aux applications de grands modèles de langage et aux agents IA, gérée par Reasoning Engine B.V. Elle relie l’observabilité, l’évaluation, la simulation d’agents, la gestion des prompts, l’AI Gateway et les capacités de gouvernance, afin d’aider les équipes depuis le développement et les tests jusqu’à la gestion en environnement de production.

La plateforme utilise OpenTelemetry pour recevoir et organiser les données de suivi, et prend en charge le cloud géré, l’autogestion complète, le cloud privé d’entreprise ainsi que le déploiement hybride. Les développeurs peuvent identifier les problèmes à partir des appels de modèles, de l’utilisation des outils et des sessions des utilisateurs, puis transformer des cas réels en tests d’évaluation et de scénarios.

Aperçu des principales compétences

Module de compétencesProblèmes résolusRésultat typique
ObservabilityComprendre comment les modèles, les outils et les agents fonctionnentSuivi, Span, indicateurs, coûts et alertes
EvaluationsÉvaluer la qualité, la sécurité et la fiabilitéScores d’essai, évaluations en ligne, Guardrails et résultats de régression
Agent SimulationsTester les dialogues et comportements complets avant la mise en ligneExécution de scénarios, simulation d’utilisateurs, raisons d’échec et rapport de test
Prompt ManagementGestion centralisée des suggestions et des versionsModèles de suggestions, variables, versions, Playground et résultats d’optimisation
AI GatewayAppel de modèle unifié, budget et routageClés virtuelles, routage, cache, quotas et protections
AI GovernanceContrôler l’accès des équipes et les risques de productionAutorisations, audit, dépenses et gouvernance organisationnelle

LLM et observabilité des agents

LangWatch enregistre automatiquement les appels aux grands modèles de langage, l’utilisation des outils, les recherches, les erreurs et les interactions avec les utilisateurs, et présente la chaîne d’exécution complète dans le suivi. Les équipes peuvent consulter les entrées/sorties, les tokens, les coûts, les délais, les modèles, les utilisateurs ainsi que des métadonnées personnalisées.

  • Filtrer le suivi par projet, utilisateur, modèle, prompt ou version.
  • Voir l’ordre d’exécution multi-étapes des Span imbriqués et des agents.
  • Échec de l’outil de localisation, appels lents et coûts anormaux.
  • Créer des tableaux de bord pour la qualité de production et les indicateurs commerciaux.
  • Relier les retours aux suivi concret par le biais d’événements utilisateur.
  • Exporter les données d’analyse vers un système externe.
  • La qualité de l’utilisation des alertes et des réponses automatisées diminue.

OpenTelemetry et intégration

La couche de suivi est basée sur OpenTelemetry, ce qui permet d’utiliser le SDK LangWatch ainsi que de recevoir des données générées par d’autres bibliothèques compatibles. L’intégration directe couvre les frameworks d’agent courants, les fournisseurs de modèles et les plateformes d’automatisation.

Catégories intégréesProjet représentatifUtilisation
Frameworks d’agent et d’applicationLangChain, LangGraph, Mastra, CrewAI et Google ADKCapture automatique de modèles, d’outils et d’agents Span
Fournisseur de modèlesOpenAI, Anthropic, Azure, Google Cloud, AWS et GroqEnregistrer les demandes de modèle, les réponses, les tokens et les coûts
Modèle localOllamaObserver les processus de raisonnement privés ou locaux
Plateforme low-codeLangFlow, Flowise et n8nAjouter le suivi et l’évaluation pour visualiser le processus
Protocole standardOTLPSe connecter à d’autres services compatibles avec OpenTelemetry

Expérience hors ligne

Experiments est utilisé pour exécuter des versions de modèles, d’indications ou d’agents sur un ensemble de données fixe avant mise en ligne, et pour enregistrer les résultats et les scores de chaque échantillon. L’équipe peut exécuter des expériences via l’interface, Python ou TypeScript, puis comparer la qualité, le coût et le délai de différentes configurations.

  1. Créer un ensemble de données représentant des tâches réelles.
  2. Choisir la version en production actuelle comme ligne de base.
  3. Définir les configurations de prompts, de modèles ou d’agents à comparer.
  4. Configurer un évaluateur intégré ou personnalisé pour la sortie.
  5. Exécuter tous les échantillons en parallèle et enregistrer le suivi.
  6. Comparer les scores, les erreurs, les retards et les coûts.
  7. Ajouter les échantillons échoués au jeu de données de régression.
  8. Intégrer les exigences de qualité minimale au contrôle d’accès de l’intégration continue.

Évaluation en ligne

L’évaluation en ligne exécute automatiquement levaluateur spécifié dès l’arrivée du suivi de production, afin d’observer en continu la fiabilité, la pertinence, la sécurité, les PII ou des indicateurs métier personnalisés. Elle est adaptée pour détecter les déviations de qualité qui apparaissent avec les changements d’utilisateurs, de modèles et de données.

Méthode d’évaluationMoment d’exécutionUtilisations adaptées
Expérience hors ligneAvant la publication, pour un ensemble de données fixeComparaison des suggestions, des modèles et des versions d’agent
Online EvaluationSuivi de la production une fois arrivéSurveiller les tendances de qualité et les échantillons anormaux
GuardrailExécution synchronisée avant et après l’appel du modèleBloquer en temps réel les évasions, les PII ou le contenu illicite
Annotation manuelleVérification des points de suivi ou des données sélectionnésÉtiquettes d’experts, préférences et cas controversés

Guardrails barrières de sécurité en temps réel

L’évaluateur peut être exécuté en synchronie avec Guardrail dans le code de l’application, et autoriser ou bloquer en fonction de la décision de validation. Il convient à la détection des jailbreaks à l’entrée, aux vérifications de sécurité à la sortie et à la validation des règles métier clés, mais il augmente le délai d’appel et la consommation d’événements.

  • Détection des évasions et des injections de suggestions.
  • Identifier les PII et les informations sensibles.
  • Vérifier la présence de contenus toxiques, nocifs ou illégaux.
  • Vérifier la fidélité et la pertinence des réponses RAG.
  • Exécuter LLM-as-a-judge ou évaluer avec du code personnalisé.
  • Retourner un message de sécurité en cas d’échec ou passer à un traitement manuel.

Évaluateur et flux de travail

LangWatch propose des évaluateurs intégrés tels que RAGAS, hallucinations, toxicité, PII et arbitrage de modèles, et permet également aux équipes de créer des évaluateurs réutilisables au niveau de l’organisation. Les évaluations complexes peuvent combiner plusieurs étapes et jugements via des workflows, et ajouter des scores personnalisés aux traces ou aux spans.

Ensembles de données et annotations

Les ensembles de données peuvent être gérés via des SDK et des API, être extraits du suivi en production ou générés avec l’aide de l’IA. Annotation Inbox sert à attribuer les échantillons aux examinateurs humains, ce qui convient aux experts métier pour ajouter des étiquettes, des réponses cibles et des évaluations subjectives de qualité.

  • Créer un ensemble d’expériences d’échec à partir du suivi réel.
  • Enregistrer les entrées d’évaluation telles que le texte et les images.
  • Créer et consulter des ensembles de données en masse à l’aide de code.
  • Permettre à l’IA de générer rapidement des échantillons de test initiaux.
  • Enregistrer séparément les étiquettes manuelles et l’évaluation automatique.
  • Utiliser les résultats de l’audit pour les tests de régression ultérieurs.

Agent Simulations

Agent Simulations vérifie si l’agent est capable d’atteindre ses objectifs, de respecter les règles et d’utiliser correctement les outils dans des conversations réelles en simulant plusieurs rounds d’interactions entre l’utilisateur et l’agent à tester. Il convient mieux que l’évaluation à un seul round d’entrée/sortie pour tester l’état, la mémoire, les appels d’outils et le comportement dans les conversations longues.

Structure de la scène

CompositionContenueffet
ScenarioConditions initiales, objectifs de l’utilisateur et contraintesDéfinir les tâches métier réelles à valider
Agent AdapterSe connecter à des proxies locaux, distants ou hébergésEnvoyer un message de test au système à tester
User SimulatorGénérer plusieurs tours de comportement utilisateur selon le rôle et l’objectifCouvrir différentes expressions, questions et résistances
CriteriaÉvaluation du succès, de l’échec et de la sécuritéDécider si la scène est validée
Run ParametersConcurrentiel, tentatives de réessai, nombre de modèles et de testsContrôler les coûts et la portée

Formes d’agents pris en charge

  • Agent de chat de texte.
  • Proxy distant nécessitant un accès ou un jeton.
  • Fonctions proxy dans le développement local.
  • Des agents en temps réel tels que OpenAI Realtime.
  • Des agents vocaux tels qu’ElevenLabs, Twilio et Pipecat.
  • Des agents multimodaux en temps réel tels que Gemini Live.

Équipe rouge et scénario de sécurité

Les tests de scénarios peuvent être utilisés pour générer des utilisateurs adverses, des demandes hors limites et des processus d’injection de prompts, afin d’observer les capacités défensives du proxy au cours de multiples interactions. Les résultats de l’équipe rouge doivent servir de base à des améliorations ; on ne doit pas en déduire que la sécurité est assurée de manière permanente après un seul test.

Bibliothèque open source Scenario

Le dépôt Scenario indépendant fournit des outils de test d’agent pour Python et TypeScript, et est soumis à la licence Apache 2.0. Il peut fonctionner localement ainsi que dans des environnements d’intégration continue, sans exiger que tous les tests soient effectués dans le cloud via LangWatch.

Gestion des suggestions

Prompt Management permet de stocker de manière centralisée les modèles de prompts, les variables, les versions et l’état de publication, évitant ainsi que les prompts soient dispersés dans le code, les tableaux et les interfaces. Les développeurs peuvent synchroniser les prompts via un SDK ou une CLI, et remplacer les modèles et paramètres dans le Playground pour effectuer des comparaisons.

FonctionnalitéeffetUtilisateur typique
Prompt RegistryConserver de manière centralisée les suggestions de nommage et les versionsÉquipe de développement et de produits
VariablesRemplir les données métier en temps de exécutionDéveloppeur d’applications
PlaygroundIndications de test, modèles et paramètresConseil pour les experts en ingénierie et en affaires
CLI SyncIntégrer la configuration des suggestions dans le dépôt de codeIngénierie de plateforme et intégration continue
Optimization StudioAmélioration des suggestions basée sur l’échantillon et la cibleÉquipes nécessitant une optimisation systématique
DSPy OptimizationRechercher des suggestions plus optimales par méthode programméeÉquipe de recherche et d’évaluation avancée

AI Gateway

AI Gateway permet d’accéder de manière unifiée à plusieurs fournisseurs de modèles, et gère au sein des limites de l’organisation les clés virtuelles, le routage, le budget, le cache et Guardrails. Lors de l’hébergement auto-géré, il est possible de choisir de faire terminer le trafic des modèles à la frontière du propre réseau.

  • Isoler les applications et les équipes à l’aide de clés virtuelles.
  • Acheminer entre plusieurs modèles ou fournisseurs.
  • Définir des budgets hiérarchisés pour les organisations, projets ou utilisateurs.
  • Utiliser le cache des suggestions pour réduire les raisonnements répétitifs.
  • Mettre en œuvre des barrières de sécurité en temps réel à l’entrée unique.
  • Enregistrer de manière centralisée les coûts, les échecs et la consommation des modèles.

MCP, CLI et compétences

LangWatch propose MCP, des outils en ligne de commande et des compétences destinées aux assistants de programmation, permettant aux assistants IA d’aider au suivi de l’accès, à la création d’évaluations, à l’exécution de simulations et à la gestion des suggestions. Les modifications automatisées doivent néanmoins faire l’objet d’une révision manuelle, en particulier pour les clés de production, les protections et les paramètres de déploiement.

Prix en cloud

Les informations sur les prix ont été vérifiées le 23 août 2026 ; les montants réels, les taxes, les taux de change et les remises peuvent varier. Les données finales seront celles affichées sur la page de paiement.

LangWatch Cloud facture en fonction des postes principaux et de l’utilisation des événements ; Growth applique en outre un frais de stockage pour les données conservées plus de 30 jours. Les utilisateurs Lite peuvent consulter et collaborer, mais les droits d’édition spécifiques dépendent des indications des permissions actuelles.

Forfait ou versionPrixPériode de facturationDroits ou crédit principalAdéquat pour les utilisateurs
DeveloperGratuitGratuit à vie, le quota est renouvelé chaque moisIncident de 50 000, accès aux données sur 14 jours, 2 utilisateurs, 3 scénarios, 3 simulations et 3 évaluations personnaliséesDéveloppeurs individuels et prototypes préliminaires
Growth29 euros par siège par cœurChaque moisInclut 200 000 événements et conservation sur 30 jours, utilisateurs Lite illimités, simulation, évaluation et conseilsL’équipe qui met en production les applications d’IA
EnterpriseCotation sur mesureDispositions contractuellesMixte, auto-hébergé ou déployé localement, avec conservation personnalisée, SSO, RBAC, audit, SLA et support technique dédiéRégulation et grandes organisations

Événements et facturation de stockage

Chaque appel au modèle, chaque utilisation d’outil, chaque recherche, évaluation ou étape de simulation est comptée comme un événement ; par conséquent, une conversation utilisateur comprend généralement plusieurs événements facturables. Les 200 000 premiers événements par mois sont inclus dans le tarif de l’abonnement, puis 5 euros sont facturés pour chaque 100 000 événements supplémentaires.

Élément de facturationQuantité incluse dans la croissancePrix excessifPrécautions à prendre
Siège cléTarification indépendante par siège29 euros par place et par moisLe nombre de places est adaptable ; pour plus de 20 personnes, des remises sur le prix et la quantité sont possibles.
Événement200 000 par mois5 euros pour 100 000 événementsLes modèles, les outils, la recherche, l’évaluation et les étapes de simulation peuvent tous faire l’objet d’une facturation.
Accès aux données30 joursPrix supplémentaire de 3 euros par GoFacturation uniquement si la conservation dépasse la période incluse
Utilisateurs LiteInfiniContientLa portée des droits diffère de celle des sièges principaux
Inférence de modèleNon inclusPerçu par le fournisseur du modèleLes simulations et l’évaluation des LLM peuvent entraîner de nombreuses appels au modèle.

Méthode d’estimation de la facture

  1. Compter le nombre d’interactions des utilisateurs finaux par mois.
  2. Mesurer le nombre de modèles, d’outils et d’événements de recherche inclus dans une interaction typique.
  3. Ajouter les évaluations en ligne et les événements générés par Guardrail.
  4. Estimer la charge de travail supplémentaire des expériences hors ligne et des simulations par proxy.
  5. Déterminer le nombre de postes clés nécessitant des droits d’accès complets.
  6. Calculer les GB de données qui nécessitent encore un accès après plus de 30 jours.
  7. Il convient d’ajouter séparément les frais de modèles, de stockage cloud et d’infrastructure auto-hébergée.
  8. Réserver un budget pour la croissance, le comblement et les flux anormaux.

Logiciels libres et licences

LangWatch adopte un modèle à noyau ouvert ; le code de la plateforme principale est soumis à la licence Apache 2.0, tandis que les SDK Python et TypeScript ainsi que le service MCP utilisent la licence MIT. Les modules d’entreprise tels que SCIM, les journaux d’audit, la gestion des licences et de la facturation se trouvent dans des répertoires séparés, et une licence commerciale est requise pour une utilisation en production.

ComposantLicenceQue peut-on faireRestrictions
Plateforme centrale LangWatchApache version 2Voir, modifier et héberger soi-même les fonctionnalités principalesLes modules du répertoire d’entreprise ne sont pas soumis à la même licence.
Python SDKMITSuivi, évaluation et accès aux donnéesIl reste nécessaire de se connecter à un service cloud ou self-hébergé.
TypeScript SDKMITIntégrer une plateforme dans les projets Node et WebSans infrastructure de hébergement
MCP ServerMITPermettre à l’application client IA d’utiliser les fonctionnalités de LangWatchIl est nécessaire d’attribuer de manière appropriée les permissions et les identifiants.
ScenarioApache version 2Test de scénario d’agent en exécution localeLes frais de modèles et d’agents cibles sont à la charge du client.
Module EnterpriseLicence commercialeSSO, SCIM, audit et gestion d’entrepriseL'utilisation en production nécessite l’achat d’une autorisation.

Version auto-hébergée

En l’absence de licence d’entreprise, LangWatch auto-hébergé permet toujours un nombre illimité de membres, d’équipes, de projets et de contenus personnalisés, et exécute le même logiciel principal que dans le cloud. La licence d’entreprise déverrouille, au sein de la même installation, SSO, RBAC, SCIM, les journaux d’audit et le support, sans nécessiter de version du produit distincte.

Comparaison des modes de déploiement

Mode de déploiementQui gère l’applicationEmplacement de stockage des donnéesScénarios adaptés
LangWatch CloudLangWatchCloud géréDébut rapide et sans maintenance
Self-ManagedclientInfrastructure clientSouveraineté des données complète et gestion autonome
Cloud EnterpriseLangWatchInstance exclusive dans la région spécifiée par le clientNécessite une isolation et ne souhaite pas en assurer la maintenance soi-même
HybridPlan de contrôle de gestion LangWatchClickHouse et le stockage d’objets se trouvent dans le réseau du clientLes données de suivi ne peuvent pas quitter le réseau de l’entreprise.

Infrastructure auto-hébergée

Le schéma de production actuel v3 repose principalement sur Kubernetes Helm, utilise ClickHouse comme stockage d’analyse central, et conserve les données froides par strates via le stockage objet. La solution rapide Docker Compose est encore principalement destinée à v2 ; lors de la préparation du déploiement de v3, il ne faut pas suivre les anciens tutoriels.

  • Utiliser ClickHouse pour enregistrer et interroger les événements de suivi et d’évaluation.
  • Assurer le suivi et l’évaluation de l’ordre de traitement par le traçage des événements.
  • Hiérarchiser les données anciennes dans un stockage d’objets compatible.
  • Utiliser les mécanismes de sauvegarde et de restauration natifs de ClickHouse.
  • Ajuster les déploiements de différentes tailles via Helm Overlay.
  • Il est possible d’activer le sous-graphique AI Gateway.
  • Il est nécessaire de gérer soi-même les clés, le réseau, les sauvegardes, les mises à jour et la surveillance.

Sécurité et conformité

LangWatch indique publiquement qu’elle est conforme au RGPD et a obtenu la certification ISO 27001 ; les clients professionnels peuvent demander les rapports correspondants ainsi que des accords de traitement des données. Étant donné que la plateforme peut avoir accès aux prompts, aux résultats, aux paramètres des outils et aux données des utilisateurs, l’équipe doit néanmoins effectuer sa propre classification des données et concevoir son propre système d’accès.

  • Supprimez les données personnelles et les clés non nécessaires avant d’installer les points de suivi.
  • Restreindre qui peut consulter le suivi original et les ensembles de données.
  • Définir les permissions minimales pour l’export, MCP et l’API.
  • Vérifier la région cloud, le sous-traitant et la durée de conservation.
  • L’environnement self-hosté active le chiffrement des transferts et statique.
  • Élaborer des processus pour l’audit, la suppression, la sauvegarde et la réponse aux incidents.
  • Les activités réglementées doivent définir les responsabilités de conformité par le biais de contrats d’entreprise.

À qui s’adresse-t-il

  • Équipe d’ingénierie chargée du développement d’applications de grands modèles de langage et d’agents IA.
  • L’équipe responsable de la qualité du modèle, des tests de régression et de sécurité.
  • Équipes de produits qui ont besoin d’imiter le comportement d’agents lors de plusieurs tours de tests utilisateurs.
  • Organisations qui souhaitent impliquer des experts métier pour les suggestions et l’annotation manuelle.
  • Équipes de plateforme nécessitant une unification des passerelles de modèles, des budgets et de la gouvernance.
  • Les entreprises qui souhaitent un hébergement auto-géré et open source, avec un contrôle des données de suivi.
  • Développeurs qui utilisent des outils low-code tels que n8n pour créer des processus d’IA.

Avantages du produit

  • La surveillance, l’évaluation, la simulation et la gestion des suggestions forment un cycle complet.
  • Agent Simulations convient pour valider les agents à plusieurs tours et les agents instrumentaux.
  • Prend en charge les expériences hors ligne, le suivi en ligne et les Guardrails synchronisés.
  • OpenTelemetry réduit la dépendance vis-à-vis d’un seul SDK.
  • Les prix en cloud offrent à la fois un accès gratuit et des extensions d’événements à bas coût.
  • Avec l’hébergement auto-géré, il n’y a pas de limite de membres ni de projets.
  • Les limites de la licence open core sont plus clairement définies.

Restrictions et précautions

  • Une interaction utilisateur peut donner naissance à plusieurs événements de facturation.
  • La simulation, les évaluations en ligne et Guardrail augmentent les coûts de modèle et d’événement.
  • Les évaluateurs LLM et les utilisateurs simulés peuvent commettre des erreurs de jugement.
  • Un système de qualité complet nécessite des ensembles de données à maintenir, des normes et une vérification manuelle.
  • L’hébergement auto-géré v3 repose principalement sur Kubernetes, ce qui rend sa gestion plus complexe que celle des outils à un seul conteneur.
  • Bien que les modules d’entreprise se trouvent dans le même entrepôt, ils ne sont pas soumis à la licence open source Apache.
  • Le contenu suivi peut contenir des données commerciales sensibles et des indications de modèles.
  • Le nombre de scénarios, de simulations et d’évaluations personnalisées dans la version Développeur est limité.

Processus de mise en œuvre

  1. Choisissez LangWatch Cloud ou planifiez un environnement auto-hébergé.
  2. Créer un projet et l’intégrer à OpenTelemetry ou au SDK officiel.
  3. Vérifier les Span, les coûts et la métadonnée des utilisateurs à l’aide de demandes de test.
  4. Établir des indicateurs de qualité clés et une classification des échecs.
  5. Créer le premier ensemble de données de test à partir du suivi réel.
  6. Définir des expériences en ligne hors ligne pour les indications et les modifications de modèle.
  7. Utiliser des simulations de scénarios pour tester le comportement des agents et outils à plusieurs reprises.
  8. Ajouter des garde-fous pour les entrées/sorties à haut risque.
  9. Configurer l’évaluation en ligne de la production, les alertes et le budget.
  10. Analyser les coûts réels en fonction des événements, des places, du stockage et des frais de modèles.

Questions fréquentes

LangWatch est-il gratuit ?

L’abonnement cloud pour développeurs est gratuit à vie et comprend 50 000 événements par mois, un accès aux données pendant 14 jours, 2 utilisateurs ainsi qu’un nombre limité de scénarios, de simulations et d’évaluations personnalisées. La version open source auto-hébergée ne limite pas non plus le nombre de membres, d’équipes et de projets, mais les coûts d’infrastructure sont à la charge de l’utilisateur.

Qu’est-ce qu’un événement de facturation ?

Les appels de modèles, les appels d’outils, la recherche, l’évaluation et les étapes de simulation peuvent tous donner naissance à des événements. Une session utilisateur complète contient généralement plusieurs événements ; il convient donc de se baser sur des mesures de suivi réelles plutôt que d’estimer directement en fonction du nombre de sessions.

LangWatch est-il open source ?

La plateforme principale est soumise à la licence Apache Version 2, tandis que le SDK et le MCP utilisent la licence MIT. Les modules d’entreprise bénéficient d’une licence commerciale distincte ; il est donc plus précis de parler de plateforme au noyau ouvert.

Peut-on l’héberger soi-même ?

Oui, pour la version v3, il est recommandé d’utiliser Kubernetes et les charts Helm officiels. Les fonctionnalités principales de la plateforme peuvent être utilisées sans licence, tandis que l’SSO, SCIM, RBAC, l’audit et le support entreprise nécessitent une licence commerciale.

Quelle est la différence entre Agent Simulation et les évaluations ordinaires ?

Les évaluations ordinaires vérifient généralement des entrées et sorties fixes, tandis que l’Agent Simulation permet à des utilisateurs simulés d’interagir à plusieurs reprises avec l’agent. Cette dernière méthode convient mieux pour tester les états, les outils, la voix, les refus de réponse ainsi que le processus complet pour atteindre les objectifs métier.

Est-il possible de bloquer en temps réel le contenu nocif ?

Le évaluateur peut être utilisé comme Guardrail pour s’exécuter de manière synchronisée avant et après l’appel du modèle, et bloquer ou revenir en arrière en fonction des résultats. Avant le déploiement, il convient de tester les délais, les faux positifs, la logique de dégradation et le traitement des exceptions.

Résumé

LangWatch ne se contente pas de enregistrer le suivi des LLM ; il combine également des expériences hors ligne, des évaluations en ligne, des garde-fous en temps réel, des simulations de scénarios d’agent et une gestion des prompts pour former un processus d’ingénierie IA complet. Il est particulièrement adapté aux équipes qui ont besoin de valider systématiquement plusieurs tours avec des agents, plutôt que de se contenter d’observer les réponses d’un modèle unique.

Le Cloud Growth commence à 29 euros par cœur, avec un tarif supplémentaire pour les événements en surcharge et le stockage prolongé ; la version open source auto-hébergée offre un contrôle des données plus poussé, mais le déploiement en production v3 nécessite des compétences en gestion de Kubernetes. Avant d’adopter officiellement ce service, il convient d’évaluer le taux d’événements, les coûts des modèles et les besoins de conservation en fonction du trafic réel.

©️Droit d’auteur : Sauf indication contraire, tous les articles de ce site sont protégés par le droit d’auteur.Partage d’outils d’IATous les droits d’auteur sont réservés. Sans autorisation, aucune personne, média, site web ou groupe ne peut reproduire, copier ou diffuser de quelque manière que ce soit le contenu de ce site, ni créer de mirror sur des serveurs qui ne lui appartiennent pas. Dans le cas contraire, notre site se réserve le droit de poursuivre en justice les responsables conformément à la loi.

Outils similaires à LangWatch