Evidently AI
Evidently AI, outil intelligent axé sur la programmation en IA
Étiquettes :Outils de programmation IAUne phrase pour présenter
Evidently AI est un framework open source d’évaluation et d’observabilité de l’IA, permettant d’examiner la qualité des LLM, des RAG, des agents intelligents, des pipelines de données ainsi que des modèles classiques d’apprentissage automatique lors d’expériences, de tests de régression et de surveillance en production.
Présentation des outils
Evidently AI est évidemment géré par Evidently AI, Inc. Son produit phare est la bibliothèque Evidently, qui peut être installée dans un environnement Python, accompagnée d’une plateforme de surveillance légère pouvant être déployée soi-même.
Il n’est pas chargé de l’entraînement des modèles de base, mais transforme les données d’entrée, les résultats de sortie, les étiquettes et les données de référence en indicateurs, rapports, résultats de test et panneaux de tendances, afin d’aider l’équipe à détecter les illusions, la dégradation de la qualité de la recherche, le drift des données, le régressions de performance et les problèmes de qualité des données.
Composition actuelle du produit
| Composants | État actuel | Utilisation principale | Licence ou mode de livraison |
|---|---|---|---|
| Évidemment la bibliothèque Python | Disponible officiellement | Exécuter les évaluations, générer des rapports et des ensembles de tests | Open source Apache 2.0 |
| Évidemment une plateforme open source | Disponible officiellement | Projets auto-hébergés, ensembles de données, rapports, interfaces de suivi et de surveillance | Version de base fournie avec la bibliothèque open source |
| Tracely | Disponible officiellement | Données de suivi quasi en temps réel des applications LLM collectées via OpenTelemetry | Open source Apache 2.0 |
| Evidently Enterprise | Offre commerciale | Évaluation avancée sans code, collaboration, sécurité et déploiement à grande échelle | Contacter le service des ventes pour une mise en œuvre privée |
| Evidently Cloud | Le service SaaS a été arrêté. | Plateformes de tutelle dans l’histoire | Il ne faut plus le présenter comme un forfait cloud gratuit. |
Fonction principale
1. Rapports d’évaluation
Reports est utilisé pour calculer et regrouper des données, ainsi que des indicateurs de qualité pour l’apprentissage automatique et les LLM, et convient à l’analyse expérimentale, au débogage, aux comparaisons de référence et aux contrôles en série de production.
- Utilisez des combinaisons prédéfinies pour rapidement créer un ensemble d’indicateurs d’évaluation courants.
- Ajoutez des indicateurs individuels ou des indicateurs Python personnalisés par tâche.
- Voir les résultats interactifs dans le Notebook, ou les exporter en JSON, dictionnaire Python et fichier HTML.
- Comparer les données actuelles aux données de référence pour analyser les changements dans la distribution, la qualité et les performances du modèle.
2. Ensembles de tests
Les ensembles de tests ajoutent des conditions de réussite ou d’échec aux indicateurs de rapport, et peuvent être utilisés pour la validation des données, les tests de régression de modèles et les contrôles de qualité dans l’intégration continue.
- Définir des conditions de seuil supérieur, inférieur ou autres pour les indicateurs.
- Générer automatiquement certaines conditions de test à partir des données de référence, afin de réduire les tâches de configuration initiale.
- Utiliser les résultats des tests pour prendre des décisions de publication, et non seulement pour afficher des graphiques.
- Répéter l’exécution du même test après mise à jour du modèle, des prompts ou de la chaîne de recherche.
3. Évaluation des LLM, RAG et des agents intelligents
Il est évident que l’on peut analyser les robots de conversation, RAG, Copilot, les agents intelligents IA et d’autres applications génératives. Les équipes peuvent combiner des règles, des classificateurs, des méthodes de similarité et des évaluateurs LLM.
| Direction de l’évaluation | Contenu pouvant être vérifié | Utilisations typiques |
|---|---|---|
| Faits et illusions | Factualité, cohérence des déclarations et réponses suspectes | Réduire les sorties sans fondement |
| Qualité de la recherche | Corrélation avec le contexte, relation entre la réponse et le matériel de recherche | Évaluer le lien RAG |
| Sécurité et confidentialité | PII, toxicité, mots sensibles et contenus dangereux | Établir des critères de sécurité pour le lancement en ligne |
| Format et règles | Longueur, régularité, mots-clés, ton et structure | Vérifier le respect des normes opérationnelles |
| Sémantique et langue | Similitude sémantique, émotions, caractéristiques linguistiques et textuelles | Comparer plusieurs modèles ou prompts |
| Évaluation personnalisée | Tout indice, modèle, règle ou logique Python | Mettre en œuvre des critères de notation spécifiques à l’activité |
4. Évaluation du apprentissage automatique traditionnel
En plus de l’IA générative, Evidently prend également en charge la classification, la régression, le tri, les recommandations et l’analyse de la qualité des données tabulaires, ce qui permet de relier l’évaluation expérimentale au suivi en production.
| Type de tâche | Indicateur représentatif ou vérification | Données nécessaires |
|---|---|---|
| Classification | Précision, exactitude, rappel, ROC AUC et matrice de confusion | Prédictions, étiquettes et données de référence optionnelles |
| Régression | MAE, ME, RMSE, distribution des erreurs et biais | Prédiction numérique et étiquettes réelles |
| Tri et RAG | NDCG, MAP, MRR et taux de précision | Recherche, tri des résultats et informations sur la pertinence |
| Système de recommandation | Originalité, diversité, biais de popularité, etc. | Listes de recommandations et données d’interaction utilisateur |
| Qualité des données | Manque, duplication, portée, catégories et pertinence | Ensemble de données actuel et ensembles de référence optionnels |
| Drift des données | Tests statistiques et distance de distribution | Lot actuel et lot de référence |
5. Drift des données et qualité des données
La plateforme peut comparer les données actuelles aux données de référence pour identifier les changements dans la répartition des champs, les valeurs manquantes, les valeurs dupliquées, de nouvelles catégories et des plages anormales. Le drift en soi ne signifie pas que le modèle a échoué ; il faut encore l’interpréter en tenant compte des étiquettes, des indicateurs métier et de la qualité du modèle.
6. Panneau de surveillance
L’UI auto-hébergée permet de sauvegarder des snapshots des évaluations par projet, et d’afficher les indicateurs ainsi que les résultats des tests sous forme de tableaux de surveillance en fonction du temps. La version open source convient à des déploiements légers ; l’équipe doit alors assumer elle-même le contrôle d’accès, les sauvegardes, les mises à jour et l’extension.
7. Suivi et évaluation de la production
Tracely est utilisé pour collecter les entrées, les sorties et les étapes intermédiaires des applications LLM, ce qui permet de transformer le suivi de la production en un ensemble de données analysables. Les évaluations à horodatage avancé, les alertes et les workflows sans code font partie des fonctionnalités de la plateforme commerciale.
8. Données synthétiques et optimisation des prompts
L’écosystème actuel comprend des capacités de génération de données synthétiques et d’optimisation des prompts, qui peuvent être utilisées pour créer des exemples normaux, de bordure ou adversariaux, afin de comparer différentes combinaisons de prompts, de modèles et de paramètres. La génération d’exemples ne peut pas remplacer les données réelles des utilisateurs ni les tests de red team manuels.
Le flux de travail de la recherche expérimentale à la production
- Définir les risques à valider, tels que les hallucinations, la pertinence des recherches, le dérive des données ou la baisse de la performance de classification.
- Préparer les données actuelles, les données de référence, les résultats de prédiction, les étiquettes ou les enregistrements d’interaction avec l’LLM, et définir la signification des champs.
- Sélectionnez les paramètres prédéfinis et générez un rapport d’indicateurs ; observez d’abord la distribution, les exemples d’échec et les groupes anormaux.
- Transformer les indicateurs clés en suite de tests avec des seuils, afin de créer des points de contrôle qualité pouvant être exécutés de manière répétée.
- Réévaluer après des modifications des prompts, du modèle, des données ou du code, et comparer les différences de résultats.
- Écrire le rapport dans un Workspace auto-hébergé, et surveiller en continu les tendances et l’état des tests via le Dashboard.
- Relier les résultats d’échec aux processus de diagnostic, de rollback, de réentraînement ou de vérification manuelle.
Installation et introduction à la version open source
Le projet actuel exige Python 3.10 ou une version ultérieure, qui peut être installée via la gestion des paquets Python. Les projets officiels doivent fixer une version et lire les notes de changement ainsi que les tests de régression avant toute mise à niveau.
- Créez un environnement Python indépendant et préparez une table Pandas ou des données pouvant être converties en tableau.
- Installez le paquet Evidently ; si vous avez besoin d’évaluation par LLM, de Spark ou de stockage cloud, sélectionnez alors les dépendances optionnelles correspondantes.
- Définir les champs de données, les données actuelles et les données de référence optionnelles, choisir des indicateurs prédéfinis ou individuels.
- Exécutez le rapport et consultez-le dans le Notebook, ou enregistrez-le en HTML, JSON et dictionnaire Python.
- Ajouter des conditions de test pour les indicateurs clés, et intégrer le Test Suite dans les tâches d’intégration continue ou batch.
- Vérifier d’abord le coût de calcul et la mise en correspondance des champs à l’aide de données d’exemple, avant d’intégrer les données de production.
Tutoriel de surveillance auto-hébergée
- Créer un Workspace, en choisissant d’utiliser un répertoire local, une base de données de type SQL ou un stockage d’objets compatible avec S3.
- Dans la tâche d’évaluation, écrire les captures de rapport, le suivi ou l’ensemble de données dans l’espace de travail spécifié.
- Démarrer le service Evidently UI et vérifier qu’il peut lire les données des projets dans Workspace.
- Créer des projets et des panneaux de tableau de bord, puis sélectionner les indicateurs et tests à suivre en continu.
- Ajouter un proxy inversé, une authentification, du chiffrement, des sauvegardes, des journaux et des restrictions de ressources dans l’environnement de production.
- Exécuter des évaluations en lot par heure, par jour ou lors de l’arrivée d’une nouvelle étiquette, et intégrer les anomalies dans le processus de réponse de l’équipe.
À qui s’adresse-t-il
- Scientifique des données : comparer les données, les modèles et les variations des caractéristiques, et générer des rapports d’analyse partageables.
- Ingénieur en apprentissage automatique : intégrer les tests de qualité dans les pipelines d’entraînement, de déploiement et de traitement par lots.
- Développeur d’applications LLM : évaluer la qualité des résultats des chatbots, RAG, agents et Copilot.
- MLOps et équipe de plateforme : panneaux unifiés d’évaluation, de suivi et de surveillance gérés en interne.
- Responsable produit d’IA et équipe qualité : définir les dimensions de la qualité, examiner les exemples d’échecs et suivre les régressions de version.
- Entreprises régulées : déployées dans un environnement privé, avec des fonctionnalités supplémentaires en matière de droits d’accès et de collaboration via la version commerciale.
Scénarios d'utilisation typiques
- Exécuter un ensemble d’évaluation fixe avant de publier de nouveaux prompts ou modèles afin d’empêcher des régressions évidentes.
- Comparer la pertinence contextuelle, la factualité et la qualité des réponses de plusieurs solutions de recherche RAG.
- Surveiller l’évolution dans le temps de la distribution des données de production, du taux de perte et de la performance du modèle.
- Vérifier les informations personnelles, la toxicité, les mots sensibles et les violations de format dans les réponses de l’LLM.
- Créer des rapports de qualité par lots pour les systèmes de classification, de régression, de tri ou de recommandation.
- Générer des entrées de test de bordure et adversariales pour élargir la couverture des ensembles de test manuels traditionnels.
- Centraliser les captures d’évaluation dans un panneau auto-hébergé, afin que les équipes de développement, de produits et de gouvernance puissent les analyser.
Avantages du produit
- Le même cadre couvre en même temps l’IA générative, l’apprentissage automatique traditionnel et la qualité des données.
- Plus de 100 évaluations intégrées sont fournies, et il est possible d’utiliser Python pour définir des indicateurs spécifiques à l’entreprise.
- Report convient à l’exploration, Test Suite convient à l’automatisation des accès ; les deux modes peuvent être combinés.
- La bibliothèque centrale et la plateforme de base sont soumises à une licence Apache 2.0 permissive, permettant leur exécution en environnement local et privé.
- Le rapport peut être conservé dans l’environnement Python, ou exporté sous forme de données structurées ou en HTML.
- Par défaut, la surveillance en batch ne conserve que les résumés agrégés et les résultats des tests, afin d’éviter de sauvegarder à nouveau toutes les prédictions brutes.
- Les entrepôts officiels, les documents, les exemples et les ressources communautaires sont assez complets, ce qui facilite le travail des développeurs pour diagnostiquer et étendre le système.
Restrictions d'utilisation et précautions
- Evidently fournit des outils d’évaluation plutôt que des réponses correctes ; une conception inadéquate des indicateurs, des seuils et des données de référence peut induire en erreur.
- Levaluateur LLM peut lui-même présenter des biais, de la randomité et des coûts supplémentaires liés au modèle, nécessitant une calibration par annotation manuelle.
- Le dérive des données ne représente que des changements de distribution et ne peut pas, à elle seule, prouver qu les performances du modèle se sont détériorées.
- Les plateformes open source ne comprennent pas les fonctionnalités de certification de la version commerciale, les droits des rôles, les alertes, les tâches planifiées ni les capacités complètes sans code.
- Evidently Cloud n’est plus fourni en tant que SaaS ; les anciens blogs, anciennes pages de connexion et certains documents restants peuvent prêter à confusion.
- Les équipes auto-hébergées doivent gérer elles-mêmes les coûts liés à l’infrastructure, à la sécurité, aux sauvegardes, aux mises à jour, à la disponibilité et à l’expansion.
- Les bibliothèques Python conviennent aux techniciens ; pour les équipes non techniques, l’absence de plateforme commerciale complémentaire rend la configuration et l’interprétation des indicateurs plus complexes.
- Avant de traiter les indications de production, les réponses et les données personnelles, il convient d’effectuer la minimisation, le masquage, le contrôle d’accès et la définition de la durée de conservation.
Prix et versions
Au 22 août 2026, les documents officiels indiquent clairement que Evidently Cloud a cessé d’être proposé en tant que produit SaaS, et qu’il n’est donc plus possible de faire référence aux forfaits cloud gratuits antérieurs ou aux anciennes tarifs payants.
| Version | Prix | Mode de déploiement | Capacités principales | Adéquat pour les utilisateurs |
|---|---|---|---|---|
| Évidemment la bibliothèque Python | Gratuit | Infrastructure locale ou propre | Plus de 100 évaluations, rapports, ensembles de tests et indicateurs personnalisés | Développeurs individuels et équipes techniques |
| Évidemment une plateforme open source | Logiciel gratuit, infrastructure à assumer soi-même | Auto-hébergement | Projets de base, ensembles de données, suivi, stockage des résultats et tableau de bord de surveillance | Équipe capable de gérer elle-même son fonctionnement |
| Tracely | Gratuit | Intégration dans l’application et hébergement des données en propre | Suivi des LLM basé sur OpenTelemetry | Équipe de développement d’applications LLM |
| Evidently Enterprise | Contacter le service des ventes | Cloud privé ou déploiement local | Évaluation sans code, alertes, tâches planifiées, permissions, backend extensible et support dédié | Entreprises qui accordent de l’importance à la sécurité, à la collaboration et à l’échelle |
| Evidently Cloud | Plus disponible | Services de gestion historique | Les fonctionnalités cloud présentes sur les anciennes pages ne peuvent pas être considérées comme des forfaits disponibles actuellement. | Pas applicable |
Le logiciel open source ne coûte pas de licence, mais les bases de données, le stockage d’objets, le calcul, les journaux, les sauvegardes et la maintenance entraînent des coûts. Il n’y a pas de tarif public et uniforme pour la version commerciale ; il est nécessaire de contacter le service des ventes en fonction de l’échelle du déploiement, ainsi que des exigences en matière de support et de sécurité.
Comparaison entre la version open source et la version commerciale
| Capacité | Version open source | Entreprise commerciale |
|---|---|---|
| Suivi, plus de 100 évaluations, rapports et tests | Soutien | Soutien |
| Tableau de bord de surveillance et indicateurs personnalisés | Soutien | Soutien |
| Rapports JSON, données brutes, suivi et gestion des ensembles de données | Soutien | Soutien |
| Données synthétiques et optimisation des prompts | Soutien | Soutien |
| Génération de données sans code, évaluation et tableau de bord | Non pris en charge | Soutien |
| Comparaison des résultats côte à côte et alertes | Non pris en charge | Soutien |
| Planifier une tâche | Non pris en charge | Soutien |
| Authentification et permissions de rôle | Non pris en charge | Soutien |
| Support exclusif, formation à la mise en production et backend à grande échelle | Soutien communautaire et maintenance autonome | Fourni selon le plan commercial |
Soutien à l’environnement et entrée/sortie
| Projet | Soutien disponible | Explication |
|---|---|---|
| Python | 3.10 et plus | Environnement principal, d’évaluation et d’indicateurs personnalisés |
| Jupyter Notebook | Soutien | Voir les rapports et les indicateurs de débogage de manière interactive |
| Ligne de commande et interface web | Soutien | Démarrer la plateforme de surveillance auto-hébergée et le projet de démonstration |
| Windows, macOS et Linux | Dépendance à l’environnement Python | La mise en production exige une vérification manuelle des dépendances et de l’environnement du conteneur. |
| Stockage de type SQL | Soutien | On peut utiliser des backends Workspace tels que SQLite, Postgres, etc. |
| Stockage d’objets compatible avec S3 | Soutien | Peut se connecter à Amazon S3, GCS ou MinIO, etc. |
| Application native pour mobile | Non fourni | Il est possible de consulter les services personnalisés via un navigateur, mais ce n’est pas une application mobile. |
| Entrée | Sortie | Explication |
|---|---|---|
| Tableaux Pandas et données textuelles | Ensemble de données avec indicateurs et rapport | Adapté aux expériences hors ligne et aux évaluations en masse |
| Ensemble actuel et ensemble de référence | Dérive, masse et analyse des différences | Il faut garantir que les définitions des champs et les fenêtres temporelles soient comparables. |
| Prédictions et étiquettes | Indicateurs de classification, de régression, de tri et de recommandation | Lors du retard des étiquettes, les indicateurs d’agent doivent être surveillés séparément. |
| Indications LLM, réponses, contexte et suivi | Évaluation de la qualité, de la sécurité et de la recherche | Le contenu sensible doit d’abord être désensibilisé. |
| Résultat du rapport | JSON, dictionnaires Python, HTML et captures d’écran de la plateforme | Peut être utilisé pour un jugement automatisé ou une vérification manuelle |
| Test Suite | Résultat positif ou négatif | Adapté à l’intégration continue et aux contrôles de déploiement |
API et capacités d’intégration
Évidemment, il s’agit d’abord de l’API de la bibliothèque Python, qui peut être appelée dans des notebooks, des scripts, des intégrations continues, des tâches d’orchestration comme Airflow, ainsi que dans des pipelines d’évaluation personnalisés. Les plateformes auto-hébergées fournissent également des interfaces pour écrire et lire les résultats des évaluations.
- Placer le Report et le Test Suite dans les pipelines d’entraînement, de validation ou de déploiement.
- La surveillance en masse est déclenchée par des scripts programmés, un planificateur de tâches ou des événements basés sur des étiquettes.
- Envoyer les résultats structurés vers des journaux existants, des alertes, des tableaux de bord ou des systèmes de gouvernance.
- Utiliser Tracely pour collecter les entrées, les sorties et les appels intermédiaires des applications LLM.
- Connecter le stockage d’objets et l’espace de travail distant grâce à une interface de système de fichiers compatible.
- Encapsuler les règles internes de l’entreprise, les classificateurs ou les modèles d’évaluation externes à l’aide d’indicateurs Python personnalisés.
GitHub et le monde du logiciel open source
Évidemment, le dépôt principal est maintenu en open source sous la licence Apache License 2.0. Lors de la vérification en août 2026, le dépôt comptait environ 7 800 étoiles ; la dernière version officielle est la 0.7.21, sortie le 10 mars 2026.
Apache 2.0 autorise l’utilisation, la modification et la distribution, mais toute nouvelle publication doit conserver la licence ainsi que les droits d’auteur, brevets et déclarations de propriété associés, et indiquer les fichiers qui ont été modifiés. Les droits de marque ne sont pas automatiquement accordés avec une licence open source.
| Projet open source officiel | Utilisation | Licence |
|---|---|---|
| evidently | Framework principal pour l’évaluation, les tests et la surveillance des ML et LLM | Apache 2.0 |
| tracely | Suivi des applications LLM basé sur OpenTelemetry | Apache 2.0 |
| community-examples | Exemples d’évaluation et de surveillance | Apache 2.0 |
| aws_alerting | Intégration d’exemples liés aux alertes AWS | Apache 2.0 |
| ml_observability_course | Matériel de cours sur l’observabilité de l’apprentissage automatique | Apache 2.0 |
Confidentialité, télémétrie et sécurité
Lorsque l’on génère des rapports dans un Notebook ou un script en utilisant uniquement des bibliothèques Python, les instructions officielles indiquent que la télémétrie des produits open source n’est pas collectée. Lors du démarrage de l’interface de surveillance auto-hébergée, la télémétrie anonyme des utilisations est activée par défaut, mais peut être désactivée via la variable d’environnement DO_NOT_TRACK.
- La télémétrie UI comprend le système d’exploitation, les versions de Python et des outils, l’heure, l’identifiant de l’utilisateur anonyme ainsi que les événements d’utilisation des fonctionnalités.
- Les autorités affirment qu’elles ne collecteront ni le contenu des ensembles de données, ni les noms des champs, ni les paramètres, ni le code, ni les schémas de données.
- L’autogestion ne signifie pas une sécurité automatique ; les plateformes open source manquent d’authentification intégrée et de permissions de rôle, ce que l’équipe doit compléter elle-même.
- Le suivi original de l’LLM peut contenir du texte client, des informations personnelles et des secrets commerciaux ; il convient donc d’établir des règles de masquage, de permissions et de suppression.
- Les politiques de confidentialité du site officiel et des services cloud historiques concernent également les adresses e-mail, les noms, les entreprises, les cookies, les données d’utilisation ainsi que les données de localisation autorisées.
- Le déploiement d’une entreprise doit vérifier les protocoles de traitement des données, les sous-traitants, les journaux, le chiffrement, les sauvegardes, la réponse aux vulnérabilités et les limites de support.
Informations de base
| Projet | Contenu |
|---|---|
| Nom de l’outil | Evidently AI |
| Société de développement | Evidently AI, Inc. |
| Type d’outil | Évaluation de l’IA, observabilité des LLM et surveillance du machine learning |
| Langue de base | Python |
| Type de données | Données de tableau et données de texte |
| Capacité centrale | Rapports, ensembles de tests, plus de 100 indicateurs, interface de suivi et de surveillance |
| Modèle de prix | Open source gratuit et devis personnalisé Enterprise |
| Faut-il s’inscrire ? | La version open source n’en a pas besoin ; pour la communication commerciale, il faut contacter les autorités officielles. |
| Est-ce open source | Oui, la bibliothèque principale utilise Apache 2.0 |
| SaaS cloud | La fourniture a été interrompue. |
| Déploiement principal | Serveurs locaux, serveurs propriétaires, cloud privé ou environnement local d’entreprise |
Indice de recommandation
Indice de recommandation : 4,6 / 5. Evidently couvre les LLM et l’apprentissage automatique traditionnel, avec une liaison cohérente entre indicateurs, rapports, tests et surveillance, idéal pour les équipes techniques souhaitant maîtriser la logique des données et de l’évaluation.
Le principal inconvénient est que le déploiement open source nécessite des investissements en ingénierie et en maintenance, tandis que les fonctionnalités sans code et collaboratives accessibles directement par les utilisateurs non techniques sont concentrées dans la version commerciale. Après le retrait de Cloud du marché SaaS, l’équipe doit également réévaluer les coûts d’hébergement et les solutions de migration.
Questions fréquentes
Est-ce que l’IA est évidemment gratuite ?
Les bibliothèques Python de base, Tracely et la plateforme de base peuvent être utilisées gratuitement, sous licence Apache 2.0. L’hébergement proprement dit entraîne néanmoins des coûts en matière de serveurs, de stockage, de maintenance et de sécurité.
Est-il évident que Cloud peut encore être enregistré et utilisé ?
La dernière version des documents officiels précise clairement que Cloud n’est plus proposé en tant que produit SaaS. Les forfaits cloud gratuits mentionnés sur les anciennes pages ou articles ne doivent plus être considérés comme des solutions actuelles.
Peut-on évaluer les LLM et le RAG ?
Oui. La plateforme prend en charge l’évaluation factuelle, la pertinence de la recherche, la similarité sémantique, les PII, la toxicité, le format ainsi que des évaluations personnalisées des LLM, et permet également de comparer différents modèles et prompts.
Est-il possible de surveiller les modèles d’apprentissage automatique traditionnels ?
Oui. Evidently prend en charge la classification, la régression, le tri, les recommandations, la qualité des données et le drift des données, et permet de sauvegarder les résultats en masse dans un dashboard auto-hébergé.
Faut-il télécharger des données dans le cloud externe ?
Les bibliothèques et plateformes open source peuvent fonctionner entièrement dans leur propre environnement. Le recours à des évaluateurs LLM externes, à des bases de données distantes ou à du stockage d’objets dépend de la configuration choisie par l’équipe.
L’interface de surveillance open source dispose-t-elle d’une fonction d’authentification et de gestion des droits ?
Le tableau de comparaison officiel indique que la version open source ne comprend pas d’authentification ni de permissions de rôle. Lors d’un déploiement externe ou multi-utilisateurs, il est nécessaire d’utiliser un gateway, un service d’identité et des politiques réseau pour compléter le contrôle d’accès.
Evidently collecte-t-il des données de modèle ?
Selon les autorités, la télémétrie UI auto-hébergée ne collecte ni le contenu des ensembles de données, ni les noms de champs, ni les paramètres, ni le code ; l’utilisation d’une bibliothèque Python pour générer des rapports seuls ne déclenche également aucune télémétrie. La télémétrie anonyme de l’UI est activée par défaut et peut être désactivée en configuration.
Evidently peut-il servir de seuil de qualité pour l’intégration continue ?
Oui. En ajoutant les indicateurs clés dans la Test Suite et en définissant des seuils, il est possible d’obtenir des résultats de réussite ou d’échec lors de mises à jour du modèle, des prompts ou des données.
Qu’est-ce qui a été ajouté à l’édition Enterprise pour les entreprises ?
La version professionnelle ajoute principalement la génération et l’évaluation de données sans code, des tableaux de bord sans code, des comparaisons côte à côte, des alertes, des tâches planifiées, de l’authentification, des droits de rôle, un backend extensible et un support dédié. Le prix doit être demandé au service des ventes.
Résumé
Il est évident que l’IA convient aux équipes qui souhaitent définir la qualité de l’IA par du code, transformer les évaluations hors ligne en tests de régression, et surveiller en continu les systèmes de LLM et d’apprentissage automatique dans leur propre environnement.
Le choix actuel doit se concentrer sur les solutions open source auto-hébergées ou les déploiements privés Enterprise, sans suivre plus les plans de forfaits cloud historiques. Lors de la mise en œuvre, il est nécessaire de concevoir en même temps l’efficacité des indicateurs, la calibration manuelle, la gouvernance des données et la sécurité des opérations.
Numéro d’enregistrement de sécurité publique du Guangxi : 45132202000164