Arize AI
Valeur ajoutée gratuite
Guide complet des outils d’IA Évaluation des modèles d’IA

Arize AI

Arize AI, outil intelligent spécialisé dans l’évaluation des modèles d’IA

Étiquettes :

Qu’est-ce qu’Arize AI ?

Arize AI est une plateforme d’observabilité, d’évaluation et d’amélioration continue destinée aux équipes d’ingénierie en IA, permettant de suivre les appels des grands modèles, d’analyser le comportement des agents, de détecter les schémas d’échec et de valider l’efficacité des modifications.

Les produits se divisent en le service géré Arize AX et Phoenix open source à priorité locale ; tous deux sont basés sur les normes OpenTelemetry et OpenInference.

Différences entre Arize AX et Phoenix

ProduitPositionnementDéploiementPublic cibleStatut open source
Arize AXPlateforme d’ingénierie d’IA géréeSaaS, les entreprises peuvent l’héberger elles-mêmesÉquipe de production et entreprises à grande échelleProduits commerciaux
Arize PhoenixOutil d’observation et d’évaluation prioritaire localEnvironnement local, conteneur ou personnaliséÉquipes de développement, de recherche et de prototypageElastic License 2.0

Fonctionnalités clés

Suivi des LLM et des Agents

  • Enregistrer les modèles, outils, rechercheurs et chaînes d’appels des agents
  • Voir entrée, sortie, délai, token et coût
  • Analyser le comportement par Trace, Span et Session
  • Soutien au suivi multimodal texte, images, voix et PDF
  • Afficher les chemins et la structure du graphe des trajectoires de l’agent
  • Intégrer des systèmes existants via OpenTelemetry

Évaluation en ligne et hors ligne

  • Évaluation en ligne de la production de Trace et Span
  • Évaluation en ligne des ensembles de données et des exécutions expérimentales
  • Évaluer la qualité à l’aide de LLM-as-a-Judge
  • Vérifier les règles déterministes à l’aide de l’évaluateur de code
  • Évaluer la pertinence, la précision et les hallucinations de RAG
  • Évaluation des sessions multiples et du parcours complet de l’agent
  • Soutien à l’annotation manuelle et aux files d’attente de feedback

Ensembles de données et expériences

L’équipe peut organiser les demandes réelles, les cas d’échec et les échantillons de bord dans un ensemble de données, puis effectuer des expériences reproductibles sur les prompts, le modèle ou la logique de l’agent.

  • Enregistrer les entrées de test et les résultats attendus
  • Comparer les scores d’évaluation des différents essais
  • Calcul de la précision, du taux de précision, du taux de rappel et de l’F1
  • Rejouer la production Trace vers Playground
  • Plusieurs ensembles de prompts côte à côte
  • Gestion des versions et optimisation des prompts

Surveillance de la production et Signal

Signal analyse en continu les données de production et détecte automatiquement les modes d’échec des agents, permettant à l’équipe d’identifier les problèmes à fort impact parmi une grande quantité de traces.

  • Clustering automatique et détection des modes de défaillance
  • Créer des surveillances en fonction de la qualité, du délai et du coût
  • Observer les tendances via le tableau de bord
  • Relier les exceptions à des sessions et appels spécifiques
  • La solution d’entreprise peut se connecter à un dépôt de code et générer des PR de correction.
  • Prend en charge les agents de débogage hébergés et la visibilité sur les groupes d’agents

Barrières de protection et évaluation de la sécurité

La plateforme peut suivre les limites d’entrée/sortie, détecter les tentatives d’évasion, les messages à faible pertinence et ceux non conformes à la stratégie, ainsi que enregistrer le processus d’interception ou de régénération.

Écosystème technique pris en charge

  • OpenTelemetry et OpenInference
  • OpenAI et Anthropic
  • LangChain et LangGraph
  • LlamaIndex et CrewAI
  • OpenAI Agents SDK
  • Bases de données vectorielles courantes et frameworks RAG
  • Python, TypeScript et flux de travail CLI

Quels scénarios d'utilisation conviennent

  • Qualité des sessions multiples avec les agents de service client de surveillance
  • Évaluer la pertinence de la recherche RAG et la justesse de la réponse
  • Échec de l’appel des outils d’analyse et comportement cyclique
  • Comparer les versions du modèle et des prompts
  • Suivi des tokens, des délais et des coûts d’appel
  • Créer un ensemble de tests de régression à partir d’échecs de production
  • Créer une file d’attente pour les annotations des évaluateurs humains
  • Utiliser Phoenix pour déboguer le prototype localement
  • Définir des seuils de qualité continus pour les systèmes d’IA d’entreprise

Avantages principaux

  • L’observation, l’évaluation, l’expérimentation et l’amélioration forment un cercle fermé.
  • Utiliser des normes de suivi ouvertes pour réduire les liens au framework
  • Soutien à une analyse unifiée pendant les phases de développement et de production
  • Des vues spécifiques pour les trajectoires des agents et les sessions multiples
  • La version gratuite offre un flux de travail de base complet.
  • Le nombre d’utilisateurs et d’évaluations n’est pas limité dans aucun des scénarios.
  • Phoenix peut fonctionner localement et contrôler les données.
  • Soutien aux options SaaS et self-hébergement d’entreprise

Restrictions d'utilisation et précautions

  • Free ne comprend que 25 000 Span par mois.
  • Pro ne comprend que 50 000 Span par mois.
  • Un agent complexe peut générer un grand nombre de Span par requête.
  • L’évaluation des LLM entraîne des frais supplémentaires de tokens de modèle.
  • Trace peut contenir des entrées utilisateur et des données commerciales sensibles.
  • Une période de conservation de 15 jours ou 30 jours peut ne pas être suffisante pour soutenir un audit à long terme.
  • L’autogestion, le SSO et les journaux d’audit font partie des capacités d’entreprise.
  • L’évaluateur lui-même peut également présenter des biais et des erreurs de jugement.
  • Phoenix utilise ELv2, ce n’est pas une licence libre sans restrictions.
  • Les équipes à fort débit doivent estimer à l’avance l’augmentation de la stockage et des Span.

Prix du forfait Arize AX

PlanPrixSpan/moisStockagePériode de conservationDéploiement
AX FreeGratuit25,0001GB15 joursSaaS
AX Pro50 dollars par mois50,00010GB30 joursSaaS
AX EnterpriseCotation sur mesuresur mesuresur mesuresur mesureSaaS ou auto-hébergé

Tous les forfaits offrent un nombre illimité d’utilisateurs, des fonctionnalités d’évaluation et d’essai, de la annotation manuelle ainsi que des files d’attente pour l’annotation ; les prix et les quotas peuvent être modifiés.

Comparaison des versions fonctionnelles

CapacitéFreeProEnterprise
Suivi OpenTelemetrySoutienSoutienSoutien
Problème de Signal/mois1025Sans limite
GDPRNon inclusSoutienSoutien
SOC 2 Type IINon inclusSoutienSoutien
Auto-hébergementNon pris en chargeNon pris en chargeSoutien
SSO d’entreprise et journaux d’auditNon pris en chargeNon pris en chargeSoutien
Évaluateur de code personnaliséNon pris en chargeNon pris en chargeSoutien
Agent de débogage hébergéNon pris en chargeNon pris en chargeSoutien
Mode de soutiencommunautéCourrielSupport exclusif

Points clés de l’estimation des coûts

  • Calculer le nombre moyen de spans générés par chaque demande utilisateur
  • Appel d’outils d’estimation, tentatives de réessai et diffusion des sous-agents
  • Distinguer les frais de stockage des traces des frais de tokens pour l’évaluation des modèles
  • Estimer l’augmentation de l’espace de stockage due à la charge multimodale
  • Vérifier la période pendant laquelle les données doivent être conservées
  • Évaluer si le nombre d’utilisateurs affecte les coûts opérationnels internes
  • Tester la limite du plan avec des échantillons de production réels

Introduction rapide à Arize AX

  1. Créez un compte gratuit et créez un nouveau Space.
  2. Sélectionnez la langue utilisée par l’application et le framework Agent.
  3. Installer les composants instrumentés correspondants d’OpenInference.
  4. Configurer l’endpoint Arize, l’ID Space et la clé API.
  5. Exécutez plusieurs requêtes de test et ouvrez la vue Trace.
  6. Vérifier que le modèle, la recherche, les outils et l’Agent Span sont complets.
  7. Ajouter des évaluateurs de retard, de coût et de qualité.
  8. Créer des tableaux de bord et un suivi des anomalies avant de le connecter à la production.

Tutoriel d’évaluation RAG

  1. Activer le suivi pour les étapes LLM, Retriever et Embedding.
  2. Exécuter un ensemble de requêtes représentatives.
  3. Vérifier que les extraits de recherche et la réponse finale se trouvent dans le Span correct.
  4. Ajouter un évaluateur de pertinence de recherche.
  5. Ajouter un évaluateur de justesse des réponses et d’illusions.
  6. Enregistrer les traces d’échec en échantillons de jeu de données.
  7. Modifier les paramètres de recherche, les prompts ou le modèle.
  8. Exécuter l’expérience et comparer les différents scores et coûts.

Tutoriel d’amélioration de l’agent de production

  1. Suivre le parcours complet de l’agent par session.
  2. Activation de Signal : détection d’un schéma d’échecs répétitifs.
  3. Vérifier aléatoirement les problèmes à fort impact et les annoter manuellement.
  4. Créer des évaluateurs pour le choix des outils, la réponse finale et la trajectoire.
  5. Ajouter les échecs typiques au jeu de données de régression.
  6. Rejouer dans Playground et modifier les prompts ou la logique.
  7. Mettre en œuvre des expériences de contrôle pour vérifier si les modifications améliorent les résultats.
  8. Après le lancement, surveillez pour voir si le même mode de défaillance réapparaît.

Confidentialité et sécurité

Une trace contient généralement des mots-clés d’instruction, les sorties du modèle, le texte recherché, les paramètres des outils et les retours des utilisateurs ; par conséquent, il est nécessaire de procéder à la classification des données et à leur masquage avant de les intégrer dans une plateforme d’observabilité.

  • Évitez d’enregistrer les mots de passe, les tokens et les identifiants complets
  • Masquer les informations personnelles et les secrets commerciaux
  • Définir les espaces et les permissions d’organisation par équipe
  • Sélectionnez la région de données États-Unis, Union européenne ou Canada en fonction des exigences régionales.
  • Évaluation des clients entreprises pour l’hébergement auto-géré, le SSO et les journaux d’audit
  • Stratégies claires de suppression, de conservation et de sauvegarde
  • Restreindre l’accès du modèle d’évaluation aux traces sensibles

Situation open source de Phoenix

Le code d’Arize Phoenix est publié sur GitHub, il permet le suivi, l’évaluation, les expérimentations et l’itération des prompts, et peut être exécuté localement ou sur des infrastructures propres.

ProjetÉtatExplication
Arize AXProduits commerciauxPlateforme de gestion et fonctionnalités d’entreprise
Arize PhoenixLe code source est publicUtilisation de la Elastic License 2.0
OpenInferenceNormes et outils ouvertsConvention sémantique unifiée pour l’IA générative
Phoenix EvalsBibliothèque d’évaluation open sourceFournir du code et un flux de travail d’évaluation des LLM

ELv2 autorise une utilisation et des modifications étendues, mais comporte des restrictions pour des utilisations telles que les services hébergés ; il convient de lire la licence avant toute redistribution à des fins commerciales.

Informations de base

ProjetContenu
Nom de l’outilArize AI
Produit phareArize AX et Arize Phoenix
Type d’outilPlateforme d’observabilité, d’évaluation de l’IA et d’amélioration des agents
Utilisateurs principauxIngénieurs en IA, ingénieurs en apprentissage automatique et équipes de plateforme
StandardOpenTelemetry et OpenInference
Plan gratuit25 000 spans/mois, 1 Go de stockage, conservation de 15 jours
Prix minimum payantAX Pro, 50 dollars par mois
Faut-il s’inscrire ?AX est nécessaire, l’utilisation locale de Phoenix n’est pas dépendante d’un compte AX.
Est-ce que le self-hosting est pris en charge ?Soutien Phoenix, soutien pour les solutions AX entreprise
Est-ce open sourceAX n’est pas open source, Phoenix utilise ELv2

Indice de recommandation

L’indice de recommandation global est de 4,8 sur 5. Arize AI convient aux équipes souhaitant relier l’observabilité de la production, l’évaluation hors ligne et l’amélioration des agents en un cycle fermé, tandis que Phoenix offre également une solution mature pour les développeurs qui privilégient le déploiement local.

Questions fréquentes

Quels problèmes Arize AI résout-il principalement ?

Il est utilisé pour suivre les applications d’IA, évaluer la qualité des résultats, détecter les défaillances de production et valider l’efficacité des améliorations.

Quelle est la différence entre l’Arize AX et le Phoenix ?

AX est une plateforme commerciale hébergée, tandis que Phoenix est un outil open source d’observation et d’évaluation pouvant être déployé localement.

Arize AX est-il gratuit ?

Le forfait Free est gratuit et comprend 25 000 Span par mois, 1 GB de stockage et une conservation sur 15 jours.

Combien Pro ?

AX Pro coûte actuellement 50 dollars par mois et inclut 50 000 Span, 10 GB de stockage et une conservation sur 30 jours.

Y a-t-il une limite au nombre d’évaluations ?

Le tableau officiel des scénarios indique que l’évaluation n’est pas limitée, mais l’utilisation de modèles externes pour l’évaluation entraîne néanmoins des frais de tokens de modèle.

Prend-il en charge la surveillance par agent ?

Soutien : permet de visualiser le parcours de l’agent, les appels d’outils, les sessions, et d’identifier les schémas d’échec à l’aide de Signal.

Peut-on l’héberger soi-même ?

Phoenix peut être déployé de manière autonome, tandis qu’Arize AX en mode self-hosting fait partie de la solution Enterprise.

Quelle est la licence Phoenix ?

Phoenix utilise la Elastic License 2.0, et non des licences plus permissives telles que MIT ou Apache.

Est-il possible de surveiller les modèles d’apprentissage automatique traditionnels ?

Oui, Arize offre également des capacités de classification, de régression, de vision par ordinateur et de surveillance des modèles traditionnels.

©️Droit d’auteur : Sauf indication contraire, tous les articles de ce site sont protégés par le droit d’auteur.Partage d’outils d’IATous les droits d’auteur sont réservés. Sans autorisation, aucune personne, média, site web ou groupe ne peut reproduire, copier ou diffuser de quelque manière que ce soit le contenu de ce site, ni créer de mirror sur des serveurs qui ne lui appartiennent pas. Dans le cas contraire, notre site se réserve le droit de poursuivre en justice les responsables conformément à la loi.

Outils similaires à Arize AI