Arize AI
Arize AI, outil intelligent spécialisé dans l’évaluation des modèles d’IA
Étiquettes :Évaluation des modèles d’IAQu’est-ce qu’Arize AI ?
Arize AI est une plateforme d’observabilité, d’évaluation et d’amélioration continue destinée aux équipes d’ingénierie en IA, permettant de suivre les appels des grands modèles, d’analyser le comportement des agents, de détecter les schémas d’échec et de valider l’efficacité des modifications.
Les produits se divisent en le service géré Arize AX et Phoenix open source à priorité locale ; tous deux sont basés sur les normes OpenTelemetry et OpenInference.
Différences entre Arize AX et Phoenix
| Produit | Positionnement | Déploiement | Public cible | Statut open source |
|---|---|---|---|---|
| Arize AX | Plateforme d’ingénierie d’IA gérée | SaaS, les entreprises peuvent l’héberger elles-mêmes | Équipe de production et entreprises à grande échelle | Produits commerciaux |
| Arize Phoenix | Outil d’observation et d’évaluation prioritaire local | Environnement local, conteneur ou personnalisé | Équipes de développement, de recherche et de prototypage | Elastic License 2.0 |
Fonctionnalités clés
Suivi des LLM et des Agents
- Enregistrer les modèles, outils, rechercheurs et chaînes d’appels des agents
- Voir entrée, sortie, délai, token et coût
- Analyser le comportement par Trace, Span et Session
- Soutien au suivi multimodal texte, images, voix et PDF
- Afficher les chemins et la structure du graphe des trajectoires de l’agent
- Intégrer des systèmes existants via OpenTelemetry
Évaluation en ligne et hors ligne
- Évaluation en ligne de la production de Trace et Span
- Évaluation en ligne des ensembles de données et des exécutions expérimentales
- Évaluer la qualité à l’aide de LLM-as-a-Judge
- Vérifier les règles déterministes à l’aide de l’évaluateur de code
- Évaluer la pertinence, la précision et les hallucinations de RAG
- Évaluation des sessions multiples et du parcours complet de l’agent
- Soutien à l’annotation manuelle et aux files d’attente de feedback
Ensembles de données et expériences
L’équipe peut organiser les demandes réelles, les cas d’échec et les échantillons de bord dans un ensemble de données, puis effectuer des expériences reproductibles sur les prompts, le modèle ou la logique de l’agent.
- Enregistrer les entrées de test et les résultats attendus
- Comparer les scores d’évaluation des différents essais
- Calcul de la précision, du taux de précision, du taux de rappel et de l’F1
- Rejouer la production Trace vers Playground
- Plusieurs ensembles de prompts côte à côte
- Gestion des versions et optimisation des prompts
Surveillance de la production et Signal
Signal analyse en continu les données de production et détecte automatiquement les modes d’échec des agents, permettant à l’équipe d’identifier les problèmes à fort impact parmi une grande quantité de traces.
- Clustering automatique et détection des modes de défaillance
- Créer des surveillances en fonction de la qualité, du délai et du coût
- Observer les tendances via le tableau de bord
- Relier les exceptions à des sessions et appels spécifiques
- La solution d’entreprise peut se connecter à un dépôt de code et générer des PR de correction.
- Prend en charge les agents de débogage hébergés et la visibilité sur les groupes d’agents
Barrières de protection et évaluation de la sécurité
La plateforme peut suivre les limites d’entrée/sortie, détecter les tentatives d’évasion, les messages à faible pertinence et ceux non conformes à la stratégie, ainsi que enregistrer le processus d’interception ou de régénération.
Écosystème technique pris en charge
- OpenTelemetry et OpenInference
- OpenAI et Anthropic
- LangChain et LangGraph
- LlamaIndex et CrewAI
- OpenAI Agents SDK
- Bases de données vectorielles courantes et frameworks RAG
- Python, TypeScript et flux de travail CLI
Quels scénarios d'utilisation conviennent
- Qualité des sessions multiples avec les agents de service client de surveillance
- Évaluer la pertinence de la recherche RAG et la justesse de la réponse
- Échec de l’appel des outils d’analyse et comportement cyclique
- Comparer les versions du modèle et des prompts
- Suivi des tokens, des délais et des coûts d’appel
- Créer un ensemble de tests de régression à partir d’échecs de production
- Créer une file d’attente pour les annotations des évaluateurs humains
- Utiliser Phoenix pour déboguer le prototype localement
- Définir des seuils de qualité continus pour les systèmes d’IA d’entreprise
Avantages principaux
- L’observation, l’évaluation, l’expérimentation et l’amélioration forment un cercle fermé.
- Utiliser des normes de suivi ouvertes pour réduire les liens au framework
- Soutien à une analyse unifiée pendant les phases de développement et de production
- Des vues spécifiques pour les trajectoires des agents et les sessions multiples
- La version gratuite offre un flux de travail de base complet.
- Le nombre d’utilisateurs et d’évaluations n’est pas limité dans aucun des scénarios.
- Phoenix peut fonctionner localement et contrôler les données.
- Soutien aux options SaaS et self-hébergement d’entreprise
Restrictions d'utilisation et précautions
- Free ne comprend que 25 000 Span par mois.
- Pro ne comprend que 50 000 Span par mois.
- Un agent complexe peut générer un grand nombre de Span par requête.
- L’évaluation des LLM entraîne des frais supplémentaires de tokens de modèle.
- Trace peut contenir des entrées utilisateur et des données commerciales sensibles.
- Une période de conservation de 15 jours ou 30 jours peut ne pas être suffisante pour soutenir un audit à long terme.
- L’autogestion, le SSO et les journaux d’audit font partie des capacités d’entreprise.
- L’évaluateur lui-même peut également présenter des biais et des erreurs de jugement.
- Phoenix utilise ELv2, ce n’est pas une licence libre sans restrictions.
- Les équipes à fort débit doivent estimer à l’avance l’augmentation de la stockage et des Span.
Prix du forfait Arize AX
| Plan | Prix | Span/mois | Stockage | Période de conservation | Déploiement |
|---|---|---|---|---|---|
| AX Free | Gratuit | 25,000 | 1GB | 15 jours | SaaS |
| AX Pro | 50 dollars par mois | 50,000 | 10GB | 30 jours | SaaS |
| AX Enterprise | Cotation sur mesure | sur mesure | sur mesure | sur mesure | SaaS ou auto-hébergé |
Tous les forfaits offrent un nombre illimité d’utilisateurs, des fonctionnalités d’évaluation et d’essai, de la annotation manuelle ainsi que des files d’attente pour l’annotation ; les prix et les quotas peuvent être modifiés.
Comparaison des versions fonctionnelles
| Capacité | Free | Pro | Enterprise |
|---|---|---|---|
| Suivi OpenTelemetry | Soutien | Soutien | Soutien |
| Problème de Signal/mois | 10 | 25 | Sans limite |
| GDPR | Non inclus | Soutien | Soutien |
| SOC 2 Type II | Non inclus | Soutien | Soutien |
| Auto-hébergement | Non pris en charge | Non pris en charge | Soutien |
| SSO d’entreprise et journaux d’audit | Non pris en charge | Non pris en charge | Soutien |
| Évaluateur de code personnalisé | Non pris en charge | Non pris en charge | Soutien |
| Agent de débogage hébergé | Non pris en charge | Non pris en charge | Soutien |
| Mode de soutien | communauté | Courriel | Support exclusif |
Points clés de l’estimation des coûts
- Calculer le nombre moyen de spans générés par chaque demande utilisateur
- Appel d’outils d’estimation, tentatives de réessai et diffusion des sous-agents
- Distinguer les frais de stockage des traces des frais de tokens pour l’évaluation des modèles
- Estimer l’augmentation de l’espace de stockage due à la charge multimodale
- Vérifier la période pendant laquelle les données doivent être conservées
- Évaluer si le nombre d’utilisateurs affecte les coûts opérationnels internes
- Tester la limite du plan avec des échantillons de production réels
Introduction rapide à Arize AX
- Créez un compte gratuit et créez un nouveau Space.
- Sélectionnez la langue utilisée par l’application et le framework Agent.
- Installer les composants instrumentés correspondants d’OpenInference.
- Configurer l’endpoint Arize, l’ID Space et la clé API.
- Exécutez plusieurs requêtes de test et ouvrez la vue Trace.
- Vérifier que le modèle, la recherche, les outils et l’Agent Span sont complets.
- Ajouter des évaluateurs de retard, de coût et de qualité.
- Créer des tableaux de bord et un suivi des anomalies avant de le connecter à la production.
Tutoriel d’évaluation RAG
- Activer le suivi pour les étapes LLM, Retriever et Embedding.
- Exécuter un ensemble de requêtes représentatives.
- Vérifier que les extraits de recherche et la réponse finale se trouvent dans le Span correct.
- Ajouter un évaluateur de pertinence de recherche.
- Ajouter un évaluateur de justesse des réponses et d’illusions.
- Enregistrer les traces d’échec en échantillons de jeu de données.
- Modifier les paramètres de recherche, les prompts ou le modèle.
- Exécuter l’expérience et comparer les différents scores et coûts.
Tutoriel d’amélioration de l’agent de production
- Suivre le parcours complet de l’agent par session.
- Activation de Signal : détection d’un schéma d’échecs répétitifs.
- Vérifier aléatoirement les problèmes à fort impact et les annoter manuellement.
- Créer des évaluateurs pour le choix des outils, la réponse finale et la trajectoire.
- Ajouter les échecs typiques au jeu de données de régression.
- Rejouer dans Playground et modifier les prompts ou la logique.
- Mettre en œuvre des expériences de contrôle pour vérifier si les modifications améliorent les résultats.
- Après le lancement, surveillez pour voir si le même mode de défaillance réapparaît.
Confidentialité et sécurité
Une trace contient généralement des mots-clés d’instruction, les sorties du modèle, le texte recherché, les paramètres des outils et les retours des utilisateurs ; par conséquent, il est nécessaire de procéder à la classification des données et à leur masquage avant de les intégrer dans une plateforme d’observabilité.
- Évitez d’enregistrer les mots de passe, les tokens et les identifiants complets
- Masquer les informations personnelles et les secrets commerciaux
- Définir les espaces et les permissions d’organisation par équipe
- Sélectionnez la région de données États-Unis, Union européenne ou Canada en fonction des exigences régionales.
- Évaluation des clients entreprises pour l’hébergement auto-géré, le SSO et les journaux d’audit
- Stratégies claires de suppression, de conservation et de sauvegarde
- Restreindre l’accès du modèle d’évaluation aux traces sensibles
Situation open source de Phoenix
Le code d’Arize Phoenix est publié sur GitHub, il permet le suivi, l’évaluation, les expérimentations et l’itération des prompts, et peut être exécuté localement ou sur des infrastructures propres.
| Projet | État | Explication |
|---|---|---|
| Arize AX | Produits commerciaux | Plateforme de gestion et fonctionnalités d’entreprise |
| Arize Phoenix | Le code source est public | Utilisation de la Elastic License 2.0 |
| OpenInference | Normes et outils ouverts | Convention sémantique unifiée pour l’IA générative |
| Phoenix Evals | Bibliothèque d’évaluation open source | Fournir du code et un flux de travail d’évaluation des LLM |
ELv2 autorise une utilisation et des modifications étendues, mais comporte des restrictions pour des utilisations telles que les services hébergés ; il convient de lire la licence avant toute redistribution à des fins commerciales.
Informations de base
| Projet | Contenu |
|---|---|
| Nom de l’outil | Arize AI |
| Produit phare | Arize AX et Arize Phoenix |
| Type d’outil | Plateforme d’observabilité, d’évaluation de l’IA et d’amélioration des agents |
| Utilisateurs principaux | Ingénieurs en IA, ingénieurs en apprentissage automatique et équipes de plateforme |
| Standard | OpenTelemetry et OpenInference |
| Plan gratuit | 25 000 spans/mois, 1 Go de stockage, conservation de 15 jours |
| Prix minimum payant | AX Pro, 50 dollars par mois |
| Faut-il s’inscrire ? | AX est nécessaire, l’utilisation locale de Phoenix n’est pas dépendante d’un compte AX. |
| Est-ce que le self-hosting est pris en charge ? | Soutien Phoenix, soutien pour les solutions AX entreprise |
| Est-ce open source | AX n’est pas open source, Phoenix utilise ELv2 |
Indice de recommandation
L’indice de recommandation global est de 4,8 sur 5. Arize AI convient aux équipes souhaitant relier l’observabilité de la production, l’évaluation hors ligne et l’amélioration des agents en un cycle fermé, tandis que Phoenix offre également une solution mature pour les développeurs qui privilégient le déploiement local.
Questions fréquentes
Quels problèmes Arize AI résout-il principalement ?
Il est utilisé pour suivre les applications d’IA, évaluer la qualité des résultats, détecter les défaillances de production et valider l’efficacité des améliorations.
Quelle est la différence entre l’Arize AX et le Phoenix ?
AX est une plateforme commerciale hébergée, tandis que Phoenix est un outil open source d’observation et d’évaluation pouvant être déployé localement.
Arize AX est-il gratuit ?
Le forfait Free est gratuit et comprend 25 000 Span par mois, 1 GB de stockage et une conservation sur 15 jours.
Combien Pro ?
AX Pro coûte actuellement 50 dollars par mois et inclut 50 000 Span, 10 GB de stockage et une conservation sur 30 jours.
Y a-t-il une limite au nombre d’évaluations ?
Le tableau officiel des scénarios indique que l’évaluation n’est pas limitée, mais l’utilisation de modèles externes pour l’évaluation entraîne néanmoins des frais de tokens de modèle.
Prend-il en charge la surveillance par agent ?
Soutien : permet de visualiser le parcours de l’agent, les appels d’outils, les sessions, et d’identifier les schémas d’échec à l’aide de Signal.
Peut-on l’héberger soi-même ?
Phoenix peut être déployé de manière autonome, tandis qu’Arize AX en mode self-hosting fait partie de la solution Enterprise.
Quelle est la licence Phoenix ?
Phoenix utilise la Elastic License 2.0, et non des licences plus permissives telles que MIT ou Apache.
Est-il possible de surveiller les modèles d’apprentissage automatique traditionnels ?
Oui, Arize offre également des capacités de classification, de régression, de vision par ordinateur et de surveillance des modèles traditionnels.
Numéro d’enregistrement de sécurité publique du Guangxi : 45132202000164