Maxim AI
Maxim AI, outil intelligent spécialisé dans l’évaluation des modèles d’IA
Étiquettes :Évaluation des modèles d’IAQu’est-ce que Maxim AI ?
Maxim AI est une plateforme d’évaluation et d’observabilité du bout en bout fournie par H3 Labs Inc. aux équipes chargées des produits, de l’ingénierie et de la qualité en matière d’IA. Elle relie les expérimentations avec des prompts, les ensembles de données, les simulations d’agents, les évaluations automatisées et manuelles, le suivi en production, le contrôle de qualité et les alertes au sein d’un même processus itératif.
Maxim n’est pas chargé d’entraîner des modèles de base pour les utilisateurs, ni de tenir un classement des modèles. Il sert à comparer des modèles, des prompts, des recherches, des outils et des versions d’agents, afin d’identifier les voies de dérive et d’échec, et à surveiller en continu, une fois en ligne, la qualité, le coût, les délais et les performances en matière de sécurité des requêtes réelles.
Fonction principale
- Prompt IDE : Permet de comparer différents prompts, modèles, paramètres, outils et contextes sans avoir à modifier le code métier. L’équipe peut enregistrer les résultats des expériences pour observer la qualité, le coût et les délais, avant de choisir la version à déployer.
- Version et déploiement des prompts : extraire les prompts du répertoire de code, conserver l’historique des modifications, et publier différentes versions selon des règles prédéfinies. Les membres du produit et de l’équipe d’ingénierie peuvent collaborer dans la même zone de travail, ce qui réduit les écarts de version dus à la copie-collage.
- Chaînes de suggestions et flux à faible code : relier plusieurs étapes de génération, de recherche et d’outils en flux testables, idéaux pour valider la logique des agents avant une intégration officielle dans le code. Les permissions de production complexes, les tentatives de réessai et les transactions nécessitent encore une implémentation en ingénierie.
- Ensemble de données multimodales : gestion des entrées de test telles que du texte, des images, etc., ainsi que des résultats attendus, avec un mode d’édition similaire à celui d’un tableau. Les ensembles de données peuvent être compilés à partir des journaux de production ou importer des échantillons de tests existants.
- Magasin d’évaluateurs : propose des indicateurs prédéfinis et permet aux équipes d’écrire des évaluateurs personnalisés pour mesurer la justesse, la pertinence, la sécurité, le format, la recherche ou les normes commerciales. Les scores des modèles peuvent eux-mêmes présenter des biais ; des références manuelles doivent être intégrées dans les scénarios clés.
- Simulation d’agents : Génération de multiples interactions avec différents profils d’utilisateurs, objectifs et scénarios, afin de tester en masse la manière dont les agents utilisent des outils, effectuent des recherches et gèrent leur état. La simulation convient pour élargir la portée, mais ne peut pas représenter pleinement la répartition réelle des utilisateurs.
- Évaluation hors ligne : Exécuter les versions candidates sur un ensemble de données fixe avant la publication, et comparer ligne par ligne les entrées, les appels d’outils, les sorties, les indicateurs et les raisons d’évaluation. Adapté aux tests de régression, au transfert de modèles et à la mise à jour des prompts.
- Évaluation en ligne : attribution automatique de notes aux journaux de production selon des règles de filtrage et d’échantillonnage, pouvant être effectuée au niveau de la session, d’une seule itération Trace ou d’un nœud Span spécifique. L’équipe peut récupérer les échantillons à faible score pour en faire un nouveau jeu de données, créant ainsi un cycle d’amélioration continue.
- Suivi distribué : représentation des workflows multi-acteurs à l’aide de Session, Trace, Span, Generation, Retrieval et Tool Call, avec une visualisation des entrées/sorties, du temps de traitement et des erreurs de chaque nœud.
- Déploiement de production et alertes : surveillance de la qualité, des jetons, des coûts, des délais, des retours des utilisateurs et des tendances d’incidents, avec émission d’alertes en cas de dégradation des indicateurs ou de déclenchement des règles de sécurité. Les alertes doivent s’appuyer à la fois sur des seuils métier et sur des processus de rotation, et ne pas se fonder uniquement sur des règles par défaut.
- Évaluation manuelle : Faire en sorte que des experts du domaine annotent, examinent et comparent les échantillons, puis intégrer les résultats dans le rapport d’évaluation. Enterprise peut également discuter des services d’évaluation humaine gérés par Maxim.
- Rapports et tableaux de bord : regroupement des indicateurs d’expérimentation et en ligne, comparaison entre différentes versions, et partage avec les équipes produits, techniques et de gestion. Business prend en charge des tableaux de bord personnalisés, tandis qu’Enterprise offre une auditabilité et des niveaux de service évolutifs.
Flux de travail typique
- Définir les objectifs commerciaux de l’agent, les échecs inacceptables et les segments d’utilisateurs, puis transformer la fiabilité, la sécurité, le coût et les délais en indicateurs mesurables.
- Collecter des questions réelles, des cas limites et des pannes historiques autorisées, afin de créer des ensembles de données d’évaluation en dehors de l’entraînement ainsi que des réponses de référence manuelles.
- Dans le Prompt IDE, comparez les modèles, les prompts, la recherche et les paramètres des outils : vérifiez d’abord un petit échantillon, puis exécutez une évaluation complète hors ligne.
- Pour les règles de combinaison d’indicateurs clés, le code, l’évaluation des modèles et la révision manuelle, afin d’éviter que un seul évaluateur automatique ne décide de la mise en ligne.
- Intégrer l’évaluation dans CI/CD, empêcher la publication lorsque la version candidate est en deçà du seuil, et conserver les versions, les ensembles de données et les historiques de notation.
- Intégrer le journalage et le suivi via un SDK pour ajouter des noms, des étiquettes et un contexte utilisateur cohérents aux sessions, à la génération, à la recherche et aux appels d’outils.
- Une fois en ligne, configurez l’évaluation en ligne, l’échantillonnage, le tableau de bord et les alertes pour suivre la qualité, les coûts, les délais, les erreurs et les retours des utilisateurs.
- Organiser les scores réels bas et les traces anormales en nouveaux échantillons de régression, effectuer à nouveau des tests hors ligne après correction et comparer les tendances.
Niveau d’évaluation
| niveau | Objet d’évaluation | Indicateurs adaptés | Valeur d’usage |
|---|---|---|---|
| Session | Session complète à plusieurs tours | Tâche accomplie, cohérence, satisfaction de l’utilisateur | Évaluer l’expérience bout en bout |
| Trace | Le chemin complet d’une demande utilisateur | Exactitude, sécurité, coût et retard total | Comparaison de la performance globale sur une seule manche |
| Span ou Nœud | Étapes concrètes telles que la recherche, la génération, les outils, etc. | Rappel, format, taux de réussite des outils et temps d’exécution local | Nœud de localisation échoué |
| Dataset Run | Versions candidates sur un ensemble d’échantillons fixe | Régression, moyenne, différences entre groupes | Sélection de la version avant le lancement |
| Human Review | Échantillonnage et annotation par des experts | Exactitude des opérations, ton et risques complexes | Évaluateur de calibration automatique |
Prix et forfaits
| Forfait ou version | Prix | Période de facturation | Droits ou crédit principal | Adéquat pour les utilisateurs |
|---|---|---|---|---|
| Developer | Gratuit | Gratuit à long terme | Jusqu’à 3 postes, 1 espace de travail, 10 000 journaux par mois, conservation sur 3 jours, support par e-mail ; nombre limité de jeux de données et d’entrées | Développeurs indépendants et petite validation |
| Professional | 29 dollars par siège | Chaque mois | Pas de limite de postes, 3 zones de travail, 100 000 journaux par mois, conservation sur 7 jours, exécution en simulation, évaluation en ligne et support par e-mail | Équipe collaborative en pleine croissance |
| Business | 49 dollars par siège | Chaque mois | Pas de limite de zone de travail, 500 000 journaux par mois, conservation sur 30 jours, RBAC, gestion des PII, exécution planifiée, tableaux de bord personnalisés et prise en charge de Slack privé | Équipes d’entreprise nécessitant une gouvernance et plus de journaux |
| Enterprise | Cotation sur mesure | Contrat de travail | SSO, déploiement VPC, journaux personnalisés et conservation, journaux d’audit, SLA, audits de sécurité, isolation des données, BAA, conformité et succès client dédié | Organisations à grande échelle ou réglementées |
Professional et Business offrent actuellement une période d’essai gratuite de 14 jours. Le tableau de comparaison public indique également que les frais supplémentaires pour les journaux de logs pour Professional et Business s’élèvent à 1 dollar par 10 000 entrées, tandis que Developer ne permet pas d’excéder cette limite ; les taxes spécifiques, les remises annuelles et les prix selon la consommation doivent être consultés sur la page de facturation.
Vérifier avant achat
- Vérifier si l’unité de statistique du journal est une requête, un Trace ou d’autres événements, et estimer le nombre d’enregistrements générés par les appels multi-agents.
- La durée de conservation des données varie considérablement, allant de 3 à 30 jours ; des stratégies de conservation distinctes doivent être conçues pour le débogage, l’audit et les échantillons de régression.
- Les frais de siège et les frais de dépassement du journal coexistent ; l’expansion de l’équipe ainsi que l’augmentation du trafic peuvent entraîner une hausse des coûts.
- Les conditions publiques ne fournissent pas de règles claires pour les remboursements automatiques ; il convient de vérifier les modalités d’annulation, la date d’effet et le traitement des périodes non utilisées avant de signer ou de s’abonner.
À qui s’adresse-t-il
- Il est nécessaire de créer des équipes produits et d’ingénierie pour des tests de régression d’agents intelligents IA reproductibles.
- En même temps, comparaison entre les développeurs d’applications LLM utilisant plusieurs modèles, RAG, appels d’outils et versions de prompts.
- Une équipe d’exploitation et de plateforme doit suivre, une fois le service en ligne, les itinéraires des multiples agents, ainsi que la qualité, le coût et les délais.
- Les entreprises ayant besoin de RBAC, de gestion des PII, d’audit, de VPC, de SSO ou de soutien en matière de conformité.
- Les normes sectorielles sont difficiles à automatiser entièrement, ce qui nécessite des équipes d’assistance médicale, financière, clientèle ou juridique requérant une évaluation manuelle par des experts.
Avantage
- Couvrant les expériences avant le lancement et les observations après le lancement, les évaluations en mode hors ligne et en ligne peuvent partager des données et des indicateurs.
- Il offre à la fois une interface sans code et un SDK multilingue, permettant aux gestionnaires de produits et aux ingénieurs de collaborer dans le même processus.
- La granularité du suivi s’étend aux nœuds de recherche, d’outils et de génération, ce qui facilite l’identification des pannes spécifiques des agents intelligents complexes.
- Prend en charge une combinaison d’évaluations prédéfinies, personnalisées, automatiques et manuelles, afin d’éviter de dépendre d’un seul modèle d’évaluation.
- Les entreprises peuvent choisir une implémentation VPC et une isolation des données, ce qui convient aux équipes ayant des exigences en matière de limites de données.
Limites et contraintes des capacités
- Les scores d’évaluation ne correspondent pas aux résultats réels de l’activité ; un ensemble de données insuffisant ou des biais dans l’évaluateur peuvent engendrer une confiance trompeuse.
- Comme arbitre, le modèle peut préférer un style particulier ou sa propre famille de modèles, et doit donc être calibré par des annotations manuelles.
- Le suivi de la production peut inclure des mots-clés, du contenu utilisateur, des extraits de recherche et des paramètres d’outil ; une intégration inappropriée peut augmenter l’exposition de données sensibles.
- Les forfaits gratuits et à bas prix ont une durée de conservation plus courte, ce qui ne convient pas à ceux qui ont besoin de la plateforme pour conserver des preuves d’audit à long terme.
- Le volume des journaux augmente avec le nombre d’agents, de tentatives de réessai et de nœuds ; l’estimation des coûts ne peut se baser uniquement sur le nombre de requêtes des utilisateurs finaux.
- La plateforme ne peut pas remplacer les tests de sécurité, l’équipe rouge, l’approbation métier et la réponse aux incidents ; elle fait simplement partie de l’infrastructure de gouvernance de la qualité.
SDK et intégration
Maxim propose des SDK pour Python, JavaScript ou TypeScript, Java et Go, qui permettent d’enregistrer les sessions à partir du code de l’application, de tracer, de générer, de rechercher et d’appeler des outils, ainsi que de déclencher des évaluations. La plateforme peut également collaborer avec OpenAI, Claude, Gemini, LangChain, LangGraph, CrewAI et d’autres modèles ou frameworks.
- Créez des clés API et un entrepôt de journaux dans la zone de travail, en séparant les environnements pour le développement, les tests et la production.
- Installez le SDK correspondant à la langue, stockez la clé dans la gestion des secrets du serveur, et interdisez son envoi dans le répertoire de dépôt.
- Initialiser le Logger, utiliser des identifiants stables pour la Session et le Trace, et ajouter des noms et des étiquettes aux nœuds clés.
- Enregistrer les entrées, les sorties, le temps de traitement, les tokens, les coûts et les erreurs autour de la génération, de la recherche et des appels d’outils.
- Vérifiez d’abord le masquage et l’échantillonnage dans un environnement de test, puis ouvrez progressivement le trafic en production afin d’éviter l’enregistrement accidentel de champs sensibles.
- Configurer l’évaluation en ligne et les alertes, afin d’envoyer les échantillons à faible score dans le jeu de données ou dans la file d’examen manuel.
Bifrost : passerelle d’IA open source
Bifrost est un gateway AI open source publié indépendamment par l’équipe de Maxim, sous licence Apache 2.0. Il permet de se connecter de manière unifiée à plusieurs fournisseurs de modèles et gère le routage, le charge balancing, le fallback, la limitation du débit, les gardiennes, les journaux ainsi que l’observation des coûts. Il peut être combiné avec la plateforme Maxim, mais le fait que Bifrost soit open source ne signifie pas que la plateforme Maxim SaaS elle-même le soit.
- Il peut être exécuté localement via un conteneur ou la ligne de commande, et se connecter à plusieurs fournisseurs grâce à une interface unifiée compatible avec le format de requête d’OpenAI.
- Prend en charge le balancement de charge adaptatif, les clusters, les plugins, le routage des modèles, MCP ainsi qu’une interface de surveillance ; ses fonctionnalités sont constamment mises à jour avec les nouvelles versions.
- La configuration par défaut nécessite des renforts de sécurité ; si la clé de chiffrement est omise, certains données locales pourraient être stockées en clair, et l’environnement de production ne doit pas reprendre les paramètres de démonstration.
- Les frais de mise en appel des modèles restent à la charge de chaque fournisseur ; le gateway open source ne comprend pas de quota de modèles.
Statut open source
| Composant | État d’ouverture | Licence ou instructions |
|---|---|---|
| Plateforme cloud Maxim | Services spécialisés | Pas de licence de produit open source |
| Bifrost | Open source | Apache 2.0 |
| Python SDK | Entrepôt public | L’entrepôt actuel est marqué Apache 2.0 |
| JavaScript, Go, Java SDK | Entrepôt public | Il convient de vérifier séparément les licences actuelles dans chaque entrepôt. |
| Code du site de documents | Entrepôt public | MIT |
| Livres de cuisine et exemples | Entrepôt public | Le fait que l’exemple soit ouvert ne signifie pas que le code source de la plateforme est ouvert. |
Confidentialité, sécurité et données
- La plateforme peut gérer les comptes, les connexions Google ou GitHub, les coordonnées de contact, les données d’utilisation, ainsi que les prompts, fichiers, entrées, sorties et journaux d’observation soumis par les clients.
- Les conditions stipulent que les données des clients et les résultats générés appartiennent au client ou à son concédant, et que Maxim obtient une licence limitée nécessaire pour fournir, exploiter et assurer le support des services.
- Les conditions stipulent que les données du client ou les résultats obtenus ne seront pas utilisés pour entraîner, affiner ou améliorer des modèles, ni pour développer des fonctionnalités destinées à d’autres clients, sans l’accord écrit préalable du client.
- La politique de confidentialité décrit le chiffrement des données sensibles, l’accès aux bases de données à double facteur, les audits de sécurité périodiques, la minimisation des données, le contrôle d’accès et les mesures de notification en cas de fuite.
- L’affirmation du produit indique qu’il est conforme à SOC 2 Type II, ISO 27001, HIPAA et GDPR ; pour les achats soumis à réglementation, il convient néanmoins de demander la portée des certifications actuelles, le DPA, le BAA ainsi que la liste des sous-traitants.
- Enterprise offre un déploiement au sein d’une VPC, une isolation des données, des politiques de conservation personnalisables et des contrôles de sécurité, idéal pour les organisations qui ne souhaitent pas que les journaux quittent leur environnement propre.
- La plateforme peut traiter du contenu en vue de la sécurité et de la détection des violations ; la politique de confidentialité mentionne également que le contenu illégal pourrait être séparé de l’identité de l’utilisateur afin d’être utilisé dans les systèmes de confiance et de sécurité.
- Avant la connexion, il convient d’identifier, de masquer et de minimiser les PII dans les prompts, les entrées utilisateur, les documents recherchés, les paramètres des outils et les sorties du modèle.
Conditions et précautions d’achat
- En haut de la page des conditions publiques, l’ancienne description des cours en ligne de 2023 reste inchangée, mais les conditions relatives aux données des clients sur cette même page ont été mises à jour pour la plateforme d’IA actuelle, ce qui entraîne des incohérences dues au passé.
- Les clients entreprises doivent demander une commande valide, un accord de service principal et un accord de traitement des données qui correspondent explicitement à l’évaluation actuelle, aux observations, au SDK et à l’intégration Bifrost.
- Définir dans le contrat la priorité des données et de la propriété des résultats, de la désactivation de l’entraînement du modèle, de la suppression, de l’exportation, du conservation, de la suspension du service et des preuves d’audit.
- Ne pensez pas que les termes SOC, ISO, HIPAA ou GDPR signifient automatiquement que votre application est conforme ; le client reste responsable de l’usage, de la configuration et de l’information des utilisateurs.
Résumé
Maxim AI est conçu pour passer d’un contrôle qualité des agents intelligents basé sur des inspections manuelles temporaires à un processus d’ingénierie continu comprenant des expérimentations, des simulations, des évaluations hors ligne, du CI, un suivi de la production, des évaluations en ligne et des ensembles de données de régression. Lors du choix du forfait, il convient de prendre en compte à la fois le nombre d’utilisateurs, le volume des journaux et la durée de conservation, tout en faisant une distinction stricte entre la plateforme propriétaire Maxim, le SDK public et le gateway open source Bifrost sous licence Apache 2.0.
Numéro d’enregistrement de sécurité publique du Guangxi : 45132202000164