OpenCompass
Valeur ajoutée gratuite
Guide complet des outils d’IA Évaluation des modèles d’IA

OpenCompass

Plateforme d’évaluation de grands modèles couvrant plusieurs modèles, plusieurs ensembles de données et des indicateurs multidimensionnels

Étiquettes :

Qu’est-ce que OpenCompass ?

OpenCompass est une plateforme d’évaluation de grands modèles open source lancée par le Laboratoire d’intelligence artificielle de Shanghai, conçue pour comparer systématiquement les modèles de base, les modèles de conversation et les modèles multimodaux. Elle offre un cadre d’évaluation, des configurations de datasets, une adaptation des modèles, un inférence distribué, le calcul d’indicateurs, la synthèse des résultats et des classements, ce qui permet aux instituts de recherche, aux équipes de modèles et aux entreprises de mettre en place des processus d’évaluation de LLM reproductibles.

OpenCompass désigne à la fois l’outil Python open source pouvant être installé localement, ainsi que les classements des LLM et VLM sur le site officiel, ainsi que l’écosystème comprenant CompassHub, CompassRank, etc. Les résultats des classements tiennent compte d’une version spécifique, de prompts, de jeux de données et de méthodes d’évaluation ; ils ne signifient pas pour autant que le modèle est supérieur dans tous les contextes professionnels réels.

Fonctionnalités clés d’OpenCompass

Évaluation des compétences multidimensionnelles

Le système de compétences couvre des dimensions générales telles que les examens, les connaissances, la langue, la compréhension, le raisonnement et la sécurité, ainsi que des compétences spécifiques comme les textes longs, le code, l’utilisation d’outils et le renforcement des connaissances. Les utilisateurs peuvent choisir des ensembles d’évaluation existants ou combiner des ensembles de données et des indicateurs adaptés à leur activité.

Plus de cent ensembles de données et exécution configurable

Le projet intègre de nombreuses références en chinois et en anglais ainsi que des normes professionnelles ; il permet de décrire les modèles, les ensembles de données, les prompts, les moteurs d’inférence et les évaluateurs à l’aide de configurations Python. Ces configurations peuvent être héritées et combinées, ce qui facilite l’évaluation du même modèle sur différents ensembles de données ou permet de comparer plusieurs modèles dans des conditions identiques.

Modèle local et modèle API

OpenCompass peut charger directement des modèles locaux tels que Hugging Face et InternLM, ainsi qu’interagir avec des API compatibles comme OpenAI et DeepSeek. Les services personnalisés peuvent voir leur débit amélioré grâce à LMDeploy, vLLM, SGLang, etc.

Les modèles d’API fermés n’ont pas besoin de carte graphique locale, mais génèrent des frais de token et sont soumis à des restrictions de débit ainsi qu’à des politiques de données imposées par le fournisseur.

Évaluation objective

Pour les questions à choix multiples, les trous à remplir et les tâches ayant des réponses standard, on peut utiliser une évaluation discriminative ou générative. La méthode discriminative compare le degré de perplexité des réponses candidates, tandis que la méthode générative fait en sorte que le modèle produise directement une réponse avant traitement par des règles.

Les modèles Prompt, les exemples few-shot et l’extracteur de réponses influencent tous la note ; les expériences de reproduction doivent impérativement utiliser des configurations fixes et des seeds aléatoires.

Évaluation subjective et LLM-as-Judge

Pour les réponses ouvertes, la sécurité, l’expression et le raisonnement complexe, des juges artificiels ou basés sur de grands modèles peuvent être utilisés. GenericLLMEvaluator permet de personnaliser le prompt du juge, les réponses de référence et le modèle de juge.

CascadeEvaluator peut d’abord évaluer avec des règles, puis ne transmettre aux LLM que les échantillons qui n’ont pas réussi, ce qui réduit les coûts de appel.

Les jugements des LLM présentent des biais de position, des préférences de style, des préférences personnelles et de la randomité. Pour les conclusions à haut risque, il convient d’utiliser plusieurs juges, d’échanger l’ordre des réponses, de procéder à des vérifications manuelles aléatoires, et de rendre publics les modèles et les templates de jugement.

Évaluation distribuée et efficace

Le cadre permet de séparer les tâches de raisonnement et d’évaluation, de les exécuter sur plusieurs GPU ou plusieurs machines, et de gérer des expériences à grande échelle grâce au suivi des tâches, à la réexécution en cas d’échec et à la gestion persistante des résultats. Le backend d’accélération du raisonnement peut améliorer le débit, mais différents backends, paramètres de quantification et configurations parallèles peuvent modifier les résultats, qui doivent être enregistrés séparément.

Écologie multimodale et spécialisée

L’écosystème OpenCompass comprend des projets tels que VLMEvalKit et AgentCompass, qui couvrent respectivement les modèles de langage visuel et les capacités des agents. Chaque sous-projet dispose de sa propre méthode d’installation, de ses propres ensembles de données et de licences ; il n’est pas possible de considérer toutes les capacités multimodales comme pouvant être gérées par une seule commande au sein du dépôt principal.

Classements et rapports

Le site officiel propose une liste publique des modèles ; le framework permet de générer des tableaux, des résumés et des résultats détaillés d’échantillons. Lors de l’examen de cette liste, il convient de se concentrer sur la date du modèle, le fait qu’il soit ou non open source, la contamination de l’ensemble de test, les prompts, le budget de raisonnement et la couverture des échantillons, plutôt que de se fier uniquement au score moyen global.

Comparaison de la manière d’utiliser OpenCompass et de ses coûts

MéthodeCoût du logicielCoûts principauxScénarios adaptés
Classement du site officielConsultation gratuitePas de coûts d’exploitation directsCompréhension initiale des performances de référence publiques du modèle
Évaluation open source localeGratuit, Apache 2.0GPU, CPU, stockage, énergie et temps d’ingénieriePoids open source, modèles privés et expériences reproductibles
Évaluation du modèle APIChâssis gratuitLe modèle testé est facturé par token ou par requêteModèles fermés ou difficiles à déployer localement
LLM-as-JudgeÉvaluation des composants gratuiteCoût de la puissance de calcul locale du modèle d’arbitrage ou des frais APIQuestions ouvertes, évaluation de la qualité et de la sécurité
Service d’évaluation des entreprisesPas de forfait fixe publicSelon le champ de coopération et de servicesOrganisations nécessitant des référentiels sur mesure, une évaluation par des experts et un rapport

Comparaison des méthodes d’évaluation

MéthodeTâches applicablesAvantageLimites
Règles/PrécisionQuestions à choix multiples, mathématiques, réponse correcteRapide, stable, à faible coûtUn changement de format de réponse peut entraîner des erreurs de jugement.
Indicateurs génératifsTraduction, résumé, codeGénération libre évaluableLes indicateurs automatiques ne reflètent pas nécessairement la véritable qualité.
LLM JudgeQuestions ouvertes, explications et sécuritéCapable de gérer des sémantiques complexesAvec des déviations, de la randomité et des frais possibles
Évaluation manuelleScénarios à haute valeur et professionnelsPeut être évalué en fonction du domaineCher, lent et difficile à rendre cohérent
Évaluation en cascadeLes règles peuvent couvrir une partie des échantillonsTenir compte à la fois des coûts et du jugement sémantiqueIl est nécessaire de concevoir des conditions de dérivation appropriées.

Guide d’installation d’OpenCompass

  1. Préparer l’environnement :Créer un environnement Python indépendant ; les modèles locaux installent les dépendances correspondantes en fonction de PyTorch, CUDA et de la carte graphique.
  2. Projet d’installation :Installez la version stable ou la version de développement depuis le dépôt officiel, et enregistrez l’hash du commit.
  3. Préparer l’ensemble de données :Téléchargez les références nécessaires selon le document, et vérifiez la licence, le répertoire ainsi que les résultats de validation.
  4. Sélectionner la configuration du modèle :Utiliser une configuration locale ou API existante pour définir le chemin du modèle, la clé, la concurrence et le contexte.
  5. Exécuter des tests à petite échelle :Utilisez d’abord une petite quantité de données pour vérifier le prompt, l’analyse des résultats, la mémoire vidéo et les coûts, puis exécutez l’ensemble complet.
  6. Voir les résultats :Vérifiez le résumé, les journaux et les détails des échantillons ; ne vous contentez pas de la note moyenne finale.
  7. Enregistrer les informations de l’expérience :Enregistrer la version du modèle, le jeu de données, les paramètres de configuration, le backend, le matériel et l’heure afin de faciliter la reproductibilité.

Évaluation de jeux de données personnalisés

  1. Organiser le JSONL ou le CSV en définissant clairement le problème, les réponses de référence, les catégories et les champs de métadonnées.
  2. Définir les colonnes d’entrée et de sortie du Dataset Reader, et diviser l’ensemble de développement de l’ensemble de test caché.
  3. Configurez le Prompt Template, le Retriever et l’Inferencer pour le modèle.
  4. Sélectionnez des règles, des indicateurs professionnels ou LLM Judge, et écrivez une fonction de post-traitement fiable.
  5. Valider l’évaluateur à l’aide d’un petit échantillon annoté manuellement, puis augmenter l’échelle et analyser les résultats de regroupement.

Comment interpréter correctement les résultats d’évaluation

Le score total peut masquer des faiblesses dans des catégories spécifiques ; il convient de le consulter par langue, domaine, niveau de difficulté et catégorie de sécurité. La longueur du contexte, les paramètres d’échantillonnage, les tokens de raisonnement et les droits d’accès aux outils doivent être autant que possible identiques pour différents modèles.

Les données publiques peuvent faire partie du corpus d’entraînement ; il convient donc d’ajouter également des ensembles de données créés par l’organisation, mis à jour dans le temps et provenant de vrais processus métier, afin d’éviter une optimisation uniquement basée sur les classements.

À qui s’adresse-t-il

  • Équipes de chercheurs et d’algorithmes comparant les capacités des grands modèles open source et propriétaires ;
  • Responsables techniques d’entreprise qui doivent établir des critères objectifs pour le choix du modèle ;
  • Équipes chargées du développement de modèles de raisonnement, de code, de sécurité, de textes longs ou multimodaux ;
  • Les développeurs qui souhaitent reproduire le classement public et analyser des échantillons spécifiques ;
  • Organisations qui ont besoin de créer des ensembles de données privés et d’effectuer des évaluations de régression continues.

Avantages et précautions

  • Les avantages d’OpenCompass sont son open source, son écosystème chinois bien développé, une grande variété de datasets et de configurations de modèles, ainsi qu’une couverture complète du processus allant de l’inference aux indicateurs jusqu’aux rapports.
  • Il convient tant pour des benchmarks rapides que pour être étendu en une plateforme d’évaluation interne à l’organisation ;
  • L’installation et l’évaluation complète nécessitent des ressources en ingénierie et en puissance de calcul, et le téléchargement des ensembles de données peut également être volumineux.
  • La note d’évaluation est influencée par le prompt, l’extraction des réponses, le backend et le juge ; elle ne doit pas être considérée comme un classement absolu du modèle.
  • Les ensembles de données, les poids des modèles et l’API ont chacun leurs propres licences et conditions de confidentialité ; pour exécuter le code d’évaluation, il convient également d’utiliser des conteneurs isolés.

Questions fréquentes

OpenCompass est-il gratuit ?

Le framework open source est gratuit et est licencié sous la licence Apache 2.0 ; sa liste officielle peut être consultée gratuitement. Le coût du matériel local, des GPU cloud, des API de modèles et des modèles d’arbitrage est à la charge de l’utilisateur.

OpenCompass peut-il évaluer des modèles propriétaires ?

Oui, c’est possible en configurant l’accès via l’API correspondante, mais cela sera soumis aux restrictions de débit du fournisseur, ainsi qu’aux politiques de prix et de données.

OpenCompass prend-il en charge le multimodal ?

L’écosystème OpenCompass propose des classements VLM ainsi que des outils d’évaluation multimodale tels que VLMEvalKit ; pour les instructions d’installation et les ensembles de données, il convient de se référer au projet correspondant.

Le numéro un du classement est-il forcément le meilleur ?

Pas nécessairement. Le classement ne représente que des critères et des configurations spécifiques ; le choix doit être fait en tenant compte de la situation commerciale réelle, des coûts, des délais, de la sécurité et d’évaluations manuelles.

OpenCompass est-il open source ?

Open source, le dépôt principal est soumis à la licence Apache 2.0. Certains ensembles de données, modèles et sous-projets de l’écosystème suivent leurs propres conditions.

©️Droit d’auteur : Sauf indication contraire, tous les articles de ce site sont protégés par le droit d’auteur.Partage d’outils d’IATous les droits d’auteur sont réservés. Sans autorisation, aucune personne, média, site web ou groupe ne peut reproduire, copier ou diffuser de quelque manière que ce soit le contenu de ce site, ni créer de mirror sur des serveurs qui ne lui appartiennent pas. Dans le cas contraire, notre site se réserve le droit de poursuivre en justice les responsables conformément à la loi.

Outils similaires à OpenCompass