LiveBench
LiveBench, outil intelligent axé sur l’amélioration de l’efficacité de l’IA
Étiquettes :Amélioration de l’efficacité de l’IAQu’est-ce que LiveBench ?
LiveBench est un ensemble de benchmarks et de classements publics pour les grands modèles de langage, constamment mis à jour, qui vise principalement à résoudre le problème de contamination causé par l’inclusion de questions d’évaluation traditionnelles dans les données d’entraînement des modèles. Il utilise des données récentes, génère des questions de manière programmée et propose des réponses correctes vérifiables, ce qui permet d’évaluer automatiquement les tâches difficiles.
La thèse de projet a été sélectionnée pour ICLR 2025 Spotlight ; le site officiel met en ligne en même temps le papier, les données et le code d’évaluation. Elle convient à l’étude des différences de capacités des modèles, et n’est pas un outil de chat ou de génération de contenu destiné aux utilisateurs ordinaires.
Pourquoi est-il nécessaire d’avoir des références dynamiques
Plus le temps pendant lequel une base de questions fixe reste accessible est long, plus il est probable que les développeurs de modèles l’utilisent pour l’entraînement, le retouche ou l’optimisation des prompts, et les scores du classement pourraient alors refléter la mémoire plutôt que la capacité de généralisation. LiveBench cherche à réduire au maximum cette durée d’exposition en ajoutant régulièrement de nouvelles questions et en mettant à jour les anciennes.
« Pollution limitée » ne signifie pas une absence absolue de pollution ; les pages web publiques, les problèmes de concours et les dépôts de code peuvent encore faire partie des données d’entraînement. Lors de l’interprétation des résultats, il convient de prendre en compte la date de publication du problème, la date limite d’entraînement du modèle et une analyse spécifique de la tâche.
Conception centrale
Mises à jour continues des sujets
LiveBench ajoute ou remplace des exercices en fonction de nouveaux ensembles de données, articles scientifiques, nouvelles, fiches de film et matériaux de compétition. Le journal des mises à jour enregistre les changements effectués pour chaque date de publication.
Réponse standard objective
Pour chaque question, il convient d’utiliser autant que possible une vérité de référence vérifiable et un système d’évaluation déterministe, plutôt que de laisser un autre grand modèle juger subjectivement. Cela permet de réduire les préférences du modèle d’évaluation, les effets de séquence et le biais personnel.
Couverture multi-capacités
Les critères de référence couvrent des dimensions telles que les mathématiques, la programmation, le raisonnement, les langues, le respect des instructions, l’analyse de données et la programmation d’agents. Le nombre de catégories, de tâches et d’épreuves varie selon les versions ; il ne faut donc pas considérer les « six catégories et dix-huit éléments » initiaux comme une spécification permanente.
Classement versionné
Chaque mise à jour crée une option de version avec date ; les résultats du modèle doivent être associés à la version spécifique publiée. Les questions et les logiques de notation diffèrent d’une version à l’autre, il est donc impossible de comparer directement les scores sans explication.
Code d’évaluation ouvert
Le entrepôt officiel fournit des scripts pour générer des réponses, évaluer les scores et afficher les résultats, et prend en charge les modèles API ainsi que des interfaces compatibles. Les tâches de programmation d’agents nécessitent également Docker pour fournir un environnement d’exécution isolé.
Catégorie d’évaluation actuelle
| Catégorie | Évaluer principalement les compétences | Caractéristiques typiques des tâches |
|---|---|---|
| Mathématiques | Calcul, démonstration et raisonnement synthétique | Problèmes de compétition, points et problèmes de mathématiques programmées |
| Programmation | Génération de code et complétion de code | Utilisation de la base réelle, cas de test et résultats d’exécution |
| Programmation d’agents intelligents | Localiser et corriger les problèmes dans l’entrepôt | Utilisation répétée d’outils, environnement de développement réel |
| Raisonnement | Logique, suivi d’état et navigation spatiale | L’énigme de la zèbre, la théorie de l’esprit et la navigation |
| langue | Structure du texte, compréhension des mots et du discours | Orthographe, ordre de l’intrigue et associations de mots |
| Suivi des instructions | Respecter un format et des contraintes bien définis | Sortie à plusieurs conditions et exigences de vérification programmable |
| Analyse de données | Gestion de tableaux, d’événements et de relations | Lien de tableaux, réorganisation du format et reconnaissance d’événements consécutifs |
Aperçu des fonctions principales
- Voir les scores des différents modèles au niveau global et dans chaque catégorie de compétences.
- Comparer les performances par modèle, organisation, version et paramètres de raisonnement.
- Comprendre les mises à jour des questions et les changements de classement grâce aux versions par date.
- Téléchargez les données publiques et consultez la structure de la tâche ainsi que les réponses correctes.
- Utiliser des scripts officiels pour générer les réponses du modèle et une évaluation objective.
- Évaluer les modèles d’API commerciales ou des modèles d’interfaces compatibles développés en interne.
- Exécuter séparément des sous-ensembles de tâches telles que les mathématiques, la programmation, le raisonnement, etc.
- Soumettez une demande d’évaluation du modèle ou signalez un problème via un Issue.
- Lisez les articles et les journaux de mise à jour pour en connaître les méthodes et les limites.
- Vérifier les tâches spécifiques et les sorties du modèle correspondant aux scores anormaux.
À qui s’adresse-t-il
- Chercheurs en IA : analyse de la généralisation des modèles, de la pollution et des différences de capacité.
- Équipe de développement de modèles : Effectuer des évaluations de régression sur les sujets de la nouvelle version.
- Spécialiste du choix des technologies d’entreprise : sélectionner les modèles candidats adaptés à une tâche spécifique.
- Plateformes API et fabricants de modèles : validation des nouveaux modèles et soumission au classement.
- Communauté open source : reproduire les résultats, évaluer les correcteurs et contribuer à de nouvelles tâches.
- Équipe des outils de développement : comparaison axée sur les capacités de programmation en code et en agents intelligents.
- Chercheurs en éducation et en médias : comprendre les méthodes de classement et les interprétations erronées courantes.
Quelles situations ne conviennent pas vraiment
- Utilisateurs qui ne veulent connaître que le « modèle le plus puissant » sans tenir compte des différences de tâches.
- Équipes nécessitant une évaluation spécifique en écriture en chinois, en tonalité de service client ou en connaissances sectorielles.
- Espérer remplacer directement les décisions d’achat issues de tests en conditions réelles par un classement unique.
- Personnes qui souhaitent reproduire intégralement tous les tests sans budget pour des API, des GPU ou un environnement sandbox.
- Institutions exigeant une certification complète en matière de sécurité, de biais, de confidentialité et de fiabilité des faits.
- Utilisateurs ordinaires qui ont besoin de chatter depuis un appareil mobile ou d’effectuer directement des tâches de production.
Tutoriel pour consulter le classement
- Vérifiez d’abord la date de publication et la version du sujet affichées sur la page de LiveBench.
- Voir le nom du modèle, la version spécifique, l’intensité de l’inférence et les paramètres de contexte.
- Comparer d’abord les catégories correspondant à l’activité cible, sans se fier uniquement au score moyen global.
- Développez les résultats au niveau de la tâche pour observer si les scores élevés sont concentrés sur un petit nombre de types de questions.
- Vérifier s’il y a des délais dépassés, des réponses vides, des limites de coût ou des différences d’outils.
- Mettre le modèle candidat dans ses propres données et flux de travail pour une évaluation secondaire.
Tutoriel d’évaluation en exécution locale
- Obtenez le dépôt officiel et créez un environnement virtuel Python indépendant.
- Installez les dépendances de base et les dépendances de tâches requises selon les instructions du projet.
- Sélectionnez l’option de version fixe de LiveBench et notez la version soumise.
- Configurer le nom du modèle, l’adresse API, la clé et les paramètres de génération.
- Exécutez d’abord un petit nombre de questions pour vérifier le format de sortie et les frais.
- Exécuter le raisonnement et l’évaluation, puis enregistrer la réponse originale ainsi que le journal d’exécution.
- Comparer différents modèles en utilisant la même version et les mêmes paramètres.
- Vérifier à nouveau les échantillons anormaux avant de regrouper les catégories et le score total.
Guide d’évaluation de la programmation d’agents intelligents
- Préparer un hôte isolé pour prendre en charge Docker et définir des limites de ressources.
- Installer les dépendances et les images supplémentaires nécessaires à la tâche de programmation d’agents intelligents.
- Vérifier que le modèle prend en charge les appels d’outils ou les modes d’interaction requis.
- Cadre d’agent fixe, limite de pas, délai d’expiration et version de l’environnement.
- Exécuter un échantillon à petite échelle pour vérifier le montage du stockage et les commandes de test.
- Exécuter des tâches en batch et enregistrer les trajectoires, les correctifs, les tests et les coûts.
- Pour les tâches échouées, on distingue les erreurs de modèle, les erreurs d’environnement et les délais dépassés.
- Désinstaller les conteneurs non fiables et nettoyer les identifiants temporaires.
Comment calculer les scores
La notation des tâches est déterminée par des règles de certitude, des réponses correctes, des cas de test ou des procédures de traitement spécifiques, avant d’être agrégée par tâche et par catégorie. La note globale provient généralement de la moyenne des différentes catégories, et non pas d’un calcul simple en mélangeant toutes les questions.
Les mises à jour de version peuvent ajouter des catégories, remplacer des tâches ou modifier la logique de notation ; il est donc nécessaire de consigner la date de publication, les soumissions de code, les paramètres du modèle et l’environnement de exécution. Citer uniquement une note sans indiquer la version entraîne une perte de reproductibilité.
| niveau | Signification | Points clés de la lecture |
|---|---|---|
| Points du sujet | Une seule réponse répond-elle aux critères ? | Format, réponse, test ou contrainte |
| Répartition des tâches | Performance moyenne pour le même type de question | Nombre d’échantillons et difficulté de la tâche |
| Classification par catégorie | Performance globale de plusieurs tâches liées | La capacité professionnelle correspond-elle ? |
| Score total | Aperçu global après moyennage des catégories | On ne peut pas cacher les faiblesses et l’importance des tâches |
| Classement | Position relative dans la version actuelle | Valable uniquement pour la même version et les mêmes paramètres |
Comparabilité des versions et des résultats
| Méthode de comparaison | Est-ce raisonnable | Raison |
|---|---|---|
| Comparaison de modèles avec la même date de publication et les mêmes paramètres | Plus raisonnable | Titre, notation et paramètres sont identiques |
| Comparaison directe des scores globaux selon les dates de publication différentes | Non recommandé | Les tâches et le niveau de difficulté ont pu changer. |
| Comparaison entre le modèle de base et la version à forte capacité de raisonnement | Il faut marquer | Calculer le budget et les retards sont différents |
| Comparaison entre les scores officiels et ceux annoncés par le fabricant | Nécessite une révision | L’environnement, les paramètres et le code peuvent être différents. |
| Les scores du classement équivalent aux résultats réels de l’activité. | Irrationnel | La tâche de référence ne couvre pas les processus spécifiques. |
| Une seule catégorie est utilisée pour le tri initial des tâches | Raisonnable mais insuffisant | Vérification des données commerciales requise |
Méthodes de contrôle de la pollution
- Des questions nouvelles basées sur des matériaux récents sont publiées régulièrement.
- Créer des tâches à partir de nouvelles thèses, d’articles de presse, de compétitions et de jeux de données.
- Générer des questions partiellement vérifiables de manière programmée.
- Mettre à jour les tâches anciennes déjà saturées ou soupçonnées d’être contaminées.
- Lier les classements et les données à une date de publication spécifique.
- Utiliser des réponses objectives pour réduire les biais des juges humains et des modèles.
Ces mesures ne peuvent que réduire la probabilité de pollution, et ne prouvent pas que tous les modèles n’aient jamais rencontré de matériaux similaires. En particulier, des problèmes à code ouvert, des nouvelles et des articles de recherche pourraient rapidement être intégrés dans les systèmes d’entraînement ou de recherche.
Avantages et limites de l’évaluation objective
| aspect | Avantage | frontière |
|---|---|---|
| cohérence | La même règle s’applique à tous les modèles. | Des erreurs de règles affectent systématiquement les résultats. |
| Reproductibilité | Il est possible de sauvegarder les réponses et de les renoter. | Version dépendante et environnement de exécution |
| Coût | Aucune appel à un juge LLM supplémentaire requis | Les sandbox de code et l’inférence des modèles ont encore des coûts. |
| Déviation | Réduire les préférences de style du modèle d’arbitrage | Les exigences de conception du sujet et de format comportent toujours des choix subjectifs |
| Tâche difficile | Les cas de test permettent de déterminer avec précision les résultats du code | La qualité ouverte et la créativité sont difficiles à couvrir. |
Prix et coûts de fonctionnement
Le site LiveBench, les articles et les dépôts open source sont accessibles gratuitement ; le projet ne propose pas de forfaits abonnés destinés aux lecteurs. Les principaux coûts liés aux tests indépendants proviennent des API de modèles, des GPU, des sandbox d’agents, du stockage et du temps d’ingénierie.
| Projet | Frais de plateforme | Coût réel possible |
|---|---|---|
| Voir le classement | Gratuit | Temps passé sur Internet et à lire |
| Télécharger le code et les données publiques | Gratuit | Stockage et maintenance locaux |
| Évaluation des modèles API commerciaux | LiveBench est gratuit | Les fournisseurs de modèles facturent par token ou par requête |
| Inference de modèles open source | LiveBench est gratuit | Location de GPU, électricité et maintenance |
| Tâche d’exécution de code | LiveBench est gratuit | Hôtes Docker, coûts en CPU et d’isolation |
| Tâche de programmation d’agent intelligent | LiveBench est gratuit | Coût des contextes longs, des appels d’outils et du raisonnement en plusieurs tours |
| Demande de critique officielle | Aucun prix public unifié non observé | L’acceptation et l’organisation sont décidées par l’équipe du projet. |
Comment choisir un modèle
LiveBench est utile pour réduire le nombre de modèles candidats de plusieurs dizaines à quelques-uns seulement, mais il ne doit pas décider directement de l’achat. Les parties prenantes doivent également évaluer le prix, les délais, la capacité de traitement, la politique de données, la stabilité, les appels aux outils et les performances en langue locale.
- Choisissez d’abord la catégorie et la tâche les plus proches de votre activité.
- Comparer les résultats de la même version, avec le même budget de raisonnement.
- Conserver un ensemble d’échantillons internes réels pour le test final.
- Enregistrez en même temps la qualité, le Token, le délai et le taux d’échec.
- Intégrer des évaluations de sécurité et de vérification des faits pour les scénarios à haut risque.
- Effectuer des tests de concurrence, de limitation du débit et de stabilité en fonction du débit réel.
Précautions de sécurité pour l’évaluation
Les tâches de programmation et d’agents exécutent du code ou des commandes générés par un modèle, et doivent être réalisées dans des conteneurs isolés. NeExposez pas les clés de production, les répertoires hôtes et les identifiants du réseau privé à du code non fiable.
- Utiliser des conteneurs jetables, des privilèges minimaux et une isolation réseau.
- Limitez la CPU, la mémoire, le disque, le nombre de processus et le temps d’exécution.
- Ne pas monter les interfaces de contrôle Docker ni les dossiers sensibles du hôte dans le conteneur.
- Utiliser une clé API à court terme et définir des budgets ainsi que des limites de vitesse.
- Enregistrer les modèles, les paramètres, les images et les versions de soumission du code.
- Une fois la tâche terminée, détruire le conteneur et annuler les identifiants temporaires.
Avantages du produit
- Mettre à jour régulièrement les questions afin de réduire le risque de pollution à long terme lié à une banque de questions fixe.
- Utiliser des réponses correctes vérifiables pour réduire les biais de jugement des LLM.
- Couvrait des compétences en mathématiques, en programmation, en raisonnement, en langues et en analyse de données.
- Intégrer l’évaluation de la programmation d’agents dans un environnement de entrepôt réel.
- Fournit des classements versionnés, des articles, des données et du code d’évaluation.
- Les résultats au niveau de la tâche facilitent l’analyse des forces et des faiblesses spécifiques du modèle.
- Capable d’évaluer les API commerciales et les modèles d’interfaces compatibles personnalisés.
- Les articles et les communautés open source fournissent une base pour la révision des méthodes.
Restrictions d'utilisation et précautions
- La pollution ne peut être que limitée, il est impossible de prouver qu’elle n’existe pas du tout.
- Les scores de différentes dates de publication ne peuvent pas être directement considérés comme appartenant à la même échelle.
- Le classement global masquera les différences au niveau des catégories et des tâches.
- Les classements publics ne couvrent pas nécessairement tous les nouveaux modèles et paramètres d’inférence.
- Les délais d’API, les prix et les limitations de vitesse peuvent affecter la note du modèle.
- Les évaluations reposent principalement sur des tâches objectives, ce qui rend difficile la prise en compte de l’esthétique et de l’écriture ouverte.
- Le chinois, les connaissances sectorielles, ainsi que les compétences en sécurité et en confidentialité ne constituent pas l’ensemble des points clés.
- Les résultats de la programmation d’agents sont influencés par le framework, le nombre d’étapes et l’environnement sandbox.
- Les chemins de raisonnement direct avec les modèles locaux sont actuellement limités ; il est recommandé officiellement d’utiliser des services compatibles.
- De hauts scores ne peuvent pas remplacer la vérification des activités réelles et l’évaluation des risques.
GitHub et l’état open source
Le dépôt officiel de LiveBench est maintenu par l’organisation LiveBench et compte environ 1 300 étoiles à ce jour. Le dépôt contient des scripts d’évaluation, des traitements de tâches, une présentation des résultats ainsi qu’un historique des modifications, et il accepte les issues et les contributions de code.
Le fichier LICENSE intègre les textes de licence provenant de sources telles que FastChat et LiveCodeBench, y compris les conditions Apache-2.0 et MIT. L’utilisation, la modification ou la redistribution doivent respecter scrupuleusement les conditions de chaque source ainsi que les déclarations des tiers ; il n’est pas possible de réduire l’ensemble du dépôt à une seule licence.
Informations de base
| champ | Contenu |
|---|---|
| Nom de l’outil | LiveBench |
| Type d’outil | Benchmarks dynamiques et classements des grands modèles de langage |
| Méthode centrale | Sujets récents, réponses objectives, notation automatique, mises à jour de version |
| Catégories principales | Mathématiques, programmation, programmation d’agents, raisonnement, langage, instructions, analyse de données |
| Thèse | ICLR 2025 Spotlight |
| Utilisation du site web | Voir gratuitement |
| Évaluation locale | Prend en charge les modèles API et les services compatibles |
| Tâche de code | Dépendances supplémentaires nécessaires, les tâches d’agent requièrent Docker |
| Est-ce open source | Oui |
| Licence | Inclut des licences tierces telles que Apache-2.0, MIT, etc. |
Indice de recommandation
4,7 / 5. LiveBench améliore les problèmes de pollution des classements traditionnels des LLM et de biais des juges grâce à des questions dynamiques et à une évaluation objective, ce qui le rend adapté à la recherche et au choix technologique ; cependant, la comparabilité des versions, la couverture des tâches et les coûts d’exécution nécessitent encore une interprétation prudente.
Questions fréquentes
LiveBench est-il gratuit ?
Les classements, les articles, le code et les données publiques sont accessibles gratuitement. L’évaluation indépendante entraîne des coûts liés aux API du modèle, aux GPU, au calcul et à la maintenance technique.
LiveBench ne pollue-t-il vraiment pas ?
On ne peut pas garantir qu’il n’y en aura absolument pas. Il réduit la probabilité de pollution par de nouvelles questions, des matériaux récents et des mises à jour continues ; pour être plus précis, on peut dire que la pollution est « limitée ».
Pourquoi ne pas utiliser de grands modèles comme arbitres ?
Le projet privilégie les réponses standard et une évaluation certaine, afin d’éviter les préférences du modèle d’arbitrage, les effets de séquence et le biais personnel. La qualité des réponses ouvertes est donc moins prise en compte.
Est-il possible de comparer les scores des différentes versions ?
Il n’est pas recommandé de faire des comparaisons directes. Les sujets, les tâches et le niveau de difficulté peuvent varier ; il faut au moins indiquer en même temps la date de publication, les paramètres du modèle et la version du code.
Peut-on tester son propre modèle ?
Oui. La méthode la plus fiable consiste à déployer le modèle via une interface compatible, puis à utiliser les scripts officiels pour générer des réponses et des notes.
Pourquoi un modèle récent n’apparaît-il pas dans le classement ?
Une évaluation officielle nécessite l’accessibilité de l’API, sa stabilité, ainsi que des ressources budgétaires et du temps ; les modèles trop coûteux ou présentant des temps d’attente excessifs peuvent ne pas permettre de mener à bien des tests équitables.
LiveBench peut-il décider directement de l’achat du modèle ?
Non. Il convient pour un premier tri, mais la qualité, les délais, les coûts, la stabilité et la conformité doivent être testés à l’aide de données commerciales réelles.
LiveBench est-il open source ?
Oui, mais le dépôt contient du code provenant de plusieurs sources ainsi que des textes de licences composées. Lors de la redistribution, il est nécessaire de vérifier les mentions Apache-2.0, MIT et autres déclarations pertinentes.
Numéro d’enregistrement de sécurité publique du Guangxi : 45132202000164