LiveBench
Valeur ajoutée gratuite
Outils de bureautique IA Amélioration de l’efficacité de l’IA

LiveBench

LiveBench, outil intelligent axé sur l’amélioration de l’efficacité de l’IA

Étiquettes :

Qu’est-ce que LiveBench ?

LiveBench est un ensemble de benchmarks et de classements publics pour les grands modèles de langage, constamment mis à jour, qui vise principalement à résoudre le problème de contamination causé par l’inclusion de questions d’évaluation traditionnelles dans les données d’entraînement des modèles. Il utilise des données récentes, génère des questions de manière programmée et propose des réponses correctes vérifiables, ce qui permet d’évaluer automatiquement les tâches difficiles.

La thèse de projet a été sélectionnée pour ICLR 2025 Spotlight ; le site officiel met en ligne en même temps le papier, les données et le code d’évaluation. Elle convient à l’étude des différences de capacités des modèles, et n’est pas un outil de chat ou de génération de contenu destiné aux utilisateurs ordinaires.

Pourquoi est-il nécessaire d’avoir des références dynamiques

Plus le temps pendant lequel une base de questions fixe reste accessible est long, plus il est probable que les développeurs de modèles l’utilisent pour l’entraînement, le retouche ou l’optimisation des prompts, et les scores du classement pourraient alors refléter la mémoire plutôt que la capacité de généralisation. LiveBench cherche à réduire au maximum cette durée d’exposition en ajoutant régulièrement de nouvelles questions et en mettant à jour les anciennes.

« Pollution limitée » ne signifie pas une absence absolue de pollution ; les pages web publiques, les problèmes de concours et les dépôts de code peuvent encore faire partie des données d’entraînement. Lors de l’interprétation des résultats, il convient de prendre en compte la date de publication du problème, la date limite d’entraînement du modèle et une analyse spécifique de la tâche.

Conception centrale

Mises à jour continues des sujets

LiveBench ajoute ou remplace des exercices en fonction de nouveaux ensembles de données, articles scientifiques, nouvelles, fiches de film et matériaux de compétition. Le journal des mises à jour enregistre les changements effectués pour chaque date de publication.

Réponse standard objective

Pour chaque question, il convient d’utiliser autant que possible une vérité de référence vérifiable et un système d’évaluation déterministe, plutôt que de laisser un autre grand modèle juger subjectivement. Cela permet de réduire les préférences du modèle d’évaluation, les effets de séquence et le biais personnel.

Couverture multi-capacités

Les critères de référence couvrent des dimensions telles que les mathématiques, la programmation, le raisonnement, les langues, le respect des instructions, l’analyse de données et la programmation d’agents. Le nombre de catégories, de tâches et d’épreuves varie selon les versions ; il ne faut donc pas considérer les « six catégories et dix-huit éléments » initiaux comme une spécification permanente.

Classement versionné

Chaque mise à jour crée une option de version avec date ; les résultats du modèle doivent être associés à la version spécifique publiée. Les questions et les logiques de notation diffèrent d’une version à l’autre, il est donc impossible de comparer directement les scores sans explication.

Code d’évaluation ouvert

Le entrepôt officiel fournit des scripts pour générer des réponses, évaluer les scores et afficher les résultats, et prend en charge les modèles API ainsi que des interfaces compatibles. Les tâches de programmation d’agents nécessitent également Docker pour fournir un environnement d’exécution isolé.

Catégorie d’évaluation actuelle

CatégorieÉvaluer principalement les compétencesCaractéristiques typiques des tâches
MathématiquesCalcul, démonstration et raisonnement synthétiqueProblèmes de compétition, points et problèmes de mathématiques programmées
ProgrammationGénération de code et complétion de codeUtilisation de la base réelle, cas de test et résultats d’exécution
Programmation d’agents intelligentsLocaliser et corriger les problèmes dans l’entrepôtUtilisation répétée d’outils, environnement de développement réel
RaisonnementLogique, suivi d’état et navigation spatialeL’énigme de la zèbre, la théorie de l’esprit et la navigation
langueStructure du texte, compréhension des mots et du discoursOrthographe, ordre de l’intrigue et associations de mots
Suivi des instructionsRespecter un format et des contraintes bien définisSortie à plusieurs conditions et exigences de vérification programmable
Analyse de donnéesGestion de tableaux, d’événements et de relationsLien de tableaux, réorganisation du format et reconnaissance d’événements consécutifs

Aperçu des fonctions principales

  • Voir les scores des différents modèles au niveau global et dans chaque catégorie de compétences.
  • Comparer les performances par modèle, organisation, version et paramètres de raisonnement.
  • Comprendre les mises à jour des questions et les changements de classement grâce aux versions par date.
  • Téléchargez les données publiques et consultez la structure de la tâche ainsi que les réponses correctes.
  • Utiliser des scripts officiels pour générer les réponses du modèle et une évaluation objective.
  • Évaluer les modèles d’API commerciales ou des modèles d’interfaces compatibles développés en interne.
  • Exécuter séparément des sous-ensembles de tâches telles que les mathématiques, la programmation, le raisonnement, etc.
  • Soumettez une demande d’évaluation du modèle ou signalez un problème via un Issue.
  • Lisez les articles et les journaux de mise à jour pour en connaître les méthodes et les limites.
  • Vérifier les tâches spécifiques et les sorties du modèle correspondant aux scores anormaux.

À qui s’adresse-t-il

  • Chercheurs en IA : analyse de la généralisation des modèles, de la pollution et des différences de capacité.
  • Équipe de développement de modèles : Effectuer des évaluations de régression sur les sujets de la nouvelle version.
  • Spécialiste du choix des technologies d’entreprise : sélectionner les modèles candidats adaptés à une tâche spécifique.
  • Plateformes API et fabricants de modèles : validation des nouveaux modèles et soumission au classement.
  • Communauté open source : reproduire les résultats, évaluer les correcteurs et contribuer à de nouvelles tâches.
  • Équipe des outils de développement : comparaison axée sur les capacités de programmation en code et en agents intelligents.
  • Chercheurs en éducation et en médias : comprendre les méthodes de classement et les interprétations erronées courantes.

Quelles situations ne conviennent pas vraiment

  • Utilisateurs qui ne veulent connaître que le « modèle le plus puissant » sans tenir compte des différences de tâches.
  • Équipes nécessitant une évaluation spécifique en écriture en chinois, en tonalité de service client ou en connaissances sectorielles.
  • Espérer remplacer directement les décisions d’achat issues de tests en conditions réelles par un classement unique.
  • Personnes qui souhaitent reproduire intégralement tous les tests sans budget pour des API, des GPU ou un environnement sandbox.
  • Institutions exigeant une certification complète en matière de sécurité, de biais, de confidentialité et de fiabilité des faits.
  • Utilisateurs ordinaires qui ont besoin de chatter depuis un appareil mobile ou d’effectuer directement des tâches de production.

Tutoriel pour consulter le classement

  1. Vérifiez d’abord la date de publication et la version du sujet affichées sur la page de LiveBench.
  2. Voir le nom du modèle, la version spécifique, l’intensité de l’inférence et les paramètres de contexte.
  3. Comparer d’abord les catégories correspondant à l’activité cible, sans se fier uniquement au score moyen global.
  4. Développez les résultats au niveau de la tâche pour observer si les scores élevés sont concentrés sur un petit nombre de types de questions.
  5. Vérifier s’il y a des délais dépassés, des réponses vides, des limites de coût ou des différences d’outils.
  6. Mettre le modèle candidat dans ses propres données et flux de travail pour une évaluation secondaire.

Tutoriel d’évaluation en exécution locale

  1. Obtenez le dépôt officiel et créez un environnement virtuel Python indépendant.
  2. Installez les dépendances de base et les dépendances de tâches requises selon les instructions du projet.
  3. Sélectionnez l’option de version fixe de LiveBench et notez la version soumise.
  4. Configurer le nom du modèle, l’adresse API, la clé et les paramètres de génération.
  5. Exécutez d’abord un petit nombre de questions pour vérifier le format de sortie et les frais.
  6. Exécuter le raisonnement et l’évaluation, puis enregistrer la réponse originale ainsi que le journal d’exécution.
  7. Comparer différents modèles en utilisant la même version et les mêmes paramètres.
  8. Vérifier à nouveau les échantillons anormaux avant de regrouper les catégories et le score total.

Guide d’évaluation de la programmation d’agents intelligents

  1. Préparer un hôte isolé pour prendre en charge Docker et définir des limites de ressources.
  2. Installer les dépendances et les images supplémentaires nécessaires à la tâche de programmation d’agents intelligents.
  3. Vérifier que le modèle prend en charge les appels d’outils ou les modes d’interaction requis.
  4. Cadre d’agent fixe, limite de pas, délai d’expiration et version de l’environnement.
  5. Exécuter un échantillon à petite échelle pour vérifier le montage du stockage et les commandes de test.
  6. Exécuter des tâches en batch et enregistrer les trajectoires, les correctifs, les tests et les coûts.
  7. Pour les tâches échouées, on distingue les erreurs de modèle, les erreurs d’environnement et les délais dépassés.
  8. Désinstaller les conteneurs non fiables et nettoyer les identifiants temporaires.

Comment calculer les scores

La notation des tâches est déterminée par des règles de certitude, des réponses correctes, des cas de test ou des procédures de traitement spécifiques, avant d’être agrégée par tâche et par catégorie. La note globale provient généralement de la moyenne des différentes catégories, et non pas d’un calcul simple en mélangeant toutes les questions.

Les mises à jour de version peuvent ajouter des catégories, remplacer des tâches ou modifier la logique de notation ; il est donc nécessaire de consigner la date de publication, les soumissions de code, les paramètres du modèle et l’environnement de exécution. Citer uniquement une note sans indiquer la version entraîne une perte de reproductibilité.

niveauSignificationPoints clés de la lecture
Points du sujetUne seule réponse répond-elle aux critères ?Format, réponse, test ou contrainte
Répartition des tâchesPerformance moyenne pour le même type de questionNombre d’échantillons et difficulté de la tâche
Classification par catégoriePerformance globale de plusieurs tâches liéesLa capacité professionnelle correspond-elle ?
Score totalAperçu global après moyennage des catégoriesOn ne peut pas cacher les faiblesses et l’importance des tâches
ClassementPosition relative dans la version actuelleValable uniquement pour la même version et les mêmes paramètres

Comparabilité des versions et des résultats

Méthode de comparaisonEst-ce raisonnableRaison
Comparaison de modèles avec la même date de publication et les mêmes paramètresPlus raisonnableTitre, notation et paramètres sont identiques
Comparaison directe des scores globaux selon les dates de publication différentesNon recommandéLes tâches et le niveau de difficulté ont pu changer.
Comparaison entre le modèle de base et la version à forte capacité de raisonnementIl faut marquerCalculer le budget et les retards sont différents
Comparaison entre les scores officiels et ceux annoncés par le fabricantNécessite une révisionL’environnement, les paramètres et le code peuvent être différents.
Les scores du classement équivalent aux résultats réels de l’activité.IrrationnelLa tâche de référence ne couvre pas les processus spécifiques.
Une seule catégorie est utilisée pour le tri initial des tâchesRaisonnable mais insuffisantVérification des données commerciales requise

Méthodes de contrôle de la pollution

  • Des questions nouvelles basées sur des matériaux récents sont publiées régulièrement.
  • Créer des tâches à partir de nouvelles thèses, d’articles de presse, de compétitions et de jeux de données.
  • Générer des questions partiellement vérifiables de manière programmée.
  • Mettre à jour les tâches anciennes déjà saturées ou soupçonnées d’être contaminées.
  • Lier les classements et les données à une date de publication spécifique.
  • Utiliser des réponses objectives pour réduire les biais des juges humains et des modèles.

Ces mesures ne peuvent que réduire la probabilité de pollution, et ne prouvent pas que tous les modèles n’aient jamais rencontré de matériaux similaires. En particulier, des problèmes à code ouvert, des nouvelles et des articles de recherche pourraient rapidement être intégrés dans les systèmes d’entraînement ou de recherche.

Avantages et limites de l’évaluation objective

aspectAvantagefrontière
cohérenceLa même règle s’applique à tous les modèles.Des erreurs de règles affectent systématiquement les résultats.
ReproductibilitéIl est possible de sauvegarder les réponses et de les renoter.Version dépendante et environnement de exécution
CoûtAucune appel à un juge LLM supplémentaire requisLes sandbox de code et l’inférence des modèles ont encore des coûts.
DéviationRéduire les préférences de style du modèle d’arbitrageLes exigences de conception du sujet et de format comportent toujours des choix subjectifs
Tâche difficileLes cas de test permettent de déterminer avec précision les résultats du codeLa qualité ouverte et la créativité sont difficiles à couvrir.

Prix et coûts de fonctionnement

Le site LiveBench, les articles et les dépôts open source sont accessibles gratuitement ; le projet ne propose pas de forfaits abonnés destinés aux lecteurs. Les principaux coûts liés aux tests indépendants proviennent des API de modèles, des GPU, des sandbox d’agents, du stockage et du temps d’ingénierie.

ProjetFrais de plateformeCoût réel possible
Voir le classementGratuitTemps passé sur Internet et à lire
Télécharger le code et les données publiquesGratuitStockage et maintenance locaux
Évaluation des modèles API commerciauxLiveBench est gratuitLes fournisseurs de modèles facturent par token ou par requête
Inference de modèles open sourceLiveBench est gratuitLocation de GPU, électricité et maintenance
Tâche d’exécution de codeLiveBench est gratuitHôtes Docker, coûts en CPU et d’isolation
Tâche de programmation d’agent intelligentLiveBench est gratuitCoût des contextes longs, des appels d’outils et du raisonnement en plusieurs tours
Demande de critique officielleAucun prix public unifié non observéL’acceptation et l’organisation sont décidées par l’équipe du projet.

Comment choisir un modèle

LiveBench est utile pour réduire le nombre de modèles candidats de plusieurs dizaines à quelques-uns seulement, mais il ne doit pas décider directement de l’achat. Les parties prenantes doivent également évaluer le prix, les délais, la capacité de traitement, la politique de données, la stabilité, les appels aux outils et les performances en langue locale.

  • Choisissez d’abord la catégorie et la tâche les plus proches de votre activité.
  • Comparer les résultats de la même version, avec le même budget de raisonnement.
  • Conserver un ensemble d’échantillons internes réels pour le test final.
  • Enregistrez en même temps la qualité, le Token, le délai et le taux d’échec.
  • Intégrer des évaluations de sécurité et de vérification des faits pour les scénarios à haut risque.
  • Effectuer des tests de concurrence, de limitation du débit et de stabilité en fonction du débit réel.

Précautions de sécurité pour l’évaluation

Les tâches de programmation et d’agents exécutent du code ou des commandes générés par un modèle, et doivent être réalisées dans des conteneurs isolés. NeExposez pas les clés de production, les répertoires hôtes et les identifiants du réseau privé à du code non fiable.

  • Utiliser des conteneurs jetables, des privilèges minimaux et une isolation réseau.
  • Limitez la CPU, la mémoire, le disque, le nombre de processus et le temps d’exécution.
  • Ne pas monter les interfaces de contrôle Docker ni les dossiers sensibles du hôte dans le conteneur.
  • Utiliser une clé API à court terme et définir des budgets ainsi que des limites de vitesse.
  • Enregistrer les modèles, les paramètres, les images et les versions de soumission du code.
  • Une fois la tâche terminée, détruire le conteneur et annuler les identifiants temporaires.

Avantages du produit

  • Mettre à jour régulièrement les questions afin de réduire le risque de pollution à long terme lié à une banque de questions fixe.
  • Utiliser des réponses correctes vérifiables pour réduire les biais de jugement des LLM.
  • Couvrait des compétences en mathématiques, en programmation, en raisonnement, en langues et en analyse de données.
  • Intégrer l’évaluation de la programmation d’agents dans un environnement de entrepôt réel.
  • Fournit des classements versionnés, des articles, des données et du code d’évaluation.
  • Les résultats au niveau de la tâche facilitent l’analyse des forces et des faiblesses spécifiques du modèle.
  • Capable d’évaluer les API commerciales et les modèles d’interfaces compatibles personnalisés.
  • Les articles et les communautés open source fournissent une base pour la révision des méthodes.

Restrictions d'utilisation et précautions

  • La pollution ne peut être que limitée, il est impossible de prouver qu’elle n’existe pas du tout.
  • Les scores de différentes dates de publication ne peuvent pas être directement considérés comme appartenant à la même échelle.
  • Le classement global masquera les différences au niveau des catégories et des tâches.
  • Les classements publics ne couvrent pas nécessairement tous les nouveaux modèles et paramètres d’inférence.
  • Les délais d’API, les prix et les limitations de vitesse peuvent affecter la note du modèle.
  • Les évaluations reposent principalement sur des tâches objectives, ce qui rend difficile la prise en compte de l’esthétique et de l’écriture ouverte.
  • Le chinois, les connaissances sectorielles, ainsi que les compétences en sécurité et en confidentialité ne constituent pas l’ensemble des points clés.
  • Les résultats de la programmation d’agents sont influencés par le framework, le nombre d’étapes et l’environnement sandbox.
  • Les chemins de raisonnement direct avec les modèles locaux sont actuellement limités ; il est recommandé officiellement d’utiliser des services compatibles.
  • De hauts scores ne peuvent pas remplacer la vérification des activités réelles et l’évaluation des risques.

GitHub et l’état open source

Le dépôt officiel de LiveBench est maintenu par l’organisation LiveBench et compte environ 1 300 étoiles à ce jour. Le dépôt contient des scripts d’évaluation, des traitements de tâches, une présentation des résultats ainsi qu’un historique des modifications, et il accepte les issues et les contributions de code.

Le fichier LICENSE intègre les textes de licence provenant de sources telles que FastChat et LiveCodeBench, y compris les conditions Apache-2.0 et MIT. L’utilisation, la modification ou la redistribution doivent respecter scrupuleusement les conditions de chaque source ainsi que les déclarations des tiers ; il n’est pas possible de réduire l’ensemble du dépôt à une seule licence.

Informations de base

champContenu
Nom de l’outilLiveBench
Type d’outilBenchmarks dynamiques et classements des grands modèles de langage
Méthode centraleSujets récents, réponses objectives, notation automatique, mises à jour de version
Catégories principalesMathématiques, programmation, programmation d’agents, raisonnement, langage, instructions, analyse de données
ThèseICLR 2025 Spotlight
Utilisation du site webVoir gratuitement
Évaluation localePrend en charge les modèles API et les services compatibles
Tâche de codeDépendances supplémentaires nécessaires, les tâches d’agent requièrent Docker
Est-ce open sourceOui
LicenceInclut des licences tierces telles que Apache-2.0, MIT, etc.

Indice de recommandation

4,7 / 5. LiveBench améliore les problèmes de pollution des classements traditionnels des LLM et de biais des juges grâce à des questions dynamiques et à une évaluation objective, ce qui le rend adapté à la recherche et au choix technologique ; cependant, la comparabilité des versions, la couverture des tâches et les coûts d’exécution nécessitent encore une interprétation prudente.

Questions fréquentes

LiveBench est-il gratuit ?

Les classements, les articles, le code et les données publiques sont accessibles gratuitement. L’évaluation indépendante entraîne des coûts liés aux API du modèle, aux GPU, au calcul et à la maintenance technique.

LiveBench ne pollue-t-il vraiment pas ?

On ne peut pas garantir qu’il n’y en aura absolument pas. Il réduit la probabilité de pollution par de nouvelles questions, des matériaux récents et des mises à jour continues ; pour être plus précis, on peut dire que la pollution est « limitée ».

Pourquoi ne pas utiliser de grands modèles comme arbitres ?

Le projet privilégie les réponses standard et une évaluation certaine, afin d’éviter les préférences du modèle d’arbitrage, les effets de séquence et le biais personnel. La qualité des réponses ouvertes est donc moins prise en compte.

Est-il possible de comparer les scores des différentes versions ?

Il n’est pas recommandé de faire des comparaisons directes. Les sujets, les tâches et le niveau de difficulté peuvent varier ; il faut au moins indiquer en même temps la date de publication, les paramètres du modèle et la version du code.

Peut-on tester son propre modèle ?

Oui. La méthode la plus fiable consiste à déployer le modèle via une interface compatible, puis à utiliser les scripts officiels pour générer des réponses et des notes.

Pourquoi un modèle récent n’apparaît-il pas dans le classement ?

Une évaluation officielle nécessite l’accessibilité de l’API, sa stabilité, ainsi que des ressources budgétaires et du temps ; les modèles trop coûteux ou présentant des temps d’attente excessifs peuvent ne pas permettre de mener à bien des tests équitables.

LiveBench peut-il décider directement de l’achat du modèle ?

Non. Il convient pour un premier tri, mais la qualité, les délais, les coûts, la stabilité et la conformité doivent être testés à l’aide de données commerciales réelles.

LiveBench est-il open source ?

Oui, mais le dépôt contient du code provenant de plusieurs sources ainsi que des textes de licences composées. Lors de la redistribution, il est nécessaire de vérifier les mentions Apache-2.0, MIT et autres déclarations pertinentes.

©️Droit d’auteur : Sauf indication contraire, tous les articles de ce site sont protégés par le droit d’auteur.Partage d’outils d’IATous les droits d’auteur sont réservés. Sans autorisation, aucune personne, média, site web ou groupe ne peut reproduire, copier ou diffuser de quelque manière que ce soit le contenu de ce site, ni créer de mirror sur des serveurs qui ne lui appartiennent pas. Dans le cas contraire, notre site se réserve le droit de poursuivre en justice les responsables conformément à la loi.

Outils similaires à LiveBench