Chatbot Arena Leaderboard
Kostenloser Mehrwert
Komplette Liste an KI-Tools Bewertung von KI-Modellen

Chatbot Arena Leaderboard

Chatbot Arena Leaderboard – ein intelligentes Tool zur Bewertung von KI-Modellen

Tags:

Was ist Arena AI?

Arena AI ist eine Plattform, die generative KI-Modelle durch anonyme Vergleiche mit echten Nutzern bewertet. Sie geht auf Chatbot Arena und LMArena zurück. Wenn Nutzer denselben Prompt eingeben, erhalten sie Antworten von zwei anonymen Modellen, und sie können per Abstimmung das bessere Ergebnis auswählen.

Das Projekt wurde ursprünglich von LMSYS und Forschern der University of California, Berkeley, ins Leben gerufen und entwickelte sich später zu einer eigenständigen Plattform. Die aktuelle offizielle Marke wurde auf Arena vereinfacht; die alte LMSYS-Blogseite dient nur noch zum Verständnis der Geschichte und sollte nicht länger als Hauptzugang zum Produkt genutzt werden.

Die Beziehung zwischen Chatbot Arena, LMArena und Arena

NamePhasen und BedeutungAktuelle Nutzungsempfehlungen
Chatbot ArenaName des ursprünglichen Forschungsprojekts, das im Jahr 2023 begannFür Aufsätze, historische Einführungen und frühe Open-Source-Code-Beispiele
LMArenaMarkenname in der Phase von eigenständigen Websites und UnternehmenWird weiterhin von vielen Medien und Nutzern verwendet
ArenaDerzeitige einheitliche MarkeOffizielle Website, Ranglisten und Produktbeschreibungen haben Vorrang.
LMSYSAkademische Organisationen, die frühe Forschungen initiiertenKann nicht vollständig mit dem aktuellen Unternehmen Arena und all seinen Produkten gleichgesetzt werden.

Wie funktioniert Arena?

  1. Wählen Sie Text, Bilder, Videos, Code oder etwas anderes aus, das für die Aufgabe geeignet ist.
  2. Geben Sie einen echten Prompt ein, der die Fähigkeiten des Modells unterscheiden kann.
  3. Die Plattform stellt zufällig zwei anonyme Modelle bereit und erzeugt gleichzeitig die Ergebnisse.
  4. Vergleichen Sie die beiden Seiten hinsichtlich Genauigkeit, Hilfreichkeit, Stil und Erfüllungsgrad der Aufgabe.
  5. Wählen Sie: A ist besser, B ist besser, Unentschieden oder beides ist schlecht.
  6. Nach dem Einreichen der Abstimmung die wahre Identität des Modells ansehen.
  7. Setzen Sie das Gespräch fort oder beginnen Sie eine neue Runde, um die Präferenzdaten in ein öffentliches Bewertungssystem aufzunehmen.

Kernfunktionen

1. Anonyme Modell-Kämpfe

Im Battle-Modus werden die Namen der Modelle vor der Abstimmung verdeckt, um die Bekanntheit der Marken sowie die Vorurteile der Nutzer zu verringern. Die Antworten selbst können dennoch den Stil des Modells offenbaren; daher kann das Anonymisierungsverfahren nur Vorurteile verringern, sie aber nicht vollständig beseitigen.

2. Menschliche Präferenzen bei der Stimmabgabe

Die Plattform verlässt sich nicht auf feste Standardantworten, sondern lässt echte Nutzer entscheiden, welche Ergebnisse nützlicher sind. Sie eignet sich besonders gut zur Bewertung von Aufgaben wie Schreiben, Dialogen, Bildern sowie für offene Aufgaben, die sich nicht mit einer einzigen Zahl bewerten lassen.

3. Mehrspur-Rankingliste

Arena hat sich von reinen Textchats auf Bilder, Videos, Code, visuelle Inhalte und weitere spezielle Bereiche erweitert. Die Eingabedaten, die verfügbaren Modelle sowie die Bewertungskriterien unterscheiden sich in den verschiedenen Kategorien, weshalb die Ranglisten nicht direkt miteinander verglichen werden können.

4. Direktemodus

Neben anonymen Kämpfen können die Nutzer auch direkt bekannte Modelle zum Testen auswählen. Der Direct-Modus eignet sich zur Überprüfung bestimmter Modelle, doch nur Stimmen, die den Regeln der anonymen Bewertung entsprechen, sollten die Rangliste beeinflussen.

5. Offene Forschung und Datensätze

Arena veröffentlicht wissenschaftliche Artikel, Analysen sowie aufbereitete Datensätze zu menschlichen Präferenzen zur Erforschung von Modellbewertungen, adversativen Angriffen, übermäßigem Ablehnen und Suchfähigkeiten. Die öffentlich zugänglichen Daten unterliegen eigenen Datenschutzbestimmungen und Lizenzen und dürfen nicht als vollständige, ursprüngliche Plattformdaten angesehen werden.

Übersicht der Hauptfunktionen

  • Lassen Sie zwei anonyme AI-Modelle zur gleichen Aufgabe antworten und vergleichen Sie sie nebeneinander.
  • Stimmenmöglichkeiten für Sieg, Unentschieden und beides sind möglich.
  • Nach der Abstimmung wird die Identität des Modells offenbart, um Vorurteile gegenüber der Marke vor der Abstimmung zu verringern.
  • Ständig aktualisierte Ranglisten für Texte, Bilder, Videos und Code.
  • Überprüfen Sie die Leistung der Modelle nach Kategorie, Sprache oder Aufgabe in detaillierter Form.
  • Wählen Sie direkt ein bestimmtes Modell aus, um es auszuprobieren und die Ergebnisse zu überprüfen.
  • Testmodelle, die noch nicht offiziell veröffentlicht wurden oder unter einem Codenamen vorliegen.
  • Öffentliche Daten zu menschlichen Präferenzen, wissenschaftliche Arbeiten und Bewertungsmethoden.
  • Die zusammengefassten Rückmeldungen der Gemeinschaft werden genutzt, um die Entwickler des Modells dabei zu unterstützen, das Produkt zu verbessern.

Wie versteht man die Punktzahlen in der Rangliste?

Arena fasst zahlreiche Paarvergleiche von Siegen und Niederlagen zu einer Rangliste der relativen Fähigkeiten zusammen. Dabei werden in der Regel statistische Modelle für Paarvergleiche wie Bradley-Terry verwendet, wobei zur Schätzung der Unsicherheit auch Resampling-Methoden eingesetzt werden. Die Nutzer bezeichnen die Ergebnisse oft als Elo-Werte, doch die genaue Berechnungsmethode sollte gemäß den Vorgaben der Rangliste festgelegt werden.

Indikatoren oder KonzepteWas steht darunter?Das sagt nichts aus.
Arena ScoreDie relative Präferenzstärke des Modells in den aktuellen AbstimmungsdatenNicht die absolute Genauigkeit oder der allgemeine Intelligenzquotient.
RankDie Position unter Berücksichtigung der festgelegten Ranglisten und StatistikregelnEs kann nicht garantiert werden, dass es im echten Geschäftsbetrieb besser sein wird.
KonfidenzintervallUnsicherheit bezüglich der Rangfolge und der PunktzahlenBei überschneidenden Intervallen sollte man keine großen Unterschiede in den Rängen betonen.
Anzahl der StimmenGröße der für die Schätzung verwendbaren KampfbeispieleEine große Anzahl bedeutet nicht, dass die Stichprobe keinen Verzerrungen aufweist.
KlassifikationslisteDie relative Leistung des Modells bei bestimmten Aufgaben oder in bestimmten SprachenKann die Aufgabe, eigene Tests zu erstellen, nicht ersetzen.

Wie man effektive Kontrasthinweise gestaltet

  1. Wählen Sie aus Ihren eigentlichen Aufgaben ein konkretes Problem aus, anstatt nur allgemeine Fragen zu stellen.
  2. Geben Sie den notwendigen Hintergrund, die Eingabedaten, die Einschränkungen sowie das gewünschte Ausgabeformat an.
  3. Vermeiden Sie die Einbeziehung von persönlichen Daten, Geschäftsgeheimnissen und nicht veröffentlichten Materialien.
  4. Lassen Sie die beiden Modelle dieselbe Aufgabe erledigen, ohne die Bewertungskriterien unterwegs zu ändern.
  5. Zuerst werden die Fakten, die Schlussfolgerungen und die Einhaltung der Anweisungen unabhängig überprüft, anschließend wird der Ausdrucksstil verglichen.
  6. Wenn es schwierig ist, eine Entscheidung zu treffen, sollte man auf Unentschieden oder „beides ist gleich schlecht“ zurückgreifen – es ist nicht notwendig, unbedingt einen Sieger zu ermitteln.
  7. Für kritische Aufgaben werden mehrere verschiedene Proben wiederholt, anstatt die Wahl auf einen einzigen Kampf zu stützen.

Für welche Benutzer geeignet

  • Normale AI-Nutzer, die verschiedene fortschrittliche Modelle ausprobieren möchten.
  • Entwickler, die über grundlegende Fähigkeiten in der Modellierung, im logischen Denken, in der Programmierung sowie in visuellen Aufgaben verfügen, sind erforderlich.
  • Wissenschaftler, die Methoden zur Messung von menschlichen Vorlieben und zur Sortierung von Modellen erforschen.
  • Branchenbeobachter, die die relative Leistung neuer Modelle im Vergleich zu Vorab-Modellen verfolgen.
  • Es sind externe Referenzen sowie Produkt- und Technikteams erforderlich, um die Modellwahl zu treffen.
  • Laboratorien und Hersteller, die hoffen, das Modell durch echte Nutzerfeedbacks zu verbessern.
  • Prüfer, die Angriffe auf Ranglisten, Vorurteile und die statistische Zuverlässigkeit untersuchen.

Verschiedene Arenen und Anwendungsgebiete

  • Textdialog: Vergleich von Wissen, Schlussfolgern, Kreativität und Befolgung von Anweisungen.
  • Code: Vergleich der Codegenerierung, -korrektur, der Implementierung der Benutzeroberfläche und der Nutzung von Tools.
  • Bild: Vergleich von Text-basierten Bildgenerierung, Bearbeitung und Einhaltung von Prompten.
  • Video: Vergleich der Qualität und Kohärenz von Videos, die aus Texten oder Bildern erstellt werden.
  • Visuelle Verständnis: Vergleich von Bild-Frage-Antwort-, Diagramm-, OCR- und multimodalem Reasoning.
  • Suche und Recherche: Vergleich von Suchergebnissen, Zitaten, Aktualität und umfassenden Antworten.
  • Spezifische Sprachen: Beobachtung der relativen Präferenzen des Modells für Chinesisch und andere Sprachen.

Kostenlos und Anmeldeanforderungen

Arena bietet der Öffentlichkeit kostenlosen Zugang zu Modellkämpfen und Ranglisten. Es gibt keine kostenpflichtigen Pakete für normale Nutzer. Verschiedene Modelle können Unterbrechungen in der Nutzung, Geschwindigkeitsbeschränkungen, regionale Einschränkungen sowie Limits bezüglich des Anmeldens oder der täglichen Nutzung aufweisen. Zudem kann die Plattform ihre Kapazitäten anpassen.

FunktionenPreisKonten und Einschränkungen
Die Rangliste ansehenKostenlosNormalerweise kann man direkt darin blättern.
Anonyme Modell-KämpfeKostenlosEs kann sein, dass ein Anmelden erforderlich ist und es Limits hinsichtlich der Geschwindigkeit oder der Kapazität gibt.
Direkte Modelle-ExperienceKostenlosDie verfügbaren Modelle und Anzahl der Durchführungen können sich ändern.
ForschungsdatensätzeNach Eröffnung der entsprechenden SeiteEs müssen die Lizenzen und Nutzungsbedingungen des Datensatzes eingehalten werden.
Modellhersteller-BewertungskooperationKein offizieller einheitlicher PreisAlleinige Koordination durch Arena und Partner

Wie man Modelle richtig mithilfe der Rangliste auswählt

  • Wählen Sie zunächst die Sparte, die Sprache und die Kategorieliste aus, die am nächsten zum Geschäftsfeld liegen.
  • Betrachten Sie die Scores und Konfidenzintervalle – schauen Sie nicht nur auf den Erstplatzierten und die geringen Unterschiede in den Rängen.
  • Stellen Sie sicher, dass die Modellversion in der Rangliste mit der tatsächlich erhältlichen Version übereinstimmt.
  • Filterung unter Berücksichtigung von Kosten, Verzögerungen, Kontext, Datenrichtlinien und Implementierungsweise.
  • Erstellen Sie ein internes Testset mit echten Geschäftsdaten.
  • Es werden getrennt voneinander die Fakten, der Code, die Sicherheit, die Aufrufe von Tools sowie die strukturierte Ausgabe getestet.
  • Nach dem Go-Live wird die Aktualisierung des Modells sowie die Kundenfeedbacks kontinuierlich überwacht.

Vorteile der Rangliste

  • Die Verwendung offener Anweisungen mit echten Nutzern kommt der täglichen Erfahrung näher als statische Prüfungen.
  • Die anonyme Präsentation verringert bestimmte Markenvoreingenommenheiten und den Einfluss des Rufs des Modells.
  • Paarvergleiche machen es einfacher zu beurteilen, da die Benutzer absolute Punktzahlen angeben müssen.
  • Modelle und Abstimmungen werden ständig aktualisiert, um schnell die Leistung der neuen Versionen widerzuspiegeln.
  • Deckt Texte, Bilder, Videos, Code und multimodale Bereiche ab.
  • Offene Forschung, Methoden und Teildaten ermöglichen eine externe Überprüfung.
  • Kleine Labore dürfen unter demselben Mechanismus wie große Hersteller Nutzerbewertungen erhalten.

Einsatzbeschränkungen und Methodenfehler

  • Wähler und Hilfestellungen stammen von frei gewählten Nutzern und können nicht alle Länder, Branchen und Bevölkerungsgruppen repräsentieren.
  • Benutzer bevorzugen möglicherweise längere, selbstbewusstere oder stilvollere Antworten statt präzisere.
  • Anonyme Modelle können dennoch durch Formulierungen, Formatierung und Stil der Ablehnung identifiziert werden.
  • Die Rangliste ist eine relative Sortierung; Veränderungen im Modellpool und in der Kampfdistribution beeinflussen die Punktzahlen.
  • Kleine Unterschiede in den Rängen haben möglicherweise keine statistische Bedeutung und sollten im Zusammenhang mit den Konfidenzintervallen interpretiert werden.
  • Die Vorschauversion des Modells kann in Bezug auf Hinweise, Stichproben oder Einstellungen von der veröffentlichten Version abweichen.
  • Böswillige Abstimmungen, koordinierte Angriffe und Datenverunreinigungen erfordern eine kontinuierliche Absicherung.
  • Allgemeine menschliche Präferenzen können die Bewertung von medizinischen, rechtlichen, sicherheitstechnischen und unternehmerischen Aufgaben nicht ersetzen.

Privatsphäre und Einreichung von Inhalten

Offiziell wird mitgeteilt, dass die von den Nutzern eingereichten Anmerkungen gesammelt werden, um eine faire und transparente Bewertung zu ermöglichen. Ein Teil der Rückmeldungen kann außerdem an die Entwickler des Modells weitergegeben werden. Die Nutzer sollten Arena als öffentliches Forschungs- und Bewertungsumfeld betrachten und nicht als privates Chatwerkzeug für die Verarbeitung vertraulicher Daten.

  • Geben Sie keinen Namen, keine Kontaktdaten, keine Account-Informationen, kein Passwort und keine Identitätsdaten ein.
  • Fügen Sie keine internen Firmencodes, Kundendaten oder nicht veröffentlichte Dokumente ein.
  • Für Bilder und Videos dürfen nur Materialien verwendet werden, die man selbst besitzt oder für die man eine Genehmigung hat.
  • Für Probleme in sensiblen Branchen sollten synthetische oder geminderte Proben verwendet werden.
  • Überprüfen Sie vor der Abstimmung, ob die Antworten sensible Inhalte aus den Eingaben preisgeben.
  • Beim Einsatz öffentlicher Datensätze müssen die Regeln zur Datenschutzfilterung, zu Lizenzen und zur Weiterverbreitung eingehalten werden.

Open-Source-Projekte und Datensätze

Die frühe Version von Chatbot Arena basierte auf der Plattform LMSYS FastChat. FastChat wird unter der Apache-2.0-Lizenz bereitgestellt und bietet Dienste für verschiedene Modelle, eine Web-Oberfläche sowie Code zur Bewertung. Die heutige Arena-Plattform verfügt über weitere spezielle Funktionen sowie kommerzielle Einsatzmöglichkeiten – die ursprüngliche Version kann daher nicht vollständig als Abbild der aktuellen Plattform dienen.

  • FastChat enthält einen Modell-Service, eine Dialogoberfläche und eine frühe Implementierung von Arena.
  • Arena veröffentlicht auf Plattformen wie Hugging Face die verarbeiteten Daten zu menschlichen Präferenzen.
  • In den entsprechenden Artikeln werden anonyme Paarabstimmungen sowie Methoden zur Sortierung vorgestellt.
  • Visuelle Aspekte, Suchfunktionen, übermäßige Ablehnung sowie Angriffe auf Ranglisten werden jeweils eigens erforscht.
  • Offener Quellcode, Forschungsdaten und Online-Plattformen sind drei unterschiedliche Bereiche.
  • Der ursprüngliche GitHub-Link für StableLM in der Datenbank hat nichts mit dem Arena-Projekt zu tun und sollte nicht als offizielle Quelldatei verwendet werden.

Warum kann man nicht nur auf die Arena-Rangliste schauen?

  • Betriebskosten und Verzögerungen fließen nicht in die allgemeine Präferenzbewertung ein.
  • Die Datenaufbewahrung, Privatsphäre, Konformität und Lieferbedingungen müssen separat bewertet werden.
  • Strukturierte Ausgaben, Toolaufrufe und Langzeitteststabilität können an ausreichenden Beispielen mangeln.
  • Die Anzahl der Hinweise für spezifische Branchen im Chinesischen kann geringer sein als bei allgemeinen Englisch-Aufgaben.
  • Nach dem Update des Modells kann es zu einer vorübergehenden Diskrepanz zwischen der Version der Rangliste und der tatsächlichen API-Version kommen.
  • Hochriskante Aufgaben erfordern umso mehr reproduzierbare Tests und Expertenprüfungen.

Plattform und Open-Source-Zustand

ProjektAktuelle Situation
Der aktuelle NameArena AI, früherer Name LMArena und Chatbot Arena
ProduktformWebseiten-Modell-Kämpfe, direkte Erfahrung und öffentliche Ranglisten
PreisDie öffentlichen Funktionen sind kostenlos – es gibt keine kostenpflichtigen Pakete für normale Nutzer.
Entwickler-APIEs wird keine einheitliche API für das Modell-Reasoning für normale Benutzer bereitgestellt.
Frühe Open-Source-ProjekteLMSYS FastChat, Lizenz Apache-2.0
Offene DatenVeröffentlichung des nach der Verarbeitung bereitgestellten Datensatzes zu menschlichen Präferenzen sowie des Forschungspapiers
Ist es insgesamt open source?Nein, die aktuelle vollständige Plattform ist nicht gleich dem früheren FastChat-Repository.

Grundlegende Informationen

FelderInhalt
Name des ToolsArena AI
Historischer NameLMArena, Chatbot Arena
UrsprungLMSYS und Forschungsprojekte der University of California, Berkeley
Arten von WerkzeugenBlinde Tests für KI-Modelle, Ranglisten und Plattformen für die Bewertung unter Berücksichtigung menschlicher Vorurteile
KernmechanismusAnonyme Paar-Kämpfe und Nutzerabstimmungen
Überlappende ModiTexte, Bilder, Videos, Code und multimodale Inhalte
PreismusterKostenlos
Wird eine Reasoning-API bereitgestellt?Nein
Ob Open SourceFastChat wurde ursprünglich unter Open Source veröffentlicht; die aktuelle Plattform ist nicht vollständig open source.

Empfehlungswert

4,7 / 5. Arena AI ist eine wichtige Referenz, um die tatsächlichen Präferenzen und Erfahrungen echter Nutzer sowie die Leistungsfähigkeit neuer Modelle zu beurteilen. Anonyme Wettkämpfe sowie öffentliche Untersuchungen haben einen besonderen Wert. Doch die Ranglisten stellen keine objektiven, umfassenden Bewertungen dar. Bei der Auswahl eines Modells müssen interne Anforderungen, Kosten, Sicherheitsaspekte sowie Anforderungen an die Implementierung berücksichtigt werden.

Häufige Fragen

Sind LMArena und Chatbot Arena derselbe Plattform?

Sie gehören zur gleichen Entwicklungsphase eines Projekts; die derzeitige Marke ist Arena. Chatbot Arena war der ursprüngliche Name, LMArena ist eine später entstandene eigenständige Marke.

Ist Arena AI kostenlos?

Öffentliche Kämpfe, die Direktnutzung sowie die Ranglisten sind derzeit kostenlos, doch die Verfügbarkeit der Modelle, die Wartezeiten sowie die Anzahl der Nutzungsmöglichkeiten können je nach Kapazität angepasst werden.

Kann man vor der Abstimmung den Namen des Modells sehen?

Im Battle-Modus wird die Identität nicht angezeigt; sie wird erst nach Abgabe der Stimme offenbart. Im Direct-Modus können die Nutzer direkt bekannte Modelle auswählen.

Ist das Modell auf Platz eins der Rangliste das beste?

Nicht unbedingt. Die Rangliste spiegelt die relativen Präferenzen unter einer bestimmten Verteilung von Nutzern und Anweisungen wider; bei der tatsächlichen Auswahl müssen außerdem Genauigkeit der Aufgabe, Kosten, Verzögerungen, Privatsphäre und Implementierung berücksichtigt werden.

Bietet Arena eine Modell-API an?

Es gibt keine einheitliche Produktionsschließung-API für gewöhnliche Entwickler. Sie wird hauptsächlich für das Erleben, den Wettkampf und die Bewertung verwendet und ist keine Plattform zur Aggregation von Modellen.

Ist Arena Open Source?

Früher war FastChat sowie ein Teil der Forschungsdaten öffentlich zugänglich, doch die aktuelle vollständige Arena-Website, alle Wettkampfkategorien und das Betriebssystem können nicht als ganzheitlich open source angesehen werden.

©️ Urheberrechtshinweis: Sofern nicht anders angegeben, liegen die Urheberrechte an allen Artikeln auf dieser Website beiTeilen von AI-ToolsAlle Urheberrechte liegen bei uns. Ohne Genehmigung darf keine Person, kein Medienunternehmen, keine Website oder irgendeine Gruppe den Inhalt dieser Website kopieren, nachahmen oder auf andere Weise verbreiten. Ebenso ist es nicht gestattet, Spiegelseiten auf Servern zu erstellen, die nicht uns gehören. Andernfalls behalten wir uns das Recht vor, rechtliche Schritte gegen die Verantwortlichen einzuleiten.

Werkzeuge, die der Chatbot Arena Leaderboard ähneln