OpenCompass
Kostenloser Mehrwert
Komplette Liste an KI-Tools Bewertung von KI-Modellen

OpenCompass

Eine Bewertungsplattform für große Modelle, die mehrere Modelle, Datensätze sowie mehrdimensionale Indikatoren berücksichtigt.

Tags:

Was ist OpenCompass?

OpenCompass ist eine Open-Source-Plattform zur Bewertung großer KI-Modelle, die vom Shanghai Artificial Intelligence Laboratory ins Leben gerufen wurde. Sie dient dazu, grundlegende Modelle, Chatmodelle sowie multimodale Modelle miteinander zu vergleichen. Die Plattform bietet ein Bewertungssystem, Einstellungen für Datensätze, Anpassungen der Modelle, verteilte Inferenzverfahren, Berechnung von Kennzahlen, Zusammenfassung der Ergebnisse sowie Ranglisten. Sie eignet sich dafür, dass Forschungseinrichtungen, Modellentwicklerteams und Unternehmen wiederholbare Bewertungsprozesse für LLMs etablieren können.

OpenCompass bezieht sich sowohl auf die lokal installierbaren Open-Source-Python-Tools als auch auf die auf der offiziellen Website bereitgestellten Ranglisten für LLMs und VLMs sowie auf Ökosysteme wie CompassHub und CompassRank. Die Ergebnisse der Ranglisten beruhen auf bestimmten Versionen, Prompten, Datensätzen und Bewertungsmethoden und bedeuten nicht, dass die Modelle in allen tatsächlichen Anwendungen besser sind.

Kernfunktionen von OpenCompass

Multidimensionale Fähigkeitsbewertung

Das Fähigkeitsprofil umfasst allgemeine Dimensionen wie Prüfungen, Wissen, Sprache, Verständnis, Schlussfolgerungsfähigkeit und Sicherheit, sowie spezifische Fähigkeiten wie das Arbeiten mit langen Texten, Code, Werkzeugen und der Erweiterung von Wissen. Die Benutzer können vorhandene Bewertungssätze auswählen oder eigene Datensätze und Indikatoren zusammenstellen, die zu ihrem Geschäft passen.

Mehr als hundert Datensätze und konfigurierbare Ausführung

Das Projekt enthält zahlreiche Standards in Chinesisch und Englisch sowie fachspezifische Referenzen. Mit Python können Modelle, Datensätze, Prompts, Inferenzwerkzeuge und Bewertungsmethoden konfiguriert werden. Die Konfigurationen sind erbbar und kombinierbar, was es ermöglicht, dasselbe Modell auf verschiedenen Datensätzen zu bewerten oder mehrere Modelle unter denselben Bedingungen miteinander zu vergleichen.

Lokale Modelle und API-Modelle

OpenCompass kann lokale Modelle wie Hugging Face und InternLM direkt laden, sowie APIs von OpenAI und DeepSeek usw. verbinden. Eigen entwickelte Dienste können mithilfe von LMDeploy, vLLM, SGLang usw. ihre Leistung steigern.

Modell mit geschlossener API benötigt keine lokale Grafikkarte, erzeugt jedoch Token-Kosten und ist den Beschränkungen des Anbieters sowie den Datennutzungsrichtlinien unterworfen.

Objektive Bewertung

Für Aufgaben mit Multiple-Choice-Fragen, Lückenfüllungen und Aufgaben mit standardisierten Antworten können diskriminative oder generative Bewertungsmethoden verwendet werden. Bei der diskriminativen Methode wird die Unklarheit der möglichen Antworten verglichen, während bei der generativen Methode das Modell direkt eine Ausgabe liefert, die anschließend nach festgelegten Regeln verarbeitet wird.

Sowohl die Prompt-Vorlagen, die Few-Shot-Beispiele als auch der Antwortextraktor beeinflussen die Punktzahl. Bei der Wiederholung von Experimenten müssen Konfiguration und Zufallszahlengenerator festgelegt werden.

Subjektive Bewertung und LLM-as-Judge

Für offene Antworten, Sicherheit, Ausdrucksfähigkeit und komplexe Schlussfolgerungen können menschliche oder große Modell-Richter eingesetzt werden. GenericLLMEvaluator ermöglicht die Anpassung von Richterprompts, Referenzantworten und Richtermodellen.

CascadeEvaluator kann zunächst mit Regeln bewertet werden, wobei nur die fehlerhaften Beispiele an den LLM übergeben werden, um die Aufrufkosten zu senken.

Bei der Nutzung von LLMs zur Beurteilung treten Positionenfehler, stilistische Präferenzen, eigene Vorlieben sowie Zufälligkeiten auf. Für hochriskante Schlussfolgerungen sollten mehrere Beurteiler eingesetzt werden, die Reihenfolge der Antworten sollte geändert werden, zufällige Überprüfungen durchgeführt werden, und die Beurteilungsmodelle sowie Vorlagen sollten offengelegt werden.

Verteilte und effiziente Bewertung

Das Framework ermöglicht die Aufteilung von Inferenz- und Bewertungsaufgaben, deren Ausführung auf mehreren GPUs oder Maschinen. Zudem lässt es sich nutzen, um umfangreiche Experimente durch Überwachung der Aufgaben, erneute Ausführung bei Fehlern sowie die dauerhafte Verwaltung der Ergebnisse zu steuern. Eine beschleunigte Inferenz im Backend kann die Durchsatzrate erhöhen, doch unterschiedliche Backends, Quantisierungs- und Parallelisierungs-Einstellungen können die Ergebnisse verändern – diese sollten daher separat dokumentiert werden.

Multimodalität und spezielle Ökologien

Die OpenCompass-Ökosystem umfasst Projekte wie VLMEvalKit und AgentCompass, die jeweils visuelle Sprachmodelle sowie Agent-Fähigkeiten abdecken. Die verschiedenen Unterprojekte haben eigene Installationsmethoden, Datensätze und Lizenzen; nicht alle multimodalen Fähigkeiten können durch einen Befehl im Hauptrepository abgebildet werden.

Ranglisten und Berichte

Die offizielle Website bietet eine Liste der verfügbaren Modelle. Das Framework kann Tabellen, Zusammenfassungen sowie detaillierte Ergebnisse der Tests erstellen. Bei der Betrachtung der Liste sollte man auf das Datum des Modells, die Frage, ob es sich um ein Closed-Source-Modell handelt, die Verunreinigung des Testdatensatzes, die verwendeten Prompts, das Berechnungsbudget sowie die Abdeckung der Beispiele achten – anstatt nur auf die Gesamtpunktzahl zu schauen.

Vergleich der Nutzung und Kosten von OpenCompass

MethodeSoftwarekostenHauptkostenPassende Szenarien
Offizielle RanglisteKostenloser DurchblickKeine direkten BetriebskostenErste Einschätzung der offiziellen Leistungsdaten des Modells
Lokale Open-Source-BewertungKostenlos, Apache 2.0GPU, CPU, Speicher, Energie und EntwicklungszeitOffene Gewichte, private Modelle und reproduzierbare Experimente
Bewertung des API-ModellsRahmen kostenlosDas getestete Modell wird nach Token oder Anfragen abgerechnet.Modelle mit geschlossener Quellcode-Struktur oder Modelle, die nicht lokal installiert werden können
LLM-as-JudgeBewertungskomponenten kostenlosKosten für lokale Rechenleistung des Schiedsmodells oder API-GebührenOffene Fragen, Bewertung von Qualität und Sicherheit
UnternehmensbewertungsdienstleistungenKeine offiziellen, festen PaketeNach Umfang der Zusammenarbeit und DienstleistungenOrganisationen, die angepasste Referenzwerte, Expertenbewertungen sowie Berichte benötigen

Vergleich der Bewertungsmethoden

MethodenGültige AufgabenVorteileEinschränkungen
Regeln/GenauigkeitMultiple-Choice-Fragen, Mathematik, StandardantwortenSchnell, stabil, geringe KostenEine Änderung der Antwortformatierung kann zu Fehlbewertungen führen.
Generative IndikatorenÜbersetzung, Zusammenfassung, CodeBewertbare freie ErstellungAutomatische Indikatoren spiegeln nicht unbedingt die tatsächliche Qualität wider.
LLM JudgeOffene Fragen, Erklärungen und SicherheitKann komplexe Semantik verarbeitenEs gibt Abweichungen, Zufälligkeiten und es können Gebühren anfallen.
Manuelle BewertungHochwertige und professionelle AnwendungenKann im Kontext des jeweiligen Bereichs beurteilt werden.Teuer, langsam und die Konstanz ist nicht gewährleistet.
Kaskadierte BewertungDie Regeln können einen Teil der Beispiele abdecken.Berücksichtigung von Kosten und semantischer BeurteilungEs sind angemessene Bedingungen für eine effektive Umleitung erforderlich.

Anleitung zur Installation von OpenCompass

  1. Vorbereitung der Umgebung:Erstellen Sie eine eigenständige Python-Umgebung; die lokalen Modelle installieren die entsprechenden Abhängigkeiten basierend auf PyTorch, CUDA und der Grafikkarte.
  2. Installationsprojekt:Installieren Sie aus dem offiziellen Repository die stabile oder Entwicklerversion und notieren Sie den Commit-Hash.
  3. Vorbereitung des Datensatzes:Laden Sie die für das Dokument erforderlichen Referenzwerte herunter und überprüfen Sie die Lizenz, den Katalog sowie die Prüfergebnisse.
  4. Wählen Sie die Modellkonfiguration aus:Verwenden Sie die vorhandene lokale oder API-Konfiguration, um den Modellpfad, die Schlüssel, die Konkurrenzfähigkeit und den Kontext einzustellen.
  5. Kleine Tests durchführen:Zuerst werden mit einer kleinen Menge an Daten der Prompt, die Auswertung der Ausgabe, der Arbeitsspeicher sowie die Kosten überprüft, anschließend wird die vollständige Datensammlung ausgeführt.
  6. Ergebnisse ansehen:Überprüfen Sie die Zusammenfassung, die Protokolle sowie die detaillierten Angaben zu den Beispielen – man sollte sich nicht nur auf die endgültige Durchschnittswert konzentrieren.
  7. Speichern von Experimentinformationen:Protokollieren Sie Version des Modells, Datensatz, Konfiguration, Backend, Hardware und Zeit, um eine Wiederholung zu erleichtern.

Bewertung von benutzerdefinierten Datensätzen

  1. Ordnen Sie JSONL oder CSV an, indem Sie die Probleme, die Referenzlösungen, Kategorien und Metadatenfelder klar definieren.
  2. Definieren Sie die Eingabespalten und Ausgabespalten des Dataset Readers sowie die Entwicklungssammlung und die versteckte Testsammlung.
  3. Konfigurieren Sie für das Modell einen Prompt-Template, einen Retriever und einen Inferencer.
  4. Wählen Sie Regeln, Fachindikatoren oder LLM Judge aus und schreiben Sie eine zuverlässige Nachverarbeitungsfunktion.
  5. Der Evaluator wird mit manuell annotierten kleinen Stichproben getestet, anschließend wird das Ausmaß erweitert und die Ergebnisse der Gruppierung analysiert.

Wie man die Bewertungsergebnisse richtig interpretiert

Die Gesamtpunktzahl kann Schwächen in einzelnen Bereichen überdecken; daher sollte man nach Sprache, Bereich, Schwierigkeitsgrad und Sicherheitskategorie betrachten. Der Kontextumfang, die Sampling-Parameter, die Inferenz-Token sowie die Rechte der Tools müssen bei verschiedenen Modellen möglichst konstant sein.

Offene Daten können in das Trainingsmaterial aufgenommen werden, weshalb auch selbst erstellte Datensätze, zeitlich aktualisierte Informationen sowie echte Geschäftsdaten hinzugefügt werden sollten, um zu vermeiden, dass nur die Ranglisten optimiert werden.

Für welche Benutzer geeignet

  • Forscher und Algorithmus-Teams, die die Fähigkeiten großer Open-Source- und Closed-Source-Modelle vergleichen;
  • Führungskräfte im Technologiebereich von Unternehmen, die objektive Kriterien für die Auswahl des Modells festlegen müssen;
  • Teams zur Entwicklung von Modellen für Schlussfolgerungen, Code, Sicherheit, lange Texte oder multimodale Modelle;
  • Entwickler, die die öffentliche Rangliste wiederherstellen und konkrete Beispiele analysieren möchten;
  • Organisationen, die private Datensätze erstellen und kontinuierliche Regressionstests durchführen müssen.

Vorteile und Bedenken

  • Die Vorteile von OpenCompass sind seine Offenheit, eine gut entwickelte chinesische Ökosystem-Struktur, umfangreiche Datensätze und Modellkonfigurationen sowie eine abgeschlossene Prozessabwicklung von der Inferenz über Kennzahlen bis hin zu Berichten.
  • Es eignet sich sowohl als schnelle Referenz als auch zur Erweiterung zu einer Evaluierungsplattform innerhalb der Organisation.
  • Die Installation und eine vollständige Bewertung erfordern erhebliche ingenieurtechnische Anstrengungen sowie Rechenleistung, und das Herunterladen des Datensatzes kann ebenfalls umfangreich sein.
  • Die Bewertungsscoren hängen von dem Prompt, der Extraktion der Antworten, der Backend-Infrastruktur sowie dem Urteiler ab und sollten daher nicht als absolute Rangliste des Modells angesehen werden.
  • Datensätze, Modellgewichte und APIs haben jeweils eigene Lizenzen und Datenschutzbestimmungen; zur Ausführung von Code-Bewertungen sollten zudem isolierte Container verwendet werden.

Häufige Fragen

Ist OpenCompass kostenlos?

Open-Source-Frameworks sind kostenlos und unterliegen der Apache 2.0-Lizenz; eine Übersicht auf der offiziellen Website kann kostenlos eingesehen werden. Die Kosten für lokale Hardware, Cloud-GPUs, Model-APIs sowie Schiedsmodellien trägt der Benutzer.

Kann OpenCompass geschlossene Modelle bewerten?

Ja, es ist möglich, über die entsprechende API eine Verbindung herzustellen, doch dies ist von den Beschränkungen des Anbieters, den Preisen sowie den Datenrichtlinien abhängig.

Unterstützt OpenCompass mehrere Modalitäten?

Die OpenCompass-Ökosystem bietet Tools für die Mehrmodalmessung wie die VLM-Rangliste und VLMEvalKit; zur genauen Installation sowie zu den Datensätzen sollte man sich die entsprechenden Projekte ansehen.

Ist der Erste in der Rangliste unbedingt der Beste?

Nicht unbedingt. Die Rangliste gibt nur bestimmte Benchmarks und Konfigurationen wieder; die Auswahl sollte anhand der tatsächlichen Geschäftsbedingungen, Kosten, Verzögerungen, Sicherheitsaspekte sowie menschlicher Bewertungen getroffen werden.

Ist OpenCompass open source?

Open Source – das Hauptrepository wird unter der Apache License 2.0 bereitgestellt. Einige Datensätze, Modelle sowie Nebenprojekte unterliegen eigenen Bedingungen.

©️ Urheberrechtshinweis: Sofern nicht anders angegeben, liegen die Urheberrechte an allen Artikeln auf dieser Website beiTeilen von AI-ToolsAlle Urheberrechte liegen bei uns. Ohne Genehmigung darf keine Person, kein Medienunternehmen, keine Website oder irgendeine Gruppe den Inhalt dieser Website kopieren, nachahmen oder auf andere Weise verbreiten. Ebenso ist es nicht gestattet, Spiegelseiten auf Servern zu erstellen, die nicht uns gehören. Andernfalls behalten wir uns das Recht vor, rechtliche Schritte gegen die Verantwortlichen einzuleiten.

Werkzeuge, die dem OpenCompass ähneln