OpenCompass
Eine Bewertungsplattform für große Modelle, die mehrere Modelle, Datensätze sowie mehrdimensionale Indikatoren berücksichtigt.
Tags:Bewertung von KI-ModellenWas ist OpenCompass?
OpenCompass ist eine Open-Source-Plattform zur Bewertung großer KI-Modelle, die vom Shanghai Artificial Intelligence Laboratory ins Leben gerufen wurde. Sie dient dazu, grundlegende Modelle, Chatmodelle sowie multimodale Modelle miteinander zu vergleichen. Die Plattform bietet ein Bewertungssystem, Einstellungen für Datensätze, Anpassungen der Modelle, verteilte Inferenzverfahren, Berechnung von Kennzahlen, Zusammenfassung der Ergebnisse sowie Ranglisten. Sie eignet sich dafür, dass Forschungseinrichtungen, Modellentwicklerteams und Unternehmen wiederholbare Bewertungsprozesse für LLMs etablieren können.
OpenCompass bezieht sich sowohl auf die lokal installierbaren Open-Source-Python-Tools als auch auf die auf der offiziellen Website bereitgestellten Ranglisten für LLMs und VLMs sowie auf Ökosysteme wie CompassHub und CompassRank. Die Ergebnisse der Ranglisten beruhen auf bestimmten Versionen, Prompten, Datensätzen und Bewertungsmethoden und bedeuten nicht, dass die Modelle in allen tatsächlichen Anwendungen besser sind.
Kernfunktionen von OpenCompass
Multidimensionale Fähigkeitsbewertung
Das Fähigkeitsprofil umfasst allgemeine Dimensionen wie Prüfungen, Wissen, Sprache, Verständnis, Schlussfolgerungsfähigkeit und Sicherheit, sowie spezifische Fähigkeiten wie das Arbeiten mit langen Texten, Code, Werkzeugen und der Erweiterung von Wissen. Die Benutzer können vorhandene Bewertungssätze auswählen oder eigene Datensätze und Indikatoren zusammenstellen, die zu ihrem Geschäft passen.
Mehr als hundert Datensätze und konfigurierbare Ausführung
Das Projekt enthält zahlreiche Standards in Chinesisch und Englisch sowie fachspezifische Referenzen. Mit Python können Modelle, Datensätze, Prompts, Inferenzwerkzeuge und Bewertungsmethoden konfiguriert werden. Die Konfigurationen sind erbbar und kombinierbar, was es ermöglicht, dasselbe Modell auf verschiedenen Datensätzen zu bewerten oder mehrere Modelle unter denselben Bedingungen miteinander zu vergleichen.
Lokale Modelle und API-Modelle
OpenCompass kann lokale Modelle wie Hugging Face und InternLM direkt laden, sowie APIs von OpenAI und DeepSeek usw. verbinden. Eigen entwickelte Dienste können mithilfe von LMDeploy, vLLM, SGLang usw. ihre Leistung steigern.
Modell mit geschlossener API benötigt keine lokale Grafikkarte, erzeugt jedoch Token-Kosten und ist den Beschränkungen des Anbieters sowie den Datennutzungsrichtlinien unterworfen.
Objektive Bewertung
Für Aufgaben mit Multiple-Choice-Fragen, Lückenfüllungen und Aufgaben mit standardisierten Antworten können diskriminative oder generative Bewertungsmethoden verwendet werden. Bei der diskriminativen Methode wird die Unklarheit der möglichen Antworten verglichen, während bei der generativen Methode das Modell direkt eine Ausgabe liefert, die anschließend nach festgelegten Regeln verarbeitet wird.
Sowohl die Prompt-Vorlagen, die Few-Shot-Beispiele als auch der Antwortextraktor beeinflussen die Punktzahl. Bei der Wiederholung von Experimenten müssen Konfiguration und Zufallszahlengenerator festgelegt werden.
Subjektive Bewertung und LLM-as-Judge
Für offene Antworten, Sicherheit, Ausdrucksfähigkeit und komplexe Schlussfolgerungen können menschliche oder große Modell-Richter eingesetzt werden. GenericLLMEvaluator ermöglicht die Anpassung von Richterprompts, Referenzantworten und Richtermodellen.
CascadeEvaluator kann zunächst mit Regeln bewertet werden, wobei nur die fehlerhaften Beispiele an den LLM übergeben werden, um die Aufrufkosten zu senken.
Bei der Nutzung von LLMs zur Beurteilung treten Positionenfehler, stilistische Präferenzen, eigene Vorlieben sowie Zufälligkeiten auf. Für hochriskante Schlussfolgerungen sollten mehrere Beurteiler eingesetzt werden, die Reihenfolge der Antworten sollte geändert werden, zufällige Überprüfungen durchgeführt werden, und die Beurteilungsmodelle sowie Vorlagen sollten offengelegt werden.
Verteilte und effiziente Bewertung
Das Framework ermöglicht die Aufteilung von Inferenz- und Bewertungsaufgaben, deren Ausführung auf mehreren GPUs oder Maschinen. Zudem lässt es sich nutzen, um umfangreiche Experimente durch Überwachung der Aufgaben, erneute Ausführung bei Fehlern sowie die dauerhafte Verwaltung der Ergebnisse zu steuern. Eine beschleunigte Inferenz im Backend kann die Durchsatzrate erhöhen, doch unterschiedliche Backends, Quantisierungs- und Parallelisierungs-Einstellungen können die Ergebnisse verändern – diese sollten daher separat dokumentiert werden.
Multimodalität und spezielle Ökologien
Die OpenCompass-Ökosystem umfasst Projekte wie VLMEvalKit und AgentCompass, die jeweils visuelle Sprachmodelle sowie Agent-Fähigkeiten abdecken. Die verschiedenen Unterprojekte haben eigene Installationsmethoden, Datensätze und Lizenzen; nicht alle multimodalen Fähigkeiten können durch einen Befehl im Hauptrepository abgebildet werden.
Ranglisten und Berichte
Die offizielle Website bietet eine Liste der verfügbaren Modelle. Das Framework kann Tabellen, Zusammenfassungen sowie detaillierte Ergebnisse der Tests erstellen. Bei der Betrachtung der Liste sollte man auf das Datum des Modells, die Frage, ob es sich um ein Closed-Source-Modell handelt, die Verunreinigung des Testdatensatzes, die verwendeten Prompts, das Berechnungsbudget sowie die Abdeckung der Beispiele achten – anstatt nur auf die Gesamtpunktzahl zu schauen.
Vergleich der Nutzung und Kosten von OpenCompass
| Methode | Softwarekosten | Hauptkosten | Passende Szenarien |
|---|---|---|---|
| Offizielle Rangliste | Kostenloser Durchblick | Keine direkten Betriebskosten | Erste Einschätzung der offiziellen Leistungsdaten des Modells |
| Lokale Open-Source-Bewertung | Kostenlos, Apache 2.0 | GPU, CPU, Speicher, Energie und Entwicklungszeit | Offene Gewichte, private Modelle und reproduzierbare Experimente |
| Bewertung des API-Modells | Rahmen kostenlos | Das getestete Modell wird nach Token oder Anfragen abgerechnet. | Modelle mit geschlossener Quellcode-Struktur oder Modelle, die nicht lokal installiert werden können |
| LLM-as-Judge | Bewertungskomponenten kostenlos | Kosten für lokale Rechenleistung des Schiedsmodells oder API-Gebühren | Offene Fragen, Bewertung von Qualität und Sicherheit |
| Unternehmensbewertungsdienstleistungen | Keine offiziellen, festen Pakete | Nach Umfang der Zusammenarbeit und Dienstleistungen | Organisationen, die angepasste Referenzwerte, Expertenbewertungen sowie Berichte benötigen |
Vergleich der Bewertungsmethoden
| Methoden | Gültige Aufgaben | Vorteile | Einschränkungen |
|---|---|---|---|
| Regeln/Genauigkeit | Multiple-Choice-Fragen, Mathematik, Standardantworten | Schnell, stabil, geringe Kosten | Eine Änderung der Antwortformatierung kann zu Fehlbewertungen führen. |
| Generative Indikatoren | Übersetzung, Zusammenfassung, Code | Bewertbare freie Erstellung | Automatische Indikatoren spiegeln nicht unbedingt die tatsächliche Qualität wider. |
| LLM Judge | Offene Fragen, Erklärungen und Sicherheit | Kann komplexe Semantik verarbeiten | Es gibt Abweichungen, Zufälligkeiten und es können Gebühren anfallen. |
| Manuelle Bewertung | Hochwertige und professionelle Anwendungen | Kann im Kontext des jeweiligen Bereichs beurteilt werden. | Teuer, langsam und die Konstanz ist nicht gewährleistet. |
| Kaskadierte Bewertung | Die Regeln können einen Teil der Beispiele abdecken. | Berücksichtigung von Kosten und semantischer Beurteilung | Es sind angemessene Bedingungen für eine effektive Umleitung erforderlich. |
Anleitung zur Installation von OpenCompass
- Vorbereitung der Umgebung:Erstellen Sie eine eigenständige Python-Umgebung; die lokalen Modelle installieren die entsprechenden Abhängigkeiten basierend auf PyTorch, CUDA und der Grafikkarte.
- Installationsprojekt:Installieren Sie aus dem offiziellen Repository die stabile oder Entwicklerversion und notieren Sie den Commit-Hash.
- Vorbereitung des Datensatzes:Laden Sie die für das Dokument erforderlichen Referenzwerte herunter und überprüfen Sie die Lizenz, den Katalog sowie die Prüfergebnisse.
- Wählen Sie die Modellkonfiguration aus:Verwenden Sie die vorhandene lokale oder API-Konfiguration, um den Modellpfad, die Schlüssel, die Konkurrenzfähigkeit und den Kontext einzustellen.
- Kleine Tests durchführen:Zuerst werden mit einer kleinen Menge an Daten der Prompt, die Auswertung der Ausgabe, der Arbeitsspeicher sowie die Kosten überprüft, anschließend wird die vollständige Datensammlung ausgeführt.
- Ergebnisse ansehen:Überprüfen Sie die Zusammenfassung, die Protokolle sowie die detaillierten Angaben zu den Beispielen – man sollte sich nicht nur auf die endgültige Durchschnittswert konzentrieren.
- Speichern von Experimentinformationen:Protokollieren Sie Version des Modells, Datensatz, Konfiguration, Backend, Hardware und Zeit, um eine Wiederholung zu erleichtern.
Bewertung von benutzerdefinierten Datensätzen
- Ordnen Sie JSONL oder CSV an, indem Sie die Probleme, die Referenzlösungen, Kategorien und Metadatenfelder klar definieren.
- Definieren Sie die Eingabespalten und Ausgabespalten des Dataset Readers sowie die Entwicklungssammlung und die versteckte Testsammlung.
- Konfigurieren Sie für das Modell einen Prompt-Template, einen Retriever und einen Inferencer.
- Wählen Sie Regeln, Fachindikatoren oder LLM Judge aus und schreiben Sie eine zuverlässige Nachverarbeitungsfunktion.
- Der Evaluator wird mit manuell annotierten kleinen Stichproben getestet, anschließend wird das Ausmaß erweitert und die Ergebnisse der Gruppierung analysiert.
Wie man die Bewertungsergebnisse richtig interpretiert
Die Gesamtpunktzahl kann Schwächen in einzelnen Bereichen überdecken; daher sollte man nach Sprache, Bereich, Schwierigkeitsgrad und Sicherheitskategorie betrachten. Der Kontextumfang, die Sampling-Parameter, die Inferenz-Token sowie die Rechte der Tools müssen bei verschiedenen Modellen möglichst konstant sein.
Offene Daten können in das Trainingsmaterial aufgenommen werden, weshalb auch selbst erstellte Datensätze, zeitlich aktualisierte Informationen sowie echte Geschäftsdaten hinzugefügt werden sollten, um zu vermeiden, dass nur die Ranglisten optimiert werden.
Für welche Benutzer geeignet
- Forscher und Algorithmus-Teams, die die Fähigkeiten großer Open-Source- und Closed-Source-Modelle vergleichen;
- Führungskräfte im Technologiebereich von Unternehmen, die objektive Kriterien für die Auswahl des Modells festlegen müssen;
- Teams zur Entwicklung von Modellen für Schlussfolgerungen, Code, Sicherheit, lange Texte oder multimodale Modelle;
- Entwickler, die die öffentliche Rangliste wiederherstellen und konkrete Beispiele analysieren möchten;
- Organisationen, die private Datensätze erstellen und kontinuierliche Regressionstests durchführen müssen.
Vorteile und Bedenken
- Die Vorteile von OpenCompass sind seine Offenheit, eine gut entwickelte chinesische Ökosystem-Struktur, umfangreiche Datensätze und Modellkonfigurationen sowie eine abgeschlossene Prozessabwicklung von der Inferenz über Kennzahlen bis hin zu Berichten.
- Es eignet sich sowohl als schnelle Referenz als auch zur Erweiterung zu einer Evaluierungsplattform innerhalb der Organisation.
- Die Installation und eine vollständige Bewertung erfordern erhebliche ingenieurtechnische Anstrengungen sowie Rechenleistung, und das Herunterladen des Datensatzes kann ebenfalls umfangreich sein.
- Die Bewertungsscoren hängen von dem Prompt, der Extraktion der Antworten, der Backend-Infrastruktur sowie dem Urteiler ab und sollten daher nicht als absolute Rangliste des Modells angesehen werden.
- Datensätze, Modellgewichte und APIs haben jeweils eigene Lizenzen und Datenschutzbestimmungen; zur Ausführung von Code-Bewertungen sollten zudem isolierte Container verwendet werden.
Häufige Fragen
Ist OpenCompass kostenlos?
Open-Source-Frameworks sind kostenlos und unterliegen der Apache 2.0-Lizenz; eine Übersicht auf der offiziellen Website kann kostenlos eingesehen werden. Die Kosten für lokale Hardware, Cloud-GPUs, Model-APIs sowie Schiedsmodellien trägt der Benutzer.
Kann OpenCompass geschlossene Modelle bewerten?
Ja, es ist möglich, über die entsprechende API eine Verbindung herzustellen, doch dies ist von den Beschränkungen des Anbieters, den Preisen sowie den Datenrichtlinien abhängig.
Unterstützt OpenCompass mehrere Modalitäten?
Die OpenCompass-Ökosystem bietet Tools für die Mehrmodalmessung wie die VLM-Rangliste und VLMEvalKit; zur genauen Installation sowie zu den Datensätzen sollte man sich die entsprechenden Projekte ansehen.
Ist der Erste in der Rangliste unbedingt der Beste?
Nicht unbedingt. Die Rangliste gibt nur bestimmte Benchmarks und Konfigurationen wieder; die Auswahl sollte anhand der tatsächlichen Geschäftsbedingungen, Kosten, Verzögerungen, Sicherheitsaspekte sowie menschlicher Bewertungen getroffen werden.
Ist OpenCompass open source?
Open Source – das Hauptrepository wird unter der Apache License 2.0 bereitgestellt. Einige Datensätze, Modelle sowie Nebenprojekte unterliegen eigenen Bedingungen.
Guigong-Netzwerk-Sicherheitsnummer: 45132202000164