Maxim AI
Maxim AI – ein intelligentes Tool, das sich auf die Bewertung von KI-Modellen konzentriert.
Tags:Bewertung von KI-ModellenWas ist Maxim AI?
Maxim AI ist eine End-to-End-Bewertungs- und Observabilitätsplattform von H3 Labs Inc., die für Teams für KI-Produkte, -Engineering und -Qualität entwickelt wurde. Sie vereint Prompt-Experimente, Datensätze, Agentensimulationen, automatische sowie manuelle Bewertungen, Produktionsverfolgung, Qualitätsüberwachung und Alarmfunktionen zu einem einzigen iterativen Prozess.
Maxim ist nicht dafür verantwortlich, grundlegende Modelle für Benutzer zu trainieren, noch führt es eine Rangliste der einzelnen Modelle. Es dient dazu, Modelle, Prompts, Suchfunktionen, Tools sowie Versionen von Agenten miteinander zu vergleichen, um Rückfall- und Fehlermuster aufzudecken, und überwacht nach dem Go-Live kontinuierlich die Qualität, die Kosten, die Verzögerungen sowie die Sicherheit der tatsächlichen Anfragen.
Hauptfunktionen
- Prompt IDE: Vergleicht verschiedene Prompte, Modelle, Parameter, Tools und Kontexte, ohne den Geschäftscode ändern zu müssen. Das Team kann die Ergebnisse der Experimente speichern, Qualität, Kosten und Verzögerungen überwachen und anschließend die für die Bereitstellung geeignete Version auswählen.
- Versionen und Bereitstellung von Prompten: Die Prompten werden aus dem Codepool extrahiert, die Änderungshistorie wird beibehalten, und verschiedene Versionen werden gemäß festgelegten Regeln veröffentlicht. Produkt- und Engineering-Mitarbeiter können in derselben Arbeitsumgebung zusammenarbeiten, wodurch Veränderungen durch Kopieren und Einfügen vermieden werden.
- Hinweisketten und Low-Code-Prozesse: Mehrere Schritte zur Erstellung, Abfrage und Verwendung von Werkzeugen werden zu testbaren Prozessen zusammengefügt – das eignet sich dazu, die Logik der Agenten vor der eigentlichen Implementierung im Code zu überprüfen. Komplexe Berechtigungsregelungen, Wiederholungsversuche sowie Transaktionen müssen weiterhin durch Programmierung umgesetzt werden.
- Multimodale Datensätze: Verwaltung von Testeingaben wie Texten und Bildern sowie den erwarteten Ergebnissen; Unterstützung einer tabellenähnlichen Bearbeitungsmethode. Datensätze können aus Produktionsprotokollen erstellt werden oder auch mit vorhandenen Testbeispielen importiert werden.
- Bewertungswerkzeug-Shop: Bietet vorgefertigte Indikatoren und ermöglicht es Teams, eigene Bewertungswerkzeuge zu entwickeln, um Kriterien wie Richtigkeit, Relevanz, Sicherheit, Formatierung, Suchfähigkeit oder Geschäftsstandards zu messen. Auch die Bewertungsnoten der Modelle können verzerrt sein; in kritischen Szenarien sollten manuelle Referenzwerte hinzugefügt werden.
- Agent-Simulation: Durch verschiedene Benutzerprofile, Ziele und Szenarien werden mehrere Interaktionsrunden erzeugt, um in großem Umfang zu testen, wie Agenten Werkzeuge nutzen, Informationen abrufen und ihren Zustand verwalten. Simulationen eignen sich zur Erweiterung des Abdeckungsbereichs, können aber die tatsächliche Verteilung der Nutzer nicht vollständig widerspiegeln.
- Offline-Bewertung: Vor der Veröffentlichung werden die Kandidatenversionen an einem festen Datensatz ausgeführt, wobei Eingaben, Toolaufrufe, Ausgaben, Metriken sowie die Begründungen für die Bewertung einzeln verglichen werden. Geeignet für Regressionstests, Modellmigrationen und Anpassungen von Prompten.
- Online-Bewertung: Die Produktionsprotokolle werden automatisch nach Filter- und Stichprobenregeln bewertet – und zwar auf Ebene der Sitzung, einer einzelnen Trace-Runde oder eines bestimmten Span-Knotens. Das Team kann Proben mit niedrigen Bewertungen als neues Datensatz verwenden, um einen Kreislauf der kontinuierlichen Verbesserung zu schaffen.
- Verteilte Verfolgung: Mehr-Agenten-Workflows werden mit Session, Trace, Span, Generation, Retrieval und Tool Call dargestellt, wodurch die Eingaben/Ausgaben, Laufzeiten und Fehler jedes Nodes visualisiert werden können.
- Produktionsabstimmung und Alarme: Überwachung von Qualität, Token, Kosten, Verzögerungen, Nutzerfeedback sowie Ausfalltrends; bei Rückgang der Kennzahlen oder Auslösung von Sicherheitsregeln werden Alarme ausgelöst. Die Alarme müssen an Geschäftsrichtwerte und Schichtprozesse angepasst sein und dürfen sich nicht nur auf Standardregeln stützen.
- Manuelle Bewertung: Fachleute aus dem jeweiligen Bereich werden beauftragt, die Beispiele zu bewerten, zu überprüfen und miteinander zu vergleichen. Die Ergebnisse werden anschließend in Berichte aufgenommen. Enterprise bietet außerdem Dienstleistungen zur menschlichen Bewertung an, die von Maxim verwaltet werden.
- Berichte und Dashboards: Zusammenfassung von Experimenten und Online-Metriken, Vergleich verschiedener Versionen sowie Austausch mit Produkt-, Engineering- und Managementebenen. Business bietet benutzerdefinierte Dashboards, Enterprise ermöglicht erweiterte Audits und Service-Level-Agreements.
Typischer Arbeitsablauf
- Die Geschäftsziele des Agents, die inakzeptablen Misserfolge sowie die Nutzergruppen klar definieren, und Genauigkeit, Sicherheit, Kosten und Verzögerungen in messbare Kennzahlen umwandeln.
- Erfasst autorisierte reale Fragen, Grenzfälle und historische Fehler, um Datensätze für die Bewertung außerhalb des Trainings sowie manuelle Referenzlösungen zu erstellen.
- Im Prompt IDE vergleichen Sie Modelle, Prompts, Suchfunktionen und Tool-Einstellungen – prüfen Sie zunächst eine kleine Stichprobe und führen Sie anschließend eine vollständige Offline-Bewertung durch.
- Für die Regeln der Kombination von Schlüsselindikatoren, den Code, die Modellbewertungen sowie die manuelle Überprüfung, um zu vermeiden, dass nur ein einziger automatischer Bewertungsfaktor darüber entscheidet, ob etwas in Betrieb genommen wird.
- Fügen Sie die Bewertung in CI/CD ein, um die Veröffentlichung zu verhindern, wenn die Kandidatenversion unter dem Schwellenwert liegt, und speichern Sie Versionen, Datensätze sowie Bewertungsprotokolle.
- Durch die Integration von Logging und Tracking über das SDK werden Sitzungen, Erstellungen, Abfragen sowie Toolaufrufe mit konsistenten Namen, Tags und Benutzerkontexten versehen.
- Nach dem Go-Live werden Online-Bewertungen, Stichprobenahmen, Dashboards und Alarme eingerichtet, um Qualität, Kosten, Verzögerungen, Fehler sowie Nutzerfeedback zu überwachen.
- Die tatsächlichen niedrigen Werte sowie die abnormalen Spuren werden zu neuen Regressionssamplen zusammengefasst, nach der Korrektur wird erneut ein Offline-Test durchgeführt und die Trends verglichen.
Bewertungsebene
| Ebene | Bewertungsgegenstand | geeignete Indikatoren | Nutzwert |
|---|---|---|---|
| Session | Vollständige mehrfache Sitzungen | Aufgaben erledigt, Kohärenz, Kundenzufriedenheit | Bewertung der End-to-End-Erfahrung |
| Trace | Der vollständige Pfad einer Benutzeranfrage | Richtigkeit, Sicherheit, Kosten und Gesamtdauer | Vergleich der Gesamtleistung in einer Runde |
| Span oder Knoten | Konkrete Schritte wie Suchen, Erstellen, Tools usw. | Rückruf, Format, Erfolgsrate der Tools und lokale Laufzeit | Node mit fehlender Positionierung |
| Dataset Run | Kandidatenversionen auf einem festen Datensatz | Rückkehrwerte, Durchschnittswerte, Unterschiede zwischen den Gruppen | Versionswahl vor dem Go-Live |
| Human Review | Expertenstichprobe und Annotation | Rechtliche Richtigkeit, Tonfall und komplexe Risiken | Kalibrierter automatischer Bewertungsalgorithmus |
Preise und Pakete
| Paket oder Version | Preis | Abrechnungszeitraum | Kernrechte oder -beträge | Für Nutzer geeignet |
|---|---|---|---|---|
| Developer | Kostenlos | Langfristig kostenlos | Maximal 3 Plätze, 1 Arbeitsbereich, 10.000 Einträge pro Monat, 3 Tage Speicherung, E-Mail-Support; begrenzte Anzahl an Datensätzen und Einträgen | Unabhängige Entwickler und kleine Prüfstellen |
| Professional | 29 US-Dollar pro Sitzplatz | Jeden Monat | Unbegrenzte Anzahl an Plätzen, 3 Arbeitsbereiche, 100.000 Einträge pro Monat, 7 Tage Speicherung, Simulationsbetrieb, Online-Bewertung und E-Mail-Support | Ein wachsendes Team in der Zusammenarbeit |
| Business | 49 US-Dollar pro Sitzplatz | Jeden Monat | Keine Einschränkungen bezüglich der Arbeitsbereiche, 500.000 Protokolle pro Monat, 30 Tage Speicherung, RBAC, Verwaltung von PII, automatisierte Ausführung, anpassbare Dashboards sowie Unterstützung für privaten Slack. | Unternehmensteams, die Governance und mehr Protokollierung benötigen |
| Enterprise | Individuelle Kostenschätzung | Vertragsbasis | SSO, VPC-Einsatz, angepasste Protokollierung und -Aufbewahrung, Audit-Protokolle, SLA, Sicherheitsprüfungen, Datentrennung, BAA, Konformität sowie spezieller Kundensupport | Großangelegte oder regulierte Organisationen |
Für Professional und Business wird derzeit eine 14-tägige kostenlose Testphase angeboten. In der Vergleichstabelle sind außerdem die Gebühren für eine Überschreitung der Logdateilimitierung für Professional und Business aufgeführt – es entstehen 1 US-Dollar pro 10.000 Einträge. Bei Developer ist eine Überschreitung nicht zulässig. Genaue Gebühren, jährliche Rabatte sowie Preise für höhere Nutzungsmengen sind auf der Rechnelseite zu entnehmen.
Prüfen vor dem Kauf
- Bestimmen Sie, ob die Statistik-Einheit für die Protokollierung Anfragen, Trace-Daten oder andere Ereignisse ist, und schätzen Sie ab, wie viele Einträge durch mehrere Agentenaufrufe entstehen.
- Die Datenaufbewahrung variiert erheblich – von 3 Tagen bis zu 30 Tagen. Für Fehlerbehebung, Audits sowie Rückführungsproben sollten eigene Strategien zur Datenaufbewahrung entwickelt werden.
- Sitzungsgebühren und Gebühren für die Übersteigung der Löschungslimits existieren gleichzeitig; sowohl die Erweiterung des Teams als auch ein Anstieg der Nutzerzahlen können die Kosten erhöhen.
- Die offiziellen Bedingungen enthalten keine klaren Richtlinien für eine selbstständige Rückerstattung. Vor Abschluss eines Vertrags oder einer Mitgliedschaft sollten die Regeln bezüglich der Stornierung, des Inkrafttretens sowie der Behandlung der ungenutzten Zeitperioden geklärt werden.
Für welche Benutzer geeignet
- Es sind Produkt- und Entwicklerteams erforderlich, um wiederholbare Regressionstests für KI-Agenten durchzuführen.
- Gleichermaßen vergleichen LLM-Entwickler verschiedene Modelle, RAG, Toolaufrufe und Prompt-Versionen.
- Nach dem Go-Live muss das Betriebs- und Plattformteam die Pfade mehrerer Agenten sowie Qualität, Kosten und Verzögerungen überwachen.
- Unternehmen, die RBAC, PII-Verwaltung, Auditing, VPC, SSO oder Compliance-Unterstützung benötigen.
- Branchenstandards lassen sich nur schwer vollständig automatisieren; es sind medizinische, finanzielle, Kundenservice- oder Rechtsunterstützungsteams mit fachkundiger manueller Prüfung erforderlich.
Vorteile
- Es umfasst Experimente vor dem Go-Live sowie Beobachtungen nach dem Go-Live; bei der Offline- und Online-Bewertung können Daten und Kennzahlen geteilt werden.
- Gleichzeitig werden eine kodenfreie Benutzeroberfläche sowie ein mehrsprachiges SDK bereitgestellt, sodass Produktmanager und Entwickler im selben Prozess zusammenarbeiten können.
- Die Verfolgungsgröße reicht bis zu den Such-, Tool- und Erstellungs Knoten, wodurch es leichter fällt, spezifische Fehler bei komplexen Agenten zu lokalisieren.
- Es wird die Kombination aus vorgefertigten, benutzerdefinierten sowie automatischen und manuellen Bewertungen unterstützt, um eine Abhängigkeit von nur einem Bewertungsmodell zu vermeiden.
- Unternehmen können eine VPC-Einrichtung sowie Datentrennung wählen, was für Teams mit Anforderungen an Datengrenzen geeignet ist.
Fähigkeitsgrenzen und Beschränkungen
- Die Bewertungsscores entsprechen nicht den tatsächlichen Geschäftsergebnissen. Ein unzureichendes Datensatzangebot oder Verzerrungen im Bewertungsmechanismus können zu einer falschen Zuversicht führen.
- Da Modelle als Schiedsrichter möglicherweise einen bestimmten Stil oder ihre eigene Modellfamilie bevorzugen, müssen sie durch manuelle Annotationen kalibriert werden.
- Die Produktverfolgung kann Hinweise, Benutzerinhalte, Suchauszüge und Tool-Parameter enthalten; eine unsichere Anbindung kann zu einer größeren Offenlegung sensibler Daten führen.
- Kostenlose und günstige Pakete haben eine kurze Gültigkeitsdauer und eignen sich nicht dafür, langfristige Prüfungsnachweise auf der Plattform zu speichern.
- Die Menge an Protokollen nimmt mit mehr Agenten, Wiederholungsversuchen und der Anzahl der Knoten zu; die Kostenschätzung darf nicht nur anhand der Anzahl der Anfragen der Endbenutzer erfolgen.
- Die Plattform kann Sicherheitstests, Red-Team-Tests, Geschäftsfreigaben und Notfallreaktionen nicht ersetzen; sie ist lediglich ein Teil der Infrastruktur für die Qualitätssteuerung.
SDK und Integration
Maxim bietet SDKs für Python, JavaScript oder TypeScript, Java und Go, mit denen Sessions aus dem Anwendungscode aufgezeichnet, verfolgt, generiert und abgerufen sowie Toolaufrufe durchgeführt und Bewertungen ausgelöst werden können. Die Plattform kann außerdem mit OpenAI, Claude, Gemini, LangChain, LangGraph, CrewAI sowie anderen Modellen oder Frameworks zusammenarbeiten.
- Erstellen Sie im Arbeitsbereich API-Schlüssel und ein Log-Repository, wobei die Umgebungen nach Entwicklung, Test und Produktion getrennt werden.
- Installieren Sie das SDK der entsprechenden Sprache, legen Sie den Schlüssel in die Server-seitige Geheimnisverwaltung und verhindern Sie, dass er im Repository gespeichert wird.
- Initialisieren Sie den Logger, verwenden Sie stabile Identifikatoren für Session und Trace und geben Sie den Schlüsselpunkten Namen sowie Tags.
- Um die Erstellung, Abfrage und Aufrufe von Tools herum werden Eingaben, Ausgaben, Laufzeiten, Token, Kosten und Fehler aufgezeichnet.
- Zunächst sollte die Desensibilisierung und das Sampling im Testumfeld überprüft werden, bevor schrittweise der Produktverkehr freigegeben wird, um das versehentliche Erfassen sensibler Felder zu vermeiden.
- Konfigurieren Sie die Online-Bewertung und -Alarmierung, um Proben mit niedrigen Punktzahlen in das Datensatz oder in die Warteschlange für manuelle Überprüfung zu leiten.
Bifrost – Open-Source-AI-Gateway
Bifrost ist ein Open-Source-AI-Gateway, das unabhängig vom Maxim-Team entwickelt wurde. Es wird unter der Apache 2.0-Lizenz bereitgestellt und ermöglicht es, mehrere Modellanbieter zu verbinden. Zudem übernimmt es Aufgaben wie Routing, Lastverteilung, Fallback-Mechanismen, Limitierung der Datenmenge, Überwachung sowie Protokollierung und Kostenkontrolle. Es kann mit der Maxim-Plattform kombiniert werden – doch die Tatsache, dass Bifrost Open Source ist, bedeutet nicht, dass auch die Maxim-SaaS-Lösung selbst Open Source ist.
- Es kann lokal über eine Container-Lösung oder die Kommandozeile ausgeführt werden und über eine einheitliche Schnittstelle im kompatiblen OpenAI-Anfrageformat mit mehreren Anbietern verbunden werden.
- Unterstützung für adaptive Lastverteilung, Clustern, Plugins, Modellrouting, MCP sowie eine Überwachungsoberfläche; die konkreten Funktionen werden mit jeder Version schnell erweitert.
- Die Standardeinstellungen erfordern eine sichere Absicherung; wenn der Verschlüsselungsschlüssel weggelassen wird, könnten einige lokalen Daten in Klartext gespeichert werden. Produktive Umgebungen sollten nicht nach den Demo-Einstellungen konfiguriert werden.
- Die Kosten für die Aufrufung der Modelle werden weiterhin von den jeweiligen Anbietern berechnet; das Open-Source-Gateway enthält keine Modellquoten.
Open-Source-Zustand
| Komponenten | Öffnungszeiten | Lizenz oder Anleitung |
|---|---|---|
| Maxim-Cloudplattform | Exklusive Dienstleistungen | Keine Lizenz für Open-Source-Produkte |
| Bifrost | Open Source | Apache 2.0 |
| Python SDK | Öffentlicher Lagerplatz | Der aktuelle Repository-Status lautet Apache 2.0 |
| JavaScript, Go, Java SDK | Öffentlicher Lagerplatz | Die aktuellen Lizenzen sollten in jedem Lager separat überprüft werden. |
| Dokumentations-Website-Code | Öffentlicher Lagerplatz | MIT |
| Kochbücher und Beispiele | Öffentlicher Lagerplatz | Beispiel: Offenheit bedeutet nicht, dass der Quellcode der Plattform offen ist. |
Privatsphäre, Sicherheit und Daten
- Die Plattform kann Konten, Google- oder GitHub-Anmeldungen, Kontaktdaten, Nutzungsdaten sowie von Kunden eingereichte Anweisungen, Dateien, Eingaben, Ausgaben und Protokolle verarbeiten.
- Laut den Bedingungen gehören die Kundendaten sowie die Ergebnisse der Verarbeitung dem Kunden oder seinem Lizenzgeber. Maxim erhält lediglich eine eingeschränkte Lizenz, um die Dienstleistungen bereitzustellen, zu betreiben und zu unterstützen.
- Laut den Bedingungen werden die Kundendaten ohne vorherige schriftliche Zustimmung des Kunden nicht verwendet, um Modelle zu trainieren, anzupassen oder zu verbessern, und es werden auch keine Funktionen für andere Kunden entwickelt.
- Die Datenschutzrichtlinie beschreibt die Verschlüsselung sensibler Daten, den zweifaktoriellen Zugriff auf Datenbanken, regelmäßige Sicherheitsaudits, die Minimierung von Daten sowie Maßnahmen zur Zugriffssteuerung und zur Meldung von Datenlecks.
- Die Produktbeschreibungen entsprechen den Anforderungen von SOC 2 Type II, ISO 27001, HIPAA und GDPR; bei regulierten Beschaffungsverfahren sollten weiterhin der aktuelle Umfang der Zertifizierungen, ein DPA, ein BAA sowie eine Liste der Unterauftragnehmer angefordert werden.
- Enterprise bietet die Möglichkeit zur Implementierung innerhalb einer VPC, Datentrennung, anpassbare Speicherung sowie Sicherheitsprüfungen – ideal für Organisationen, denen es nicht gestattet ist, Logs aus ihrem eigenen Umfeld herauszusenden.
- Die Plattform kann Inhalte zur Überprüfung von Sicherheit und Verstößen bearbeiten; die Datenschutzerklärung erwähnt außerdem, dass verbotene Inhalte getrennt von den Nutzeridentifikationen für Vertrauens- und Sicherheitssysteme verwendet werden können.
- Vor der Verbindung sollten Anweisungen, Benutzereingaben, gesuchte Dokumente, Tool-Parameter sowie Modellausgaben auf PII hin überprüft, maskiert und minimiert werden.
Bedingungen und Hinweise zur Bestellung
- Oben auf der Seite mit den allgemeinen Bedingungen bleibt die alte Beschreibung der Online-Kurse aus dem Jahr 2023 erhalten, doch die Bedingungen bezüglich der Kundendaten auf derselben Seite wurden an die aktuelle AI-Plattform angepasst; es bestehen daher textliche Inkonsistenzen aus der Vergangenheit.
- Unternehmenskunden sollten eine gültige Bestellbestätigung sowie einen Hauptdienstleistungsvertrag und einen Datenerfassungsvertrag verlangen, die eindeutig mit den aktuellen Bewertungen, Beobachtungen, dem SDK sowie der Integration mit Bifrost übereinstimmen.
- Bestätigung der Priorität von Daten und Eigentumsrechten an den Ausgaben, Deaktivierung des Modelltrainings, Löschung, Export, Beibehaltung, Einstellung des Services sowie Prüfprotokolle im Vertrag.
- Verstehen Sie die Begriffe SOC, ISO, HIPAA oder GDPR nicht als Garantie dafür, dass Ihre Anwendung automatisch konform ist – der Kunde bleibt weiterhin für die Verwendung, Konfiguration und Information der Nutzer verantwortlich.
Zusammenfassung
Maxim AI eignet sich dazu, die Qualitätskontrolle von Agenten von vorübergehenden manuellen Überprüfungen in einen kontinuierlichen Engineering-Prozess umzuwandeln, der „Experimente, Simulationen, Offline-Bewertungen, CI, Produktionsverfolgung, Online-Bewertungen sowie Rückgängigmachungsdatensätze“ umfasst. Bei der Auswahl des Pakets sollten gleichzeitig die Anzahl der Nutzerplätze, die Menge an Protokollen sowie die Aufbewahrungsfrist berücksichtigt werden. Zudem muss zwischen der proprietären Maxim-Plattform, dem öffentlichen SDK sowie dem open-source Bifrost-Gateway unter Apache 2.0 klar unterschieden werden.
Guigong-Netzwerk-Sicherheitsnummer: 45132202000164