LangWatch
Kostenloser Mehrwert
Komplette Liste an KI-Tools Bewertung von KI-Modellen

LangWatch

LangWatch – ein intelligentes Tool, das sich auf die Bewertung von KI-Modellen konzentriert.

Tags:

Was ist LangWatch?

LangWatch ist eine open-source LLMOps-Plattform für große Sprachmodell-Anwendungen und AI-Agenten, die von Reasoning Engine B.V. betrieben wird. Sie verbindet Überwachung, Bewertung, Agentensimulation, Prompt-Management, AI-Gateway sowie Governance-Funktionen miteinander und unterstützt Teams dabei, vom Entwicklungs- und Testprozess bis hin zum Betrieb in der Produktion.

Die Plattform verwendet OpenTelemetry zur Erfassung und Organisation von Tracking-Daten und unterstützt gehostete Clouds, vollständig selbst gehostete Lösungen, unternehmensspezifische Clouds sowie hybride Implementierungen. Entwickler können Probleme in Modellaufrufen, Toolnutzung und Benutzer-Sessions erkennen und tatsächliche Fälle in Bewertungen und Szenario-Tests umwandeln.

Überblick über die wichtigsten Fähigkeiten

FähigkeitsmoduleLösung der ProblemeTypische Ausgaben
ObservabilityVerstehen, wie Modelle, Werkzeuge und Agenten funktionierenTracking, Span, Metriken, Kosten und Alarme
EvaluationsMessung von Qualität, Sicherheit und ZuverlässigkeitExperimentelle Punktzahlen, Online-Bewertungen, Guardrails und Regressionsergebnisse
Agent SimulationsVor der Veröffentlichung vollständige Gespräche und Verhaltensweisen testenSzenenerfüllung, simulierte Benutzer, Ursachen für Misserfolge und Testberichte
Prompt ManagementZentrale Verwaltung von Hinweisen und VersionenTipps zu Vorlagen, Variablen, Versionen, Playground und Optimierungsergebnissen
AI GatewayEinheitliche Modellaufrufe, Budgets und RoutingVirtuelle Schlüssel, Routing, Caching, Limits und Schutzmaßnahmen
AI GovernanceKontrolle des Team-Zugriffs und ProduktionsrisikenRechte, Auditing, Ausgaben und Organisationsführung

LLM und Agenten-Überwachbarkeit

LangWatch protokolliert automatisch Aufrufe großer Sprachmodelle, die Verwendung von Tools, Suchvorgänge, Fehler sowie Benutzerinteraktionen und zeigt dabei den vollständigen Ausführungspfad an. Das Team kann Eingaben und Ausgaben, Tokens, Kosten, Verzögerungen, Modelle, Benutzer sowie benutzerdefinierte Metadaten einsehen.

  • Filtern Sie die Nachverfolgung nach Projekt, Benutzer, Modell, Prompt oder Version.
  • Überprüfen Sie die mehrstufige Ausführungsreihenfolge von verschachtelten Spans und Agenten.
  • Fehler bei der Ortung, langsame Aufrufe und ungewöhnliche Kosten.
  • Einführung von Dashboards für die Produktionsqualität und Geschäftsindikatoren.
  • Durch Benutzerereignisse wird die Rückmeldung mit der konkreten Verfolgung verknüpft.
  • Die Analysedaten werden in ein externes System exportiert.
  • Die Qualität der Benutzung von Alarmen und automatischen Reaktionen nimmt ab.

OpenTelemetry und Integration

Die Tracking-Schicht basiert auf OpenTelemetry, wodurch sowohl das LangWatch SDK genutzt werden kann als auch Daten von anderen kompatiblen Bibliotheken empfangen werden. Die direkte Integration umfasst gängige Proxy-Frameworks, Modellanbieter und Automatisierungsplattformen.

Integrierte KategorienVertretende ProjekteVerwendung
Agenten und AnwendungsframeworksLangChain, LangGraph, Mastra, CrewAI und Google ADKAutomatische Erfassung von Modellen, Tools und Agenten-Spannungen
ModellanbieterOpenAI, Anthropic, Azure, Google Cloud, AWS und GroqProtokollierung von Modellanfragen, -antworten, Tokens und Kosten
Lokales ModellOllamaBeobachtung von privaten oder lokalen Inferenzprozessen
Low-Code-PlattformenLangFlow, Flowise und n8nZur Visualisierung von Prozessen: Hinzufügen von Tracking und Bewertung
StandardprotokollOTLPAnbindung an andere OpenTelemetry-kompatible Dienste

Offline-Experimente

Experimente dienen dazu, vor dem Einsatz Modelle, Vorlagen oder Proxy-Versionen an einem festen Datensatz auszuprobieren und die Ergebnisse sowie Bewertungen für jede Probe aufzuzeichnen. Das Team kann Experimente über die Benutzeroberfläche, Python oder TypeScript durchführen und anschließend die Qualität, Kosten und Verzögerungen der verschiedenen Konfigurationen vergleichen.

  1. Erstellen Sie Datensätze, die echte Aufgaben repräsentieren.
  2. Wählen Sie die aktuelle Produktionsversion als Basis aus.
  3. Definieren Sie die Hinweise, Modelle oder Agentenkonfigurationen, die verglichen werden sollen.
  4. Konfigurieren Sie einen eingebauten oder benutzerdefinierten Bewertungsalgorithmus für die Ausgabe.
  5. Alle Proben werden parallel ausgeführt und die Verfolgung aufgezeichnet.
  6. Vergleichen Sie Punkte, Fehler, Verzögerungen und Kosten.
  7. Fügen Sie die fehlerhaften Beispiele dem Regressionsdatensatz hinzu.
  8. Führen Sie die Anforderungen an die Mindestqualität in die Kontrollmechanismen für kontinuierliche Integration ein.

Online-Bewertungen

Die Online-Bewertung führt nach Erreichen der Produktverfolgung automatisch den festgelegten Bewertungsmechanismus aus, um kontinuierlich Authentizität, Relevanz, Sicherheit, PII oder benutzerdefinierte Geschäftsindikatoren zu überwachen. Sie eignet sich zur Erkennung von Qualitätsveränderungen, die durch Veränderungen bei Benutzern, Modellen und Daten entstehen.

BewertungsmethodeAusführungszeitpunktgeeignete Anwendungen
Offline-ExperimentVor der Veröffentlichung für feste DatensätzeVergleich von Hinweisen, Modellen und Agentenversionen
Online EvaluationNach Erhalt der ProduktverfolgungÜberwachung von Qualitätsentwicklungen und außergewöhnlichen Proben
GuardrailSynchronisierte Ausführung vor und nach dem Aufruf des ModellsEchtzeit-Blockierung von Jailbreaks, PII oder unzulässigem Inhalt
Künstliche AnnotationÜberprüfung der ausgewählten Tracking- oder DatensätzeExperten-Labels, Präferenzen und umstrittene Fälle

Echtzeit-Schutzbügel

Der Prüfer kann im Anwendungscode als Guardrail synchron ausgeführt werden und je nach Ergebnis entweder zulassen oder blockieren. Er eignet sich zur Erkennung von Jailbreaks an der Eingangsseite, zur Sicherheitsüberprüfung an der Ausgangsseite sowie zur Überprüfung wichtiger Geschäftsregeln, erhöht jedoch die Aufrufverzögerungen und die Anzahl der Ereignisse.

  • Detektion von Jailbreaks und Prompt-Injectionen.
  • Erkennen von PII und sensiblen Informationen.
  • Überprüfen Sie auf toxische, schädliche oder rechtswidrige Inhalte.
  • Überprüfen Sie die Treue und Relevanz der RAG-Antworten.
  • Ausführung von LLM-as-a-Judge oder Bewertung mit benutzerdefiniertem Code.
  • Bei einem Fehler wird eine Sicherheitshinweis angezeigt oder es wird auf die manuelle Bearbeitung umgeleitet.

Bewertungstools und Workflows

LangWatch bietet eingebaute Bewertungstools wie RAGAS, Halluzinationen, Toxizität, PII sowie Model-Richtlinien. Zudem ermöglicht es Teams, wiederverwendbare, organisatorische Bewertungstools zu erstellen. Komplexe Bewertungen können durch die Kombination mehrerer Schritte und Entscheidungen in Workflows durchgeführt werden, wobei individuelle Bewertungsscores den jeweiligen Trackings oder Spans zugeordnet werden können.

Datensätze und Annotationen

Datensätze können über SDKs und APIs verwaltet werden, auch aus der Produktionsüberwachung extrahiert oder mit Hilfe von KI erzeugt werden. Die Annotation Inbox dient dazu, Beispiele an menschliche Prüfer zuzuweisen, wodurch Fachleute Etiketten hinzufügen, Zielantworten festlegen und subjektive Qualitätsbeurteilungen vornehmen können.

  • Erstellen Sie eine Sammlung von Fehlern auf der Grundlage der tatsächlichen Überwachung.
  • Speichern von Bewertungseingaben wie Text und Bildern.
  • Datenmengen werden über Code in Massen erstellt und abgerufen.
  • Lassen Sie die KI schnell erste Testbeispiele erzeugen.
  • Manuelle Etiketten und automatische Bewertungen werden getrennt aufgezeichnet.
  • Verwenden Sie die Ergebnisse der Überprüfung für anschließende Regressionstests.

Agent Simulations

Agent-Simulationen überprüfen, ob ein Agent in echten Dialogen Ziele erreichen, Regeln einhalten und Werkzeuge richtig verwenden kann, indem sie mehrere Interaktionsschleifen zwischen dem Benutzer und dem zu testenden Agenten simulieren. Sie eignen sich besser als eine einzige Eingabe-Ausgabe-Bewertung, um Zustände, Gedächtnisleistung, Werkzeugaufrufe sowie Verhaltensweisen in langen Dialogen zu testen.

Szenenstruktur

ZusammensetzungInhaltWirkung
ScenarioAnfangsbedingungen, Benutzerziele und EinschränkungenDefinierung der tatsächlichen Geschäftsaufgaben, die überprüft werden müssen
Agent AdapterVerbindung mit lokalen, entfernten oder gehosteten Proxy-ServernSenden einer Testnachricht an das zu testende System
User SimulatorErstellung mehrerer Runden Benutzerverhalten nach Rolle und ZielAbdeckung verschiedener Ausdrucksweisen, Nachfragen und Widerstände
CriteriaErfolg, Misserfolg und SicherheitsbeurteilungEntscheiden, ob die Szene bestanden wird.
Run ParametersParallelität, Wiederholungsversuche, Anzahl der Modelle und TestsKostenkontrolle und Abdeckungsbereich

Unterstützte Proxy-Formen

  • Text-Chat-Proxy.
  • Remote-Proxy, der Anmeldedaten oder einen Token erfordert.
  • Proxy-Funktionen in der lokalen Entwicklung.
  • Echtzeit-Proxye wie OpenAI Realtime usw.
  • Sprachagenten wie ElevenLabs, Twilio und Pipecat.
  • Echtzeit-multimodale Agenten wie Gemini Live.

Rotes Team und sichere Szenarien

Szenentests können verwendet werden, um feindliche Benutzer, Anfragen mit übermäßigen Berechtigungen sowie Prozesse der Prompt-Injection zu erzeugen, um die Verteidigungsfähigkeit des Agents in mehrfachen Interaktionsschleifen zu beobachten. Die Ergebnisse des Red-Teams sollten als Input für Verbesserungen dienen und nicht so interpretiert werden, als wäre die Sicherheit nach einem einzigen Test dauerhaft gewährleistet.

Scenario-Open-Source-Bibliothek

Der unabhängige Scenario-Repository bietet Proxy-Testwerkzeuge für Python und TypeScript und verwendet die Apache-Lizenz Version 2. Er kann lokal sowie in Umgebungen für kontinuierliche Integration ausgeführt werden – es ist nicht notwendig, dass alle Tests über LangWatch in der Cloud durchgeführt werden.

Hinweisverwaltung

Prompt Management speichert Templates, Variablen, Versionen sowie den Veröffentlichungszustand von Prompts zentral, um zu vermeiden, dass sie im Code, in Tabellen und in der Benutzeroberfläche verstreut sind. Entwickler können Prompts über SDK oder CLI synchronisieren und im Playground Modelle sowie Parameter austauschen, um Vergleiche durchzuführen.

FunktionenWirkungTypischer Benutzer
Prompt RegistryNamenshinweise und Versionen zentral speichernEntwicklung- und Produktteams
VariablesBusinessdaten bei der Ausführung einfügenAnwendungsentwickler
PlaygroundTesthinweise, Modelle und ParameterTipps für Ingenieure und Geschäftsexperten
CLI SyncDie Hinweise in das Code-Repository aufnehmenPlattformengineering und kontinuierliche Integration
Optimization StudioAnpassung der Hinweise auf Basis von Beispiel und ZielTeams, die systematisch optimiert werden müssen
DSPy OptimizationMit programmatischen Methoden nach besseren Hinweisen suchenForschungs- und hochrangige Bewertungsteams

AI Gateway

Der AI Gateway ermöglicht es, mehrere Modellanbieter zentral anzubinden und innerhalb der Organisationsgrenzen virtuelle Schlüssel, Routing-Regeln, Budgets, Caching-Funktionen sowie Guardrails zu verwalten. Bei einer selbst gehosteten Lösung kann man wählen, dass der Datenverkehr der Modelle an den Grenzen des eigenen Netzwerks endet.

  • Isolieren Sie Anwendungen und Teams mit virtuellen Schlüsseln.
  • Routen zwischen mehreren Modellen oder Anbietern.
  • Legen Sie Hierarchiebudgets für Organisationen, Projekte oder Benutzer fest.
  • Verwenden Sie einen Hinweisspeicher, um wiederholte Berechnungen zu reduzieren.
  • Erfüllen Sie die Echtzeit-Schutzmaßnahmen am einheitlichen Eingang.
  • Fokussiert auf die Erfassung von Kosten, Fehlern und Modellverbrauch.

MCP, CLI und Fähigkeiten

LangWatch bietet MCP, Befehlszeilenwerkzeuge sowie Programmierhilfen, damit KI-Hilfsprogramme bei der Überwachung von Zugriffen, der Erstellung von Tests, dem Ausführen von Simulierungen und der Verwaltung von Hinweisen unterstützen können. Automatisierte Änderungen sollten dennoch einer manuellen Überprüfung unterzogen werden, insbesondere bei Produktionschlüsseln, Sicherheitsmaßnahmen und Bereitstellungs-Einstellungen.

Preise in der Cloud

Die Preisangaben wurden am 23. August 2026 überprüft. Die tatsächlichen Beträge, Steuern, Wechselkurse sowie Rabatte können sich ändern; es gilt letztendlich das, was auf der Zahlelseite angezeigt wird.

LangWatch Cloud wird nach Anzahl der Kernplätze sowie nach der Menge der verarbeiteten Ereignisse abgerechnet. Für Daten, die länger als 30 Tage gespeichert werden, wird zusätzlich eine Speicherkostenpauschale fällig. Lite-Nutzer können zwar Inhalte ansehen und zusammenarbeiten, doch die genauen Bearbeitungsmöglichkeiten richten sich nach den aktuellen Berechtigungen.

Paket oder VersionPreisAbrechnungszeitraumKernrechte oder -beträgeFür Nutzer geeignet
DeveloperKostenlosFür immer kostenlos, die Limits werden monatlich erneuert50.000 Ereignisse, 14 Tage Datenzugriff, 2 Benutzer, 3 Szenarien, 3 Simulationsläufe sowie 3 benutzerdefinierte BewertungenEinzelne Entwickler und frühe Prototypen
Growth29 Euro pro KernplatzJeden MonatEnthält 200.000 Ereignisse und 30-tägige Aufbewahrung, unbegrenzte Lite-Nutzer, Simulationen, Bewertungen und HinweiseDas Team, das KI-Anwendungen in die Produktion bringt
EnterpriseIndividuelle KostenschätzungVertragsvereinbarungenHybrid-, Self-Hosting- oder lokale Bereitstellung, anpassbare Speicherung, SSO, RBAC, Auditing, SLA und exklusiver technischer SupportRegulierung und große Organisationen

Ereignisse und Speicherabrechnung

Jeder Aufruf des Modells, jeder Einsatz eines Tools, jede Suche, jede Bewertung oder jedes Simulationsverfahren zählt als ein Ereignis. Daher umfasst ein Benutzerdialog in der Regel mehrere Abrechnungsereignisse. Die ersten 200.000 Ereignisse pro Monat sind im Mitgliedsbeitrag enthalten; ab dort wird für jede weitere 100.000 Ereignisse eine Gebühr von 5 Euro fällig.

AbrechnungspostenWachstumsumfangÜberpreisHinweise
KernplätzeJeder Sitz wird separat abgerechnet29 Euro pro Sitzplatz pro MonatDie Anzahl der Plätze kann erhöht oder verringert werden. Bei mehr als 20 Personen können Sonderkonditionen in Bezug auf Preis und Menge angefragt werden.
Ereignisse200.000 pro Monat5 Euro pro 100.000 VorkommnisseModelle, Werkzeuge, Suchfunktionen, Bewertungen sowie Simulationsschritte können alle gebührenpflichtig sein.
Datenzugriff30 TageVerlängerung: 3 Euro pro GBAbrechnung nur bei Beibehaltung über den enthaltenen Zyklus hinaus
Lite-NutzerUnendlichEnthältDer Umfang der Berechtigungen unterscheidet sich von den Kernrechten.
ModellableitungNicht enthaltenVon dem Anbieter des Modells eingezogenSimulations- und LLM-Bewertungen können viele Modellaufrufe erzeugen.

Methoden zur Schätzung der Rechnungssumme

  1. Zählen Sie die Anzahl der Interaktionen mit Endbenutzern pro Monat.
  2. Man misst, wie viele Modelle, Werkzeuge und Abfragen eine typische Interaktion umfasst.
  3. Fügen Sie die Online-Bewertungen sowie die durch Guardrail erzeugten Ereignisse hinzu.
  4. Schätzen Sie die zusätzliche Rechenzeit für Offline-Experimente und Proxy-Simulationen.
  5. Bestimmen Sie die Anzahl der Kernplätze, für die vollständige Zugriffsrechte erforderlich sind.
  6. Berechnung der in GB angegebenen Datenmenge, die noch länger als 30 Tage zugänglich sein muss.
  7. Zusätzlich kommen Kosten für Modelle, Cloud-Speicher und selbst gehostete Infrastruktur hinzu.
  8. Legen Sie ein Budget für Wachstum, Auffüllung und außergewöhnlichen Traffic fest.

Open Source und Lizenzen

LangWatch arbeitet nach dem Open-Core-Prinzip. Der Code der Hauptplattform wird unter der Apache-Lizenz Version 2 bereitgestellt, während die Python-, TypeScript-SDKs sowie MCP-Dienste unter der MIT-Lizenz liegen. Die Unternehmensmodule wie SCIM, Audit-Logs, Lizenz- und Abrechnungsfunktionen befinden sich in separaten Verzeichnissen; für den Einsatz in der Produktion ist eine kommerzielle Lizenz erforderlich.

KomponentenLizenzWas kann man tun?Einschränkungen
LangWatch-KernplattformApache, Version 2Anzeigen, Ändern und selbst hosten der HauptfunktionenDie Module im Unternehmenskatalog stehen nicht unter derselben Lizenz.
Python SDKMITVerfolgung, Bewertung und DatenzugriffEs ist immer noch eine Verbindung zum Cloud- oder Self-Hosting-Dienst erforderlich.
TypeScript SDKMITIntegration der Plattform in Node- und Web-ProjekteOhne Hosting-Infrastruktur
MCP ServerMITErmöglichen Sie es dem AI-Klienten, die Funktionen von LangWatch zu nutzen.Es ist notwendig, Rechte und Anmeldeinformationen sinnvoll zu verteilen.
ScenarioApache, Version 2Testen von Szenarien für den lokalen Betrieb eines ProxysDie Kosten für Modelle und Zielagenten sind selbst zu tragen.
Enterprise-ModulGewerbelizenzSSO, SCIM, Auditing und UnternehmensverwaltungFür die Produktion und Nutzung ist eine Lizenz anzuschaffen.

Selbstverwaltete Version

Ohne eine Unternehmenslizenz ermöglicht Self-Hosted LangWatch weiterhin unbegrenzte Mitglieder, Teams, Projekte und selbst erstellte Inhalte sowie den Betrieb derselben Hauptsoftware wie in der Cloud. Eine Unternehmenslizenz gibt in derselben Installation SSO, RBAC, SCIM, Audit-Logs und Support frei, ohne dass eine separate Produktversion erforderlich ist.

Vergleich der Bereitstellungsmodi

EinsatzmodusWer verwaltet die Anwendung?Speicherort der DatenPassende Szenarien
LangWatch CloudLangWatchVerwalteter Cloud-ServiceSchneller Start und ohne Wartung
Self-ManagedKundenKunden-InfrastrukturVollständige Datensouveränität und eigenständige Verwaltung
Cloud EnterpriseLangWatchExklusive Instanzen für vom Kunden angegebene BereicheMuss isoliert werden und nicht selbst betrieben werden.
HybridLangWatch-VerwaltungskontrollflächeClickHouse und Object Storage befinden sich im Kundennetzwerk.Die Tracking-Daten dürfen das Unternehmensnetzwerk nicht verlassen.

Selbstverwaltete Infrastruktur

Das aktuelle Produktionskonzept für Version v3 basiert hauptsächlich auf Kubernetes Helm, wobei ClickHouse als zentrale Analyse-Datenbank verwendet wird. Kaltdaten werden durch objektbasierte Speicherlösungen strukturiert gespeichert. Die schnelle Lösung mit Docker Compose richtet sich weiterhin hauptsächlich an Version v2; bei der Bereitstellung von Version v3 sollten keine alten Anleitungen verwendet werden.

  • Verwenden Sie ClickHouse zur Speicherung und Abfrage von Tracking- sowie Bewertungsereignissen.
  • Durch die Rückverfolgung von Ereignissen wird die Nachverfolgung sowie die Bewertung der Verarbeitungsreihenfolge gewährleistet.
  • Alte Daten in kompatible Objektspeicher schichten.
  • Verwenden Sie die eingebauten Backup- und Wiederherstellungsmechanismen von ClickHouse.
  • Anpassung von Deployments unterschiedlicher Größe über Helm Overlay.
  • Optional kann das AI Gateway-SubChart aktiviert werden.
  • Es ist notwendig, die Schlüssel, das Netzwerk, die Backups, die Aktualisierungen sowie die Überwachung selbst zu verwalten.

Sicherheit und Konformität

LangWatch gibt öffentlich an, dass es den Anforderungen der GDPR entspricht und über die Zertifizierung ISO 27001 verfügt. Unternehmenskunden können entsprechende Berichte sowie Verträge zur Datenverarbeitung anfordern. Da die Plattform mit Eingabefragen, Ausgaben, Tool-Parametern sowie Benutzerdaten in Berührung kommen kann, muss das Team weiterhin seine eigene Klassifizierung und Zugriffsstrategie für die Daten festlegen.

  • Entfernen Sie vor dem Einbetten unerwünschte personenbezogene Daten und Schlüssel.
  • Einschränkung, wer die ursprünglichen Tracking-Daten und Datensätze einsehen darf.
  • Setzen Sie für die Exportfunktionen, MCP und API minimale Berechtigungen fest.
  • Überprüfen Sie die Cloud-Regionen, die Unterverarbeiter und die Aufbewahrungsfristen.
  • In selbst verwalteten Umgebungen wird die Übertragung sowie die statische Verschlüsselung aktiviert.
  • Prozesse für Audits, Löschungen, Backups und Reaktion auf Ereignisse festlegen.
  • Bei regulierten Geschäften müssen die Compliance-Pflichten durch Unternehmensverträge festgelegt werden.

Für welche Benutzer geeignet

  • Ingenieurteam zur Entwicklung von Anwendungen für große Sprachmodelle und KI-Agenten.
  • Das Team, das für die Qualität des Modells sowie für Tests zur Rückführung und Sicherheit zuständig ist.
  • Produktteams, die das Verhalten von Agenten in mehreren Runden von Benutzertests simulieren müssen.
  • Organisationen, die Experten für Geschäftsprozesse zur Bereitstellung von Hinweisen und zur manuellen Anzeichnung einbeziehen möchten.
  • Plattformteams, die einheitliche Modelle für Gateways, Budgets und Governance benötigen.
  • Unternehmen, die auf offene Quellen setzen, ihre Daten selbst verwalten und die Erfassung von Daten kontrollieren möchten.
  • Entwickler, die mit Low-Code-Tools wie n8n AI-Prozesse erstellen.

Vorteile des Produkts

  • Beobachtung, Bewertung, Simulation und Hinweismanagement bilden einen vollständigen Kreislauf.
  • Agent-Simulationen eignen sich zur Überprüfung von mehrfach wiederholten und toolbasierten Agenten.
  • Unterstützung für Offline-Experimente, Online-Überwachung und synchronisierte Guardrails.
  • OpenTelemetry verringert die Bindung an ein einzelnes SDK.
  • Der Cloud-Preis bietet sowohl einen kostenlosen Zugang als auch günstige Erweiterungen für Events.
  • Die Hauptvorteile der Self-Hosting-Lösung sind, dass es keine Obergrenzen für Mitglieder und Projekte gibt.
  • Die Grenzen der Open-Core-Lizenz sind klar definiert.

Einschränkungen und Hinweise

  • Eine Benutzerinteraktion kann mehrere Abrechnungsvorgänge verursachen.
  • Simulationen, Online-Bewertungen und Guardrail erhöhen die Kosten für das Modell und die Ereignisse.
  • LLM-Bewertungstools und Simulationsnutzer können Fehlentscheidungen treffen.
  • Ein vollständiges Qualitätsmanagementsystem erfordert die Verwaltung von Datensätzen, Standards sowie manuelle Überprüfungen.
  • Die v3-Hosting-Lösung basiert hauptsächlich auf Kubernetes, wodurch die Wartungskomplexität höher ist als bei Tools mit einem einzigen Container.
  • Obwohl die Unternehmensmodule sich im selben Lager befinden, gelten für sie keine Apache-Open-Source-Lizenzbedingungen.
  • Die Verfolgungsinhalte können sensible Geschäftsdaten und Modellhinweise enthalten.
  • In der Developer-Version sind die Anzahl der Szenarien, Simulationen und anpassbaren Bewertungen begrenzt.

Umsetzungsprozess

  1. Wählen Sie LangWatch Cloud oder planen Sie eine selbst gehostete Umgebung.
  2. Erstellen Sie ein Projekt und integrieren Sie OpenTelemetry oder das offizielle SDK.
  3. Überprüfen Sie Span, Kosten und Benutzermetadaten mit Testanfragen.
  4. Etablierung von Kernqualitätsindikatoren und Klassifizierung von Fehlern.
  5. Erstes Testdatensatz aus der tatsächlichen Verfolgung erstellen.
  6. Um Hinweise und Änderungen am Modell zu testen, werden Offline-Experimente durchgeführt.
  7. Testen Sie das Verhalten von Agenten und Tools in mehreren Runden mithilfe von Szenario-Simulationen.
  8. Für hochriskante Eingaben und Ausgaben zusätzliche Schutzmechanismen hinzufügen.
  9. Konfigurieren Sie die Online-Bewertung der Produktion, Benachrichtigungen und Budgets.
  10. Überprüfen Sie die tatsächlichen Kosten nach Ereignis, Sitzplatz, Speicherung und Modellkosten.

Häufige Fragen

Ist LangWatch kostenlos?

Das Developer-Cloud-Paket ist dauerhaft kostenlos und beinhaltet monatlich 50.000 Ereignisse, Zugang zu den Daten über 14 Tage, 2 Benutzer sowie eine begrenzte Anzahl an Szenarien, Simulationsmodellen und benutzerdefinierten Tests. Die selbst gehostete Open-Source-Version setzt keine Beschränkungen hinsichtlich Mitgliedern, Teams und Projekten, doch die Infrastrukturkosten müssen vom Benutzer getragen werden.

Was ist ein Abrechnungsevent?

Modellaufrufe, Toolaufrufe, Abfragen, Bewertungen und Simulationsschritte können alle als Ereignisse gelten. Eine vollständige Benutzer-Sitzung umfasst in der Regel mehrere Ereignisse; daher sollte die Anzahl der Ereignisse anhand tatsächlicher Aufzeichnungen ermittelt werden, anstatt direkt nach der Anzahl der Sitzungen zu schätzen.

Ist LangWatch Open Source?

Die Hauptplattform verwendet die Apache-Lizenz Version 2, während SDKs und MCP die MIT-Lizenz verwenden. Die Unternehmensmodule verfügen über eine eigene kommerzielle Lizenz; daher ist eine genauere Bezeichnung „offene Kernplattform“.

Kann man es selbst hosten?

Ja, für v3 wird empfohlen, Kubernetes sowie die offiziellen Helm-Charts zu verwenden. Die wichtigsten Funktionen der Plattform können auch ohne Lizenz genutzt werden. Für SSO, SCIM, RBAC, Auditing sowie Unternehmensunterstützung ist jedoch eine kommerzielle Lizenz erforderlich.

Was ist der Unterschied zwischen Agent-Simulation und herkömmlicher Bewertung?

Übliche Bewertungen prüfen in der Regel feste Eingaben und Ausgaben, während die Agent-Simulation es ermöglicht, dass simulierte Benutzer mehrfach mit dem Agenten interagieren. Letzteres eignet sich besser zur Überprüfung von Zuständen, Werkzeugen, Sprachfunktionen, Ablehnungen sowie des gesamten Prozesses zur Erreichung der Geschäftsziele.

Kann schädliche Inhalte in Echtzeit blockiert werden?

Der Bewertungstool kann als Guardrail vor und nach dem Aufruf des Modells synchron ausgeführt werden, um je nach Ergebnis Abläufe zu blockieren oder auf einen Ersatzmodus umzuschalten. Vor der Veröffentlichung sollten Verzögerungen, Fehlalarme, Downgrade-Logik sowie Fehlerbehandlung getestet werden.

Zusammenfassung

LangWatch dokumentiert nicht nur die Überwachung von LLMs, sondern vereint auch Offline-Experimente, Online-Bewertungen, Echtzeit-Schutzmechanismen, Simulationen von Agentenszenarien sowie die Verwaltung von Hinweisen zu einem umfassenden AI-Entwicklungsprozess. Es eignet sich besonders für Teams, die eine systematische Überprüfung mehrerer Agentenrunden benötigen – anstatt nur die Antworten eines einzelnen Modells zu beobachten.

Cloud-Growth beginnt bei 29 Euro pro Kernplatz und wird je nach Anzahl der zusätzlichen Ereignisse sowie der verlängerten Speicherung berechnet; die open-source-Version zur selbstverwalteten Nutzung bietet mehr Kontrolle über die Daten, doch für eine produktive Einrichtung in Version v3 sind Kenntnisse im Umgang mit Kubernetes erforderlich. Vor der endgültigen Einführung sollten die Anzahl der Ereignisse, die Kosten für die Modelle sowie die Speicheranforderungen anhand des tatsächlichen Datenverkehrs berechnet werden.

©️ Urheberrechtshinweis: Sofern nicht anders angegeben, liegen die Urheberrechte an allen Artikeln auf dieser Website beiTeilen von AI-ToolsAlle Urheberrechte liegen bei uns. Ohne Genehmigung darf keine Person, kein Medienunternehmen, keine Website oder irgendeine Gruppe den Inhalt dieser Website kopieren, nachahmen oder auf andere Weise verbreiten. Ebenso ist es nicht gestattet, Spiegelseiten auf Servern zu erstellen, die nicht uns gehören. Andernfalls behalten wir uns das Recht vor, rechtliche Schritte gegen die Verantwortlichen einzuleiten.

Tools, die dem LangWatch ähneln