LiteLLM
LiteLLM – macht die Arbeit mit KI effizienter und einfacher.
Tags:Steigerung der Effizienz durch KIWas ist LiteLLM?
LiteLLM ist ein open-source-basiertes AI-Gateway sowie ein Python-SDK, das verschiedene Modelldienste wie OpenAI, Anthropic, Gemini, Azure, Amazon Bedrock, Vertex AI und Ollama unter einer ähnlichen Aufrufmethode zusammenführt. Anwendungen können mithilfe der OpenAI-kompatiblen Schnittstellen zwischen den Modellen wechseln, wodurch die Notwendigkeit entfällt, für jeden Anbieter separat Anpassungscode zu verwalten.
Das Projekt wird von Berri AI gewartet und eignet sich sowohl dafür, dass Entwickler es direkt in ihren Python-Projekten verwenden, als auch dafür, dass es als gemeinsamer Proxy-Server für Teams eingesetzt wird. Es handelt sich dabei nicht um ein großes Sprachmodell, und es werden keine Ressourcen für die Modellverarbeitung bereitgestellt. Die tatsächlichen Antworten werden weiterhin von den vom Benutzer konfigurierten Cloud- oder lokalen Modellen erzeugt.
Zwei Hauptverwendungsmöglichkeiten
| Methode | Zielgruppe | Hauptfähigkeiten | Typische Szenarien |
|---|---|---|---|
| Python SDK | Anwendungsentwickler | Einheitliche Aufrufe, Abweichkeitszuordnung, Routing, Wiederholung, Rückfallstrategien und Callbacks | Einbetten mehrerer Modelle in ein einzelnes Python-Projekt |
| AI Gateway | Team für Plattformen und Infrastruktur | Zentrale Authentifizierung, virtuelle Schlüssel, Budget, Protokolle, Admin-Interface und Mehr-Mieter-Steuerung | Einen einheitlichen Zugang zum Modell für mehrere Anwendungen, Benutzer oder Teams bereitstellen |
Das SDK ähnelt eher einem Codepaket, während das Gateway ein eigenständig laufender zentraler Dienst ist. Kleine Projekte können mit dem SDK beginnen; erst wenn einheitliche Berechtigungen, Kosten und eine Überwachung erforderlich sind, wird das Gateway eingesetzt.
Hauptfunktionen
Einheitliche API für große Modelle
LiteLLM stellt mehrere Modellanbieter über eine einheitliche Schnittstelle bereit, die verschiedene Endpunkte wie Chat, Antworten, Einbettungen, Bilder, Audio, Batch-Verarbeitung, Umordnung und Nachrichten abdeckt. Die einzelnen Modelle unterstützen nicht unbedingt alle Funktionen; vor der Anbindung ist es daher notwendig, die Kompatibilitätsliste der jeweiligen Anbieter zu prüfen.
- Anruf mehrerer Modelle in einem OpenAI-kompatiblen Format
- Verbindung von Geschäfts-APIs, Cloud-Plattformmodellen und einigen lokalen Inferenzdiensten
- Einheitliche Struktur für gängige Fehlerarten und Antworten
- Legen Sie Alias-Namen für das Modell fest, um die Verknüpfung des Geschäftscode mit bestimmten Modellen zu verringern.
- Senkung der Migrationskosten bei der Hinzufügung neuer Modelle oder Lieferanten
Intelligente Routenwahl und Fehlerrückfallbehandlung
Ein Router kann Anfragen zwischen verschiedenen Modellen oder Implementierungen verteilen und Strategien für Wiederholungsversuche, Zeitlimits sowie Rückfallmaßnahmen konfigurieren. Wenn ein bestimmter Endpunkt überlastet ist oder ausfällt, kann das System andere Implementierungen ausprobieren – vorausgesetzt, das Team hat die Ersatzmodelle sowie die kompatiblen Parameter ordnungsgemäß konfiguriert.
- Mehrere Load-Balancing-Einheiten einsetzen
- Routen nach Kosten, Verzögerung oder Verfügbarkeit gestalten
- Umgang mit Bandbreitenbeschränkungen und vorübergehenden Servicefehlern
- Rufen Sie das Ersatzmodell auf, wenn das Hauptmodell versagt.
- Durch Caching werden einige wiederholte Aufrufe reduziert.
Virtuelle Schlüssel und Zugriffskontrolle
Der Gateway kann virtuelle Schlüssel an Anwendungen, Projekte, Benutzer oder Teams ausstellen, ohne die zugrunde liegenden Modellschlüssel direkt verteilen zu müssen. Administratoren können die verfügbaren Modelle, das Budget, die Anfragenrate sowie die Gültigkeitsdauer begrenzen und die Ausgaben nach verschiedenen Gruppen auflisten.
Die virtuellen Schlüssel dienen nur der Verwaltung; es ist weiterhin notwendig, den Hauptschlüssel, die Datenbanken sowie die Verwaltungsplattform zu schützen. In der Produktionsumgebung sollten keine Beispielschlüssel verwendet werden, und die Verwaltungsschnittstellen dürfen nicht direkt im öffentlichen Netzwerk zugänglich gemacht werden.
Kostenverfolgung und Budgetmanagement
LiteLLM berechnet die Kosten anhand der Preisstruktur des Modells sowie einer Schätzung des Verbrauchs. Die Kosten können nach Schlüsseln, Benutzern, Teams, Projekten oder Tags zusammengefasst werden. Teams können Budgets und Geschwindigkeitsbeschränkungen festlegen, um unerwartete Rechnungen durch Testskripte oder abnormalen Datenverkehr zu vermeiden.
- Verfolgung der Anfragenanzahl, der Tokenanzahl und der geschätzten Kosten
- Budget für Benutzer, Teams oder Projekte festlegen
- Beschränkung der Anfragen pro Minute und der Tokenanzahl
- Kostenverteilung nach Modell oder Label betrachten
- Anbindung an das Überwachungssystem über Prometheus usw.
Protokolle, Überwachbarkeit und Guardrails
Das Gateway unterstützt Protokollierung von Anfragen und Antworten, Callbacks, Metriken sowie verschiedene Überwachungsfunktionen. Zudem kann es mit Mechanismen zur Inhaltssicherheit und zu Guardrails integriert werden. Ob Prompte und Antworten protokolliert werden, wird durch die Konfiguration festgelegt. Bei der Verarbeitung sensibler Daten sollte grundsätzlich eine Strategie der Minimierung der Protokollierung angewandt werden.
MCP und Agenten-Gateway
Das aktuelle Projekt umfasst außerdem die Funktionen von MCP Gateway und A2A Agent Gateway, wodurch MCP-Tools oder kompatible Agenten hinter einer einheitlichen Schnittstelle platziert werden können. Der Administrator muss weiterhin die Autorisierungen der Tools, den Netzwerkzugriff, die Genehmigungsrichtlinien sowie den Umfang der Zugangsdaten separat steuern.
Unterstützte Modelle und Dienste
Offiziell wird angegeben, dass mehr als 100 Modellanbieter unterstützt werden, wobei die genaue Anzahl mit den Versionen variiert. Zu den gängigen Optionen gehören OpenAI, Anthropic, Google Gemini, Azure OpenAI, Amazon Bedrock, Vertex AI, Cohere, Mistral, DeepSeek, xAI, Ollama und vLLM usw.
| Kategorie | Beispiel | Erinnerungen verwenden |
|---|---|---|
| Business-Modell-API | OpenAI, Anthropic, Gemini, Mistral, xAI | Jeder benötigt seinen eigenen Schlüssel und zahlt zu den vom Anbieter festgelegten Preisen. |
| Cloud-Plattform-Modell | Azure, Bedrock, Vertex AI | Bezieht sich auf Cloud-Konten, Regionen, Berechtigungen und Netzwerkkonfigurationen |
| Lokale oder selbst gehostete Inferenz | Ollama, vLLM, LM Studio | Man muss die Modelle, die Rechenleistung sowie die Server-Endpunkte selbst bereitstellen. |
| Multimodale Dienste | Anbieter für Bilder, Audio, Einbetungen und Neuordnung | Der Grad der Unterstützung für Endpunkte variiert je nach Anbieter. |
Preis und Version
Die folgenden Informationen wurden am 24. August 2026 überprüft. LiteLLM nutzt ein Modell mit einer kostenlosen, open-source-basierten Kernsoftware sowie kostenpflichtigen Unternehmensfunktionen. Die Kosten für Unternehmen werden nicht nach der Anzahl der Modelleingaben berechnet, sondern basieren auf der jährlichen Anzahl der Gateway-Anfragen, der Implementierungsarchitektur sowie den Anforderungen an den Support.
| Version | Lizenz oder Preis | Hauptfähigkeiten | Zielgruppe |
|---|---|---|---|
| Open Source | Keine Lizenzgebühren von 0 US-Dollar, dauerhaft kostenlos self-hosten | Einheitliche API, virtuelle Schlüssel, Benutzer und Teams, Kostenverfolgung, Budgets, Geschwindigkeitsbeschränkungen, Fallback-Mechanismen, Protokolle sowie Prometheus-Metriken | Entwickler und Teams, die in der Lage sind, selbst zu deployen und zu warten. |
| Enterprise | Jahresvertrag, Kontaktieren Sie den Verkauf für Preisanfragen | Open-Source-Funktionen inklusive SSO, SCIM, OIDC oder JWT, Audit-Logs, Schlüsselwechsel, Organisationsrechte, Mehrregionskontrolle und Unternehmensunterstützung | Großangelegte Organisationen, die reguliert werden oder für die Service-Level-Agreements erforderlich sind |
| Enterprise-Testversion | 30 Tage, ohne Kreditkarte erforderlich | Zur Überprüfung der Unternehmenslizenzfunktionen | Team zur Überprüfung der Sicherheits- und Governance-Anforderungen vor dem Einkauf |
Die Standardunterstützung der Unternehmensversion beinhaltet eigene Kommunikationskanäle. Der in den offiziellen Dokumenten angegebene Service-Level-Agreement für eine 24-Stunden-Unterstützung kann zusätzliche Kosten verursachen. Die tatsächlichen Preise, die gewünschte Kapazität, das isolierte Netzwerk, die Multi-Region-Deployment-Möglichkeiten sowie der Servicelevel richten sich nach den Vereinbarungen im Vertrag.
Welche Kosten gibt es noch in der kostenlosen Version?
- Kosten für den Aufruf von upstream-Modellen wie OpenAI, Anthropic, Gemini usw.
- Kosten für Cloud-Server, Container oder lokale Hardware
- PostgreSQL, Redis und Objektspeicher, die für die Produktionsumgebung erforderlich sind
- Kosten für Protokollierung, Überwachung, Backups, Netzwerkverkehr und Sicherheitsdienste
- Personalkosten für die Einrichtung, Aufrüstung, Fehlerbehebung und Konformitätsprüfungen
Daher bedeutet „kostenlose Self-Hosting“ lediglich, dass für den Open-Source-Kern keine Lizenzgebühren anfallen, und nicht, dass der Betrieb des Gateways sowie die Modellverarbeitung kostenlos sind. Vor dem Kauf oder der Bereitstellung sollten Verbrauch, Infrastruktur und Wartung in die Gesamtkosten einbezogen werden.
Einrichtungsmethode
- Verwenden Sie Python-Pakete, um das SDK direkt zu integrieren oder einen Proxy-Dienst zu starten.
- Betrieb des AI Gateway und der Verwaltungsoberfläche über offizielle Container-Images
- Verwendung von Docker Compose zur Erstellung von Test- oder kleinen Umgebungen
- Durch Helm im Kubernetes-Cluster bereitstellen
- Mit den offiziellen Terraform-Modulen auf AWS oder Google Cloud bereitstellen
- Die Unternehmensversion kann auf eigener Infrastruktur betrieben werden und unterstützt isolierte Netzwerklösungen.
In der Produktionsumgebung sind in der Regel auch Datenbanken, Caching-Systeme, Reverse-Proxy-Server, TLS-Verfahren, Mechanismen zur Verwaltung von Geheimnissen sowie Überwachungs- und Backup-Funktionen erforderlich. Offiziell wird empfohlen, für Produktionsimages stabile Tags zu verwenden. Dennoch sollten die Teams eine klare Version festlegen, um unplanmäßige Updates, die zu Verhaltensänderungen führen könnten, zu vermeiden.
Schneller Nutzungsvorgang
- Ermitteln Sie klar, ob das Python SDK oder ein zentrales AI-Gateway verwendet werden soll, und listen Sie die Anbieter der Modelle auf, die angeschlossen werden müssen.
- Vorbereiten Sie die Konten, API-Schlüssel, Regionen und Quoten für die verschiedenen Modell-Dienste – schreiben Sie die Schlüssel nicht in den Quellcode.
- Installieren Sie LiteLLM in der Testumgebung oder starten Sie den offiziellen Container und konfigurieren Sie die Modell-Alias sowie die Upstream-Endpunkte.
- Erstellen Sie eine Haupt- und eine virtuelle Schlüssel, und legen Sie für Anwendungen, Teams oder Projekte eine Allowlist für Modelle sowie Budget- und Geschwindigkeitsbeschränkungen fest.
- Lassen Sie die Anwendung auf die Gateway-Adresse und eine mit OpenAI kompatible Aufrufmethode umsteigen, um fließende Ausgaben, Tool-Aufrufe sowie Fehlerbehandlung zu überprüfen.
- Konfigurieren von Timeout, Wiederholungsversuchen, Rückfallstrategien, Maskierung von Protokollen, Metriken, Alarmen und Datenbankbackups.
- Durchführen von Parallelitäts-, Fehler- und Kostentests, bevor eine stabile Version in die Produktionsumgebung veröffentlicht wird.
Für welche Benutzer geeignet
- Entwickler von KI-Anwendungen, die gleichzeitig mehrere große Modelle aufrufen müssen
- Das Team der Plattform, das eine einheitliche Verwaltung von Schlüsseln und Gebühren anstrebt.
- Unternehmen, die Budgets und Zugriffsrechte für mehrere Abteilungen zuweisen müssen
- Produktionsysteme, die ein Modellrückfall und Lastverteilung benötigen
- Organisationen, die das Modell-Gateway in ihrem eigenen Netzwerk beibehalten möchten
- Teams, die zwischen Cloud-Modellen und lokalen Modellen wechseln müssen
Vorteile des Produkts
- Breites Spektrum an kompatiblen Modellen und Anbietern – dadurch wird eine wiederholte Anpassung vermieden.
- Zwei Einsatzebenen: SDK und zentrales Gateway
- Der Open-Source-Kern kann selbst überprüft, geändert und bereitgestellt werden.
- Virtuelle Schlüssel, Budgets und Geschwindigkeitsbeschränkungen eignen sich für die Verwaltung mehrerer Mieter.
- Fähigkeiten zur Routenplanung, Wiederholungsversuchen, Rückfallstrategien, Caching sowie zur Überwachbarkeit
- Unterstützung für Container, Kubernetes und gängige Cloud-Infrastrukturen
Einschränkungen und Risiken
Kompatible Schnittstellen bedeuten keine vollständige Übereinstimmung.
Verschiedene Modelle weisen weiterhin Unterschiede in Bezug auf die Aufrufung von Tools, die strukturierte Ausgabe, Bilder, Audio, die Länge des Kontexts sowie das Verhalten bei Fehlern auf. Vor dem Wechsel auf ein anderes Modell müssen tatsächliche Testfälle durchgeführt werden – es reicht nicht aus, nur eine einfache Chatanfrage zu überprüfen.
Die Preisschätzung muss gepflegt werden.
Die Kostenverfolgung stützt sich auf Modellpreise und Token-Berechnungsdaten; Abweichungen können auftreten, wenn Lieferanten ihre Preise anpassen oder neue Modelle eingeführt werden. Die finanziellen Abrechnungen sollten anhand der Rechnungen aus den vorherigen Schritten erfolgen, wobei die Statistiken von LiteLLM besser für die Betriebsüberwachung geeignet sind.
Der Gateway wird zu einer Schlüsselinfrastruktur.
Nachdem der Datenverkehr aller Modelle zusammengeführt wurde, können fehlerhafte Konfigurationen, Datenbankprobleme oder Versionsaufwertungen mehrere Anwendungen beeinträchtigen. In der Produktivumgebung sollten hohe Verfügbarkeit, Kapazitätsplanung, Health Checks, Rollbacks sowie Katastrophenwiederherstellung eingestellt werden.
Offene Quellen bedeuten nicht automatisch Sicherheit.
Der Administrator muss die Authentifizierung, die Netzwerkisolation, TLS, den Schlüsselwechsel sowie die Maskierung von Protokollen selbst konfigurieren. Wenn die Protokollierung von Anfragen und Antworten aktiviert wird, können die Eingabeanfragen sowie die Antworten des Modells in eine Datenbank oder in ein System zur Überwachung durch Dritte gelangen.
Daten und Privatsphäre
Selbstverwaltung bedeutet, dass die Hersteller von LiteLLM in der Regel nicht für die Verwaltung des Gateway-Traffics sowie der Schlüssel der Nutzer verantwortlich sind. Die Anfragen an die Modelle werden jedoch weiterhin an den konfigurierten upstream-Modellservice gesendet. Auch Protokolle, Caches, Guardrails sowie Tools zur Überwachung können mit den Eingaben und Ausgaben in Berührung kommen.
- Speichern Sie den Modell-Schlüssel nur in einem geheimen Verwaltungssystem.
- Erstellung unabhängiger virtueller Schlüssel für verschiedene Anwendungen
- Deaktivieren von unnötigen Hinweisen und Antwort-Log-Texten
- Desensibilisierung von personenbezogenen Daten, Geschäftsgeheimnissen und Zugangsdaten
- Überprüfung der Datenerhaltungspolitiken jeder Modell- und Überwachungsdienstleistung
- Regelmäßige Aktualisierung von Sicherheitspatches und Überprüfung der Signatur der Container-Images
Erklärung zur Open-Source-Lizenz
Im LiteLLM-Repository werden nicht alle Verzeichnisse unter derselben Lizenz bereitgestellt. Laut der Hauptlizenzrichtlinie unterliegt der Inhalt des enterprise-Verzeichnisses der eigenen Unternehmenslizenz dieses Verzeichnisses, während der Rest des unbeschränkten Codes unter der MIT-Lizenz steht.
| Codeumfang | Lizenzstatus | Anleitung zur Verwendung |
|---|---|---|
| Open-Source-Kern und nicht-kommerzielle Verzeichnisse | MIT-Lizenz | Es darf unter Beibehaltung der Urheberrechts- und Lizenzangaben verwendet, verändert und verbreitet werden. |
| Enterprise-Katalog | Einzellicenz für das Unternehmenverzeichnis | Man darf nicht davon ausgehen, dass der gesamte Unternehmenscode aufgrund der Offenlegung des Lager-Systems frei für kommerzielle Zwecke genutzt werden kann. |
| Externe Modelle und SDKs | Jeglicher Bestandteil | Modellgewichte, APIs und Drittanbieter-Abhängigkeiten erben die LiteLLM-Lizenz nicht automatisch. |
Versionen und Wartungsempfehlungen
LiteLLM wird häufiger veröffentlicht. Die offizielle Versionspolitik unterstützt die letzten vier stabilen Unter-Versionen; ältere Versionen werden schrittweise nicht mehr aktualisiert. Produktivsysteme sollten auf eine bestimmte stabile Version festgelegt werden, wobei zunächst in einer Vorab-Testumgebung getestet und anschließend aktualisiert wird.
- Speichern der genauen Version des aktuellen Images oder Pakets
- Lesen Sie die Änderungsprotokolle und achten Sie auf Sicherheitsmitteilungen.
- Vorbereitung von Backups und Rollbacks für Änderungen der Datenbankstruktur
- Testen von Kernmodellen, Toolaufrufen, fließenden Antworten und Fallback-Pfaden
- Planen Sie den Upgrade, bevor das Support-Fenster für die Version schließt.
Häufige Fragen
Ist LiteLLM kostenlos?
Die Lizenzgebühren für die Open-Source, selbst gehostete Version betragen 0 US-Dollar. Für Modelle-APIs, Server, Datenbanken, Überwachung und Wartung entstehen weiterhin Kosten, und für Funktionen zur Unternehmensführung und zum Support ist ein Kostenvoranschlag erforderlich.
Bietet LiteLLM eine Model-Limitierung an?
Nicht verfügbar. Der Benutzer muss sein eigenes Konto beim Modellanbieter konfigurieren, sowie Schlüssel und Limits einrichten, oder eine selbst bereitgestellte Modellservice-Plattform nutzen.
Ist LiteLLM wie OpenRouter?
Nicht ganz dasselbe. LiteLLM ist hauptsächlich ein selbsthostierbares Gateway und SDK, das nicht alle Modell-Lizenzen zentral verkauft; OpenRouter hingegen ist ein gehosteter Modell-Aggregationsdienst.
Kann es in privater Weise eingesetzt werden?
Ja. Die Open-Source-Version kann auf eigenen Infrastrukturen betrieben werden. Auch die Enterprise-Version wird selbst gehostet, und es können auf Vertragsbasis stärkere Funktionen zur Steuerung, zum Support sowie zur Netzwerkisolation bereitgestellt werden.
Wird ein chinesischer Modell unterstützt?
Es werden einige chinesische und internationale Modellanbieter unterstützt, wobei sich die konkreten Modelle, Regionen sowie die Funktionalitäten der Endpunkte ändern können. Vor der Anbindung sollte man die aktuelle Liste der Anbieter prüfen und die Funktionalitäten im Chinesischen direkt testen.
Wie viel kostet die Unternehmensversion?
Die offizielle Website gibt keinen festen Betrag an; es wird ein Preis auf Grundlage der jährlichen Anforderungen bezüglich Kapazität, Architektur und Unterstützung kalkuliert. Derzeit steht eine 30-tägige Testversion für Unternehmen zur Verfügung. Der endgültige Preis richtet sich nach dem Verkaufsvertrag.
Zusammenfassung
LiteLLM eignet sich für Entwicklerteams, die eine einheitliche API, Berechtigungen, Budgets, Routing-Strategien sowie Überwachungsfunktionen für ihre Modelle benötigen. Die Open-Source-Version umfasst die grundlegenden Funktionen eines Gateways, während die Enterprise-Version zusätzlich fortgeschrittene Funktionen zur Verwaltung von Identitäten, Auditing-Möglichkeiten sowie Unterstützung für mehrere Regionen bietet. Dennoch müssen die Nutzer weiterhin die Kosten für die Modelle sowie die Verantwortung für die Infrastruktur und den Sicherheitsbetrieb tragen.
Guigong-Netzwerk-Sicherheitsnummer: 45132202000164