LiteLLM
Kostenloser Mehrwert

Was ist LiteLLM?

LiteLLM ist ein open-source-basiertes AI-Gateway sowie ein Python-SDK, das verschiedene Modelldienste wie OpenAI, Anthropic, Gemini, Azure, Amazon Bedrock, Vertex AI und Ollama unter einer ähnlichen Aufrufmethode zusammenführt. Anwendungen können mithilfe der OpenAI-kompatiblen Schnittstellen zwischen den Modellen wechseln, wodurch die Notwendigkeit entfällt, für jeden Anbieter separat Anpassungscode zu verwalten.

Das Projekt wird von Berri AI gewartet und eignet sich sowohl dafür, dass Entwickler es direkt in ihren Python-Projekten verwenden, als auch dafür, dass es als gemeinsamer Proxy-Server für Teams eingesetzt wird. Es handelt sich dabei nicht um ein großes Sprachmodell, und es werden keine Ressourcen für die Modellverarbeitung bereitgestellt. Die tatsächlichen Antworten werden weiterhin von den vom Benutzer konfigurierten Cloud- oder lokalen Modellen erzeugt.

Zwei Hauptverwendungsmöglichkeiten

MethodeZielgruppeHauptfähigkeitenTypische Szenarien
Python SDKAnwendungsentwicklerEinheitliche Aufrufe, Abweichkeitszuordnung, Routing, Wiederholung, Rückfallstrategien und CallbacksEinbetten mehrerer Modelle in ein einzelnes Python-Projekt
AI GatewayTeam für Plattformen und InfrastrukturZentrale Authentifizierung, virtuelle Schlüssel, Budget, Protokolle, Admin-Interface und Mehr-Mieter-SteuerungEinen einheitlichen Zugang zum Modell für mehrere Anwendungen, Benutzer oder Teams bereitstellen

Das SDK ähnelt eher einem Codepaket, während das Gateway ein eigenständig laufender zentraler Dienst ist. Kleine Projekte können mit dem SDK beginnen; erst wenn einheitliche Berechtigungen, Kosten und eine Überwachung erforderlich sind, wird das Gateway eingesetzt.

Hauptfunktionen

Einheitliche API für große Modelle

LiteLLM stellt mehrere Modellanbieter über eine einheitliche Schnittstelle bereit, die verschiedene Endpunkte wie Chat, Antworten, Einbettungen, Bilder, Audio, Batch-Verarbeitung, Umordnung und Nachrichten abdeckt. Die einzelnen Modelle unterstützen nicht unbedingt alle Funktionen; vor der Anbindung ist es daher notwendig, die Kompatibilitätsliste der jeweiligen Anbieter zu prüfen.

  • Anruf mehrerer Modelle in einem OpenAI-kompatiblen Format
  • Verbindung von Geschäfts-APIs, Cloud-Plattformmodellen und einigen lokalen Inferenzdiensten
  • Einheitliche Struktur für gängige Fehlerarten und Antworten
  • Legen Sie Alias-Namen für das Modell fest, um die Verknüpfung des Geschäftscode mit bestimmten Modellen zu verringern.
  • Senkung der Migrationskosten bei der Hinzufügung neuer Modelle oder Lieferanten

Intelligente Routenwahl und Fehlerrückfallbehandlung

Ein Router kann Anfragen zwischen verschiedenen Modellen oder Implementierungen verteilen und Strategien für Wiederholungsversuche, Zeitlimits sowie Rückfallmaßnahmen konfigurieren. Wenn ein bestimmter Endpunkt überlastet ist oder ausfällt, kann das System andere Implementierungen ausprobieren – vorausgesetzt, das Team hat die Ersatzmodelle sowie die kompatiblen Parameter ordnungsgemäß konfiguriert.

  • Mehrere Load-Balancing-Einheiten einsetzen
  • Routen nach Kosten, Verzögerung oder Verfügbarkeit gestalten
  • Umgang mit Bandbreitenbeschränkungen und vorübergehenden Servicefehlern
  • Rufen Sie das Ersatzmodell auf, wenn das Hauptmodell versagt.
  • Durch Caching werden einige wiederholte Aufrufe reduziert.

Virtuelle Schlüssel und Zugriffskontrolle

Der Gateway kann virtuelle Schlüssel an Anwendungen, Projekte, Benutzer oder Teams ausstellen, ohne die zugrunde liegenden Modellschlüssel direkt verteilen zu müssen. Administratoren können die verfügbaren Modelle, das Budget, die Anfragenrate sowie die Gültigkeitsdauer begrenzen und die Ausgaben nach verschiedenen Gruppen auflisten.

Die virtuellen Schlüssel dienen nur der Verwaltung; es ist weiterhin notwendig, den Hauptschlüssel, die Datenbanken sowie die Verwaltungsplattform zu schützen. In der Produktionsumgebung sollten keine Beispielschlüssel verwendet werden, und die Verwaltungsschnittstellen dürfen nicht direkt im öffentlichen Netzwerk zugänglich gemacht werden.

Kostenverfolgung und Budgetmanagement

LiteLLM berechnet die Kosten anhand der Preisstruktur des Modells sowie einer Schätzung des Verbrauchs. Die Kosten können nach Schlüsseln, Benutzern, Teams, Projekten oder Tags zusammengefasst werden. Teams können Budgets und Geschwindigkeitsbeschränkungen festlegen, um unerwartete Rechnungen durch Testskripte oder abnormalen Datenverkehr zu vermeiden.

  • Verfolgung der Anfragenanzahl, der Tokenanzahl und der geschätzten Kosten
  • Budget für Benutzer, Teams oder Projekte festlegen
  • Beschränkung der Anfragen pro Minute und der Tokenanzahl
  • Kostenverteilung nach Modell oder Label betrachten
  • Anbindung an das Überwachungssystem über Prometheus usw.

Protokolle, Überwachbarkeit und Guardrails

Das Gateway unterstützt Protokollierung von Anfragen und Antworten, Callbacks, Metriken sowie verschiedene Überwachungsfunktionen. Zudem kann es mit Mechanismen zur Inhaltssicherheit und zu Guardrails integriert werden. Ob Prompte und Antworten protokolliert werden, wird durch die Konfiguration festgelegt. Bei der Verarbeitung sensibler Daten sollte grundsätzlich eine Strategie der Minimierung der Protokollierung angewandt werden.

MCP und Agenten-Gateway

Das aktuelle Projekt umfasst außerdem die Funktionen von MCP Gateway und A2A Agent Gateway, wodurch MCP-Tools oder kompatible Agenten hinter einer einheitlichen Schnittstelle platziert werden können. Der Administrator muss weiterhin die Autorisierungen der Tools, den Netzwerkzugriff, die Genehmigungsrichtlinien sowie den Umfang der Zugangsdaten separat steuern.

Unterstützte Modelle und Dienste

Offiziell wird angegeben, dass mehr als 100 Modellanbieter unterstützt werden, wobei die genaue Anzahl mit den Versionen variiert. Zu den gängigen Optionen gehören OpenAI, Anthropic, Google Gemini, Azure OpenAI, Amazon Bedrock, Vertex AI, Cohere, Mistral, DeepSeek, xAI, Ollama und vLLM usw.

KategorieBeispielErinnerungen verwenden
Business-Modell-APIOpenAI, Anthropic, Gemini, Mistral, xAIJeder benötigt seinen eigenen Schlüssel und zahlt zu den vom Anbieter festgelegten Preisen.
Cloud-Plattform-ModellAzure, Bedrock, Vertex AIBezieht sich auf Cloud-Konten, Regionen, Berechtigungen und Netzwerkkonfigurationen
Lokale oder selbst gehostete InferenzOllama, vLLM, LM StudioMan muss die Modelle, die Rechenleistung sowie die Server-Endpunkte selbst bereitstellen.
Multimodale DiensteAnbieter für Bilder, Audio, Einbetungen und NeuordnungDer Grad der Unterstützung für Endpunkte variiert je nach Anbieter.

Preis und Version

Die folgenden Informationen wurden am 24. August 2026 überprüft. LiteLLM nutzt ein Modell mit einer kostenlosen, open-source-basierten Kernsoftware sowie kostenpflichtigen Unternehmensfunktionen. Die Kosten für Unternehmen werden nicht nach der Anzahl der Modelleingaben berechnet, sondern basieren auf der jährlichen Anzahl der Gateway-Anfragen, der Implementierungsarchitektur sowie den Anforderungen an den Support.

VersionLizenz oder PreisHauptfähigkeitenZielgruppe
Open SourceKeine Lizenzgebühren von 0 US-Dollar, dauerhaft kostenlos self-hostenEinheitliche API, virtuelle Schlüssel, Benutzer und Teams, Kostenverfolgung, Budgets, Geschwindigkeitsbeschränkungen, Fallback-Mechanismen, Protokolle sowie Prometheus-MetrikenEntwickler und Teams, die in der Lage sind, selbst zu deployen und zu warten.
EnterpriseJahresvertrag, Kontaktieren Sie den Verkauf für PreisanfragenOpen-Source-Funktionen inklusive SSO, SCIM, OIDC oder JWT, Audit-Logs, Schlüsselwechsel, Organisationsrechte, Mehrregionskontrolle und UnternehmensunterstützungGroßangelegte Organisationen, die reguliert werden oder für die Service-Level-Agreements erforderlich sind
Enterprise-Testversion30 Tage, ohne Kreditkarte erforderlichZur Überprüfung der UnternehmenslizenzfunktionenTeam zur Überprüfung der Sicherheits- und Governance-Anforderungen vor dem Einkauf

Die Standardunterstützung der Unternehmensversion beinhaltet eigene Kommunikationskanäle. Der in den offiziellen Dokumenten angegebene Service-Level-Agreement für eine 24-Stunden-Unterstützung kann zusätzliche Kosten verursachen. Die tatsächlichen Preise, die gewünschte Kapazität, das isolierte Netzwerk, die Multi-Region-Deployment-Möglichkeiten sowie der Servicelevel richten sich nach den Vereinbarungen im Vertrag.

Welche Kosten gibt es noch in der kostenlosen Version?

  • Kosten für den Aufruf von upstream-Modellen wie OpenAI, Anthropic, Gemini usw.
  • Kosten für Cloud-Server, Container oder lokale Hardware
  • PostgreSQL, Redis und Objektspeicher, die für die Produktionsumgebung erforderlich sind
  • Kosten für Protokollierung, Überwachung, Backups, Netzwerkverkehr und Sicherheitsdienste
  • Personalkosten für die Einrichtung, Aufrüstung, Fehlerbehebung und Konformitätsprüfungen

Daher bedeutet „kostenlose Self-Hosting“ lediglich, dass für den Open-Source-Kern keine Lizenzgebühren anfallen, und nicht, dass der Betrieb des Gateways sowie die Modellverarbeitung kostenlos sind. Vor dem Kauf oder der Bereitstellung sollten Verbrauch, Infrastruktur und Wartung in die Gesamtkosten einbezogen werden.

Einrichtungsmethode

  • Verwenden Sie Python-Pakete, um das SDK direkt zu integrieren oder einen Proxy-Dienst zu starten.
  • Betrieb des AI Gateway und der Verwaltungsoberfläche über offizielle Container-Images
  • Verwendung von Docker Compose zur Erstellung von Test- oder kleinen Umgebungen
  • Durch Helm im Kubernetes-Cluster bereitstellen
  • Mit den offiziellen Terraform-Modulen auf AWS oder Google Cloud bereitstellen
  • Die Unternehmensversion kann auf eigener Infrastruktur betrieben werden und unterstützt isolierte Netzwerklösungen.

In der Produktionsumgebung sind in der Regel auch Datenbanken, Caching-Systeme, Reverse-Proxy-Server, TLS-Verfahren, Mechanismen zur Verwaltung von Geheimnissen sowie Überwachungs- und Backup-Funktionen erforderlich. Offiziell wird empfohlen, für Produktionsimages stabile Tags zu verwenden. Dennoch sollten die Teams eine klare Version festlegen, um unplanmäßige Updates, die zu Verhaltensänderungen führen könnten, zu vermeiden.

Schneller Nutzungsvorgang

  1. Ermitteln Sie klar, ob das Python SDK oder ein zentrales AI-Gateway verwendet werden soll, und listen Sie die Anbieter der Modelle auf, die angeschlossen werden müssen.
  2. Vorbereiten Sie die Konten, API-Schlüssel, Regionen und Quoten für die verschiedenen Modell-Dienste – schreiben Sie die Schlüssel nicht in den Quellcode.
  3. Installieren Sie LiteLLM in der Testumgebung oder starten Sie den offiziellen Container und konfigurieren Sie die Modell-Alias sowie die Upstream-Endpunkte.
  4. Erstellen Sie eine Haupt- und eine virtuelle Schlüssel, und legen Sie für Anwendungen, Teams oder Projekte eine Allowlist für Modelle sowie Budget- und Geschwindigkeitsbeschränkungen fest.
  5. Lassen Sie die Anwendung auf die Gateway-Adresse und eine mit OpenAI kompatible Aufrufmethode umsteigen, um fließende Ausgaben, Tool-Aufrufe sowie Fehlerbehandlung zu überprüfen.
  6. Konfigurieren von Timeout, Wiederholungsversuchen, Rückfallstrategien, Maskierung von Protokollen, Metriken, Alarmen und Datenbankbackups.
  7. Durchführen von Parallelitäts-, Fehler- und Kostentests, bevor eine stabile Version in die Produktionsumgebung veröffentlicht wird.

Für welche Benutzer geeignet

  • Entwickler von KI-Anwendungen, die gleichzeitig mehrere große Modelle aufrufen müssen
  • Das Team der Plattform, das eine einheitliche Verwaltung von Schlüsseln und Gebühren anstrebt.
  • Unternehmen, die Budgets und Zugriffsrechte für mehrere Abteilungen zuweisen müssen
  • Produktionsysteme, die ein Modellrückfall und Lastverteilung benötigen
  • Organisationen, die das Modell-Gateway in ihrem eigenen Netzwerk beibehalten möchten
  • Teams, die zwischen Cloud-Modellen und lokalen Modellen wechseln müssen

Vorteile des Produkts

  • Breites Spektrum an kompatiblen Modellen und Anbietern – dadurch wird eine wiederholte Anpassung vermieden.
  • Zwei Einsatzebenen: SDK und zentrales Gateway
  • Der Open-Source-Kern kann selbst überprüft, geändert und bereitgestellt werden.
  • Virtuelle Schlüssel, Budgets und Geschwindigkeitsbeschränkungen eignen sich für die Verwaltung mehrerer Mieter.
  • Fähigkeiten zur Routenplanung, Wiederholungsversuchen, Rückfallstrategien, Caching sowie zur Überwachbarkeit
  • Unterstützung für Container, Kubernetes und gängige Cloud-Infrastrukturen

Einschränkungen und Risiken

Kompatible Schnittstellen bedeuten keine vollständige Übereinstimmung.

Verschiedene Modelle weisen weiterhin Unterschiede in Bezug auf die Aufrufung von Tools, die strukturierte Ausgabe, Bilder, Audio, die Länge des Kontexts sowie das Verhalten bei Fehlern auf. Vor dem Wechsel auf ein anderes Modell müssen tatsächliche Testfälle durchgeführt werden – es reicht nicht aus, nur eine einfache Chatanfrage zu überprüfen.

Die Preisschätzung muss gepflegt werden.

Die Kostenverfolgung stützt sich auf Modellpreise und Token-Berechnungsdaten; Abweichungen können auftreten, wenn Lieferanten ihre Preise anpassen oder neue Modelle eingeführt werden. Die finanziellen Abrechnungen sollten anhand der Rechnungen aus den vorherigen Schritten erfolgen, wobei die Statistiken von LiteLLM besser für die Betriebsüberwachung geeignet sind.

Der Gateway wird zu einer Schlüsselinfrastruktur.

Nachdem der Datenverkehr aller Modelle zusammengeführt wurde, können fehlerhafte Konfigurationen, Datenbankprobleme oder Versionsaufwertungen mehrere Anwendungen beeinträchtigen. In der Produktivumgebung sollten hohe Verfügbarkeit, Kapazitätsplanung, Health Checks, Rollbacks sowie Katastrophenwiederherstellung eingestellt werden.

Offene Quellen bedeuten nicht automatisch Sicherheit.

Der Administrator muss die Authentifizierung, die Netzwerkisolation, TLS, den Schlüsselwechsel sowie die Maskierung von Protokollen selbst konfigurieren. Wenn die Protokollierung von Anfragen und Antworten aktiviert wird, können die Eingabeanfragen sowie die Antworten des Modells in eine Datenbank oder in ein System zur Überwachung durch Dritte gelangen.

Daten und Privatsphäre

Selbstverwaltung bedeutet, dass die Hersteller von LiteLLM in der Regel nicht für die Verwaltung des Gateway-Traffics sowie der Schlüssel der Nutzer verantwortlich sind. Die Anfragen an die Modelle werden jedoch weiterhin an den konfigurierten upstream-Modellservice gesendet. Auch Protokolle, Caches, Guardrails sowie Tools zur Überwachung können mit den Eingaben und Ausgaben in Berührung kommen.

  • Speichern Sie den Modell-Schlüssel nur in einem geheimen Verwaltungssystem.
  • Erstellung unabhängiger virtueller Schlüssel für verschiedene Anwendungen
  • Deaktivieren von unnötigen Hinweisen und Antwort-Log-Texten
  • Desensibilisierung von personenbezogenen Daten, Geschäftsgeheimnissen und Zugangsdaten
  • Überprüfung der Datenerhaltungspolitiken jeder Modell- und Überwachungsdienstleistung
  • Regelmäßige Aktualisierung von Sicherheitspatches und Überprüfung der Signatur der Container-Images

Erklärung zur Open-Source-Lizenz

Im LiteLLM-Repository werden nicht alle Verzeichnisse unter derselben Lizenz bereitgestellt. Laut der Hauptlizenzrichtlinie unterliegt der Inhalt des enterprise-Verzeichnisses der eigenen Unternehmenslizenz dieses Verzeichnisses, während der Rest des unbeschränkten Codes unter der MIT-Lizenz steht.

CodeumfangLizenzstatusAnleitung zur Verwendung
Open-Source-Kern und nicht-kommerzielle VerzeichnisseMIT-LizenzEs darf unter Beibehaltung der Urheberrechts- und Lizenzangaben verwendet, verändert und verbreitet werden.
Enterprise-KatalogEinzellicenz für das UnternehmenverzeichnisMan darf nicht davon ausgehen, dass der gesamte Unternehmenscode aufgrund der Offenlegung des Lager-Systems frei für kommerzielle Zwecke genutzt werden kann.
Externe Modelle und SDKsJeglicher BestandteilModellgewichte, APIs und Drittanbieter-Abhängigkeiten erben die LiteLLM-Lizenz nicht automatisch.

Versionen und Wartungsempfehlungen

LiteLLM wird häufiger veröffentlicht. Die offizielle Versionspolitik unterstützt die letzten vier stabilen Unter-Versionen; ältere Versionen werden schrittweise nicht mehr aktualisiert. Produktivsysteme sollten auf eine bestimmte stabile Version festgelegt werden, wobei zunächst in einer Vorab-Testumgebung getestet und anschließend aktualisiert wird.

  • Speichern der genauen Version des aktuellen Images oder Pakets
  • Lesen Sie die Änderungsprotokolle und achten Sie auf Sicherheitsmitteilungen.
  • Vorbereitung von Backups und Rollbacks für Änderungen der Datenbankstruktur
  • Testen von Kernmodellen, Toolaufrufen, fließenden Antworten und Fallback-Pfaden
  • Planen Sie den Upgrade, bevor das Support-Fenster für die Version schließt.

Häufige Fragen

Ist LiteLLM kostenlos?

Die Lizenzgebühren für die Open-Source, selbst gehostete Version betragen 0 US-Dollar. Für Modelle-APIs, Server, Datenbanken, Überwachung und Wartung entstehen weiterhin Kosten, und für Funktionen zur Unternehmensführung und zum Support ist ein Kostenvoranschlag erforderlich.

Bietet LiteLLM eine Model-Limitierung an?

Nicht verfügbar. Der Benutzer muss sein eigenes Konto beim Modellanbieter konfigurieren, sowie Schlüssel und Limits einrichten, oder eine selbst bereitgestellte Modellservice-Plattform nutzen.

Ist LiteLLM wie OpenRouter?

Nicht ganz dasselbe. LiteLLM ist hauptsächlich ein selbsthostierbares Gateway und SDK, das nicht alle Modell-Lizenzen zentral verkauft; OpenRouter hingegen ist ein gehosteter Modell-Aggregationsdienst.

Kann es in privater Weise eingesetzt werden?

Ja. Die Open-Source-Version kann auf eigenen Infrastrukturen betrieben werden. Auch die Enterprise-Version wird selbst gehostet, und es können auf Vertragsbasis stärkere Funktionen zur Steuerung, zum Support sowie zur Netzwerkisolation bereitgestellt werden.

Wird ein chinesischer Modell unterstützt?

Es werden einige chinesische und internationale Modellanbieter unterstützt, wobei sich die konkreten Modelle, Regionen sowie die Funktionalitäten der Endpunkte ändern können. Vor der Anbindung sollte man die aktuelle Liste der Anbieter prüfen und die Funktionalitäten im Chinesischen direkt testen.

Wie viel kostet die Unternehmensversion?

Die offizielle Website gibt keinen festen Betrag an; es wird ein Preis auf Grundlage der jährlichen Anforderungen bezüglich Kapazität, Architektur und Unterstützung kalkuliert. Derzeit steht eine 30-tägige Testversion für Unternehmen zur Verfügung. Der endgültige Preis richtet sich nach dem Verkaufsvertrag.

Zusammenfassung

LiteLLM eignet sich für Entwicklerteams, die eine einheitliche API, Berechtigungen, Budgets, Routing-Strategien sowie Überwachungsfunktionen für ihre Modelle benötigen. Die Open-Source-Version umfasst die grundlegenden Funktionen eines Gateways, während die Enterprise-Version zusätzlich fortgeschrittene Funktionen zur Verwaltung von Identitäten, Auditing-Möglichkeiten sowie Unterstützung für mehrere Regionen bietet. Dennoch müssen die Nutzer weiterhin die Kosten für die Modelle sowie die Verantwortung für die Infrastruktur und den Sicherheitsbetrieb tragen.

©️ Urheberrechtshinweis: Sofern nicht anders angegeben, liegen die Urheberrechte an allen Artikeln auf dieser Website beiTeilen von AI-ToolsAlle Urheberrechte liegen bei uns. Ohne Genehmigung darf keine Person, kein Medienunternehmen, keine Website oder irgendeine Gruppe den Inhalt dieser Website kopieren, nachahmen oder auf andere Weise verbreiten. Ebenso ist es nicht gestattet, Spiegelseiten auf Servern zu erstellen, die nicht uns gehören. Andernfalls behalten wir uns das Recht vor, rechtliche Schritte gegen die Verantwortlichen einzuleiten.

Tools, die dem LiteLLM ähneln