DeepInfra
DeepInfra – damit KI effizienter und einfacher arbeiten kann
Tags:KI-Lern-WebsitesWas ist DeepInfra?
DeepInfra ist eine KI-Inferenz-Cloud, die von der amerikanischen Firma Deep Infra Inc. betrieben wird. Sie richtet sich an Entwickler und Unternehmen, die Sprache, Bilder, Sprachaufnahmen, Videos sowie herkömmliche Machine-Learning-Modelle in ihre Produkte integrieren möchten.
Die Plattform bietet außerdem gemeinsam genutzte Serverless-Inferenzlösungen, Batch-Verarbeitung, die Bereitstellung privater Modelle, GPU-Instanzen, Code-Sandboxes sowie gehostete Agenten. Sie löst Probleme wie die Einrichtung von Modellen, flexible Skalierbarkeit, Interfacedekompabilität sowie die Kosten für die Inferenz – anstatt lediglich eine Chat-Seite bereitzustellen.
Hauptfähigkeiten
- Modell-Inferenz teilen: Wählen Sie aus dem Modellkatalog ein Sprach-, Embedding-, Umordnungs-, Bild-, Video-, Sprach- oder Klassifizierungsmodell aus. Die Gebühren werden nach tatsächlich verwendeten Tokens oder Ausführungseinheiten berechnet – es ist kein eigenes Management von GPUs erforderlich.
- OpenAI-kompatible Schnittstelle: Chatten, Textvervollständigung, Einbetten und Bildgenerierung – das OpenAI SDK kann wiederverwendet werden, indem lediglich die Basisadresse, der Modellname und der Schlüssel geändert werden.
- Ursprüngliche multimodale Schnittstelle: Abdeckt Aufgaben wie Bildgenerierung, Spracherkennung, Objekterkennung, Bildklassifizierung, Klassifizierung ohne Beispiele, Entitätserkennung und Maskenerfüllung, die von anderen kompatiblen Schnittstellen nicht abgedeckt werden.
- Batch-Verarbeitung: Eine große Anzahl an nicht-echtzeitigen Anfragen wird als Dateien und Batchs asynchron eingereicht. Dies eignet sich für Offline-Bewertungen, Inhaltsverarbeitung sowie Dateneinordnung. Die Qualität der Bearbeitung offener Dokumente ist um 20 % geringer als bei der Echtzeitverarbeitung.
- Private Modelle: Hugging Face-Modelle, eigene Gewichte, Sprach-LoRA oder Bild-LoRA werden auf dedizierten GPUs bereitgestellt – dies bietet isolierte Endpunkte, automatische Skalierung sowie kürzere, vorhersehbarere Latenzzeiten.
- GPU-Instanz: Mieten Sie einen B200-Container, um über SSH Training, Feinabstimmung, Inferenz oder benutzerdefinierte Workloads auszuführen – die Gebühr wird nach Laufzeit berechnet.
- Sandboxes: Isolierte Linux-Mikrovirtualmaschinen können nach Bedarf gestartet werden, damit Agenten Code ausführen, Dateien in der Arbeitsumgebung lesen und schreiben sowie auf das öffentliche Internet zugreifen können. Nach dem Stoppen fallen keine Berechnungskosten an.
Unterstützte Modellaufgaben
| Aufgabenkategorie | Typische Eingabe | Hauptausgabe | Passende Szenarien |
|---|---|---|---|
| Chatten und Schlussfolgern | Nachrichten, Systemanweisungen, Tool-Definitionen, Bilder | Texte, strukturierte Daten, Toolaufrufe | Kundenservice, Wissensassistenten, Intelligenzagenten und Code-Anwendungen |
| Einbetten und Umordnen | Abfragen und Dokumentensammlungen | Vektor oder Korrelationskoeffizient | Semantische Suche, RAG und Suchrangliste |
| Bilder und Videos | Anleitungen, Bilder und Erstellungsparameter | Bilder, Bearbeitungsergebnisse oder Videoaufgaben | Visuelle Materialien, Prototypen und Inhaltsproduktion |
| Stimme | Audio oder Text | Transkription, Übersetzung oder synthetische Sprachwiedergabe | Konferenztranskription, Untertitel und Sprachinteraktion |
| Visuelle und textbasierte Klassifizierung | Bilder, Texte oder Vorschlagslabels | Kategorien, Rahmen, Entitäten oder Wahrscheinlichkeiten | Prüfung, Informationsextraktion und automatische Annotation |
Der Unterschied zwischen den beiden API-Seten
| Interface-Typ | Abdeckungsfähigkeit | Hauptvorteile | Für Nutzer geeignet |
|---|---|---|---|
| OpenAI-kompatible Schnittstelle | Chatten, Ergänzen, Einbetten, Bilder usw. | Bestehende OpenAI-Clients und Aufrufstrukturen können wiederverwendet werden. | Übertragung bestehender Anwendungen oder schnelle Prototypen |
| DeepInfra- natives Interface | Alle Modelltypen, die von der Plattform angeboten werden | Unterstützung für weitere Funktionen wie visuelle Aufgaben, Sprachverarbeitung, Klassifizierungen sowie Callbacks. | Projekte, die einen vollständigen Modellkatalog sowie Parameter in hoher Auflösung benötigen |
Alle Schnittstellen nutzen Bearer Tokens zur Authentifizierung. Die Parameter der verschiedenen Modelle, die Länge des Kontexts, die fließende Ausgabe, die Aufrufe von Tools, die strukturierte Ausgabe sowie die Multimodalität sind nicht einheitlich; man kann nicht einfach den Modellnamen austauschen und davon ausgehen, dass sich das Verhalten vollständig gleich verhält.
Schneller Zugangsweg
- Registrieren Sie ein Konto, erstellen Sie in der Konsole einen API-Token und verwenden Sie unterschiedliche Schlüssel für die Entwicklungs-, Test- und Produktionsumgebung.
- Wählen Sie das Modell aus dem Modellverzeichnis aus und überprüfen Sie die Lizenz, den Kontext, die Eingabetypen, das Ausgabeformat, den Einzelpreis, die Geschwindigkeitsbeschränkungen sowie die Ausnahmen bei der Datenverarbeitung.
- Für kompatible Schnittstellen kann weiterhin das OpenAI SDK verwendet werden; für spezielle Aufgaben wird stattdessen der native Schnittstelle genutzt, wobei die Anfragen gemäß dem Modellschema erstellt werden.
- Zuerst werden mit geringem Durchsatz Timeout, Flussreaktion, Toolaufrufe, Fehlerwiederholungen und Ausgabegüte getestet, anschließend werden Limits für Konkurrenz, Budget und automatische Aufladung festgelegt.
- Nach dem Go-Live werden durch die Überwachung der Nutzungsmenge und der Anfragenkosten Token, Cache-Erfolge, Verzögerungen sowie die Fehlerquote erfasst, um unbegrenzte Wiederholungsversuche zu vermeiden.
Abrechnungsmodell für gemeinsames Reasoning
Sprachmodelle werden in der Regel pro 1 Million Eingangs- und Ausgabetoken abgerechnet; einige Modelle bieten außerdem einen niedrigeren Preis pro gespeichertem Eingabedatenblock. Bilder, Sprache, Video und andere Modelle können nach der Länge des Bildes oder Audiomaterials, der Anzahl der erzeugten Sekunden oder der Dauer der Berechnung abgerechnet werden.
| Paket oder Version | Preis | Abrechnungszeitraum | Kernrechte oder -beträge | Für Nutzer geeignet |
|---|---|---|---|---|
| Llama 3.1 8B Turbo | Eingabe: 0,02 US-Dollar, Ausgabe: 0,04 US-Dollar | Jede 1 Million Tokens | Kostenloser Text-Reasoning im Kontext von 128K | Klassifizierung, Zusammenfassung und leichter Assistent |
| Llama 3.3 70B Turbo | Eingabe: 0,10 US-Dollar, Ausgabe: 0,32 US-Dollar | Jede 1 Million Tokens | Allgemeine Chatten- und Schlussfolgerungsfunktionen für größere Modelle | Anwendungen mit höheren Qualitätsanforderungen |
| DeepSeek V4 Flash | Eingabe: 0,09 US-Dollar, Ausgabe: 0,18 US-Dollar | Jede 1 Million Tokens | Es gibt außerdem einen noch niedrigeren Preis pro Einheit für den Cache-Eingang. | Langer Kontext und Aufgaben mit hoher Durchsatzrate |
| Qwen 3.5 9B | Eingabe: 0,10 US-Dollar, Ausgabe: 0,15 US-Dollar | Jede 1 Million Tokens | 256K Kontext | Mehrsprachigkeit und leichtgewichtige Inferenz |
| Kimi K2.5 | Eingabe: 0,45 US-Dollar, Ausgabe: 2,25 US-Dollar | Jede 1 Million Tokens | Es gibt außerdem preisbezogene Cache-Eingaben. | Langer Kontext und komplexe Aufgaben |
Oben ist ein repräsentatives Beispiel der Seiten mit den Echtzeitpreisen dargestellt – es handelt sich dabei nicht um feste Pakete oder Preisgarantien. Die verfügbaren Modelle, Versionen, Caching-Regeln sowie die Preise können sich ändern. Für eine genaue Schätzung sollten die Informationen der ausgewählten Modellseite sowie die Kontoinformationen herangezogen werden.
Kostenlose Kontingente, Aufladungen und Rückerstattungen
- Derzeit gibt es keine bestätigten, dauerhaft gültigen kostenlosen API-Pakete oder monatliche kostenlose Gebührenlimits für alle Konten; registrierte Rabatte und Promotionsbeträge gelten nicht als dauerhafte Vorteile.
- Bei der gemeinsamen Inferenz wird ein Pay-as-you-go-Modell verwendet. Es ist möglich, Geld auf das Konto einzuzahlen und eine automatische Auffüllung einzustellen; bei unzureichendem Saldo können Anfragen, Sandbox-Umgebungen oder Instanzoperationen ausgesetzt werden.
- Unternehmensdienstleistungen können durch Serviceaufträge hinsichtlich Zahlungsfristen, Support und weiterer Bedingungen festgelegt werden; auf der öffentlichen Seite gibt es keine einheitlichen Preise für Unternehmen.
- Die geltenden Bestimmungen bieten keine allgemeine Rückerstattungsgarantie für alle Vorauszahlungen und verbrauchten Mengen; im Falle eines Vertragsbruchs und bei Unmöglichkeit der erneuten Erfüllung gelten die Bestimmungen als spezielle Abhilfemittel für die Rückerstattung.
Batchverarbeitung und Kostensenkung
- Für Aufgaben, bei denen keine sofortige Rückgabe erforderlich ist, kann die Batch-API verwendet werden. Dadurch erhält man einen Rabatt von 20 % gemäß den Angaben in der Dokumentation und es wird außerdem der Druck durch gleichzeitige Anfragen verringert.
- Beim Wiederholten Gebrauch langer Prompt-Prefixe kann der Prompt-Cache genutzt werden, um die Verzögerung beim Vorausfüllen sowie die Kosten für das Lesen aus dem Cache zu verringern. Die verfügbaren Zeiträume umfassen kurze Zeitintervalle sowie eine Stunde.
- Stellen Sie sicher, dass die Antwort nur die erforderliche Länge hat, und legen Sie Obergrenzen für den maximalen Ausgabetoken, die Konkurrenz sowie die Anzahl der Wiederholungsversuche fest.
- Zuerst werden Klassifizierung, Routing und Extraktion mit kleinen Modellen bearbeitet, während die wenigen komplexen Anfragen an große Modelle weitergeleitet werden. Dies ist in der Regel kontrollierbarer als die Verwendung eines teuren Modells für alle Anfragen gleichzeitig.
Private Modelle und eigene Implementierungen
| Bereitstellungsart | Abrechnungsmethode | Kernkompetenzen | Für Nutzer geeignet |
|---|---|---|---|
| Shared Serverless | Nach Token oder Rechenmenge | Keine Verwaltung von Instanzen nötig, Kapazität wird automatisch geteilt | Stromschwankungen und schnelles Online-Gehen |
| Private LLM | Nach GPU-Stunden | Mit Gewichtung, isolierte Endpunkte, automatische Skalierung, kompatible Schnittstellen | Angepasste Modelle und stabile Verzögerungen |
| LoRA-Einsatz | Nach speziellen Ressourcen | Sprache oder Bildadapter laden | Domain-Tuning und Markenstil |
| B200 GPU-Instanz | Ab 3,69 US-Dollar pro Stunde | SSH, Container, 180 GB Grafikspeicher, Abrechnung pro Minute | Training, Feinjustierung und Anpassung von Programmen |
| Unternehmenslösungen | Individuelle Kostenschätzung | Serviceaufträge, Kapazitäten, Support und Geschäftsbedingungen | Großangelegte oder spezielle Compliance-Anforderungen |
Bei einer privaten Bereitstellung wird weiterhin Gebühren berechnet, solange die GPU im Betrieb ist – unabhängig davon, ob eine Anfrage vorliegt. In den Dokumentbeispielen wird darauf hingewiesen, dass das Vergessen, eine Bereitstellung mit zwei GPUs über 64 Stunden hinweg auszuschalten, Kosten von etwa 256 US-Dollar verursachen kann. Deshalb müssen Budgetobergrenzen sowie automatische Skalierungsmechanismen eingestellt werden.
Sandboxes Code-Sandbox
- Jede Sandbox ist eine eigenständige Linux-Mikrovirtuelle Maschine, die Befehle ausführen sowie Python nutzen kann. Sie ermöglicht außerdem den Transfer von Dateien und den Zugriff auf das öffentliche Internet. Allerdings werden keine eingehenden Verbindungen empfangen, und es ist kein Zugriff auf andere Sandboxes oder das interne Netzwerk von DeepInfra möglich.
- Es wird pro Sekunde abgerechnet, ohne Mindestzeitraum. Die Erstellung, Aktivierung, Ausführung und Beendigung werden berechnet; der Zustand der Beendigung wird nicht berechnet.
- Nur der Arbeitsbereichskatalog wird zwischen einem normalen Beenden und Neustarten beibehalten, maximal 7 Tage nach dem Beenden; im Fehlerzustand wird er innerhalb weniger Minuten gelöscht, eine Wiederherstellung des Arbeitsbereichs ist nicht garantiert.
- Die Standard-Wartezeit beträgt 1 Stunde; nach 24 Stunden ununterbrochener Nutzung wird die Funktion automatisch gestoppt. Eine einzelne Anweisung kann maximal 30 Minuten lang ausgeführt werden. Pro Konto sind maximal 5 Sandkästen im nicht-gestoppten Zustand zulässig.
- Die maximale Größe für eine einzige Lese- oder Schreiboperation beträgt 100 MiB. Wichtige Ergebnisse sollten umgehend auf eine externe Speicherstelle kopiert werden.
Datenschutz und keine Datenspeicherung
- Die Eingaben für die gewöhnliche Schlussfolgerung existieren nur während der Verarbeitung im Speicher und werden nicht auf die Festplatte geschrieben; nach der Rückgabe der Ausgabe werden sie aus dem Speicher gelöscht. Die Plattform gibt an, diese Daten nicht zur Trainierung von Modellen zu verwenden.
- Die erzeugten Bildausgaben werden kurzfristig gespeichert, um darauf zuzugreifen. Bei Batch-Verarbeitungen können die Daten verschlüsselt auf der Festplatte gespeichert und kurz nach Rückgabe des Ergebnisses wieder gelöscht werden.
- Beim Aufruf der Google- oder Anthropic-Modelle werden die Daten an die entsprechenden Modell-Endpunkte übermittelt. Die Speicherung der Ausgaben, die Protokollierung sowie die Regeln für das Training unterliegen den Richtlinien des jeweiligen Anbieters.
- Die Plattform protokolliert in der Regel nicht den Inhalt der Anfragen, führt aber Metadaten wie die Anfragennummer, die Kosten sowie die Sampling-Parameter auf. Zudem behält sie sich das Recht vor, bei Bedarf zur Fehlersuche oder zur Sicherheit eine geringe Anzahl von Anfragen zu protokollieren.
- Kontoinformationen, Kommunikationsdaten, Geräteinformationen, Nutzungsdaten, Netzwerkadressen sowie Rechnungsinformationen werden gemäß der Datenschutzrichtlinie behandelt. Nach Löschung des Kontos werden personenbezogene Daten in der Regel nach 30 Tagen entfernt, wobei gesetzliche, steuerliche oder sicherheitstechnische Aufzeichnungen eine Ausnahme darstellen können.
Sicherheit und Konformität
DeepInfra gibt an, dass seine Sicherheitsmaßnahmen den Anforderungen von SOC 2 und ISO 27001 entsprechen, und bietet zudem technische sowie organisatorische Maßnahmen im Einklang mit GDPR und HIPAA. Zertifizierungen und Kontrollen sichern jedoch nicht automatisch die Konformität der Kundenanwendungen; vor der Verarbeitung von gesundheitlichen, finanziellen oder anderen sensiblen Daten müssen Verträge, DPA, ausgewählte Modelle sowie regionale Anforderungen überprüft werden.
- API-Tokens sollten ausschließlich auf der Serverseite oder in einem Schlüsselverwaltungssystem gespeichert werden, nach Umgebungen getrennt und regelmäßig erneuert werden.
- Um dem Endbenutzer einen eingeschränkten Zugriff zu gewähren, können JWTs mit Gültigkeitsbereich und -dauer verwendet werden, um die Ausgabe eines Hauptkontostokens zu vermeiden.
- Prüfen Sie vor der Verwendung von Drittanbietermodellen, wohin die Daten gesendet werden, und wenden Sie die Aussage über die keine Speicherung von Standardwerten nicht auf ausdrücklich aufgeführte Ausnahmen an.
- Legen Sie Zugriffssteuerung und Löschprozesse für Protokolle, Callbacks und Batch-Dateien fest, um zu verhindern, dass sensible Benutzerinhalte in das eigene Überwachungssystem geschrieben werden.
SDK, Integration und Open-Source-Status
- Der offizielle TypeScript-Client deepinfra-node verwendet die MIT-Lizenz und umfasst native Schnittstellen für Text, Embedded-Elemente, Bilder, Sprache sowie Klassifizierung.
- Das Python-Paket deepinfra umfasst Funktionen für die Inferenz sowie Sandboxes. In der README-Datei des aktuellen Repositoriums wird es als offizielles SDK beschrieben und unterliegt der MIT-Lizenz.
- Das Dokument bietet außerdem Anleitungen zur Integration von LangChain, LlamaIndex, Vercel AI SDK, AutoGen, Anthropic SDK sowie diverser Agenten-Frameworks.
- Offen zugänglich sind der Client sowie ein Teil des Integrationscodes – das bedeutet jedoch nicht, dass die DeepInfra-Cloudplattform, das Scheduling-System oder die gehosteten Modelle ebenfalls offen zugänglich sind. Jedes Drittanbietermodell unterliegt weiterhin seinen eigenen Lizenzen und Nutzungsbedingungen.
Geeignet für Nutzer und Einschränkungen
- Anwendungsentwickler: Schneller Zugriff auf mehrere Modelle bei Beibehaltung kompatibler Schnittstellen, jedoch sind Tests und Rückfallmechanismen aufgrund der Unterschiede zwischen den Modellen erforderlich.
- RAG und Suchteams: Kombination von Eingebettung, Umordnung und Generierungsmodellen sowie Optimierung der Kosten durch Batch-Verarbeitung und Caching.
- Teams mit eigenem Gewicht: Die Verwendung privater GPUs gewährleistet Isolation und stabile Latenzzeiten, kommt jedoch mit laufenden Kosten für den Betrieb zusammen.
- Entwickler von Agenten: Führen Sie unzuverlässigen Code in einer Sandbox aus, müssen aber eine kurze Lebensdauer sowie das Risiko des Datenverlusts in die Gestaltung einbeziehen.
- Projekte, bei denen das Verhalten des Modells absolut festgelegt werden muss, dauerhafte kostenlose Quoten erforderlich sind oder bei denen es keinerlei Verarbeitung durch Dritte geben darf, sollten sich nicht allein auf die Standardeinstellungen des gemeinsamen Verzeichnisses verlassen.
Häufige Fragen
Hat DeepInfra eine dauerhaft kostenlose API?
Derzeit gibt es keine bestätigten dauerhaften kostenlosen Pakete oder feste monatliche Gebühren für alle Konten. Der Rabattbetrag kann je nach Aktionen und Kontoeinstellungen variieren; die Kosten sollten anhand der aktuellen Einzelpreise sowie der tatsächlichen Rechnungen berechnet werden.
Kann man das OpenAI SDK direkt verwenden?
Ja, die Schnittstellen für Chatten, Ergänzen, Einbetten und Bilder können wiederverwendet werden – dabei kommt das OpenAI SDK zum Einsatz. Dennoch müssen die Basisadresse, der DeepInfra-Token sowie der Modellname geändert werden, außerdem muss auf die Kompatibilität der Parameter geachtet werden.
Speichert DeepInfra die Prompts und verwendet sie zur Trainierung?
Einfache Schlussfolgerungen werden nicht gespeichert; die Ausgaben werden nach ihrer Rückgabe gelöscht. Die Plattform gibt an, dass sie nicht zur Trainierung verwendet wird. Ausnahmen gelten für Bilder, Batch-Verarbeitungen sowie Google- und Anthropic-Modelle. In Fällen der Fehlerbehebung oder zur Sicherheit können auch geringe Anzahl an Anfragen aufgezeichnet werden.
Wie wählt man zwischen gemeinsamer Inferenz und privater Implementierung?
Bei Schwankungen im Datenverkehr und während die Modelle noch bewertet werden, sollte der Schritt der Inferenz vorrangig erfolgen; bei Bedarf an eigenen Gewichten, Isolation, stabiler Verzögerung oder dedizierter Kapazität sollte eine private Implementierung gewählt werden, wobei die Kosten für den Betrieb der GPU ständig überwacht werden müssen.
Ist DeepInfra eine Open-Source-Plattform?
Die Cloud-Plattform selbst ist kein vollständig offenes Open-Source-Projekt. Die offiziellen Python- und TypeScript-Clients sowie einige Integrationen unterliegen einer Open-Source-Lizenz, während die gehosteten Modelle jeweils ihren eigenen Lizenzbedingungen folgen.
Warum ist Batch-Verarbeitung günstiger?
Batch-Verarbeitung ermöglicht es der Plattform, nicht dringende Anfragen asynchron zu verarbeiten; laut den offiziellen Dokumenten liegt die Genauigkeit dabei um 20 Prozent unter der bei Echtzeit-Verarbeitung. Sie eignet sich nicht für interaktive Antworten und kann Eingaben sowie Ergebnisse kurzfristig verschlüsselt speichern.
Zusammenfassung
Der Vorteil von DeepInfra besteht darin, dass mit einem einzigen Konto kompatible Schnittstellen, native multimodale Modelle, Batch-Verarbeitung, eigene Gewichte, GPU sowie Code-Sandboxes bereitgestellt werden. Zudem ist es möglich, je nach Arbeitslast nach Token, Anzahl der Ausführungen oder GPU-Stunden abzurechnen. Vor dem Go-Live ist es wichtig, die Preise für die einzelnen Modelle sowie die Lizenzen zu überprüfen, ein Budget festzulegen und eine Obergrenze für Wiederholungsversuche zu setzen. Zudem müssen Ausnahmen bezüglich der keinerlei Daten gespeichert werden, ordnungsgemäß behandelt werden.
Guigong-Netzwerk-Sicherheitsnummer: 45132202000164