GroqCloud
Cloud-Plattform mit niedriger Latenz für die Inferenz großer Modelle sowie Entwickler-APIs
Tags:KI-TrainingsmodelleWas ist GroqCloud?
GroqCloud ist eine von Groq entwickelte Cloud-Plattform für KI-Inferenz, die auf der speziell für die Inferenz von Sprachmodellen konzipierten LPU-Hardware basiert. Sie bietet Entwicklern Modelle und Sprach-APIs mit niedriger Latenz und hoher Durchsatzrate. Die Plattform kann Modelle wie Llama, GPT-OSS, Qwen und Whisper aufrufen und eignet sich für Echtzeit-Chat, Sprachassistenten, RAG, toolbasierte Agenten, Inhaltsverarbeitung sowie Batch-Inferenz.
GroqCloud bietet hauptsächlich die Möglichkeit zur Auswertung von Modellen an. Es handelt sich dabei nicht um eine allgemeine Plattform zum Leasen von GPUs. Zudem wurden die gehosteten Modelle nicht alle von Groq entwickelt. Die Gewichte der Modelle sowie die Lizenzen stammen von den jeweiligen Herstellern. Groq ist für die Hosting-Infrastruktur sowie die API-Dienste verantwortlich.
Der Modellkatalog, der Kontext, der Vorschauzustand, die Geschwindigkeit und der Preis werden aktualisiert. Vor dem Veröffentlichen des Projekts sollte man die aktuelle Modulkarte in der Konsole überprüfen.
Kernfunktionen von GroqCloud
LPU-Hochgeschwindigkeits-Infersenz
LPU ist für die sequenzielle Erzeugung und vorhersagbare Ausführung konzipiert, während Groq auf der Preisseite den aktuellen Referenzwert pro Sekunde für die Tokens der einzelnen Modelle anzeigt. Eine hohe Ausgabeleistung eignet sich besonders für Sprachdialoge, interaktive Agenten sowie Anwendungen, die eine schnelle Erstantwort erfordern.
Die Seitenbeschleunigung ist unter bestimmten Bedingungen ein Referenzwert; die tatsächliche Erfahrung hängt außerdem von der Länge der Eingaben, den Wartezeiten, dem Netzwerk, den Aufrufen von Tools sowie der Länge der Ausgaben ab.
OpenAI-kompatible API
Die Groq API bietet OpenAI-kompatible Schnittstellen für Chats, Antworten, Audio usw. Projekte, die bereits ein OpenAI SDK verwenden, können in der Regel durch Anpassung der Base URL, des API Keys sowie der Modell-ID migriert werden. Kompatibilität bedeutet jedoch nicht, dass alle Parameter identisch sind; es sollte geprüft werden, welche Modellfunktionen, Reasoning-Fähigkeiten, Tool-Choice-Möglichkeiten, JSON-Ausgaben sowie Bild- und Stream-Felder von Groq derzeit unterstützt werden.
Text, Schlussfolgerungen und multimodale Modelle
Das Modellkatalog umfasst kleine, kostengünstige Modelle, größere, allgemein einsetzbare Modelle sowie Inferenzmodelle. Entwickler können je nach Aufgabe zwischen Preis, Geschwindigkeit, Kontext und Qualität wählen.
Einige Modelle befinden sich in der Vorschau-Phase und können geändert, eingeschränkt oder deaktiviert werden; in der Produktionsumgebung sollten vorrangig offiziell unterstützte Modelle verwendet werden, wobei Ersatzmodelle bereitstehen müssen.
Toolaufrufe und das Compound-System
Es werden Funktionen zur Aufrufung von Tools unterstützt, außerdem steht das Compound-System zur Verfügung, das Suchfunktionen im Web, den Zugriff auf Webseiten, die Ausführung von Code sowie die Automatisierung des Browsers bietet. Compound ermöglicht es, einen oder mehrere Modelle dazu zu bringen, je nach Bedarf Server-Seitentools auszuwählen; die Kosten für die Modelle und die Tools werden getrennt in Rechnung gestellt.
Wenn ein Tool auf das externe Netzwerk zugreifen oder Code ausführen kann, müssen die Ergebnisse dennoch überprüft werden, und sensible Daten, die verarbeitet werden können, müssen eingeschränkt werden.
Ferngesteuertes MCP
Die Groq Responses API kann mit entfernten HTTPS-MCP-Diensten verbunden werden. Die Plattform ist dafür verantwortlich, die Tools zu erkennen, ihre Definitionen an das Modell weiterzuleiten, die Aufrufe auszuführen und weiterhin Inhalte zu erzeugen – dadurch wird die Arbeit der Entwickler, mehrfach wiederholte Tool-Zyklen selbst zu schreiben, reduziert. Der entfernte MCP befindet sich derzeit noch in der Testphase; Drittanbieter-Server greifen auf die an die Tools übergebenen Parameter zu. Es ist daher notwendig, die Herkunft des Services sowie die Authentifizierung und Berechtigungen zu überprüfen.
Sprach zu Text
GroqCloud hostet Whisper Large V3 und Turbo, die eine Mehrsprachentranskription ermöglichen; die vollständige Version unterstützt außerdem die Übersetzung ins Englische.
Die Audio-Schnittstelle ist mit den gängigen Formaten kompatibel. Die kostenlosen und die Entwickler-Versionen haben unterschiedliche Dateigrößenbeschränkungen, und die Gebühren werden mindestens für 10 Sekunden berechnet.
Große Dateien können zunächst in Mono mit 16 kHz umgewandelt und in Abschnitten verarbeitet werden.
Batch-API
Die Batch-API eignet sich für Aufgaben wie Zusammenfassung, Klassifizierung, Bewertung und Datenreinigung, bei denen keine sofortige Rückgabe erforderlich ist. Nachdem der Benutzer eine Batch-Anfrage eingereicht hat, wird diese asynchron verarbeitet – die Verarbeitungszeit kann von 24 Stunden bis zu mehreren Tagen betragen. Der aktuelle Preis liegt 50 Prozent unter dem Preis bei Echtzeitaufrufen nach Bedarf, und es werden keine Standard-Echtzeit-Limits in Anspruch genommen.
Für die Verarbeitung von Aufgaben sollten stabile Anfrage-IDs verwendet werden, um Wiederholungsversuche und die Zuordnung der Ergebnisse zu erleichtern.
Prompt Caching
Einige Modelle unterstützen die Caching von Prompten. Wenn wiederholte System-Prompts oder lange Präfixe im Cache gespeichert sind, können die eingegebenen Tokens zu einem günstigeren Preis berechnet werden. Die Caching-Funktion selbst ist nicht extra kostenpflichtig, doch nur die im Cache gespeicherten Tokens profitieren von dem Rabatt.
Die Anwendung sollte die Trefferlage aus dem Feld „Usage“ überprüfen und nicht alle Eingaben nach dem Cache-Preis schätzen.
Kostenlose Entwicklungsschicht und Bandbreitenbegrenzung
Nach der Registrierung steht ein kostenloses Entwicklungslimit zur Verfügung, um Prototypen zu testen. Für verschiedene Modelle werden jeweils Obergrenzen für die Anzahl der Anfragen pro Minute, die Anzahl der Tokens pro Minute sowie die Gesamtanzahl der Anfragen oder Tokens pro Tag festgelegt. Die Limitierungen sind dynamische Regeln für Konten und Modelle – man sollte die Werte für ein bestimmtes Modell nicht als dauerhafte Obergrenzen für die gesamte Plattform betrachten.
Nach der Verknüpfung einer Zahlungsmethode und dem Aufstieg in ein höheres Profil kann eine höhere Obergrenze genutzt werden. Unternehmen können sich über spezielle Kapazitäten und Dienstleistungen beraten lassen.
Vergleich der GroqCloud-Pakete und deren Nutzungsmöglichkeiten
| Plan | Kostenmodell | Hauptmerkmale | Für Nutzer geeignet |
|---|---|---|---|
| Kostenlose Ebene | Kostenlose Nutzungsmenge | Nach dem Modell begrenzt die Leistung – geeignet für Entwicklung und Testing, keine Garantie für Produktionskapazität. | APIs, Prototypen und persönliche Projekte lernen |
| Entwickler zahlen nach Verbrauch | Nach tatsächlichem Verbrauch von Eingabe, Ausgabe, Audio oder Tools | Höhere Obergrenzen, die für formelle Anwendungen verwendet werden können; kein fester Monatsplan erforderlich | Unabhängige Entwickler und wachsende Produkte |
| Batch API | 50% des aktuellen Preises | Asynchrone Verarbeitung, längere Bearbeitungszeit, belegt nicht die Standard-Echtzeit-Beschränkung | Bewertung, Klassifizierung, Offline-Datenverarbeitung |
| Enterprise | Individuelle Kostenschätzung | Exklusive Limits, Kapazitäten, Unterstützung oder Lokalisierungslösungen gemäß Vertrag | Großskalige und kritische Geschäftsorganisationen |
Preisvergleich der GroqCloud-Modelle
Im Folgenden finden Sie die aktuellen Referenzpreise zum Zeitpunkt der Überprüfung auf der offiziellen Preisseite, ausgedrückt in US-Dollar pro Million Tokens. Die Gebühren sowie der Status des Modells können sich ändern; letztendlich gelten die Angaben in der Konsole zum Zeitpunkt der Anfrage.
| Modell | Eingabepreis | Auslieferungspreis | Positionierung |
|---|---|---|---|
| Llama 3.1 8B Instant | 0,05 US-Dollar | 0,08 US-Dollar | Kostenlose, schnelle Allzweckaufgaben |
| GPT-OSS 20B | 0,075 US-Dollar | 0,30 US-Dollar | Leichte Inferenz und Tool-Aufgaben |
| GPT-OSS 120B | 0,15 US-Dollar | 0,60 US-Dollar | Stärkere Schlussfolgerungen und komplexe Aufgaben |
| Llama 4 Scout 17Bx16E | 0,11 US-Dollar | 0,34 US-Dollar | Langer Kontext und multimodale Richtungen |
| Qwen3 32B | 0,29 US-Dollar | 0,59 US-Dollar | Allgemeine, chinesische und Schlussfolgerungsaufgaben |
| Llama 3.3 70B Versatile | 0,59 US-Dollar | 0,79 US-Dollar | Stärkere allgemeine Textfähigkeiten |
Preise für Sprachfunktionen und integrierte Tools
| Dienstleistungen | Aktueller Referenzpreis | Abrechnungshinweise |
|---|---|---|
| Whisper Large V3 | 0,111 US-Dollar/Stunde | Mehrsprachige Transkription und Übersetzung, mindestens 10 Sekunden pro Vorgang |
| Whisper Large V3 Turbo | 0,04 US-Dollar/Stunde | Schnellere Transkription zu niedrigeren Kosten, keine Übersetzungsfunktion. |
| Basic Search | 5 Dollar pro 1.000 Mal | Compound-Basis-Webseiten-Suche |
| Advanced Search | 8 Dollar pro 1.000 Mal | Fortgeschrittenere Suchwerkzeuge |
| Visit Website | 1 US-Dollar pro 1.000 Mal | Eine Webseite besuchen und lesen |
| Code Execution | 0,18 US-Dollar/Stunde | Abrechnung nach Betriebszeit des Tools |
| Browser Automation | 0,08 US-Dollar/Stunde | Abrechnung nach automatisierter Betriebszeit |
Anleitung zur Anbindung an die Groq-API
- Konto erstellen und Schlüssel:Erstellen Sie eine API-Key in der GroqCloud-Konsole; die Key wird nur in den Serverumgebungsvariablen gespeichert.
- Modell auswählen:Überprüfen Sie die aktuellen Produktions- und Vorschaumodelle, um Kontext, Preis, Limitierungen, Tools sowie multimodale Fähigkeiten zu überprüfen.
- SDK installieren:Man kann das offizielle Groq Python/TypeScript SDK verwenden, oder man kann das OpenAI SDK nutzen und die Base URL anpassen.
- Anfrage senden:Übergeben Sie die vollständige Modell-ID und die Nachrichten, testen Sie zunächst die nicht-flussbasierte Antwort und aktivieren Sie anschließend den Streaming-Modus.
- Überprüfen Sie die Nutzung:Erhalten Sie Aufzeichnungen zu Eingaben, Ausgaben, Cache und Tool-Kosten sowie berechnen Sie das Budget anhand der tatsächlichen Nutzung.
- Behandlung der Bandbreitenbeschränkung:Lesen Sie die Antwort-Header und Fehlercodes aus, verwenden Sie exponentielles Zurücksetzen sowie Jittering, und verbieten Sie unbegrenzte parallele Wiederholungsversuche.
- Anschlusswerkzeuge:Parameterüberprüfung, Zeitüberschreitung, Berechtigungen und manuelle Freigabe für Funktionen, Compound oder MCP.
- In Betriebnahme:Einstellung von Ausgabengrenzen, Maskierung von Protokollen, Ersatzmodelle, Health Checks und Qualitätsbewertung.
Anleitung zur Verwendung von GroqCloud
Erstellung wiederverwendbarer professioneller Workflows
- Für die Entwicklungs-, Test- und Produktionsumgebungen werden unterschiedliche Schlüssel und Limits verwendet;
- Etablierung eines repräsentativen Bewertungssatzes für schnelle LPU-Inferenz, OpenAI-kompatible APIs sowie textbasierte, inferenzbasierte und multimodale Modelle;
- Einstellen von Timeout, Konkurrenz, Wiederholungsversuchen, Limitierung sowie Budgetobergrenzen;
- Durchführung von Überprüfungen hinsichtlich Fakten, Sicherheit, Formatierung und sensibler Informationen am Ausgangsinhalt;
- Überwachung von Änderungen bei Modellversionen, Preisen, Verzögerungen und Ausfallraten;
- Vorbereitung von Plänen für die Herabstufung des Modells, Schutzmaßnahmen sowie manuelle Übernahme.
Für welche Benutzer geeignet
- Chatten- oder Sprachprodukte, die eine flüssige Ausgabe mit geringer Verzögerung sowie eine schnelle Antwort auf die ersten Zeichen benötigen;
- Entwickler, die hoffen, Open-Source-Gewichtsmodelle auf eine mit OpenAI kompatible Weise aufrufen zu können;
- Aufbau eines Entwicklerteams für RAG, Suchfunktionen, Code-Tools und mehrstufige Agenten;
- Ingenieurteams, die eine kostengünstige Massenklassifizierung, Zusammenfassung und Bewertung benötigen;
- Entwickler von KI, die die Geschwindigkeit, Qualität und Kosten verschiedener Modelle vergleichen möchten.
Vorteile und Bedenken
- Die Hauptvorteile von GroqCloud sind die schnelle Inferenzgeschwindigkeit, die einfache Anbindung über APIs, transparente Preise sowie eine kostenlose Entwicklungsplattform, Echtzeit-Berechnungen, Batch-Verarbeitung, Sprachfunktionen und Serverseitige Tools.
- Bei interaktiven Anwendungen kann eine hohe Token-Ausgabe-Geschwindigkeit das Warteerlebnis erheblich verbessern.
- Die Einschränkung besteht darin, dass der Modellkatalog von den von Groq derzeit unterstützten Modellen abhängt; nicht alle kommerziellen, geschlossenen Modellversionen können verwendet werden, und es ist auch nicht möglich, beliebige eigene Gewichte hochzuladen.
- Das Preview-Modell kann sich ändern, und die kostenlose Obergrenze eignet sich nicht zur direkten Zusicherung eines SLAs für die Produktion;
- Werkzeuge und MCP erweitern die Grenzen von Daten und Berechtigungen;
- Die von dem Modell erzeugten Inhalte können fehlerhaft sein; entscheidende Entscheidungen sowie tatsächliche Aktionen müssen daher manuell überprüft werden.
Häufige Fragen
Ist GroqCloud kostenlos?
Es wird eine kostenlose Entwicklungsplattform bereitgestellt, die zum Lernen und für Prototyp-Tests genutzt werden kann. Allerdings gibt es Beschränkungen hinsichtlich der Anzahl der Modelle. Bei höherem Bedarf sollte man auf ein Pay-as-you-go-Modell wechseln oder sich an den Unternehmensvertrieb wenden.
Sind Groq und Grok dasselbe Produkt?
Nein. Groq ist ein Unternehmen, das LPU sowie Cloud-Dienste für schnelle Inferenzleistungen anbietet. Grok hingegen ist die Marke für Modelle von xAI. Die Namen ähneln sich, doch die Produkte sind unterschiedlich.
Ist die Groq-API mit OpenAI kompatibel?
Es werden OpenAI-kompatible Schnittstellen unterstützt; viele Anwendungen benötigen lediglich eine Anpassung der Service-Adresse, des Schlüssels und der Modell-ID. Für fortgeschrittene Parameter muss man sich weiterhin an die Groq-Dokumentation wenden.
Unterstützt GroqCloud die Spracherkennung?
Unterstützung für die Audio-Transkription von Whisper Large V3 und Turbo; die vollständige Version kann außerdem ins Englische übersetzt werden. Die Gebühr richtet sich nach der Länge des Audios.
Unterstützt GroqCloud MCP?
Die Responses-API unterstützt entfernte HTTPS-MCP-Tools und befindet sich derzeit in der Testphase. Vor der Anbindung sollten Server, Authentifizierung und Datenrechte überprüft werden.
Guigong-Netzwerk-Sicherheitsnummer: 45132202000164