GroqCloud
Plateforme cloud offrant une inférence de grands modèles à faible latence et des API pour développeurs
Étiquettes :Modèle d’entraînement d’IAQu’est-ce que GroqCloud ?
GroqCloud est une plateforme cloud d’inférence IA développée par Groq, qui utilise son matériel LPU conçu spécialement pour l’inférence des modèles linguistiques, afin de fournir aux développeurs des API de grands modèles et de traitement vocal à faible latence et à forte capacité de traitement. La plateforme peut appeler des modèles tels que Llama, GPT-OSS, Qwen, Whisper, etc., et est adaptée aux chats en temps réel, aux assistants vocaux, au RAG, aux agents utilitaires, au traitement du contenu et à l’inférence en batch.
GroqCloud se concentre principalement sur l’inference de modèles ; ce n’est pas une plateforme de location de GPU générale, et les modèles hébergés ne sont pas tous développés par Groq. Les poids des modèles et leurs licences proviennent de leurs respectifs éditeurs, tandis que Groq est responsable de l’hébergement et des services API.
Le répertoire des modèles, le contexte, l’état de prévisualisation, la vitesse et le prix seront mis à jour ; il convient de consulter la carte du modèle actuel dans la console avant de lancer le projet.
Fonctionnalités clés de GroqCloud
Inference haute vitesse LPU
LPU a été conçu pour une génération séquentielle et une exécution prévisible ; Groq affiche sur la page des prix la valeur de référence actuelle en tokens par seconde pour chaque modèle. Une sortie rapide est particulièrement adaptée aux dialogues vocaux, aux agents interactifs et aux applications nécessitant une réponse rapide au premier mot.
La vitesse de page est un indicateur de référence dans des conditions spécifiques ; l’expérience réelle dépend également de la longueur de l’entrée, des files d’attente, du réseau, des appels d’outils et de la longueur de la sortie.
API compatible OpenAI
L’API Groq offre des interfaces de chat, de réponse, audio, etc., compatibles avec OpenAI. Les projets utilisant déjà le SDK d’OpenAI peuvent généralement être migrés en modifiant l’URL de base, la clé API et l’ID du modèle. La compatibilité ne signifie pas que tous les paramètres soient identiques ; il convient de vérifier les capacités actuellement supportées par Groq en matière de modèles, de raisonnement, de choix d’outils, de sortie JSON, ainsi que les champs d’images et en flux.
Texte, raisonnement et modèles multimodaux
Le catalogue de modèles couvre des modèles petits et à faible coût, des modèles plus grands et polyvalents, ainsi que des modèles d’inférence. Les développeurs peuvent choisir, en fonction de la tâche, entre prix, vitesse, contexte et qualité.
Certains modèles sont en version Preview et peuvent subir des modifications, être soumis à des limitations ou être retirés ; dans un environnement de production, il convient de privilégier les modèles officiellement pris en charge et de disposer de modèles de remplacement.
Appels d’outils et système Compound
Il prend en charge les appels de fonctions utilitaires et propose également le système Compound avec recherche sur le web, accès aux pages web, exécution de code et automatisation du navigateur. Compound permet à un ou plusieurs modèles de sélectionner des outils côté serveur selon leurs besoins, les frais des modèles et des outils étant facturés séparément.
Lorsque l’outil peut accéder à un réseau externe ou exécuter du code, les résultats doivent encore être vérifiés, et les données sensibles pouvant être traitées doivent être limitées.
MCP à distance
L’API Groq Responses peut se connecter à des services MCP HTTPS distants ; la plateforme est chargée de découvrir les outils, de transmettre leurs définitions au modèle, d’exécuter les appels et de continuer à générer du contenu, ce qui réduit le travail des développeurs consistant à écrire eux-mêmes des boucles d’outils multiples. Le MCP distant est actuellement en phase de test ; les serveurs tiers interviennent pour transmettre les paramètres aux outils, il convient donc de vérifier l’origine du service, ainsi que l’authentification et les droits d’accès.
Transcription vocale en texte
GroqCloud héberge Whisper Large V3 et Turbo, permettant la transcription multilingue ; la version complète prend également en charge la traduction en anglais.
L’interface audio est compatible avec les formats courants ; les versions gratuite et de développement ont des limites de taille de fichier différentes, et la facturation s’effectue par tranches d’au moins 10 secondes.
Les gros fichiers peuvent d’abord être convertis en mono 16 kHz et traités par tronçons.
API par lots Batch API
L’API par lots convient aux tâches qui ne nécessitent pas de réponse immédiate, telles que la résumé, la classification, l’évaluation et le nettoyage des données. Une fois une demande par lot soumise par l’utilisateur, elle est exécutée de manière asynchrone ; la fenêtre de traitement peut aller de 24 heures à plusieurs jours. Le prix actuel est inférieur de 50 % par rapport aux appels en temps réel payés au forfait, et il ne consomme pas les quotas standard en temps réel.
Les tâches par lots doivent utiliser un ID de requête stable, afin de faciliter les tentatives de réessai et le correspondance des résultats.
Prompt Caching
Certains modèles prennent en charge le cache des prompts : lorsque des prompts système répétés ou des préfixes longs sont stockés dans le cache, les tokens entrants peuvent être facturés à un tarif inférieur. La fonction de cache n’est pas facturée en supplément, mais seuls les tokens du cache trouvés bénéficient de la remise.
L’application doit vérifier le cas de correspondance à partir du champ usage, et ne pas estimer toutes les entrées en se basant sur le prix en mémoire cache.
Couche de développement gratuit et limitation du trafic
Après inscription, vous pouvez utiliser une quantité de développement gratuite pour des tests de prototype. Chaque modèle dispose de seuils distincts pour le nombre de requêtes par minute, les tokens par minute, le nombre de requêtes par jour ou les tokens par jour. La limitation du trafic est une règle dynamique par compte et par modèle ; il ne faut pas considérer les chiffres d’un modèle comme des limites permanentes pour toute la plateforme.
Après avoir lié un moyen de paiement et effectué une mise à niveau, il est possible d’utiliser des plafonds plus élevés en fonction de la consommation ; les entreprises peuvent demander des capacités et des services sur mesure.
Comparaison des forfaits GroqCloud et modes d’utilisation
| Plan | Mode de paiement | Caractéristiques principales | Adéquat pour les utilisateurs |
|---|---|---|---|
| Niveau gratuit | Limite gratuite | Limiter le débit selon le modèle, adapté au développement et aux tests, sans garantie de capacité en production | Apprendre les API, les prototypes et les projets personnels |
| Tarification à l’usage pour les développeurs | Selon la consommation réelle en entrée, sortie, audio ou outils | Limite plus élevée, pouvant être utilisée pour des applications officielles ; pas de forfait mensuel fixe requis | Développeurs indépendants et produits en croissance |
| Batch API | Équivalent à 50 % du prix en temps réel | Traitement asynchrone, fenêtre de finalisation longue, ne consomme pas la limite en temps réel standard | Évaluation, classification, traitement de données hors ligne |
| Enterprise | Cotation sur mesure | Les quotas, capacités, supports ou solutions de localisation exclusifs sont définis par contrat. | Organisations à grande échelle et critiques |
Comparaison des prix des modèles GroqCloud
Voici les prix de référence en temps réel par usage, vérifiés sur la page des prix officiels, exprimés en dollars américains par million de tokens. Les tarifs et l’état du modèle peuvent varier ; le prix final est celui indiqué dans la console au moment de l’appel.
| modèle | Prix d’entrée | Prix de vente | Positionnement |
|---|---|---|---|
| Llama 3.1 8B Instant | 0,05 dollar | 0,08 dollar américain | Tâches générales à faible coût et haute vitesse |
| GPT-OSS 20B | 0,075 dollar américain | 0,30 dollar | Inference légère et tâches d’outils |
| GPT-OSS 120B | 0,15 dollar | 0,60 dollar | Raisonnement plus puissant et tâches complexes |
| Llama 4 Scout 17Bx16E | 0,11 dollar | 0,34 dollar | Contexte long et orientation multimodale |
| Qwen3 32B | 0,29 dollar | 0,59 dollar | Tâches générales, en chinois et de raisonnement |
| Llama 3.3 70B Versatile | 0,59 dollar | 0,79 dollar | Capacités solides pour le texte général |
Prix de la voix et des outils intégrés
| Service | Prix de référence actuel | Instructions de facturation |
|---|---|---|
| Whisper Large V3 | 0,111 dollar de l’heure | Transcription et traduction multilingue, minimum 10 secondes par fois |
| Whisper Large V3 Turbo | 0,04 dollar de l’heure | Transcription rapide à un prix encore plus bas, sans prise en charge des points de traduction |
| Basic Search | 5 $/1 000 utilisations | Recherche de base sur la page web Compound |
| Advanced Search | 8 dollars/1 000 fois | Outils de recherche plus avancés |
| Visit Website | 1 dollar/1 000 fois | Visiter et lire une page web |
| Code Execution | 0,18 dollar de l’heure | Facturation selon le temps d’exécution de l’outil |
| Browser Automation | 0,08 dollar de l’heure | Facturation selon le temps d’exécution automatisé |
Guide d’intégration de l’API Groq
- Créer un compte et une clé :Créez une clé API dans la console de GroqCloud ; la clé n’est stockée que dans les variables d’environnement du serveur.
- Sélectionner le modèle :Vérifiez les modèles de production actuels et de prévisualisation pour confirmer le contexte, les prix, les limites de flux, les outils et les capacités multimodales.
- Installer le SDK :On peut utiliser le SDK officiel Groq pour Python/TypeScript, ou bien le SDK d’OpenAI en modifiant l’URL de base.
- Envoyer la demande :Transmettre l’ID du modèle complet et les messages, tester d’abord une réponse non en flux, puis activer le streaming.
- Vérifier l’usage :Enregistrer les coûts d’entrée, de sortie, de cache et d’outils, et calculer le budget en fonction de la consommation réelle.
- Gestion de la limitation du débit :Lire les en-têtes de réponse et les codes d’erreur, utiliser un recul exponentiel et du jitter, interdire les tentatives de réessai simultanées sans limite.
- Outils d’accès :Vérification des paramètres, délais d’attente, droits d’accès et approbation manuelle pour les fonctions, Compound ou MCP.
- Mise en production :Définir des limites de dépenses, le masquage des journaux, des modèles alternatifs, ainsi que des contrôles de santé et des évaluations de qualité.
Guide d'utilisation de GroqCloud
Créer des flux de travail professionnels réutilisables
- Utiliser des clés et des quotas différents pour les environnements de développement, de test et de production ;
- Créer un ensemble d’évaluation représentatif pour l’inférence à haute vitesse LPU, une API compatible OpenAI ainsi que des modèles textuels, d’inférence et multimodaux ;
- Définir les délais d’attente, la concurrence, les tentatives de réessai, le throttling et les plafonds budgétaires ;
- Effectuer des vérifications sur la sortie en ce qui concerne les faits, la sécurité, le format et les informations sensibles ;
- Surveiller les changements de version, de prix, de délai et de taux d’échec des modèles de surveillance ;
- Préparer des plans de dégradation du modèle, de coupure et de prise en main manuelle ;
À qui s’adresse-t-il
- Produits de chat ou de voix nécessitant une sortie en flux à faible latence et une réponse rapide au premier caractère ;
- Développeurs souhaitant appeler des modèles de poids open source de manière compatible avec OpenAI ;
- Créer une équipe d’application pour le RAG, la recherche, les outils de code et les agents à plusieurs tours ;
- Équipes d’ingénierie ayant besoin de tri, de résumé et d’évaluation en grande quantité à faible coût ;
- Développeurs d’IA qui souhaitent comparer la vitesse, la qualité et le coût de différents modèles.
Avantages et précautions
- Les principaux avantages de GroqCloud sont une vitesse de raisonnement élevée, une intégration API simple, des prix transparents, ainsi qu’une couche de développement gratuite, un mode payant en temps réel, des traitements par lots, des fonctionnalités vocales et des outils serveur.
- Pour les applications interactives, une vitesse élevée de génération de tokens peut améliorer considérablement l’expérience d’attente.
- La limitation est que le répertoire des modèles est déterminé par ceux actuellement pris en charge par Groq ; il n’est pas possible d’appeler tous les modèles commerciaux propriétaires, et cela ne signifie pas non plus qu’on puisse télécharger n’importe quelles poids personnalisés.
- Le modèle Preview peut changer, et la limite gratuite ne permet pas d’assurer directement un SLA de production ;
- Les outils et MCP élargiront les limites des données et des permissions ;
- Le contenu généré par le modèle peut être erroné ; les décisions clés et les opérations réelles doivent faire l’objet d’une vérification manuelle.
Questions fréquentes
GroqCloud est-il gratuit ?
Une couche de développement gratuite est disponible pour l’apprentissage et les tests de prototype, mais une limitation de débit est appliquée en fonction du modèle. Pour une capacité plus élevée, passez à un abonnement payant ou contactez le service des ventes entreprises.
Groq et Grok, est-ce que c’est le même produit ?
Non. Groq est une entreprise qui propose des LPU et des services cloud pour l’inference à haute vitesse, tandis que Grok est la marque de modèles de xAI ; les noms sont similaires mais les produits sont différents.
L’API Groq est-elle compatible avec OpenAI ?
Prend en charge les interfaces compatibles avec OpenAI ; de nombreuses applications n’ont besoin que de modifier l’adresse du service, la clé et l’ID du modèle. Les paramètres avancés doivent toutefois être vérifiés selon la documentation de Groq.
GroqCloud prend-il en charge la reconnaissance vocale ?
Prend en charge la transcription audio pour Whisper Large V3 et Turbo ; la version complète permet également une traduction en anglais, avec un tarif basé sur la durée de l’audio.
GroqCloud prend-il en charge MCP ?
L’API de réponses prend en charge les outils MCP HTTPS à distance et se trouve actuellement en phase de test. Avant de l’intégrer, il convient d’examiner le serveur, l’authentification et les droits sur les données.
Numéro d’enregistrement de sécurité publique du Guangxi : 45132202000164