Fireworks AI
Valeur ajoutée gratuite
Guide complet des outils d’IA Modèle d’entraînement d’IA

Fireworks AI

Fireworks AI : fait en sorte que les modèles d’IA fonctionnent de manière plus efficace et plus simple

Étiquettes :

Qu’est-ce que Fireworks AI ?

Fireworks AI est une plateforme d’infrastructure d’IA générative fournie par Fireworks.ai, Inc., destinée aux développeurs et entreprises qui ont besoin d’appeler, de mettre au point et de déployer des modèles à poids ouverts. Elle regroupe dans une même plateforme le catalogue des modèles, les interfaces de raisonnement, les tâches d’entraînement, le déploiement sur GPU dédiés, les quotas ainsi que les capacités d’observation.

Fireworks AI n’est ni un seul chatbot, ni équivalent à un modèle particulier. Les utilisateurs doivent choisir un modèle spécifique, un niveau de trafic et un mode de déploiement ; les licences des modèles, la longueur du contexte, le type d’entrée, la qualité de la sortie ainsi que le prix peuvent varier.

Forme du produit principal

Forme du produitBase de facturationCaractéristiques principalesAdéquat pour la tâche
Serverless StandardEntrée, cache d’entrées et tokens de sortieHébergement partagé, pas de gestion nécessaire pour les GPU, appel sur demandePrototype, débit élastique et modèles courants
Serverless PriorityPrix plus élevé par jetonRoute prioritaire en période de pointe pour améliorer la fiabilitéDemandes de production sensibles à la congestion
Serverless FastPrix exclusif pour le modèle haute vitessePour l’optimisation des retards, certains modèles sont en version préliminaireAgents interactifs et applications à faible latence
Déploiement sur demandePar seconde de GPUCapacité dédiée, évolutif, prise en charge des modèles personnalisés et de LoRAStabilisation du débit élevé et modèles privés
Entraînement et fine-tuningJetons d’entraînement ou heures GPUSFT, DPO, RFT, LoRA et entraînement à paramètres completsAdaptation au domaine, alignement du style et agent complexe

Inference dans le modèle Serverless

Serverless propose des modèles de texte, visuels et intégrés populaires ; l’appelant ne paie que pour les tokens réellement utilisés, sans avoir à choisir une GPU, configurer des copies ou gérer le démarrage en froid. Standard est la couche par défaut, Priority est activée via des paramètres de requête, tandis que Fast utilise des identifiants de modèles haut débit indépendants.

  • La messagerie et le complétion de texte prennent en charge la sortie en flux, les appels d’outils et des résultats structurés.
  • Le modèle visuel reçoit du texte et du contenu d’image ; le format et la taille réels sont limités par le modèle.
  • Les modèles d’incorporation transforment le texte en vecteurs, ce qui est adapté à la recherche, au clustering et au calcul de la similarité.
  • Le cache des prompts peut réduire les coûts liés à des contextes répétitifs, mais les hits dépendent de l’acheminement et de la cohérence du contenu.
  • Le raisonnement en lot est facturé à 50 % du prix normal d’entrée et de sortie Serverless, ce qui convient aux tâches massives non en temps réel.

Le partage Serverless relève d’un service « fait de son mieux », sans garantie uniforme de latence ou d’disponibilité. Les modèles peuvent être mis hors ligne, et les modèles les plus utilisés sont généralement notifiés au moins deux semaines à l’avance ; si des versions fixes et des engagements de performance sont nécessaires, il convient d’envisager un déploiement dédié.

Interfaces compatibles entre OpenAI et Anthropic

Fireworks propose des interfaces compatibles avec le format de complétion de conversation d’OpenAI et le format Anthropic Messages ; les applications existantes n’ont généralement qu’à remplacer l’adresse du service, la clé et l’identifiant du modèle. La compatibilité ne signifie pas que chaque paramètre, le comportement du modèle ou les conditions limites soient identiques, il est donc nécessaire de tester chaque élément avant la migration.

  • Prend en charge les réponses synchrones, asynchrones et en flux ; le dernier élément du flux peut contenir la consommation de tokens.
  • Lors d’un débordement du contexte du modèle, la sortie maximale peut par défaut être réduite automatiquement, ou il est possible de définir une erreur directe.
  • La clé de raisonnement doit être stockée sur le serveur et ne doit pas être écrite dans l’interface frontale du site ou dans un dépôt public.
  • Les capacités de appel d’outils, de raisonnement sur les champs et de sortie structurée doivent être vérifiées en fonction du modèle spécifique.

Ajustement et entraînement du modèle

Surveillance du fine-tuning SFT

SFT entraîne le modèle à l’aide d’échantillons de dialogue contenant des réponses idéales, ce qui est adapté à l’expression de connaissances sectorielles, à des formats fixes, au ton de la marque et aux appels d’outils. Les données sont structurées sous forme de messages compatibles OpenAI en JSON ligne par ligne, et peuvent être téléchargées via une interface, la ligne de commande, une API ou le SDK Python.

Optimisation par préférences DPO

Le DPO utilise des paires de réponses préférées et non préférées sous la même incitation pour faire en sorte que le modèle corresponde mieux aux préférences en termes de qualité, de style ou de sécurité. Le format actuel des données et la structure de la session présentent des contraintes claires ; une validation des données est nécessaire avant l’entraînement.

Ajustement renforcé RFT

RFT utilise des évaluateurs ou des fonctions de récompense pour optimiser les performances du modèle dans l’inference, l’utilisation d’outils et les tâches multi-étapes pour agents. Les équipes peuvent utiliser des processus gérés ou intégrer leur propre logique d’évaluation et leurs cycles d’entraînement à la Training API.

LoRA et entraînement à paramètres complets

LoRA modifie le comportement grâce à de petits adaptateurs, et son coût de déploiement dépend de la stratégie de partage du modèle de base ; l’entraînement à tous les paramètres convient aux tâches nécessitant des changements de comportement plus profonds, mais entraîne des coûts plus élevés en termes de données, de ressources de calcul et de gouvernance. Les modèles affinés et ceux téléchargés par les utilisateurs nécessitent un déploiement sur demande dédié et ne peuvent pas être directement intégrés dans des serveurs Serverless partagés.

Workflow d’entraînement

  1. Définir les objectifs de qualité, l’ensemble de référence, les types d’échec et les critères de mise en production.
  2. Vérifier dans le répertoire du modèle les modèles de base ajustables, la longueur du contexte et les méthodes d’entraînement pris en charge.
  3. Nettoyer les données, supprimer les clés, les informations personnelles sensibles et le contenu non autorisé.
  4. Générer un ensemble d’entraînement et un ensemble d’évaluation indépendant au format SFT, DPO ou RFT.
  5. Téléchargez et validez les données, en vérifiant d’abord le format, la perte et la qualité des échantillons avec de petites tâches.
  6. Démarrer l’entraînement et enregistrer le modèle, les hyperparamètres, la version des données et les coûts.
  7. Comparer la qualité, la sécurité et les délais du modèle de base et du modèle fine-tuné sur des échantillons non vus.
  8. Créer un déploiement dédié, effectuer un basculement par étapes et surveiller en continu le dérive et les sorties anormales.

Déploiement dédié sur demande

On-demand facture en secondes GPU, offrant une capacité indépendante du trafic partagé et des délais plus contrôlables. Les utilisateurs peuvent déployer des modèles de plateforme, leurs propres modèles ou LoRA, définir un nombre minimal et maximal de copies, et réduire l’infrastructure à zéro en l’absence de demandes.

  • La capacité de traitement est principalement déterminée par le modèle de GPU, leur nombre, la taille du modèle, la quantification, le contexte et le batch processing.
  • L’augmentation du nombre de copies ou du nombre de GPU par copie entraîne une augmentation proportionnelle des coûts de fonctionnement.
  • Il est possible de choisir parmi plusieurs régions : GLOBAL, US, EUROPE et APAC, ou de demander une région unique fixe.
  • Les zones fixes ne peuvent pas être déplacées sur place ; il est nécessaire de créer une nouvelle implémentation et d’effectuer le basculement du trafic.
  • Les entreprises peuvent discuter de connexions privées, de routage direct, de capacité dédiée et de quotas plus élevés.

Processus d’intégration API

  1. Créez un compte et obtenez de l’argent d’essai ou reliez une méthode de paiement.
  2. Dans le répertoire des modèles, sélectionnez un modèle dont le type d’entrée, le contexte et le prix sont appropriés.
  3. Créez une clé API et placez-la dans une variable d’environnement du serveur ou dans un gestionnaire de clés.
  4. Choisissez le SDK officiel Python, le SDK OpenAI, le SDK Anthropic ou une appel directe via l’interface.
  5. Commencez par utiliser de petites requêtes non en flux pour confirmer l’identifiant du modèle, le format du message et les champs de quantité.
  6. Ajoutez également la sortie en flux, les appels d’outils, les résultats structurés, le cache ou les tâches par lots.
  7. Concevoir des tentatives de réessai et des stratégies de dégradation pour gérer la limitation du trafic, les délais d’attente, la mise hors service des modèles et les anomalies de contenu.
  8. Définir le budget mensuel, les alertes et le renouvellement des clés, puis activer le trafic de production.

Exemple de prix actuel

Forfait ou versionPrixPériode de facturationDroits ou crédit principalAdéquat pour les utilisateurs
Essai du nouveau compte1 dollar d’essaiUniquement pour une foisDéduction selon les tarifs du modèle réel, ce n’est pas un forfait gratuit illimité.Première vérification de l’interface
Kimi K2.6 StandardEntrée : 0,95, mémoire tampon : 0,16, sortie : 4 dollarsPar million de tokensInférence de texte sans serveurAgent et génération universelle
DeepSeek V4 Pro StandardEntrée : 1,74 $, mémoire cache : 0,145 $, sortie : 3,48 $Par million de tokensInference sans serveurTâches de raisonnement et de code
GPT OSS 120B StandardEntrée : 0,15 $, cache : 0,015 $, sortie : 0,60 $Par million de tokensModèle de pondération ouverte ServerlessApplications sensibles au coût
Modèle intégréDe 0,008 à 0,10 dollar américainTaux par million de tokens entrantsTarification en fonction de l’échelle des paramètres et du modèle spécifiéRecherche sémantique et vectorisation
Inference en batch50 % du tarif normalPar jeton d’entrée et de sortieTraitement par lots asynchrone, inadapté à l’interaction en temps réelGénération hors ligne et tests de critique approfondie
EnterpriseContacter le service des ventesContrat sur mesureEspace de stockage exclusif, réseau privé, région, SLA et supportOrganisations de grande taille et réglementées

Le répertoire des modèles et les tarifs Serverless seront mis à jour, et Priority et Fast pourraient également voir leurs prix augmenter. Lors du choix, il convient de vérifier à nouveau en fonction des modèles réels, de la couche de service et de la page de facturation du compte ; les exemples présentés dans le tableau ne peuvent pas être généralisés à tous les modèles.

Prix de formation

Taille du modèleLoRA SFTLoRA DPOSFT à paramètres completsDPO à paramètres complets
Pas plus de 16B0,50 dollar américain1 dollar1 dollar2 dollars
16,1 milliards à 80 milliards3 dollars6 dollars6 dollars12 dollars
80B à 300B6 dollars12 dollars12 dollars24 dollars
Plus de 300 milliards10 dollars20 dollars20 dollars40 dollars

Les prix indiqués dans le tableau sont calculés pour un million de tokens d’entraînement ; ces tokens dépendent du volume d’échantillons, du nombre de tours, de la mise en œuvre sur plusieurs tours, des images et des trajectoires de raisonnement. RFT et Dedicated Training API peuvent être facturés en heures GPU, tandis que Serverless Training API calcule séparément les tokens de préremplissage, de préremplissage en cache, d’échantillonnage et d’entraînement.

Prix de la GPU sur demande

GPUAvant le 31 aoûtÀ partir du 1er septembrePériode de facturationAdéquat pour les utilisateurs
H100 80GB7 dollars8 dollarsPar heure GPU, facturation au secondRaisonnement et entraînement de la production conventionnelle
H200 141GB7 dollars8 dollarsPar heure GPU, facturation au secondGrand contexte et grands modèles
B200 180GB10 dollars13 dollarsPar heure GPU, facturation au secondCharge de travail à fort débit
B300 288GB12 dollars15 dollarsPar heure GPU, facturation au secondBesoin de plus grande mémoire vidéo
GB300 288GB18 dollars20 dollarsPar heure GPU, facturation au secondEntraînement et raisonnement de pointe

Le déploiement soumis à des restrictions régionales est facturé à 1,5 fois le tarif standard et nécessite une prise de contact avec le service des ventes pour être activé. Aucun frais supplémentaire n’est appliqué pour le temps de démarrage, mais définir la copie minimale à une valeur supérieure à zéro entraîne des frais GPU continus.

Plafond de compte et budget

  • La limite pour les comptes sans méthode de paiement associée est de 10 requêtes par minute.
  • La limite maximale de requêtes au niveau du compte pour les comptes ayant une méthode de paiement liée est de 6000 par minute, et elle reste soumise à la limite des tokens du modèle.
  • Les méthodes de paiement valides correspondent à un budget mensuel maximal de 50 dollars ; les recharges ou dépenses cumulées augmentent le niveau du budget.
  • Lorsque le budget mensuel défini par l’utilisateur est atteint, les demandes de raisonnement, de déploiement et d’ajustement sont suspendues.
  • Les fonds prépayés sont consommés en premier ; la quantité dépassant le solde prépayé est facturée à la fin du mois.
  • La création et la lecture de comptes, d’utilisateurs, de modèles et de jeux de données, ainsi que les appels de gestion eux-mêmes, ne sont pas facturés ; en revanche, les tâches de déploiement et d’entraînement le sont.

SDK, ligne de commande et frontières du logiciel libre

ComposantÉtatUtilisation principaleNotes sur le logiciel open source
SDK officiel PythonDisponibleRaisonnement synchrone et asynchrone, ensembles de données, entraînement et gestion des ressourcesIl existe des dépôts de code ouverts ; la licence spécifique est indiquée dans les fichiers du dépôt.
firectlDisponibleConnexion, clés, modèles, déploiement, entraînement et gestion des quotasPrend en charge macOS, Linux et Windows
Compatibilité avec l’SDK OpenAIDisponibleMigration de la complétion de chat, des outils et des appels en fluxUne interface compatible ne signifie pas que la plateforme Fireworks est open source.
Compatibilité avec l’Anthropic SDKDisponibleAppel au style MessagesIl existe des différences dans la plage de support et les paramètres.
Recueil de recettes et projets d’exemplePublicRéférences pour la formation, l’évaluation et l’applicationPlusieurs entrepôts utilisent Apache-2.0

Les SDK publics, les livres de recettes, les modèles de démarrage et certains outils peuvent être utilisés séparément conformément à leurs licences respectives, mais la plateforme d’inférence hébergée n’en devient pas pour autant du logiciel open source. Le fait que les poids des modèles soient ou non rendus publics, ainsi que leur possibilité d’être utilisés à des fins commerciales, dépendent également de la licence propre à chaque modèle de base.

Adapté aux utilisateurs et aux scénarios

  • Développeur d’applications IA : accès rapide au chat, à l’inference, à la vision, à l’incorporation et aux appels d’outils.
  • Équipe Agent : utilisation du raisonnement rapide, d’une sortie structurée et de RFT pour améliorer les workflows complexes.
  • Équipe de recherche et d’apprentissage automatique : exécution de SFT, DPO, RFT ou de cycles d’entraînement personnalisés.
  • Produits à fort débit : une bande passante plus stable et un contrôle de version des modèles grâce à des GPU dédiés.
  • Entreprises mondiales : déploiement par région, et évaluation des besoins en connexions privées et en hébergement des données.
  • Équipe de traitement par lots : exécution à un prix réduit de la génération hors ligne, du renforcement des données et de l’évaluation des modèles.

Avantage

  • Serverless, l’inférence dédiée et l’entraînement partagent le même système de comptes et de ressources.
  • Compatibilité avec les SDK courants, ce qui réduit l’effort de migration des applications existantes.
  • Prend en charge plusieurs modèles de poids ouverts, sans lier l’application à un seul modèle.
  • De LoRA aux paramètres complets et aux boucles personnalisées, les niveaux de contrôle de l’entraînement sont assez complets.
  • Les zones multiples, le réseau privé et l’exportation d’indicateurs conviennent à la gestion des infrastructures de production.

Restrictions et risques

  • Les catalogues de modèles, les prix et les fonctionnalités d’aperçu évoluent rapidement ; il est nécessaire de fixer les modèles dans l’environnement de production et de préparer des alternatives.
  • Shared Serverless ne dispose pas d’un SLA uniforme ; les délais et l’disponibilité peuvent varier en période de pointe.
  • Les interfaces compatibles présentent encore des différences de comportement, il est donc impossible de sauter les tests de régression.
  • L’expansion automatique augmentera les coûts liés aux GPU, et une valeur minimale de réplicas incorrecte pourrait également entraîner des facturations continues.
  • Les sorties du modèle peuvent présenter des hallucinations, du contenu inapproprié et des erreurs de structure ; une vérification manuelle doit être effectuée en fonction du niveau de risque.
  • La qualité du ajustement fin est déterminée par les données et la conception de l’évaluation ; la fin de l’entraînement ne signifie pas qu’il s’agit d’un modèle supérieur au modèle de base.
  • L’utilisation, la redistribution et l’exploitation commerciale des modèles tiers restent soumises à leurs licences.

Confidentialité et sécurité

Pour le raisonnement ordinaire sur des modèles ouverts, Fireworks ne consigne ni ne sauvegarde les prompts et le contenu généré s’il n’y a pas de choix explicite d’inclusion ; il ne forme pas non plus le modèle à l’aide de prompts clients, de données d’entraînement ou d’entrées via une interface. La fonction propriétaire FireFunction prévoyait autrefois une exception permettant un enregistrement des entrées et sorties sur une période maximale de 30 jours, et des fonctionnalités avancées comme FireOptimizer peuvent également enregistrer des données si l’utilisateur le choisit activement.

  • Les données transmises sont chiffrées à l’aide de TLS 1.2 ou une version ultérieure, tandis que les données statiques sont chiffrées avec AES-256.
  • Les charges de travail dédiées bénéficient d’une isolation logique et offrent des journaux d’accès ainsi que la possibilité d’utiliser des buckets propriétaires du client.
  • La plateforme liste ISO 27001, ISO 27701, ISO 42001 et SOC 2 Type II.
  • Pour la charge de travail médicale, il est nécessaire de vérifier les contrats HIPAA, les accords avec les partenaires commerciaux et la portée des services spécifiques.
  • Le service dispose de serveurs aux États-Unis et un traitement transfrontalier peut avoir lieu ; le lieu de stockage des données dépend de la région de déploiement et est confirmé par le contrat.

Droits d’auteur, usage commercial et remboursement

L’utilisateur est responsable de l’utilisation des données téléchargées, du jeu de données d’entraînement, des prompts et des résultats générés, et doit vérifier la précision des sorties du modèle. Les conditions interdisent le reverse engineering, la vente ou le transfert des clés API, la perturbation du système, la violation des droits de tiers ainsi que tout autre usage illégal.

Le fait que la plateforme autorise les entreprises à créer des contenus ne signifie pas que toutes les sorties de modèles et tous les poids soient inconditionnellement commerciaux. Avant l’achat, il convient de lire en même temps les conditions de la plateforme, la licence du modèle de base, la licence du jeu de données ainsi que la commande entreprise.

Les informations publiques indiquent que les fonds prépayés sont déduits en priorité, et que l’usage excédentaire est facturé à la fin du mois, mais aucune promesse de remboursement général valable pour tous les comptes n’a été confirmée. Les conditions de remboursement ou de déduction pour les recharges, les prélèvements erronés, l’expiration des crédits d’essai et les contrats entreprise doivent être confirmées auprès du service d’assistance facturation avant le paiement.

Questions fréquentes

Fireworks AI propose-t-il un forfait gratuit permanent ?

Aucun forfait gratuit permanent et illimité n’a été confirmé. Les nouveaux comptes bénéficient d’un crédit d’essai de 1 dollar, puis le tarif est calculé en fonction de l’utilisation réelle des modèles, de l’entraînement ou des GPU.

Comment choisir entre Serverless et On-demand ?

Un débit faible à moyen, des modèles couramment utilisés et des tests rapides conviennent bien au mode Serverless ; un débit stable élevé, des modèles personnalisés, LoRA ou des besoins de contrôle de la performance sont plus adaptés au mode On-demand.

Peut-on utiliser directement l’SDK d’OpenAI ?

Oui, il est possible d’appeler l’interface compatible en modifiant la configuration du service, les clés et l’identifiant du modèle, mais les détails des paramètres ainsi que le comportement en cas de débordement de contexte doivent être rétestés.

Les modèles de fine-tuning peuvent-ils fonctionner sur Serverless ?

Non. Les LoRA ajustés par l’utilisateur et les modèles personnalisés nécessitent une déploiement sur demande dédié.

Les prompts seront-ils sauvegardés ou utilisés pour l’entraînement ?

Le raisonnement général du modèle ouvert ne conserve aucune donnée et celles qui ne sont pas explicitement choisies pour être ajoutées ne sont pas utilisées pour l’entraînement ; des exceptions peuvent exister pour les modèles propriétaires ou les fonctionnalités avancées, il convient de vérifier les règles spécifiques relatives aux données avant utilisation.

Fireworks AI est-il une plateforme open source ?

Ce n’est pas une plateforme de hébergement open source confirmée. Certains SDK, outils en ligne de commande, Cookbooks et dépôts d’exemples ont leur code ouvert, mais les services de la plateforme et les modèles tiers sont soumis à des conditions différentes.

Comment éviter des dépassements de budget inattendus ?

Définissez un budget mensuel et des alertes, effectuez d’abord des tests de charge à petite échelle pour vérifier les taux de hits en cache et la longueur des résultats, et assurez-vous que le déploiement dédié peut être réduit à zéro. Lorsque le budget est atteint, le service sera suspendu, mais il faut continuer à le surveiller.

Est-ce que cela prend en charge les applications natives de Chine continentale ?

Aucune application de bureau ou mobile native chinoise destinée aux utilisateurs finaux n’a été confirmée. Fireworks AI est principalement utilisé via une console web, des API, des SDK et des outils en ligne de commande ; l’accessibilité en réseau et les exigences de conformité doivent être évaluées par l’utilisateur lui-même.

Résumé

Fireworks AI convient aux équipes qui souhaitent effectuer l’inférence de modèles ouverts, le fine-tuning, l’entraînement et le déploiement dédié sur une même plateforme. Ses interfaces compatibles et son Serverless à la demande permettent d’accélérer le processus d’essai, tandis que les fonctionnalités à la demande et les capacités d’entreprise offrent un contrôle plus poussé sur les versions, les régions et les performances.

L’évaluation des coûts ne doit pas se limiter à la comparaison du prix d’un seul jeton ; il faut également prendre en compte le cache, la longueur de la sortie, les remises par volume, les jetons d’entraînement, les copies GPU et les surcoûts régionaux. Avant le lancement, une validation end-to-end de la qualité du modèle, des licences, du traitement des données, du throttling et du budget doit être effectuée.

©️Droit d’auteur : Sauf indication contraire, tous les articles de ce site sont protégés par le droit d’auteur.Partage d’outils d’IATous les droits d’auteur sont réservés. Sans autorisation, aucune personne, média, site web ou groupe ne peut reproduire, copier ou diffuser de quelque manière que ce soit le contenu de ce site, ni créer de mirror sur des serveurs qui ne lui appartiennent pas. Dans le cas contraire, notre site se réserve le droit de poursuivre en justice les responsables conformément à la loi.

Outils similaires à Fireworks AI