Together AI
Valeur ajoutée gratuite
Guide complet des outils d’IA Modèle d’entraînement d’IA

Together AI

Plateforme cloud native pour l’IA offrant l’inference de modèles open source, le fine-tuning et des ressources de calcul dédiées

Étiquettes :

Qu’est-ce que Together AI ?

Together AI est une plateforme d’infrastructure IA destinée aux développeurs et aux entreprises, qui propose des services API pour des modèles de langage de grande taille, des images, des vidéos, du texte parlé, des Embedding ainsi que des modèles de sécurité. Les utilisateurs peuvent commencer avec l’inference Serverless, puis passer à des solutions plus performantes telles que Provisioned Throughput, Dedicated Inference ou GPU Cluster en fonction de leurs besoins.

La plateforme se concentre principalement sur les modèles open source et à poids ouverts, tout en offrant le fine-tuning de modèles, une API par lots, un Sandbox de code et un stockage haute performance. Les développeurs peuvent intégrer ces modèles dans des applications de chat, de recherche, d’agents et de génération de contenu à l’aide des SDK REST, Python ou TypeScript.

Fonctionnalités principales de Together AI

  • Serverless Inference:Pas de gestion nécessaire pour la GPU ; le paiement s’effectue en fonction de l’utilisation réelle en tokens, images, vidéos ou audio.
  • Répertoire des modèles :Fournit des modèles de texte, de raisonnement, de code, visuels et multimodaux de plusieurs fabricants.
  • Interface compatible OpenAI :Réduire les coûts de migration des applications de chat existantes et de Completion.
  • Batch API:Traiter un grand nombre de requêtes non en temps réel de manière asynchrone, adapté aux tâches hors ligne.
  • Entrée en cache :Prend en charge le prix de mise en cache des prompts pour certains modèles, afin de réduire les coûts liés à des contextes répétitifs.
  • Provisioned Throughput:Préserve une capacité de débit fixe selon le PTU, idéale pour des flux importants stables.
  • Dedicated Inference:Exécutez des modèles sur des GPU à un seul locataire pour obtenir des performances stables et un contrôle accru.
  • GPU Clusters:Utiliser des puces de calcul telles que H100, H200, B200 en fonction des heures d’utilisation de la GPU.
  • Fine-tuning:Prend en charge les méthodes d’entraînement telles que SFT, LoRA, l’ajustement complet et l’optimisation des préférences.
  • Images et vidéos :Appeler divers modèles de génération, d’édition et multimédia via une API unifiée.
  • Code Sandbox:Fournit un environnement d’exécution isolé pour générer du code pour des agents ou des modèles.
  • SDK officiel et Cookbook :Fournit des exemples en Python, TypeScript et d’agents réutilisables.

Comparaison des méthodes de déploiement par raisonnement

MéthodeMode de facturationScénarios adaptés
ServerlessPar token ou unité de génération de médiaEssais, débits fluctuants et mise en ligne rapide
Batch APIPrix par lot asynchroneClassification hors ligne, résumé, évaluation et traitement des données
Provisioned ThroughputPar PTU par minuteStabiliser un fort débit et une bande passante prévisible
Dedicated InferenceHeures GPU par locataire sur commandeModèles personnalisés, latence stable et besoins en isolation
GPU ClusterPar heure GPU et par période réservéeEntraînement, raisonnement, charges de travail personnalisées et recherche

Exemple de prix du modèle de texte Serverless

Le tableau ci-dessous présente les prix de référence standard utilisés lors de la vérification sur la page des prix officiels, exprimés en dollars américains par million de tokens. Les modèles sont fréquemment mis en ligne, retirés ou voir leurs prix changer ; il convient de vérifier à nouveau la page du modèle avant d’appeler officiellement le modèle.

modèleEntréeEntrée en cacheSortie
MiniMax M30,30 dollar0,06 dollar américain1,20 dollar
GLM-5.21,40 dollar0,26 dollar4,40 dollars
Kimi K33,00 dollars0,30 dollar15,00 dollars
DeepSeek V4 Flash 07310,14 dollar0,03 dollar américain0,28 dollar
gpt-oss-120B0,15 dollarPas séparé0,60 dollar
Llama 3.3 70B1,04 dollarPas séparé1,04 dollar
gpt-oss-20B0,05 dollarPas séparé0,20 dollar

Les prix unitaires d’entrée et de sortie ne représentent que les coûts de base ; les boucles d’agent, les contextes longs, les résultats des outils et l’historique des répétitions augmentent tous le nombre de tokens. Seuls les modèles disposant de prix en mémoire peuvent bénéficier d’une remise lorsque la requête correspond aux règles de mise en cache.

Prix de Dedicated et de GPU Cluster

Les prix ci-dessous sont des prix de référence en dollars par heure, sur demande, pour chaque GPU ; les prix pour l’inférence dédiée et les clusters diffèrent. Une réduction progressive est disponible pour les réservations à long terme. Les régions disponibles, les stocks et les configurations sont indiqués dans la console.

MatérielDedicated InferenceCluster GPU sur demandeRéférence à long terme du cluster
NVIDIA HGX H1005,49 dollars3,99 dollarsDe 7 à 30 jours : 3,69 dollars, de 91 à 180 jours : 3,19 dollars
NVIDIA HGX H200Contacter le service des ventes5,99 dollarsDe 7 à 30 jours : 4,99 dollars, de 91 à 180 jours : 3,99 dollars
NVIDIA HGX B2008,99 dollars8,19 dollarsDe 7 à 30 jours : 7,99 dollars, de 91 à 180 jours : 6,79 dollars
NVIDIA HGX B300Contacter le service des ventesContacter le service des ventesConformément au contrat
NVIDIA GB200 ou GB300 NVL72Contacter le service des ventesContacter le service des ventesConformément au contrat

Ajustements et prix Sandbox

ServicePrix de référenceInstructions de facturation
Ajustement fin complet SFT jusqu’à 16B1,20 dollarChaque million de tokens d’entraînement
SFT LoRA sous 16B1,50 dollarChaque million de tokens d’entraînement
Ajustement fin complet du DPO jusqu’à 16B3,75 dollarsChaque million de tokens d’entraînement
DPO LoRA jusqu’à 16B3,20 dollarsChaque million de tokens d’entraînement
Tarif minimum pour le réglage standard4 dollars/tâcheLes règles des modèles de grande taille spécifiques peuvent varier.
Code Interpreter0,03 dollar américainChaque session d’une durée maximale de 60 minutes
Sandbox vCPU0,0446 dollar/hourCalcul des ressources selon l’affectation
Mémoire Sandbox0,0149 dollar américain/GiB/heureSous-total avec les coûts de vCPU

Les frais de fine-tuning sont calculés en multipliant le nombre de tokens des données d’entraînement par le nombre d’Époches, et en ajoutant le nombre optionnel d’évaluations sur les données de validation. L’inference du modèle après entraînement, les endpoints dédiés ainsi que le stockage peuvent faire l’objet de frais supplémentaires.

Création d’une clé API et tutoriel pour la première appel

  1. Créer un projet :Inscrivez-vous à la console et créez un projet de développement indépendant.
  2. Configurer la facture :Recharger ou configurer les méthodes de paiement disponibles, tout en définissant un budget et des rappels.
  3. Générer une clé :Créez une clé API et sauvegardez-la immédiatement dans un système de secrets sécurisé.
  4. Installer le SDK :Installez les bibliothèques officielles Python ou TypeScript en fonction de la pile technique.
  5. Sélectionner le modèle :Comparer le contexte, les capacités, la vitesse, les licences et le prix unitaire actuel.
  6. Test en petite quantité :Restreindre le nombre maximal de tokens de sortie en vérifiant d’abord le format de la réponse, les erreurs et le retour par flux.
  7. Surveillance en ligne :Enregistrer le token, le délai, le code d’état, la version du modèle et le coût par requête.

Tutoriel sur le choix de modèles

  1. Utiliser des échantillons de données réelles pour créer des ensembles d’évaluation de la qualité, des délais, de la sécurité et des coûts.
  2. Testez d’abord des tâches de classification simple, d’extraction et de routage avec de petits modèles à bas coût.
  3. Pour le raisonnement complexe, le code ou les contextes longs, ainsi que pour les modèles de grande taille, il ne suffit pas de se fier aux scores des classements.
  4. Vérifier la licence du modèle, les politiques d’utilisation acceptables et les exigences pour le déploiement commercial.
  5. Tester le JSON, les appels d’outils, la sortie en flux, la concurrence et la limite de contexte.
  6. Configurer des alternatives de dégradation pour le modèle principal, et mettre en place un processus de migration en cas de désactivation du modèle.
  7. Calculer le coût des tâches réussies par semaine, plutôt que de se limiter à comparer le prix par million de tokens.

Tutoriel sur le fine-tuning des modèles

  1. Vérifier la nécessité :Vérifiez d’abord si le Prompt, RAG et les appels d’outils peuvent déjà répondre aux besoins.
  2. Préparation des données :Éliminer les doublons, masquer les données sensibles et unifier le format d’entrée/sortie, en divisant les ensembles d’entraînement et de validation.
  3. Méthode de sélection :On utilise généralement d’abord LoRA SFT, et on ne considère le modèle complet ou DPO que s’il y a une raison claire.
  4. Estimation des coûts :Calculez le budget d’entraînement en fonction des tokens de données, des époches, du nombre de validations et du frais minimum.
  5. Démarrer la tâche :Télécharger les données et enregistrer le modèle de base, les paramètres, le code ainsi que la version des données.
  6. Évaluation indépendante :Vérifier la qualité, le biais et la régression de sécurité à l’aide d’un ensemble de test non utilisé pour l’entraînement.
  7. Déploiement de la surveillance :Publier d’abord à un faible débit, et ajuster continuellement le modèle affiné par rapport au modèle de base.

À qui convient Together AI

  • Développeur d’applications d’IA :Utiliser des appels API unifiés pour accéder à divers modèles ouverts et fonctionnalités multimédias.
  • Équipe Agent :Raisonnement combiné, outils, Embedding, Sandbox et routage multi-modèles.
  • Équipe des données :Utilisez Batch pour effectuer un classement à grande échelle, des résumés et une extraction structurée.
  • Équipe de modélisation :Mettre en œuvre SFT, LoRA, DPO et des modèles personnalisés.
  • Produits à fort débit :Passer progressivement de Serverless à PTU ou à Inference dédiée.
  • Institut de recherche :Louer des clusters GPU pour mener des expériences de formation, d’évaluation et d’inference.
  • Produits multimédias :Modèles unifiés d’accès à l’identification et à la synthèse d’images, de vidéos et de voix.

Avantages du produit

  • Couvre l’ensemble des parcours Serverless, Batch, PTU, Dedicated et GPU Cluster ;
  • Une large gamme de modèles est disponible, permettant de comparer plusieurs modèles ouverts sur la même plateforme ;
  • Prend en charge le texte, les images, les vidéos, l’audio, les Embedding et les modèles de sécurité ;
  • Certaines interfaces sont compatibles avec le format OpenAI, ce qui réduit les coûts de migration des applications existantes.
  • Fournir une infrastructure d’agent incluant la formation, le fine-tuning, des Sandboxes de code et du stockage ;
  • Les exemples officiels de Python, TypeScript SDK et Cookbook sont assez complets ;
  • La page de tarification divulgue les tokens, les GPU et les unités d’entraînement, ce qui facilite l’estimation des coûts.

Restrictions d'utilisation et précautions relatives aux coûts

  • Les catalogues de modèles et les prix unitaires évoluent fréquemment, il n’est donc pas possible d’inscrire définitivement un prix vérifié une seule fois dans un budget à long terme.
  • Les capacités de appel d’outils, JSON, visuelles et contextuelles varient selon les modèles ;
  • Les cycles multiples d’Agent transportent à plusieurs reprises le contexte, ce qui peut entraîner des coûts bien plus élevés qu’une conversation unique ;
  • Les GPU dédiés sont facturés en fonction du temps d’exécution, et les endpoints inactifs peuvent également engendrer des frais continus ;
  • Pour les scénarios où Sandbox ne se termine pas automatiquement, un TTL doit être défini et un nettoyage actif effectué ;
  • Le réglage fin peut conserver des informations sensibles ou diminuer les capacités générales ; il doit être évalué de manière indépendante.
  • Les licences de modèle diffèrent, l’appel à l’API ne confère pas automatiquement un droit d’utilisation commerciale illimité.

Sécurité des données et recommandations de production

  • La clé API est uniquement stockée dans les secrets du serveur, créée séparément pour chaque projet et environnement ;
  • Définir des budgets, des limites de vitesse et des droits d’accès indépendants pour le développement, les tests et la production ;
  • Supprimez les informations personnelles, les clés et le contenu restreint avant de télécharger les données de fine-tuning ;
  • Enregistrer l’ID du modèle, les paramètres de la requête et la version, afin de garantir que le problème puisse être reproduit ;
  • Utiliser des tentatives limitées et un recul exponentiel pour les erreurs 429, de délai d’attente et de service ;
  • Pour les sorties à haut risque, on augmente le filtrage du contenu, la vérification des faits et l’approbation manuelle ;
  • Nettoyer régulièrement les endpoints inutilisés, les Sandboxes, les ensembles de données et les anciennes clés API.

GitHub et explications sur le logiciel libre

L’organisation officielle GitHub de Together AI a mis en ligne des SDK pour Python et TypeScript, un Together Cookbook, des outils Sandbox ainsi que de nombreux exemples. Les dépôts tels que le Cookbook et Sandbox sont soumis à leurs propres licences open source, idéaux pour apprendre les API et les workflows d’agents.

La plateforme cloud commerciale Together AI, l’infrastructure de raisonnement et tout le code serveur ne forment pas un produit entièrement open source. Les modèles hébergés sur la plateforme appartiennent également à des développeurs et à des licences différents, et il est nécessaire de les vérifier un par un avant utilisation.

Questions fréquentes

Together AI est-il gratuit ?

La plateforme repose principalement sur des recharges ou un paiement à l’usage ; le compte peut recevoir des crédits pour des offres promotionnelles ou des essais, mais le montant et les conditions peuvent varier. Pour une utilisation professionnelle, il convient de budgétiser en fonction de la consommation réelle en modèles, médias, GPU et outils.

Comment Together AI facture-t-il ?

Les modèles de texte sont généralement facturés en fonction des tokens d’entrée et de sortie, tandis que les images, vidéos et sons sont calculés selon leurs unités respectives. L’inference dédiée et les clusters GPU sont facturés en heures GPU, et le fine-tuning est facturé en fonction des tokens d’entraînement.

Prend-il en charge l’SDK OpenAI ?

Certaines interfaces de messagerie et de génération offrent une version compatible OpenAI, ce qui facilite le transfert des applications existantes. L’ID du modèle, les paramètres et les fonctionnalités spécifiques doivent cependant être adaptés conformément aux documents de Together.

Peut-on affiner les modèles open source ?

Oui, la plateforme offre des fonctionnalités telles que SFT, LoRA, fine-tuning complet et DPO. La portée de la prise en charge, les prix et les frais minimaux varient en fonction de la taille et du type du modèle.

Together AI est-il open source ?

La plateforme cloud elle-même n’est pas un produit entièrement open source. Le SDK officiel, les Cookbook ainsi que certains outils sont open source, tandis que les modèles hébergés suivent leurs propres licences de modèle.

©️Droit d’auteur : Sauf indication contraire, tous les articles de ce site sont protégés par le droit d’auteur.Partage d’outils d’IATous les droits d’auteur sont réservés. Sans autorisation, aucune personne, média, site web ou groupe ne peut reproduire, copier ou diffuser de quelque manière que ce soit le contenu de ce site, ni créer de mirror sur des serveurs qui ne lui appartiennent pas. Dans le cas contraire, notre site se réserve le droit de poursuivre en justice les responsables conformément à la loi.

Outils similaires à Together AI