Replicate
Valeur ajoutée gratuite
Guide complet des outils d’IA Modèle d’entraînement d’IA

Replicate

Plateforme permettant d’exécuter, de déployer et d’élargir des modèles d’IA open source via une API cloud

Étiquettes :

Qu’est-ce que Replicate ?

Replicate est une plateforme API qui gère des modèles d’apprentissage automatique. Les développeurs n’ont pas besoin de configurer eux-mêmes les pilotes GPU, les conteneurs ou les serveurs d’inference ; ils peuvent exécuter des modèles pour du texte, des images, des vidéos, de l’audio, du 3D, de l’ultra-résolution, etc., via un site web ou une API. Ils peuvent également empaqueter leurs propres modèles à l’aide de Cog et les publier en tant qu’API publiques ou privées.

La plateforme intègre à la fois des modèles communautaires, des Replicate Official Models et des modèles propriétaires de tiers. Les pages communautaires facilitent les essais rapides, mais la qualité des modèles, leur état de maintenance, les licences ainsi que les formats d’entrée et de sortie sont déterminés par chaque projet ;

Les modèles officiels sont généralement maintenus par Replicate pour assurer une API stable et des prix prévisibles.

Avant l’intégration officielle, il convient de fixer la version du modèle, et il ne faut pas utiliser uniquement la version par défaut qui peut changer.

Fonctionnalité clé de Replicate

Exécuter des modèles d’IA en ligne

L’utilisateur peut saisir des paramètres sur la page du modèle et l’exécuter directement ; une fois les résultats affichés, il peut copier des exemples d’API en Python, JavaScript, HTTP ou d’autres langages. La prédiction passe par des états tels que starting, processing, succeeded, failed ou canceled ; l’application peut effectuer des requêtes périodiques, attendre la synchronisation des résultats ou utiliser un Webhook pour recevoir une notification de finition.

Images, vidéos et API multimodales

Le catalogue de modèles couvre la génération d’images à partir de texte, l’édition d’images, l’agrandissement, le retrait de fond, la génération de vidéos, la voix, le texte et la compréhension multimodale. Les différents modèles peuvent être facturés en fonction des images générées, du nombre de secondes de vidéo, des tokens d’entrée/sortie ou des secondes d’exécution sur le matériel.

Avant d’appeler, veuillez consulter l’unité de facturation, le coût d’exemple, les limites d’entrée et la politique de contenu de la page du modèle actuel.

Modèles officiels et communautaires

Les modèles officiels disposent d’extrémités stables et d’un déploiement géré par la plateforme, avec une facturation basée en partie sur des images, des vidéos ou des tokens ; les modèles communautaires sont généralement facturés en fonction du temps réel d’exécution sur le matériel.

Les projets communautaires peuvent être mis à niveau, arrêtés ou voir leur schéma modifié ; les projets en production doivent conserver l’hash de la version, mettre en place une validation des sorties et se préparer avec des modèles de remplacement.

Emballage de modèles personnalisés Cog

Cog est un outil de conteneurisation pour l’apprentissage automatique open source développé par Replicate. Les développeurs déclarent l’environnement Python, les dépendances système, la GPU ainsi que l’interface de prédiction dans un fichier de configuration ; Cog construit alors le conteneur et génère un service HTTP.

Le modèle peut être déployé sur Replicate ou exécuté dans un environnement prenant en charge Docker. Le fait que l’outil Cog soit open source ne signifie pas que les poids qu’il contient bénéficient automatiquement de la même licence.

Modèles privés et déploiements

Les modèles privés ne sont pas mis à disposition des autres utilisateurs. La mise en déploiement permet de spécifier le matériel, le nombre minimal et maximal d’instances, ainsi que l’expansion et la contraction, offrant ainsi une capacité plus contrôlable pour le trafic en production.

La plupart des modèles privés sont facturés au tarif du matériel pendant le démarrage de l’instance, en attente inactivité et pendant le traitement effectif ; un nombre minimal d’instances supérieur à zéro entraîne constamment des coûts d’inactivité.

Entraînement et fine-tuning

Certains modèles offrent une interface d’entraînement, par exemple pour entraîner LoRA ou effectuer un retouche de style à l’aide d’images. Les tâches d’entraînement sont également facturées en fonction du matériel utilisé, du temps consacré ou du prix unitaire défini pour le modèle, et les résultats sont généralement écrits dans le modèle cible spécifié.

Les données d’entraînement doivent être légalement autorisées, et il convient d’éviter de télécharger des visages, des marques, des informations privées ou des contenus restreints non autorisés.

Sortie en flux et Webhook

Il est possible de recevoir du texte en flux via Server-Sent Events, et des Webhook peuvent également être configurés pour les images, vidéos de longue durée ainsi que les tâches d’entraînement. Le destinataire du Webhook doit valider l’origine, gérer de manière idempotente les événements répétés, et retourner rapidement un statut de succès avant d’exécuter asynchrone la logique chronophage.

Fichiers d’entrée et de sortie

L’API peut recevoir une URL, un fichier à télécharger ou une Data URI ; la sortie du modèle est généralement l’adresse d’un fichier temporaire hébergé par la plateforme. Le fichier de sortie n’est pas considéré comme un stockage d’objets permanent, et l’application doit le télécharger dans son propre stockage avant l’expiration de la période valide, en vérifiant son type, sa taille et sa sécurité.

Pour les entrées sensibles, il convient de vérifier la politique de confidentialité de la plateforme, le fournisseur du modèle et la politique de conservation des données.

Secrets et gestion de versions

Lorsque des identifiants de tiers sont nécessaires pour un modèle personnalisé, on peut utiliser Secrets afin d’éviter d’inclure les clés dans l’image. Chaque déploiement crée une version du modèle immuable, et l’API peut fixer une version spécifique pour assurer la reproductibilité.

Lors de la mise à niveau, il convient d’abord de tester en mode gris le schéma d’entrée, le format de sortie, le temps de traitement et le coût.

Comparaison des modes de facturation Replicate

Mode d'utilisationBase de facturationFrais de disponibilité/démarrageScénarios adaptés
Modèle de communauté ouverteLa plupart sont basées sur le nombre réel de secondes de traitement du matérielGénéralement, seule la durée d’exécution de la demande est facturée.Essais, tâches à basse fréquence et tâches élastiques
Official ModelsPar image, seconde de vidéo, token ou unité définieSelon les règles de la page du modèleIl est nécessaire d’avoir une API stable et des prix unitaires prévisibles.
Modèle privéDurée d’utilisation en ligne du matériel sélectionnéLa plupart des démarrages, temps d’inactivité et traitements sont facturés.Poids propre et affaires privées
Fast-booting fine-tunesTemps de traitement réelLes versions conformes à la marque ne prennent pas en compte le temps libre.Modèle de micro-régulation à basse fréquence
EnterpriseContrat et quantité utiliséeConfiguration selon le déploiementLimite élevée de GPU, SLA, support dédié et avantages tarifaires

Prix de la GPU et du CPU répliqués

Voici le tarif standard par instance lors de la vérification sur la page des prix officiels. Le matériel et les prix peuvent être modifiés ; pour des configurations avec plusieurs cartes ou H200, un contrat d’engagement de consommation peut être requis. Les informations finales sont celles affichées dans la console.

MatérielPrix par secondePrix par heureSpécifications principales
CPU Small0,000025 dollar américain0,09 dollar1 CPU, 2 GB de RAM
CPU0,000100 dollar américain0,36 dollar4 CPU, 8 GB de RAM
Nvidia T40,000225 dollar américain0,81 dollar16 GB de mémoire vidéo
Nvidia L40S0,000975 dollar américain3,51 dollars48 GB de mémoire vidéo
Nvidia A100 80GB0,001400 dollar américain5,04 dollars80 GB de mémoire vidéo
Nvidia H1000,001525 dollar américain5,49 dollars80 GB de mémoire vidéo
Nvidia H2000,001525 dollar américain5,49 dollarsLa capacité nécessite généralement une engagement de consommation.

Exemples de prix pour certains modèles officiels

Ce qui suit sert uniquement à expliquer les différentes unités de facturation de Replicate, et ne représente pas des prix permanents ni un catalogue complet des modèles.

Exemple de modèlePrix de référence actuelUnité de facturation
FLUX 1.1 Pro0,04 dollar américainChaque image de sortie
FLUX Dev0,025 dollar américainChaque image de sortie
FLUX Schnell3 dollarsPar 1 000 images générées
Ideogram V3 Quality0,09 dollarChaque image de sortie
Wan 2.1 I2V 480p0,09 dollarSortie vidéo par seconde
Wan 2.1 I2V 720p0,25 dollarSortie vidéo par seconde

Tutoriel d’intégration de l’API Replicate

  1. S’inscrire et configurer le paiement :Créer un compte et un token API, puis ajouter des méthodes de paiement et un budget conformément aux règles du compte actuel.
  2. Sélectionner le modèle :Vérifier la version du modèle, la licence, le schéma d’entrée, la sortie, le temps d’exécution et l’estimation du prix.
  3. Protéger le Token :La clé n’est placée que dans les variables d’environnement du serveur ; les requêtes provenant des navigateurs ou des appareils mobiles doivent passer par leur propre backend.
  4. Installer le client :Il est possible d’utiliser les packages officiels Python ou Node.js, ou bien d’appeler directement l’API HTTP.
  5. Créer une Prédiction :Version du modèle entrant et entrée, les tâches courtes attendent le résultat, tandis que les tâches longues utilisent un Webhook ou la pollinisation.
  6. Enregistrer la sortie :Téléchargez la sortie temporaire dans votre propre stockage d’objets, tout en enregistrant l’ID de prédiction, la version et les paramètres.
  7. Gestion des exceptions :Définir des logiques de délai d’attente, d’annulation, de tentative répétée et d’idempotence pour éviter que les requêtes échouées ne génèrent continuellement des frais.
  8. Surveillance en ligne :Statistiques du temps de traitement, du matériel, des unités de sortie et du taux d’échec ; détection d’alertes pour les dépenses et limitation de la consommation.

Tutoriel pour déployer des modèles personnalisés

  1. Installez Cog et définez dans le projet les dépendances, les paquets système, la GPU ainsi que les entrées et sorties du prédicteur.
  2. Construisez et exécutez des conteneurs localement, et utilisez des échantillons représentatifs pour vérifier le démarrage en froid, la mémoire vidéo, les sorties et le traitement des erreurs.
  3. Créer un modèle Replicate et publier une version ; les Secrets sont configurés via la plateforme et ne sont pas écrits dans l’image.
  4. Sélectionnez le matériel en fonction de la mémoire vidéo et des performances, créez un déploiement et définissez le nombre minimal et maximal d’instances.
  5. On observe le démarrage en froid à partir d’un nombre minimal d’instances nul ; on augmente ensuite la capacité permanente lorsque des délais faibles sont requis, et on calcule le coût de l’inactivité.

À qui s’adresse-t-il

  • Développeurs qui souhaitent appeler rapidement des APIs pour des images, des vidéos, de la voix et des modèles open source ;
  • Équipes de produits qui ne souhaitent pas gérer eux-mêmes les GPU, CUDA, les conteneurs et l’automatisation de l’échelle ;
  • Créateurs d’IA qui doivent tester de nombreux modèles communautaires et comparer leurs performances aux coûts ;
  • Ingénieurs en apprentissage automatique qui doivent emballer des modèles personnalisés en API privée ;
  • Équipes d’application nécessitant l’entraînement de LoRA, des tâches asynchrones, une sortie en flux et des Webhook.

Avantages et précautions

  • Les avantages de Replicate sont la grande variété de modèles, un seuil d’accès bas en fonction de la quantité utilisée, des exemples d’API clairs, ainsi qu’un parcours complet allant des tests avec des modèles publics jusqu’à l’emballage Cog, l’entraînement et le déploiement en production.
  • Pour les tâches GPU à faible fréquence ou présentant des fluctuations de demande importantes, le paiement par seconde est plus flexible que la location à long terme d’un serveur.
  • Le temps d’inactivité et de démarrage des modèles privés peut être facturé, et le coût total peut dépasser celui du location d’une GPU par soi-même en cas d’utilisation élevée en permanence.
  • Les modèles communautaires ne sont pas nécessairement soumis à une vérification de sécurité ou de qualité ; les entrées peuvent déclencher du code malveillant ou des dépendances instables.
  • La sortie du modèle, les données d’entraînement et les licences nécessitent une vérification manuelle ;
  • Lorsqu’il s’agit de données personnelles et de matériel protégé par le droit d’auteur, il convient de s’assurer de la légalité du téléchargement, du stockage et de la création de contenu ;

Questions fréquentes

Replicate est-il gratuit ?

Il s’agit d’une plateforme à paiement par usage, et non d’un outil gratuit fixe. Certaines comptes ou activités peuvent disposer d’une période d’essai, tandis que l’utilisation régulière est facturée en fonction des résultats générés par le modèle, des tokens ou du temps d’exploitation du matériel.

Comment est facturé Replicate ?

La plupart des modèles publics sont facturés en fonction du nombre de secondes d’exécution réelle, tandis que les modèles officiels peuvent également être facturés en fonction du nombre de secondes dans les images ou vidéos, ou en fonction des tokens ; la plupart des modèles privés sont quant à eux facturés tant pour le temps d démarrage que pour le temps d’inactivité.

Replicate peut-il déployer ses propres modèles ?

Oui, on peut utiliser Cog open source pour définir l’environnement de exécution et l’interface de prédiction ; après déploiement, il est possible de créer des modèles privés et des déploiements.

Le fichier de sortie sera-t-il sauvegardé de manière permanente ?

Il ne faut pas compter sur l’adresse générée par la plateforme pour un stockage permanent. L’application doit copier en temps opportun les fichiers importants dans son propre système de stockage d’objets.

Replicate est-il open source ?

La plateforme cloud Replicate est un service commercial ; les outils de développement tels que Cog sont open source.

Chaque code de modèle et chaque poids suivent leur propre licence.

©️Droit d’auteur : Sauf indication contraire, tous les articles de ce site sont protégés par le droit d’auteur.Partage d’outils d’IATous les droits d’auteur sont réservés. Sans autorisation, aucune personne, média, site web ou groupe ne peut reproduire, copier ou diffuser de quelque manière que ce soit le contenu de ce site, ni créer de mirror sur des serveurs qui ne lui appartiennent pas. Dans le cas contraire, notre site se réserve le droit de poursuivre en justice les responsables conformément à la loi.

Outils similaires à Replicate