Replicate
Plateforme permettant d’exécuter, de déployer et d’élargir des modèles d’IA open source via une API cloud
Étiquettes :Modèle d’entraînement d’IAQu’est-ce que Replicate ?
Replicate est une plateforme API qui gère des modèles d’apprentissage automatique. Les développeurs n’ont pas besoin de configurer eux-mêmes les pilotes GPU, les conteneurs ou les serveurs d’inference ; ils peuvent exécuter des modèles pour du texte, des images, des vidéos, de l’audio, du 3D, de l’ultra-résolution, etc., via un site web ou une API. Ils peuvent également empaqueter leurs propres modèles à l’aide de Cog et les publier en tant qu’API publiques ou privées.
La plateforme intègre à la fois des modèles communautaires, des Replicate Official Models et des modèles propriétaires de tiers. Les pages communautaires facilitent les essais rapides, mais la qualité des modèles, leur état de maintenance, les licences ainsi que les formats d’entrée et de sortie sont déterminés par chaque projet ;
Les modèles officiels sont généralement maintenus par Replicate pour assurer une API stable et des prix prévisibles.
Avant l’intégration officielle, il convient de fixer la version du modèle, et il ne faut pas utiliser uniquement la version par défaut qui peut changer.
Fonctionnalité clé de Replicate
Exécuter des modèles d’IA en ligne
L’utilisateur peut saisir des paramètres sur la page du modèle et l’exécuter directement ; une fois les résultats affichés, il peut copier des exemples d’API en Python, JavaScript, HTTP ou d’autres langages. La prédiction passe par des états tels que starting, processing, succeeded, failed ou canceled ; l’application peut effectuer des requêtes périodiques, attendre la synchronisation des résultats ou utiliser un Webhook pour recevoir une notification de finition.
Images, vidéos et API multimodales
Le catalogue de modèles couvre la génération d’images à partir de texte, l’édition d’images, l’agrandissement, le retrait de fond, la génération de vidéos, la voix, le texte et la compréhension multimodale. Les différents modèles peuvent être facturés en fonction des images générées, du nombre de secondes de vidéo, des tokens d’entrée/sortie ou des secondes d’exécution sur le matériel.
Avant d’appeler, veuillez consulter l’unité de facturation, le coût d’exemple, les limites d’entrée et la politique de contenu de la page du modèle actuel.
Modèles officiels et communautaires
Les modèles officiels disposent d’extrémités stables et d’un déploiement géré par la plateforme, avec une facturation basée en partie sur des images, des vidéos ou des tokens ; les modèles communautaires sont généralement facturés en fonction du temps réel d’exécution sur le matériel.
Les projets communautaires peuvent être mis à niveau, arrêtés ou voir leur schéma modifié ; les projets en production doivent conserver l’hash de la version, mettre en place une validation des sorties et se préparer avec des modèles de remplacement.
Emballage de modèles personnalisés Cog
Cog est un outil de conteneurisation pour l’apprentissage automatique open source développé par Replicate. Les développeurs déclarent l’environnement Python, les dépendances système, la GPU ainsi que l’interface de prédiction dans un fichier de configuration ; Cog construit alors le conteneur et génère un service HTTP.
Le modèle peut être déployé sur Replicate ou exécuté dans un environnement prenant en charge Docker. Le fait que l’outil Cog soit open source ne signifie pas que les poids qu’il contient bénéficient automatiquement de la même licence.
Modèles privés et déploiements
Les modèles privés ne sont pas mis à disposition des autres utilisateurs. La mise en déploiement permet de spécifier le matériel, le nombre minimal et maximal d’instances, ainsi que l’expansion et la contraction, offrant ainsi une capacité plus contrôlable pour le trafic en production.
La plupart des modèles privés sont facturés au tarif du matériel pendant le démarrage de l’instance, en attente inactivité et pendant le traitement effectif ; un nombre minimal d’instances supérieur à zéro entraîne constamment des coûts d’inactivité.
Entraînement et fine-tuning
Certains modèles offrent une interface d’entraînement, par exemple pour entraîner LoRA ou effectuer un retouche de style à l’aide d’images. Les tâches d’entraînement sont également facturées en fonction du matériel utilisé, du temps consacré ou du prix unitaire défini pour le modèle, et les résultats sont généralement écrits dans le modèle cible spécifié.
Les données d’entraînement doivent être légalement autorisées, et il convient d’éviter de télécharger des visages, des marques, des informations privées ou des contenus restreints non autorisés.
Sortie en flux et Webhook
Il est possible de recevoir du texte en flux via Server-Sent Events, et des Webhook peuvent également être configurés pour les images, vidéos de longue durée ainsi que les tâches d’entraînement. Le destinataire du Webhook doit valider l’origine, gérer de manière idempotente les événements répétés, et retourner rapidement un statut de succès avant d’exécuter asynchrone la logique chronophage.
Fichiers d’entrée et de sortie
L’API peut recevoir une URL, un fichier à télécharger ou une Data URI ; la sortie du modèle est généralement l’adresse d’un fichier temporaire hébergé par la plateforme. Le fichier de sortie n’est pas considéré comme un stockage d’objets permanent, et l’application doit le télécharger dans son propre stockage avant l’expiration de la période valide, en vérifiant son type, sa taille et sa sécurité.
Pour les entrées sensibles, il convient de vérifier la politique de confidentialité de la plateforme, le fournisseur du modèle et la politique de conservation des données.
Secrets et gestion de versions
Lorsque des identifiants de tiers sont nécessaires pour un modèle personnalisé, on peut utiliser Secrets afin d’éviter d’inclure les clés dans l’image. Chaque déploiement crée une version du modèle immuable, et l’API peut fixer une version spécifique pour assurer la reproductibilité.
Lors de la mise à niveau, il convient d’abord de tester en mode gris le schéma d’entrée, le format de sortie, le temps de traitement et le coût.
Comparaison des modes de facturation Replicate
| Mode d'utilisation | Base de facturation | Frais de disponibilité/démarrage | Scénarios adaptés |
|---|---|---|---|
| Modèle de communauté ouverte | La plupart sont basées sur le nombre réel de secondes de traitement du matériel | Généralement, seule la durée d’exécution de la demande est facturée. | Essais, tâches à basse fréquence et tâches élastiques |
| Official Models | Par image, seconde de vidéo, token ou unité définie | Selon les règles de la page du modèle | Il est nécessaire d’avoir une API stable et des prix unitaires prévisibles. |
| Modèle privé | Durée d’utilisation en ligne du matériel sélectionné | La plupart des démarrages, temps d’inactivité et traitements sont facturés. | Poids propre et affaires privées |
| Fast-booting fine-tunes | Temps de traitement réel | Les versions conformes à la marque ne prennent pas en compte le temps libre. | Modèle de micro-régulation à basse fréquence |
| Enterprise | Contrat et quantité utilisée | Configuration selon le déploiement | Limite élevée de GPU, SLA, support dédié et avantages tarifaires |
Prix de la GPU et du CPU répliqués
Voici le tarif standard par instance lors de la vérification sur la page des prix officiels. Le matériel et les prix peuvent être modifiés ; pour des configurations avec plusieurs cartes ou H200, un contrat d’engagement de consommation peut être requis. Les informations finales sont celles affichées dans la console.
| Matériel | Prix par seconde | Prix par heure | Spécifications principales |
|---|---|---|---|
| CPU Small | 0,000025 dollar américain | 0,09 dollar | 1 CPU, 2 GB de RAM |
| CPU | 0,000100 dollar américain | 0,36 dollar | 4 CPU, 8 GB de RAM |
| Nvidia T4 | 0,000225 dollar américain | 0,81 dollar | 16 GB de mémoire vidéo |
| Nvidia L40S | 0,000975 dollar américain | 3,51 dollars | 48 GB de mémoire vidéo |
| Nvidia A100 80GB | 0,001400 dollar américain | 5,04 dollars | 80 GB de mémoire vidéo |
| Nvidia H100 | 0,001525 dollar américain | 5,49 dollars | 80 GB de mémoire vidéo |
| Nvidia H200 | 0,001525 dollar américain | 5,49 dollars | La capacité nécessite généralement une engagement de consommation. |
Exemples de prix pour certains modèles officiels
Ce qui suit sert uniquement à expliquer les différentes unités de facturation de Replicate, et ne représente pas des prix permanents ni un catalogue complet des modèles.
| Exemple de modèle | Prix de référence actuel | Unité de facturation |
|---|---|---|
| FLUX 1.1 Pro | 0,04 dollar américain | Chaque image de sortie |
| FLUX Dev | 0,025 dollar américain | Chaque image de sortie |
| FLUX Schnell | 3 dollars | Par 1 000 images générées |
| Ideogram V3 Quality | 0,09 dollar | Chaque image de sortie |
| Wan 2.1 I2V 480p | 0,09 dollar | Sortie vidéo par seconde |
| Wan 2.1 I2V 720p | 0,25 dollar | Sortie vidéo par seconde |
Tutoriel d’intégration de l’API Replicate
- S’inscrire et configurer le paiement :Créer un compte et un token API, puis ajouter des méthodes de paiement et un budget conformément aux règles du compte actuel.
- Sélectionner le modèle :Vérifier la version du modèle, la licence, le schéma d’entrée, la sortie, le temps d’exécution et l’estimation du prix.
- Protéger le Token :La clé n’est placée que dans les variables d’environnement du serveur ; les requêtes provenant des navigateurs ou des appareils mobiles doivent passer par leur propre backend.
- Installer le client :Il est possible d’utiliser les packages officiels Python ou Node.js, ou bien d’appeler directement l’API HTTP.
- Créer une Prédiction :Version du modèle entrant et entrée, les tâches courtes attendent le résultat, tandis que les tâches longues utilisent un Webhook ou la pollinisation.
- Enregistrer la sortie :Téléchargez la sortie temporaire dans votre propre stockage d’objets, tout en enregistrant l’ID de prédiction, la version et les paramètres.
- Gestion des exceptions :Définir des logiques de délai d’attente, d’annulation, de tentative répétée et d’idempotence pour éviter que les requêtes échouées ne génèrent continuellement des frais.
- Surveillance en ligne :Statistiques du temps de traitement, du matériel, des unités de sortie et du taux d’échec ; détection d’alertes pour les dépenses et limitation de la consommation.
Tutoriel pour déployer des modèles personnalisés
- Installez Cog et définez dans le projet les dépendances, les paquets système, la GPU ainsi que les entrées et sorties du prédicteur.
- Construisez et exécutez des conteneurs localement, et utilisez des échantillons représentatifs pour vérifier le démarrage en froid, la mémoire vidéo, les sorties et le traitement des erreurs.
- Créer un modèle Replicate et publier une version ; les Secrets sont configurés via la plateforme et ne sont pas écrits dans l’image.
- Sélectionnez le matériel en fonction de la mémoire vidéo et des performances, créez un déploiement et définissez le nombre minimal et maximal d’instances.
- On observe le démarrage en froid à partir d’un nombre minimal d’instances nul ; on augmente ensuite la capacité permanente lorsque des délais faibles sont requis, et on calcule le coût de l’inactivité.
À qui s’adresse-t-il
- Développeurs qui souhaitent appeler rapidement des APIs pour des images, des vidéos, de la voix et des modèles open source ;
- Équipes de produits qui ne souhaitent pas gérer eux-mêmes les GPU, CUDA, les conteneurs et l’automatisation de l’échelle ;
- Créateurs d’IA qui doivent tester de nombreux modèles communautaires et comparer leurs performances aux coûts ;
- Ingénieurs en apprentissage automatique qui doivent emballer des modèles personnalisés en API privée ;
- Équipes d’application nécessitant l’entraînement de LoRA, des tâches asynchrones, une sortie en flux et des Webhook.
Avantages et précautions
- Les avantages de Replicate sont la grande variété de modèles, un seuil d’accès bas en fonction de la quantité utilisée, des exemples d’API clairs, ainsi qu’un parcours complet allant des tests avec des modèles publics jusqu’à l’emballage Cog, l’entraînement et le déploiement en production.
- Pour les tâches GPU à faible fréquence ou présentant des fluctuations de demande importantes, le paiement par seconde est plus flexible que la location à long terme d’un serveur.
- Le temps d’inactivité et de démarrage des modèles privés peut être facturé, et le coût total peut dépasser celui du location d’une GPU par soi-même en cas d’utilisation élevée en permanence.
- Les modèles communautaires ne sont pas nécessairement soumis à une vérification de sécurité ou de qualité ; les entrées peuvent déclencher du code malveillant ou des dépendances instables.
- La sortie du modèle, les données d’entraînement et les licences nécessitent une vérification manuelle ;
- Lorsqu’il s’agit de données personnelles et de matériel protégé par le droit d’auteur, il convient de s’assurer de la légalité du téléchargement, du stockage et de la création de contenu ;
Questions fréquentes
Replicate est-il gratuit ?
Il s’agit d’une plateforme à paiement par usage, et non d’un outil gratuit fixe. Certaines comptes ou activités peuvent disposer d’une période d’essai, tandis que l’utilisation régulière est facturée en fonction des résultats générés par le modèle, des tokens ou du temps d’exploitation du matériel.
Comment est facturé Replicate ?
La plupart des modèles publics sont facturés en fonction du nombre de secondes d’exécution réelle, tandis que les modèles officiels peuvent également être facturés en fonction du nombre de secondes dans les images ou vidéos, ou en fonction des tokens ; la plupart des modèles privés sont quant à eux facturés tant pour le temps d démarrage que pour le temps d’inactivité.
Replicate peut-il déployer ses propres modèles ?
Oui, on peut utiliser Cog open source pour définir l’environnement de exécution et l’interface de prédiction ; après déploiement, il est possible de créer des modèles privés et des déploiements.
Le fichier de sortie sera-t-il sauvegardé de manière permanente ?
Il ne faut pas compter sur l’adresse générée par la plateforme pour un stockage permanent. L’application doit copier en temps opportun les fichiers importants dans son propre système de stockage d’objets.
Replicate est-il open source ?
La plateforme cloud Replicate est un service commercial ; les outils de développement tels que Cog sont open source.
Chaque code de modèle et chaque poids suivent leur propre licence.
Numéro d’enregistrement de sécurité publique du Guangxi : 45132202000164