Stable Audio
Valeur ajoutée gratuite
Guide complet des outils d’IA Outils audio IA

Stable Audio

Plateforme audio générative pour la création musicale et d’effets sonores

Étiquettes :

Qu’est-ce que Stable Audio ?

Stable Audio est une plateforme de génération de musique et d’effets audio basée sur l’IA, lancée par Stability AI. Elle permet de créer des extraits de chansons, de la musique de fond, des sons d’environnement, des effets sonores et des éléments de production à partir de descriptions textuelles. Il est également possible de télécharger ou d’enregistrer ses propres fichiers audio, puis de modifier le style, de poursuivre une mélodie ou de redessiner des parties spécifiques à l’aide du langage naturel.

Jusqu’à présent, Stable Audio est passé des modèles initiaux de 90 secondes à la série Stable Audio 3. La version 3.0 prend en charge des morceaux musicaux à structure complète d’environ 6 minutes, avec plusieurs tailles : Small, Small SFX, Medium et Large, et offre des interfaces telles qu’une application web, l’API Stability AI, des poids ouverts, une plateforme de collaboration ainsi que des solutions d’hébergement privé pour les entreprises.

Stable Audio 3.0

Stable Audio 3.0 est la dernière famille de modèles actuelle, dont les données d’entraînement proviennent de ressources avec autorisation complète et Creative Commons, et qui vise à améliorer la structure à long terme, la cohérence mélodique, le respect des instructions et la vitesse de génération. Le modèle peut créer des compositions complètes comprenant une introduction, un développement et une conclusion, et non seulement des boucles isolées.

3.0 Large : conçu pour la production audio à l’échelle entreprise et la plus haute qualité ; Medium prend en charge des chansons complètes d’environ 6 minutes 20 secondes et offre des poids ouverts ;

Small et Small SFX sont optimisés pour des capacités de calcul plus faibles, ainsi que pour les appareils edge et grand public.

Stable Audio 2.5

Stable Audio 2.5 reste un modèle de production important dans les pages web et les API, capable de générer de l’audio stéréo à 44,1 kHz sur une durée maximale de 3 minutes, et prenant en charge la génération de texte, le transfert audio en audio ainsi que l’Audio Inpainting. Il améliore la structure musicale, la vitesse et le respect des instructions grâce à un entraînement post-ARC.

Les autorités affirment que, sous certaines conditions de GPU, il est possible de générer 3 minutes d’audio en 2,5 secondes, mais le temps global reste influencé par les files d’attente, le téléchargement, le réseau et le matériel ; il ne doit donc pas être considéré comme un SLA fixe pour tous les comptes.

Génération de musique à partir de texte

L’utilisateur peut indiquer dans les instructions le genre, l’émotion, les instruments, le BPM, le style de production, le contexte d’utilisation et la structure, par exemple une bande originale de film, une scène de combat contre un boss dans un jeu, de la musique publicitaire, un loop de batterie ou une ambiance sonore. Le modèle générera ensuite un audio stéréo selon la durée souhaitée.

Il convient d’utiliser des mots qui décrivent le son, plutôt que de simplement écrire « transformez-le en une certaine musique ». Des instruments spécifiques, des timbres, un rythme, un espace, une époque et une émotion sont généralement plus stables que des instructions abstraites.

Génération d’effets sonores et création de matériel

Stable Audio ne crée pas seulement de la musique, il est également adapté à la création de battements de batterie, de synthétiseurs, d’effets d’environnement, de bruits de pas, de mécanismes, d’impacts, de transitions et d’effets sonores pour le cinéma. Small SFX est conçu spécifiquement pour la génération d’effets sonores côté appareil.

Lorsqu’un cycle sans rupture est nécessaire, il faut préciser le Loop et le rythme dans les indications, puis vérifier la phase début-fin, le volume et le bruit après l’exportation. Les effets générés par l’IA peuvent encore contenir des voix inattendues ou des éléments musicaux indésirables.

Audio-to-Audio

Audio-to-Audio utilise des œuvres Stable Audio téléchargées, enregistrées ou existantes comme références structurelles et de timbre, puis génère une nouvelle version en combinant du texte. Les utilisateurs peuvent ajuster la Intensité de l’audio d’entrée et l’Intensité du prompt pour choisir entre conserver l’audio original et le modifier considérablement.

API recommande de commencer avec une force d’environ 0,8 : plus la valeur est élevée, plus la sortie s’éloigne généralement de l’entrée ; une valeur plus basse conserve davantage la structure originale.

La valeur optimale réelle doit être itérée en fonction des matériaux et des indications.

Chant humain et entrée audio enregistrée

Les utilisateurs peuvent enregistrer des murmures, des sifflements, des instruments ou des sons naturels comme entrée pour générer des accompagnements, différentes versions instrumentales ou des variations de style. Cela convient pour développer rapidement des esquisses musicales en versions audibles.

L’entrée par voix humaine reste une méthode expérimentale, ce qui peut entraîner des variations en termes de justesse, de rythme et de caractéristiques identitaires. Une enregistrement avec une personne réelle nécessite une autorisation, et les appareils Bluetooth peuvent également provoquer des retards dans l’enregistrement depuis le navigateur.

Inpainting audio et extension

L’audio inpainting permet de désigner une position dans l’audio et d’utiliser le contexte avant, après, à gauche et à droite pour régénérer ou étendre le reste, ce qui peut servir à réécrire des paragraphes, compléter des fins, corriger les transitions et ajuster la structure.

La génération n’est pas une édition sans perte. Les nouveaux segments peuvent modifier le rythme, l’harmonie et le mixage ; les œuvres officielles doivent conserver le fichier d’origine et effectuer une écoute complète avant et après la zone redessinée.

Détection des droits d’auteur audio

Les utilisateurs ne peuvent télécharger que des fichiers audio pour lesquels ils possèdent les droits nécessaires. La plateforme utilise un système de reconnaissance de contenu pour vérifier les fichiers téléchargés ; ceux qui semblent être des éléments protégés par le droit d’auteur appartenant à autrui sont rejetés et supprimés.

Même en cas de refus, la durée du fichier sera tout de même déduite de la limite de téléchargement du mois. Ne testez pas la conversion de style avec des chansons commerciales, et n’allez pas supposer que le fait de pouvoir télécharger signifie que vous avez obtenu l’autorisation.

Le contenu téléchargé sera-t-il utilisé pour l’entraînement ?

Selon les FAQ officielles, les fichiers audio fournis par les utilisateurs ne sont pas inclus dans les données d’entraînement de Stable Audio, mais ne sont utilisés que lors de l’interaction en cours. Cependant, les résultats générés à partir de cette interaction peuvent être utilisés pour améliorer le modèle, tant actuellement que à l’avenir.

Pour la musique non publiée pour les clients, la voix de la marque et les éléments soumis à des accords de confidentialité, il convient de vérifier les conditions les plus récentes. Si une sortie est requise, aucun entraînement n’est permis et cela doit être confirmé par un contrat d’entreprise.

Plan gratuit

Avec Free, il est possible de générer 10 morceaux par mois à l’aide de Stable Audio 2.5, sous licence personnelle, uniquement pour des projets personnels et non commerciaux. Le quota gratuit est renouvelé le 1er de chaque mois, et les générations non utilisées ne sont pas reportées.

Le guide utilisateur actuel mentionne deux durées différentes pour la limite de téléchargement : 6 minutes dans le document et 2 minutes dans les FAQ, tandis que chaque transmission est tronquée à 30 secondes. Il convient de se fier à la valeur affichée sur le compte ; le plan gratuit ne doit pas être utilisé pour une production commerciale officielle.

Comparaison des prix et des versions

Forfait ou versionPrix, plafonds et avantages clés
Prix ProPro coûte actuellement 11,99 dollars par mois et s’adresse aux créateurs individuels ayant besoin d’une licence commerciale. Il offre une licence de créateur et élargit les capacités de génération et de téléchargement audio ; selon les FAQ actuelles, il est possible de télécharger 30 minutes par mois, avec un maximum de 6 minutes par fichier téléchargé. La page des prix ne divulgue pas de manière stable le nombre actuel de générations dans le texte extrait, et la limite historique de 500 chansons peut varier en fonction des coûts du modèle. Avant achat, il convient de se référer au chiffre des générations de pistes affiché en temps réel sur la page de paiement.
Prix StudioStudio coûte actuellement 29,99 dollars par mois et est destiné aux créations personnelles fréquentes, en utilisant la licence Creator. La limite de téléchargement audio par mois est de 60 minutes, avec un maximum de 6 minutes par téléchargement. Studio augmente la capacité de génération et de téléchargement, mais ne confère pas automatiquement de licences aux grandes organisations, de garanties juridiques ou le droit de déploiement local.
Prix MaxActuellement, Max coûte 89,99 dollars par mois et constitue le forfait destiné aux créateurs individuels ayant un fort volume d’utilisation dans les applications web. La limite de téléchargement audio par mois est de 90 minutes, avec une durée maximale de 6 minutes par téléchargement ; pour plus d’espace de stockage, il convient de contacter le service client. Max reste différent d’Enterprise. Les organisations ayant une grande taille d’équipe, des produits destinés aux utilisateurs finaux, un hébergement personnalisé des modèles et un revenu annuel élevé doivent acquérir le forfait entreprise.
Prix de l’API Stability AILa plateforme pour développeurs est facturée en crédits, 1 crédit équivaut à 0,01 dollar, et 25 crédits gratuits sont offerts aux nouveaux comptes. Stable Audio 2.5 génère 20 crédits à chaque génération réussie, soit environ 0,20 dollar ; Stable Audio 3.0 génère 26 crédits à chaque génération réussie, soit environ 0,26 dollar, et aucun frais n’est facturé en cas d’échec. Les tarifs API ne correspondent pas à une licence commerciale complète. Les développeurs doivent également se conformer aux conditions de l’API, à la licence communautaire ou à la licence entreprise, et prendre en compte les coûts de stockage, de transmission, de tentatives répétées et de traitement postérieur.

Prix Pro

Pro coûte actuellement 11,99 dollars par mois et s’adresse aux créateurs individuels ayant besoin d’une licence commerciale. Il offre une licence de créateur et élargit les capacités de génération et de téléchargement audio.

Selon les FAQ actuelles, il est possible de télécharger 30 minutes par mois, avec une durée maximale de 6 minutes par fichier téléchargé.

La page des prix ne publie pas de manière stable le nombre actuel de générations dans le texte extrait ; la limite de 500 chansons historiques peut varier en fonction des coûts du modèle. Avant achat, il convient de se référer au compteur des générations affiché en temps réel sur la page de paiement.

Prix Studio

Le Studio coûte actuellement 29,99 dollars par mois et est destiné aux créations personnelles fréquentes, en utilisant la licence Creator. La limite de téléchargement audio par mois est de 60 minutes, avec un maximum de 6 minutes par téléchargement.

Studio augmente la capacité de génération et de téléchargement, mais ne confère pas automatiquement d’autorisations aux grandes organisations, de garanties juridiques ou le droit de déploiement local.

Prix Max

Actuellement, Max coûte 89,99 dollars par mois et représente le forfait destiné aux créateurs individuels à fort volume d’utilisation dans les applications web. La limite de téléchargement audio par mois est de 90 minutes, avec une durée maximale de 6 minutes par téléchargement.

Pour plus de capacité, veuillez contacter le support.

Max reste différent d’Enterprise. Les organisations de grande taille, celles qui proposent des produits pour utilisateurs finaux, qui gèrent elles-mêmes leurs modèles et dont le chiffre d’affaires annuel est élevé, doivent acheter en vertu des conditions professionnelles.

Licence d’entreprise Enterprise

Enterprise propose des devis sur demande, permet de déployer les modèles sur des infrastructures propres, et offre des services d’entreprise tels que l’entraînement personnalisé, le support de mise en œuvre, le support continu ainsi que des garanties juridiques. La page des prix invite les entreprises ayant un chiffre d’affaires annuel supérieur à 1 million de dollars et souhaitant déployer sur leurs propres infrastructures à contacter l’équipe.

L’entreprise doit préciser dans le contrat la version du modèle, le matériel, la concurrence en parallèle, les mises à jour, l’entraînement des données, le son de la marque, le SLA de support, les droits de sortie et la portée de l’indemnisation.

Licences Personal, Creator et Enterprise

Personal autorise les projets non commerciaux ; Creator permet aux particuliers d’utiliser l’audio généré pour des projets commerciaux et la sortie de musique.

Enterprise est destiné aux grandes organisations, aux produits à grande échelle, aux applications, aux jeux, au cinéma, à la publicité et aux scénarios à fort nombre d’utilisateurs actifs mensuels.

La licence est déterminée par le niveau du compte au moment de sa création. Selon les FAQ, pour les plans Pro et supérieurs, l’audio généré reste soumis à la même licence, même en cas d’annulation ultérieure ;

La mise à niveau ou la dégradation ne modifie pas automatiquement la licence des œuvres antérieures.

Annulation et remboursement

L’abonnement est géré via Stripe et peut être mis à niveau, downgradé ou annulé à tout moment. La mise à niveau prend effet immédiatement et est facturée en fonction du cycle restant ;

L’annulation réduit immédiatement le plan à Free et fait perdre la quantité de crédits générés ce mois-ci qui n’a pas été utilisée.

Le remboursement est à la discrétion de la plateforme ; il est généralement demandé dans un délai de 48 heures après le prélèvement, lorsque la consommation est inférieure à 2 % du plafond du mois, ou dans des cas particuliers tels que des paiements non autorisés. Les abonnés avec renouvellement automatique doivent annuler avant la date d’émission de la facture.

Prix de l’API Stability AI

La plateforme pour développeurs est facturée en crédits, 1 crédit équivaut à 0,01 dollar, et 25 crédits gratuits sont offerts aux nouveaux comptes. Stable Audio 2.5 génère 20 crédits par génération réussie, soit environ 0,20 dollar.

Stable Audio 3.0 génère 26 crédits à chaque génération réussie, soit environ 0,26 dollar ; aucun frais n’est facturé en cas d’échec.

Les tarifs API ne constituent pas un critère pour déterminer une licence commerciale complète. Les développeurs doivent également se conformer aux conditions de l’API, à la licence communautaire ou à la licence entreprise, et prendre en compte les coûts de stockage, de transmission, de tentative de réessai et de traitement ultérieur.

Mode d’appel API

Text-to-Audio peut retourner directement de l’audio ou en format Base64. Stable Audio 3.0 Audio-to-Audio utilise un processus asynchrone : après soumission, un ID de génération est retourné, puis il faut pollinger l’endpoint des résultats ;

La taille maximale du fichier à télécharger est d’environ 100 MB.

La clé API doit être stockée du côté serveur. En environnement de production, il convient de limiter le téléchargement par les utilisateurs, de valider les types de fichiers, de gérer l’état 202 et les délais d’expiration, ainsi que de conserver les paramètres de génération et la version de la licence.

Stable Audio 3 poids ouverts

Stable Audio 3.0 Small, Small SFX et Medium offrent des poids téléchargeables, tandis que Large est principalement utilisé via l’API Stability AI et Enterprise self-hosted. Les poids ouverts permettent aux développeurs d’étudier, de raisonner et de créer des workflows locaux.

Les poids sont soumis à la Stability AI Community License, et ne font pas partie du domaine public inconditionnel. L’utilisation par des particuliers, à des fins de recherche, ainsi que par des entreprises répondant aux critères de revenu est autorisée conformément à cette licence ;

Les organisations qui dépassent les limites autorisées ont besoin d’une licence Enterprise.

Stable Audio Open 1.0

La première version de Stable Audio Open 1.0 convient à la génération de beats, de riffs, d’éléments sonores d’ambiance et de production d’une durée maximale d’environ 47 secondes, en s’appuyant sur des données d’entraînement issues d’audios Creative Commons provenant de Freesound et du Free Music Archive. Elle n’a pas pour objectif principal de créer des chansons complètes longues ou des voix hyper-réalistes.

Les poids de son modèle sont également soumis à la Stability AI Community License. Ses sources d’entraînement et ses capacités diffèrent de ceux des modèles pour sites web commerciaux de la série AudioSparx 2.x, 3.0, et ne doivent pas être confondus.

Code GitHub et licences

Le dépôt officiel stable-audio-tools fournit des outils d’entraînement et de déduction pour la génération audio conditionnée, dont le code est licencié sous la licence MIT ; le dépôt stable-audio-3 met également à disposition le code source ainsi que des instructions d’utilisation du modèle.

Le MIT du code n’est pas équivalent au MIT de tous les poids du modèle. Les poids du modèle, les sorties et l’échelle commerciale restent soumis à la licence Community ou Enterprise ; il est nécessaire de vérifier simultanément les licences du code et du modèle avant le déploiement.

Données d’entraînement

Les versions initiales 1.0 et 2.0 du site web Stable Audio utilisaient des musiques autorisées par AudioSparx pour l’entraînement, et permettaient aux artistes concernés de choisir de se retirer ; la série 3.0 utilise des licences complètes ainsi que des données Creative Commons.

Stability AI collabore également avec d’autres partenaires de données pour étendre les modèles.

Les « données d’autorisation » peuvent améliorer la conformité des sources, mais ne garantissent pas que le résultat ne sera jamais similaire à des œuvres existantes. Une distribution commerciale nécessite encore des vérifications de similarité, des écoutes manuelles et une vérification des politiques de la plateforme.

Guide d'utilisation de Stable Audio

Terminer une tâche de base

  1. Vérifier l’enregistrement, le son, la musique et l’autorisation des participants ;
  2. Téléchargez ou saisissez un audio clair dans Stable Audio ;
  3. Sélectionnez la langue, le locuteur et les paramètres de traitement tels que Stable Audio 3.0 ;
  4. Utiliser Stable Audio 2.5 pour générer des transcriptions, des doublages ou des résultats de nettoyage ;
  5. Vérifier par segment le nom, les chiffres, les pauses, le volume et l’émotion ;
  6. Vérifiez le format, le niveau de loudness, les droits d’auteur et les exigences de confidentialité avant d’exporter ;

Créer des flux de travail professionnels réutilisables

  1. Créer un ensemble de test avec du bruit réel, des accents et des extraits multiples ;
  2. Comparer les différences de traitement entre Stable Audio 3.0, Stable Audio 2.5 et la génération de musique à partir de texte ;
  3. Conserver l’enregistrement original et la transcription non modifiée ;
  4. Organiser une audition par un humain avant la publication externe ;
  5. Statistiques sur la durée de traitement, le taux d’erreurs et la consommation de crédit ;
  6. Mettre à jour régulièrement le glossaire, les autorisations sonores et la politique de suppression ;

À qui s’adresse-t-il ?

  • Créateurs individuels qui produisent de la musique pour des publicités, des vidéos courtes, des jeux et des podcasts ;
  • Des concepteurs sonores nécessaires pour l’environnement, les effets sonores, les boucles et les matériaux de production ;
  • Musiciens générés à l’aide de murmures, d’instruments et de stems existants ;
  • Développeurs qui génèrent en masse de la musique et des effets sonores via une API ;
  • Équipes techniques souhaitant télécharger des poids ouverts, de l’inférence locale ou un ton de marque personnalisé.

Avantages du produit

  • Stable Audio 3 peut générer une musique complète d’environ 6 minutes au maximum ;
  • Couvrant Text-to-Audio, Audio-to-Audio, Inpainting et extensions ;
  • Les données d’entraînement proviennent principalement de sources autorisées et Creative Commons ;
  • Offre Web, API, poids ouverts et hébergement self-hosté pour les entreprises ;
  • Small SFX prend en charge la génération d’effets sonores côté appareil ;
  • La génération de contenu avec un plan personnel payant permet d’obtenir une licence commerciale Creator.

Restrictions et précautions

  • Free ne peut être utilisé qu’à des fins non commerciales ; les projets commerciaux nécessitent Pro ou une version supérieure, ou Enterprise.
  • L’audio à entrer doit être licencié ; les téléchargements rejetés par le détecteur de droits d’auteur continueront de consommer la limite mensuelle de téléchargements.
  • Le nombre de générations de pages et les minutes de téléchargement peuvent varier en fonction des ajustements du modèle ; le solde inutilisé n’est pas reporté.
  • Le poids d’ouverture utilise CommunityLicense, le code MIT ne signifie pas que le modèle peut être utilisé à des fins commerciales sans restriction ;

Questions fréquentes

Stable Audio est-il gratuit ?

Il existe un forfait gratuit offrant 10 génération de Stable Audio 2.5 par mois, uniquement à usage personnel et non commercial. Les nouveaux comptes API bénéficient en plus de 25 crédits gratuits.

Combien coûte Stable Audio ?

Pro : 11,99 dollars par mois, Studio : 29,99 dollars par mois, Max : 89,99 dollars par mois ; version Enterprise sur mesure.

API 2.5 : environ 0,20 dollar par appel, 3.0 : environ 0,26 dollar par appel.

Quelle longueur de musique peut être générée ?

Stable Audio 2.5 dure jusqu’à environ 3 minutes, Stable Audio 3.0 jusqu’à environ 6 minutes ; les limites de durée varient selon le modèle et l’entrée spécifique.

Peut-on l’utiliser à des fins commerciales ?

Les créateurs individuels Pro, Studio et Max peuvent être utilisés à des fins commerciales sous la licence Creator, tandis que les organisations et les produits à grande échelle doivent vérifier la licence Enterprise. La version Free ne peut pas être utilisée à des fins commerciales.

Stable Audio est-il open source ?

Ouverture partielle. Le code de stable-audio-tools est sous licence MIT, avec des poids d’ouverture 3.0 Small, Small SFX et Medium, mais l’utilisation des modèles est soumise à la Stability AI Community License ;

Large est principalement utilisé via API et Enterprise.

©️Droit d’auteur : Sauf indication contraire, tous les articles de ce site sont protégés par le droit d’auteur.Partage d’outils d’IATous les droits d’auteur sont réservés. Sans autorisation, aucune personne, média, site web ou groupe ne peut reproduire, copier ou diffuser de quelque manière que ce soit le contenu de ce site, ni créer de mirror sur des serveurs qui ne lui appartiennent pas. Dans le cas contraire, notre site se réserve le droit de poursuivre en justice les responsables conformément à la loi.

Outils similaires à Stable Audio