Altered Studio
Studio d’IA pour la conversion de performances sonores, le doublage et le post-traitement
Étiquettes :Outils audio IAQu’est-ce que Altered Studio ?
Altered Studio est une plateforme de contenu vocal basée sur l’IA destinée à la production médiatique, dont la technologie clé est le morphing vocal Speech-to-Speech, qui permet de transformer la voix d’une personne réelle en une autre tout en préservant autant que possible le rythme, les pauses, l’accentuation et l’émotion originaux. Elle est adaptée à l’ADR pour le cinéma et la télévision, aux personnages de jeux vidéo, aux dialogues d’animation, aux publicités, au contenu audio, aux commentaires pédagogiques et à la modification de la voix pour des raisons de confidentialité.
La plateforme peut être utilisée via un navigateur, et des applications de bureau pour Windows et macOS sont également disponibles. La version de bureau permet d’utiliser les ressources de calcul locales pour effectuer des modifications, du changement de voix en temps réel et certaines tâches de clonage de sons locaux ;
Les entreprises peuvent également consulter les options de serveur local, d’API et de plusieurs postes.
Fonctionnalités clés d’Altered Studio
Transformation voix à voix
L’utilisateur enregistre ou importe une performance, puis sélectionne un son cible et un modèle pour générer un nouveau timbre. Le modèle de timbre modifie principalement le timbre physique du son, tout en conservant dans une large mesure l’accent et l’expression de l’interprète ;
Le modèle Clone s’approchera de manière plus évidente du son cible et de son accent ; les directions Performance et Style sont quant à elles utilisées pour un contrôle plus professionnel de la performance.
Par rapport à la conversion texte-voix pure, la déformation vocale permet de conserver l’interprétation spécifique de l’acteur pour ses répliques.
La plateforme déduit les minutes de Voice Morphing en fonction de la durée de l’audio entré. Une fois que le même segment d’entrée a été modifié une première fois, tenter d’autres voix ou paramètres ne consomme généralement pas à nouveau cette portion de quota, ce qui permet de comparer plusieurs personnages, âges, sexes et réglages de hauteur de ton.
Voix modifiée par IA en temps réel
Le Real-Time Voice Morphing permet d’utiliser Altered comme micro virtuel pour les jeux, les chats vocaux ou les visioconférences. Selon la documentation officielle, ce mode privilégie un faible délai de réponse ; il utilise généralement de 1 à 4 cœurs CPU et il est recommandé de l’exécuter sur des ordinateurs disposant de 8 cœurs ou plus.
L’utilisateur peut choisir le modèle de voix et le style de parole, ainsi que régler des paramètres tels que la détection de la voix et l’augmentation automatique du gain.
Le mode en temps réel n’est pas identique au mode de création de médias : le mode en temps réel privilégie la vitesse, tandis que la création de médias hors ligne permet des modèles de meilleure qualité et des ajustements plus précis. Avant la diffusion en direct, il convient de vérifier le facteur temps réel, le buffer, le bruit du micro et les dispositifs d’entrée de l’application cible.
Clonage de voix
Rapid Voice Cloning permet de créer rapidement des clones à partir de quelques secondes de voix propre, destinés à des contenus courts, à des brouillons de personnages et aux corrections ADR. Des clones locaux de meilleure qualité peuvent être générés à l’aide d’enregistrements d’un seul locuteur d’une durée allant de quelques minutes à environ une heure, et entraînés sur la carte graphique du propre utilisateur.
La configuration minimale officielle est un GPU du niveau NVIDIA RTX 2080, avec 12 Go de mémoire vidéo ; on recommande une RTX 3090 ou 4090, avec 24 Go de mémoire vidéo ; la compatibilité exacte doit être vérifiée avec les applications de bureau.
Il est nécessaire d’obtenir l’autorisation de la personne dont provient le son ou du détenteur des droits avant de cloner ce son. Il convient d’éviter la musique, le bruit de fond, le réverbère et d’autres parlants ; il est préférable que le fichier de test soit différent du fichier d’entraînement afin de vérifier si le modèle généralise réellement.
Texte à la voix et voix multilingue
Altered Studio propose des voix professionnelles propres, ainsi que plus de 700 voix tierces provenant de fournisseurs tels qu’Azure, Google, AWS Polly et IBM, couvrant plus de 70 langues et accents. Les utilisateurs peuvent choisir la voix, le style de parole et le rythme pour générer des scripts, ou bien créer d’abord un long texte avec TTS, puis utiliser Speech-to-Speech pour ajuster les répliques clés.
Transcription, traduction, réduction du bruit et édition audio
La plateforme combine la transcription vocale en texte, la traduction de texte, le débruiteur IA, le nettoyeur de voix IA et des effets DSP traditionnels, permettant de couper, d’organiser, de mixer et de traiter en batch au sein du même projet. Les différents services consomment des tokens IA en fonction du nombre de caractères, de secondes ou de minutes ; les tokens ne doivent pas être confondus avec les minutes de morphing vocal dans le même quota.
API et déploiement d’entreprise
Enterprise offre des API, un pool de quotas pour plusieurs utilisateurs, des voix personnalisées, un gestionnaire client dédié et des solutions de protection des données commerciales, ainsi que la possibilité de consulter des serveurs de calcul locaux. Les forfaits standard Creator ou Professional ne comprennent pas d’accès à des API publiques.
Les applications principales, les sons et les modèles d’Altered Studio ne sont pas des logiciels open source, et à la date de vérification, il n’existait pas non plus de répertoire SDK open source officiel représentant un produit complet.
Comparaison des prix et des forfaits d’Altered Studio
Le site officiel affiche les prix par région pour des abonnements mensuels, trimestriels et annuels. Ci-dessous figurent les options en dollars américains pour vérification ; les montants pour les abonnements trimestriels et annuels représentent le prix moyen par mois, et le paiement sera effectué selon la période correspondante.
| forfait | Mensuel / Trimestriel Moyenne mensuelle / Annuel Moyenne mensuelle | Déformation vocale et tokens | Autorisation et capacités principales |
|---|---|---|---|
| Free | 0 dollar | 3 minutes/mois ; 10 000 Tokens | Licence signée, clonage rapide de la voix, voix de base et édition ; mention obligatoire pour les publications non commerciales |
| Creator | 40 / 36 / 30 dollars | 60 minutes/mois ; 325 000 Tokens | Licence de création, clonage de voix locale, modification d’accent et de style de parole |
| Professional | 120 / 108 / 90 dollars | 180 minutes/mois ; 1 000 000 de tokens ; transformation locale illimitée dans toutes les directions | Licence commerciale, Morphing vocal flexible/performant, sortie 48 kHz |
| Enterprise | Contacter le service des ventes | Pas de limites pour les transformations vocales et les personnalisations des tokens | Voix personnalisée, API, plusieurs postes, manager exclusif et protection des données commerciales |
Pour les comptes Creator et Professional, les tokens d’IA non utilisés peuvent être reportés au mois suivant conformément aux règles officielles, mais le nombre de minutes de transformation vocale et la limite de report dépendent de l’interface du compte. Le compte Free utilise une licence d’attribution, ne permettant que des publications non commerciales et exigeant que l’indication « Altered » soit mentionnée.
La licence Creator permet aux particuliers ou aux entreprises de moins de 5 personnes d’utiliser le produit à des fins commerciales, à condition que les revenus ou les financements liés à leurs activités au cours des 12 derniers mois soient inférieurs à 100 000 dollars ; en cas de dépassement de ce seuil ou lorsqu’il est nécessaire des droits commerciaux standard, il convient de choisir Professional ou Enterprise.
Comment déduire les tokens d’IA
| Service | Unité de facturation | Exemple de consommation sur le site officiel |
|---|---|---|
| Texte à la voix | Par caractère | Les fournisseurs courants : 1 Token par caractère ; Google Studio : 8 Tokens par caractère |
| Transcription vocale | Par seconde | Azure 14, avec séparation des locuteurs 19, Google 20 tokens/seconde |
| AI Denoiser | Par seconde | 12 tokens/seconde |
| AI Voice Cleaner | Par minute | 720 tokens/minute |
Les fournisseurs et les coefficients de consommation peuvent être mis à jour ; pour les projets longs, il convient d’estimer le nombre de caractères du script et la durée audio avant le traitement. La transformation vocale Speech-to-Speech utilise une quota de minutes indépendant, calculé en fonction de la durée de l’entrée traitée pour la première fois.
Guide d'utilisation d’Altered Studio
- Sélectionner le mode de travail :L’édition en batch utilise Studio en mode hors ligne, tandis que Real-Time est utilisé pour les réunions ou les jeux où une faible latence est requise.
- Préparer une entrée propre :Enregistrer près du micro pour réduire le bruit ambiant, l’écho, le clipping et les superpositions de plusieurs personnes.
- Importer ou enregistrer une performance :Il faut d’abord mettre en place le rythme, les pauses et l’émotion, puis laisser le modèle modifier le timbre ; cela est généralement plus naturel que de procéder à des corrections ultérieures forcées.
- Sélection du modèle :Pour changer uniquement le timbre, essayez Timbre ; si vous souhaitez vous rapprocher davantage du son ou de l’accent cible, choisissez Clone ou le modèle de style correspondant.
- Paramètres de comparaison :Avec la même entrée, il est possible de continuer à essayer différents sons cibles, âges, sexes, altérations de tonalité et styles, sans consommer à nouveau la quota de première transformation.
- Fin du post-traitement :Utiliser le réduction de bruit, le nettoyage, l’équilibrage et d’autres effets, puis exporter à la fréquence d’échantillonnage requise par le projet.
Guide d'utilisation d’Altered Studio
Créer des flux de travail professionnels réutilisables
- Créer un ensemble de test avec du bruit réel, des accents et des extraits multiples ;
- Comparer les différences de traitement entre la transformation voix à voix, la modification de la voix par l’IA en temps réel et le clonage de la voix ;
- Conserver l’enregistrement original et la transcription non modifiée ;
- Organiser une audition par un humain avant la publication externe ;
- Statistiques sur la durée de traitement, le taux d’erreurs et la consommation de crédit ;
- Mettre à jour régulièrement le glossaire, les autorisations sonores et la politique de suppression ;
À qui s’adresse-t-il
- Équipe de voix pour la création de jeux, d’animations, de films et séries avec ADR et dialogues de personnages ;
- Des doubleurs et des créateurs de contenu qui doivent essayer plusieurs rôles ;
- Studio de création de publicités, d’audiobooks, de cours et de voix off pour le marketing ;
- Utilisateurs qui souhaitent changer leur voix avec un faible délai lors de jeux, de streams ou de réunions ;
- Les organisations qui accordent de l’importance à la clonation des voix locales, au contrôle des données, aux API et aux flux de travail d’entreprise.
Avantages et précautions
- La particularité d’AlteredStudio réside dans le fait qu’il utilise des interprètes réels comme source principale, ce qui permet de préserver le rythme et l’émotion des dialogues, plutôt que de se contenter de faire lire par un TTS à partir de zéro.
- Les deux modes en temps réel et hors ligne de haute qualité, le clonage local, l’édition audio et les TTS multi-fournisseurs le rapprochent également d’une station de travail audio professionnelle ;
- La sortie du modèle peut encore présenter un aspect métallique, des erreurs de prononciation, des déviations d’accent ou une respiration peu naturelle.
- Les modèles locaux de haute qualité exigent des cartes graphiques puissantes, et le mode en temps réel est également influencé par la CPU, les pilotes et la configuration audio virtuelle.
- Lorsque des voix de personnalités publiques, d’acteurs, de clients ou d’employés sont utilisées, une autorisation écrite doit être conservée et l’utilisation synthétique doit être divulguée au public ; il est interdit de créer des contenus frauduleux, des arnaques ou des endossements falsifiés.
Questions fréquentes
Altered Studio est-il gratuit ?
Il existe un forfait gratuit comprenant 3 minutes de modification de la voix par mois et 10 000 tokens. Creator propose également une période d’essai gratuite de 7 jours, sans carte de crédit nécessaire ;
Après la période d’essai, vous pouvez choisir librement de passer à la version ultime.
La déformation de la voix fait-elle retenir des minutes supplémentaires ?
Pour le même segment d’entrée, la quota est généralement déduite uniquement lors de la première morphing en fonction de sa longueur ; par la suite, les essais avec d’autres voix et paramètres ne consomment pas à nouveau ces minutes.
Peut-on l’utiliser à des fins commerciales ?
Free est uniquement une licence d’attribution non commerciale. Creator impose des plafonds en matière de revenus, de financement et de taille d’équipe, tandis que Professional offre une licence commerciale plus complète ;
Les projets commerciaux officiels doivent choisir une solution en fonction de leur taille.
Est-ce que cela prend en charge l’exécution locale ?
Prend en charge les applications de bureau Windows et macOS, et offre une fonction de clonage audio local. Un clonage de haute qualité nécessite une GPU NVIDIA compatible ;
Les entreprises peuvent consulter séparément les serveurs locaux.
Altered Studio est-il open source ?
Pas de code source ouvert. Les applications principales, les modèles audio et les services sont des produits propriétaires, et l’API d’entreprise n’équivaut pas non plus à du code source ouvert.
Numéro d’enregistrement de sécurité publique du Guangxi : 45132202000164