Kits AI
Outils de conversion, de clonage et de création de voix par IA pour musiciens
Étiquettes :Outils audio IAQu’est-ce que Kits AI ?
Kits AI est un studio de voix basé sur l’IA destiné aux chanteurs, producteurs musicaux, paroliers et créateurs audio. Il permet de transformer une voix enregistrée en un autre timbre, d’entraîner des modèles de voix personnalisés, de générer des extraits chantés à partir de texte, et offre également des outils pour les harmonies, les chœurs, la séparation des voix, la réparation, le décomposition en stems et le mastering.
La plateforme souligne que les voix de la Voice Library officielle sont autorisées par les artistes et ont fait l’objet d’un nettoyage en matière de licences commerciales, ce qui les rend adaptées à la création de démos, de jingles, de publicités, de vidéos et de sorties officielles. Cependant, les droits liés à la création de modèles par les utilisateurs eux-mêmes, au téléchargement de chansons et à l’utilisation d’accompagnements tiers doivent encore être vérifiés individuellement.
Changer la voix avec l’IA
Voice Changer convertit les chants ou les enregistrements vocaux téléchargés par l’utilisateur en la voix AI cible, tout en conservant autant que possible la mélodie, le rythme, l’articulation et l’émotion originaux. L’utilisateur peut ajuster le pitch, la portée, le timbre ainsi que des paramètres avancés pour rendre la sortie plus adaptée à la voix cible.
Plus l’entrée est propre, meilleur est généralement le résultat de la conversion. Le réverbère, les fuites d’accompagnement, les harmonies superposées, la distorsion et la compression excessive seront appris ou amplifiés par le modèle.
Bibliothèque de voix pour chanteurs IA autorisés
Kits propose des banques de sons couvrant des styles tels que le pop, le rap, l’électronique et Broadway, pouvant être filtrés par genre, registre vocal et type. Selon les indications officielles, les changementurs de voix inclus dans la banque sont autorisés et peuvent être utilisés sans droits d’auteur dans des projets commerciaux.
« Sans droits d’auteur » ne signifie pas que l’utilisateur possède les modèles de voix ou peut se faire passer pour un artiste en particulier. Il convient de respecter les conditions de chaque page Voice, les termes de la plateforme ainsi que les interdictions de tromperie.
Clonage instantané de la voix
Instant Cloning permet de créer rapidement des sons personnalisés pouvant être testés, idéal pour les démos et l’exploration de directions. Disponible à partir de Starter, il nécessite peu de temps d’entraînement, mais sa qualité en termes de registre vocal, de détails et de stabilité dans les prononciations inhabituelles est généralement inférieure à celle du modèle Professional.
Professional Voice Cloning
Professional Voice Cloning est conçu pour des voix personnalisées de haute fidélité. Les recommandations officielles indiquent de télécharger des fichiers audio bruts d’une durée de 10 à 60 minutes, sans effets, à une seule voix, note par note, couvrant les registres, voyelles, consonnes et dynamiques les plus courants.
Les produits Producer et Professional offrent cette orientation. L’ensemble d’entraînement doit être débarrassé de réverbérations, d’harmonies, d’accompagnements et de corrections d’amplitude excessives ; des données erronées affecteront de manière permanente la qualité du modèle.
Autorisation de formation vocale
L’utilisateur doit posséder les droits sur l’ensemble des données d’entraînement et ne pas cloner la voix d’autrui sans consentement. Lors de la création de modèles pour des chanteurs ou des clients, un contrat écrit doit définir la propriété du modèle, le périmètre du projet, les délais, la rémunération, ainsi que les modalités de retrait et de suppression.
Voice Designer et Voice Blender
Voice Designer permet de créer de nouvelles directions sonores à partir des caractéristiques timbrales, tandis que Voice Blender sert à mixer différentes caractéristiques sonores. Ils conviennent pour trouver des timbres créatifs qui n’imitent pas directement une personne réelle, et peuvent également être enregistrés comme slots de voix personnalisés.
La sortie mixte doit toujours être écoutée sur toute la plage de fréquences, afin d’éviter des ruptures dans les basses, les aigus et les médiums.
Texte en chant
Le générateur de voix convertit les paroles saisies en phrases chantées, idéal pour créer des titres phares, des démos, des échantillons et des idées mélodiques. Une fois la voix souhaitée sélectionnée, il suffit de saisir les paroles pour générer une voix unique.
La conversion de texte en musique ne garantit pas des mélodies complexes, un rythme précis ni une structure complète de chanson. Une production professionnelle nécessite généralement de découper, d’accorder, d’aligner et de mixer dans un DAW.
Text to Speech
Les versions Starter et supérieures offrent la fonction de conversion texte en voix, permettant de faire lire des commentaires par une voix personnalisée ou préexistante. La naturalité des modèles vocaux peut varier pour la parole ordinaire ; pour les podcasts et les commentaires commerciaux, il convient de tester d’abord le rythme, les pauses et la prononciation.
Harmony Generator et Chœur
Le générateur d’harmonie crée des harmonies polyphoniques à partir du chanteur principal, tandis que l’outil Chœur est utilisé pour une superposition de voix plus dense. L’utilisateur peut choisir les intervalles, les timbres et les directions de combinaison afin de créer rapidement des voix de fond.
L’harmonie automatique peut entrer en conflit avec les accords, les modes ou la mélodie. Après l’exportation, il convient de vérifier la hauteur de chaque voix, son déroulement, ainsi que les harmoniques et la phase.
Vocal Remover et Stem Splitter
Vocal Remover permet de séparer la voix et l’accompagnement d’un mix, tandis que Stem Splitter décompose davantage les directions instrumentales. Il est idéal pour obtenir des pistes d’exercice, des matériaux de remix et pour nettoyer les données d’entraînement.
Les résultats de séparation peuvent contenir des résonances, des sons de batterie ou des vides spectraux. Les stems utilisant des enregistrements appartenant à d’autres personnes restent soumis aux droits d’auteur de l’enregistrement original et de l’œuvre.
Vocal Repair – Réparation de la voix
Vocal Repair est utilisé pour améliorer les voix endommagées, bruitées, déformées ou incomplètes, afin de rendre les conversions et mixages ultérieurs plus stables. La réparation devine les informations manquantes et ne peut pas restituer des détails réels qui n’étaient pas présents dans l’enregistrement original.
Traitement du master
Les outils de mastering permettent d’apporter des traitements de loudness, de fréquence et d’équilibre pour le mixage, idéaux pour une prévisualisation rapide ou une démo. Pour une sortie officielle, il convient de vérifier les valeurs LUFS, True Peak, la dynamique, le stéréo, le codage ainsi que les spécifications de chaque plateforme.
Comparaison de forfaits et de prix
| forfait | Prix mensuel | Conversion et téléchargement | Voix et fonctionnalités |
|---|---|---|---|
| Free | 0 dollar | 15 minutes de conversion ; 0 minute de téléchargement | 1 direction Voice ; Voice Designer/Blender ; voix humaine générative ; outils de séparation et de réparation accessibles ; sans clonage |
| Starter | 10 dollars/mois | Conversion illimitée ; 15 minutes de téléchargement/mois | 2 emplacements pour la voix ; modes de clonage vocal Instant et Professional ; paramètres avancés ; chœur et outils complets |
| Producer | 30 dollars/mois | Conversion illimitée ; 60 minutes de téléchargement/mois | Slots vocaux illimités ; clonage professionnel haute fidélité ; inclut toutes les fonctionnalités de Starter |
| Professional | 60 dollars/mois | Pas de limite de conversion ni de minutes de téléchargement, soumis aux principes d’usage équitable | Slots de voix illimités ; outils complets ; destiné aux producteurs et organisations professionnels |
Le site officiel indique actuellement qu’un abonnement annuel peut permettre d’économiser jusqu’à 47 % ; les nouveaux utilisateurs bénéficient de ces tarifs. Les abonnés existants peuvent conserver les prix et avantages de leur abonnement initial, par conséquent, les noms Converter, Creator, Composer ainsi que le montant de 11,99 $ mentionnés dans les anciens blogs ne correspondent pas aux offres actuelles pour les nouveaux utilisateurs.
Différence entre minutes de conversion et minutes de téléchargement
Free limite les essais en fonction des minutes de conversion. Toutes les abonnements payants offrent une durée de conversion illimitée ; le véritable seuil de facturation devient alors le nombre de minutes de téléchargement : seules les minutes passées à télécharger l’audio depuis la plateforme sont comptabilisées.
La conversion illimitée et le téléchargement illimité restent soumis au principe de l’usage équitable et ne doivent pas être interprétés comme une concurrence illimitée, un abus automatisé ou une revente de services.
Télécharger le report de minutes
Les minutes téléchargées sont mises à jour chaque mois, et les minutes non utilisées peuvent être reportées sur le solde du mois suivant ; c’est là une différence importante entre Kits et de nombreuses plateformes qui ne permettent pas ce report des crédits. La page du compte doit afficher le mois en cours ainsi que le solde reporté ; la limite maximale d’accumulation sur le long terme est déterminée par les conditions de l’abonnement.
Qu’est-ce que les Voice Slots ?
Le Voice Slot est le nombre de voix personnalisées que le compte peut enregistrer, y compris celles créées par Voice Cloning, Designer et Blender. Sur la page Free, on observe une différence dans l’affichage des composants entre « 1 direction de Voice » et « 0 Voice Slots », mais les FAQ officiels indiquent que Free peut disposer d’une direction de slot de voix personnalisée ;
Cela dépend réellement du compte.
Son après désabonnement
La fonction de paiement à la livraison peut être utilisée jusqu’à la fin du cycle actuel. Les sons personnalisés ne sont pas supprimés immédiatement, mais ils sont gelés et indisponibles ;
Il peut être restauré après réabonnement.
Si vous souhaitez supprimer définitivement les données d’entraînement, vous devez soumettre une demande de suppression séparée.
Applications de bureau et plateformes Web
Kits propose des solutions pour Web Studio et les applications de bureau, adaptées à l’utilisation dans un navigateur ou sur un ordinateur de création. Lors du traitement de gros fichiers, il convient de conserver l’enregistrement audio brut ainsi que la version exportée, et de ne pas considérer l’historique de la plateforme comme le seul sauvegarde.
Recommandations pour l’entrée audio
- Utiliser un son sec, sans accompagnement et avec le moins de réverbération possible dans la salle ;
- Restez monodique, ne mélangez pas le chanteur principal et les harmonies dans le même fichier d’entraînement ;
- Éviter le clipping, les distorsions sonores, le bruit de réduction excessive et l’Auto-Tune extrême ;
- Couvrir la gamme tonale cible, l’intensité et les prononciations courantes ;
- Vérifier la tonalité de la chanson et la gamme de confort vocale cible avant la conversion ;
- Après l’exportation, vérifiez les grincements, la phase et la justesse dans l’accompagnement complet.
Voice Earn : Monétisation de la voix
Les créateurs peuvent créer un modèle de voix et gagner de l’argent grâce à Kits Earn, permettant ainsi à d’autres utilisateurs de l’utiliser dans le cadre des licences accordées. Avant de participer, il convient de vérifier les parts de revenus, les retraits, l’exclusivité, les utilisations du modèle et l’authentification.
Utilisation commerciale et droits d’auteur
Les sons de la bibliothèque officielle utilisent des données autorisées et sont indiqués comme pouvant être utilisés à des fins commerciales ; les utilisateurs peuvent les employer pour la publication de musique, la publicité et des projets clients. Les mélodies, paroles, enregistrements et sons personnalisés téléchargés par les utilisateurs doivent néanmoins disposer de droits légaux.
La voix générative peut être soumise aux droits personnels locaux, aux droits liés à la voix et aux réglementations sur les médias synthétiques ; des archives d’autorisation et de production doivent être conservées lors de sa publication officielle.
Confidentialité des données
Les données d’entraînement vocal constituent des informations d’identité hautement sensibles. Avant d’entraîner les clients ou les employés, il convient de vérifier l’accès aux fichiers, la visibilité du modèle, les finalités de l’entraînement, la conservation, la suppression et les mesures de sécurité ; il ne faut pas télécharger de démos non autorisées ni divulguer des œuvres.
API et compétences des développeurs
Le site officiel indique qu’il est possible de développer des applications sur les modèles audio Kits, mais la page des prix actuellement publiée cible principalement les abonnements Studio. L’accès à l’API, le tarif par appel, la concurrence et la revente commerciale dépendent des informations fournies via l’espace développeur ou en contactant l’entreprise ; il n’est pas possible de calculer les frais d’API en se basant simplement sur le nombre de minutes téléchargées.
GitHub et l’état open source
Les modèles de conversion de voix, de clonage, de génération de Kits AI ainsi que Web Studio ne sont pas des produits open source. Aucun SDK complet officiel ni aucun dépôt de modèles principaux clairement indiqués sur le site officiel n’a été trouvé lors d’une recherche en temps réel sur GitHub.
Les Kits UI du même nom et les projets tiers ne sont pas liés à cette plateforme audio.
Guide d'utilisation de Kits AI
Terminer une tâche de base
- Déterminer le public cible, la plateforme, l’aspect, la durée et les informations à communiquer ;
- Préparer des scripts, des plans ou des matériaux de référence utilisables dans Kits AI ;
- Sélectionnez le convertisseur de voix AI Voice Changer pour générer une prévisualisation à bas coût ;
- Utiliser la bibliothèque de voix d’artistes IA autorisés pour ajuster l’image, le rythme, les sous-titres et le son ;
- Vérifier frame par frame les personnages, le texte, le logo, la forme des lèvres et l’exactitude factuelle ;
- Exporter selon les spécifications ciblées après confirmation de l’autorisation pour la musique, les portraits et les matériaux ;
Créer des flux de travail professionnels réutilisables
- Créer des scripts, des fiches de tournage, des matériaux de marque et une liste d’éléments interdits ;
- Pour la conversion de voix avec AI Voice Changer, l’autorisation de la bibliothèque de voix des chanteurs IA et le clonage instantané, enregistrement de paramètres unifiés ;
- Testez d’abord le modèle et les limites avec des scènes représentatives ;
- Transférer les plans ratés pour un montage manuel ou une régénération ;
- Unifier les sous-titres, le volume, les couleurs et les informations de droits d’auteur en fin de film ;
- Enregistrez la version et l’auditeur avant de publier en masse ;
À qui s’adresse-t-il ?
- Producteur musical qui remplace le timbre vocal du chanteur pour la démo ;
- Chanteurs et créateurs qui entraînent leur propre modèle de voix ;
- Les équipes qui ont besoin d’autorisation pour utiliser la voix d’IA dans des œuvres commerciales ;
- Auteur-compositeur capable de générer rapidement des harmonies, des chœurs et des lignes mélodiques principales ;
- Édition audio nécessitant la séparation des voix, la restauration et le décomposition en stems ;
- Artistes qui souhaitent obtenir l’autorisation d’utiliser leur voix et participer aux revenus.
Avantages principaux
- Conçu spécifiquement autour du chant et de la production musicale ;
- La bibliothèque officielle de voix met l’accent sur les données autorisées et les licences commerciales ;
- Fournit en même temps des clonages instantanés et professionnels haute fidélité ;
- Couverture de la conversion, de la génération, de l’harmonisation, de la séparation, de la réparation et du mastering ;
- Le forfait payant ne limite pas les conversions et est facturé en fonction des minutes de téléchargement ;
- Les minutes de téléchargement non utilisées peuvent être reportées.
Restrictions et précautions
- La qualité de la sortie dépend fortement du son sec, de la portée vocale et des données d’entraînement ;
- La séparation et la conversion peuvent provoquer un son métallique, des sifflements, des déviations de hauteur et des fuites d’accompagnement ; une post-production dans un DAW est encore nécessaire pour une sortie officielle.
- La clonage de voix présente des risques en matière d’identité et de droits d’auteur, et nécessite une autorisation ;
- L’utilisation illimitée est soumise à l’usage équitable, et les conditions de l’API ne peuvent pas être directement assimilées à une abonnement Studio ;
Questions fréquentes
Kits AI est-il gratuit ?
Il existe une version gratuite qui offre 15 minutes d’essai de conversion et des outils de base, mais sans minutes téléchargeables, ni fonction de clonage Instant ou Professional.
Combien coûte le Kit AI Starter ?
Actuellement, les nouveaux utilisateurs paient 10 dollars par mois, ce qui inclut un nombre illimité de conversions, 2 Voice Slots et 15 minutes de téléchargement par mois.
Les minutes téléchargées sont-elles reportées ?
Oui, les minutes non utilisées pour le téléchargement peuvent être reportées sur le solde du mois suivant.
Une voix d’IA officielle peut-elle être utilisée à des fins commerciales ?
La bibliothèque de voix officielle est indiquée comme étant autorisée et pouvant être utilisée sans redevance pour des projets commerciaux, mais il convient néanmoins de respecter les conditions spécifiques à chaque voix et à la plateforme.
Combien de matériel est nécessaire pour entraîner une voix de haute qualité ?
Clonage vocal professionnel : 10 à 60 minutes, sans effet, son brut monophonique.
Les kits AI sont-ils open source ?
Pas de code open source ; aucun modèle audio complet officiellement publié, ni code d’entraînement, ni code source du serveur n’a été mis à disposition.
Numéro d’enregistrement de sécurité publique du Guangxi : 45132202000164