Voice.ai
Plateforme offrant un changement de voix en temps réel, une génération de sons et des outils de synthèse vocale
Étiquettes :Outils audio IAQu’est-ce que Voice.ai ?
Voice.ai est une plateforme d’IA pour la création vocale et le changement de voix en temps réel, comprenant un transformateur de voix desktop, un texte à la parole en ligne, du clonage de voix, des Voice Agents et des outils de traitement audio. Les utilisateurs peuvent modifier en temps réel le son de leur micro dans les jeux, les streams et les réunions, générer de l’audio à partir de texte, créer des modèles de voix autorisés, ou mettre en place des agents vocaux capables d’effectuer des appels.
Voice.ai propose actuellement une large gamme de produits : sous la même marque, on trouve des clients desktop pour Windows et Mac, ainsi que des plateformes web et des services mobiles. Auparavant, les abonnements et crédits des différents clients n’étaient pas compatibles ; avant d’acheter, il convient de vérifier sur la page de paiement s’il s’agit d’une « application desktop » ou d’une « plateforme TTS/Agent en ligne », et de ne pas supposer automatiquement qu’un abonnement obtenu via une plateforme peut être utilisé sur toutes les autres.
Fonctionnalités clés de Voice.ai
Modificateur de voix IA en temps réel
Le client desktop utilise Voice.ai comme micro virtuel, permettant d’envoyer en temps réel un son converti dans Discord, Zoom, les communications vocales en jeu, les logiciels de diffusion en direct et d’autres applications utilisant le micro. La conversion voix en voix conserve le rythme et une partie de l’émotion du locuteur d’origine, ce qui est plus naturel que simplement changer la hauteur du son, mais les résultats dépendent de la carte graphique, des délais de traitement, du micro et du réseau.
Mode enregistrement et changement de voix en ligne
En plus du mode en temps réel, il est également possible de télécharger ou d’enregistrer de courtes séquences audio pour les convertir ensuite en timbre cible. Le mode d’enregistrement convient aux messages vocaux, aux dialogues vidéo et aux contenus nécessitant une retouche précise.
L’audio d’entrée doit être enregistré par une seule personne, clair, sans réverbération ni musique de fond ; après sortie, vérifier les pics de volume, les hachures et les déviations de timbre.
Instant Voice Cloning
Les forfaits payants offrent un nombre différent de slots de clonage vocal instantané en fonction du niveau : Starter avec 5, Launch avec 10, Core avec 50, Scale avec 200, et Business avec 2 200.
Le client desktop dispose également de règles de modélisation Pro et Premium ; créer un son en mode Premium peut coûter 15 000 crédits, et ces crédits ne doivent pas être confondus avec les slots du forfait web.
Synthèse vocale et TTS Studio
Le TTS en ligne permet de choisir une voix et de générer de l’audio à partir de texte. Gratuit : jusqu’à 500 caractères par utilisation, sans possibilité de téléchargement ;
Le plafond pour la première commande de Starter est porté à 5 000 caractères, y compris le téléchargement de fichiers, la licence commerciale et TTS Studio.
Le forfait supérieur augmente la génération simultanée et les crédits mensuels, idéal pour les sous-titres en masse, les podcasts et la publication de contenu.
AI Voice Agents
La Plateforme d’agents vocaux permet de créer des agents intelligents vocaux pour le conseil, les rendez-vous, la collecte de leads ou le service client, et de configurer des numéros de téléphone ainsi que des appels en parallèle. Les forfaits vont de 1 numéro de téléphone et 2 appels en parallèle jusqu’à 50 numéros et 30 appels en parallèle.
Le déploiement en production nécessite également la conception d’une base de connaissances, l’appel d’outils, le transfert à un agent humain, les notifications par enregistrement audio et le traitement des échecs.
Outils audio en ligne
La plateforme intègre des outils tels que Audio Enhancer, Vocal Remover, Echo Remover, Stem Splitter, Key/BPM Finder et Reverb Remover. Les différentes options imposent des limites sur la durée d’un fichier à la fois, et le taux de conversion des crédits diffère également.
La séparation des voix ou le renforcement du son peuvent générer des artefacts ; les pistes master professionnelles, forensiques et liées aux droits d’auteur ne doivent pas se fier uniquement à des résultats automatisés.
Prix des forfaits Voice.ai pour particuliers et créateurs
Voici les prix en dollars américains mensuels actuels et les avantages affichés sur la page des prix officiels pour le mois en cours. Launch propose une remise de 50 % pour le premier mois ; le montant normal de renouvellement est de 24 dollars.
La promotion peut se terminer à tout moment.
La page de paiement annuel indique une exemption d’environ 2 mois ; le montant final, les taxes et le prix de renouvellement sont indiqués sur la page de règlement.
| forfait | Prix mensuel | Crédits/mois | Clonage de voix | TTS / Agent et concurrence |
|---|---|---|---|---|
| Free | 0 dollar | 5,000 | Sans Instant Clone | Environ 5 minutes de TTS ; Agent de base et outils audio ; 500 caractères par séance de TTS |
| Starter | 5 dollars | 15,000 | 5 | Environ 15 minutes pour TTS ou Agent ; 3 flux TTS, 2 flux Agent en parallèle ; 1 numéro |
| Launch | Tarif normal : 24 dollars ; promotion pour le premier mois : 12 dollars | 200,000 | 10 | Environ 200 minutes pour TTS ou Agent ; 5 canaux TTS, 4 canaux Agent en parallèle ; 3 numéros |
| Core | 99 dollars | 1,000,000 | 50 | Environ 1 000 minutes de TTS ou d’Agent ; 10 flux de TTS, 8 flux d’Agent en parallèle ; 10 numéros |
Prix des forfaits pour entreprises et à grande échelle de Voice.ai
| forfait | Prix mensuel | Crédits/mois | Clonage de voix | Part principal du capital |
|---|---|---|---|---|
| Scale | 330 dollars | 4,000,000 | 200 | 15 TTS en parallèle, 16 agents en parallèle, 20 numéros, priorité de génération plus élevée |
| Business | 880 dollars | 22,000,000 | 2 200 | 15 TTS en parallèle, 30 agents en parallèle, 50 numéros, Technical Success Manager |
| Enterprise | Cotation sur mesure | Personnalisation | Plus de sièges et de voix | DPA/SLA, BAA HIPAA pour les clients, SSO personnalisé, remises pour la concurrence et l’échelle |
Combien de temps peut-on utiliser les crédits
Les crédits unifiés peuvent être utilisés pour le TTS, les Voice Agents ou les outils audio, mais le taux de conversion varie en fonction des fonctionnalités. Le centre d’aide officiel indique que les crédits reçus ne expirent pas.
La méthode de report spécifique pour le montant mensuel fourni dans le cadre de l’abonnement reste soumise à ce qui est affiché sur le compte et aux conditions de l’abonnement.
| forfait | TTS approximativement disponible | Agents vocaux disponibles approximativement | Outils audio environ disponibles | Durée d’une seule utilisation de l’outil audio |
|---|---|---|---|---|
| Free | 5 minutes | Selon les règles de essai de base | Environ 3 fois | 5 minutes |
| Starter | 15 minutes | 15 minutes | 500 minutes | 10 minutes |
| Launch | 200 minutes | 200 minutes | 3 000 minutes | 20 minutes |
| Core | 1 000 minutes | 1 000 minutes | 15 000 minutes | 60 minutes |
| Scale | 4 000 minutes | 4 000 minutes | 50 000 minutes | 180 minutes |
| Business | 22 000 minutes | 22 000 minutes | 150 000 minutes | Selon les règles au niveau entreprise |
Les minutes indiquées dans le tableau représentent la valeur théorique lorsque l’ensemble des crédits d’une tranche est utilisé pour une seule fonction ; il n’est pas possible d’obtenir simultanément trois ensembles complets de minutes. Launch prend en charge depuis lors la facturation basée sur l’utilisation ; le tarif par excès n’est pas clairement indiqué sur la carte publique, et il est nécessaire de définir un budget et des alertes avant son activation.
Comment choisir entre les différentes versions des plateformes
| Version | Utilisation principale | Mode de fonctionnement | Vérifier avant d’acheter |
|---|---|---|---|
| Client Windows | Changement de voix en temps réel, enregistrement, jeux et diffusion en direct | Client local et micro virtuel | Performances de la carte graphique, règles Pro/Premium pour les postes de travail et crédits |
| Client Mac | Changement de voix en temps réel et Soundboard | Application de bureau compatible avec les chipsets Apple | Version actuelle du système, compatibilité des applications et canaux d’abonnement |
| Plateforme web | TTS, clonage de voix, Voice Agents, modification de voix en ligne et outils audio | Navigateur et traitement cloud | Forfait unifié, droits de téléchargement, licence commerciale et facturation par utilisation |
| iOS / Android | Création vocale mobile et outils associés | Application ou page web mobile | Les achats intégrés dans la boutique d’applications sont-ils compatibles avec le compte en ligne ? |
| SDK / API | Intégrer le TTS et les agents vocaux dans les produits | Serveur, Web SDK et plugins d’intégration | Clés, concurrence, crédits, frais de téléphone et conditions commerciales |
Tutoriel en temps réel pour changer de voix avec Voice.ai
- Vérifier le matériel :Vérifiez que le système d’exploitation, la carte graphique et le micro répondent aux exigences actuelles du client, et désactivez les plugins de réduction de bruit inutiles.
- Installer le client :Téléchargez depuis la plateforme officielle, connectez-vous à votre compte et autorisez la création d’un dispositif audio virtuel.
- Sélectionner l’entrée :Définissez le micro réel comme entrée pour Voice.ai, et dans l’application cible, définissez le micro virtuel Voice.ai comme source de sortie.
- Sélection du timbre :Utilisez d’abord des voix officielles ou personnelles disposant d’une autorisation claire, afin d’éviter que des personnalités publiques ne imitent le timbre de voix.
- Ajuster la qualité :Équilibrer le retard, l’utilisation de la GPU et la qualité du son, en utilisant des écouteurs pour éviter les échos.
- Test local :Enregistrez un message vocal, vérifiez les coupures, le bruit, le volume et le retard, puis commencez la diffusion en direct ou la réunion.
- Préciser volontairement :Indiquer clairement l’utilisation de techniques de modification de la voix dans les communications susceptibles de prêter à confusion quant à l’identité.
Tutoriel de clonage de voix et autorisation
- Préparez uniquement votre propre voix ou un échantillon de voix avec autorisation écrite, en précisant l’usage, la région, la durée et la manière de le retirer.
- Enregistrer un audio en solo, sans musique, sans réverbération et avec une prononciation naturelle, dans un environnement calme.
- Choisissez entre la méthode de clonage instantané du site web ou le mode de modélisation sur bureau, et vérifiez d’abord si cela consomme des slots ou des crédits.
- Après création, tester la similarité, la prononciation et la stabilité à l’aide de textes courts sans contenu sensible.
- Rendre les voix privées privées, restreindre les droits d’équipe, et autoriser la suppression immédiate du modèle après la fin de l’autorisation.
Il est interdit de cloner la voix d’autrui sans autorisation, en particulier pour créer des instructions politiques, journalistiques ou financières falsifiées, du contenu pornographique ou des voix d’authentification. Même si le modèle provient d’une bibliothèque communautaire, cela ne signifie pas que l’uploader dispose d’une autorisation légale ; toute utilisation commerciale doit faire appel à des voix dont l’origine est prouvée.
Agents vocaux et outils de développement
L’organisation officielle GitHub a rendu publics le Web SDK, les nœuds n8n, les plugins LiveKit ainsi que du code d’exemple, pouvant être utilisés pour des agents vocaux sur page web, du TTS et l’intégration d’automatisation. La publication du SDK ne signifie pas que les modèles Voice.ai et la plateforme cloud soient open source ; leur fonctionnement dépend toujours des services officiels, des comptes et des crédits.
Lors du développement, il convient de distinguer les paramètres configurables publiquement côté client des clés serveur, de vérifier la signature du Webhook, et de définir des limites pour la concurrence, la durée maximale et les coûts des appels. Lors du traitement des appels des clients, il faut se conformer aux règlements locaux concernant l’enregistrement, la vie privée, les appels commerciaux et la divulgation d’informations liées à l’IA.
Les scénarios médicaux ne peuvent être évalués selon les exigences de conformité qu’après l’entrée en vigueur des contrats d’entreprise et des BAA correspondants.
Est-ce open source
Le modèle de modification de voix en temps réel au cœur de Voice.ai, le service TTS, la plateforme de voix et les Voice Agents ne sont pas des produits open source. Une version partiellement open source ou des exemples d’intégration avec le code source sont fournis officiellement pour faciliter la connexion aux services cloud, mais ils ne permettent pas de déployer une plateforme complète en mode hors ligne.
À qui s’adresse-t-il
- Utilisateurs ayant besoin d’une modification en temps réel de la voix pour les jeux, les streams et les chats vocaux ;
- Créateurs de voix off pour vidéos, podcasts et contenus audio ;
- Équipe souhaitant créer des sons autorisés pour une personne ou une marque ;
- Entreprises qui développent des agents pour le service client par téléphone, les rendez-vous et le tri des leads ;
- Développeurs qui se connectent aux services de voix via le Web SDK, n8n ou LiveKit.
Avantages et limites d'utilisation
- L’avantage de Voice.ai est de regrouper la modification en temps réel de la voix, le TTS, le clonage de voix, les agents vocaux et les outils audio sous une même marque, tout en offrant une gamme complète de forfaits allant d’une version d’essai gratuite aux versions professionnelles à forte capacité de traitement.
- Les applications de bureau conviennent aux scénarios interactifs, tandis que les plateformes Web sont adaptées à la production de contenu et à l’intégration métier.
- La limite réside dans le grand nombre de lignes de produits et de canaux d’abonnement, ainsi que dans le fait que les abonnements desktop anciens et les services en ligne ne sont pas forcément compatibles.
- Les effets en temps réel dépendent du matériel, et les crédits varient considérablement d’une fonction à l’autre ;
- La clonage de voix présente des risques évidents en matière d’identité, de portrait, de vie privée et de fraude ; toute sortie nécessite une autorisation, une identification et une vérification manuelle.
Questions fréquentes
Voice.ai est-il gratuit ?
Le forfait unifié Web dispose d’un niveau gratuit offrant 5 000 crédits par mois, permettant d’essayer le TTS, la modification de la voix en ligne et les outils audio, mais sans clonage instantané de la voix ni téléchargement de TTS. Le client desktop a ses propres règles gratuites et payantes.
Combien coûte Voice.ai Starter ?
Le tarif mensuel officiel actuel est de 5 dollars, comprenant 15 000 crédits, 5 clones de voix instantanés, des téléchargements TTS et une licence commerciale.
Les crédits de Voice.ai expirent-ils ?
Le centre d’aide officiel indique actuellement que les crédits ne expirent pas, mais les avantages liés à l’abonnement mensuel, ainsi que le solde sur différentes plateformes, sont soumis aux conditions du compte.
Une abonnement peut-il être utilisé sur un ordinateur, un site web et un téléphone ?
On ne peut pas supposer que c’est universel. La documentation officielle précise que les abonnements à iOS, aux services en ligne et aux applications PC ne sont pas compatibles entre eux ; il faut vérifier le produit et le canal de compte avant de payer.
Voice.ai est-il open source ?
La plateforme principale n’est pas open source. GitHub officiel a publié le Web SDK, les nœuds n8n et des exemples de code, mais ce ne sont que des outils de développement pour connecter les services.
Numéro d’enregistrement de sécurité publique du Guangxi : 45132202000164