WellSaid Labs
Plateforme de voix IA de haute qualité pour la production de contenu d’entreprise
Étiquettes :Outils audio IAQu’est-ce que WellSaid Labs ?
WellSaid Labs est une plateforme d’IA de conversion texte en voix destinée à la formation d’entreprise, aux démonstrations de produits, à la publicité, ainsi qu’aux contenus vidéo et audio. Son produit phare est WellSaid Studio. Les utilisateurs saisissent un texte, choisissent un Voice Avatar, puis ajustent le ton, la hauteur du son, l’émotion, les pauses et la prononciation pour générer et télécharger une voix off professionnelle.
Il met l’accent sur la sécurité de la marque, la collaboration entre entreprises et une base de voix en anglais fiable, plutôt que sur des voix de personnalités publiques téléchargées arbitrairement par la communauté. Le forfait payant offre des droits d’utilisation commerciale, une génération illimitée et un comptage des minutes de téléchargement des produits finis ;
Business et Enterprise ajoutent des espaces d’équipe, une bibliothèque de prononciations partagée, des commentaires, des droits d’accès, une intégration avec Adobe Premiere Pro et des fonctionnalités de sécurité d’entreprise.
Fonctionnalités clés de WellSaid Labs
Bibliothèque de voix Voice Avatar
WellSaid désigne les voix d’IA prédéfinies sous le nom de Voice Avatars. Les abonnements Starter, Pro, Business et Enterprise disposent d’une bibliothèque complète de voix en anglais, tandis que la version d’essai gratuite ne propose que des voix sélectionnées.
Les utilisateurs peuvent écouter des extraits selon le type de contenu, le ton, l’âge suggéré et le style ; les voix et les styles spécifiques évolueront avec les mises à jour de la plateforme.
Ton, hauteur vocale et contrôle émotionnel
Studio offre des contrôles de ton, de hauteur et d’émotion, permettant d’adapter le même texte pour l’enseignement, la publicité, le service client ou la narration. Des ajustements excessifs peuvent rendre la voix artificielle ; il est conseillé de générer plusieurs enregistrements avec des phrases courtes, puis de combiner les extraits satisfaisants en un projet, plutôt que de générer tout le texte d’un coup avant de l’examiner.
Personnalisation de la prononciation et Suggestions intelligentes
Pour les noms de marques, les noms de personnes, les abréviations, les chiffres et les mots d’origine étrangère, l’utilisateur peut effectuer des corrections par substitution phonétique, reformulation ou pauses. L’intégration des Suggestions Smart avec le dictionnaire permet de trouver des prononciations plus appropriées, et la fonction de partage de bibliothèque de prononciations au sein d’une équipe assure la cohérence des termes de marque entre différents projets et membres.
Projets, fragments et réessais infinis
Le forfait payant permet une génération illimitée ; la quantité réelle est principalement mesurée en fonction des minutes d’audio final téléchargées. Les utilisateurs peuvent générer à plusieurs reprises des prises de son, et supprimer les extraits téléchargés non nécessaires pour libérer l’espace correspondant conformément aux règles d’aide.
Jusqu’à 10 projets pour Starter, pas de limite pour Pro et les versions supérieures.
Sous-titres et exportation en plusieurs formats
Le forfait payant permet de télécharger des fichiers de sous-titres, et les formats audio ainsi que la fréquence d’échantillonnage varient en fonction du plan choisi. Le Starter utilise principalement MP3 à 24 kHz ;
Pro prend en charge le TXT et jusqu’à 48 kHz ; Business et Enterprise prennent en charge MP3, WAV, OGG, TXT, avec Enterprise atteignant jusqu’à 96 kHz.
Les sous-titres SRT et VTT doivent encore être vérifiés pour la timeline et la ponctuation.
Collaboration d’équipe
Business et Enterprise prennent en charge la collaboration en équipe, permettant de travailler ensemble sur de grands projets dans un espace d’équipe, avec des banques de sons partagées, des commentaires, la possibilité de marquer des sons comme favoris et un contrôle des permissions. Business permet d’acheter jusqu’à 5 licences, tandis que le nombre de licences Enterprise est déterminé selon le contrat.
Intégration d’Adobe avec les API
La version Pro inclut Adobe Express, tandis que les versions Business et Enterprise ajoutent une intégration avec Adobe Premiere Pro. Lorsqu’il est nécessaire de synthétiser dynamiquement de la voix dans un produit ou un processus automatisé, l’API WellSaid peut être utilisée séparément.
Les forfaits API, la concurrence, les modèles et la consommation sont déterminés selon la page des développeurs en vigueur ou l’accord commercial ; les minutes de téléchargement depuis Studio ne doivent pas être considérées comme un solde API.
Comparaison des prix des forfaits personnels WellSaid
Voici les prix en dollars affichés actuellement sur le site officiel pour les nouveaux clients. Les prix pour Creative, Team, etc., mentionnés dans les anciens articles d’aide pourraient correspondre à des forfaits antérieurs ; les avantages réservés aux anciens clients pourraient être maintenus.
Lors de l’achat, il convient de se référer aux options visibles sur la page de paiement actuelle et dans le compte.
| forfait | Prix mensuel | Prix annuel | Minutes de téléchargement | Projets et principaux intérêts |
|---|---|---|---|---|
| Trial | 0 dollar | Pas de carte de crédit nécessaire | 3 minutes par mois ; sans droits commerciaux | 3 projets, sons sélectionnés, génération en 10 minutes, MP3, 24 kHz |
| Starter | 19 $/mois | 120 dollars/an, soit 10 dollars/mois | 20 minutes/mois ou 240 minutes/an en paiement annuel | 10 projets, voix entièrement en anglais, droits commerciaux, sous-titres, minutes supplémentaires disponibles à l’achat |
| Pro | 49 dollars/mois | 396 dollars/an, soit 33 dollars/mois | 180 minutes/mois ou 2 160 minutes/an en paiement annuel | Projets illimités, 48 kHz, Adobe Express, fonctionnalités avancées et minutes supplémentaires |
Comparaison des prix des forfaits entreprises et de l’équipe WellSaid
| forfait | Prix | Minutes de téléchargement | Siège | Principale différence |
|---|---|---|---|---|
| Business | 1 920 dollars par an/utilisateur, soit 160 dollars par mois/utilisateur | 2 880 minutes par utilisateur/an | De 1 à 5 places payantes, des collaborateurs possibles | Espace d’équipe, commentaires, partage de prononciation, WAV/OGG, Premiere Pro, chat en temps réel et factures |
| Enterprise | Tarif sur mesure, paiement annuel | Sur mesure pour l’utilisateur | Personnalisation | Plus de langues, traduction, SSO, contrôles de sécurité, 96 kHz, espaces de travail personnalisés, analyse et support exclusif |
| API | Par développeur ou par solution commerciale | Selon la consommation API | Conformément au contrat | Synthèse automatique dans les applications et workflows, sans téléchargement via Studio |
Le plan individuel annuel fournit un certain nombre de minutes de téléchargement pour toute l’année, tandis que le plan mensuel est renouvelé chaque mois. Selon les informations sur le site officiel, il est possible d’acheter des minutes supplémentaires directement dans Studio, mais le prix unitaire exact et la possibilité de transférer les minutes non utilisées doivent être vérifiés sur la page de solde du compte.
Tous les forfaits payants permettent de générer des fichiers de manière illimitée ; le coût porte sur le téléchargement final de l’audio, et non sur chaque écoute ou reprise.
Différences de fonctionnalités des forfaits
| Fonctionnalité | Trial | Starter | Pro | Business / Enterprise |
|---|---|---|---|---|
| Droit d’usage commercial | Aucun | Oui | Oui | Oui, selon le contrat. |
| Bibliothèque audio anglaise complète | Sélectionnés | Oui | Oui | Oui |
| Sous-titres SRT/VTT | Sans | Contient | Contient | Contient |
| Espace de travail d’équipe | Aucun | Aucun | Aucun | Business commence à fournir |
| Intégration Adobe | Aucun | Aucun | Express | Premiere Pro et Express |
| Plus de langues et de traductions | Aucun | Aucun | Aucun | Enterprise |
| Entraînement sur les données des clients | Non utilisé pour l’entraînement | Non utilisé pour l’entraînement | Non utilisé pour l’entraînement | Non utilisé pour l’entraînement |
Guide d’utilisation de WellSaid Studio
- Mettre en forme le document :Transformer le texte écrit en phrases courtes adaptées à la lecture à voix haute, et unifier les chiffres, abréviations, unités et noms de marques.
- Nouveau projet :Créez des projets par cours, vidéo ou chapitre ; les utilisateurs Starter doivent noter que la limite est de 10 projets.
- Écouter l’audio :Écoutez plusieurs Voice Avatars avec le même texte type, et ne vous contentez pas d’écouter les phrases de démonstration officielles.
- Génération par segments :Créez des clips par phrase ou par court paragraphe pour faciliter les remplacements locaux, la combinaison de dialogues et le contrôle du rythme.
- Correction de la prononciation :Utiliser la réécriture, le remplacement, les pauses et les Smart Suggestions pour gérer les noms propres.
- Ajuster l’expression :Modifier légèrement le ton, la hauteur et l’émotion, et utiliser des écouteurs pour vérifier la naturalité et la cohérence.
- Produit assemblé :Sélectionner les takes satisfaisants et les fusionner, supprimer les fragments inutiles pour organiser les projets et éventuellement libérer de l’espace d’utilisation.
- Télécharger et exporter :Vérifiez les minutes de produit fini à déduire, puis sélectionnez le format, la fréquence d’échantillonnage et les sous-titres pris en charge par le forfait.
Comment réduire le gaspillage de minutes de téléchargement
- Terminez d’abord toutes les écoutes et la correction du texte avant de télécharger, car la génération est généralement illimitée dans le plan payant.
- Diviser le texte long en paragraphes réutilisables, ne reprendre que les parties erronées ;
- Une fois l’avatar vocal final et la prononciation déterminés, exporter la version à haute fréquence d’échantillonnage ;
- Créer une liste de prononciation unifiée pour les noms de marque, à partager par l’équipe et à mettre à jour régulièrement ;
- Enregistrez le script final, les noms des sons et les paramètres, afin d’éviter que les versions ultérieures ne puissent être reproduites.
Dialogue et doublage multi-voix
Lors de la création des dialogues, il est possible d’utiliser différents Voice Avatars pour enregistrer les répliques de chaque personnage, puis de les combiner dans l’ordre à l’aide de l’outil Combine. Il convient d’unifier le volume, les pauses et l’impression d’espace, afin d’éviter que chaque personnage ne semble provenir d’un environnement d’enregistrement différent.
Les représentations théâtrales complexes peuvent encore nécessiter des doublages en direct ou un travail d’ingénierie audio post-production.
Points clés d'utilisation de l’API WellSaid
L’API peut générer de la voix à partir de modèles et d’avatars vocaux depuis un programme, et prend en charge le contrôle XML via AI Director, par exemple pour le tempo, les pauses, le volume, la hauteur tonale et la réépellisation. Les développeurs doivent utiliser des clés serveur pour limiter la longueur des requêtes, la concurrence et le budget, mettre en cache des scripts fixes et enregistrer chaque version du modèle, de la voix et du texte générée.
Les abonnements Studio et l’API sont des produits distincts ; les quotas ne peuvent pas être partagés par défaut. Les services externes doivent également gérer les délais d’expiration, les tentatives de réessai, la modération du contenu, le stockage audio, l’autorisation des utilisateurs et les textes sensibles dans les journaux.
Le code d’exemple API ne sert qu’à se connecter à des services commerciaux et ne peut pas exécuter les modèles principaux hors ligne.
Utilisation commerciale et sécurité des données
L’audio généré par Trial n’est pas destiné à un usage commercial. Les forfaits Starter et supérieurs incluent une option pour un usage commercial, mais il faut tout de même respecter les conditions du service et les restrictions relatives au contenu. L’utilisateur doit disposer des droits nécessaires pour fournir du texte, de la musique, des images et des éléments de marque, et ne pas utiliser de voix synthétique pour induire en erreur le public ou enfreindre les droits de tiers.
La page de comparaison des prix sur le site officiel indique clairement que les données des clients ne seront pas utilisées pour entraîner les modèles. Enterprise ajoute SSO, des contrôles de sécurité, des rapports SOC 2, des conditions personnalisables et une modération du contenu ;
Pour déterminer si les exigences réglementaires spécifiques à un secteur sont remplies, il est nécessaire d’évaluer en fonction du flux de données réel et des contrats signés, et non de se fier uniquement aux affirmations relatives à la « sécurité de l’entreprise ».
Est-ce open source
WellSaid Labs utilise des modèles d’IA propriétaires et fermés ; Studio, Voice Avatars et le système vocal principal ne sont pas des produits open source. Il existe des dépôts publics sur GitHub officiels avec des exemples d’API simples, mais ils ne montrent que comment appeler les services cloud, sans inclure les poids des modèles ni le code source complet de la plateforme.
Guide d’utilisation de WellSaid Labs
Créer des flux de travail professionnels réutilisables
- Créer un ensemble de test avec du bruit réel, des accents et des extraits multiples ;
- Comparer les différences de traitement entre la bibliothèque de voix Voice Avatar, le contrôle du ton, de la hauteur et de l’émotion ainsi que la personnalisation de la prononciation, et les Smart Suggestions ;
- Conserver l’enregistrement original et la transcription non modifiée ;
- Organiser une audition par un humain avant la publication externe ;
- Statistiques sur la durée de traitement, le taux d’erreurs et la consommation de crédit ;
- Mettre à jour régulièrement le glossaire, les autorisations sonores et la politique de suppression ;
À qui s’adresse-t-il
- Équipes éducatives et commerciales chargées de créer des formations en anglais, des micro-cours et des démonstrations de produits ;
- Des professionnels du marketing, de la publicité et de la production vidéo qui ont besoin d’une voix de marque stable ;
- Créateurs qui souhaitent modifier rapidement et fréquemment des scripts sans devoir réserver à nouveau des enregistrements avec des personnes réelles ;
- Équipes de contenu qui ont besoin de partager des banques de prononciation, des commentaires et des droits d’accès ;
- Développeurs qui génèrent en masse des expériences vocales de produits via une API.
Avantages et limites d'utilisation
- Les avantages de WellSaidLabs sont des voix en anglais professionnelles, un contrôle précis de la prononciation, une génération illimitée dans le cadre de forfaits payants, un tarif calculé en fonction des minutes de téléchargement finales, ainsi qu’une gouvernance claire pour les équipes et les entreprises.
- Il convient particulièrement aux workflows nécessitant une voix d’entreprise stable et réutilisable ;
- La limitation est que les forfaits individuels sont principalement axés sur l’anglais, tandis que les fonctionnalités multilingues et de traduction sont réservées à Enterprise.
- Les minutes de production et le prix des places peuvent être élevés pour les petits utilisateurs ;
- La voix d’IA peut également mal prononcer les termes ou manquer de la profondeur d’une interprétation humaine ; le contenu commercial nécessite toujours une édition, une vérification des faits et une vérification des autorisations.
Questions fréquentes
WellSaid Labs est-il gratuit ?
Une version d’essai sans carte de crédit est disponible, permettant de télécharger 3 minutes par mois, mais sans droit d’utilisation commerciale ; elle convient uniquement aux tests de performance.
Comment choisir entre Starter et Pro ?
Starter convient aux créateurs individuels qui travaillent environ 20 minutes par mois et ont jusqu’à 10 projets ; il est plus judicieux de choisir Pro si l’on a besoin de 180 minutes par mois, d’un nombre illimité de projets, de 48 kHz et d’Adobe Express.
Comment WellSaid calcule le plafond
La création et la révision de plans payants ne sont pas limitées ; le coût est principalement calculé en fonction des minutes audio téléchargées. Des minutes supplémentaires peuvent être achetées dans le Studio ; les détails sont indiqués sur la page de compte.
WellSaid prend-il en charge le chinois ?
Le forfait individuel actuel met en avant toutes les voix en anglais ; les langues supplémentaires et la traduction sont incluses dans les avantages Enterprise. Pour les besoins en chinois, il convient de confirmer auprès du service des ventes les voix disponibles, la qualité et le périmètre du contrat.
WellSaid Labs est-il open source ?
Pas de code source ouvert. Les exemples d’API publiés officiellement ne comprennent pas de modèles propriétaires ni de système de Voice Avatar.
Numéro d’enregistrement de sécurité publique du Guangxi : 45132202000164