WellSaid Labs
Valeur ajoutée gratuite
Guide complet des outils d’IA Outils audio IA

WellSaid Labs

Plateforme de voix IA de haute qualité pour la production de contenu d’entreprise

Étiquettes :

Qu’est-ce que WellSaid Labs ?

WellSaid Labs est une plateforme d’IA de conversion texte en voix destinée à la formation d’entreprise, aux démonstrations de produits, à la publicité, ainsi qu’aux contenus vidéo et audio. Son produit phare est WellSaid Studio. Les utilisateurs saisissent un texte, choisissent un Voice Avatar, puis ajustent le ton, la hauteur du son, l’émotion, les pauses et la prononciation pour générer et télécharger une voix off professionnelle.

Il met l’accent sur la sécurité de la marque, la collaboration entre entreprises et une base de voix en anglais fiable, plutôt que sur des voix de personnalités publiques téléchargées arbitrairement par la communauté. Le forfait payant offre des droits d’utilisation commerciale, une génération illimitée et un comptage des minutes de téléchargement des produits finis ;

Business et Enterprise ajoutent des espaces d’équipe, une bibliothèque de prononciations partagée, des commentaires, des droits d’accès, une intégration avec Adobe Premiere Pro et des fonctionnalités de sécurité d’entreprise.

Fonctionnalités clés de WellSaid Labs

Bibliothèque de voix Voice Avatar

WellSaid désigne les voix d’IA prédéfinies sous le nom de Voice Avatars. Les abonnements Starter, Pro, Business et Enterprise disposent d’une bibliothèque complète de voix en anglais, tandis que la version d’essai gratuite ne propose que des voix sélectionnées.

Les utilisateurs peuvent écouter des extraits selon le type de contenu, le ton, l’âge suggéré et le style ; les voix et les styles spécifiques évolueront avec les mises à jour de la plateforme.

Ton, hauteur vocale et contrôle émotionnel

Studio offre des contrôles de ton, de hauteur et d’émotion, permettant d’adapter le même texte pour l’enseignement, la publicité, le service client ou la narration. Des ajustements excessifs peuvent rendre la voix artificielle ; il est conseillé de générer plusieurs enregistrements avec des phrases courtes, puis de combiner les extraits satisfaisants en un projet, plutôt que de générer tout le texte d’un coup avant de l’examiner.

Personnalisation de la prononciation et Suggestions intelligentes

Pour les noms de marques, les noms de personnes, les abréviations, les chiffres et les mots d’origine étrangère, l’utilisateur peut effectuer des corrections par substitution phonétique, reformulation ou pauses. L’intégration des Suggestions Smart avec le dictionnaire permet de trouver des prononciations plus appropriées, et la fonction de partage de bibliothèque de prononciations au sein d’une équipe assure la cohérence des termes de marque entre différents projets et membres.

Projets, fragments et réessais infinis

Le forfait payant permet une génération illimitée ; la quantité réelle est principalement mesurée en fonction des minutes d’audio final téléchargées. Les utilisateurs peuvent générer à plusieurs reprises des prises de son, et supprimer les extraits téléchargés non nécessaires pour libérer l’espace correspondant conformément aux règles d’aide.

Jusqu’à 10 projets pour Starter, pas de limite pour Pro et les versions supérieures.

Sous-titres et exportation en plusieurs formats

Le forfait payant permet de télécharger des fichiers de sous-titres, et les formats audio ainsi que la fréquence d’échantillonnage varient en fonction du plan choisi. Le Starter utilise principalement MP3 à 24 kHz ;

Pro prend en charge le TXT et jusqu’à 48 kHz ; Business et Enterprise prennent en charge MP3, WAV, OGG, TXT, avec Enterprise atteignant jusqu’à 96 kHz.

Les sous-titres SRT et VTT doivent encore être vérifiés pour la timeline et la ponctuation.

Collaboration d’équipe

Business et Enterprise prennent en charge la collaboration en équipe, permettant de travailler ensemble sur de grands projets dans un espace d’équipe, avec des banques de sons partagées, des commentaires, la possibilité de marquer des sons comme favoris et un contrôle des permissions. Business permet d’acheter jusqu’à 5 licences, tandis que le nombre de licences Enterprise est déterminé selon le contrat.

Intégration d’Adobe avec les API

La version Pro inclut Adobe Express, tandis que les versions Business et Enterprise ajoutent une intégration avec Adobe Premiere Pro. Lorsqu’il est nécessaire de synthétiser dynamiquement de la voix dans un produit ou un processus automatisé, l’API WellSaid peut être utilisée séparément.

Les forfaits API, la concurrence, les modèles et la consommation sont déterminés selon la page des développeurs en vigueur ou l’accord commercial ; les minutes de téléchargement depuis Studio ne doivent pas être considérées comme un solde API.

Comparaison des prix des forfaits personnels WellSaid

Voici les prix en dollars affichés actuellement sur le site officiel pour les nouveaux clients. Les prix pour Creative, Team, etc., mentionnés dans les anciens articles d’aide pourraient correspondre à des forfaits antérieurs ; les avantages réservés aux anciens clients pourraient être maintenus.

Lors de l’achat, il convient de se référer aux options visibles sur la page de paiement actuelle et dans le compte.

forfaitPrix mensuelPrix annuelMinutes de téléchargementProjets et principaux intérêts
Trial0 dollarPas de carte de crédit nécessaire3 minutes par mois ; sans droits commerciaux3 projets, sons sélectionnés, génération en 10 minutes, MP3, 24 kHz
Starter19 $/mois120 dollars/an, soit 10 dollars/mois20 minutes/mois ou 240 minutes/an en paiement annuel10 projets, voix entièrement en anglais, droits commerciaux, sous-titres, minutes supplémentaires disponibles à l’achat
Pro49 dollars/mois396 dollars/an, soit 33 dollars/mois180 minutes/mois ou 2 160 minutes/an en paiement annuelProjets illimités, 48 kHz, Adobe Express, fonctionnalités avancées et minutes supplémentaires

Comparaison des prix des forfaits entreprises et de l’équipe WellSaid

forfaitPrixMinutes de téléchargementSiègePrincipale différence
Business1 920 dollars par an/utilisateur, soit 160 dollars par mois/utilisateur2 880 minutes par utilisateur/anDe 1 à 5 places payantes, des collaborateurs possiblesEspace d’équipe, commentaires, partage de prononciation, WAV/OGG, Premiere Pro, chat en temps réel et factures
EnterpriseTarif sur mesure, paiement annuelSur mesure pour l’utilisateurPersonnalisationPlus de langues, traduction, SSO, contrôles de sécurité, 96 kHz, espaces de travail personnalisés, analyse et support exclusif
APIPar développeur ou par solution commercialeSelon la consommation APIConformément au contratSynthèse automatique dans les applications et workflows, sans téléchargement via Studio

Le plan individuel annuel fournit un certain nombre de minutes de téléchargement pour toute l’année, tandis que le plan mensuel est renouvelé chaque mois. Selon les informations sur le site officiel, il est possible d’acheter des minutes supplémentaires directement dans Studio, mais le prix unitaire exact et la possibilité de transférer les minutes non utilisées doivent être vérifiés sur la page de solde du compte.

Tous les forfaits payants permettent de générer des fichiers de manière illimitée ; le coût porte sur le téléchargement final de l’audio, et non sur chaque écoute ou reprise.

Différences de fonctionnalités des forfaits

FonctionnalitéTrialStarterProBusiness / Enterprise
Droit d’usage commercialAucunOuiOuiOui, selon le contrat.
Bibliothèque audio anglaise complèteSélectionnésOuiOuiOui
Sous-titres SRT/VTTSansContientContientContient
Espace de travail d’équipeAucunAucunAucunBusiness commence à fournir
Intégration AdobeAucunAucunExpressPremiere Pro et Express
Plus de langues et de traductionsAucunAucunAucunEnterprise
Entraînement sur les données des clientsNon utilisé pour l’entraînementNon utilisé pour l’entraînementNon utilisé pour l’entraînementNon utilisé pour l’entraînement

Guide d’utilisation de WellSaid Studio

  1. Mettre en forme le document :Transformer le texte écrit en phrases courtes adaptées à la lecture à voix haute, et unifier les chiffres, abréviations, unités et noms de marques.
  2. Nouveau projet :Créez des projets par cours, vidéo ou chapitre ; les utilisateurs Starter doivent noter que la limite est de 10 projets.
  3. Écouter l’audio :Écoutez plusieurs Voice Avatars avec le même texte type, et ne vous contentez pas d’écouter les phrases de démonstration officielles.
  4. Génération par segments :Créez des clips par phrase ou par court paragraphe pour faciliter les remplacements locaux, la combinaison de dialogues et le contrôle du rythme.
  5. Correction de la prononciation :Utiliser la réécriture, le remplacement, les pauses et les Smart Suggestions pour gérer les noms propres.
  6. Ajuster l’expression :Modifier légèrement le ton, la hauteur et l’émotion, et utiliser des écouteurs pour vérifier la naturalité et la cohérence.
  7. Produit assemblé :Sélectionner les takes satisfaisants et les fusionner, supprimer les fragments inutiles pour organiser les projets et éventuellement libérer de l’espace d’utilisation.
  8. Télécharger et exporter :Vérifiez les minutes de produit fini à déduire, puis sélectionnez le format, la fréquence d’échantillonnage et les sous-titres pris en charge par le forfait.

Comment réduire le gaspillage de minutes de téléchargement

  • Terminez d’abord toutes les écoutes et la correction du texte avant de télécharger, car la génération est généralement illimitée dans le plan payant.
  • Diviser le texte long en paragraphes réutilisables, ne reprendre que les parties erronées ;
  • Une fois l’avatar vocal final et la prononciation déterminés, exporter la version à haute fréquence d’échantillonnage ;
  • Créer une liste de prononciation unifiée pour les noms de marque, à partager par l’équipe et à mettre à jour régulièrement ;
  • Enregistrez le script final, les noms des sons et les paramètres, afin d’éviter que les versions ultérieures ne puissent être reproduites.

Dialogue et doublage multi-voix

Lors de la création des dialogues, il est possible d’utiliser différents Voice Avatars pour enregistrer les répliques de chaque personnage, puis de les combiner dans l’ordre à l’aide de l’outil Combine. Il convient d’unifier le volume, les pauses et l’impression d’espace, afin d’éviter que chaque personnage ne semble provenir d’un environnement d’enregistrement différent.

Les représentations théâtrales complexes peuvent encore nécessiter des doublages en direct ou un travail d’ingénierie audio post-production.

Points clés d'utilisation de l’API WellSaid

L’API peut générer de la voix à partir de modèles et d’avatars vocaux depuis un programme, et prend en charge le contrôle XML via AI Director, par exemple pour le tempo, les pauses, le volume, la hauteur tonale et la réépellisation. Les développeurs doivent utiliser des clés serveur pour limiter la longueur des requêtes, la concurrence et le budget, mettre en cache des scripts fixes et enregistrer chaque version du modèle, de la voix et du texte générée.

Les abonnements Studio et l’API sont des produits distincts ; les quotas ne peuvent pas être partagés par défaut. Les services externes doivent également gérer les délais d’expiration, les tentatives de réessai, la modération du contenu, le stockage audio, l’autorisation des utilisateurs et les textes sensibles dans les journaux.

Le code d’exemple API ne sert qu’à se connecter à des services commerciaux et ne peut pas exécuter les modèles principaux hors ligne.

Utilisation commerciale et sécurité des données

L’audio généré par Trial n’est pas destiné à un usage commercial. Les forfaits Starter et supérieurs incluent une option pour un usage commercial, mais il faut tout de même respecter les conditions du service et les restrictions relatives au contenu. L’utilisateur doit disposer des droits nécessaires pour fournir du texte, de la musique, des images et des éléments de marque, et ne pas utiliser de voix synthétique pour induire en erreur le public ou enfreindre les droits de tiers.

La page de comparaison des prix sur le site officiel indique clairement que les données des clients ne seront pas utilisées pour entraîner les modèles. Enterprise ajoute SSO, des contrôles de sécurité, des rapports SOC 2, des conditions personnalisables et une modération du contenu ;

Pour déterminer si les exigences réglementaires spécifiques à un secteur sont remplies, il est nécessaire d’évaluer en fonction du flux de données réel et des contrats signés, et non de se fier uniquement aux affirmations relatives à la « sécurité de l’entreprise ».

Est-ce open source

WellSaid Labs utilise des modèles d’IA propriétaires et fermés ; Studio, Voice Avatars et le système vocal principal ne sont pas des produits open source. Il existe des dépôts publics sur GitHub officiels avec des exemples d’API simples, mais ils ne montrent que comment appeler les services cloud, sans inclure les poids des modèles ni le code source complet de la plateforme.

Guide d’utilisation de WellSaid Labs

Créer des flux de travail professionnels réutilisables

  1. Créer un ensemble de test avec du bruit réel, des accents et des extraits multiples ;
  2. Comparer les différences de traitement entre la bibliothèque de voix Voice Avatar, le contrôle du ton, de la hauteur et de l’émotion ainsi que la personnalisation de la prononciation, et les Smart Suggestions ;
  3. Conserver l’enregistrement original et la transcription non modifiée ;
  4. Organiser une audition par un humain avant la publication externe ;
  5. Statistiques sur la durée de traitement, le taux d’erreurs et la consommation de crédit ;
  6. Mettre à jour régulièrement le glossaire, les autorisations sonores et la politique de suppression ;

À qui s’adresse-t-il

  • Équipes éducatives et commerciales chargées de créer des formations en anglais, des micro-cours et des démonstrations de produits ;
  • Des professionnels du marketing, de la publicité et de la production vidéo qui ont besoin d’une voix de marque stable ;
  • Créateurs qui souhaitent modifier rapidement et fréquemment des scripts sans devoir réserver à nouveau des enregistrements avec des personnes réelles ;
  • Équipes de contenu qui ont besoin de partager des banques de prononciation, des commentaires et des droits d’accès ;
  • Développeurs qui génèrent en masse des expériences vocales de produits via une API.

Avantages et limites d'utilisation

  • Les avantages de WellSaidLabs sont des voix en anglais professionnelles, un contrôle précis de la prononciation, une génération illimitée dans le cadre de forfaits payants, un tarif calculé en fonction des minutes de téléchargement finales, ainsi qu’une gouvernance claire pour les équipes et les entreprises.
  • Il convient particulièrement aux workflows nécessitant une voix d’entreprise stable et réutilisable ;
  • La limitation est que les forfaits individuels sont principalement axés sur l’anglais, tandis que les fonctionnalités multilingues et de traduction sont réservées à Enterprise.
  • Les minutes de production et le prix des places peuvent être élevés pour les petits utilisateurs ;
  • La voix d’IA peut également mal prononcer les termes ou manquer de la profondeur d’une interprétation humaine ; le contenu commercial nécessite toujours une édition, une vérification des faits et une vérification des autorisations.

Questions fréquentes

WellSaid Labs est-il gratuit ?

Une version d’essai sans carte de crédit est disponible, permettant de télécharger 3 minutes par mois, mais sans droit d’utilisation commerciale ; elle convient uniquement aux tests de performance.

Comment choisir entre Starter et Pro ?

Starter convient aux créateurs individuels qui travaillent environ 20 minutes par mois et ont jusqu’à 10 projets ; il est plus judicieux de choisir Pro si l’on a besoin de 180 minutes par mois, d’un nombre illimité de projets, de 48 kHz et d’Adobe Express.

Comment WellSaid calcule le plafond

La création et la révision de plans payants ne sont pas limitées ; le coût est principalement calculé en fonction des minutes audio téléchargées. Des minutes supplémentaires peuvent être achetées dans le Studio ; les détails sont indiqués sur la page de compte.

WellSaid prend-il en charge le chinois ?

Le forfait individuel actuel met en avant toutes les voix en anglais ; les langues supplémentaires et la traduction sont incluses dans les avantages Enterprise. Pour les besoins en chinois, il convient de confirmer auprès du service des ventes les voix disponibles, la qualité et le périmètre du contrat.

WellSaid Labs est-il open source ?

Pas de code source ouvert. Les exemples d’API publiés officiellement ne comprennent pas de modèles propriétaires ni de système de Voice Avatar.

©️Droit d’auteur : Sauf indication contraire, tous les articles de ce site sont protégés par le droit d’auteur.Partage d’outils d’IATous les droits d’auteur sont réservés. Sans autorisation, aucune personne, média, site web ou groupe ne peut reproduire, copier ou diffuser de quelque manière que ce soit le contenu de ce site, ni créer de mirror sur des serveurs qui ne lui appartiennent pas. Dans le cas contraire, notre site se réserve le droit de poursuivre en justice les responsables conformément à la loi.

Outils similaires à WellSaid Labs