Dubbing and AI
Valeur ajoutée gratuite
Guide complet des outils d’IA Outils audio IA

Dubbing and AI

Dubbing et IA : rendre le travail audio avec l’IA plus efficace et plus simple

Étiquettes :

Le doublage et l’IA correspondent en réalité à Deepdub

« Dubbing and AI » dans la base de données provient du titre de la page du produit ; le nom réel de la marque est Deepdub. Il s’agit d’une infrastructure d’IA pour la doublage et les voix de niveau entreprise, destinée aux médias, à la radiodiffusion, au post-traitement et aux agents vocaux intelligents.

Deepdub propose en même temps une synthèse vocale émotionnelle, du clonage de voix, du Voice-to-Voice, du doublage de films et de séries, du doublage pour diffusion en direct et une API pour développeurs. Ce n’est pas une application de traduction de vidéos courtes en un clic destinée aux utilisateurs ordinaires ; de nombreux services professionnels nécessitent de contacter l’équipe pour une configuration.

Capacités principales du produit

CapacitéEntréeSortieScénarios adaptés
TTS émotionnelParamètres de texte, de langue, de son et d’émotionVoix avec rythme, accent et expressionAgents intelligents, commentaires, service client et formation
Clonage de voixÉchantillons vocaux autorisésSon numérique utilisable entre languesVoix de la marque, acteurs et présentateurs
Voice-to-VoiceLa performance complète de l’acteur ou du doubleurNouveau son qui conserve le ton et le rythmePersonnages de films et séries et contenu à forte charge émotionnelle
Doublage médiatiqueVidéos, pistes audio, scénarios et terminologieTraduction, doublage et contrôle de qualité du produit finalFilms, séries, chaîne FAST et streaming
Deepdub LiveÉmissions en direct ou audio en streamingFlux audio multilingue à faible latenceSport, actualités, e-sport et événements en direct
Voice APIConfiguration en temps réel ou par lots de texte et de sonAudio WAV, MP3, ULAW, etc.Agents vocaux, appels et voix dans les applications
Contrôle des termes et des accentsGlossaire, prononciation et exigences régionalesTermes professionnels plus cohérents et accents régionauxMarques, produits et contenu international

Texte émotionnel en voix parlée

La technologie eTTS de Deepdub met l’accent sur le rythme, les pauses, l’accentuation et l’émotion, plutôt que de se contenter de lire le texte. Les utilisateurs peuvent choisir la voix, la langue et le style d’interprétation, et générer un audio complet via une API ou recevoir des blocs audio en flux continu.

  • Idéal pour les agents de service client intelligent, les systèmes téléphoniques, les cours, les commentaires audio et les personnages interactifs.
  • Il est possible d’ajuster l’accent, la vitesse, le pitch et l’intensité émotionnelle ; les paramètres spécifiques varient en fonction du modèle.
  • Permet de générer du son pour une durée cible, facilitant la synchronisation entre la timeline des sous-titres et l’image.
  • Les marques phonémiques SSML peuvent être utilisées pour contrôler les noms propres et les prononciations spéciales.
  • Il est possible de choisir des sons déjà autorisés, ou de créer des références sonores si l’on en a les droits.
  • Pour les longs textes, il reste à vérifier le décalage sonore, la ponctuation, les chiffres et la cohérence entre les sections.

La démonstration de la page d’accueil utilise Phantom X 3.2, tandis que l’exemple de démarrage rapide fait appel à dd-etts-3.0. Le nom affiché pour le produit n’est pas toujours identique au numéro du modèle API ; les développeurs doivent se référer aux modèles disponibles dans leur compte ainsi qu’aux documents les plus récents.

Clonage de voix et Voice-to-Voice

La clonage de voix crée des sons numériques à partir de petits échantillons audio, afin de préserver l’identité dans différents textes et langues. La conversion voix à voix, quant à elle, conserve le rythme, les émotions et les subtilités de la performance originale de l’acteur, avant de la transformer en une autre voix autorisée.

  • Les échantillons de voix doivent provenir de la personne elle-même ou d’un interprète disposant d’une autorisation explicite.
  • L’autorisation doit couvrir la formation, la génération, le langage, la région, la durée et les canaux commerciaux.
  • Lors du téléchargement d’un son, il est nécessaire de préciser des attributs tels que la langue, l’âge, le sexe et le style de parole.
  • L’API offre des opérations de téléchargement, de liste, de lecture et de suppression de sons.
  • Un projet cinématographique ou télévisuel peut passer d’une performance avec un petit nombre d’acteurs à des voix pour davantage de personnages.
  • Un projet de marque peut maintenir une identité sonore cohérente à travers la publicité, le marché et les canaux.

Deepdub met en place un système de licences et de redevances pour les talents vocaux, mais les contrats spécifiques pour chaque projet doivent encore être confirmés un par un. Tout son qui peut être cloné techniquement n’est pas nécessairement utilisable légalement.

Processus de doublage pour le cinéma et les médias

La localisation des médias consiste à identifier la voix dans les vidéos et les audios, à générer des scripts, à gérer la traduction et la prononciation, puis à créer des pistes linguistiques cibles à l’aide de banques de sons, de clonage ou de Voice-to-Voice. Pour les projets professionnels, on peut ajouter une adaptation au langue maternelle, une équipe de production et un contrôle qualité.

  1. Fournir à l’équipe le type de contenu, la durée, la langue source, la langue cible et la région de diffusion.
  2. Vérifier la portée des droits sur la vidéo, le script, les voix des acteurs, la musique et les effets sonores.
  3. Téléchargez des médias ou des scripts existants pour générer une transcription et séparer les dialogues.
  4. Définir les exigences en matière de personnages, de terminologie, de prononciation, d’accent et de style.
  5. Choisissez pour chaque personnage un son autorisé ou une référence sonore approuvée.
  6. Générer des extraits et vérifier la traduction, la performance, la cohérence des personnages et la synchronisation temporelle.
  7. Modifier les segments clés, gérer la musique et les effets, le volume et le mixage.
  8. Terminer les vérifications de qualité en langue maternelle, créativité, technologie et conformité.
  9. Livrer les pistes audio et le produit final conformément aux normes de diffusion ou de plateforme, et conserver les archives d’approbation.

La page de transcription automatique propose plus de 130 langues, tandis que la page des APIs de doublage et de voix couvre généralement plus de 100 langues et accents. La gamme de langues varie selon les modules ; il convient de confirmer les paires de langues spécifiques, les voix et les accents régionaux avant le lancement du projet.

Deepdub Live – Doublage en temps réel

Deepdub Live s’adresse aux chaînes sportives, d’actualités, de jeux vidéo et en direct, en convertissant les voix en direct en flux audio multilingues. Il prend en charge des workflows de diffusion tels que SRT, HLS et MPEG-DASH, et peut fournir une sortie à 48 kHz.

  • S’adapte automatiquement au locuteur et conserve l’identité vocale de l’animateur à partir d’échantillons courts.
  • La correspondance émotionnelle suit le rythme, l’intensité, les pauses et les changements d’événements en direct.
  • Le temps d’audio indiqué sur la page est d’environ 125 millisecondes, mais le délai global réel dépend de l’ensemble du chemin.
  • On peut utiliser des sons clonés ou des personnages sonores de diffusion préalablement autorisés.
  • La configuration de production offre des droits d’accès, une isolation des données et un soutien opérationnel continu.
  • Les noms, les scores, les informations en temps réel et les expressions sensibles lors des diffusions en direct doivent encore être surveillés manuellement.

La page de la solution en direct indique un SLA de plus de 99,9 %, tandis que les conditions générales de l’API stipulent une disponibilité de 99,95 % par mois pour les API payantes ; les plages de mesure sont différentes. Le contrat doit préciser les limites du service, les fenêtres de maintenance, les objectifs de latence, la bascule en cas de panne et les modalités d’indemnisation.

Mode d’ connexion de l’API de voix

MéthodeCaractéristiques principalesAdéquat pour la tâchePrécautions à prendre
REST APIUne requête renvoie de l’audio binaireCommentaires en batch, tâches asynchrones et génération de fichiersIl est nécessaire de contrôler les délais d’attente, les tentatives de réessai et les prélèvements répétés.
WebSocketRecevoir des blocs audio en continu et en fluxAgents vocaux et interaction en temps réelIl faut gérer les interruptions de connexion, le buffering et l’ordre.
Python SDKInterfaces en flux synchrones et asynchronesBackend Python et applications d’IAL’environnement de production doit verrouiller la version.
Node SDKCallback de buffering et de segmentation JavaScriptServices Node.js et applications en temps réelLa clé doit rester du côté du serveur.
PlaygroundEssai des sons et paramètres dans le compteSélection du son, comparaison de modèles et validation rapideLes résultats des tests ne représentent pas la charge de production totale.

Introduction rapide à l’API

  1. Inscrivez-vous avec une adresse e-mail professionnelle pour une période d’essai de 14 jours, et suivez les étapes d’invitation et de code de vérification.
  2. Accédez à Playground et vérifiez la clé API générée automatiquement par le compte.
  3. Écoutez les présets de voix et enregistrez l’ID du voice prompt souhaité.
  4. Installez le paquet Python deepdub ou le client Node.js, ou vous pouvez également envoyer des requêtes réseau directement.
  5. Sélectionnez le modèle, la langue, le texte cible, la voix et le format de sortie.
  6. Les tâches en batch utilisent REST, tandis que les conversations à faible latence font l’objet de tests prioritaires pour la génération en flux via WebSocket.
  7. Stockez la clé dans le système de gestion des clés du serveur, et non sur une page web ou une application mobile.
  8. Tester du texte vide, du texte très long, des caractères spéciaux, des chiffres, SSML et des interruptions de réseau.
  9. Enregistrer la demande de génération, l’autorisation sonore, la version du modèle, le fichier de sortie et le résultat de l’approbation manuelle.
  10. Avant la fin de la période d’essai, confirmer avec le service des ventes les modalités de facturation, le mode de conservation, la concurrence en parallèle, les SLA et les conditions commerciales.

Entrée, langue et sortie

CatégorieContenu pris en chargefrontière
TexteTexte ordinaire, contrôle de la prononciation et partie SSMLLes limites de longueur, de caractères et de langue dépendent de l’interface et du forfait.
Échantillons de voixVoix autorisée téléchargée ou enregistrée sur placeRelatif aux caractéristiques biologiques, aux droits de la personnalité et aux contrats d’acteurs
Audio et vidéoMédias, diffusion en direct et contenus localisésLa taille du fichier, le stockage et le format du projet doivent faire l’objet d’une confirmation écrite.
languePlus de 100 langues et accentsL’API locale et la couverture sonore spécifique sont inférieures au discours de communication global.
Transcription automatiquePlus de 130 languesLa portée de la transcription n’est pas identique pour toutes les langues en termes de capacités de doublage.
Sortie audioWAV 48 kHz, MP3, ULAW et audio non compresséLe taux d’échantillonnage et le format spécifiques varient en fonction de l’interface et du contexte.
Sortie en directFlux de travail SRT, HLS, MPEG-DASHIntégration de diffusion professionnelle et redondance réseau requises

Essai gratuit et prix

Forfait ou versionPrixPériode de facturationDroits ou crédit principalAdéquat pour les utilisateurs
Essai API0 dollar14 joursJusqu’à 10 000 caractères, environ 10 minutes ; Playground et clé APIDéveloppement, validation et sélection sonore
Forfait temps APIPas encore rendu publicSelon le forfait de temps sélectionnéAprès essai, choisissez la durée d'utilisation ; les quantités supplémentaires sont facturées à un prix fixe.Agents vocaux et production de contenu
Doublage médiatiqueContacter le service des ventesProjet ou contratTraduction, voix, production, contrôle de qualité et livraisonCinéma, streaming et chaînes FAST
Deepdub LiveContacter le service des ventesContrat sur mesureVoix multilingue en temps réel, intégration de la radiodiffusion, SLA et support opérationnelOrganismes de diffusion en direct et de radiodiffusion
Déploiement d’entrepriseCotation sur mesureDispositions contractuellesConcurrentiel, support, sécurité, conservation et licences configurables selon les besoinsPlateforme de voix à grande échelle

La page publique ne mentionne pas le montant des forfaits de temps après l’essai, le prix unitaire pour la consommation supplémentaire, l’engagement minimum ni les frais de service pour les entreprises. Il n’est pas possible de déduire le prix de facturation en se basant sur le fait que 10 000 caractères équivalent à environ 10 minutes.

Les taxes et frais, la renouvellement automatique, l’annulation, le remboursement, le solde non utilisé, ainsi que les frais de génération échouée et de dépassement de concurrence ne sont pas clairement exposés. Avant l’achat, il convient de se référer à la page de facturation réelle, au pack d’abonnement et aux documents signés par les deux parties.

Autorisation sonore et droits de diffusion

La bibliothèque de sons Deepdub se distingue par des sons licenciés, traçables et adaptés à une utilisation radiophonique et commerciale, mais ces droits ne couvrent que les actifs sonores correspondants et le cadre du contrat. L’utilisateur doit néanmoins disposer de tous les droits nécessaires pour le script, la vidéo, la musique, les personnages et ses propres échantillons sonores.

  • La région, le canal, la durée et l’utilisation de la marque pour les sons prédéfinis doivent être confirmés dans la commande.
  • Les voix d’acteurs intégrées nécessitent des autorisations pour la formation, la synthèse, la traduction et la réutilisation.
  • Il ne faut pas considérer que les éléments provenant de tiers, une fois téléchargés, permettent de distribuer les résultats à l’extérieur.
  • Les conditions générales de l’API imposent des restrictions strictes aux sorties générées à partir d’entrées qui ne sont pas entièrement détenues par le client.
  • Les projets de cinéma et de publicité doivent conserver l’accord des acteurs, la chaîne des droits d’auteur et l’approbation de l’usage final.
  • L’obligation d’identifier les voix synthétiques dépend des réglementations du pays de publication et des règles de la plateforme.

Les conditions de l’API stipulent que, si les données saisies ne sont pas entièrement propriétaires du client, les résultats correspondants ne peuvent généralement être fournis qu’à des parties liées et à des fins internes non commerciales. Les projets complexes nécessitant une licence tierce doivent avoir leur portée clairement définie par un contrat distinct, et ne peuvent pas se fier uniquement à des comptes d’essai généraux.

Confidentialité, sécurité et conservation des données

L’appendice sur le traitement des données de Deepdub couvre les données des représentants clients et des acteurs avec lesquels le traitement est effectué, y compris les noms, les coordonnées et les enregistrements vocaux. Les sous-traitants incluent AWS, Google et WeTransfer, et les lieux de traitement se trouvent dans l’Union européenne et aux États-Unis.

  • La plateforme est certifiée SOC 2 Type II et porte la marque TPN Gold ou certification TPN dans le secteur des médias.
  • Pour l’utilisation statique des données personnelles, on utilise AES-256 ; pour le transfert chiffré, on utilise TLS 1.2 ou une version ultérieure.
  • La page de solution indique que les données des clients sont par défaut isolées et ne sont pas utilisées pour entraîner les modèles.
  • Le client peut choisir de ne pas conserver le mode, afin que les données traitées ne soient pas enregistrées davantage.
  • Le client peut demander la suppression de ses données personnelles, à l’exception de celles dont la conservation est exigée par la loi.
  • Lorsqu’un incident de sécurité se produit ou qu’un tel incident est suspecté, la DPA exige que le client soit informé dans un délai de 48 heures.
  • La demande du titulaire des données fera l’objet d’une notification au client et d’une assistance pour son traitement dans un délai de 72 heures.

Sauf disposition écrite contraire, Deepdub n’a pas l’obligation de conserver les fichiers d’entrée sur le long terme et peut imposer des limites de taille de fichier ainsi que des limites de capacité de stockage et de traitement. L’utilisateur doit conserver ses propres sauvegardes des matériaux originaux, des scripts, des autorisations sonores et du produit final.

SLA API et fiabilité en production

Les conditions générales de l’API payante garantissent une disponibilité de 99,95 % par mois, à l’exclusion des maintenances planifiées sans préavis ; cette garantie ne s’applique pas aux services gratuits. Ce niveau élevé d’disponibilité ne garantit pas à chaque fois un délai minimal, une qualité audio optimale ou une précision du contenu.

  • Définir un contrôle d’identité pour les requêtes REST afin d’éviter que les tentatives de réessai ne génèrent des enregistrements audio dupliqués et des frais supplémentaires.
  • WebSocket doit gérer la réconnexion en cas de déconnexion, l’ordre des fragments et l’audio incomplet.
  • Préparer en temps réel des sons de secours ou une voie de dégradation TTS traditionnelle pour les opérations.
  • Surveiller le temps d’encodage initial, le temps total de génération, le taux d’erreurs et la qualité audio.
  • Intégrer la mise à jour des modèles ou des API dans les tests de compatibilité et l’approbation de publication.
  • Le contrat de diffusion en direct doit préciser séparément les retards, les SLA, les délais de support et la réponse aux incidents.

GitHub, SDK et statut open source

ProjetÉtat actuelLicence
Plateforme et modèles DeepdubServices spécialisésLicence de code source de produit non divulgué
Python SDK deepdubEntrepôt public officielMIT
AudioSampleBibliothèque officielle de traitement audioMIT
deepdub-apiDocumentation officielle de l’API et répertoire d’exemplesAucune licence détectée pour le moment.
Node SDKPeut être installé via le gestionnaire de paquetsSelon la licence incluse dans le paquet
Autres intégrations officiellesCertains entrepôts sont accessibles au publicMIT, Apache, etc., sont tous différents.

Le Python SDK et AudioSample sont soumis à la licence MIT, qui ne précise que les conditions d’utilisation de ces bibliothèques de code. Ils ne rendent pas accessibles les poids des modèles de Deepdub, les bibliothèques sonores, la plateforme de production ou les services de doublage commerciaux.

Adapté aux utilisateurs et aux scénarios

  • Équipe des agents vocaux intelligents : création d’interfaces vocales pour le service client, l’assistance médicale et la finance.
  • Sociétés de cinéma et de streaming : production d’épisodes, de films et de contenus de catalogue multilingues.
  • Organismes de radiodiffusion : fourniture de pistes audio en temps réel pour le sport, l’actualité et les grandes retransmissions en direct.
  • Fournisseur de services linguistiques : intégrer la voix émotionnelle et le clonage de voix dans les processus de localisation existants.
  • Équipe de post-production : utilisation de Deepdub Go pour contrôler l’accent, l’émotion et la voix du personnage.
  • Marque et équipe de formation : maintenir la cohérence de l’identité sonore et des termes dans les différents marchés.
  • Développeur : Générer de la voix via REST, WebSocket, Python ou le SDK Node.

Avantages et principales limites

Avantages principaux

  • Une gamme de produits multiples couvrant l’API TTS, la production cinématographique et la diffusion en direct.
  • Les émotions, le rythme, l’accent et la fonction Voice-to-Voice conviennent mieux aux contenus de type performance.
  • Fournit une grande quantité de sons licenciés et un mécanisme de redevances destiné aux acteurs.
  • Prend en charge l’intégration avec REST, WebSocket, Python et Node.js.
  • Fournit SOC 2, TPN, GDPR, chiffrement et mode sans conservation optionnel.
  • Les projets professionnels peuvent intégrer une adaptation à la langue maternelle, une équipe de production et un contrôle de qualité.

Principales restrictions

  • Le prix exact après essai n’a pas été divulgué ; il est nécessaire de choisir un compte ou d’obtenir une offre de vente.
  • Le langage, le nombre d’émotions et la SLA utilisent des méthodes statistiques différentes sur les différentes pages de produits.
  • Les langues disponibles pour l’API ne coïncident pas entièrement avec les langues des services de transcription globale ou de médias.
  • La doublage de médias de haute qualité nécessite encore une traduction, une interprétation et un contrôle par des techniciens.
  • La sortie générée à partir d’entrées tierces est soumise à des restrictions strictes en matière de distribution et d’utilisation commerciale.
  • La plateforme centrale et les modèles sont propriétaires ; un SDK open source ne signifie pas que le produit l’est également.

Résumé

Deepdub convient aux projets d’agents vocaux intelligents, de médias et de radiodiffusion qui exigent des performances sonores élevées, des licences commerciales, une capacité en temps réel et une sécurité d’entreprise. Avant de commencer l’essai, il convient de déterminer si l’on utilise l’API, Deepdub Go, la création de médias ou Live, et de confirmer par écrit le prix, les langues, les droits audio, la conservation des données et la portée de la distribution des résultats.

Questions fréquentes

Dubbing et AI, sont-ce des noms de produits ?

C’est le titre utilisé sur la page de Deepdub ; la marque réelle est Deepdub. Les fonctionnalités, API et services décrits dans cette entrée appartiennent tous à Deepdub.

Deepdub est-il disponible en essai gratuit ?

Oui, la période d’essai de l’API actuelle est de 14 jours, elle permet jusqu’à 10 000 caractères, soit environ 10 minutes de contenu par page. Une inscription avec un e-mail professionnel est requise.

Combien après l’essai ?

La page publique indique uniquement que des forfaits payants par heure sont disponibles, avec un prix fixe pour les quantités supplémentaires, sans préciser de montant exact. Pour les solutions de médias et de diffusion en direct, il est nécessaire de contacter le service des ventes.

Quel nombre de langues sont pris en charge ?

En général, le produit est disponible en plus de 100 langues et accents, tandis que la transcription automatique et certaines pages techniques le sont en plus de 130. Il convient de vérifier individuellement les capacités API locales, vocales et linguistiques cibles.

Prend-il en charge la voix en temps réel ?

Oui, l’API WebSocket permet une génération en flux continu, et Deepdub Live est également conçu pour la doublage en diffusion en temps réel. Le délai réel dépend du modèle, du réseau, de la compression et de l’intégralité du lien médiatique.

Les sons peuvent-ils être utilisés à des fins commerciales ?

La bibliothèque de sons Deepdub propose une licence commerciale, mais ses conditions dépendent des sons choisis et du contrat. Les utilisateurs doivent obtenir eux-mêmes les droits pour les scripts, vidéos, personnages et échantillons de sons qu’ils apportent.

Les données des clients seront-elles utilisées pour l’entraînement ?

La page de solution indique que les données des clients sont par défaut isolées et ne sont pas utilisées pour l’entraînement, et propose un mode optionnel sans conservation. L’entreprise doit néanmoins confirmer les paramètres spécifiques du projet dans le contrat et le DPA.

Deepdub dispose-t-il de SDK pour Python et Node ?

Oui, il existe un paquet Python nommé deepdub, et un paquet Node nommé @deepdub/node. Il est également possible d’utiliser directement les interfaces REST ou WebSocket.

Deepdub est-il open source ?

La plateforme centrale et les modèles ne sont pas open source. Le SDK officiel Python et AudioSample sont licenciés sous la licence MIT, mais cela ne couvre pas les bibliothèques audio, les poids des modèles ni les services hébergés.

Les entrées seront-elles conservées à long terme ?

Aucune garantie n’est donnée. Sauf accord écrit contraire, Deepdub n’a pas l’obligation de conserver les fichiers d’entrée sur le long terme ; l’utilisateur doit conserver lui-même des sauvegardes des matériaux originaux, des autorisations et des résultats de traitement.

©️Droit d’auteur : Sauf indication contraire, tous les articles de ce site sont protégés par le droit d’auteur.Partage d’outils d’IATous les droits d’auteur sont réservés. Sans autorisation, aucune personne, média, site web ou groupe ne peut reproduire, copier ou diffuser de quelque manière que ce soit le contenu de ce site, ni créer de mirror sur des serveurs qui ne lui appartiennent pas. Dans le cas contraire, notre site se réserve le droit de poursuivre en justice les responsables conformément à la loi.

Outils similaires au doublage et à l’IA