Murf
Studio de voix IA pour les commentaires, la formation et la production publicitaire
Étiquettes :Outils audio IAQu’est-ce que Murf AI ?
Murf AI est une plateforme qui couvre la voix off par IA, les commentaires vidéo, la localisation, le clonage de voix et des interfaces vocales pour développeurs. Les créateurs ordinaires utilisent principalement Murf Studio pour générer des commentaires à partir de scénarios et créer des œuvres en combinant des images, des vidéos et de la musique ;
Les équipes qui ont besoin de traduire des vidéos et des audios existants utilisent Murf Dub ; quant aux développeurs, ils intègrent des fonctionnalités vocales dans leurs applications grâce aux API TTS, Voice Changer, Dubbing, Translation, Streaming et WebSocket.
Ces produits ont des modes de facturation différents : Studio est abonné en fonction du temps de génération de la voix, Dub est facturé en crédits, et l’API est facturée par caractère, par minute ou selon un contrat entreprise. La quantité d’audio offerte par Studio sur 24 heures ne peut pas être directement utilisée pour appeler l’API ou créer des doublages multilingues d’une durée équivalente.
Texte à la voix Texte en parole
Murf Studio propose actuellement plus de 300 sons et plus de 30 langues et accents, pouvant être utilisés pour des cours, des publicités, des podcasts, des démonstrations de produits, du contenu audio, de la formation d’entreprise et des commentaires pour YouTube. Le menu des sons peut être filtré par langue, accent, genre, âge, style et usage.
Les différentes prononciations d’une même langue se manifestent différemment pour les chiffres, les abréviations, les noms de marques et les termes techniques. Les projets formels doivent être écoutés par paragraphes, et une bibliothèque de prononciation doit être utilisée pour conserver une prononciation uniforme.
Modèle de voix Gen2
Gen2 est conçu pour les commentaires audio de haute qualité, offrant un contrôle plus fin du ton, du style, des pauses, de la vitesse et de la hauteur sonore. Par rapport aux modèles de dialogue en temps réel, il accorde une plus grande importance à l’expressivité et aux capacités d’édition, ce qui le rend adapté à la production de vidéos non en temps réel et de cours.
Les sorties du modèle peuvent encore présenter des accents peu naturels, une incohérence émotionnelle et des problèmes de rythme dans les paragraphes longs. Diviser le script en blocs sémantiques plus petits permet généralement de corriger plus facilement que de générer d’importantes sections audio d’un seul coup.
Emphasis, Variabilité et Say It My Way
Business et les versions supérieures offrent Emphasis, Variability et Say It My Way. Emphasis permet de mettre en évidence des mots, Variability ajoute des variations de tonalité, tandis que Say It My Way permet à l’utilisateur d’enregistrer une phrase d’exemple afin que la voix de l’IA imite son rythme, son ton et sa manière de s’exprimer.
Enregistrements de référence qui influencent l’expression sans équivaloir à une clonage de l’identité du locuteur. Différentes voix et styles ne peuvent pas reproduire entièrement des interprétations complexes ; il convient de comparer phrase par phrase et d’éviter les exagérations.
Voice Changer
Voice Changer convertit les enregistrements existants en une voix d’IA spécifiée, tout en conservant autant que possible le rythme, le ton, l’accent et les pauses de l’orateur original. Il est idéal pour remplacer les enregistrements familiaux, les captures d’écran et les commentaires temporaires par une voix de marque unifiée.
Une seule saisie côté API dure actuellement jusqu’à environ 3 minutes, prend en charge les formats WAV, MP3, ALAW, ULAW et FLAC, et peut générer divers formats audio. La conversion de sons nécessite néanmoins une autorisation légale tant du titulaire enregistré que du son cible.
Audio to Text
Business propose un service Audio to Text qui permet de télécharger des enregistrements et de les convertir en scripts editables, que l’on peut ensuite remplacer par une voix IA tout en conservant la durée totale, ce qui facilite la synchronisation avec la vidéo d’origine. L’abonnement annuel Business inclut 48 heures de transcription, tandis qu’Enterprise offre des options personnalisables ou sans limite.
La transcription peut mal interpréter les noms de personnes, les chiffres et les termes techniques. Après avoir modifié le texte, il faut également vérifier que l’audio reste en accord avec l’image, les diapositives et les sous-titres.
Voice Over Video
Murf Studio permet de combiner des voix off générées par l’IA avec des images, des vidéos, de la musique et des sous-titres dans un même projet, en ajustant la durée via des scènes ou une timeline. Les utilisateurs peuvent exporter l’audio, les sous-titres ou une vidéo en Full HD.
Studio convient aux vidéos explicatives et à la formation, mais ce n’est pas un logiciel de montage professionnel à plusieurs caméras. Un colorisation complexe, des effets spéciaux et un mixage multi-pistes doivent encore être réalisés avec des outils tels que Premiere Pro ou DaVinci Resolve.
Intégration avec Canva, Google Slides et PowerPoint
Creator prend en charge Canva, tandis que Business offre en plus une intégration avec Google Slides et PowerPoint. Les utilisateurs peuvent écrire des scripts dans les notes du présentateur des diapositives, choisir une voix et générer un commentaire synchronisé ; le projet est ensuite enregistré dans Murf Studio pour être continué dans l’édition.
La synchronisation automatique doit vérifier les animations, les changements de page et les pauses. Les polices, médias et objets intégrés importés ne sont pas non plus nécessairement entièrement convertis en vidéo.
AI Translation
Enterprise propose une traduction par IA qui permet de convertir les projets Studio en autres langues, tout en continuant à éditer le script, les voix et les scènes dans le nouveau projet. La plateforme couvre actuellement plus de 30 langues, et Multi-Native Voices permet de basculer naturellement entre plusieurs langues au sein d’une même voix.
La traduction automatique ne peut pas remplacer la révision par un native speaker. Pour les termes juridiques, politiques, de santé, de sécurité et de marque, il est nécessaire de créer un glossaire et de vérifier la longueur des sous-titres ainsi que leur adaptation culturelle.
Doublage vidéo de Murf Dub
Murf Dub sert à télécharger des vidéos ou des fichiers audio existants et à en générer des versions multilingues. Le système identifie le locuteur, traduit les dialogues, génère de nouvelles voix, et s’efforce de conserver les timestamps originaux, la musique de fond et les effets sonores.
Actuellement, plus de 25 langues sources et cibles sont prises en charge, et la page de l’API de doublage indique environ 28 langues.
La doublage automatique peut présenter des problèmes de séparation des locuteurs, d’émotion, de volume, de traduction et de synchronisation. Enterprise peut acquérir un doublage Quality-Assured, vérifié par des experts internes, pour une localisation à plus haut niveau de exigence.
Essai gratuit de Murf Dub
La version d’essai gratuite de Dub offre par défaut 200 crédits, permettant de créer 1 projet et d’exporter les résultats avec une watermark. Ce montant n’est pas identique aux 10 minutes de génération de voix offertes par Studio Free.
Comparaison des prix et des versions
| Forfait ou version | Prix, plafonds et avantages clés |
|---|---|
| Prix Murf Dub Pay-as-you-go | Dub est facturé à 1 dollar par crédit, avec un achat minimum de 5 dollars. Il est possible d’acheter jusqu’à 10 000 crédits à la fois, et l’option de paiement automatique peut être configurée. Avec le mode PAYG standard, on peut créer environ 5 projets ; la consommation dépend du nombre de fichiers, de la durée de la vidéo d’origine, du nombre de langues cibles et des préférences de doublage. Chaque langue cible supplémentaire augmente la consommation. Pour les contenus volumineux, il est conseillé de tester d’abord la traduction et le son à l’aide de petits échantillons avant de décider d’opter pour la remise Enterprise. |
| Prix du créateur | Le abonnement annuel Creator équivaut à 19 dollars par mois, soit 228 dollars pour l’année. Il comprend 1 éditeur, 100 projets, 24 heures de génération de voix par an, plus de 200 voix et styles, des voix multi-natives, des téléchargements illimités, une intégration avec Canva, des droits commerciaux, des exportations en Full HD, ainsi que des médias prêts à l’emploi et une intégration HTML. Creator convient aux créateurs individuels et aux freelances, mais ne comprend pas Emphasis, Variability, Say It My Way, Audio to Text, PowerPoint et Business License. |
| Prix d’affaires | Le forfait annuel Business équivaut à 66 dollars par mois, soit 792 dollars pour l’année ; il comprend 1 éditeur, 500 projets, 96 heures de génération de voix par an, 48 heures de transcription, des téléchargements illimités, des droits commerciaux et une licence Business, ainsi que les fonctionnalités Emphasis, Variability, Say It My Way, PowerPoint, Google Slides, sons Windows et Audio to Text. Le nom Business ne signifie pas collaboration multiple : la solution autonome actuelle ne comprend qu’un seul éditeur et aucune place pour des viewers. Pour partager des projets, gérer des droits et permettre plusieurs éditions, il convient de choisir Enterprise. |
| Prix Enterprise | Les devis personnalisés d’Enterprise commencent généralement à partir de 5 éditeurs, et offrent un nombre illimité de projets personnalisés, une génération de voix illimitée, une transcription et une traduction illimitées, des fonctionnalités de partage et de collaboration, un visualiseur, un contrôle d’accès, des dossiers privés, SSO, des journaux d’accès, une restauration après suppression en 60 jours, un rendu rapide, aucune formation sur vos données, MSA, des bons de commande et un gestionnaire de succès client. Le clone vocal personnalisé, les modèles personnalisés, l’intégration et les droits complets de diffusion peuvent être des options supplémentaires. Lors de l’achat, il convient d’inclure dans le contrat la conservation des données, l’entraînement des modèles, la concurrence simultanée, les niveaux de service et les licences. |
| Prix et restrictions de l’API | L’essai gratuit API offre 100 000 caractères, 1 clé API, 5 connexions simultanées et 1000 requêtes par minute. Le tarif normal PAYG est de 0,03 dollar pour chaque 1000 caractères, avec un montant minimum d’achat de 2 dollars ; il permet de créer 3 clés, 15 connexions simultanées et 10 000 requêtes par minute. La solution personnalisée propose des remises en volume et des limites plus élevées. Le site officiel du modèle en temps réel Falcon indique un tarif d’environ 0,01 dollar par minute, adapté aux agents vocaux. Différents modèles et capacités utilisent des unités différentes ; le coût final est indiqué sur le tableau de bord API. |
Prix Murf Dub Pay-as-you-go
Dub est facturé à 1 dollar par crédit, avec un achat minimum de 5 dollars. Il est possible d’acheter jusqu’à 10 000 crédits à la fois, et l’option de paiement automatique peut être configurée. Avec le paiement PAYG standard, on peut créer environ 5 projets au maximum.
La consommation spécifique dépend du nombre de fichiers, de la durée de la vidéo d’origine, du nombre de langues cibles et des préférences de doublage.
Chaque langue cible supplémentaire augmente la consommation. Pour les contenus volumineux, il convient d’abord de tester la traduction et le son à l’aide d’échantillons courts avant de décider s’il est opportun d’acquérir la remise Enterprise.
Clonage de voix
Le clonage de voix personnalisé de Murf n’est actuellement pas une fonctionnalité autonome pour les utilisateurs ordinaires, mais plutôt un service supplémentaire destiné aux entreprises. Un gestionnaire client assiste pour l’enregistrement, l’entraînement, le contrôle de qualité et le déploiement ; la voix clonée peut être utilisée dans Studio, Dub ou les workflows d’entreprise.
Les entreprises doivent disposer d’une autorisation explicite des doubleurs ou des employés, et définir l’usage, la langue, la durée, ainsi que l’accès aux modèles et leur suppression. La clonage de voix ne peut pas être utilisé pour se faire passer pour autrui, commettre de la fraude ou effectuer des publicités et des déclarations sans consentement.
Plan gratuit
Studio Free est gratuit, sans carte de crédit requis, et inclut 10 projets, 10 minutes de temps de génération de voix et 1 éditeur. Il permet d’essayer les fonctionnalités de niveau Business, mais il n’y a pas de possibilité de téléchargement ni d’utilisation à des fins commerciales.
La limite gratuite convient pour écouter un échantillon sonore et tester les éléments de contrôle, mais pas pour une publication officielle. Le fait de pouvoir visualiser le projet ne signifie pas que l’on a obtenu les fichiers audio ou une licence commerciale.
Prix du créateur
Le abonnement annuel Creator équivaut à 19 dollars par mois, soit 228 dollars pour l’année ; il comprend 1 éditeur, 100 projets, une génération de voix disponible 24 heures sur 24 toute l’année, plus de 200 voix et styles différents, des voix Multi-Native, des téléchargements illimités, une intégration avec Canva, des droits commerciaux, des exportations en Full HD, ainsi que des médias prêts à l’emploi et une intégration HTML.
Creator convient aux créateurs individuels et aux freelances, mais ne comprend pas Emphasis, Variability, Say It My Way, Audio to Text, PowerPoint et Business License.
Prix d’affaires
Abonnement annuel Business : 66 dollars par mois, soit 792 dollars pour l’année. Il comprend 1 éditeur, 500 projets, 96 heures de génération de voix par an, 48 heures de transcription, des téléchargements illimités, des droits commerciaux et une licence Business, avec en plus les fonctionnalités Emphasis, Variability, Say It My Way, PowerPoint.
Google Slides, Windows Sound et Audio to Text.
Le nom Business ne signifie pas une collaboration entre plusieurs personnes : la solution autonome actuelle ne dispose que d’un seul Éditeur et n’offre pas de places de Visualisation. Pour partager des projets, gérer les permissions et permettre plusieurs éditions, il faut choisir Enterprise.
Prix Enterprise
Tarification sur mesure Enterprise, généralement à partir de 5 éditeurs, avec un nombre illimité de projets personnalisés, génération de voix illimitée, transcription et traduction illimitées, partage et collaboration, visualiseur, contrôle d’accès, dossiers privés, SSO, journal des accès, restauration après suppression en 60 jours, rendu rapide, pas d’entraînement sur vos données, MSA, bons de commande et gestionnaire du succès client.
Le clone de voix personnalisé, les modèles sur mesure, l’intégration et les droits complets de diffusion peuvent être des éléments supplémentaires. Lors de l’achat, la conservation des données, l’entraînement des modèles, la concurrence en parallèle, le niveau de service et les licences doivent être inscrits dans le contrat.
Comment calculer le temps de génération de la voix ?
Le VGT est déduit en fonction de la durée réelle de l’audio généré. Un script en anglais d’environ 1000 mots génère généralement environ 6 minutes d’audio, mais cela peut varier en fonction du timbre de la voix et du rythme de parole.
Une script de 500 mots génère 4 minutes 34 secondes, il sera donc déduit 4 minutes 34 secondes.
Modifier le texte et le regénérer consommera à nouveau la partie correspondante. La documentation d’aide actuelle indique que le VGT restant pour une abonnement actif ou en pause peut être reporté sur le cycle suivant ; la validité exacte et l’état du compte doivent cependant se référer à la page d’abonnement.
Droits commerciaux et licence d’activité
Tous les forfaits Studio payants offrent les droits commerciaux pour générer des voix off, pouvant être utilisés pour du contenu original sur YouTube, en streaming et à des fins commerciales ; le forfait Business inclut en plus une licence d’entreprise.
La documentation officielle d’aide indique que les droits commerciaux et de licence d’entreprise sur le contenu généré restent en vigueur même après la fin de l’abonnement.
Les droits commerciaux ne couvrent pas les scripts, personnages, musiques et contenus téléchargés sur lesquels l’utilisateur n’a pas de droits, et ne garantissent pas que les plateformes tierces autoriseront à jamais les voix IA. Il est nécessaire de vérifier en temps réel les politiques de YouTube et des plateformes publicitaires.
Musique de fond et codes YouTube
Murf propose plus de 8000 morceaux de musique en stock. L’utilisation de certains morceaux de Murf pour les télécharger sur YouTube peut déclencher Content ID ; le système fournit alors un Code YouTube unique dans le paquet d’exportation, que l’utilisateur doit insérer dans la description de la vidéo selon les instructions afin d’éliminer automatiquement la mention d’autorisation.
Murf TTS API
L’API pour développeurs offre un TTS Gen2 à haute expressivité et un TTS en temps réel Falcon à faible latence, et prend en charge la vitesse, le pitch, les pauses, la prononciation, la durée cible, la Variation, Multi-Native, MP3, WAV, FLAC, ALAW, ULAW, Base64 ainsi qu’une sortie jusqu’à 48 kHz.
La bibliothèque vocale API compte actuellement plus de 150 voix, couvrant une trentaine de langues ; elles ne sont pas entièrement identiques aux plus de 300 voix de Studio.
Avant de choisir, vérifiez le modèle et la langue ciblés dans la API Voice Library.
Guide d’utilisation de Murf AI
Terminer une tâche de base
- Vérifier l’enregistrement, le son, la musique et l’autorisation des participants ;
- Téléchargez ou saisissez un audio clair dans Murf AI ;
- Sélectionner les paramètres de traitement tels que la langue, le locuteur et la conversion de texte en paroles Text to Speech ;
- Utiliser le modèle de voix Gen2 pour générer des transcriptions, des doublages ou des résultats de nettoyage ;
- Vérifier par segment le nom, les chiffres, les pauses, le volume et l’émotion ;
- Vérifiez le format, le niveau de loudness, les droits d’auteur et les exigences de confidentialité avant d’exporter ;
Créer des flux de travail professionnels réutilisables
- Créer un ensemble de test avec du bruit réel, des accents et des extraits multiples ;
- Comparer les différences de traitement entre Text to Speech, le modèle de voix Gen2 et Voice Changer ;
- Conserver l’enregistrement original et la transcription non modifiée ;
- Organiser une audition par un humain avant la publication externe ;
- Statistiques sur la durée de traitement, le taux d’erreurs et la consommation de crédit ;
- Mettre à jour régulièrement le glossaire, les autorisations sonores et la politique de suppression ;
Prix et restrictions de l’API
- APIFreeTrial offre 100 000 caractères, 1 APIKey, 5 connexions simultanées et 1000 requêtes par minute ;
- Le tarif PAYG standard est de 0,03 dollar pour chaque 1000 caractères, avec un montant minimal d’achat de 2 dollars. Il est possible de créer 3 clés, avec 15 connexions simultanées et 10 000 requêtes par minute.
- La solution personnalisée offre des remises en gros et des limites plus élevées ;
- Le site officiel du modèle en temps réel Falcon indique environ 0,01 dollar par minute, ce qui convient à VoiceAgent ;
- Les différents modèles et capacités utilisent des unités distinctes, le coût final est indiqué sur l’APIDashboard.
API de doublage, de traduction et de streaming
Murf propose l’API de duplication Dub Automation, l’API de traduction, ainsi que du streaming à faible latence et WebSocket. La duplication peut utiliser des tâches transitoires, et les liens de sortie expirent après 72 heures ;
Il est également possible de créer des projets persistants pour continuer à les éditer et à collaborer via l’interface Murf Dub.
La clé TTS est différente de la clé API Murf Dub. Le système en production doit valider le Webhook Secret, gérer les notifications redondantes et enregistrer rapidement les résultats temporaires.
SDK officiel, MCP et intégration
GitHub officiel fournit des exemples de SDK Python, de Cookbook, de Pipecat, de LiveKit, de serveur MCP et d’agent vocal. MCP permet aux agents compatibles d’appeler Murf TTS, tandis que Pipecat et LiveKit sont intégrés pour les applications vocales en temps réel.
Ces connecteurs open source ne contiennent pas le modèle vocal Murf. Leur exécution nécessite toujours une clé API et engendre des frais cloud ; la clé ne doit pas être intégrée au client ni mise en répertoire public.
Est-ce open source ?
Murf Studio, Dub, les modèles de son et les API cloud ne sont pas des projets open source, et il n’existe pas non plus de version entièrement auto-hébergée. Le SDK officiel, MCP et les exemples d’intégration peuvent être open source, mais cela ne signifie pas que les services principaux le soient également.
Les entreprises ayant des exigences strictes en matière de stockage des données et de déploiement sur réseau privé peuvent consulter Falcon On-Prem ou des solutions sur mesure ; la disponibilité doit être confirmée au titre d’un contrat.
À qui s’adresse-t-il ?
- Créateurs de cours, publicités, démonstrations de produits et commentaires pour YouTube ;
- Équipe qui crée des vidéos de formation à l’aide de PPT, Slides et Canva ;
- Les entreprises ayant besoin de traduction et de doublage vidéo multilingue ;
- Organisation de la voix de la marque par clonage vocal ;
- Développeurs de Voice Agents, IVR, jeux et applications accessibles ;
- Plateformes nécessitant une TTS en temps réel à faible latence et une API de doublage par lots.
Avantages du produit
- Studio, Dub et API couvrent la création, la localisation et l’intégration de produits ;
- Plus de 300 sons Studio et plus de 30 langues ;
- Gen2 offre un contrôle précis de la performance, tandis que Falcon est conçu pour les conversations en temps réel.
- « Say It My Way » peut être mimé comme un exemple d’expression ;
- Prend en charge Canva, Slides, PowerPoint et les applications Windows ;
- L’écosystème officiel inclut SDK, MCP, Pipecat et LiveKit.
Restrictions et précautions
- Free ne peut pas être téléchargé et n’offre pas de droits commerciaux ;
- Les solutions Self-Service Creator et Business n’ont qu’un seul Éditeur ;
- La clonage de voix n’est pas une fonction auto-service ; la traduction et la collaboration relèvent principalement d’Enterprise.
- Les crédits Studio, Dub et API ne peuvent pas être échangés ;
- La régénération de l’audio consomme du VGT, les doublages multilingues augmentent les Credits en fonction de la langue et du fichier, tandis que l’API facture en fonction des caractères ou des minutes ;
- La voix, la transcription et la traduction par l’IA peuvent toutes commettre des erreurs ;
- Pour Clone, VoiceChanger et Dubbing, il est nécessaire d’obtenir des autorisations pour les sons et les matériaux, ainsi que de réaliser un contrôle qualité manuel sur le contenu important.
Questions fréquentes
Murf est-il gratuit ?
Studio propose un plan gratuit comprenant 10 minutes de génération de voix et 10 projets, mais sans possibilité de téléchargement et sans droits commerciaux. Dub et API disposent eux aussi de leurs propres crédits d’essai.
Combien coûte Murf ?
Pour Studio, le tarif mensuel annuel est de 19 $ pour les créateurs et de 66 $ pour les entreprises ; une tarification sur mesure est disponible pour Enterprise ; pour Dub, le paiement à l’utilisation est de 1 $ par crédit.
L’API TTS PAYG coûte 0,03 dollar pour chaque 1000 caractères.
Murf prend-il en charge le chinois ?
Il prend en charge le chinois et divers accents, mais Studio, API et Dub offrent un nombre différent de langues et de voix ; il convient d’écouter la voix souhaitée dans le produit correspondant avant d’acheter.
Est-il possible de cloner sa propre voix ?
C’est possible, mais le clonage de voix personnalisé n’est pas une fonction autonome ordinaire ; il nécessite l’aide d’une équipe Enterprise et doit être activé en tant que service supplémentaire.
Murf a-t-il une autorisation commerciale ?
Tous les forfaits Studio payants accordent des droits commerciaux ; le forfait Business inclut en plus une licence d’entreprise. Les droits relatifs au contenu déjà créé restent valables après annulation, mais l’utilisateur doit posséder les droits sur le script et les éléments visuels.
Murf a-t-il une API ?
Il existe des API pour le TTS, le changement de voix, la diffusion en streaming, WebSocket, la traduction et le doublage, ainsi qu’un SDK Python, MCP et diverses intégrations de Voice Agents.
Murf est-il open source ?
La plateforme et les modèles principaux ne sont pas open source. L’SDK officiel, MCP ainsi que les exemples d’intégration sont partiellement open source, mais dépendent néanmoins de l’API cloud Murf et des quotas payants.
Numéro d’enregistrement de sécurité publique du Guangxi : 45132202000164