Xunfei ZhiZuo
Plateforme de création offrant des voix d’IA multijoueurs, multilingues et émotionnelles
Étiquettes :Outils audio IAQu’est-ce que iFlytek SmartWrite ?
Xunfei ZhiZuo est une plateforme de création audiovisuelle basée sur l’IA, lancée par iFlytek à l’intention des créateurs de contenu, des établissements éducatifs, des médias et des entreprises. Ses fonctionnalités principales comprennent la conversion de texte en voix, la doublage par plusieurs personnes, la reconstitution de voix, les présentations par des personnages virtuels et la génération de vidéos. Les utilisateurs peuvent saisir un texte dans leur navigateur, choisir le timbre de voix et les paramètres de narration pour convertir du texte en audio, ou faire en sorte que des personnages numériques lisent un texte pour créer des vidéos.
Il convient mieux à la production standardisée et en série de contenu chinois, tels que les commentaires pédagogiques, les descriptions pour vidéos courtes, les bulletins d’information, la formation professionnelle, les présentations publicitaires et le contenu audio. L’interface web de iFlytek SmartWrite est un outil de création de produits finis ;
Les développeurs qui ont besoin d’appeler automatiquement les capacités de synthèse vocale dans des applications, des sites web ou des systèmes d’entreprise doivent utiliser séparément l’API vocale de la plateforme ouverte iFly.
Les droits, les limites et les modes de facturation des comptes des deux peuvent être différents.
Fonctionnalités clés de iFlytek Smart Creation
Conversion texte en parole par IA
Après avoir collé son texte, l’utilisateur peut choisir des timbres de voix de différents genres, âges, styles linguistiques et contextes d’utilisation, et ajuster le rythme, le volume, les pauses ainsi que la musique de fond. Pour les titres, les noms propres, les chiffres, les abréviations en anglais et les mots à plusieurs prononciations, il est conseillé d’écouter d’abord, puis de corriger phrase par phrase en utilisant des pauses ou des paramètres de prononciation.
Les longs textes peuvent être divisés en paragraphes pour attribuer des rôles, ce qui réduit le coût de reprise globale après une seule génération.
Double narration et expression émotionnelle
La plateforme peut assigner des locuteurs différents à chaque paragraphe, ce qui convient aux dialogues, interviews, histoires et contenus pédagogiques. Certaines voix permettent de créer des styles ou des tons tels que le journalisme, le service client, l’approche chaleureuse ou la gravité, mais les options disponibles dépendent de la voix actuelle et des droits associés au compte.
La synthèse émotionnelle ne permet pas de comprendre pleinement le contexte ; elle nécessite une écoute humaine lorsqu’il s’agit d’ironie, de questions rhétoriques, de jargon spécialisé ou d’une forte dimension dramatique.
Recréation du son
La reproduction de la voix consiste à créer un timbre personnel en enregistrant ou en téléchargeant des échantillons vocaux conformes, puis à utiliser du texte pour générer une voix similaire. Plus l’environnement d’enregistrement est calme et plus la prononciation est stable, plus le résultat de la reproduction est généralement naturel.
Les différentes options de reproduction peuvent présenter des différences en termes de durée d’échantillon, de qualité d’entraînement, de durée d’utilisation, de volume de génération et de licence commerciale ; il convient de consulter les informations sur la page actuelle avant achat.
La voix fait partie des informations biométriques sensibles. Seule la voix de la personne concernée ou une voix pour laquelle une autorisation explicite a été obtenue peut être reproduite ; il est interdit de se faire passer pour autrui, de falsifier les paroles de personnalités publiques, ainsi que d’utiliser cette voix à des fins de fraude, de harcèlement ou pour contourner les mécanismes de vérification d’identité.
Lorsque les entreprises personnalisent des timbres de voix pour leurs employés, formateurs ou ambassadeurs, elles doivent conserver les limites de l’autorisation, la durée d’utilisation et le mécanisme de retrait.
Vidéos de personnes virtuelles et numériques
L’utilisateur peut choisir un présentateur virtuel fourni par la plateforme, entrer le texte à lire et configurer l’arrière-plan, le ratio d’image, les sous-titres et la voix off pour créer une vidéo de narration numérique. Cette méthode convient aux explications théoriques, aux présentations de produits, à la promotion des magasins, aux annonces de formation et aux rubriques d’information.
La clarté, la posture, la durée et les droits d’exportation des différents avatars peuvent être soumis à des restrictions liées au forfait ; les avatars personnalisés nécessitent généralement une collecte et une estimation séparées.
Doublage vidéo et sous-titres
Dans les flux de travail audiovisuels, il est possible de générer des commentaires à partir de documents ou d’images existants et d’y associer des sous-titres, ce qui réduit le besoin d’enregistrements vocaux en direct et de montages répétés. La ponctuation automatique, la timeline des sous-titres et la correspondance avec les mouvements des lèvres peuvent présenter des erreurs ; il convient donc de vérifier avant publication les éléments à haut risque tels que les noms de personnes, les montants, les dates, les unités, les noms de médicaments et les termes juridiques.
Gestion de projets et de matériaux
La station de travail en ligne permet de sauvegarder des documents, des fichiers audio et vidéo, ce qui facilite les modifications et les exports ultérieurs. La durée de conservation des projets, l’espace de stockage cloud, le nombre d’exports et les droits de collaboration en équipe sont déterminés selon la page du compte actuel.
Il est recommandé de télécharger en temps voulu les produits finaux importants sur un disque local ou dans le stockage de l’entreprise, et de ne pas considérer les projets en ligne comme la seule sauvegarde.
Comparaison des forfaits et des versions de facturation de iFlytek SmartWork
L’interface d’achat de iFlytek SmartWork affiche différentes options en fonction des promotions, du type de compte, des modules de produit et des besoins personnalisés ; certains prix ne sont visibles qu’après connexion. Les prix des abonnements initiaux circulant sur Internet ne doivent pas être considérés comme les prix actuels de vente. Ci-dessous, une comparaison est effectuée selon les méthodes d’achat réelles ; les montants qui ne peuvent pas être vérifiés de manière fiable sur la page officielle actuelle ne sont pas indiqués.
| Version ou service | Contenu principal | Adéquat pour les utilisateurs | Facturation et modes d’achat |
|---|---|---|---|
| Essai gratuit | Essayez les fonctions de création de timbres, de doublage ou de vidéos ; la quantité, la durée et l’exportation peuvent être limitées. | Essai initial et test d’efficacité | La limite gratuite peut être ajustée selon la console après connexion. |
| Abonnement voix off ou pack de ressources | Augmenter la longueur du texte à synthétiser, les timbres de voix disponibles, les éléments et les fonctionnalités d’exportation | Utilisateurs de médias personnels, de contenu audio et de doublage quotidien | Acheter selon la période d’abonnement ou le quota de ressources, selon la page de règlement en vigueur |
| Solution vidéo de personnage virtuel | Image de l’avatar numérique, durée de diffusion, génération de vidéo et export en haute définition | Cours, informations, marketing et formation d’entreprise | Peut être facturé en fonction de la durée, du nombre d’occurrences, du membre ou du projet |
| Personnalisation de la voix ou de l’image | Recréation de timbres sonores exclusifs, avatar numérique en réalité virtuelle, services d’enregistrement et techniques | Formateurs, marques, médias et entreprises | Tarif indépendant selon la qualité, la portée des autorisations et le contenu des services |
| Services aux entreprises | Permissions d’équipe, production en série, actifs de marque, sécurité et support technique | Institutions et équipes de contenu à grande échelle | Contacter le service commercial pour obtenir un devis en fonction du nombre de connexions simultanées, de la consommation et des exigences de déploiement. |
| API de la plateforme ouverte iFly | Appeler la synthèse vocale en ligne ou des fonctionnalités similaires dans une application propre | Développeurs et équipes de produits | Activation indépendante et facturation selon les règles de l’interface, ce qui n’est pas équivalent à un abonnement sur le site web |
Lors du choix d’un forfait, il convient de comparer en priorité les timbres sonores disponibles, le nombre de mots synthétisés, le nombre de minutes vidéo, la qualité de l’exportation, les tâches simultanées, le nombre de timbres sonores personnalisables, les conditions d’utilisation commerciale et la durée de validité, plutôt que de se fier uniquement au nom du abonnement. Il faut également vérifier avant de payer si les packs de ressources sont périmés, si les crédits non utilisés peuvent être reportés, les conditions de remboursement ainsi que les règles relatives aux factures fiscales.
Comparaison des différentes méthodes de création
| Demande | Méthode de recommandation | Préparer les matériaux | Il faut vérifier en détail |
|---|---|---|---|
| Commentaire pour vidéos courtes | Texte à la voix | Script de voix après la phrase | Prononciation, pauses, vitesse de parole et droits d’auteur de la musique de fond |
| Dialogue ou histoire à plusieurs personnes | Doublage multi-rôles | Lignes de dialogue marquées par le personnage | Consistance du timbre des personnages et liaison entre les paragraphes |
| Voix de marque fixe | Reproduction de son ou timbre exclusif | Enregistrement propre de la personne ou du mandant | Autorisation, qualité des échantillons, durée de validité et champ d’application |
| Podcast numérique | Vidéo de personnage virtuel | Documents, contexte, matériel de marque | Mouvements des lèvres, sous-titres, gestes, clarté et autorisation d’utilisation de l’image |
| Synthèse en lot du système | API de la plateforme ouverte iFly | Création de compte, clés d’interface et programmes | Volume d’appels, concurrence, latence, format audio et sécurité des données |
Guide d’utilisation de la voix synthétique AI de iFlytek
- Mettre en forme le document :Supprimer la navigation du site et les symboles inutiles, transformer les phrases longues en phrases courtes adaptées à la lecture à voix haute, et vérifier les faits ainsi que les droits d’auteur.
- Nouveau projet de doublage :Connectez-vous à la console, sélectionnez l’option de doublage ou de conversion texte en voix, puis collez le texte.
- Sélectionner le timbre :Écoutez plusieurs locuteurs en fonction du contenu cible, et ne vous basez pas uniquement sur le nom de la timbre de voix.
- Configurer la diffusion :Ajuster la vitesse de parole, le volume, les pauses et les mots polysyllabiques ; pour le contenu à plusieurs personnes, désigner un personnage pour chaque paragraphe.
- Écoute par segments :Vérifier principalement les pauses erronées causées par les noms, les noms de lieux, les langues étrangères, les chiffres, les unités et la ponctuation.
- Ajouter de la musique :Contrôlez le volume de la musique de fond et assurez-vous que la musique, les effets sonores et les éléments ont les droits d’édition ou commerciaux appropriés.
- Générer et exporter :Une fois le montant prévu de consommation confirmé, générer, télécharger le format audio requis et enregistrer le document final.
Tutoriel de création de vidéos avec des avatars virtuels
- Déterminez d’abord le ratio paysage ou portrait, la durée souhaitée et la plateforme de publication, puis rédigez un texte parlé.
- Choisir l’avatar virtuel et le timbre de voix appropriés, et vérifier si cet avatar est inclus dans le plan actuel.
- Configurez l’arrière-plan, le titre, les sous-titres, les images ou les éléments de marque pour éviter que les informations importantes ne dépassent la zone sécurisée.
- Créez des prévisualisations de courts extraits pour vérifier les lèvres, la prononciation, les gestes et les sous-titres, sans générer immédiatement une vidéo complète et longue.
- Après modification du paragraphe concerné, générer le texte final ; lorsqu’il s’agit d’informations sur les prix, les politiques, la santé et les finances, effectuer une nouvelle vérification manuelle.
- Après l’exportation, visualisez la qualité de l’image et les sous-titres sur la plateforme cible, et indiquez selon les règles en vigueur si le contenu a été généré par l’IA ou s’il met en scène un avatar numérique.
Différences entre Xunfei Zhizuo et l’API de la plateforme ouverte Xunfei
Xunfei ZhiZuo est une plateforme de création de contenu visuel, adaptée à la création et à l’exportation d’œuvres après connexion manuelle ; la plateforme ouverte Xunfei est destinée au développement logiciel, permettant de générer automatiquement de l’audio dans les systèmes métier grâce à des clés et des interfaces.
Les noms des timbres audio, les quotas de membre et les ressources API accessibles depuis le site web ne sont pas nécessairement identiques ; il ne faut pas utiliser les requêtes internes du navigateur comme une interface publique.
Les développeurs doivent créer des applications séparément sur la plateforme ouverte, choisir un produit de synthèse vocale, consulter la quantité gratuite actuelle, les limites de concurrence, les formats audio et le tarif supplémentaire pour les dépassements, avant d’intégrer le service côté serveur. Les clés ne doivent être stockées que dans les paramètres de sécurité du serveur, et non dans l’interface web, les packages d’installation client ou les dépôts de code publics.
Est-ce open source
Xunfei Zhizuo est un service en ligne commercial ; sa plateforme de produits, ses modèles vocaux clés et son système de génération de personnes numériques ne sont pas des projets open source. Les exemples de code ou SDK publiés ne servent qu’à se connecter aux services officiels ; ils ne signifient pas que les poids des modèles, les données d’entraînement ou l’ensemble de la plateforme soient open source, ni qu’ils puissent être utilisés gratuitement en mode hors ligne.
À qui s’adresse-t-il
- Créateurs de contenu qui produisent des commentaires, des voix off, des histoires et des audios éducatifs ;
- Enseignants et institutions ayant besoin de commentaires pour les cours, de micro-cours et de vidéos de formation ;
- Entreprises qui produisent en masse des bulletins d’information, des publicités pour les magasins et des présentations de produits ;
- Les équipes ayant besoin d’une identité sonore de marque, d’employés virtuels ou de présentateurs numériques ;
- Développeurs qui souhaitent intégrer la synthèse vocale à leurs produits via une API.
Avantages et limites d'utilisation
- L’avantage de iFlytek Smart Production est sa solide expertise en technologie vocale chinoise, ainsi que son regroupement du doublage, de la reconstitution de voix et des vidéos de personnes numériques dans un flux de travail en ligne, permettant aux utilisateurs non professionnels de produire des contenus rapidement sans avoir besoin d’un studio d’enregistrement ni de logiciels de montage complexes.
- Pour le contenu régulier, répétitif et en masse, il permet de réduire considérablement le temps d’enregistrement ;
- La voix IA peut encore se tromper dans la prononciation des mots à plusieurs prononciations, des termes spécialisés et des langues étrangères, et la reproduction de la voix peut présenter un ton peu naturel ou des fluctuations de similarité.
- Les mouvements des lèvres, les gestes et l’expression émotionnelle des personnes numériques ne peuvent pas remplacer complètement la performance d’une personne réelle.
- Les quotas gratuits, la gamme de timbres et les règles des forfaits seront ajustés ; les projets commerciaux doivent vérifier l’autorisation en vigueur.
- Lorsqu’il s’agit de voix personnelles, de portraits et de données sensibles, une autorisation doit être obtenue et des mesures de sécurité doivent être mises en œuvre ;
Questions fréquentes
Est-ce que Xunfei Zhizuo est gratuit ?
Il est généralement possible de tester certaines fonctionnalités, mais le nombre de caractères utilisables, la durée des vidéos, les timbres sonores et les droits d’exportation peuvent être limités. Pour créer des contenus professionnels, il est possible d’acheter des abonnements, des packs de ressources ou des services sur mesure ; le prix réel est indiqué sur la page d’achat après connexion.
Xunfei Zhizuo peut-il cloner sa propre voix ?
La plateforme propose un service de reproduction de la voix. Il convient d’utiliser sa propre voix ou une enregistrement pour lequel une autorisation claire a été obtenue, et de procéder à l’enregistrement et à la vérification conformément aux exigences de la page ;
Il est interdit de reproduire la voix d’autrui sans autorisation.
Les doublages et vidéos générés peuvent-ils être utilisés à des fins commerciales ?
Il est nécessaire de respecter en même temps les exigences liées au forfait de compte, à l’autorisation des timbres vocaux ou des images, ainsi que les conditions relatives aux droits d’auteur des matériaux fournis. La génération payante ne résout pas automatiquement les problèmes de droits concernant les textes, les images, la musique, les polices de caractères, les portraits et les éléments de marque ; il convient de vérifier chaque élément avant toute publication commerciale.
L’abonnement iFlytek Smart Creator inclut-il une API ?
L’inclusion n’est pas prévue par défaut. L’abonnement en ligne Xunfei ZhiZuo et l’API de la plateforme ouverte Xunfei appartiennent à des systèmes de produits distincts ; les développeurs doivent s’inscrire séparément sur la plateforme ouverte et consulter les prix en temps réel ainsi que les règles d’appel.
Pourquoi ne trouve-t-on pas de prix fixe pour les membres
Les forfaits peuvent être influencés par des promotions, des comptes, des modules fonctionnels et des besoins personnalisés ; certains prix ne sont affichés qu’après connexion. Les montants indiqués dans les articles anciens peuvent être obsolètes, il convient donc de se référer à la page d’achat actuelle ou au devis officiel.
Numéro d’enregistrement de sécurité publique du Guangxi : 45132202000164