Xunfei entend
Plateforme audio offrant la transcription de fichiers audio, le simultané, les sous-titres et des services de conférence
Étiquettes :Outils audio IAQu’est-ce que Xunfei Yingjian ?
Xunfei Tingjian est une plateforme de transcription vocale par IA gérée par Anhui Tingjian Technology Co., Ltd., et qui s’appuie sur les capacités de reconnaissance vocale de iFlytek ainsi que sur le grand modèle cognitif Xinghuo. Elle permet de convertir des réunions, des interviews, des cours, des formations, des podcasts et des vidéos en texte avec une chronologie, tout en assurant la distinction des interlocuteurs, l’organisation du texte, la traduction complète, la rédaction de comptes rendus de réunion par IA, la création de cartes mentales et des questions-réponses sur le contenu.
Xunfei Tingjian fait partie de la plateforme SaaS pour un bureau intelligent de iFlytek, et est associée à Xunfei Writing, Xunfei Simultaneous Translation, Xunfei Meetings ainsi qu’aux services de traduction audiovisuelle. Les utilisateurs individuels peuvent l’utiliser via le site web, une application pour ordinateur, une application mobile et un mini-programme WeChat.
Les entreprises peuvent également acheter des parts de partage, des services sur mesure ou des solutions de privatisation.
Fonctionnalités clés
1. Transcription en temps réel d’enregistrements audio
Les utilisateurs peuvent enregistrer audio tout en visualisant le texte reconnu sur un site web, par ordinateur ou sur smartphone, ce qui est idéal pour les réunions en direct, les cours, les interviews et les notes vocales personnelles. La version ordinateur permet de choisir entre le microphone, le son intégré à l’ordinateur ou une combinaison des deux pour l’enregistrement. Le mode sous-titres flottants affiche le texte en temps réel dans une petite fenêtre, facilitant ainsi la consultation simultanée du logiciel de réunion, du diaporama ou d’autres pages.
La précision de la transcription en temps réel dépend de la distance par rapport au microphone, du bruit ambiant, de la vitesse de parole, de l’accent et du fait que plusieurs personnes parlent en même temps. Le taux de précision de 98 % annoncé officiellement pour les enregistrements clairs en mandarin provient de conditions d’évaluation spécifiques et ne signifie pas que ce niveau puisse être atteint dans tous les contextes.
2. Importer la transcription audio/vidéo
Les utilisateurs peuvent télécharger des fichiers audio et vidéo enregistrés ; le système les traite en ligne et génère du texte. Les formats actuellement pris en charge par l’entreprise incluent MP3, WAV, PCM, M4A, M4V, AMR, WMA, AAC, MP4, MPG et 3GP.
Un seul fichier ne peut durer plus de 5 heures et faire plus de 2 GB ; jusqu’à 100 fichiers peuvent être téléchargés à la fois.
Dans des conditions normales de réseau et de volume de travail, les responsables affirment qu’un fichier audio de 1 heure peut être généré en environ 5 minutes. Le temps réel nécessaire dépend de la taille du fichier, de la qualité sonore, de la langue et de la file d’attente des services ; le terme « le plus rapidement possible » ne doit pas être interprété comme une promesse de livraison fiable.
3. Optimisation multilingue et par domaine professionnel
Xunfei Hearing indique actuellement qu’il prend en charge 11 langues, dont le chinois, l’anglais, le russe, le français et l’allemand, ainsi que l’optimisation des performances dans 17 domaines professionnels. Les utilisateurs peuvent également utiliser des dialectes et parler en mélangeant plusieurs langues ; la liste des langues disponibles varie en fonction de l’entrée d’accès, du pack d’avantages et de la version.
L’optimisation dans les domaines spécialisés peut améliorer le taux de reconnaissance des termes courants, mais les noms de personnes, les noms de médicaments, les modèles, les abréviations, les chiffres et les noms d’institutions doivent encore être vérifiés manuellement. Les documents juridiques, médicaux, financiers et académiques ne peuvent pas se fier uniquement à la transcription automatique.
4. Distinction entre locuteurs
Le système peut automatiquement attribuer les interventions dans les enregistrements audio multilieux à des rôles différents, ce qui facilite la lecture des dialogues de réunion et des contenus d’interviews. Les utilisateurs peuvent modifier les noms des rôles après la transcription, afin de rendre les comptes rendus plus faciles à comprendre.
Plusieurs personnes qui parlent en même temps, l’enregistrement à distance ou des voix similaires peuvent entraîner une confusion entre les personnages. Les étiquettes des locuteurs ne sont qu’un résultat d’identification et ne constituent ni une authentification ni une preuve.
5. Optimisation pour les mots-clés populaires
Avant le téléchargement, vous pouvez ajouter le nom du projet, le nom du produit, les noms de personnes et des termes sectoriels en tant que mots clés, afin d’aider le modèle à identifier en priorité les mots moins courants. La règle actuelle autorise jusqu’à 200 mots clés en chinois, chacun pouvant compter de 1 à 16 caractères, pour une longueur totale maximale de 1000 caractères.
Les mots-clés doivent être des termes facilement confondables et réellement fréquents ; un trop grand nombre de mots sans rapport peut nuire à l’efficacité réelle. Les noms de clients sensibles ou les noms de projets non divulgués doivent également faire l’objet d’une décision, conformément à la politique de données de l’organisation, quant à leur transmission dans le cloud.
6. Compte rendu de la réunion sur l’IA
Une fois la transcription terminée, Xunfei Shengdian peut générer des comptes rendus de réunion structurés à partir du texte intégral, en extrayant les thèmes, les points clés et les tâches à effectuer. Les utilisateurs peuvent vérifier le contenu en combinant le texte original avec la chronologie de l’enregistrement, ce qui est idéal pour les réunions de projet, les communications commerciales, les entretiens d’embauche et l’analyse des formations.
Le compte rendu de l’IA est une synthèse du modèle et n’équivaut pas au procès-verbal officiel confirmé par les participants. Il peut omettre des conditions, interpréter à tort des relations négatives ou présenter des suggestions comme des décisions ; avant sa publication, il est nécessaire de confirmer les responsables, les délais, les chiffres et les conclusions.
7. Aperçu du texte complet, structuration du discours et insights de l’IA
Un aperçu du texte complet aide les utilisateurs à comprendre rapidement le thème d’enregistrements longs ; la structuration du discours supprime certaines répétitions orales et les mots modaux, organisant le langage oral en une expression écrite plus cohérente.
Les analyses d’IA et les organigrammes transforment les informations en structures hiérarchiques, afin d’aider à organiser les idées, les relations et les pistes de décision.
La structuration du texte modifie la formulation originale, ce qui permet d’améliorer l’efficacité de la lecture, mais elle ne remplace pas les témoignages mot pour mot, les citations journalistiques ou les documents de preuve juridique. Lorsqu’il est nécessaire de conserver le texte original, il convient de garder à la fois le manuscrit brut non structuré et l’enregistrement audio d’origine.
8. Traduction intégrale et traduction en temps réel
L’enregistrement en temps réel affiche les résultats de la traduction, et une fois l’enregistrement terminé, il est possible de choisir la langue et de sauvegarder le texte traduit. Selon les indications officielles, les résultats de la traduction en temps réel ne sont utilisés que pour visualisation pendant l’enregistrement et ne sont pas sauvegardés directement.
La version linguistique générée après l’enregistrement peut être sélectionnée et enregistrée.
La traduction automatique peut mal interpréter les termes techniques, les noms, les chiffres, le jargon et les phrases longues. Les contrats internationaux, les discours publics et les sous-titres doivent être révisés par des professionnels de la langue cible.
9. Notes et notes diverses
Pendant l’enregistrement, il est possible d’ajouter des notes pour indiquer les endroits qui nécessitent des questions supplémentaires ou une révision approfondie. Lors de l’export du texte, le contenu correspondant s’affiche en surbrillance, ce qui facilite la combinaison des jugements immédiats et de la transcription automatique.
10. Partager et télécharger
Une fois l’enregistrement terminé, il peut être partagé par lien ou code QR ; le contenu peut inclure l’audio original, la transcription écrite et des notes. Lors du téléchargement, il est possible de sélectionner en combinaison le résultat de la transcription, la mise en forme du texte, le locuteur, le résumé généré par l’IA, les notes et l’audio.
Les documents déverrouillés en paiement permettent un téléchargement en masse, jusqu’à 50 exemplaires par fois, et sont sauvegardés sous forme de fichier compressé.
Les liens partagés peuvent contenir l’audio original ainsi que des transcriptions détaillées sensibles ; il convient de contrôler le cercle des destinataires et de les supprimer régulièrement. Une fois les fichiers téléchargés en dehors du système de permissions de la plateforme, il est encore plus nécessaire de les protéger à l’aide de services de stockage en réseau organisationnel, de chiffrement et de contrôle d’accès.
Paket de transcription audio et pack Enjoy
Xunfei Hearing divise actuellement les droits des utilisateurs en un forfait de transcription d’enregistrements et un forfait Enjoy. Le forfait de transcription d’enregistrements permet de transcrire les fichiers audio enregistrés via une application mobile ou un client informatique, ainsi que les liens de podcasts, avec 3000 minutes par mois incluses ;
Le forfait Premium ajoute à cela la possibilité d’importer des transcriptions audio, avec 6000 minutes par mois, ainsi que l’accès à des transcriptions en temps réel grâce aux grands modèles de voix IA pour le cantonais, le mandarin, l’anglais et divers dialectes.
La durée de validité des deux types de forfaits est d’un mois, et ils prennent fin une fois épuisés. Un même avantage ne peut pas être utilisé en même temps au sein du forfait en cours ; après un achat supplémentaire, il faut généralement attendre l’expiration des avantages existants pour qu’il devienne applicable.
La transcription des commandes suit la règle du paiement intégral : si un seul droit n’est pas suffisant pour couvrir l’ensemble de l’enregistrement audio, il n’est pas possible de procéder à un paiement fractionné, mais plusieurs cartes de durée peuvent être combinées lorsque cela est autorisé par les règles.
Indications de prix
La documentation d’aide publiée sur le site officiel présente principalement la durée des avantages et les règles de paiement ; le montant en temps réel doit être confirmé en se connectant à la page d’achat. Sur l’App Store en Chine, le prix mensuel forfaitaire pour les packs de transcription de enregistrements actuellement listés est de 6 yuans pour le premier mois et de 18 yuans à partir du mois suivant ; selon la description du produit pour les appareils mobiles, la durée de transcription des enregistrements via l’application est de 30 heures par mois.
Cela ne correspond pas aux forfaits de 3000 minutes ou 6000 minutes décrits dans les nouvelles informations des avantages sur le site officiel ; il s’agit de canaux et de définitions de produits différents, et ils ne peuvent pas être directement échangés.
Les abonnés peuvent également être classés en différents niveaux de cartes mensuelles, annuelles, en fonction de la durée d’utilisation rapide de la machine, de la transcription en période creuse et de coupons. La plateforme peut ajuster les frais et les avantages ; la durée non utilisée peut être annulée à l’expiration de la période valide.
Avant d’effectuer l’achat officiel, il convient de vérifier si la fonction « importation de fichiers » est disponible, si seules les enregistrements sont autorisés, combien de minutes sont incluses, si le tri par IA entraîne des frais supplémentaires, ainsi que les règles de renouvellement automatique.
Service de transfert génétique artificiel
En plus de la transcription automatique, iFlytek Listen propose également une transcription manuelle de haute qualité, permettant de choisir des documents avec des personnages identifiés, des documents ordinaires, des sous-titres, des sous-titres avec timestamps, ainsi que une organisation fluide, une transcription mot à mot ou phrase par phrase ou un résumé du contenu. Les délais normaux et les services express sont facturés en fonction de la qualité audio et de l’évaluation de la commande.
Selon la page publique actuelle, le tarif horaire pour les codes temps est de 25 yuans/horaire ; pour les commandes urgentes approuvées en semaine de 9h00 à 18h00, un supplément de 30 % est appliqué, et de 50 % de 18h00 à 22h00.
Le prix total de la transcription manuelle est indiqué sur la page de commande en fonction de la langue, de la qualité, des exigences de mise en forme et du délai requis.
Xunfei Interprétation en temps réel et services de conférence
Xunfei Real-time Translation offre une transcription vocale en temps réel multilingue, une traduction, des sous-titres bilingues et une exportation de documents audio, idéale pour les conférences interlangues, les diffusions en direct et les événements. Xunfei Meetings ajoute quant à lui les visioconférences, le partage d’écran et la collaboration en groupe.
Elles sont liées au système de comptes iFlytek Hearing et à la plateforme de bureautique intelligente, mais appartiennent à des produits et des avantages de paiement distincts ; il ne faut donc pas considérer par défaut les packs de transcription Hearing comme des abonnements à des services de simultané ou de conférence.
Services aux entreprises et privatisation
Les entreprises peuvent acquérir des droits d’interprétation partagée pour leurs employés, ainsi que des services de personnalisation et de support technique sur mesure. Elles peuvent également demander des solutions SaaS privatisées. La page officielle pour les entreprises indique que le service est compatible avec Windows, macOS et les ordinateurs HarmonyOS, ainsi qu’avec les versions web, et avec Android, iOS et les appareils mobiles HarmonyOS ; il intègre en outre des moteurs d’interprétation en chinois, anglais, japonais et coréen.
Le déploiement en mode privé, la concurrence, le système d’identifiants, le stockage des données, les langues des modèles et les niveaux de service doivent faire l’objet d’une proposition de prix en fonction des besoins de l’entreprise. Lors de l’achat, il convient de vérifier si l’audio quitte le réseau privé, les méthodes de mise à niveau et de maintenance, l’audit des journaux, la reprise après sinistre, les ensembles de test pour l’exactitude de la transcription ainsi que le mécanisme de suppression des données.
API pour les développeurs
La plateforme ouverte iFlytek propose une API de transcription de fichiers audio, mais il s’agit d’un produit destiné aux développeurs indépendants et non d’un avantage réservé aux abonnés iFlytek. La transcription standard de fichiers audio prend en charge des enregistrements d’une durée maximale de 5 heures et d’une taille maximale de 500 MB ; les formats couramment supportés incluent WAV, FLAC, OPUS, M4A et MP3. Elle permet de reconnaître le mandarin, l’anglais, ainsi que diverses langues et dialectes disponibles à l’achat ou en essai.
L’interface ancienne suivait un processus de prétraitement, de téléchargement en fragments de fichiers, de fusion, de suivi des progrès de la recherche et de récupération des résultats ; l’interface standard nouvelle permet de créer directement des commandes et de consulter les résultats.
L’interface utilise l’identifiant de l’application et une signature pour l’authentification. Les documents standards exigent que chaque application effectue moins de 20 requêtes par seconde, et les résultats des commandes sont généralement supprimés après 72 heures ; les anciens documents d’interface mentionnaient également une période de conservation de 30 jours ; lors du développement, il convient de se référer à la version d’interface réellement utilisée.
La plateforme ouverte iFlytek met également à disposition un grand modèle de transcription de fichiers audio ; la page de la version standard officielle indique qu’il prend en charge davantage de dialectes et de langues. Les forfaits gratuits, les forfaits par durée et le nombre de connexions simultanées sont calculés via la console de la plateforme ouverte, et ne peuvent pas faire l’objet du tarif mensuel de l’application iFlytek Hear.
Plateforme de support
- Interface web ;
- Clients pour ordinateurs Windows et macOS ;
- Applications pour téléphones Android et iOS ;
- Version HarmonyOS ;
- Mini-programme WeChat ;
- API Web de la plateforme ouverte iFly;
- Privatisation des entreprises et accès sur mesure.
La version client PC offre également des fonctionnalités telles que l’enregistrement d’écran et les sous-titres flottants ; certaines fonctions ne sont disponibles que sur des systèmes spécifiques ou dans de nouvelles versions. Les anciens systèmes peuvent utiliser une version compatible, mais il convient de se référer aux instructions actuelles du centre de téléchargement.
Statut open source
Xunfei Tingjian est un service SaaS commercial ; ses fonctionnalités principales telles que la transcription, les comptes rendus par IA, la traduction et la plateforme d’entreprise ne sont pas open source. La plateforme officielle fournit des documents API, du code d’exemple et certains SDK, mais cela ne signifie pas que le produit Xunfei Tingjian puisse être déployé de manière indépendante.
Lorsqu’une entreprise a besoin de privatisation, elle doit acquérir la solution correspondante.
Guide d’utilisation de iFlytek Hearing
Terminer une tâche de base
- Vérifier l’enregistrement, le son, la musique et l’autorisation des participants ;
- Téléchargez ou saisissez un audio clair dans iFlytek Hearing.
- Sélectionner les paramètres de traitement tels que la langue, le locuteur et la transcription en temps réel ;
- Utiliser la transcription d’audio et de vidéo importée pour générer des transcriptions, du doublage ou des résultats de nettoyage ;
- Vérifier par segment le nom, les chiffres, les pauses, le volume et l’émotion ;
- Vérifiez le format, le niveau de loudness, les droits d’auteur et les exigences de confidentialité avant d’exporter ;
Créer des flux de travail professionnels réutilisables
- Créer un ensemble de test avec du bruit réel, des accents et des extraits multiples ;
- Comparer les différences de traitement entre la transcription en temps réel, l’importation de transcriptions audiovisuelles, ainsi que les optimisations pour plusieurs langues et domaines spécialisés ;
- Conserver l’enregistrement original et la transcription non modifiée ;
- Organiser une audition par un humain avant la publication externe ;
- Statistiques sur la durée de traitement, le taux d’erreurs et la consommation de crédit ;
- Mettre à jour régulièrement le glossaire, les autorisations sonores et la politique de suppression ;
À qui s’adresse-t-il ?
- Personne qui organise les enregistrements de réunions, d’interviews, de cours et de formations ;
- Équipe nécessitant de générer rapidement des scripts mot par mot et des comptes rendus à partir de vidéos longues ;
- Éditeur de sous-titres, de scripts pour podcasts et de matériel médiatique ;
- Organisations ayant besoin de transcription en mandarin, en dialectes et en multilingue ;
- Projets professionnels nécessitant une traduction manuelle, des codes temps et une livraison express ;
- Les entreprises souhaitant acquérir des droits d’accès partagés, une API ou une transcription privatisée.
Avantages du produit
- Deux processus de transcription complets : enregistrement en temps réel et import local d’audio et de vidéo ;
- Soutien à la distinction des locuteurs, aux mots clés et à l’optimisation pour les domaines spécialisés ;
- Synthèse de l’IA intégrée, aperçu, organisation, traduction et cartes mentales ;
- Couverture multi-plateformes : Web, ordinateurs, téléphones portables, HarmonyOS et mini-programmes ;
- Nous proposons en même temps la transcription automatisée, la retranscription manuelle de qualité, la traduction simultanée et des solutions pour les entreprises ;
- La plateforme ouverte iFlytek propose un chemin d’accès API indépendant.
Restrictions et précautions
- L’utilisateur doit disposer des droits légaux pour enregistrer et télécharger du contenu, et obtenir les consentements nécessaires avant d’enregistrer une réunion, une interview ou un appel.
- Le protocole de la plateforme exige expressément que les utilisateurs soient responsables de la source audio et des droits des tiers ;
- Le taux de précision de la publicité ne s’applique qu’à des conditions de test spécifiques ;
- Le bruit, les dialectes, les interventions superposées et le jargon peuvent entraîner des erreurs. La mise en forme et la rédaction par l’IA modifient en outre davantage le sens original ; il convient d’écouter à nouveau les contenus importants pour les vérifier.
- Les forfaits individuels sont différenciés selon l’entrée et le canal, la durée d’enregistrement n’est pas toujours couverte par le paiement du fichier importé, et l’abonnement à l’App Store n’équivaut pas au forfait complet sur le site officiel.
- Les droits peuvent expirer et être annulés, veuillez vérifier la description du produit avant d’acheter.
Questions fréquentes
Xunfei Tingyan est-il gratuit ?
Il est possible de s’inscrire pour essayer certaines fonctions de transcription et d’IA ; pour une utilisation continue, il est nécessaire d’acheter un pack de transcription, un pack illimité, une carte de durée ou un service unique. Les quantités offertes sont indiquées sur la page du compte.
Quels fichiers Xunfei Hearing prend-il en charge ?
La plateforme personnelle prend actuellement en charge MP3, WAV, PCM, M4A, M4V, AMR, WMA, AAC, MP4, MPG et 3GP ; la durée maximale d’un fichier est de 5 heures et sa taille maximale est de 2 GB.
Quelle est la différence entre le pack de transcription audio et le pack Enjoy ?
L’abonnement de transcription d’enregistrements couvre principalement les enregistrements depuis des applications, d’un ordinateur et des liens de podcasts, soit 3000 minutes par mois ; l’abonnement premium inclut également l’importation d’audio, soit 6000 minutes par mois, ainsi que des fonctionnalités supplémentaires comme la conversation multilingue.
Xunfei Yingjian peut-il générer des comptes rendus de réunion ?
Il est possible de générer des comptes rendus de réunions par IA, des aperçus, des organigrammes et des listes de tâches, mais une validation manuelle en combinant le texte original et l’enregistrement audio est obligatoire.
Xunfei Hearing propose-t-elle une API ?
La plateforme ouverte iFlytek propose une API de transcription de fichiers audio indépendants ainsi que des interfaces pour les grands modèles, dont les frais sont calculés séparément de ceux de l’abonnement personnel Xunfei Tingjian.
Xunfei entend-il OpenSource ?
Pas de code source ouvert. Il s’agit d’un service cloud commercial ; les exemples d’API et les SDK ne signifient pas que le code source du produit principal est accessible.
Numéro d’enregistrement de sécurité publique du Guangxi : 45132202000164