Fish Audio
Valeur ajoutée gratuite
Guide complet des outils d’IA Outils audio IA

Fish Audio

Plateforme de voix offrant la transcription texte en voix multilingue, le clonage de voix et des API

Étiquettes :

Qu’est-ce que Fish Audio ?

Fish Audio est une plateforme de voix IA destinée à la création de contenu, au doublage, à la localisation, aux produits vocaux en temps réel et à l’intégration pour les développeurs. Les utilisateurs peuvent entrer des scripts sur le site pour générer une voix naturelle, cloner instantanément une voix à partir d’enregistrements courts, entraîner des modèles de voix à long terme, créer des livres audio multijoueurs, modifier le timbre d’enregistrements existants, ainsi que réaliser des tâches telles que la transcription, la génération d’effets sonores pour la musique et les films, et la séparation des pistes audio.

Actuellement, la plateforme repose sur des modèles de voix tels que S2.1 Pro, S2 Pro et S1, tout en offrant une API REST, des interfaces en flux WebSocket, ainsi que des SDK en Python et JavaScript. Les abonnements en ligne et le solde API suivent deux systèmes de facturation distincts : les abonnés reçoivent des Credits mensuellement, tandis que l’API est principalement facturée en fonction du nombre d’octets UTF-8, de la durée audio ou du nombre de requêtes réussies ; il convient de déterminer le mode d’utilisation avant l’achat.

Texte à la voix

La conversion de texte en parole prend en charge plus de 80 langues, et peut gérer le chinois, l’anglais ainsi que des textes mixtes. Les utilisateurs peuvent choisir des voix publiques sur la plateforme, leur propre voix clonée ou des voix professionnelles, ajuster le rythme, l’émotion et le style de narration, puis exporter les fichiers au format MP3, WAV, PCM ou Opus.

Les chiffres, les dates, les monnaies, les abréviations, les noms de marques et le jargon spécialisé peuvent encore être mal prononcés. Pour un projet formel, il convient d’abord de créer un ensemble de tests de prononciation, d’écouter les scripts longs par segments, puis d’unifier les règles relatives aux noms propres et aux pauses.

S2.1 Modèle vocal Pro

Le S2.1 Pro est le modèle de production recommandé actuellement, axé sur l’amélioration de la qualité sonore, du délai du premier paquet et du débit. Il prend en charge les étiquettes de direction du langage naturel, les dialogues à plusieurs interlocuteurs, le basculement entre langues, le clonage audio en temps réel, l’audio en flux continu et des timestamps au niveau des mots, ce qui le rend adapté aux agents vocaux, aux personnages de jeu, aux histoires interactives et aux commentaires à grande échelle.

Le premier segment audio affiché sur le site officiel présente un délai d’environ 100 millisecondes ou dans la fourchette de 70 à 90 millisecondes, mais il s’agit d’une valeur indicative selon des conditions matérielles, géographiques, de texte et de réseau spécifiques, et ne garantit pas qu’elle sera atteinte pour toutes les requêtes. En environnement de production, il est également nécessaire de mesurer le réseau bout en bout, les files d’attente, le buffer du lecteur ainsi que les limites de concurrence.

S2 Pro et S1

Le S2 Pro est le modèle de la génération précédente ; il permet d’utiliser un langage naturel entre crochets pour décrire les émotions, le ton et les actions, et peut également générer des dialogues avec plusieurs interlocuteurs en même temps. Le S1 utilise des balises d’émotion entre parenthèses, ce qui est adapté à la compatibilité avec des flux de travail existants et à des effets sonores spécifiques.

Les différents modèles présentent des performances variables en ce qui concerne les étiquettes, les langues, les phrases courtes et les textes complexes. Lors du transfert de modèles, il ne suffit pas de remplacer les noms ; il faut également revoir la similarité du timbre, le rythme, les mots sensibles, les timestamps et le coût unitaire.

Clonage audio en temps réel

La clonage en temps réel permet d’extraire le timbre et le style de parole à partir d’un segment audio de référence, et d’utiliser cette voix pour la génération de paroles dans d’autres langues. De courtes séquences conviennent aux essais rapides ; plus l’enregistrement est propre, monosyllabique, sans musique et avec une prononciation stable, plus les résultats sont généralement fiables.

Une ressemblance de voix ne signifie pas que l’identité, les émotions et l’accent puissent être entièrement reproduits. Toute voix réelle doit faire l’objet d’un consentement explicite de la personne concernée, avec définition de l’usage, de la durée, de la région, des membres ayant accès et des modalités de suppression.

Il ne doit pas être utilisé pour se faire passer pour autrui, pour escroquer ou pour faire des déclarations trompeuses.

Améliorer la clonage de voix professionnelle

Le plan de site web distingue également la clonage améliorée et la Voix Professionnelle. La Voix Professionnelle nécessite généralement des processus d’enregistrement et de formation plus structurés, convient aux voix de marque à long terme, aux livres audio et aux projets exigeant une grande cohérence, et est limitée par le nombre de places disponibles pour les voix professionnelles parmi les abonnés.

Les emplacements de voix publiques, privées et professionnelles ne génèrent pas de minutes. Les voix publiques peuvent être accessibles à la communauté, tandis que les voix privées ne sont utilisables que par un compte ou une équipe.

Lorsqu’il s’agit d’acteurs, de clients et de voix de marques non publiées, il convient de privilégier les droits privés et de vérifier les paramètres de partage.

Design sonore

Voice Design permet de décrire par des mots l’âge, le timbre de voix, l’accent, la vitesse, le tempérament et l’usage, afin que le système génère plusieurs voix candidates. Il est idéal pour explorer rapidement des timbres de voix pour des personnages fictifs, des publicités et des jeux, sans avoir besoin de trouver au préalable des enregistrements audio de référence avec des personnes réelles.

La description textuelle peut produire des résultats similaires ou instables. Pour les personnages importants, il convient de conserver l’enregistrement audio de référence et le Voice ID, et de vérifier si la voix candidate est trop similaire à celle d’une personne réelle ou d’un personnage protégé.

Audio long pour plusieurs personnes et livres audio

L’interface web permet d’organiser plusieurs personnages et des scripts longs, afin de créer des podcasts, des dialogues, des livres audio et des projets avec des commentaires audio. La fonctionnalité multijoueur native de S2.1 Pro permet de changer de locuteur lors de la même génération, réduisant ainsi le travail de montage ultérieur.

Les textes longs sont sujets à l’accumulation d’accentuations, de décalages de personnages et de différences de volume. Il est recommandé de les générer par chapitres, de fixer la voix de chaque personnage, et de procéder à une écoute complète ainsi qu’à une normalisation du volume avant l’export final.

Changer de voix

Voice Changer convertit les enregistrements téléchargés en un autre type de voix, tout en préservant autant que possible le rythme et l’expression originaux. Il convient pour remplacer des commentaires temporaires par une voix de personnage uniforme, et peut également être utilisé dans des processus audio multilingues ou créatifs.

La musique de fond, le réverbère, les voix superposées et les bruits forts diminuent la qualité de la conversion. La modification de la voix n’affecte pas les droits d’auteur ni les exigences de consentement de l’enregistrement original ; tant le locuteur d’entrée que la voix cible doivent disposer d’une autorisation légale.

Transcription audio

L’ASR de Fish Audio peut convertir l’audio en texte avec des timestamps par intervalles, ce qui facilite les sous-titres, la recherche et la doublage ultérieur. L’API transcribe-1 est actuellement facturée en heures d’audio, arrondie à l’unité supérieure par seconde.

La superposition de plusieurs personnes, les dialectes, le bruit et les noms propres affectent la précision. Le droit, la médecine, la finance et les sous-titres publics nécessitent une relecture manuelle ; on ne peut pas considérer la transcription automatique comme une preuve littérale.

Musique, effets sonores et outils audio

L’application web propose également des outils pour générer de la musique et des effets sonores de films à partir de prompts, pour séparer les pistes audio ainsi que d’autres outils audio, adaptés à la création de matériel pour les vidéos courtes, les podcasts et les jeux. La consommation de Credits et les conditions d’utilisation commerciale peuvent varier selon les outils ; il convient de vérifier ces informations sur la page de génération.

La génération par IA ne garantit pas l’absence totale de litiges de droits d’auteur. Avant la publication, il convient de conserver un enregistrement de la génération, et de vérifier les conditions de la plateforme, le degré de similarité avec des exemples existants, ainsi que les exigences des canaux de diffusion ciblés concernant la musique générée par IA.

Plan gratuit

Gratuit à 0 dollar, pas de carte de crédit requise, 8000 Crédits par mois, estimation du site officiel : jusqu’à environ 7 minutes de génération ; jusqu’à 500 caractères par utilisation, avec 3 emplacements de voix publiques, vitesse de génération standard, clonage de voix amélioré et usage commercial.

« Jusqu’à 7 minutes » : selon un calcul de 600 à 625 Crédits par minute, la consommation réelle dépend du modèle, des fonctionnalités et des paramètres. Les Crédits mensuels ne constituent pas un solde permanent, et l’offre gratuite n’est pas adaptée pour stocker des sons nécessitant une stricte confidentialité.

Comparaison des prix et des versions

Forfait ou versionPrix, plafonds et avantages clés
Plus prixLa promotion actuelle du programme annuel montre un coût mensuel moyen de 5,5 dollars et 66 dollars pour l’année entière, alors que le prix initial sur la page est de 15 dollars par mois. 250 000 crédits sont fournis chaque mois, ce qui correspond à environ 200 minutes selon une consommation de base ; la longueur maximale d’un message est de 15 000 caractères, avec des sons publics illimités, 10 emplacements pour des sons privés, Voice Design, 1 emplacement pour un son professionnel, accès prioritaire aux modèles les plus récents, clonage amélioré et utilisation commerciale. Les remises anniversaires ou annuelles font partie de promotions en temps réel et le prix initial peut être rétabli une fois celles-ci terminées. Il convient de se référer à la monnaie, aux taxes, au prix de renouvellement et au délai de paiement indiqués sur la page de règlement.
Prix ProLa promotion actuelle du programme annuel Pro affiche un coût moyen de 37,5 dollars par mois et de 450 dollars pour l’année entière, alors que le prix initial sur la page est de 100 dollars par mois. 2 000 000 de crédits sont fournis chaque mois, ce qui correspond à environ 1620 minutes, 3 places pour des équipes, 30 000 caractères par utilisation, des slots audio publics et privés illimités, 5 slots audio professionnels, ainsi qu’une garantie de remboursement sur 7 jours. La garantie de remboursement dépend du canal d’achat, du volume d’utilisation et des règles de remboursement en vigueur ; tous les commandes ayant consommé une grande quantité de crédits ne donnent pas nécessairement droit à un remboursement. Les équipes doivent confirmer les droits des membres, le partage des projets et la propriété des voix avant l’achat officiel.
Prix MaxLe plan annuel Max indique un montant moyen de 749 dollars par mois et 8988 dollars pour l’année entière ; la page présente également le prix initial ou mensuel de 999 dollars/mois. 25 000 000 de crédits sont fournis chaque mois, ce qui correspond à environ 6250 minutes, 10 places pour des équipes et 15 emplacements pour des voix professionnelles, idéal pour les équipes de production fréquentes. Les crédits de Max ne sont pas convertis simplement selon un rapport uniforme par rapport aux minutes nominales, ce qui montre que différents modèles ou flux de travail peuvent présenter des différences. Les clients travaillant en grande quantité doivent effectuer des tests de coût en fonction des scripts réels, plutôt que d’acheter uniquement en fonction du nombre maximal de minutes.
Prix à l’utilisation de l’APIL’API ne prévoit pas de abonnement mensuel obligatoire ni de consommation minimale mensuelle. Pour S2.1 Pro, S2 Pro et S1 Text-to-Speech, le tarif actuel est de 15 dollars pour un million de caractères UTF-8. Selon les estimations officielles, un million de caractères équivaut à 180 000 mots en anglais ou à 12 heures de voix, mais les caractères chinois occupent généralement plus de bytes UTF-8, ce qui rend impossible une conversion directe en mots anglais. Le tarif actuel de l’ASR est de 0,36 dollar par heure audio, arrondi à l’unité supérieure par seconde ; Voice Design coûte 0,01 dollar par demande réussie. Les échecs, les tentatives de réessai, la segmentation de textes longs et la génération de plusieurs versions influencent le coût final.

Plus prix

L’offre promotionnelle actuelle du programme annuel affiche 5,5 dollars par mois en moyenne et 66 dollars pour l’année entière, tandis que le prix original sur la page est de 15 dollars par mois. 250 000 crédits sont fournis chaque mois, ce qui correspond à environ 200 minutes au maximum selon les besoins de base.

Jusqu’à 15 000 caractères par utilisation, avec des sons publics illimités, 10 emplacements pour des sons privés, Voice Design, 1 emplacement pour un son professionnel, priorité à l’utilisation des modèles les plus récents, clonage amélioré et utilisation commerciale.

Les remises anniversaires ou annuelles font partie des promotions en temps réel ; le prix original peut être rétabli une fois celles-ci terminées. Il convient de se référer à la monnaie, aux taxes, au prix de renouvellement et au délai de paiement indiqués sur la page de paiement.

Prix Pro

La promotion actuelle du programme annuel Pro affiche 37,5 dollars par mois en moyenne et 450 dollars pour l’année entière, alors que le prix initial sur la page est de 100 dollars par mois. 2 000 000 de crédits sont fournis chaque mois, ce qui correspond à environ 1620 minutes, 3 places pour des équipes, 30 000 caractères par message, des slots audio publics et privés illimités, 5 slots audio professionnels, ainsi qu’une garantie de remboursement sur 7 jours.

La garantie de remboursement doit être déterminée en fonction du canal d’achat, du volume d’utilisation et des règles de remboursement en vigueur ; tous les commandes ayant épuisé une grande partie de leur quota ne donnent pas nécessairement droit à un remboursement. L’équipe doit confirmer les droits des membres, le partage des projets et la propriété des voix avant d’effectuer une acquisition officielle.

Prix Max

Le plan annuel de Max affiche un montant moyen de 749 dollars par mois et 8988 dollars pour l’année entière ; la page indique également le prix initial ou mensuel de 999 dollars/mois. 25 000 000 de crédits sont fournis chaque mois, ce qui correspond à environ 6250 minutes, 10 places pour des équipes et 15 emplacements pour des voix professionnelles, idéal pour les équipes de production fréquentes.

Les Credits de Max ne sont pas convertis simplement en fonction d’un ratio uniforme par rapport aux minutes nominales, ce qui indique que les différents modèles ou flux de travail peuvent présenter des différences. Les clients travaillant en grande quantité doivent effectuer des tests de coût en se basant sur les scripts réels, plutôt que d’acheter uniquement en fonction du nombre maximal de minutes.

Solution d’entreprise Enterprise

Enterprise propose des devis sur demande, avec des solutions annuelles ou basées sur la consommation, des remises pour achats en gros, aucune conservation de données, des options de privatisation ou de déploiement local, des capacités liées à SOC 2 ainsi que du support personnalisé ; SSO peut encore être indiqué comme prochainement disponible sur la page de comparaison actuelle.

La suppression totale des données et le déploiement local exigent que des clauses soient inscrites dans le contrat et que la portée couverte soit vérifiée ; on ne peut pas supposer par défaut que toutes les entrées, journaux, sauvegardes et modèles audio ne seront pas conservés simplement parce que l’icône de l’entreprise apparaît sur la page.

Prix à l’utilisation de l’API

L’API ne impose ni abonnement mensuel obligatoire, ni dépense mensuelle minimale. Actuellement, le texte à la voix S2.1 Pro, S2 Pro et S1 coûte 15 dollars pour chaque million de caractères UTF-8.

Selon les estimations officielles, 1 million de caractères chinois équivaut à 180 000 mots en anglais ou à 12 heures d’enregistrement audio, mais les caractères chinois occupent généralement plus de octets UTF-8, ce qui rend impossible une conversion directe en mots anglais.

Actuellement, le tarif de l’ASR est de 0,36 dollar par heure audio, arrondi à l’unité supérieure par seconde ; Voice Design facture 0,01 dollar pour chaque demande réussie.

L’échec, la tentative de nouveau, la segmentation de textes longs et la génération de multiples versions modifient tous le coût final.

S2.1 Pro Free API

s2.1-pro-free coûte 0 dollar dans le cadre de la politique d’utilisation équitable, prend en charge 83 langues et est destiné aux tests, aux prototypes, au développement ainsi qu’aux petites entreprises. Il utilise le même modèle que S2.1 Pro, mais ne propose pas de délai de premier paquet, de protocole de traitement des données ou de garanties de services pour les entreprises ; la période d’accès gratuit et les règles peuvent également être modifiées.

Les modèles gratuits ne correspondent pas à un SLA de production illimitée. Les activités critiques doivent disposer de modèles payants, de tentatives de réessai en cas de délai, de mécanismes de coupure, de cache et de fournisseurs alternatifs, tout en vérifiant régulièrement les limites d’utilisation équitable.

Niveau de concurrence API

La limite de concurrence est déterminée en fonction du montant total prépayé par compte : les comptes Starter, avec un paiement total inférieur à 100 dollars, ont généralement une capacité de 5 tâches simultanées ; ceux de niveau Elevated, avec un montant atteignant 100 dollars, en ont 15.

Un volume élevé atteignant 1000 dollars correspond à 50 connexions simultanées ; pour Enterprise, c’est en fonction des spécifications du contrat.

Le nombre de concurrences n’est pas le nombre de requêtes par seconde, et il ne garantit pas de délai fixe. Les requêtes longues en flux occupent plus longtemps la connexion ; les développeurs ont besoin de files d’attente, de limitation du trafic, d’abandon exponentiel et d’observabilité.

REST, WebSocket et SDK

Les développeurs peuvent lancer une génération ordinaire via REST, recevoir de l’audio en flux via WebSocket, et utiliser les SDK officiels Python et JavaScript pour gérer le TTS, la transcription et les modèles de voix. L’interface permet de créer, de lister, de mettre à jour et de supprimer des voix, et peut également être intégrée à des frameworks de voix en temps réel tels que LiveKit et Pipecat.

La clé API doit être stockée du côté serveur ou dans un système de gestion de clés, et ne doit pas être écrite dans des pages web, des paquets mobiles ou des dépôts publics. Les systèmes en production doivent également valider le type de fichier, limiter la longueur du texte, enregistrer l’ID de la requête et gérer la rupture des connexions en flux continu.

GitHub et l’état open source

La plateforme web Fish Audio, l’API hébergée, le système de comptes et le marché des sons communautaires ne constituent pas des produits entièrement open source. GitHub officiel fournit le code source de Fish Speech, des ressources liées aux modèles, un SDK ainsi que des outils d’exploitation, mais le code public n’équivaut pas à une autorisation d’utilisation commerciale sans condition.

Le code de la branche principale actuelle de Fish Speech ainsi que les poids des modèles associés sont tous soumis à la Fish Audio Research License. L’utilisation à des fins de recherche et non commerciales est autorisée conformément à cette licence ;

Toute utilisation commerciale, y compris les opérations internes de l’entreprise, les produits payants, les services d’hébergement ou les API, nécessite une autorisation commerciale écrite distincte de la part de Fish Audio.

Les informations sur Apache ou CC-BY-NC-SA dans les anciennes pages peuvent correspondre à des versions historiques ; il convient de se référer à la licence actuelle accompagnant la version utilisée pour prendre une décision.

Déploiement local

La documentation officielle Fish Speech propose des méthodes d’installation sous Linux ou WSL, avec Docker, une WebUI et un serveur API ; pour l’inference de la série S2, on recommande environ 24 GB de mémoire vidéo, et une solution basée sur le CPU est également disponible. Les entreprises peuvent également consulter des options de déploiement dans des VPC, en local, dans des clouds souverains ou sur des réseaux isolés.

Le fait de pouvoir télécharger et exécuter un modèle ne signifie pas obtenir le droit de le déployer à des fins commerciales. Avec l’hébergement auto-géré, il faut également assumer les coûts liés aux GPU, la sécurité des modèles, les mises à jour, la protection contre les abus, ainsi que la conformité en matière de journaux et de données ; pour les projets commerciaux, une licence distincte doit d’abord être obtenue.

Utilisation commerciale et autorisation sonore

Les versions gratuites et payantes du site web indiquent actuellement une utilisation commerciale, mais cette autorisation ne couvre que les résultats générés par l’utilisation du service sous réserve du respect des conditions ; elle ne confère pas aux utilisateurs les droits sur les scripts, la musique, les voix humaines, les personnages, les marques et autres éléments téléchargés.

Les droits de sortie des services hébergés et la licence de recherche Fish Speech sont deux choses distinctes : la génération de contenu commercial via un abonnement ou une API ne signifie pas que l’on peut utiliser les poids des modèles téléchargés pour un hébergement commercial propre. Pour les projets sensibles, il convient de conserver le formulaire d’accord, la source du son et les archives d’audit de publication.

Guide d’utilisation de Fish Audio

Terminer une tâche de base

  1. Vérifier l’enregistrement, le son, la musique et l’autorisation des participants ;
  2. Téléchargez ou saisissez un audio clair dans Fish Audio ;
  3. Sélectionner les paramètres de traitement tels que la langue, le locuteur et la synthèse vocale ;
  4. Utiliser le modèle vocal S2.1 Pro pour générer des transcriptions, des doublages ou des résultats de nettoyage ;
  5. Vérifier par segment le nom, les chiffres, les pauses, le volume et l’émotion ;
  6. Vérifiez le format, le niveau de loudness, les droits d’auteur et les exigences de confidentialité avant d’exporter ;

Créer des flux de travail professionnels réutilisables

  1. Créer un ensemble de test avec du bruit réel, des accents et des extraits multiples ;
  2. Comparer les différences de traitement entre Text-to-Speech, le modèle vocal S2.1 Pro et S2 Pro par rapport à S1 ;
  3. Conserver l’enregistrement original et la transcription non modifiée ;
  4. Organiser une audition par un humain avant la publication externe ;
  5. Statistiques sur la durée de traitement, le taux d’erreurs et la consommation de crédit ;
  6. Mettre à jour régulièrement le glossaire, les autorisations sonores et la politique de suppression ;

À qui s’adresse-t-il ?

  • Créateurs qui produisent des commentaires vidéo, des podcasts, des livres audio et des enregistrements audio pour des cours ;
  • Équipe nécessaire pour les doublages multilingues, les dialogues des personnages et la localisation ;
  • Les entreprises qui souhaitent établir rapidement une voix de marque ou une voix de personnage de jeu ;
  • Développeurs de agents vocaux, de services client, d’applications de compagnie et de produits accessibles ;
  • Équipe technique chargée de la recherche et de l’évaluation des modèles vocaux pouvant fonctionner localement.

Avantages du produit

  • Couvre plus de 80 langues et prend en charge un changement naturel entre plusieurs langues ;
  • S2.1 Pro prend en charge les étiquettes de jeu en langage naturel et les conversations multijoueurs natives ;
  • L’interface web propose en même temps des outils de clonage, d’audio long, de changement de voix, de transcription et d’audio ;
  • SDK REST, WebSocket, Python et JavaScript assez complets ;
  • Fournir un modèle API gratuit sous réserve de restrictions d’utilisation équitable ;
  • Il existe des services de gestion, ainsi que des modèles téléchargeables à des fins de recherche et des options de déploiement en entreprise.

Restrictions et précautions

  • Les crédits du site web, le solde API et les licences auto-hébergées sont indépendants les uns des autres ; on ne peut pas utiliser directement les minutes de membre pour l’API.
  • Les prix promotionnels, les modèles gratuits et la politique d’utilisation équitable peuvent varier ; le budget doit se baser sur la page de règlement et la console.
  • La voix d’IA peut présenter des écarts en termes de prononciation, de personnage, d’émotion et de similarité ;
  • La clonage de voix, le changement de voix et les voix communautaires doivent faire l’objet d’une vérification des autorisations, et les contenus importants nécessitent une écoute manuelle.
  • La licence de recherche actuelle de FishSpeech ne confère pas un droit d’utilisation commerciale ;

Questions fréquentes

Fish Audio est-il gratuit ?

Le site Web Free offre 8000 crédits par mois, soit environ 7 minutes ; l’API dispose également du modèle s2.1-pro-free sous des restrictions d’utilisation équitable, mais sans garanties SLA de production ni protocoles de traitement des données.

Combien coûte Fish Audio ?

Pour les promotions de l’année en cours, Plus coûte 66 dollars pour toute l’année, Pro 450 dollars, et Max 8988 dollars ; version Enterprise sur mesure.

Les prix promotionnels et de renouvellement peuvent varier ; se référer à la page de paiement.

Comment l’API est-elle facturée ?

S2.1 Pro, S2 Pro et S1 TTS coûtent actuellement 15 dollars pour chaque million de caractères UTF-8 ; la transcription coûte 0,36 dollar par heure audio.

Voice Design facture 0,01 dollar par demande réussie.

Est-ce que c’est compatible avec le chinois ?

Il prend en charge le chinois et plus de 80 langues, ainsi que l’affichage mixte de plusieurs langues. Lorsque le chinois est facturé en octets UTF-8, il n’est pas possible d’utiliser directement une estimation basée sur les mots en anglais.

Est-il possible de cloner sa propre voix ?

On peut utiliser des clonages instantanés, améliorés ou professionnels, mais il est nécessaire d’obtenir une autorisation explicite du locuteur, et de choisir entre des emplacements de voix publics ou privés en fonction des exigences de confidentialité.

Fish Audio est-il open source ?

La plateforme de gestion n’est pas un produit open source. Le code source et les modèles de Fish Speech sont accessibles au public, mais ils sont actuellement soumis à la Fish Audio Research License ; l’utilisation à des fins de recherche et non commerciales est autorisée conformément à cette licence, tandis qu’une utilisation commerciale nécessite une autorisation écrite distincte.

©️Droit d’auteur : Sauf indication contraire, tous les articles de ce site sont protégés par le droit d’auteur.Partage d’outils d’IATous les droits d’auteur sont réservés. Sans autorisation, aucune personne, média, site web ou groupe ne peut reproduire, copier ou diffuser de quelque manière que ce soit le contenu de ce site, ni créer de mirror sur des serveurs qui ne lui appartiennent pas. Dans le cas contraire, notre site se réserve le droit de poursuivre en justice les responsables conformément à la loi.

Outils similaires à Fish Audio