Speechify
Convertir des pages web, des PDF et des documents en parole naturelle et fournir des outils de création
Étiquettes :Outils audio IAQu’est-ce que Speechify ?
Speechify est une plateforme de lecture, de création et de développement axée sur la voix IA. Initialement utilisée pour lire des pages web, des PDF, des livres et du texte scanné, elle couvre désormais également l’entrée par voix, les résumés IA, les podcasts, la doublage, la traduction vidéo, le clonage de voix et des API pour développeurs.
Speechify Text to Speech Reader, Speechify Studio et Speechify API sont trois produits distincts ; les abonnements et les quotas ne peuvent pas se substituer les uns aux autres. Les lecteurs, les créateurs de contenu et les équipes de développement doivent comparer respectivement les solutions correspondantes.
Fonctionnalités principales de Speechify
- Lire à voix haute des pages web, des PDF, des livres électroniques, des e-mails et des documents de bureau ;
- Numériser des pages papier par OCR et les convertir en parole ;
- Prend en charge plus de 1000 sons et plus de 60 langues et accents ;
- Surlignage du texte, vitesse de lecture synchronisée avec le niveau d’avancement entre appareils ;
- Résumés par IA, Q&R sur le contenu, quiz et assistant vocal ;
- La saisie vocale permet de convertir ce qui est dit en texte dans les applications compatibles.
- Studio génère des voix off, des doublages vidéo, des changements de voix et du clonage de voix ;
- Le studio de doublage traduit la vidéo et résynthétise la voix parlée ;
- Les créateurs peuvent ajouter de la musique, des images, des vidéos et des effets sonores ;
- L’API TTS prend en charge la voix en flux, SSML, Speech Marks et des SDK.
Text to Speech Reader
Reader permet d’importer des fichiers PDF, Word, EPUB, des pages web et des fichiers de stockage cloud, et de les lire à haute voix sur Web, iOS, Android, Windows, Mac, Chrome et Edge. Les utilisateurs peuvent ajuster la voix et la vitesse, et le soulignement du texte se déplace en synchronisation avec l’audio.
La version gratuite offre principalement un TTS de base, 10 voix mécaniques et une vitesse allant jusqu’à 1,5 fois. Premium propose des voix naturelles, davantage de langues, une vitesse allant jusqu’à 5 fois, la lecture par balayage, des résumés par IA et des fonctionnalités de chat, ainsi qu’une intégration avec le stockage cloud.
Numérisation OCR et import de fichiers
Sur smartphone, il est possible de prendre en photo des manuels, des fiches de cours ou des pages de livres imprimés, puis de lire à haute voix après reconnaissance du texte par OCR. La qualité de la reconnaissance dépend de la clarté, du format, de la langue et de l’écriture manuscrite ; les formules, les tableaux et les documents à plusieurs colonnes nécessitent une vérification manuelle.
L’intégration avec Google Drive, Dropbox et Microsoft OneDrive facilite l’importation des fichiers, mais la portée des autorisations ne doit pas dépasser ce qui est nécessaire. Avant d’importer des fichiers sensibles, il convient de vérifier la politique de traitement des données de l’organisation.
Résumés d’IA, Q&A et assistants vocaux
Premium peut générer des résumés du contenu lu, des réponses aux messages et des quiz, et permettre des conversations vocales autour de pages web ou de livres grâce à l’Assistant IA vocale. L’IA peut omettre des conditions restrictives ou considérer les opinions exprimées comme des faits.
Entrée vocale et podcasts IA
Voice Typing convertit l’oral en texte, utile pour les e-mails, les documents et la rédaction quotidienne. AI Podcasts, quant à lui, organise les informations en contenus audibles, adaptés à la révision et aux déplacements, mais ne peut pas remplacer une citation précise du texte original.
Doublage Studio AI
Speechify Studio est utilisé pour créer du contenu audio téléchargeable et publiable ; il s’agit d’une abonnement indépendant de celui du lecteur personnel. Les utilisateurs peuvent choisir des voix prédéfinies, entrer un script, ajuster les pauses, la prononciation, le rythme et l’émotion, puis exporter la voix off.
Le plan Studio payant inclut des droits d’utilisation commerciale, tandis que le plan gratuit n’en comprend pas. Les sons spécifiques, les voix de célébrités et les matériaux peuvent également être soumis à des licences distinctes ; il convient de vérifier la licence actuelle du projet avant sa publication.
Dubbing, changeur de voix et clonage de voix
Le studio de doublage peut traduire des vidéos et les redubler, en s’efforçant de conserver le rythme, le ton et les caractéristiques identitaires du locuteur. Le changeur de voix, quant à lui, convertit des sons déjà enregistrés en autres voix disponibles, idéal pour les personnages, les commentaires et la localisation.
La clonage de voix nécessite le consentement explicite du locuteur et ne doit pas servir à se faire passer pour autrui ou à générer des contenus trompeurs. Les conditions de l’API restreignent également les voix de mineurs, de défunts et de personnalités politiques connues, et exigent une divulgation raisonnable des contenus synthétisés.
Speechify TTS API
L’API Speechify utilise le modèle vocal Simba pour générer ou retourner du son en flux, et prend en charge SSML, des timestamps au niveau des mots, le contrôle de l’émotion et le clonage de la voix. Le côté serveur est authentifié via une API Key, et des SDK officiels en Python ainsi qu’en JavaScript ou TypeScript sont fournis.
L’interface en flux est adaptée aux agents vocaux et à la lecture en temps réel, tandis que l’interface de génération standard convient à la création d’audios sauvegardables. Ce document indique qu’une seule requête peut traiter jusqu’à environ 20 000 caractères ; les modèles spécifiques et les limitations dépendent de la console.
Comparaison des trois catégories de produits Speechify
| Produit | Utilisation principale | Sortie | Mode de facturation |
|---|---|---|---|
| Text to Speech Reader | Lire le contenu existant à haute voix pour les utilisateurs individuels | Lecture à voix haute, résumé et questions-réponses dans l’application | Abonnement Gratuit ou Premium |
| Speechify Studio | Création de commentaires, doublage vidéo et contenu audio | Projets audio et vidéo téléchargeables | Abonnement avec points Studio |
| Speechify API | Intégration du TTS dans les applications, agents et services | Flux audio programmé ou fichier | Consommation de caractères ou contrat d’entreprise |
| Programmes d’entreprise et éducatifs | Déploiement des institutions, accessibilité et gestion d’équipe | Comptes centralisés et services d’organisation | Contacter le service des ventes |
Prix de Speechify Reader
Le tableau ci-dessous indique les prix mensuels en dollars actuellement affichés sur le site officiel. La page propose également un passage au paiement annuel ainsi que des offres ponctuelles ; le montant final, les taxes et la période de renouvellement sont indiqués sur la page de paiement.
| Plan | Prix | Principaux droits | Adéquat pour les utilisateurs |
|---|---|---|---|
| Free | 0 dollar | Vitesse allant jusqu’à 1,5x, 10 sons de base, synthèse vocale de base | Lire à voix haute et expérimenter de temps en temps |
| Premium | 29 dollars/mois | Plus de 1000 sons naturels, plus de 60 langues, vitesse allant jusqu’à 5 fois accélérée, fonction de balayage, résumé et intégration avec le stockage cloud | Apprentissage et lecture à haute fréquence |
| Entreprise ou Éducation | Cotation sur mesure | Déploiement en masse, gestion des comptes et soutien organisationnel | Écoles, entreprises et projets d’accessibilité |
La voix Premium est soumise à un usage raisonnable et à une limite de mots par mois. Le volume de base garanti officiellement est actuellement d’au moins 150 000 mots par mois ; les augmentations temporaires ou les offres promotionnelles ne doivent pas être considérées comme des droits permanents.
Prix de Speechify Studio et API
| Produits et solutions | Prix | Limite ou droit | Limites importantes |
|---|---|---|---|
| Studio Free | 0 dollar | 600 points Studio, plus de 1000 sons, doublage, dubbing et changement de voix | Clonage sans son, sans droit d’utilisation commerciale |
| Studio Starter | 19 $/mois | 7200 points, clonage de voix, bibliothèque de matériel et droits d’utilisation commerciale | Points consommés en fonction du contenu généré |
| Studio Creator | 49 dollars/mois | 28 800 points et toutes les fonctionnalités de Starter | La création à haute fréquence nécessite toujours la gestion des points |
| API Starter | Gratuit | 50 000 caractères, environ 100 minutes, SSML, Speech Marks et SDK | Sans clonage audio |
| API Pay-As-You-Go | 10 dollars pour 1 million de caractères | Utilisation à la demande, environ 2000 minutes, avec clonage de la voix | Le nombre réel de minutes dépend du texte et du rythme de parole. |
| API Enterprise | Cotation sur mesure | Contrats, sécurité, SLA, voix personnalisée et support prioritaire | Le site officiel indique un montant minimum de 5 000 dollars par an. |
Comment consommer les points Studio
La voix off consomme 1 point par seconde générée, le doublage 3 points par seconde, et l’avatar 30 points par seconde. Modifier le volume ou exporter à nouveau du contenu inchangé ne coûte généralement pas de points, mais modifier le script, la voix, le rythme, la hauteur tonale ou l’émotion entraîne une nouvelle génération et une consommation de points.
Guide d’utilisation de Speechify
Convertir un PDF ou une page web en contenu audio
- Inscrivez-vous sur Speechify et choisissez Web, mobile ou extension de navigateur ;
- Télécharger des fichiers, coller des pages web ou importer depuis un stockage cloud ;
- Vérifier le texte OCR, l’ordre des titres et la reconnaissance linguistique ;
- Choisir le son, la langue et la vitesse de lecture appropriés ;
- Activer l’highlighting synchronisé et définir le saut des en-têtes et pieds de page ;
- Avant d’utiliser un résumé ou des questions-réponses, consultez d’abord la structure du texte original ;
- Une fois terminé, supprimez les données sensibles qui ne doivent pas être conservées.
Créer des doublages commerciaux avec Studio
- Il est confirmé que le scénario d’utilisation nécessite Studio plutôt que Reader ;
- Choisir un forfait payant incluant des droits d’utilisation commerciale ;
- Importer le script et séparer les plans et les locuteurs par paragraphes ;
- Sélectionner des sons autorisés et ajuster la prononciation, les pauses et l’émotion ;
- Tester avec de courtes séquences avant de générer le projet complet ;
- Vérifier les noms, les chiffres, les traductions multilingues et le rythme des lèvres ;
- Conserver les enregistrements d’autorisation et divulguer les contenus synthétisés par l’IA selon les exigences.
Accès au TTS via une API
- Créer et restreindre des clés API dans la console de développement ;
- Conserver la clé dans l’environnement du serveur ou dans Secrets ;
- Installer le SDK officiel Python ou TypeScript ;
- Testez d’abord la voix, le modèle et les formats audio avec de courts textes ;
- Pour les scénarios en temps réel, on utilise l’interface fluide, et pour les scénarios de fichiers, on utilise l’interface speech.
- Segmenter les textes longs et gérer la limitation de débit, les délais d’expiration et les tentatives de réessai ;
- Enregistrer le coût des caractères, rotationner les clés et effectuer la modération du contenu.
À quels utilisateurs Speechify convient-il ?
- Utilisateurs atteints de dyslexie, de problèmes de vision ou ayant des difficultés d’attention : conversion du texte en contenu audio ;
- Étudiants et chercheurs : lire à haute voix des manuels, des thèses et des matériaux de révision ;
- Travailleurs du savoir : écouter des documents en déplacement ou dans des situations de multitâche ;
- Apprenants de langues : exercices combinant des sons multilingues et un soulignement synchronisé ;
- Créateurs de vidéos et de podcasts : création de voix off, de voix de personnages et de localisation ;
- Éducation et équipes d’entreprise : déploiement de contenus d’aide à la lecture et de formation ;
- Développeur : Intégration du TTS pour les produits, les agents vocaux et les fonctionnalités d’accessibilité.
Les avantages de Speechify
- Les lecteurs couvrent les pages web, les fichiers, le texte scanné et divers appareils ;
- Sons naturels, choix de langues et d’accent variés ;
- L’highlighting synchronisé, le contrôle de vitesse et la synchronisation entre appareils conviennent à la lecture de longs textes ;
- Reader, Studio et API couvrent les scénarios allant des particuliers aux développeurs ;
- Studio intègre la doublage, le dubbing, le changement de voix, le clonage et les matériaux ;
- L’API prend en charge la sortie en flux, SSML, les timestamps émotionnels et au niveau des mots ;
- Fournit des SDK officiels pour Python et TypeScript ainsi que des projets d’exemple.
Restrictions d'utilisation et précautions
- Reader, Studio et API sont des produits indépendants ; il est nécessaire de bien les distinguer avant d’acheter.
- La voix naturelle Premium a une limite mensuelle de mots d'utilisation raisonnable ;
- La sortie gratuite en studio ne comprend pas un droit d’utilisation commerciale ;
- Studio déduira à nouveau des points en modifiant le script, le son ou l’émotion ;
- L’OCR peut mal lire les formules, les tableaux, l’écriture manuscrite et la mise en page complexe ;
- Les résumés, traductions, questions-réponses et prononciations générés par l’IA peuvent encore contenir des erreurs ;
- La clonage de voix doit faire l’objet d’une autorisation prouvable et d’un consentement applicable ;
- Les prix, les voix de célébrités, les promotions et les taxes régionales peuvent varier.
Confidentialité, sécurité et autorisation de la voix
La politique de confidentialité de Speechify indique qu’elle ne vend ni ne loue de données personnelles, mais traite les comptes, les appareils, les historiques d’utilisation et le contenu soumis par les utilisateurs. Les employés n’ont généralement pas accès au contenu des utilisateurs, mais peuvent y accéder dans des cas spécifiques tels que l’assistance technique, les enquêtes sur des violations, les obligations légales ou l’amélioration des algorithmes.
Avant de télécharger des fichiers de travail, des documents inédits, des informations concernant des étudiants ou des données protégées, il convient de vérifier les licences contractuelles et organisationnelles en vigueur. Les services de stockage cloud tiers, les extensions de navigateur et les ressources externes introduisent également des parties traitant des données supplémentaires.
- Ne téléchargez que du texte, de l’audio, de la vidéo et des images pour lesquels vous avez les droits de traitement ;
- Obtenir le consentement écrit, clair et enregistré du locuteur avant de cloner sa voix ;
- Il est interdit d’utiliser des voix synthétiques pour se faire passer pour autrui, escroquer ou induire en erreur le public ;
- Fournir des informations claires en langue vocale IA sur les API et les produits commerciaux finis ;
- Restreindre l’autorisation du stockage cloud, les collaborateurs au projet et les droits de téléchargement ;
- Vider régulièrement les fichiers, les échantillons audio, les clés API et les comptes expirés.
API, GitHub et explications sur le logiciel open source
Speechify propose une API REST, des SDK officiels en Python et TypeScript, ainsi que des exemples d’API sur GitHub. Les dépôts des anciennes versions des SDK ont été abandonnés ; les développeurs doivent utiliser les nouveaux packages logiciels et méthodes d’authentification indiqués dans la documentation actuelle.
Le fait que les SDK et les codes d’exemple soient publics ne signifie pas que les modèles de reconnaissance vocale Speechify, Reader ou la plateforme Studio soient open source. Les modèles principaux et les services hébergés ne peuvent pas être déployés en mode privé de manière complète à l’aide de ces dépôts.
Questions fréquentes
Speechify est-il gratuit ?
Tant Reader que Studio offrent des versions gratuites, et l’API fournit également un quota de 50 000 caractères pour les tests. Les fonctionnalités, les effets sonores, les droits commerciaux et le quota de génération de la version gratuite sont tous limités.
Combien coûte Speechify Premium ?
Le tarif mensuel actuel sur le site officiel est de 29 dollars ; des remises peuvent être appliquées pour un abonnement annuel ou pour les nouveaux utilisateurs. Avant de finaliser la transaction, il convient de vérifier la monnaie, les taxes, le prix de renouvellement et les conditions de remboursement.
Quelle est la différence entre Speechify Reader et Studio ?
Reader est utilisé pour écouter des pages web et des documents en privé, tandis que Studio sert à créer et exporter des commentaires audio, des doublages et des vidéos. Il s’agit de deux abonnements indépendants.
Speechify prend-il en charge le chinois ?
Il prend en charge le chinois ainsi que de nombreuses langues et accents, mais la couverture linguistique varie selon les produits, les voix et les fonctionnalités. Il convient de tester la prononciation et les caractères à plusieurs prononciations avant la version officielle.
Speechify est-il open source ?
Non, les produits et modèles principaux ne sont pas open source. Seuls une partie des SDK, des exemples et du code d’intégration historique sont rendus publics par les éditeurs officiels.
Numéro d’enregistrement de sécurité publique du Guangxi : 45132202000164