Cartesia
Plateforme audio générative à faible latence pour des agents vocaux en temps réel
Étiquettes :Outils audio IAQu’est-ce que Cartesia ?
Cartesia est une plateforme d’IA vocale en temps réel destinée aux développeurs et aux entreprises, dont les produits phares sont Sonic pour la transcription texte-voix, Ink pour la reconnaissance vocale et Line pour les agents vocaux intelligents. La plateforme met l’accent sur un traitement en flux à faible latence, idéal pour les applications nécessitant des conversations naturelles et des réponses rapides aux interruptions.
Les développeurs peuvent utiliser les fonctionnalités vocales via le Playground, des API, des SDK en Python ou JavaScript, ainsi que MCP. En plus de la synthèse et de la transcription vocale, Cartesia propose également le clonage de voix, la conversion de voix, la localisation, un dictionnaire de prononciation et des services pour le déploiement entreprise.
Fonctions principales de Cartesia
- Sonic TTS:Convertir le texte en parole naturelle en temps réel et retourner l’audio de manière fluide.
- Ink STT:Transcription de la voix pour des conversations en temps réel, traitement du bruit, des accents, de la qualité du son téléphonique et des données structurées.
- Détection d’extrémités sémantiques :Déterminer quand une boucle se termine en fonction du sens des paroles, afin de réduire les erreurs dues à une activation uniquement par le mode silencieux.
- Clonage audio en temps réel :Créez rapidement des sons à partir d’échantillons clairs en environ 10 secondes, disponible à partir du forfait Pro.
- Clonage de voix professionnel :Ajustement du modèle par enregistrement individuel de plus de 30 minutes, disponible à partir du forfait Startup.
- Voice Changer:Conserver le ton et le rythme audio d’origine, en remplaçant la voix par un autre timbre.
- Localisation du son :Adapter les sons existants à d’autres langues ou dialectes.
- Dictionnaire de prononciation :Personnaliser la prononciation et le traitement des phonèmes pour les marques, noms de personnes, noms de médicaments et termes spécialisés.
- Émotions et contrôle :Ajustez la vitesse, le volume, l’émotion, les pauses et l’expression en fonction des capacités du modèle.
- Line Agents:Combiner l’entrée vocale, la sortie vocale, les modèles et les fonctionnalités téléphoniques pour créer un agent intelligent en temps réel.
- API et SDK :Fournit des interfaces pour Python, JavaScript et d’autres applications HTTP/WebSocket.
- MCP:Permettez aux clients compatibles avec l’IA d’exécuter directement TTS, STT, la gestion du son et la consultation de la consommation.
Comparaison de Sonic, Ink et Line
| Produit | Principales importations | Sortie principale | Scénarios adaptés |
|---|---|---|---|
| Sonic | Texte, voix et paramètres d’expression | Voix en temps réel ou par fichier | Commentaire, service client, personnages de jeu et interface vocale |
| Ink | Audio en temps réel ou enregistré | Transcription progressive et finale, événements de tour | Agent vocal, téléphone, conférence et sténographie |
| Line | Voix de l’utilisateur et flux de travail de l’agent | Dialogues vocaux complets et interactions téléphoniques | Service client, réservations, filtrage et appels automatisés |
Comparaison des prix des forfaits Cartesia
Voici les prix mensuels en dollars affichés lors de la vérification de la page des tarifs officiels ; tous les forfaits offrent un nombre illimité de postes de travail. Les crédits et les minutes d’agent sont facturés séparément, tandis que les taxes, le solde d’avance et les remises d’entreprise sont indiqués sur la page de paiement de la console.
| forfait | Prix | Crédits mensuels | Limite d’agent prépayé | Droits fondamentaux |
|---|---|---|---|---|
| Free | 0 dollar/mois | 20,000 | 1 dollar/mois | TTS, STT et essai de base |
| Pro | 5 dollars/mois | 100,000 | 5 dollars/mois | Licence d'utilisation commerciale et clonage instantané de la voix |
| Startup | 49 dollars/mois | 1,250,000 | 49 dollars/mois | Clonage professionnel de la voix et organisation |
| Scale | 299 dollars/mois | 8,000,000 | 299 dollars/mois | Privilégier le support pour une plus grande concurrence |
| Enterprise | sur mesure | sur mesure | sur mesure | Remises pour volume, SSO, DPA, BAA et support exclusif |
Comparaison de la capacité du forfait et de la concurrence simultanée
| forfait | Environ TTS minutes | Durée approximative STT | TTS concurrentiel | STT/Agent concurrentiel |
|---|---|---|---|---|
| Free | Environ 27 minutes | Environ 1 heure 51 minutes | 2 | 8 |
| Pro | Environ 133 minutes | Environ 9 heures 16 minutes | 3 | 12 |
| Startup | Environ 1667 minutes | Environ 115 heures 44 minutes | 5 | 20 |
| Scale | Environ 10667 minutes | Environ 740 heures 44 minutes | 15 | 60 |
| Enterprise | sur mesure | sur mesure | sur mesure | sur mesure |
Les minutes indiquées ci-dessus sont des valeurs approximatives calculées officiellement selon le modèle standard actuel, et ne constituent pas une promesse ferme. Le prétraitement du texte, le modèle, le son, le silence, les points d’arrêt, la clonage professionnelle et différentes tâches audio influencent la consommation réelle.
Crédits et règles de facturation supplémentaire
- TTS standard :En général, chaque caractère coûte environ 1 crédit ; le prétraitement peut entraîner de légères variations.
- Clonage professionnel TTS :Environ 1,5 crédits par caractère, soit 50 % de plus que la voix standard.
- Clonage instantané TTS :Calculé selon les tarifs standards de TTS, sans coefficient de clonage professionnel.
- Formation à la clonage professionnel :Un entraînement réussi coûte 1 000 000 de crédits.
- Réentraînement :Changer le modèle de base ou les données d’entraînement nécessite de payer à nouveau des crédits d’entraînement.
- Voice Changer:Tarif de 15 crédits par seconde d’audio entrant.
- Localisation du son :Consomme 225 crédits d’un coup.
- Line Agent:Appel : 0,06 dollar par minute, plus 0,014 dollar par minute pour l’utilisation d’un numéro de plateforme.
- STT:Facturation selon le modèle, le traitement par lots ou les points de terminaison en temps réel, ainsi que la durée audio ; le silence est également pris en compte.
Guide d’accès à la synthèse vocale
- Créer une clé :Générer une clé API dans Playground, et séparer le développement, les tests et la production selon l’environnement.
- Sélectionner le modèle :Privilégiez l’utilisation de la version actuelle stable de Sonic, et n’inscrivez pas définitivement les anciens IDs de modèle.
- Sélectionner le son :Écoutez les candidats de la bibliothèque audio par langue, rôle, scène et vitesse de parole.
- Formater le texte :Ajouter des ponctuations, des dates, des heures, des pauses et une prononciation personnalisée.
- Utiliser le mode flux :La conversation en temps réel utilise WebSocket ou une sortie en flux pour diffuser le premier segment audio le plus tôt possible.
- Gérer la continuité :Utiliser la capacité de génération continue pour diviser les longs contenus en blocs, afin de réduire les changements de tonalité et de rythme entre les paragraphes.
- Qualité de la surveillance :Enregistrer les retards, le taux d’échec, les crédits et les interruptions des utilisateurs, afin d’optimiser progressivement les paramètres.
Guide d’intégration de la transcription en temps réel Ink
- Vérifier que le codage audio, la fréquence d’échantillonnage, les canaux et le protocole de transmission répondent aux exigences de l’interface en temps réel.
- Connectez-vous à WebSocket avant d’envoyer de l’audio, et concevez un état machine pour gérer les coupures de connexion, les reconnexions et les délais d’attente.
- Faire la distinction entre la transcription intermédiaire et la transcription finale ; ne pas enregistrer directement dans les documents commerciaux des textes non stabilisés.
- Surveiller les événements turn.start, turn.end et eager_end, afin de coordonner le grand modèle avec la réponse TTS.
- Créer un ensemble de test pour les numéros de téléphone, les dates, les adresses e-mail, les monnaies, les noms de produits et les termes sectoriels.
- Évaluation réelle en conditions de bruit téléphonique, de bruit de fond, d’accent différents et de silence.
- Enregistrer la durée de l’audio, le délai, le taux d’erreurs et le coût de chaque requête, et définir des alertes de consommation.
Tutoriel de clonage de voix
- Confirmer l’accord :Cloner uniquement sa propre voix, ou obtenir une autorisation écrite explicite du titulaire des droits de la voix.
- Type de sélection :Testez d’abord la clonage instantané avec un échantillon de 10 secondes environ ; si cela ne suffit pas, envisagez alors le clonage professionnel.
- Préparer les matériaux :Clonage professionnel d’enregistrements de haute qualité individuels d’au moins 30 minutes, 2 heures ou plus étant généralement préférable.
- Style unifié :Les enregistrements d’entraînement doivent conserver le rythme de parole, le volume, l’environnement et le style d’expression souhaités.
- Soumettre l’entraînement :Créer des sons professionnels à l’aide du tableau de bord ou des ensembles de données et de l’API de fine-tuning.
- Vérification du son :Tester les noms de personnes, les chiffres, les émotions, les phrases longues, les mots à faible fréquence et la langue cible.
- Contrôle de publication :Restreindre l’accès, enregistrer les utilisations et indiquer selon les exigences que le contenu est synthétisé par l’IA dans les contenus publics.
Contrôle des coûts de l’agent vocal Line
- Définir la durée maximale, le délai de timeout sans son et le nombre maximal de tentatives pour chaque appel ;
- Testez d’abord sur une page web ou dans un environnement de test, puis activez les numéros de téléphone payants et les appels sortants.
- Utiliser des indications système courtes et des outils de retour pour réduire les coûts supplémentaires liés aux grands modèles ;
- Enregistrer séparément les frais de STT, LLM, TTS et de téléphone, en ne se basant pas uniquement sur la facture globale ;
- Utiliser un cache ou une voix préenregistrée pour les questions-réponses répétées, mais éviter de diffuser des informations obsolètes ;
- Détecter les robots, les boîtes vocales et les numéros invalides pour mettre fin rapidement aux appels sans intérêt ;
- Ajouter une confirmation manuelle pour les opérations à haut risque, afin d’empêcher l’agent vocal de finaliser directement des transactions irréversibles.
À quels utilisateurs Cartesia convient-il ?
- Développeur d’agent vocal :Créer un service client, des réservations, un filtrage des ventes et un assistant interactif.
- Centre d’appels :Utiliser la transcription en temps réel, la synthèse et les fonctionnalités téléphoniques pour gérer un grand nombre de conversations.
- Jeux et applications de personnages :Générer des voix de personnages à faible latence, contrôlables et expressives.
- Éducation et produits accessibles :Fournit la lecture à voix haute, l’dictée, la navigation vocale et une expérience multilingue.
- Médias et créateurs :Création de voix off, doublage localisé et voix de marque autorisée.
- Équipe de développement d’entreprise :Accéder à l’infrastructure vocale via des API, des SDK, du MCP et le déploiement d’entreprise.
Avantages du produit
- Sonic, Ink et Line couvrent l’entrée et la sortie vocales ainsi que des agents intelligents complets ;
- Optimisation du retard du premier paquet, du traitement en flux et de la détection des tours pour les conversations en temps réel ;
- Prend en charge le clonage, la conversion, la localisation et un contrôle professionnel de la prononciation ;
- Tous les forfaits offrent un nombre illimité de postes de travail, ce qui facilite le développement et la collaboration d’affaires ;
- Fournit des interfaces Python, JavaScript, MCP et HTTP/WebSocket ;
- L’édition entreprise offre SSO, des accords de conformité, un support dédié et une concurrence personnalisable.
Restrictions d'utilisation et précautions
- Les crédits du forfait ne peuvent pas être simplement assimilés à des minutes fixes, la consommation réelle dépend du contenu et des tâches ;
- La qualité du son en temps réel dépend du réseau, des appareils audio, de la codification et des paramètres des endpoints ;
- STT peut encore faire des erreurs de reconnaissance des noms propres, des chiffres, des accents et du bruit de fond ;
- Le modèle de base est lié à l’entraînement de clonage professionnel, et la mise à niveau du modèle nécessite généralement un nouvel entraînement ;
- Les anciens modèles ont une période de désactivation, et le système de production doit suivre le journal officiel des modifications.
- Les agents vocaux entraînent des frais supplémentaires pour les appels et les grands modèles, il est donc nécessaire de définir un budget et des limites.
- La clonage de voix ne doit pas être utilisé pour se faire passer pour autrui, pour la fraude, pour des représentations mensongères ou pour la reproduction d’une identité sans consentement.
Sécurité, confidentialité et conformité audio
Les projets d’entreprise doivent définir le lieu de traitement des données, la durée de conservation, les journaux, les sous-traitants et les mécanismes d’accord pour l’enregistrement audio. Dans les domaines médical, financier et autres secteurs réglementés, il est possible de se référer aux DPA, BAA ainsi qu’aux capacités correspondantes de l’entreprise, mais leur applicabilité doit néanmoins être confirmée par un contrat.
- Les échantillons de voix, les scripts mot par mot et les informations d’identité doivent faire l’objet d’une collecte minimale et d’un isolement des permissions ;
- Conserver les informations sur le titulaire des droits, l’usage, la région, la durée et les enregistrements de révocation pour le clonage de sons ;
- La clé API ne doit pas être stockée dans le navigateur, les paquets mobiles ou des dépôts publics ;
- Ajouter une identification de synthèse à la sortie, et fournir des canaux pour passer en mode humain et déposer des plaintes ;
- Les appels sensibles ne doivent pas être enregistrés, clonés ou conservés sur le long terme sans consentement.
Explications sur le logiciel open source, les SDK et le MCP
Les plateformes hébergées Cartesia, ainsi que les modèles principaux Sonic, Ink et Line ne sont pas des produits open source, mais l’entreprise a rendu publics sur GitHub le SDK Python, le SDK JavaScript, le MCP Server et certains outils d’agent. Le SDK JavaScript est licencié sous la licence Apache 2.0 ; il convient de vérifier la licence propre à chaque répertoire.
L’SDK open source n’est qu’un client qui appelle l’API Cartesia et ne comprend pas le modèle complet ni l’infrastructure de raisonnement. MCP peut être hébergé via une connexion OAuth officielle ou exécuté localement à partir du code source, mais la génération et la transcription réelles nécessitent toujours un compte ainsi que des crédits.
Questions fréquentes
Cartesia peut-il être utilisé gratuitement ?
Le forfait Free offre 20 000 crédits par mois ainsi qu’un crédit d’agent prépayé de 1 dollar pour tester le TTS et le STT. Les licences pour un usage commercial et la clonation instantanée de la voix sont disponibles à partir du forfait Pro.
Combien coûte Cartesia Pro ?
Selon la page de tarification officielle, le prix est de 5 dollars par mois, ce qui inclut 100 000 crédits et un crédit d’agent de 5 dollars. Les taxes et frais supplémentaires en raison d’une utilisation accrue sont facturés via la console.
Quelle est la différence entre la clonage sonore en temps réel et le clonage sonore professionnel ?
La clonage en temps réel nécessite environ 10 secondes d’échantillon, disponible à partir de Pro ; le clonage professionnel requiert au moins 30 minutes d’enregistrement de haute qualité, disponible à partir de Startup et consomme 1 million de crédits pour l’entraînement.
Cartesia prend-il en charge le chinois ?
La version actuelle de Sonic prend en charge plusieurs langues ; la documentation officielle la plus récente indique un soutien natif pour 42 langues. Les voix chinoises spécifiques, les régions et les effets des modèles doivent être testés concrètement dans le Playground.
Cartesia est-il open source ?
La plateforme et les modèles vocaux principaux ne sont pas des produits open source, tandis que le SDK officiel ainsi que des projets de connexion tels que MCP ont leurs codes sources mis à disposition. L’utilisation de ces clients entraîne néanmoins l’appel d’API hébergées payantes.
Numéro d’enregistrement de sécurité publique du Guangxi : 45132202000164