Inworld
Inworld, outil intelligent axé sur l’amélioration de l’efficacité de l’IA
Étiquettes :Amélioration de l’efficacité de l’IAUne phrase pour présenter
Inworld AI est une plateforme de développement destinée aux applications vocales en temps réel, qui intègre la conversion texte-voix, la conversion voix-texte, les conversations full-duplex, le routage des modèles et l’hébergement du traitement en un seul compte et système de facturation.
Présentation des outils
Inworld AI est géré par Theai, Inc. Il a d’abord attiré l’attention pour ses personnages de jeu et les capacités des PNJ contrôlés par l’IA, mais son focus actuel se porte désormais sur l’infrastructure de traitement du langage en temps réel et de raisonnement à faible latence nécessaire aux applications grand public. Il s’apparente davantage à une plateforme d’API pour développeurs qu’à un éditeur de doublage destiné aux utilisateurs ordinaires.
Les applications principales comprennent la compagnie vocale, l’apprentissage des langues, les jeux et médias interactifs, le service client, ainsi que les appels commerciaux et les agents téléphoniques intelligents. Les développeurs peuvent utiliser un seul modèle vocal ou combiner des chaînes de dialogue complètes via l’API en temps réel.
Composition actuelle du produit
| Produit | Capacités principales | Entrée et sortie | Scénarios adaptés |
|---|---|---|---|
| Realtime TTS | Synthèse vocale à faible latence, clonage et conception sonore | Transcodage de texte ou audio complet | Assistants vocaux, doublage et personnages interactifs |
| Realtime STT | Transcription et extraction des caractéristiques de la voix | Conversion audio en texte et profiling vocal | Compréhension des conversations et appels en temps réel |
| Realtime API | Intégrer le STT, le LLM et le TTS dans une session continue | Audio, texte et événements en flux bidirectionnel | Agent vocal full-duplex intelligent |
| Realtime Router | Accéder et router plus de 220 modèles via une interface unifiée | Texte de modèle ou réponse vocale pour les messages | Changement de modèle, dérivation et bascule en cas de panne |
| Realtime Inference | Gérer et optimiser les modèles de poids ouverts | Demande de texte : résultats de raisonnement à faible latence | Applications de consommation à haute fréquence |
| Compute | Fournir des capacités GPU hébergées aux clients à fort volume d’utilisation | Déduction exclusive et capacité | Charge de production stable à grande échelle |
Realtime TTS
Realtime TTS propose deux versions de modèles : TTS-2 et TTS-2 Flash. Le premier met l’accent sur le contrôle du langage naturel et l’expressivité, tandis que le second privilégie des délais plus faibles et un coût par caractère réduit.
| modèle | Positionnement | Indicateurs de retard publics | langue | Adéquat pour la tâche |
|---|---|---|---|---|
| Realtime TTS-2 | Expression élevée et voix contrôlable | Économie de 100 millisecondes pour la première lettre de P90 | Plus de 200 | Personnages, service client et dialogue émotionnel |
| Realtime TTS-2 Flash | Faible latence et faible coût | Économie de 20 millisecondes pour la première lettre de P90 | Plus de 200 | Assistant en temps réel à haute concurrence et génération à grande échelle |
L’indicateur de délai est mesuré du côté serveur et ne prend pas en compte le réseau de l’utilisateur, les buffers de l’application ni le temps du dispositif de lecture. La réponse réelle du bout en bout dépend également de la génération du texte, de la qualité de la connexion et de l’implémentation du client.
Contrôle et sortie vocale
- Il est possible de contrôler l’émotion, la prononciation, le ton, le volume, la hauteur du son, la vitesse et le style de parole par le biais du langage naturel.
- Il est possible d’ajouter au texte des instructions, des pauses et des sons non verbaux.
- Prend en charge la génération en flux, idéale pour synthétiser et jouer en même temps.
- Il peut retourner des timestamps de mots, de phonèmes et de mouvements labiaux, utilisés pour les sous-titres et la synchronisation des lèvres des personnages.
- Prend en charge la vitesse de parole, la température, une prononciation personnalisée et différentes configurations d’encodage audio.
- Playground permet de tester d’abord, puis d’utiliser la même identification sonore pour l’interface du programme.
Clonage de la voix et conception sonore
Instant Voice Cloning permet de créer une voix à partir d’un audio de référence d’environ 5 à 15 secondes, et de reproduire cette même voix dans plus de 200 langues. Voice Design, quant à lui, génère directement de nouvelles voix en se basant sur des descriptions textuelles telles que l’âge, l’accent, le timbre et l’énergie.
- Vérifier que l’enregistreur a donné son consentement clair pour la clonage, le stockage et l’usage prévu.
- Enregistrer un échantillon clair sans musique de fond, sans écho et avec une seule personne.
- Après avoir créé un son, enregistrez l’identifiant du son retourné.
- Tester la langue source, le multilinguisme et les différentes instructions d’expression avec des textes courts.
- Vérifier la similarité, le risque de tromperie, les mots sensibles et l’autorisation commerciale.
- Ajouter la divulgation d’identité, le contrôle d’accès et la surveillance des abus pour les déploiements publics.
La clonage de voix professionnelle est disponible en tant que fonction supplémentaire pour Developer, 1 version est incluse dans Growth, et elle est configurée selon le contrat pour Enterprise. Le clonage de voix implique des données qui peuvent être considérées comme des informations biométriques ; il ne faut pas copier la voix d’autrui sans autorisation.
Realtime STT
STT en temps réel est chargé de convertir la voix en texte et peut identifier des caractéristiques telles que l’âge, le registre, l’émotion, le style de parole et l’accent grâce au profiling vocal. Le produit peut se connecter à la transcription propre d’Inworld ainsi qu’à d’autres fournisseurs de reconnaissance vocale.
| Capacité | effet | Précautions d'utilisation |
|---|---|---|
| Transcription en temps réel | Fournir en continu des entrées textuelles pour les agents vocaux intelligents | Gérer les fluctuations réseau, les interruptions et la réconnexion |
| Voice profiling | Aider le modèle à comprendre les modes d’expression et le contexte | Sa caractéristique est l’inférence par modèle ; elle ne peut pas servir de conclusion concernant l’identité ou la médecine. |
| Plusieurs fournisseurs | Sélectionnez Inworld ou d’autres services STT en fonction des capacités | Langues comparées, délais, coûts et politique de réservation |
| Connexion en flux | Retourner le résultat tout en recevant l’audio | Contrôler la concurrence et le cycle de vie des sessions |
| Facturation par durée audio | Deduction des frais selon les heures de traitement | Le mode silencieux, la tentative de réessai et le téléchargement répété peuvent également affecter les coûts. |
Realtime API
L’API en temps réel combine la reconnaissance vocale, les grands modèles et la synthèse vocale au moyen d’une session WebSocket continue, permettant aux utilisateurs d’interrompre, de reprendre et de parler à tour de rôle de manière naturelle. Elle est compatible avec le protocole Realtime d’OpenAI, ce qui facilite la migration des clients existants.
- Détection intégrée de l’activité vocale, utilisée pour déterminer quand l’utilisateur commence et s’arrête de parler.
- Smart Turn aide à distinguer les pauses temporaires de la fin réelle d’un discours.
- On peut utiliser les modèles du Router, ou choisir de connecter ses propres modèles selon la conception.
- Prend en charge des sessions multimodales avec du contenu audio, texte et des images partielles.
- Le TTS de base, le STT et l’LLM sont facturés respectivement en fonction de l’utilisation réelle.
- Une connexion continue nécessite de gérer les battements cardiaques, la réconnexion, l’annulation et la restauration de l’état de session.
Construire un agent vocal intelligent
- Créer un compte, un espace de travail et des identifiants API réservés à l’usage du serveur.
- Déterminez d’abord le son TTS, les paramètres STT et le modèle cible dans Playground.
- Concevoir des instructions de système, des outils, des interruptions utilisateur et des règles de fin de dialogue.
- Créer des sessions en temps réel et gérer correctement les formats audio, les événements et la lecture en flux.
- Définir des chemins de dégradation pour les interruptions réseau, les délais d’expiration des modèles et les échecs des outils.
- Enregistrer le retard, les erreurs de transcription, le taux de réussite des interruptions, le taux d’achèvement des tâches et le coût par minute.
- Mettre en ligne sur une petite échelle avant d’augmenter la concurrence, puis vérifier que la facture correspond à la consommation réelle.
Realtime Router
Realtime Router accède à plus de 220 modèles via une interface compatible avec les méthodes d’appel d’OpenAI et d’Anthropic. Les modèles tiers sont revendus au prix public indiqué par le fournisseur sans surcoût, tandis qu’un pourcentage supplémentaire est facturé en cas d’utilisation de clés propres.
| Capacité de routage | Mode de fonctionnement | Valeur d’application |
|---|---|---|
| Route conditionnelle | Sélectionner les modèles par langue, région, forfait, intention ou émotion | Adapter les coûts et les capacités aux différents utilisateurs |
| Découpage du trafic | Répartir les requêtes en proportion sur plusieurs modèles | Mener des tests A/B en ligne |
| Allocation visqueuse | Même utilisateur utilise continuellement la même variante d’expérience | Maintenir une expérience cohérente |
| Redondance automatique | Essayer les modèles candidats en cas d’échec ou de limitation de vitesse | Améliorer la continuité des services |
| Sélection automatique | Filtrer par prix, retard, débit ou référence | Combinaison de modèles d’optimisation dynamique |
| Observabilité | Enregistrer le modèle sélectionné, la chaîne d’essais, le temps du premier token et les frais | Qualité de l’analyse et coûts |
| Analyse d’exportation | Envoyer les données au niveau de la requête vers un système d’analyse externe | Créer un tableau de bord d’exploitation propre |
| Voix intégrée | Ajouter la configuration audio dans la demande de chat | Une seule appelée retourne texte et voix |
Modèles et modes de facturation
Les informations sur les prix ont été vérifiées le 23 août 2026 ; les montants réels, les taxes, les taux de change et les remises peuvent varier. Les données finales seront celles affichées sur la page de paiement.
Le routeur couvre des fournisseurs tels que OpenAI, Anthropic, Google, Meta, Mistral, DeepSeek, xAI, ainsi que des modèles à poids ouverts optimisés pour Inworld. La liste des modèles et leurs prix varient fréquemment ; il convient de les lire dynamiquement à partir du catalogue des modèles actuel.
| Mode d’appel | Règles de tarification | Précautions à prendre |
|---|---|---|
| Modèles tiers revendus dans le monde du jeu | Au coût du fournisseur, sans surcoût pour le routeur | Reste influencé par les prix d’entrée, de sortie et de cache de chaque modèle |
| Clé privée fournie par l’utilisateur | Coût du fournisseur + 4 % | Les factures seront distribuées entre le fournisseur et Inworld. |
| Deduction propre à Inworld | Selon son taux de modèle | Optimisable en fonction de l’ampleur de la consommation et du délai en temps réel |
| LLM dans l’API en temps réel | Mesure séparée pour le TTS et le STT | Le coût total est la somme des quantités utilisées pour les trois niveaux. |
Playground et développement d’API
La plateforme propose des environnements de test tels que TTS et Realtime, permettant de tester les sons, les modèles et les paramètres avant d’écrire du code. Les applications officielles se connectent via une API serveur ou WebSocket ; les sessions en temps réel dans le navigateur doivent utiliser des tokens à courte durée de vie afin d’éviter la fuite de la clé principale.
- REST convient aux requêtes ponctuelles de TTS, STT et de gestion des ressources.
- Le TTS en flux renvoie continuellement du contenu audio sous forme de JSON multi-lignes, qui doit être décodé ligne par ligne.
- WebSocket convient au dialogue bidirectionnel en temps réel et à l’état continu.
- Le routeur est compatible avec les SDK courants ; il faut néanmoins vérifier les champs d’extension qui ne correspondent pas parfaitement lors du transfert.
- Les identifiants doivent être partagés selon les limites de concurrence par compte, séparés par environnement et rotatifs périodiquement.
- Le système de production doit mettre en œuvre le délai d’attente, l’évitement exponentiel, la protection par quotas et le masquage des journaux.
Forfaits d’abonnement
| Plan | Frais mensuels | Intégrale par cycle | Principaux droits | Adéquat pour les utilisateurs |
|---|---|---|---|---|
| On-Demand | Début gratuit | Avec une période d’essai gratuite | Jusqu’à 70 minutes de TTS ou 400 minutes de STT, 100 voix personnalisées, API et routeur, licence commerciale | Évaluation et prototype |
| Creator | 25 dollars/mois | 25 points à 25 dollars | 500 voix, jusqu’à 40 000 caractères par session sur Playground, espace de travail et gestion d’équipe | Création de contenu et petits projets |
| Builder | 100 dollars/mois | 100 points de 100 dollars | 3000 voix, plus de concurrence simultanée, partage des espaces de travail et tarifs plus bas | Projets de développement et petites équipes |
| Developer | 300 dollars/mois | 300 points de 1 dollar | 10 000 voix, 150 flux TTS en parallèle, fonctionnalités de clonage professionnel et support prioritaire pour les e-mails | Application de production |
| Growth | 1500 dollars/mois | 1500 points de dollars | 30 000 voix, 500 canaux TTS en parallèle, 1 clonage professionnel et fonctionnalités complémentaires conformes | Déploiement à grande échelle et conforme |
| Enterprise | Cotation sur mesure | Conformément au contrat | Restrictions sur mesure, SLA, DPA, déploiement local, résidence des données et support exclusif | Environnements de très grande échelle et sur mesure |
Les abonnements peuvent être payés mensuellement ou annuellement, le paiement annuel étant effectué en une seule fois. Le prix du forfait est converti en points d’utilisation équivalents en dollars américains ; au-delà de cette quantité, l’achat se poursuit au tarif en vigueur ou un rechargement automatique a lieu.
Prix unitaire TTS et STT
| Plan | TTS-2 par million de caractères | TTS-2 Flash par million de caractères | STT 1 par heure |
|---|---|---|---|
| On-Demand | 25 dollars | 15 dollars | 0,15 dollar |
| Creator | 20 dollars | 10 dollars | 0,10 dollar |
| Builder | 17,50 dollars | 9 dollars | 0,10 dollar |
| Developer | 15 dollars | 8 dollars | 0,10 dollar |
| Growth | 12,50 dollars | 7 dollars | 0,10 dollar |
| Enterprise | Jusqu’à 5 dollars | Moins de 5 dollars | sur mesure |
Les quantités excédentaires du même forfait sont facturées au tarif de ce dernier. L’API en temps réel ne dispose pas de tarif fixe par minute ; au lieu de cela, elle facture séparément le nombre réel de caractères TTS, la durée audio STT et les tokens LLM.
Concurrence et capacité
| Plan | Génération simultanée TTS | STT flux concurrentiel | Séances concurrentes en temps réel | Estimer les sessions des utilisateurs vocaux |
|---|---|---|---|---|
| On-Demand | 5 | 10 | 10 | Environ 20 |
| Creator | 10 | 20 | 20 | Environ 40 |
| Builder | 50 | 100 | 100 | Environ 200 |
| Developer | 150 | 300 | 300 | Environ 600 |
| Growth | 500 | 1000 | 1000 | Environ 2000 |
| Enterprise | sur mesure | sur mesure | sur mesure | sur mesure |
Les limites de concurrence sont partagées par compte et clé API ; les demandes dépassant la valeur garantie ne seront traitées que dans la mesure où la capacité le permet. La planification de la capacité doit se baser sur les pics de charge et les tests de stress, et le nombre estimé de sessions ne peut pas être considéré directement comme une garantie de service.
Péremption des points et modification du compte
- Les points non utilisés du forfait payant peuvent être reportés jusqu’à 3 mois tant que l’abonnement est en cours et que la valeur du plan reste inchangée.
- Les points attribués chaque mois ont une période de validité indépendante de 3 mois.
- L’achat supplémentaire de points coûte au minimum 10 dollars et reste valable pendant 1 an.
- Il est possible de configurer un rechargement automatique pour ajouter des points lorsque le solde est inférieur à un seuil.
- La mise à niveau prend effet immédiatement, et le montant intégral du nouveau forfait ainsi que la consommation non encore facturée sont dus.
- La dégradation ou l’annulation prend effet à la fin du cycle en cours, et les points restants seront supprimés.
- Après plusieurs échecs de paiement consécutifs et 7 tentatives de réessai, le compte est mis en mode On-Demand et l’API est désactivée.
Responsabilités liées au son et à la vie privée
La politique de confidentialité inclut les conversations, les enregistrements ainsi que les caractéristiques vocales dérivées du son parmi les données susceptibles d’être traitées, certaines de ces caractéristiques pouvant constituer des informations biométriques dans certaines régions. La clonage et l’analyse de la voix exigent un consentement applicable, ainsi que des mécanismes de suppression et de retrait.
| Données | Utilisation principale | Contrôle des risques |
|---|---|---|
| Se référer à l’enregistrement | Créer une clonage de voix instantané ou professionnel | Conserver l’accord, limiter l’usage et protéger l’audio original |
| Caractéristiques vocales | Préserver l’identité sonore ou faciliter la compréhension du contexte | Non utilisé pour l’authentification ou les déductions sensibles |
| Transcription du texte | Fourni aux modèles et outils métier | Désensibilisation et limitation de la conservation des journaux |
| Audio du dialogue | Traitement en temps réel, qualité et gestion des services | Information claire par enregistrement audio et consentement régional |
| Comptes et transactions | Certification, facturation et support | Principes du moindre privilège et accès d’audit |
| Analyser les données | Améliorer les produits et évaluer leur utilisation | Distinguer les données clients des données de recherche déidentifiées |
Politique de confidentialité : Inworld peut utiliser certaines informations à des fins de recherche et de développement ainsi que pour l’entraînement de modèles, et propose également une option de non-rétention de données pour les entreprises. Pour les charges de travail sensibles ou réglementées, il convient de préciser dans le contrat les conditions de retrait de l’entraînement, la durée de conservation et la gamme de produits concernés.
Sécurité et conformité
| Projet | Statut public | Rappel applicable |
|---|---|---|
| SOC 2 | Type II | Demander le rapport actuel et vérifier les services couverts |
| GDPR | Déclaration conforme | Le client doit encore déterminer le fondement légal et exercer ses droits sur les données. |
| HIPAA et BAA | Growth permet d’acheter des éléments supplémentaires | Signer le BAA et définir les limites du traitement des informations de santé protégées |
| Zero Data Retention | Growth permet d’acheter des options supplémentaires, les entreprises peuvent négocier. | Vérifier que TTS, STT, le routeur et les modèles tiers sont tous couverts. |
| Chiffrement | AES statique, TLS de transmission | Vérifier les clés, les sauvegardes et l’environnement des journaux |
| Connexion unique | L’entreprise prend en charge SAML et OIDC | Intégration des permissions de rôle et configuration automatique |
| Déploiement local | Enterprise propose | Définir les responsabilités en matière de modèles, de mises à jour, d’équipement et de maintenance. |
| Résidence des données | Enterprise propose des options pour l’UE et l’Inde | Vérifier tous les sous-traitants et les emplacements de sauvegarde |
GitHub, SDK et statut open source
Inworld dispose d’une organisation officielle active sur GitHub, qui met à disposition du code TTS, des exemples d’API, des modèles Runtime, des outils MCP, des outils de migration vocale ainsi que diverses applications d’exemple. Le TTS, les exemples d’API et plusieurs modèles sont soumis à la licence MIT.
Les exemples et modèles publics ne signifient pas que la plateforme d’hébergement, les modèles ou l’ensemble des SDK sont open source. Certains binaires de runtime ainsi que les anciennes versions d’Unity et des SDK Unreal sont soumis à des licences spécifiques ; il est nécessaire de vérifier la licence pour chaque répertoire et chaque composant avant utilisation.
| Ressources de développement | Situation publique | Remarques sur la licence |
|---|---|---|
| Entrepôt TTS | Public | Marquer MIT |
| API Examples | Public | Marquer MIT |
| Modèle Node Runtime | Public | Modèle MIT, avec des termes séparés pour le binaire |
| Outil MCP | Public | Selon l’utilisation actuelle de la licence du entrepôt |
| Ressources Unity et Unreal | Certains SDK et exemples sont téléchargeables | Sous réserve des conditions du SDK ou de la licence du projet |
| Modèles de gestion et plateformes cloud | Pas open source | Par des conditions commerciales et l'utilisation d'une API |
À qui s’adresse-t-il
- Créer une équipe pour développer des applications consommatoires offrant de la compagnie vocale, des fonctionnalités sociales, un apprentissage linguistique et du contenu interactif.
- Développeurs ayant besoin de TTS multilingue à faible latence et de clonage de voix.
- Équipe d’agents intelligents vocaux souhaitant intégrer le STT, les LLM et le TTS dans une seule session en temps réel.
- Équipe d’ingénierie de plateforme nécessitant la routage, les expérimentations et le basculement en cas de panne entre plus de 220 modèles.
- Les entreprises qui nécessitent une grande concurrence, une capacité dédiée ou un déploiement local.
- Développeurs qui créent des expériences interactives à l’aide d’Unity, Unreal, Node.js et de frameworks vocaux courants.
Avantages du produit
- TTS, STT, l’API en temps réel et le routage des modèles partagent les comptes, les points et la documentation de développement.
- Le TTS-2 allie contrôle de l’expression, tandis que Flash met l’accent sur une faible latence et des coûts à grande échelle.
- Les échantillons de clonage de voix sont courts et permettent de préserver l’identité vocale dans plus de 200 langues.
- Le routeur est compatible avec les méthodes d’appel courantes et prend en charge le routage conditionnel, les expérimentations et la bascule automatique en cas de panne.
- Le prix d’abonnement est converti en points disponibles ; le forfait haut de gamme voit à la fois son prix unitaire diminuer et sa capacité de concurrence augmenter.
- Offre des options SOC 2 Type II, ZDR d’entreprise, déploiement local et hébergement des données.
- Les exemples et modèles officiels de GitHub couvrent de multiples langages ainsi que des frameworks de voix en temps réel.
Restrictions d'utilisation et risques de coûts
- Le coût total de la voix en temps réel est la somme des composantes TTS, STT et LLM ; il ne faut pas se baser uniquement sur le prix par caractère.
- Les points payants peuvent être reportés jusqu’à 3 mois au maximum ; le solde inutilisé est supprimé en cas d’annulation ou de dégradation de statut.
- Une forte concurrence, le clonage professionnel de voix, ZDR, HIPAA et le déploiement local nécessitent des solutions plus avancées ou des options supplémentaires.
- Les indicateurs de latence du serveur ne prennent pas en compte le réseau, la génération du modèle et le temps de lecture du client.
- L’analyse vocale relève de l’inférence probabiliste et ne peut pas remplacer l’authentification, le diagnostic émotionnel ou le jugement humain.
- Les modèles tiers et les clés propriétaires peuvent entraîner des contrats, des réserves et des frais supplémentaires.
- Les services cloud et les modèles principaux ne sont pas open source ; les dépôts publics contiennent principalement du code, des templates et des exemples.
Liste de vérification avant mise en ligne
- Décider s’il suffit de TTS ou STT, ou s’une session en temps réel complète avec un routeur est nécessaire.
- Tester la qualité du son, la transcription et les interruptions à l’aide de langues, d’équipements et de réseaux représentatifs.
- Estimer les caractères, les heures d’audio, les tokens LLM et les sessions simultanées en fonction de la valeur maximale.
- Comparer les points du forfait, le prix unitaire, la période de report et les frais supplémentaires pour définir des alertes budgétaires.
- Obtenir une autorisation claire pour le clonage de voix, et évaluer la réglementation en matière d’identification biométrique et d’enregistrement audio.
- La clé principale est stockée sur le serveur, et le navigateur n’utilise que des identifiants à court terme.
- Vérifier les exigences de conservation des modèles tiers, ZDR, HIPAA, de résidence des données et de suppression.
- Délai de déploiement, reconnexion, fallback du modèle et prise en charge manuelle, puis augmentation progressive.
Questions fréquentes
Que fait Inworld AI principalement aujourd’hui ?
L’accent est actuellement mis sur l’infrastructure de voix en temps réel et de raisonnement, y compris le TTS, le STT, les API de voix full-duplex, le routage des modèles ainsi que le calcul hébergé, et non plus uniquement sur les outils de rôle d’IA antérieurs.
Inworld AI est-il gratuit ?
On-Demand peut être utilisé gratuitement, avec jusqu’à environ 70 minutes de TTS ou 400 minutes de STT. Au-delà de la quantité gratuite, le paiement s’effectue en fonction de l’utilisation réelle ; certains modèles avancés nécessitent également une méthode de paiement associée.
Est-ce que c’est compatible avec le chinois ?
La série TTS-2 couvre plus de 200 langues, y compris le chinois. Avant une utilisation officielle, il convient de tester séparément le mandarin standard, les accents, les chiffres, les noms propres et les prononciations personnalisées.
Combien d’enregistrements sont nécessaires pour la clonage de voix ?
La clonage en temps réel utilise généralement un audio clair d’environ 5 à 15 secondes. Le clonage professionnel fait partie des avantages de plans plus élevés ou de services supplémentaires, et nécessite le respect des exigences de licence sonore.
Comment est facturée l’API en temps réel ?
Il n’y a pas de tarif fixe indépendant par minute. Les caractères TTS, la durée audio STT et les tokens LLM de la session sont facturés selon les taux respectifs du forfait en vigueur.
Le modèle Router va-t-il avoir une surcoût ?
Les modèles tiers sont routés via Inworld et facturés au coût du fournisseur, sans surcoût de routeur supplémentaire ; lors de l’utilisation d’une clé propre, un frais de service de 4 % est indiqué dans la documentation.
Les points sont-ils reportés ?
Les points mensuels du forfait payant peuvent être reportés jusqu’à 3 mois tant que l’abonnement reste équivalent ou supérieur, tandis que les points achetés en supplément restent valables pendant 1 an. Lors d’une annulation ou d’une downgrade, les points restants sont supprimés.
Inworld AI est-il open source ?
La plateforme principale et les modèles ne sont pas entièrement open source. Les codes TTS, les exemples d’API et plusieurs modèles sont publiés sous la licence MIT, mais certains binaires SDK sont soumis à une licence distincte.
Résumé
Inworld AI est adapté aux équipes qui ont besoin de déployer la reconnaissance vocale naturelle, des conversations à faible latence et l’inférence multi-modèles dans des applications grand public à grande échelle. Il peut fournir séparément TTS ou STT, ou bien constituer une chaîne complète d’agents intelligents vocaux à l’aide d’une API en temps réel et d’un routeur.
Lors du choix d’une option, il convient de prendre en compte en même temps le nombre de caractères, la durée audio, les tokens du modèle, la concurrence et la durée de validité des points. Lorsqu’il s’agit de clonage de voix, de données médicales ou de données sensibles, il est également nécessaire d’implémenter, en plus des tests techniques, des autorisations, un ZDR, des contrats et une gouvernance humaine.
Numéro d’enregistrement de sécurité publique du Guangxi : 45132202000164