Inworld
Valeur ajoutée gratuite
Outils de bureautique IA Amélioration de l’efficacité de l’IA

Inworld

Inworld, outil intelligent axé sur l’amélioration de l’efficacité de l’IA

Étiquettes :

Une phrase pour présenter

Inworld AI est une plateforme de développement destinée aux applications vocales en temps réel, qui intègre la conversion texte-voix, la conversion voix-texte, les conversations full-duplex, le routage des modèles et l’hébergement du traitement en un seul compte et système de facturation.

Présentation des outils

Inworld AI est géré par Theai, Inc. Il a d’abord attiré l’attention pour ses personnages de jeu et les capacités des PNJ contrôlés par l’IA, mais son focus actuel se porte désormais sur l’infrastructure de traitement du langage en temps réel et de raisonnement à faible latence nécessaire aux applications grand public. Il s’apparente davantage à une plateforme d’API pour développeurs qu’à un éditeur de doublage destiné aux utilisateurs ordinaires.

Les applications principales comprennent la compagnie vocale, l’apprentissage des langues, les jeux et médias interactifs, le service client, ainsi que les appels commerciaux et les agents téléphoniques intelligents. Les développeurs peuvent utiliser un seul modèle vocal ou combiner des chaînes de dialogue complètes via l’API en temps réel.

Composition actuelle du produit

ProduitCapacités principalesEntrée et sortieScénarios adaptés
Realtime TTSSynthèse vocale à faible latence, clonage et conception sonoreTranscodage de texte ou audio completAssistants vocaux, doublage et personnages interactifs
Realtime STTTranscription et extraction des caractéristiques de la voixConversion audio en texte et profiling vocalCompréhension des conversations et appels en temps réel
Realtime APIIntégrer le STT, le LLM et le TTS dans une session continueAudio, texte et événements en flux bidirectionnelAgent vocal full-duplex intelligent
Realtime RouterAccéder et router plus de 220 modèles via une interface unifiéeTexte de modèle ou réponse vocale pour les messagesChangement de modèle, dérivation et bascule en cas de panne
Realtime InferenceGérer et optimiser les modèles de poids ouvertsDemande de texte : résultats de raisonnement à faible latenceApplications de consommation à haute fréquence
ComputeFournir des capacités GPU hébergées aux clients à fort volume d’utilisationDéduction exclusive et capacitéCharge de production stable à grande échelle

Realtime TTS

Realtime TTS propose deux versions de modèles : TTS-2 et TTS-2 Flash. Le premier met l’accent sur le contrôle du langage naturel et l’expressivité, tandis que le second privilégie des délais plus faibles et un coût par caractère réduit.

modèlePositionnementIndicateurs de retard publicslangueAdéquat pour la tâche
Realtime TTS-2Expression élevée et voix contrôlableÉconomie de 100 millisecondes pour la première lettre de P90Plus de 200Personnages, service client et dialogue émotionnel
Realtime TTS-2 FlashFaible latence et faible coûtÉconomie de 20 millisecondes pour la première lettre de P90Plus de 200Assistant en temps réel à haute concurrence et génération à grande échelle

L’indicateur de délai est mesuré du côté serveur et ne prend pas en compte le réseau de l’utilisateur, les buffers de l’application ni le temps du dispositif de lecture. La réponse réelle du bout en bout dépend également de la génération du texte, de la qualité de la connexion et de l’implémentation du client.

Contrôle et sortie vocale

  • Il est possible de contrôler l’émotion, la prononciation, le ton, le volume, la hauteur du son, la vitesse et le style de parole par le biais du langage naturel.
  • Il est possible d’ajouter au texte des instructions, des pauses et des sons non verbaux.
  • Prend en charge la génération en flux, idéale pour synthétiser et jouer en même temps.
  • Il peut retourner des timestamps de mots, de phonèmes et de mouvements labiaux, utilisés pour les sous-titres et la synchronisation des lèvres des personnages.
  • Prend en charge la vitesse de parole, la température, une prononciation personnalisée et différentes configurations d’encodage audio.
  • Playground permet de tester d’abord, puis d’utiliser la même identification sonore pour l’interface du programme.

Clonage de la voix et conception sonore

Instant Voice Cloning permet de créer une voix à partir d’un audio de référence d’environ 5 à 15 secondes, et de reproduire cette même voix dans plus de 200 langues. Voice Design, quant à lui, génère directement de nouvelles voix en se basant sur des descriptions textuelles telles que l’âge, l’accent, le timbre et l’énergie.

  1. Vérifier que l’enregistreur a donné son consentement clair pour la clonage, le stockage et l’usage prévu.
  2. Enregistrer un échantillon clair sans musique de fond, sans écho et avec une seule personne.
  3. Après avoir créé un son, enregistrez l’identifiant du son retourné.
  4. Tester la langue source, le multilinguisme et les différentes instructions d’expression avec des textes courts.
  5. Vérifier la similarité, le risque de tromperie, les mots sensibles et l’autorisation commerciale.
  6. Ajouter la divulgation d’identité, le contrôle d’accès et la surveillance des abus pour les déploiements publics.

La clonage de voix professionnelle est disponible en tant que fonction supplémentaire pour Developer, 1 version est incluse dans Growth, et elle est configurée selon le contrat pour Enterprise. Le clonage de voix implique des données qui peuvent être considérées comme des informations biométriques ; il ne faut pas copier la voix d’autrui sans autorisation.

Realtime STT

STT en temps réel est chargé de convertir la voix en texte et peut identifier des caractéristiques telles que l’âge, le registre, l’émotion, le style de parole et l’accent grâce au profiling vocal. Le produit peut se connecter à la transcription propre d’Inworld ainsi qu’à d’autres fournisseurs de reconnaissance vocale.

CapacitéeffetPrécautions d'utilisation
Transcription en temps réelFournir en continu des entrées textuelles pour les agents vocaux intelligentsGérer les fluctuations réseau, les interruptions et la réconnexion
Voice profilingAider le modèle à comprendre les modes d’expression et le contexteSa caractéristique est l’inférence par modèle ; elle ne peut pas servir de conclusion concernant l’identité ou la médecine.
Plusieurs fournisseursSélectionnez Inworld ou d’autres services STT en fonction des capacitésLangues comparées, délais, coûts et politique de réservation
Connexion en fluxRetourner le résultat tout en recevant l’audioContrôler la concurrence et le cycle de vie des sessions
Facturation par durée audioDeduction des frais selon les heures de traitementLe mode silencieux, la tentative de réessai et le téléchargement répété peuvent également affecter les coûts.

Realtime API

L’API en temps réel combine la reconnaissance vocale, les grands modèles et la synthèse vocale au moyen d’une session WebSocket continue, permettant aux utilisateurs d’interrompre, de reprendre et de parler à tour de rôle de manière naturelle. Elle est compatible avec le protocole Realtime d’OpenAI, ce qui facilite la migration des clients existants.

  • Détection intégrée de l’activité vocale, utilisée pour déterminer quand l’utilisateur commence et s’arrête de parler.
  • Smart Turn aide à distinguer les pauses temporaires de la fin réelle d’un discours.
  • On peut utiliser les modèles du Router, ou choisir de connecter ses propres modèles selon la conception.
  • Prend en charge des sessions multimodales avec du contenu audio, texte et des images partielles.
  • Le TTS de base, le STT et l’LLM sont facturés respectivement en fonction de l’utilisation réelle.
  • Une connexion continue nécessite de gérer les battements cardiaques, la réconnexion, l’annulation et la restauration de l’état de session.

Construire un agent vocal intelligent

  1. Créer un compte, un espace de travail et des identifiants API réservés à l’usage du serveur.
  2. Déterminez d’abord le son TTS, les paramètres STT et le modèle cible dans Playground.
  3. Concevoir des instructions de système, des outils, des interruptions utilisateur et des règles de fin de dialogue.
  4. Créer des sessions en temps réel et gérer correctement les formats audio, les événements et la lecture en flux.
  5. Définir des chemins de dégradation pour les interruptions réseau, les délais d’expiration des modèles et les échecs des outils.
  6. Enregistrer le retard, les erreurs de transcription, le taux de réussite des interruptions, le taux d’achèvement des tâches et le coût par minute.
  7. Mettre en ligne sur une petite échelle avant d’augmenter la concurrence, puis vérifier que la facture correspond à la consommation réelle.

Realtime Router

Realtime Router accède à plus de 220 modèles via une interface compatible avec les méthodes d’appel d’OpenAI et d’Anthropic. Les modèles tiers sont revendus au prix public indiqué par le fournisseur sans surcoût, tandis qu’un pourcentage supplémentaire est facturé en cas d’utilisation de clés propres.

Capacité de routageMode de fonctionnementValeur d’application
Route conditionnelleSélectionner les modèles par langue, région, forfait, intention ou émotionAdapter les coûts et les capacités aux différents utilisateurs
Découpage du traficRépartir les requêtes en proportion sur plusieurs modèlesMener des tests A/B en ligne
Allocation visqueuseMême utilisateur utilise continuellement la même variante d’expérienceMaintenir une expérience cohérente
Redondance automatiqueEssayer les modèles candidats en cas d’échec ou de limitation de vitesseAméliorer la continuité des services
Sélection automatiqueFiltrer par prix, retard, débit ou référenceCombinaison de modèles d’optimisation dynamique
ObservabilitéEnregistrer le modèle sélectionné, la chaîne d’essais, le temps du premier token et les fraisQualité de l’analyse et coûts
Analyse d’exportationEnvoyer les données au niveau de la requête vers un système d’analyse externeCréer un tableau de bord d’exploitation propre
Voix intégréeAjouter la configuration audio dans la demande de chatUne seule appelée retourne texte et voix

Modèles et modes de facturation

Les informations sur les prix ont été vérifiées le 23 août 2026 ; les montants réels, les taxes, les taux de change et les remises peuvent varier. Les données finales seront celles affichées sur la page de paiement.

Le routeur couvre des fournisseurs tels que OpenAI, Anthropic, Google, Meta, Mistral, DeepSeek, xAI, ainsi que des modèles à poids ouverts optimisés pour Inworld. La liste des modèles et leurs prix varient fréquemment ; il convient de les lire dynamiquement à partir du catalogue des modèles actuel.

Mode d’appelRègles de tarificationPrécautions à prendre
Modèles tiers revendus dans le monde du jeuAu coût du fournisseur, sans surcoût pour le routeurReste influencé par les prix d’entrée, de sortie et de cache de chaque modèle
Clé privée fournie par l’utilisateurCoût du fournisseur + 4 %Les factures seront distribuées entre le fournisseur et Inworld.
Deduction propre à InworldSelon son taux de modèleOptimisable en fonction de l’ampleur de la consommation et du délai en temps réel
LLM dans l’API en temps réelMesure séparée pour le TTS et le STTLe coût total est la somme des quantités utilisées pour les trois niveaux.

Playground et développement d’API

La plateforme propose des environnements de test tels que TTS et Realtime, permettant de tester les sons, les modèles et les paramètres avant d’écrire du code. Les applications officielles se connectent via une API serveur ou WebSocket ; les sessions en temps réel dans le navigateur doivent utiliser des tokens à courte durée de vie afin d’éviter la fuite de la clé principale.

  • REST convient aux requêtes ponctuelles de TTS, STT et de gestion des ressources.
  • Le TTS en flux renvoie continuellement du contenu audio sous forme de JSON multi-lignes, qui doit être décodé ligne par ligne.
  • WebSocket convient au dialogue bidirectionnel en temps réel et à l’état continu.
  • Le routeur est compatible avec les SDK courants ; il faut néanmoins vérifier les champs d’extension qui ne correspondent pas parfaitement lors du transfert.
  • Les identifiants doivent être partagés selon les limites de concurrence par compte, séparés par environnement et rotatifs périodiquement.
  • Le système de production doit mettre en œuvre le délai d’attente, l’évitement exponentiel, la protection par quotas et le masquage des journaux.

Forfaits d’abonnement

PlanFrais mensuelsIntégrale par cyclePrincipaux droitsAdéquat pour les utilisateurs
On-DemandDébut gratuitAvec une période d’essai gratuiteJusqu’à 70 minutes de TTS ou 400 minutes de STT, 100 voix personnalisées, API et routeur, licence commercialeÉvaluation et prototype
Creator25 dollars/mois25 points à 25 dollars500 voix, jusqu’à 40 000 caractères par session sur Playground, espace de travail et gestion d’équipeCréation de contenu et petits projets
Builder100 dollars/mois100 points de 100 dollars3000 voix, plus de concurrence simultanée, partage des espaces de travail et tarifs plus basProjets de développement et petites équipes
Developer300 dollars/mois300 points de 1 dollar10 000 voix, 150 flux TTS en parallèle, fonctionnalités de clonage professionnel et support prioritaire pour les e-mailsApplication de production
Growth1500 dollars/mois1500 points de dollars30 000 voix, 500 canaux TTS en parallèle, 1 clonage professionnel et fonctionnalités complémentaires conformesDéploiement à grande échelle et conforme
EnterpriseCotation sur mesureConformément au contratRestrictions sur mesure, SLA, DPA, déploiement local, résidence des données et support exclusifEnvironnements de très grande échelle et sur mesure

Les abonnements peuvent être payés mensuellement ou annuellement, le paiement annuel étant effectué en une seule fois. Le prix du forfait est converti en points d’utilisation équivalents en dollars américains ; au-delà de cette quantité, l’achat se poursuit au tarif en vigueur ou un rechargement automatique a lieu.

Prix unitaire TTS et STT

PlanTTS-2 par million de caractèresTTS-2 Flash par million de caractèresSTT 1 par heure
On-Demand25 dollars15 dollars0,15 dollar
Creator20 dollars10 dollars0,10 dollar
Builder17,50 dollars9 dollars0,10 dollar
Developer15 dollars8 dollars0,10 dollar
Growth12,50 dollars7 dollars0,10 dollar
EnterpriseJusqu’à 5 dollarsMoins de 5 dollarssur mesure

Les quantités excédentaires du même forfait sont facturées au tarif de ce dernier. L’API en temps réel ne dispose pas de tarif fixe par minute ; au lieu de cela, elle facture séparément le nombre réel de caractères TTS, la durée audio STT et les tokens LLM.

Concurrence et capacité

PlanGénération simultanée TTSSTT flux concurrentielSéances concurrentes en temps réelEstimer les sessions des utilisateurs vocaux
On-Demand51010Environ 20
Creator102020Environ 40
Builder50100100Environ 200
Developer150300300Environ 600
Growth50010001000Environ 2000
Enterprisesur mesuresur mesuresur mesuresur mesure

Les limites de concurrence sont partagées par compte et clé API ; les demandes dépassant la valeur garantie ne seront traitées que dans la mesure où la capacité le permet. La planification de la capacité doit se baser sur les pics de charge et les tests de stress, et le nombre estimé de sessions ne peut pas être considéré directement comme une garantie de service.

Péremption des points et modification du compte

  • Les points non utilisés du forfait payant peuvent être reportés jusqu’à 3 mois tant que l’abonnement est en cours et que la valeur du plan reste inchangée.
  • Les points attribués chaque mois ont une période de validité indépendante de 3 mois.
  • L’achat supplémentaire de points coûte au minimum 10 dollars et reste valable pendant 1 an.
  • Il est possible de configurer un rechargement automatique pour ajouter des points lorsque le solde est inférieur à un seuil.
  • La mise à niveau prend effet immédiatement, et le montant intégral du nouveau forfait ainsi que la consommation non encore facturée sont dus.
  • La dégradation ou l’annulation prend effet à la fin du cycle en cours, et les points restants seront supprimés.
  • Après plusieurs échecs de paiement consécutifs et 7 tentatives de réessai, le compte est mis en mode On-Demand et l’API est désactivée.

Responsabilités liées au son et à la vie privée

La politique de confidentialité inclut les conversations, les enregistrements ainsi que les caractéristiques vocales dérivées du son parmi les données susceptibles d’être traitées, certaines de ces caractéristiques pouvant constituer des informations biométriques dans certaines régions. La clonage et l’analyse de la voix exigent un consentement applicable, ainsi que des mécanismes de suppression et de retrait.

DonnéesUtilisation principaleContrôle des risques
Se référer à l’enregistrementCréer une clonage de voix instantané ou professionnelConserver l’accord, limiter l’usage et protéger l’audio original
Caractéristiques vocalesPréserver l’identité sonore ou faciliter la compréhension du contexteNon utilisé pour l’authentification ou les déductions sensibles
Transcription du texteFourni aux modèles et outils métierDésensibilisation et limitation de la conservation des journaux
Audio du dialogueTraitement en temps réel, qualité et gestion des servicesInformation claire par enregistrement audio et consentement régional
Comptes et transactionsCertification, facturation et supportPrincipes du moindre privilège et accès d’audit
Analyser les donnéesAméliorer les produits et évaluer leur utilisationDistinguer les données clients des données de recherche déidentifiées

Politique de confidentialité : Inworld peut utiliser certaines informations à des fins de recherche et de développement ainsi que pour l’entraînement de modèles, et propose également une option de non-rétention de données pour les entreprises. Pour les charges de travail sensibles ou réglementées, il convient de préciser dans le contrat les conditions de retrait de l’entraînement, la durée de conservation et la gamme de produits concernés.

Sécurité et conformité

ProjetStatut publicRappel applicable
SOC 2Type IIDemander le rapport actuel et vérifier les services couverts
GDPRDéclaration conformeLe client doit encore déterminer le fondement légal et exercer ses droits sur les données.
HIPAA et BAAGrowth permet d’acheter des éléments supplémentairesSigner le BAA et définir les limites du traitement des informations de santé protégées
Zero Data RetentionGrowth permet d’acheter des options supplémentaires, les entreprises peuvent négocier.Vérifier que TTS, STT, le routeur et les modèles tiers sont tous couverts.
ChiffrementAES statique, TLS de transmissionVérifier les clés, les sauvegardes et l’environnement des journaux
Connexion uniqueL’entreprise prend en charge SAML et OIDCIntégration des permissions de rôle et configuration automatique
Déploiement localEnterprise proposeDéfinir les responsabilités en matière de modèles, de mises à jour, d’équipement et de maintenance.
Résidence des donnéesEnterprise propose des options pour l’UE et l’IndeVérifier tous les sous-traitants et les emplacements de sauvegarde

GitHub, SDK et statut open source

Inworld dispose d’une organisation officielle active sur GitHub, qui met à disposition du code TTS, des exemples d’API, des modèles Runtime, des outils MCP, des outils de migration vocale ainsi que diverses applications d’exemple. Le TTS, les exemples d’API et plusieurs modèles sont soumis à la licence MIT.

Les exemples et modèles publics ne signifient pas que la plateforme d’hébergement, les modèles ou l’ensemble des SDK sont open source. Certains binaires de runtime ainsi que les anciennes versions d’Unity et des SDK Unreal sont soumis à des licences spécifiques ; il est nécessaire de vérifier la licence pour chaque répertoire et chaque composant avant utilisation.

Ressources de développementSituation publiqueRemarques sur la licence
Entrepôt TTSPublicMarquer MIT
API ExamplesPublicMarquer MIT
Modèle Node RuntimePublicModèle MIT, avec des termes séparés pour le binaire
Outil MCPPublicSelon l’utilisation actuelle de la licence du entrepôt
Ressources Unity et UnrealCertains SDK et exemples sont téléchargeablesSous réserve des conditions du SDK ou de la licence du projet
Modèles de gestion et plateformes cloudPas open sourcePar des conditions commerciales et l'utilisation d'une API

À qui s’adresse-t-il

  • Créer une équipe pour développer des applications consommatoires offrant de la compagnie vocale, des fonctionnalités sociales, un apprentissage linguistique et du contenu interactif.
  • Développeurs ayant besoin de TTS multilingue à faible latence et de clonage de voix.
  • Équipe d’agents intelligents vocaux souhaitant intégrer le STT, les LLM et le TTS dans une seule session en temps réel.
  • Équipe d’ingénierie de plateforme nécessitant la routage, les expérimentations et le basculement en cas de panne entre plus de 220 modèles.
  • Les entreprises qui nécessitent une grande concurrence, une capacité dédiée ou un déploiement local.
  • Développeurs qui créent des expériences interactives à l’aide d’Unity, Unreal, Node.js et de frameworks vocaux courants.

Avantages du produit

  • TTS, STT, l’API en temps réel et le routage des modèles partagent les comptes, les points et la documentation de développement.
  • Le TTS-2 allie contrôle de l’expression, tandis que Flash met l’accent sur une faible latence et des coûts à grande échelle.
  • Les échantillons de clonage de voix sont courts et permettent de préserver l’identité vocale dans plus de 200 langues.
  • Le routeur est compatible avec les méthodes d’appel courantes et prend en charge le routage conditionnel, les expérimentations et la bascule automatique en cas de panne.
  • Le prix d’abonnement est converti en points disponibles ; le forfait haut de gamme voit à la fois son prix unitaire diminuer et sa capacité de concurrence augmenter.
  • Offre des options SOC 2 Type II, ZDR d’entreprise, déploiement local et hébergement des données.
  • Les exemples et modèles officiels de GitHub couvrent de multiples langages ainsi que des frameworks de voix en temps réel.

Restrictions d'utilisation et risques de coûts

  • Le coût total de la voix en temps réel est la somme des composantes TTS, STT et LLM ; il ne faut pas se baser uniquement sur le prix par caractère.
  • Les points payants peuvent être reportés jusqu’à 3 mois au maximum ; le solde inutilisé est supprimé en cas d’annulation ou de dégradation de statut.
  • Une forte concurrence, le clonage professionnel de voix, ZDR, HIPAA et le déploiement local nécessitent des solutions plus avancées ou des options supplémentaires.
  • Les indicateurs de latence du serveur ne prennent pas en compte le réseau, la génération du modèle et le temps de lecture du client.
  • L’analyse vocale relève de l’inférence probabiliste et ne peut pas remplacer l’authentification, le diagnostic émotionnel ou le jugement humain.
  • Les modèles tiers et les clés propriétaires peuvent entraîner des contrats, des réserves et des frais supplémentaires.
  • Les services cloud et les modèles principaux ne sont pas open source ; les dépôts publics contiennent principalement du code, des templates et des exemples.

Liste de vérification avant mise en ligne

  1. Décider s’il suffit de TTS ou STT, ou s’une session en temps réel complète avec un routeur est nécessaire.
  2. Tester la qualité du son, la transcription et les interruptions à l’aide de langues, d’équipements et de réseaux représentatifs.
  3. Estimer les caractères, les heures d’audio, les tokens LLM et les sessions simultanées en fonction de la valeur maximale.
  4. Comparer les points du forfait, le prix unitaire, la période de report et les frais supplémentaires pour définir des alertes budgétaires.
  5. Obtenir une autorisation claire pour le clonage de voix, et évaluer la réglementation en matière d’identification biométrique et d’enregistrement audio.
  6. La clé principale est stockée sur le serveur, et le navigateur n’utilise que des identifiants à court terme.
  7. Vérifier les exigences de conservation des modèles tiers, ZDR, HIPAA, de résidence des données et de suppression.
  8. Délai de déploiement, reconnexion, fallback du modèle et prise en charge manuelle, puis augmentation progressive.

Questions fréquentes

Que fait Inworld AI principalement aujourd’hui ?

L’accent est actuellement mis sur l’infrastructure de voix en temps réel et de raisonnement, y compris le TTS, le STT, les API de voix full-duplex, le routage des modèles ainsi que le calcul hébergé, et non plus uniquement sur les outils de rôle d’IA antérieurs.

Inworld AI est-il gratuit ?

On-Demand peut être utilisé gratuitement, avec jusqu’à environ 70 minutes de TTS ou 400 minutes de STT. Au-delà de la quantité gratuite, le paiement s’effectue en fonction de l’utilisation réelle ; certains modèles avancés nécessitent également une méthode de paiement associée.

Est-ce que c’est compatible avec le chinois ?

La série TTS-2 couvre plus de 200 langues, y compris le chinois. Avant une utilisation officielle, il convient de tester séparément le mandarin standard, les accents, les chiffres, les noms propres et les prononciations personnalisées.

Combien d’enregistrements sont nécessaires pour la clonage de voix ?

La clonage en temps réel utilise généralement un audio clair d’environ 5 à 15 secondes. Le clonage professionnel fait partie des avantages de plans plus élevés ou de services supplémentaires, et nécessite le respect des exigences de licence sonore.

Comment est facturée l’API en temps réel ?

Il n’y a pas de tarif fixe indépendant par minute. Les caractères TTS, la durée audio STT et les tokens LLM de la session sont facturés selon les taux respectifs du forfait en vigueur.

Le modèle Router va-t-il avoir une surcoût ?

Les modèles tiers sont routés via Inworld et facturés au coût du fournisseur, sans surcoût de routeur supplémentaire ; lors de l’utilisation d’une clé propre, un frais de service de 4 % est indiqué dans la documentation.

Les points sont-ils reportés ?

Les points mensuels du forfait payant peuvent être reportés jusqu’à 3 mois tant que l’abonnement reste équivalent ou supérieur, tandis que les points achetés en supplément restent valables pendant 1 an. Lors d’une annulation ou d’une downgrade, les points restants sont supprimés.

Inworld AI est-il open source ?

La plateforme principale et les modèles ne sont pas entièrement open source. Les codes TTS, les exemples d’API et plusieurs modèles sont publiés sous la licence MIT, mais certains binaires SDK sont soumis à une licence distincte.

Résumé

Inworld AI est adapté aux équipes qui ont besoin de déployer la reconnaissance vocale naturelle, des conversations à faible latence et l’inférence multi-modèles dans des applications grand public à grande échelle. Il peut fournir séparément TTS ou STT, ou bien constituer une chaîne complète d’agents intelligents vocaux à l’aide d’une API en temps réel et d’un routeur.

Lors du choix d’une option, il convient de prendre en compte en même temps le nombre de caractères, la durée audio, les tokens du modèle, la concurrence et la durée de validité des points. Lorsqu’il s’agit de clonage de voix, de données médicales ou de données sensibles, il est également nécessaire d’implémenter, en plus des tests techniques, des autorisations, un ZDR, des contrats et une gouvernance humaine.

©️Droit d’auteur : Sauf indication contraire, tous les articles de ce site sont protégés par le droit d’auteur.Partage d’outils d’IATous les droits d’auteur sont réservés. Sans autorisation, aucune personne, média, site web ou groupe ne peut reproduire, copier ou diffuser de quelque manière que ce soit le contenu de ce site, ni créer de mirror sur des serveurs qui ne lui appartiennent pas. Dans le cas contraire, notre site se réserve le droit de poursuivre en justice les responsables conformément à la loi.

Outil similaire à Inworld