Tavus
Plateforme d’IA offrant des avatars numériques programmables et des fonctionnalités de vidéos personnalisées
Étiquettes :Outils vidéo IAQu’est-ce que Tavus ?
Tavus est une plateforme de personnages numériques IA en temps réel destinée aux développeurs, aux équipes de produits et aux entreprises. Elle a d’abord attiré l’attention pour sa capacité à générer des vidéos de doubles numériques personnalisés, mais son produit phare aujourd’hui est l’Interface Vidéo Conversationnelle, abrégée CVI, utilisée pour créer des agents IA vidéo en temps réel capables de voir, d’entendre, de parler, de mémoriser et d’appeler des outils.
CVI intègre le rendu de personnages numériques, la reconnaissance vocale, les LLM, la synthèse vocale et les connexions WebRTC en une seule API ainsi que des composants hébergés. Les développeurs n’ont pas besoin d’acquérir séparément plusieurs services audio et vidéo pour intégrer des conversations avec des personnages numériques en 1080p dans des pages web, des applications, Zoom ou Google Meet.
Différences entre Face et PAL
Face définit l’apparence et le son à l’écran, c’est-à-dire le visage, la voix, les expressions et la manière de présenter l’être numérique. PAL définit le comportement, les connaissances, les prompts, les objectifs, les garde-fous, les outils et la configuration du pipeline.
Un PAL peut être lié à un Face par défaut, ou on peut choisir un autre Face lors de la création de la session.
Découpler la conception de l’identité et du comportement favorise la réutilisation : la même logique de service client peut être associée à différentes personnalités, et le même avatar numérique peut également assumer des rôles variés tels que la vente, la formation ou le conseil.
Modèle de rendu de personnage numérique Phoenix
Phoenix est chargé de générer en temps réel les visages, les micro-expressions, les mouvements de la tête et les changements d’émotion. Actuellement, la version Phoenix-4 permet d’ajuster dynamiquement les expressions en fonction du contexte, du ton et des indices du dialogue, ainsi que de passer naturellement entre les états de parole et d’écoute.
Il se concentre sur la présentation visuelle et ne couvre pas toute la connaissance métier. Un aspect réaliste ne signifie pas pour autant que les réponses sont fiables ; la qualité des faits dépend toujours de la configuration PAL, du LLM, de la base de connaissances et des outils.
Modèle de perception Raven
Raven analyse les vidéos, les sons, le langage corporel, le partage d’écran et les indices environnementaux des utilisateurs pour identifier les émotions, les intentions, le ton ainsi que des objets ou des actions spécifiques. Il peut déclencher des outils lorsqu’il détecte des comportements ou des événements sonores spécifiés.
L’inférence visuelle et émotionnelle peut entraîner des erreurs et ne doit pas être utilisée seule pour le diagnostic médical, le tri des candidats, les décisions de crédit ou l’application de la loi. Lorsqu’il s’agit d’inférences sensibles, une information claire, le consentement de l’utilisateur et une vérification manuelle sont nécessaires.
Modèle de gestion des tours Sparrow
Sparrow gère les pauses, le rythme, les tours de parole et les interruptions dans les dialogues. Sparrow-1 est la version officiellement recommandée ; elle est plus rapide et plus naturelle que les versions anciennes ainsi que que les règles basées uniquement sur le temps.
Les développeurs peuvent définir la patience pour le tour de parole sur faible, moyen ou élevé, et contrôler également la sensibilité à la perturbation du PAL. Les réponses au service client peuvent être rapides, tandis que dans les scénarios d’entretien et de consultation, une plus grande patience est requise.
Créer un visage personnalisé à partir d’une vidéo
La méthode de haute qualité consiste à télécharger une vidéo d’entraînement d’environ 1 minute, comprenant environ 30 secondes de parole et 30 secondes d’écoute. Cette méthode permet de capturer l’apparence, la voix, les expressions et les habitudes de parole, et sa qualité et son contrôle sont généralement supérieurs à ceux d’une seule image.
Les vidéos d’entraînement doivent être claires, stables, principalement en plan frontal et répondre aux exigences techniques. L’utilisateur doit disposer des droits nécessaires sur le portrait, la voix et la vidéo.
Créer un visage à partir d’une image
Les utilisateurs peuvent également télécharger des images individuelles de personnes ou de personnages, le système générant automatiquement des données d’entraînement et permettant de choisir une voix existante. Cette méthode est plus rapide à déployer, mais la fidélité en termes d’identité, de mouvements et d’expression est inférieure à celle de l’entraînement par vidéo.
L’image Face convient aux prototypes et aux personnages virtuels, et ne doit pas être utilisée pour la clonation non autorisée de personnes réelles.
Plus de 100 visages de stock
Tavus propose plus de 100 Stock Faces enregistrés par des acteurs réels, idéaux pour les prototypes rapides, les démonstrations et les équipes qui ne disposent pas de matériel personnalisé. L’utilisation des ressources Stock doit toujours respecter les règles relatives aux scénarios autorisés et à la divulgation publicitaire fixées par la plateforme.
Conception sans code avec PAL Maker
PAL Maker offre une interface guidée qui permet aux non-développeurs de configurer le visage, la voix, le comportement, les connaissances, les objectifs et les outils, afin de lancer directement des conversations hébergées. L’API, quant à elle, convient à l’intégration dans des produits professionnels et au déploiement automatisé.
Base de connaissances et RAG
Une base de connaissances optimisée peut charger les documents de l’entreprise pour fournir un contexte de recherche aux réponses. Les documents doivent être classés par version, les informations obsolètes supprimées et des droits d’accès définis.
RAG peut réduire les hallucinations, mais il ne garantit pas de trouver toujours le paragraphe correct.
Mémoire dynamique
Dynamic Memories permet à PAL de mémoriser les préférences et le contexte de l’utilisateur lors des sessions ultérieures, afin d’améliorer la continuité. Les mémoires constituent des données personnelles ; il est nécessaire de fournir des informations sur leur traitement, ainsi que la possibilité de les supprimer, de les modifier et de déterminer leur durée de conservation. Il ne faut pas conserver de mots de passe, d’informations de paiement ou de données sensibles inutiles.
Objectifs, barrières de protection et appel d’outils
Les Objectifs définissent les tâches à accomplir au cours de la session, les Guardrails restreignent les comportements interdits, tandis que le Function Calling et les Tools servent à consulter les commandes, planifier des rendez-vous ou mettre à jour le CRM. Les paramètres des outils doivent être vérifiés par le serveur, et une confirmation de l’utilisateur est requise pour les opérations à haut risque.
Contrôle émotionnel
Phoenix-4 prend en charge un contrôle émotionnel explicite et implicite. La configuration explicite permet de spécifier la direction de l’expression, tandis que le mode implicite s’adapte en fonction du contexte de la conversation.
Le marketing et le divertissement peuvent utiliser des émotions plus marquées, tandis que le secteur médical, la finance et le traitement des réclamations doivent éviter les expressions manipulatrices.
Voix, prononciation et réduction du bruit
Le CVI comprend le TTS, de l’audio à 24 kHz, un dictionnaire de prononciation, un réduction de bruit avancée et une isolation des locuteurs. Le Dictionnaire de Prononciation Personnalisé permet de corriger les noms de marques, les noms propres et les termes techniques.
Un environnement bruyant doit néanmoins fournir une confirmation textuelle et des sous-titres.
Chaîne vidéo et audio pur
Les développeurs peuvent choisir entre la version vidéo complète ou le mode audio uniquement. Le coût et la bande passante pour l’audio pur sont généralement plus faibles, ce qui le rend adapté aux appels ou aux agents en arrière-plan ;
Le mode vidéo offre des expressions et une perception visuelle, mais exige davantage de connexion Internet, d’équipement et de confidentialité.
Comparaison des forfaits et des modes de tarification
| forfait | Mode de prix | Face et dosage | Scénarios adaptés |
|---|---|---|---|
| Free | Essai de développement gratuit, le nombre de minutes et de connexions simultanées sont déterminés selon la console. | On peut utiliser les ressources Stock et le CVI de base ; il n’est pas possible de créer un visage personnalisé. | Prototype, tests API et évaluation des fonctionnalités |
| Starter | Le prix de l’abonnement ou de la consommation est affiché dans la console dynamique. | Ouverture de visages personnalisés et montant de session accru | Produits innovants et déploiement officiel à petite échelle |
| Growth | Facturation selon des quantités et des capacités plus élevées | Visage personnalisé, plus de concurrence, minutes et capacité de production | Applications en croissance et déploiement multi-scénarios |
| Enterprise | Cotation sur mesure | Personnalisation du visage, capacité, conformité, support et conditions contractuelles | Haute concurrence, réglementation et projets d’entreprise de grande envergure |
Les composants de prix sur le site officiel ne renvoient pas de montants précis de manière fiable dans le texte public, mais il est confirmé que des API et des stacks de dialogue bout en bout sont disponibles des versions Free aux versions Enterprise. Les niveaux payants permettent d’personnaliser le visage, le nombre de minutes et la concurrence. Avant achat, il convient de se connecter à la console des développeurs pour vérifier les prix en temps réel, y compris le nombre de minutes, les frais supplémentaires, la concurrence et le stockage des enregistrements.
Qu’est-ce qui est inclus dans le prix ?
Selon le site officiel, le prix de CVI comprend toutes les étapes complètes telles que LLM, TTS et WebRTC, ainsi que des vidéos en 1080p, de l’audio à 24 kHz, la perception, RAG, la mémoire, les garde-fous, les outils, la transcription et l’enregistrement. Le coût total pour les entreprises peut également inclure l’intégration, la préparation des données, la conformité, le support en ligne et les utilisations supplémentaires.
Génération de vidéos anciennes et CVI actuel
Tavus dispose toujours des capacités API de vidéos et de créations de doubles numériques ; l’information d’aide relative à la création d’une vidéo individuelle indiquait auparavant une durée maximale de 5 minutes. L’accent du produit est désormais mis sur le CVI en temps réel et PAL ; le catalogue ne devrait pas le décrire uniquement comme un outil pour la création de vidéos enregistrées personnalisées en masse.
Zoom et Google Meet
PAL peut rejoindre des sessions sur Zoom et Google Meet, idéal pour les entretiens, la formation, les ventes et le support. Avant de rejoindre automatiquement une réunion, il faut informer les participants qu’il s’agit d’une IA et préciser si l’enregistrement audio, vidéo, la transcription et le stockage sont possibles.
Intégration de LiveKit et Pipecat
Tavus propose une intégration de LiveKit avec Pipecat, idéale pour intégrer le rendu du visage dans des agents en temps réel et des infrastructures médias existantes. L’équipe doit gérer le cycle de vie de la session, la reconexion réseau, les permissions microphone et les clés serveur.
Processus d’incorporation rapide
- Enregistrer TAVUS_API_KEY sur le serveur.
- Sélectionnez Stock ou personnalisez PAL et Face.
- L’interface de création de Conversation est appelée du côté serveur.
- Intégrez l’URL de Conversation retournée dans un iframe ou une application.
- L’utilisateur termine volontairement la session en partant, afin d’éviter une facturation continue.
Les tests automatisés peuvent utiliser test_mode pour créer une session qui n’implique pas réellement le PAL et se termine immédiatement, évitant ainsi que la tâche de test ne génère des frais liés à une session normale.
Conversation API
Les développeurs peuvent créer, terminer et consulter des sessions, ainsi que récupérer les transcriptions et les enregistrements. Une fois une session créée, la facturation peut commencer et des ressources concurrentes peuvent être utilisées ; par conséquent, on ne peut pas compter uniquement sur la fermeture du navigateur pour libérer ces ressources.
OpenAPI et sécurité du serveur
Une documentation OpenAPI complète est fournie officiellement. La clé API ne doit pas être intégrée dans le code du navigateur, dans les applications mobiles ou dans des dépôts publics ;
L’interface utilisateur ne peut appeler que son propre backend, qui crée les sessions contrôlées.
L’URL du fichier utilisé pour l’entraînement de Face doit être une adresse avec signature à court terme ; les clés et les éléments sensibles publiés de manière permanente ne doivent pas être enregistrés dans les journaux.
GitHub et projets d’exemple
Tavus Engineering met à disposition sur GitHub des exemples CVI officiels, des entretiens d’embauche, ainsi que des projets de démonstration tels que Santa, afin d’aider les développeurs à comprendre les interfaces en temps réel. Les résultats de recherche incluent également des SDK tiers en Python, Ruby et C#, et il est nécessaire de distinguer ceux gérés officiellement de ceux maintenus par la communauté avant de les utiliser.
Statut open source
Les modèles Phoenix, Raven, Sparrow de Tavus, l’entraînement des visages, le hébergement CVI et les API commerciales ne sont pas des produits open source. Le fait que les projets d’exemple officiels aient un code ouvert ne signifie pas que les modèles principaux ou le serveur puissent être déployés en mode privé.
Données, enregistrement et conformité
Le CVI peut enregistrer et conserver les transcriptions des conversations, ainsi que gérer des vidéos, de l’audio, des données faciales, des émotions et une base de connaissances. Les entreprises doivent déterminer le consentement à informer, la base légale, les droits d’accès, la conservation, la suppression, la localisation des données et le traitement réglementé des informations.
L’utilisateur peut demander la suppression des données, mais l’application d’entreprise doit également effectuer une suppression synchronisée dans son propre système de données.
Guide d’utilisation de Tavus
Créer des flux de travail professionnels réutilisables
- Créer des scripts, des fiches de tournage, des matériaux de marque et une liste d’éléments interdits ;
- Conserver des paramètres unifiés pour les différences entre Face et PAL, le modèle de rendu de personnage numérique Phoenix et le modèle de perception Raven ;
- Testez d’abord le modèle et les limites avec des scènes représentatives ;
- Transférer les plans ratés pour un montage manuel ou une régénération ;
- Unifier les sous-titres, le volume, les couleurs et les informations de droits d’auteur en fin de film ;
- Enregistrez la version et l’auditeur avant de publier en masse ;
À qui s’adresse-t-il ?
- Développeurs qui créent des agents de service client et de vente virtuels en temps réel ;
- Produits de dialogue nécessitant la perception visuelle, vocale et émotionnelle ;
- Équipe chargée de créer des formations et des cours interactifs pour les avatars numériques ;
- Les entreprises qui intègrent des agents IA dans Zoom ou Google Meet ;
- Applications nécessitant RAG, mémoire, garde-corps et appels d’outils ;
- Équipes qui utilisent LiveKit ou Pipecat pour mettre en place des pipelines de médias en temps réel.
Avantages principaux
- Prend en charge du début à la fin les LLM, le TTS, WebRTC et le rendu de personnages numériques ;
- Phoenix, Raven et Sparrow s’occupent respectivement de l’apparence, de la perception et des tours ;
- Permet de créer des visages personnalisés à partir de vidéos ou d’une seule image ;
- PAL intègre les connaissances, la mémoire, les objectifs, les garde-fous et les outils ;
- Fournit des vidéos en 1080p, un faible retard et une large gamme de contrôles en temps réel ;
- API ouverte, PAL Maker, intégration avec des frameworks de conférence en temps réel.
Restrictions et précautions
- La vidéo en temps réel entraîne des coûts, une bande passante et des risques pour la vie privée plus élevés que les agents textuels ou vocaux ;
- L’inférence des émotions visuelles peut être erronée, l’utilisation de visages personnalisés nécessite une autorisation ;
- Si la session n’est pas fermée correctement, la facturation peut se poursuivre ;
- La plateforme principale n’est pas open source, le prix exact doit être vérifié en se connectant à la console.
- Les réponses des LLM, la recherche RAG et l’exécution d’outils peuvent encore faire des erreurs ; les opérations à haut risque doivent faire l’objet d’une validation manuelle.
Questions fréquentes
Tavus est-il gratuit ?
Il existe une expérience de développement gratuite permettant d’utiliser des ressources CVI de base et des contenus Stock ; la personnalisation du visage n’est disponible que pour les abonnements Starter, Growth et Enterprise.
Combien de matériel est nécessaire pour créer son propre double numérique ?
Utiliser une vidéo de haute qualité d’environ 1 minute, avec environ 30 secondes de parole et 30 secondes d’écoute ; on peut également créer rapidement une image unique, mais la qualité est moindre.
Quelle est la différence entre Face et PAL ?
Face est responsable de l’apparence et du son, tandis que PAL est responsable du comportement, des connaissances, des objectifs, de la mémoire, des garde-fous et des outils.
Tavus propose-t-il une API ?
Fournit une API complète ainsi que des spécifications OpenAPI pour gérer les Faces, PALs, Conversations, Vidéos, Outils et Documents.
Peut-on ajouter Tavus à Zoom ?
Prend en charge l’intégration avec Zoom et Google Meet ; il est nécessaire d’informer les participants de l’identité de l’IA et des politiques d’enregistrement lors de l’utilisation.
Tavus est-il open source ?
Le modèle de base et CVI hébergé ne sont pas open source ; des exemples et projets de démonstration officiels sont disponibles sur GitHub.
Numéro d’enregistrement de sécurité publique du Guangxi : 45132202000164