Deepgram
Valeur ajoutée gratuite
Guide complet des outils d’IA Outils audio IA

Deepgram

Deepgram, outil intelligent spécialisé dans l’audio IA

Étiquettes :

Une phrase pour présenter

Deepgram est une plateforme d’IA vocale destinée aux développeurs et aux entreprises, qui offre, via des API, une reconnaissance vocale en temps réel et en batch, une synthèse vocale dialoguée, une orchestration complète de Voice Agents ainsi que la compréhension audio, et prend en charge le cloud hébergé, les environnements dédiés et le déploiement local.

Présentation des outils

Deepgram propose une capacité complète, allant de l’écoute au raisonnement puis à la parole, pour les applications vocales réelles. Les développeurs peuvent soit utiliser séparément Speech-to-Text ou Text-to-Speech, soit créer, via une connexion WebSocket, des agents intelligents vocaux en temps réel capables de gérer les interruptions, les tours de parole et les appels d’outils.

Les modèles principaux actuels comprennent Nova-3 pour la transcription générale, Flux STT pour les tours de dialogue, Flux TTS interactif et la série Aura pour la synthèse vocale. Les produits et modèles sont des services commerciaux ; le SDK officiel étant open source ne signifie pas que les poids des modèles ou le code source de la plateforme le soient également.

Aperçu des capacités du produit

ProduitPrincipales importationsSortie principaleUtilisations typiques
Speech-to-TextFlux en temps réel ou fichier audioTexte avec heure, locuteur et niveau de confianceTranscription, sous-titres et analyse
Text-to-SpeechContexte du texte et des dialoguesSynthèse vocale en fluxService client, assistants et robots téléphoniques
Voice Agent APIAudio en temps réel bidirectionnel et configurationDialogue vocal interrompableService client, prise de rendez-vous et appels externes
Audio IntelligenceTranscription audio ou texteRésumé, thème, émotion et intentionContrôle qualité, analyse et routage
Self-HostedInfrastructure GPU d’entrepriseÉtendue de raisonnement vocal privéeRésidence des données et faible latence
PlaygroundMicrophone, fichier ou texteRésultats de l’essai du modèleVérification du prototype et comparaison des paramètres

Modèle de reconnaissance vocale

Nova-3

Nova-3 est le modèle de reconnaissance vocale de niveau production actuellement recommandé, pouvant être utilisé pour des flux en temps réel et des fichiers audio préenregistrés. Il prend en charge plusieurs langues, la détection automatique du langue, le bruit et les sons provenant de distances éloignées, et permet d’améliorer la reconnaissance des termes de marque, de produits et du secteur grâce au Keyterm Prompting.

Flux STT

Flux STT est conçu spécifiquement pour les agents vocaux en temps réel ; il ne se contente pas de reconnaître le texte, mais intègre également dans le modèle la détection de la fin des tours de parole ainsi qu’un rythme de dialogue configurable. Les versions anglaise et multilingue sont facturées séparément, et la version multilingue permet d’influencer la reconnaissance à l’aide de suggestions linguistiques.

Nova-3 Medical et modèles sur mesure

Nova-3 propose des options destinées au vocabulaire médical ; les entreprises peuvent également contacter le service commercial pour obtenir des modèles personnalisés adaptés à des données propres ou spécifiques. Les modèles professionnels doivent néanmoins être évalués en utilisant des accents, des équipements, des scénarios et des corpus de vocabulaire réels, et ne peuvent pas se baser uniquement sur des références générales.

Whisper Cloud et le modèle ancien

Deepgram continue de proposer l’hébergement de Whisper Large, tout en conservant Nova-2, Enhanced et Base pour les déploiements existants. Pour de nouveaux projets, il est généralement conseillé de comparer d’abord Nova-3 et Flux, afin d’éviter d’opter par défaut pour Whisper, dont la capacité d’extension est plus limitée en raison de sa compatibilité historique.

Fonction de reconnaissance vocale

  • Le streaming est utilisé pour la transcription incrémentale en temps réel des appels, des conférences et des agents vocaux.
  • Pre-Recorded est utilisé pour télécharger des enregistrements et générer du texte complet de manière asynchrone ou synchrone.
  • La diarisation du locuteur permet d’identifier plusieurs personnes et d’indiquer qui parle à chaque moment.
  • Le formatage intelligent gère automatiquement la ponctuation, la casse, les dates et les monnaies.
  • Le Keyterm Prompting améliore la reconnaissance des noms de produits, des abréviations et des termes techniques.
  • Redaction est utilisé pour identifier et supprimer certaines informations personnelles sensibles.
  • La détection d’entités permet d’extraire des entités telles que des personnes, des organisations, des lieux et des dates.
  • La détection automatique de langue aide à gérer les langues inconnues ou les changements de scène.

Synthèse vocale Text-to-Speech

Flux TTS

Flux TTS est un modèle fluide et nativement conçu pour les agents vocaux en temps réel, qui utilise le contexte à travers les différentes phases de la conversation pour maintenir la continuité du ton, du rythme et de l’émotion. Il peut fournir des retours sur le texte que l’utilisateur a réellement entendu avant une interruption, et permet d’ajuster la vitesse et le style sans interrompre la conversation.

Aura-2

Aura-2 est conçu pour la synthèse vocale professionnelle, à grande échelle et à faible latence, et peut être utilisé dans les services client, les notifications et les applications de dialogue. Les modèles Aura-2 existants ne seront pas migrés de force suite à la sortie de Flux TTS.

Aura-1

Aura-1 reste disponible en tant qu’option de synthèse vocale à moindre coût. Lors du choix, il convient de comparer à la fois les langues, les voix, les délais, la prononciation du contenu structuré et la région de déploiement, et non seulement le prix par millier de caractères.

Contrôle vocal interactif

Deepgram conçoit actuellement la synthèse vocale comme une partie de l’architecture de dialogue, capable de suivre l’état, les limites des tours de parole et les interruptions. Pour les projets ayant des exigences strictes en matière de voix de marque ou de clonage vocal, il convient de vérifier d’abord le modèle actuel et les capacités d’autorisation.

Voice Agent API

L’API Voice Agent combine la reconnaissance vocale, l’orchestration de LLM et la synthèse vocale dans une connexion en temps réel, réduisant ainsi le travail des développeurs qui devaient assembler plusieurs services. Les utilisateurs peuvent également utiliser leurs propres LLM ou TTS, et n’utiliser que les autres capacités de voix et d’orchestration de Deepgram.

  • Détection intégrée de Barge-in, permettant aux utilisateurs d’interrompre naturellement l’agent intelligent.
  • La prédiction du tour de parole aide le système à déterminer quand écouter, réfléchir et parler.
  • L’appel de fonction permet de consulter des systèmes métier ou d’exécuter des outils au cours d’une conversation.
  • Le contrôle en cours de session permet d’ajuster les configurations et le comportement au cours de la session.
  • Les configurations réutilisables facilitent la réutilisation des paramètres des agents.
  • L’architecture Multi-Agent prend en charge le transfert entre des agents intelligents spécialisés.
  • La capacité de téléphonie est utilisée pour se connecter aux réseaux de téléphonie entrante et sortante.
  • Le Browser Agent SDK permet d’intégrer des fonctionnalités de voix en temps réel dans les applications Web.

Audio Intelligence

L’Audio Intelligence est utilisée pour générer, à partir de transcriptions, des résultats structurés tels que des résumés, des thèmes, des émotions et des intentions. Certaines fonctionnalités sont facturées séparément en fonction des tokens d’entrée et de sortie ; elles ne font pas partie intégrante et gratuite du prix du reconnaissance vocale.

CapacitéRésultatScénarios adaptésRisques principaux
SummarizationRésumé du dialogueComptes rendus du service client, résumé des réunionsLes conditions limitatives pourraient être oubliées
Topic DetectionMétadonnéesClassification du contenu et routageInstabilité des frontières multi-thèmes
Sentiment AnalysisTendance émotionnelleContrôle qualité des services et tendancesContexte, culture et déviation ironique
Intent RecognitionIntention de l’utilisateurDépartition automatique et actions suivantesUne intention erronée peut déclencher un processus incorrect.
Entity DetectionPersonnages, organisations, lieux et datesSaisie et recherche dans le CRMLa orthographe des noms doit être vérifiée.
RedactionSupprimer une partie du texte sensibleGestion de la confidentialité et du respect des réglementationsNe peut pas remplacer une protection complète contre les fuites de données

Processus d’accès complet

  1. Créez un compte Deepgram et un projet pour obtenir un crédit gratuit.
  2. Générer une clé API ne possédant que les permissions nécessaires, et la stocker dans des configurations serveur sécurisées.
  3. Choisissez Streaming ou Pré-enregistré en fonction du traitement de conversations en temps réel ou d’enregistrements.
  4. Choisissez Nova-3, Flux ou un autre modèle adapté au langage et à la scène.
  5. Définir l’encodage audio, la fréquence d’échantillonnage, la langue, le locuteur et les paramètres de formatage.
  6. Exécuter des tests de référence avec des équipements réels, du bruit, des accents et un vocabulaire professionnel.
  7. Les segments temporaires, les segments finaux, les erreurs, les délais d’exécution et les réconnections dans les résultats du traitement.
  8. Enregistrer la durée audio, le nombre de caractères, les fonctionnalités supplémentaires et la concurrence pour surveiller les coûts.
  9. Configurer avant le lancement les politiques de confidentialité, de conservation, de région, de quotas et de dégradation en cas de panne.

Tutoriel de transcription en temps réel

  1. Obtenir un audio monophonique ou stéréo stable depuis un navigateur, un téléphone ou un appareil audio.
  2. Établir une connexion WebSocket et effectuer l’authentification avec des identifiants à court ou long terme du côté serveur.
  3. Indiquez le codage, le taux d’échantillonnage et le nombre de canaux corrects pour éviter une interprétation erronée de l’audio.
  4. Utiliser Nova-3 pour le traitement de la transcription générale, ou Flux pour les tours de dialogue.
  5. Activez le Formatage intelligent, la Diarisation et les Mots-clés selon les besoins.
  6. Utiliser les résultats intermédiaires pour l’interface en temps réel, et les résultats finaux pour la persistance et les actions métier.
  7. Créer un état machine pour la déconnexion, le silence, les longues pauses, la réconnection et la répétition des segments.
  8. Calculer le taux d’erreur de mot, la précision des entités et le délai bout en bout à l’aide d’un ensemble d’étiquetage manuel.

Tutoriel pour créer un Voice Agent

  1. Définir les tâches de l’agent, les actions autorisées et les conditions nécessitant une intervention humaine.
  2. Configurer la reconnaissance vocale Flux ou Nova, les fournisseurs de LLM et les voix TTS.
  3. Rédiger des indications systémiques pour limiter l’identité, la portée des activités et les engagements non assumables.
  4. Exécuter l’appel de fonction et valider les paramètres, les droits d’accès et l’idempotence du côté serveur.
  5. Tester les interruptions, le silence, la répétition, les bruits de fond et le parlage simultané par les utilisateurs.
  6. Enregistrer ce que l’utilisateur entend réellement, afin d’éviter des incohérences dans l’état du système après une interruption.
  7. Ajouter une authentification, des étapes de confirmation et une prise en charge manuelle pour les opérations sensibles.
  8. Surveiller la durée de chaque appel, le délai, le taux de transfert vers un agent humain, le taux de réussite des tâches et les coûts.

Évaluation de la qualité de production

  1. Préparer un ensemble de tests couvrant les principales langues, accents, appareils, bruits et termes professionnels.
  2. Des transcriptions de référence fiables sont créées manuellement, et des règles de notation sont établies.
  3. Tester séparément les modes en temps réel et par lots, sans comparer les délais et la précision de manière mixte.
  4. Comparer Nova-3 monolingue, multilingue, Flux et les fournisseurs existants.
  5. Des points sont attribués séparément aux entités clés telles que les chiffres, les noms de personnes, les adresses, les médicaments et les comptes.
  6. Évaluer le jugement de tour en dehors du taux d’erreur de mot, le retard du premier caractère et le retard final.
  7. Estimer les coûts pour plusieurs canaux, les fonctionnalités supplémentaires, l’Audio Intelligence et les tentatives de réessai.
  8. L’augmentation du trafic n’a lieu que lorsque le seuil opérationnel est atteint.

À qui s’adresse-t-il

  • Équipe de développement d’agents vocaux : création d’assistants vocaux en temps réel à faible latence et interrompables.
  • Plateforme de centre d’appels : transcription des appels, résumé des conversations et identification des intentions.
  • Produits de conférence et de sous-titres : génération de sous-titres en temps réel, d’identifiants de locuteurs et de chapitres.
  • Entreprises médicales et financières : utilisation de la conformité et du déploiement privé via des contrats d’entreprise.
  • Plateformes de médias et de podcasts : transcription en masse, recherche et compréhension des enregistrements.
  • Équipe des ventes et du service client : convertir les données vocales en informations CRM et de contrôle qualité.
  • Équipe d’ingénierie de plateforme : intégration via des SDK, des endpoints régionaux et une solution auto-hébergée.

Scénarios d'utilisation typiques

ScèneCapacité de recommandationIndicateurs clésContrôle des risques
Robot de service client en temps réelFlux STT + Flux TTS ou Voice AgentInterrompre, retarder, taux de résolutionPasser en mode manuel et authentification
Sous-titres de réunionNova-3 Streaming + DiarisationTaux d’erreur de mot et taux de précision du locuteurLes participants sont d’accord
Archivage audioNova-3 Pre-RecordedDébit, coût et taux de récupérationRéservation et contrôle d’accès
Dossiers médicauxNova-3 Medical + RedactionTerminologie et entités clésBAA et vérification manuelle
Contrôle qualité téléphoniqueSTT + Intelligence audioRésumé, émotions et intentionsÉviter de punir uniquement en se basant sur des scores émotionnels
Avis vocalAura-2 ou Aura-1Prononciation, retard et coûtVérification de la marque et de l’accessibilité
Plateforme de voix localeSelf-HostedRésidence des données et capacitéGPU, mises à niveau et gestion des licences

Plan de prix

Les prix ci-dessous ont été vérifiés sur la page officielle le 22 août 2026. Une partie des prix pour le traitement par reconnaissance vocale en flux est soumise à des promotions temporaires ; l’avantage offert pour Flux TTS et Voice Agent utilisant Flux TTS prendra fin le 12 septembre 2026, il est donc nécessaire de vérifier à nouveau les prix avant leur mise en service.

PlanPrix ou seuilPrincipaux droitsTaille par défautAdéquat pour les utilisateurs
Free CreditNouveau compte : 200 dollarsPas de carte de crédit nécessaire, aucun échéance fixe pour le crédit accordéUtiliser un modèle publicPrototype et évaluation
Pay As You GoSelon la consommation réellePas de engagement minimumSTT en flux, jusqu’à 150 simultanésDéveloppeurs et équipes startup
GrowthA partir de 4 000 dollars par an à payer d’avanceJusqu’à 20 % de réduction maximale et plus de concurrence simultanéeFlux STT jusqu’à 225 simultanésApplications de production en croissance
EnterpriseContacter le service des ventesModèles à grande échelle, personnalisés, déploiement privé et supportConcurrence sur mesure et SLAEntreprises de grande taille ou réglementées

Prix de la reconnaissance vocale en texte

Reconnaissance vocale en temps réel par streaming

modèlePay As You GoGrowthUnité de facturationRemarques
Flux EnglishActuellement 0,0065 dollar américainActuellement 0,0057 dollar américainpar minutePrix promotionnel en flux
Flux Multilingual0,0078 dollar américain0,0068 dollar américainpar minuteSoutien au dialogue multilingue
Nova-3 MonolingualActuellement 0,0048 dollar américainActuellement 0,0042 dollar américainpar minutePrix promotionnel en flux
Nova-3 MultilingualActuellement 0,0058 dollar américainActuellement 0,0050 dollar américainpar minutePrix promotionnel en flux
CustomContacter le service des ventesContacter le service des ventescontratDonnées propres ou spéciales

Reconnaissance de la parole enregistrée

modèlePay As You GoGrowthUnité de facturationAdéquat pour la tâche
Nova-3 Monolingual0,0043 dollar américain0,0036 dollar américainpar minuteEnregistrement monolingue
Nova-3 Multilingual0,0052 dollar américain0,0043 dollar américainpar minuteEnregistrements multilingues
Whisper Large0,0048 dollar américain0,0048 dollar américainpar minuteCompatibilité avec des processus Whisper spécifiques
CustomContacter le service des ventesContacter le service des ventescontratModèle personnalisé

Fonctionnalité supplémentaire Speech-to-Text

FonctionnalitéPay As You GoGrowthEn direct ou en enregistrementRemarques
Redaction0,0020 dollar par minute0,0017 dollar par minuteLes deuxSupprimer certaines informations sensibles
Keyterm Prompting0,0013 dollar par minute0,0012 dollar par minuteLes deuxRenforcer les termes clés
Smart FormattingContientContientLes deuxPontuation et mise en forme
Entity Detection0,0017 dollar par minute0,0017 dollar par minuteLes deuxExtraction d’entités
Speaker DiarizationEn temps réel : 0,0020 dollar par minuteSelon la pageen temps réelLe mode enregistrement contient actuellement
Speaker DiarizationContientContientEnregistrementAnnotation multiple

Prix Text-to-Speech

Flux TTS est gratuit pendant une période limitée jusqu’au 12 septembre 2026, puis le tarif normal par caractère sera rétabli à partir du 13 septembre 2026. La période gratuite n’est pas un plan gratuit permanent.

modèlePay As You GoGrowthUnité de facturationStatut du prix
Flux TTSGratuit jusqu’au 12 septembre, puis 0,0450 dollarGratuit jusqu’au 12 septembre, puis 0,0405 dollarChaque 1000 caractèresOffre limitée dans le temps
Aura-20,030 dollar américain0,027 dollar américainChaque 1000 caractèresPrix standard actuel
Aura-10,0150 dollar américain0,0135 dollar américainChaque 1000 caractèresPrix standard actuel

Prix de l’API Voice Agent

L’agent vocal est facturé en fonction de la durée de la conversation, et des niveaux diffèrent selon que l’on utilise ou non les LLM et TTS fournis par Deepgram. Voici les prix actuels pendant la période d’essai gratuite de Flux TTS, ainsi que les prix standard une fois cette période terminée.

niveauPrix actuel Pay As You GoPrix après l’événementPrix actuel de GrowthConforme à la configuration
Standard0,056 dollar par minute0,075 dollar par minute0,051 dollar par minuteUtiliser la pile vocale par défaut complète
Standard BYO TTS0,065 dollar par minuteAvec le présent0,051 dollar par minuteSynthèse vocale intégrée
Custom BYO LLM0,050 dollar par minute0,065 dollar par minute0,041 dollar par minuteModèle de langue intégré
LLM personnalisé BYO avec TTS0,050 dollar par minuteAvec le présent0,041 dollar par minuteModèle de langue et synthèse vocale intégrés
Advanced0,122 dollar par minute0,163 dollar par minute0,110 dollar par minuteNiveaux plus avancés de LLM
Advanced BYO TTS0,122 dollar par minuteAvec le présent0,110 dollar par minuteLLM avancé avec TTS intégré

Règles de facturation et pièges de coûts

  • La reconnaissance vocale est facturée en secondes réelles, sans arrondi à des minutes fixes.
  • Le tarif pour les sons stéréo est calculé en fonction de la durée totale de traitement de chaque canal ; 10 minutes en stéréo sont facturées comme 20 minutes.
  • La rédaction, les mots-clés, les entités et une partie de la diarisation entraînent des frais supplémentaires.
  • Audio Intelligence facture en fonction des tokens d’entrée et de sortie, ce qui n’est pas inclus dans le prix unitaire du STT.
  • Tout dépassement du plafond de crédit est facturé au taux de Growth initial majoré de 10 % et réglé hebdomadairement.
  • Pour activer la croissance et les utilisations supplémentaires, il est nécessaire de conserver une carte de crédit valide ; sinon, l’épuisement du plafond interrompra la demande.
  • La limite de concurrence est définie au niveau du projet ; plusieurs clés API partageant le même pool n’augmentent pas la capacité.
  • Créer des projets supplémentaires pour contourner les limitations de vitesse constitue une violation des conditions d’utilisation.
  • Une fois les promotions et les offres gratuites à durée limitée terminées, le coût unitaire peut varier automatiquement.

Limite de vitesse

ServiceLimite par défaut Pay As You GoRestrictions publiques à la croissanceExplication
Voice AgentJusqu’à 45 connexions simultanéesJusqu’à 60 connexions simultanéesCalculé par projet
Flux STT StreamingJusqu’à 150 requêtes simultanéesLa page de planification affiche un maximum de 225Les documents régionaux doivent être confirmés à nouveau.
Nova-3 Pre-RecordedJusqu’à 50 requêtes simultanéesLe plan public est de 50Tâches en batch
Nova-3 StreamingJusqu’à 150 requêtes simultanéesJusqu’à 225Transcription en temps réel
Speaker Diarization Streaming50 en Amérique du Nord, 25 en Europe et en AustralieConformément à l’accordEn dessous de la limite de flux normal
Text-to-Speech RESTJusqu’à 15 requêtes simultanées par modèleL’aperçu du plan indique une échelle globale plus importante.Préférence aux restrictions de modèle et de région
Audio IntelligenceJusqu’à 10 requêtes simultanéesJusqu’à 10Analyse supplémentaire

Mode de déploiement

MéthodeEmplacement d’exécutionResponsabilités de maintenanceDonnées et scénarios d’application
HostedCloud multi-locataires DeepgramDeepgram est responsable de l’infrastructure et des mises à jour.Commencer le développement le plus rapidement possible
Cloud régionalPoints d’entrée en Amérique du Nord, en Europe ou en AustralieDeepgram est responsable deTraitement régional et résidence des données
Dédier ou VPCEnvironnement cloud dédié aux clientsSelon l’accord d’entrepriseIsolation et capacité personnalisée
Self-HostedVPC du client ou centre de donnéesLe client est responsable de l’infrastructure, des sauvegardes et des mises à jour.Confidentialité stricte et faible latence
Amazon SageMakerClient AWS VPCPoints d’entrée hébergés par AWS et configuration clientDéploiement de modèles via Marketplace

Exigences pour l’hébergement auto-géré

Le déploiement local prend en charge Docker, Podman, Kubernetes, le bare metal et certaines plateformes cloud, mais uniquement Linux x86-64 ou amd64 ainsi que des GPU NVIDIA. Nova et Aura offrent un support plus large, tandis que le modèle Flux exige des générations de GPU et plus de mémoire.

  • Le moteur STT nécessite généralement au moins une GPU NVIDIA avec 16 Go de mémoire vidéo, un CPU à 4 cœurs et 32 Go de mémoire vive.
  • Le moteur TTS de la classe Aura nécessite exactement 2 GPU dédiés, un CPU à 8 cœurs et 64 GB de mémoire.
  • Flux TTS utilise une seule GPU, mais peut occuper environ 60 GB de mémoire système lors du chargement.
  • Les conteneurs auto-hébergés nécessitent toujours une licence et des rapports d’utilisation ; ils ne sont pas entièrement hors ligne automatiquement, sauf dans le cadre du mode d’isolation SageMaker.
  • Le client est responsable du suivi, de la capacité, des sauvegardes, des mises à jour, des proxies et de la terminaison TLS.
  • L’autonomisation de Docker, Podman ou Kubernetes nécessite généralement une licence Enterprise.

Confidentialité, sécurité et amélioration des modèles

Deepgram laisse aux accords commerciaux la responsabilité de la conservation, du stockage et de la suppression des données clients des entreprises. Selon les documents d’autogestion, l’audio, les transcriptions et autres contenus de reconnaissance d’une demande d’autogestion typique ne sont pas envoyés à Deepgram ; seuls des métadonnées d’utilisation tels que la durée, le nombre de caractères, les fonctionnalités et l’état de réussite sont communiqués.

Les clients Pay As You Go et Growth peuvent choisir d’adhérer ou de quitter le Model Improvement Program ; le retrait à partir de mars 2026 n’affecte pas les tarifs affichés sur le site officiel. Avant de traiter des données personnelles réelles, il convient de confirmer les options de la console, la région, la durée de conservation et le protocole de traitement des données.

  • Deepgram divulgue les informations relatives aux certifications SOC 2 Type I et Type II.
  • Les clients médicaux d’Enterprise peuvent signer un BAA pour traiter des informations de santé protégées électroniquement.
  • Les points d’extrémité régionaux en Europe sont utilisés pour répondre aux exigences de traitement et de stockage des données au sein de l’Union européenne.
  • La clé API doit être stockée uniquement du côté serveur, et organisée par projet, environnement et avec les permissions minimales nécessaires.
  • La rédaction ne peut que réduire partiellement le risque d’exposition ; elle ne peut pas remplacer la minimisation des données à la source.
  • Évitez d’enregistrer dans le journal l’audio brut, la transcription complète et les clés valables sur le long terme.
  • Les agents vocaux à haut risque doivent fournir des informations, un consentement pour l’enregistrement, une prise en charge humaine et une audit.

SDK, GitHub et statut open source

Deepgram maintient des SDK pour JavaScript, Python, .NET, Go et Java au sein de son organisation officielle GitHub, et fournit également des paquets liés au navigateur Voice Agent. La documentation actuelle du SDK JavaScript indique que la version v5 est la version principale en cours, et les projets en cours de migration doivent se référer aux instructions d’upgrade correspondantes.

Plusieurs SDK officiels sont soumis à la licence MIT, permettant aux développeurs de consulter, modifier et distribuer ces codes clients. Cependant, la plateforme cloud Deepgram, son modèle commercial, les poids des modèles et les conteneurs auto-hébergés ne deviennent pas pour autant des produits open source.

ProjetEntretienÉtatLicence ou instructions
SDK JavaScript et TypeScriptDeepgram officielPublicMIT, version principale actuelle v5
Python SDKDeepgram officielPublicSelon la licence d’entrepôt
.NET SDKDeepgram officielPublicMIT
Go SDKDeepgram officielPublicMIT
Java SDKDeepgram officielPublicMIT
Rust SDKcommunautéPublicCe n’est pas le même niveau de soutien officiel
Voice Agent SDKDeepgram officielPublicMIT
Poids du modèle et plateforme cloudDeepgramPas open sourceProduits commerciaux

Langues et plateformes prises en charge

CapacitéLangue ou plateformeStatut publicPrécautions à prendre
Reconnaissance vocale NovaPlus de 45 languesSoutienLes fonctionnalités spécifiques varient en fonction du modèle et de la langue.
Nova-3 MultilingualDescriptions de produits en plus de 50 languesSoutienDétection automatique de langue
Flux STT Multilingual10 languesSoutienPour les conversations en temps réel
Flux TTSVoix anglaise actuelleSoutienD’autres langues sont encore en cours de planification
API cloudServeur et WebSocketSoutienLes points d’extrémité régionaux diffèrent
Self-HostedLinux x86-64 et GPU NVIDIASoutien aux entreprisesLes exigences en matière de matériel varient selon le modèle.
SDK pour mobilePas d’application consommateur indépendantePar intégration backend ou WebLa clé ne peut pas être placée dans le client.

Avantages du produit

  • De STT, TTS à Voice Agent : une pile vocale cohérente.
  • Flux intègre la fin des tours et les retours d’interruption dans le modèle de dialogue, réduisant ainsi le collage externe.
  • Nova-3 couvre la transcription en temps réel et par lots, et offre un enrichissement multilingue et terminologique.
  • La facturation par seconde évite les gaspillages dus à l’arrondi vers le haut en fonction des minutes fixes.
  • Une ligne de crédit gratuite de 200 dollars est offerte pour effectuer une évaluation de données réelles.
  • Les options de déploiement en gestion déléguée, régional, VPC, local et SageMaker sont assez complètes.
  • Le SDK officiel prend en charge de nombreux langages serveur populaires et met son code source à disposition.
  • La sécurité des entreprises, les accords médicaux et les options de stockage des données en UE sont assez clairs.

Restrictions d'utilisation et précautions

  • La précision du modèle est affectée par la langue, l’accent, le bruit, le matériel, les conditions à distance et le chevauchement des paroles.
  • Les prix promotionnels et les offres gratuites à durée limitée ont une date de fin clairement définie, tandis que les coûts à long terme doivent être estimés au tarif standard.
  • La somme des durées de chaque canal stéréo peut facilement conduire à une sous-estimation des coûts.
  • Certaines fonctionnalités d’amélioration de la transcription et l’Audio Intelligence sont facturées en supplément.
  • La concurrence par défaut est limitée par projet, et il n’est pas possible de l’éviter en créant davantage de projets.
  • L’agent vocal doit valider les autorisations, les paramètres et la confirmation de l’utilisateur lorsqu’il exécute des actions externes.
  • Les modèles d’émotions et d’intentions peuvent présenter des biais et ne doivent pas servir de seul critère de décision.
  • L’hébergement auto-géré nécessite une GPU, Linux, la gestion de conteneurs, des connexions autorisées et un contrat d’entreprise.
  • Le fait que l’SDK officiel soit open source ne signifie pas que les modèles de voix ou la plateforme puissent être déployés en privé gratuitement.
  • Les informations médicales, juridiques, financières et d’identité importantes doivent encore faire l’objet d’une vérification manuelle.

Informations de base

champContenu
Nom de l’outilDeepgram
Société de développementDeepgram, Inc.
Type d’outilReconnaissance vocale, synthèse vocale et plateforme Voice Agent
Modèle principalNova-3, Flux STT, Flux TTS, Aura-2 et Aura-1
Interface principaleAPI REST et API WebSocket
Limite gratuiteNouveau compte : limite de crédit de 200 dollars
Modèle de prixPayant, prépaiement annuel Growth et personnalisé Enterprise
Seuil de croissanceÀ partir de 4 000 dollars par an
Déploiement principalHébergé, cloud régional, VPC, auto-hébergé et SageMaker
Soutien en chinoisSoutien de la série Nova, les capacités spécifiques doivent être consultées dans le tableau des langages du modèle.
Faut-il s’inscrire ?Oui
Fournit-on une API ?Oui
SDK officielJavaScript, Python, .NET, Go, Java, etc.
GitHub officielOui
Le SDK est-il open sourceOui, plusieurs SDK officiels utilisent MIT.
Le produit est-il open sourceNon

Indice de recommandation

Le score de recommandation est de 4,7 sur 5. Deepgram couvre l’ensemble du processus de production, allant de la transcription en temps réel au TTS dialogué et aux agents vocaux complets, offrant une gamme complète de modèles, de documents, d’SDK, ainsi que des options de déploiement régional et local.

Le défi réside dans le grand nombre de lignes de produits et de dimensions de facturation ; la fin des promotions, les canaux audio, les fonctionnalités supplémentaires et le nombre de connexions simultanées peuvent tous modifier le coût total. La méthode la plus fiable consiste à utiliser un crédit de 200 dollars pour évaluer une charge réelle de référence, puis à estimer le budget de production en fonction du prix standard.

Questions fréquentes

Deepgram est-il gratuit ?

Les nouveaux comptes bénéficient d’une ligne de crédit gratuite de 200 dollars, sans carte de crédit, et selon le site officiel, elle n’a pas de date d’échéance fixe. Une fois cette ligne de crédit épuisée, des frais sont facturés en fonction de l’utilisation réelle.

Combien coûte la reconnaissance vocale Deepgram ?

Le prix actuel promotionnel en temps réel pour Nova-3 en langue unique est de 0,0048 dollar américain par minute, et pour l’audio préenregistré, de 0,0043 dollar américain par minute. Les prix varient pour les langues multiples, Flux et les fonctionnalités supplémentaires.

Flux TTS est-il gratuit à vie ?

Non. Flux TTS est gratuit uniquement pendant une période limitée jusqu’au 12 septembre 2026 ; à partir du 13 septembre, le tarif standard Pay As You Go est de 0,0450 dollar américain par 1000 caractères.

Comment est facturée l’API Voice Agent ?

La facturation se fait en fonction du nombre de minutes de conversation et de la combinaison LLM/TTS choisie. Le tarif actuel pour l’offre Standard est de 0,056 dollar par minute, et passera à 0,075 dollar une fois l’offre terminée.

Est-ce que c’est compatible avec le chinois ?

La série Nova prend en charge le chinois et d’autres langues, mais les fonctionnalités de reconnaissance spécifiques, les options de modèles et la disponibilité par région dépendent de la liste linguistique la plus récente. Les projets en chinois doivent toujours être testés pour les accents, les mots anglais intégrés et les termes spécialisés.

Peut-on l’installer localement ?

Oui, les clients Enterprise peuvent l’héberger eux-mêmes dans une VPC, sur du bare metal ou sur une plateforme de conteneurs, ou le déployer via Amazon SageMaker. Le matériel nécessite généralement Linux et des GPU NVIDIA.

Deepgram enregistre-t-il l’audio ?

La conservation et la suppression des données clients dans le cloud sont gérées conformément aux accords commerciaux. Une demande typique d’hébergement propre n’envoie pas d’audio ou de transcriptions à Deepgram, mais communique des métadonnées sur la consommation.

Peut-on se retirer du programme d’amélioration du modèle ?

Oui, les clients Pay As You Go et Growth peuvent choisir de s’inscrire ou de se désinscrire ; à partir de mars 2026, le retrait n’affectera pas les prix affichés sur le site officiel.

Comment est facturé le multicanal ?

Calculé sur la durée totale de traitement de tous les canaux. Un audio stéréo de 10 minutes sera facturé comme s’il s’agissait de 20 minutes de traitement.

Quels SDK sont fournis ?

L’entreprise maintient officiellement des SDK pour JavaScript, Python, .NET, Go et Java, et fournit des paquets navigateur liés à Voice Agent. Le SDK Rust est un projet communautaire.

Deepgram est-il open source ?

Les produits et les modèles ne sont pas open source. Plusieurs SDK officiels utilisent la licence MIT, ce qui signifie uniquement que le code d’accès au client est ouvert.

Résumé

Deepgram convient aux équipes de développement ayant besoin d’une reconnaissance vocale en temps réel de niveau professionnel, d’une synthèse vocale conversationnelle et d’agents vocaux, et peut également répondre aux exigences de données et de déploiement des entreprises grâce à des endpoints régionaux et à des services auto-hébergés. Nova-3 est adapté à la transcription générale, tandis que Flux convient mieux aux conversations en temps réel nécessitant le traitement des tours de parole et des interruptions.

Avant le lancement, il convient de vérifier en même temps la précision, le délai, la concurrence, les canaux audio, les fonctionnalités supplémentaires ainsi que le coût standard après la fin des promotions. L’open source du SDK abaisse la barrière à l’entrée, mais les modèles, les services cloud et les conteneurs auto-hébergés restent des produits commerciaux.

©️Droit d’auteur : Sauf indication contraire, tous les articles de ce site sont protégés par le droit d’auteur.Partage d’outils d’IATous les droits d’auteur sont réservés. Sans autorisation, aucune personne, média, site web ou groupe ne peut reproduire, copier ou diffuser de quelque manière que ce soit le contenu de ce site, ni créer de mirror sur des serveurs qui ne lui appartiennent pas. Dans le cas contraire, notre site se réserve le droit de poursuivre en justice les responsables conformément à la loi.

Outils similaires à Deepgram