assemblyai
Valeur ajoutée gratuite
Guide complet des outils d’IA Outils de programmation IA

assemblyai

assemblyai, outil intelligent spécialisé dans la programmation par IA

Étiquettes :

Qu’est-ce que AssemblyAI ?

AssemblyAI est une plateforme d’IA vocale destinée aux développeurs et aux entreprises, dont la capacité principale est de convertir des audio enregistrés ou en temps réel en texte structuré. Les équipes de développement peuvent intégrer des fonctionnalités de transcription, de reconnaissance de la voix, de compréhension du langage parlé ainsi que d’agents vocaux dans leurs produits via des API et des SDK officiels.

La plateforme n’est pas un outil web ordinaire de transcription de fichiers audio, mais une infrastructure pour développeurs facturée en fonction de l’utilisation. Ses produits couvrent la transcription préenregistrée asynchrone, la transcription en flux en temps réel, une interface de synchronisation audio à faible latence, une API Voice Agent bout en bout, le Speech Understanding et le LLM Gateway.

Produits et fonctionnalités principaux

  • Transcription d’audio préenregistré : soumettez un fichier audio ou vidéo pour obtenir une transcription complète générée de manière asynchrone.
  • Transcription en flux en temps réel : envoi du flux audio via WebSocket et réception des événements textuels en quelques centaines de millisecondes.
  • Transcription synchrone de courts extraits audio : traitement rapide de commandes vocales et d’exercices de dictée par demande unique.
  • API d’agent vocal : combine la reconnaissance vocale, les modèles linguistiques, la synthèse vocale et l’orchestration de conversations dans une connexion en temps réel.
  • Séparation des locuteurs : Identifier les différents interlocuteurs et ajouter des étiquettes aux mots ou aux tours de parole.
  • Mots-clés et indications générales : Améliorer la reconnaissance dans un contexte spécifique par le biais de termes ou d’une description en langage naturel.
  • Compréhension vocale : exécution des tâches de détection d’entités, de thème, d’émotion, de traduction et d’autres traitements post-traitement.
  • Barrières de confidentialité : traitement de texte ou audio d’informations sensibles, modération de contenu et filtrage des insultes.
  • LLM Gateway : Utiliser des identifiants unifiés pour appeler plusieurs modèles de langage afin de traiter les résumés et les flux de travail audio.

Modèle de transcription vocale en texte

Mode d'utilisationmodèleCaractéristiquesPrix de base
Enregistrement asynchrone préenregistréUniversal-3.5 ProPlus grande précision et capacité de suggestion0,21 dollar/horaire audio
Enregistrement asynchrone préenregistréUniversal-2Coût plus bas0,15 dollar/horaire audio
Flux en temps réelUniversal-3.5 Pro RealtimePrécision accrue et indications en temps réel0,45 dollar/horaire de session
Flux en temps réelUniversal-StreamingProgramme économique en anglais ou multilingue0,15 dollar/horaire de session
Audio court synchroniséUniversal-3.5 ProRésultat audio court retourné pour une seule requête0,45 dollar/horaire audio

Comment choisir entre les interfaces enregistrées à l’avance, en temps réel et synchronisées

interfaceAdéquat pour la tâcheMode de retourChoix clés
Enregistrement asynchrone préenregistréPodcasts, conférences, interviews et enregistrements historiquesPoller ou recevoir une réponse après soumission de la tâcheCoût faible, mais il faut attendre le traitement.
Flux en temps réelSous-titres, service client, robots vocaux et réunions en directWebSocket renvoie continuellement des événementsFaible latence, mais facturation en fonction du temps d’inactivité de la connexion
Audio court synchroniséDiction, recherche vocale et commandes courtesUne requête retourne directement le résultatInterface simple, prix unitaire plus élevé que pour l’asynchrone
Voice AgentTéléphonie et assistants vocaux bout en boutUne seule session en temps réelDéveloppement simple, mais tarif global plus élevé

Capacité de compréhension vocale

  • Reconnaissance de la voix : distinguer les différents interlocuteurs lors de réunions, d’interviews ou d’appels.
  • Détection d’entités : extraction de personnes, d’organisations, de lieux et d’autres entités structurées.
  • Analyse émotionnelle : Déterminer la tendance positive, négative ou neutre exprimée dans le segment de texte.
  • Détection de thème : identification du thème des discussions enregistrées selon leur contenu.
  • Mots-clés et points forts : Détecter les phrases répétées ou représentatives.
  • Générer le texte dans la langue cible tout en conservant la structure de transcription originale.
  • Format personnalisé : ajuster les chiffres, les abréviations et les expressions spécialisées selon les règles métier.
  • Résumé et chapitres : des résultats de post-traitement plus flexibles peuvent être générés grâce au flux de travail actuel du modèle de langage.

Quels scénarios d'utilisation conviennent

  • Assistant de réunion : enregistrement des réunions avec plusieurs participants, identification des orateurs et génération d’actions à entreprendre.
  • Centre de contact : transcription des appels au service client, analyse des thèmes, des émotions et des problèmes de qualité.
  • Plateformes médiatiques : génération de sous-titres et d’index pour les podcasts, vidéos, streams en direct et cours.
  • Agent vocal : reconnaît les paroles de l’utilisateur et pilote les conversations en temps réel ainsi que les appels d’outils.
  • Analyse des ventes : organisation des appels, des objections, des informations sur la concurrence et des prochaines étapes à suivre.
  • Voix médicale : Traitement des termes techniques dans les langues applicables et selon les paramètres de conformité.
  • Vérification du contenu : Traitement des informations sensibles, du contenu inapproprié et des données personnelles dans l’audio.
  • Recherche vocale : Convertir de grandes quantités de contenu audio et vidéo en texte pouvant être recherché.

Pour quels équipes de développement

  • Équipes SaaS qui doivent intégrer une API de reconnaissance vocale dans leur produit.
  • Ingénieurs qui développent des sous-titres en temps réel, des robots vocaux ou l’automatisation téléphonique.
  • Équipes médias et de données nécessitant le traitement en masse de grandes quantités d’audio et de vidéo historiques.
  • Plateforme d’analyse nécessitant un locuteur, des timestamps et des résultats structurés.
  • Développeurs souhaitant une intégration rapide avec Python, JavaScript ou d’autres SDK.
  • Les organisations qui ont des exigences internes en matière de zone de données, de temps de rétention, de droits d’accès et d’audit.

Tutoriel d’accès rapide

  1. Inscrivez-vous et créez une clé API dédiée à l’environnement de test.
  2. Comparer les modèles dans le Playground de la console à l’aide d’audio réel mais anonymisé.
  3. Choisissez l’enregistrement préalable, en temps réel, des fichiers audio courts synchronisés ou l’interface Voice Agent.
  4. Installer le SDK officiel du langage de programmation cible et fixer la version compatible.
  5. Spécifiez explicitement le modèle de voix, sans vous fier aux valeurs par défaut qui peuvent varier.
  6. Configurer les délais d’attente, les tentatives de réessai, la vérification des appels de retour et l’enregistrement des échecs.
  7. Calculer le taux d’erreurs de mots et le taux d’erreurs dans les champs clés en utilisant la relecture manuelle du texte.
  8. Configurez les alertes pour le solde, la consommation et les frais anormaux avant d’accéder à l’environnement de production.

Tutoriel de transcription en temps réel

  1. Vérifier le taux d’échantillonnage, le codage et les canaux audio du microphone ou du téléphone.
  2. Établir une connexion WebSocket et envoyer les paramètres de session corrects.
  3. Transmettre continuellement des blocs audio et gérer les tours de parole, les timestamps et les événements d’erreur.
  4. Configurer des mots-clés ou des indications en fonction du jargon métier.
  5. Activez la séparation des locuteurs, le mode médical ou Voice Focus en cas de besoin.
  6. Distinguer dans l’interface les états temporaires du texte final immuable.
  7. L’utilisateur envoie un message de fin de session après avoir terminé l’appel.
  8. Vérifier que la connexion est véritablement fermée et surveiller la durée réelle de facturation de la session.

Prix de base

AssemblyAI utilise un modèle de paiement à l’usage : il n’y a pas de abonnement mensuel obligatoire, de seuil d’achat minimum ni de contrat à long terme. Les nouveaux comptes reçoivent une crédit gratuit de 50 dollars, sans besoin de carte de crédit ; ce crédit peut être utilisé pour la transcription vocale, Voice Agent, la compréhension vocale et les protections, mais il ne comprend pas LLM Gateway.

ProduitPrix publicBase de facturation
Universal-3.5 Pro enregistrement préenregistré0,21 dollar de l’heureDurée de l’audio ou de la vidéo soumise, avec précision jusqu’à la seconde
Universal-2 enregistrement préalable0,15 dollar de l’heureDurée de l’audio ou de la vidéo soumise, avec précision jusqu’à la seconde
Universal-3.5 Pro en temps réel0,45 dollar de l’heureDurée de connexion WebSocket active
Universal-Streaming0,15 dollar de l’heureDurée de connexion WebSocket active
Audio court synchronisé0,45 dollar de l’heureDurée des fichiers audio courts traités
Voice Agent API4,50 $/heureDurée de la connexion de session bout en bout
LLM GatewayFacturation par token de modèleCalculer séparément les tokens d’entrée et de sortie

Prix des fonctionnalités ajoutées de valeur

FonctionnalitéPrix supplémentaireExplication
Séparation asynchrone standard des locuteurs+0,02 dollar/hourApplicable aux transcriptions préenregistrées
Séparation asynchrone de locuteurs expérimentale+0,065 dollar de l’heureAdapté à plus de locuteurs ou à des audio difficiles
Séparation en temps réel des locuteurs+0,12 dollar de l’heureFacturation selon la durée totale de la session en flux continu
Medical Mode+0,15 dollar de l’heureLangues et modèles applicables limités
Conseils généraux+0,05 dollar de l’heureFonction de test asynchrone ou en temps réel Universal-3.5 Pro
Voice Focus+0,10 dollar de l’heureSeulement en temps réel Universal-3.5 Pro
Traduire+0,06 dollar de l’heureAudio enregistré à l’avance, compatible avec plusieurs langues cibles
Masquage de texte PII+0,08 dollar de l’heureTraiter les informations sensibles à partir du texte transcrit
Masquage audio PII+0,05 dollar de l’heureMuet ou remplacer l’audio
Vérification du contenu+0,15 dollar de l’heureSur le coût du modèle de base

Règles de facturation et erreurs fréquentes

  • La transcription préenregistrée est facturée en fonction du nombre réel de secondes de l’audio soumis ; les transcriptions échouées ne sont pas facturées.
  • La transcription en flux est facturée selon la durée totale de la connexion, allumée ou éteinte ; le mode silencieux et le temps d’inactivité sont également pris en compte.
  • Une session en flux non fermée correctement pourrait être fermée automatiquement après 3 heures et entraîner le paiement intégral.
  • Plusieurs flux concurrents calculent séparément la durée de facturation.
  • La transcription multicanal est facturée séparément pour chaque canal ; une heure en 3 canaux équivaut à trois heures d’utilisation.
  • Les fonctionnalités supplémentaires s’ajoutent au prix du modèle de base.
  • Les fenêtres de silence et de rétablissement pour les connexions via un agent vocal peuvent également faire l’objet d’une facturation.
  • Si un LLM Gateway est appelé séparément à l’intérieur du Voice Agent, les frais associés aux tokens pourraient s’ajouter séparément.

Guide sur le contrôle des coûts

  1. Choisir le modèle qui répond au minimum aux exigences en termes de précision, de délai et de fonctionnalités.
  2. Spécifiez explicitement le modèle dans la demande, afin d’éviter que les valeurs par défaut ne diffèrent entre les comptes gratuits et payants.
  3. Prétraiter le long silence et vérifier s’il est vraiment nécessaire de transcrire séparément les pistes stéréo.
  4. Activer uniquement les fonctionnalités supplémentaires qui génèrent une véritable valeur commerciale.
  5. Envoyer un événement de fin immédiatement à la fin de l’appel et fermer le WebSocket.
  6. Séparer les tests, la production et la consommation par client selon le projet et la clé API.
  7. Définir une limite maximale de rechargement automatique du solde, des alertes de frais et une surveillance des sessions anormales.
  8. Comparer régulièrement le coût de la relecture manuelle, la précision du modèle et le coût par tâche réussie.

Voice Agent API

L’API Voice Agent intègre la reconnaissance vocale en temps réel, les modèles linguistiques, la synthèse vocale, le déterminisme des tours de parole, le traitement des interruptions et les appels d’outils au sein d’un WebSocket. Son prix public est de 4,50 dollars par heure, ce qui convient aux équipes souhaitant réduire les tâches d’orchestration de multiples services.

PlanAvantagesLe prix à payer
Voice Agent APIUne seule interface, orchestration bout en bout et session unifiée4,50 dollars de l’heure, faible flexibilité pour le remplacement des composants
Construction propre de STT+LLM+TTSChaque fournisseur et modèle peuvent être sélectionnés indépendamment.Il faut gérer soi-même les retards, les interruptions, les pannes et les factures multiples.
Seulement STT en temps réelAdapté aux architectures de dialogue et de synthèse vocale existantesIl reste encore à assumer les coûts des modèles et de l’infrastructure ultérieurs.

Sécurité et gouvernance des données

  • Isolation des projets : Chaque projet dispose de clés API et d’une plage de données historiques indépendantes.
  • Permissions des rôles : Le compte prend en charge trois types de rôles : Owner, Admin et Reader.
  • Authentification multifacteur : peut être activée pour les membres et imposée par l’organisation.
  • Contrôle des données : Les comptes payants permettent de définir eux-mêmes la durée de conservation et d’arrêter l’entraînement du modèle.
  • Accord de partenariat commercial : les équipes liées au secteur médical peuvent évaluer et signer un BAA.
  • Traitement régional : vous pouvez choisir des points de terminaison aux États-Unis ou dans l’UE pour répondre aux exigences de localisation des données.
  • Journal des activités : enregistre les opérations de compte et de gestion, afin de faciliter l’audit.
  • Traitement des PII : Il est possible de masquer les informations sensibles dans le texte ou l’audio à l’aide de barrières de protection à valeur ajoutée.

Avantages du produit

  • Couvre en même temps l’enregistrement préalable, en temps réel, les audio courts et les agents vocaux bout en bout.
  • Les tarifs sont affichés par heure, et l’audio enregistré à l’avance est facturé au quart de seconde.
  • Fournit l’identité du locuteur, des timestamps, des indications et une compréhension vocale avancée.
  • Les SDK officiels tels que Python et JavaScript réduisent l’effort d’intégration.
  • Playground permet de comparer l’audio réel et différents modèles avant l’enregistrement.
  • Les projets, les rôles des membres, le MFA, la conservation des données et l’audit sont adaptés à la gouvernance d’équipe.
  • Le crédit gratuit de 50 dollars facilite l’évaluation de prototypes représentatifs.

Restrictions d'utilisation

  • Le taux de précision de la reconnaissance est affecté par la langue, l’accent, le bruit, les paroles superposées et le jargon spécialisé.
  • Les sessions en flux sont facturées en fonction de la durée de la connexion, et les erreurs de gestion de la connexion peuvent entraîner des frais supplémentaires.
  • Avec la combinaison de plusieurs canaux audio et de fonctionnalités supplémentaires, le coût peut être considérablement plus élevé que le prix de base.
  • Certaines fonctionnalités ne sont disponibles que pour des modèles, des langues ou des modes prédéfinis spécifiques.
  • Les paramètres du modèle ancien et la fonction de résumé obsolète peuvent provoquer des problèmes de migration.
  • L’API cloud doit envoyer l’audio vers un service externe et n’est pas adaptée aux données sensibles non autorisées.
  • LLM Gateway n’est pas inclus dans le forfait gratuit et est facturé séparément en fonction des tokens de chaque modèle.
  • Le système de production doit encore gérer les tentatives de réessai, la sécurité des appels de retour, le throttling et la vérification manuelle.

GitHub et SDK

AssemblyAI dispose d’une organisation officielle sur GitHub et gère le SDK Python, le SDK JavaScript, des exemples ainsi que des projets de démarrage pour les agents vocaux. Le fait que les SDK soient open source ne signifie pas que les modèles vocaux cloud, les données d’entraînement et l’API hébergée le soient également.

Les développeurs doivent se référer à la documentation officielle actuelle et à la version du SDK, en prêtant une attention particulière aux anciens points de terminaison en temps réel, aux alias de modèles et aux changements de paramètres au singulier et au pluriel. Dans l’environnement de production, il faut fixer les versions des dépendances et exécuter des tests de régression avant toute mise à niveau.

Informations de base

ProjetContenu
Nom de la plateformeAssemblyAI
Type d’outilPlateforme de transcription vocale et de développement d’IA vocale
Interface principaleEnregistrement préalable, en temps réel, audio court synchronisé et API Voice Agent
Modèle principalUniversal-3.5 Pro et Universal-2
Limite gratuiteNouveau compte : 50 dollars, hors LLM Gateway
Modèle de prixTarification par audio, durée de la session, fonctionnalités supplémentaires ou jetons
SDK officielFournit des SDK et des exemples pour Python, JavaScript, etc.
APIFournir
Est-ce open sourceLe SDK et les exemples sont open source, tandis que la plateforme d’hébergement et les modèles ne le sont pas.

Indice de recommandation

L’indice de recommandation global est de 4,6 sur 5. Les interfaces d’AssemblyAI, ses capacités vocales, la transparence des documents et des prix sont relativement complètes, ce qui en fait un outil adapté à la création d’applications vocales de niveau professionnel. Cependant, il est nécessaire de surveiller attentivement la facturation en temps réel ainsi que les fonctionnalités supplémentaires.

Questions fréquentes

Qu’est-ce que AssemblyAI fait principalement ?

Il convertit l’audio enregistré ou en temps réel en texte via une API, et offre des capacités de compréhension vocale et d’agent intelligent.

Y a-t-il une limite gratuite ?

Le nouveau compte bénéficie d’un crédit gratuit de 50 dollars, sans carte de crédit, mais ne comprend pas LLM Gateway.

Combien coûte une transcription enregistrée à l’avance ?

Universal-3.5 Pro coûte 0,21 dollar par heure, et Universal-2 coûte 0,15 dollar par heure.

Combien coûte la transcription en temps réel ?

Universal-3.5 Pro Realtime coûte 0,45 dollar par heure, tandis que Universal-Streaming coûte 0,15 dollar.

Comment le paiement fonctionne pour la reconnaissance en flux ?

La facturation se fait en fonction de la durée de la connexion WebSocket, y compris le temps en mode silencieux et le temps d’inactivité.

Prend-il en charge la séparation des locuteurs ?

Le prix supplémentaire pour le mode d’accompagnement, en enregistrement préalable et en temps réel est différent.

Combien coûte l’API Voice Agent ?

Le prix public est de 4,50 dollars par heure, calculé en fonction de la durée de la connexion de session.

AssemblyAI est-il open source ?

Le SDK officiel et les exemples sont open source, mais les modèles hébergés, les données d’entraînement et la plateforme elle-même ne le sont pas.

Est-ce adapté aux données médicales ?

Les modèles médicaux évaluables, les BAA et le contrôle des données peuvent être mis en œuvre, mais l’organisation doit néanmoins effectuer sa propre vérification de conformité.

©️Droit d’auteur : Sauf indication contraire, tous les articles de ce site sont protégés par le droit d’auteur.Partage d’outils d’IATous les droits d’auteur sont réservés. Sans autorisation, aucune personne, média, site web ou groupe ne peut reproduire, copier ou diffuser de quelque manière que ce soit le contenu de ce site, ni créer de mirror sur des serveurs qui ne lui appartiennent pas. Dans le cas contraire, notre site se réserve le droit de poursuivre en justice les responsables conformément à la loi.

Outils similaires à AssemblyAI