assemblyai
assemblyai, outil intelligent spécialisé dans la programmation par IA
Étiquettes :Outils de programmation IAQu’est-ce que AssemblyAI ?
AssemblyAI est une plateforme d’IA vocale destinée aux développeurs et aux entreprises, dont la capacité principale est de convertir des audio enregistrés ou en temps réel en texte structuré. Les équipes de développement peuvent intégrer des fonctionnalités de transcription, de reconnaissance de la voix, de compréhension du langage parlé ainsi que d’agents vocaux dans leurs produits via des API et des SDK officiels.
La plateforme n’est pas un outil web ordinaire de transcription de fichiers audio, mais une infrastructure pour développeurs facturée en fonction de l’utilisation. Ses produits couvrent la transcription préenregistrée asynchrone, la transcription en flux en temps réel, une interface de synchronisation audio à faible latence, une API Voice Agent bout en bout, le Speech Understanding et le LLM Gateway.
Produits et fonctionnalités principaux
- Transcription d’audio préenregistré : soumettez un fichier audio ou vidéo pour obtenir une transcription complète générée de manière asynchrone.
- Transcription en flux en temps réel : envoi du flux audio via WebSocket et réception des événements textuels en quelques centaines de millisecondes.
- Transcription synchrone de courts extraits audio : traitement rapide de commandes vocales et d’exercices de dictée par demande unique.
- API d’agent vocal : combine la reconnaissance vocale, les modèles linguistiques, la synthèse vocale et l’orchestration de conversations dans une connexion en temps réel.
- Séparation des locuteurs : Identifier les différents interlocuteurs et ajouter des étiquettes aux mots ou aux tours de parole.
- Mots-clés et indications générales : Améliorer la reconnaissance dans un contexte spécifique par le biais de termes ou d’une description en langage naturel.
- Compréhension vocale : exécution des tâches de détection d’entités, de thème, d’émotion, de traduction et d’autres traitements post-traitement.
- Barrières de confidentialité : traitement de texte ou audio d’informations sensibles, modération de contenu et filtrage des insultes.
- LLM Gateway : Utiliser des identifiants unifiés pour appeler plusieurs modèles de langage afin de traiter les résumés et les flux de travail audio.
Modèle de transcription vocale en texte
| Mode d'utilisation | modèle | Caractéristiques | Prix de base |
|---|---|---|---|
| Enregistrement asynchrone préenregistré | Universal-3.5 Pro | Plus grande précision et capacité de suggestion | 0,21 dollar/horaire audio |
| Enregistrement asynchrone préenregistré | Universal-2 | Coût plus bas | 0,15 dollar/horaire audio |
| Flux en temps réel | Universal-3.5 Pro Realtime | Précision accrue et indications en temps réel | 0,45 dollar/horaire de session |
| Flux en temps réel | Universal-Streaming | Programme économique en anglais ou multilingue | 0,15 dollar/horaire de session |
| Audio court synchronisé | Universal-3.5 Pro | Résultat audio court retourné pour une seule requête | 0,45 dollar/horaire audio |
Comment choisir entre les interfaces enregistrées à l’avance, en temps réel et synchronisées
| interface | Adéquat pour la tâche | Mode de retour | Choix clés |
|---|---|---|---|
| Enregistrement asynchrone préenregistré | Podcasts, conférences, interviews et enregistrements historiques | Poller ou recevoir une réponse après soumission de la tâche | Coût faible, mais il faut attendre le traitement. |
| Flux en temps réel | Sous-titres, service client, robots vocaux et réunions en direct | WebSocket renvoie continuellement des événements | Faible latence, mais facturation en fonction du temps d’inactivité de la connexion |
| Audio court synchronisé | Diction, recherche vocale et commandes courtes | Une requête retourne directement le résultat | Interface simple, prix unitaire plus élevé que pour l’asynchrone |
| Voice Agent | Téléphonie et assistants vocaux bout en bout | Une seule session en temps réel | Développement simple, mais tarif global plus élevé |
Capacité de compréhension vocale
- Reconnaissance de la voix : distinguer les différents interlocuteurs lors de réunions, d’interviews ou d’appels.
- Détection d’entités : extraction de personnes, d’organisations, de lieux et d’autres entités structurées.
- Analyse émotionnelle : Déterminer la tendance positive, négative ou neutre exprimée dans le segment de texte.
- Détection de thème : identification du thème des discussions enregistrées selon leur contenu.
- Mots-clés et points forts : Détecter les phrases répétées ou représentatives.
- Générer le texte dans la langue cible tout en conservant la structure de transcription originale.
- Format personnalisé : ajuster les chiffres, les abréviations et les expressions spécialisées selon les règles métier.
- Résumé et chapitres : des résultats de post-traitement plus flexibles peuvent être générés grâce au flux de travail actuel du modèle de langage.
Quels scénarios d'utilisation conviennent
- Assistant de réunion : enregistrement des réunions avec plusieurs participants, identification des orateurs et génération d’actions à entreprendre.
- Centre de contact : transcription des appels au service client, analyse des thèmes, des émotions et des problèmes de qualité.
- Plateformes médiatiques : génération de sous-titres et d’index pour les podcasts, vidéos, streams en direct et cours.
- Agent vocal : reconnaît les paroles de l’utilisateur et pilote les conversations en temps réel ainsi que les appels d’outils.
- Analyse des ventes : organisation des appels, des objections, des informations sur la concurrence et des prochaines étapes à suivre.
- Voix médicale : Traitement des termes techniques dans les langues applicables et selon les paramètres de conformité.
- Vérification du contenu : Traitement des informations sensibles, du contenu inapproprié et des données personnelles dans l’audio.
- Recherche vocale : Convertir de grandes quantités de contenu audio et vidéo en texte pouvant être recherché.
Pour quels équipes de développement
- Équipes SaaS qui doivent intégrer une API de reconnaissance vocale dans leur produit.
- Ingénieurs qui développent des sous-titres en temps réel, des robots vocaux ou l’automatisation téléphonique.
- Équipes médias et de données nécessitant le traitement en masse de grandes quantités d’audio et de vidéo historiques.
- Plateforme d’analyse nécessitant un locuteur, des timestamps et des résultats structurés.
- Développeurs souhaitant une intégration rapide avec Python, JavaScript ou d’autres SDK.
- Les organisations qui ont des exigences internes en matière de zone de données, de temps de rétention, de droits d’accès et d’audit.
Tutoriel d’accès rapide
- Inscrivez-vous et créez une clé API dédiée à l’environnement de test.
- Comparer les modèles dans le Playground de la console à l’aide d’audio réel mais anonymisé.
- Choisissez l’enregistrement préalable, en temps réel, des fichiers audio courts synchronisés ou l’interface Voice Agent.
- Installer le SDK officiel du langage de programmation cible et fixer la version compatible.
- Spécifiez explicitement le modèle de voix, sans vous fier aux valeurs par défaut qui peuvent varier.
- Configurer les délais d’attente, les tentatives de réessai, la vérification des appels de retour et l’enregistrement des échecs.
- Calculer le taux d’erreurs de mots et le taux d’erreurs dans les champs clés en utilisant la relecture manuelle du texte.
- Configurez les alertes pour le solde, la consommation et les frais anormaux avant d’accéder à l’environnement de production.
Tutoriel de transcription en temps réel
- Vérifier le taux d’échantillonnage, le codage et les canaux audio du microphone ou du téléphone.
- Établir une connexion WebSocket et envoyer les paramètres de session corrects.
- Transmettre continuellement des blocs audio et gérer les tours de parole, les timestamps et les événements d’erreur.
- Configurer des mots-clés ou des indications en fonction du jargon métier.
- Activez la séparation des locuteurs, le mode médical ou Voice Focus en cas de besoin.
- Distinguer dans l’interface les états temporaires du texte final immuable.
- L’utilisateur envoie un message de fin de session après avoir terminé l’appel.
- Vérifier que la connexion est véritablement fermée et surveiller la durée réelle de facturation de la session.
Prix de base
AssemblyAI utilise un modèle de paiement à l’usage : il n’y a pas de abonnement mensuel obligatoire, de seuil d’achat minimum ni de contrat à long terme. Les nouveaux comptes reçoivent une crédit gratuit de 50 dollars, sans besoin de carte de crédit ; ce crédit peut être utilisé pour la transcription vocale, Voice Agent, la compréhension vocale et les protections, mais il ne comprend pas LLM Gateway.
| Produit | Prix public | Base de facturation |
|---|---|---|
| Universal-3.5 Pro enregistrement préenregistré | 0,21 dollar de l’heure | Durée de l’audio ou de la vidéo soumise, avec précision jusqu’à la seconde |
| Universal-2 enregistrement préalable | 0,15 dollar de l’heure | Durée de l’audio ou de la vidéo soumise, avec précision jusqu’à la seconde |
| Universal-3.5 Pro en temps réel | 0,45 dollar de l’heure | Durée de connexion WebSocket active |
| Universal-Streaming | 0,15 dollar de l’heure | Durée de connexion WebSocket active |
| Audio court synchronisé | 0,45 dollar de l’heure | Durée des fichiers audio courts traités |
| Voice Agent API | 4,50 $/heure | Durée de la connexion de session bout en bout |
| LLM Gateway | Facturation par token de modèle | Calculer séparément les tokens d’entrée et de sortie |
Prix des fonctionnalités ajoutées de valeur
| Fonctionnalité | Prix supplémentaire | Explication |
|---|---|---|
| Séparation asynchrone standard des locuteurs | +0,02 dollar/hour | Applicable aux transcriptions préenregistrées |
| Séparation asynchrone de locuteurs expérimentale | +0,065 dollar de l’heure | Adapté à plus de locuteurs ou à des audio difficiles |
| Séparation en temps réel des locuteurs | +0,12 dollar de l’heure | Facturation selon la durée totale de la session en flux continu |
| Medical Mode | +0,15 dollar de l’heure | Langues et modèles applicables limités |
| Conseils généraux | +0,05 dollar de l’heure | Fonction de test asynchrone ou en temps réel Universal-3.5 Pro |
| Voice Focus | +0,10 dollar de l’heure | Seulement en temps réel Universal-3.5 Pro |
| Traduire | +0,06 dollar de l’heure | Audio enregistré à l’avance, compatible avec plusieurs langues cibles |
| Masquage de texte PII | +0,08 dollar de l’heure | Traiter les informations sensibles à partir du texte transcrit |
| Masquage audio PII | +0,05 dollar de l’heure | Muet ou remplacer l’audio |
| Vérification du contenu | +0,15 dollar de l’heure | Sur le coût du modèle de base |
Règles de facturation et erreurs fréquentes
- La transcription préenregistrée est facturée en fonction du nombre réel de secondes de l’audio soumis ; les transcriptions échouées ne sont pas facturées.
- La transcription en flux est facturée selon la durée totale de la connexion, allumée ou éteinte ; le mode silencieux et le temps d’inactivité sont également pris en compte.
- Une session en flux non fermée correctement pourrait être fermée automatiquement après 3 heures et entraîner le paiement intégral.
- Plusieurs flux concurrents calculent séparément la durée de facturation.
- La transcription multicanal est facturée séparément pour chaque canal ; une heure en 3 canaux équivaut à trois heures d’utilisation.
- Les fonctionnalités supplémentaires s’ajoutent au prix du modèle de base.
- Les fenêtres de silence et de rétablissement pour les connexions via un agent vocal peuvent également faire l’objet d’une facturation.
- Si un LLM Gateway est appelé séparément à l’intérieur du Voice Agent, les frais associés aux tokens pourraient s’ajouter séparément.
Guide sur le contrôle des coûts
- Choisir le modèle qui répond au minimum aux exigences en termes de précision, de délai et de fonctionnalités.
- Spécifiez explicitement le modèle dans la demande, afin d’éviter que les valeurs par défaut ne diffèrent entre les comptes gratuits et payants.
- Prétraiter le long silence et vérifier s’il est vraiment nécessaire de transcrire séparément les pistes stéréo.
- Activer uniquement les fonctionnalités supplémentaires qui génèrent une véritable valeur commerciale.
- Envoyer un événement de fin immédiatement à la fin de l’appel et fermer le WebSocket.
- Séparer les tests, la production et la consommation par client selon le projet et la clé API.
- Définir une limite maximale de rechargement automatique du solde, des alertes de frais et une surveillance des sessions anormales.
- Comparer régulièrement le coût de la relecture manuelle, la précision du modèle et le coût par tâche réussie.
Voice Agent API
L’API Voice Agent intègre la reconnaissance vocale en temps réel, les modèles linguistiques, la synthèse vocale, le déterminisme des tours de parole, le traitement des interruptions et les appels d’outils au sein d’un WebSocket. Son prix public est de 4,50 dollars par heure, ce qui convient aux équipes souhaitant réduire les tâches d’orchestration de multiples services.
| Plan | Avantages | Le prix à payer |
|---|---|---|
| Voice Agent API | Une seule interface, orchestration bout en bout et session unifiée | 4,50 dollars de l’heure, faible flexibilité pour le remplacement des composants |
| Construction propre de STT+LLM+TTS | Chaque fournisseur et modèle peuvent être sélectionnés indépendamment. | Il faut gérer soi-même les retards, les interruptions, les pannes et les factures multiples. |
| Seulement STT en temps réel | Adapté aux architectures de dialogue et de synthèse vocale existantes | Il reste encore à assumer les coûts des modèles et de l’infrastructure ultérieurs. |
Sécurité et gouvernance des données
- Isolation des projets : Chaque projet dispose de clés API et d’une plage de données historiques indépendantes.
- Permissions des rôles : Le compte prend en charge trois types de rôles : Owner, Admin et Reader.
- Authentification multifacteur : peut être activée pour les membres et imposée par l’organisation.
- Contrôle des données : Les comptes payants permettent de définir eux-mêmes la durée de conservation et d’arrêter l’entraînement du modèle.
- Accord de partenariat commercial : les équipes liées au secteur médical peuvent évaluer et signer un BAA.
- Traitement régional : vous pouvez choisir des points de terminaison aux États-Unis ou dans l’UE pour répondre aux exigences de localisation des données.
- Journal des activités : enregistre les opérations de compte et de gestion, afin de faciliter l’audit.
- Traitement des PII : Il est possible de masquer les informations sensibles dans le texte ou l’audio à l’aide de barrières de protection à valeur ajoutée.
Avantages du produit
- Couvre en même temps l’enregistrement préalable, en temps réel, les audio courts et les agents vocaux bout en bout.
- Les tarifs sont affichés par heure, et l’audio enregistré à l’avance est facturé au quart de seconde.
- Fournit l’identité du locuteur, des timestamps, des indications et une compréhension vocale avancée.
- Les SDK officiels tels que Python et JavaScript réduisent l’effort d’intégration.
- Playground permet de comparer l’audio réel et différents modèles avant l’enregistrement.
- Les projets, les rôles des membres, le MFA, la conservation des données et l’audit sont adaptés à la gouvernance d’équipe.
- Le crédit gratuit de 50 dollars facilite l’évaluation de prototypes représentatifs.
Restrictions d'utilisation
- Le taux de précision de la reconnaissance est affecté par la langue, l’accent, le bruit, les paroles superposées et le jargon spécialisé.
- Les sessions en flux sont facturées en fonction de la durée de la connexion, et les erreurs de gestion de la connexion peuvent entraîner des frais supplémentaires.
- Avec la combinaison de plusieurs canaux audio et de fonctionnalités supplémentaires, le coût peut être considérablement plus élevé que le prix de base.
- Certaines fonctionnalités ne sont disponibles que pour des modèles, des langues ou des modes prédéfinis spécifiques.
- Les paramètres du modèle ancien et la fonction de résumé obsolète peuvent provoquer des problèmes de migration.
- L’API cloud doit envoyer l’audio vers un service externe et n’est pas adaptée aux données sensibles non autorisées.
- LLM Gateway n’est pas inclus dans le forfait gratuit et est facturé séparément en fonction des tokens de chaque modèle.
- Le système de production doit encore gérer les tentatives de réessai, la sécurité des appels de retour, le throttling et la vérification manuelle.
GitHub et SDK
AssemblyAI dispose d’une organisation officielle sur GitHub et gère le SDK Python, le SDK JavaScript, des exemples ainsi que des projets de démarrage pour les agents vocaux. Le fait que les SDK soient open source ne signifie pas que les modèles vocaux cloud, les données d’entraînement et l’API hébergée le soient également.
Les développeurs doivent se référer à la documentation officielle actuelle et à la version du SDK, en prêtant une attention particulière aux anciens points de terminaison en temps réel, aux alias de modèles et aux changements de paramètres au singulier et au pluriel. Dans l’environnement de production, il faut fixer les versions des dépendances et exécuter des tests de régression avant toute mise à niveau.
Informations de base
| Projet | Contenu |
|---|---|
| Nom de la plateforme | AssemblyAI |
| Type d’outil | Plateforme de transcription vocale et de développement d’IA vocale |
| Interface principale | Enregistrement préalable, en temps réel, audio court synchronisé et API Voice Agent |
| Modèle principal | Universal-3.5 Pro et Universal-2 |
| Limite gratuite | Nouveau compte : 50 dollars, hors LLM Gateway |
| Modèle de prix | Tarification par audio, durée de la session, fonctionnalités supplémentaires ou jetons |
| SDK officiel | Fournit des SDK et des exemples pour Python, JavaScript, etc. |
| API | Fournir |
| Est-ce open source | Le SDK et les exemples sont open source, tandis que la plateforme d’hébergement et les modèles ne le sont pas. |
Indice de recommandation
L’indice de recommandation global est de 4,6 sur 5. Les interfaces d’AssemblyAI, ses capacités vocales, la transparence des documents et des prix sont relativement complètes, ce qui en fait un outil adapté à la création d’applications vocales de niveau professionnel. Cependant, il est nécessaire de surveiller attentivement la facturation en temps réel ainsi que les fonctionnalités supplémentaires.
Questions fréquentes
Qu’est-ce que AssemblyAI fait principalement ?
Il convertit l’audio enregistré ou en temps réel en texte via une API, et offre des capacités de compréhension vocale et d’agent intelligent.
Y a-t-il une limite gratuite ?
Le nouveau compte bénéficie d’un crédit gratuit de 50 dollars, sans carte de crédit, mais ne comprend pas LLM Gateway.
Combien coûte une transcription enregistrée à l’avance ?
Universal-3.5 Pro coûte 0,21 dollar par heure, et Universal-2 coûte 0,15 dollar par heure.
Combien coûte la transcription en temps réel ?
Universal-3.5 Pro Realtime coûte 0,45 dollar par heure, tandis que Universal-Streaming coûte 0,15 dollar.
Comment le paiement fonctionne pour la reconnaissance en flux ?
La facturation se fait en fonction de la durée de la connexion WebSocket, y compris le temps en mode silencieux et le temps d’inactivité.
Prend-il en charge la séparation des locuteurs ?
Le prix supplémentaire pour le mode d’accompagnement, en enregistrement préalable et en temps réel est différent.
Combien coûte l’API Voice Agent ?
Le prix public est de 4,50 dollars par heure, calculé en fonction de la durée de la connexion de session.
AssemblyAI est-il open source ?
Le SDK officiel et les exemples sont open source, mais les modèles hébergés, les données d’entraînement et la plateforme elle-même ne le sont pas.
Est-ce adapté aux données médicales ?
Les modèles médicaux évaluables, les BAA et le contrôle des données peuvent être mis en œuvre, mais l’organisation doit néanmoins effectuer sa propre vérification de conformité.
Numéro d’enregistrement de sécurité publique du Guangxi : 45132202000164