audEERING
audEERING : rend l’audio IA plus efficace et plus simple.
Étiquettes :Outils audio IAQu’est-ce que l’audEERING ?
audEERING est une entreprise allemande spécialisée dans l’intelligence artificielle pour la voix et l’audio, axée sur l’extraction d’informations non verbales à partir du son. Son produit phare, devAIce, est proposé sous forme de SDK, d’API Web et de plugins XR, destiné aux logiciels, au matériel, aux centres d’appel, à l’automobile, aux robots, aux appareils portables et aux projets de recherche.
Ce n’est pas un site de montage audio, de génération musicale ou de transcription vocale universelle. L’accent est mis sur la détection de l’activité sonore, des événements acoustiques, des dimensions expressives, de la rythmique, des attributs du locuteur, de la qualité audio et du contexte acoustique.
Les principaux produits d’audEERING
devAIce SDK
Le SDK s’exécute sur des appareils locaux et convient aux scénarios nécessitant un faible délai de réponse, un traitement hors ligne ou l’évitement de téléchargements audio continus. Le site officiel cite Windows, Linux, macOS, Android et iOS, et prend en charge les architectures x86-64 et ARMv8.
devAIce Web API
L’API Web est utilisée pour l’analyse en masse d’audio dans le cloud, et non comme un éditeur graphique destiné aux utilisateurs ordinaires. Les développeurs peuvent obtenir des résultats JSON à l’aide de la ligne de commande, de requêtes HTTP directes, ou de clients Python, .NET, Java, JavaScript et PHP.
devAIce XR
devAIce XR intègre la capacité d’expression vocale et de reconnaissance de scène dans des moteurs de jeu tels que Unity et Unreal. Il peut être utilisé pour les personnages virtuels, les expériences immersives et la recherche sur les joueurs, mais les modules spécifiques ainsi que les licences commerciales doivent être confirmés.
AI SoundLab
AI SoundLab est une plateforme de recherche et développement utilisée pour collecter des données audio et effectuer des analyses en temps réel. Dans le cadre des recherches en santé, les contributeurs peuvent gérer leurs données ; selon le site officiel, les fichiers audio et les informations personnelles associées sont stockés en Allemagne et peuvent être supprimés.
openSMILE
openSMILE est un outil d’extraction de caractéristiques audio à grande échelle maintenu par audEERING, qui peut être utilisé pour l’analyse de la voix, de la musique, des émotions, des locuteurs et du rythme. Une version encapsulée en Python est également fournie, permettant aux chercheurs d’extraire directement des ensembles de caractéristiques courants.
Quel contenu devAIce peut-il analyser ?
BASE – Pack de base
- Détection d’activité vocale, utilisée pour distinguer les segments parlés des segments non parlés.
- Détection d’événements acoustiques, utilisée pour identifier des événements sonores tels que la sonnerie du téléphone ou les pleurs.
- Vérification de l’orateur, utilisée pour comparer les caractéristiques d’identité vocale.
- Reconnaissance vocale automatique, qui transforme la parole en texte.
- Analyse de la qualité audio et extraction de caractéristiques acoustiques générales.
PACK D’EXPRESSION
- Expression vocale et grands modèles d’expression.
- Analyse de l’expression multimodale.
- Le ton, le rythme et d’autres caractéristiques rythmiques.
- Dimensions d’expression continues telles que l’activité, le plaisir et le degré de domination.
SPEAKER et SCENE
- Estimer les attributs du locuteur tels que l’âge et le genre perçu.
- Distinguer les trois scénarios acoustiques : intérieur, extérieur et transport.
- Identifier huit scénarios secondaires au sein de trois grandes catégories.
À quels scénarios AUDEERING convient-il ?
- Le centre d’appels analyse l’expression vocale du service client et de la clientèle, ainsi que la qualité des conversations.
- Les robots, les voitures et les appareils intelligents ajustent leur interaction en fonction de l’environnement sonore.
- Les jeux et les applications XR font en sorte que les personnages virtuels réagissent au ton du joueur.
- L’équipe de recherche de marché analyse les expressions verbales issues des entretiens et des retours produits.
- Les institutions de recherche extraient des caractéristiques audio reproductibles et entraînent les modèles.
- La recherche médicale explore les biomarqueurs sonores, mais ils ne peuvent pas servir directement de diagnostic clinique.
Guide d’utilisation de l’API web devAIce
- Déterminer si les modules BASE, EXPRESSION, SPEAKER ou SCENE sont nécessaires pour la tâche.
- Préparer un audio ayant une autorisation légale et obtenir le consentement éclairé du locuteur.
- Achetez des minutes prépayées avec un petit nombre d’échantillons non sensibles ou contactez le service des ventes pour demander un forfait.
- Utilisez d’abord la CLI recommandée par les officiels pour télécharger le fichier et vérifier le résultat JSON.
- Vérifier que le taux d’échantillonnage, les canaux audio, le bruit et l’équipement d’enregistrement répondent aux exigences du modèle.
- Évaluer les performances en différentes langues, accents, âges et environnements à l’aide d’échantillons annotés manuellement.
- Une fois que la sortie répond aux exigences, choisissez ensuite la bibliothèque client ou une intégration HTTP directe.
- Mettre en place des processus de tentative de réessai en cas d’échec, de surveillance des quotas, de suppression de données et de contrôle d’accès.
- Effectuer une évaluation de la confidentialité, des relations de travail, de la lutte contre la discrimination et des réglementations locales avant le lancement.
Recommandations pour l’intégration SDK
- Comparer la vitesse de traitement, l’utilisation de la CPU et de la mémoire sur le dispositif cible réel.
- Utiliser la détection d’activité vocale pour exclure les segments non vocaux qui n’ont pas besoin d’être analysés.
- Tester en même temps le silence, le bruit, le champ lointain et différentes conditions de microphones.
- Ne tirez pas de conclusions à haut risque concernant une personne sur la base d’un seul enregistrement audio court.
- Vérifier clairement si l’analyse du côté du dispositif nécessite toujours une connexion pour la vérification de la licence.
Les avantages d’audEERING
- Spécialisée dans l’analyse audio et du langage non verbal, avec une positionnement de produit clair.
- Il fournit en même temps un SDK pour le matériel, une API Web cloud et des plugins XR.
- Peut fonctionner sur des architectures de bureau, mobiles et embarquées.
- L’API Web prépayée convient aux tests à petite échelle, sans nécessiter de souscription à long terme au préalable.
- Les responsables maintiennent openSMILE et une série d’outils de recherche audio.
- Support des clients en plusieurs langages de programmation et des appels HTTP directs.
Restrictions d'utilisation et risques éthiques
- L’expression vocale n’équivaut pas aux émotions réelles, aux intentions ou à la personnalité d’une personne.
- L’âge et la perception du genre sont des inférences du modèle, qui peuvent être erronées et renforcer les préjugés.
- L’accent, la langue, la culture, le handicap, l’équipement et l’environnement peuvent tous influencer les résultats.
- Les notes d’évaluation ne doivent pas être utilisées directement pour des décisions à haut risque telles que le recrutement, le licenciement, l’assurance ou l’application de la loi.
- Les voix peuvent constituer des données d’identification biométrique ou liées à la santé, et il est nécessaire de définir une base légale claire.
- La démonstration de santé n’est pas un produit médical et ne donne pas de conseils médicaux.
- L’API prépayée est une interface pour développeurs, qui ne comprend pas une station de travail d’analyse visuelle complète.
Prix de l’API web devAIce
Voici les options de paiement à l’avance publiées sur le site officiel le 26 août 2026, adaptées aux essais et à une analyse occasionnelle. Le paiement est effectué via Stripe ; les taxes, la durée de validité des minutes, les modules supplémentaires et les avantages liés aux offres sont indiqués sur la page d’achat.
| Plan | Prix unique | minutes audio | Contenu inclus | Scénarios adaptés |
|---|---|---|---|---|
| Prepaid Entry | 35 euros | 600 minutes | API Web, paquet BASE et un module sélectionné | Premier test et petits projets |
| Prepaid Plus | 250 euros | 6 000 minutes | API Web, paquet BASE et un module sélectionné | Vérification à grande échelle et analyse en masse |
Le site officiel promeut actuellement l’ouverture temporaire de tous les forfaits, mais cette offre pourrait prendre fin. Les abonnements, les SDK, les plugins XR, les licences commerciales et les consultations sur mesure n’ont pas de prix fixe public ; il est nécessaire de contacter le service des ventes pour obtenir des informations.
Données et vie privée
La politique de confidentialité du site officiel couvre principalement les visites du site, les cookies, les formulaires de contact et les données marketing, et indique que le RGPD est respecté. Les échantillons vocaux contenus dans les produits ainsi que le contenu des clients sont également soumis aux conditions d’utilisation et aux contrats spécifiques ; il ne faut pas se fier uniquement à la page de confidentialité du site pour en juger.
Les conditions de service exigent que le client dispose des droits et des autorisations nécessaires pour les fichiers audio, les échantillons sonores et autres contenus, ainsi que qu’il assume les responsabilités prévues par le RGPD. Elles accordent également à audEERING une large autorisation d’utiliser, de copier, de modifier et de présenter les données du client aux fins d’exécution du contrat, et permettent l’utilisation de données agrégées et anonymisées.
Vérification de la confidentialité avant déploiement
- Vérifier quel type d’accord est nécessaire respectivement pour l’enregistrement, le téléchargement, l’authentification et l’inférence des attributs.
- Définir la durée de conservation de l’audio original, des caractéristiques, de la transcription et des résultats d’inférence.
- Comparer les chemins de données pour le traitement du téléchargement via une Web API et celui de l’SDK côté appareil.
- Restreindre qui peut consulter les expressions au niveau individuel et les attributs du locuteur.
- Mettre en place des processus pour l’accès aux données, leur suppression, les objections et la révision manuelle.
AudEERING est-il open source ?
Les dispositifs audEERING, les plugins XR et le modèle commercial ne constituent pas un produit entièrement open source. GitHub officiel met à disposition openSMILE, l’enveloppe Python, audb, audmodel et d’autres outils de recherche, mais il est nécessaire de consulter séparément la licence pour chaque projet.
Le code source d’openSMILE est ouvert à des fins non commerciales telles que l’usage privé, la recherche et l’enseignement, et autorise la recherche commerciale sous réserve de critères spécifiques. L’utilisation de son code, de versions dérivées ou d’éléments extraits dans des produits commerciaux nécessite généralement l’acquisition d’une licence commerciale ; il ne peut pas être considéré comme du logiciel libre sans restriction simplement parce qu’il est disponible dans un dépôt public.
Questions fréquentes
Que fait principalement audEERING ?
Il se concentre sur l’IA vocale et audio, en analysant à l’aide de devAIce l’activité sonore, l’expression, les attributs du locuteur, la qualité audio, les événements acoustiques et les scénarios.
Le devAIce peut-il fonctionner hors ligne ?
Le SDK peut fonctionner sur un appareil local et il n’est généralement pas nécessaire de télécharger en continu l’audio analysé dans le cloud, mais les vérifications de licence et les conditions d’installation spécifiques doivent être confirmées auprès des responsables officiels.
Combien coûte la devAIce Web API ?
Les forfaits prépayés publics sont de 35 euros pour 600 minutes et de 250 euros pour 6 000 minutes ; les abonnements, SDK, XR et licences d’entreprise nécessitent une demande de prix.
La reconnaissance des émotions vocales peut-elle déterminer les véritables sentiments ?
Non. L’analyse du modèle porte sur les caractéristiques de l’expression vocale, et les résultats sont influencés par la langue, la culture, l’accent et le contexte ; elle ne doit pas servir de conclusion fiable quant aux émotions ou intentions réelles d’une personne.
openSMILE peut-il être utilisé à des fins commerciales gratuitement ?
Généralement, ce n’est pas possible. La version publique est principalement destinée à des utilisations non commerciales, de recherche et éducatives ; les produits commerciaux ou les utilisations dérivées nécessitent généralement une licence commerciale.
AudEERING est-elle une entreprise open source ?
Non. L’entreprise maintient publiquement plusieurs outils de recherche, mais le produit commercial principal, devAIce, ainsi que les modèles et services, sont toujours fournis sous licence commerciale.
Numéro d’enregistrement de sécurité publique du Guangxi : 45132202000164