audEERING是什么
audEERING是一家来自德国的语音与音频人工智能公司,专注从声音中提取非语言信息。其核心商业产品devAIce以SDK、Web API和XR插件形式提供,面向软件、硬件、呼叫中心、汽车、机器人、可穿戴设备和研究项目。
它不是录音剪辑、音乐生成或通用语音转文字网站。产品重点是检测声音活动、声学事件、表达维度、韵律、说话者属性、音频质量和所处声学场景。
audEERING的主要产品
devAIce SDK
SDK在本地设备上运行,适合需要低延迟、离线处理或避免持续上传音频的场景。官网列出Windows、Linux、macOS、Android和iOS,并支持x86-64与ARMv8架构。
devAIce Web API
Web API用于云端批量分析音频,不是面向普通用户的图形化编辑器。开发者可以使用命令行、直接HTTP请求或Python、.NET、Java、JavaScript和PHP客户端获取JSON结果。
devAIce XR
devAIce XR把语音表达与场景识别能力带入Unity和Unreal等游戏引擎。它可用于虚拟角色、沉浸式体验和玩家研究,但具体模块与商业授权需要确认。
AI SoundLab
AI SoundLab是用于收集音频数据和实时分析的研发平台。健康研究场景允许贡献者管理其数据,官网称相关音频和个人信息存储在德国并可删除。
openSMILE
openSMILE是audEERING维护的大规模音频特征提取工具,可用于语音、音乐、情绪、说话人和节拍等分析。官方还提供Python封装,方便研究人员直接提取常见特征集。
devAIce可分析哪些内容
BASE基础包
- 语音活动检测,用于区分讲话与非语音片段。
- 声学事件检测,用于识别电话铃、哭声等声音事件。
- 说话人验证,用于比较声音身份特征。
- 自动语音识别,把讲话转成文本。
- 音频质量分析与通用声学特征提取。
EXPRESSION表达包
- 声音表达与大型表达模型。
- 多模态表达分析。
- 语调、语速和其他韵律特征。
- 激活度、愉悦度和支配度等连续表达维度。
SPEAKER与SCENE
- 估计年龄和感知性别等说话者属性。
- 区分室内、室外和交通三类声学场景。
- 在三个大类下进一步识别八种子场景。
audEERING适合哪些场景
- 呼叫中心分析客服与客户的声音表达和对话质量。
- 机器人、汽车和智能设备根据声音环境调整交互。
- 游戏与XR应用让虚拟角色响应玩家语气。
- 市场研究团队分析访谈和产品反馈中的声音表达。
- 科研机构提取可复现的音频特征并训练模型。
- 医疗研究探索声音生物标志物,但不能直接作为临床诊断。
devAIce Web API使用教程
- 确定任务需要BASE、EXPRESSION、SPEAKER还是SCENE模块。
- 准备具有合法授权的音频,并取得说话者知情同意。
- 用少量非敏感样本购买预付分钟或联系销售申请方案。
- 先使用官方推荐的CLI上传文件并检查JSON结果。
- 确认采样率、声道、噪声和录音设备符合模型要求。
- 用人工标注样本评估不同语言、口音、年龄和环境表现。
- 确定输出满足需求后,再选择客户端库或直接HTTP集成。
- 建立失败重试、额度监控、数据删除和访问控制流程。
- 上线前完成隐私、劳动关系、反歧视和地区法规评估。
SDK接入建议
- 在真实目标设备上比较处理速度、CPU和内存占用。
- 使用语音活动检测排除不需要分析的非语音片段。
- 同时测试安静、噪声、远场和不同麦克风条件。
- 不要根据单次短音频对个人作出高风险判断。
- 明确设备端分析是否仍需要联网进行许可证验证。
audEERING的优势
- 专注音频与非语言语音分析,产品定位清晰。
- 同时提供设备端SDK、云端Web API和XR插件。
- 可运行在桌面、移动和嵌入式架构上。
- 预付Web API适合小规模测试,无需先签长期订阅。
- 官方维护openSMILE和一系列音频研究工具。
- 支持多种编程语言客户端和直接HTTP调用。
使用限制与伦理风险
- 声音表达不等于人的真实情绪、意图或人格。
- 年龄与感知性别是模型推断,可能错误并强化偏见。
- 口音、语言、文化、残障、设备和环境都会影响结果。
- 不得把表达评分直接用于招聘、解雇、保险或执法等高风险决策。
- 声音可能构成生物识别或健康相关数据,需要明确合法依据。
- 健康演示不是医疗产品,也不提供医疗建议。
- 预付API是开发者接口,不包含完整的可视化分析工作台。
devAIce Web API价格
以下为2026年8月26日官网公开的预付费方案,适合试用和偶尔分析。付款由Stripe完成;税费、分钟有效期、额外模块和活动权益以购买页面为准。
| 方案 | 一次性价格 | 音频分钟 | 包含内容 | 适合场景 |
|---|---|---|---|---|
| Prepaid Entry | 35欧元 | 600分钟 | Web API、BASE包及一个所选模块 | 初次测试与小型项目 |
| Prepaid Plus | 250欧元 | 6,000分钟 | Web API、BASE包及一个所选模块 | 较大规模验证与批量分析 |
官网当前还宣传限时开放全部包,但活动可能结束。订阅、SDK、XR插件、商业许可和定制咨询没有公开固定价格,需要联系销售确认。
数据与隐私
官网隐私政策主要覆盖网站访问、Cookie、联系表单和营销数据,并说明遵循GDPR。产品中的语音样本和客户内容还受服务条款与具体合同约束,不能只依赖网站隐私页判断。
服务条款要求客户拥有音频、声音样本和其他内容的必要权利与同意,并承担GDPR责任。条款还授予audEERING为履行协议使用、复制、修改和展示客户数据的广泛许可,并允许利用聚合匿名数据。
部署前隐私检查
- 确认录音、上传、身份验证和属性推断分别需要何种同意。
- 明确原始音频、特征、转写和推断结果的保留期限。
- 比较Web API上传处理与设备端SDK的数据路径。
- 限制谁可以查看个体级表达和说话者属性。
- 为数据访问、删除、异议和人工复核建立流程。
audEERING是否开源
audEERING的devAIce、XR插件和商业模型不是整体开源产品。官方GitHub公开openSMILE、Python封装、audb、audmodel和其他研究工具,但每个项目需要分别查看许可证。
openSMILE源码对私人、研究和教育等非商业用途开放,并允许符合条件的商业研究。将其代码、派生版本或提取特征用于商业产品通常需要另购商业许可,不能仅凭公开仓库就当作无限制开源。
常见问题
audEERING主要做什么?
它专注语音与音频AI,通过devAIce分析声音活动、表达、说话者属性、音频质量、声学事件和场景。
devAIce可以离线运行吗?
SDK可在本地设备运行,通常不需要把分析音频持续上传云端,但许可证检查和具体部署条件需要向官方确认。
devAIce Web API多少钱?
公开预付包为35欧元600分钟和250欧元6,000分钟;订阅、SDK、XR和企业许可需要询价。
声音情绪识别能判断真实感受吗?
不能。模型分析的是声音表达特征,结果受语言、文化、口音和环境影响,不应当作个人真实情绪或意图的确定结论。
openSMILE可以免费商用吗?
通常不可以。公开版本主要允许非商业、研究和教育用途,商业产品或相关派生使用一般需要商业许可。
audEERING是开源公司吗?
不是。公司公开维护多个研究工具,但核心商业产品devAIce、模型和服务仍按商业许可证提供。
桂公网安备45132202000164号