audEERING是什麼
audEERING是一家來自德國的語音與音頻人工智慧公司,專注於從聲音中提取非語言資訊。其核心商業產品devAIce以SDK、Web API和XR插件等形式提供,適用於軟體、硬體、客服中心、汽車、機器人、可穿戴裝置以及各種研究專案。
它不是錄音剪輯、音樂生成或通用語音轉文字網站。產品的重點在於檢測聲音活動、聲學事件、表達維度、韻律、說話者屬性、音頻品質以及所處的聲學場景。
audEERING的主要產品
devAIce SDK
SDK在本地設備上運行,適合需要低延遲、離線處理或避免持續上傳音頻的場景。官網列出了Windows、Linux、macOS、Android和iOS,並支援x86-64與ARMv8架構。
devAIce Web API
Web API用於在雲端上對音頻進行批量分析,它並非為一般使用者所設計的圖形化編輯工具。開發人員可以透過命令列、直接的HTTP請求,或是使用Python、.NET、Java、JavaScript和PHP等程式語言的客戶端來取得JSON格式的結果。
devAIce XR
devAIce XR將語音表達與場景識別功能引入Unity和Unreal等遊戲引擎中。它可用於虛擬角色、沉浸式體驗以及玩家研究,但具體的模組與商業授權需另行確認。
AI SoundLab
AI SoundLab是一個用於收集音頻數據並進行即時分析的研發平台。在健康研究領域中,參與者可以自行管理自己的數據,官方表示,相關的音頻及個人資訊會儲存於德國,且可被刪除。
openSMILE
openSMILE是audEERING所維護的大型音頻特徵提取工具,可用於語音、音樂、情緒、說話人以及節奏等方面的分析。官方還提供了Python封裝版本,讓研究人員能夠直接提取常見的特徵集。
devAIce可分析哪些內容
BASE基礎包
- 語音活動檢測,用於區分講話與非語音片段。
- 聲學事件檢測,用於識別電話鈴聲、哭聲等聲音事件。
- 說話人驗證,用於比較聲音身份特徵。
- 自動語音識別,把講話轉成文本。
- 音頻品質分析與通用聲學特徵提取。
EXPRESSION表達包
- 聲音表達與大型表達模型。
- 多模態表達分析。
- 語調、語速和其他韻律特徵。
- 激活度、愉悅度和支配度等連續表達維度。
SPEAKER與SCENE
- 估計年齡和感知性別等說話者屬性。
- 區分室內、室外和交通三類聲學場景。
- 在三個大類下進一步識別八種子場景。
audEERING適合哪些場景
- 呼叫中心分析客服與客戶的聲音表達和對話品質。
- 機器人、汽車和智慧設備根據聲音環境調整互動。
- 遊戲與XR應用讓虛擬角色響應玩家語氣。
- 市場研究團隊分析訪談和產品回饋中的聲音表達。
- 科研機構提取可重現的音頻特徵並訓練模型。
- 醫學研究探索聲音生物標記物,但不能直接用於臨床診斷。
devAIce Web API使用教學
- 確定任務需要BASE、EXPRESSION、SPEAKER還是SCENE模組。
- 準備具有合法授權的音頻,並取得說話者知情同意。
- 用少量非敏感樣本購買預付分鐘或聯繫銷售申請方案。
- 先使用官方推薦的CLI上傳檔案並檢查JSON結果。
- 確認採樣率、聲道、雜訊和錄音設備符合模型要求。
- 用人工標註樣本評估不同語言、口音、年齡和環境表現。
- 確定輸出滿足需求後,再選擇用戶端庫或直接HTTP整合。
- 建立失敗重試、額度監控、資料刪除和訪問控制流程。
- 上線前完成隱私、勞動關係、反歧視和地區法規評估。
SDK接入建議
- 在真實目標設備上比較處理速度、CPU和記憶體佔用。
- 使用語音活動檢測排除不需要分析的非語音片段。
- 同時測試安靜、噪聲、遠場和不同麥克風條件。
- 不要根據單次短音頻對個人作出高風險判斷。
- 明確設備端分析是否仍需要上網進行許可證驗證。
audEERING的優勢
- 專注音頻與非語言語音分析,產品定位清晰。
- 同時提供設備端SDK、雲端Web API和XR插件。
- 可運行在桌面、移動和嵌入式架構上。
- 預付Web API適合小規模測試,無需先簽長期訂閱。
- 官方維護openSMILE及一系列音頻研究工具。
- 支援多種程式設計語言的用戶端及直接HTTP呼叫。
使用限制與倫理風險
- 聲音表達不等於人的真實情緒、意圖或人格。
- 年齡與感知性別是模型推斷,可能錯誤並強化偏見。
- 口音、語言、文化、殘障、設備和環境都會影響結果。
- 不得把表達評分直接用於招聘、解雇、保險或執法等高風險決策。
- 聲音可能構成生物識別或健康相關數據,需要明確合法依據。
- 健康演示不是醫療產品,也不提供醫療建議。
- 預付API是開發者介面,不包含完整的可視化分析工作台。
devAIce Web API價格
以下為2026年8月26日官網公開的預付費方案,適合試用和偶爾分析。付款由Stripe完成;稅費、分鐘有效期限、額外模組和活動權益以購買頁面為準。
| 方案 | 一次性價格 | 音頻分鐘 | 包含內容 | 適合場景 |
|---|---|---|---|---|
| Prepaid Entry | 35歐元 | 600分鐘 | Web API、BASE套件及一個所選模組 | 初次測試與小型項目 |
| Prepaid Plus | 250歐元 | 6,000分鐘 | Web API、BASE套件及一個所選模組 | 較大規模驗證與批量分析 |
官網目前仍宣傳限時開放所有套件,但活動可能會結束。訂閱、SDK、XR插件、商業許可及訂製諮詢沒有公開固定價格,需聯繫銷售確認。
數據與隱私
官網的隱私政策主要涉及網站訪問、Cookie、聯絡表單以及行銷數據,並說明會遵守GDPR規定。至於產品中的語音樣本和客戶內容,則還受服務條款及具體合約的約束,因此不能僅依賴網站的隱私頁面來判斷。
服務條款要求客戶必須擁有音頻、聲音樣本及其他內容的相關權利與同意,並承擔GDPR所規定的責任。此外,條款還授予audEERING在履行協議過程中,使用、複製、修改及展示客戶數據的廣泛授權,同時也允許其利用經過匿名處理的數據。
部署前隱私檢查
- 確認錄音、上傳、身分驗證和屬性推斷分別需要何種同意。
- 明確原始音頻、特徵、轉寫和推斷結果的保留期限。
- 比較Web API上傳處理與設備端SDK的資料路徑。
- 限制誰可以查看個體級表達和說話者屬性。
- 為數據訪問、刪除、異議和人工複核建立流程。
audEERING是否開源
audEERING的devAIce、XR插件和商業模式並非整體開源的產品。官方在GitHub上公開了openSMILE、Python封裝、audb、audmodel以及其他研究工具,但每個專案都需要分別查看其許可證條款。
openSMILE的源代碼對於個人、研究及教育等非商業用途是開放的,同時也允許符合條件的商業研究使用。若要將其代碼、衍生版本或提取出的特徵用於商業產品中,通常需要另行購買商業許可,不能僅憑公開的儲存庫就認為其屬於無限制的開源軟體。
常見問題
audEERING主要做什麼?
它專注於語音與音頻AI,透過devAIce分析聲音活動、表達、說話者屬性、音頻品質、聲學事件和場景。
devAIce可以離線運行嗎?
SDK可在本地設備運行,通常不需要把分析音頻持續上傳雲端,但許可證檢查及具體部署條件需要向官方確認。
devAIce Web API多少錢?
公開預付包為35歐元600分鐘和250歐元6,000分鐘;訂閱、SDK、XR及企業許可需另行詢價。
聲音情緒識別能判斷真實感受嗎?
不能。模型分析的是聲音表達特徵,結果受語言、文化、口音和環境影響,不應當作個人真實情緒或意圖的確定結論。
openSMILE可以免費商用嗎?
通常不可以。公開版本主要允許非商業、研究和教育用途,商業產品或相關衍生使用一般需要商業許可。
audEERING是開源公司嗎?
不是。公司公開維護多個研究工具,但核心商業產品devAIce、模型和服務仍按商業許可證提供。
桂公網安備45132202000164號