AssemblyAI是什麼
AssemblyAI是一個面向開發者與企業的語音AI平台,其核心功能在於將預錄或即時的音頻轉換成結構化的文字。開發團隊可以透過API和官方SDK,將轉錄、說話人辨識、語音理解以及語音智能體等功能整合到自己的產品中。
該平台並非一般的錄音轉文字網頁工具,而是一種根據使用量來計費的開發者基礎設施。其產品涵蓋異步預先錄製的轉錄功能、即時流式轉錄功能、低延遲的短音頻同步介面、端到端的Voice Agent API、語音理解功能,以及LLM Gateway功能。
主要產品與功能
- 預錄音頻轉錄:提交音頻或影片檔案,異步產生完整轉錄結果。
- 實時流式轉錄:透過WebSocket傳送音頻流,並在數百毫秒內接收文字事件。
- 同步短音頻轉錄:以單次請求快速處理語音指令和聽寫等短片段。
- Voice Agent API:在即時連線中結合語音辨識、語言模型、語音合成與對話編排。
- 說話人分離:判斷不同的發言者,並為詞語或話輪添加標籤。
- 關鍵詞與通用提示:透過術語或自然語言說明,以改善特定上下文的識別。
- 語音理解:完成實體、主題、情感、翻譯及其他後處理任務。
- 隱私護欄:提供敏感資訊文本或音頻處理、內容審核和髒話過濾。
- LLM Gateway:使用統一憑證調用多個語言模型,以處理摘要與語音工作流程。
語音轉文字模型
| 使用方式 | 模型 | 特點 | 基礎價格 |
|---|---|---|---|
| 預錄異步 | Universal-3.5 Pro | 更高準確性和提示能力 | 0.21美元/音頻小時 |
| 預錄異步 | Universal-2 | 成本較低 | 0.15美元/音頻小時 |
| 實時流式 | Universal-3.5 Pro Realtime | 更高準確性及即時提示 | 0.45美元/會話小時 |
| 實時流式 | Universal-Streaming | 英語或多語言經濟方案 | 0.15美元/會話小時 |
| 同步短音頻 | Universal-3.5 Pro | 單請求返回短音頻結果 | 0.45美元/音頻小時 |
預錄、實時與同步介面如何選擇
| 介面 | 適合任務 | 返回方式 | 關鍵取捨 |
|---|---|---|---|
| 預錄異步 | 播客、會議、採訪和歷史錄音 | 提交任務後輪詢或接收回呼 | 成本較低,但需等待處理 |
| 實時流式 | 字幕、客服、語音機器人和現場會議 | WebSocket持續返回事件 | 低延遲,但連接空閒時間計費 |
| 同步短音頻 | 聽寫、語音搜尋和短指令 | 一次請求直接返回結果 | 介面簡單,單價高於異步 |
| Voice Agent | 端到端電話和語音助手 | 單個實時會話 | 開發簡單,但整體費率更高 |
語音理解能力
- 說話人識別:區分會議、訪談或通話中的不同發言者。
- 實體檢測:提取人物、組織、地點和其他結構化實體。
- 情感分析:判斷話段中表達的正向、負向或中性傾向。
- 主題檢測:依內容分類識別錄音討論的主題。
- 關鍵詞與亮點:發現重複或具有代表性的短語。
- 在保留原始轉錄結構的同時生成目標語言文本。
- 自訂格式:依照業務規則調整數字、縮寫及專業表達。
- 摘要與章節:可透過現有的語言模型工作流程產生更靈活的後處理結果。
適合哪些使用場景
- 會議助手:記錄多人會議、區分發言者並生成行動項目。
- 聯絡中心:轉錄客服通話,分析主題、情感及品質問題。
- 媒體平台:為播客、影片、直播和課程生成字幕與索引。
- 語音智能體:識別用戶發言並驅動即時對話和工具調用。
- 銷售分析:整理通話、異議、競爭資訊及下一步跟進。
- 醫療語音:在適用語言和合規配置下處理專業術語。
- 內容審核:對音頻中的敏感資訊、不當內容及個人數據進行處理。
- 語音搜尋:將大量音視頻轉換成可搜尋的文本。
適合哪些開發團隊
- 需要在產品中嵌入語音識別API的SaaS團隊。
- 開發即時字幕、語音機器人或電話自動化系統的工程師。
- 需要批量處理大量歷史音視頻的媒體和數據團隊。
- 需要說話人、時間戳和結構化結果的分析平台。
- 希望用Python、JavaScript或其他SDK快速集成的開發者。
- 對數據區域、保留時間、權限和審計有企業要求的組織。
快速接入教學
- 註冊帳戶並建立用於測試環境的獨立 API 金鑰。
- 在控制台Playground中用真實但脫敏的音頻比較模型。
- 選擇預錄、實時、同步短音頻或Voice Agent介面。
- 安裝目標編程語言的官方SDK,並固定相容版本。
- 顯式指定語音模型,不要依賴可能變化的預設值。
- 配置超時、重試、回呼驗證和失敗記錄。
- 用人工校對文本計算詞錯誤率與關鍵字段錯誤率。
- 設定餘額、用量和異常費用提醒後再進入生產環境。
實時轉錄教學
- 確認麥克風或電話音訊的採樣率、編碼和聲道。
- 建立WebSocket連接並發送正確的會話參數。
- 持續傳輸音頻塊,並處理話輪、時間戳和錯誤事件。
- 根據業務術語配置關鍵字或提示。
- 需要時啟用說話人分離、醫療模式或Voice Focus。
- 在界面中區分臨時狀態和不可變最終文本。
- 用戶結束通話後發送會話終止消息。
- 確認連接真正關閉,並監控實際會話計費時長。
基礎價格
AssemblyAI採用按量付費模式,沒有強制的月度訂閱、最低消費額或長期合約。新帳戶可獲得50美元的免費額度,無需信用卡,該額度可用於語音轉文字、Voice Agent、語音理解及相關功能,但不包括LLM Gateway。
| 產品 | 公開價格 | 計費依據 |
|---|---|---|
| Universal-3.5 Pro預錄 | 0.21美元/小時 | 提交的音頻或影片時長,精確到秒 |
| Universal-2預錄 | 0.15美元/小時 | 提交的音頻或影片時長,精確到秒 |
| Universal-3.5 Pro即時 | 0.45美元/小時 | WebSocket連接開啟時長 |
| Universal-Streaming | 0.15美元/小時 | WebSocket連接開啟時長 |
| 同步短音頻 | 0.45美元/小時 | 處理的短音頻時長 |
| Voice Agent API | 4.50美元/小時 | 端到端會話連接時長 |
| LLM Gateway | 按模型Token計費 | 分別計算輸入和輸出Token |
增值功能價格
| 功能 | 附加價格 | 說明 |
|---|---|---|
| 標準異步說話人分離 | +0.02美元/小時 | 適用於預錄轉錄 |
| 實驗異步說話人分離 | +0.065美元/小時 | 適合更多說話人或困難音頻 |
| 實時說話人分離 | +0.12美元/小時 | 按完整流式會話時長計費 |
| Medical Mode | +0.15美元/小時 | 適用語言和模型有限 |
| 通用提示 | +0.05美元/小時 | Universal-3.5 Pro異步或實時測試功能 |
| Voice Focus | +0.10美元/小時 | 僅Universal-3.5 Pro實時 |
| 翻譯 | +0.06美元/小時 | 預錄音頻,支援多個目標語言 |
| PII文本遮蓋 | +0.08美元/小時 | 從轉錄文本中處理敏感資訊 |
| PII音頻遮蓋 | +0.05美元/小時 | 對音頻執行消音或替換 |
| 內容審核 | +0.15美元/小時 | 與基礎模型費用疊加 |
計費規則與常見誤區
- 預錄轉錄按提交音頻的實際秒數計算,失敗的轉錄不收費。
- 流式轉錄按連接開啟到關閉的總時長收費,靜音和空閒也計算。
- 未正確關閉的流式會話可能在3小時後自動關閉並產生完整費用。
- 多個並發流分別累計計費時長。
- 多聲道轉錄按每個聲道分別計費,一小時三聲道等於三小時用量。
- 增值功能會與基礎模型價格疊加。
- Voice Agent連接的靜音和恢復寬限窗口也可能計費。
- Voice Agent內部若另行調用LLM Gateway,相關Token費用可能單獨累加。
成本控制教學
- 按準確率、延遲和功能要求選擇最低可滿足需求的模型。
- 在請求中顯式指定模型,避免免費與付費帳戶的預設值不同。
- 預處理長靜音,並確認是否真的需要多聲道分別轉錄。
- 只啟用能產生實際業務價值的增值功能。
- 通話結束立即發送終止事件並關閉WebSocket。
- 按項目和API密鑰拆分測試、生產及不同客戶用量。
- 設定餘額自動充值上限、費用提醒和異常會話監控。
- 定期比較人工校對成本、模型準確率及每條成功任務成本。
Voice Agent API
Voice Agent API將即時語音辨識、語言模型、語音合成、輪次判斷、中斷處理以及工具調用等功能整合在單一個WebSocket中。其公開定價為每小時4.50美元,很適合那些希望減少多服務協調工作的團隊使用。
| 方案 | 優點 | 代價 |
|---|---|---|
| Voice Agent API | 單一介面、端到端編排及統一會話 | 每小時4.50美元,組件替換靈活性較低 |
| 自建STT+LLM+TTS | 可獨立選擇每個供應商和模型 | 需要自行處理延遲、中斷、故障和多份賬單 |
| 僅實時STT | 適合已有對話和語音合成架構 | 仍需承擔後續模型與基礎設施費用 |
資料安全與治理
- 專案隔離:不同專案擁有獨立的API金鑰與歷史數據範圍。
- 角色權限:帳戶支援Owner、Admin和Reader三類角色。
- 多因素認證:可為成員啟用並由組織強制執行。
- 資料控制:付費帳戶可自助設定保留時間和模型訓練退出。
- 業務合作夥伴協議:醫療相關團隊可評估並簽署BAA。
- 區域處理:可選擇美國或歐盟相關端點,以符合資料駐留要求。
- 活動日誌:記錄帳戶與管理操作,便於審計。
- PII處理:可透過增值護欄遮蓋文字或音訊中的敏感資訊。
產品優勢
- 同時覆蓋預錄、即時、短音頻和端到端語音智能體。
- 定價按小時公開,預錄音頻精確到秒計費。
- 提供說話人、時間戳、提示和豐富語音理解能力。
- Python和JavaScript等官方SDK降低接入工作量。
- Playground可在編碼前比較真實音頻和不同模型。
- 專案、成員角色、MFA、資料保留與審計適用於團隊治理。
- 50美元免費額度便於完成有代表性的原型評估。
使用限制
- 識別準確率會受語言、口音、雜音、重疊說話及專業術語影響。
- 流式會話按連接時長計費,連接管理錯誤容易產生額外費用。
- 多聲道和多個增值功能疊加後成本可能顯著高於基礎價格。
- 部分功能只支援特定模型、語言或預錄模式。
- 舊模型參數和已棄用摘要功能可能導致遷移問題。
- 雲端API需要將音頻發送到外部服務,不適合未經批准的敏感數據。
- LLM Gateway不包含在免費額度中,並按各模型Token單獨計費。
- 生產系統仍需處理重試、回呼安全、限流和人工校驗。
GitHub與SDK
AssemblyAI擁有官方GitHub組織,並維護Python SDK、JavaScript SDK、範例以及語音智慧體的入門專案。SDK開源並不代表雲端語音模型、訓練數據和託管API也全部開源。
開發者應以目前的官方文件和SDK版本為準,特別注意舊的即時端點、模型別名以及單數/複數參數的變化。在生產環境中,必須鎖定所使用的依賴版本,並在升級前執行回歸測試。
基本資訊
| 項目 | 內容 |
|---|---|
| 平台名稱 | AssemblyAI |
| 工具類型 | 語音轉文字與語音AI開發平台 |
| 核心介面 | 預錄、即時、同步短音頻和Voice Agent API |
| 主要模型 | Universal-3.5 Pro與Universal-2 |
| 免費額度 | 新帳戶50美元,不含LLM Gateway |
| 價格模式 | 按音頻、會話時長、附加功能或Token計費 |
| 官方SDK | 提供Python、JavaScript等SDK和範例 |
| API | 提供 |
| 是否開源 | SDK和範例開源,託管平台與模型不開源 |
推薦指數
綜合推薦指數為4.6分,滿分5分。AssemblyAI的介面、語音功能、文件處理能力以及價格透明度都相當良好,適合用於開發生產級的語音應用程式,但實時連線的計費方式以及各種附加功能,都需要妥善監控。
常見問題
AssemblyAI主要做什麼?
它透過API將預錄或即時音頻轉換成文字,並提供語音理解與智能體功能。
有免費額度嗎?
新帳戶可獲得50美元的免費額度,無需信用卡,但不包含LLM Gateway。
預錄轉錄多少錢?
Universal-3.5 Pro的費用為每小時0.21美元,Universal-2則為每小時0.15美元。
實時轉錄多少錢?
Universal-3.5 Pro Realtime的費用為每小時0.45美元,Universal-Streaming則為0.15美元。
流式識別如何計費?
按WebSocket連接開啟時長計費,包括靜音和空閒時間。
支援說話人分離嗎?
支持,預錄和實時模式的附加價格不同。
Voice Agent API多少錢?
公開價格為每小時4.50美元,按會話連接時長計算。
AssemblyAI是開源的嗎?
官方SDK和範例開源,但託管模型、訓練數據和平台本身不開源。
適合醫療數據嗎?
可評估醫療模式、BAA和資料控制,但仍需由組織完成自身合規審查。
桂公網安備45132202000164號