一句話介紹
Deepgram是一套面向開發者與企業的語音AI平台,透過API提供即時與批量語音識別、對話式語音合成、完整的Voice Agent編排以及音頻理解功能,並支援託管雲端、專用環境與本地部署。
工具簡介
Deepgram圍繞真實語音應用,提供從聽取、思考到說話的完整功能。開發者可以單獨使用語音轉文字或文字轉語音的功能,或者透過WebSocket連接,打造能夠處理中斷、輪流發言以及各種工具調用的即時語音智能體。
目前的核心模型包括用於一般轉錄的Nova-3、用於對話輪次的Flux STT、對話式的Flux TTS以及Aura系列語音合成技術。這些產品與模型均屬於商業服務,雖然官方提供了開源的SDK,但並不意味著模型的權重或平台的原始代碼也會被公開。
產品能力概覽
| 產品 | 主要輸入 | 主要輸出 | 典型用途 |
|---|---|---|---|
| Speech-to-Text | 實時流或錄音檔案 | 帶時間、說話人和置信度的文本 | 轉錄、字幕與分析 |
| Text-to-Speech | 文本與對話上下文 | 流式合成語音 | 客服、助手與電話機器人 |
| Voice Agent API | 雙向實時音頻與配置 | 可中斷的語音對話 | 客戶服務、預約與外呼 |
| Audio Intelligence | 音頻轉錄或文本 | 摘要、主題、情緒與意圖 | 檢質、洞察和路由 |
| Self-Hosted | 企業GPU基礎設施 | 私有語音推理端點 | 數據駐留與低延遲 |
| Playground | 麥克風、檔案或文字 | 模型試用結果 | 原型驗證與參數比較 |
語音識別模型
Nova-3
Nova-3是目前推薦的通用型生產級語音識別模型,可用於即時串流及預錄音檔。它支援多種語言、自動語言檢測、雜訊處理以及遠場音頻的處理,此外還能透過關鍵字提示來提升對品牌、產品及行業術語的識別能力。
Flux STT
Flux STT專為即時語音客服設計,不僅能識別文字,還將輪次結束檢測及可配置的對話節奏整合至模型中。英文版與多語言版分別計費,多語言版可透過語言提示來影響識別結果。
Nova-3 Medical與訂製模型
Nova-3提供了針對醫療詞彙的選項,企業亦可聯繫銷售人員,訓練適用於專有或特殊數據的Custom模型。專業模型仍需以真實的口音、設備、場景及詞彙集來評估,不能僅依賴通用標準。
Whisper Cloud與舊模型
Deepgram仍提供托管Whisper Large的服務,同時也保留Nova-2、Enhanced和Base版本,供現有系統使用。對於新專案而言,建議先比較Nova-3與Flux,以避免因歷史相容性問題而被迫選擇擴展性較低的Whisper。
語音識別功能
- Streaming用於電話、會議和Voice Agent的即時增量轉錄。
- Pre-Recorded用於上傳錄音,並以異步或同步方式產生完整文本。
- Speaker Diarization識別多人並標註每段由誰說出。
- Smart Formatting自動處理標點、大小寫、日期和貨幣。
- 關鍵字提示可增強產品名、縮寫及專業術語的識別能力。
- Redaction用於識別並移除部分個人敏感資訊。
- 實體檢測可提取人物、組織、地點和日期等實體。
- Automatic Language Detection輔助處理語言未知或切換場景。
文字轉語音語音合成
Flux TTS
Flux TTS是一種針對即時語音智能體的流式、對話型模型,它能透過跨輪上下文來保持語氣、節奏和情緒的連續性。它還能回傳用戶在被打斷之前所聽到的文字,並且可以在不中斷對話的情況下調整語速和風格。
Aura-2
Aura-2專為專業、大規模且低延遲的語音合成而設計,可用於客戶服務、通知及對話應用。現有的Aura-2模型不會因Flux TTS的推出而被迫轉換。
Aura-1
Aura-1仍作為成本較低的语音合成選項提供。選擇時應同時比較語言、聲音、延遲、結構化內容發音以及部署區域,而非僅比較每千字元的單價。
對話式語音控制
Deepgram目前將語音合成設計為對話架構的一部分,能夠追蹤狀態、輪次邊界以及中斷情況。對於那些有嚴格的品牌聲音或聲音克隆需求的專案,應先確認現有模型是否具備相應的機能與授權能力。
Voice Agent API
Voice Agent API將語音辨識、LLM編排以及語音合成整合在單一實時連線中,從而減少開發者需要整合多個服務的繁瑣工作。使用者也可以自行攜帶LLM或TTS,僅使用Deepgram的其他語音與編排功能。
- 內建Barge-in檢測,讓用戶可以自然打斷智能體。
- 輪流說話預測幫助系統判斷何時聽、思考和說話。
- 函數呼叫允許在對話中查詢業務系統或執行工具。
- Mid-session control可在會話中調整配置和行為。
- 可重複使用的設定能夠方便地重複運用智能體的設定。
- 多代理架構支援專用智能體之間交接。
- 電話功能用於接入呼入及呼出電話網路。
- Browser Agent SDK可把即時語音能力嵌入Web應用。
Audio Intelligence
音頻智慧技術用於在轉錄的基礎上,產生摘要、主題、情緒和意圖等結構化結果。部分功能會根據輸入和輸出的 Token 數量另行收費,因此不能將其視為語音識別服務中已包含的所有功能。
| 能力 | 結果 | 適合場景 | 主要風險 |
|---|---|---|---|
| Summarization | 對話摘要 | 客服紀要、會議回顧 | 可能遺漏限定條件 |
| Topic Detection | 主題標籤 | 內容歸類與路由 | 多主題邊界不穩定 |
| Sentiment Analysis | 情緒傾向 | 服務品質檢測與趨勢 | 語境、文化與諷刺偏差 |
| Intent Recognition | 用戶意圖 | 自動分流與後續動作 | 錯誤意圖可能觸發錯誤流程 |
| Entity Detection | 人物、組織、地點和日期 | CRM錄入與檢索 | 實體拼寫需複核 |
| Redaction | 移除部分敏感文字 | 隱私與合規處理 | 不能替代完整數據防泄漏 |
完整接入流程
- 創建Deepgram帳戶和Project,領取免費信用額度。
- 生成只具備必要權限的API Key,並存入安全的服務端配置。
- 根據即時對話或錄音處理選擇Streaming或Pre-Recorded。
- 選擇Nova-3、Flux或其他適合語言和場景的模型。
- 設定音頻編碼、採樣率、語言、說話人以及格式化參數。
- 使用真實設備、雜訊、口音及專業術語來執行基準測試。
- 處理結果中的臨時段、最終段、錯誤、超時和重連。
- 記錄音頻時長、字數、附加功能及併發量以監控成本。
- 上線前配置隱私、保留、區域、配額和故障降級策略。
實時轉錄教學
- 從瀏覽器、電話或音訊設備取得穩定的單聲道或多聲道音訊。
- 建立WebSocket連接並在服務端完成短期或長期憑證認證。
- 聲明正確的編碼、採樣率及聲道數,避免音頻被錯誤解釋。
- 使用Nova-3處理通用轉錄,或用Flux處理對話輪次。
- 按需求啟用Smart Formatting、Diarization和Keyterm。
- 將中間結果用於即時介面,最終結果用於持久化與業務動作。
- 為斷網、靜音、長停頓、重連和重複片段建立狀態機。
- 用人工標註集計算詞錯率、實體準確率和端到端延遲。
構建Voice Agent教學
- 定義智能體任務、允許執行的動作以及必須轉交給人工處理的條件。
- 配置Flux或Nova語音識別、LLM供應商和TTS聲音。
- 編寫系統提示,限制身份、業務範圍和不可承諾事項。
- 實現函數調用,並在服務端驗證參數、權限和幀等性。
- 測試用戶打斷、沉默、重複、背景聲和同時說話。
- 記錄用戶實際聽到的內容,避免打斷後業務狀態不一致。
- 為敏感操作增加身分驗證、確認步驟和人工接管。
- 監控每通時長、延遲、轉人工率、任務成功率及成本。
生產品質評估
- 準備覆蓋主要語言、口音、設備、雜訊和業務術語的測試集。
- 由人工製作可靠參考轉錄,並固定評分規則。
- 分別測試實時與批次模式,不混合比較延遲和準確率。
- 比較Nova-3單語、多語、Flux和現有供應商。
- 對數字、人名、地址、藥品和賬號等關鍵實體單獨計分。
- 計算詞錯率之外的輪次判斷、首字延遲和最終延遲。
- 估算多聲道、附加功能、Audio Intelligence和重試成本。
- 只有在業務閾值達標後才擴大流量。
適合哪些用戶
- Voice Agent開發團隊:構建低延遲、可中斷的即時語音助手。
- 呼叫中心平台:轉錄電話、總結通話並識別意圖。
- 會議與字幕產品:生成即時字幕、說話人與章節。
- 醫療與金融企業:透過企業合約使用合規與私有部署。
- 媒體與播客平台:批量轉錄、搜尋和理解錄音。
- 銷售與客服團隊:將語音數據轉換為CRM及品質檢查資訊。
- 平台工程團隊:使用SDK、區域端點及自託管方式進行整合。
典型使用場景
| 場景 | 推薦能力 | 關鍵指標 | 風險控制 |
|---|---|---|---|
| 即時客服機器人 | Flux STT加Flux TTS或Voice Agent | 打斷、延遲、解決率 | 轉人工與身分驗證 |
| 會議字幕 | Nova-3 Streaming加語音分割 | 詞錯率與說話人準確率 | 參會者同意 |
| 錄音歸檔 | Nova-3 Pre-Recorded | 吞吐、成本和檢索率 | 保留與訪問控制 |
| 醫療記錄 | Nova-3 Medical加Redaction | 術語與關鍵實體 | BAA和人工審核 |
| 電話品質檢測 | STT加音頻智慧 | 摘要、情緒和意圖 | 避免只憑情緒評分處罰 |
| 語音通知 | Aura-2或Aura-1 | 發音、延遲和成本 | 品牌與無障礙檢查 |
| 本地語音平台 | Self-Hosted | 數據駐留和容量 | GPU、升級和許可運維 |
價格計劃
以下價格是根據2026年8月22日的官方頁面所確認的。在語音識別服務的價格中,有部分是限時優惠;Flux TTS以及使用Flux TTS的Voice Agent相關優惠,將在2026年9月12日結束,因此在上線之前必須再次查看價格。
| 計劃 | 價格或門檻 | 主要權益 | 預設規模 | 適合用戶 |
|---|---|---|---|---|
| Free Credit | 新帳戶200美元 | 無需信用卡,信用額無固定到期日 | 使用公共模型 | 原型與評估 |
| Pay As You Go | 按實際用量 | 無最低承諾 | STT流式最高150併發 | 開發者與創業團隊 |
| Growth | 每年4000美元起預付 | 最高約20%折扣與更高併發 | STT流式最高225並發 | 增長中的生產應用 |
| Enterprise | 聯絡銷售 | 大規模、訂製模型、私有部署與支援 | 訂製併發與SLA | 大型或受監管企業 |
語音轉文字價格
Streaming實時語音識別
| 模型 | Pay As You Go | Growth | 計費單位 | 備註 |
|---|---|---|---|---|
| Flux English | 當前0.0065美元 | 當前0.0057美元 | 每分鐘 | 流式促銷價 |
| Flux Multilingual | 0.0078美元 | 0.0068美元 | 每分鐘 | 支援對話多語言 |
| Nova-3 Monolingual | 當前0.0048美元 | 當前0.0042美元 | 每分鐘 | 流式促銷價 |
| Nova-3 Multilingual | 當前0.0058美元 | 當前0.0050美元 | 每分鐘 | 流式促銷價 |
| Custom | 聯絡銷售 | 聯絡銷售 | 合同 | 專有或特殊數據 |
預錄音錄音識別
| 模型 | Pay As You Go | Growth | 計費單位 | 適合任務 |
|---|---|---|---|---|
| Nova-3 Monolingual | 0.0043美元 | 0.0036美元 | 每分鐘 | 單語錄音 |
| Nova-3 Multilingual | 0.0052美元 | 0.0043美元 | 每分鐘 | 多語言錄音 |
| Whisper Large | 0.0048美元 | 0.0048美元 | 每分鐘 | 相容特定Whisper流程 |
| Custom | 聯絡銷售 | 聯絡銷售 | 合同 | 訂製模型 |
語音轉文字附加功能
| 功能 | Pay As You Go | Growth | 實時或錄音 | 備註 |
|---|---|---|---|---|
| Redaction | 0.0020美元每分鐘 | 0.0017美元每分鐘 | 兩者 | 移除部分敏感資訊 |
| Keyterm Prompting | 0.0013美元每分鐘 | 0.0012美元每分鐘 | 兩者 | 增強關鍵術語 |
| Smart Formatting | 包含 | 包含 | 兩者 | 標點與格式 |
| Entity Detection | 0.0017美元每分鐘 | 0.0017美元每分鐘 | 兩者 | 提取實體 |
| Speaker Diarization | 實時0.0020美元每分鐘 | 以頁面為準 | 實時 | 錄音模式目前包含 |
| Speaker Diarization | 包含 | 包含 | 錄音 | 多人標註 |
文字轉語音價格
Flux TTS在2026年9月12日前限時免費,2026年9月13日起恢復標準字符計費。免費期不是永久免費計劃。
| 模型 | Pay As You Go | Growth | 計費單位 | 價格狀態 |
|---|---|---|---|---|
| Flux TTS | 9月12日前免費,之後0.0450美元 | 9月12日前免費,之後0.0405美元 | 每1000字元 | 限時活動 |
| Aura-2 | 0.030美元 | 0.027美元 | 每1000字元 | 當前標準價 |
| Aura-1 | 0.0150美元 | 0.0135美元 | 每1000字元 | 當前標準價 |
Voice Agent API價格
Voice Agent是根據對話的持續時間來計費的,同時還會根據是否使用Deepgram所提供的LLM和TTS技術,來區分不同的等級。以下為Flux TTS免費活動期間的現行價格,以及活動結束後的標準價格。
| 層級 | Pay As You Go當前價格 | 活動後價格 | Growth當前價 | 適合配置 |
|---|---|---|---|---|
| Standard | 0.056美元每分鐘 | 0.075美元每分鐘 | 0.051美元每分鐘 | 使用完整預設語音堆疊 |
| Standard BYO TTS | 0.065美元每分鐘 | 同當前 | 0.051美元每分鐘 | 自帶語音合成 |
| Custom BYO LLM | 0.050美元每分鐘 | 0.065美元每分鐘 | 0.041美元每分鐘 | 自帶語言模型 |
| 自訂 BYO LLM加TTS | 0.050美元每分鐘 | 同當前 | 0.041美元每分鐘 | 自帶語言模型和語音合成 |
| Advanced | 0.122美元每分鐘 | 0.163美元每分鐘 | 0.110美元每分鐘 | 更高級LLM層級 |
| Advanced BYO TTS | 0.122美元每分鐘 | 同當前 | 0.110美元每分鐘 | 高級LLM並自帶TTS |
計費規則與成本陷阱
- 語音識別按實際秒數計費,不向上取整到固定分鐘。
- 多聲道按各聲道總處理時長計費,10分鐘雙聲道按20分鐘計算。
- Redaction、Keyterm、Entity以及部分Diarization需要額外費用。
- Audio Intelligence是依據輸入和輸出的Token來計費的,不包含在STT的單價之中。
- Growth超出信用額度按原Growth費率加10%並按週結算。
- Growth若要啟用超額用量,需保留有效信用卡,否則額度耗盡會中斷請求。
- 併發限制以專案為單位,共用同一池的多個API Key不會增加容量。
- 創建額外Project繞過速率限制違反服務條款。
- 促銷和限時免費結束後,單位成本可能自動變化。
速率限制
| 服務 | Pay As You Go預設限制 | Growth公開限制 | 說明 |
|---|---|---|---|
| Voice Agent | 最高45個併發連接 | 最高60個併發連接 | 按Project計算 |
| Flux STT Streaming | 最高150個併發請求 | 計劃頁顯示最高225 | 區域文件需再次確認 |
| Nova-3 Pre-Recorded | 最高50個並發請求 | 公開計劃為50 | 批次任務 |
| Nova-3 Streaming | 最高150個併發請求 | 最高225 | 實時轉錄 |
| Speaker Diarization Streaming | 北美最高50,歐澳最高25 | 按協議 | 低於普通流式限制 |
| Text-to-Speech REST | 每模型最高15個並發請求 | 計劃總覽給出更高整體規模 | 模型與區域限制優先 |
| Audio Intelligence | 最高10個併發請求 | 最高10 | 附加分析 |
部署方式
| 方式 | 運行位置 | 運維責任 | 數據與適用場景 |
|---|---|---|---|
| Hosted | Deepgram多租戶雲 | Deepgram負責基礎設施和更新 | 最快開始開發 |
| 區域雲端 | 北美、歐洲或澳大利亞端點 | Deepgram負責 | 區域處理和數據駐留 |
| Dedicated或VPC | 專用客戶雲環境 | 按企業協議 | 隔離與訂製容量 |
| Self-Hosted | 客戶VPC或資料中心 | 客戶負責基礎設施、備份和更新 | 嚴格隱私與低延遲 |
| Amazon SageMaker | 客戶AWS VPC | AWS託管端點與客戶配置 | 透過Marketplace部署模型 |
Self-Hosted要求
本地部署支援Docker、Podman、Kubernetes、裸機以及部分雲端平台,僅支援Linux x86-64或amd64架構,以及NVIDIA GPU。Nova與Aura的支援範圍較廣,而Flux模型則對GPU的世代及記憶體有更高的要求。
- STT Engine通常至少需要1張16GB顯存的NVIDIA GPU、4核CPU和32GB記憶體。
- Aura類TTS Engine需要正好2張專用GPU、8核CPU和64GB記憶體。
- Flux TTS使用單GPU,但載入時可佔用約60GB系統記憶體。
- 自託管容器仍需許可與用量報告連接,除SageMaker隔離方案外並非自動完全離線。
- 客戶負責監控、容量、備份、更新、代理和TLS終止。
- Docker、Podman或Kubernetes的自托管功能,通常需要企業版授權才能使用。
隱私、安全與模型改進
Deepgram將企業的客戶資料之保存、儲存及刪除等相關事宜,交由商業協議來規定。根據自托管的說明,典型的自托管請求中所包含的音頻、轉錄內容以及其他識別資料,都不會被傳送給Deepgram,而只會上報時長、字數、功能以及成功狀態等用量相關的元數據而已。
Pay As You Go和Growth客戶可以選擇加入或退出Model Improvement Program,2026年3月起退出不會影響官網列示的費率。在處理真實個人數據之前,仍應確認控制台選項、地區、保留期以及數據處理協議。
- Deepgram公開SOC 2 Type I與Type II認證資訊。
- Enterprise醫療客戶可簽署BAA以處理電子受保護健康資訊。
- 歐洲區域端點用於滿足歐盟內的處理及資料存放需求。
- API Key應僅保存在服務端,並按項目、環境和最小權限拆分。
- 編輯只能降低部分暴露風險,不能代替源頭數據最小化。
- 日誌中避免記錄原始音頻、完整轉錄和長期有效金鑰。
- 高風險Voice Agent必須提供告知、錄音同意、人工接管和審計。
SDK、GitHub與開源狀態
Deepgram在官方GitHub組織中維護JavaScript、Python、.NET、Go和Java等SDK,並提供Voice Agent瀏覽器相關套件。JavaScript SDK的現行文件將v5列為當前主版本,進行專案遷移時應參考對應的升級說明。
多個官方 SDK 使用 MIT 授權條款,開發人員可以查看、修改和散布這些用戶端程式碼。不過,Deepgram 雲端平台、其商業模式、模型權重以及自托管的容器則並非開源產品。
| 項目 | 維護方 | 狀態 | 許可證或說明 |
|---|---|---|---|
| JavaScript與TypeScript SDK | Deepgram官方 | 公開 | MIT,當前主線v5 |
| Python SDK | Deepgram官方 | 公開 | 以倉庫許可證為準 |
| .NET SDK | Deepgram官方 | 公開 | MIT |
| Go SDK | Deepgram官方 | 公開 | MIT |
| Java SDK | Deepgram官方 | 公開 | MIT |
| Rust SDK | 社區 | 公開 | 不是同等官方支持級別 |
| Voice Agent SDK | Deepgram官方 | 公開 | MIT |
| 模型權重與雲平台 | Deepgram | 未開源 | 商業產品 |
支援語言與平台
| 能力 | 語言或平台 | 公開狀態 | 注意事項 |
|---|---|---|---|
| Nova語音識別 | 45種以上語言 | 支持 | 具體功能隨模型和語言變化 |
| Nova-3 Multilingual | 50種以上語言的產品描述 | 支持 | 自動語言檢測 |
| Flux STT Multilingual | 10種語言 | 支持 | 面向即時對話 |
| Flux TTS | 當前英文聲音 | 支持 | 更多語言仍在規劃 |
| 雲端API | 服務端與WebSocket | 支持 | 區域端點不同 |
| Self-Hosted | Linux x86-64與NVIDIA GPU | 企業支持 | 硬體要求按模型變化 |
| 行動端SDK | 無獨立消費者App | 透過後端或Web整合 | 密鑰不可放進用戶端 |
產品優勢
- 從STT、TTS到Voice Agent,提供一套連貫的語音堆疊。
- Flux將輪次結束和打斷反饋放入對話模型,減少外部拼接。
- Nova-3涵蓋即時與批次轉錄,並提供多語言和術語增強。
- 按秒計費避免固定分鐘向上取整帶來的浪費。
- 提供免費200美元信用額度,適合完成真實數據評估。
- 託管、區域、VPC、本地及SageMaker部署選項較完整。
- 官方SDK覆蓋多種主流服務端語言並公開源代碼。
- 企業安全、醫療協議和歐盟數據駐留選項較明確。
使用限制與注意事項
- 模型準確率會受語言、口音、雜訊、設備、遠場和重疊說話影響。
- 促銷價和限時免費有明確結束日期,長期成本需按標準價估算。
- 多聲道按各聲道時長累加,容易低估費用。
- 部分轉錄增強功能與Audio Intelligence需要額外計費。
- 預設的並發數量以專案為限,無法透過建立更多專案來規避。
- Voice Agent執行外部動作時必須驗證權限、參數和用戶確認。
- 情緒和意圖模型可能產生偏差,不能作為唯一決策依據。
- 自託管需要GPU、Linux、容器運維、許可連接及企業合約。
- 官方SDK開源並不代表語音模型或平台可以免費私有部署。
- 重要醫療、法律、金融和身分資訊仍需人工核複。
基本資訊
| 字段 | 內容 |
|---|---|
| 工具名稱 | Deepgram |
| 開發公司 | Deepgram, Inc. |
| 工具類型 | 語音識別、語音合成與Voice Agent平台 |
| 主要模型 | Nova-3、Flux STT、Flux TTS、Aura-2和Aura-1 |
| 主要介面 | REST API與WebSocket API |
| 免費額度 | 新帳戶200美元信用額度 |
| 價格模式 | 按量、Growth年度預付和Enterprise訂製 |
| 成長門檻 | 每年4000美元起 |
| 主要部署 | Hosted、區域雲、VPC、Self-Hosted和SageMaker |
| 中文支援 | Nova系列支援,具體能力需查看模型語言表 |
| 是否需要註冊 | 是 |
| 是否提供API | 是 |
| 官方SDK | JavaScript、Python、.NET、Go、Java等 |
| 官方GitHub | 有 |
| SDK是否開源 | 是,多個官方SDK採用MIT |
| 產品是否開源 | 否 |
推薦指數
推薦指數為4.7分,滿分5分。Deepgram涵蓋從即時轉錄到對話式TTS以及完整的Voice Agent製作流程,其模型、文件、SDK、區域及本地部署的選項都相當完整。
選擇難點在於產品線和計費維度較多,促銷結束、聲道、附加功能以及併發數量都可能改變總成本。最穩妥的方法是使用200美元的信用額度來測試實際負載情況,再根據標準價格來估算生產預算。
常見問題
Deepgram免費嗎?
新帳戶可獲得200美元的免費信貸額度,無需信用卡,且官網表示沒有固定的到期日。額度用完後將根據實際使用量來計算費用。
Deepgram語音識別多少錢?
目前,Nova-3的單語即時播報服務價格為每分鐘0.0048美元,而預錄音檔的價格則為每分鐘0.0043美元。多語言服務、Flux功能以及各種附加功能的價格則有所不同。
Flux TTS永久免費嗎?
不是。Flux TTS只在2026年9月12日前限時免費,9月13日起Pay As You Go的標準價格為每1000字元0.0450美元。
Voice Agent API如何收費?
按對話分鐘數以及所選的LLM、TTS組合來計費。目前,Standard方案的價格為每分鐘0.056美元,而活動結束後則為0.075美元。
支援中文嗎?
Nova系列支援中文等多種語言,但具體的識別功能、模型選項及地區可用性需以最新的語言列表為準。中文項目仍應測試口音、夾雜英文及專業詞彙的情況。
可以本地部署嗎?
可以,Enterprise客戶可以在VPC、裸機或容器平台上自行管理,亦可透過Amazon SageMaker來部署。硬體方面,通常需要Linux作業系統以及NVIDIA GPU。
Deepgram會保存音頻嗎?
雲端中的客戶資料之保留與刪除,是依照商業協議來執行的。一般的自托管請求不會將音訊或轉錄內容傳送給 Deepgram,但會傳回使用量相關的元資料。
可以退出模型改進計劃嗎?
可以,Pay As You Go和Growth客戶可以選擇加入或退出,2026年3月起退出不會影響官網列示的價格。
多聲道如何計費?
按所有聲道的總處理時長計算。10分鐘的雙聲道音頻會按20分鐘的處理量計費。
提供哪些SDK?
官方維護JavaScript、Python、.NET、Go和Java等SDK,並提供Voice Agent相關的瀏覽器套件。Rust SDK則屬於社群專案。
Deepgram是開源的嗎?
產品和模型不開源。多個官方SDK使用MIT許可證,只代表客戶端接入代碼開放。
總結
Deepgram適合那些需要進行生產級即時語音辨識、對話式語音合成以及開發Voice Agent的開發團隊;此外,它還能透過區域端點及自托管服務,滿足企業在數據處理和部署方面的需求。Nova-3則適合用於一般的轉錄工作,而Flux則更適合需要處理輪流對話及中斷情況的即時對話應用。
上線前應同時驗證準確率、延遲、併發、聲道、附加功能以及促銷結束後的標準成本。SDK開源降低了接入門檻,但模型、雲服務與自托管容器仍是商業產品。
桂公網安備45132202000164號