Deepgram
免費增值
AI工具大全 AI音頻工具

Deepgram

Deepgram,專注於AI音頻的智能工具

標籤:

一句話介紹

Deepgram是一套面向開發者與企業的語音AI平台,透過API提供即時與批量語音識別、對話式語音合成、完整的Voice Agent編排以及音頻理解功能,並支援託管雲端、專用環境與本地部署。

工具簡介

Deepgram圍繞真實語音應用,提供從聽取、思考到說話的完整功能。開發者可以單獨使用語音轉文字或文字轉語音的功能,或者透過WebSocket連接,打造能夠處理中斷、輪流發言以及各種工具調用的即時語音智能體。

目前的核心模型包括用於一般轉錄的Nova-3、用於對話輪次的Flux STT、對話式的Flux TTS以及Aura系列語音合成技術。這些產品與模型均屬於商業服務,雖然官方提供了開源的SDK,但並不意味著模型的權重或平台的原始代碼也會被公開。

產品能力概覽

產品主要輸入主要輸出典型用途
Speech-to-Text實時流或錄音檔案帶時間、說話人和置信度的文本轉錄、字幕與分析
Text-to-Speech文本與對話上下文流式合成語音客服、助手與電話機器人
Voice Agent API雙向實時音頻與配置可中斷的語音對話客戶服務、預約與外呼
Audio Intelligence音頻轉錄或文本摘要、主題、情緒與意圖檢質、洞察和路由
Self-Hosted企業GPU基礎設施私有語音推理端點數據駐留與低延遲
Playground麥克風、檔案或文字模型試用結果原型驗證與參數比較

語音識別模型

Nova-3

Nova-3是目前推薦的通用型生產級語音識別模型,可用於即時串流及預錄音檔。它支援多種語言、自動語言檢測、雜訊處理以及遠場音頻的處理,此外還能透過關鍵字提示來提升對品牌、產品及行業術語的識別能力。

Flux STT

Flux STT專為即時語音客服設計,不僅能識別文字,還將輪次結束檢測及可配置的對話節奏整合至模型中。英文版與多語言版分別計費,多語言版可透過語言提示來影響識別結果。

Nova-3 Medical與訂製模型

Nova-3提供了針對醫療詞彙的選項,企業亦可聯繫銷售人員,訓練適用於專有或特殊數據的Custom模型。專業模型仍需以真實的口音、設備、場景及詞彙集來評估,不能僅依賴通用標準。

Whisper Cloud與舊模型

Deepgram仍提供托管Whisper Large的服務,同時也保留Nova-2、Enhanced和Base版本,供現有系統使用。對於新專案而言,建議先比較Nova-3與Flux,以避免因歷史相容性問題而被迫選擇擴展性較低的Whisper。

語音識別功能

  • Streaming用於電話、會議和Voice Agent的即時增量轉錄。
  • Pre-Recorded用於上傳錄音,並以異步或同步方式產生完整文本。
  • Speaker Diarization識別多人並標註每段由誰說出。
  • Smart Formatting自動處理標點、大小寫、日期和貨幣。
  • 關鍵字提示可增強產品名、縮寫及專業術語的識別能力。
  • Redaction用於識別並移除部分個人敏感資訊。
  • 實體檢測可提取人物、組織、地點和日期等實體。
  • Automatic Language Detection輔助處理語言未知或切換場景。

文字轉語音語音合成

Flux TTS

Flux TTS是一種針對即時語音智能體的流式、對話型模型,它能透過跨輪上下文來保持語氣、節奏和情緒的連續性。它還能回傳用戶在被打斷之前所聽到的文字,並且可以在不中斷對話的情況下調整語速和風格。

Aura-2

Aura-2專為專業、大規模且低延遲的語音合成而設計,可用於客戶服務、通知及對話應用。現有的Aura-2模型不會因Flux TTS的推出而被迫轉換。

Aura-1

Aura-1仍作為成本較低的语音合成選項提供。選擇時應同時比較語言、聲音、延遲、結構化內容發音以及部署區域,而非僅比較每千字元的單價。

對話式語音控制

Deepgram目前將語音合成設計為對話架構的一部分,能夠追蹤狀態、輪次邊界以及中斷情況。對於那些有嚴格的品牌聲音或聲音克隆需求的專案,應先確認現有模型是否具備相應的機能與授權能力。

Voice Agent API

Voice Agent API將語音辨識、LLM編排以及語音合成整合在單一實時連線中,從而減少開發者需要整合多個服務的繁瑣工作。使用者也可以自行攜帶LLM或TTS,僅使用Deepgram的其他語音與編排功能。

  • 內建Barge-in檢測,讓用戶可以自然打斷智能體。
  • 輪流說話預測幫助系統判斷何時聽、思考和說話。
  • 函數呼叫允許在對話中查詢業務系統或執行工具。
  • Mid-session control可在會話中調整配置和行為。
  • 可重複使用的設定能夠方便地重複運用智能體的設定。
  • 多代理架構支援專用智能體之間交接。
  • 電話功能用於接入呼入及呼出電話網路。
  • Browser Agent SDK可把即時語音能力嵌入Web應用。

Audio Intelligence

音頻智慧技術用於在轉錄的基礎上,產生摘要、主題、情緒和意圖等結構化結果。部分功能會根據輸入和輸出的 Token 數量另行收費,因此不能將其視為語音識別服務中已包含的所有功能。

能力結果適合場景主要風險
Summarization對話摘要客服紀要、會議回顧可能遺漏限定條件
Topic Detection主題標籤內容歸類與路由多主題邊界不穩定
Sentiment Analysis情緒傾向服務品質檢測與趨勢語境、文化與諷刺偏差
Intent Recognition用戶意圖自動分流與後續動作錯誤意圖可能觸發錯誤流程
Entity Detection人物、組織、地點和日期CRM錄入與檢索實體拼寫需複核
Redaction移除部分敏感文字隱私與合規處理不能替代完整數據防泄漏

完整接入流程

  1. 創建Deepgram帳戶和Project,領取免費信用額度。
  2. 生成只具備必要權限的API Key,並存入安全的服務端配置。
  3. 根據即時對話或錄音處理選擇Streaming或Pre-Recorded。
  4. 選擇Nova-3、Flux或其他適合語言和場景的模型。
  5. 設定音頻編碼、採樣率、語言、說話人以及格式化參數。
  6. 使用真實設備、雜訊、口音及專業術語來執行基準測試。
  7. 處理結果中的臨時段、最終段、錯誤、超時和重連。
  8. 記錄音頻時長、字數、附加功能及併發量以監控成本。
  9. 上線前配置隱私、保留、區域、配額和故障降級策略。

實時轉錄教學

  1. 從瀏覽器、電話或音訊設備取得穩定的單聲道或多聲道音訊。
  2. 建立WebSocket連接並在服務端完成短期或長期憑證認證。
  3. 聲明正確的編碼、採樣率及聲道數,避免音頻被錯誤解釋。
  4. 使用Nova-3處理通用轉錄,或用Flux處理對話輪次。
  5. 按需求啟用Smart Formatting、Diarization和Keyterm。
  6. 將中間結果用於即時介面,最終結果用於持久化與業務動作。
  7. 為斷網、靜音、長停頓、重連和重複片段建立狀態機。
  8. 用人工標註集計算詞錯率、實體準確率和端到端延遲。

構建Voice Agent教學

  1. 定義智能體任務、允許執行的動作以及必須轉交給人工處理的條件。
  2. 配置Flux或Nova語音識別、LLM供應商和TTS聲音。
  3. 編寫系統提示,限制身份、業務範圍和不可承諾事項。
  4. 實現函數調用,並在服務端驗證參數、權限和幀等性。
  5. 測試用戶打斷、沉默、重複、背景聲和同時說話。
  6. 記錄用戶實際聽到的內容,避免打斷後業務狀態不一致。
  7. 為敏感操作增加身分驗證、確認步驟和人工接管。
  8. 監控每通時長、延遲、轉人工率、任務成功率及成本。

生產品質評估

  1. 準備覆蓋主要語言、口音、設備、雜訊和業務術語的測試集。
  2. 由人工製作可靠參考轉錄,並固定評分規則。
  3. 分別測試實時與批次模式,不混合比較延遲和準確率。
  4. 比較Nova-3單語、多語、Flux和現有供應商。
  5. 對數字、人名、地址、藥品和賬號等關鍵實體單獨計分。
  6. 計算詞錯率之外的輪次判斷、首字延遲和最終延遲。
  7. 估算多聲道、附加功能、Audio Intelligence和重試成本。
  8. 只有在業務閾值達標後才擴大流量。

適合哪些用戶

  • Voice Agent開發團隊:構建低延遲、可中斷的即時語音助手。
  • 呼叫中心平台:轉錄電話、總結通話並識別意圖。
  • 會議與字幕產品:生成即時字幕、說話人與章節。
  • 醫療與金融企業:透過企業合約使用合規與私有部署。
  • 媒體與播客平台:批量轉錄、搜尋和理解錄音。
  • 銷售與客服團隊:將語音數據轉換為CRM及品質檢查資訊。
  • 平台工程團隊:使用SDK、區域端點及自託管方式進行整合。

典型使用場景

場景推薦能力關鍵指標風險控制
即時客服機器人Flux STT加Flux TTS或Voice Agent打斷、延遲、解決率轉人工與身分驗證
會議字幕Nova-3 Streaming加語音分割詞錯率與說話人準確率參會者同意
錄音歸檔Nova-3 Pre-Recorded吞吐、成本和檢索率保留與訪問控制
醫療記錄Nova-3 Medical加Redaction術語與關鍵實體BAA和人工審核
電話品質檢測STT加音頻智慧摘要、情緒和意圖避免只憑情緒評分處罰
語音通知Aura-2或Aura-1發音、延遲和成本品牌與無障礙檢查
本地語音平台Self-Hosted數據駐留和容量GPU、升級和許可運維

價格計劃

以下價格是根據2026年8月22日的官方頁面所確認的。在語音識別服務的價格中,有部分是限時優惠;Flux TTS以及使用Flux TTS的Voice Agent相關優惠,將在2026年9月12日結束,因此在上線之前必須再次查看價格。

計劃價格或門檻主要權益預設規模適合用戶
Free Credit新帳戶200美元無需信用卡,信用額無固定到期日使用公共模型原型與評估
Pay As You Go按實際用量無最低承諾STT流式最高150併發開發者與創業團隊
Growth每年4000美元起預付最高約20%折扣與更高併發STT流式最高225並發增長中的生產應用
Enterprise聯絡銷售大規模、訂製模型、私有部署與支援訂製併發與SLA大型或受監管企業

語音轉文字價格

Streaming實時語音識別

模型Pay As You GoGrowth計費單位備註
Flux English當前0.0065美元當前0.0057美元每分鐘流式促銷價
Flux Multilingual0.0078美元0.0068美元每分鐘支援對話多語言
Nova-3 Monolingual當前0.0048美元當前0.0042美元每分鐘流式促銷價
Nova-3 Multilingual當前0.0058美元當前0.0050美元每分鐘流式促銷價
Custom聯絡銷售聯絡銷售合同專有或特殊數據

預錄音錄音識別

模型Pay As You GoGrowth計費單位適合任務
Nova-3 Monolingual0.0043美元0.0036美元每分鐘單語錄音
Nova-3 Multilingual0.0052美元0.0043美元每分鐘多語言錄音
Whisper Large0.0048美元0.0048美元每分鐘相容特定Whisper流程
Custom聯絡銷售聯絡銷售合同訂製模型

語音轉文字附加功能

功能Pay As You GoGrowth實時或錄音備註
Redaction0.0020美元每分鐘0.0017美元每分鐘兩者移除部分敏感資訊
Keyterm Prompting0.0013美元每分鐘0.0012美元每分鐘兩者增強關鍵術語
Smart Formatting包含包含兩者標點與格式
Entity Detection0.0017美元每分鐘0.0017美元每分鐘兩者提取實體
Speaker Diarization實時0.0020美元每分鐘以頁面為準實時錄音模式目前包含
Speaker Diarization包含包含錄音多人標註

文字轉語音價格

Flux TTS在2026年9月12日前限時免費,2026年9月13日起恢復標準字符計費。免費期不是永久免費計劃。

模型Pay As You GoGrowth計費單位價格狀態
Flux TTS9月12日前免費,之後0.0450美元9月12日前免費,之後0.0405美元每1000字元限時活動
Aura-20.030美元0.027美元每1000字元當前標準價
Aura-10.0150美元0.0135美元每1000字元當前標準價

Voice Agent API價格

Voice Agent是根據對話的持續時間來計費的,同時還會根據是否使用Deepgram所提供的LLM和TTS技術,來區分不同的等級。以下為Flux TTS免費活動期間的現行價格,以及活動結束後的標準價格。

層級Pay As You Go當前價格活動後價格Growth當前價適合配置
Standard0.056美元每分鐘0.075美元每分鐘0.051美元每分鐘使用完整預設語音堆疊
Standard BYO TTS0.065美元每分鐘同當前0.051美元每分鐘自帶語音合成
Custom BYO LLM0.050美元每分鐘0.065美元每分鐘0.041美元每分鐘自帶語言模型
自訂 BYO LLM加TTS0.050美元每分鐘同當前0.041美元每分鐘自帶語言模型和語音合成
Advanced0.122美元每分鐘0.163美元每分鐘0.110美元每分鐘更高級LLM層級
Advanced BYO TTS0.122美元每分鐘同當前0.110美元每分鐘高級LLM並自帶TTS

計費規則與成本陷阱

  • 語音識別按實際秒數計費,不向上取整到固定分鐘。
  • 多聲道按各聲道總處理時長計費,10分鐘雙聲道按20分鐘計算。
  • Redaction、Keyterm、Entity以及部分Diarization需要額外費用。
  • Audio Intelligence是依據輸入和輸出的Token來計費的,不包含在STT的單價之中。
  • Growth超出信用額度按原Growth費率加10%並按週結算。
  • Growth若要啟用超額用量,需保留有效信用卡,否則額度耗盡會中斷請求。
  • 併發限制以專案為單位,共用同一池的多個API Key不會增加容量。
  • 創建額外Project繞過速率限制違反服務條款。
  • 促銷和限時免費結束後,單位成本可能自動變化。

速率限制

服務Pay As You Go預設限制Growth公開限制說明
Voice Agent最高45個併發連接最高60個併發連接按Project計算
Flux STT Streaming最高150個併發請求計劃頁顯示最高225區域文件需再次確認
Nova-3 Pre-Recorded最高50個並發請求公開計劃為50批次任務
Nova-3 Streaming最高150個併發請求最高225實時轉錄
Speaker Diarization Streaming北美最高50,歐澳最高25按協議低於普通流式限制
Text-to-Speech REST每模型最高15個並發請求計劃總覽給出更高整體規模模型與區域限制優先
Audio Intelligence最高10個併發請求最高10附加分析

部署方式

方式運行位置運維責任數據與適用場景
HostedDeepgram多租戶雲Deepgram負責基礎設施和更新最快開始開發
區域雲端北美、歐洲或澳大利亞端點Deepgram負責區域處理和數據駐留
Dedicated或VPC專用客戶雲環境按企業協議隔離與訂製容量
Self-Hosted客戶VPC或資料中心客戶負責基礎設施、備份和更新嚴格隱私與低延遲
Amazon SageMaker客戶AWS VPCAWS託管端點與客戶配置透過Marketplace部署模型

Self-Hosted要求

本地部署支援Docker、Podman、Kubernetes、裸機以及部分雲端平台,僅支援Linux x86-64或amd64架構,以及NVIDIA GPU。Nova與Aura的支援範圍較廣,而Flux模型則對GPU的世代及記憶體有更高的要求。

  • STT Engine通常至少需要1張16GB顯存的NVIDIA GPU、4核CPU和32GB記憶體。
  • Aura類TTS Engine需要正好2張專用GPU、8核CPU和64GB記憶體。
  • Flux TTS使用單GPU,但載入時可佔用約60GB系統記憶體。
  • 自託管容器仍需許可與用量報告連接,除SageMaker隔離方案外並非自動完全離線。
  • 客戶負責監控、容量、備份、更新、代理和TLS終止。
  • Docker、Podman或Kubernetes的自托管功能,通常需要企業版授權才能使用。

隱私、安全與模型改進

Deepgram將企業的客戶資料之保存、儲存及刪除等相關事宜,交由商業協議來規定。根據自托管的說明,典型的自托管請求中所包含的音頻、轉錄內容以及其他識別資料,都不會被傳送給Deepgram,而只會上報時長、字數、功能以及成功狀態等用量相關的元數據而已。

Pay As You Go和Growth客戶可以選擇加入或退出Model Improvement Program,2026年3月起退出不會影響官網列示的費率。在處理真實個人數據之前,仍應確認控制台選項、地區、保留期以及數據處理協議。

  • Deepgram公開SOC 2 Type I與Type II認證資訊。
  • Enterprise醫療客戶可簽署BAA以處理電子受保護健康資訊。
  • 歐洲區域端點用於滿足歐盟內的處理及資料存放需求。
  • API Key應僅保存在服務端,並按項目、環境和最小權限拆分。
  • 編輯只能降低部分暴露風險,不能代替源頭數據最小化。
  • 日誌中避免記錄原始音頻、完整轉錄和長期有效金鑰。
  • 高風險Voice Agent必須提供告知、錄音同意、人工接管和審計。

SDK、GitHub與開源狀態

Deepgram在官方GitHub組織中維護JavaScript、Python、.NET、Go和Java等SDK,並提供Voice Agent瀏覽器相關套件。JavaScript SDK的現行文件將v5列為當前主版本,進行專案遷移時應參考對應的升級說明。

多個官方 SDK 使用 MIT 授權條款,開發人員可以查看、修改和散布這些用戶端程式碼。不過,Deepgram 雲端平台、其商業模式、模型權重以及自托管的容器則並非開源產品。

項目維護方狀態許可證或說明
JavaScript與TypeScript SDKDeepgram官方公開MIT,當前主線v5
Python SDKDeepgram官方公開以倉庫許可證為準
.NET SDKDeepgram官方公開MIT
Go SDKDeepgram官方公開MIT
Java SDKDeepgram官方公開MIT
Rust SDK社區公開不是同等官方支持級別
Voice Agent SDKDeepgram官方公開MIT
模型權重與雲平台Deepgram未開源商業產品

支援語言與平台

能力語言或平台公開狀態注意事項
Nova語音識別45種以上語言支持具體功能隨模型和語言變化
Nova-3 Multilingual50種以上語言的產品描述支持自動語言檢測
Flux STT Multilingual10種語言支持面向即時對話
Flux TTS當前英文聲音支持更多語言仍在規劃
雲端API服務端與WebSocket支持區域端點不同
Self-HostedLinux x86-64與NVIDIA GPU企業支持硬體要求按模型變化
行動端SDK無獨立消費者App透過後端或Web整合密鑰不可放進用戶端

產品優勢

  • 從STT、TTS到Voice Agent,提供一套連貫的語音堆疊。
  • Flux將輪次結束和打斷反饋放入對話模型,減少外部拼接。
  • Nova-3涵蓋即時與批次轉錄,並提供多語言和術語增強。
  • 按秒計費避免固定分鐘向上取整帶來的浪費。
  • 提供免費200美元信用額度,適合完成真實數據評估。
  • 託管、區域、VPC、本地及SageMaker部署選項較完整。
  • 官方SDK覆蓋多種主流服務端語言並公開源代碼。
  • 企業安全、醫療協議和歐盟數據駐留選項較明確。

使用限制與注意事項

  • 模型準確率會受語言、口音、雜訊、設備、遠場和重疊說話影響。
  • 促銷價和限時免費有明確結束日期,長期成本需按標準價估算。
  • 多聲道按各聲道時長累加,容易低估費用。
  • 部分轉錄增強功能與Audio Intelligence需要額外計費。
  • 預設的並發數量以專案為限,無法透過建立更多專案來規避。
  • Voice Agent執行外部動作時必須驗證權限、參數和用戶確認。
  • 情緒和意圖模型可能產生偏差,不能作為唯一決策依據。
  • 自託管需要GPU、Linux、容器運維、許可連接及企業合約。
  • 官方SDK開源並不代表語音模型或平台可以免費私有部署。
  • 重要醫療、法律、金融和身分資訊仍需人工核複。

基本資訊

字段內容
工具名稱Deepgram
開發公司Deepgram, Inc.
工具類型語音識別、語音合成與Voice Agent平台
主要模型Nova-3、Flux STT、Flux TTS、Aura-2和Aura-1
主要介面REST API與WebSocket API
免費額度新帳戶200美元信用額度
價格模式按量、Growth年度預付和Enterprise訂製
成長門檻每年4000美元起
主要部署Hosted、區域雲、VPC、Self-Hosted和SageMaker
中文支援Nova系列支援,具體能力需查看模型語言表
是否需要註冊是
是否提供API是
官方SDKJavaScript、Python、.NET、Go、Java等
官方GitHub有
SDK是否開源是,多個官方SDK採用MIT
產品是否開源否

推薦指數

推薦指數為4.7分,滿分5分。Deepgram涵蓋從即時轉錄到對話式TTS以及完整的Voice Agent製作流程,其模型、文件、SDK、區域及本地部署的選項都相當完整。

選擇難點在於產品線和計費維度較多,促銷結束、聲道、附加功能以及併發數量都可能改變總成本。最穩妥的方法是使用200美元的信用額度來測試實際負載情況,再根據標準價格來估算生產預算。

常見問題

Deepgram免費嗎?

新帳戶可獲得200美元的免費信貸額度,無需信用卡,且官網表示沒有固定的到期日。額度用完後將根據實際使用量來計算費用。

Deepgram語音識別多少錢?

目前,Nova-3的單語即時播報服務價格為每分鐘0.0048美元,而預錄音檔的價格則為每分鐘0.0043美元。多語言服務、Flux功能以及各種附加功能的價格則有所不同。

Flux TTS永久免費嗎?

不是。Flux TTS只在2026年9月12日前限時免費,9月13日起Pay As You Go的標準價格為每1000字元0.0450美元。

Voice Agent API如何收費?

按對話分鐘數以及所選的LLM、TTS組合來計費。目前,Standard方案的價格為每分鐘0.056美元,而活動結束後則為0.075美元。

支援中文嗎?

Nova系列支援中文等多種語言,但具體的識別功能、模型選項及地區可用性需以最新的語言列表為準。中文項目仍應測試口音、夾雜英文及專業詞彙的情況。

可以本地部署嗎?

可以,Enterprise客戶可以在VPC、裸機或容器平台上自行管理,亦可透過Amazon SageMaker來部署。硬體方面,通常需要Linux作業系統以及NVIDIA GPU。

Deepgram會保存音頻嗎?

雲端中的客戶資料之保留與刪除,是依照商業協議來執行的。一般的自托管請求不會將音訊或轉錄內容傳送給 Deepgram,但會傳回使用量相關的元資料。

可以退出模型改進計劃嗎?

可以,Pay As You Go和Growth客戶可以選擇加入或退出,2026年3月起退出不會影響官網列示的價格。

多聲道如何計費?

按所有聲道的總處理時長計算。10分鐘的雙聲道音頻會按20分鐘的處理量計費。

提供哪些SDK?

官方維護JavaScript、Python、.NET、Go和Java等SDK,並提供Voice Agent相關的瀏覽器套件。Rust SDK則屬於社群專案。

Deepgram是開源的嗎?

產品和模型不開源。多個官方SDK使用MIT許可證,只代表客戶端接入代碼開放。

總結

Deepgram適合那些需要進行生產級即時語音辨識、對話式語音合成以及開發Voice Agent的開發團隊;此外,它還能透過區域端點及自托管服務,滿足企業在數據處理和部署方面的需求。Nova-3則適合用於一般的轉錄工作,而Flux則更適合需要處理輪流對話及中斷情況的即時對話應用。

上線前應同時驗證準確率、延遲、併發、聲道、附加功能以及促銷結束後的標準成本。SDK開源降低了接入門檻,但模型、雲服務與自托管容器仍是商業產品。

©️版權聲明:若無特殊說明,本站所有文章版權均歸AI工具分享本網站的內容為原創作品,任何人或機構在未獲許可的情況下,都不得轉載、抄襲或以其他方式複製並發表本網站的內容,亦不得在非本網站所屬的伺服器上建立其鏡像版本。否則,本網站將依法追究相關責任人的法律責任。

類似於Deepgram的工具