Deepgram
免费增值
AI工具大全 AI音频工具

Deepgram

Deepgram,专注于AI 音频的智能工具

标签:

一句话介绍

Deepgram是一套面向开发者和企业的语音AI平台,通过API提供实时与批量语音识别、对话式语音合成、完整Voice Agent编排和音频理解,并支持托管云、专用环境与本地部署。

工具简介

Deepgram围绕真实语音应用提供从Listen到Think再到Speak的完整能力。开发者既可单独调用Speech-to-Text或Text-to-Speech,也可通过一个WebSocket连接构建能处理打断、轮次和工具调用的实时语音智能体。

当前核心模型包括面向通用转录的Nova-3、面向对话轮次的Flux STT、对话式Flux TTS和Aura系列语音合成。产品与模型是商业服务,官方SDK开源不代表模型权重或平台源码开放。

产品能力概览

产品主要输入主要输出典型用途
Speech-to-Text实时流或录音文件带时间、说话人和置信度的文本转录、字幕与分析
Text-to-Speech文本与对话上下文流式合成语音客服、助手与电话机器人
Voice Agent API双向实时音频与配置可打断的语音对话客户服务、预约与外呼
Audio Intelligence音频转录或文本摘要、主题、情绪与意图质检、洞察和路由
Self-Hosted企业GPU基础设施私有语音推理端点数据驻留与低延迟
Playground麦克风、文件或文本模型试用结果原型验证与参数比较

语音识别模型

Nova-3

Nova-3是当前推荐的通用生产级语音识别模型,可用于实时流和预录音频。它支持多语言、自动语言检测、噪声与远场音频,并可通过Keyterm Prompting提高品牌、产品和行业术语识别。

Flux STT

Flux STT专门面向实时Voice Agent,不只识别文字,还把轮次结束检测和可配置对话节奏整合到模型中。英文版与多语言版分别计费,多语言版可使用语言提示影响识别。

Nova-3 Medical与定制模型

Nova-3提供面向医疗词汇的选项,企业还可联系销售训练适应专有或特殊数据的Custom模型。专业模型仍需用真实口音、设备、场景和词汇集评估,不能只看通用基准。

Whisper Cloud与旧模型

Deepgram仍提供托管Whisper Large,也保留Nova-2、Enhanced和Base用于既有部署。新项目通常应先比较Nova-3与Flux,避免因为历史兼容而默认采用扩展性较低的Whisper。

语音识别功能

  • Streaming用于电话、会议和Voice Agent的实时增量转录。
  • Pre-Recorded用于上传录音并异步或同步生成完整文本。
  • Speaker Diarization识别多人并标注每段由谁说出。
  • Smart Formatting自动处理标点、大小写、日期和货币。
  • Keyterm Prompting增强产品名、缩写和专业术语识别。
  • Redaction用于识别并移除部分个人敏感信息。
  • Entity Detection提取人物、组织、地点和日期等实体。
  • Automatic Language Detection辅助处理语言未知或切换场景。

Text-to-Speech语音合成

Flux TTS

Flux TTS是面向实时语音智能体的流式、对话原生模型,会利用跨轮上下文保持语气、节奏和情绪连续。它可以反馈打断前用户实际听到的文字,并支持在不中断会话的情况下调整速度和风格。

Aura-2

Aura-2面向专业、大规模和低延迟语音合成,可用于客服、通知和对话应用。现有Aura-2模型不会因Flux TTS发布而被强制迁移。

Aura-1

Aura-1仍作为成本较低的语音合成选项提供。选择时应同时比较语言、声音、延迟、结构化内容发音和部署区域,而不只比较每千字符单价。

对话式语音控制

Deepgram当前把语音合成设计为对话架构的一部分,可跟踪状态、轮次边界和打断。对于有严格品牌声音或声音克隆需求的项目,应先核对当前模型和授权能力。

Voice Agent API

Voice Agent API把语音识别、LLM编排和语音合成放在一个实时连接中,减少开发者拼接多个服务的工作。用户也可以自带LLM或TTS,并只使用Deepgram的其他语音与编排能力。

  • 内置Barge-in检测,让用户可以自然打断智能体。
  • Turn-taking prediction帮助系统判断何时听、思考和说话。
  • Function Calling允许对话中查询业务系统或执行工具。
  • Mid-session control可在会话中调整配置和行为。
  • Reusable Configurations便于复用智能体设置。
  • Multi-Agent Architecture支持专用智能体之间交接。
  • Telephony能力用于接入呼入和呼出电话网络。
  • Browser Agent SDK可把实时语音能力嵌入Web应用。

Audio Intelligence

Audio Intelligence用于在转录基础上生成摘要、主题、情绪和意图等结构化结果。部分能力按输入和输出Token另行收费,不能把它们理解为语音识别价格中全部免费包含。

能力结果适合场景主要风险
Summarization对话摘要客服纪要、会议回顾可能遗漏限定条件
Topic Detection主题标签内容归类与路由多主题边界不稳定
Sentiment Analysis情绪倾向服务质检与趋势语境、文化和讽刺偏差
Intent Recognition用户意图自动分流与后续动作错误意图可能触发错误流程
Entity Detection人物、组织、地点和日期CRM录入与检索实体拼写需复核
Redaction移除部分敏感文字隐私与合规处理不能替代完整数据防泄漏

完整接入流程

  1. 创建Deepgram账户和Project,领取免费信用额度。
  2. 生成只具备必要权限的API Key,并存入安全的服务端配置。
  3. 根据实时对话或录音处理选择Streaming或Pre-Recorded。
  4. 选择Nova-3、Flux或其他适合语言和场景的模型。
  5. 设置音频编码、采样率、语言、说话人和格式化参数。
  6. 用真实设备、噪声、口音和专业词汇运行基准测试。
  7. 处理结果中的临时段、最终段、错误、超时和重连。
  8. 记录音频时长、字符数、附加功能和并发以监控成本。
  9. 上线前配置隐私、保留、区域、配额和故障降级策略。

实时转录教程

  1. 从浏览器、电话或音频设备取得稳定的单声道或多声道音频。
  2. 建立WebSocket连接并在服务端完成短期或长期凭据认证。
  3. 声明正确的编码、采样率和声道数,避免音频被错误解释。
  4. 使用Nova-3处理通用转录,或用Flux处理对话轮次。
  5. 按需求启用Smart Formatting、Diarization和Keyterm。
  6. 把中间结果用于实时界面,最终结果用于持久化和业务动作。
  7. 为断网、静音、长停顿、重连和重复片段建立状态机。
  8. 用人工标注集计算词错率、实体准确率和端到端延迟。

构建Voice Agent教程

  1. 定义智能体任务、允许执行的动作和必须转人工的条件。
  2. 配置Flux或Nova语音识别、LLM提供商和TTS声音。
  3. 编写系统提示,限制身份、业务范围和不可承诺事项。
  4. 实现函数调用,并在服务端验证参数、权限和幂等性。
  5. 测试用户打断、沉默、重复、背景声和同时说话。
  6. 记录用户实际听到的内容,避免打断后业务状态不一致。
  7. 为敏感操作增加身份验证、确认步骤和人工接管。
  8. 监控每通时长、延迟、转人工率、任务成功率和成本。

生产质量评估

  1. 准备覆盖主要语言、口音、设备、噪声和业务术语的测试集。
  2. 由人工制作可靠参考转录,并固定评分规则。
  3. 分别测试实时与批量模式,不混合比较延迟和准确率。
  4. 比较Nova-3单语、多语、Flux和现有供应商。
  5. 对数字、人名、地址、药品和账号等关键实体单独计分。
  6. 计算词错率之外的轮次判断、首字延迟和最终延迟。
  7. 估算多声道、附加功能、Audio Intelligence和重试成本。
  8. 只有在业务阈值达标后才扩大流量。

适合哪些用户

  • Voice Agent开发团队:构建低延迟、可打断的实时语音助手。
  • 呼叫中心平台:转录电话、总结通话并识别意图。
  • 会议与字幕产品:生成实时字幕、说话人和章节。
  • 医疗与金融企业:通过企业合同使用合规与私有部署。
  • 媒体与播客平台:批量转录、搜索和理解录音。
  • 销售与客服团队:把语音数据转成CRM和质检信息。
  • 平台工程团队:使用SDK、区域端点和自托管方式集成。

典型使用场景

场景推荐能力关键指标风险控制
实时客服机器人Flux STT加Flux TTS或Voice Agent打断、延迟、解决率转人工与身份验证
会议字幕Nova-3 Streaming加Diarization词错率和说话人准确率参会者同意
录音归档Nova-3 Pre-Recorded吞吐、成本和检索率保留与访问控制
医疗记录Nova-3 Medical加Redaction术语与关键实体BAA和人工审核
电话质检STT加Audio Intelligence摘要、情绪和意图避免只凭情绪评分处罚
语音通知Aura-2或Aura-1发音、延迟和成本品牌与无障碍检查
本地语音平台Self-Hosted数据驻留和容量GPU、升级和许可运维

价格计划

以下价格按2026年8月22日官方页面核验。语音识别流式价格中部分为限时促销,Flux TTS和Voice Agent使用Flux TTS的优惠将在2026年9月12日结束,因此上线前必须重新查看价格。

计划价格或门槛主要权益默认规模适合用户
Free Credit新账户200美元无需信用卡,信用额无固定到期日使用公共模型原型与评估
Pay As You Go按实际用量无最低承诺STT流式最高150并发开发者与初创团队
Growth每年4000美元起预付最高约20%折扣与更高并发STT流式最高225并发增长中的生产应用
Enterprise联系销售大规模、定制模型、私有部署和支持定制并发与SLA大型或受监管企业

Speech-to-Text价格

Streaming实时语音识别

模型Pay As You GoGrowth计费单位备注
Flux English当前0.0065美元当前0.0057美元每分钟流式促销价
Flux Multilingual0.0078美元0.0068美元每分钟支持对话多语言
Nova-3 Monolingual当前0.0048美元当前0.0042美元每分钟流式促销价
Nova-3 Multilingual当前0.0058美元当前0.0050美元每分钟流式促销价
Custom联系销售联系销售合同专有或特殊数据

Pre-Recorded录音识别

模型Pay As You GoGrowth计费单位适合任务
Nova-3 Monolingual0.0043美元0.0036美元每分钟单语录音
Nova-3 Multilingual0.0052美元0.0043美元每分钟多语言录音
Whisper Large0.0048美元0.0048美元每分钟兼容特定Whisper流程
Custom联系销售联系销售合同定制模型

Speech-to-Text附加功能

功能Pay As You GoGrowth实时或录音备注
Redaction0.0020美元每分钟0.0017美元每分钟两者移除部分敏感信息
Keyterm Prompting0.0013美元每分钟0.0012美元每分钟两者增强关键术语
Smart Formatting包含包含两者标点与格式
Entity Detection0.0017美元每分钟0.0017美元每分钟两者提取实体
Speaker Diarization实时0.0020美元每分钟以页面为准实时录音模式当前包含
Speaker Diarization包含包含录音多人标注

Text-to-Speech价格

Flux TTS在2026年9月12日前限时免费,2026年9月13日起恢复标准字符计费。免费期不是永久免费计划。

模型Pay As You GoGrowth计费单位价格状态
Flux TTS9月12日前免费,之后0.0450美元9月12日前免费,之后0.0405美元每1000字符限时活动
Aura-20.030美元0.027美元每1000字符当前标准价
Aura-10.0150美元0.0135美元每1000字符当前标准价

Voice Agent API价格

Voice Agent按对话时长计费,并根据是否使用Deepgram提供的LLM与TTS区分层级。以下为Flux TTS免费活动期间的当前价格和活动结束后的标准价格。

层级Pay As You Go当前价活动后价格Growth当前价适合配置
Standard0.056美元每分钟0.075美元每分钟0.051美元每分钟使用完整默认语音栈
Standard BYO TTS0.065美元每分钟同当前0.051美元每分钟自带语音合成
Custom BYO LLM0.050美元每分钟0.065美元每分钟0.041美元每分钟自带语言模型
Custom BYO LLM加TTS0.050美元每分钟同当前0.041美元每分钟自带语言模型和语音合成
Advanced0.122美元每分钟0.163美元每分钟0.110美元每分钟更高级LLM层级
Advanced BYO TTS0.122美元每分钟同当前0.110美元每分钟高级LLM并自带TTS

计费规则与成本陷阱

  • 语音识别按真实秒数计费,不向上取整到固定分钟。
  • 多声道按各声道总处理时长计费,10分钟双声道按20分钟计算。
  • Redaction、Keyterm、Entity和部分Diarization需要附加费用。
  • Audio Intelligence按输入和输出Token计费,不含在STT单价内。
  • Growth超出信用额度按原Growth费率加10%并按周结算。
  • Growth要启用超额用量需保留有效信用卡,否则额度耗尽会中断请求。
  • 并发限制以Project为单位,共用同一池的多个API Key不会增加容量。
  • 创建额外Project绕过速率限制违反服务条款。
  • 促销和限时免费结束后,单位成本可能自动变化。

速率限制

服务Pay As You Go默认限制Growth公开限制说明
Voice Agent最高45个并发连接最高60个并发连接按Project计算
Flux STT Streaming最高150个并发请求计划页显示最高225区域文档需再次确认
Nova-3 Pre-Recorded最高50个并发请求公开计划为50批量任务
Nova-3 Streaming最高150个并发请求最高225实时转录
Speaker Diarization Streaming北美最高50,欧澳最高25按协议低于普通流式限制
Text-to-Speech REST每模型最高15个并发请求计划总览给出更高总体规模模型与区域限制优先
Audio Intelligence最高10个并发请求最高10附加分析

部署方式

方式运行位置运维责任数据与适用场景
HostedDeepgram多租户云Deepgram负责基础设施和更新最快开始开发
区域云端北美、欧洲或澳大利亚端点Deepgram负责区域处理和数据驻留
Dedicated或VPC专用客户云环境按企业协议隔离与定制容量
Self-Hosted客户VPC或数据中心客户负责基础设施、备份和更新严格隐私与低延迟
Amazon SageMaker客户AWS VPCAWS托管端点与客户配置通过Marketplace部署模型

Self-Hosted要求

本地部署支持Docker、Podman、Kubernetes、裸金属和部分云平台,只支持Linux x86-64或amd64及NVIDIA GPU。Nova与Aura支持范围较广,Flux模型对GPU代际和内存要求更高。

  • STT Engine通常至少需要1张16GB显存的NVIDIA GPU、4核CPU和32GB内存。
  • Aura类TTS Engine需要正好2张专用GPU、8核CPU和64GB内存。
  • Flux TTS使用单GPU但加载时可占用约60GB系统内存。
  • 自托管容器仍需许可与用量报告连接,除SageMaker隔离方案外并非自动完全离线。
  • 客户负责监控、容量、备份、更新、代理和TLS终止。
  • Docker、Podman或Kubernetes自托管通常需要Enterprise授权。

隐私、安全与模型改进

Deepgram把企业Customer Data的保留、存储和删除安排交由商业协议约定。自托管文档说明,典型自托管请求的音频、转录和其他识别内容不会发送给Deepgram,只上报时长、字符数、功能和成功状态等用量元数据。

Pay As You Go和Growth客户可以选择加入或退出Model Improvement Program,2026年3月起退出不影响官网列示费率。项目在处理真实个人数据前仍应确认控制台选项、区域、保留期和数据处理协议。

  • Deepgram公开SOC 2 Type I与Type II认证信息。
  • Enterprise医疗客户可签署BAA以处理电子受保护健康信息。
  • 欧洲区域端点用于满足欧盟内处理和数据驻留需求。
  • API Key应仅保存在服务端,并按项目、环境和最小权限拆分。
  • Redaction只能降低部分暴露风险,不能代替源头数据最小化。
  • 日志中避免记录原始音频、完整转录和长期有效密钥。
  • 高风险Voice Agent必须提供告知、录音同意、人工接管和审计。

SDK、GitHub与开源状态

Deepgram在官方GitHub组织维护JavaScript、Python、.NET、Go和Java等SDK,并提供Voice Agent浏览器相关包。JavaScript SDK当前文档把v5列为当前主版本,迁移项目应查对应升级说明。

多个官方SDK使用MIT许可证,开发者可以查看、修改和分发这些客户端代码。但Deepgram云平台、商业模型、模型权重和Self-Hosted容器没有因此成为开源产品。

项目维护方状态许可证或说明
JavaScript与TypeScript SDKDeepgram官方公开MIT,当前主线v5
Python SDKDeepgram官方公开以仓库许可证为准
.NET SDKDeepgram官方公开MIT
Go SDKDeepgram官方公开MIT
Java SDKDeepgram官方公开MIT
Rust SDK社区公开不是同等官方支持级别
Voice Agent SDKDeepgram官方公开MIT
模型权重与云平台Deepgram未开源商业产品

支持语言与平台

能力语言或平台公开状态注意事项
Nova语音识别45种以上语言支持具体功能随模型和语言变化
Nova-3 Multilingual50种以上语言的产品描述支持自动语言检测
Flux STT Multilingual10种语言支持面向实时对话
Flux TTS当前英文声音支持更多语言仍在规划
云端API服务端与WebSocket支持区域端点不同
Self-HostedLinux x86-64与NVIDIA GPU企业支持硬件要求按模型变化
移动端SDK无独立消费者App通过后端或Web集成密钥不可放进客户端

产品优势

  • 从STT、TTS到Voice Agent提供一套连贯语音栈。
  • Flux把轮次结束和打断反馈放进对话模型,减少外部拼接。
  • Nova-3覆盖实时与批量转录,并提供多语言和术语增强。
  • 按秒计费避免固定分钟向上取整带来的浪费。
  • 提供免费200美元信用额度,适合完成真实数据评估。
  • 托管、区域、VPC、本地和SageMaker部署选择较完整。
  • 官方SDK覆盖多种主流服务端语言并公开源代码。
  • 企业安全、医疗协议和欧盟数据驻留选项较明确。

使用限制与注意事项

  • 模型准确率会受语言、口音、噪声、设备、远场和重叠说话影响。
  • 促销价和限时免费有明确结束日期,长期成本需按标准价估算。
  • 多声道按各声道时长累加,容易低估费用。
  • 部分转录增强功能和Audio Intelligence需要额外计费。
  • 默认并发按Project限制,不能通过创建更多Project规避。
  • Voice Agent执行外部动作时必须验证权限、参数和用户确认。
  • 情绪和意图模型可能产生偏差,不能作为唯一决策依据。
  • 自托管需要GPU、Linux、容器运维、许可连接和企业合同。
  • 官方SDK开源不代表语音模型或平台可以免费私有部署。
  • 重要医疗、法律、金融和身份信息仍需人工复核。

基本信息

字段内容
工具名称Deepgram
开发公司Deepgram, Inc.
工具类型语音识别、语音合成与Voice Agent平台
主要模型Nova-3、Flux STT、Flux TTS、Aura-2和Aura-1
主要接口REST API与WebSocket API
免费额度新账户200美元信用额度
价格模式按量、Growth年度预付和Enterprise定制
Growth门槛每年4000美元起
主要部署Hosted、区域云、VPC、Self-Hosted和SageMaker
中文支持Nova系列支持,具体能力需查看模型语言表
是否需要注册
是否提供API
官方SDKJavaScript、Python、.NET、Go、Java等
官方GitHub
SDK是否开源是,多个官方SDK采用MIT
产品是否开源

推荐指数

推荐指数为4.7分,满分5分。Deepgram覆盖从实时转录到对话式TTS和完整Voice Agent的生产链路,模型、文档、SDK、区域与本地部署选择都比较完整。

选择难点在于产品线和计费维度较多,促销结束、声道、附加功能和并发都可能改变总成本。最稳妥的方法是用200美元信用额度跑真实负载基准,再按标准价估算生产预算。

常见问题

Deepgram免费吗?

新账户可获得200美元免费信用额度,无需信用卡且官网称没有固定到期日。额度用完后按实际使用量计费。

Deepgram语音识别多少钱?

当前Nova-3单语实时促销价为每分钟0.0048美元,预录音频为每分钟0.0043美元。多语言、Flux和附加功能价格不同。

Flux TTS永久免费吗?

不是。Flux TTS只在2026年9月12日前限时免费,9月13日起Pay As You Go标准价为每1000字符0.0450美元。

Voice Agent API如何收费?

按对话分钟和所选LLM、TTS组合计费。当前Standard活动价为每分钟0.056美元,活动结束后为0.075美元。

支持中文吗?

Nova系列支持中文等多种语言,但具体识别功能、模型选项和地区可用性要以最新语言表为准。中文项目仍应测试口音、夹杂英文和专业词。

可以本地部署吗?

可以,Enterprise客户可在VPC、裸金属或容器平台自托管,也可通过Amazon SageMaker部署。硬件通常需要Linux和NVIDIA GPU。

Deepgram会保存音频吗?

云端Customer Data的保留和删除按商业协议执行。典型自托管请求不会把音频或转录发送给Deepgram,但会报告用量元数据。

可以退出模型改进计划吗?

可以,Pay As You Go和Growth客户可以选择加入或退出,2026年3月起退出不影响官网列示价格。

多声道如何计费?

按所有声道的总处理时长计算。10分钟双声道音频会按20分钟处理量计费。

提供哪些SDK?

官方维护JavaScript、Python、.NET、Go和Java等SDK,并提供Voice Agent相关浏览器包。Rust SDK属于社区项目。

Deepgram开源吗?

产品和模型不开源。多个官方SDK使用MIT许可证,只代表客户端接入代码开放。

总结

Deepgram适合需要生产级实时语音识别、对话式语音合成和Voice Agent的开发团队,也能通过区域端点与自托管服务满足企业数据和部署要求。Nova-3适合通用转录,Flux更适合需要轮次与打断处理的实时对话。

上线前应同时验证准确率、延迟、并发、声道、附加功能和促销结束后的标准成本。SDK开源降低了接入门槛,但模型、云服务与自托管容器仍是商业产品。

©️版权声明:若无特殊声明,本站所有文章版权均归AI工具分享原创和所有,未经许可,任何个人、媒体、网站、团体不得转载、抄袭或以其他方式复制发表本站内容,或在非我站所属的服务器上建立镜像。否则,我站将依法保留追究相关法律责任的权利。

类似于Deepgram的工具