一句话介绍
Deepgram是一套面向开发者和企业的语音AI平台,通过API提供实时与批量语音识别、对话式语音合成、完整Voice Agent编排和音频理解,并支持托管云、专用环境与本地部署。
工具简介
Deepgram围绕真实语音应用提供从Listen到Think再到Speak的完整能力。开发者既可单独调用Speech-to-Text或Text-to-Speech,也可通过一个WebSocket连接构建能处理打断、轮次和工具调用的实时语音智能体。
当前核心模型包括面向通用转录的Nova-3、面向对话轮次的Flux STT、对话式Flux TTS和Aura系列语音合成。产品与模型是商业服务,官方SDK开源不代表模型权重或平台源码开放。
产品能力概览
| 产品 | 主要输入 | 主要输出 | 典型用途 |
|---|---|---|---|
| Speech-to-Text | 实时流或录音文件 | 带时间、说话人和置信度的文本 | 转录、字幕与分析 |
| Text-to-Speech | 文本与对话上下文 | 流式合成语音 | 客服、助手与电话机器人 |
| Voice Agent API | 双向实时音频与配置 | 可打断的语音对话 | 客户服务、预约与外呼 |
| Audio Intelligence | 音频转录或文本 | 摘要、主题、情绪与意图 | 质检、洞察和路由 |
| Self-Hosted | 企业GPU基础设施 | 私有语音推理端点 | 数据驻留与低延迟 |
| Playground | 麦克风、文件或文本 | 模型试用结果 | 原型验证与参数比较 |
语音识别模型
Nova-3
Nova-3是当前推荐的通用生产级语音识别模型,可用于实时流和预录音频。它支持多语言、自动语言检测、噪声与远场音频,并可通过Keyterm Prompting提高品牌、产品和行业术语识别。
Flux STT
Flux STT专门面向实时Voice Agent,不只识别文字,还把轮次结束检测和可配置对话节奏整合到模型中。英文版与多语言版分别计费,多语言版可使用语言提示影响识别。
Nova-3 Medical与定制模型
Nova-3提供面向医疗词汇的选项,企业还可联系销售训练适应专有或特殊数据的Custom模型。专业模型仍需用真实口音、设备、场景和词汇集评估,不能只看通用基准。
Whisper Cloud与旧模型
Deepgram仍提供托管Whisper Large,也保留Nova-2、Enhanced和Base用于既有部署。新项目通常应先比较Nova-3与Flux,避免因为历史兼容而默认采用扩展性较低的Whisper。
语音识别功能
- Streaming用于电话、会议和Voice Agent的实时增量转录。
- Pre-Recorded用于上传录音并异步或同步生成完整文本。
- Speaker Diarization识别多人并标注每段由谁说出。
- Smart Formatting自动处理标点、大小写、日期和货币。
- Keyterm Prompting增强产品名、缩写和专业术语识别。
- Redaction用于识别并移除部分个人敏感信息。
- Entity Detection提取人物、组织、地点和日期等实体。
- Automatic Language Detection辅助处理语言未知或切换场景。
Text-to-Speech语音合成
Flux TTS
Flux TTS是面向实时语音智能体的流式、对话原生模型,会利用跨轮上下文保持语气、节奏和情绪连续。它可以反馈打断前用户实际听到的文字,并支持在不中断会话的情况下调整速度和风格。
Aura-2
Aura-2面向专业、大规模和低延迟语音合成,可用于客服、通知和对话应用。现有Aura-2模型不会因Flux TTS发布而被强制迁移。
Aura-1
Aura-1仍作为成本较低的语音合成选项提供。选择时应同时比较语言、声音、延迟、结构化内容发音和部署区域,而不只比较每千字符单价。
对话式语音控制
Deepgram当前把语音合成设计为对话架构的一部分,可跟踪状态、轮次边界和打断。对于有严格品牌声音或声音克隆需求的项目,应先核对当前模型和授权能力。
Voice Agent API
Voice Agent API把语音识别、LLM编排和语音合成放在一个实时连接中,减少开发者拼接多个服务的工作。用户也可以自带LLM或TTS,并只使用Deepgram的其他语音与编排能力。
- 内置Barge-in检测,让用户可以自然打断智能体。
- Turn-taking prediction帮助系统判断何时听、思考和说话。
- Function Calling允许对话中查询业务系统或执行工具。
- Mid-session control可在会话中调整配置和行为。
- Reusable Configurations便于复用智能体设置。
- Multi-Agent Architecture支持专用智能体之间交接。
- Telephony能力用于接入呼入和呼出电话网络。
- Browser Agent SDK可把实时语音能力嵌入Web应用。
Audio Intelligence
Audio Intelligence用于在转录基础上生成摘要、主题、情绪和意图等结构化结果。部分能力按输入和输出Token另行收费,不能把它们理解为语音识别价格中全部免费包含。
| 能力 | 结果 | 适合场景 | 主要风险 |
|---|---|---|---|
| Summarization | 对话摘要 | 客服纪要、会议回顾 | 可能遗漏限定条件 |
| Topic Detection | 主题标签 | 内容归类与路由 | 多主题边界不稳定 |
| Sentiment Analysis | 情绪倾向 | 服务质检与趋势 | 语境、文化和讽刺偏差 |
| Intent Recognition | 用户意图 | 自动分流与后续动作 | 错误意图可能触发错误流程 |
| Entity Detection | 人物、组织、地点和日期 | CRM录入与检索 | 实体拼写需复核 |
| Redaction | 移除部分敏感文字 | 隐私与合规处理 | 不能替代完整数据防泄漏 |
完整接入流程
- 创建Deepgram账户和Project,领取免费信用额度。
- 生成只具备必要权限的API Key,并存入安全的服务端配置。
- 根据实时对话或录音处理选择Streaming或Pre-Recorded。
- 选择Nova-3、Flux或其他适合语言和场景的模型。
- 设置音频编码、采样率、语言、说话人和格式化参数。
- 用真实设备、噪声、口音和专业词汇运行基准测试。
- 处理结果中的临时段、最终段、错误、超时和重连。
- 记录音频时长、字符数、附加功能和并发以监控成本。
- 上线前配置隐私、保留、区域、配额和故障降级策略。
实时转录教程
- 从浏览器、电话或音频设备取得稳定的单声道或多声道音频。
- 建立WebSocket连接并在服务端完成短期或长期凭据认证。
- 声明正确的编码、采样率和声道数,避免音频被错误解释。
- 使用Nova-3处理通用转录,或用Flux处理对话轮次。
- 按需求启用Smart Formatting、Diarization和Keyterm。
- 把中间结果用于实时界面,最终结果用于持久化和业务动作。
- 为断网、静音、长停顿、重连和重复片段建立状态机。
- 用人工标注集计算词错率、实体准确率和端到端延迟。
构建Voice Agent教程
- 定义智能体任务、允许执行的动作和必须转人工的条件。
- 配置Flux或Nova语音识别、LLM提供商和TTS声音。
- 编写系统提示,限制身份、业务范围和不可承诺事项。
- 实现函数调用,并在服务端验证参数、权限和幂等性。
- 测试用户打断、沉默、重复、背景声和同时说话。
- 记录用户实际听到的内容,避免打断后业务状态不一致。
- 为敏感操作增加身份验证、确认步骤和人工接管。
- 监控每通时长、延迟、转人工率、任务成功率和成本。
生产质量评估
- 准备覆盖主要语言、口音、设备、噪声和业务术语的测试集。
- 由人工制作可靠参考转录,并固定评分规则。
- 分别测试实时与批量模式,不混合比较延迟和准确率。
- 比较Nova-3单语、多语、Flux和现有供应商。
- 对数字、人名、地址、药品和账号等关键实体单独计分。
- 计算词错率之外的轮次判断、首字延迟和最终延迟。
- 估算多声道、附加功能、Audio Intelligence和重试成本。
- 只有在业务阈值达标后才扩大流量。
适合哪些用户
- Voice Agent开发团队:构建低延迟、可打断的实时语音助手。
- 呼叫中心平台:转录电话、总结通话并识别意图。
- 会议与字幕产品:生成实时字幕、说话人和章节。
- 医疗与金融企业:通过企业合同使用合规与私有部署。
- 媒体与播客平台:批量转录、搜索和理解录音。
- 销售与客服团队:把语音数据转成CRM和质检信息。
- 平台工程团队:使用SDK、区域端点和自托管方式集成。
典型使用场景
| 场景 | 推荐能力 | 关键指标 | 风险控制 |
|---|---|---|---|
| 实时客服机器人 | Flux STT加Flux TTS或Voice Agent | 打断、延迟、解决率 | 转人工与身份验证 |
| 会议字幕 | Nova-3 Streaming加Diarization | 词错率和说话人准确率 | 参会者同意 |
| 录音归档 | Nova-3 Pre-Recorded | 吞吐、成本和检索率 | 保留与访问控制 |
| 医疗记录 | Nova-3 Medical加Redaction | 术语与关键实体 | BAA和人工审核 |
| 电话质检 | STT加Audio Intelligence | 摘要、情绪和意图 | 避免只凭情绪评分处罚 |
| 语音通知 | Aura-2或Aura-1 | 发音、延迟和成本 | 品牌与无障碍检查 |
| 本地语音平台 | Self-Hosted | 数据驻留和容量 | GPU、升级和许可运维 |
价格计划
以下价格按2026年8月22日官方页面核验。语音识别流式价格中部分为限时促销,Flux TTS和Voice Agent使用Flux TTS的优惠将在2026年9月12日结束,因此上线前必须重新查看价格。
| 计划 | 价格或门槛 | 主要权益 | 默认规模 | 适合用户 |
|---|---|---|---|---|
| Free Credit | 新账户200美元 | 无需信用卡,信用额无固定到期日 | 使用公共模型 | 原型与评估 |
| Pay As You Go | 按实际用量 | 无最低承诺 | STT流式最高150并发 | 开发者与初创团队 |
| Growth | 每年4000美元起预付 | 最高约20%折扣与更高并发 | STT流式最高225并发 | 增长中的生产应用 |
| Enterprise | 联系销售 | 大规模、定制模型、私有部署和支持 | 定制并发与SLA | 大型或受监管企业 |
Speech-to-Text价格
Streaming实时语音识别
| 模型 | Pay As You Go | Growth | 计费单位 | 备注 |
|---|---|---|---|---|
| Flux English | 当前0.0065美元 | 当前0.0057美元 | 每分钟 | 流式促销价 |
| Flux Multilingual | 0.0078美元 | 0.0068美元 | 每分钟 | 支持对话多语言 |
| Nova-3 Monolingual | 当前0.0048美元 | 当前0.0042美元 | 每分钟 | 流式促销价 |
| Nova-3 Multilingual | 当前0.0058美元 | 当前0.0050美元 | 每分钟 | 流式促销价 |
| Custom | 联系销售 | 联系销售 | 合同 | 专有或特殊数据 |
Pre-Recorded录音识别
| 模型 | Pay As You Go | Growth | 计费单位 | 适合任务 |
|---|---|---|---|---|
| Nova-3 Monolingual | 0.0043美元 | 0.0036美元 | 每分钟 | 单语录音 |
| Nova-3 Multilingual | 0.0052美元 | 0.0043美元 | 每分钟 | 多语言录音 |
| Whisper Large | 0.0048美元 | 0.0048美元 | 每分钟 | 兼容特定Whisper流程 |
| Custom | 联系销售 | 联系销售 | 合同 | 定制模型 |
Speech-to-Text附加功能
| 功能 | Pay As You Go | Growth | 实时或录音 | 备注 |
|---|---|---|---|---|
| Redaction | 0.0020美元每分钟 | 0.0017美元每分钟 | 两者 | 移除部分敏感信息 |
| Keyterm Prompting | 0.0013美元每分钟 | 0.0012美元每分钟 | 两者 | 增强关键术语 |
| Smart Formatting | 包含 | 包含 | 两者 | 标点与格式 |
| Entity Detection | 0.0017美元每分钟 | 0.0017美元每分钟 | 两者 | 提取实体 |
| Speaker Diarization | 实时0.0020美元每分钟 | 以页面为准 | 实时 | 录音模式当前包含 |
| Speaker Diarization | 包含 | 包含 | 录音 | 多人标注 |
Text-to-Speech价格
Flux TTS在2026年9月12日前限时免费,2026年9月13日起恢复标准字符计费。免费期不是永久免费计划。
| 模型 | Pay As You Go | Growth | 计费单位 | 价格状态 |
|---|---|---|---|---|
| Flux TTS | 9月12日前免费,之后0.0450美元 | 9月12日前免费,之后0.0405美元 | 每1000字符 | 限时活动 |
| Aura-2 | 0.030美元 | 0.027美元 | 每1000字符 | 当前标准价 |
| Aura-1 | 0.0150美元 | 0.0135美元 | 每1000字符 | 当前标准价 |
Voice Agent API价格
Voice Agent按对话时长计费,并根据是否使用Deepgram提供的LLM与TTS区分层级。以下为Flux TTS免费活动期间的当前价格和活动结束后的标准价格。
| 层级 | Pay As You Go当前价 | 活动后价格 | Growth当前价 | 适合配置 |
|---|---|---|---|---|
| Standard | 0.056美元每分钟 | 0.075美元每分钟 | 0.051美元每分钟 | 使用完整默认语音栈 |
| Standard BYO TTS | 0.065美元每分钟 | 同当前 | 0.051美元每分钟 | 自带语音合成 |
| Custom BYO LLM | 0.050美元每分钟 | 0.065美元每分钟 | 0.041美元每分钟 | 自带语言模型 |
| Custom BYO LLM加TTS | 0.050美元每分钟 | 同当前 | 0.041美元每分钟 | 自带语言模型和语音合成 |
| Advanced | 0.122美元每分钟 | 0.163美元每分钟 | 0.110美元每分钟 | 更高级LLM层级 |
| Advanced BYO TTS | 0.122美元每分钟 | 同当前 | 0.110美元每分钟 | 高级LLM并自带TTS |
计费规则与成本陷阱
- 语音识别按真实秒数计费,不向上取整到固定分钟。
- 多声道按各声道总处理时长计费,10分钟双声道按20分钟计算。
- Redaction、Keyterm、Entity和部分Diarization需要附加费用。
- Audio Intelligence按输入和输出Token计费,不含在STT单价内。
- Growth超出信用额度按原Growth费率加10%并按周结算。
- Growth要启用超额用量需保留有效信用卡,否则额度耗尽会中断请求。
- 并发限制以Project为单位,共用同一池的多个API Key不会增加容量。
- 创建额外Project绕过速率限制违反服务条款。
- 促销和限时免费结束后,单位成本可能自动变化。
速率限制
| 服务 | Pay As You Go默认限制 | Growth公开限制 | 说明 |
|---|---|---|---|
| Voice Agent | 最高45个并发连接 | 最高60个并发连接 | 按Project计算 |
| Flux STT Streaming | 最高150个并发请求 | 计划页显示最高225 | 区域文档需再次确认 |
| Nova-3 Pre-Recorded | 最高50个并发请求 | 公开计划为50 | 批量任务 |
| Nova-3 Streaming | 最高150个并发请求 | 最高225 | 实时转录 |
| Speaker Diarization Streaming | 北美最高50,欧澳最高25 | 按协议 | 低于普通流式限制 |
| Text-to-Speech REST | 每模型最高15个并发请求 | 计划总览给出更高总体规模 | 模型与区域限制优先 |
| Audio Intelligence | 最高10个并发请求 | 最高10 | 附加分析 |
部署方式
| 方式 | 运行位置 | 运维责任 | 数据与适用场景 |
|---|---|---|---|
| Hosted | Deepgram多租户云 | Deepgram负责基础设施和更新 | 最快开始开发 |
| 区域云端 | 北美、欧洲或澳大利亚端点 | Deepgram负责 | 区域处理和数据驻留 |
| Dedicated或VPC | 专用客户云环境 | 按企业协议 | 隔离与定制容量 |
| Self-Hosted | 客户VPC或数据中心 | 客户负责基础设施、备份和更新 | 严格隐私与低延迟 |
| Amazon SageMaker | 客户AWS VPC | AWS托管端点与客户配置 | 通过Marketplace部署模型 |
Self-Hosted要求
本地部署支持Docker、Podman、Kubernetes、裸金属和部分云平台,只支持Linux x86-64或amd64及NVIDIA GPU。Nova与Aura支持范围较广,Flux模型对GPU代际和内存要求更高。
- STT Engine通常至少需要1张16GB显存的NVIDIA GPU、4核CPU和32GB内存。
- Aura类TTS Engine需要正好2张专用GPU、8核CPU和64GB内存。
- Flux TTS使用单GPU但加载时可占用约60GB系统内存。
- 自托管容器仍需许可与用量报告连接,除SageMaker隔离方案外并非自动完全离线。
- 客户负责监控、容量、备份、更新、代理和TLS终止。
- Docker、Podman或Kubernetes自托管通常需要Enterprise授权。
隐私、安全与模型改进
Deepgram把企业Customer Data的保留、存储和删除安排交由商业协议约定。自托管文档说明,典型自托管请求的音频、转录和其他识别内容不会发送给Deepgram,只上报时长、字符数、功能和成功状态等用量元数据。
Pay As You Go和Growth客户可以选择加入或退出Model Improvement Program,2026年3月起退出不影响官网列示费率。项目在处理真实个人数据前仍应确认控制台选项、区域、保留期和数据处理协议。
- Deepgram公开SOC 2 Type I与Type II认证信息。
- Enterprise医疗客户可签署BAA以处理电子受保护健康信息。
- 欧洲区域端点用于满足欧盟内处理和数据驻留需求。
- API Key应仅保存在服务端,并按项目、环境和最小权限拆分。
- Redaction只能降低部分暴露风险,不能代替源头数据最小化。
- 日志中避免记录原始音频、完整转录和长期有效密钥。
- 高风险Voice Agent必须提供告知、录音同意、人工接管和审计。
SDK、GitHub与开源状态
Deepgram在官方GitHub组织维护JavaScript、Python、.NET、Go和Java等SDK,并提供Voice Agent浏览器相关包。JavaScript SDK当前文档把v5列为当前主版本,迁移项目应查对应升级说明。
多个官方SDK使用MIT许可证,开发者可以查看、修改和分发这些客户端代码。但Deepgram云平台、商业模型、模型权重和Self-Hosted容器没有因此成为开源产品。
| 项目 | 维护方 | 状态 | 许可证或说明 |
|---|---|---|---|
| JavaScript与TypeScript SDK | Deepgram官方 | 公开 | MIT,当前主线v5 |
| Python SDK | Deepgram官方 | 公开 | 以仓库许可证为准 |
| .NET SDK | Deepgram官方 | 公开 | MIT |
| Go SDK | Deepgram官方 | 公开 | MIT |
| Java SDK | Deepgram官方 | 公开 | MIT |
| Rust SDK | 社区 | 公开 | 不是同等官方支持级别 |
| Voice Agent SDK | Deepgram官方 | 公开 | MIT |
| 模型权重与云平台 | Deepgram | 未开源 | 商业产品 |
支持语言与平台
| 能力 | 语言或平台 | 公开状态 | 注意事项 |
|---|---|---|---|
| Nova语音识别 | 45种以上语言 | 支持 | 具体功能随模型和语言变化 |
| Nova-3 Multilingual | 50种以上语言的产品描述 | 支持 | 自动语言检测 |
| Flux STT Multilingual | 10种语言 | 支持 | 面向实时对话 |
| Flux TTS | 当前英文声音 | 支持 | 更多语言仍在规划 |
| 云端API | 服务端与WebSocket | 支持 | 区域端点不同 |
| Self-Hosted | Linux x86-64与NVIDIA GPU | 企业支持 | 硬件要求按模型变化 |
| 移动端SDK | 无独立消费者App | 通过后端或Web集成 | 密钥不可放进客户端 |
产品优势
- 从STT、TTS到Voice Agent提供一套连贯语音栈。
- Flux把轮次结束和打断反馈放进对话模型,减少外部拼接。
- Nova-3覆盖实时与批量转录,并提供多语言和术语增强。
- 按秒计费避免固定分钟向上取整带来的浪费。
- 提供免费200美元信用额度,适合完成真实数据评估。
- 托管、区域、VPC、本地和SageMaker部署选择较完整。
- 官方SDK覆盖多种主流服务端语言并公开源代码。
- 企业安全、医疗协议和欧盟数据驻留选项较明确。
使用限制与注意事项
- 模型准确率会受语言、口音、噪声、设备、远场和重叠说话影响。
- 促销价和限时免费有明确结束日期,长期成本需按标准价估算。
- 多声道按各声道时长累加,容易低估费用。
- 部分转录增强功能和Audio Intelligence需要额外计费。
- 默认并发按Project限制,不能通过创建更多Project规避。
- Voice Agent执行外部动作时必须验证权限、参数和用户确认。
- 情绪和意图模型可能产生偏差,不能作为唯一决策依据。
- 自托管需要GPU、Linux、容器运维、许可连接和企业合同。
- 官方SDK开源不代表语音模型或平台可以免费私有部署。
- 重要医疗、法律、金融和身份信息仍需人工复核。
基本信息
| 字段 | 内容 |
|---|---|
| 工具名称 | Deepgram |
| 开发公司 | Deepgram, Inc. |
| 工具类型 | 语音识别、语音合成与Voice Agent平台 |
| 主要模型 | Nova-3、Flux STT、Flux TTS、Aura-2和Aura-1 |
| 主要接口 | REST API与WebSocket API |
| 免费额度 | 新账户200美元信用额度 |
| 价格模式 | 按量、Growth年度预付和Enterprise定制 |
| Growth门槛 | 每年4000美元起 |
| 主要部署 | Hosted、区域云、VPC、Self-Hosted和SageMaker |
| 中文支持 | Nova系列支持,具体能力需查看模型语言表 |
| 是否需要注册 | 是 |
| 是否提供API | 是 |
| 官方SDK | JavaScript、Python、.NET、Go、Java等 |
| 官方GitHub | 有 |
| SDK是否开源 | 是,多个官方SDK采用MIT |
| 产品是否开源 | 否 |
推荐指数
推荐指数为4.7分,满分5分。Deepgram覆盖从实时转录到对话式TTS和完整Voice Agent的生产链路,模型、文档、SDK、区域与本地部署选择都比较完整。
选择难点在于产品线和计费维度较多,促销结束、声道、附加功能和并发都可能改变总成本。最稳妥的方法是用200美元信用额度跑真实负载基准,再按标准价估算生产预算。
常见问题
Deepgram免费吗?
新账户可获得200美元免费信用额度,无需信用卡且官网称没有固定到期日。额度用完后按实际使用量计费。
Deepgram语音识别多少钱?
当前Nova-3单语实时促销价为每分钟0.0048美元,预录音频为每分钟0.0043美元。多语言、Flux和附加功能价格不同。
Flux TTS永久免费吗?
不是。Flux TTS只在2026年9月12日前限时免费,9月13日起Pay As You Go标准价为每1000字符0.0450美元。
Voice Agent API如何收费?
按对话分钟和所选LLM、TTS组合计费。当前Standard活动价为每分钟0.056美元,活动结束后为0.075美元。
支持中文吗?
Nova系列支持中文等多种语言,但具体识别功能、模型选项和地区可用性要以最新语言表为准。中文项目仍应测试口音、夹杂英文和专业词。
可以本地部署吗?
可以,Enterprise客户可在VPC、裸金属或容器平台自托管,也可通过Amazon SageMaker部署。硬件通常需要Linux和NVIDIA GPU。
Deepgram会保存音频吗?
云端Customer Data的保留和删除按商业协议执行。典型自托管请求不会把音频或转录发送给Deepgram,但会报告用量元数据。
可以退出模型改进计划吗?
可以,Pay As You Go和Growth客户可以选择加入或退出,2026年3月起退出不影响官网列示价格。
多声道如何计费?
按所有声道的总处理时长计算。10分钟双声道音频会按20分钟处理量计费。
提供哪些SDK?
官方维护JavaScript、Python、.NET、Go和Java等SDK,并提供Voice Agent相关浏览器包。Rust SDK属于社区项目。
Deepgram开源吗?
产品和模型不开源。多个官方SDK使用MIT许可证,只代表客户端接入代码开放。
总结
Deepgram适合需要生产级实时语音识别、对话式语音合成和Voice Agent的开发团队,也能通过区域端点与自托管服务满足企业数据和部署要求。Nova-3适合通用转录,Flux更适合需要轮次与打断处理的实时对话。
上线前应同时验证准确率、延迟、并发、声道、附加功能和促销结束后的标准成本。SDK开源降低了接入门槛,但模型、云服务与自托管容器仍是商业产品。
桂公网安备45132202000164号