Dubbing and AI 实际对应 Deepdub
数据库中的“Dubbing and AI”来自产品页面标题,实际品牌名称是 Deepdub。它是一套面向媒体、广播、后期制作和语音智能体的企业级 AI 配音与声音基础设施。
Deepdub 同时提供情绪化文字转语音、声音克隆、Voice-to-Voice、影视配音、实时广播配音和开发者 API。它不是面向普通用户的一键短视频翻译应用,许多生产服务需要联系团队配置。
主要产品能力
| 能力 | 输入 | 输出 | 适合场景 |
|---|---|---|---|
| 情绪化 TTS | 文字、语言、声音和情绪参数 | 带节奏、重音和表达的语音 | 智能体、旁白、客服和培训 |
| 声音克隆 | 经授权的语音样本 | 可跨语言使用的数字声音 | 品牌声音、演员和主持人延展 |
| Voice-to-Voice | 演员或配音者的完整表演 | 保留语气和节奏的新声音 | 影视角色和高情绪内容 |
| 媒体配音 | 视频、音轨、脚本和术语 | 翻译、配音和质量控制成片 | 电影、剧集、FAST频道和流媒体 |
| Deepdub Live | 实时节目或直播音频 | 低延迟多语言声音流 | 体育、新闻、电竞和直播活动 |
| Voice API | 实时或批量文字与声音配置 | WAV、MP3、ULAW等音频 | 语音智能体、电话和应用内语音 |
| 术语与口音控制 | 词汇表、发音和地区要求 | 更一致的专业词和地区口音 | 品牌、产品和国际内容 |
情绪化文字转语音
Deepdub 的 eTTS 技术强调节奏、停顿、重音和情绪,而不是只把文字读出来。用户可以选择声音、语言与表现风格,并通过 API 生成完整音频或流式接收音频块。
- 适合客服智能体、电话系统、课程、旁白和互动角色。
- 可调整口音、速度、音高与情绪强度,具体参数随模型变化。
- 支持为目标时长生成语音,便于字幕时间轴和画面配合。
- 可用 SSML 音素标记控制专有名词和特殊发音。
- 可选择已许可声音,也可在有权利的情况下创建声音参考。
- 长内容仍需检查声音漂移、断句、数字和跨段一致性。
当前主页演示采用 Phantom X 3.2,而快速入门示例使用 dd-etts-3.0。产品展示名与 API 模型编号并不完全一致,开发者应以账户中可用模型和最新文档为准。
声音克隆与 Voice-to-Voice
声音克隆根据短语音样本创建数字声音,用于在不同文本和语言中保持身份。Voice-to-Voice 则保留演员原始表演的节奏、情绪和细微变化,再转换成另一种经许可的声音。
- 声音样本必须来自本人或已取得明确授权的表演者。
- 授权应覆盖训练、生成、语言、地区、期限和商业渠道。
- 上传声音时需要标注语言、年龄、性别和说话风格等属性。
- API 提供声音上传、列出、读取和删除操作。
- 影视项目可由少量演员的表演扩展为更多角色声音。
- 品牌项目可保持跨广告、市场和渠道的一致声音身份。
Deepdub 推行声音人才许可与版税机制,但具体项目合同仍需逐项确认。任何技术上可以克隆的声音都不等于法律上可以使用。
影视与媒体配音流程
媒体本地化会从音视频中识别语音、生成脚本、处理翻译与发音,再用声音库、克隆或 Voice-to-Voice 制作目标语言音轨。专业项目可叠加母语适配、制作团队和质量控制。
- 向团队提供内容类型、时长、源语言、目标语言和发行地区。
- 确认视频、脚本、演员声音、音乐与效果音的权利范围。
- 上传媒体或现有脚本,生成转写并拆分对白。
- 建立人物、术语、发音、口音和风格要求。
- 为每个角色选择已许可声音或经授权的声音参考。
- 生成样片并审核翻译、表演、角色一致性和时间匹配。
- 修订重点片段,处理音乐与效果、响度和混音。
- 完成母语、创意、技术和合规质量检查。
- 按广播或平台规范交付音轨与成片,并保留批准记录。
自动转写页面给出 130 多种语言,配音和声音 API 页面通常写 100 多种语言与口音。不同模块的语言范围不完全相同,项目启动前应确认具体语对、声音和地区口音。
Deepdub Live 实时配音
Deepdub Live 面向体育、新闻、电竞和实时频道,把现场语音转换成多语言声音流。它支持 SRT、HLS 和 MPEG-DASH 等广播工作流,并可提供 48kHz 输出。
- 自动适应说话人,并从短样本保留主持人声音身份。
- 情绪匹配会跟随现场语速、强度、停顿和事件变化。
- 页面给出的首音频时间约为 125 毫秒,但实际端到端延迟取决于完整链路。
- 可使用克隆声音或预先许可的广播声音角色。
- 生产配置提供权限、数据隔离和持续运营支持。
- 直播中的姓名、比分、突发信息和敏感表述仍需人工监看。
Live 解决方案页面写 99.9% 以上 SLA,API 通用条款写付费 API 月度 99.95% 可用性,统计范围不同。合同中应明确服务边界、维护窗口、延迟目标、故障切换和赔偿方式。
Voice API 接入方式
| 方式 | 主要特点 | 适合任务 | 注意事项 |
|---|---|---|---|
| REST API | 一次请求返回二进制音频 | 批量旁白、异步任务和文件生成 | 需要控制超时、重试和重复扣费 |
| WebSocket | 持续连接并流式接收音频块 | 语音智能体和实时交互 | 需要处理断线、缓冲和顺序 |
| Python SDK | 同步与异步流式接口 | Python后端和AI应用 | 生产环境应锁定版本 |
| Node SDK | JavaScript缓冲和分块回调 | Node.js服务与实时应用 | 密钥必须留在服务器端 |
| Playground | 账户内试听声音和参数 | 选声、模型比较和快速验证 | 测试结果不代表全部生产负载 |
API 快速上手
- 使用企业邮箱注册 14 天试用,并完成邀请和验证码流程。
- 进入 Playground,确认账户自动生成的 API 密钥。
- 试听声音预设并保存需要的 voice prompt id。
- 安装 deepdub Python 包或 Node.js 客户端,也可直接发送网络请求。
- 选择模型、语言、目标文字、声音和输出格式。
- 批量任务使用 REST,低延迟对话优先测试 WebSocket 流式生成。
- 把密钥存入服务器端密钥管理系统,不要放入网页或移动客户端。
- 测试空文本、超长文本、特殊字符、数字、SSML 和网络中断。
- 记录生成请求、声音许可、模型版本、输出文件和人工批准结果。
- 试用结束前向销售确认计费、保留模式、并发、SLA 与商业条款。
输入、语言与输出
| 类别 | 支持内容 | 边界 |
|---|---|---|
| 文字 | 普通文字、发音控制和部分SSML | 长度、字符和语言限制按接口与套餐执行 |
| 声音样本 | 上传或现场录制的授权语音 | 涉及生物特征、人格权和演员合同 |
| 音视频 | 媒体、直播和本地化素材 | 文件大小、存储和项目格式需书面确认 |
| 语言 | 100多种语言与口音 | API locale与具体声音覆盖少于总体宣传口径 |
| 自动转写 | 130多种语言 | 转写范围不等于每种语言都有相同配音能力 |
| 音频输出 | WAV 48kHz、MP3、ULAW和未压缩音频 | 具体采样率和格式随接口与场景变化 |
| 直播输出 | SRT、HLS、MPEG-DASH工作流 | 需专业广播集成与网络冗余 |
免费试用与价格
| 套餐或版本 | 价格 | 计费周期 | 核心权益或额度 | 适合用户 |
|---|---|---|---|---|
| API试用 | 0美元 | 14天 | 最多1万字符,约10分钟;Playground与API密钥 | 开发验证和选声 |
| API时间套餐 | 暂未公开 | 按所选时间包 | 试用后选择使用时长,额外用量按固定价格 | 语音智能体和内容生产 |
| 媒体配音 | 联系销售 | 项目或合同 | 翻译、声音、制作、质量控制和交付 | 影视、流媒体和FAST频道 |
| Deepdub Live | 联系销售 | 定制合同 | 实时多语言声音、广播集成、SLA和运营支持 | 直播与广播机构 |
| 企业部署 | 定制报价 | 合同约定 | 并发、支持、安全、保留和许可按需求配置 | 大规模语音平台 |
公开页面没有列出试用后的具体时间包金额、额外用量单价、最低承诺或企业服务费。不能根据 1 万字符约等于 10 分钟反推出付费价格。
税费、自动续费、取消、退款、未用额度、失败生成和并发超限计费也未公开明确。采购前应以实际结算页面、订阅包和双方签署文件为准。
声音许可与输出权利
Deepdub 声音库主打已许可、可追踪并适合广播和商业使用,但这项权利只覆盖相应声音资产和合同范围。用户仍需拥有脚本、视频、音乐、角色和自带声音样本的全部必要权利。
- 预置声音的地区、渠道、期限和品牌用途应在订单中确认。
- 自带演员声音必须有训练、合成、翻译和再利用授权。
- 不得把第三方素材上传后就视为可以对外分发生成结果。
- API 通用条款对非客户完全拥有输入生成的输出设有严格限制。
- 影视和广告项目应保存演员同意、版权链和最终用途批准。
- 合成声音的标识义务取决于发行地法规和平台规则。
API 条款规定,若输入不是客户完全拥有,相关输出通常只能向关联方提供并限内部非商业用途。拥有第三方许可的复杂项目应通过单独合同明确覆盖范围,不能只依赖通用试用账户。
隐私、安全与数据保存
Deepdub 的数据处理附录覆盖作为处理者接触的客户代表与演员数据,包括姓名、联系方式和声音录音。子处理商包括 AWS、Google 与 WeTransfer,处理地点涉及欧盟和美国。
- 平台通过 SOC 2 Type II,并在媒体场景标示 TPN Gold 或 TPN 认证。
- 个人数据静态使用 AES-256,加密传输使用 TLS 1.2 或更高版本。
- 解决方案页面称客户数据默认隔离,且不用于训练模型。
- 客户可选择不保留模式,让处理后的数据不继续保存。
- 客户可指示删除个人数据,法律要求保留的部分除外。
- 安全事件发生或怀疑发生时,DPA 规定在 48 小时内通知客户。
- 数据主体请求会在 72 小时内通知客户并协助处理。
除非书面另有约定,Deepdub 没有义务长期保存输入,并可设置文件大小、存储和处理容量限制。用户必须保留原始素材、脚本、声音授权和最终输出的自有备份。
API SLA 与生产可靠性
付费 API 通用条款承诺月度 99.95% 可用性,不含提前通知的计划维护,免费服务不适用。高可用数字不代表每次生成的延迟、音质或内容准确性都得到保证。
- 为 REST 请求设置幂等控制,防止重试产生重复音频和费用。
- WebSocket 应处理断线重连、片段顺序和不完整音频。
- 实时业务准备备用声音或传统 TTS 降级路径。
- 监控首音频时间、总生成时间、错误率和音频质量。
- 把模型或 API 更新纳入兼容测试和发布审批。
- 直播合同需单独明确延迟、SLA、支持时间和事故响应。
GitHub、SDK 与开源状态
| 项目 | 当前状态 | 许可证 |
|---|---|---|
| Deepdub平台与模型 | 专有服务 | 未公开产品源码许可 |
| Python SDK deepdub | 官方公开仓库 | MIT |
| AudioSample | 官方音频处理库 | MIT |
| deepdub-api | 官方API文档与示例仓库 | 当前未检测到许可证 |
| Node SDK | 可通过软件包管理器安装 | 以包内许可为准 |
| 其他官方集成 | 部分仓库公开 | MIT、Apache等各不相同 |
Python SDK 和 AudioSample 使用 MIT 许可证,只说明这些代码库的使用权。它们不开放 Deepdub 的模型权重、声音库、生产平台或商业配音服务。
适合用户与场景
- 语音智能体团队:构建客服、医疗引导和金融语音界面。
- 影视与流媒体公司:制作多语言剧集、电影和目录内容。
- 广播机构:为体育、新闻和大型直播提供实时语言音轨。
- 语言服务商:把情绪语音和声音克隆接入现有本地化流程。
- 后期制作团队:使用 Deepdub Go 控制口音、情绪和角色声音。
- 品牌与培训团队:保持不同市场中的声音身份和术语一致性。
- 开发者:通过 REST、WebSocket、Python 或 Node SDK 生成语音。
优势与主要限制
主要优势
- 覆盖从 API TTS 到影视制作和实时广播的多层产品。
- 情绪、节奏、口音和 Voice-to-Voice 更适合表演型内容。
- 提供大量已许可声音和面向演员的版税机制。
- 支持 REST、WebSocket、Python 和 Node.js 集成。
- 提供 SOC 2、TPN、GDPR、加密与可选不保留模式。
- 专业项目可叠加母语适配、制作团队和质量控制。
主要限制
- 试用后具体价格没有公开,需要账户选择或销售报价。
- 语言、情绪数量和 SLA 在不同产品页面采用不同统计口径。
- API 可用语言与整体转写或媒体服务语言并不完全相同。
- 高质量媒体配音仍需要翻译、表演和技术人员审核。
- 第三方输入生成的输出受严格分发与商业使用限制。
- 核心平台与模型闭源,开源 SDK 不代表产品开源。
总结
Deepdub 适合对声音表演、商业许可、实时性和企业安全要求较高的语音智能体、媒体与广播项目。开始试用前应先确定使用的是 API、Deepdub Go、媒体制作还是 Live,并书面确认价格、语言、声音权利、数据保留和输出分发范围。
常见问题
Dubbing and AI 是产品名称吗?
它是 Deepdub 页面使用的标题,实际品牌为 Deepdub。本词条所述功能、API 和服务均属于 Deepdub。
Deepdub 可以免费试用吗?
可以,当前 API 试用期为 14 天,包含最多 1 万字符,页面估算约 10 分钟内容。需要企业邮箱注册。
试用后多少钱?
公开页面只说明可购买按时间计算的套餐,并对额外用量采用固定价格,没有列出具体金额。媒体和实时广播方案需要联系销售。
支持多少语言?
产品整体通常写 100 多种语言与口音,自动转写与部分技术页面写 130 多种。具体 API locale、声音和目标语能力应逐项核对。
支持实时语音吗?
支持,WebSocket API 可流式生成,Deepdub Live 也面向实时广播配音。实际延迟取决于模型、网络、编码和完整媒体链路。
声音可以商业使用吗?
Deepdub 声音库提供商业许可,但范围以所选声音和合同为准。用户自带脚本、视频、角色和声音样本仍需自行取得权利。
客户数据会用于训练吗?
解决方案页面表示客户数据默认隔离且不用于训练,并提供可选不保留模式。企业仍应在合同和 DPA 中确认具体项目设置。
Deepdub 有 Python 和 Node SDK 吗?
有,Python 包为 deepdub,Node 包为 @deepdub/node。也可以直接使用 REST 或 WebSocket 接口。
Deepdub 开源吗?
核心平台和模型不开源。官方 Python SDK 与 AudioSample 使用 MIT 许可证,但这不覆盖声音库、模型权重和托管服务。
输入会长期保存吗?
不保证。除非另有书面约定,Deepdub 没有长期保存输入的义务,用户应自行保留原始素材、授权和输出备份。
桂公网安备45132202000164号