Resemble AI是什么?
Resemble AI是一套同时覆盖AI语音生成和生成式媒体安全的平台。创作与开发能力包括文字转语音、声音克隆、文字设计声音、语音转语音、语音转写、音频编辑增强和实时语音Agent;
安全能力则包括音频、图片和视频Deepfake检测、检测解释、会议实时分析、身份登记与匹配、C2PA签名和不可感知水印。
产品定位已从单纯的AI配音工具扩展为“生成、验证、检测”一体化平台。内容团队可以制作品牌声音和多语言旁白,开发者可以用API接入实时语音,安全团队则可把可疑媒体送入检测流程并保留审计结果。
Resemble Ultra文字转语音
Resemble Ultra是当前托管平台为新建和升级声音使用的默认文字转语音模型,支持同步生成、HTTP流式和WebSocket流式输出。API会根据voice_uuid自动选择关联模型,开发者不应把resemble-ultra作为普通model参数强行传入。
旧版托管Chatterbox、Chatterbox Turbo、Chatterbox Multilingual及更早TTS版本已被官方文档列为停止服务,仍绑定旧模型的声音需要升级到Ultra才能继续生成。迁移前应重新验证音质、发音、延迟和项目兼容性。
声音克隆
声音克隆可从约10秒清晰录音建立可复用声音。API既可以一次上传完整音频并训练,也可以创建声音后分批上传录音,再通过回调接收训练完成通知。
克隆API当前要求Business或更高方案。
短样本能快速建立声音,但环境噪声、音乐、混响、多人重叠和过度压缩会降低相似度。任何真人声音都必须取得本人明确同意,并约定可使用场景、期限、团队成员、模型删除和衍生内容范围。
Voice Design声音设计
Voice Design不需要真人录音。用户用文字描述年龄、口音、语气、风格和角色用途,系统生成3个候选声音,试听后把选中的候选转成可用于TTS的voice_uuid。
声音设计适合虚构角色、原型和无法录制真人的项目,但不能保证候选声线与现实人物完全无关。品牌和游戏项目仍应进行相似性检查,并保存最终候选和生成参数。
Speech-to-Speech语音转语音
语音转语音会把输入录音的节奏、语调和表演转换到目标声音,适合实时角色、游戏、配音修订和语音代理。当前文档列出Core STS v2和v1,其中v2提升音高跟踪并支持48kHz,训练数据通常要求10分钟以上。
STS比纯文字生成更能保留表演,但不会自动解决输入噪声、口误和版权问题。输入说话者与目标声音都要取得授权,直播场景还需要滥用检测和人工中止能力。
同步、HTTP与WebSocket流式API
同步接口一次返回完整音频,适合短句和离线任务;HTTP流式接口边生成边返回WAV数据,并在文件头中包含字素和音素时间戳;
WebSocket保持长连接,以更低延迟连续返回音频帧。
WebSocket当前面向Business及以上方案,默认通常允许集群20个并发会话和每个API Key 20个并行连接。并发不是每秒请求数,开发者仍要处理容量错误、退避重试、连接断开和audio_end结束消息。
实时语音Agent
Real-Time Agents可把Resemble声音与提示词、知识库、工具、Webhook和电话号码组合,用于客服、预约、销售、游戏NPC和交互式培训。系统支持Agent API、工具调用、知识库和电话接入。
实时代理的语音自然度不能替代事实可靠性。涉及账户、付款、医疗、法律或身份核验时,应限制工具权限、建立真人转接、确认敏感操作并保存可审计日志。
音频编辑、增强与转写
Audio Edit可对自有非市场声音生成的音频执行异步编辑,Audio Enhancement用于降噪和提升语音清晰度,Speech to Text可创建并查询转写任务。它们适合清理录音、制作字幕和重做局部旁白。
增强可能改变音色细节,转写也会误识别人名、数字和专业术语。关键记录应保留原始文件并人工校对,不能把处理结果当成无误证据。
Deepfake多模态检测
Resemble Detect面向音频、图片和视频,分析TTS、声音克隆、脸部替换和生成式图像等痕迹,可在上传文件、API或实时流程中给出置信结果和解释信息。当前DETECT-3B Omni被定位为覆盖三种媒体的企业检测模型。
检测结论是概率判断,压缩、剪辑、重录、新模型和对抗处理都可能造成误判。高风险场景不能只凭一个分数自动拒绝用户,应结合来源、身份验证、人工复核和申诉流程。
Resemble Intelligence与Meetings
Intelligence用于对检测结果提供更丰富的分析,Meetings可在会议中实时监测可疑媒体。Team包含会议分析能力,Business增加组织级日历集成和会议安全通知。
会议监测会涉及参会者音视频和元数据。组织应事先告知、限制保存期限并核对所在地区的录音、隐私和员工监控规则。
Identity身份搜索
Identity API可登记个人或品牌身份、关联参考媒体,并搜索上传内容是否匹配已登记对象,用于发现冒充、未经授权的声音或品牌素材。它可以成为KYC、内容审核和人才权益保护的一层信号。
身份相似不能单独证明欺诈,误匹配也可能影响真实用户。生产系统需要阈值校准、二次认证和人工复核,不能把身份搜索当作唯一生物识别结论。
PerTH水印与C2PA
Resemble Watermarker可为媒体编码和解码不可感知标记,PerTH项目则专注音频神经水印,目标是在压缩和常见编辑后仍能检测来源。平台也支持检查SynthID及签署C2PA记录。
水印适合证明已标记内容的来源,但没有检测到水印不代表文件一定是真实的,因为第三方工具可能从未嵌入兼容标记。最佳实践是将水印、内容凭证、Deepfake检测和发布记录组合使用。
Flex免费按量方案
Flex订阅费为0美元,无需信用卡,包含1个团队席位、平台和API、音频图片视频检测、检测解释、身份登记、会议实时检测、SynthID检查和C2PA签名。用户预充Credits后按实际处理量付费,没有最低承诺,Flex Credits当前不会过期。
0美元指没有月订阅费,并不表示所有处理免费。生成语音、检测、身份搜索和水印会按对应费率消耗余额,购买前应在控制台确认未列在公开页中的生成类费率。
价格与版本对比
| 套餐或版本 | 价格、额度与核心权益 |
|---|---|
| Team价格 | Team月付350美元;年付月均280美元,全年3360美元,相比月付全年节省840美元。它包含5个席位、Flex全部能力、部分服务更低用量单价、会议Intelligence、大文件和批量上传。Team适合把检测投入生产的中型团队,但不含SSO、组织级会议日历和企业SLA。年付折扣需要一次性承担年度承诺。 |
| Business价格 | Business月付1000美元;年付月均800美元,全年9600美元,相比月付全年节省2400美元。它包含20个席位、可随部署调整的配置、组织级日历集成、会议安全通知和SSO。Business也是声音克隆API和WebSocket流式语音的当前准入等级。若月支出超过1000美元、需要更高并发或本地部署,官方建议联系销售评估企业批量价格。 |
| 检测与安全处理价格 | Flex中音频和图片Detect均为每秒0.035美元,视频Detect为每秒0.07美元,Intelligence为每秒0.025美元。Team和Business中音频、图片Detect均为每秒0.015美元,视频为每秒0.03美元,Intelligence为每秒0.015美元。Identity搜索为每次调用0.0005美元,Watermarker编码为每次0.0005美元,解码为每次0.0002美元,这三项在Flex、Team和Business当前同价。图片按“每秒”显示是官方价格表的计费展示方式,实际账单单位和文件换算应以控制台为准。 |
| 托管语音生成价格如何看? | 当前公开价格页主要展示生成式媒体安全方案及处理费,没有在同一表格公开列出Resemble Ultra TTS、克隆、STS和Agent的完整用量单价。因此目录不应沿用旧博客或历史套餐的每秒生成价格。需要语音生成的用户应注册Flex查看实时Rates,或让销售按语言、时长、并发和部署方式报价。预算时要把生成、流式主机、克隆、Agent电话和安全检测分开核算。 |
Team价格
Team月付350美元;年付月均280美元,全年3360美元,相比月付全年节省840美元。
它包含5个席位、Flex全部能力、部分服务更低用量单价、会议Intelligence、大文件和批量上传。
Team适合把检测投入生产的中型团队,但不含SSO、组织级会议日历和企业SLA。年付折扣需要一次性承担年度承诺。
Business价格
Business月付1000美元;年付月均800美元,全年9600美元,相比月付全年节省2400美元。
它包含20个席位、可随部署调整的配置、组织级日历集成、会议安全通知和SSO。
Business也是声音克隆API和WebSocket流式语音的当前准入等级。若月支出超过1000美元、需要更高并发或本地部署,官方建议联系销售评估企业批量价格。
Enterprise企业方案
Enterprise定制报价,可提供容量折扣、企业SLA、定制模型训练、本地部署、专属支持、SOC 2文档和自定义席位。高并发、数据隔离、私有云或气隙环境通常需要企业合同。
本地部署并非公开订阅自动包含,采购时应书面确认模型、检测模态、硬件、更新频率、日志留存、支持响应和许可证范围。
检测与安全处理价格
Flex中音频和图片Detect均为每秒0.035美元,视频Detect为每秒0.07美元,Intelligence为每秒0.025美元。Team和Business中音频、图片Detect均为每秒0.015美元,视频为每秒0.03美元,Intelligence为每秒0.015美元。
Identity搜索为每次调用0.0005美元,Watermarker编码为每次0.0005美元,解码为每次0.0002美元,这三项在Flex、Team和Business当前同价。图片按“每秒”显示是官方价格表的计费展示方式,实际账单单位和文件换算应以控制台为准。
托管语音生成价格如何看?
当前公开价格页主要展示生成式媒体安全方案及处理费,没有在同一表格公开列出Resemble Ultra TTS、克隆、STS和Agent的完整用量单价。因此目录不应沿用旧博客或历史套餐的每秒生成价格。
需要语音生成的用户应注册Flex查看实时Rates,或让销售按语言、时长、并发和部署方式报价。预算时要把生成、流式主机、克隆、Agent电话和安全检测分开核算。
Chatterbox开源模型
Resemble AI在GitHub公开Chatterbox语音模型系列。当前仓库包含350M参数、面向低延迟英文和表演标签的Chatterbox Turbo;
110M参数、可在CPU和受限设备运行的Nano;以及500M参数、支持中文在内23种语言的Multilingual V3和多种单语言微调包。
Chatterbox代码与模型采用MIT许可证,可用于个人、研究和商业项目,也可在闭源产品中自托管,但仍须保留许可证通知并遵守适用法律和声音同意要求。托管平台的Resemble Ultra与开源Chatterbox是两条产品线,当前官方文档还明确将旧托管Chatterbox版本列为停止服务。
PerTH与Resemble Enhance开源项目
官方GitHub还公开MIT许可的PerTH音频水印工具,以及用于降噪和增强的Resemble Enhance。开发者可本地测试水印提取与音频处理,但这不代表Detect、Identity、Meetings和托管平台整体开源。
开源示例和部分旧SDK可能已停止维护,例如官方Go SDK已标记弃用。新项目应以当前API文档和Client Libraries页面为准,并在升级前锁定版本与执行回归测试。
Resemble AI使用教程
完成一次基础任务
- 注册Resemble AI并创建仅用于测试环境的API Key;
- 根据输入类型、上下文、质量、速度和价格选择模型;
- 先调用Resemble Ultra文字转语音完成最小请求并检查返回结构;
- 再用声音克隆测试流式输出、参数和异常响应;
- 记录Tokens、调用次数、延迟、错误率和单次成本;
- 把密钥移入服务端密钥管理器后再接入正式应用;
建立可复用的专业工作流
- 为开发、测试和生产环境使用不同密钥与额度;
- 按Resemble Ultra文字转语音、声音克隆和Voice Design声音设计建立代表性评测集;
- 设置超时、并发、重试、限流和预算上限;
- 对输出执行事实、安全、格式和敏感信息检查;
- 监控模型版本、价格、延迟和失败率变化;
- 准备降级模型、熔断和人工接管方案;
适合哪些用户?
- 需要品牌声音、游戏角色和多语言旁白的内容团队;
- 构建低延迟语音Agent、客服和互动应用的开发者;
- 审核音频、图片和视频真伪的安全与风控团队;
- 保护演员、品牌和高管身份不被冒充的组织;
- 希望自托管MIT语音模型的研究与工程团队。
产品优势
- 把语音生成、身份、水印和Deepfake检测整合在同一平台;
- Resemble Ultra覆盖同步及两种流式TTS;
- 支持快速声音克隆、Voice Design与语音转语音;
- 检测覆盖音频、图片和视频,并提供解释信息;
- Flex没有月订阅费,Credits当前不会过期;
- Chatterbox、PerTH和Enhance提供可自托管开源选择。
限制与注意事项
- 当前公开价格重点已经转向安全产品,托管语音生成完整单价需要在控制台核对;
- VoiceCloningAPI、WebSocket和部分生产能力要求Business及以上,入门用户不能假定0美元Flex开放全部语音接口;
- Deepfake检测会误报和漏报,水印缺失也不能证明内容真实;
- 克隆与STS必须取得声音授权;
- 开源Chatterbox的MIT许可证不免除隐私、肖像、声音人格权和反冒充义务;
常见问题
Resemble AI免费吗?
有0美元/月的Flex方案,不收订阅费并采用预充Credits按量付费。Credits当前不会过期,但实际生成、检测和水印调用仍会收费。
Resemble AI多少钱?
Team为350美元/月或年付月均280美元;Business为1000美元/月或年付月均800美元;
Enterprise定制。Flex没有月费。
可以克隆自己的声音吗?
可以,约10秒清晰录音即可建立快速克隆,但API当前要求Business或更高方案,并必须取得说话者同意。
能检测视频和图片Deepfake吗?
可以。Detect目前覆盖音频、图片和视频,并可结合Intelligence、Identity、会议监测和水印;
结果仍需按风险进行人工复核。
Resemble AI开源吗?
托管平台与Ultra模型不是整体开源;官方Chatterbox语音模型、PerTH水印和Resemble Enhance以开源项目提供,其中Chatterbox与PerTH采用MIT许可证。
桂公网安备45132202000164号