Resemble AI
免费增值
AI工具大全 AI音频工具

Resemble AI

提供声音克隆、生成、检测和企业API的音频平台

标签:

Resemble AI是什么?

Resemble AI是一套同时覆盖AI语音生成和生成式媒体安全的平台。创作与开发能力包括文字转语音、声音克隆、文字设计声音、语音转语音、语音转写、音频编辑增强和实时语音Agent;

安全能力则包括音频、图片和视频Deepfake检测、检测解释、会议实时分析、身份登记与匹配、C2PA签名和不可感知水印。

产品定位已从单纯的AI配音工具扩展为“生成、验证、检测”一体化平台。内容团队可以制作品牌声音和多语言旁白,开发者可以用API接入实时语音,安全团队则可把可疑媒体送入检测流程并保留审计结果。

Resemble Ultra文字转语音

Resemble Ultra是当前托管平台为新建和升级声音使用的默认文字转语音模型,支持同步生成、HTTP流式和WebSocket流式输出。API会根据voice_uuid自动选择关联模型,开发者不应把resemble-ultra作为普通model参数强行传入。

旧版托管Chatterbox、Chatterbox Turbo、Chatterbox Multilingual及更早TTS版本已被官方文档列为停止服务,仍绑定旧模型的声音需要升级到Ultra才能继续生成。迁移前应重新验证音质、发音、延迟和项目兼容性。

声音克隆

声音克隆可从约10秒清晰录音建立可复用声音。API既可以一次上传完整音频并训练,也可以创建声音后分批上传录音,再通过回调接收训练完成通知。

克隆API当前要求Business或更高方案。

短样本能快速建立声音,但环境噪声、音乐、混响、多人重叠和过度压缩会降低相似度。任何真人声音都必须取得本人明确同意,并约定可使用场景、期限、团队成员、模型删除和衍生内容范围。

Voice Design声音设计

Voice Design不需要真人录音。用户用文字描述年龄、口音、语气、风格和角色用途,系统生成3个候选声音,试听后把选中的候选转成可用于TTS的voice_uuid。

声音设计适合虚构角色、原型和无法录制真人的项目,但不能保证候选声线与现实人物完全无关。品牌和游戏项目仍应进行相似性检查,并保存最终候选和生成参数。

Speech-to-Speech语音转语音

语音转语音会把输入录音的节奏、语调和表演转换到目标声音,适合实时角色、游戏、配音修订和语音代理。当前文档列出Core STS v2和v1,其中v2提升音高跟踪并支持48kHz,训练数据通常要求10分钟以上。

STS比纯文字生成更能保留表演,但不会自动解决输入噪声、口误和版权问题。输入说话者与目标声音都要取得授权,直播场景还需要滥用检测和人工中止能力。

同步、HTTP与WebSocket流式API

同步接口一次返回完整音频,适合短句和离线任务;HTTP流式接口边生成边返回WAV数据,并在文件头中包含字素和音素时间戳;

WebSocket保持长连接,以更低延迟连续返回音频帧。

WebSocket当前面向Business及以上方案,默认通常允许集群20个并发会话和每个API Key 20个并行连接。并发不是每秒请求数,开发者仍要处理容量错误、退避重试、连接断开和audio_end结束消息。

实时语音Agent

Real-Time Agents可把Resemble声音与提示词、知识库、工具、Webhook和电话号码组合,用于客服、预约、销售、游戏NPC和交互式培训。系统支持Agent API、工具调用、知识库和电话接入。

实时代理的语音自然度不能替代事实可靠性。涉及账户、付款、医疗、法律或身份核验时,应限制工具权限、建立真人转接、确认敏感操作并保存可审计日志。

音频编辑、增强与转写

Audio Edit可对自有非市场声音生成的音频执行异步编辑,Audio Enhancement用于降噪和提升语音清晰度,Speech to Text可创建并查询转写任务。它们适合清理录音、制作字幕和重做局部旁白。

增强可能改变音色细节,转写也会误识别人名、数字和专业术语。关键记录应保留原始文件并人工校对,不能把处理结果当成无误证据。

Deepfake多模态检测

Resemble Detect面向音频、图片和视频,分析TTS、声音克隆、脸部替换和生成式图像等痕迹,可在上传文件、API或实时流程中给出置信结果和解释信息。当前DETECT-3B Omni被定位为覆盖三种媒体的企业检测模型。

检测结论是概率判断,压缩、剪辑、重录、新模型和对抗处理都可能造成误判。高风险场景不能只凭一个分数自动拒绝用户,应结合来源、身份验证、人工复核和申诉流程。

Resemble Intelligence与Meetings

Intelligence用于对检测结果提供更丰富的分析,Meetings可在会议中实时监测可疑媒体。Team包含会议分析能力,Business增加组织级日历集成和会议安全通知。

会议监测会涉及参会者音视频和元数据。组织应事先告知、限制保存期限并核对所在地区的录音、隐私和员工监控规则。

Identity身份搜索

Identity API可登记个人或品牌身份、关联参考媒体,并搜索上传内容是否匹配已登记对象,用于发现冒充、未经授权的声音或品牌素材。它可以成为KYC、内容审核和人才权益保护的一层信号。

身份相似不能单独证明欺诈,误匹配也可能影响真实用户。生产系统需要阈值校准、二次认证和人工复核,不能把身份搜索当作唯一生物识别结论。

PerTH水印与C2PA

Resemble Watermarker可为媒体编码和解码不可感知标记,PerTH项目则专注音频神经水印,目标是在压缩和常见编辑后仍能检测来源。平台也支持检查SynthID及签署C2PA记录。

水印适合证明已标记内容的来源,但没有检测到水印不代表文件一定是真实的,因为第三方工具可能从未嵌入兼容标记。最佳实践是将水印、内容凭证、Deepfake检测和发布记录组合使用。

Flex免费按量方案

Flex订阅费为0美元,无需信用卡,包含1个团队席位、平台和API、音频图片视频检测、检测解释、身份登记、会议实时检测、SynthID检查和C2PA签名。用户预充Credits后按实际处理量付费,没有最低承诺,Flex Credits当前不会过期。

0美元指没有月订阅费,并不表示所有处理免费。生成语音、检测、身份搜索和水印会按对应费率消耗余额,购买前应在控制台确认未列在公开页中的生成类费率。

价格与版本对比

套餐或版本价格、额度与核心权益
Team价格Team月付350美元;年付月均280美元,全年3360美元,相比月付全年节省840美元。它包含5个席位、Flex全部能力、部分服务更低用量单价、会议Intelligence、大文件和批量上传。Team适合把检测投入生产的中型团队,但不含SSO、组织级会议日历和企业SLA。年付折扣需要一次性承担年度承诺。
Business价格Business月付1000美元;年付月均800美元,全年9600美元,相比月付全年节省2400美元。它包含20个席位、可随部署调整的配置、组织级日历集成、会议安全通知和SSO。Business也是声音克隆API和WebSocket流式语音的当前准入等级。若月支出超过1000美元、需要更高并发或本地部署,官方建议联系销售评估企业批量价格。
检测与安全处理价格Flex中音频和图片Detect均为每秒0.035美元,视频Detect为每秒0.07美元,Intelligence为每秒0.025美元。Team和Business中音频、图片Detect均为每秒0.015美元,视频为每秒0.03美元,Intelligence为每秒0.015美元。Identity搜索为每次调用0.0005美元,Watermarker编码为每次0.0005美元,解码为每次0.0002美元,这三项在Flex、Team和Business当前同价。图片按“每秒”显示是官方价格表的计费展示方式,实际账单单位和文件换算应以控制台为准。
托管语音生成价格如何看?当前公开价格页主要展示生成式媒体安全方案及处理费,没有在同一表格公开列出Resemble Ultra TTS、克隆、STS和Agent的完整用量单价。因此目录不应沿用旧博客或历史套餐的每秒生成价格。需要语音生成的用户应注册Flex查看实时Rates,或让销售按语言、时长、并发和部署方式报价。预算时要把生成、流式主机、克隆、Agent电话和安全检测分开核算。

Team价格

Team月付350美元;年付月均280美元,全年3360美元,相比月付全年节省840美元。

它包含5个席位、Flex全部能力、部分服务更低用量单价、会议Intelligence、大文件和批量上传。

Team适合把检测投入生产的中型团队,但不含SSO、组织级会议日历和企业SLA。年付折扣需要一次性承担年度承诺。

Business价格

Business月付1000美元;年付月均800美元,全年9600美元,相比月付全年节省2400美元。

它包含20个席位、可随部署调整的配置、组织级日历集成、会议安全通知和SSO。

Business也是声音克隆API和WebSocket流式语音的当前准入等级。若月支出超过1000美元、需要更高并发或本地部署,官方建议联系销售评估企业批量价格。

Enterprise企业方案

Enterprise定制报价,可提供容量折扣、企业SLA、定制模型训练、本地部署、专属支持、SOC 2文档和自定义席位。高并发、数据隔离、私有云或气隙环境通常需要企业合同。

本地部署并非公开订阅自动包含,采购时应书面确认模型、检测模态、硬件、更新频率、日志留存、支持响应和许可证范围。

检测与安全处理价格

Flex中音频和图片Detect均为每秒0.035美元,视频Detect为每秒0.07美元,Intelligence为每秒0.025美元。Team和Business中音频、图片Detect均为每秒0.015美元,视频为每秒0.03美元,Intelligence为每秒0.015美元。

Identity搜索为每次调用0.0005美元,Watermarker编码为每次0.0005美元,解码为每次0.0002美元,这三项在Flex、Team和Business当前同价。图片按“每秒”显示是官方价格表的计费展示方式,实际账单单位和文件换算应以控制台为准。

托管语音生成价格如何看?

当前公开价格页主要展示生成式媒体安全方案及处理费,没有在同一表格公开列出Resemble Ultra TTS、克隆、STS和Agent的完整用量单价。因此目录不应沿用旧博客或历史套餐的每秒生成价格。

需要语音生成的用户应注册Flex查看实时Rates,或让销售按语言、时长、并发和部署方式报价。预算时要把生成、流式主机、克隆、Agent电话和安全检测分开核算。

Chatterbox开源模型

Resemble AI在GitHub公开Chatterbox语音模型系列。当前仓库包含350M参数、面向低延迟英文和表演标签的Chatterbox Turbo;

110M参数、可在CPU和受限设备运行的Nano;以及500M参数、支持中文在内23种语言的Multilingual V3和多种单语言微调包。

Chatterbox代码与模型采用MIT许可证,可用于个人、研究和商业项目,也可在闭源产品中自托管,但仍须保留许可证通知并遵守适用法律和声音同意要求。托管平台的Resemble Ultra与开源Chatterbox是两条产品线,当前官方文档还明确将旧托管Chatterbox版本列为停止服务。

PerTH与Resemble Enhance开源项目

官方GitHub还公开MIT许可的PerTH音频水印工具,以及用于降噪和增强的Resemble Enhance。开发者可本地测试水印提取与音频处理,但这不代表Detect、Identity、Meetings和托管平台整体开源。

开源示例和部分旧SDK可能已停止维护,例如官方Go SDK已标记弃用。新项目应以当前API文档和Client Libraries页面为准,并在升级前锁定版本与执行回归测试。

Resemble AI使用教程

完成一次基础任务

  1. 注册Resemble AI并创建仅用于测试环境的API Key;
  2. 根据输入类型、上下文、质量、速度和价格选择模型;
  3. 先调用Resemble Ultra文字转语音完成最小请求并检查返回结构;
  4. 再用声音克隆测试流式输出、参数和异常响应;
  5. 记录Tokens、调用次数、延迟、错误率和单次成本;
  6. 把密钥移入服务端密钥管理器后再接入正式应用;

建立可复用的专业工作流

  1. 为开发、测试和生产环境使用不同密钥与额度;
  2. 按Resemble Ultra文字转语音、声音克隆和Voice Design声音设计建立代表性评测集;
  3. 设置超时、并发、重试、限流和预算上限;
  4. 对输出执行事实、安全、格式和敏感信息检查;
  5. 监控模型版本、价格、延迟和失败率变化;
  6. 准备降级模型、熔断和人工接管方案;

适合哪些用户?

  • 需要品牌声音、游戏角色和多语言旁白的内容团队;
  • 构建低延迟语音Agent、客服和互动应用的开发者;
  • 审核音频、图片和视频真伪的安全与风控团队;
  • 保护演员、品牌和高管身份不被冒充的组织;
  • 希望自托管MIT语音模型的研究与工程团队。

产品优势

  • 把语音生成、身份、水印和Deepfake检测整合在同一平台;
  • Resemble Ultra覆盖同步及两种流式TTS;
  • 支持快速声音克隆、Voice Design与语音转语音;
  • 检测覆盖音频、图片和视频,并提供解释信息;
  • Flex没有月订阅费,Credits当前不会过期;
  • Chatterbox、PerTH和Enhance提供可自托管开源选择。

限制与注意事项

  • 当前公开价格重点已经转向安全产品,托管语音生成完整单价需要在控制台核对;
  • VoiceCloningAPI、WebSocket和部分生产能力要求Business及以上,入门用户不能假定0美元Flex开放全部语音接口;
  • Deepfake检测会误报和漏报,水印缺失也不能证明内容真实;
  • 克隆与STS必须取得声音授权;
  • 开源Chatterbox的MIT许可证不免除隐私、肖像、声音人格权和反冒充义务;

常见问题

Resemble AI免费吗?

有0美元/月的Flex方案,不收订阅费并采用预充Credits按量付费。Credits当前不会过期,但实际生成、检测和水印调用仍会收费。

Resemble AI多少钱?

Team为350美元/月或年付月均280美元;Business为1000美元/月或年付月均800美元;

Enterprise定制。Flex没有月费。

可以克隆自己的声音吗?

可以,约10秒清晰录音即可建立快速克隆,但API当前要求Business或更高方案,并必须取得说话者同意。

能检测视频和图片Deepfake吗?

可以。Detect目前覆盖音频、图片和视频,并可结合Intelligence、Identity、会议监测和水印;

结果仍需按风险进行人工复核。

Resemble AI开源吗?

托管平台与Ultra模型不是整体开源;官方Chatterbox语音模型、PerTH水印和Resemble Enhance以开源项目提供,其中Chatterbox与PerTH采用MIT许可证。

©️版权声明:若无特殊声明,本站所有文章版权均归AI工具分享原创和所有,未经许可,任何个人、媒体、网站、团体不得转载、抄袭或以其他方式复制发表本站内容,或在非我站所属的服务器上建立镜像。否则,我站将依法保留追究相关法律责任的权利。

类似于Resemble AI的工具