Fish Audio
免费增值
AI工具大全 AI音频工具

Fish Audio

提供多语种文字转语音、声音克隆和API的语音平台

标签:

Fish Audio是什么?

Fish Audio是一款面向内容创作、配音、本地化、实时语音产品和开发者集成的AI语音平台。用户可以在网页中输入脚本生成自然语音,也可以用短录音即时克隆声音、训练长期使用的声音模型、制作多人有声书、改变已有录音的音色,并完成转写、音乐与电影音效生成、音轨分离等处理。

平台当前以S2.1 Pro、S2 Pro和S1等语音模型为核心,同时提供REST API、WebSocket流式接口、Python与JavaScript SDK。网页会员和API余额是两套不同计费体系:会员按月发放Credits,API则主要按UTF-8字节、音频时长或成功请求量计费,购买前应先确定使用入口。

文字转语音

文字转语音支持80多种语言,可处理中文、英文及多语言混排。用户可以选择平台公开声音、自己的克隆声音或专业声音,调整语速、情绪与表演方式,并导出MP3、WAV、PCM或Opus等格式。

数字、日期、货币、缩写、品牌名和专业术语仍可能读错。正式项目应先制作发音测试集,将长脚本拆段试听,再统一专有名词和停顿规则。

S2.1 Pro语音模型

S2.1 Pro是当前推荐的生产模型,重点提升音质、首包延迟和吞吐量。它支持自然语言方向标签、多说话人对话、跨语言切换、即时声音克隆、流式音频和词级时间戳,适合语音代理、游戏角色、互动故事和大规模旁白。

官网展示的首段音频延迟约为100毫秒以内或70至90毫秒量级,但这属于特定硬件、地区、文本和网络条件下的指标,不等于所有请求都能达到。生产环境还要测量端到端网络、排队、播放器缓冲及并发限制。

S2 Pro与S1

S2 Pro是上一代模型,支持在方括号中使用自然语言描述情绪、语气和动作,也能一次生成多说话人对话。S1使用圆括号情绪标签,适合已有工作流兼容和特定声音效果。

不同模型对标签、语言、短句和复杂文本的表现不同。迁移模型时不能只替换名称,应重新检查音色相似度、节奏、敏感词、时间戳和单位成本。

即时声音克隆

即时克隆可从一段参考音频提取音色和说话风格,并把声音用于其他语言的语音生成。短样本适合快速试验,录音越干净、单人、无音乐且发音越稳定,结果通常越可靠。

声音相似不代表身份、情绪和口音能够完全复制。任何真人声音都应取得本人明确同意,并约定用途、期限、地域、可访问成员和删除方式;

不得用来冒充、诈骗或制作误导性声明。

增强与专业声音克隆

网页方案还区分增强克隆和Professional Voice。专业声音通常需要更规范的录音与训练流程,适合长期品牌声线、有声书和高一致性项目,并受会员中的专业声音槽位数量限制。

公开、私有和专业声音槽位不是生成分钟数。公开声音可能进入社区可发现范围,私有声音仅供账户或团队使用;

涉及演员、客户和未发布品牌声音时,应优先选择私有权限并检查共享设置。

Voice Design声音设计

Voice Design允许用文字描述年龄、音色、口音、速度、气质和用途,系统生成多个候选声音。它适合为虚构人物、广告和游戏快速探索声线,不需要先找到真人参考音频。

文字描述可能产生相近或不稳定结果。重要角色应保存参考音频和Voice ID,并验证候选声音是否与真实人物或受保护角色过度相似。

多人长音频与有声书

网页端可以组织多个角色和较长脚本,制作播客、对话、有声书和旁白项目。S2.1 Pro原生多人能力可在一次生成中切换说话人,减少后期拼接。

长文本容易积累重音、角色错位和响度差异。建议按章节生成,锁定每个角色的声音,并在最终导出前进行完整试听和响度标准化。

Voice Changer变声

Voice Changer把上传的录音转换为另一种声音,同时尽量保留原始节奏与表达。它适合把临时旁白替换成统一角色声线,也能用于跨语言或创意音频流程。

背景音乐、混响、重叠说话和强噪声会降低转换质量。变声不改变原录音的版权与同意要求,输入说话者和目标声音都必须具备合法授权。

音频转写

Fish Audio的ASR可把音频转为带分段时间戳的文本,便于字幕、检索和后续配音。API的transcribe-1当前按音频小时计费,并按秒向上取整。

多人重叠、方言、噪声和专有名词会影响准确率。法律、医疗、财务和公开字幕需要人工校对,不能把自动转写直接当作逐字证据。

音乐、音效与音频工具

网页应用还提供提示词生成音乐与电影音效、音轨分离及相关音频工具,适合给短视频、播客和游戏制作素材。不同工具的Credits消耗和商用边界可能不同,应在生成页核对。

AI生成不保证绝对无版权争议。发布前应保存生成记录,检查平台条款、样本相似度和目标发行渠道对AI音乐的要求。

Free免费方案

Free为0美元,无需信用卡,每月提供8000 Credits,按官网估算最多约7分钟生成;单次最多500字符,并包含3个公开声音槽位、标准生成速度、增强声音克隆和商业使用。

“最多7分钟”按约每分钟600至625 Credits估算,实际消耗会受模型、功能和设置影响。月度Credits不是永久余额,免费方案也不适合存放需要严格保密的声音。

价格与版本对比

套餐或版本价格、额度与核心权益
Plus价格Plus年度方案当前促销显示月均5.5美元、全年66美元,页面原价为15美元/月。每月提供250000 Credits,按基础消耗估算最多约200分钟;单次最多15000字符,包含无限公开声音、10个私有声音槽位、Voice Design、1个专业声音槽位、优先使用最新模型、增强克隆和商业使用。周年或年度折扣属于实时促销,结束后可能恢复原价。应以结算页的币种、税费、续费价格和账期为准。
Pro价格Pro年度方案当前促销显示月均37.5美元、全年450美元,页面原价为100美元/月。每月提供2000000 Credits,最多约1620分钟、3个团队席位、单次30000字符、无限公开和私有声音槽位、5个专业声音槽位,并标注7天退款保证。退款保证应按购买渠道、使用量和当前退款规则判断,并非所有已大量消耗额度的订单都必然退款。团队应在正式采购前确认成员权限、项目共享和声音所有权。
Max价格Max年度方案显示月均749美元、全年8988美元,页面同时列出999美元/月的原始或月付价格。每月提供25000000 Credits,估算最多约6250分钟、10个团队席位和15个专业声音槽位,适合高频生产团队。Max的Credits与标称分钟并非简单按统一比例换算,说明不同模型或工作流可能有差异。大批量客户应根据真实脚本做成本测试,而不是只按最大分钟数采购。
API按量价格API没有强制月订阅或最低月消费。S2.1 Pro、S2 Pro和S1文字转语音当前均为每100万UTF-8字节15美元。 官方估算100万字节约等于18万英文单词或12小时语音,但中文字符通常占更多UTF-8字节,不能直接套用英文单词换算。ASR当前为每音频小时0.36美元,按秒向上取整;Voice Design每次成功请求0.01美元。失败、重试、长文本拆分和多版本生成都会改变最终成本。

Plus价格

Plus年度方案当前促销显示月均5.5美元、全年66美元,页面原价为15美元/月。每月提供250000 Credits,按基础消耗估算最多约200分钟;

单次最多15000字符,包含无限公开声音、10个私有声音槽位、Voice Design、1个专业声音槽位、优先使用最新模型、增强克隆和商业使用。

周年或年度折扣属于实时促销,结束后可能恢复原价。应以结算页的币种、税费、续费价格和账期为准。

Pro价格

Pro年度方案当前促销显示月均37.5美元、全年450美元,页面原价为100美元/月。每月提供2000000 Credits,最多约1620分钟、3个团队席位、单次30000字符、无限公开和私有声音槽位、5个专业声音槽位,并标注7天退款保证。

退款保证应按购买渠道、使用量和当前退款规则判断,并非所有已大量消耗额度的订单都必然退款。团队应在正式采购前确认成员权限、项目共享和声音所有权。

Max价格

Max年度方案显示月均749美元、全年8988美元,页面同时列出999美元/月的原始或月付价格。每月提供25000000 Credits,估算最多约6250分钟、10个团队席位和15个专业声音槽位,适合高频生产团队。

Max的Credits与标称分钟并非简单按统一比例换算,说明不同模型或工作流可能有差异。大批量客户应根据真实脚本做成本测试,而不是只按最大分钟数采购。

Enterprise企业方案

Enterprise按需报价,可提供年度或按量组织方案、批量折扣、零数据保留、私有化或本地部署、SOC 2相关企业能力和定制支持;SSO在当前比较页仍可能标为即将推出。

零数据保留和本地部署需要写入合同并核对覆盖范围,不能因为页面出现企业标签就默认所有输入、日志、备份和声音模型都不留存。

API按量价格

API没有强制月订阅或最低月消费。S2.1 Pro、S2 Pro和S1文字转语音当前均为每100万UTF-8字节15美元。

官方估算100万字节约等于18万英文单词或12小时语音,但中文字符通常占更多UTF-8字节,不能直接套用英文单词换算。

ASR当前为每音频小时0.36美元,按秒向上取整;Voice Design每次成功请求0.01美元。

失败、重试、长文本拆分和多版本生成都会改变最终成本。

S2.1 Pro Free API

s2.1-pro-free在公平使用政策下为0美元,支持83种语言,定位于测试、原型、开发和较小规模业务。它使用与S2.1 Pro相同的模型,但不提供首包延迟、数据处理协议或企业服务保证,免费开放期与规则也可能调整。

免费模型不等于无限制生产SLA。关键业务应准备付费模型、超时重试、熔断、缓存和替代供应商,并定期检查公平使用限制。

API并发等级

并发上限按账户累计预付金额分级:累计付费不足100美元的Starter通常为5并发;达到100美元的Elevated为15并发;

达到1000美元的High Volume为50并发;Enterprise按合同配置。

并发数不是每秒请求数,也不保证固定延迟。流式长请求会更久占用连接,开发者需要队列、限流、指数退避和可观测性。

REST、WebSocket与SDK

开发者可以通过REST发起普通生成,通过WebSocket接收流式音频,并使用官方Python和JavaScript SDK管理TTS、转写与声音模型。接口支持创建、列出、更新和删除声音,也可与LiveKit、Pipecat等实时语音框架集成。

API Key必须保存在服务端或密钥管理系统,不应写入网页、移动端包或公开仓库。生产系统还要验证文件类型、限制文本长度、记录请求ID,并处理流式连接断开。

GitHub与开源状态

Fish Audio网页平台、托管API、账户系统和社区声音市场不是完整开源产品。官方GitHub提供Fish Speech源码、模型相关资源、SDK和运维工具,但公开代码不等于可无条件商用。

当前Fish Speech主分支的代码和关联模型权重统一采用Fish Audio Research License。研究与非商业使用可按许可进行;

任何商业用途,包括企业内部运营、收费产品、托管服务或API,都需要另行取得Fish Audio书面商业许可。

旧页面中关于Apache或CC-BY-NC-SA的说明可能对应历史版本,判断时应以所使用版本随附的当前许可证为准。

本地部署

官方Fish Speech文档提供Linux或WSL安装、Docker、WebUI和API服务器方式,S2系列推理建议约24GB显存,也提供CPU路径。企业还可咨询VPC、本地、主权云或隔离网络部署。

能下载并运行模型不代表获得商业部署权。自托管还要承担GPU成本、模型安全、更新、滥用防护、日志与数据合规,商业项目必须先取得单独许可。

商业使用与声音授权

网页Free及付费方案当前都标注商业使用,但这一授权仅覆盖在遵守条款前提下使用服务生成的输出,不会替用户取得脚本、音乐、真人声音、角色、商标和其他上传素材的权利。

Hosted服务输出权利与Fish Speech研究许可证是两件事:通过会员或API生成商业内容,不表示可以把下载的模型权重用于商业自托管。敏感项目应保留同意书、声音来源和发布审核记录。

Fish Audio使用教程

完成一次基础任务

  1. 确认录音、声音、音乐及参与者授权;
  2. 把清晰音频上传或录入Fish Audio;
  3. 选择语言、说话人和文字转语音等处理设置;
  4. 使用S2.1 Pro语音模型生成转录、配音或清理结果;
  5. 逐段检查姓名、数字、停顿、音量和情绪;
  6. 导出前确认格式、响度、版权和隐私要求;

建立可复用的专业工作流

  1. 用真实噪声、口音和多人片段建立测试集;
  2. 比较文字转语音、S2.1 Pro语音模型和S2 Pro与S1的处理差异;
  3. 保留原始录音和未经修改的转录;
  4. 对外发布前安排人工听审;
  5. 统计处理时长、错误率和额度消耗;
  6. 定期更新术语表、声音授权和删除策略;

适合哪些用户?

  • 制作视频旁白、播客、有声书和课程音频的创作者;
  • 需要多语言配音、角色对话和本地化的内容团队;
  • 希望快速建立品牌声音或游戏角色声音的企业;
  • 构建Voice Agent、客服、陪伴应用和无障碍产品的开发者;
  • 研究和评估可本地运行语音模型的技术团队。

产品优势

  • 覆盖80多种语言并支持多语言自然切换;
  • S2.1 Pro支持自然语言表演标签和原生多人对话;
  • 网页端同时提供克隆、长音频、变声、转写和音频工具;
  • REST、WebSocket、Python与JavaScript SDK较完整;
  • 提供公平使用限制下的免费API模型;
  • 既有托管服务,也有研究用途的可下载模型与企业部署选项。

限制与注意事项

  • 网页Credits、API余额和自托管许可证相互独立,不能把会员分钟直接用于API;
  • 促销价格、免费模型和公平使用政策可能变化,预算应以结算页和控制台为准;
  • AI声音会出现发音、角色、情绪和相似度偏差;
  • 声音克隆、变声和社区声音必须核验授权,重要内容需要人工试听;
  • FishSpeech当前研究许可证不授予商业使用权;

常见问题

Fish Audio免费吗?

网页Free每月提供8000 Credits,最多约7分钟;API另有公平使用限制下的s2.1-pro-free模型,但没有生产SLA和数据处理协议保证。

Fish Audio多少钱?

当前年度促销中Plus为全年66美元,Pro为450美元,Max为8988美元;Enterprise定制。

促销和续费价会变化,以结算页为准。

API如何收费?

S2.1 Pro、S2 Pro和S1 TTS当前均为每100万UTF-8字节15美元;转写每音频小时0.36美元;

Voice Design每次成功请求0.01美元。

支持中文吗?

支持中文和80多种语言,也支持多语言混排。中文按UTF-8字节计费时不能直接套用英文单词估算。

可以克隆自己的声音吗?

可以使用即时、增强或专业克隆,但必须取得说话者明确授权,并根据隐私需求选择公开或私有声音槽位。

Fish Audio开源吗?

托管平台不是开源产品。Fish Speech源码和模型可公开获取,但当前采用Fish Audio Research License,研究和非商业使用可按许可进行,商业用途必须另获书面许可。

©️版权声明:若无特殊声明,本站所有文章版权均归AI工具分享原创和所有,未经许可,任何个人、媒体、网站、团体不得转载、抄袭或以其他方式复制发表本站内容,或在非我站所属的服务器上建立镜像。否则,我站将依法保留追究相关法律责任的权利。

类似于Fish Audio的工具