Fish Audio是什么?
Fish Audio是一款面向内容创作、配音、本地化、实时语音产品和开发者集成的AI语音平台。用户可以在网页中输入脚本生成自然语音,也可以用短录音即时克隆声音、训练长期使用的声音模型、制作多人有声书、改变已有录音的音色,并完成转写、音乐与电影音效生成、音轨分离等处理。
平台当前以S2.1 Pro、S2 Pro和S1等语音模型为核心,同时提供REST API、WebSocket流式接口、Python与JavaScript SDK。网页会员和API余额是两套不同计费体系:会员按月发放Credits,API则主要按UTF-8字节、音频时长或成功请求量计费,购买前应先确定使用入口。
文字转语音
文字转语音支持80多种语言,可处理中文、英文及多语言混排。用户可以选择平台公开声音、自己的克隆声音或专业声音,调整语速、情绪与表演方式,并导出MP3、WAV、PCM或Opus等格式。
数字、日期、货币、缩写、品牌名和专业术语仍可能读错。正式项目应先制作发音测试集,将长脚本拆段试听,再统一专有名词和停顿规则。
S2.1 Pro语音模型
S2.1 Pro是当前推荐的生产模型,重点提升音质、首包延迟和吞吐量。它支持自然语言方向标签、多说话人对话、跨语言切换、即时声音克隆、流式音频和词级时间戳,适合语音代理、游戏角色、互动故事和大规模旁白。
官网展示的首段音频延迟约为100毫秒以内或70至90毫秒量级,但这属于特定硬件、地区、文本和网络条件下的指标,不等于所有请求都能达到。生产环境还要测量端到端网络、排队、播放器缓冲及并发限制。
S2 Pro与S1
S2 Pro是上一代模型,支持在方括号中使用自然语言描述情绪、语气和动作,也能一次生成多说话人对话。S1使用圆括号情绪标签,适合已有工作流兼容和特定声音效果。
不同模型对标签、语言、短句和复杂文本的表现不同。迁移模型时不能只替换名称,应重新检查音色相似度、节奏、敏感词、时间戳和单位成本。
即时声音克隆
即时克隆可从一段参考音频提取音色和说话风格,并把声音用于其他语言的语音生成。短样本适合快速试验,录音越干净、单人、无音乐且发音越稳定,结果通常越可靠。
声音相似不代表身份、情绪和口音能够完全复制。任何真人声音都应取得本人明确同意,并约定用途、期限、地域、可访问成员和删除方式;
不得用来冒充、诈骗或制作误导性声明。
增强与专业声音克隆
网页方案还区分增强克隆和Professional Voice。专业声音通常需要更规范的录音与训练流程,适合长期品牌声线、有声书和高一致性项目,并受会员中的专业声音槽位数量限制。
公开、私有和专业声音槽位不是生成分钟数。公开声音可能进入社区可发现范围,私有声音仅供账户或团队使用;
涉及演员、客户和未发布品牌声音时,应优先选择私有权限并检查共享设置。
Voice Design声音设计
Voice Design允许用文字描述年龄、音色、口音、速度、气质和用途,系统生成多个候选声音。它适合为虚构人物、广告和游戏快速探索声线,不需要先找到真人参考音频。
文字描述可能产生相近或不稳定结果。重要角色应保存参考音频和Voice ID,并验证候选声音是否与真实人物或受保护角色过度相似。
多人长音频与有声书
网页端可以组织多个角色和较长脚本,制作播客、对话、有声书和旁白项目。S2.1 Pro原生多人能力可在一次生成中切换说话人,减少后期拼接。
长文本容易积累重音、角色错位和响度差异。建议按章节生成,锁定每个角色的声音,并在最终导出前进行完整试听和响度标准化。
Voice Changer变声
Voice Changer把上传的录音转换为另一种声音,同时尽量保留原始节奏与表达。它适合把临时旁白替换成统一角色声线,也能用于跨语言或创意音频流程。
背景音乐、混响、重叠说话和强噪声会降低转换质量。变声不改变原录音的版权与同意要求,输入说话者和目标声音都必须具备合法授权。
音频转写
Fish Audio的ASR可把音频转为带分段时间戳的文本,便于字幕、检索和后续配音。API的transcribe-1当前按音频小时计费,并按秒向上取整。
多人重叠、方言、噪声和专有名词会影响准确率。法律、医疗、财务和公开字幕需要人工校对,不能把自动转写直接当作逐字证据。
音乐、音效与音频工具
网页应用还提供提示词生成音乐与电影音效、音轨分离及相关音频工具,适合给短视频、播客和游戏制作素材。不同工具的Credits消耗和商用边界可能不同,应在生成页核对。
AI生成不保证绝对无版权争议。发布前应保存生成记录,检查平台条款、样本相似度和目标发行渠道对AI音乐的要求。
Free免费方案
Free为0美元,无需信用卡,每月提供8000 Credits,按官网估算最多约7分钟生成;单次最多500字符,并包含3个公开声音槽位、标准生成速度、增强声音克隆和商业使用。
“最多7分钟”按约每分钟600至625 Credits估算,实际消耗会受模型、功能和设置影响。月度Credits不是永久余额,免费方案也不适合存放需要严格保密的声音。
价格与版本对比
| 套餐或版本 | 价格、额度与核心权益 |
|---|---|
| Plus价格 | Plus年度方案当前促销显示月均5.5美元、全年66美元,页面原价为15美元/月。每月提供250000 Credits,按基础消耗估算最多约200分钟;单次最多15000字符,包含无限公开声音、10个私有声音槽位、Voice Design、1个专业声音槽位、优先使用最新模型、增强克隆和商业使用。周年或年度折扣属于实时促销,结束后可能恢复原价。应以结算页的币种、税费、续费价格和账期为准。 |
| Pro价格 | Pro年度方案当前促销显示月均37.5美元、全年450美元,页面原价为100美元/月。每月提供2000000 Credits,最多约1620分钟、3个团队席位、单次30000字符、无限公开和私有声音槽位、5个专业声音槽位,并标注7天退款保证。退款保证应按购买渠道、使用量和当前退款规则判断,并非所有已大量消耗额度的订单都必然退款。团队应在正式采购前确认成员权限、项目共享和声音所有权。 |
| Max价格 | Max年度方案显示月均749美元、全年8988美元,页面同时列出999美元/月的原始或月付价格。每月提供25000000 Credits,估算最多约6250分钟、10个团队席位和15个专业声音槽位,适合高频生产团队。Max的Credits与标称分钟并非简单按统一比例换算,说明不同模型或工作流可能有差异。大批量客户应根据真实脚本做成本测试,而不是只按最大分钟数采购。 |
| API按量价格 | API没有强制月订阅或最低月消费。S2.1 Pro、S2 Pro和S1文字转语音当前均为每100万UTF-8字节15美元。 官方估算100万字节约等于18万英文单词或12小时语音,但中文字符通常占更多UTF-8字节,不能直接套用英文单词换算。ASR当前为每音频小时0.36美元,按秒向上取整;Voice Design每次成功请求0.01美元。失败、重试、长文本拆分和多版本生成都会改变最终成本。 |
Plus价格
Plus年度方案当前促销显示月均5.5美元、全年66美元,页面原价为15美元/月。每月提供250000 Credits,按基础消耗估算最多约200分钟;
单次最多15000字符,包含无限公开声音、10个私有声音槽位、Voice Design、1个专业声音槽位、优先使用最新模型、增强克隆和商业使用。
周年或年度折扣属于实时促销,结束后可能恢复原价。应以结算页的币种、税费、续费价格和账期为准。
Pro价格
Pro年度方案当前促销显示月均37.5美元、全年450美元,页面原价为100美元/月。每月提供2000000 Credits,最多约1620分钟、3个团队席位、单次30000字符、无限公开和私有声音槽位、5个专业声音槽位,并标注7天退款保证。
退款保证应按购买渠道、使用量和当前退款规则判断,并非所有已大量消耗额度的订单都必然退款。团队应在正式采购前确认成员权限、项目共享和声音所有权。
Max价格
Max年度方案显示月均749美元、全年8988美元,页面同时列出999美元/月的原始或月付价格。每月提供25000000 Credits,估算最多约6250分钟、10个团队席位和15个专业声音槽位,适合高频生产团队。
Max的Credits与标称分钟并非简单按统一比例换算,说明不同模型或工作流可能有差异。大批量客户应根据真实脚本做成本测试,而不是只按最大分钟数采购。
Enterprise企业方案
Enterprise按需报价,可提供年度或按量组织方案、批量折扣、零数据保留、私有化或本地部署、SOC 2相关企业能力和定制支持;SSO在当前比较页仍可能标为即将推出。
零数据保留和本地部署需要写入合同并核对覆盖范围,不能因为页面出现企业标签就默认所有输入、日志、备份和声音模型都不留存。
API按量价格
API没有强制月订阅或最低月消费。S2.1 Pro、S2 Pro和S1文字转语音当前均为每100万UTF-8字节15美元。
官方估算100万字节约等于18万英文单词或12小时语音,但中文字符通常占更多UTF-8字节,不能直接套用英文单词换算。
ASR当前为每音频小时0.36美元,按秒向上取整;Voice Design每次成功请求0.01美元。
失败、重试、长文本拆分和多版本生成都会改变最终成本。
S2.1 Pro Free API
s2.1-pro-free在公平使用政策下为0美元,支持83种语言,定位于测试、原型、开发和较小规模业务。它使用与S2.1 Pro相同的模型,但不提供首包延迟、数据处理协议或企业服务保证,免费开放期与规则也可能调整。
免费模型不等于无限制生产SLA。关键业务应准备付费模型、超时重试、熔断、缓存和替代供应商,并定期检查公平使用限制。
API并发等级
并发上限按账户累计预付金额分级:累计付费不足100美元的Starter通常为5并发;达到100美元的Elevated为15并发;
达到1000美元的High Volume为50并发;Enterprise按合同配置。
并发数不是每秒请求数,也不保证固定延迟。流式长请求会更久占用连接,开发者需要队列、限流、指数退避和可观测性。
REST、WebSocket与SDK
开发者可以通过REST发起普通生成,通过WebSocket接收流式音频,并使用官方Python和JavaScript SDK管理TTS、转写与声音模型。接口支持创建、列出、更新和删除声音,也可与LiveKit、Pipecat等实时语音框架集成。
API Key必须保存在服务端或密钥管理系统,不应写入网页、移动端包或公开仓库。生产系统还要验证文件类型、限制文本长度、记录请求ID,并处理流式连接断开。
GitHub与开源状态
Fish Audio网页平台、托管API、账户系统和社区声音市场不是完整开源产品。官方GitHub提供Fish Speech源码、模型相关资源、SDK和运维工具,但公开代码不等于可无条件商用。
当前Fish Speech主分支的代码和关联模型权重统一采用Fish Audio Research License。研究与非商业使用可按许可进行;
任何商业用途,包括企业内部运营、收费产品、托管服务或API,都需要另行取得Fish Audio书面商业许可。
旧页面中关于Apache或CC-BY-NC-SA的说明可能对应历史版本,判断时应以所使用版本随附的当前许可证为准。
本地部署
官方Fish Speech文档提供Linux或WSL安装、Docker、WebUI和API服务器方式,S2系列推理建议约24GB显存,也提供CPU路径。企业还可咨询VPC、本地、主权云或隔离网络部署。
能下载并运行模型不代表获得商业部署权。自托管还要承担GPU成本、模型安全、更新、滥用防护、日志与数据合规,商业项目必须先取得单独许可。
商业使用与声音授权
网页Free及付费方案当前都标注商业使用,但这一授权仅覆盖在遵守条款前提下使用服务生成的输出,不会替用户取得脚本、音乐、真人声音、角色、商标和其他上传素材的权利。
Hosted服务输出权利与Fish Speech研究许可证是两件事:通过会员或API生成商业内容,不表示可以把下载的模型权重用于商业自托管。敏感项目应保留同意书、声音来源和发布审核记录。
Fish Audio使用教程
完成一次基础任务
- 确认录音、声音、音乐及参与者授权;
- 把清晰音频上传或录入Fish Audio;
- 选择语言、说话人和文字转语音等处理设置;
- 使用S2.1 Pro语音模型生成转录、配音或清理结果;
- 逐段检查姓名、数字、停顿、音量和情绪;
- 导出前确认格式、响度、版权和隐私要求;
建立可复用的专业工作流
- 用真实噪声、口音和多人片段建立测试集;
- 比较文字转语音、S2.1 Pro语音模型和S2 Pro与S1的处理差异;
- 保留原始录音和未经修改的转录;
- 对外发布前安排人工听审;
- 统计处理时长、错误率和额度消耗;
- 定期更新术语表、声音授权和删除策略;
适合哪些用户?
- 制作视频旁白、播客、有声书和课程音频的创作者;
- 需要多语言配音、角色对话和本地化的内容团队;
- 希望快速建立品牌声音或游戏角色声音的企业;
- 构建Voice Agent、客服、陪伴应用和无障碍产品的开发者;
- 研究和评估可本地运行语音模型的技术团队。
产品优势
- 覆盖80多种语言并支持多语言自然切换;
- S2.1 Pro支持自然语言表演标签和原生多人对话;
- 网页端同时提供克隆、长音频、变声、转写和音频工具;
- REST、WebSocket、Python与JavaScript SDK较完整;
- 提供公平使用限制下的免费API模型;
- 既有托管服务,也有研究用途的可下载模型与企业部署选项。
限制与注意事项
- 网页Credits、API余额和自托管许可证相互独立,不能把会员分钟直接用于API;
- 促销价格、免费模型和公平使用政策可能变化,预算应以结算页和控制台为准;
- AI声音会出现发音、角色、情绪和相似度偏差;
- 声音克隆、变声和社区声音必须核验授权,重要内容需要人工试听;
- FishSpeech当前研究许可证不授予商业使用权;
常见问题
Fish Audio免费吗?
网页Free每月提供8000 Credits,最多约7分钟;API另有公平使用限制下的s2.1-pro-free模型,但没有生产SLA和数据处理协议保证。
Fish Audio多少钱?
当前年度促销中Plus为全年66美元,Pro为450美元,Max为8988美元;Enterprise定制。
促销和续费价会变化,以结算页为准。
API如何收费?
S2.1 Pro、S2 Pro和S1 TTS当前均为每100万UTF-8字节15美元;转写每音频小时0.36美元;
Voice Design每次成功请求0.01美元。
支持中文吗?
支持中文和80多种语言,也支持多语言混排。中文按UTF-8字节计费时不能直接套用英文单词估算。
可以克隆自己的声音吗?
可以使用即时、增强或专业克隆,但必须取得说话者明确授权,并根据隐私需求选择公开或私有声音槽位。
Fish Audio开源吗?
托管平台不是开源产品。Fish Speech源码和模型可公开获取,但当前采用Fish Audio Research License,研究和非商业使用可按许可进行,商业用途必须另获书面许可。
桂公网安备45132202000164号