Fish Audio
免費增值
AI工具大全 AI音頻工具

Fish Audio

提供多語種文字轉語音、聲音克隆和API的語音平台

標籤:

Fish Audio是什麼?

Fish Audio是一個面向內容創作、配音、本地化、即時語音產品以及開發者整合的AI語音平台。使用者可以在網頁上輸入腳本來產生自然語音,也可以利用短暫的錄音來即時複製聲音、訓練可長期使用的聲音模型、製作多人有聲書、改變既有錄音的音色,同時還能進行轉寫、音樂與電影音效的生成、音軌分離等處理。

平台目前以S2.1 Pro、S2 Pro和S1等語音模型為核心,同時提供REST API、WebSocket流式接口、Python與JavaScript SDK。網頁會員和API餘額是兩套不同的計費體系:會員按月發放Credits,API則主要按UTF-8字節、音頻時長或成功請求量計費,購買前應先確定使用入口。

文字轉語音

文字轉語音支援80多種語言,可處理中文、英文及多語言混排。使用者可以選擇平台公開的聲音、自己的克隆聲音或專業聲音,調整語速、情緒與表演方式,並導出MP3、WAV、PCM或Opus等格式。

數字、日期、貨幣、縮寫、品牌名及專業術語仍可能讀錯。正式項目應先製作發音測試集,將長腳本拆段試聽,再統一專有名詞和停頓規則。

S2.1 Pro語音模型

S2.1 Pro是目前推薦的生產模型,重點在提升音質、首包延遲以及吞吐量。它支援自然語言方向標籤、多說話人對話、跨語言切換、即時聲音克隆、流式音頻以及詞級時間戳,適用於語音代理人、遊戲角色、互動故事以及大規模旁白等場景。

官網上展示的首段音頻延遲約在100毫秒以內,或是70至90毫秒左右,但這些數值是針對特定硬體、地區、文本以及網路條件所測得的數值,並不代表所有請求都能達到這樣的延遲水準。在實際使用環境中,還需要考慮端到端的網路延遲、排隊情況、播放器的緩衝能力以及同時處理多個請求的限制等因素。

S2 Pro與S1

S2 Pro是上一代產品,它支援在方括號中以自然語言來描述情緒、語氣和動作,同時也能一次生成多個說話人的對話。而S1則使用圓括號來標示情緒,這種方式適用於那些已有的工作流程,以及需要特定聲音效果的情境。

不同模型對標籤、語言、短句和複雜文本的表現不同。遷移模型時不能只替換名稱,應重新檢查音色相似度、節奏、敏感詞、時間戳和單位成本。

即時聲音克隆

即時克隆可從一段參考音頻中提取音色和說話風格,並將其用於其他語言的語音生成。短樣本適合快速試驗,錄音越乾淨、為單人發聲、沒有背景音樂且發音越穩定,結果通常越可靠。

聲音相似並不代表身份、情緒和口音能夠完全複製。任何真人的聲音都應取得本人的明確同意,並約定用途、期限、地區、可訪問的成員以及刪除方式;

不得用來冒充、詐騙或製作誤導性聲明。

增強與專業聲音克隆

網頁方案還區分增強克隆和專業聲音。專業聲音通常需要更規範的錄音與訓練流程,適合長期品牌聲線、有聲書以及需要高度一致性的專案,且其數量會受到會員中專業聲音槽位數量的限制。

公開、私有及專業的聲音槽位並非用於計算分鐘數。公開聲音可能會出現在社區的可搜尋範圍內,而私有聲音則僅供帳戶或團隊使用;

涉及演員、客戶和未發布的品牌聲音時,應優先選擇私有權限並檢查共享設定。

Voice Design聲音設計

Voice Design允許用文字描述年齡、音色、口音、速度、氣質和用途,系統會生成多個候選聲音。它適合用於為虛構人物、廣告和遊戲快速探索聲線,無需先找到真人的參考音頻。

文字描述可能產生相近或不穩定的結果。重要角色應保存參考音頻和Voice ID,並驗證候選聲音是否與真實人物或受保護角色過度相似。

多人長音頻與有聲書

網頁端可以組織多個角色和較長的腳本,製作播客、對話、有聲書和旁白專案。S2.1 Pro原生多人功能可讓在一次性生成過程中切換說話人,減少後期拼接的工作量。

長文本容易累積重音、角色錯位和響度差異。建議按章節生成,鎖定每個角色的聲音,並在最終導出前進行完整試聽和響度標準化。

Voice Changer變聲

Voice Changer能將上傳的錄音轉換為另一種聲音,同時盡量保留原有的節奏與表達方式。它適合用來將臨時的旁白替換成統一的角色的聲線,也可用於跨語言或創意音頻製作中。

背景音樂、混響、重疊的說話聲以及強大的噪音都會降低轉換品質。變聲功能並不會改變原始錄音的版權及使用限制,無論是輸入的說話者還是目標聲音,都必須具有合法的授權。

音頻轉寫

Fish Audio的ASR可把音頻轉為帶有分段時間戳的文本,便於字幕、檢索和後續配音。API的transcribe-1目前按音頻小時計費,並按秒向上取整。

多人重疊、方言、雜音和專有名詞會影響準確率。法律、醫療、財務和公開字幕需要人工校對,不能把自動轉寫直接當作逐字證據。

音樂、音效與音頻工具

網頁應用還提供提示詞生成音樂與電影音效、音軌分離以及相關的音頻工具,適合用於短影片、播客和遊戲的素材製作。不同工具的Credits消耗量及商用限制可能有所不同,應在生成頁面中仔細核對。

AI生成不保證絕對無版權爭議。發布前應保存生成記錄,檢查平台條款、樣本相似度及目標發行渠道對AI音樂的要求。

Free免費方案

免費版為0美元,無需信用卡,每月提供8000點數值,根據官網估計,最多約7分鐘即可完成生成;單次最多可輸入500個字元,並包含3個公開音效槽位、標準生成速度、增強型音效克隆功能,以及商業使用權。

「最多7分鐘」,按約每分鐘600至625 Credits估算,實際消耗會受模型、功能及設定影響。月度Credits並非永久餘額,免費方案也不適合儲存需要嚴格保密的聲音。

價格與版本對比

套餐或版本價格、額度與核心權益
Plus價格Plus年度方案的現行促銷價格為每月5.5美元,全年則為66美元;而頁面上的原價則為每月15美元。每個月可獲得250,000個Credit點數,根據基本使用量來估算,大約可以使用200分鐘;單次最多可輸入15,000個字元。此外,還包含無限的公共音效、10個私人音效槽位、Voice Design功能、1個專業音效槽位,以及優先使用最新模型的權益,同時還支持克隆功能及商業用途。周年或年度折扣屬於即時促銷活動,活動結束後價格可能會恢復原價。最終的費用應以結帳頁面上的貨幣類型、稅金、續費價格及付款期限為準。
Pro價格Pro年度方案的現行促銷價格為每月37.5美元,全年則為450美元;而頁面上的原價則為每月100美元。該方案每月提供2,000,000個點數,相當於約1620分鐘的使用時間,此外還包含3個團隊席位、每次可發送30,000個字元的訊息量,以及無限的公開和私密語音通道。另外,還有5個專業語音通道可用。該方案還提供7天的退款保證。不過,退款的條件需根據購買途徑、使用量以及當前的退款規則來判定,並非所有已大量消耗點數的訂單都一定可以退款。團隊在正式購買之前,應先確認成員的權限、資料共享方式以及語音內容的所有權問題。
Max價格Max年度方案顯示,每月的平均費用為749美元,全年則為8988美元。頁面上同時也列出了999美元/月的原始價格或按月支付的價格。每個月可獲得25000000個Credit,這相當於約6250分鐘的使用時間,此外還有10個團隊席位以及15個專業音效槽位,因此很適合需要高頻率進行工作的團隊。Max的Credit數量與所對應的分鐘數並非按照固定比例換算的,因此不同模型或工作流程下,其數值可能會有所差異。大量採購的客戶應根據實際的腳本內容來估算成本,而非僅根據最大的分鐘數來決定購買量。
API按量價格API並不要求必須訂閱月度服務,也沒有最低的月度消費額限制。目前,S2.1 Pro、S2 Pro和S1文字轉語音服務的費用為每100萬UTF-8字節15美元。 官方估計,100萬個字約相當於18萬個英文單詞,或12小時的語音播放時間;不過,中文字符所佔用的UTF-8字節數通常更多,因此無法直接用英文單詞來換算。目前,ASR服務的費用為每小時0.36美元,且費用會按秒向上取整;而Voice Design服務則是每次成功處理一個請求需支付0.01美元。如果出現失敗、需要重試,或是處理長文本或多個版本時,最終的費用也會有所變化。

Plus價格

Plus年度方案的現行促銷價格為每月5.5美元,全年則為66美元,而頁面的原價為每月15美元。每個月可獲得250000個Credits,根據基本使用量來估算,大約可使用200分鐘左右。

單次最多15000字元,包含無限公開聲音、10個私有聲音槽位、Voice Design、1個專業聲音槽位、優先使用最新模型、增強克隆及商業使用。

週年或年度折扣屬於即時促銷,結束後可能恢復原價。應以結算頁面的貨幣種類、稅費、續費價格及帳期為準。

Pro價格

Pro年度方案的現行促銷價格為每月37.5美元,全年則為450美元;而頁面上的原價則為每月100美元。該方案每個月提供2,000,000點數值,相當於約1620分鐘的使用時間,此外還包含3個團隊席位、每次可輸入30,000個字元,以及無限的公開和私人語音通道。另外,還有5個專業語音通道,並且提供7天的退款保證。

退款保證應依購買渠道、使用量及現行的退款規則來判斷,並非所有已大量消耗額度的訂單都必然能獲得退款。團隊應在正式採購前確認成員的權限、專案共享方式以及音頻的擁有權。

Max價格

Max年度方案顯示,每月平均費用為749美元,全年則為8988美元。頁面上同時列出了999美元/月的原始價格或按月支付的方式。每個月可獲得25000000個Credit,這相當於最多6250分鐘的使用時間,以及10個團隊席位和15個專業音效槽位,非常適合需要高頻率進行制作的團隊。

Max的Credits與標稱分鐘並非簡單按統一比例換算,說明不同模型或工作流可能有差異。大批量客戶應根據實際腳本做成本測試,而不是只按最大分鐘數採購。

Enterprise企業方案

Enterprise可依需求報價,能提供年度或按量計算的方案、批量折扣、零資料保留服務、私有化或本地部署選項,以及SOC 2相關的企業級功能與客製化支援;而SSO在目前的比較頁面中仍可能標示為即將推出。

零數據保留和本地部署需要寫入合約並核對覆蓋範圍,不能因為頁面出現企業標籤就預設所有輸入、日誌、備份和聲音模型都不留存。

API按量價格

API並沒有強制要求每月訂閱或設定最低每月消費額。目前,S2.1 Pro、S2 Pro和S1文字轉語音的費用為每100萬UTF-8字節15美元。

官方估計,100萬個漢字所節省的空間相當於18萬個英文單詞,或12小時的語音儲存量,但漢字通常會佔用更多的UTF-8位元組,因此無法直接套用英文單詞的換算方式。

ASR的費率為每個音頻小時0.36美元,費用會按秒數向上取整;而Voice Design的費率則為每次成功請求0.01美元。

失敗、重試、長文本拆分和多版本生成都會改變最終成本。

S2.1 Pro Free API

s2.1-pro-free在公平使用政策下為0美元,支援83種語言,適用於測試、原型設計、開發以及規模較小的業務。它使用與S2.1 Pro相同的模型,但不提供首包延遲、資料處理協議或企業級服務保證,且免費使用期間及相關規則也可能有所調整。

免費模型並不等同於無限制生產的 SLA。關鍵業務應準備付費模型、超時重試、熔斷、快取以及替代供應商,並定期檢查公平使用限制。

API併發等級

併發上限依賴帳戶的累計預付金額來決定:若累計付款金額低於100美元,Starter等級的帳戶通常可支援5個併發連線;而當累計付款金額達到100美元時,Elevated等級的帳戶則可支援15個併發連線。

達到1000美元的High Volume為50並發;Enterprise則依合約設定。

並發數並非每秒的請求數,也無法保證固定的延遲。流式長時間請求會更長時間佔用連線,開發者需要使用佇列、限流、指數退避以及可觀測性機制。

REST、WebSocket與SDK

開發者可以透過 REST 來進行一般的資料產生,並透過 WebSocket 接收流式音訊;同時,他們還可以使用官方提供的 Python 與 JavaScript SDK 來管理 TTS、轉錄以及音聲模型。該介面支援建立、列出、更新和刪除音聲檔案,且也能與 LiveKit、Pipecat 等即時語音框架相整合。

API Key必須保存在服務端或金鑰管理系統中,不應寫入網頁、行動端套件或公開倉庫。生產系統還需驗證檔案類型、限制文字長度、記錄請求ID,並處理流式連線中斷的情況。

GitHub與開源狀態

Fish Audio網頁平台、託管API、帳戶系統以及社區聲音市場並非完整的開源產品。官方的GitHub上提供了Fish Speech的源代碼、模型相關資源、SDK以及運維工具,但公開的代碼並不代表可以無條件用於商業用途。

目前Fish Speech主分支的代碼及相關模型權重均採用Fish Audio Research License。用於研究及非商業用途時,可依據該許可規定使用;

任何商業用途,包括企業內部運作、收費產品、託管服務或API,皆需另行取得Fish Audio的書面商業許可。

舊頁面中關於Apache或CC-BY-NC-SA的說明可能對應歷史版本,判斷時應以所使用版本隨附的現行許可證為準。

本地部署

官方的 Fish Speech 文件提供了 Linux 或 WSL 安裝方式,以及 Docker、WebUI 和 API 伺服器等安裝方式。對於 S2 系列的推論需求,建議使用約 24GB 的顯存;同時也提供了以 CPU 作為運算方式的選項。企業還可以諮詢有關 VPC、本地環境、主權雲或隔離式網路等部署方式。

能下載並運行模型並不代表獲得商業部署權。自托管還需承擔GPU成本、模型安全、更新、濫用防護、日誌與數據合規等問題,商業項目必須先取得單獨許可。

商業使用與聲音授權

網頁的免費及付費方案目前皆標註為商業使用,但此授權僅適用於在遵守條款的前提下使用服務所產生的輸出內容,不會為使用者取得腳本、音樂、真人聲音、角色、商標及其他上傳素材的權利。

Hosted服務的輸出權限與Fish Speech研究許可證是兩回事:透過會員或API產生商業內容,並不代表可以將下載的模型權重用於商業自托管。敏感專案應保留同意書、聲音來源及發布審核記錄。

Fish Audio使用教學

完成一次基礎任務

  1. 確認錄音、聲音、音樂及參與者授權;
  2. 把清晰音頻上傳或錄入Fish Audio;
  3. 選擇語言、說話人及文字轉語音等處理設定;
  4. 使用S2.1 Pro語音模型生成轉錄、配音或清理結果;
  5. 逐段檢查姓名、數字、停頓、音量與情緒;
  6. 導出前確認格式、響度、版權和隱私要求;

建立可重複使用的專業工作流

  1. 用真實噪聲、口音和多人片段建立測試集;
  2. 比較文字轉語音、S2.1 Pro語音模型和S2 Pro與S1的處理差異;
  3. 保留原始錄音和未經修改的轉錄;
  4. 對外發布前安排人工聽審;
  5. 統計處理時長、錯誤率及額度消耗;
  6. 定期更新術語表、聲音授權和刪除策略;

適合哪些用戶?

  • 製作影片旁白、播客、有聲書和課程音頻的創作者;
  • 需要多語言配音、角色對話和本地化的內容團隊;
  • 希望快速建立品牌聲音或遊戲角色聲音的企業;
  • 構建Voice Agent、客服、陪伴應用及無障礙產品的開發者;
  • 研究和評估可本地運行語音模型的技術團隊。

產品優勢

  • 覆蓋80多種語言並支援多語言自然切換;
  • S2.1 Pro支援自然語言表演標籤及原生多人對話;
  • 網頁端同時提供克隆、長音頻、變聲、轉寫和音頻工具;
  • REST、WebSocket、Python與JavaScript SDK較完整;
  • 提供公平使用限制下的免費API模型;
  • 既有託管服務,也有研究用途的可下載模型與企業部署選項。

限制與注意事項

  • 網頁Credits、API餘額和自託管許可證相互獨立,不能把會員分鐘直接用於API;
  • 促銷價格、免費模型及公平使用政策可能會變動,預算應以結算頁面及控制台為準;
  • AI聲音會出現發音、角色、情緒和相似度偏差;
  • 聲音克隆、變聲和社區聲音必須核驗授權,重要內容需要人工試聽;
  • FishSpeech目前的研發許可證不授予商業使用權;

常見問題

Fish Audio免費嗎?

網頁版Free每月提供8000 Credits,最多約7分鐘;API另有在公平使用限制下的s2.1-pro-free模型,但沒有生產SLA和資料處理協議的保證。

Fish Audio多少錢?

當前年度促銷中,Plus為全年66美元,Pro為450美元,Max為8988美元;Enterprise則可訂製。

促銷和續費價格會變化,以結算頁面為準。

API如何收費?

S2.1 Pro、S2 Pro和S1 TTS目前的費率為:每100萬UTF-8字節15美元;而每小時的轉寫服務費則為0.36美元。

Voice Design每次成功請求0.01美元。

支援中文嗎?

支援中文與80多種語言,也支援多語言混排。中文以UTF-8字節計費時,無法直接套用英文單詞來估算。

可以克隆自己的聲音嗎?

可以使用即時、增強或專業克隆,但必須取得說話者明確授權,並根據隱私需求選擇公開或私有的聲音槽位。

Fish Audio是開源的嗎?

託管平台並非開源產品。Fish Speech的原始碼與模型可公開取得,但目前採用Fish Audio Research License,研究及非商業用途可依據該許可進行,而商業用途則必須另行取得書面許可。

©️版權聲明:若無特殊說明,本站所有文章版權均歸AI工具分享本網站的內容為原創作品,任何人或機構在未獲許可的情況下,都不得轉載、抄襲或以其他方式複製並發表本網站的內容,亦不得在非本網站所屬的伺服器上建立其鏡像版本。否則,本網站將依法追究相關責任人的法律責任。

類似於Fish Audio的工具