Stable Audio
免費增值
AI工具大全 AI音頻工具

Stable Audio

面向音樂與音效創作的生成式音頻平台

標籤:

Stable Audio是什麼?

Stable Audio是Stability AI推出的AI音樂與音效生成平台,可從文字描述創建歌曲片段、背景音樂、環境聲、擬音及製作素材,也能上傳或錄製自有音頻,透過自然語言改變風格、繼續旋律或重繪局部。

截至目前,Stable Audio已從早期的90秒模型發展到Stable Audio 3系列。3.0版本可處理長達約6分鐘的完整結構音樂,並提供Small、Small SFX、Medium和Large等多種尺寸選項;同時還具備網頁應用、Stability AI API、開放式權重、合作平台以及企業自托管等使用方式。

Stable Audio 3.0

Stable Audio 3.0是當前最新的模型系列,其訓練數據來自具有完整授權的資源以及Creative Commons的資源。該模型的優點在於能夠提升長程結構、旋律的連貫性、對提示語的遵循程度,以及生成速度。它可以創造出包含開頭、發展和結尾的完整曲目,而不只是單一的循環音段。

3.0 Large適用於企業級的音效製作,且品質最佳;Medium則可處理長達約6分20秒的完整歌曲,並提供可調整的權重設定。

Small與Small SFX針對較低算力、端側和消費級設備優化。

Stable Audio 2.5

Stable Audio 2.5依然是網頁及API中的重要產生模型,能夠生成長達3分鐘、44.1kHz的立體聲音頻,並支援文字轉換為音頻、音頻轉換以及音頻修復功能。透過ARC後訓練,它能進一步改善音樂的結構、速度以及對指令的遵循度。

官方在特定GPU條件下宣傳2.5可生成3分鐘的音頻,時間可低於2秒,但端到端時間仍受排隊、上傳、網路與硬體影響,不應當作所有帳戶的固定SLA。

文字生成音樂

用戶可以在提示中寫明流派、情緒、樂器、BPM、製作風格、使用場景和結構,例如電影配樂、遊戲Boss戰、廣告音樂、鼓Loop或環境氛圍。模型會根據目標時長生成立體聲音頻。

建議使用能描述聲音特性的詞彙,而非僅寫「把它變成某種音樂」。具體的樂器、音色、節奏、空間感、年代以及情緒,通常比抽象的指示更為明確且穩定。

生成音效與製作素材

Stable Audio不僅能夠生成音樂,還適用於製作鼓點、合成器音效、環境音效、腳步聲、機械聲、衝擊聲,以及用於轉場和電影中的各種音效。而Small SFX則是專門用於在設備端生成音效的。

需要無縫循環時應在提示中說明Loop與節奏,並在導出後檢查頭尾相位、響度與雜音。AI生成的效果仍可能含有意外的人聲或不必要的音樂成分。

Audio-to-Audio

Audio-to-Audio會以已上傳、錄製的,或是現有的Stable Audio作品作為結構與音色的參考,再結合文字來生成新版本。使用者可以調整Input Audio Strength和Prompt Strength,從而在保留原音頻與大幅改變之間做出選擇。

API建議從約0.8的strength開始:數值越高,輸出通常越偏離輸入;數值較低則保留更多原結構。

實際最佳值需要按素材和提示迭代。

人聲哼唱與錄音輸入

使用者可以錄下哼唱、口哨、樂器或自然聲音作為輸入,進而產生伴奏、不同樂器的演奏版本或風格變化。它很適合將快速的音樂構思擴展為可聆聽的成品。

人聲輸入仍屬於實驗性工作流程,可能出現音準、節奏及身份特徵的變化。真人錄音必須取得授權,藍牙設備還可能為瀏覽器錄音帶來延遲。

音訊修補與延展

音頻修補功能可讓使用者指定音頻中的特定位置,並利用周圍的上下文資料來重新生成或延伸該部分的內容,如此即可用於改寫段落、補全結尾、修復過渡部分,以及調整整體結構。

生成並非無損編輯。新片段可能改變節拍、和聲與混音,正式作品應保留原文件並對重繪區域前後做完整试听。

輸入音頻版權檢測

用戶只能上傳自己擁有必要權利的音頻。平台會使用內容識別系統檢查上傳的檔案,疑似屬於他人版權的素材將會被拒絕並刪除。

即使被拒絕,檔案長度仍會從當月的上傳額度中扣除。請勿使用商業歌曲來測試風格轉換,也不要以能上傳為由就認為已獲得許可。

上傳的內容會用於訓練嗎?

官方FAQ說明,用戶上傳的輸入音頻不會被納入Stable Audio的訓練數據中,僅在當次互動時使用。但基於該互動所產生的生成輸出,可能會被用於當前或未來的模型改進。

對於客戶尚未發布的音樂、品牌聲音,以及受保密協議約束的素材,應核對最新條款。若要求輸出,亦不得進行訓練,必須透過企業合約來確認。

Free免費方案

Free版每月可使用Stable Audio 2.5生成10首歌曲,採用個人許可證,僅能用於個人及非商業項目。免費額度每月1日更新,未使用的生成次數不會結轉。

目前的使用者指南中,對於上傳額度有6分鐘和FAQ中的2分鐘兩種說法,且每次上傳的長度會被截斷為30秒。實際上應以帳戶內顯示的數值為準,不應將免費方案用於正式的商業用途。

價格與版本對比

套餐或版本價格、額度與核心權益
Pro價格Pro的目前價格為每月11.99美元,適用於需要商業許可的個人創作者。它提供創作者許可證,並提升內容生成及音頻上傳的功能;根據目前的FAQ,每個月可上傳30分鐘的內容,且每個上傳的檔案最多可使用6分鐘。價格頁面並未明確顯示當前的生成次數,而過去500首作品的產出限制可能會隨著模型成本的變動而調整。購買前應以結帳頁面所顯示的即時數據為準。
Studio價格Studio的費用為每月29.99美元,適用於需要高頻率進行個人製作的用戶,此時需使用Creator License。每個月可上傳的音頻時間為60分鐘,單次上傳的時間則最多為6分鐘。雖然Studio提升了內容生成與上傳的容量,但並不會自動授予中大型組織或企業相關的許可、法律保障或本地部署的權力。
Max價格Max的價格目前為每月89.99美元,這是適用於網頁應用程式中高用量個人創作者的方案。每個月可上傳的音頻時間為90分鐘,單次上傳的最長時間為6分鐘;如果需要更多存儲空間,可以聯絡客服尋求協助。不過,Max仍與Enterprise方案不同。那些團隊規模較大、有大量終端用戶、需要自行管理模型,或是年收入較高的組織,應該選擇企業版方案。
Stability AI API價格開發者平台是按信用點數來計費的,1個信用點數相當於0.01美元,而新帳戶則可獲得25個免費的信用點數。Stable Audio 2.5每次成功生成20個信用點數,約合0.20美元;Stable Audio 3.0則每次成功生成26個信用點數,約合0.26美元,若生成失敗則不收取費用。API的費率並不等同於完整的商業使用許可費用。開發者還必須遵守API條款、Community License或Enterprise License的規定,同時還需考慮儲存、傳輸、重試以及後處理等相關成本。

Pro價格

Pro的目前價格為每月11.99美元,適用於需要商業許可的個人創作者。它提供創作者許可證,並提升內容生成及音頻上傳的功能。

目前FAQ確認每月可上傳30分鐘,每個上傳檔案最多使用6分鐘。

價格頁面在抓取的文本中並未穩定公開當前的生成次數,過去500首的產出額度可能會隨著模型成本的調整而改變。購買前應以結算頁面實時顯示的「Track Generations」數值為準。

Studio價格

Studio的目前價格為29.99美元/月,適用於需要更頻繁進行個人創作的用戶,此時需使用Creator License。每個月可上傳的音頻時間為60分鐘,而單次上傳的時間則最多為6分鐘。

Studio提升了生成與上傳的容量,但並不會自動授予中大型組織企業許可、法律賠償或本地部署權。

Max價格

Max目前的價格為每月89.99美元,這是針對在網頁上創作內容的個人創作者所設計的方案。每個月可上傳的音頻時間為90分鐘,且每次上傳的時間不得超過6分鐘。

需要更多容量可聯繫支援。

Max仍與Enterprise不同。團隊規模、終端用戶產品、模型自托管以及年收入較高的組織應按企業條款採購。

Enterprise企業許可

Enterprise可根據需求報價,能夠在自有基礎設施上部署模型,並提供定製化訓練、實作支援、持續性支援以及法律賠償等企業級服務。若企業的年營收超過100萬美元,且希望在自己的基礎設施上部署相關系統,則請與該團隊聯絡。

企業應在合同中寫明模型版本、硬件、並發、更新、數據訓練、商標聲音、支援SLA、輸出權利及賠償範圍。

Personal、Creator與Enterprise許可

Personal允許非商業專案;Creator允許個人將生成的音頻用於商業專案及音樂發行;

Enterprise用於中大型組織、規模化產品、應用、遊戲、影視、廣告與高MAU場景。

許可證以生成時的帳戶等級為準。FAQ說明,Pro及更高方案所生成的音頻,即便之後取消,仍保持原有的許可證;

升級或降級不會自動改變過去作品的許可。

取消與退款

訂閱透過Stripe管理,可隨時升級、降級或取消。升級會立即生效並按剩餘週期比例收費;

取消會立即降為Free,並失去未使用的本月生成額度。

退款由平台酌情處理,通常要求在扣款48小時內提出,且使用量低於當月額度的2%,或是屬於未經授權的付款等特殊情況。自動續費用戶應在賬單日之前取消服務。

Stability AI API價格

開發者平台是按信用點數來計費的,1個信用點數相當於0.01美元,而新帳戶則可獲得25個免費的信用點數。Stable Audio 2.5每成功生成一次內容,就能獲得20個信用點數,約合0.20美元。

Stable Audio 3.0每次成功生成26 Credits,約0.26美元,失敗則不收取費用。

API費率並不等同於完整的商業授權標準。開發者還必須遵守API條款、Community License或Enterprise License的規定,並需計算儲存、傳輸、重試及後處理的成本。

API呼叫方式

Text-to-Audio可直接返回音頻或Base64。Stable Audio 3.0的Audio-to-Audio則採用異步流程,提交後會返回generation ID,接著再輪詢結果端點;

上傳檔案最大約100MB。

API Key必須保存在服務端。生產環境應限制用戶上傳的檔案類型、驗證檔案類型、處理202狀態及超時情況,並保存生成的參數與許可證版本。

Stable Audio 3開放權重

Stable Audio 3.0的Small、Small SFX和Medium版本提供可下載的權重,而Large版本則主要透過Stability AI API以及Enterprise自托管方式來使用。開放式的權重讓開發人員能夠進行研究、推理,並建立自己的本地工作流程。

權重採用Stability AI Community License,並非無條件的公共領域。個人、研究以及符合收入門檻的商業使用可依據許可進行;

超過許可範圍的組織需要Enterprise License。

Stable Audio Open 1.0

早期的 Stable Audio Open 1.0 適合用來產生長度約 47 秒的鼓點、Riff、環境音效以及各種製作元素,其訓練數據則來自 Freesound 與 Free Music Archive 中的 Creative Commons 格式音頻。它並非以創造完整的歌曲或逼真的人聲為主要目標。

其模型權重同樣受Stability AI Community License約束。訓練來源和能力與商業網頁模型AudioSparx 2.x、3.0系列不同,不能混為一談。

GitHub代碼與許可證

官方的stable-audio-tools倉庫提供了用於條件音頻生成的訓練與推理工具,其代碼採用MIT許可證;stable-audio-3倉庫也公開了實作代碼與模型使用說明。

代碼MIT並不等於所有模型權重MIT。模型權重、輸出及商業規模仍受Community或Enterprise License的約束,部署前必須同時檢查代碼與模型兩份許可證。

訓練數據

Stable Audio網頁端的早期1.0和2.0版本,是使用AudioSparx的授權音樂進行訓練的,且相關藝術家可以選擇退出該系統;而3.0系列則是使用正式授權的音樂以及Creative Commons授權的音樂資料。

Stability AI還與其他資料合作夥伴合作,以擴展模型。

「授權數據」可改善來源合規性,但無法保證輸出內容絕不會與現有作品相似。商業發行仍需進行相似性檢查、人工聽審以及平台政策核驗。

Stable Audio使用教學

完成一次基礎任務

  1. 確認錄音、聲音、音樂及參與者授權;
  2. 把清晰音頻上傳或錄入Stable Audio;
  3. 選擇語言、說話人及Stable Audio 3.0等處理設定;
  4. 使用Stable Audio 2.5生成轉錄、配音或清理結果;
  5. 逐段檢查姓名、數字、停頓、音量與情緒;
  6. 導出前確認格式、響度、版權和隱私要求;

建立可重複使用的專業工作流

  1. 用真實噪聲、口音和多人片段建立測試集;
  2. 比較Stable Audio 3.0、Stable Audio 2.5和文字生成音樂的處理差異;
  3. 保留原始錄音和未經修改的轉錄;
  4. 對外發布前安排人工聽審;
  5. 統計處理時長、錯誤率及額度消耗;
  6. 定期更新術語表、聲音授權和刪除策略;

適合哪些用戶?

  • 製作廣告、短影片、遊戲與播客音樂的個人創作者;
  • 需要環境、擬音、Loop和製作素材的聲音設計師;
  • 用哼唱、樂器與已有Stem引導生成的音乐人;
  • 透過API批量生成音樂與音效的開發者;
  • 希望下載開放權重、本地推理或訂製品牌聲音的技術團隊。

產品優勢

  • Stable Audio 3可生成最長約6分鐘完整音樂;
  • 覆蓋Text-to-Audio、Audio-to-Audio、Inpainting與延展;
  • 訓練數據以授權和Creative Commons來源為主;
  • 提供Web、API、開放權重與Enterprise自託管;
  • Small SFX支援端側音效生成方向;
  • 付費個人方案生成的內容可獲得Creator商業許可。

限制與注意事項

  • Free僅能用於非商業用途,商業專案需要Pro及以上或Enterprise;
  • 輸入的音頻必須擁有權利,被版權檢測拒絕的上傳仍會消耗月度上傳額度;
  • 網頁生成次數與上傳分鐘可能隨模型調整,未用額度不結轉;
  • 開放權重採用CommunityLicense,代碼MIT並不代表模型可以無限制商用;

常見問題

Stable Audio免費嗎?

有免費方案,每月可生成10次Stable Audio 2.5,僅限個人非商業使用。API新帳戶還有25個免費Credit。

Stable Audio多少錢?

網頁Pro為11.99美元/月、Studio 29.99美元/月、Max 89.99美元/月;Enterprise可訂製。

API 2.5約0.20美元/次,3.0約0.26美元/次。

可以生成多長的音樂?

Stable Audio 2.5的最長時間約為3分鐘,Stable Audio 3.0的最長時間則約為6分鐘;不同模型及入口的時間上限也有所差異。

可以商用嗎?

Pro、Studio和Max的個人創作者可依據Creator License用於商業用途,而組織及大規模產品則需核對Enterprise License。Free版本不可用於商業用途。

Stable Audio是開源的嗎?

部分開放。stable-audio-tools的代碼採用MIT授權,3.0 Small、Small SFX與Medium則採用開放權重,但模型的使用必須遵守Stability AI Community License的規定;

Large主要透過API和Enterprise使用。

©️版權聲明:若無特殊說明,本站所有文章版權均歸AI工具分享本網站的內容為原創作品,任何人或機構在未獲許可的情況下,都不得轉載、抄襲或以其他方式複製並發表本網站的內容,亦不得在非本網站所屬的伺服器上建立其鏡像版本。否則,本網站將依法追究相關責任人的法律責任。

類似於Stable Audio的工具