Stable Audio
免费增值
AI工具大全 AI音频工具

Stable Audio

面向音乐与音效创作的生成式音频平台

标签:

Stable Audio是什么?

Stable Audio是Stability AI推出的AI音乐与音效生成平台,可从文字描述创建歌曲片段、背景音乐、环境声、拟音和制作素材,也能上传或录制自有音频,通过自然语言改变风格、继续旋律或重绘局部。

截至当前,Stable Audio已经从早期90秒模型发展到Stable Audio 3系列。3.0支持最长约6分钟的完整结构音乐,包含Small、Small SFX、Medium和Large多个尺寸,并提供网页应用、Stability AI API、开放权重、合作平台及企业自托管等入口。

Stable Audio 3.0

Stable Audio 3.0是当前最新模型家族,训练数据来自完整授权与Creative Commons资源,重点提升长程结构、旋律连贯、提示遵循和生成速度。模型可以创建包含开头、发展与结尾的完整曲目,而不仅是孤立Loop。

3.0 Large面向企业级声音制作和最高质量;Medium支持最长约6分20秒的完整歌曲并提供开放权重;

Small与Small SFX针对较低算力、端侧和消费级设备优化。

Stable Audio 2.5

Stable Audio 2.5仍是网页和API中的重要生产模型,可生成最长3分钟、44.1kHz立体声音频,并支持文字生成、音频转音频和Audio Inpainting。它通过ARC后训练改善音乐结构、速度与提示遵循。

官方在特定GPU条件下宣传2.5生成3分钟音频可低于2秒,但端到端时间仍受排队、上传、网络与硬件影响,不应当作所有账户的固定SLA。

文字生成音乐

用户可以在提示中写流派、情绪、乐器、BPM、制作风格、使用场景和结构,例如电影配乐、游戏Boss战、广告音乐、鼓Loop或环境氛围。模型会按目标时长生成立体声音频。

提示应使用描述声音的词,而不是只写“把它变成某种音乐”。具体的乐器、音色、节奏、空间、年代和情绪通常比抽象指令更稳定。

生成音效与制作素材

Stable Audio不仅生成音乐,也适合制作鼓点、合成器、环境、脚步、机械、冲击、转场和电影音效。Small SFX专门面向设备端声音效果生成。

需要无缝循环时应在提示中说明Loop与节奏,并在导出后检查头尾相位、响度和噪声。AI生成效果仍可能含有意外人声或不需要的音乐成分。

Audio-to-Audio

Audio-to-Audio把上传、录制或既有Stable Audio作品作为结构和音色参考,再结合文字生成新版本。用户可以调节Input Audio Strength和Prompt Strength,在保留原音频与大幅改变之间选择。

API建议从约0.8的strength开始:数值越高,输出通常越偏离输入;数值较低则保留更多原结构。

实际最佳值需要按素材和提示迭代。

人声哼唱与录音输入

用户可以录下哼唱、口哨、乐器或自然声音作为输入,生成伴奏、不同乐器版本或风格变化。它适合把快速音乐草图扩展为可试听方向。

人声输入仍属于实验工作流,可能出现音准、节奏和身份特征变化。真人录音必须取得授权,蓝牙设备还可能给浏览器录音增加延迟。

Audio Inpainting与延展

Audio Inpainting允许指定音频中的位置,利用前后上下文重新生成或延展其余部分,可用于改写段落、补全结尾、修复过渡和调整结构。

生成并非无损编辑。新片段可能改变节拍、和声与混音,正式作品应保留原文件并对重绘区域前后做完整试听。

输入音频版权检测

用户只能上传自己拥有必要权利的音频。平台会使用内容识别系统检查上传文件,疑似属于他人的版权素材会被拒绝和删除。

即使被拒绝,文件时长仍会从当月上传额度中扣除。不要用商业歌曲测试风格转换,也不要假设能上传就代表获得许可。

上传内容会用于训练吗?

官方FAQ说明,用户上传的输入音频不会加入Stable Audio训练数据,只在当次交互中使用。但基于交互产生的生成输出可能用于当前或未来模型改进。

对客户未发布音乐、品牌声音和受保密协议约束的素材,应核对最新条款。若要求输出也不得训练,需要通过企业合同确认。

Free免费方案

Free每月可使用Stable Audio 2.5生成10首,采用Personal License,只能用于个人和非商业项目。免费额度每月1日刷新,未用生成次数不会结转。

当前用户指南对上传额度存在6分钟与FAQ 2分钟两种文档表述,且单次会裁剪为30秒。实际应以账户内显示为准,不应把免费方案用于正式商业生产。

价格与版本对比

套餐或版本价格、额度与核心权益
Pro价格Pro当前为11.99美元/月,面向需要商业许可的个人创作者。它提供Creator License,并扩大生成和音频上传能力;当前FAQ确认每月可上传30分钟,每个上传文件最多使用6分钟。价格页未在抓取文本中稳定公开当前生成次数,历史500首额度可能随模型成本调整。购买前应以结算页实时显示的Track Generations为准。
Studio价格Studio当前为29.99美元/月,面向更高频个人制作,使用Creator License。每月音频上传额度为60分钟,单个上传最多6分钟。Studio提高生成与上传容量,但并不自动授予中大型组织企业许可、法律赔偿或本地部署权。
Max价格Max当前为89.99美元/月,是网页应用中的高用量个人创作者方案。每月音频上传额度为90分钟,单个上传最多6分钟;需要更多容量可联系支持。Max仍与Enterprise不同。团队规模、终端用户产品、模型自托管和年收入较高组织应按企业条款采购。
Stability AI API价格开发者平台按Credits计费,1 Credit等于0.01美元,并为新账户提供25个免费Credits。Stable Audio 2.5每次成功生成20 Credits,约0.20美元;Stable Audio 3.0每次成功生成26 Credits,约0.26美元,失败生成不收费。API费率不等于完整商用许可判断。开发者还需遵守API条款、Community License或Enterprise License,并计算存储、传输、重试与后处理成本。

Pro价格

Pro当前为11.99美元/月,面向需要商业许可的个人创作者。它提供Creator License,并扩大生成和音频上传能力;

当前FAQ确认每月可上传30分钟,每个上传文件最多使用6分钟。

价格页未在抓取文本中稳定公开当前生成次数,历史500首额度可能随模型成本调整。购买前应以结算页实时显示的Track Generations为准。

Studio价格

Studio当前为29.99美元/月,面向更高频个人制作,使用Creator License。每月音频上传额度为60分钟,单个上传最多6分钟。

Studio提高生成与上传容量,但并不自动授予中大型组织企业许可、法律赔偿或本地部署权。

Max价格

Max当前为89.99美元/月,是网页应用中的高用量个人创作者方案。每月音频上传额度为90分钟,单个上传最多6分钟;

需要更多容量可联系支持。

Max仍与Enterprise不同。团队规模、终端用户产品、模型自托管和年收入较高组织应按企业条款采购。

Enterprise企业许可

Enterprise按需报价,可在自有基础设施部署模型,并提供定制训练、实现支持、持续支持与法律赔偿等企业能力。价格页要求年收入超过100万美元、希望在自有基础设施部署的企业联系团队。

企业应在合同中写明模型版本、硬件、并发、更新、数据训练、商标声音、支持SLA、输出权利和赔偿范围。

Personal、Creator与Enterprise许可

Personal允许非商业项目;Creator允许个人把生成音频用于商业项目和音乐发行;

Enterprise用于中大型组织、规模化产品、应用、游戏、影视、广告与高MAU场景。

许可证以生成时账户等级为准。FAQ说明Pro及更高方案生成的音频,即使之后取消,仍保持原有许可证;

升级或降级不会自动改变过去作品的许可。

取消与退款

订阅通过Stripe管理,可随时升级、降级或取消。升级会立即生效并按剩余周期比例收费;

取消会立即降为Free,并失去未使用的本月生成额度。

退款由平台酌情处理,通常要求在扣款48小时内提出且使用量低于当月额度2%,或属于未经授权付款等特殊情况。自动续费用户应在账单日前取消。

Stability AI API价格

开发者平台按Credits计费,1 Credit等于0.01美元,并为新账户提供25个免费Credits。Stable Audio 2.5每次成功生成20 Credits,约0.20美元;

Stable Audio 3.0每次成功生成26 Credits,约0.26美元,失败生成不收费。

API费率不等于完整商用许可判断。开发者还需遵守API条款、Community License或Enterprise License,并计算存储、传输、重试与后处理成本。

API调用方式

Text-to-Audio可直接返回音频或Base64。Stable Audio 3.0 Audio-to-Audio采用异步流程,提交后返回generation ID,再轮询结果端点;

上传文件最大约100MB。

API Key必须保存在服务端。生产环境应限制用户上传、验证文件类型、处理202状态与超时,并保存生成参数和许可证版本。

Stable Audio 3开放权重

Stable Audio 3.0 Small、Small SFX和Medium提供可下载权重,Large主要通过Stability AI API和Enterprise自托管使用。开放权重让开发者可以研究、推理和构建本地工作流。

权重采用Stability AI Community License,不是无条件公共领域。个人、研究和符合收入门槛的商业使用可按许可进行;

超过许可范围的组织需要Enterprise License。

Stable Audio Open 1.0

早期Stable Audio Open 1.0适合生成最长约47秒的鼓点、Riff、环境和制作元素,训练数据来自Freesound与Free Music Archive的Creative Commons音频。它不以长篇完整歌曲和逼真人声为主要目标。

其模型权重同样受Stability AI Community License约束。训练来源和能力与商业网页模型AudioSparx 2.x、3.0系列不同,不能混为一谈。

GitHub代码与许可证

官方stable-audio-tools仓库提供条件音频生成的训练与推理工具,代码采用MIT许可证;stable-audio-3仓库也公开了实现代码与模型使用说明。

代码MIT不等于所有模型权重MIT。模型权重、输出和商业规模仍受Community或Enterprise License约束,部署前必须同时检查代码与模型两份许可证。

训练数据

Stable Audio网页端早期1.0和2.0模型使用AudioSparx授权音乐训练,并允许相关艺术家选择退出;3.0系列使用完整授权和Creative Commons数据。

Stability AI还与其他数据伙伴合作扩展模型。

“授权数据”可以改善来源合规,但不保证输出绝不与现有作品相似。商业发行仍需做相似性检查、人工听审和平台政策核验。

Stable Audio使用教程

完成一次基础任务

  1. 确认录音、声音、音乐及参与者授权;
  2. 把清晰音频上传或录入Stable Audio;
  3. 选择语言、说话人和Stable Audio 3.0等处理设置;
  4. 使用Stable Audio 2.5生成转录、配音或清理结果;
  5. 逐段检查姓名、数字、停顿、音量和情绪;
  6. 导出前确认格式、响度、版权和隐私要求;

建立可复用的专业工作流

  1. 用真实噪声、口音和多人片段建立测试集;
  2. 比较Stable Audio 3.0、Stable Audio 2.5和文字生成音乐的处理差异;
  3. 保留原始录音和未经修改的转录;
  4. 对外发布前安排人工听审;
  5. 统计处理时长、错误率和额度消耗;
  6. 定期更新术语表、声音授权和删除策略;

适合哪些用户?

  • 制作广告、短视频、游戏与播客音乐的个人创作者;
  • 需要环境、拟音、Loop和制作素材的声音设计师;
  • 用哼唱、乐器与已有Stem引导生成的音乐人;
  • 通过API批量生成音乐与音效的开发者;
  • 希望下载开放权重、本地推理或定制品牌声音的技术团队。

产品优势

  • Stable Audio 3可生成最长约6分钟完整音乐;
  • 覆盖Text-to-Audio、Audio-to-Audio、Inpainting与延展;
  • 训练数据以授权和Creative Commons来源为主;
  • 提供Web、API、开放权重与Enterprise自托管;
  • Small SFX支持端侧音效生成方向;
  • 付费个人方案生成内容可获得Creator商业许可。

限制与注意事项

  • Free只能非商业使用,商业项目需要Pro及以上或Enterprise;
  • 输入音频必须拥有权利,被版权检测拒绝的上传仍会消耗月度上传额度;
  • 网页生成次数与上传分钟可能随模型调整,未用额度不结转;
  • 开放权重采用CommunityLicense,代码MIT不代表模型可以无限制商用;

常见问题

Stable Audio免费吗?

有Free方案,每月10次Stable Audio 2.5生成,只能个人非商业使用。API新账户另有25个免费Credits。

Stable Audio多少钱?

网页Pro为11.99美元/月、Studio 29.99美元/月、Max 89.99美元/月;Enterprise定制。

API 2.5约0.20美元/次,3.0约0.26美元/次。

可以生成多长的音乐?

Stable Audio 2.5最长约3分钟,Stable Audio 3.0最高约6分钟;具体模型和入口的时长上限不同。

可以商用吗?

Pro、Studio和Max的个人创作者可按Creator License商用,组织和大规模产品需核对Enterprise License。Free不能商用。

Stable Audio开源吗?

部分开放。stable-audio-tools代码采用MIT,3.0 Small、Small SFX与Medium开放权重,但模型使用受Stability AI Community License约束;

Large主要通过API和Enterprise使用。

©️版权声明:若无特殊声明,本站所有文章版权均归AI工具分享原创和所有,未经许可,任何个人、媒体、网站、团体不得转载、抄袭或以其他方式复制发表本站内容,或在非我站所属的服务器上建立镜像。否则,我站将依法保留追究相关法律责任的权利。

类似于Stable Audio的工具