Fireworks AI 是什么
Fireworks AI 是 Fireworks.ai, Inc. 提供的生成式 AI 基础设施平台,面向需要调用、微调和部署开放权重模型的开发者与企业。它把模型目录、推理接口、训练任务、专用 GPU 部署、配额和观测能力放在同一平台中。
Fireworks AI 不是单一聊天机器人,也不等于某个模型。用户需要选择具体模型、流量层级和部署方式,模型许可证、上下文长度、输入类型、输出质量与价格都可能不同。
核心产品形态
| 产品形态 | 计费基础 | 主要特点 | 适合任务 |
|---|---|---|---|
| Serverless Standard | 输入、缓存输入与输出令牌 | 共享托管、无需管理 GPU、按需调用 | 原型、弹性流量与常用模型 |
| Serverless Priority | 较高的按令牌价格 | 高峰期优先路由,提高可靠性 | 对拥塞敏感的生产请求 |
| Serverless Fast | 高速模型专属价格 | 针对延迟优化,部分模型处于预览 | 交互式 Agent 与低延迟应用 |
| On-demand 部署 | 按 GPU 秒 | 专用容量、可扩缩、支持自定义模型和 LoRA | 稳定高流量与私有模型 |
| 训练与微调 | 训练令牌或 GPU 小时 | SFT、DPO、RFT、LoRA 与全参数训练 | 领域适配、风格对齐与复杂 Agent |
Serverless 模型推理
Serverless 提供热门文本、视觉和嵌入模型,调用方只为实际令牌付费,不需要选择 GPU、配置副本或处理冷启动。Standard 是默认层,Priority 通过请求参数启用,Fast 则使用独立的高速模型标识。
- 聊天与文本补全支持流式输出、工具调用和结构化结果。
- 视觉模型接收文本与图像内容,实际格式和大小受模型限制。
- 嵌入模型把文本转换为向量,适合检索、聚类和相似度计算。
- 提示词缓存可降低重复上下文的费用,但命中依赖路由和内容一致性。
- 批量推理按普通 Serverless 输入与输出价格的五折计费,适合非实时大批任务。
共享 Serverless 属于尽力而为服务,不提供统一的延迟或可用性保证。模型可能下线,常用模型通常至少提前两周通知;需要固定版本和性能承诺时应考虑专用部署。
OpenAI 与 Anthropic 兼容接口
Fireworks 提供兼容 OpenAI 聊天补全格式和 Anthropic Messages 格式的接口,已有应用通常只需替换服务地址、密钥和模型标识。兼容不代表每个参数、模型行为或边界条件完全相同,迁移前仍要逐项测试。
- 支持同步、异步和流式响应,流式最后一块可包含令牌用量。
- 模型上下文溢出时默认可能自动缩减最大输出,也可设置为直接报错。
- 推理密钥应保存在服务端,不能写入网页前端或公开仓库。
- 工具调用、推理字段和结构化输出能力应按具体模型核对。
模型微调与训练
监督微调 SFT
SFT 使用带有理想回答的对话样本训练模型,适合领域知识表达、固定格式、品牌语气和工具调用行为。数据采用逐行 JSON 的 OpenAI 兼容消息结构,可通过界面、命令行、接口或 Python SDK 上传。
偏好优化 DPO
DPO 使用同一提示下的优选与非优选回答对,让模型更符合质量、风格或安全偏好。当前数据格式和会话结构有明确限制,训练前要先通过数据验证。
强化微调 RFT
RFT 使用评估器或奖励函数优化模型在推理、工具使用和多轮 Agent 任务中的表现。团队可以使用托管流程,也可以把自有评估逻辑和训练循环接入 Training API。
LoRA 与全参数训练
LoRA 以较小适配器修改行为,部署成本与基础模型共享策略相关;全参数训练适合需要更深行为改变的任务,但数据、算力与治理成本更高。微调模型和用户上传模型需要 On-demand 专用部署,不能直接放入共享 Serverless。
训练工作流
- 明确质量目标、基准集、失败类型和上线门槛。
- 从模型目录确认基础模型可调、上下文长度和支持的训练方法。
- 清洗数据,删除密钥、个人敏感信息和无权使用的内容。
- 按 SFT、DPO 或 RFT 格式生成训练集与独立评估集。
- 上传并验证数据,先用小任务检查格式、损失与样本质量。
- 启动训练并记录模型、超参数、数据版本和费用。
- 在未见样本上比较基础模型与微调模型的质量、安全和延迟。
- 创建专用部署,分阶段切流并持续监控漂移与异常输出。
On-demand 专用部署
On-demand 以 GPU 秒计费,提供独立于共享流量的容量和更可控的延迟。用户可部署平台模型、自有模型或 LoRA,设置最小与最大副本,并在无请求时缩容到零。
- 吞吐量主要由 GPU 型号、数量、模型大小、量化、上下文和批处理决定。
- 扩大副本或每副本 GPU 数会按比例增加运行费用。
- 可选 GLOBAL、US、EUROPE 和 APAC 多区域,也可申请固定单一区域。
- 固定区域不能原地迁移,需要创建新部署并完成流量切换。
- 企业可讨论私网连接、直接路由、专属容量和更高配额。
API 接入流程
- 创建账户并取得试用金或绑定付款方式。
- 在模型目录选择输入类型、上下文和价格合适的模型。
- 创建 API 密钥,并放入服务端环境变量或密钥管理器。
- 选择官方 Python SDK、OpenAI SDK、Anthropic SDK或直接接口调用。
- 先用非流式小请求确认模型标识、消息格式和用量字段。
- 再加入流式输出、工具调用、结构化结果、缓存或批量任务。
- 为限流、超时、模型下线和内容异常设计重试与降级。
- 设置月度预算、告警和密钥轮换,再开放生产流量。
当前价格示例
| 套餐或版本 | 价格 | 计费周期 | 核心权益或额度 | 适合用户 |
|---|---|---|---|---|
| 新账户试用 | 1 美元试用金 | 一次性 | 按实际模型费率抵扣,不是无限免费套餐 | 首次接口验证 |
| Kimi K2.6 Standard | 输入 0.95、缓存 0.16、输出 4 美元 | 每百万令牌 | Serverless 文本推理 | Agent 与通用生成 |
| DeepSeek V4 Pro Standard | 输入 1.74、缓存 0.145、输出 3.48 美元 | 每百万令牌 | Serverless 推理 | 推理与代码任务 |
| GPT OSS 120B Standard | 输入 0.15、缓存 0.015、输出 0.60 美元 | 每百万令牌 | Serverless 开放权重模型 | 成本敏感型应用 |
| 嵌入模型 | 0.008 至 0.10 美元 | 每百万输入令牌 | 按参数规模和指定模型收费 | 语义检索与向量化 |
| 批量推理 | 普通费率的 50% | 按输入与输出令牌 | 异步批处理,不适合即时交互 | 离线生成和大批评测 |
| Enterprise | 联系销售 | 定制合同 | 专属容量、私网、区域、SLA 与支持 | 大型及受监管组织 |
模型目录和 Serverless 费率会更新,Priority 与 Fast 也可能采用更高价格。选型时应按实际模型、服务层和账户结算页重新确认,不能把表中示例推广到所有模型。
训练价格
| 模型规模 | LoRA SFT | LoRA DPO | 全参数 SFT | 全参数 DPO |
|---|---|---|---|---|
| 不超过 16B | 0.50 美元 | 1 美元 | 1 美元 | 2 美元 |
| 16.1B 至 80B | 3 美元 | 6 美元 | 6 美元 | 12 美元 |
| 80B 至 300B | 6 美元 | 12 美元 | 12 美元 | 24 美元 |
| 超过 300B | 10 美元 | 20 美元 | 20 美元 | 40 美元 |
表中价格均按每百万训练令牌计算,训练令牌会受到样本量、轮数、多轮展开、图像和推理轨迹影响。RFT 与 Dedicated Training API 可按 GPU 小时收费,Serverless Training API 则分别计算预填充、缓存预填充、采样和训练令牌。
On-demand GPU 价格
| GPU | 8 月 31 日前 | 9 月 1 日起 | 计费周期 | 适合用户 |
|---|---|---|---|---|
| H100 80GB | 7 美元 | 8 美元 | 每 GPU 小时,按秒结算 | 常规生产推理与训练 |
| H200 141GB | 7 美元 | 8 美元 | 每 GPU 小时,按秒结算 | 大上下文与大模型 |
| B200 180GB | 10 美元 | 13 美元 | 每 GPU 小时,按秒结算 | 高吞吐工作负载 |
| B300 288GB | 12 美元 | 15 美元 | 每 GPU 小时,按秒结算 | 更大显存需求 |
| GB300 288GB | 18 美元 | 20 美元 | 每 GPU 小时,按秒结算 | 前沿训练与推理 |
受区域限制的部署按标准费率的 1.5 倍计价,并需联系销售开通。启动时间不额外收费,但把最小副本设为大于零会产生持续 GPU 费用。
账户额度与预算
- 未绑定付款方式的账户请求上限为每分钟 10 次。
- 已绑定付款方式的账户级请求上限最高为每分钟 6000 次,仍受模型令牌限额影响。
- 有效付款方式对应最高 50 美元月预算,累计充值或消费会提高预算等级。
- 达到用户设置的月度预算后,推理、部署和微调请求会暂停。
- 预付金先消耗,超过预付余额的用量在月末后付费结算。
- 创建和读取账户、用户、模型与数据集等管理调用本身不计费,部署和训练任务会计费。
SDK、命令行与开源边界
| 组件 | 状态 | 主要用途 | 开源说明 |
|---|---|---|---|
| 官方 Python SDK | 可用 | 同步、异步推理、数据集、训练与资源管理 | 有公开代码仓库,具体许可证以仓库文件为准 |
| firectl | 可用 | 登录、密钥、模型、部署、训练和配额管理 | 支持 macOS、Linux 与 Windows |
| OpenAI SDK 兼容 | 可用 | 迁移聊天补全、工具与流式调用 | 兼容接口不代表 Fireworks 平台开源 |
| Anthropic SDK 兼容 | 可用 | Messages 风格调用 | 存在支持范围与参数差异 |
| Cookbook 与示例项目 | 公开 | 训练、评估和应用参考 | 多个仓库采用 Apache-2.0 |
公开 SDK、Cookbook、启动模板和部分工具可以单独按其许可证使用,但托管推理平台并未因此成为开源软件。模型权重是否开放以及能否商用,还取决于每个基础模型自己的许可证。
适合用户与场景
- AI 应用开发者:快速接入聊天、推理、视觉、嵌入和工具调用。
- Agent 团队:使用快速推理、结构化输出和 RFT 改善复杂工作流。
- 研究与机器学习团队:运行 SFT、DPO、RFT 或自定义训练循环。
- 高流量产品:用专用 GPU 获得更稳定吞吐和模型版本控制。
- 全球企业:按区域部署,并评估私网连接与数据驻留需求。
- 批处理团队:以折扣价格执行离线生成、数据扩充和模型评测。
优势
- Serverless、专用推理和训练共用一套账户与资源体系。
- 兼容常见 SDK,可降低已有应用的迁移工作量。
- 支持多种开放权重模型,不把应用绑定在单一模型上。
- 从 LoRA 到全参数与自定义循环,训练控制层级较完整。
- 多区域、私网和指标导出适合生产基础设施管理。
限制与风险
- 模型目录、价格和预览功能变化较快,生产环境要固定模型并准备替代项。
- 共享 Serverless 没有统一 SLA,高峰时延迟与可用性可能波动。
- 兼容接口仍有行为差异,不能跳过回归测试。
- 自动扩容会增加 GPU 费用,错误的最小副本设置也可能持续计费。
- 模型输出可能出现幻觉、不当内容和结构错误,必须按风险加入人工复核。
- 微调质量取决于数据和评估设计,训练完成不代表优于基础模型。
- 第三方模型的使用、再分发和商用仍受其许可证限制。
隐私与安全
对开放模型的普通推理,Fireworks 表示未获得明确选择加入时不会记录或保存提示词与生成内容,也不会用客户提示、训练数据或接口输入训练模型。专有 FireFunction 曾列有最长 30 天输入输出记录例外,FireOptimizer 等高级能力也可能在用户主动选择后记录数据。
- 传输数据使用 TLS 1.2 以上加密,静态数据使用 AES-256 加密。
- 专用工作负载采用逻辑隔离,并提供访问日志和客户自有存储桶选项。
- 平台列有 ISO 27001、ISO 27701、ISO 42001 和 SOC 2 Type II。
- 医疗工作负载需确认 HIPAA 合同、业务伙伴协议和具体服务范围。
- 服务在美国设有服务器,并可能发生跨境处理,数据驻留要结合部署区域和合同确认。
版权、商用与退款
用户要对上传数据、训练集、提示词和输出的使用权负责,并应检查模型输出准确性。条款限制逆向工程、出售或转让 API 密钥、干扰系统、侵犯第三方权利及其他违法使用。
平台允许商业构建不等于所有模型输出和权重都无条件可商用。采购前应同时阅读平台条款、基础模型许可证、数据集许可及企业订单。
公开资料说明预付金优先抵扣,超额用量按月后付费,但未确认适用于所有账户的一般退款承诺。充值、误扣、试用金到期和企业合同的退款或抵扣条件应在付款前向账单支持确认。
常见问题
Fireworks AI 有永久免费套餐吗?
未确认永久不限期免费套餐。新账户提供 1 美元试用金,之后按实际模型、训练或 GPU 用量计费。
Serverless 与 On-demand 应该如何选择?
低到中等流量、常用模型和快速试验适合 Serverless;稳定高流量、自定义模型、LoRA 或性能控制需求更适合 On-demand。
可以直接使用 OpenAI SDK 吗?
可以,通过修改服务配置、密钥和模型标识调用兼容接口,但参数细节和上下文溢出行为仍应重新测试。
微调模型能运行在 Serverless 吗?
不能。用户微调的 LoRA 和自定义模型需要创建 On-demand 专用部署。
提示词会被保存或用于训练吗?
开放模型普通推理采用零数据保留,且未经明确选择加入不会用于训练;专有模型或高级功能可能有例外,使用前要核对具体数据规则。
Fireworks AI 是开源平台吗?
不是已确认的开源托管平台。部分 SDK、命令行工具、Cookbook 和示例仓库开放代码,但平台服务与第三方模型分别受不同条款约束。
如何避免意外超支?
设置月度预算和告警,先小规模压测,检查缓存命中与输出长度,并确保专用部署可缩容到零。达到预算后服务会暂停,但仍应持续监控。
支持中国大陆原生应用吗?
未确认面向终端用户的中国大陆原生桌面或移动应用。Fireworks AI 主要通过网页控制台、API、SDK 和命令行工具使用,网络与合规可用性需自行评估。
总结
Fireworks AI 适合希望在同一平台完成开放模型推理、微调、训练和专用部署的团队。其兼容接口和按需 Serverless 能缩短试验路径,On-demand 与企业能力则提供更强的版本、区域和性能控制。
成本评估不能只比较单个令牌价格,还要纳入缓存、输出长度、批量折扣、训练令牌、GPU 副本和区域溢价。上线前应完成模型质量、许可证、数据处理、限流与预算的端到端验证。
桂公网安备45132202000164号