Fireworks AI 是什麼
Fireworks AI 是 Fireworks.ai, Inc. 所提供的生成式 AI 基礎設施平台,專為那些需要調用、微調及部署開放權重模型的開發者與企業而設。它將模型目錄、推理介面、訓練任務、專用 GPU 的部署功能,以及配額與監控功能整合在同一個平台上。
Fireworks AI 不是單一聊天機器人,也不等於某個模型。用戶需要選擇具體模型、流量層級和部署方式,模型許可證、上下文長度、輸入類型、輸出品質與價格都可能不同。
核心產品形態
| 產品形態 | 計費基礎 | 主要特點 | 適合任務 |
|---|---|---|---|
| Serverless Standard | 輸入、緩存輸入與輸出令牌 | 共享託管、無需管理 GPU、按需調用 | 原型、彈性流量與常用模型 |
| Serverless Priority | 較高的按令牌價格 | 高峰期優先路由,提高可靠性 | 對擁塞敏感的生產請求 |
| Serverless Fast | 高速模型專屬價格 | 針對延遲優化,部分模型處於預覽 | 互動式 Agent 與低延遲應用 |
| 隨需部署 | 按 GPU 秒 | 專用容量、可擴縮、支援自訂模型和 LoRA | 穩定高流量與私有模型 |
| 訓練與微調 | 訓練令牌或 GPU 小時 | SFT、DPO、RFT、LoRA 與全參數訓練 | 領域適配、風格對齊與複雜 Agent |
Serverless 模型推理
Serverless 提供熱門的文本、視覺及內嵌模型,呼叫方只需為實際使用的令牌付費,無需選擇 GPU、配置副本或處理冷啟動問題。Standard 是預設層級,Priority 是透過請求參數來啟用的,而 Fast 則使用獨立的高速模型。
- 聊天與文本補全支援流式輸出、工具調用和結構化結果。
- 視覺模型接收文本與圖像內容,實際格式和大小受模型限制。
- 嵌入模型把文本轉換為向量,適合檢索、聚類和相似度計算。
- 提示詞緩存可降低重複上下文的費用,但命中依賴路由和內容一致性。
- 批量推理按普通 Serverless 的輸入與輸出價格的五折計費,適合非即時大批量任務。
共享 Serverless 屬於盡力而為的服務,不提供統一的延遲或可用性保證。模型可能會下線,常用的模型通常至少會提前兩週通知;若需要固定的版本與性能保障,則應考慮使用專用部署方式。
OpenAI 與 Anthropic 兼容介面
Fireworks 提供了與 OpenAI 聊天補全格式以及 Anthropic Messages 格式相容的介面,現有的應用程式通常只需更換服務地址、金鑰和模型識別碼即可。不過,雖然能相容,但並不代表所有的參數、模型行為或邊界條件都完全相同,因此在遷移之前仍需逐一進行測試。
- 支援同步、異步和流式回應,流式最後一塊可包含令牌用量。
- 模型上下文溢出時預設可能自動縮減最大輸出,也可設定為直接報錯。
- 推理密鑰應保存在服務端,不能寫入網頁前端或公開倉庫。
- 工具調用、推理字段和結構化輸出能力應按具體模型核對。
模型微調與訓練
監督微調 SFT
SFT 使用帶有理想回答的對話樣本來訓練模型,適用於領域知識表達、固定格式、品牌語氣以及工具調用行為。資料採用逐行 JSON 的 OpenAI 相容訊息結構,可透過介面、命令列、接口或 Python SDK 來上傳。
偏好優化 DPO
DPO 使用同一提示下的優選與非優選回答對,讓模型更符合品質、風格或安全偏好。目前數據格式和會話結構有明確限制,訓練前要先通過數據驗證。
強化微調 RFT
RFT透過評估器或獎勵函數來優化模型在推理、工具使用以及多輪Agent任務中的表現。團隊可以使用託管流程,也可以將自己的評估邏輯與訓練循環接入Training API中。
LoRA 與全參數訓練
LoRA透過較小的適配器來修改行為,其部署成本與基礎模型的共享策略有關;而全參數訓練則適用於需要更大幅度改變行為的任務,但此方法會產生更高的資料、運算力及管理成本。微調模型和使用者上傳的模型需要透過按需式專用部署方式來使用,無法直接放入共享的 Serverless 環境中。
訓練工作流
- 明確品質目標、基準集、失敗類型和上線門檻。
- 從模型目錄確認基礎模型可調、上下文長度及支援的訓練方法。
- 清洗數據,刪除密鑰、個人敏感資訊及無權使用的主題。
- 按 SFT、DPO 或 RFT 格式生成訓練集與獨立評估集。
- 上傳並驗證數據,先用小任務檢查格式、損失與樣本品質。
- 啟動訓練並記錄模型、超參數、資料版本和費用。
- 在未見樣本上比較基礎模型與微調模型的品質、安全與延遲。
- 創建專用部署,分階段切流並持續監控漂移與異常輸出。
按需專用部署
按需服務以 GPU 時數計費,能提供獨立於共享流量的運算容量,且延遲更易控制。使用者可以部署平台模型、自訂模型或 LoRA,設定最小與最大的副本數量,而在沒有請求時則可將其規模縮減至零。
- 吞吐量主要由 GPU 型號、數量、模型大小、量化、上下文和批次處理決定。
- 擴大副本或每副本 GPU 數會按比例增加運行費用。
- 可選 GLOBAL、US、EUROPE 和 APAC 多區域,也可申請固定單一區域。
- 固定區域不能原地遷移,需要創建新部署並完成流量切換。
- 企業可討論私網連接、直接路由、專屬容量和更高配額。
API 接入流程
- 創建帳戶並取得試用金或綁定付款方式。
- 在模型目錄選擇輸入類型、上下文和價格合適的模型。
- 建立 API 金鑰,並放入伺服器環境變數或金鑰管理器。
- 選擇官方 Python SDK、OpenAI SDK、Anthropic SDK或直接介面調用。
- 先用非流式小請求確認模型識別碼、消息格式和用量字段。
- 再加入流式輸出、工具呼叫、結構化結果、快取或批次任務。
- 為限流、超時、模型下線及內容異常設計重試與降級。
- 設定月度預算、告警和金鑰輪換,再開放生產流量。
當前價格範例
| 套餐或版本 | 價格 | 計費週期 | 核心權益或額度 | 適合用戶 |
|---|---|---|---|---|
| 新帳戶試用 | 1美元試用金 | 一次性 | 按實際模型費率抵扣,不是無限免費套餐 | 首次接口驗證 |
| Kimi K2.6 Standard | 輸入 0.95、緩存 0.16、輸出 4 美元 | 每百萬令牌 | Serverless 文本推理 | Agent與通用生成 |
| DeepSeek V4 Pro Standard | 輸入 1.74、緩存 0.145、輸出 3.48 美元 | 每百萬令牌 | Serverless 推理 | 推理與代碼任務 |
| GPT OSS 120B Standard | 輸入 0.15、緩存 0.015、輸出 0.60 美元 | 每百萬令牌 | Serverless 開放權重模型 | 成本敏感型應用 |
| 嵌入模型 | 0.008 至 0.10 美元 | 每百萬輸入令牌 | 按參數規模和指定模型收費 | 語義檢索與向量化 |
| 批量推理 | 普通費率的 50% | 按輸入與輸出令牌 | 異步批次處理,不適合即時互動 | 離線生成和大批評測 |
| Enterprise | 聯絡銷售 | 訂製合約 | 專屬容量、私網、區域、SLA 與支援 | 大型及受監管組織 |
模型目錄和 Serverless 費率會更新,Priority 與 Fast 也可能採用更高價格。選型時應按實際模型、服務層和帳戶結算頁重新確認,不能把表中示例推廣到所有模型。
訓練價格
| 模型規模 | LoRA SFT | LoRA DPO | 全參數 SFT | 全參數 DPO |
|---|---|---|---|---|
| 不超過 16B | 0.50 美元 | 1 美元 | 1 美元 | 2 美元 |
| 16.1B 至 80B | 3 美元 | 6 美元 | 6 美元 | 12 美元 |
| 80B 至 300B | 6 美元 | 12 美元 | 12 美元 | 24 美元 |
| 超過 300B | 10 美元 | 20 美元 | 20 美元 | 40 美元 |
表中的價格皆以每百萬個訓練令牌來計算,而訓練令牌的數量會受到樣本量、訓練輪數、多輪訓練次數、圖像資料以及推理過程的影響。RFT與Dedicated Training API是按GPU使用時數來收費的,至於Serverless Training API則會分別計算預填充、快取預填充、採樣以及訓練令牌的費用。
按需 GPU 價格
| GPU | 8 月 31 日前 | 9月1日起 | 計費週期 | 適合用戶 |
|---|---|---|---|---|
| H100 80GB | 7 美元 | 8 美元 | 每 GPU 小時,按秒結算 | 常規生產推理與訓練 |
| H200 141GB | 7 美元 | 8 美元 | 每 GPU 小時,按秒結算 | 大上下文與大模型 |
| B200 180GB | 10 美元 | 13 美元 | 每 GPU 小時,按秒結算 | 高吞吐工作負載 |
| B300 288GB | 12 美元 | 15 美元 | 每 GPU 小時,按秒結算 | 更大顯存需求 |
| GB300 288GB | 18 美元 | 20 美元 | 每 GPU 小時,按秒結算 | 前沿訓練與推理 |
因區域限制而必須在特定地點進行部署時,費用將按照標準費率的 1.5 倍來計算,且必須聯絡銷售人員才能啟用此功能。啟動該功能時不會產生額外費用,但若將最小副本數設定為大於零的數值,則會持續產生 GPU 使用費用。
帳戶額度與預算
- 未綁定付款方式的帳戶請求上限為每分鐘 10 次。
- 已綁定付款方式的帳戶級請求上限最高為每分鐘 6000 次,仍受模型令牌限額影響。
- 有效付款方式對應最高 50 美元月預算,累計充值或消費會提高預算等級。
- 達到用戶設定的月度預算後,推理、部署和微調請求會暫停。
- 預付金先消耗,超過預付餘額的用量在月末後付款結算。
- 建立與讀取帳戶、使用者、模型與資料集等的管理呼叫本身不計費,部署與訓練任務則會計費。
SDK、命令行與開源邊界
| 組件 | 狀態 | 主要用途 | 開源說明 |
|---|---|---|---|
| 官方 Python SDK | 可用 | 同步、異步推理、資料集、訓練與資源管理 | 有公開代碼倉庫,具體許可證以倉庫文件為準 |
| firectl | 可用 | 登入、金鑰、模型、部署、訓練和配額管理 | 支援 macOS、Linux 與 Windows |
| OpenAI SDK 相容 | 可用 | 遷移聊天補全、工具與流式調用 | 相容介面不代表 Fireworks 平台開源 |
| Anthropic SDK 相容 | 可用 | Messages 風格呼叫 | 存在支援範圍與參數差異 |
| 食譜集與範例專案 | 公開 | 訓練、評估和應用參考 | 多個倉庫採用 Apache-2.0 |
公開的 SDK、Cookbook、啟動模板以及部分工具可以依其各自的許可證單獨使用,但託管推理平台並不因此而成為開源軟體。模型權重是否公開以及能否用於商業用途,則取決於每個基礎模型本身的許可證規定。
適合用戶與場景
- AI 應用開發者:快速接入聊天、推理、視覺、嵌入和工具調用。
- Agent 團隊:使用快速推理、結構化輸出和 RFT 改善複雜工作流。
- 研究與機器學習團隊:運行 SFT、DPO、RFT 或自訂訓練循環。
- 高流量產品:使用專用 GPU 以獲得更穩定的吞吐量及模型版本控制。
- 全球企業:按區域部署,並評估私網連接與數據駐留需求。
- 批處理團隊:以折扣價格執行離線生成、數據擴充和模型評測。
優勢
- Serverless、專用推理和訓練共用一套帳戶與資源體系。
- 相容常見 SDK,可降低既有應用的遷移工作量。
- 支援多種開放權重模型,不將應用綁定在單一模型上。
- 從 LoRA 到全參數與自訂循環,訓練控制層級較完整。
- 多區域、私網和指標導出適合生產基礎設施管理。
限制與風險
- 模型目錄、價格和預覽功能變化較快,生產環境要固定模型並準備替代項。
- 共享 Serverless 沒有統一 SLA,高峰時延遲與可用性可能波動。
- 相容介面仍有行為差異,不能跳過回歸測試。
- 自動擴容會增加 GPU 費用,錯誤的最小副本設定也可能持續計費。
- 模型輸出可能出現幻覺、不當內容和結構錯誤,必須按風險加入人工複核。
- 微調品質取決於數據和評估設計,訓練完成並不代表優於基礎模型。
- 第三方模型的使用、再分發和商用仍受其許可證限制。
隱私與安全
對於開放型模型的常規推理,Fireworks 表示在未明確選擇要加入時,不會記錄或儲存提示詞與生成內容,也不會使用用戶的提示、訓練數據或介面輸入來訓練模型。唯有專有的 FireFunction 才有最多 30 天的輸入輸出記錄例外,而 FireOptimizer 等進階功能則可能在用戶主動選擇後才會記錄數據。
- 傳輸數據使用 TLS 1.2 以上加密,靜態數據使用 AES-256 加密。
- 專用工作負載採用邏輯隔離,並提供訪問日誌及客戶自有儲存桶選項。
- 平台列有 ISO 27001、ISO 27701、ISO 42001 和 SOC 2 Type II。
- 醫療工作負載需確認 HIPAA 合約、業務合作夥伴協議及具體服務範圍。
- 服務在美國設有伺服器,並可能發生跨境處理,資料駐留需結合部署區域和合約確認。
版權、商用與退款
用戶需對上傳的資料、訓練集、提示詞及輸出的使用權負責,並應檢查模型輸出的準確性。條款禁止逆向工程、出售或轉讓 API 金鑰、干擾系統、侵犯第三方權利及其他違法使用行為。
平台允許商業使用並不代表所有模型輸出和權重都能無條件用於商業用途。在採購之前,應同時閱讀平台條款、基礎模型許可證、資料集許可以及企業訂單的相關規定。
公開資料說明預付金優先抵扣,超額用量按月後付費,但尚未確認適用於所有帳戶的一般退款承諾。充值、誤扣、試用金到期以及企業合同的退款或抵扣條件,都應在付款前向帳單支援部門確認。
常見問題
Fireworks AI 有永久免費套餐嗎?
尚未確認是否有永久且無期限的免費套餐。新帳戶可獲得 1 美元的試用金,之後則根據實際的模型、訓練量或 GPU 使用量來計費。
Serverless 與 On-demand 應該如何選擇?
低到中等流量、常用模型和快速試驗適合 Serverless;穩定高流量、自訂模型、LoRA 或性能控制需求更適合 On-demand。
可以直接使用 OpenAI SDK 嗎?
可以,透過修改服務配置、金鑰和模型識別碼來呼叫相容的介面,但參數細節和上下文溢出行為仍應重新測試。
微調模型能運行在 Serverless 嗎?
不能。用戶微調的 LoRA 和自訂模型需要創建 On-demand 專用部署。
提示詞會被保存或用於訓練嗎?
開放模型普通推理採用零數據保留,且未經明確選擇加入不會用於訓練;專有模型或高級功能可能有例外,使用前要核對具體數據規則。
Fireworks AI 是開源平台嗎?
並非已確認的開源託管平台。部分 SDK、命令列工具、Cookbook 與範例倉庫會公開代碼,但平台服務與第三方模型則分別受不同的條款約束。
如何避免意外超支?
設定月度預算與告警,先以小規模進行壓力測試,檢查緩存命中率與輸出長度,並確保專用部署能夠縮容至零。一旦達到預算上限,服務就會暫停,但仍應持續監控。
支持中國大陸原生應用嗎?
尚未確認有針對終端用戶的大陸原生桌面或行動應用。Fireworks AI 主要透過網頁控制台、API、SDK 與命令列工具來使用,其網路與合規性則需自行評估。
總結
Fireworks AI適合那些希望在同一平台上完成開放式模型的推理、微調、訓練以及專用部署的團隊。其相容的介面以及按需提供的 Serverless 功能,能夠縮短測試流程;而 On-demand 與企業級功能則能提供更強大的版本控制、地區管理及效能調整功能。
成本評估不能只比較單個令牌的價格,還必須考慮緩存、輸出長度、批量折扣、訓練令牌、GPU副本以及地區溢價等因素。在上線之前,應完成對模型品質、許可證、資料處理、限流機制以及預算等各個方面的端到端驗證。
桂公網安備45132202000164號