Together AI是什麼
Together AI是一個面向開發者與企業的AI基礎建設平台,提供大語言模型、圖片、影片、語音、Embedding以及安全模型的API服務。使用者可以從Serverless推理開始使用,也可根據需求升級到Provisioned Throughput、Dedicated Inference或GPU Cluster等服務。
平台主要涵蓋開源及開放權重模型,同時提供模型微調、Batch API、代碼Sandbox以及高效能儲存功能。開發者可透過REST、Python或TypeScript SDK,將模型整合到聊天、搜尋、Agent及內容生成應用中。
Together AI主要功能
- Serverless Inference:無需管理GPU,按Token、圖片、影片或音頻的實際用量結算。
- 模型目錄:提供多家廠商的文本、推理、代碼、視覺和多模態模型。
- OpenAI相容介面:降低現有聊天與Completion應用遷移成本。
- Batch API:以異步方式處理大量非即時請求,適合離線任務。
- 緩存輸入:支援部分模型的Prompt緩存價格,降低重複上下文成本。
- Provisioned Throughput:按PTU預留固定吞吐能力,適合穩定大流量。
- Dedicated Inference:在單租戶GPU上運行模型,獲得穩定性能與更強控制。
- GPU Clusters:按GPU小時使用H100、H200、B200等算力。
- Fine-tuning:支援SFT、LoRA、全量微調和偏好優化等訓練方式。
- 圖像與影片:透過統一API調用多種生成、編輯和多媒體模型。
- Code Sandbox:為Agent或模型生成代碼提供隔離執行環境。
- 官方SDK與Cookbook:提供Python、TypeScript和可重複使用Agent範例。
推理部署方式對比
| 方式 | 計費方式 | 適合場景 |
|---|---|---|
| Serverless | 按Token或媒體生成單位 | 試驗、波動流量和快速上線 |
| Batch API | 異步批量價格 | 離線分類、摘要、評測和數據處理 |
| Provisioned Throughput | 按PTU每分鐘 | 穩定大流量與可預測吞吐 |
| Dedicated Inference | 按單租戶GPU小時 | 訂製模型、穩定延遲和隔離需求 |
| GPU Cluster | 按GPU小時與預留週期 | 訓練、推理、自訂工作負載和研究 |
Serverless文本模型價格範例
下表為官方價格頁核驗時的標準請求參考價,單位為每100萬Token美元。模型上線、下線及單價變化頻繁,應在正式調用前再次檢查模型頁。
| 模型 | 輸入 | 緩存輸入 | 輸出 |
|---|---|---|---|
| MiniMax M3 | 0.30美元 | 0.06美元 | 1.20美元 |
| GLM-5.2 | 1.40美元 | 0.26美元 | 4.40美元 |
| Kimi K3 | 3.00美元 | 0.30美元 | 15.00美元 |
| DeepSeek V4 Flash 0731 | 0.14美元 | 0.03美元 | 0.28美元 |
| gpt-oss-120B | 0.15美元 | 未單列 | 0.60美元 |
| Llama 3.3 70B | 1.04美元 | 未單列 | 1.04美元 |
| gpt-oss-20B | 0.05美元 | 未單列 | 0.20美元 |
輸入與輸出單價僅是基礎費用,Agent循環、長上下文、工具結果以及重複歷史都會增加Token數量。具有緩存價格的模型,只有在請求符合緩存規則時,才能獲得相應優惠。
Dedicated與GPU Cluster價格
以下皆為每張GPU每小時的按需美元參考價格,專用推理及集群的價格則有所不同。長期預訂可享有階梯式優惠,實際可使用的地區、庫存及配置以控制台顯示的內容為準。
| 硬體 | Dedicated Inference | GPU Cluster按需 | 集群長期參考 |
|---|---|---|---|
| NVIDIA HGX H100 | 5.49美元 | 3.99美元 | 7至30天3.69美元,91至180天3.19美元 |
| NVIDIA HGX H200 | 聯絡銷售 | 5.99美元 | 7至30天4.99美元,91至180天3.99美元 |
| NVIDIA HGX B200 | 8.99美元 | 8.19美元 | 7至30天7.99美元,91至180天6.79美元 |
| NVIDIA HGX B300 | 聯絡銷售 | 聯絡銷售 | 按合約 |
| NVIDIA GB200或GB300 NVL72 | 聯絡銷售 | 聯絡銷售 | 按合約 |
微調與Sandbox價格
| 服務 | 參考價格 | 計費說明 |
|---|---|---|
| 16B以內SFT全量微調 | 1.20美元 | 每100萬訓練Token |
| 16B以內SFT LoRA | 1.50美元 | 每100萬訓練Token |
| 16B以內DPO全量微調 | 3.75美元 | 每100萬訓練Token |
| 16B以內DPO LoRA | 3.20美元 | 每100萬訓練Token |
| 標準微調最低收費 | 4美元/任務 | 特定大型模型規則可能不同 |
| Code Interpreter | 0.03美元 | 每個最長60分鐘Session |
| Sandbox vCPU | 0.0446美元/小時 | 按分配計算資源 |
| Sandbox記憶體 | 0.0149美元/GiB/小時 | 與vCPU費用疊加 |
微調費用按訓練數據Token乘Epoch,並加上可選驗證數據與評估次數計算。訓練後的模型推理、專用端點及儲存仍可能另外收費。
創建API Key與首次調用教學
- 建立專案:註冊控制台並建立獨立開發專案。
- 設定帳單:充值或配置可用支付方式,同時設定預算與提醒。
- 生成密鑰:建立API Key並立即儲存到安全的Secrets系統中。
- 安裝SDK:根據技術架構安裝官方的Python或TypeScript函式庫。
- 選擇模型:比較上下文、能力、速度、許可證和當前單價。
- 小量測試:限制最大輸出Token,先驗證回應格式、錯誤和流式返回。
- 上線監控:記錄Token、延遲、狀態碼、模型版本和單請求成本。
模型選擇教學
- 使用真實業務樣本建立品質、延遲、安全與成本評測集。
- 先用低價小模型測試簡單分類、提取和路由任務。
- 複雜推理、代碼或長上下文再比較大型模型,不只看榜單分數。
- 檢查模型許可證、可接受使用政策及商業部署要求。
- 測試JSON、工具呼叫、流式輸出、併發和上下文上限。
- 為主模型配置可降級備選,並對模型下線建立遷移流程。
- 按週統計單成功任務成本,而不是只比較每百萬Token價格。
微調模型教學
- 確認必要性:先驗證Prompt、RAG和工具調用是否已經能滿足需求。
- 準備數據:去重、脫敏並統一輸入輸出格式,劃分訓練與驗證集。
- 選擇方法:一般先用LoRA SFT,只有明確理由才考慮全量或DPO。
- 估算費用:按數據Token、Epoch、驗證次數和最低收費計算訓練預算。
- 啟動任務:上傳數據並記錄基座模型、參數、代碼和數據版本。
- 獨立評估:用未參與訓練的測試集檢查品質、偏差和安全回歸。
- 部署監控:先小流量發布,並持續比較微調模型與基座模型。
Together AI適合哪些用戶
- AI應用開發者:透過統一API調用多種開放模型與多媒體能力。
- Agent團隊:組合推理、工具、Embedding、Sandbox和多模型路由。
- 數據團隊:使用Batch完成大規模分類、摘要和結構化提取。
- 模型團隊:進行SFT、LoRA、DPO和訂製模型部署。
- 高流量產品:從Serverless逐步升級到PTU或Dedicated Inference。
- 研究機構:租用GPU集群開展訓練、評測和推理實驗。
- 多媒體產品:統一接入圖片、影片、語音識別與合成模型。
產品優勢
- 覆蓋Serverless、Batch、PTU、Dedicated與GPU Cluster完整路徑;
- 模型選擇豐富,可在同一平台比較多家開放模型;
- 支援文本、圖片、影片、音頻、Embedding和安全模型;
- 部分介面相容OpenAI格式,現有應用遷移成本較低;
- 提供訓練、微調、代碼Sandbox和儲存等Agent基礎設施;
- 官方Python、TypeScript SDK與Cookbook範例較完整;
- 定價頁公開Token、GPU和訓練單位,便於成本估算。
使用限制與成本注意事項
- 模型目錄和單價更新頻繁,不能將一次核驗價格寫死到長期預算;
- 不同模型的工具調用、JSON、視覺和上下文能力並不一致;
- Agent多輪循環會反複攜帶上下文,成本可能遠高於單次聊天;
- 專用GPU按運行時間計費,空閒端點也可能持續產生費用;
- Sandbox不會自動終止的場景應設定TTL並主動清理;
- 微調可能記憶敏感資訊或降低通用能力,必須獨立評測;
- 模型許可證不同,調用API不會自動授予無限商業使用權。
數據安全與生產建議
- API Key僅保存在服務端Secrets中,並會根據項目和環境分別建立;
- 為開發、測試和生產設定獨立預算、速率限制和權限;
- 上傳微調數據前刪除個人資訊、密鑰和受限制內容;
- 記錄模型ID、請求參數和版本,確保問題可以重現;
- 為429、超時和服務錯誤使用有限重試與指數退避;
- 高風險輸出增加內容過濾、事實核驗和人工審批;
- 定期清理閒置端點、Sandbox、資料集和舊API Key。
GitHub與開源說明
Together AI的官方GitHub帳戶公開了Python與TypeScript的SDK、Together Cookbook、Sandbox工具以及多種範例。Cookbook和Sandbox等儲存庫都採用各自的開源授權條款,非常適合用來學習API和Agent的工作流程。
AI商業雲平台、推論基礎設施以及所有的伺服器端代碼,並不構成完整的開源產品。平台上所託管的模型亦分屬於不同的開發者及授權條款,使用前需逐一核對。
常見問題
Together AI免費嗎
平台以儲值或按量計費為主,帳號可能獲得活動或試用Credits,但金額和資格可能會變動。生產使用時應根據模型、媒體、GPU及工具的實際用量來預算。
Together AI如何收費
文本模型通常按輸入與輸出Token收費,圖片、影片和音頻則按各自的單位計算。專用推理與GPU集群則按GPU小時計費,微調則按訓練Token計費。
支援OpenAI SDK嗎
部分聊天和生成接口提供OpenAI相容方式,便於遷移現有應用。模型ID、參數和特有功能仍需按Together文件調整。
可以微調開源模型嗎
可以,平台提供SFT、LoRA、全量微調和DPO等功能。支援範圍、價格和最低收費會因模型大小與類型不同而有所差異。
Together AI是開源的嗎
雲平台本身並非完整的開源產品。官方的 SDK、Cookbook以及部分工具是開源的,而所託管的模型則需遵守各自的模型許可證規定。
桂公網安備45132202000164號