Ollama是什麼
Ollama是一種用於下載、運行及管理大型語言模型的本地推理工具。安裝後,可透過簡單的指令下載Qwen、Gemma、DeepSeek、gpt-oss、Llama等模型,並在自己的Windows、macOS或Linux裝置上使用它們進行對話,或是提供API服務。
它負責處理模型檔案、量化版本、顯存載入、上下文以及本地服務,讓開發者不必手動配置複雜的推理框架。Ollama也提供雲端模型:其命令和API形式與本地模型相似,但實際的推理過程會自動轉移到Ollama的雲端上,如此一來就能運行那些無法在本地裝載的大型模型。
核心功能
- 本地模型管理:透過pull、run、list、show和remove等命令下載、運行、查看和刪除模型,支援不同參數量與量化版本。
- 本地API:安裝後預設提供生成、聊天、Embedding、模型列表與管理介面,本機訪問通常無需API Key。
- OpenAI相容介面:常用Chat Completions等相容方式便於接入已有應用、IDE和Agent工具。
- Modelfile:從基礎模型定義System Prompt、模板、參數、Adapter和許可證資訊,創建可重複使用的自訂模型。
- 工具與結構化輸出:支援Tool Calling、JSON Schema、視覺輸入和Embedding,具體能力取決於模型。
- 雲端模型:使用帶有cloud標識的模型或直接調用雲端API,無需本地GPU即可獲得完整上下文和大模型能力。
- 開發工具整合:可連接Claude Code、Codex、OpenCode、OpenClaw、Zed及多種聊天UI,透過ollama launch簡化配置。
- Web Search與Fetch:雲端提供搜尋和網頁讀取API,為本地或雲模型補充即時資料。
價格
| 套餐或版本 | 價格、額度與核心權益 |
|---|---|
| 本地使用 / 免費 | 0美元,下載用戶端並在本機運行模型不收平台訂閱費;Cloud提供輕量免費用量及1個併發模型。 |
| Pro | 20美元/月或200美元/年,Cloud使用量約為Free的50倍,可同時運行3個雲模型,並支援上傳和分享私有模型。 |
| Max | 100美元/月,Cloud用量約為Pro的5倍、10個並發模型;目前新訂閱暫時暫停,現有用戶保留權益。 |
| Team | 介紹期25美元/席位/月,至少5席、最低125美元/月;加入共享帳單及團隊使用餘額,目前需加入候補名單。 |
| Enterprise | 訂製報價,增加批量價格、合約、安全採購支援及部署規劃。 |
Cloud並非固定的Token包,而是根據模型等級、輸入資料、緩存輸入及輸出Token來計算使用量;不同的模型從低成本的Level 1到高成本的Level 4,其資源消耗也有所不同。
個人方案存在每5小時Session限制和每7天周限制,Pro與Max可購買額外餘額。
團隊先消耗成員包含用量,超出後從共享餘額按模型費率扣費。
硬件與本地成本
本地軟體免費並不代表推理沒有成本。模型檔案可能佔幾GB到數百GB,速度和可用上下文則取決於記憶體、顯存、GPU架構以及量化方式。
小型模型可在CPU或統一記憶體裝置上運行,大型模型則需要大量的顯存或多個GPU。上下文越長,KV Cache的佔用量就越高。
正式部署還應考慮電力、伺服器、併發、監控、備份和訪問控制。
隱私、開源與許可證
在本地運行時,官方表示無法看到使用者提示與數據;可關閉Cloud功能進入Local-only模式。
使用Cloud時,提示和回復會被處理以提供服務,但官方聲明不保存、不記錄內容,也不用於訓練,只收集有限的帳戶與用量元數據。
Cloud主要在美國託管,也可能路由到歐洲和新加坡。
Ollama的核心命令行及伺服器端程式碼採用MIT許可證。需要注意的是,模型檔案則各有其各自的許可證:有些允許商業使用,而有些則對使用範圍、使用者數量或再散布行為有所限制。
Ollama開源並不代表透過它下載的所有模型都能自由用於商業用途;企業必須逐一審查模型說明文件及許可證。
桌面GUI、Cloud和網站服務的開源範圍也不能簡單等同於核心倉庫。
Ollama使用教學
完成一次基礎任務
- 註冊Ollama並創建僅用於測試環境的API Key;
- 根據輸入類型、上下文、品質、速度和價格選擇模型;
- 先調用本地模型管理完成最小請求並檢查返回結構;
- 再用本地API測試流式輸出、參數和異常響應;
- 記錄Tokens、呼叫次數、延遲、錯誤率及單次成本;
- 把密鑰移入服務端密鑰管理器後再接入正式應用;
建立可重複使用的專業工作流
- 為開發、測試與生產環境使用不同密鑰與額度;
- 按本地模型管理、本地API和OpenAI相容接口建立代表性評測集;
- 設定超時、併發、重試、限流和預算上限;
- 對輸出執行事實、安全、格式和敏感資訊檢查;
- 監控模型版本、價格、延遲和失敗率變化;
- 準備降級模型、熔斷和人工接管方案;
適合哪些用戶
- 希望數據留在本機的開發者和隱私敏感用戶
- 構建本地RAG、聊天、編程助手和Agent的團隊
- 需要用統一API切換本地與Cloud模型的應用開發者
- 學習不同開源模型和量化效果的研究與教育用戶
安全與限制
- 本地API預設可能無需認證,只應綁定可信網路,不能直接暴露到公網;
- 容器、遠端伺服器及團隊環境應增加反向代理、TLS、身分驗證與速率限制;
- Agent在接入終端或檔案系統時必須使用沙箱和最小權限;
- 模型輸出可能幻覺、生成不安全代碼或泄露提示中的敏感數據;
- 小模型品質通常低於前沿Cloud模型;
- 模型來源、檔案完整性及許可證也需核查;
- 關鍵業務應建立評測、內容過濾和人工複核;
常見問題
Ollama完全是免費的嗎?
本地用戶端和本地推理免費;Cloud高級用量、團隊服務以及自己的硬件和電力需要成本。
Ollama需要連網嗎?
首次下載模型需要上網,下載後本地模型可離線運行;Cloud和Web Search必須上網。
沒有顯卡可以用嗎?
可以運行部分小模型但速度較慢。記憶體不足的大模型可改用量化版本或Cloud模型。
桂公網安備45132202000164號