Ollama是什么
Ollama是一款用于下载、运行和管理大语言模型的本地推理工具。安装后可通过简单命令拉取Qwen、Gemma、DeepSeek、gpt-oss、Llama等模型,在自己的Windows、macOS或Linux设备上聊天或提供API。
它负责模型文件、量化版本、显存加载、上下文和本地服务,让开发者无需手工配置复杂推理框架。Ollama也提供Cloud模型:命令和API形式与本地模型相近,但实际推理会自动转移到Ollama云端,从而运行本机装不下的大模型。
核心功能
- 本地模型管理:通过pull、run、list、show和remove等命令下载、运行、查看和删除模型,支持不同参数量与量化版本。
- 本地API:安装后默认提供生成、聊天、Embedding、模型列表与管理接口,本机访问通常无需API Key。
- OpenAI兼容接口:常用Chat Completions等兼容方式便于接入已有应用、IDE和Agent工具。
- Modelfile:从基础模型定义System Prompt、模板、参数、Adapter和许可证信息,创建可复用自定义模型。
- 工具与结构化输出:支持Tool Calling、JSON Schema、视觉输入和Embedding,具体能力取决于模型。
- Cloud模型:使用带cloud标识的模型或直接调用云API,无需本地GPU即可获得完整上下文和大模型能力。
- 开发工具集成:可连接Claude Code、Codex、OpenCode、OpenClaw、Zed及多种聊天UI,通过ollama launch简化配置。
- Web Search与Fetch:云端提供搜索和网页读取API,为本地或云模型补充实时资料。
价格
| 套餐或版本 | 价格、额度与核心权益 |
|---|---|
| 本地使用 / Free | 0美元,下载客户端并在本机运行模型不收平台订阅费;Cloud提供轻量免费用量和1个并发模型。 |
| Pro | 20美元/月或200美元/年,Cloud使用量约为Free的50倍,可同时运行3个云模型,并支持上传和分享私有模型。 |
| Max | 100美元/月,Cloud用量约为Pro的5倍、10个并发模型;当前新订阅暂时暂停,现有用户保留权益。 |
| Team | 介绍期25美元/席位/月,至少5席、最低125美元/月;加入共享账单和团队使用余额,目前需加入候补名单。 |
| Enterprise | 定制报价,增加批量价格、合同、安全采购支持和部署规划。 |
Cloud不是固定Token包,而是按模型等级、输入、缓存输入和输出Token衡量用量;不同模型从轻量Level 1到高成本Level 4消耗不同。
个人方案存在每5小时Session限制和每7天周限制,Pro与Max可购买额外余额。
Team先消耗成员包含用量,超出后从共享余额按模型费率扣费。
硬件与本地成本
本地软件免费不代表推理没有成本。模型文件可能占几GB到数百GB,速度和可用上下文取决于内存、显存、GPU架构和量化。
小模型可在CPU或统一内存设备运行,大型模型需要高显存或多GPU。上下文越长,KV Cache占用越高。
正式部署还应考虑电力、服务器、并发、监控、备份和访问控制。
隐私、开源与许可证
本地运行时,官方表示看不到用户提示和数据;可关闭Cloud功能进入Local-only模式。
使用Cloud时,提示和回复会被处理以提供服务,但官方声明不保存、不记录内容,也不用于训练,只收集有限账户与用量元数据。
Cloud主要在美国托管,也可能路由到欧洲和新加坡。
Ollama核心命令行和服务端仓库采用MIT许可证。需要注意,模型文件拥有各自许可证:有些允许商业使用,有些限制用途、用户规模或再分发。
Ollama开源不等于通过它下载的所有模型都可自由商用;企业必须逐个审查模型卡和许可证。
桌面GUI、Cloud和网站服务的开源范围也不能简单等同于核心仓库。
Ollama使用教程
完成一次基础任务
- 注册Ollama并创建仅用于测试环境的API Key;
- 根据输入类型、上下文、质量、速度和价格选择模型;
- 先调用本地模型管理完成最小请求并检查返回结构;
- 再用本地API测试流式输出、参数和异常响应;
- 记录Tokens、调用次数、延迟、错误率和单次成本;
- 把密钥移入服务端密钥管理器后再接入正式应用;
建立可复用的专业工作流
- 为开发、测试和生产环境使用不同密钥与额度;
- 按本地模型管理、本地API和OpenAI兼容接口建立代表性评测集;
- 设置超时、并发、重试、限流和预算上限;
- 对输出执行事实、安全、格式和敏感信息检查;
- 监控模型版本、价格、延迟和失败率变化;
- 准备降级模型、熔断和人工接管方案;
适合哪些用户
- 希望数据留在本机的开发者和隐私敏感用户
- 构建本地RAG、聊天、编程助手和Agent的团队
- 需要用统一API切换本地与Cloud模型的应用开发者
- 学习不同开源模型和量化效果的研究与教育用户
安全与限制
- 本地API默认可能无需认证,只应绑定可信网络,不能直接暴露到公网;
- 容器、远程服务器和团队环境应增加反向代理、TLS、身份验证与速率限制;
- Agent接入终端或文件系统时必须使用沙箱和最小权限;
- 模型输出可能幻觉、生成不安全代码或泄露提示中的敏感数据;
- 小模型质量通常低于前沿Cloud模型;
- 模型来源、文件完整性和许可证也需核查;
- 关键业务应建立评测、内容过滤和人工复核;
常见问题
Ollama完全免费吗?
本地客户端和本地推理免费;Cloud高级用量、团队服务以及自己的硬件和电力需要成本。
Ollama需要联网吗?
首次下载模型需要联网,下载后本地模型可离线运行;Cloud和Web Search必须联网。
没有显卡可以用吗?
可以运行部分小模型但速度较慢。内存不足的大模型可改用量化版本或Cloud模型。
桂公网安备45132202000164号