Ollama
免费增值
AI工具大全 AI开发框架

Ollama

在本地电脑或云端快速运行和调用开放大语言模型

标签:

Ollama是什么

Ollama是一款用于下载、运行和管理大语言模型的本地推理工具。安装后可通过简单命令拉取Qwen、Gemma、DeepSeek、gpt-oss、Llama等模型,在自己的Windows、macOS或Linux设备上聊天或提供API。

它负责模型文件、量化版本、显存加载、上下文和本地服务,让开发者无需手工配置复杂推理框架。Ollama也提供Cloud模型:命令和API形式与本地模型相近,但实际推理会自动转移到Ollama云端,从而运行本机装不下的大模型。

核心功能

  • 本地模型管理:通过pull、run、list、show和remove等命令下载、运行、查看和删除模型,支持不同参数量与量化版本。
  • 本地API:安装后默认提供生成、聊天、Embedding、模型列表与管理接口,本机访问通常无需API Key。
  • OpenAI兼容接口:常用Chat Completions等兼容方式便于接入已有应用、IDE和Agent工具。
  • Modelfile:从基础模型定义System Prompt、模板、参数、Adapter和许可证信息,创建可复用自定义模型。
  • 工具与结构化输出:支持Tool Calling、JSON Schema、视觉输入和Embedding,具体能力取决于模型。
  • Cloud模型:使用带cloud标识的模型或直接调用云API,无需本地GPU即可获得完整上下文和大模型能力。
  • 开发工具集成:可连接Claude Code、Codex、OpenCode、OpenClaw、Zed及多种聊天UI,通过ollama launch简化配置。
  • Web Search与Fetch:云端提供搜索和网页读取API,为本地或云模型补充实时资料。

价格

套餐或版本价格、额度与核心权益
本地使用 / Free0美元,下载客户端并在本机运行模型不收平台订阅费;Cloud提供轻量免费用量和1个并发模型。
Pro20美元/月或200美元/年,Cloud使用量约为Free的50倍,可同时运行3个云模型,并支持上传和分享私有模型。
Max100美元/月,Cloud用量约为Pro的5倍、10个并发模型;当前新订阅暂时暂停,现有用户保留权益。
Team介绍期25美元/席位/月,至少5席、最低125美元/月;加入共享账单和团队使用余额,目前需加入候补名单。
Enterprise定制报价,增加批量价格、合同、安全采购支持和部署规划。

Cloud不是固定Token包,而是按模型等级、输入、缓存输入和输出Token衡量用量;不同模型从轻量Level 1到高成本Level 4消耗不同。

个人方案存在每5小时Session限制和每7天周限制,Pro与Max可购买额外余额。

Team先消耗成员包含用量,超出后从共享余额按模型费率扣费。

硬件与本地成本

本地软件免费不代表推理没有成本。模型文件可能占几GB到数百GB,速度和可用上下文取决于内存、显存、GPU架构和量化。

小模型可在CPU或统一内存设备运行,大型模型需要高显存或多GPU。上下文越长,KV Cache占用越高。

正式部署还应考虑电力、服务器、并发、监控、备份和访问控制。

隐私、开源与许可证

本地运行时,官方表示看不到用户提示和数据;可关闭Cloud功能进入Local-only模式。

使用Cloud时,提示和回复会被处理以提供服务,但官方声明不保存、不记录内容,也不用于训练,只收集有限账户与用量元数据。

Cloud主要在美国托管,也可能路由到欧洲和新加坡。

Ollama核心命令行和服务端仓库采用MIT许可证。需要注意,模型文件拥有各自许可证:有些允许商业使用,有些限制用途、用户规模或再分发。

Ollama开源不等于通过它下载的所有模型都可自由商用;企业必须逐个审查模型卡和许可证。

桌面GUI、Cloud和网站服务的开源范围也不能简单等同于核心仓库。

Ollama使用教程

完成一次基础任务

  1. 注册Ollama并创建仅用于测试环境的API Key;
  2. 根据输入类型、上下文、质量、速度和价格选择模型;
  3. 先调用本地模型管理完成最小请求并检查返回结构;
  4. 再用本地API测试流式输出、参数和异常响应;
  5. 记录Tokens、调用次数、延迟、错误率和单次成本;
  6. 把密钥移入服务端密钥管理器后再接入正式应用;

建立可复用的专业工作流

  1. 为开发、测试和生产环境使用不同密钥与额度;
  2. 按本地模型管理、本地API和OpenAI兼容接口建立代表性评测集;
  3. 设置超时、并发、重试、限流和预算上限;
  4. 对输出执行事实、安全、格式和敏感信息检查;
  5. 监控模型版本、价格、延迟和失败率变化;
  6. 准备降级模型、熔断和人工接管方案;

适合哪些用户

  • 希望数据留在本机的开发者和隐私敏感用户
  • 构建本地RAG、聊天、编程助手和Agent的团队
  • 需要用统一API切换本地与Cloud模型的应用开发者
  • 学习不同开源模型和量化效果的研究与教育用户

安全与限制

  • 本地API默认可能无需认证,只应绑定可信网络,不能直接暴露到公网;
  • 容器、远程服务器和团队环境应增加反向代理、TLS、身份验证与速率限制;
  • Agent接入终端或文件系统时必须使用沙箱和最小权限;
  • 模型输出可能幻觉、生成不安全代码或泄露提示中的敏感数据;
  • 小模型质量通常低于前沿Cloud模型;
  • 模型来源、文件完整性和许可证也需核查;
  • 关键业务应建立评测、内容过滤和人工复核;

常见问题

Ollama完全免费吗?

本地客户端和本地推理免费;Cloud高级用量、团队服务以及自己的硬件和电力需要成本。

Ollama需要联网吗?

首次下载模型需要联网,下载后本地模型可离线运行;Cloud和Web Search必须联网。

没有显卡可以用吗?

可以运行部分小模型但速度较慢。内存不足的大模型可改用量化版本或Cloud模型。

©️版权声明:若无特殊声明,本站所有文章版权均归AI工具分享原创和所有,未经许可,任何个人、媒体、网站、团体不得转载、抄袭或以其他方式复制发表本站内容,或在非我站所属的服务器上建立镜像。否则,我站将依法保留追究相关法律责任的权利。

类似于Ollama的工具