LiteLLM是什么
LiteLLM是一款开源AI网关和Python SDK,可以把OpenAI、Anthropic、Gemini、Azure、Amazon Bedrock、Vertex AI、Ollama等不同模型服务统一到相近的调用方式中。应用可以使用OpenAI兼容接口切换模型,减少为每家供应商分别维护适配代码的工作。
项目由Berri AI维护,既适合开发者在Python项目中直接调用,也可以作为团队共享的代理服务器部署。它不是大语言模型,也不赠送模型推理额度,实际回答仍由用户配置的云端或本地模型生成。
两种主要使用方式
| 方式 | 适合对象 | 主要能力 | 典型场景 |
|---|---|---|---|
| Python SDK | 应用开发者 | 统一调用、异常映射、路由、重试、回退和回调 | 在单个Python项目中接入多个模型 |
| AI Gateway | 平台与基础设施团队 | 集中认证、虚拟密钥、预算、日志、管理后台和多租户控制 | 为多个应用、用户或团队提供统一模型入口 |
SDK更接近代码库,网关则是独立运行的中心服务。小型项目可先从SDK开始,需要统一权限、费用和审计时再部署网关。
主要功能
统一大模型API
LiteLLM把多家模型提供商映射为统一接口,覆盖聊天、Responses、嵌入、图像、音频、批处理、重排序和消息等不同端点。各模型并不一定支持所有能力,接入前仍需查看对应提供商的端点兼容表。
- 使用OpenAI兼容格式调用多家模型
- 连接商业API、云平台模型和部分本地推理服务
- 统一常见异常类型与响应结构
- 为模型设置别名,减少业务代码与具体型号绑定
- 在新增模型或供应商时降低迁移成本
智能路由与故障回退
路由器可以在多个模型或部署之间分配请求,并配置重试、超时和回退策略。某个端点限流或故障时,系统可尝试其他部署,但前提是团队已经正确配置备用模型和兼容参数。
- 多部署负载均衡
- 按成本、延迟或可用性设计路由
- 处理限流与临时服务错误
- 在主模型失败时调用备用模型
- 通过缓存减少部分重复调用
虚拟密钥与访问控制
网关可以向应用、项目、用户或团队签发虚拟密钥,而不必直接分发上游模型密钥。管理员能够限制可用模型、预算、请求速率和有效期,并按不同主体统计花费。
虚拟密钥只是治理层,仍需保护主密钥、数据库和管理后台。生产环境不应使用示例密钥,也不能把管理接口直接暴露到公网。
成本追踪与预算管理
LiteLLM会根据模型价格映射和请求用量估算成本,并可按密钥、用户、团队、项目或标签汇总。团队可以设置预算和速率限制,减少测试脚本或异常流量造成的意外账单。
- 跟踪请求量、令牌量和估算花费
- 设置用户、团队或项目预算
- 限制每分钟请求数与令牌数
- 按模型或标签观察成本分布
- 通过Prometheus等方式接入监控体系
日志、可观测性与Guardrails
网关支持请求和响应日志、回调、指标及多种可观测性集成,也可以接入内容安全和Guardrails机制。是否记录提示词与回答由配置决定,处理敏感数据时应优先采用最小化日志策略。
MCP与智能体网关
当前项目还包含MCP Gateway和A2A Agent Gateway能力,可把MCP工具或兼容智能体置于统一入口后面。管理员仍需单独控制工具授权、网络访问、审批策略和凭据范围。
支持的模型与服务
官方当前描述为支持100多家模型提供商,具体数量会随版本变化。常见选择包括OpenAI、Anthropic、Google Gemini、Azure OpenAI、Amazon Bedrock、Vertex AI、Cohere、Mistral、DeepSeek、xAI、Ollama和vLLM等。
| 类别 | 示例 | 使用提醒 |
|---|---|---|
| 商业模型API | OpenAI、Anthropic、Gemini、Mistral、xAI | 需要各自密钥并按供应商价格付费 |
| 云平台模型 | Azure、Bedrock、Vertex AI | 涉及云账户、区域、权限和网络配置 |
| 本地或自托管推理 | Ollama、vLLM、LM Studio | 需要自行准备模型、算力和服务端点 |
| 多模态服务 | 图像、音频、嵌入与重排序提供商 | 端点支持程度因提供商而异 |
价格与版本
以下信息于2026年8月24日核验。LiteLLM采用免费开源核心加付费企业功能的模式,企业费用不是按模型令牌加价,而是根据年度网关请求容量、部署架构和支持需求报价。
| 版本 | 许可证或价格 | 主要能力 | 适合对象 |
|---|---|---|---|
| Open Source | 0美元许可证费,永久免费自托管 | 统一API、虚拟密钥、用户与团队、费用追踪、预算、速率限制、回退、日志和Prometheus指标 | 能够自行部署和维护的开发者与团队 |
| Enterprise | 年度合同,联系销售询价 | 开源版能力加SSO、SCIM、OIDC或JWT、审计日志、密钥轮换、组织权限、多区域控制和企业支持 | 大规模、受监管或需要服务等级协议的组织 |
| Enterprise试用 | 30天,无需信用卡 | 用于测试企业许可功能 | 采购前验证安全与治理需求的团队 |
企业版标准支持包含专用沟通渠道,官方文档列出的24小时支持服务等级协议可能需要额外费用。实际报价、请求容量、隔离网络、多区域部署和响应等级应以合同为准。
免费版仍有哪些成本
- OpenAI、Anthropic、Gemini等上游模型调用费
- 云服务器、容器或本地硬件成本
- 生产环境所需的PostgreSQL、Redis和对象存储
- 日志、监控、备份、网络流量和安全服务费用
- 部署、升级、故障处理和合规审计的人力成本
因此“免费自托管”只表示开源核心没有许可证费,不代表网关运行和模型推理免费。购买或部署前应把模型用量、基础设施和运维一起计入总成本。
部署方式
- 使用Python包直接集成SDK或启动代理服务
- 通过官方容器镜像运行AI Gateway与管理后台
- 使用Docker Compose搭建测试或小型环境
- 通过Helm在Kubernetes集群部署
- 使用官方Terraform模块部署到AWS或Google Cloud
- 企业版可在自有基础设施运行,并支持隔离网络方案
生产环境通常还需要数据库、缓存、反向代理、TLS、秘密管理、监控和备份。官方建议生产镜像使用稳定标签,但团队仍应固定明确版本,避免无计划升级带来行为变化。
快速使用流程
- 明确采用Python SDK还是集中式AI Gateway,并列出需要接入的模型提供商。
- 准备各模型服务的账户、API密钥、区域和配额,不要把密钥写入源码。
- 在测试环境安装LiteLLM或启动官方容器,配置模型别名与上游端点。
- 创建主密钥和虚拟密钥,为应用、团队或项目设置模型白名单、预算与速率限制。
- 让应用改用网关地址和OpenAI兼容调用方式,验证流式输出、工具调用与错误处理。
- 配置超时、重试、回退、日志脱敏、指标、告警和数据库备份。
- 进行并发、故障和成本测试,再以固定稳定版本发布到生产环境。
适合哪些用户
- 需要同时调用多家大模型的AI应用开发者
- 希望统一管理模型密钥和费用的平台团队
- 需要为多个部门分配预算与模型权限的企业
- 需要模型回退和负载均衡的生产系统
- 希望把模型网关保留在自有网络中的组织
- 需要在云端模型与本地模型之间切换的团队
产品优势
- 兼容模型和服务商范围广,减少重复适配
- 提供SDK与集中式网关两种使用层级
- 开源核心可自行审查、修改和部署
- 虚拟密钥、预算和速率限制适合多租户治理
- 具备路由、重试、回退、缓存和可观测性能力
- 支持容器、Kubernetes和主流云基础设施
限制与风险
兼容接口不代表完全一致
不同模型在工具调用、结构化输出、图像、音频、上下文长度和错误行为上仍有差异。切换模型前必须运行真实用例测试,不能只验证一个简单聊天请求。
价格估算需要维护
成本追踪依赖模型价格和令牌计算信息,供应商调价或新模型上线时可能出现偏差。财务结算应以上游账单为准,LiteLLM统计更适合作为运营监控。
网关会成为关键基础设施
所有模型流量集中后,错误配置、数据库故障或版本升级都可能影响多个应用。生产环境应设置高可用、容量规划、健康检查、回滚和灾难恢复。
开源不自动等于安全
管理员需要自行配置身份认证、网络隔离、TLS、密钥轮换和日志脱敏。若启用请求响应日志,提示词和模型回答可能进入数据库或第三方可观测性系统。
数据与隐私
自托管意味着LiteLLM厂商通常不负责托管用户的网关流量和密钥,但模型请求仍会发送给配置的上游模型服务。日志、缓存、Guardrails和可观测性插件也可能接触输入与输出。
- 只把模型密钥保存在秘密管理系统中
- 为不同应用签发独立虚拟密钥
- 关闭不必要的提示词与回答正文日志
- 对个人信息、商业秘密和凭据进行脱敏
- 核查每家模型与监控服务的数据保留政策
- 定期升级安全补丁并验证容器镜像签名
开源许可证说明
LiteLLM仓库不是所有目录都采用同一许可证。根许可证说明,enterprise目录中的内容遵循该目录自己的企业许可证,其余不受限制的代码采用MIT许可证。
| 代码范围 | 许可证状态 | 使用提示 |
|---|---|---|
| 开源核心与非企业目录 | MIT许可证 | 可在保留版权与许可声明的前提下使用、修改和分发 |
| enterprise目录 | 企业目录单独许可证 | 不能因仓库主体开源而默认自由商用全部企业代码 |
| 外部模型与SDK | 各自条款 | 模型权重、API和第三方依赖不自动继承LiteLLM许可 |
版本与维护建议
LiteLLM发布频率较高,官方版本策略支持最近四个稳定次版本线,旧版本会逐步停止更新。生产系统应锁定具体稳定版本,先在预发布环境测试再升级。
- 记录当前镜像或软件包的精确版本
- 阅读变更记录并关注安全公告
- 为数据库结构变更准备备份与回滚
- 测试核心模型、工具调用、流式响应和回退路径
- 在版本退出支持窗口前安排升级
常见问题
LiteLLM是免费的吗?
开源自托管版许可证费为0美元。模型API、服务器、数据库、监控和运维仍会产生成本,企业治理与支持功能需要询价。
LiteLLM提供模型额度吗?
不提供。用户需要配置自己的模型提供商账户、密钥和额度,或连接自行部署的模型服务。
LiteLLM和OpenRouter一样吗?
不完全相同。LiteLLM主要是可自托管的网关和SDK,本身不统一销售全部模型额度;OpenRouter属于托管式模型聚合服务。
可以私有化部署吗?
可以。开源版可在自有基础设施运行,企业版也采用自托管方式,并可按合同提供更强治理、支持和隔离网络能力。
是否支持中文模型?
支持部分中文和国际模型提供商,但具体模型、区域和端点能力会变化。接入前应查看当前提供商列表并实际测试中文效果。
企业版多少钱?
官网不公开固定金额,按年度请求容量、部署架构和支持需求报价。当前提供30天企业试用,正式价格以销售合同为准。
总结
LiteLLM适合需要统一模型接口、权限、预算、路由和可观测性的开发团队。开源版覆盖多数网关基础能力,企业版补充高级身份治理、审计、多区域与支持,但使用者仍需承担模型费用、基础设施和安全运维责任。
桂公网安备45132202000164号