DeepInfra 是什么
DeepInfra 是美国 Deep Infra Inc. 运营的 AI 推理云,面向需要把语言、图像、语音、视频和传统机器学习模型接入产品的开发者与企业。
平台同时提供共享 Serverless 推理、批处理、私有模型部署、GPU 实例、代码沙箱和托管智能体。它解决的是模型上线、弹性扩缩、接口兼容和推理成本问题,而不是只提供一个聊天页面。
主要能力
- 共享模型推理:从模型目录选择语言、嵌入、重排、图片、视频、语音或分类模型,按实际 Token 或执行量计费,无需自行管理 GPU。
- OpenAI 兼容接口:聊天、文本补全、嵌入和图片生成可复用 OpenAI SDK,只需更改基础地址、模型名和密钥。
- 原生多模态接口:覆盖图片生成、语音识别、目标检测、图像分类、零样本分类、实体识别和掩码填充等兼容接口未覆盖的任务。
- 批处理:把大量非实时请求作为文件和批次异步提交,适合离线评测、内容处理与数据标注,公开文档标注比实时推理低 20%。
- 私有模型:在专属 GPU 上部署 Hugging Face 模型、自有权重、语言 LoRA 或图像 LoRA,提供隔离端点、自动扩缩和更可预测的延迟。
- GPU 实例:租用 B200 容器,通过 SSH 运行训练、微调、推理或自定义工作负载,按运行时间计费。
- Sandboxes:按需启动隔离 Linux 微型虚拟机,让智能体执行代码、读写工作区文件和访问公网,停止后不再收取计算费。
支持的模型任务
| 任务类别 | 典型输入 | 主要输出 | 适合场景 |
|---|---|---|---|
| 聊天与推理 | 消息、系统指令、工具定义、图片 | 文本、结构化数据、工具调用 | 客服、知识助手、智能体和代码应用 |
| 嵌入与重排 | 查询和文档集合 | 向量或相关性分数 | 语义检索、RAG 和搜索排序 |
| 图片与视频 | 提示词、图片及生成参数 | 图片、编辑结果或视频任务 | 视觉素材、原型和内容生产 |
| 语音 | 音频或文本 | 转写、翻译或合成语音 | 会议转写、字幕和语音交互 |
| 视觉与文本分类 | 图片、文字或候选标签 | 类别、框、实体或概率 | 审核、信息抽取和自动标注 |
两套 API 的区别
| 接口类型 | 覆盖能力 | 主要优势 | 适合用户 |
|---|---|---|---|
| OpenAI 兼容接口 | 聊天、补全、嵌入、图片等 | 可复用现有 OpenAI 客户端和调用结构 | 迁移现有应用或快速原型 |
| DeepInfra 原生接口 | 平台提供的全部模型类型 | 支持更多视觉、语音、分类任务及回调等能力 | 需要完整模型目录和细粒度参数的项目 |
所有接口都使用 Bearer Token 鉴权。不同模型的参数、上下文长度、流式输出、工具调用、结构化输出和多模态支持并不一致,不能只替换模型名后假设行为完全相同。
快速接入流程
- 注册账户,在控制台创建 API Token,并为开发、测试和生产环境使用不同密钥。
- 从模型目录选择模型,核对许可证、上下文、输入类型、输出格式、单价、速率限制和数据处理例外。
- 兼容接口可继续使用 OpenAI SDK;特殊任务改用原生接口,并按模型 Schema 构造请求。
- 先以小流量测试超时、流式响应、工具调用、错误重试和输出质量,再设置并发、预算和自动充值限制。
- 上线后通过使用量和请求成本记录监控 Token、缓存命中、延迟和失败率,避免无上限重试。
共享推理的计费方式
语言模型通常分别按每 100 万输入和输出 Token 计费,部分模型还提供更低的缓存输入单价。图片、语音、视频和其他模型可能按图片、音频时长、生成秒数或推理执行时间计费。
| 套餐或版本 | 价格 | 计费周期 | 核心权益或额度 | 适合用户 |
|---|---|---|---|---|
| Llama 3.1 8B Turbo | 输入 0.02 美元,输出 0.04 美元 | 每 100 万 Token | 128K 上下文的低成本文本推理 | 分类、摘要和轻量助手 |
| Llama 3.3 70B Turbo | 输入 0.10 美元,输出 0.32 美元 | 每 100 万 Token | 更大模型的通用聊天和推理 | 质量要求更高的应用 |
| DeepSeek V4 Flash | 输入 0.09 美元,输出 0.18 美元 | 每 100 万 Token | 另有更低缓存输入单价 | 长上下文和高吞吐任务 |
| Qwen 3.5 9B | 输入 0.10 美元,输出 0.15 美元 | 每 100 万 Token | 256K 上下文 | 多语言和轻量推理 |
| Kimi K2.5 | 输入 0.45 美元,输出 2.25 美元 | 每 100 万 Token | 另有缓存输入价格 | 长上下文与复杂任务 |
以上是实时价格页的代表样本,不是固定套餐或价格保证。模型上下线、版本、缓存规则和单价会变化,正式估算应读取所选模型页和账户结算信息。
免费额度、充值与退款
- 当前未确认对所有账户长期有效的固定免费 API 套餐或每月免费额度;注册优惠和促销余额不能视为永久权益。
- 共享推理采用按量付费,账户可添加资金并配置自动充值;余额不足可能令请求、沙箱或实例操作被暂停。
- 企业服务可通过服务订单约定账期、支持和其他条款,公开页面没有统一企业报价。
- 现行条款未提供适用于所有预付余额和已消费用量的通用退款保证;服务违约且无法重新履行时,条款把相关退款列为特定救济。
批处理与成本优化
- 对不要求即时返回的任务使用 Batch API,可按文档标注获得 20% 折扣,并降低实时并发压力。
- 重复使用长提示前缀时,可使用提示缓存降低预填充延迟与缓存读取成本,保留档位包括短时和一小时选项。
- 让响应只生成所需长度,并为最大输出 Token、并发和重试次数设置上限。
- 先用小模型处理分类、路由和抽取,再把少数复杂请求交给大模型,通常比所有请求统一使用高价模型更可控。
私有模型与专属部署
| 部署类型 | 计费方式 | 核心能力 | 适合用户 |
|---|---|---|---|
| 共享 Serverless | 按 Token 或推理量 | 无需管理实例,自动共享容量 | 流量波动和快速上线 |
| 私有 LLM | 按 GPU 小时 | 自有权重、隔离端点、自动扩缩、兼容接口 | 定制模型与稳定延迟 |
| LoRA 部署 | 按专属资源 | 加载语言或图像适配器 | 领域微调与品牌风格 |
| B200 GPU 实例 | 3.69 美元起每小时 | SSH、容器、180GB 显存,按分钟计费 | 训练、微调和自定义程序 |
| 企业方案 | 定制报价 | 服务订单、容量、支持与商务条款 | 大规模或特殊合规需求 |
私有部署即使没有请求,只要 GPU 仍在运行就会继续计费。文档示例指出忘记关闭双 GPU 部署 64 小时可能产生约 256 美元费用,因此必须设置预算上限和自动缩容。
Sandboxes 代码沙箱
- 每个 Sandbox 是独立 Linux 微型虚拟机,可运行命令和 Python、传输文件并访问公网,但不接受入站连接,也不能访问其他沙箱或 DeepInfra 内部网络。
- 按秒计费且无最低时长,创建、启动、运行和停止过程计费;停止状态不计计算费。
- 只有工作区目录在正常停止和重启之间保留,停止后最长保留 7 天;失败状态会在数分钟内删除,工作区不保证恢复。
- 默认空闲超时为 1 小时,连续运行 24 小时会自动停止,单条命令最长 30 分钟,每账户最多 5 个非停止状态沙箱。
- 文件单次读写上限为 100 MiB,重要结果应及时复制到外部存储。
数据隐私与零保留边界
- 普通推理的输入只在处理期间存在内存中,不写入磁盘;输出返回后从内存删除,平台声明不使用这些数据训练模型。
- 图片生成输出会短期保存以便访问,批处理可能把数据加密写入磁盘并在结果返回后的短期内删除。
- 调用 Google 或 Anthropic 模型时,数据会传给对应模型端点,输出保存、日志和训练规则适用相应提供方的政策。
- 平台通常不记录请求正文,但会记录请求编号、成本、采样参数等元数据,并保留在调试或安全需要时记录少量请求的权利。
- 账户、通信、设备、使用、网络地址和账单信息按隐私政策处理;账户删除后,个人信息通常在 30 天后移除,法律、税务或安全记录可能例外。
安全与合规
DeepInfra 表示其安全措施符合 SOC 2 与 ISO 27001,并提供 GDPR 和 HIPAA 相关技术及组织措施。认证和控制并不自动使客户应用合规,处理健康、金融或其他敏感数据前仍需确认合同、DPA、所选模型及地区要求。
- API Token 应仅保存在服务器端或密钥管理系统,按环境拆分并定期轮换。
- 对终端用户创建受限访问时,可使用有范围和期限的 JWT,避免下发主账户 Token。
- 使用第三方模型前检查数据会被发送到哪里,不要把统一零保留表述套用到明确列出的例外。
- 为日志、回调和批处理文件设置访问控制与删除流程,并避免把用户敏感内容写入自己的可观测性系统。
SDK、集成与开源状态
- 官方 TypeScript 客户端 deepinfra-node 采用 MIT 许可证,覆盖文本、嵌入、图像、语音和分类等原生接口。
- Python deepinfra 包覆盖推理与 Sandboxes,当前仓库 README 将其描述为官方 SDK,并采用 MIT 许可证。
- 文档还提供 LangChain、LlamaIndex、Vercel AI SDK、AutoGen、Anthropic SDK 和多种智能体框架的集成方式。
- 开源的是客户端和部分集成代码,不代表 DeepInfra 云平台、调度系统或托管模型统一开源;每个第三方模型仍受自己的许可证和使用政策约束。
适合用户与限制
- 应用开发者:快速接入多个模型并保留兼容接口,但需要针对模型差异做测试和回退。
- RAG 与搜索团队:组合嵌入、重排和生成模型,并通过批处理及缓存优化成本。
- 拥有自有权重的团队:使用私有 GPU 部署获得隔离和稳定延迟,同时承担持续运行费用。
- 智能体开发者:用 Sandbox 执行不可信代码,但必须把短生命周期和数据丢失边界纳入设计。
- 需要绝对固定模型行为、永久免费配额或完全无第三方处理的项目,不应仅依赖共享目录默认配置。
常见问题
DeepInfra 有永久免费的 API 吗?
当前未确认面向所有账户的永久免费套餐或固定月度额度。促销余额可能随活动和账户变化,生产使用应按实时单价和实际账单估算。
可以直接使用 OpenAI SDK 吗?
可以,聊天、补全、嵌入和图片等兼容接口可复用 OpenAI SDK。仍需更换基础地址、DeepInfra Token 和模型名,并检查参数兼容性。
DeepInfra 会保存提示词并用于训练吗?
普通推理输入不落盘,输出返回后删除,平台声明不用于训练。图片、批处理以及 Google、Anthropic 模型存在例外,调试或安全场景也可能记录少量请求。
共享推理和私有部署怎么选?
流量波动、模型仍在评估时优先共享推理;需要自有权重、隔离、稳定延迟或专属容量时选择私有部署,并持续监控 GPU 运行费用。
DeepInfra 是开源平台吗?
云平台本体不是已公开的完整开源项目。官方 Python、TypeScript 客户端及部分集成采用开源许可证,托管模型则分别遵守各自许可证。
批处理为什么更便宜?
批处理允许平台异步调度不紧急请求,公开文档标注比实时推理低 20%。它不适合交互式响应,并可能短期加密保存输入与结果。
总结
DeepInfra 的优势在于用一个账户覆盖兼容接口、原生多模态模型、批处理、私有权重、GPU 和代码沙箱,并允许按工作负载选择 Token、执行量或 GPU 小时计费。上线前最重要的是核对单模型价格与许可证、设置预算和重试上限,并准确处理零数据保留的例外。
桂公网安备45132202000164号