Replicate是什么
Replicate 是一个托管机器学习模型的 API 平台。开发者无需自行配置 GPU 驱动、容器和推理服务器,就能通过网页或 API 运行文本、图片、视频、音频、3D、超分辨率等模型,也可以用 Cog 打包自己的模型并发布为公开或私有 API。
平台同时收录社区模型、Replicate Official Models 和第三方专有模型。社区页面便于快速试验,但模型质量、维护状态、许可证和输入输出格式由各项目决定;Official Models 通常由 Replicate 维护稳定 API 和可预测价格。正式集成前应固定模型版本,不能只使用会变化的默认版本。
Replicate核心功能
在线运行AI模型
用户可以在模型页面填写参数并直接运行,确认输出效果后复制 Python、JavaScript、HTTP 或其他语言的 API 示例。Prediction 会经历 starting、processing、succeeded、failed 或 canceled 等状态,应用可轮询、等待同步结果或使用 Webhook 接收完成通知。
图片、视频与多模态API
模型目录覆盖文生图、图像编辑、放大、去背景、视频生成、语音、文本和多模态理解。不同模型可能按输出图片、视频秒数、输入输出 Token 或硬件运行秒计费。调用前应查看当前模型页的计费单位、示例成本、输入限制和内容政策。
Official与Community Models
Official Models 具有稳定端点和由平台维护的部署,部分按图片、视频或 Token 计价;社区模型通常按实际硬件运行时间计费。社区项目可能升级、停更或修改 Schema,生产项目应保存版本哈希、建立输出验证并准备替代模型。
Cog自定义模型打包
Cog 是 Replicate 开源的机器学习容器工具。开发者在配置文件中声明 Python 环境、系统依赖、GPU 与预测接口,Cog 会构建容器并生成 HTTP 服务。模型可以推送到 Replicate,也能在支持 Docker 的环境运行。Cog 工具开源不代表包装进去的权重自动获得相同许可证。
私有模型与Deployments
私有模型不会公开给其他用户。Deployment 可指定硬件、最小与最大实例数、扩缩容和版本,为生产流量提供更可控的容量。多数私有模型在实例启动、空闲等待和实际处理期间都按硬件费率计费;最小实例数大于零会持续产生空闲成本。
训练与微调
部分模型提供训练接口,例如使用图片训练 LoRA 或风格微调。Training 任务也按所用硬件和时间或模型规定单价收费,输出通常写入指定目标模型。训练数据需拥有合法权利,并避免上传未经授权的人脸、商标、隐私信息和受限内容。
流式输出与Webhook
支持通过 Server-Sent Events 接收流式文本,也可为长时间图片、视频和训练任务配置 Webhook。Webhook 接收端应验证来源、幂等处理重复事件,并快速返回成功状态后再异步执行耗时逻辑。
输入与输出文件
API 可接收 URL、上传文件或 Data URI,模型输出通常是由平台托管的临时文件地址。输出文件不会被视为永久对象存储,应用应在有效期内下载到自己的存储,并检查文件类型、大小和安全性。敏感输入应核对平台隐私、模型提供方和保留政策。
Secrets与版本管理
自定义模型需要第三方凭据时可使用 Secrets,避免把密钥写进镜像。每次推送会创建不可变模型版本,API 可以固定具体版本以保证可复现;升级时应先灰度测试输入 Schema、输出格式、耗时和成本。
Replicate计费方式对比
| 使用方式 | 计费依据 | 空闲/启动费用 | 适合场景 |
|---|---|---|---|
| 公开社区模型 | 多数按硬件实际处理秒数 | 通常只收请求运行时间 | 试验、低频和弹性任务 |
| Official Models | 按图片、视频秒、Token或明确单位 | 按模型页规则 | 需要稳定API和易预测单价 |
| 私有模型 | 所选硬件在线时长 | 多数启动、空闲和处理均收费 | 自有权重与私密业务 |
| Fast-booting fine-tunes | 实际处理时间 | 符合标记的版本不收空闲时间 | 低频微调模型 |
| Enterprise | 合同与用量 | 按部署配置 | 高GPU限额、SLA、专属支持和量价优惠 |
Replicate GPU与CPU价格
以下为官方定价页核验时的单实例标准费率。硬件与价格可能调整,多卡和 H200 等容量可能要求承诺消费合同,最终以控制台为准。
| 硬件 | 每秒价格 | 每小时价格 | 主要规格 |
|---|---|---|---|
| CPU Small | 0.000025美元 | 0.09美元 | 1 CPU、2GB RAM |
| CPU | 0.000100美元 | 0.36美元 | 4 CPU、8GB RAM |
| Nvidia T4 | 0.000225美元 | 0.81美元 | 16GB显存 |
| Nvidia L40S | 0.000975美元 | 3.51美元 | 48GB显存 |
| Nvidia A100 80GB | 0.001400美元 | 5.04美元 | 80GB显存 |
| Nvidia H100 | 0.001525美元 | 5.49美元 | 80GB显存 |
| Nvidia H200 | 0.001525美元 | 5.49美元 | 容量通常需承诺消费 |
部分Official Models价格示例
以下只用于说明 Replicate 的不同计费单位,不代表永久价格或完整模型目录。
| 模型示例 | 当前参考价 | 计费单位 |
|---|---|---|
| FLUX 1.1 Pro | 0.04美元 | 每张输出图片 |
| FLUX Dev | 0.025美元 | 每张输出图片 |
| FLUX Schnell | 3美元 | 每1,000张输出图片 |
| Ideogram V3 Quality | 0.09美元 | 每张输出图片 |
| Wan 2.1 I2V 480p | 0.09美元 | 每秒输出视频 |
| Wan 2.1 I2V 720p | 0.25美元 | 每秒输出视频 |
Replicate API接入教程
- 注册并设置付款:创建账户和 API Token,根据当前账户规则添加支付方式和预算。
- 选择模型:核对模型版本、许可证、输入 Schema、输出、运行时间和价格估算。
- 保护Token:密钥只放在服务端环境变量,浏览器或移动端请求应经过自己的后端。
- 安装客户端:使用官方 Python 或 Node.js 包,也可直接调用 HTTP API。
- 创建Prediction:传入模型版本和 input,短任务等待结果,长任务使用 Webhook 或轮询。
- 保存输出:把临时输出下载到自有对象存储,同时记录 Prediction ID、版本和参数。
- 处理异常:设置超时、取消、重试和幂等逻辑,避免失败请求不断产生费用。
- 上线监控:统计每次耗时、硬件、输出单位和失败率,设置支出告警和用量限制。
部署自定义模型教程
- 安装 Cog,并在项目中定义依赖、系统包、GPU 与预测器输入输出。
- 在本地构建并运行容器,用代表性样本检查冷启动、显存、输出和错误处理。
- 创建 Replicate 模型并推送版本,Secrets 通过平台配置,不写入镜像。
- 按显存和性能选择硬件,创建 Deployment 并设置最小、最大实例数。
- 从最小实例数为零开始观察冷启动;需要低延迟时再提高常驻容量并计算空闲成本。
适合哪些用户
- 希望快速调用图片、视频、语音和开源模型 API 的开发者;
- 不想自行管理 GPU、CUDA、容器和自动扩缩的产品团队;
- 需要测试大量社区模型并比较效果与成本的 AI 创作者;
- 要把自定义模型打包为私有 API 的机器学习工程师;
- 需要训练 LoRA、异步任务、流式输出和 Webhook 的应用团队。
优势与注意事项
Replicate 的优势是模型种类多、按量调用门槛低、API 示例清晰,并提供从公开模型试验到 Cog 打包、训练和生产 Deployment 的完整路径。对低频或需求波动大的 GPU 任务,按秒计费比长期租用服务器更灵活。
私有模型的空闲与启动时间可能收费,高常驻利用率下总成本可能高于自行租用 GPU。社区模型不一定经过安全或质量审查,输入可能触发恶意代码或不稳定依赖。模型输出、训练数据和许可证都需要人工审查;涉及个人信息和受版权保护素材时,应确认上传、保留与生成内容的合法性。
常见问题
Replicate免费吗
是按量付费平台,不是固定免费工具。部分账户或活动可能有试用额度,正式使用按模型输出、Token 或硬件时间结算。
Replicate怎么计费
公开模型多数按实际运行秒数,Official Models 也可能按图片、视频秒或 Token;私有模型多数连启动和空闲时间一起计费。
Replicate可以部署自己的模型吗
可以,使用开源 Cog 定义运行环境和预测接口,推送后可创建私有模型与 Deployment。
输出文件会永久保存吗
不应依赖平台输出地址作为永久存储。应用应及时把重要文件复制到自己的对象存储。
Replicate开源吗
Replicate 云平台是商业服务;Cog 等开发工具开源。每个模型代码和权重遵循各自许可证。
桂公网安备45132202000164号