NVIDIA DGX Cloud Lepton是什么
NVIDIA DGX Cloud Lepton是一套面向AI开发者和企业团队的统一GPU计算平台,用于构建、训练、微调和部署模型。它连接NVIDIA Cloud Partner、GPU市场、云服务商与用户自有计算资源,并提供一致的工作区和管理体验。
该产品延续了Lepton AI的平台和开发工具,现行官方文档与开源仓库都使用NVIDIA DGX Cloud Lepton名称。目录中可以保留“Lepton AI”作为旧名称和搜索词,但正文应以当前品牌为主。
产品沿革与当前定位
NVIDIA在2025年5月宣布DGX Cloud Lepton,将全球GPU供应与开发者工作流接入统一平台。它不是普通聊天机器人或模型目录,而是覆盖开发环境、训练任务、推理服务和资源编排的AI基础设施。
平台与NVIDIA NIM、NeMo、Blueprints等软件栈协同,也支持自定义容器、开源模型和用户自有基础设施。实际可用区域、GPU和服务会随工作区与供应商变化。
核心功能
推理端点
Endpoint把模型或容器部署为可访问的网络服务,并支持副本、自动扩缩、健康检查、日志、监控和访问控制。用户可以从容器镜像、LLM运行时、NVIDIA NIM或模板创建端点。
Dev Pods开发环境
Dev Pod提供带CPU或GPU的交互式开发环境,可连接终端、SSH、Jupyter或VS Code。它适合调试代码、准备数据、验证容器和测试模型。
批处理与训练任务
Batch Job用于训练、数据处理和离线推理,可选择PyTorch、MPI或自定义容器。任务支持多节点、优先级、预抢占、存储挂载、环境变量和失败重试。
Ray与Slurm集群
平台支持RayCluster与Slurm集群,为分布式训练和计算提供熟悉的调度方式。集群在运行期间持续占用所选资源,使用完毕需要及时删除。
GPU资源与Node Group
Node Group把特定GPU节点组织成资源池,并通过Resource Shape定义GPU、CPU、内存和存储组合。团队可以使用平台托管节点,也可以通过BYOC接入自己的机器。
工作区、存储与可观测性
Workspace集中管理成员、角色、令牌、密钥、镜像仓库和工作负载。平台同时提供日志、指标、事件、健康检查和持久存储能力。
Python SDK与lep CLI
官方LeptonAI Python库同时安装lep命令行工具,可创建和管理端点、任务、Pod、集群、存储、密钥和工作区。SDK客户端还能读取端点的OpenAPI结构,并以接近Python函数的方式调用服务。
主要功能一览
- 在统一工作区发现并使用不同地区与供应商的GPU资源。
- 把模型、NIM或自定义容器部署成弹性REST API。
- 创建GPU开发Pod并通过终端、SSH、Jupyter或VS Code连接。
- 运行单机、多GPU或多节点训练与批处理任务。
- 创建Ray和Slurm集群处理分布式工作负载。
- 通过Node Group和Resource Shape管理资源组合。
- 接入自有GPU基础设施并沿用统一管理界面。
- 挂载本地卷或NFS共享存储保存数据与模型。
- 管理环境变量、密钥、镜像仓库和访问令牌。
- 查看日志、指标、事件、健康状态和副本信息。
- 通过Python SDK、REST API和lep CLI自动化运维。
- 利用角色、令牌、IP白名单和端点访问策略控制权限。
适合哪些使用场景
- AI创业团队:快速从模型原型扩展到生产推理端点。
- 模型研发团队:使用多GPU或多节点资源训练和微调模型。
- 数据团队:运行批量特征处理、嵌入生成和离线推理。
- 企业平台团队:统一管理多云与自有GPU计算资源。
- 研究机构:按项目创建隔离开发环境和分布式集群。
- 推理服务商:部署自定义LLM、视觉、音频和多模态模型。
- DevOps团队:通过CLI、SDK和服务账号接入CI/CD流程。
- 主权AI项目:按地区选择计算资源并规划数据位置。
哪些情况不太适合
- 只想直接聊天、写作或生成图片的普通个人用户。
- 没有容器、Linux、GPU和云成本管理经验的小白用户。
- 需要固定低价套餐且不能接受动态资源报价的项目。
- 要求全部平台控制面源码开源并能完全自行部署的机构。
- 预算极小、仅偶尔运行轻量CPU脚本的团队。
- 无法承担模型许可证、数据合规和基础设施安全责任的用户。
工作负载类型对比
| 工作负载 | 主要用途 | 运行特征 | 常见入口 |
|---|---|---|---|
| Endpoint | 在线推理与API服务 | 长期或弹性副本,可缩容 | 控制台、CLI、SDK |
| Dev Pod | 交互开发与调试 | 持续占用选定资源 | 终端、SSH、Jupyter、VS Code |
| Batch Job | 训练、批处理、离线推理 | 任务完成后结束 | 控制台、CLI、SDK |
| RayCluster | 分布式Python计算 | 头节点与工作节点持续运行 | 控制台、Ray客户端 |
| Slurm Cluster | HPC与训练调度 | 集群式资源管理 | Slurm工具链 |
| Node Group | 组织GPU节点与容量 | 承载其他工作负载 | 工作区管理 |
快速开始教程
创建工作区并准备资源
- 使用NVIDIA账户进入DGX Cloud Lepton并创建或加入工作区。
- 确认所在区域、可用供应商、GPU型号和账户计费状态。
- 创建或选择Node Group,并查看当前Resource Shape。
- 配置成员角色、令牌、密钥和镜像仓库凭据。
- 先用小规格资源完成测试,再扩大副本或节点数量。
部署推理端点
- 选择从LLM、NVIDIA NIM、容器镜像或模板创建端点。
- 填写端点名称、镜像、运行命令和服务端口。
- 选择Node Group、GPU规格、副本数和自动扩缩策略。
- 通过Secret注入模型令牌,不要写进镜像或普通环境变量。
- 启用端点令牌或IP限制,避免默认公开敏感服务。
- 部署后检查健康状态、日志、延迟和显存占用。
- 使用测试请求验证输出,再接入真实业务流量。
运行批处理任务
- 准备包含代码和依赖的容器镜像。
- 选择自定义、PyTorch或MPI任务模板。
- 配置GPU规格、节点数、工作进程和运行命令。
- 挂载数据、模型和检查点存储,并设置归档时间。
- 设定失败重试、优先级和是否允许被抢占。
- 启动任务后观察日志、事件和资源利用率。
- 保存结果和检查点,确认无后续任务后释放资源。
使用Python SDK与CLI
- 在Python 3.10或兼容环境中安装最新版leptonai包。
- 使用工作区ID和短期API令牌完成登录。
- 先列出工作区、Node Group和可用Resource Shape。
- 通过lep命令创建端点、Pod或任务,并查看状态。
- 在自动化流程中使用服务账号令牌和最小权限角色。
- 对删除、扩容和高成本任务加入人工确认与预算检查。
端点创建方式对比
| 方式 | 适合对象 | 优势 | 需要准备 |
|---|---|---|---|
| NVIDIA NIM | 希望使用NVIDIA优化推理的团队 | 预优化容器和统一接口 | NGC权限、API Key、兼容GPU |
| LLM运行时 | 部署开源大语言模型 | 可使用SGLang、Dynamo等后端 | 模型权重、运行参数、GPU容量 |
| 自定义容器 | 自研模型或非标准服务 | 控制镜像、命令和端口 | 容器镜像与服务程序 |
| 模板 | 重复部署标准工作负载 | 减少配置并保持一致 | 可用模板和必要密钥 |
定价与计费方式
DGX Cloud Lepton没有面向所有地区统一不变的单一套餐表。费用会随GPU供应商、区域、型号、资源形状、运行时长、容量方式、存储和网络流量变化,并在工作区或商务报价中确认。
因此不应继续引用早期Lepton页面的旧GPU小时价或第三方推测数字作为当前官方定价。采购前应在实际工作区查看可用资源和结算价格,企业容量与长期预留则联系销售。
| 成本项目 | 常见计费依据 | 控制成本的方法 |
|---|---|---|
| GPU计算 | 型号、数量、区域和运行时长 | 选择合适Shape并及时停止资源 |
| CPU与内存 | 资源规格和占用时间 | 减少过度配置 |
| Endpoint | 副本资源与运行时长 | 设置自动缩容和最小副本 |
| Dev Pod | Pod持续占用的资源 | 不用时停止或删除 |
| Batch Job | 任务实际运行资源与时间 | 先小规模验证并优化检查点 |
| Ray与Slurm集群 | 全部集群节点占用时间 | 任务结束立即释放集群 |
| 存储 | 容量、类型和保留时长 | 清理旧模型、日志和检查点 |
| 网络 | 区域与供应商的数据传输 | 就近计算并减少跨区复制 |
| 预留容量 | GPU、期限和合同 | 用稳定负载换取可预测供给 |
托管计算与BYOC对比
| 对比项 | 平台托管计算 | Bring Your Own Compute |
|---|---|---|
| 硬件来源 | NVIDIA合作伙伴与云供应商 | 用户自有或已租用节点 |
| 启用速度 | 取决于市场容量和区域 | 需要完成节点准备与接入 |
| 运维责任 | 平台与供应商承担较多 | 用户负责硬件、系统和网络 |
| 成本结构 | 按市场或合同价格 | 基础设施成本加平台运维成本 |
| 数据控制 | 依赖所选区域与供应商 | 可放在自有网络和地点 |
| 最低环境 | 由供应商提供 | Ubuntu LTS、驱动、CUDA、存储和网络需符合要求 |
| 适合场景 | 快速获取全球GPU容量 | 已有GPU集群或强调本地控制 |
自动扩缩与资源释放
官方文档说明,新端点默认单副本,并可在空闲一小时后自动缩容到零。缩容能够降低间歇性服务的空闲成本,但下一次请求可能出现冷启动延迟。
- 为突发流量设置合理最小与最大副本数。
- 对低频测试端点启用缩容到零。
- 生产服务保留必要副本并监控排队与延迟。
- Dev Pod、Ray和Slurm集群不会因任务结束自动等价释放。
- 批处理完成后检查残留存储、日志和节点预留。
存储与数据管理
平台支持Node Local Volume和Static NFS Volume。前者把数据保存在同一节点本地,不跨节点复制;后者允许多个节点挂载共享文件系统,但性能和持久性取决于NFS基础设施。
权限可按卷路径和成员配置,一旦启用规则,未明确授权的路径将不能访问。训练数据、模型权重和检查点应同时制定备份、清理与恢复计划。
| 存储类型 | 主要特点 | 适合内容 | 注意事项 |
|---|---|---|---|
| Node Local Volume | 同节点生命周期外持久化 | 缓存、临时模型、单节点数据 | 不跨节点复制,节点故障风险需自担 |
| Static NFS Volume | 多节点共享 | 数据集、检查点、共享模型 | 性能与可靠性取决于网络和NFS服务 |
| 容器临时存储 | 随工作负载变化 | 临时文件和中间结果 | 不适合唯一副本 |
安全与权限管理
端点可以配置访问令牌、IP地址或CIDR限制,并设置工作区可见性。官方文档建议为端点启用访问令牌,不应把含敏感模型或业务逻辑的服务直接设为公开。
个人API Token默认有效期较短,服务账号令牌适合CI/CD和共享自动化。服务账号令牌只在创建时显示一次,应存入企业密钥管理系统并定期轮换。
- 使用最小权限角色区分开发、部署和管理员职责。
- 模型仓库、云凭据和API Key统一存入Secret。
- 生产端点启用令牌并限制来源IP。
- 自动化使用服务账号,不复用员工个人令牌。
- 定期撤销过期、离职或用途不明的令牌。
- 日志中避免输出提示词、密钥和用户敏感数据。
- 公开端点上线前进行限流、滥用和成本攻击测试。
Python SDK、CLI与云平台的开源边界
| 组件 | 开源状态 | 许可证或说明 |
|---|---|---|
| leptonai Python库 | 开源 | Apache License 2.0 |
| lep CLI | 随开源Python包提供 | Apache License 2.0 |
| 官方示例仓库 | 开源 | 以各仓库许可证为准 |
| DGX Cloud Lepton控制台 | 闭源托管服务 | 需NVIDIA账户与工作区 |
| GPU市场与托管基础设施 | 闭源商业服务 | 按供应商与合同使用 |
开源SDK允许开发者检查客户端代码、提交问题和构建自动化,但不意味着DGX Cloud Lepton的调度器、控制面和云服务全部开源。能本地运行部分Photon或客户端功能,也不等于完整平台可离线私有部署。
产品优势
- 把开发、训练、批处理与生产推理放在统一平台管理。
- 连接多家GPU供应商并支持不同地区和NVIDIA架构。
- 兼容NVIDIA NIM、NeMo和常见开源模型工作流。
- 提供Endpoint、Dev Pod、Batch Job和分布式集群。
- 支持BYOC,便于整合已有GPU基础设施。
- SDK、CLI和REST API覆盖自动化与平台工程需求。
- 开源Python SDK采用宽松的Apache-2.0许可证。
- 访问控制、密钥、日志和监控能力较完整。
- Resource Shape帮助统一描述GPU、CPU、内存和存储。
使用限制与注意事项
- 定价随供应商、区域和GPU容量变化,难以用单一公开价格概括。
- 平台面向专业开发者,需要容器、Linux和GPU运维知识。
- 端点若设为公开,任何获得地址的人都可能调用并产生费用。
- 缩容到零会带来冷启动,生产延迟需要实际压测。
- Dev Pod和集群持续占用资源,忘记释放会增加成本。
- 模型权重、数据集和NIM可能有独立许可证与使用限制。
- 多云和BYOC降低平台差异,但不能消除网络与硬件差异。
- Node Local Volume不跨节点复制,不能作为唯一备份。
- 服务账号和工作负载身份需要严格设计权限边界。
- 开源SDK不等于托管平台整体开源。
基本信息
| 字段 | 内容 |
|---|---|
| 当前名称 | NVIDIA DGX Cloud Lepton |
| 原名称 | Lepton AI |
| 运营主体 | NVIDIA |
| 工具类型 | AI开发、训练、推理与GPU资源平台 |
| 核心工作负载 | Endpoint、Dev Pod、Batch Job、Ray、Slurm |
| 计算来源 | 合作伙伴托管GPU与BYOC |
| 开发接口 | Web控制台、REST API、Python SDK、lep CLI |
| 价格模式 | 动态计算计费、按供应商报价、预留或企业合同 |
| Python要求 | 官方当前入门文档建议Python 3.10或更高 |
| 是否开源 | SDK与CLI开源,云平台闭源 |
| SDK许可证 | Apache License 2.0 |
推荐指数
4.7 / 5。DGX Cloud Lepton适合需要统一GPU资源、训练、批处理和生产推理的专业团队,NVIDIA生态与开源SDK是明显优势;但动态定价、技术门槛和资源治理要求较高。
常见问题
Lepton AI现在叫什么?
当前官方名称是NVIDIA DGX Cloud Lepton。Lepton AI可作为旧名称保留,官方文档和SDK仓库已经转向新平台名称。
它是模型API平台还是GPU云?
两者都覆盖,但范围更广。它既能部署模型端点,也提供开发Pod、批处理、训练集群、GPU市场和BYOC管理。
DGX Cloud Lepton多少钱?
没有适用于所有地区的固定统一价。费用取决于GPU供应商、区域、型号、数量、时长、存储和网络,需在工作区或企业报价中确认。
支持哪些GPU?
具体型号取决于所选Node Group和供应商,官方生态覆盖NVIDIA Blackwell及H100、H200、A100等架构。实际库存以工作区为准。
端点可以自动缩容吗?
可以。文档说明默认可在空闲一小时后缩容到零,但再次调用时可能出现冷启动。
可以接入自己的GPU吗?
可以,通过BYOC把符合系统、驱动、CUDA、存储和网络要求的节点加入平台。用户仍需负责自有硬件和底层运维。
Lepton AI开源吗?
Python SDK和lep CLI开源并使用Apache-2.0许可证,完整DGX Cloud Lepton云平台和GPU市场不是开源项目。
如何避免端点被滥用?
启用端点令牌、限制IP范围、使用最小权限、设置扩缩容上限并监控请求与成本。不要把生产端点默认公开。
桂公网安备45132202000164号