Lepton AI
免费增值
AI工具大全 AI编程工具

Lepton AI

Lepton AI,专注于AI 编程的智能工具

标签:

NVIDIA DGX Cloud Lepton是什么

NVIDIA DGX Cloud Lepton是一套面向AI开发者和企业团队的统一GPU计算平台,用于构建、训练、微调和部署模型。它连接NVIDIA Cloud Partner、GPU市场、云服务商与用户自有计算资源,并提供一致的工作区和管理体验。

该产品延续了Lepton AI的平台和开发工具,现行官方文档与开源仓库都使用NVIDIA DGX Cloud Lepton名称。目录中可以保留“Lepton AI”作为旧名称和搜索词,但正文应以当前品牌为主。

产品沿革与当前定位

NVIDIA在2025年5月宣布DGX Cloud Lepton,将全球GPU供应与开发者工作流接入统一平台。它不是普通聊天机器人或模型目录,而是覆盖开发环境、训练任务、推理服务和资源编排的AI基础设施。

平台与NVIDIA NIM、NeMo、Blueprints等软件栈协同,也支持自定义容器、开源模型和用户自有基础设施。实际可用区域、GPU和服务会随工作区与供应商变化。

核心功能

推理端点

Endpoint把模型或容器部署为可访问的网络服务,并支持副本、自动扩缩、健康检查、日志、监控和访问控制。用户可以从容器镜像、LLM运行时、NVIDIA NIM或模板创建端点。

Dev Pods开发环境

Dev Pod提供带CPU或GPU的交互式开发环境,可连接终端、SSH、Jupyter或VS Code。它适合调试代码、准备数据、验证容器和测试模型。

批处理与训练任务

Batch Job用于训练、数据处理和离线推理,可选择PyTorch、MPI或自定义容器。任务支持多节点、优先级、预抢占、存储挂载、环境变量和失败重试。

Ray与Slurm集群

平台支持RayCluster与Slurm集群,为分布式训练和计算提供熟悉的调度方式。集群在运行期间持续占用所选资源,使用完毕需要及时删除。

GPU资源与Node Group

Node Group把特定GPU节点组织成资源池,并通过Resource Shape定义GPU、CPU、内存和存储组合。团队可以使用平台托管节点,也可以通过BYOC接入自己的机器。

工作区、存储与可观测性

Workspace集中管理成员、角色、令牌、密钥、镜像仓库和工作负载。平台同时提供日志、指标、事件、健康检查和持久存储能力。

Python SDK与lep CLI

官方LeptonAI Python库同时安装lep命令行工具,可创建和管理端点、任务、Pod、集群、存储、密钥和工作区。SDK客户端还能读取端点的OpenAPI结构,并以接近Python函数的方式调用服务。

主要功能一览

  • 在统一工作区发现并使用不同地区与供应商的GPU资源。
  • 把模型、NIM或自定义容器部署成弹性REST API。
  • 创建GPU开发Pod并通过终端、SSH、Jupyter或VS Code连接。
  • 运行单机、多GPU或多节点训练与批处理任务。
  • 创建Ray和Slurm集群处理分布式工作负载。
  • 通过Node Group和Resource Shape管理资源组合。
  • 接入自有GPU基础设施并沿用统一管理界面。
  • 挂载本地卷或NFS共享存储保存数据与模型。
  • 管理环境变量、密钥、镜像仓库和访问令牌。
  • 查看日志、指标、事件、健康状态和副本信息。
  • 通过Python SDK、REST API和lep CLI自动化运维。
  • 利用角色、令牌、IP白名单和端点访问策略控制权限。

适合哪些使用场景

  • AI创业团队:快速从模型原型扩展到生产推理端点。
  • 模型研发团队:使用多GPU或多节点资源训练和微调模型。
  • 数据团队:运行批量特征处理、嵌入生成和离线推理。
  • 企业平台团队:统一管理多云与自有GPU计算资源。
  • 研究机构:按项目创建隔离开发环境和分布式集群。
  • 推理服务商:部署自定义LLM、视觉、音频和多模态模型。
  • DevOps团队:通过CLI、SDK和服务账号接入CI/CD流程。
  • 主权AI项目:按地区选择计算资源并规划数据位置。

哪些情况不太适合

  • 只想直接聊天、写作或生成图片的普通个人用户。
  • 没有容器、Linux、GPU和云成本管理经验的小白用户。
  • 需要固定低价套餐且不能接受动态资源报价的项目。
  • 要求全部平台控制面源码开源并能完全自行部署的机构。
  • 预算极小、仅偶尔运行轻量CPU脚本的团队。
  • 无法承担模型许可证、数据合规和基础设施安全责任的用户。

工作负载类型对比

工作负载主要用途运行特征常见入口
Endpoint在线推理与API服务长期或弹性副本,可缩容控制台、CLI、SDK
Dev Pod交互开发与调试持续占用选定资源终端、SSH、Jupyter、VS Code
Batch Job训练、批处理、离线推理任务完成后结束控制台、CLI、SDK
RayCluster分布式Python计算头节点与工作节点持续运行控制台、Ray客户端
Slurm ClusterHPC与训练调度集群式资源管理Slurm工具链
Node Group组织GPU节点与容量承载其他工作负载工作区管理

快速开始教程

创建工作区并准备资源

  1. 使用NVIDIA账户进入DGX Cloud Lepton并创建或加入工作区。
  2. 确认所在区域、可用供应商、GPU型号和账户计费状态。
  3. 创建或选择Node Group,并查看当前Resource Shape。
  4. 配置成员角色、令牌、密钥和镜像仓库凭据。
  5. 先用小规格资源完成测试,再扩大副本或节点数量。

部署推理端点

  1. 选择从LLM、NVIDIA NIM、容器镜像或模板创建端点。
  2. 填写端点名称、镜像、运行命令和服务端口。
  3. 选择Node Group、GPU规格、副本数和自动扩缩策略。
  4. 通过Secret注入模型令牌,不要写进镜像或普通环境变量。
  5. 启用端点令牌或IP限制,避免默认公开敏感服务。
  6. 部署后检查健康状态、日志、延迟和显存占用。
  7. 使用测试请求验证输出,再接入真实业务流量。

运行批处理任务

  1. 准备包含代码和依赖的容器镜像。
  2. 选择自定义、PyTorch或MPI任务模板。
  3. 配置GPU规格、节点数、工作进程和运行命令。
  4. 挂载数据、模型和检查点存储,并设置归档时间。
  5. 设定失败重试、优先级和是否允许被抢占。
  6. 启动任务后观察日志、事件和资源利用率。
  7. 保存结果和检查点,确认无后续任务后释放资源。

使用Python SDK与CLI

  1. 在Python 3.10或兼容环境中安装最新版leptonai包。
  2. 使用工作区ID和短期API令牌完成登录。
  3. 先列出工作区、Node Group和可用Resource Shape。
  4. 通过lep命令创建端点、Pod或任务,并查看状态。
  5. 在自动化流程中使用服务账号令牌和最小权限角色。
  6. 对删除、扩容和高成本任务加入人工确认与预算检查。

端点创建方式对比

方式适合对象优势需要准备
NVIDIA NIM希望使用NVIDIA优化推理的团队预优化容器和统一接口NGC权限、API Key、兼容GPU
LLM运行时部署开源大语言模型可使用SGLang、Dynamo等后端模型权重、运行参数、GPU容量
自定义容器自研模型或非标准服务控制镜像、命令和端口容器镜像与服务程序
模板重复部署标准工作负载减少配置并保持一致可用模板和必要密钥

定价与计费方式

DGX Cloud Lepton没有面向所有地区统一不变的单一套餐表。费用会随GPU供应商、区域、型号、资源形状、运行时长、容量方式、存储和网络流量变化,并在工作区或商务报价中确认。

因此不应继续引用早期Lepton页面的旧GPU小时价或第三方推测数字作为当前官方定价。采购前应在实际工作区查看可用资源和结算价格,企业容量与长期预留则联系销售。

成本项目常见计费依据控制成本的方法
GPU计算型号、数量、区域和运行时长选择合适Shape并及时停止资源
CPU与内存资源规格和占用时间减少过度配置
Endpoint副本资源与运行时长设置自动缩容和最小副本
Dev PodPod持续占用的资源不用时停止或删除
Batch Job任务实际运行资源与时间先小规模验证并优化检查点
Ray与Slurm集群全部集群节点占用时间任务结束立即释放集群
存储容量、类型和保留时长清理旧模型、日志和检查点
网络区域与供应商的数据传输就近计算并减少跨区复制
预留容量GPU、期限和合同用稳定负载换取可预测供给

托管计算与BYOC对比

对比项平台托管计算Bring Your Own Compute
硬件来源NVIDIA合作伙伴与云供应商用户自有或已租用节点
启用速度取决于市场容量和区域需要完成节点准备与接入
运维责任平台与供应商承担较多用户负责硬件、系统和网络
成本结构按市场或合同价格基础设施成本加平台运维成本
数据控制依赖所选区域与供应商可放在自有网络和地点
最低环境由供应商提供Ubuntu LTS、驱动、CUDA、存储和网络需符合要求
适合场景快速获取全球GPU容量已有GPU集群或强调本地控制

自动扩缩与资源释放

官方文档说明,新端点默认单副本,并可在空闲一小时后自动缩容到零。缩容能够降低间歇性服务的空闲成本,但下一次请求可能出现冷启动延迟。

  • 为突发流量设置合理最小与最大副本数。
  • 对低频测试端点启用缩容到零。
  • 生产服务保留必要副本并监控排队与延迟。
  • Dev Pod、Ray和Slurm集群不会因任务结束自动等价释放。
  • 批处理完成后检查残留存储、日志和节点预留。

存储与数据管理

平台支持Node Local Volume和Static NFS Volume。前者把数据保存在同一节点本地,不跨节点复制;后者允许多个节点挂载共享文件系统,但性能和持久性取决于NFS基础设施。

权限可按卷路径和成员配置,一旦启用规则,未明确授权的路径将不能访问。训练数据、模型权重和检查点应同时制定备份、清理与恢复计划。

存储类型主要特点适合内容注意事项
Node Local Volume同节点生命周期外持久化缓存、临时模型、单节点数据不跨节点复制,节点故障风险需自担
Static NFS Volume多节点共享数据集、检查点、共享模型性能与可靠性取决于网络和NFS服务
容器临时存储随工作负载变化临时文件和中间结果不适合唯一副本

安全与权限管理

端点可以配置访问令牌、IP地址或CIDR限制,并设置工作区可见性。官方文档建议为端点启用访问令牌,不应把含敏感模型或业务逻辑的服务直接设为公开。

个人API Token默认有效期较短,服务账号令牌适合CI/CD和共享自动化。服务账号令牌只在创建时显示一次,应存入企业密钥管理系统并定期轮换。

  • 使用最小权限角色区分开发、部署和管理员职责。
  • 模型仓库、云凭据和API Key统一存入Secret。
  • 生产端点启用令牌并限制来源IP。
  • 自动化使用服务账号,不复用员工个人令牌。
  • 定期撤销过期、离职或用途不明的令牌。
  • 日志中避免输出提示词、密钥和用户敏感数据。
  • 公开端点上线前进行限流、滥用和成本攻击测试。

Python SDK、CLI与云平台的开源边界

组件开源状态许可证或说明
leptonai Python库开源Apache License 2.0
lep CLI随开源Python包提供Apache License 2.0
官方示例仓库开源以各仓库许可证为准
DGX Cloud Lepton控制台闭源托管服务需NVIDIA账户与工作区
GPU市场与托管基础设施闭源商业服务按供应商与合同使用

开源SDK允许开发者检查客户端代码、提交问题和构建自动化,但不意味着DGX Cloud Lepton的调度器、控制面和云服务全部开源。能本地运行部分Photon或客户端功能,也不等于完整平台可离线私有部署。

产品优势

  • 把开发、训练、批处理与生产推理放在统一平台管理。
  • 连接多家GPU供应商并支持不同地区和NVIDIA架构。
  • 兼容NVIDIA NIM、NeMo和常见开源模型工作流。
  • 提供Endpoint、Dev Pod、Batch Job和分布式集群。
  • 支持BYOC,便于整合已有GPU基础设施。
  • SDK、CLI和REST API覆盖自动化与平台工程需求。
  • 开源Python SDK采用宽松的Apache-2.0许可证。
  • 访问控制、密钥、日志和监控能力较完整。
  • Resource Shape帮助统一描述GPU、CPU、内存和存储。

使用限制与注意事项

  • 定价随供应商、区域和GPU容量变化,难以用单一公开价格概括。
  • 平台面向专业开发者,需要容器、Linux和GPU运维知识。
  • 端点若设为公开,任何获得地址的人都可能调用并产生费用。
  • 缩容到零会带来冷启动,生产延迟需要实际压测。
  • Dev Pod和集群持续占用资源,忘记释放会增加成本。
  • 模型权重、数据集和NIM可能有独立许可证与使用限制。
  • 多云和BYOC降低平台差异,但不能消除网络与硬件差异。
  • Node Local Volume不跨节点复制,不能作为唯一备份。
  • 服务账号和工作负载身份需要严格设计权限边界。
  • 开源SDK不等于托管平台整体开源。

基本信息

字段内容
当前名称NVIDIA DGX Cloud Lepton
原名称Lepton AI
运营主体NVIDIA
工具类型AI开发、训练、推理与GPU资源平台
核心工作负载Endpoint、Dev Pod、Batch Job、Ray、Slurm
计算来源合作伙伴托管GPU与BYOC
开发接口Web控制台、REST API、Python SDK、lep CLI
价格模式动态计算计费、按供应商报价、预留或企业合同
Python要求官方当前入门文档建议Python 3.10或更高
是否开源SDK与CLI开源,云平台闭源
SDK许可证Apache License 2.0

推荐指数

4.7 / 5。DGX Cloud Lepton适合需要统一GPU资源、训练、批处理和生产推理的专业团队,NVIDIA生态与开源SDK是明显优势;但动态定价、技术门槛和资源治理要求较高。

常见问题

Lepton AI现在叫什么?

当前官方名称是NVIDIA DGX Cloud Lepton。Lepton AI可作为旧名称保留,官方文档和SDK仓库已经转向新平台名称。

它是模型API平台还是GPU云?

两者都覆盖,但范围更广。它既能部署模型端点,也提供开发Pod、批处理、训练集群、GPU市场和BYOC管理。

DGX Cloud Lepton多少钱?

没有适用于所有地区的固定统一价。费用取决于GPU供应商、区域、型号、数量、时长、存储和网络,需在工作区或企业报价中确认。

支持哪些GPU?

具体型号取决于所选Node Group和供应商,官方生态覆盖NVIDIA Blackwell及H100、H200、A100等架构。实际库存以工作区为准。

端点可以自动缩容吗?

可以。文档说明默认可在空闲一小时后缩容到零,但再次调用时可能出现冷启动。

可以接入自己的GPU吗?

可以,通过BYOC把符合系统、驱动、CUDA、存储和网络要求的节点加入平台。用户仍需负责自有硬件和底层运维。

Lepton AI开源吗?

Python SDK和lep CLI开源并使用Apache-2.0许可证,完整DGX Cloud Lepton云平台和GPU市场不是开源项目。

如何避免端点被滥用?

启用端点令牌、限制IP范围、使用最小权限、设置扩缩容上限并监控请求与成本。不要把生产端点默认公开。

©️版权声明:若无特殊声明,本站所有文章版权均归AI工具分享原创和所有,未经许可,任何个人、媒体、网站、团体不得转载、抄袭或以其他方式复制发表本站内容,或在非我站所属的服务器上建立镜像。否则,我站将依法保留追究相关法律责任的权利。

类似于Lepton AI的工具