NVIDIA DGX Cloud Lepton是什麼
NVIDIA DGX Cloud Lepton是一套專為AI開發者及企業團隊所設計的統一GPU計算平台,用於建立、訓練、微調及部署模型。它能將NVIDIA Cloud Partner、GPU市場、雲端服務供應商以及使用者自身的計算資源相互連接,並提供一致的工作環境與管理體驗。
該產品延續了Lepton AI的平臺與開發工具,現行的官方文件及開源儲存庫均以NVIDIA DGX Cloud Lepton作為名稱。目錄中可以保留「Lepton AI」作為舊名稱及搜尋詞,但正文中應以現行品牌名稱為主。
產品沿革與當前定位
NVIDIA在2025年5月宣佈推出DGX Cloud Lepton,將全球的GPU供應與開發者的工作流程整合到一個統一的平台上。它並非一般的聊天機器人或模型目錄,而是一種涵蓋開發環境、訓練任務、推論服務以及資源編排等功能的AI基礎設施。
該平台能與NVIDIA的NIM、NeMo、Blueprints等軟體堆疊相協作,同時也支援自訂容器、開源模型以及使用者自有的基礎設施。實際可用的區域、GPU和服務會隨著工作區及供應商的不同而有所差異。
核心功能
推理端點
Endpoint能將模型或容器部署為可存取的網路服務,並支援副本建立、自動擴縮容、健康檢查、日誌記錄、監控以及訪問控制等功能。使用者可以透過容器鏡像、LLM運行時環境、NVIDIA NIM或模板來建立端點。
Dev Pods開發環境
Dev Pod提供具備CPU或GPU的互動式開發環境,可連接終端機、SSH、Jupyter或VS Code。它適用於除錯代碼、準備資料、驗證容器以及測試模型。
批處理與訓練任務
批次任務用於訓練、資料處理和離線推論,可選擇PyTorch、MPI或自訂容器。該任務支援多節點、優先級、預先搶佔、儲存裝載、環境變數以及失敗重試功能。
Ray與Slurm集群
平台支援 RayCluster 與 Slurm 集群,為分散式訓練與運算提供熟悉的調度方式。集羣在運行期間會持續佔用所選的資源,使用完畢後需及時刪除。
GPU資源與Node Group
Node Group會將特定的GPU節點組織成資源池,並透過Resource Shape來定義GPU、CPU、記憶體和儲存裝置的組合方式。團隊可以使用平台提供的節點,或者自行帶入自己的機器來使用。
工作區、儲存與可觀測性
Workspace可集中管理成員、角色、令牌、金鑰、鏡像倉庫以及工作負載。該平台同時還提供日誌、指標、事件、健康檢查以及永久儲存功能。
Python SDK與lep CLI
官方的LeptonAI Python套件同時也包含了lep這個命令列工具,可以用來建立及管理端點、任務、Pod、集群、儲存空間、金鑰以及工作區等。此外,SDK客戶端還能讀取端點的OpenAPI結構,並以類似Python函數的方式來呼叫服務。
主要功能一覽
- 在統一工作區發現並使用不同地區與供應商的GPU資源。
- 將模型、NIM或自訂容器部署成彈性REST API。
- 建立GPU開發Pod,並透過終端機、SSH、Jupyter或VS Code進行連線。
- 運行單機、多GPU或多節點訓練與批次處理任務。
- 建立Ray和Slurm集群以處理分散式工作負載。
- 透過Node Group和Resource Shape管理資源組合。
- 接入自有GPU基礎設施並沿用統一管理介面。
- 掛載本地卷或NFS共享儲存來保存數據與模型。
- 管理環境變數、金鑰、鏡像倉庫和訪問令牌。
- 查看日誌、指標、事件、健康狀態和副本資訊。
- 透過Python SDK、REST API和lep CLI自動化運維。
- 利用角色、令牌、IP白名單和端點訪問策略控制權限。
適合哪些使用場景
- AI創業團隊:快速從模型原型擴展到生產推理端點。
- 模型研發團隊:使用多GPU或多節點資源訓練和微調模型。
- 資料團隊:運行批次特徵處理、嵌入生成和離線推理。
- 企業平台團隊:統一管理多雲與自有GPU計算資源。
- 研究機構:依據專案建立隔離開發環境與分散式集群。
- 推理服務商:部署自訂LLM、視覺、音頻和多模態模型。
- DevOps團隊:透過CLI、SDK和服務帳號來接入CI/CD流程。
- 主權AI專案:依地區選擇運算資源並規劃資料位置。
哪些情況不太適合
- 只想直接聊天、寫作或生成圖片的普通個人用戶。
- 沒有容器、Linux、GPU以及雲端成本管理經驗的初學者用戶。
- 需要固定低價套餐且不能接受動態資源報價的項目。
- 要求全部平台控制面源碼開源並能完全自行部署的機構。
- 預算極低、僅偶爾運行輕量CPU腳本的團隊。
- 無法承擔模型許可證、資料合規及基礎設施安全責任的使用者。
工作負載類型對比
| 工作負載 | 主要用途 | 運行特徵 | 常見入口 |
|---|---|---|---|
| Endpoint | 在線推理與API服務 | 長期或彈性副本,可縮容 | 控制台、CLI、SDK |
| Dev Pod | 互動開發與調試 | 持續佔用選定資源 | 終端、SSH、Jupyter、VS Code |
| Batch Job | 訓練、批次處理、離線推理 | 任務完成後結束 | 控制台、CLI、SDK |
| RayCluster | 分散式Python計算 | 頭節點與工作節點持續運行 | 控制台、Ray用戶端 |
| Slurm Cluster | HPC與訓練調度 | 集群式資源管理 | Slurm工具鏈 |
| Node Group | 組織GPU節點與容量 | 承載其他工作負載 | 工作區管理 |
快速開始教學
創建工作區並準備資源
- 使用NVIDIA帳戶進入DGX Cloud Lepton,並建立或加入工作區。
- 確認所在區域、可用供應商、GPU型號和帳戶計費狀態。
- 建立或選擇Node Group,並查看目前的Resource Shape。
- 配置成員角色、令牌、金鑰和鏡像倉庫憑證。
- 先用小規格資源完成測試,再擴大副本或節點數量。
部署推理端點
- 選擇從LLM、NVIDIA NIM、容器鏡像或模板來建立端點。
- 填寫端點名稱、鏡像、運行命令和服務端口。
- 選擇Node Group、GPU規格、副本數和自動擴縮策略。
- 透過Secret注入模型令牌,不要寫進鏡像或普通環境變數。
- 啟用端點令牌或IP限制,避免預設公開敏感服務。
- 部署後檢查健康狀態、日誌、延遲和顯存佔用。
- 使用測試請求驗證輸出,再接入真實業務流量。
運行批次處理任務
- 準備包含代碼和依賴的容器鏡像。
- 選擇自訂、PyTorch或MPI任務模板。
- 配置GPU規格、節點數、工作進程和運行命令。
- 掛載資料、模型和檢查點儲存,並設定歸檔時間。
- 設定失敗重試、優先級和是否允許被搶佔。
- 啟動任務後觀察日誌、事件和資源利用率。
- 保存結果和檢查點,確認無後續任務後釋放資源。
使用Python SDK與CLI
- 在Python 3.10或相容環境中安裝最新版的leptonai套件。
- 使用工作區ID和短期API令牌完成登入。
- 先列出工作區、Node Group和可用Resource Shape。
- 透過lep命令來建立端點、Pod或任務,並查看其狀態。
- 在自動化流程中使用服務帳號令牌和最小權限角色。
- 對刪除、擴容和高成本任務加入人工確認與預算檢查。
端點創建方式對比
| 方式 | 適合對象 | 優勢 | 需要準備 |
|---|---|---|---|
| NVIDIA NIM | 希望使用NVIDIA優化推理的團隊 | 預優化容器和統一介面 | NGC權限、API Key、相容GPU |
| LLM運行時 | 部署開源大語言模型 | 可使用SGLang、Dynamo等後端 | 模型權重、運行參數、GPU容量 |
| 自訂容器 | 自研模型或非標準服務 | 控制鏡像、命令和端口 | 容器鏡像與服務程式 |
| 模板 | 重複部署標準工作負載 | 減少配置並保持一致 | 可用模板和必要密鑰 |
定價與計費方式
DGX Cloud Lepton並沒有適用於所有地區的統一套餐表。其費用會因GPU供應商、地區、型號、資源規格、運行時間、儲存容量以及網路流量等因素而有所差異,具體費用則需在工作區或商業報價中確認。
因此不應繼續引用早期Lepton頁面的舊GPU小時價或第三方推測數字作為當前的官方定價。採購前應在實際工作區查看可用資源與結算價格,企業容量與長期預留則聯絡銷售。
| 成本項目 | 常見計費依據 | 控制成本的方法 |
|---|---|---|
| GPU計算 | 型號、數量、區域和運行時長 | 選擇合適Shape並及時停止資源 |
| CPU與記憶體 | 資源規格和佔用時間 | 減少過度配置 |
| Endpoint | 副本資源與運行時長 | 設定自動縮容和最小副本 |
| Dev Pod | Pod持續佔用的資源 | 不用時停止或刪除 |
| Batch Job | 任務實際運行資源與時間 | 先小規模驗證並優化檢查點 |
| Ray與Slurm集群 | 全部集群節點佔用時間 | 任務結束立即釋放集群 |
| 儲存 | 容量、類型和保留時長 | 清理舊模型、日誌和檢查點 |
| 網路 | 區域與供應商的數據傳輸 | 就近計算並減少跨區複製 |
| 預留容量 | GPU、期限和合約 | 用穩定負載換取可預測供給 |
託管計算與BYOC對比
| 對比項 | 平台託管計算 | Bring Your Own Compute |
|---|---|---|
| 硬體來源 | NVIDIA合作夥伴與雲端供應商 | 用戶自有或已租用節點 |
| 啟用速度 | 取決於市場容量和區域 | 需要完成節點準備與接入 |
| 運維責任 | 平台與供應商承擔較多 | 用戶負責硬體、系統和網路 |
| 成本結構 | 按市場或合約價格 | 基礎設施成本加平台運維成本 |
| 數據控制 | 依賴所選區域與供應商 | 可放在自有網路和地點 |
| 最低環境 | 由供應商提供 | Ubuntu LTS、驅動程式、CUDA、儲存及網路皆需符合要求 |
| 適合場景 | 快速獲取全球GPU容量 | 已有GPU集群或強調本地控制 |
自動擴縮與資源釋放
官方文件說明,新端點預設為單個副本,且可在空閒一小時後自動縮容至零。此種縮容方式可以降低間歇性服務的閒置成本,但下一次請求時可能會出現冷啟動延遲。
- 為突發流量設定合理最小與最大副本數。
- 對低頻測試端點啟用縮容到零。
- 生產服務保留必要副本並監控排隊與延遲。
- Dev Pod、Ray和Slurm集群不會因任務結束而自動等價釋放。
- 批處理完成後檢查殘留儲存、日誌和節點預留。
儲存與資料管理
平台支援 Node Local Volume 和 Static NFS Volume。前者將資料儲存在同一個節點的本地上,不會在節點之間複製;後者則允許多個節點掛載共享的檔案系統,但其效能與持久性取決於 NFS 基礎設施。
權限可按卷路徑和成員配置,一旦啟用規則,未明確授權的路徑將不能訪問。訓練數據、模型權重和檢查點應同時制定備份、清理與恢復計劃。
| 儲存類型 | 主要特點 | 適合內容 | 注意事項 |
|---|---|---|---|
| Node Local Volume | 同節點生命週期外持久化 | 緩存、臨時模型、單節點數據 | 不跨節點複製,節點故障風險需自擔 |
| Static NFS Volume | 多節點共享 | 資料集、檢查點、共享模型 | 性能與可靠性取決於網路和NFS服務 |
| 容器臨時儲存 | 隨工作負載變化 | 臨時檔案和中間結果 | 不適合唯一副本 |
安全與權限管理
端點可配置訪問令牌、IP地址或CIDR限制,並設定工作區的可見性。官方文件建議為端點啟用訪問令牌,不應將包含敏感模型或業務邏輯的服務直接設為公開。
個人API Token的預設有效期限較短,而服務帳號令牌則適用於CI/CD及共享自動化流程。服務帳號令牌在建立時只會顯示一次,應儲存在企業金鑰管理系統中,並定期更換。
- 使用最小權限角色區分開發、部署和管理員職責。
- 模型倉庫、雲端憑證和API Key統一存入Secret。
- 生產端點啟用令牌並限制來源IP。
- 自動化使用服務帳號,不再使用員工個人令牌。
- 定期撤銷過期、離職或用途不明的令牌。
- 日誌中避免輸出提示詞、密鑰和用戶敏感數據。
- 公開端點上線前進行限流、濫用和成本攻擊測試。
Python SDK、CLI與雲平台的開源邊界
| 組件 | 開源狀態 | 許可證或說明 |
|---|---|---|
| leptonai Python庫 | 開源 | Apache License 2.0 |
| lep CLI | 隨開源Python套件提供 | Apache License 2.0 |
| 官方範例倉庫 | 開源 | 以各倉庫許可證為準 |
| DGX Cloud Lepton控制台 | 閉源託管服務 | 需NVIDIA帳戶與工作區 |
| GPU市場與託管基礎設施 | 閉源商業服務 | 按供應商與合約使用 |
開源SDK允許開發者檢查用戶端代碼、提交問題以及實現自動化建構,但這並不意味著DGX Cloud Lepton的調度器、控制面及雲端服務都是開源的。雖然可以在本地上運行部分Photon或用戶端功能,但這並不等同於整個平台都能在離線環境中進行私有部署。
產品優勢
- 將開發、訓練、批次處理與生產推理置於統一平台管理。
- 連接多家GPU供應商並支援不同地區和NVIDIA架構。
- 相容NVIDIA NIM、NeMo以及常見的開源模型工作流程。
- 提供Endpoint、Dev Pod、Batch Job和分散式集群。
- 支援BYOC,便於整合既有GPU基礎設施。
- SDK、CLI和REST API覆蓋自動化與平台工程需求。
- 開源Python SDK採用寬鬆的Apache-2.0許可證。
- 訪問控制、金鑰、日誌和監控能力較完整。
- Resource Shape有助於統一描述GPU、CPU、記憶體和儲存裝置。
使用限制與注意事項
- 定價隨供應商、地區及GPU容量變化,難以用單一公開價格概括。
- 平台面向專業開發者,需要容器、Linux和GPU運維知識。
- 端點若設為公開,任何獲得地址的人都可能調用並產生費用。
- 縮容到零會帶來冷啟動,生產延遲需要實際壓測。
- Dev Pod和集群持續佔用資源,忘記釋放會增加成本。
- 模型權重、資料集和NIM可能有獨立許可證與使用限制。
- 多雲和BYOC可降低平台差異,但無法消除網路與硬體差異。
- Node Local Volume不跨節點複製,不能作為唯一備份。
- 服務帳號和工作負載身分需要嚴格設計權限邊界。
- 開源SDK不等於託管平台整體開源。
基本資訊
| 字段 | 內容 |
|---|---|
| 當前名稱 | NVIDIA DGX Cloud Lepton |
| 原名稱 | Lepton AI |
| 運營主體 | NVIDIA |
| 工具類型 | AI開發、訓練、推理與GPU資源平台 |
| 核心工作負載 | Endpoint、Dev Pod、批次任務、Ray、Slurm |
| 計算來源 | 合作夥伴託管GPU與BYOC |
| 開發介面 | Web控制台、REST API、Python SDK、lep CLI |
| 價格模式 | 動態計算計費、按供應商報價、預留或企業合約 |
| Python要求 | 官方目前入門文件建議Python 3.10或更高 |
| 是否開源 | SDK與CLI開源,雲平台閉源 |
| SDK許可證 | Apache License 2.0 |
推薦指數
4.7 / 5。DGX Cloud Lepton適合那些需要統一管理GPU資源、進行訓練、批次處理以及生產環境下的推論工作的專業團隊,NVIDIA的生態系統及開源SDK是其明顯優勢;不過,其動態定價機制、技術門檻以及資源管理的要求都相當高。
常見問題
Lepton AI現在叫什麼?
目前的官方名稱是NVIDIA DGX Cloud Lepton。Lepton AI仍可作為舊名稱繼續使用,而官方文件及SDK倉庫則已改用新平台名稱。
它是模型API平台還是GPU雲?
兩者都涵蓋,但範圍更廣。它既能部署模型端點,也提供開發Pod、批次處理、訓練集群、GPU市場和BYOC管理。
DGX Cloud Lepton多少錢?
沒有適用於所有地區的固定統一價格。費用取決於GPU供應商、地區、型號、數量、時長、儲存及網路,需在工作區或企業報價中確認。
支援哪些GPU?
具體型號取決於所選的Node Group以及供應商,官方生態系統涵蓋NVIDIA Blackwell以及H100、H200、A100等架構。實際庫存以工作區的狀況為準。
端點可以自動縮容嗎?
可以。文件說明中,預設在空閒一小時後可縮容至零,但再次呼叫時可能會出現冷啟動的狀況。
可以接入自己的GPU嗎?
可以,透過BYOC將符合系統、驅動、CUDA、儲存及網路要求的節點加入平台。使用者仍需負責自身的硬體及底層運維。
Lepton AI是開源的嗎?
Python SDK和lep CLI是開源的,且採用Apache-2.0許可證,但完整的DGX Cloud Lepton雲平台以及GPU市場則不是開源項目。
如何避免端點被濫用?
啟用端點令牌、限制IP範圍、使用最小權限、設定擴縮容上限並監控請求與成本。不要將生產端點預設為公開。
桂公網安備45132202000164號