Lepton AI
Lepton AI – ein intelligentes Tool, das sich auf die Programmierung mit KI konzentriert.
Tags:AI-ProgrammierwerkzeugeWas ist NVIDIA DGX Cloud Lepton?
NVIDIA DGX Cloud Lepton ist eine einheitliche GPU-Berechnungsplattform für KI-Entwickler und Unternehmensteams, die zum Erstellen, Trainieren, Feinabstimmen und Bereitstellen von Modellen verwendet wird. Sie verbindet NVIDIA Cloud Partner, den GPU-Markt, Cloud-Dienstleister sowie die eigenen Rechenressourcen der Nutzer und bietet ein konsistentes Arbeitsumfeld sowie eine einheitliche Verwaltungsoberfläche.
Dieses Produkt baut auf der Plattform und den Entwicklungswerkzeugen von Lepton AI auf. Sowohl die offiziellen Dokumentationen als auch die Open-Source-Repositorien verwenden den Namen NVIDIA DGX Cloud Lepton. Im Verzeichnis kann „Lepton AI“ weiterhin als alter Name sowie Suchbegriff beibehalten werden, doch im Haupttext sollte der aktuelle Markenname verwendet werden.
Entwicklung des Produkts und aktuelle Positionierung
Im Mai 2025 kündigte NVIDIA DGX Cloud Lepton an – eine Plattform, die die weltweite GPU-Verfügbarkeit mit den Entwicklungswerkzeugen der Entwickler in einem einzigen System zusammenführt. Es handelt sich dabei nicht um einen gewöhnlichen Chatbot oder ein Modellverzeichnis, sondern um eine KI-Infrastruktur, die Entwicklungsumgebungen, Trainingsaufgaben, Inferenzdienste sowie Ressourcenverwaltung umfasst.
Die Plattform arbeitet mit Software-Stacks wie NVIDIA NIM, NeMo, Blueprints usw. zusammen und unterstützt außerdem benutzerdefinierte Container, Open-Source-Modelle sowie eigene Infrastrukturen der Nutzer. Die verfügbaren Regionen, GPUs und Dienste variieren je nach Arbeitsumgebung und Anbieter.
Kernfunktionen
Schlussfolgerungs-Endpunkt
Endpoint stellt Modelle oder Container als zugängliche Netzwerkdienste bereit und unterstützt Kopien, automatische Skalierung, Health Checks, Protokollierung, Überwachung sowie Zugriffskontrolle. Benutzer können Endpunkte aus Container-Images, LLM-Runtimes, NVIDIA NIM oder Vorlagen erstellen.
Entwicklungsumgebung für Dev Pods
Dev Pod bietet eine interaktive Entwicklungsumgebung mit CPU oder GPU, die mit Terminal, SSH, Jupyter oder VS Code verbunden werden kann. Sie eignet sich zum Debuggen von Code, zur Vorbereitung von Daten, zur Überprüfung von Containern und zum Testen von Modellen.
Batch-Verarbeitung und Trainingsaufgaben
Batch-Jobs werden für das Training, die Datenverarbeitung und die Berechnungen offline verwendet. Es ist möglich, PyTorch, MPI oder benutzerdefinierte Container zu verwenden. Die Aufgaben unterstützen mehrere Knoten, Prioritäten, vorzeitige Beendigung, Speichermontage, Umgebungsvariablen sowie Wiederholungsversuche bei Fehlern.
Ray und Slurm-Cluster
Die Plattform unterstützt RayCluster- und Slurm-Clustern und bietet vertraute Scheduling-Methoden für verteiltes Training und Berechnen. Die Clustern belegen während ihrer Laufzeit kontinuierlich die ausgewählten Ressourcen und müssen nach ihrer Verwendung rechtzeitig gelöscht werden.
GPU-Ressourcen und Node-Gruppen
Die Node Group organisiert bestimmte GPU-Node in Ressourcepools und definiert durch Resource Shape Kombinationen aus GPU, CPU, Speicher und Speichersystemen. Teams können entweder von den von der Plattform bereitgestellten Nodeen nutzen oder ihre eigenen Maschinen über BYOC anschließen.
Arbeitsbereich, Speicherung und Überwachbarkeit
Der Workspace ermöglicht eine zentrale Verwaltung von Mitgliedern, Rollen, Tokenen, Schlüsseln, Image-Repositories sowie Workloads. Die Plattform bietet außerdem Funktionen für Protokollierung, Metriken, Ereignisse, Health Checks sowie persistente Speicherung.
Python SDK und lep CLI
Die offizielle LeptonAI-Python-Bibliothek installiert gleichzeitig das lep-Command-Line-Tool, mit dem Endpunkte, Aufgaben, Pods, Clustern, Speicher, Schlüssel und Arbeitsbereiche erstellt und verwaltet werden können. Der SDK-Client kann außerdem die OpenAPI-Struktur der Endpunkte lesen und die Dienste auf eine Weise aufrufen, die der Nutzung von Python-Funktionen ähnelt.
Übersicht der Hauptfunktionen
- In der einheitlichen Arbeitsumgebung werden GPU-Ressourcen aus verschiedenen Regionen und von verschiedenen Lieferanten entdeckt und genutzt.
- Implementieren Sie Modelle, NIMs oder benutzerdefinierte Container als flexible REST-APIs.
- Erstellen Sie einen GPU-Entwicklungs-Pod und verbinden Sie sich über die Terminal, SSH, Jupyter oder VS Code.
- Führen von Einzelrechner-, Mehr-GPU- oder Mehrknoten-Training- sowie Batch-Verarbeitungsaufgaben durch.
- Erstellen Sie Ray- und Slurm-Cluster zur Verarbeitung verteilter Arbeitslasten.
- Ressourcenkombinationen werden über Node Groups und Resource Shapes verwaltet.
- Zugang zur eigenen GPU-Infrastruktur sowie Nutzung einer einheitlichen Verwaltungsoberfläche.
- Lokale Volumes oder NFS-geteilte Speicherbereiche zum Speichern von Daten und Modellen.
- Verwaltung von Umgebungsvariablen, Schlüsseln, Image-Repositorys und Zugriffstoken.
- Überprüfen Sie Protokolle, Metriken, Ereignisse, den Status sowie Informationen zu den Kopien.
- Automatisierte Wartung über das Python SDK, REST API und die lep CLI.
- Nutzen Sie Rollen, Token, eine IP-Whitelist und Endpunkt-Zugriffsrichtlinien zur Steuerung der Berechtigungen.
Für welche Anwendungsszenarien geeignet
- KI-Start-up-Teams: Schnelle Erweiterung von Modellprototypen zu produktiven Inferenzendpunkten.
- Modellentwicklungsteam: Nutzung von mehreren GPUs oder Mehrknoten-Ressourcen zur Trainierung und Feinabstimmung von Modellen.
- Daten-Team: Durchführung von Batch-Feature-Verarbeitung, Embedding-Generierung und Offline-Inferenz.
- Team für Unternehmensplattformen: Zentrale Verwaltung von Multi-Cloud- sowie eigenen GPU-Rechenressourcen.
- Forschungseinrichtungen: Es werden isolierte Entwicklungsumgebungen sowie verteilte Clustern je nach Projekt erstellt.
- Inferenz-Dienstleister: Implementierung von benutzerdefinierten LLM-, visuellen, audio-basierten und multimodalen Modellen.
- DevOps-Team: Zugriff auf CI/CD-Prozesse über CLI, SDK und Service-Konten.
- Projekt souveräne KI: Auswahl von Rechenressourcen nach Region und Planung der Datenspeicherung.
In welchen Fällen ist es nicht geeignet
- Einfache Privatnutzer, die nur direkt chatten, schreiben oder Bilder erstellen möchten.
- Anfänger, die keine Erfahrung mit Containern, Linux, GPUs oder der Verwaltung von Cloud-Kosten haben.
- Projekte, bei denen ein fester Preisplan erforderlich ist und dynamische Ressourcenkosten nicht akzeptiert werden können.
- Einrichtungen, die verlangen, dass der Quellcode für die Steuerungsschnittstellen aller Plattformen offen zugänglich ist und dass diese vollständig eigenständig bereitgestellt werden können.
- Teams mit einem äußerst geringen Budget, die nur gelegentlich leichte CPU-Skripte ausführen.
- Benutzer, die sich den Kosten für Lizenzgebühren für Modelle, die Einhaltung von Datenvorschriften sowie die Sicherheit der Infrastruktur nicht leisten können.
Vergleich der Arbeitlasttypen
| Arbeitlast | Hauptverwendungszweck | Laufmerkmale | Häufige Eingänge |
|---|---|---|---|
| Endpoint | Online-Logik und API-Dienste | Langfristige oder flexible Kopien – mit Möglichkeit zur Skalierung | Konsole, CLI, SDK |
| Dev Pod | Interaktive Entwicklung und Debugging | Anhaltende Inanspruchnahme der ausgewählten Ressourcen | Terminal, SSH, Jupyter, VS Code |
| Batch Job | Training, Batch-Verarbeitung, Offline-Inferenz | Beendigung nach Abschluss der Aufgabe | Konsole, CLI, SDK |
| RayCluster | Verteilte Python-Berechnung | Der Root-Node und die Arbeitsknoten laufen kontinuierlich. | Konsole, Ray-Client |
| Slurm Cluster | HPC und Trainingsscheduling | Clusterbasierte Ressourcenverwaltung | Slurm-Toolchain |
| Node Group | Organisierung von GPU-Node und Kapazität | Andere Arbeitslasten tragen | Arbeitsbereichsverwaltung |
Schneller Einstiegsleitfaden
Arbeitsbereich erstellen und Ressourcen vorbereiten
- Verwenden Sie Ihr NVIDIA-Konto, um sich bei DGX Cloud Lepton anzumelden und Arbeitsbereiche zu erstellen oder sich ihnen anzuschließen.
- Überprüfen Sie den Standort, die verfügbaren Lieferanten, die GPU-Modelle sowie den Abrechnungszustand des Kontos.
- Erstellen oder wählen Sie eine Node Group aus und sehen Sie sich die aktuelle Resource Shape an.
- Konfigurieren Sie Mitgliederrollen, Token, Schlüssel und Anmeldeinformationen für das Spiegel-Repository.
- Erst werden die Tests mit Ressourcen in kleinerem Umfang durchgeführt, anschließend wird die Anzahl der Kopien oder Knoten erhöht.
Einrichten des Inferenzendpunkts
- Wählen Sie aus, ob Sie den Endpunkt über LLM, NVIDIA NIM, Container-Images oder Vorlagen erstellen möchten.
- Geben Sie den Endpoint-Name, das Image, den Ausführungsbefehl und die Service-Portnummer ein.
- Wählen Sie die Node-Gruppe, die GPU-Eigenschaften, die Anzahl der Kopien sowie die Strategie zur automatischen Skalierung aus.
- Führen Sie das Modell-Token über Secret ein – schreiben Sie es nicht in das Image oder in allgemeine Umgebungsvariablen.
- Aktivieren Sie Endpunkt-Token oder IP-Beschränkungen, um sensible Dienste standardmäßig nicht öffentlich zugänglich zu machen.
- Nach dem Bereitstellen wird der Gesundheitszustand, die Protokolle, die Verzögerungen sowie der Speicherverbrauch überprüft.
- Verwenden Sie Testanfragen, um die Ausgabe zu überprüfen, bevor Sie den echten Geschäftsverkehr einbinden.
Batch-Aufgaben ausführen
- Erstellen Sie ein Container-Image, das den Code und die Abhängigkeiten enthält.
- Wählen Sie ein benutzerdefiniertes, PyTorch- oder MPI-Aufgabenvorlage aus.
- Konfigurieren Sie die GPU-Eigenschaften, die Anzahl der Knoten, die Arbeitsprozesse sowie die Ausführungsbefehle.
- Speichern von Daten, Modellen und Checkpoints sowie Einstellen der Archivierungszeit.
- Einstellung von Versuchswiederholungen, Prioritäten und ob eine Übernahme erlaubt ist.
- Beobachten Sie nach dem Start der Aufgabe die Protokolle, Ereignisse und die Ressourcennutzung.
- Speichern Sie die Ergebnisse und Checkpoints und geben Sie die Ressourcen frei, nachdem sichergestellt wurde, dass es keine weiteren Aufgaben gibt.
Verwendung des Python SDK und der CLI
- Installieren Sie die neueste Version des leptonai-Pakets in einer Python 3.10- oder kompatiblen Umgebung.
- Melden Sie sich mit der Arbeitsbereichs-ID und einem kurzfristigen API-Token an.
- Zuerst werden die Arbeitsbereiche, Node-Gruppen und verfügbaren Resource-Formen aufgelistet.
- Erstellen Sie Endpunkte, Pods oder Aufgaben mit dem Befehl lep und überprüfen Sie den Status.
- Verwenden Sie in automatisierten Prozessen Service-Kontostoken und Rollen mit minimalem Berechtigungsgrad.
- Für Löschvorgänge, Skalierungen und kostspielige Aufgaben werden manuelle Bestätigungen sowie Budgetüberprüfungen eingeführt.
Vergleich der Methoden zur Erstellung von Endpunkten
| Methode | Zielgruppe | Vorteile | Es muss vorbereitet werden. |
|---|---|---|---|
| NVIDIA NIM | Teams, die NVIDIA zur Optimierung der Inferenz nutzen möchten | Voroptimierte Container und einheitliche Schnittstellen | NGC-Rechte, API-Schlüssel, kompatible GPU |
| LLM-Laufzeit | Einsatz von Open-Source-Grundlagenmodellen für große Sprachmodelle | Man kann SGLang, Dynamo und andere Backend-Lösungen verwenden. | Modellgewichte, Betriebsparameter, GPU-Kapazität |
| Custom Container | Selbstentwickelte Modelle oder nicht-standardisierte Dienste | Steuerung von Spiegeln, Befehlen und Ports | Container-Images und Dienstprogramme |
| Vorlage | Wiederholte Bereitstellung von Standard-Arbeitlasten | Konfiguration reduzieren und Konsistenz gewährleisten | Verfügbare Vorlagen und notwendige Schlüssel |
Preisgestaltung und Abrechnungsmethode
DGX Cloud Lepton verfügt nicht über ein einheitliches Preisliste, das in allen Regionen gleich bleibt. Die Kosten variieren je nach GPU-Anbieter, Region, Modell, Ressourcenkonfiguration, Laufzeit, Speicherkapazität sowie Netzwerkverkehr und werden im Arbeitsbereich oder in der Geschäftsangebotserstellung festgelegt.
Daher sollten die alten GPU-Stundenpreise von frühen Lepton-Seiten oder Schätzungen Dritter nicht weiter als aktuelle offizielle Preise herangezogen werden. Vor dem Kauf sollten die verfügbaren Ressourcen sowie die Abrechnungspreise im tatsächlichen Arbeitsumfeld überprüft werden; bei Unternehmenskapazitäten und langfristigen Reservierungen ist der Vertrieb zu kontaktieren.
| Kostenposten | Häufige Abrechnungsgrundlagen | Methoden zur Kontrolle der Kosten |
|---|---|---|
| GPU-Berechnung | Modell, Menge, Region und Betriebsdauer | Wählen Sie die richtige Form aus und stoppen Sie die Ressourcen rechtzeitig. |
| CPU und Arbeitsspeicher | Ressourcenspezifikationen und Nutzungsdauer | Reduzierung der Überausstattung |
| Endpoint | Kopierressourcen und Laufzeit | Einstellen von automatischer Skalierung und minimalem Anzahl an Kopien |
| Dev Pod | Ressourcen, die ständig von Pod in Anspruch genommen werden | Bei Nichtgebrauch stoppen oder löschen |
| Batch Job | Ressourcen und Zeit für die tatsächliche Ausführung der Aufgabe | Zuerst in kleinem Maßstab testen und Checkpoints optimieren |
| Ray und Slurm-Cluster | Zeit, die alle Cluster-Knoten in Anspruch nehmen | Freigeben des Clusters unverzüglich nach Abschluss der Aufgabe |
| Speichern | Kapazität, Typ und Aufbewahrungszeitraum | Alte Modelle, Protokolle und Checkpoints löschen |
| Internet | Datenübertragung zwischen Regionen und Lieferanten | Näherungsrechnung und Reduzierung der Cross-Region-Kopien |
| Reservierter Speicherplatz | GPU, Fristen und Verträge | Stabile Last gegen vorhersehbare Versorgung eintauschen |
Vergleich von Hosted Computing und BYOC
| Vergleichspunkte | Plattform-basierte Rechenverwaltung | Bring Your Own Compute |
|---|---|---|
| Quelle der Hardware | NVIDIA-Partner und Cloud-Anbieter | Benutzerbesitzte oder gemietete Knoten |
| Geschwindigkeit aktivieren | Abhängig von der Marktkapazität und der Region | Es ist notwendig, die Vorbereitungen für die Knoten sowie deren Anschluss abzuschließen. |
| Verantwortung für Betrieb und Wartung | Die Plattformen und Lieferanten tragen einen größeren Anteil. | Der Benutzer ist für die Hardware, Systeme und Netzwerke verantwortlich. |
| Kostenstruktur | Zu Marktpreis oder Vertragspreis | Kosten für Infrastruktur plus Kosten für die Betriebsführung der Plattform |
| Datenkontrolle | Abhängigkeit von der ausgewählten Region und dem Lieferanten | Kann auf eigenen Netzwerken und Standorten platziert werden |
| Mindestumgebung | Von dem Lieferanten bereitgestellt | Ubuntu LTS, Treiber, CUDA, Speicher und Netzwerk müssen den Anforderungen entsprechen. |
| Passende Szenarien | Schneller Zugang zur globalen GPU-Kapazität | Es gibt bereits GPU-Cluster oder der Fokus liegt auf lokaler Steuerung. |
Automatische Skalierung und Ressourcenfreigabe
Laut den offiziellen Dokumentationen verfügt das neue Endpunkt standardmäßig über nur eine Kopie. Nach einer Stunde Inaktivität kann die Anzahl der Kopien automatisch auf null reduziert werden. Dadurch können die Kosten für die Inaktivität von Diensten, die nur gelegentlich genutzt werden, gesenkt werden. Allerdings kann es bei der nächsten Anfrage zu Verzögerungen durch einen „Cold Start“ kommen.
- Legen Sie für den plötzlichen Traffic angemessene Mindest- und Maximallimits für die Anzahl der Kopien fest.
- Für die Testendpunkte bei niedrigen Frequenzen wird eine Reduzierung auf Null aktiviert.
- Die Produktionsdienste halten notwendige Kopien bei und überwachen Warteschlangen sowie Verzögerungen.
- Die Dev Pod-, Ray- und Slurm-Clustern werden nicht automatisch und gleichmäßig freigegeben, sobald eine Aufgabe abgeschlossen ist.
- Nach Abschluss der Batch-Verarbeitung werden der verbleibende Speicher, die Protokolle sowie die reservierten Knoten überprüft.
Speicherung und Datenverwaltung
Die Plattform unterstützt Node Local Volume und Static NFS Volume. Beim erstgenannten werden die Daten lokal auf derselben Node gespeichert, es findet keine Kopie zwischen den Nodes statt; beim zweiten können mehrere Nodes einen gemeinsamen Dateisystem einbinden, wobei Leistung und Zuverlässigkeit von der NFS-Infrastruktur abhängen.
Rechte können nach Volume-Pfad und Mitgliedskonfiguration festgelegt werden. Sobald Regeln aktiviert sind, können Pfade, die nicht ausdrücklich autorisiert sind, nicht mehr angegriffen werden. Für Trainingsdaten, Modellgewichte und Checkpoints sollten gleichzeitig Pläne für Backups, Löschung und Wiederherstellung erstellt werden.
| Speichertyp | Hauptmerkmale | Passender Inhalt | Hinweise |
|---|---|---|---|
| Node Local Volume | Persistenz außerhalb der Lebensdauer des Knotens | Caching, temporäre Modelle, Daten eines einzigen Knotens | Keine Kopie über Knoten – das Risiko von Ausfällen der Knoten muss selbst getragen werden. |
| Static NFS Volume | Mehrfachnutzung über mehrere Knoten | Datensätze, Checkpoints, geteilte Modelle | Leistung und Zuverlässigkeit hängen vom Netzwerk sowie von den NFS-Diensten ab. |
| Temporäre Speicherung im Container | Je nach Arbeitslast ändern sich die Werte. | Temporäre Dateien und Zwischenergebnisse | Nicht geeignet für die einzige Kopie |
Sicherheit und Berechtigungsverwaltung
An Endpunkten können Zugriffstoken, IP-Adressen oder CIDR-Beschränkungen konfiguriert werden, außerdem kann die Sichtbarkeit der Arbeitsbereiche festgelegt werden. In den offiziellen Dokumentationen wird empfohlen, für Endpunkte Zugriffstoken zu verwenden; Dienste, die sensible Modelle oder Geschäftslogiken enthalten, sollten nicht direkt öffentlich zugänglich gemacht werden.
Persönliche API-Tokens haben standardmäßig eine kurze Gültigkeitsdauer, während Service-Kontakt-Tokens für CI/CD und gemeinsame Automatisierungen geeignet sind. Service-Kontakt-Tokens werden nur einmal bei ihrer Erstellung angezeigt und sollten in einem Unternehmens-Keys Management System gespeichert sowie regelmäßig erneuert werden.
- Verwenden Sie Rollen mit minimalen Berechtigungen, um die Aufgaben von Entwicklern, Deployern und Administratoren voneinander zu trennen.
- Modelldepots, Cloud-Zertifikate und API-Schlüssel werden zentral in Secret gespeichert.
- Am Produktionsende werden Token aktiviert und die Quell-IPs eingeschränkt.
- Für die Automatisierung werden Service-Konten verwendet; die persönlichen Token der Mitarbeiter werden nicht mehr genutzt.
- Ablaufende, entlassene oder unklar genutzte Token sollten regelmäßig entfernt werden.
- Vermeiden Sie in den Protokollen die Ausgabe von Anweisungen, Schlüsseln und sensiblen Benutzerdaten.
- Vor dem Go-Live des öffentlichen Endpunkts werden Tests zu Bandbreitenbeschränkungen, Missbrauch und Kostenangriffen durchgeführt.
Offene Schnittstellen des Python SDK, der CLI und der Cloud-Plattformen
| Komponenten | Open-Source-Zustand | Lizenz oder Anleitung |
|---|---|---|
| Leptonai-Python-Bibliothek | Open Source | Apache License 2.0 |
| lep CLI | Kommt mit dem Open-Source-Python-Paket | Apache License 2.0 |
| Offizielles Beispiel-Repository | Open Source | Gemäß den Lizenzen der jeweiligen Lager. |
| DGX Cloud Lepton-Konsole | Closed-Source-Hosting-Dienste | Eine NVIDIA-Konto und eine Arbeitsumgebung sind erforderlich. |
| GPU-Markt und Hosted-Infrastruktur | Closed-Source-Business-Dienste | Nach Lieferant und Vertragsnutzung |
Open-Source-SDKs ermöglichen es Entwicklern, den Client-Code zu überprüfen, Probleme zu melden und die Erstellung von Anwendungen zu automatisieren. Das bedeutet jedoch nicht, dass der Scheduler, die Steuerungssoftware sowie alle Cloud-Dienste von DGX Cloud Lepton vollständig open source sind. Auch wenn einige Funktionen von Photon oder des Clients lokal ausgeführt werden können, bedeutet das noch nicht, dass die gesamte Plattform offline und privat eingesetzt werden kann.
Vorteile des Produkts
- Entwicklung, Schulung, Batch-Verarbeitung und produktive Inferenz unter einer einheitlichen Plattform verwalten.
- Verbindung mit mehreren GPU-Anbietern und Unterstützung für verschiedene Regionen sowie NVIDIA-Architekturen.
- Kompatibel mit NVIDIA NIM, NeMo und gängigen Open-Source-Modell-Workflows.
- Es werden Endpoint, Dev Pod, Batch Job und verteilt arbeitende Cluster bereitgestellt.
- BYOC wird unterstützt, um bestehende GPU-Infrastrukturen leicht integrieren zu können.
- SDK, CLI und REST API decken die Anforderungen an Automatisierung und Platform Engineering ab.
- Das Open-Source-Python-SDK verwendet eine lockere Apache-2.0-Lizenz.
- Die Funktionen zur Zugriffskontrolle, zu Schlüsseln sowie zur Protokollierung und Überwachung sind recht umfassend.
- Resource Shape hilft dabei, GPU, CPU, Speicher und Speichersysteme einheitlich zu beschreiben.
Einsatzbeschränkungen und Hinweise
- Die Preise variieren je nach Lieferant, Region und GPU-Kapazität und lassen sich nicht mit einem einzigen öffentlichen Preis zusammenfassen.
- Die Plattform richtet sich an professionelle Entwickler und erfordert Kenntnisse in der Verwaltung von Containern, Linux sowie GPUs.
- Wenn die Endpunkte als öffentlich festgelegt werden, kann jeder, der die Adresse kennt, sie aufrufen und Gebühren verursachen.
- Eine Reduzierung auf Null führt zu einem kalten Start; Verzögerungen in der Produktion erfordern tatsächliche Belastungstests.
- Dev Pod und Clustern verbrauchen kontinuierlich Ressourcen – wenn man vergisst, sie freizugeben, steigen die Kosten.
- Für die Modellgewichte, Datensätze und NIM können eigene Lizenzen sowie Nutzungsbeschränkungen gelten.
- Wolkenbedeckung und BYOC verringern die Unterschiede zwischen den Plattformen, können aber die Unterschiede im Netzwerk und bei der Hardware nicht beseitigen.
- Node Local Volume wird nicht zwischen Nodes kopiert und kann daher nicht als einzige Sicherungskopie dienen.
- Für Service-Konten und Workload-Identitäten müssen strenge Berechtigungsgrenzen festgelegt werden.
- Ein Open-Source-SDK bedeutet nicht, dass die gesamte Plattform offen zugänglich ist.
Grundlegende Informationen
| Felder | Inhalt |
|---|---|
| Der aktuelle Name | NVIDIA DGX Cloud Lepton |
| Ursprünglicher Name | Lepton AI |
| Betreibende Stelle | NVIDIA |
| Arten von Werkzeugen | Plattform für die Entwicklung, Schulung und Inferenz von KI sowie GPU-Ressourcen |
| Kernarbeitslast | Endpoint, Dev Pod, Batch Job, Ray, Slurm |
| Recheneinheit | Partner-Hosted GPU und BYOC |
| Entwicklung von Schnittstellen | Web-Konsole, REST-API, Python-SDK, lep CLI |
| Preismuster | Dynamische Abrechnung, nach Angebot des Lieferanten, Reservierung oder Unternehmensvertrag |
| Anforderungen an Python | Die offiziellen Einführungsunterlagen empfehlen Python 3.10 oder neuer. |
| Ob Open Source | SDK und CLI sind offen source, die Cloud-Plattform ist geschlossen source |
| SDK-Lizenz | Apache License 2.0 |
Empfehlungswert
4,7 / 5. DGX Cloud Lepton eignet sich für Fachteams, die einheitliche GPU-Ressourcen sowie Funktionen für das Training, den Batch-Processing und die Inferenz benötigen. Der NVIDIA-Ekosystem sowie die Open-Source-SDKs stellen klare Vorteile dar; doch es gibt Herausforderungen in Form von dynamischer Preisgestaltung, hohen technischen Anforderungen sowie komplexen Anforderungen an die Ressourcenverwaltung.
Häufige Fragen
Wie heißt Lepton AI jetzt?
Der aktuelle offizielle Name ist NVIDIA DGX Cloud Lepton. Lepton AI kann als alter Name beibehalten werden, während die offiziellen Dokumente sowie die SDK-Repositorys bereits auf den neuen Plattformnamen umgestellt wurden.
Ist es eine API-Plattform für Modelle oder ein GPU-Cloud-Dienst?
Beides ist abgedeckt, doch mit einem größeren Umfang. Es ermöglicht sowohl die Bereitstellung von Modell-Endpunkten als auch die Entwicklung von Pods, Batch-Verarbeitung, Trainingsclustern, GPU-Märkte sowie die Verwaltung von BYOC.
Wie viel kostet DGX Cloud Lepton?
Es gibt keinen festen, einheitlichen Preis, der für alle Regionen gilt. Die Kosten hängen vom GPU-Anbieter, der Region, dem Modell, der Menge, der Dauer, der Speicherung sowie vom Netzwerk ab und müssen in der Angebotserstellung für die Arbeitsumgebung oder das Unternehmen bestätigt werden.
Welche GPUs werden unterstützt?
Die genauen Modelle hängen von der gewählten Node Group sowie vom Anbieter ab. Das offizielle Produktportfolio umfasst die Architekturen NVIDIA Blackwell sowie H100, H200, A100 usw. Die tatsächliche Verfügbarkeit richtet sich nach den Beständen in der Arbeitsumgebung.
Können Endpunkte automatisch skaliert werden?
Ja. Laut den Dokumentationen kann die Ressource standardmäßig eine Stunde nachdem sie nicht mehr genutzt wird, auf Null reduziert werden. Beim erneuten Aufruf kann es jedoch zu einem „Cold Start“ kommen.
Kann man seine eigene GPU anschließen?
Ja, es ist möglich, über BYOC Knoten hinzuzufügen, die den Anforderungen bezüglich System, Treibern, CUDA, Speicher und Netzwerk entsprechen. Der Benutzer bleibt weiterhin für seine eigene Hardware sowie die zugrunde liegende Wartung verantwortlich.
Ist Lepton AI open source?
Das Python SDK und die lep CLI sind open source und unterliegen der Apache-2.0-Lizenz, während die gesamte DGX Cloud Lepton-Plattform sowie der GPU-Markt keine Open-Source-Projekte sind.
Wie kann verhindert werden, dass Endpunkte missbraucht werden?
Aktivieren Sie Endpunkt-Tokens, beschränken Sie den IP-Bereich, verwenden Sie minimale Berechtigungen, legen Sie Obergrenzen für Skalierung fest und überwachen Sie Anfragen sowie Kosten. Machen Sie Produktionsendpunkte nicht standardmäßig öffentlich.
Guigong-Netzwerk-Sicherheitsnummer: 45132202000164