Lepton AI
Lepton AI, outil intelligent spécialisé dans la programmation en IA
Étiquettes :Outils de programmation IAQu’est-ce que NVIDIA DGX Cloud Lepton ?
NVIDIA DGX Cloud Lepton est une plateforme de calcul GPU unifiée destinée aux développeurs d’IA et aux équipes d’entreprise, utilisée pour construire, entraîner, affiner et déployer des modèles. Elle relie les partenaires NVIDIA Cloud, le marché des GPU, les fournisseurs de services cloud et les ressources de calcul propriétaires des utilisateurs, tout en offrant un espace de travail et une expérience de gestion cohérents.
Ce produit reprend la plateforme et les outils de développement de Lepton AI ; les documents officiels actuels ainsi que le dépôt open source utilisent tous le nom NVIDIA DGX Cloud Lepton. On peut conserver « Lepton AI » dans le répertoire en tant que nom ancien et mot de recherche, mais le texte principal doit utiliser la marque actuelle.
Évolution du produit et positionnement actuel
En mai 2025, NVIDIA a annoncé DGX Cloud Lepton, qui unifie l’offre mondiale de GPU et les workflows des développeurs sur une même plateforme. Il ne s’agit pas d’un simple chatbot ou d’un catalogue de modèles, mais d’une infrastructure IA couvrant l’environnement de développement, les tâches d’entraînement, les services d’inference et l’orchestration des ressources.
La plateforme fonctionne en synergie avec des stacks logiciels tels que NVIDIA NIM, NeMo, Blueprints, et prend également en charge des conteneurs personnalisés, des modèles open source ainsi que des infrastructures propriétaires de l’utilisateur. Les régions disponibles, les GPU et les services varient en fonction de l’workspace et du fournisseur.
Fonctionnalités clés
Point d’extrémité de raisonnement
Endpoint déploie les modèles ou les conteneurs en tant que services réseau accessibles, et prend en charge les copies, l’élargissement/le rétrécissement automatique, les vérifications de santé, les journaux, la surveillance et le contrôle d’accès. Les utilisateurs peuvent créer des endpoints à partir d’images de conteneur, de runtimes LLM, de NVIDIA NIM ou de modèles.
Environnement de développement Dev Pods
Dev Pod offre un environnement de développement interactif équipé d’une CPU ou d’une GPU, pouvant se connecter à une terminal, SSH, Jupyter ou VS Code. Il est idéal pour déboguer du code, préparer des données, valider des conteneurs et tester des modèles.
Tâches de traitement par lots et d’entraînement
Batch Job est utilisé pour l’entraînement, le traitement des données et le raisonnement hors ligne ; on peut choisir PyTorch, MPI ou des conteneurs personnalisés. La tâche prend en charge plusieurs nœuds, les priorités, la préemption, le montage de stockage, les variables d’environnement et la réessai en cas d’échec.
Ray et les clusters Slurm
La plateforme prend en charge les clusters RayCluster et Slurm, offrant des méthodes de planification familières pour l’entraînement et le calcul distribués. Les clusters occupent continuellement les ressources sélectionnées pendant leur exécution et doivent être supprimés dès qu’ils ne sont plus utilisés.
Ressources GPU et groupe de nœuds
Un groupe de nœuds organise des nœuds GPU spécifiques en un pool de ressources, et définit la combinaison de GPU, CPU, mémoire et stockage via une forme de ressource. Les équipes peuvent utiliser les nœuds hébergés par la plateforme ou se connecter à leurs propres machines via BYOC.
Zone de travail, stockage et observabilité
Workspace gère de manière centralisée les membres, les rôles, les tokens, les clés, les dépôts d’images et les charges de travail. La plateforme offre en même temps des fonctionnalités de journalisation, d’indicateurs, d’événements, de vérification de santé et de stockage persistant.
SDK Python et CLI lep
La bibliothèque officielle LeptonAI pour Python installe en même temps l’outil en ligne de commande lep, qui permet de créer et de gérer des endpoints, des tâches, des Pods, des clusters, du stockage, des clés et des espaces de travail. Le client SDK peut également lire la structure OpenAPI des endpoints et appeler les services de manière similaire à des fonctions Python.
Aperçu des fonctions principales
- Découvrir et utiliser des ressources GPU provenant de différentes régions et fournisseurs dans l’espace de travail unifié.
- Déployez des modèles, NIM ou des conteneurs personnalisés en tant qu’API REST élastique.
- Créer un Pod de développement GPU et se connecter via le terminal, SSH, Jupyter ou VS Code.
- Exécuter des tâches d’entraînement et de traitement par lots en mode single-machine, multi-GPU ou multi-nœuds.
- Créer des clusters Ray et Slurm pour traiter des charges de travail distribuées.
- Gérer les combinaisons de ressources via les Groupes de nœuds et les Formes de ressources.
- Accéder à son propre infrastructure GPU et utiliser une interface de gestion unifiée.
- Monter un volume local ou un stockage partagé NFS pour enregistrer les données et les modèles.
- Gérer les variables d’environnement, les clés, les registres d’images et les tokens d’accès.
- Voir les journaux, les métriques, les événements, l’état de santé et les informations sur les réplicas.
- Automatisation de l’opération et de la maintenance via le SDK Python, l’API REST et la CLI.
- Utiliser des rôles, des jetons, une liste blanche d’IP et des politiques d’accès aux endpoints pour contrôler les permissions.
Quels scénarios d'utilisation conviennent
- Équipe de startups en IA : passage rapide du prototype de modèle à un endpoint d’inférence en production.
- Équipe de développement de modèles : utilisation de plusieurs GPU ou de ressources multi-nœuds pour entraîner et affiner les modèles.
- Équipe des données : exécution du traitement batch des caractéristiques, de la génération d’embeddings et du raisonnement hors ligne.
- Équipe de la plateforme d’entreprise : gestion unifiée des ressources de calcul multi-cloud et des GPU propriétaires.
- Institut de recherche : création d’environnements de développement isolés et de clusters distribués par projet.
- Fournisseur de services d’inférence : déploiement de modèles LLM personnalisés, visuels, audio et multimodaux.
- Équipe DevOps : accès aux processus CI/CD via la CLI, les SDK et des comptes de service.
- Projet d’IA souveraine : sélectionner les ressources de calcul par région et planifier l’emplacement des données.
Quelles situations ne conviennent pas vraiment
- Utilisateurs individuels ordinaires qui souhaitent simplement discuter en direct, écrire ou générer des images.
- Utilisateurs débutants sans expérience avec les conteneurs, Linux, les GPU ou la gestion des coûts cloud.
- Projets qui nécessitent des forfaits à prix fixe et ne peuvent pas accepter des tarifs dynamiques en fonction des ressources.
- Institutions exigeant que le code source de l’interface de contrôle de toutes les plateformes soit open source et qu’il soit possible de les déployer entièrement de manière autonome.
- Équipes avec un budget très limité, exécutant uniquement occasionnellement des scripts CPU légers.
- Utilisateurs qui ne peuvent pas assumer les responsabilités liées aux licences de modèles, à la conformité des données et à la sécurité de l’infrastructure.
Comparaison des types de charges de travail
| Charge de travail | Utilisation principale | Caractéristiques de fonctionnement | Entrée courante |
|---|---|---|---|
| Endpoint | Raisonnement en ligne et services API | Copie à long terme ou flexible, réversible en taille | Console, CLI, SDK |
| Dev Pod | Développement interactif et débogage | Occupation continue des ressources sélectionnées | Terminal, SSH, Jupyter, VS Code |
| Batch Job | Entraînement, traitement par lots, inférence hors ligne | Finir une fois la tâche accomplie | Console, CLI, SDK |
| RayCluster | Calcul Python distribué | Le nœud de tête et les nœuds de travail fonctionnent en continu | Console, client Ray |
| Slurm Cluster | HPC et planification de l’entraînement | Gestion des ressources en cluster | Chaîne d’outils Slurm |
| Node Group | Organisation des nœuds GPU et de la capacité | Supporter d’autres charges de travail | Gestion de l’espace de travail |
Tutoriel pour commencer rapidement
Créer un espace de travail et préparer les ressources
- Utilisez votre compte NVIDIA pour accéder à DGX Cloud Lepton et créer ou rejoindre un espace de travail.
- Vérifier la région, les fournisseurs disponibles, le modèle de GPU et l’état de facturation du compte.
- Créez ou sélectionnez un groupe de nœuds, puis consultez la forme des ressources actuelle.
- Configurer les rôles des membres, les jetons, les clés et les identifiants du dépôt d’images.
- Commencez par effectuer les tests avec des ressources de petite taille, puis augmentez le nombre de copies ou de nœuds.
Déployer l’endpoint de raisonnement
- Choisissez de créer un point de terminaison à partir d’un LLM, de NVIDIA NIM, d’une image de conteneur ou d’un modèle.
- Remplissez le nom de l’endpoint, l’image, la commande d’exécution et le port du service.
- Sélectionnez le groupe de nœuds, les spécifications GPU, le nombre de réplicas et la stratégie d’extension/contraction automatique.
- Injectez le token du modèle via Secret, sans l’écrire dans l’image ou les variables d’environnement ordinaires.
- Activez les tokens d’extrémité ou les restrictions IP pour éviter que les services sensibles ne soient par défaut accessibles au public.
- Vérifier l’état de santé, les journaux, les retards et l’utilisation de la mémoire vidéo après le déploiement.
- Utilisez des requêtes de test pour valider la sortie, puis connectez le trafic métier réel.
Exécuter une tâche batch
- Préparer une image de conteneur contenant le code et les dépendances.
- Sélectionnez un modèle de tâche personnalisé, PyTorch ou MPI.
- Configurer les spécifications de la GPU, le nombre de nœuds, les processus de travail et les commandes d’exécution.
- Montez le stockage des données, des modèles et des points de contrôle, et définissez la date d’archivage.
- Définir la tentative de réessai en cas d’échec, la priorité et la possibilité d’être préempté.
- Après le démarrage de la tâche, observez les journaux, les événements et l’utilisation des ressources.
- Enregistrer les résultats et les points de contrôle, puis libérer les ressources une fois que aucune tâche ultérieure n’est présente.
Utiliser le SDK et la CLI Python
- Installez la dernière version du paquet leptonai dans Python 3.10 ou un environnement compatible.
- Connectez-vous en utilisant l’ID de zone de travail et un token API à court terme.
- Listez d’abord l’espace de travail, le groupe de nœuds et les formes de ressources disponibles.
- Créer des endpoints, des Pods ou des tâches à l’aide de la commande lep, et consulter leur état.
- Utilisez des tokens de compte de service et des rôles aux privilèges minimaux dans les processus automatisés.
- Ajout de vérifications manuelles et de contrôles budgétaires pour les tâches de suppression, d’extension et à coût élevé.
Comparaison des méthodes de création d’extrémités
| Méthode | Public cible | Avantage | Il faut se préparer |
|---|---|---|---|
| NVIDIA NIM | Les équipes souhaitant utiliser NVIDIA pour optimiser l’inference | Conteneurs préoptimisés et interface unifiée | Permissions NGC, clé API, GPU compatible |
| Temps de exécution du LLM | Déployer des modèles de langage grands ouverts | On peut utiliser SGLang, Dynamo et d’autres backends. | Poids du modèle, paramètres de fonctionnement, capacité GPU |
| Conteneur personnalisé | Modèles développés en interne ou services non standard | Contrôler les images, les commandes et les ports | Images de conteneur et programmes de service |
| Modèle | Déploiement répété de charges de travail standard | Réduire la configuration et maintenir la cohérence | Modèles disponibles et clés nécessaires |
Tarification et mode de facturation
DGX Cloud Lepton ne dispose pas de tarif unique et constant pour toutes les régions. Les coûts varient en fonction du fournisseur de GPU, de la région, du modèle, de la configuration des ressources, de la durée d’exécution, du mode de capacité, de l’stockage et du trafic réseau, et sont confirmés dans l’espace de travail ou dans une offre commerciale.
Par conséquent, il ne faut pas continuer à utiliser les anciennes prix horaires GPU ou les chiffres estimés par des tiers provenant des pages Lepton antérieures comme prix officiels actuels. Avant d’effectuer une commande, il convient de vérifier les ressources disponibles et les prix de facturation dans l’espace de travail réel ; pour les capacités d’entreprise et les réservations à long terme, veuillez contacter le service des ventes.
| Poste de coût | Critères de facturation courants | Méthodes pour contrôler les coûts |
|---|---|---|
| Calcul GPU | Modèle, quantité, région et durée de fonctionnement | Choisir la forme appropriée et arrêter les ressources en temps opportun |
| CPU et mémoire | Spécifications des ressources et temps d’occupation | Réduire la surconfiguration |
| Endpoint | Ressources de copie et durée de fonctionnement | Définir la réduction automatique et le nombre minimal de copies |
| Dev Pod | Ressources occupées en continu par Pod | Arrêter ou supprimer lorsqu’on n’en a plus besoin |
| Batch Job | Ressources et temps réels d’exécution de la tâche | Valider et optimiser les points de contrôle à petite échelle d’abord |
| Ray et les clusters Slurm | Temps d’occupation de tous les nœuds du cluster | Libérer le cluster immédiatement à la fin de la tâche |
| Stockage | Capacité, type et durée de conservation | Nettoyer les anciens modèles, journaux et points de contrôle |
| Réseau | Transmission de données régionales et fournisseurs | Calculer à proximité et réduire la copie inter-régionale |
| Capacité réservée | GPU, délais et contrat | Échanger une charge stable contre un approvisionnement prévisible |
Calcul en gestion et BYOC comparés
| Élément de comparaison | Hébergement de calcul sur plateforme | Bring Your Own Compute |
|---|---|---|
| Source du matériel | Partenaires NVIDIA et fournisseurs de cloud | Nœuds propriétaires ou loués par l’utilisateur |
| Activer la vitesse | Dépend de la capacité du marché et de la région | Il est nécessaire de terminer la préparation et l’ connexion des nœuds. |
| Responsabilités de maintenance | La plateforme et les fournisseurs assument une charge plus lourde | L’utilisateur est responsable du matériel, des systèmes et du réseau. |
| Structure des coûts | Au prix du marché ou contractuel | Coûts d’infrastructure plus coûts de maintenance de la plateforme |
| Contrôle des données | Dépendance de la région sélectionnée et du fournisseur | Peut être utilisé sur son propre réseau et site |
| Environnement minimal | Fourni par le fournisseur | Ubuntu LTS, les pilotes, CUDA, le stockage et le réseau doivent être conformes aux exigences. |
| Scénarios adaptés | Obtenir rapidement la capacité mondiale des GPU | Clustering GPU existant ou accent mis sur le contrôle local |
Ajustement automatique et libération des ressources
La documentation officielle indique que le nouveau point de terminaison dispose par défaut d’une seule copie et peut être réduit automatiquement à zéro après une heure d’inactivité. La réduction permet de diminuer les coûts liés à l’inactivité des services intermittents, mais un retard de démarrage en froid peut survenir pour la prochaine requête.
- Définir un nombre minimum et maximum raisonnable de copies pour le trafic soudain.
- Activer la réduction à zéro pour les points d’essai à basse fréquence.
- Les services de production conservent des copies nécessaires et surveillent les files d’attente et les retards.
- Les clusters Dev Pod, Ray et Slurm ne sont pas libérés automatiquement de manière équivalente à la fin d’une tâche.
- Vérifier le stockage restant, les journaux et les réservations de nœuds une fois le traitement par lots terminé.
Stockage et gestion des données
La plateforme prend en charge les volumes locaux Node et les volumes NFS statiques. Le premier stocke les données localement sur le même nœud, sans copie entre nœuds ; le second permet à plusieurs nœuds de monter un système de fichiers partagé, mais les performances et la persistance dépendent de l’infrastructure NFS.
Les permissions peuvent être configurées en fonction du chemin du volume et des membres ; une fois les règles activées, les chemins non autorisés ne pourront pas être accédés. Des plans de sauvegarde, de nettoyage et de restauration doivent être établis simultanément pour les données d’entraînement, les poids du modèle et les points de contrôle.
| Type de stockage | Caractéristiques principales | Contenu adapté | Précautions à prendre |
|---|---|---|---|
| Node Local Volume | Persistance en dehors du cycle de vie du même nœud | Cache, modèles temporaires, données à un nœud | Aucune copie entre nœuds : le risque de panne du nœud est à votre charge. |
| Static NFS Volume | Partage multi-nœuds | Ensembles de données, points de contrôle, modèles partagés | Les performances et la fiabilité dépendent du réseau et du service NFS |
| Stockage temporaire dans un conteneur | En fonction de la charge de travail | Fichiers temporaires et résultats intermédiaires | Inadapté pour une seule copie |
Gestion de la sécurité et des droits d’accès
Les endpoints peuvent être configurés avec des tokens d’accès, des adresses IP ou des restrictions CIDR, ainsi que pour définir la visibilité de l’espace de travail. La documentation officielle recommande d’activer les tokens d’accès pour les endpoints, et il ne faut pas rendre publics directement les services contenant des modèles sensibles ou de la logique métier.
Par défaut, la durée de validité d’un token API personnel est courte, tandis que les tokens de compte de service conviennent aux processus CI/CD et à l’automatisation partagée. Les tokens de compte de service ne s’affichent qu’une seule fois lors de leur création ; ils doivent être stockés dans un système de gestion des clés d’entreprise et mis à jour régulièrement.
- Utiliser des rôles aux privilèges minimaux pour distinguer les responsabilités de développement, de déploiement et d’administration.
- Les entrepôts de modèles, les identifiants cloud et les clés API sont stockés de manière centralisée dans Secret.
- Activer les jetons au niveau de l’endpoint de production et restreindre les adresses IP sources.
- L’automatisation utilise des comptes de service, sans réutiliser les tokens personnels des employés.
- Révoquer régulièrement les jetons périmés, ceux des employés partis ou dont l’usage est indéterminé.
- Évitez d’afficher dans le journal les prompts, les clés et les données sensibles des utilisateurs.
- Mettre en place des tests de limitation du trafic, d’abus et d’attaques coûteuses avant le lancement de l’endpoint public.
Les limites open source du SDK Python, de la CLI et des plateformes cloud
| Composant | Statut open source | Licence ou instructions |
|---|---|---|
| la bibliothèque Leptonai Python | Open source | Apache License 2.0 |
| lep CLI | Fourni avec le paquet Python open source | Apache License 2.0 |
| Répertoire d’exemples officiel | Open source | Selon les licences de chaque entrepôt |
| Console DGX Cloud Lepton | Services de hébergement fermés | Compte NVIDIA et espace de travail requis |
| Le marché des GPU et l’infrastructure de hébergement | Services commerciaux propriétaires | Selon le fournisseur et l’utilisation contractuelle |
Le SDK open source permet aux développeurs d’examiner le code client, de soumettre des problèmes et d’automatiser la construction, mais cela ne signifie pas que le planificateur, la couche de contrôle et les services cloud de DGX Cloud Lepton soient entièrement open source. Le fait de pouvoir exécuter localement certaines fonctionnalités de Photon ou du client ne revient pas à ce que l’ensemble de la plateforme puisse être déployée en mode privé hors ligne.
Avantages du produit
- Gérer le développement, l’entraînement, le traitement par lots et l’inference en production sur une plateforme unifiée.
- Connecte plusieurs fournisseurs de GPU et prend en charge différentes régions ainsi que les architectures NVIDIA.
- Compatible avec NVIDIA NIM, NeMo et les flux de travail de modèles open source courants.
- Fournit des endpoints, des Dev Pods, des jobs batch et des clusters distribués.
- Prend en charge BYOC, ce qui facilite l’intégration d’une infrastructure GPU existante.
- Les SDK, la CLI et l’API REST couvrent les besoins en automatisation et en ingénierie de plateforme.
- Le SDK Python open source est soumis à une licence permissive Apache-2.0.
- Les fonctionnalités de contrôle d’accès, de clés, de journalisation et de surveillance sont assez complètes.
- Resource Shape aide à décrire de manière unifiée les GPU, les CPU, la mémoire et le stockage.
Restrictions d'utilisation et précautions
- Le prix varie en fonction du fournisseur, de la région et de la capacité de la GPU, il est donc difficile de le définir par un seul prix public.
- La plateforme s’adresse aux développeurs professionnels et nécessite des connaissances en gestion de conteneurs, de Linux et de GPU.
- Si les points d’accès sont configurés en mode public, toute personne disposant de l’adresse peut les appeler et engendrer des frais.
- Réduire la taille à zéro entraîne un démarrage en froid ; les retards de production nécessitent des tests de charge réels.
- Dev Pod et le cluster consomment continuellement des ressources ; oublier de les libérer augmente les coûts.
- Les poids du modèle, l’ensemble de données et le NIM peuvent avoir des licences et des restrictions d’utilisation indépendantes.
- Les nuages et le BYOC réduisent les différences de plateforme, mais ne peuvent pas éliminer les différences de réseau et de matériel.
- Le volume local du nœud n’est pas copié entre les nœuds et ne peut pas servir de sauvegarde unique.
- Les comptes de service et les identités de charge de travail nécessitent une définition stricte des limites des permissions.
- Un SDK open source ne signifie pas que toute la plateforme hébergée soit open source.
Informations de base
| champ | Contenu |
|---|---|
| Nom actuel | NVIDIA DGX Cloud Lepton |
| Nom original | Lepton AI |
| Entité opérationnelle | NVIDIA |
| Type d’outil | Plateforme pour le développement, l’entraînement et l’inference de l’IA ainsi que les ressources GPU |
| Charge de travail principale | Endpoint, Dev Pod, Batch Job, Ray, Slurm |
| Source de calcul | Hébergement de GPU par des partenaires et BYOC |
| Développer une interface | Console web, API REST, SDK Python, CLI lep |
| Modèle de prix | Facturation calculée dynamiquement, selon les prix du fournisseur, réservation ou contrat d’entreprise |
| Exigences de Python | La documentation officielle de démarrage recommande Python 3.10 ou une version ultérieure. |
| Est-ce open source | Le SDK et la CLI sont open source, la plateforme cloud est close source. |
| Licence SDK | Apache License 2.0 |
Indice de recommandation
4,7 / 5. DGX Cloud Lepton convient aux équipes professionnelles ayant besoin de ressources GPU unifiées, de capacités d’entraînement, de traitement par lots et d’inference en production ; l’écosystème NVIDIA et les SDK open source constituent des avantages significatifs ; cependant, le tarif dynamique, le niveau technique requis et les exigences en matière de gestion des ressources sont élevés.
Questions fréquentes
Comment s’appelle maintenant Lepton AI ?
Le nom officiel actuel est NVIDIA DGX Cloud Lepton. Lepton AI peut rester en tant que nom ancien, tandis que la documentation officielle et les dépôts SDK ont déjà été mis à jour pour utiliser le nouveau nom de la plateforme.
S’agit-il d’une plateforme API de modèles ou d’un cloud GPU ?
Les deux sont couverts, mais avec une portée plus large. Il permet non seulement de déployer des endpoints de modèles, mais offre également la gestion de Pods, du traitement par lots, de clusters d’entraînement, du marché GPU et du BYOC.
Combien coûte le DGX Cloud Lepton ?
Il n’existe pas de prix fixe et uniforme valable dans toutes les régions. Les frais dépendent du fournisseur de GPU, de la région, du modèle, de la quantité, de la durée, du stockage et du réseau ; il convient de les confirmer dans la cotation de l’espace de travail ou de l’entreprise.
Quelles GPU sont prises en charge ?
Le modèle spécifique dépend du groupe de nœuds choisi et du fournisseur ; l’écosystème officiel couvre les architectures NVIDIA Blackwell ainsi que H100, H200, A100, etc. Les stocks réels sont indiqués dans l’espace de travail.
Les points d’extrémité peuvent-ils être réduits automatiquement ?
Oui. La documentation indique que par défaut, il est possible de réduire la taille à zéro après une heure d’inactivité, mais un démarrage en froid peut survenir lors d’une nouvelle invocation.
Est-il possible d’utiliser sa propre GPU ?
Oui, il est possible d’ajouter des nœuds répondant aux exigences en matière de système, de pilotes, de CUDA, de stockage et de réseau à la plateforme via BYOC. L’utilisateur reste responsable de son propre matériel et de l’exploitation de base.
Lepton AI est-il open source ?
Le Python SDK et la CLI lep sont open source et utilisent la licence Apache-2.0, tandis que l’ensemble de la plateforme cloud DGX Cloud Lepton ainsi que le marché des GPU ne sont pas des projets open source.
Comment éviter que les points d’extrémité ne soient mal utilisés ?
Activer les tokens d’endpoint, limiter la plage d’IP, utiliser le minimum de privilèges, définir des plafonds de mise à l’échelle et surveiller les requêtes ainsi que les coûts. Ne pas rendre par défaut les endpoints de production publics.
Numéro d’enregistrement de sécurité publique du Guangxi : 45132202000164