Communauté Modelers Magique
Valeur ajoutée gratuite
Guide complet des outils d’IA Modèle d’entraînement d’IA

Communauté Modelers Magique

Communauté chinoise d’IA regroupant des modèles, des ensembles de données, des espaces créatifs et des ressources de développement

Étiquettes :

Qu’est-ce que la communauté Modelers Magle ?

La communauté Modelers est une communauté neutre et à but non lucratif destinée aux développeurs et apprenants en intelligence artificielle, qui offre des services de hébergement, d’exposition, de téléchargement et de collaboration pour les modèles, les ensembles de données, les espaces d’expérimentation et les outils de développement. La communauté fonctionne selon un système de conseil d’administration, avec pour objectif de construire ensemble, par les acteurs de la chaîne industrielle, un écosystème d’IA national.

Ce n’est pas seulement un site de téléchargement de fichiers de modèles, mais il relie également les cartes de modèles, les descriptions des ensembles de données, les démonstrations d’application, la collaboration organisationnelle, les dépôts Git, les tokens d’accès, le kit de développement openMind et l’adaptation à la NPU Ascend. Les utilisateurs peuvent rechercher des poids publics, mais aussi créer leurs propres dépôts pour publier des modèles, des données et des applications.

Bibliothèque de modèles

La bibliothèque de modèles couvre des tâches telles que le traitement du langage naturel, la vision par ordinateur, le traitement du son, l’IA multimodale et l’IA générative. Les cartes de modèles affichent le propriétaire, le type de tâche, le framework, les étiquettes, le fichier, la version et les instructions d’utilisation, et peuvent être liées à des espaces d’applications accessibles en ligne.

Avant de télécharger, veuillez lire le README, la licence du modèle, les instructions concernant les données d’entraînement et leurs limites. Le fait que les modèles soient hébergés par la communauté ne signifie pas que la plateforme garantit l’exactitude, la sécurité ou l’utilisation commerciale de chacun d’eux ; pour un même nom de modèle, il peut exister une version originale, une version quantifiée, une version PyTorch, une version MindSpore et une version adaptée à Ascend.

Méthode de téléchargement du modèle

Le modèle public peut être téléchargé fichier par fichier via une page web, ou l’on peut cloner le répertoire complet à l’aide de Git et de Git LFS. Le client openMind Hub propose le téléchargement de fichiers individuels, le téléchargement du répertoire entier sous forme de snapshot, un cache, des branches de version et un filtrage des fichiers, ce qui est idéal pour obtenir de manière fiable les poids dans des scripts.

La bibliothèque openMind permet également de charger des modèles directement sous la forme « nom d’utilisateur/nom du dépôt », et d’exécuter des inférences via Pipeline, AutoModel et AutoTokenizer. Lors de l’utilisation de trust_remote_code, le code personnalisé fourni par le dépôt est exécuté ; il convient donc de vérifier au préalable son code source et de le tester dans un environnement isolé.

Téléchargement de modèles et contributions

Après l’inscription, vous pouvez créer un dépôt de modèles personnel ou organisationnel. Téléchargez le upload_folder compatible avec Git, Git LFS et openMind Hub Client, ainsi que push_to_hub pour l’entraîneur openMind Library.

Le dépôt créera automatiquement une carte de modèle README ; les contributeurs doivent compléter avec des tâches, des données, des indicateurs, un environnement, des restrictions et une licence.

Les tokens d’accès se divisent en droits Lire et Écrire ; l’option Écrire permet de télécharger et de téléverser des fichiers, tandis que le token n’est affiché dans son intégralité qu’au moment de sa création. Il convient de créer des tokens distincts pour l’automatisation, sans les stocker dans le dépôt de code.

Après une fuite, il faut la supprimer immédiatement et la recréer.

Ensemble de données

Un entrepôt de datasets est utilisé pour héberger, découvrir et gérer les versions des données d’entraînement ou d’évaluation. Les utilisateurs peuvent filtrer par tâche et domaine, consulter les fichiers et les instructions, puis télécharger ces éléments dans leur environnement d’entraînement local à l’aide d’outils communautaires.

La divulgation des données ne signifie pas qu’elles peuvent être utilisées à volonté. Avant l’entraînement, il est nécessaire de vérifier la licence, les informations personnelles, les droits d’auteur, les autorisations de collecte et les restrictions géographiques, en particulier pour les données médicales, financières, liées au visage, à la voix et obtenues via Internet.

Une carte de données ne doit pas être considérée comme commercialement utilisable par défaut en l’absence de celle-ci.

Espace d’expérience

L’espace d’expérience est utilisé pour présenter des applications en ligne basées sur des modèles, dont les formes courantes incluent les ChatBot, les images, la voix, les Notebooks ou des applications personnalisées. La page détaillée du modèle peut être associée à un espace d’expérience, permettant aux visiteurs de tester les entrées et sorties sans avoir à configurer d’environnement local au préalable.

Les espaces d’expérience sont gérés par différents éditeurs ; la vitesse de démarrage, la durée d’utilisation, les ressources informatiques, la conservation des données et les règles de confidentialité peuvent varier. Ne saisissez pas de informations confidentielles du client, de données personnelles sensibles ou de documents non publics lors des démonstrations publiques.

Application et Notebook

Les développeurs peuvent créer des démonstrations de modèles de publication dans des espaces d’application, ou utiliser l’environnement Notebook pour effectuer des expérimentations. Les documents de pratique officiels présentent la méthode pour charger, affiner et inférer des modèles à l’aide des ressources NPU, ce qui convient aux développeurs ne disposant pas d’un environnement Ascend local pour vérifier la compatibilité.

Les notebooks en ligne nécessitent encore la gestion des dépendances, du stockage, du temps de exécution et de la libération des ressources. Avant un entraînement à long terme, il convient de vérifier la durée de la session, la persistance sur disque, les quotas ainsi que les règles d’interruption des tâches, et d’exporter en temps opportun le code, les journaux et les points de contrôle.

openMind Library

La bibliothèque openMind est un ensemble de développement complémentaire pour l’apprentissage profond, qui prend en charge le pré-entraînement, le fine-tuning et l’inférence des modèles grâce à une API unifiée. Elle encapsule les interfaces AutoClass, Pipeline et Trainer fréquemment utilisées par Transformers et MindFormers, est compatible avec PyTorch et MindSpore, et intègre également des capacités d’affinité avec la NPU Ascend.

Le côté de l’entraînement peut intégrer des outils tels que MindSpeed, Accelerate, PEFT, DeepSpeed et LLaMA Factory. La compatibilité réelle dépend d’openMind, du framework d’apprentissage profond, de CANN, des pilotes, du firmware et de la version de l’implémentation du modèle ; il convient donc de créer un environnement virtuel indépendant en se référant à la documentation avant l’installation.

openMind Hub Client

OpenMind Hub Client est un outil en Python et en ligne de commande qui interagit avec les entrepôts communautaires ; il permet de créer des entrepôts, de consulter des métadonnées, de télécharger des fichiers, de télécharger un seul fichier ou un Snapshot, ainsi que de gérer le cache local. Il est adapté à l’automatisation des pipelines d’entraînement et à la préparation d’environnements hors ligne.

Le client dispose d’une liste blanche et noire pour les chemins de téléchargement, afin d’éviter l’écriture dans des répertoires système sensibles. Par défaut, Linux autorise les répertoires temporaires et les répertoires utilisateur, tandis que Windows autorise les répertoires utilisateur ainsi que certains disques de données ;

Lors de la définition d’une liste blanche personnalisée, la liste noire conserve une priorité plus élevée.

Raisonnement local

La documentation pour débuter rapidement propose des exemples pour Python 3.8, 3.9 et 3.10, et exige l’installation de frameworks tels que PyTorch ou MindSpore en fonction de la tâche à effectuer. Grâce aux pipelines, il est possible de réaliser des tâches de classification de texte, de génération, visuelles et autres ; une fois les poids du modèle téléchargés, ils consomment principalement les ressources CPU, GPU ou NPU de l’utilisateur lui-même.

Les fichiers de grands modèles peuvent atteindre des dizaines ou des centaines de GB ; avant une utilisation locale, il convient de vérifier le disque, la mémoire, la mémoire vidéo, la précision, la quantification et la compatibilité du matériel. Un téléchargement réussi ne signifie pas que le matériel actuel peut les exécuter directement.

Pré-entraînement et fine-tuning

La bibliothèque openMind fournit des interfaces telles que Trainer et TrainingArguments, qui permettent de poursuivre le pré-entraînement à partir de modèles communautaires, d’effectuer un fine-tuning complet ou un fine-tuning efficace en termes de paramètres en combinant PEFT. Une fois terminé, il est possible d’utiliser push_to_hub pour téléverser les configurations, le Tokenizer et les poids vers la communauté.

La qualité du micro-ajustement dépend des données, des modèles de base, du taux d’apprentissage, de l’évaluation et de la licence du modèle de base. Les journaux d’entraînement et la baisse de la perte ne suffisent pas à prouver l’efficacité ; il convient d’utiliser un ensemble de validation indépendant, des évaluations manuelles et des tests de sécurité, tout en enregistrant le framework, la graine aléatoire et l’environnement matériel.

Test d’accessibilité du modèle NPU

Le propriétaire du modèle ou un membre de l’organisation ayant des droits d’édition peut soumettre des tests d’availability du modèle afin de vérifier si les cas d’utilisation d’inférence personnalisés peuvent être exécutés dans un environnement NPU. Le script de test commence par inference.py dans le répertoire examples, et peut être accompagné d’un fichier requirements.

En cas de réussite du test, des journaux ainsi que des liens de téléchargement de l’image sont fournis. Toute modification dans les commits du dépôt, toute mise en privé ou tout retrait du modèle entraîne l’arrêt des tests correspondants. La disponibilité ne signifie qu que le script et l’environnement spécifiés peuvent fonctionner ; cela n’équivaut pas à une certification de la précision, de la performance ou de la stabilité en production.

Organisation et permissions

L’organisation peut gérer de manière centralisée les modèles, les ensembles de données et les espaces d’expérience, et définir trois rôles : gestionnaire, éditeur et lecteur uniquement. Le gestionnaire peut également gérer les membres, les informations de l’organisation et les tokens d’accès.

Les éditeurs peuvent modifier le dépôt organisationnel ; les membres en lecture seule ne peuvent accéder qu’aux ressources autorisées.

Une fois le nom d’une organisation créé, il ne peut pas être modifié. Avant de la supprimer, il est nécessaire de nettoyer les projets associés, ce qui constitue une opération à haut risque.

L’équipe doit éviter de partager les tokens d’écriture personnels et mettre en place des processus d’audit, de branchement et de sauvegarde pour les modèles importants.

Gestion des versions de entrepôt

Les modèles et les entrepôts de données utilisent une gestion de versions au style Git, tandis que les gros fichiers sont traités via Git LFS. Les utilisateurs peuvent télécharger des versions fixes différentes selon les révisions, afin d’éviter que les résultats d’entraînement ne puissent pas être reproduits suite à des mises à jour en amont.

La construction de production doit retenir un Commit ou une Tag spécifique, et vérifier les hashes des fichiers clés. Seul le nom de la branche principale peut changer avec les mises à jour du dépôt, ce qui pourrait entraîner le téléchargement de poids remplacés ou de code personnalisé.

Prix et frais

La communauté MoLe est conçue comme une communauté à but non lucratif ; les modèles, ensembles de données, documents et accès aux expériences sont accessibles gratuitement. Le site officiel ne propose actuellement pas de prix uniforme pour les abonnements, ni de tableau de prix fixe pour les GPU ou NPU applicable à tous les espaces d’expérience.

Une consultation gratuite ne signifie pas que tous les coûts d’utilisation soient nuls. Le téléchargement local entraîne des coûts de stockage et de réseau, tandis que l’entraînement et le déploiement locaux font encourir à l’utilisateur les frais liés à l’électricité du matériel ou aux ressources cloud.

Les ressources, les quotas et les droits d’activité dans l’espace en ligne peuvent être ajustés en fonction de la page spécifique.

Si la page ne mentionne pas de prix clair, il ne faut pas se fier à des articles de tiers pour estimer le forfait.

Licence de modèle et usage commercial

Les plateformes communautaires, les outils openMind et les modèles dans les dépôts sont des entités juridiques distinctes. Chaque modèle et ensemble de données peut faire l’objet de sa propre licence : certaines autorisent une utilisation commerciale, tandis que d’autres exigent une demande, une attribution de crédits, des restrictions sur le nombre d’utilisateurs ou interdisent des utilisations spécifiques.

Avant utilisation, il convient de vérifier séparément les droits d’auteur des poids, du code, du jeu de données et des conditions d’utilisation du contenu généré. Même si l’outil openMind utilise une licence souple, cela ne modifie pas automatiquement la licence du modèle téléchargé.

GitHub, Gitee et l’état du logiciel open source

Le code source principal d’openMind Library et d’openMind Hub Client est disponible dans l’organisation Gitee liée à Ascend, et le Hub Client est soumis à la licence permissive Mulan version 2. Modelers dispose également sur Gitee d’un dépôt de retours destiné à la communication concernant les problèmes et les besoins de la communauté.

Les services de page web communautaire, les comptes, le stockage hébergé, la modération et tout le code backend n’ont pas été rendus publics dans leur intégralité en raison de l’ouverture source de la chaîne d’outils. Par conséquent, il convient de préciser que « la plateforme communautaire fournit une chaîne d’outils open source, mais les services du site ne constituent pas pour autant un projet entièrement open source ».

Puissance de calcul nationale et écosystème de frameworks

La communauté Mojo se distingue par son soutien à l’NPU, à MindSpore et à l’adaptation des modèles nationaux, tout en étant compatible avec les workflows PyTorch. Les développeurs peuvent obtenir des modèles optimisés pour l’NPU ou déjà validés, ce qui réduit les efforts de recherche technique nécessaires lors du passage d’une écosystème GPU classique.

La version adaptée produite localement doit encore être compatible avec des puces spécifiques, CANN et des versions de framework. L’étiquette « Ascend » sur la carte de modèle ne signifie pas qu’elle est adaptée à toutes les générations de matériel, et ne peut pas remplacer les tests de performance.

Guide d’utilisation de la communauté Modelers Magle

Terminer une tâche de base

  1. Inscrivez-vous à la communauté Modelers et créez une clé API réservée uniquement à l’environnement de test ;
  2. Sélectionner le modèle en fonction du type d’entrée, du contexte, de la qualité, de la vitesse et du prix ;
  3. Appeler d’abord la bibliothèque de modèles pour effectuer la requête minimale et vérifier la structure de réponse ;
  4. Tester ensuite la sortie en flux, les paramètres et les réponses en cas d’erreur par le biais du mode de téléchargement du modèle ;
  5. Enregistrer les tokens, le nombre d’appels, le délai, le taux d’erreurs et le coût par appel ;
  6. Transférez la clé dans le gestionnaire de clés du serveur avant de l’intégrer à l’application officielle ;

Créer des flux de travail professionnels réutilisables

  1. Utiliser des clés et des quotas différents pour les environnements de développement, de test et de production ;
  2. Créer des ensembles d’évaluation représentatifs en fonction de la bibliothèque de modèles, des méthodes de téléchargement de modèles, ainsi que du téléversement et des contributions de modèles ;
  3. Définir les délais d’attente, la concurrence, les tentatives de réessai, le throttling et les plafonds budgétaires ;
  4. Effectuer des vérifications sur la sortie en ce qui concerne les faits, la sécurité, le format et les informations sensibles ;
  5. Surveiller les changements de version, de prix, de délai et de taux d’échec des modèles de surveillance ;
  6. Préparer des plans de dégradation du modèle, de coupure et de prise en main manuelle ;

À qui s’adresse-t-il ?

  • Développeurs à la recherche de modèles open source nationaux, de datasets et de ressources adaptées à Ascend ;
  • Étudiants qui apprennent le processus de chargement, d’ajustement fin, d’inference et de déploiement des modèles ;
  • Équipes nécessitant une collaboration entre entrepôts organisationnels pour maintenir les modèles et les données ;
  • Les chercheurs souhaitant publier des démos en ligne, des notebooks et les résultats de leurs modèles ;
  • Ingénieurs utilisant PyTorch, MindSpore ou la NPU Ascend.

Avantages du produit

  • Les modèles, les ensembles de données, les espaces d’expérience et la collaboration organisationnelle sont regroupés au sein d’une communauté ;
  • Prend en charge plusieurs méthodes de téléchargement : pages web, Git, Git LFS et Hub Client ;
  • La bibliothèque openMind couvre le pré-entraînement, le fine-tuning, l’inférence et le téléchargement ;
  • Compatibilité avec PyTorch et MindSpore, avec un soutien prioritaire pour l’NPU Ascend ;
  • Il est possible de tester l’disponibilité du NPU et d’enregistrer les journaux ainsi que les images ;
  • Positionnement communautaire à but non lucratif, seuil d’accès aux ressources publiques faible.

Restrictions et précautions

  • Les entrepôts communautaires sont gérés par différents contributeurs, de sorte que les descriptions des modèles, la qualité, les licences et la sécurité ne sont pas toujours uniformes ;
  • L’espace d’expérience peut être en veille ou hors ligne, les quotas de ressources en ligne n’ont pas de prix public uniforme, et l’environnement de démonstration ne peut pas être considéré comme un SLA de production.
  • Les gros fichiers nécessitent GitLFS et suffisamment d’espace disque ;
  • Le code personnalisé présente des risques liés à la chaîne d’approvisionnement ;
  • L’environnement NPU est sensible à la combinaison de versions ;
  • Avant de télécharger, d’entraîner et de publier, il convient d’examiner la licence, de verrouiller la version, de scanner le code, ainsi que de créer des sommaires de contrôle et des sauvegardes pour les poids et les données ;

Questions fréquentes

La communauté Magic Music est-elle gratuite ?

Les modèles, ensembles de données, documents et points d’accès aux expériences sont accessibles gratuitement ; il n’existe actuellement pas de tarif membre uniforme. Les ressources de calcul en ligne, les quotas d’événements ou les services d’entreprise sont soumis aux pages et règles spécifiques correspondantes.

Comment télécharger les modèles Modelers ?

Il est possible de télécharger un fichier unique depuis le site web, ou de le cloner avec Git et Git LFS, ou encore de télécharger un fichier unique ainsi que l’ensemble du Snapshot via l’openMind Hub Client.

Quels frameworks la communauté Magic Music prend-elle en charge ?

La bibliothèque openMind est compatible avec PyTorch et MindSpore, et est spécifiquement adaptée à l’NPU Ascend ; elle peut être utilisée en combinaison avec des outils tels que PEFT, DeepSpeed, Accelerate et LLaMA Factory.

Tous les modèles communautaires peuvent-ils être commercialisés ?

On ne peut pas généraliser. Chaque modèle et ensemble de données a des licences différentes ; il est nécessaire de vérifier les restrictions relatives à l’usage commercial, à la mention des crédits, aux demandes et aux scénarios dans le dépôt spécifique.

Les modélisateurs sont-ils open source ?

La bibliothèque openMind et des outils tels que Hub Client disposent d’un code source ouvert, mais le site complet de la communauté MoLe ainsi que ses services d’hébergement ne peuvent pas être considérés comme entièrement open source pour autant.

©️Droit d’auteur : Sauf indication contraire, tous les articles de ce site sont protégés par le droit d’auteur.Partage d’outils d’IATous les droits d’auteur sont réservés. Sans autorisation, aucune personne, média, site web ou groupe ne peut reproduire, copier ou diffuser de quelque manière que ce soit le contenu de ce site, ni créer de mirror sur des serveurs qui ne lui appartiennent pas. Dans le cas contraire, notre site se réserve le droit de poursuivre en justice les responsables conformément à la loi.

Outils similaires à la communauté Magic Music des Modelers