Datawhale
Communauté d’apprentissage de l’IA offrant des tutoriels open source, du apprentissage en équipe et des projets pratiques
Étiquettes :Site d’apprentissage de l’IAQu’est-ce que Datawhale ?
Datawhale est une communauté chinoise d’apprentissage open source spécialisée en intelligence artificielle et en science des données, fondée en 2018. Il ne s’agit pas d’un modèle d’IA ou d’un outil de génération en ligne, mais plutôt d’une collection de tutoriels, de codes, de parcours d’apprentissage, d’activités en équipe et de projets pratiques créés conjointement par des apprenants, des développeurs, des enseignants et des contributeurs du secteur, dont l’idée centrale est « pour l’apprenant, grandir avec les apprenants ».
Le contenu communautaire couvre l’apprentissage automatique, l’apprentissage profond, les mathématiques, la programmation, les grands modèles de langage, les agents, RAG, l’apprentissage par renforcement, la vision par ordinateur, les systèmes de recommandation, l’analyse de données, l’intelligence incarnée et l’ingénierie de l’IA. Il convient à organiser des informations dispersées en parcours d’apprentissage progressifs, ainsi qu’à participer à la collaboration open source via des Issues, des Pull Request et la co-création de projets.
Site officiel et centre d’apprentissage de l’IA
Le site officiel de Datawhale résume les parcours d’apprentissage, les cours, les actualités de la communauté ainsi que les accès aux événements ; le centre d’apprentissage de l’IA met en avant davantage la liste des scénarios réels, l’arbre des compétences, les exercices, les compétitions, les certifications et le cycle complet des applications.
Les utilisateurs peuvent choisir le contenu en fonction de la spécialisation technique et du niveau de compétence, plutôt que de se limiter à la lecture d’un seul article.
Les différentes entrées sont encore en cours de mise à jour, et certaines pages peuvent être en phase de test interne ou de migration. Les noms des cours, les dates de début, ainsi que les règles relatives aux certificats et aux points doivent se référer à la page de l’événement en cours ; les anciennes pages de tutoriels ne représentent pas nécessairement l’ensemble des fonctionnalités du centre d’apprentissage actuel.
Programme de formation en intelligence artificielle
Pour les apprenants qui ne savent pas par où commencer, la communauté propose des programmes de formation en intelligence artificielle qui organisent des connaissances telles que les bases mathématiques, Python, l’analyse de données, l’apprentissage automatique, l’apprentissage profond et l’IA générative en un parcours structuré. Les apprenants peuvent choisir, en fonction de leurs objectifs, une orientation en algorithmes, en ingénierie, en développement d’applications ou en recherche.
Le plan de formation sert de guide et n’est pas équivalent à un cours certifié uniformément. Chaque projet est géré par des équipes différentes, ce qui entraîne des différences en termes de difficulté, de version du code, de forme des devoirs et de fréquence des mises à jour ; il convient de consulter le README du répertoire, les instructions d’environnement, les issues ainsi que les dernières contributions avant de commencer.
Apprentissage en équipe
L’apprentissage en équipe est une activité communautaire emblématique de Datawhale. Les organisateurs planifient des cycles, des tâches et un rythme d’échanges autour d’un ensemble de contenus open source ; les apprenants lisent, codent, remplissent des fiches de suivi, discutent et résument par étapes, réduisant ainsi le risque d’abandon en auto-apprentissage grâce à la collaboration entre pairs.
L’apprentissage en groupe n’est pas un accompagnement individuel, et il ne garantit pas l’obtention d’un poste ou d’un certificat à la fin. Le thème de chaque session, les modalités d’inscription, l’affectation des tuteurs et les exigences relatives aux devoirs peuvent varier.
Même en manquant une activité, il est possible d’apprendre de manière autonome en utilisant l’entrepôt public.
Tutoriels et code open source
Les tutoriels open source de Datawhale mettent l’accent sur le fait que le contenu est gratuit, que le code peut être consulté et hébergé sur GitHub. Ces tutoriels comprennent généralement des documents de chapitres, des notebooks, des projets d’exemple, les dépendances de l’environnement, des exercices et des références ; les utilisateurs peuvent les lire en ligne ou les cloner localement pour les modifier et les exécuter.
« Open source » ne signifie pas que tout le contenu utilise la même licence. Certains tutoriels emploient la licence Creative Commons Attribution-NonCommercial-PartageIdentique, tandis que certains codes logiciels utilisent des licences comme MIT ou Apache ; il existe également des dépôts contenant des données et des modèles de tiers.
Avant toute reproduction, publication pédagogique ou utilisation commerciale, il est impératif de consulter la LICENSE du dépôt cible.
Organisation open source GitHub
À la date de cette vérification, l’organisation officielle GitHub affiche plus de 200 dépôts publics, les langages les plus couramment utilisés étant Jupyter Notebook, Python, TypeScript, C++ et JavaScript. La page de l’organisation propose des programmes de formation en intelligence artificielle, des guides pour lancer des projets open source, une liste de sujets à développer et un accès pour contribuer.
Le grand nombre de dépôts ne signifie pas que chaque projet est constamment mis à jour. Lors du choix d’un projet, il convient d’examiner en détail les dernières contributions, le mainteneur, les issues, les versions dépendantes, la licence et la présence de documents en ligne, plutôt que de se fier uniquement au nombre de stars pour évaluer la qualité du contenu.
Tutoriel sur l’agent Hello-Agents
Hello-Agents aborde le thème de « la création d’agents intelligents à partir de zéro », en expliquant les principes fondamentaux des agents, l’appel d’outils, la mémoire, la planification, la collaboration et les pratiques d’ingénierie. Il est destiné aux apprenants qui souhaitent comprendre le fonctionnement interne des agents et ne se contentent pas d’utiliser des plateformes prêtes à l’emploi.
L’écosystème des agents intelligents évolue rapidement ; les API des modèles, les interfaces des frameworks et les stratégies de sécurité peuvent changer après la publication des tutoriels. Lors de l’exécution des exemples, il est nécessaire de contrôler les permissions des outils afin d’éviter de transmettre des clés réelles, des fichiers privés ou des systèmes en production directement à l’agent d’essai.
Principes du grand modèle Happy-LLM
Happy-LLM s’adresse aux lecteurs qui souhaitent comprendre les bases et construire de grands modèles de langage, en abordant progressivement le tokeniseur, le Transformer, les données d’entraînement, l’entraînement préalable, ainsi que le fine-tuning et l’inference. Contrairement à une simple utilisation d’une API de chat, il accorde plus d’importance aux principes, au code et au processus d’entraînement complet.
L’apprentissage de modèles d’enseignement à partir de zéro et les ressources nécessaires pour entraîner des grands modèles commerciaux sont complètement différents. Les tutoriels conviennent pour établir des concepts et effectuer des exercices à petite échelle, mais cela ne signifie pas qu’un ordinateur ordinaire puisse reproduire un volume de paramètres et de données au niveau industriel.
Guide d’utilisation du grand modèle open source Self-LLM
Self-LLM se concentre sur le déploiement, l’utilisation et le fine-tuning des grands modèles open source nationaux et internationaux dans un environnement Linux, et couvre des sujets tels que la configuration de l’environnement, les appels depuis la ligne de commande, des démos en ligne, l’intégration dans des applications, le fine-tuning complet des paramètres ainsi que LoRA. Le projet actuel prend en charge plus de 50 modèles populaires et inclut désormais des chapitres consacrés aux GPU AMD et aux NPU Ascend.
Le nom du modèle et le tutoriel ne signifient pas que les poids peuvent être utilisés sans restriction. Avant de télécharger, il est nécessaire de vérifier la licence du modèle, les exigences en mémoire vidéo, le format de quantification et la compatibilité matérielle, afin qu’ils correspondent strictement à l’environnement des pilotes, PyTorch, CUDA, ROCm ou CANN.
Le livre de citrouille et les bases de l’apprentissage automatique
Le « Pumpkin Book » propose des démonstrations et des explications pour les formules présentées dans « Machine Learning ». Il est adapté pour étudier, en complément des manuels, des sujets de base tels que la probabilité, l’optimisation, les modèles linéaires, les arbres de décision et les réseaux de neurones. Il s’agit de notes de cours et de matériel supplémentaire, et non d’un outil pour résoudre automatiquement les problèmes.
La dérivation des formules nécessite des calculs actifs et une vérification par code. Il est difficile de comprendre les conditions hypothétiques, les symboles et les limites algorithmiques en se contentant de lire les réponses ; il est recommandé de combiner cela avec les exercices supplémentaires, les données expérimentales et le manuel original.
Recueil de recettes LLM et développement d’applications
Le LLM Cookbook rassemble des ressources d’introduction aux grands modèles destinées aux développeurs. La communauté propose également des projets tels que LLM Universe, Tiny Universe, All in RAG, Easy VectorDB, Handy Ollama et Self Dify, couvrant l’ingénierie des prompts, les bases de connaissances, RAG, l’évaluation, les agents, les bases de données vectorielles, les modèles locaux et les plateformes d’application.
Ces entrepôts peuvent dépendre d’API de modèles tiers, de serveurs cloud ou de composants open source. Le fait que les tutoriels soient gratuits ne signifie pas qu’il n’y a aucun coût de fonctionnement ; les appels API, les embeddings, les bases de vecteurs, les GPU, le stockage et les noms de domaine peuvent tous engendrer des frais.
Vibe Coding et développement natif avec l’IA
Des projets tels qu’Easy Vibe sont destinés à l’programmation assistée par l’IA et au développement de produits natifs basés sur l’IA, afin d’aider les apprenants à gérer l’intégralité du processus de création de projets, depuis la définition des besoins, la conception de prototypes, la génération de code et le débogage jusqu’à la publication. Le contenu met l’accent sur la maîtrise de la collaboration avec l’IA à travers des réalisations concrètes, plutôt que simplement sur mémoriser des modèles de prompts.
Le code généré doit faire l’objet d’une revue manuelle, de tests, d’un scan de sécurité des dépendances et d’une vérification des licences. L’IA peut accélérer la création de prototypes, mais elle ne peut pas assumer automatiquement les responsabilités en matière d’architecture, de sécurité, de confidentialité et de maintenance.
Apprentissage renforcé, recommandations et IA traditionnelle
Datawhale n’a pas limité ses contenus aux grands modèles à cause de l’émergence de l’IA générative. La communauté propose toujours des projets tels qu’Easy RL, Torch RecHub, apprentissage profond, apprentissage statistique, extraction de données et pratiques en compétitions, idéaux pour consolider les bases algorithmiques ou se tourner vers des tâches de recommandation, de contrôle et de prédiction.
Le parcours d’apprentissage doit être choisi en fonction des objectifs, il n’est pas nécessaire de maîtriser tous les outils en même temps. Si vous souhaitez vous spécialiser dans le développement d’applications, privilégiez Python, les LLM et RAG.
Si l’on souhaite se consacrer à la recherche en algorithmes, il convient de renforcer les connaissances en mathématiques, en apprentissage automatique, en optimisation et en reproductibilité des articles.
Événements et pratique
La communauté organise des compétitions de données, des camps d’été, des projets pratiques, des ateliers de partage technique et des événements universitaires, afin de relier les données publiques, les problèmes métier et les matériaux pédagogiques. Ces compétitions permettent de développer des compétences en nettoyage de données, en ingénierie des caractéristiques, en modélisation, en évaluation et en travail d’équipe.
Le classement d’une compétition dépend de la segmentation des données, des règles et de critères spécifiques, et ne peut pas être directement équivalent à la valeur de production. Les participants doivent respecter les licences relatives aux données ainsi que les règles de la compétition ; il est interdit de divulguer l’ensemble de test, de copier des solutions ou d’utiliser des données externes non autorisées.
Collaboration à des projets open source
Les apprenants peuvent signaler des erreurs via Issue, soumettre des Pull Request pour améliorer les documents ou le code, et peuvent également demander à lancer de nouveaux projets conformément aux guides open source. La maintenance communautaire comprend le choix du sujet, la création du projet, la collaboration, la révision, la publication et la maintenance continue, et ne se limite pas au simple téléversement de notes personnelles dans un dépôt.
Avant de contribuer, veuillez lire les règles du dépôt, maintenir une portée de soumission claire, indiquer les sources de référence, et éviter de soumettre des manuels protégés par des droits d’auteur commerciaux, des données d’utilisateurs, des clés ainsi que des poids de modèles de grande taille dans un dépôt public.
Prix et frais
Les tutoriels officiels open source de Datawhale soulignent clairement qu’ils sont gratuits, sans aucune forme de frais, et que les répertoires GitHub publics peuvent être lus et utilisés conformément à leurs licences respectives. Pour apprendre au sein de la communauté, il n’est pas nécessaire d’acheter un abonnement unique.
Les tutoriels gratuits ne signifient pas que le processus d’apprentissage n’a aucun coût. Les GPU cloud tiers, les API de modèles, les services de données, les publications imprimées, les certificats, les locaux physiques ou les projets collaboratifs peuvent être facturés séparément ;
Les frais, les remboursements et les avantages sont soumis aux conditions spécifiques du prestataire de services et à la description de l’événement en cours.
Une API est-elle disponible ?
Datawhale n’est pas en soi un service de modèle d’IA unifié, il n’existe donc pas d’API de génération universelle couvrant tous les tutoriels. Ces derniers présentent des interfaces compatibles avec OpenAI, des API de modèles nationaux, Ollama, des bases de données vectorielles ainsi que divers frameworks open source ; les clés nécessaires et les frais sont gérés par les fournisseurs respectifs.
Ne mettez pas en évidence la clé API dans des notes, des captures d’écran ou des devoirs publics. Les projets d’apprentissage doivent utiliser des variables d’environnement, des quotas et des comptes de test indépendants, et renouveler les clés à la fin de l’activité.
Est-ce open source ?
Datawhale est une organisation open source en matière d’IA, qui met à disposition de nombreux tutoriels et codes sur GitHub. Le fait que l’organisation soit ouverte ne signifie pas que tous les backends des sites, les systèmes d’événements et les ressources de partenariat avec des tiers soient également open source, ni que plus de 200 dépôts utilisent une licence unique.
La méthode la plus fiable pour juger est d’examiner le LICENSE, le README et les sources citées pour chaque entrepôt. En l’absence de contenu de licence clair, on ne doit pas supposer par défaut que l’œuvre est commerciale ou peut être redistribuée.
Guide d'utilisation de Datawhale
Terminer une tâche de base
- Inscrivez-vous sur Datawhale et créez une clé API réservée uniquement à l’environnement de test ;
- Sélectionner le modèle en fonction du type d’entrée, du contexte, de la qualité, de la vitesse et du prix ;
- Appeler d’abord le site officiel et le centre d’apprentissage de l’IA pour effectuer la demande minimale et vérifier la structure de réponse ;
- Tester ensuite la sortie en flux, les paramètres et la réponse aux anomalies à l’aide d’un programme d’entraînement par intelligence artificielle ;
- Enregistrer les tokens, le nombre d’appels, le délai, le taux d’erreurs et le coût par appel ;
- Transférez la clé dans le gestionnaire de clés du serveur avant de l’intégrer à l’application officielle ;
Créer des flux de travail professionnels réutilisables
- Utiliser des clés et des quotas différents pour les environnements de développement, de test et de production ;
- Créer un ensemble d’évaluation représentatif en s’appuyant sur le site officiel, le centre d’apprentissage par l’IA, les programmes de formation en intelligence artificielle et l’apprentissage en équipe ;
- Définir les délais d’attente, la concurrence, les tentatives de réessai, le throttling et les plafonds budgétaires ;
- Effectuer des vérifications sur la sortie en ce qui concerne les faits, la sécurité, le format et les informations sensibles ;
- Surveiller les changements de version, de prix, de délai et de taux d’échec des modèles de surveillance ;
- Préparer des plans de dégradation du modèle, de coupure et de prise en main manuelle ;
À qui s’adresse-t-il ?
- Débutants qui souhaitent apprendre l’IA de manière systématique mais ne savent pas comment planifier leur parcours ;
- Développeurs ayant besoin de tutoriels sur les grands modèles chinois, RAG, les agents et le fine-tuning ;
- Étudiants souhaitant maintenir un rythme par le apprentissage en groupe et personnes en transition ;
- Professeurs d’université ayant besoin de cours, d’expériences et de ressources open source ;
- Contribueurs open source souhaitant participer à la création d’Issues, de PR et de tutoriels ;
- Apprenants qui souhaitent combiner la théorie avec la pratique compétitive, les projets et les produits.
Avantages principaux
- Le contenu chinois est riche, couvrant de la base des mathématiques à l’IA générative de pointe ;
- Tutoriels, code, notebooks et parcours d’apprentissage sont publics ;
- L’apprentissage en équipe offre des cycles, des tâches et des retours d’accompagnateurs ;
- Un grand nombre de projets, comprenant les LLM, les Agents, le RAG, le CV, l’RL et les recommandations ;
- Soutenir la correction d’erreurs, la collaboration et les mises à jour continues via GitHub ;
- Reliant les universités, l’industrie et les apprenants, les thèmes pratiques sont variés.
Restrictions et précautions
- Datawhale est une communauté et un écosystème de contenu, ce n’est ni une institution de formation qui garantit des résultats d’apprentissage, ni un environnement de fonctionnement unifié.
- Certains tutoriels deviendront obsolètes en raison de mises à jour des frameworks, des modèles et des dépendances ;
- La qualité, la difficulté et l’état de maintenance des différents projets varient également.
- Le contenu public peut contenir des modèles, des données, des articles de recherche et des services cloud de tiers ; l’utilisateur doit vérifier séparément les licences, la confidentialité et les frais.
- Les exemples pédagogiques concernant les domaines médical, financier, juridique, etc., ne peuvent pas servir directement de base à des décisions professionnelles ;
Questions fréquentes
Datawhale est-il gratuit ?
Les tutoriels officiels et les contenus de GitHub mettent l’accent sur le modèle gratuit et ouvert, sans frais d’abonnement unifiés. L’utilisation des ressources cloud pour exécuter les cours, des API de modèles, des livres imprimés ou certaines activités de partenariat peuvent entraîner des frais supplémentaires.
Datawhale convient-il aux débutants ?
Adéquat. On peut commencer par des programmes de formation en intelligence artificielle, les bases de Python et de l’apprentissage automatique, avant de passer aux grands modèles, aux agents ou à des projets pratiques.
Les difficultés varient considérablement d’un entrepôt à l’autre ; il convient de lire d’abord les exigences préalables.
Qu’est-ce que l’apprentissage en groupe ?
Il s’agit de lire, coder, enregistrer ses activités et échanger en équipe au cours de périodes fixes autour de cours publics. Une fois l’activité terminée, les tutoriels peuvent généralement être étudiés de manière autonome, mais les tuteurs et l’organisation des tâches suivent les annonces de la période en cours.
Datawhale a-t-il des tutoriels sur les grands modèles ?
Oui. Happy-LLM aborde les principes et la construction des grands modèles, Self-LLM traite du déploiement et du fine-tuning des modèles open source, et il y a également RAG, Agents, l’évaluation et des projets de développement d’applications.
Tous les projets de Datawhale peuvent-ils être utilisés à des fins commerciales ?
On ne peut pas généraliser. Les licences varient d’un entrepôt à l’autre, certaines formations sont exemptes de restrictions commerciales, et les modèles, les données et les dépendances ont également leurs propres conditions ; il est nécessaire de vérifier chaque élément avant toute utilisation commerciale.
Comment contribuer ?
Vous pouvez soumettre un Issue ou une Pull Request dans le dépôt cible, ou bien demander à participer à la création du projet et à en lancer un en suivant les guides officiels pour le logiciel open source. Avant de contribuer, veuillez lire les spécifications du projet et vous assurer que la provenance du contenu et les licences sont conformes.
Numéro d’enregistrement de sécurité publique du Guangxi : 45132202000164