Le langage des lettrés de Pu
Système de modèles de langage grandeur nature ouverts aux chercheurs et développeurs
Étiquettes :Modèle d’entraînement d’IAQu’est-ce que InternLM, le langage de Pu Shusheng ?
Shuxing·Puyu InternLM est un ensemble de modèles et d’outils open source développé par le Laboratoire d’intelligence artificielle de Shanghai, destiné aux questions-réponses en chinois et en anglais, au raisonnement, au code, à la compréhension de textes longs, à l’intelligence multimodale, à la recherche scientifique et au développement d’agents. Il offre non seulement une expérience de chat en ligne, mais aussi les poids du modèle, des frameworks de formation et de fine-tuning, un moteur de déploiement, un framework d’agents et des outils d’évaluation.
La position de Shusheng Puyu est plus proche d’une « plateforme de modèle ouvert et d’écosystème de développement », et non d’un produit de messagerie commerciale axé sur des abonnements individuels. Les utilisateurs ordinaires peuvent en faire l’expérience via le Chat Web officiel, tandis que les développeurs téléchargent généralement les modèles sur Hugging Face, ModelScope ou OpenXLab pour les déployer eux-mêmes.
Modèle principal
1. InternLM3
InternLM3 est le troisième modèle de langue universel de Shusheng Puyu, et la version InternLM3-8B-Instruct a été officiellement mise à disposition. Il prend en charge deux modes : la conversation ordinaire et la réflexion approfondie, et est destiné aux tâches liées aux connaissances, aux mathématiques, à la logique, au codage ainsi qu’aux instructions complexes.
Une taille de 8B convient à une déployment GPU sur une seule machine. Selon les indications officielles, une quantification à 4 bits nécessite environ 8 Go de mémoire vidéo, mais cela dépend également de la longueur du contexte, du framework d’inférence, du cache KV et du nombre de tâches en parallèle. Pour une déployment avec peu de mémoire vidéo, il convient d’abord de mesurer l’occupation maximale, et non seulement de se fier à la taille des fichiers de poids.
2. InternLM2.5
InternLM2.5 comprend des tailles de 1,8 B, 7 B et 20 B, ainsi que des versions Chat, mathématiques, de récompense et à contexte long. Parmi elles, le 7B Chat 1M prend en charge un contexte de plusieurs millions de tokens, ce qui est adapté aux expériences sur des documents très longs, mais un contexte long augmente considérablement la mémoire vidéo, le temps de précharge et les coûts d’attention.
3. Modèle multimodal scientifique Intern-S
La série Intern-S est destinée à l’IA pour la science. L’Intern-S1 ajoute, sur la base des capacités générales en texte et en vision, des données en chimie, matériaux, sciences de la vie et sciences de la Terre, permettant de comprendre les formules moléculaires, les séquences protéiques, les structures chimiques et les images scientifiques.
Intern-S1-mini propose une version légère.
L’Intern-S1-Pro de 2026 s’étend au raisonnement scientifique MoE à des milliards de paramètres, tandis que l’Intern-S2 Preview explore des modèles scientifiques efficaces avec un nombre plus faible de paramètres. Les modèles scientifiques peuvent aider à la recherche, à l’interprétation et à la génération de candidats, mais ils ne peuvent pas remplacer les expériences, l’évaluation par les pairs, le jugement clinique ou les procédures de sécurité professionnelles.
4. InternLM-XComposer
La série XComposer est conçue pour la compréhension d’images et de texte, la création libre d’images et de textes, ainsi que l’interaction vidéo et audio à long terme. Elle peut traiter des images haute résolution, des documents, des pages web et des entrées multimodales. La licence de cette série n’est pas exactement identique à celle du dépôt universel InternLM ; pour une utilisation commerciale, il convient de consulter les spécifications détaillées de chaque modèle et les exigences de demande.
Expérience en ligne
Le chat web officiel permet aux utilisateurs de dialoguer directement avec les modèles, ce qui est idéal pour tester leurs capacités en réponse à des questions en chinois, en raisonnement et en programmation. La version des modèles, le nombre de connexions simultanées, l’historique des interactions ainsi que la quantité d’utilisation gratuite offerte par le service en ligne peuvent être mis à jour ; le site officiel ne publie pas de tableau de prix fixe pour les abonnements personnels.
Par conséquent, le catalogue d’outils convient d’être qualifié de « essai en ligne gratuit + déploiement open source », sans inventer de frais mensuels ni promettre une gratuité permanente. L’accès à l’API en ligne ainsi que les ressources de calcul pour les événements peuvent également nécessiter une demande ou reposer sur des plateformes telles qu’OpenXLab.
Entraînement et retouche avec XTuner
XTuner est le moteur de formation open source de l’écosystème Shusheng, pouvant être utilisé pour le pré-entraînement de grands modèles, le micro-ajustement sur des instructions, l’entraînement multimodal et l’apprentissage par renforcement. La nouvelle version XTuner V1 est conçue pour les modèles MoE très volumineux, prend en charge les séquences longues, FSDP, DeepSpeed Ulysses ainsi que les GPU et les NPU Ascend, et peut s’intégrer à LMDeploy, vLLM et SGLang.
Les développeurs individuels peuvent utiliser LoRA ou QLoRA pour réduire les ressources nécessaires au fine-tuning, mais la qualité des données de fine-tuning, leur format, les droits d’auteur et la confidentialité sont plus importants que les paramètres de configuration. Avant l’entraînement, il convient de diviser l’ensemble de validation, de noter la version du modèle de base et de ses dépendances, afin d’éviter de ne se concentrer que sur la perte d’entraînement.
Déploiement de l’inférence LMDeploy
LMDeploy est utilisé pour la compression, la quantification, l’inférence et les services API, et prend en charge InternLM, Intern-S ainsi que divers modèles tiers. Il offre un moteur d’inférence à haute performance, une gestion du cache KV, de la quantification et des interfaces compatibles, ce qui le rend adapté au déploiement de modèles en tant que services locaux ou sur serveur.
Le débit dépend de la GPU, de la précision, du contexte, du traitement par lots et de la concurrence. Une mise en œuvre en production doit également assurer l’authentification, la limitation du trafic, la sécurité du contenu, la surveillance, le masquage des journaux et le retrait des modèles ; il est interdit d’exposer directement un service de démonstration à Internet.
Le cadre d’agent intelligent Lagent
Lagent est un framework d’agent LLM léger qui prend en charge les appels d’outils, des interpréteurs de code, la recherche, la mémoire, ainsi que des workflows monopoint et multipoints d’agent. Les développeurs peuvent remplacer les modèles locaux ou les API externes, et combiner des outils et des agents à l’aide d’une structure de message unifiée.
Les interpréteurs de code, les accès aux pages web et les outils externes ont des effets secondaires réels. Il convient d’isoler l’environnement d’exécution, de limiter les permissions réseau et de fichiers, et d’ajouter une validation manuelle pour les opérations de suppression, de paiement, d’envoi de messages et de création de bases de données.
Évaluation OpenCompass
OpenCompass est une plateforme d’évaluation de grands modèles open source développée par le Laboratoire d’intelligence artificielle de Shanghai, qui permet de comparer des modèles sur des ensembles de données liés au savoir, au langage, au raisonnement, à la compréhension, au code et aux données multimodales. Le tableau officiel des performances d’InternLM utilise également OpenCompass pour organiser les évaluations.
Les références publiques sont susceptibles d’être influencées par les modèles de suggestion, les paramètres d’échantillonnage, la pollution des données et les versions. Le choix des modèles devrait prendre en compte ses propres documents réels, langue, latence, coût, sécurité et évaluations manuelles, plutôt que de se baser uniquement sur le classement général.
Autres outils écologiques
- InternStudio:Offre des cours de langue Pusu, ainsi que des tutoriels sur les capacités de calcul et la pratique ;
- HuixiangDou:Assistant de questions-réponses pour les groupes de discussion et les bases de connaissances ;
- MindSearch:Utilisé pour la recherche en réseau à plusieurs étapes et les réponses sous forme de rapport ;
- InternEvo:Système d’entraînement pour le pré-entraînement à grande échelle ;
- OpenXLab:Fournir des services liés à des modèles, des données et des ressources de calcul ouvertes.
Les états de maintenance et les modèles d’adaptation varient selon les projets ; lors de l’installation, il convient d’utiliser la documentation officielle à jour et de fixer les versions des dépendances.
Téléchargement et déploiement local
Le modèle InternLM est généralement fourni au format Hugging Face Transformers, et peut également être obtenu via ModelScope et OpenXLab. Il peut être exécuté à l’aide de Transformers, LMDeploy, vLLM, etc., et, une fois quantifié, s’adapte aux GPU grand public.
Avant de télécharger le modèle, il convient d’évaluer le disque dur, la mémoire vidéo, la mémoire vive, la bande passante et la licence. Activer trust_remote_code exécutera du code Python personnalisé provenant du dépôt ; il faut donc d’abord vérifier l’origine, la version du commit et le contenu des fichiers, puis l’exécuter dans un environnement isolé.
API et prix
Le dépôt officiel d’InternLM propose des interfaces Chat Web et API, mais le site officiel ne dispose pas pour l’instant de tableau de prix unifié par million de tokens, comme c’est le cas pour les plateformes MaaS commerciales. L’expérience publique, les ressources de calcul d’OpenXLab ainsi que les demandes d’API en collaboration peuvent présenter des différences en termes de quotas et de facturation.
Le déploiement du modèle en propre ne comporte pas de frais liés à la plateforme de tokens, mais il faut prendre en charge les coûts liés aux GPU, aux serveurs cloud, à l’électricité, au stockage, à la bande passante, à la maintenance et au nombre de connexions simultanées. Avant d’utiliser cette solution, les entreprises doivent comparer les coûts de développement propre avec ceux du hébergement par un tiers.
Licences open source et commerciales
Le dépôt principal d’InternLM3 indique clairement que le code et les poids des modèles sont soumis à la licence Apache 2.0, qui autorise leur utilisation, modification, distribution et application commerciale, à condition de conserver la licence et la notice de droits d’auteur, ainsi que de se conformer aux lois en vigueur.
XTuner, Lagent et plusieurs autres outils utilisent également Apache 2.0. Le projet Intern-S1 est actuellement indiqué comme étant sous Apache 2.0.
Différents projets multimodaux peuvent avoir des conditions supplémentaires ; par exemple, le code de XComposer est distribué sous Apache 2.0, mais les instructions d'utilisation commerciale des poids du modèle exigent néanmoins de consulter ou de soumettre une demande commerciale.
Les modèles de base tiers, les ensembles de données et les licences associées ne sont pas couverts par la licence du projet InternLM. Les produits commerciaux doivent vérifier individuellement les poids, le code, les données d’entraînement et les composants externes, plutôt que de se fier uniquement à l’étiquette de licence en haut de la page GitHub.
Données et sécurité
Les poids open source permettent de traiter des données sensibles localement, ce qui facilite le contrôle des frontières des données, mais la responsabilité en matière de sécurité est également transférée à l’opérateur. Les organisations doivent corriger les dépendances, contrôler les interfaces des modèles, enregistrer les accès, filtrer les injections de prompts et empêcher les modèles de divulguer des informations système.
Le modèle peut générer des biais, du contenu nocif, des codes d’erreur et des faits fictifs. Les autorités indiquent également clairement que la génération probabiliste ne permet pas d’éviter complètement les résultats inattendus ; les éditeurs doivent donc effectuer une vérification du contenu et une révision manuelle.
Guide d'utilisation d’InternLM pour les étudiants en langue
Terminer une tâche de base
- Inscrivez le linguiste InternLM et créez une clé API réservée uniquement à l’environnement de test ;
- Sélectionner le modèle en fonction du type d’entrée, du contexte, de la qualité, de la vitesse et du prix ;
- Appeler d’abord le modèle principal pour traiter la requête minimale et vérifier la structure de réponse ;
- Tester à nouveau l’affichage en flux, les paramètres et les réponses aux anomalies via un test d’expérience en ligne ;
- Enregistrer les tokens, le nombre d’appels, le délai, le taux d’erreurs et le coût par appel ;
- Transférez la clé dans le gestionnaire de clés du serveur avant de l’intégrer à l’application officielle ;
Créer des flux de travail professionnels réutilisables
- Utiliser des clés et des quotas différents pour les environnements de développement, de test et de production ;
- Créer un ensemble d’évaluation représentatif en fonction des modèles principaux, de l’expérience en ligne, ainsi que de l’entraînement et du retouche avec XTuner ;
- Définir les délais d’attente, la concurrence, les tentatives de réessai, le throttling et les plafonds budgétaires ;
- Effectuer des vérifications sur la sortie en ce qui concerne les faits, la sécurité, le format et les informations sensibles ;
- Surveiller les changements de version, de prix, de délai et de taux d’échec des modèles de surveillance ;
- Préparer des plans de dégradation du modèle, de coupure et de prise en main manuelle ;
À qui s’adresse-t-il ?
- Développeurs ayant besoin de modèles de langage open source en chinois et d’un déploiement local ;
- Étudiants qui apprennent le fine-tuning, l’inference, la quantification et le développement d’agents ;
- Équipes utilisant des modèles scientifiques multimodaux pour étudier la chimie, les matériaux et les sciences de la vie ;
- Organisations ayant besoin de millions de contextes et d’expérimentations avec des documents privés ;
- Équipe d’ingénierie utilisant XTuner, LMDeploy et Lagent pour développer des applications sur l’ensemble du pipeline ;
- Les entreprises qui souhaitent obtenir des poids du modèle générique Apache 2.0 pour des produits commerciaux.
Restrictions et précautions
- Le modèle 8B a un coût plus faible, mais il n’atteint pas nécessairement les performances des grands modèles propriétaires dans les cas de faits complexes, les dépôts de code, les agents à long terme et les domaines spécialisés.
- Les sorties des modèles scientifiques ne sont pas non plus des résultats d’expériences ou des certifications professionnelles ;
- Un contexte de plusieurs millions ne signifie pas que le modèle se souviendra avec précision de tout ; les performances réelles dépendent de la position, de la recherche et du dilution de l’attention.
- Il convient de combiner RAG, le broyage en blocs, les citations et la révision manuelle, plutôt que d’insérer toutes les données d’un coup ;
Questions fréquentes
Le livre « Pu Yu » est-il gratuit ?
Des essais en ligne gratuits sont proposés par les officiels, ainsi que des modèles open source téléchargeables gratuitement. La mise en place nécessite de prendre en charge soi-même les coûts matériels et d’exploitation, et la quantité de services en ligne peut être ajustée.
Quel est le dernier modèle universel ?
Le dépôt principal d’InternLM se concentre actuellement sur InternLM3-8B-Instruct ; dans le domaine scientifique multimodal, on trouve des mises à jour telles que Intern-S1, S1-Pro et S2 Preview.
Peut-on l’utiliser à des fins commerciales ?
Le code et les poids d’InternLM3 sont sous licence Apache 2.0 et peuvent être utilisés à des fins commerciales. Pour d’autres projets tels que XComposer, il est nécessaire de consulter séparément les conditions relatives aux poids du modèle et aux demandes commerciales.
Combien de mémoire vidéo est nécessaire ?
Selon les exemples officiels, InternLM3 8B nécessite environ 8 Go de mémoire vidéo en 4 bits, et il faut également réserver de l’espace pour le contexte, le cache et le framework.
Y a-t-il une API ?
Les autorités disposent d’entrées relatives à des API en ligne ainsi que d’exemples de déploiement autonome, mais il n’existe pas de prix fixe et public pour les tokens. Les développeurs peuvent également déployer leurs propres API compatibles à l’aide de LMDeploy ou de vLLM.
Le langage Pu utilisé par Shusheng est-il open source ?
Il s’agit d’un écosystème de modèles et d’outils open source. Il existe des dépôts officiels pour le modèle principal, l’entraînement, le déploiement, les agents ainsi que l’évaluation, mais il faut vérifier séparément les licences pour chaque projet et chaque composant tiers.
Numéro d’enregistrement de sécurité publique du Guangxi : 45132202000164