numind_ai
@numind_ai, outil intelligent spécialisé dans l’entraînement de modèles d’IA
Étiquettes :Modèle d’entraînement d’IAQu’est-ce que NuMind ?
NuMind est une entreprise d’IA spécialisée dans l’extraction d’informations à partir de documents. Ses produits phares actuels sont la plateforme NuExtract et le modèle multimodal NuExtract3. Elle permet de convertir des PDF, des scans, des images, des tableaux et du texte en JSON structuré ou en Markdown adapté au RAG.
Au début, NuMind offrait principalement la classification de texte, la reconnaissance d’entités et l’entraînement de modèles NLP à faible code. Le site officiel actuel se concentre désormais sur l’extraction de documents et l’OCR ; les présentations dans le catalogue devraient porter essentiellement sur NuExtract3, NuMarkdown, l’API et le déploiement privé en entreprise.
Fonctionnalités clés
- Extraction structurée : retourne les champs et les relations hiérarchiques selon un modèle JSON défini par l’utilisateur.
- Compréhension multimodale : traitement simultané de texte, d’images ainsi que d’entrées combinant texte et images.
- Conversion de documents en Markdown : reconnaissance des titres, paragraphes, listes, tableaux et formules.
- Génération de modèles : création d’une structure d’extraction à partir de descriptions en langage naturel ou de documents de référence.
- Apprentissage par exemple : ajouter une petite quantité d’entrée et de sortie standard pour améliorer des tâches spécifiques.
- Traitement multilingue : extraction et OCR pour des fichiers en différentes langues.
- Interface par lots : traitement des documents en environnement de production via des tâches asynchrones.
- SDK Python : créer des projets, télécharger des exemples, soumettre des fichiers et obtenir des résultats.
- Déploiement privé : prend en charge le cloud privé d’entreprise ou un environnement local.
- Modèles personnalisés : offre un affinage pour les scénarios à forte utilisation ou à haute précision.
Modèle NuExtract3
NuExtract3 est un modèle unifié de raisonnement linguistique visuel à 4 milliards de paramètres, qui combine l’extraction d’informations structurées et la conversion d’images en Markdown. L’entrée peut être du texte, une image unique ou plusieurs images, et il est possible de choisir entre le mode de raisonnement et le mode sans raisonnement.
- Un JSON parseable peut être généré en fonction du modèle et des instructions.
- Lire des données à partir de factures, de formulaires, de contrats, de reçus et de tableaux complexes.
- Convertir l’image du document en Markdown hiérarchisé.
- Identifier les tableaux et utiliser des marques appropriées pour exprimer la structure.
- Conserver le contenu spécial tel que les formules mathématiques et le code.
- Gérer des entrées longues et des sorties structurées de grande taille.
- On peut utiliser des poids publics pour raisonner dans son propre environnement.
Extraction de données structurées
L’utilisateur commence par décrire les champs requis à l’aide de JSON Schema ou de modèles de plateforme, puis fournit une documentation ainsi que des exemples optionnels. Le modèle ne sert qu’à extraire des informations selon la structure cible, ce qui le rend adapté à l’insertion de fichiers non structurés dans une base de données, un système métier ou un processus d’évaluation.
- Facture : fournisseur, date, montant des taxes, montant total et lignes détaillées.
- Contrat : parties, durée, montant, clauses de renouvellement et de résiliation.
- Curriculum vitae : nom, expérience, compétences, formation et certifications.
- Assurance : polices, demandes de indemnisation, pertes, responsabilités et informations annexes.
- Santé : champs de formulaire, codage, médicaments et dossiers médicaux.
- Banque : champs de preuve client, transactions, prêts et conformité.
- Documents techniques : composants, spécifications, paramètres et relations hiérarchiques.
NuMarkdown et OCR
NuMarkdown est utilisé pour transformer des documents complexes en Markdown propre, en se concentrant en particulier sur la mise en page, les tableaux et le prétraitement RAG. La version actuelle de NuExtract3 a intégré la capacité de conversion en Markdown dans un modèle unifié ; l’ancien dépôt NuMarkdown peut encore être utilisé pour comprendre cette approche technique.
- Restaurer la hiérarchie claire pour les titres et les paragraphes.
- Générer des tableaux complexes en format Markdown ou HTML.
- Utiliser LaTeX pour exprimer les formules mathématiques.
- Gestion des scans, des PDF en format image et des layouts anormaux.
- Préserver une structure lisible pour la recherche vectorielle et les bases de connaissances.
- Analyser la mise en page par raisonnement avant de générer le texte final.
Apprentissage avec des modèles et des exemples
NuExtract organise les tâches d’extraction en projets, qui comprennent des modèles, des instructions, des paramètres et des exemples. Les modèles peuvent être générés automatiquement à partir de descriptions en langage naturel, ou être modifiés après conversion via JSON Schema.
- Utilisez une chaîne vide pour représenter le champ de texte à extraire.
- Utiliser un tableau pour décrire les éléments détaillés qui peuvent apparaître plusieurs fois.
- Ajouter des objets imbriqués pour exprimer les relations hiérarchiques.
- Fournir un exemple de sortie correcte pour expliquer la signification des champs.
- Utiliser des échantillons négatifs pour tester si les champs absents restent vides.
- Verrouiller les projets dont la validation est terminée afin de réduire les modifications accidentelles.
API et SDK Python
NuExtract propose une interface d’extraction asynchrone basée sur une API Key ainsi qu’un SDK Python officiel. Les développeurs peuvent créer des projets, générer des modèles, gérer des exemples, soumettre du texte ou des fichiers, consulter l’état des tâches et exporter les résultats.
- Génération de modèles à partir de descriptions en langage naturel.
- Créer, copier, importer et exporter des éléments d’extraction.
- Ajouter ou mettre à jour des exemples pour le projet.
- Soumettez du texte ou des fichiers pour une extraction structurée.
- Extrait le contenu du document en Markdown.
- Vérifier l’état des tâches asynchrones par polling ou en flux continu.
- Annuler les tâches et gérer l’état de partage du projet.
À qui s’adresse-t-il
- Équipe de développement : Écrire automatiquement les PDF et les images dans la base de données métier.
- Équipe des données : Préparer des données structurées pour l’analyse, la recherche et l’entraînement de modèles.
- Institutions financières : gestion des prêts, ouverture de comptes, transactions et vérification de documents.
- Assureur : lire la police d’assurance, les documents de sinistre et de perte.
- Établissements de santé : extraction des formulaires, des dossiers médicaux et des champs de codage.
- Équipe juridique : reconnaissance en masse des clauses contractuelles et des dates clés.
- Développeur RAG : Convertir des PDF complexes en Markdown bien structuré.
- Chercheurs : Évaluation ou ajustement de modèles de langage visuel pour de petits documents.
Scénarios d’application typiques
- Convertir les factures reçues par e-mail en éléments détaillés pour le système financier.
- Générer un tableau de comparaison des clauses à partir de centaines de contrats.
- Lire la pièce d’identité et remplir les champs de vérification du client.
- Transformer les archives scannées en une base de connaissances Markdown consultable.
- Extraire le montant de la demande d’indemnisation et la cause du préjudice à partir des annexes de l’assurance.
- Analyser le CV et le saisir dans le système de recrutement selon une structure uniforme.
- Extraire les spécifications, les modèles et les relations de compatibilité à partir du manuel du produit.
- Traiter les fichiers qui ne peuvent pas être envoyés aux modèles publics dans un environnement privé.
Avantages du produit
- Le modèle est conçu spécifiquement pour l’extraction de documents et l’entraînement OCR, avec des objectifs plus ciblés que ceux des modèles de conversation généraux.
- Le même modèle génère simultanément du JSON et du Markdown, réduisant ainsi le nombre de chaînes OCR.
- Prend en charge les textes, les images et les documents multilingues.
- On peut adapter les champs et le format de l’entreprise à l’aide de quelques exemples.
- L’API est facturée à l’usage, sans seuil de frais mensuels fixe public.
- Propose plusieurs options : poids open source, SDK, SaaS et déploiement privé.
- La taille du modèle public est plus petite, ce qui convient aux entreprises souhaitant contrôler les coûts de raisonnement.
Restrictions d'utilisation
- L’OCR et l’extraction peuvent encore omettre des champs, mal interpréter des lignes ou ne pas comprendre correctement les relations complexes.
- Les données officielles de performance proviennent de benchmarks internes et doivent être vérifiées à l’aide de documents propres.
- Le fait que le JSON généré soit lisible ne signifie pas pour autant que le contenu des champs est correct.
- Une faible résolution, la rotation, les obstacles et le contenu manuscrit peuvent affecter les résultats.
- Les documents très longs et les grands tableaux augmentent les coûts de saisie, de sortie et de raisonnement.
- Il n’y a pas de tarif fixe et public pour le déploiement privé et l’ajustement des entreprises.
- Les modèles open source nécessitent de la mémoire vidéo, un framework d’inférence et des capacités de maintenance.
- Les fonctionnalités anciennes de NuMind ne sont pas entièrement compatibles avec les données actuelles de NuExtract.
Tarification API
NuExtract3 utilise actuellement un modèle de facturation distinct pour les tokens d’entrée et de sortie ; il est possible de commencer gratuitement après s’être inscrit. Des tarifs plus bas sont appliqués pour le traitement en lot, les appels à grande échelle et le fine-tuning, tandis que des devis personnalisés sont proposés pour les déploiements privés d’entreprise en fonction du volume d’utilisation.
| Projet | Prix public | Explication |
|---|---|---|
| Saisir le token | 1 dollar par million de tokens | Contient des modèles, des exemples et des documents d’entrée |
| Token de sortie | 5 dollars par million de tokens | Facturation selon le JSON ou le texte généré |
| Texte en anglais, 1 page | Frais d’entrée d’environ 0,001 dollar américain | Estimation sur la base d’environ 1000 tokens d’entrée |
| Texte en anglais 100 pages | Frais d’entrée d’environ 0,10 dollar | Pas de frais de token de sortie |
| Scan A4 1 page | Frais d’entrée d’environ 0,0015 dollar | Estimation à environ 1500 tokens d’image à 115 dpi |
| Scanne de A4, 100 pages | Frais d’entrée d’environ 0,15 dollar | Pas de frais de token de sortie |
| Déploiement privé d’entreprise | Cotation sur mesure | Cloud privé ou déploiement local, selon la consommation par niveau |
| Ajustement du modèle | Cotation sur mesure | Adapté pour des volumes élevés ou des tâches spécifiques |
Les tokens de texte sont généralement des mots ou des sous-mots ; en anglais, un mot correspond en moyenne à 1,3 token ; les tokens d’image correspondent à une région de 32×32 pixels. Les documents formatés tels que le PDF sont convertis par défaut en images, donc le coût réel doit être déterminé en fonction des statistiques de la tâche.
Comparaison SaaS et déploiement entreprise
| Plan | Mode de déploiement | Scénarios adaptés | Facturation |
|---|---|---|---|
| NuExtract API | NuMind cloud | Appels de test, d’intégration et de production flexible | Par token d’entrée et de sortie |
| Plateforme web | NuMind cloud | Créer des modèles, des exemples et des projets de test | À partir de l’enregistrement, les frais d’appel suivent les règles par page. |
| Cloud privé d’entreprise | Environnement exclusif pour les clients | Données réglementées et intégration de systèmes internes | Quantité par couche personnalisée |
| Déploiement local | Infrastructure client | Scénario où les données ne peuvent pas quitter le réseau privé | Cotation sur mesure |
| Modèles open source | Déploiement autonome | Développement, évaluation et personnalisation avancée | Pas de frais API, coûts de calcul et de maintenance à la charge de l’utilisateur |
Comment créer des projets d’extraction
- Choisir une catégorie de documents dont les champs sont stables et dont les résultats manuels sont vérifiables.
- Préparer des échantillons démasqués en mode normal, à faible résolution et avec un layout anormal.
- Inscrivez-vous sur la plateforme et créez un nouveau projet d’extraction structurée.
- Générer des modèles en langage naturel ou importer un JSON Schema.
- Définir les types de champs, les tableaux répétés et les relations imbriquées.
- Téléversez un petit nombre d’échantillons et corrigez la sortie standard champ par champ.
- Exécuter le taux de précision de vérification des documents non configurés.
- Définir des règles métier et des vérifications manuelles pour les champs clés.
- Créez une clé API avant de vous connecter à l’environnement de test.
Comment s’intégrer au processus de production
- Statistiques sur le nombre de documents par jour, le nombre moyen de pages et le coût estimé en tokens.
- Déterminer la source du fichier, le système de sortie et le mécanisme de tentative de réessai en cas d’échec.
- Utiliser le SDK officiel pour créer des tâches asynchrones et enregistrer de manière sécurisée leur numéro de tâche.
- Vérifier l’état des tâches en boucle, en distinguant en cours de traitement, réussi, échoué et annulé.
- Valider la structure JSON à l’aide de Schema et vérifier les champs obligatoires.
- Allouer la vérification manuelle selon des règles de confiance ou le montant d’affaires.
- Enregistrer la version du modèle, la version du template et chaque modification.
- Effectuer des échantillonnages continus pour comparer les résultats manuels et surveiller les erreurs au niveau des champs.
- Évaluer le traitement par lots, le fine-tuning ou le déploiement privé avant un lancement à grande échelle.
Recommandations pour la validation de la précision
- Calculer le taux de précision par champ, et non pas seulement déterminer si tout le document a été traité avec succès.
- Évaluer séparément les lignes du tableau, les montants, les dates et les champs enumératifs.
- Conserver les échantillons négatifs sans champs existants pour empêcher le modèle de compléter du contenu.
- Scannage de couverture, photos, rotation et pièces jointes multi-pages.
- Comparer les résultats du modèle avec la norme d’or manuelle point par point.
- Exécuter des tests de régression après la mise à jour des templates, des exemples ou des modèles.
- Ne comptez pas uniquement sur le degré de confiance indiqué par le modèle pour les opérations clés.
Confidentialité et sécurité d’entreprise
NuMind propose des solutions SaaS ainsi que des déploiements en environnement privé ; les secteurs bancaire, assurantiel et médical peuvent choisir entre le cloud privé ou un environnement local. Avant de traiter des données réelles, il convient de définir dans le contrat la durée de conservation, les sous-traitants, l’utilisation à des fins d’entraînement, les transferts transfrontaliers et les mécanismes de suppression.
- Pendant la phase de test, on utilise d’abord des documents masqués ou synthétiques.
- La clé API est stockée dans le système de clés du serveur.
- Isoler les droits de développement, de test et de production par projet et par environnement.
- Les journaux ne doivent pas consigner les documents d’identité complets, les dossiers médicaux ou les documents financiers.
- Définir les responsabilités en matière de mise à niveau, de surveillance et de sécurité pour les déploiements privés.
- Établir des processus pour l’exportation des données, leur suppression et la réponse aux incidents.
GitHub et l’état open source
NuMind met à disposition sur GitHub les versions officielles de NuExtract, NuMarkdown et le SDK de la plateforme NuExtract. Le code de NuExtract ainsi que les modèles publiés sont licenciés sous la licence MIT ; les solutions SaaS commerciales, les fonctionnalités NuExtract PRO et les composants hébergés en entreprise ne font pas partie de l’open source global.
| Projet | État ou licence | Utilisation |
|---|---|---|
| NuExtract3 | Open source du MIT | Compréhension de documents avec 4 milliards de paramètres, extraction JSON et conversion Markdown |
| Ancien modèle NuExtract | Open source du MIT | Extraction structurée de textes de différentes tailles |
| NuMarkdown | Entrepôt public et modèles | Conversion de documents déduits en Markdown |
| nuextract-platform-sdk | Open source du MIT | Types de clients et d’interfaces Python |
| NuExtract SaaS | Service à source fermée | Projets gérés, tâches et interfaces de production |
| Déploiement privé d’entreprise | Autorisation commerciale | Cloud privé, déploiement local et ajustements personnalisés |
Informations de base
| champ | Contenu |
|---|---|
| Nom de l’outil | NuMind |
| Produit phare | Plateforme NuExtract et NuExtract3 |
| Type d’outil | IA de documents, extraction structurée, OCR, conversion Markdown |
| Sortie principale | JSON et Markdown |
| Type d’entrée | Textes, images, PDF, scans et documents de bureau |
| Modèle de prix | Paiement par token + personnalisation d’entreprise |
| API et SDK Python | Soutien |
| Déploiement privé | Soutien |
| Est-ce open source | Certains modèles et SDK sont open source, tandis que les plateformes commerciales le sont pas. |
Indice de recommandation
4,7 / 5. NuMind convient aux développeurs et entreprises qui ont besoin de convertir de manière fiable des documents complexes en données JSON ou RAG, offrant des modèles publics, une API payante à faible seuil d’accès ainsi que des options de déploiement privé assez complètes ; cependant, la précision en environnement de production doit encore être validée à l’aide d’échantillons réels de données métier.
Questions fréquentes
Que fait NuMind principalement maintenant ?
Actuellement, on extrait principalement du JSON structuré à partir des documents via NuExtract3, et on convertit les images ou PDF en Markdown.
NuExtract prend-il en charge les scans ?
Prend en charge les PDF graphiques, les scans et les photos, et utilise la compréhension visuelle pour effectuer l’OCR et l’extraction des champs.
Est-il possible de personnaliser les champs de sortie ?
Oui, on peut définir les champs, les tableaux et la hiérarchie à l’aide de modèles JSON, de descriptions en langage naturel et de quelques exemples corrects.
Combien coûte l’API NuExtract ?
Le tarif actuel est de 1 dollar par million de tokens, et de 5 dollars par million de tokens pour les appels à grande échelle ; vous pouvez contacter le service client pour obtenir une remise.
L’interface web est-elle gratuite ?
Vous pouvez vous enregistrer et commencer à créer et tester des projets. Les appels en production sont facturés selon les règles actuelles relatives aux tokens, et le montant offert dépend de votre compte.
Prend-il en charge le déploiement privé ?
Prend en charge le cloud privé et les environnements locaux, des ajustements personnalisés sont également possibles ; pour les prix, veuillez contacter le service des ventes.
Quelle est la relation entre NuMarkdown et NuExtract3 ?
NuMarkdown se concentre sur la conversion de documents en Markdown, tandis que NuExtract3 a intégré l’extraction structurée et la conversion en Markdown dans le même modèle.
Y a-t-il un SDK Python ?
Fournit des projets et des exemples gérables, la possibilité de soumettre du texte ou des fichiers, la recherche de tâches et l’obtention de résultats en JSON ou Markdown.
NuMind est-il un outil open source ?
Partiellement open source : les modèles NuExtract et le SDK officiel sont publics, mais la plateforme hébergée et les services d’entreprise ne constituent pas des produits entièrement open source.
Peut-il remplacer complètement l’audit manuel ?
Ce n’est pas recommandé ; les champs à haut risque tels que le montant, l’identité, les informations médicales et les contrats nécessitent toujours une vérification par des règles ainsi qu’un contrôle manuel aléatoire.
Numéro d’enregistrement de sécurité publique du Guangxi : 45132202000164