numind_ai
@numind_ai, intelligente Werkzeug für den Trainings von AI-Modellen
Tags:KI-TrainingsmodelleWas ist NuMind?
NuMind ist ein AI-Unternehmen, das sich auf die Extraktion von Informationen aus Dokumenten spezialisiert hat. Die Kernprodukte sind die NuExtract-Plattform sowie das multimodale Modell NuExtract3. Sie können PDFs, Scans, Bilder, Tabellen und Texte in strukturiertes JSON oder Markdown umwandeln, das für RAG geeignet ist.
Früher bot NuMind hauptsächlich Textklassifizierung, Entity-Recognition sowie den Trainings von NLP-Modellen mit geringem Codeaufwand. Die aktuelle Website konzentriert sich nun auf Dokumentenauswertung und OCR; die Übersicht sollte sich vor allem auf NuExtract3, NuMarkdown, APIs sowie die private Bereitstellung in Unternehmen beziehen.
Kernfunktionen
- Strukturierte Extraktion: Es werden Felder sowie die Hierarchiebeziehungen gemäß einem vom Benutzer definierten JSON-Template zurückgegeben.
- Multimodales Verständnis: Gleichzeitige Verarbeitung von Texten, Bildern sowie Kombinationen aus Text und Bild.
- Dokument in Markdown umwandeln: Erkennung von Überschriften, Absätzen, Listen, Tabellen und Formeln.
- Template-Erstellung: Erstellung einer Extraktionsstruktur auf der Grundlage von natursprachlichen Anweisungen oder Musterdokumenten.
- Beispiel zur Lernung: Hinzufügen einer kleinen Menge an Eingaben und Standardausgaben zur Verbesserung bestimmter Aufgaben.
- Mehrsprachige Verarbeitung: Extraktion und OCR für Dokumente in verschiedenen Sprachen.
- Batch-Schnittstelle: Verarbeitung von Dokumenten in der Produktionsumgebung über asynchrone Aufgaben.
- Python SDK: Projekte erstellen, Beispiele hochladen, Dateien einreichen und Ergebnisse erhalten.
- Private Bereitstellung: Unterstützung für unternehmensinterne Clouds oder lokale Umgebungen.
- Angepasste Modelle: Feinabstimmung für Szenarien mit hohem Verbrauch oder hoher Genauigkeit.
NuExtract3-Modell
NuExtract3 ist ein einheitliches visuelles Sprachverarbeitungsmodell mit 4 Milliarden Parametern, das sowohl die Extraktion strukturierter Informationen als auch die Umwandlung von Bildern in Markdown ermöglicht. Als Eingabe können Texte sowie ein- oder mehrseitige Bilder verwendet werden, und es ist möglich, zwischen rechnergestütztem und manuellem Modus zu wählen.
- Basierend auf dem Template und den Anweisungen wird parsbares JSON ausgegeben.
- Daten aus Rechnungen, Formularen, Verträgen, Quittungen und komplexen Tabellen lesen.
- Dokumentenbilder in strukturiertes Markdown umwandeln.
- Erkennen Sie Tabellen und verwenden Sie die geeigneten Markierungen, um die Struktur darzustellen.
- Bewahren Sie spezielle Inhalte wie mathematische Formeln und Code bei.
- Verarbeitung langer Eingaben und größerer strukturierter Ausgaben.
- Man kann öffentliche Gewichte in der eigenen Umgebung zum Schlussfolgern verwenden.
Strukturierte Datenauswertung
Der Benutzer beschreibt zunächst die benötigten Felder mithilfe von JSON Schema oder Plattformvorlagen und liefert anschließend Dokumentation sowie optionale Beispiele. Das Modell extrahiert Informationen ausschließlich aus der gewünschten Struktur und eignet sich dazu, unstrukturierte Dateien in Datenbanken, Geschäftsunternehmen oder Prüfprozesse einzuspeichern.
- Rechnung: Lieferant, Datum, Steuerbetrag, Gesamtbetrag und Detailzeilen.
- Vertrag: Parteien, Fristen, Beträge, Verlängerungs- und Kündigungsbedingungen.
- Lebenslauf: Name, Berufserfahrung, Fähigkeiten, Ausbildung und Zertifikate.
- Versicherung: Policen, Ansprüche, Schäden, Haftung und Anhanginformationen.
- Medizinische Versorgung: Formularfelder, Kodierung, Medikamente und Behandlungsunterlagen.
- Bank: Kundennachweise, Transaktionen, Kredite und Konformitätsfelder.
- Technische Daten: Komponenten, Spezifikationen, Parameter und Hierarchieverhältnisse.
NuMarkdown und OCR
NuMarkdown wird verwendet, um komplexe Dokumente in sauberes Markdown umzuwandeln, wobei besonderes Augenmerk auf der Formatierung, Tabellen sowie der Vorbereitung von RAG-Daten gelegt wird. Die aktuelle Version NuExtract3 hat die Markdown-Umwandlungsfunktion in ein einheitliches Modell integriert; das alte NuMarkdown-Repo kann weiterhin genutzt werden, um diesen technischen Ansatz zu verstehen.
- Setzen Sie den Titel und die Absätze wieder in eine klare Hierarchie.
- Komplexe Tabellen in Markdown- oder HTML-Struktur ausgeben.
- Verwenden Sie LaTeX zur Darstellung mathematischer Formeln.
- Bearbeitung von Scans, bildbasierten PDFs und ungewöhnlichen Layouts.
- Für die Vektorabfrage und die Aufrechterhaltung einer lesbaren Struktur in der Wissensdatenbank.
- Zuerst wird die Layout-Analyse durch Schlussfolgerungen vorgenommen, anschließend wird der endgültige Text erzeugt.
Lernen mit Vorlagen und Beispielen
NuExtract organisiert die Extraktionsaufgaben in Projekte, die Vorlagen, Anleitungen, Einstellungen und Beispiele enthalten. Die Vorlagen können aus natürsprachlichen Beschreibungen automatisch generiert werden oder aus JSON Schema umgewandelt und anschließend weiter angepasst werden.
- Verwenden Sie einen leeren String, um das zu extrahierende Textfeld anzugeben.
- Verwenden Sie Arrays, um Details, die sich wiederholen können, darzustellen.
- Fügen Sie verschachtelte Objekte hinzu, um Hierarchien darzustellen.
- Geben Sie Beispiele für die korrekte Ausgabe, um die Bedeutung der Felder zu veranschaulichen.
- Mit negativen Beispielen wird getestet, ob das Feld leer bleibt.
- Projekte, deren Validierung abgeschlossen ist, werden gesperrt, um unerwünschte Änderungen zu vermeiden.
API und Python SDK
NuExtract bietet eine asynchrone Extraktions-Schnittstelle basierend auf API-Schlüsseln sowie ein offizielles Python SDK. Entwickler können Projekte erstellen, Vorlagen definieren, Beispiele verwalten, Texte oder Dateien hochladen, den Status von Aufgaben abfragen und die Ergebnisse exportieren.
- Erstellung von Vorlagen aus natürlicher Sprachbeschreibung.
- Erstellen, Kopieren, Importieren und Exportieren von Extraktprojekten.
- Beispiele zum Projekt hinzufügen oder aktualisieren.
- Geben Sie Texte oder Dateien ein, um eine strukturierte Extraktion durchzuführen.
- Den Inhalt des Dokuments in Markdown extrahieren.
- Status von asynchronen Aufgaben über Polling oder Streaming abrufen.
- Aufgaben stornieren und den Share-Zustand von Projekten verwalten.
Für welche Benutzer geeignet
- Entwicklerteam: Automatische Eintragung von PDFs und Bildern in die Geschäftsdatenbank.
- Daten-Team: Strukturierte Daten für die Analyse, Suche und Modelltrainierung bereitstellen.
- Finanzinstitute: Bearbeitung von Krediten, Eröffnung von Konten, Transaktionen und Prüfung von Dokumenten.
- Versicherungsgesellschaft: Lesen Sie die Police sowie die Unterlagen zu Ansprüchen und Schäden.
- Medizinische Einrichtungen: Ausfüllen von Formularen, Krankenakten und Codierfelder.
- Rechtsabteilung: Massenidentifizierung von Vertragsklauseln und wichtigen Terminen.
- RAG-Entwickler: Konvertiert komplexe PDFs in strukturiertes Markdown.
- Forscher: Bewertung oder Feinabstimmung von Modellen für die visuelle Sprache kleiner Dokumente.
Typische Anwendungsfallen
- Die in der E-Mail eingegangenen Rechnungen in Posten des Finanzsystems umwandeln.
- Erstellen Sie einen Vergleichstabellen der Bedingungen aus Hunderten von Verträgen.
- Lesen Sie die Identitätsdokumente ein und füllen Sie die Felder zur Kundenüberprüfung aus.
- Konvertieren Sie die gescannten Dokumente in eine suchbare Markdown-Wissensdatenbank.
- Aus den Versicherungsunterlagen die Anspruchssumme sowie die Ursache des Schadens ermitteln.
- Lebensläufe analysieren und in einer einheitlichen Struktur in das Stellensuchsystem eingeben.
- Aus dem Produkthandbuch die Spezifikationen, Modelle und Kompatibilitätsbeziehungen entnehmen.
- In einer privaten Umgebung können Dateien verarbeitet werden, die nicht an öffentliche Modelle gesendet werden können.
Vorteile des Produkts
- Das Modell ist speziell für Dokumentextraktion und OCR-Training entwickelt, wobei das Ziel klarer als bei allgemeinen Chat-Modellen ist.
- Derselbe Modul gibt gleichzeitig JSON und Markdown aus, wodurch mehrere OCR-Pfade vermieden werden.
- Unterstützung von Texten, Bildern und mehrsprachigen Dokumenten.
- Mit wenigen Beispielen können Unternehmensfelder und -formate angepasst werden.
- Die API wird nach Verbrauch abgerechnet, es gibt keine offiziell festgelegte monatliche Gebühr.
- Es werden verschiedene Optionen angeboten: offene Gewichte, SDKs, SaaS sowie private Implementierungen.
- Das öffentliche Modell ist von geringer Größe und eignet sich dafür, die Kosten für die Inferenz durch Unternehmen zu kontrollieren.
Nutzungsbeschränkungen
- OCR und das Extrahieren können immer noch Felder übersehen, Zeilen falsch interpretieren oder komplexe Beziehungen fehlverstehen.
- Die offiziellen Leistungsdaten stammen aus internen Benchmarks und müssen mit eigenen Dokumenten erneut überprüft werden.
- Dass die ausgegebene JSON-Struktur parsierbar ist, bedeutet nicht unbedingt, dass der Inhalt der Felder korrekt ist.
- Niedrige Auflösung, Rotation, Verdeckung und handschriftliche Inhalte können die Ergebnisse beeinträchtigen.
- Sehr lange Dokumente und große Tabellen erhöhen die Kosten für Eingabe, Ausgabe und Inferenz.
- Für die private Implementierung in Unternehmen sowie für Anpassungen gibt es keine offiziellen, festen Preise.
- Offene Modelle benötigen Grafikspeicher, ein Inferenzframework und Wartungskapazitäten.
- Die Funktionen des alten NuMind sind nicht vollständig mit den Daten des aktuellen NuExtract kompatibel.
API-Preisgestaltung
NuExtract3 verwendet derzeit ein Modell, bei dem für Eingangs- und Ausgabetokens getrennt abgerechnet wird. Nach der Registrierung kann man kostenlos starten. Für Batch-Verarbeitungen, große Anfragen sowie Feinabstimmungen gelten niedrigere Preise. Für eine private Unternehmensverwendung werden individuelle Preise je nach Nutzungsmenge berechnet.
| Projekt | Offener Preis | Erklärung |
|---|---|---|
| Token eingeben | 1 US-Dollar pro Million Token | Enthält Vorlagen, Beispiele und Eingabedokumente |
| Ausgabe-Token | 5 US-Dollar pro Million Token | Abrechnung nach generiertem JSON oder Textausgabe |
| Englischer Text, Seite 1 | Etwa 0,001 US-Dollar als Eingabengebühr | Schätzung nach etwa 1000 Eingabetokens |
| Englischer Text 100 Seiten | Ca. 0,10 US-Dollar Gebühr für die Eingabe | Keine Gebühren für Ausgabe-Token |
| A4-Scan, 1 Seite | Ungefähr 0,0015 US-Dollar als Eingabengebühr | Schätzung bei 115 dpi: ca. 1500 Bild-Token |
| A4-Scan, 100 Seiten | Ungefähr 0,15 US-Dollar als Eingabengebühr | Keine Gebühren für Ausgabe-Token |
| Private Unternehmensimplementierung | Individuelle Kostenschätzung | Private Cloud oder lokale Implementierung, nach schichtweiser Nutzung |
| Modell-Anpassung | Individuelle Kostenschätzung | Eignet sich für hohe Verbrauchsmengen oder spezielle Aufgaben |
Text-Token sind in der Regel Wörter oder Wortteile; im Englischen entspricht ein Wort im Durchschnitt etwa 1,3 Token. Bild-Token entsprechen einer Fläche von ca. 32×32 Pixeln. Formatierte Dokumente wie PDF werden standardmäßig in Bilder umgewandelt, weshalb die tatsächlichen Kosten nach der Auftragsstatistik ermittelt werden sollten.
Vergleich von SaaS und Unternehmensimplementierungen
| Plan | Einrichtungsmethode | Passende Szenarien | Abrechnung |
|---|---|---|---|
| NuExtract API | NuMind in der Cloud | Testen, Integration und flexible Produktionsaufrufe | Nach Eingangs- und Ausgabetoken |
| Web-Plattform | NuMind in der Cloud | Erstellen von Vorlagen, Beispielen und Testprojekten | Ab der Registrierung gelten die Kosten für Aufrufe gemäß den Seitenrichtlinien. |
| Unternehmens-Private Cloud | Kunden-spezifische Umgebung | Geregelte Daten und interne Systemintegration | Anpassbare Schichtmenge |
| Lokale Bereitstellung | Kunden-Infrastruktur | Daten dürfen das Intranet nicht verlassen. | Individuelle Kostenschätzung |
| Open-Source-Modelle | Selbstverwaltung | Entwicklung, Bewertung und hohe Anpassbarkeit | Keine API-Gebühren, Selbstzahlung für Rechenleistung und Wartung |
Wie man Extraktionsprojekte erstellt
- Wählen Sie eine Kategorie von Dokumenten mit stabilen Feldern und überprüfbaren manuellen Ergebnissen.
- Erstellen Sie Desensibilisierungsproben in normaler, niedriger Auflösung und mit abweichender Anordnung.
- Registrieren Sie die Plattform und erstellen Sie ein neues strukturiertes Extraktionsprojekt.
- Erstellen Sie Vorlagen in natürlicher Sprache oder importieren Sie JSON Schema.
- Klare Angaben zu den Feldtypen, wiederholten Arrays und verschachtelten Beziehungen.
- Laden Sie eine kleine Anzahl von Beispielen hoch und korrigieren Sie die Standardausgabe Feld für Feld.
- Ausführen der Genauigkeit der Dokumentenprüfung ohne Konfiguration.
- Für Schlüsselfelder werden Geschäftsregeln sowie manuelle Überprüfungen festgelegt.
- Erstellen Sie erst einen API-Schlüssel, bevor Sie das Testumfeld anschließen.
Wie wird man in den Produktionsprozess eingebunden?
- Erstellen Sie Statistiken zur täglichen Anzahl der Dokumente, zur durchschnittlichen Seitenanzahl und zu den geschätzten Token-Kosten.
- Bestimmen Sie die Quelle der Datei, das Ausgabesystem sowie den Mechanismus zur Wiederholung bei Fehlern.
- Verwenden Sie das offizielle SDK, um asynchrone Aufgaben zu erstellen und die Aufgabenummern sicher zu speichern.
- Status der Polling-Aufgaben abfragen, um zwischen in Bearbeitung, erfolgreich, fehlgeschlagen und abgebrochen zu unterscheiden.
- Überprüfen Sie die JSON-Struktur mit Schema und prüfen Sie die obligatorischen Felder.
- Manuelle Überprüfung gemäß Zuverlässigkeitsregeln oder Geschäftsbedeutung.
- Protokollieren Sie die Version des Modells, die Version des Templates sowie jede Änderung.
- Dauerhafte Stichprobenvergleiche mit den manuellen Ergebnissen sowie Überwachung von Fehlern auf Feldebene.
- Bevor es in großem Umfang in Betrieb genommen wird, sollten Batch-Verarbeitung, Feinabstimmung oder private Bereitstellung bewertet werden.
Empfehlungen zur Überprüfung der Genauigkeit
- Berechnen Sie die Genauigkeit nach Feldern – es geht nicht nur darum, zu ermitteln, ob das gesamte Dokument erfolgreich ist.
- Einzeln bewerten Sie die Tabellenzeilen, Beträge, Daten und Enumerationsspalten.
- Negative Beispiele mit nicht vorhandenen Feldern werden beibehalten, um zu verhindern, dass das Modell Inhalte ergänzt.
- Abdeckung von Scans, Fotos, Drehungen und mehrseitigen Anhängen.
- Vergleichen Sie die Modellausgaben mit dem manuellen Goldstandard Punkt für Punkt.
- Nach dem Aufrüsten von Vorlagen, Beispielen oder Modellen werden Regressionstests durchgeführt.
- Verlassen Sie sich bei kritischen Geschäftsprozessen nicht nur auf die von den Modellen angegebenen Zuverlässigkeitswerte.
Privatsphäre und Unternehmenssicherheit
NuMind bietet SaaS- sowie On-Premises-Lösungen an; in Bereichen wie Bankwesen, Versicherung und Gesundheitswesen kann entweder eine Private Cloud oder ein lokales Umfeld gewählt werden. Vor der Verarbeitung echter Daten sollten im Vertrag die Aufbewahrungsfrist, die Drittanbieter, die Nutzung zur Schulung, die grenzüberschreitende Übertragung sowie die Löschmechanismen festgelegt werden.
- In der Testphase werden zunächst gedämpfte oder synthetische Dokumente verwendet.
- Der API-Schlüssel wird im Schlüsselsystem auf der Serverseite gespeichert.
- Entwicklungs-, Test- und Produktionsrechte werden nach Projekt und Umgebung getrennt.
- In den Protokollen sollen keine vollständigen Ausweisdokumente, Krankenakten oder Finanzdokumente aufgeführt werden.
- Klare Definition der Verantwortlichkeiten für Updates, Überwachung und Sicherheit bei privater Implementierung.
- Prozesse für die Datenexportierung, Löschung und Notfallreaktionen einrichten.
GitHub und der Open-Source-Zustand
NuMind macht auf GitHub offiziell NuExtract, NuMarkdown sowie die SDKs für die NuExtract-Plattform verfügbar. Der Code von NuExtract sowie die öffentlichen Modelle werden unter der MIT-Lizenz bereitgestellt; kommerzielle SaaS-Lösungen, die Funktionen von NuExtract PRO sowie die components für Unternehmenshosting sind hingegen nicht vollständig open source.
| Projekt | Status oder Lizenz | Verwendung |
|---|---|---|
| NuExtract3 | MIT-OpenSource | Verständnis von Dokumenten mit 4 Milliarden Parametern, Extraktion von JSON und Konvertierung in Markdown |
| Altes NuExtract-Modell | MIT-OpenSource | Strukturierte Extraktion von Texten in unterschiedlichen Größenordnungen |
| NuMarkdown | Öffentliche Lager und Modelle | Dokumentenkonvertierung von Reasoning in Markdown |
| nuextract-platform-sdk | MIT-OpenSource | Python-Client und Interface-Typen |
| NuExtract SaaS | Closed-Source-Dienste | Gemanagte Projekte, Aufgaben und Produktionsanschlüsse |
| Private Unternehmensimplementierung | Kommerzielle Lizenzierung | Private Cloud, lokale Implementierung und maßgeschneiderte Anpassungen |
Grundlegende Informationen
| Felder | Inhalt |
|---|---|
| Name des Tools | NuMind |
| Kernprodukte | Die NuExtract-Plattform und NuExtract3 |
| Arten von Werkzeugen | Dokumenten-AI, strukturierte Extraktion, OCR, Markdown-Umwandlung |
| Hauptausgabe | JSON und Markdown |
| Eingabetyp | Texte, Bilder, PDFs, Scans und Bürodokumente |
| Preismuster | Zahlung per Token + Unternehmensanpassung |
| API und Python SDK | Unterstützung |
| Private Bereitstellung | Unterstützung |
| Ob Open Source | Einige Modelle und SDKs sind open source, kommerzielle Plattformen hingegen nicht. |
Empfehlungswert
4,7 / 5. NuMind eignet sich für Entwickler und Unternehmen, die komplexe Dokumente zuverlässig in JSON- oder RAG-Daten umwandeln müssen. Es bietet offene Modelle, eine API mit geringen Anforderungen sowie Optionen für eine private Implementierung – doch die Genauigkeit in der Produktion muss weiterhin anhand echter Geschäftsbeispiele überprüft werden.
Häufige Fragen
Was macht NuMind derzeit hauptsächlich?
Derzeit wird hauptsächlich über NuExtract3 strukturiertes JSON aus Dokumenten extrahiert und Bilder oder PDFs in Markdown umgewandelt.
Unterstützt NuExtract Scans?
Unterstützung: Es können Bilder in PDF-Format, Scans sowie Fotos verarbeitet werden; außerdem wird durch visuelle Analyse OCR sowie das Extrahieren von Feldern ermöglicht.
Kann man die Ausgabefelder anpassen?
Ja, man kann Felder, Arrays und Hierarchien über JSON-Vorlagen, Beschreibungen in natürlicher Sprache sowie einige korrekte Beispiele definieren.
Wie viel kostet die NuExtract-API?
Der aktuelle Preis beträgt 1 US-Dollar pro Million Token, während der Ausgabepreis bei 5 US-Dollar pro Million Token liegt. Bei großflächiger Nutzung können Sie sich an die offiziellen Ansprechpartner wenden, um einen Rabatt zu erhalten.
Ist die Web-Oberfläche kostenlos?
Man kann sich registrieren und mit der Erstellung sowie dem Testen von Projekten beginnen. Die Kosten für die Nutzung werden nach den aktuellen Token-Regeln berechnet; das genaue Gratis-Volumen hängt vom Konto ab.
Wird eine private Bereitstellung unterstützt?
Unterstützung für Private Clouds und lokale Umgebungen, auch Anpassungen sind möglich – die Preise müssen bei den Verkäufern erfragt werden.
Was ist der Zusammenhang zwischen NuMarkdown und NuExtract3?
NuMarkdown konzentriert sich auf die Umwandlung von Dokumenten in Markdown, während NuExtract3 die strukturierte Extraktion und die Markdown-Umwandlung in einem einzigen Modell vereint hat.
Wird ein Python SDK bereitgestellt?
Es werden Projekt- und Beispielmöglichkeiten zur Verwaltung bereitgestellt, es ist möglich, Texte oder Dateien hochzuladen, Aufgaben abzufragen und JSON- oder Markdown-Ergebnisse zu erhalten.
Ist NuMind ein Open-Source-Tool?
Teilweise open source: Das NuExtract-Modell und die offizielle SDK sind öffentlich zugänglich, doch die Hostplattformen und Unternehmensdienste sind keine vollständig open source Produkte.
Kann es die manuelle Überprüfung vollständig ersetzen?
Es wird nicht empfohlen. Felder mit hohem Risiko wie Beträge, Identitätsdaten, medizinische Informationen und Vertragsbedingungen benötigen weiterhin Regelüberprüfungen sowie manuelle Kontrollen.
Guigong-Netzwerk-Sicherheitsnummer: 45132202000164