Nanonets
Nanonets – eine intelligente Tool-Lösung, die sich auf KI-Agenten konzentriert.
Tags:AI AgentWas ist Nanonets?
Nanonets ist eine Plattform für die intelligente Verarbeitung von Dokumenten und die Automatisierung von Arbeitsabläufen, die von Nano Net Technologies Inc. betrieben wird. Sie verbindet OCR, Datenextraktion, Klassifizierung, Überprüfung, manuelle Freigabe sowie die Rückmeldung an Geschäftssysteme zu einem Workflow, der zur Verarbeitung von Rechnungen, Quittungen, Bestellaufträgen, Bankauszügen, Logistikdokumenten und anderen unstrukturierten Dateien eingesetzt wird.
Das aktuelle Produkt entwickelt sich von einem reinen OCR-Tool zu einer AI-Agenten-Plattform für Finanz- und Betriebsprozesse. Nutzer können sowohl ohne Programmierung Web-basierte Prozesse erstellen als auch über APIs, Python-Skripte sowie Unternehmensanbindungen auf bestehende Systeme zugreifen.
Hauptfunktionen
- Dokumente importieren: Automatische Übernahme von Dateien aus Webseiten, E-Mails, Dropbox, Google Drive, OneDrive, Amazon S3, Zapier oder über APIs.
- OCR und strukturierte Extraktion: Erkennung von Texten, Feldern, Tabellen und Zeilelementen, um Dateien unterschiedlicher Formatierung in überprüfbare und exportierbare strukturierte Daten umzuwandeln.
- Dokumentenklassifizierung: Die Dateien werden nach Rechnungen, Bestellungen, Quittungen, Verträgen oder benutzerdefinierten Kategorien sortiert; Classification AI gehört zu den Funktionen der Stufe Growth und höher.
- Datenprüfung: Überprüfung von Datum, Betrag, Format, Datenbankübereinstimmung und Geschäftsregeln; Ergebnisse mit geringer Zuverlässigkeit oder Abweichungen werden markiert.
- Zwei- und Dreiseitige Abstimmung: Die Rechnungen werden mit den Bestellaufträgen sowie den Lieferbestätigungen abgeglichen, um Unterschiede in Menge, Preis und Lieferant herauszufinden.
- Prüfung auf Doppelzahlungen und Betrug: Potenzielle Doppelzahlungen oder abweichende Dokumente werden anhand von Lieferanten, Rechnungsnummern, Beträgen und historischen Daten erkannt.
- GL-Kodierung und Kostenzentren: Auf der Grundlage der Unternehmensregeln sowie historischer Daten werden die Konten des Hauptbuchs, Steuercodes und Kostenzentren vorgeschlagen; eine Überprüfung ist vor der endgültigen Buchung weiterhin erforderlich.
- Mehrstufige Freigabe: Die Prüfer werden je nach Betragsschwelle, Feldgültigkeit, Lieferant oder Anomalietyp zugewiesen; es wird sowohl eine verpflichtende Prüfung als auch nur eine Prüfung bei Anomalien unterstützt.
- Datenverarbeitungsbereich: Formatierung nach Datum, Suche, Bedingungen, Feldauswahl und benutzerdefinierte Python-Verarbeitung zur Extraktion der Ergebnisse.
- Systemrückschreiben: Die genehmigten Daten werden an Google Sheets, QuickBooks, Xero, SAP, NetSuite, Oracle, Dynamics 365 oder relationale Datenbanken gesendet.
- Prüfungsverlauf: Dokumentation der ursprünglichen Dateien, der Extraktionsergebnisse, der Regeln, der manuellen Eingriffe sowie der Reaktionen externer Systeme – zur einfachen Nachverfolgung von Abweichungen und Buchungen.
- Dokumentenbasiertes Agent: Kann Prozessanleitungen, Lieferantenbedingungen und Freigabematrizen lesen, Regeln in überprüfbare Prozessschritte umwandeln und bei Ausfällen an den Menschen weiterleiten.
Unterstützte Eingaben und Ausgaben
| Kategorie | Unterstützte Inhalte | Hauptergebnisse | Für Aufgaben geeignet |
|---|---|---|---|
| Dokumente und Bilder | PDF, PNG, JPG, TIFF, DOCX, TXT | Felder, Tabellen, Zeilenelemente und Text | Rechnungen, Quittungen, Dokumente und Scans |
| Tabellendatei | CSV, XLS, XLSX | Normierte Felder und Ergebnisse der Datenauswertung | Lieferantenliste, Bestellungen und Abrechnungsdaten |
| Prozesskontext | Businessregeln, Genehmigungsmatrix, Lieferantenbedingungen | Abgleich, Routing, Freigabe und Agentenentscheidungen | Forderungen aus Lieferungen und Leistungen sowie Automatisierung der Betriebsabläufe |
| Ergebnisse exportieren | Strukturierte Daten, Originaldokumente und Genehmigungsstatus | Tabellen, Datenbankeinträge, ERP-Dokumente oder API-Antworten | Systemrückschreiben und Auditing |
Die genauen Dateigrößen, Anzahl der Seiten, Synchronisierungsfrequenz sowie die API-Limits variieren je nach Eingangspunkt, Modell und Kontoeinstellungen. Vor dem Test sollte man die Dokumentation der aktuellen Arbeitsumgebung oder der Schnittstelle einsehen; die Beschränkungen eines einzelnen OCR-Beispiels können nicht auf den gesamten Prozess übertragen werden.
Standardarbeitsablauf
- Wählen Sie eine der Optionen „Rechnung“, „Bestellung“, „Dokumente“ oder „Benutzerdefinierte Dokumente“ aus und bereiten Sie eine Gruppe realer, aber anonymisierter Beispiele vor.
- Konfigurieren Sie den Upload, E-Mail, Cloud-Speicher, S3 oder Import über API und überprüfen Sie zunächst den Berechtigungsrahmen sowie die Auslösebedingungen.
- Definieren Sie die Felder, Tabellen und Zeilenpositionen, die extrahiert werden sollen, und überprüfen Sie anschließend mit Beispielen die Formatunterschiede, handschriftlichen Inhalt sowie schlecht gescannte Dokumente.
- Fügen Sie Formatierungs-, Such-, Bedingungs-, Klassifizierungs- und Überprüfungsblöcke hinzu, um klarzustellen, welche Fehler automatisch korrigiert werden und welche manuell bearbeitet werden müssen.
- Legen Sie Genehmigungsstufen und Regeln fest, um Dokumente mit hohem Betrag, geringer Zuverlässigkeit, Wiederholungen, fehlgeschlagenen Abgleichen oder abgelaufenem Datum an die zuständigen Personen zu zuweisen.
- Konfigurieren Sie die Exportfunktionen für ERP-Systeme, Datenbanken, Tabellen oder APIs – es darf nur durch genehmigte Dateien eine formelle Übertragung ausgelöst werden.
- Führen Sie den End-zu-End-Prozess mit Testdateien aus, um die Anzahl der Ausführungen jedes Blocks, die Kosten, die Feldzuordnungen sowie die Wiederholungsversuche bei Fehlern zu überprüfen.
- Nach dem Go-Live werden die Genauigkeit der Stichprobenprüfungen, die Fehlerrate, die manuellen Anpassungen sowie die Systemreaktionen überwacht, wobei die Regeln kontinuierlich angepasst werden und nicht vollständig auf Automatisierung verlassen wird.
Typische Szenarien
- Forderungen gegen Lieferanten: Rechnungen aus dem E-Mail-Postfach der Lieferanten abrufen, die Zeilenpositionen extrahieren, wiederholte Überprüfungen durchführen, eine Dreiparteienabgleichung vornehmen, Freigaben erteilen und im ERP-System buchen.
- Bestellverwaltung: Lesen von Einkaufs- oder Verkaufsbestellungen, Überprüfung der Artikel, Mengen und Kundeninformationen, anschließende Synchronisierung mit dem Betriebsystem.
- Kosten und Quittungen: Überprüfen Sie, ob die Rechnungsnachweise den Vorschriften entsprechen, und übergeben Sie abweichende Punkte sowie die verletzten Regeln an den Genehmigungsbeauftragten.
- Logistik und Lieferketten: Bearbeitung von Frachtpapieren, Verpackungslisten, Lieferbescheinigungen und Zolldokumenten; nach der Vereinheitlichung der Felder werden sie an das Geschäftssystem gesendet.
- Gesundheitswesen und Versicherungen: Abruf von Formularen, Schadensansprüchen oder Patientendokumenten – doch bei der Verarbeitung regulierter Daten muss eine unter den Vertragsanforderungen liegende Unternehmenskonfiguration verwendet werden.
- LLM und RAG-Datenvorbereitung: Komplexe PDFs, Tabellen, Formeln und Bildinhalte in strukturiertes Markdown oder JSON umwandeln, um späteres Suchen und Stellen von Antworten zu ermöglichen.
Vorteile und Grenzen der Fähigkeiten
Tatsächliche Vorteile
- Es umfasst Import, Extraktion, Verarbeitung, Freigabe und Export – es ist nicht notwendig, die OCR-Ergebnisse manuell in mehrere Systeme zu übertragen.
- Es wird kodenlose Konfiguration sowie API- und Python-Erweiterungen unterstützt, sodass Geschäftsabteilungen und Entwickler im selben Prozess zusammenarbeiten können.
- Manuelle Überprüfung über eine abweichende Route – geeignet, um die finanzielle Kontrolle aufrechtzuerhalten, anstatt eine vollautomatische Verarbeitung durchzusetzen.
- Die aktuelle Abrechnung erfolgt blockbasiert, wodurch das Team die Kosten für Extrahieren, Klassifizieren, Formatieren und Exportieren getrennt kalkulieren kann.
- Das Unternehmensangebot bietet SSO, SCIM, Rollenrechte, Audit-Logs, Datenhaltung sowie Optionen für Private Cloud oder lokale Implementierung.
Fähigkeitsgrenzen
- Niedrige Auflösung bei der Scannung, Handschrift, komplexe Tabellen, nicht standardisierte Formatierungen sowie Mischung von Sprachen können weiterhin zu Fehlern in Feldern oder Zeileninhalten führen.
- KI-Agenten können bei der Erklärung von Prozessdokumenten Ausnahmefälle übersehen; die automatisch erzeugten Regeln müssen von den Verantwortlichen im Unternehmen genehmigt werden.
- Jedes Dokument kann mehrere Blöcke auslösen, und Prozesse mit derselben Anzahl an Seiten und Dokumenten können aufgrund unterschiedlicher Komplexität unterschiedliche Kosten verursachen.
- Growth umfasst generative KI, Klassifizierung, Erkennung von Barcodesignaturen, anpassbaren Python sowie die Integration in Unternehmensdatenbanken; Starter ist keine vollständige Funktionsversion zur Testung.
- Die in den Beispielen für offene Preise verwendeten typischen Rechnungen verwenden 4 bis 6 Blöcke – das dient nur als Schätzung. Es kann nicht garantiert werden, dass jede Organisation geringere Kosten hat.
Preise und Limits
| Paket oder Version | Preis | Abrechnungszeitraum | Kernrechte oder -beträge | Für Nutzer geeignet |
|---|---|---|---|---|
| Starter Testversion | 0 US-Dollar | Einmalige Testmenge | 50 US-Dollar an Credits – kein Bankkonto erforderlich. Zugang zu AI-, API-Diensten, E-Mail- Funktionen sowie Cloud-Speichermöglichkeiten; für bis zu 3 Personen. | Verifizierung des Prozesses für einzelne Dokumente |
| Starter-Bezahlung | 100 US-Dollar | Jeden Monat | 100 Credits; nach tatsächlichem Verbrauch pro Block, Community-Unterstützung | Kleine Teams und stabile Grundprozesse |
| Growth | Kontaktieren Sie den Verkauf | Preis nach Menge | Teilen Sie Credits, Premium-AI-Blöcke, Analysefunktionen, generative KI, Python sowie ERP-Systeme und benutzerdefinierte Integrationen – mit bis zu 40 % Rabatt auf Menge und Preis. | Business-Teams für die Batchverarbeitung |
| Enterprise | Individuelle Kostenschätzung | Vertragsvereinbarungen | SSO, SCIM, RBAC, Konformität, private oder lokale Implementierung, Datenspeicherung, SLA und SIEM | Geregelt oder große Organisationen |
Preis pro Blockverarbeitung
| Blockkomplexität | Preis | Abrechnungszeitraum | Kernrechte oder -beträge | Für Nutzer geeignet |
|---|---|---|---|---|
| Simple | 0,02 US-Dollar pro Mal | Jedes Mal beim Ausführen | Einfache Operationen wie Formatieren, Routing und Exportieren | Grundlegende Datenverarbeitung |
| Standard AI | 0,10 US-Dollar pro Mal | Jedes Mal beim Ausführen | Standards für Klassifizierung und Überprüfung usw. bei KI-Operationen | Regeln und Dokumentenverteilung |
| Complex AI | 0,30 US-Dollar pro Mal | Jedes Mal beim Ausführen | Komplexe Operationen wie Datenextraktion und generative KI | Feld- und Inhaltserkennung |
Credits sind vorab gezahlte Beträge, die zwischen den Workflow-Blöcken verwendet werden können. Das Team kann sie gemeinsam nutzen, und auf der Seite steht, dass sie nicht ablaufen. Bestandskunden können möglicherweise weiterhin zu den alten Preisen pro Seite oder zum alten Paketpreis bezahlen. Die historischen Starter-Preise pro Seite können daher nicht als einzige Abrechnungsmethode für neue Konten herangezogen werden.
Verlängerung und Rückerstattung
- Die Bestellung wird automatisch zum Ende der Vertragsdauer verlängert, es sei denn, eine der Parteien teilt schriftlich und fristgerecht mit, dass sie die Verlängerung nicht wünscht.
- In den Dienstbedingungen steht, dass die Gebühren nicht rückerstattet werden können und der Nutzer kein Recht auf Rückerstattung des Services hat; Steuern können zusätzlich berechnet werden.
- Für den Probemonat ist keine Bankkarte erforderlich, doch vor dem Aufstieg auf die kostenpflichtige Version sollten die Regeln bezüglich Blöcken, Credits, Überschreitungen und Pause noch überprüft werden.
- Die Mindestverpflichtungen bezüglich Wachstum und Unternehmen, die Zahlungszyklen, Serviceabzüge sowie Kündigungsbedingungen richten sich nach der Bestell- und Verkaufsvereinbarung.
API, Integration und Bereitstellung
- Starter beinhaltet bereits Zugriff auf die API; Entwickler können mit einer Account-Schlüssel Dokumente hochladen, Modelle aufrufen und strukturierte Ergebnisse erhalten.
- Die offiziellen Dokumente bieten Authentifizierung, Workflows, Modelle sowie Einstellungen für Import/Export; auf GitHub finden sich außerdem Beispiele und Klassen für Python OCR.
- Import ist über E-Mails, gängige Cloud-Speicher, S3, Zapier und APIs möglich; Export kann an Tabellen, Buchhaltungssysteme, ERP-Systeme, Datenbanken, FTP oder benutzerdefinierte Skripte angebunden werden.
- Die Unternehmensverbindungen decken Systeme wie SAP, Oracle, Salesforce usw. ab; die genauen Versionen, Feldobjekte sowie die Les- und Schreibbereiche müssen bei der Implementierung festgelegt werden.
- Standard-Cloud-Dienste nutzen die Infrastruktur von AWS und GCP; für Enterprise-Kunden kann eine Anfrage für eine Private Cloud, eine lokale Implementierung sowie für die Speicherung von Daten in den USA, der EU und Asien-Pazifik gestellt werden.
- Es gibt keine offiziellen, native iOS- oder Android-Apps für Endnutzer; die hauptsächlichen Einsatzformen sind Webseiten, APIs und Systemintegrationen.
Offene Modelle und der Offenheitsstatus von Produkten
- Nanonets verfügt über eine offizielle GitHub-Organisation mit Domain-Zertifizierung und stellt öffentlich OCR-Beispiele, Docstrange, Docext, NanoIndex, n8n-Node sowie andere Projekte zur Verfügung.
- Die Gewichte von Nanonets-OCR-s sind öffentlich zugänglich und unterliegen der Apache 2.0-Lizenz; sie können gemäß dieser Lizenz eigenständig eingesetzt werden. Bei der Verwendung muss dennoch auf das Basismodell, die Abhängigkeiten sowie die Rechte an den Eingabedaten geachtet werden.
- Die Gewichte und Beispiele für die Verwendung von Nanonets-OCR2-3B sind öffentlich zugänglich, doch auf der Modellseite wird die Lizenz noch nicht eindeutig angegeben. In den Diskussionsforen werden weiterhin Anfragen nach zusätzlichen Informationen gestellt. Daher kann eine uneingeschränkte kommerzielle Nutzung nicht automatisch zugelassen werden.
- Projekte wie Docstrange, Docext, NanoIndex usw. verfügen jeweils über eigene Lizenzen wie MIT oder Apache 2.0, wobei der Geltungsbereich dieser Lizenzen nur auf das jeweilige Repository beschränkt ist.
- Die Nanonets-Produkte wie SaaS, gehostete Workflows, Connector sowie die Verwaltungsoberfläche sind nicht deshalb vollständig open source, weil einige Modelle oder SDKs open source sind.
Privatsphäre, Sicherheit und Konformität
- Der Kunde behält das Eigentum an den hochgeladenen Daten und ermächtigt Nanonets, diese ausschließlich zur Erbringung der Dienstleistungen zu verarbeiten, zu übertragen und zu nutzen.
- Die Bestimmungen erlauben es Nanonets, abgeleitete Daten zur Verbesserung, zum Testen, zur Betriebsführung sowie zur Vermarktung und Werbung von Produkten zu verwenden. Die Unternehmen müssen in der DPA sowie in den Bestellungen die Grenzen der abgeleiteten Daten sowie der Verarbeitung klar festlegen.
- In der Datenschutzerklärung wird ausdrücklich festgehalten, dass die Daten der Google Workspace API nicht zur Entwicklung, Verbesserung oder Schulung von KI- und Machine-Learning-Modellen verwendet werden. Dies bedeutet jedoch nicht, dass alle anderen Eingaben automatisch von der Verbesserung der Modelle ausgeschlossen werden.
- Laut der Standard-Sicherheitsrichtlinie werden Kundendaten in mehrbenutzerfähigen Datenspeichern in den USA gespeichert; auf der Preisseite des Unternehmens werden außerdem Standorte in den USA, der EU und in Asien-Pazifik angegeben. Der tatsächliche Standort hängt von der gewählten Paket- und Vertragskonfiguration ab.
- Für den Datentransport wird eine 256-Bit-Verschlüsselung verwendet, für statische Daten AES-256. Die Plattform bietet Netzwerkisolation, Backups, Auditing sowie Maßnahmen zur Reaktion auf Ereignisse.
- Nanonets gibt an, SOC 2 Type I und Type II sowie ISO 27001 zu besitzen, und bietet in der Enterprise-Version Unterstützung bei der Einhaltung von HIPAA- und SOC 2-Vorgaben; Berichte müssen auf Anfrage erstellt werden.
- Kundendaten werden während einer bezahlten Mitgliedschaft oder eines aktiven Kontos aufbewahrt; ein schriftlicher Antrag auf Löschung ist möglich. Die Bedingungen erlauben eine Aufbewahrung von bis zu 30 Tagen nach Beendigung der Bestellung, wobei das Unternehmen eine eigene Strategie zur Aufbewahrung festlegen kann.
- Unternehmen können eine DPA und eine NDA beantragen und sollten minimale Berechtigungen, Zwei-Faktor-Authentifizierung, Trennung der Rollen, Audit-Logs sowie die Maskierung sensibler Felder einrichten.
Zusammenfassung
Nanonets eignet sich für Teams, die Dokumente empfangen, extrahieren, nach Regeln verarbeiten, manuell freigeben und in einen auditablen Prozess einbinden müssen – und nicht für Einzelpользоватel, die nur gelegentlich ein Bild erkennen möchten. Bei der Erprobung sollten gleichzeitig die Genauigkeit der Felder, die Handhabung von Ausnahmen, die Anzahl der Blöcke, die pro Dokument ausgelöst werden, der Umfang der Verbindungen sowie die Datenverträge bewertet werden; auch Open-Source-OCR-Modelle müssen im Vergleich zu den Funktionen, Preisen und Lizenzen kommerzieller SaaS-Lösungen beurteilt werden.
Guigong-Netzwerk-Sicherheitsnummer: 45132202000164