Doctly AI
Doctly AI – macht die Verarbeitung von Dokumenten mit KI effizienter und einfacher.
Tags:KI-DokumentenwerkzeugeWas ist Doctly AI?
Doctly AI ist eine Plattform für Unternehmen zur Analyse von Dokumenten, zur Extraktion strukturierter Daten sowie zur Beantwortung von Fragen zu Dokumenten. Über eine Webkonsole sowie APIs werden PDF-, Office-Dateien und Bilder empfangen, wobei anschließend Formate wie Markdown, JSON, CSV oder XML ausgegeben werden.
Der Schwerpunkt des Produkts liegt darauf, komplexe Layouts, Tabellen, Formulare, Diagramme sowie handschriftliche und gescannte Dokumente in für Maschinen verarbeitbare Daten umzuwandeln. Es eignet sich für Prozesse mit hohem Dokumentenvolumen in Bereichen wie Finanzen, Versicherungen, Gesundheitswesen, Rechtswesen, Regierung, Logistik und Bauwesen.
Überblick über die Hauptfunktionen
| Funktionen | Eingabe | Ausgabe | Für Aufgaben geeignet |
|---|---|---|---|
| Dokumentumwandlung | PDF, DOCX und Bilder | Reiniger Markdown | RAG, Suchfunktionen und Inhaltstransfer |
| Strukturierte Extraktion | Rechnungen, Verträge, Formulare und Berichte | JSON, CSV oder XML | Dateneingabe und Systemsynchronisierung |
| Benutzerdefinierter Extractor | Felddefinitionen und Geschäftsunterlagen | Daten der festgelegten Struktur | Massenhaftes Auslesen von Branchenfeldern |
| Sammlung und Fragen/Antworten | Mehrere Index-Dokumente und Fragen | Antworten und Seitenzitate | Datenbanksuche und -analyse |
| Dokumentenchat | Sammlungen, Sessions und Nachrichten | Einmalige oder fließende Antwort | Interaktive Abfragen innerhalb der Anwendung |
| Asynchrone Verarbeitung | Dateien, Parameter und Callbacks | Status, Downloadergebnisse und Webhook | Produktionsreife Batch-Workflows |
Unterstützte Dateien und Inhalte
Zu den von der Website aufgelisteten Dateiformaten gehören PDF, DOCX, PNG, JPG, TIFF und XLSX. Die Plattform betont außerdem die Verarbeitung von gescannten Bildern, Fotos, komplexen Layouts, Tabellen, Formularen, Handschriften, Diagrammen und Illustrationen.
- PDF: Verträge, Finanzberichte, Versicherungspolicen, Krankenakten, Berichte und Bauunterlagen.
- DOCX: Bürodokumente, Anleitungen und vorgefertigte Berichte.
- Bilder: Scans, Handyfotos, Quittungen und handschriftliche Formulare.
- XLSX: Tabellenbasierte Geschäftsdaten; die tatsächlichen Verarbeitungsgrenzen müssen anhand von Beispielen getestet werden.
- Komplexe Seiten: Mehrspaltige Layouts, verschachtelte Tabellen, Seitenüberschriften und -fußzeilen sowie Mischung aus Text und Bildern.
Die Fehlermeldung der API gibt an, dass die maximale Größe eines einzigen hochgeladenen Files 100 MB beträgt. Sehr große Dateien, mit Passwörtern geschützte Dokumente, geringauflösende Scans, gedrehte Seiten sowie komplexe Formeln sollten vor der eigentlichen Nutzung getestet werden.
Dokument in Markdown konvertieren
Die Konvertierungs-Schnittstelle wandelt PDF-, DOCX-Dateien sowie Bilder in sauberes Markdown um, was die Einbindung in Suchfunktionen, Wissensdatenbanken, RAG-Systeme oder Content-Management-Systeme erleichtert. Die Verarbeitung erfolgt asynchron; nach dem Hochladen durchlaufen die Dateien die Zustände Warteschlange, Verarbeitung und abgeschlossen.
- Erstellen Sie ein Konto und generieren Sie einen speziellen API-Schlüssel.
- Legen Sie die Datei ein und wählen Sie die geeigneten Genauigkeits- oder Auflösungsparameter aus.
- Speichern Sie die Dokumentidentifikation, den Polling-Zustand oder rufen Sie bei Abschluss der Konfiguration eine Rückruffunktion auf.
- Laden Sie Markdown oder strukturierte Ergebnisse herunter.
- Überprüfen Sie die Seitenzahlen, Überschriften, Tabellen, Anmerkungen und fehlende Inhalte.
- Die bestätigten Ergebnisse werden in das Geschäftssystem geschrieben, und die nicht mehr benötigten Originaldateien werden gelöscht.
Ein erfolgreicher Umwandlungsvorgang bedeutet nicht, dass die Formatsemantik vollständig beibehalten wird. Vereinigte Zellen, Legenden, Tabellen über mehrere Seiten sowie handschriftliche Zeichen erfordern insbesondere eine manuelle Überprüfung.
Strukturierte Datenextraktion
Der Extractor dient dazu, aus Dokumenten spezifische Felder zu extrahieren und die Beziehungen zwischen diesen Feldern aufrechtzuerhalten. Das Team kann die gewünschte Struktur für Rechnungen, Ansprüche, Verträge, Krankenakten, Logistikdokumente oder Bauunterlagen definieren.
- Klare Angaben zu Feldnamen, Typen, ob sie Pflichtfelder sind und welche leeren Werte zulässig sind.
- Legen Sie Formatregeln für Datum, Betrag, Währung und Nummer fest.
- Seitennummern, Originalausschnitte oder Zuverlässigkeitsinformationen werden zur Überprüfung beibehalten.
- Strukturen für Arrays entwerfen, die für mehrere Tabellen, mehrere Entitäten und wiederholte Elemente geeignet sind.
- Die Seiten mit fehlgeschlagenen Überprüfungen sowie abgelehnten Modellen werden in eine manuelle Warteschlange gelegt.
Die Bestimmungen legen klar fest, dass die Ausgaben fehlerhaft, unvollständig oder irreführend sein können. Bei der Buchführung, bei medizinischen Behandlungen sowie bei rechtlichen Unterlagen müssen manuelle Überprüfungen sowie Überprüfungen nach den Geschäftsregeln durchgeführt werden.
Kollektive Fragen und Antworten sowie Dokumentenchat
Entwickler können Collections erstellen, Dateien hochladen, um sie zu indizieren, und anschließend per einmaliger Abfrage oder im Chat Fragen stellen. Die Antworten enthalten Seitenverweise, die es dem Aufrufer ermöglichen, zur entsprechenden Dokumentstelle zurückzukehren, um diese zu überprüfen.
- Teilen Sie die Sammlung nach Kunden, Fällen, Projekten oder Berechtigungsrahmen auf.
- Für die Indexdatei Version und Aktualisierungsdatum festlegen.
- In der Frage werden Zeitpunkt, Subjekt, Dokument und erforderliche Felder klar angegeben.
- Zeigt die Zitierseite an und ermöglicht es den Benutzern, den Originaltext zu überprüfen.
- Löschen Sie veraltete Daten, um zu vermeiden, dass alte Versionen bei der Beantwortung mitwirken.
Sammlungen von Fragen und Antworten eignen sich zur Suche und zur Unterstützung beim Lesen, sollten aber keine Ersatz für eine formelle Überprüfung sein. Seitenbezogene Verweise können nur belegen, dass das System eine bestimmte Seite verknüpft hat, sie garantieren jedoch nicht, dass die Antwort das Verständnis dieser Seite korrekt widerspiegelt.
API-Anbindung
Die Doctly-API nutzt Bearer-Tokens für die Authentifizierung, und die Antworten werden im JSON-Format bereitgestellt. Die wichtigsten Schnittstellen umfassen Dokumente, Extractoren, Sammlungen, Dateien, einmalige Fragen-Antwort-Sitzungen sowie Chatverläufe und Nachrichtenhistorien.
| Interface-Gruppe | Hauptvorgänge | Typische Anwendungen |
|---|---|---|
| Documents | Hochladen, Auflisten, Details, Herunterladen, Löschen | Dokumentumwandlungs-Pipeline |
| Extractors | Listen, Ausführen, Aktualisieren und Löschen | Verwaltung von Feldextraktionsvorlagen |
| Collections | Erstellen, Aktualisieren, Löschen und Dateimanagement | Dokumentendatenbank |
| Query | Einmalige Anfrage an die Menge | Zustandslose Frage-Antwort-Interaktion |
| Chat | Sitzungen, Nachrichten, Flussantworten und Löschung | Kontinuierliches Dialogfeld |
| Webhook | Benachrichtigung nach Abschluss der Verarbeitung | Asynchrone Geschäftsorchestrierung |
Bei einem fehlgeschlagenen Webhook-Versand sind maximal 3 Versuche möglich, mit einem Zeitabstand von 5 Sekunden zwischen den Versuchen. Der Empfänger sollte weiterhin die Signatur oder die Glaubwürdigkeitsbedingungen überprüfen, idempotent handeln und im Falle eines verlorenen Benachrichtigungsversands aktiv den Status abfragen.
Fehler und Geschwindigkeitsbeschränkungen
- Wenn die Datei größer als 100 MB ist, wird ein Fehler wegen zu hoher Last angezeigt.
- Fehlende oder ungültige Schlüssel führen zu einem Fehler wegen fehlender Berechtigung.
- Bei einem fehlgeschlagenen Validieren werden detaillierte Feldfehler angezeigt.
- Überschreitet man die Geschwindigkeitsbegrenzung des Pakets, wird ein Fehler wegen zu vieler Anfragen zurückgegeben.
- Der Client sollte einen exponentiellen Rückzug verwenden und nicht unendlich sofort wieder versuchen.
- Speichern Sie die Request-ID, um sie dem Support-Team zur Untersuchung zur Verfügung zu stellen.
Python SDK
Doctly bietet einen über pip installierbaren Python-Client, der hauptsächlich das Hochladen von PDFs, asynchrone Abfragen sowie die Auswertung von Markdown-Ergebnissen abdeckt. Die SDK unterstützt die Genauigkeitsoptionen LITE und ULTRA und bietet außerdem den Exceptionstyp DoctlyError.
Das SDK ist unter der MIT-Lizenz verfügbar und lässt Beiträge zu, doch sein Funktionsumfang kann hinter einem vollständigen API zurückbleiben. Die neuen Extractor-, Collection- und Chat-Schnittstellen richten sich nach den aktuellen Entwicklungsdokumentationen.
Seitenmessung und Verbrauchsberechnung
| Eingabetyp | Messmethode | Hinweise |
|---|---|---|
| Jede tatsächliche Seite zählt als 1 Seite. | Leere Felder oder Umschläge können ebenfalls in die Verarbeitung einbezogen werden. | |
| Bilder | Jedes Bildfile zählt als 1 Seite. | Mehrere Bilder werden separat berechnet. |
| DOCX | Jede 3000 Zeichen ergeben eine Seite | Verschiedene Sprachen und versteckter Text beeinflussen die Anzahl der Zeichen. |
| Professionell – Über dem Durchschnitt | 0,02 US-Dollar pro Seite | Ab 25.000 Seiten wird weiterhin berechnet |
Wenn die Nutzung 80 % der Obergrenze erreicht, wird die Plattform benachrichtigen, und es ist möglich, eine automatische Erhöhung der Menge einzustellen. Im Produktivumfeld sollten zusätzlich interne Budgets, Obergrenzen pro Aufgabe sowie Alarme bei einer bestimmten Anzahl von Fehlern festgelegt werden.
Preise und Pakete
| Paket oder Version | Preis | Abrechnungszeitraum | Kernrechte oder -beträge | Für Nutzer geeignet |
|---|---|---|---|---|
| Flexible | 0,02 US-Dollar/Seite | Pay-as-you-go, ohne monatliche Verpflichtungen | Alle Formate, Markdown/JSON/CSV, API, 1 Stelle, 99% SLA | Versuchs- und Schwankungsmengen |
| Professional | 499 US-Dollar/Monat | Monatsweise, jährlich mit Rabatt | 25.000 Seiten pro Monat, 0,02 US-Dollar pro Seite für die Überschreitung, 5 Plätze, benutzerdefinierter Extraktor, Webhook, ZDR-Optionen | Dauerhafte Batchverarbeitungsteam |
| Enterprise | Individuelle Kostenschätzung | Nach Menge und Vertragsvereinbarung | Anpassbare Seitenanzahl, dedizierte Infrastruktur, SSO, Self-Hosting, 99,9%+ SLA | Große und regulierte Organisationen |
Alle Pakete bieten eine kostenlose Testphase ohne Kreditkarte an; bei Enterprise ist eine Konzeptprüfung mit echten Dokumenten möglich. Auf der Seite zur jährlichen Zahlung wird ein Rabatt von 10 % angegeben, doch es ist notwendig, den Verkaufspersonal zu kontaktieren, um den genauen Vertragsbetrag zu klären.
Der Preis pro Seite bei Flexible scheint niedrig zu sein, beinhaltet jedoch nicht die monatliche Vorauszahlung. Zu den tatsächlichen Kosten gehören außerdem Versuche zur Wiederholung fehlgeschlagener Vorgänge, mehrfaches Verarbeiten, besonders große Dokumente, manuelle Überprüfungen sowie die Integration in das Speichersystem.
Upgrade, Downgrade und Rückerstattung
Das Paket kann jederzeit aufgewertet oder herabgestuft werden. Bei einer Aufwertung werden sofort neue Funktionen verfügbar, bei einer Herabstufung tritt dies ab dem nächsten Abrechnungszyklus in Kraft. Die Abonnementgebühren werden im Voraus gezahlt und automatisch periodisch abgebucht. Gemäß den Bedingungen erfolgt grundsätzlich keine Rückerstattung – außer bei gesetzlichen Vorgaben.
Die Plattform kann mindestens 30 Tage im Voraus über eine Preiserhöhung informieren. Im Falle einer Stornierung wird der Zugriff über die API umgehend eingestellt, und die verbleibenden Daten im Kontoinhalt werden nach Ablauf eines Zeitraums von maximal 30 Tagen endgültig gelöscht.
Datenarchivierung und keine Archivierung
| Paket | Standard- oder optionale Strategien | Erklärung |
|---|---|---|
| Flexible | Maximal 30 Tage | Wird für die Historisierung und Fehlerbehebung verwendet, kann manuell gelöscht werden |
| Professional | Optional ZDR | Im Preisverzeichnis ist ein 24-Stunden-Löschzeitraum angegeben. |
| Enterprise | Optional ZDR oder vollständig maßgeschneidert | Kann mit Private Cloud oder lokaler Installation kombiniert werden |
„Dokumente werden niemals gespeichert“ auf der Startseite ist eine Zusammenfassung der Strategie der keinerlei Datenspeicherung. Auf den Seiten zu Privatsphäre und Paketen wird klar darauf hingewiesen, dass sich die Speicherrichtlinien je nach Plan unterscheiden. Bei sensiblen Daten gelten die schriftlichen Bestimmungen in der Kontoeinrichtung, im DPA, im BAA oder in Unternehmensverträgen.
Sicherheit, Privatsphäre und Konformität
Die Plattform gibt an, dass zur Verschlüsselung der Übertragung TLS 1.2 oder eine neuere Version verwendet wird, während statische Daten mit AES-256 geschützt werden. Zudem unterliegt die Plattform einer SOC 2 Type II-Audits. Alle Pakete garantieren, dass die eingegebenen und ausgegebenen Daten nicht zur Schulung oder Anpassung der Doctly-Modelle sowie von Drittanbieter-Modellen verwendet werden.
- Zu den AI-Anbietern gehören OpenAI, Google, Anthropic sowie andere Anbieter von Protokollen ohne Trainingsphase.
- Die Zahlungen werden von Stripe abgewickelt; die Plattform behält nur begrenzte Informationen wie die letzten vier Ziffern der Kartennummer, das Ablaufdatum und die Rechnungsadresse bei.
- Professional und Enterprise können eine DPA sowie eine HIPAA BAA beantragen.
- Das Hochladen geschützter Gesundheitsinformationen ist vor der Unterzeichnung einer gültigen BAA untersagt.
- Personendaten können grenzüberschreitend verarbeitet werden; in bestimmten Regionen ist vorherige Kontaktaufnahme zur Bestätigung erforderlich.
- Der Nutzer kann um Zugang, Korrektur, Löschung, Einschränkung, Übertragung oder Widerruf der Zustimmung bitten.
- Alle Benutzer können Dokumente über die API oder die Konsole löschen.
HIPAA-Ready, BAA verfügbar und BAA unterzeichnet sind unterschiedliche Zustände. Medizinische Einrichtungen müssen zunächst ein zertifiziertes Paket, Verträge, Berechtigungen, Audits sowie Aufbewahrungsregelungen vorbereiten, bevor sie geschützte Daten hochladen können.
Rechte am Datenbesitz, Urheberrecht und Beschränkungen
Der Benutzer behält das Recht, Dokumente einzugeben; das Recht, die extrahierten und strukturierten Inhalte zu nutzen, wird dem Benutzer übertragen. Doctly behält sich das Urheberrecht an der Plattform, den APIs, dem Code sowie den zugrunde liegenden Technologien vor.
- Es darf keine Datensätze erstellt werden, die zur Trainierung von neuronalen Netzen und Machine-Learning-Modellen verwendet werden können.
- Es darf keine Wettbewerbsprodukte oder Plattformen für Reverse Engineering erstellt werden.
- Die Geschwindigkeit und der Datenvolumen des Pakets dürfen nicht überschritten werden.
- Der Benutzer ist dafür verantwortlich zu überprüfen, dass das hochgeladene Dokument die notwendigen Rechte aufweist.
- Die Ausgabe muss manuell überprüft werden und darf nicht als medizinischer, rechtlicher oder finanzieller Rat angesehen werden.
Plattform, Deployment und Open-Source-Zustand
| Projekt | Aktueller Zustand | Erklärung |
|---|---|---|
| Webkonsole | Bereitgestellt | Verwaltung von Konten, Dateien und Konfigurationen |
| REST API | Bereitgestellt | Dokumente, Extraktion, Sammlung und Chat |
| Webhook | Bereitgestellt | Professionell sowie die entsprechenden Unternehmenslösungen |
| Python SDK | Open Source | MIT-Lizenz, mit Schwerpunkt auf PDF-zu-Markdown-Umwandlung |
| Doctly SaaS-Plattform | Closed Source | Dass das SDK open source ist, bedeutet nicht, dass auch die Quellcodes der Plattform freigegeben werden. |
| Private Cloud oder lokale Implementierung | Enterprise optional | Kommerzielle Implementierungsweise ist nicht gleich Open Source |
| Eigene Mobile- oder Desktop-Anwendungen | Noch nicht bestätigt | Derzeit dominieren API und Webseiten. |
Typische Anwendungsfallen
- Finanzen: Extrahieren von Beträgen und Posten aus Rechnungen, Abrechnungen und Finanzberichten.
- Versicherung: Bearbeitung von Policen, Anspruchsunterlagen und Anhängen.
- Medizinisch: Strukturierte Krankenakten und Formulare unter einer wirksamen BAA und konformen Konfiguration.
- Recht: Extrahieren von Vertragsklauseln, Parteien, Daten und Verpflichtungen.
- Logistik: Lesen von Frachtpapieren, Verpackungslisten, Quittungen und Transportdokumenten.
- Bauleitung: Organisation von Plänen, Beschreibungen, Prüfberichten und Projekttabellen.
- Wissenssysteme: Dokumente in Markdown umwandeln und eine Sammlung von Fragen und Antworten mit Seitenbelegen erstellen.
Vorteile und Grenzen der Fähigkeiten
Hauptvorteile
- Gleichzeitig werden Konvertierung, strukturierte Extraktion und Sammelfragen beantwortet.
- Unterstützung für komplexe Layouts, Tabellen, Scans und handschriftliche Inhalte.
- Die API ist vollständig abgedeckt und unterstützt asynchrone Zustände sowie Webhooks.
- Alle Pakete beinhalten eine schriftliche Zusage, dass sie nicht für das Modelltraining verwendet werden.
- Es werden SOC 2, BAA, ZDR, SSO sowie Optionen für eine private Implementierung angeboten.
- Das Python SDK wird unter der liberalen MIT-Lizenz bereitgestellt.
Hauptbeschränkungen
- Die Ausgaben von KI können weiterhin fehlerhaft, unvollständig oder halluzinatorisch sein.
- Professionelle Versionen haben einen höheren Einstiegspreis; Nutzer mit geringem Verbrauch sollten die Kosten pro Nutzung sorgfältig vergleichen.
- Die Angaben zur „keinen Datenspeicherung“ auf der Startseite und auf der Datenschutzseite müssen im Zusammenhang mit dem Paket verstanden werden.
- Medizinische Daten müssen zunächst mit einem BAA abgesichert werden; man kann sich nicht nur auf die HIPAA-Informationen verlassen.
- Das Open-Source-SDK deckt nur einige Anwendungsszenarien ab, die gesamte Plattform ist proprietär.
- Die Genauigkeit und Kosten komplexer Dokumente müssen anhand echter Beispiele überprüft werden.
Häufige Fragen
Welche Dateien kann Doctly AI verarbeiten?
Die öffentliche Seite listet PDF, DOCX, PNG, JPG, TIFF und XLSX auf und betont Scans, Fotos, Tabellen, Formulare, Diagramme sowie handschriftliche Inhalte.
In welchen Formaten kann ausgegeben werden?
Häufige Ausgabeformate sind Markdown, JSON, CSV und XML. Die strukturierten Felder werden vom Extractor definiert.
Gibt es eine monatliche Gebühr für Flexible?
Es gibt keine monatlichen Verpflichtungen; die Gebühr beträgt 0,02 US-Dollar pro Seite. Man muss weiterhin auf wiederholte Verarbeitungen, Versuche zur Wiederholung fehlgeschlagener Vorgänge sowie zusätzliche Prozesskosten achten.
Wie viele Seiten enthält das Professional-Paket?
Jeder Monat umfasst 25.000 Seiten; für jede zusätzliche Seite wird ein Betrag von 0,02 US-Dollar berechnet. Die Definition einer Seite unterscheidet sich je nach Format – PDF, Bild oder DOCX.
Wird das Dokument zur Trainierung des Modells verwendet?
Die Plattform garantiert allen Kunden und Paketen, dass sie ihre eigenen sowie die Basismodelle Dritter weder durch Eingabe- noch Ausgabedaten trainieren, feinjustieren oder verbessern wird.
Wird bei Doctly keine Daten gespeichert?
Man kann nicht allgemein sprechen. Bei der Version Flexible kann die Datenlagerung maximal 30 Tage andauern. Die Versionen Professional und Enterprise bieten die Option ZDR – die tatsächliche Strategie hängt jedoch von der Konfiguration sowie vom Vertrag ab.
Kann man medizinische Daten verarbeiten?
Geschützte Gesundheitsinformationen können nur von Nutzern der Kategorien Professional oder Enterprise hochgeladen werden, sofern ein gültiger BAA unterzeichnet wurde.
Gibt es eine öffentliche API?
Ja, es umfasst Dokumente, Extractoren, Sammlungen, Abfragen und Chat. Alle Anfragen verwenden einen API-Schlüssel und sind durch die Limits des Pakets begrenzt.
Ist das Python SDK Open Source?
Ja, die offizielle Python SDK wird unter der MIT-Lizenz bereitgestellt. Die Doctly-Cloudplattform selbst bleibt jedoch ein kommerzieller, nicht-offener Service.
Kann es in meine eigene Umgebung eingesetzt werden?
Enterprise bietet eigene Infrastruktur, Private Cloud oder Optionen für eine lokale Implementierung an. Für die genauen Architekturen, die Wartungspflichten sowie die Preise ist es notwendig, sich an den Verkauf zu wenden.
Muss die Ausgabe manuell überprüft werden?
Notwendig. Die Bestimmungen legen klar fest, dass die Ausgaben großer Modelle fehlerhaft, unvollständig oder halluzinatorisch sein können; bei wichtigen Geschäftsprozessen muss daher eine manuelle Überprüfung erfolgen.
Zusammenfassung
Doctly AI eignet sich für Teams, die komplexe Dokumente zuverlässig in automatisierte Prozesse integrieren müssen und gleichzeitig eine strukturierte Extraktion, APIs, Konformität sowie Optionen zur Bereitstellung benötigen. Vor der Einführung sollte die Genauigkeit sowie die Kosten pro Seite anhand echter Beispiele überprüft werden. Zudem sollten manuelle Überprüfungen, die Aufbewahrung von Daten sowie die Verwaltung von Schlüsseln in die Konzeption einbezogen werden.
Guigong-Netzwerk-Sicherheitsnummer: 45132202000164