Data Donkee
Data Donkee – ein intelligentes Tool, das sich auf die Programmierung mit KI konzentriert.
Tags:AI-ProgrammierwerkzeugeEine kurze Beschreibung
Data Donkee ist ein AI-Web-Agent für die datenbasierte Extraktion von Inhalten auf Webseiten ohne Programmierung. Die Benutzer definieren ihre Anforderungen in natürlicher Sprache sowie mit JSON Schema, wobei das System anschließend einen Scraping-Algorithmus erstellt und strukturierte Daten liefert.
Einführung in die Tools
Data Donkee möchte die Probleme wie die langsame Entwicklung traditioneller Scraper, die hohen Wartungskosten nach Änderungen auf Webseiten sowie die Schwierigkeiten bei der Verarbeitung komplexer dynamischer Seiten lösen. Dabei wird betont, dass die Definition der Datenspalten von der eigentlichen Datenerfassung getrennt werden sollte, damit die Fachleute zunächst beschreiben können, was benötigt wird.
Stand dem 22. August 2026 ist die offizielle Website weiterhin hauptsächlich über eine Registrierung auf der Warteliste zugänglich; es gibt keine Möglichkeit zur selbstständigen Registrierung, keine Produktkonsole, keine Standardpakete und auch keine offiziellen API-Dokumentationen. Daher sollte das Produkt als Produkt in der Early-Access-Phase eingestuft werden – und nicht als ausgereiftes SaaS-Produkt, das bereits vollständig im kommerziellen Einsatz ist.
Überblick über die Kernkompetenzen
| Fähigkeiten | Benutzereingabe | Systemverarbeitung | Ausgabe |
|---|---|---|---|
| Anforderungen an natürliche Sprache | Ziel-Website und Datenbeschreibung | Verständnis der Erfassungsaufgabe | Extraktionsplan |
| Schema-Beschränkungen | Felder, Typen und Pflichtregeln | Die Ergebnisse nach Struktur organisieren | Konsistente Datensätze |
| AI Web Agent | Seiten und Aufgabenziele | Inhalt navigieren und positionieren | Zielfelder |
| Codegenerierung | Natürliche Sprache und Schema | Erstellung wiederverwendbarer Scraping-Programme | Reduzierung der Kosten für wiederholte Überlegungen |
| Dynamische Siteverarbeitung | Komplexe Seitenstruktur | Autonome Navigation und Extraktion | Strukturierte Aufzeichnungen |
| Download-Ergebnis | Aufgabe erledigt | Reinigen und Ordnen | Analyzierbare Datendateien |
Hauptfunktionen
Natürlsprachliche Beschreibung der Datenanforderungen
Der Benutzer kann direkt die Ziel-Website, die Filterbedingungen, den Seitenbereich sowie die gewünschten Felder angeben, ohne zunächst Selektoren oder Scraping-Code schreiben zu müssen. Die Anforderungen müssen weiterhin konkret sein, da sonst das System falsche Seiten abrufen oder die Bedeutung der Felder falsch interpretieren könnte.
JSON Schema definiert die Struktur
Das Beispiel auf der offiziellen Website verwendet JSON Schema, um die Gesamtanzahl der Ergebnisse, die Länder, die Domainnamen sowie die Arraye der Produkte zu beschreiben. Zudem werden für Titel, Preis, Währung und Produktidentifikatoren Typen sowie Pflichtfelder festgelegt. Das Schema hilft dabei, ein einheitliches Format zu gewährleisten, kann jedoch nicht automatisch garantieren, dass die Quelldaten korrekt sind.
Automatische Erstellung von Crawlern
Laut der Plattform erstellt die KI auf Anfrage maßgeschneiderte Scraping-Programme und senkt durch wiederverwendbaren Code die Kosten für die weitere Verarbeitung. Auf der offiziellen Seite wird nicht erklärt, ob der generierte Code an den Benutzer übergeben wird, in welchem Betriebssystem er verwendet werden kann oder ob eine eigene Bereitstellung möglich ist.
Komplexe Seitennavigation
Der Web Agent wird als in der Lage beschrieben, komplexe Website-Strukturen eigenständig zu verarbeiten. Ob Login-Prozesse, Captcha-Fragen, unbegrenztes Scrollen, regionale Beschränkungen sowie Seiten mit starken Anti-Automatisierungs-Maßnahmen stabil abgewickelt werden können, muss durch praktische Tests auf der jeweiligen Zielseite überprüft werden.
Strukturierte Datenausgabe
Nach Abschluss der Aufgabe können die bereinigten, strukturierten Ergebnisse heruntergeladen werden, um sie für Analysen, Marktstudien oder die Eingabe in Systeme zu verwenden. Auf der offiziellen Website werden keine unterstützten Dateiformate, die maximale Anzahl der Einträge pro Export sowie die Aufbewahrungszeit des Exportdatens angegeben.
Skalierter Extraktionsprozess
Die Produktarchitektur umfasst Skalierbarkeit über mehrere Standorte sowie mit großen Datenmengen und zielt darauf ab, durch die Erstellung wiederverwendbaren Codes die Kosten für wiederholte KI-Verarbeitungen zu senken. Durchsatz, Konkurrenzfähigkeit, Proxy-Netzwerke, Wiederholungsversuche bei Fehlern sowie Servicelevel sind noch nicht offengelegt.
Verkauf von fertigen Datensätzen
Die offizielle Website verweist außerdem auf einen unabhängigen Online-Shop für digitale Produkte, in dem derzeit Datensatz der Teilnehmer der London Tech Week 2025 zum Verkauf steht. Es handelt sich dabei um ein einmaliges Datenprodukt – es ist nicht dasselbe wie die noch in Vorbereitung befindliche Web-Agent-Abonnementlösung.
Standardverwendungsprozess
- Überprüfen, ob für die Zieldaten legale Gründe für deren Erhebung, Speicherung und Nutzung vorliegen.
- Definieren Sie den Seitenumfang, die Aktualisierungsfrequenz, die Filterkriterien und den endgültigen Geschäftszweck.
- Beschreiben Sie die Aufgabe in natürlicher Sprache und geben Sie für jedes Feld eine klare Erklärung.
- Erstellen Sie ein JSON Schema und definieren Sie Typen, Pflichtfelder, Arrays sowie zulässige leere Werte.
- Zuerst werden Tests an einer kleinen Anzahl von Seiten durchgeführt, wobei die Ergebnisse manuell mit der ursprünglichen Webseite abgeglichen werden.
- Hinzufügen von Doppelungen-Entfernung, Ausreißwerten, Zeitstempeln und Einträgen für Verweisseiten.
- Erweiterung auf vollständige Aufgaben sowie Überwachung von Fehlern, Standortänderungen und Datenqualität.
- Legen Sie Fristen für die Aufbewahrung und Löschung nach Verwendungszweck fest, um die gesammelten Daten nicht unbegrenzt zu speichern.
Leitfaden zur Aufgabenentwicklung
Entwurf zur Erfassung von Produktdaten
- Listen Sie die Artikel-ID, den Titel, die Marke, den Preis, die Währung, den Bestand und das Erfassungsdatum auf.
- Die festgelegte Preisangabe gibt nur Zahlen zurück, und die Währung wird in einem separaten Feld angegeben.
- Unterscheiden Sie den Preis auf der Übersichtsseite, den Preis auf der Detailseite, den Rabattpreis und den Mitgliederpreis.
- Prüfen Sie mit einer kleinen Menge an Produkten Varianten, Ausverkäufe, Paginierung und doppelte Einträge.
- Die Referenzseite sowie das Scannungsdatum werden beibehalten, um nach Preisänderungen nachvollziehen zu können.
- Manuelle Überprüfung bei außergewöhnlich niedrigen Preisen, leeren Titeln und falschen Währungseinheiten.
Erstellen eines zuverlässigen Schemas
- Zuerst zeichnet man die endgültige Tabelle und wandelt anschließend jede Spalte in ein Feld um.
- Wählen Sie den richtigen Typ für Datumsangaben, Zahlen, boolesche Werte, Texte und Arrays aus.
- Nur die für den Geschäftsbetrieb unverzichtbaren Felder sind als Pflichtfelder festgelegt.
- In der Feldbeschreibung sind Einheiten, Beispiele, zulässige Werte und Ausschlussregeln anzugeben.
- Legen Sie eine Strategie für fehlende Daten fest, damit das Modell keine Werte selbst erfindet.
- Sparen Sie eine Version des Schemas, um plötzliche Fehler bei der Verarbeitung nach einem Task-Update zu vermeiden.
Überprüfung der Crawling-Ergebnisse
- Zufällige Stichproben aus verschiedenen Seitenarten werden entnommen und Seite für Seite mit der Webseite abgeglichen.
- Überprüfen Sie, ob Seitenanzeige, Listen, Details, Pop-ups und lazy loading fehlen.
- Erstellen Sie Statistiken zu den Prozentsätzen an leeren Werten, Duplikaten, Typfehlern und unangemessenen Werten.
- Testen Sie erneut nach einer Überarbeitung der Website, einem Änderung des Anmeldezustands oder eines Wechsels des Standorts.
- Die Ursachen für Misserfolge werden in Zugriffs-, Navigations-, Parsing- und Schema-Probleme eingeteilt.
- Erst wenn eine vorgegebene Genauigkeitsrate erreicht ist, wird er für Berichte oder automatische Entscheidungen verwendet.
Für welche Benutzer geeignet
- Marktforscher: Sammlung von Informationen über öffentlich zugängliche Waren, Unternehmen und Veranstaltungen.
- E-Commerce-Team: Organisation von Preisen, Beständen und Änderungen im Produktkatalog.
- Datenanalyst: Schnelle Erstellung einer strukturierten Dateneingabe.
- Gründerteam: Überprüfung der Datenanforderungen ohne fest angestellte Spider-Entwickler.
- Beratungs- und Wettbewerbsintelligenz-Team: Offene Informationen werden nach einem einheitlichen Schema zusammengefasst.
- Maschinelles Lern-Team: Erstellung von überprüften Datensätzen für Forschungsprojekte.
- Entwicklerteam: Bewertung der Wartungskosten für wiederverwendbare Crawling-Logiken, die durch KI erzeugt werden.
Typische Anwendungsszenarien
| Szene | Hauptfelder | Aktualisierungsfrequenz | Kritische Risiken |
|---|---|---|---|
| Preisüberwachung im E-Commerce | Waren, Preise, Währung, Lagerbestand | Täglich oder öfter | Nutzungsbedingungen und falsche Preisangaben |
| Organisation von Veranstaltungsunterlagen | Unternehmen, Position, Thema, Datum | Vor und nach der Veranstaltung | Profil- und Marketingzustimmung |
| Immobilienanalyse | Ort, Fläche, Preis, Zustand | täglich | Wiederholte Immobilien und regionale Vorschriften |
| Rekrutierungstrends | Position, Fähigkeiten, Standort, Veröffentlichungsdatum | Jede Woche | Abgelaufene Stellen und persönliche Informationen |
| Inhaltsverzeichnis | Titel, Autor, Datum, Kategorie | regelmäßig | Urheberrecht und Wiederverwendung des gesamten Textes |
| Lieferantenverzeichnis | Name, Kategorie, Region, Kontaktkanäle | Jeden Monat | Genauigkeit und Rechtfertigung für den kommerziellen Einsatz |
Preis und Öffnungsstatus
Für den Web-Agenten von Data Donkee sind noch keine standardisierten Preise bekannt. Man kann sich nur auf eine Warteliste setzen, um frühen Zugang zu erhalten. Die Angaben auf der offiziellen Website bezüglich Skalierbarkeit und niedriger Kosten dienen lediglich der Produktbeschreibung und ersetzen keine tatsächlichen Preisangaben pro Seite, pro Datensatz, pro Aufgabe oder je nach Rechenaufwand.
| Produkte | Aktueller Preis | Offener Ansatz | Erklärung |
|---|---|---|---|
| AI Web Agent | Nicht veröffentlicht | Auf die Warteliste setzen | Es gibt keine Standardpakete, Probierversionen oder Erklärungen zur Abrechnung. |
| Datensatz der Teilnehmer der London Tech Week 2025 | 5000 US-Dollar | Einmalkauf in unabhängigen Geschäften | Getrennt von der Web-Agent-Abonnementierung |
| Anpassung oder Unternehmensabruf | Nicht veröffentlicht | Es könnte notwendig sein, das Team zu kontaktieren. | Die offizielle Website hat keine Seite mit offiziellen Preisen. |
Der Shop für öffentliche Datensätze nutzt Plattformen Dritter für die Abrechnung digitaler Produkte. Vor dem Kauf sollten Inhalt der Dateien, Anzahl der Einträge, Aktualisierungsdatum, Datenquellen, Lizenzbedingungen, Bedingungen für Rückerstattungen sowie die Konformität der personenbezogenen Daten überprüft werden – man sollte sich nicht allein auf den Produktnamen stützen, um den Wert zu beurteilen.
Prüfung vor Kauf und Testen
| Überprüfungspunkte | Offenheit der offiziellen Website | Zu klärende Fragen |
|---|---|---|
| Verfügbarkeit | Warteschleife | Wann wird es eingeführt, ist eine Einladung erforderlich? |
| Abrechnung | Nicht veröffentlicht | Nach Seite, Eintrag, Aufgabe oder Laufzeit |
| Limit | Nicht veröffentlicht | Parallelisierung, Anzahl der Seiten, Dateigröße und Überpreis |
| Format | Nur strukturierte Downloade schreiben | JSON, CSV oder andere Formate |
| Zugriffsmöglichkeiten | Zusammenfassende Beschreibung | Anmelden, dynamische Seiten, Verifizierungscode und regionale Einschränkungen |
| Datenhaltung | Nicht veröffentlicht | Fristen für die Löschung von Eingaben, Ergebnissen, Protokollen und Backups |
| Servicegarantie | Nicht veröffentlicht | Verfügbarkeit, Support, Wiederherstellung und Rückerstattung bei Fehlern |
| Code-Eigentum | Nicht veröffentlicht | Kann ein Crawling-Programm heruntergeladen oder selbst gehostet werden? |
Vorteile des Produkts
- Beschreiben Sie die Aufgaben in natürlicher Sprache, um die Hürden für Nicht-Techniker zu verringern, die damit beginnen wollen.
- JSON Schema wird unterstützt, um Felder und Datentypen im Voraus zu beschränken.
- Es wird betont, dass die Erstellung wiederverwendbarer Scraping-Programme dazu beitragen kann, die Kosten für jeden einzelnen Aufruf der KI zu senken.
- Das Ziel umfasst komplexe, dynamische Webseiten sowie die großangelegte Extraktion von Daten.
- Der Prozess ist einfach: Von der Beschreibung der Anforderungen bis zum Herunterladen des Ergebnisses gibt es nur drei wesentliche Schritte.
- Der Gründer präsentiert sich öffentlich mit jahrelanger Erfahrung in Projekten zur Verarbeitung von Unternehmensdaten.
Einsatzbeschränkungen und Hinweise
- Das Produkt befindet sich noch in der Vorbereitungsphase; Funktionen, Benutzeroberfläche und Geschäftsmodell können sich ändern.
- Es gibt keine offiziellen Preise, keinen kostenlosen Datenvolumen, keine Support-Dokumentation, keine API oder keine Service-Level-Angaben.
- Die offizielle Website behauptet, dass Ergebnisse ohne Halluzinationen keine Garantie für fehlerfreie Ergebnisse darstellen.
- Komplexe Webseiten, Verifizierungscode und Maßnahmen gegen Automatisierung können dazu führen, dass Aufgaben fehlschlagen.
- Nach einer Änderung der Website-Struktur sind Wartungsarbeiten und Regressionstests erforderlich, selbst wenn der Code wiederverwendet werden kann.
- Eine korrekte Struktur bedeutet nicht, dass der Inhalt auch wahr ist; die wichtigen Felder müssen weiterhin manuell überprüft werden.
- Das Erfassen öffentlicher Seiten kann auch gegen die Bedingungen der Website, Urheberrechte, Datenbankrechte oder Datenschutzvorschriften verstoßen.
- Bevor man vorgefertigte Datensätze kauft, muss man die Quelle, die Lizenzen, die Gültigkeitsdauer sowie die Angaben zu den Personen überprüfen.
- Verwenden Sie keine Tools, um sich um das Anmelden, Zahlungsschranken, Verifizierungscode oder Zugriffskontrollen zu drücken.
Konformität und verantwortungsvolles Crawling
- Lesen Sie die Dienstbedingungen, die Scraping-Regeln sowie die Beschreibungen der öffentlichen Schnittstellen der Zielwebsite.
- Verwenden Sie vorrangig die offiziellen APIs, den Download von offenen Daten oder eine schriftliche Genehmigung.
- Die Häufigkeit der Anfragen sowie die Konkurrenz unter den Anfragen werden kontrolliert, um eine Störung des normalen Betriebs der Website zu vermeiden.
- Es werden keine privaten Informationen, Zahlungsdaten oder sensible persönliche Daten nach dem Anmelden abgerufen.
- Speichern Sie nur die für den Betrieb notwendigen Felder und legen Sie Zugriffsrechte sowie eine Ablaufzeit für die Löschung fest.
- Respektieren Sie Urheberrechte, Markenrechte, Rechte an Datenbanken sowie Beschränkungen bei der erneuten Verbreitung von Inhalten.
- Vor der Nutzung für Kontaktmarketing sollten Zustimmungen, Austrittsmöglichkeiten sowie die geltenden Landesgesetze erneut überprüft werden.
- Aufzeichnen Sie Kanäle, Zeitpunkte, Schema und Verarbeitungsschritte, um Korrekturen und Audits zu erleichtern.
Privatsphäre und Datensicherheit
Die offizielle Website bietet keinen Zugang zu einer überprüfbaren, unabhängigen Datenschutzerklärung, zu Nutzungsbedingungen oder zu Informationen zur Datenverarbeitung. Da die Crawling-Aufgaben Seiten, Schemata, Ergebnisse sowie Profile umfassen können, sollten Unternehmen sensible Daten nicht ohne schriftliche Unterlagen hochladen.
- Fragen Sie nach dem Eingabefeld für Aufgaben, den Ergebnissen der Extraktion, der Erstellung von Code sowie dem Speicherort der Protokolle.
- Bestätigen Sie den Zugriffsbereich der Plattformmitarbeiter, Model-Anbieter und Infrastrukturanbieter.
- Überprüfen, ob die Daten für das Trainieren von Modellen, die Verbesserung von Produkten oder andere Kundenaufgaben verwendet werden.
- Anfragen bezüglich Verschlüsselung, Berechtigungen, Backups, Benachrichtigungen bei Störungen sowie Löschverfahren.
- Während der Testphase werden öffentliche und weniger sensible Datensätze verwendet.
- Löschen Sie nach der Exportierung umgehend die Cloud-Kopie und schützen Sie die lokale Datei.
- Bei personenbezogenen Daten werden die rechtlichen Grundlagen, die Zweckbeschränkungen sowie eine Bewertung der Rechte des Betroffenen berücksichtigt.
API, GitHub und Open-Source-Status
Stand der Überprüfung bietet die offizielle Website von Data Donkee keine öffentlichen API-Dokumentationen, SDKs, Kommandozeilenwerkzeuge oder Möglichkeiten zur Anfrage von Entwickler-Schlüsseln. JSON Schema ist zwar das Standardformat für die Eingabe von Daten, bedeutet aber nicht, dass die Plattform bereits programmierte Schnittstellen bereitstellt.
Es wurden weder eine offizielle GitHub-Organisation noch Quellcode-Repositories oder Open-Source-Lizenzen gefunden, die auf Data Donkee zurückzuführen wären. Auf der offiziellen Website wird zwar auf von KI erzeugten, wiederverwendbaren Code hingewiesen, doch das bedeutet nicht, dass Nutzer den Code oder die Plattform selbst herunterladen können.
Grundlegende Informationen
| Felder | Inhalt |
|---|---|
| Name des Tools | Data Donkee |
| Arten von Werkzeugen | AI-basierte Extraktion von Webdaten und codefreie Crawler |
| Produktphase | Warteliste und früher Zugang |
| Kern-Eingabe | Anforderungen an natürliche Sprache und JSON Schema |
| Kernausgabe | Strukturierte Daten nach der Reinigung |
| Hauptplattformen | Web |
| Preise für Web Agent | Nicht veröffentlicht |
| Öffentliche Datenträger | Datensatz der Teilnehmer der London Tech Week 2025 |
| Datensatzpreise | 5000 US-Dollar |
| Öffentliche API | Nicht gefunden |
| Offizielles SDK | Nicht gefunden |
| Offizieller GitHub | Nicht gefunden |
| Ob Open Source | Nein |
Empfehlungswert
Die Empfehlungswertung beträgt 3,4 von 5 Punkten. Die Aufgabenstellung für natürliche Sprache und JSON Schema ist klar strukturiert; die wiederverwendbaren Codekonzepte eignen sich außerdem dazu, die Kosten für das Extrahieren wiederholter Webseiten zu senken.
Da das Produkt sich noch in der Warteschleife befindet, liegen keine offiziellen Angaben zu Preis, Datenschutz, Bedingungen, technischen Grenzen und Stabilität vor. Es eignet sich besser für die Nutzung in der Warteschleife zur Testung mit unbedeutenden Aufgaben, ist jedoch nicht geeignet, um direkt für wichtige Produktionsprojekte verwendet zu werden.
Häufige Fragen
Ist Data Donkee bereits offiziell verfügbar?
Es ist noch nicht vollständig freigegeben; die wichtigsten Schaltflächen auf der offiziellen Website führen weiterhin nur zur Aufnahme in die Warteliste. Es wurde keine öffentliche, selbstbedienbare Konsole gefunden, über die man direkt zugreifen kann.
Ist Programmierung erforderlich?
Die Produktstrategie beruht darauf, dass keine Programmierung erforderlich ist – die Benutzer können ihre Anforderungen in natürlicher Sprache sowie mit Hilfe von Schemata beschreiben. Die Kenntnis der Feldtypen sowie der Datenqualität verbessert die Ergebnisse erheblich.
Was ist JSON Schema?
Es handelt sich um ein Standard, der Datenspalten, Typen, Hierarchien sowie Regeln bezüglich der Pflichtangaben beschreibt. Data Donkee verwendet diesen Standard, um die Struktur der erfassten Ergebnisse zu regulieren.
Ist Data Donkee kostenlos?
Die offizielle Website gibt keine Informationen über die kostenlosen Nutzungsmöglichkeiten des Web Agents oder über kostenpflichtige Pakete preis. Die Aufnahme in die Warteliste bedeutet nicht, dass man einen dauerhaften kostenlosen Zugang erhält.
Kann man dynamische Webseiten erfassen?
Die offizielle Website besagt, dass Web Agent für komplexe, dynamische Strukturen geeignet ist, gibt jedoch keine Angaben zu den Fähigkeiten und Einschränkungen des Browsers. Es sollte mit einer kleinen Stichprobe der Zielseite getestet werden.
Ist das Ergebnis sicherlich genau?
Nicht unbedingt. Schema kann die Formatkonsistenz verbessern, aber die Verständlichkeit der Seite, die Zuordnung der Felder, die Aktualität des Inhalts sowie Fehler auf der Quellseite beeinflussen weiterhin das Ergebnis.
Wird eine API bereitgestellt?
Es wurden weder offizielle API-Dokumentationen noch Anträge auf Zugang zu Schlüsseln gefunden. Die Website zeigt ein JSON Schema an – dies sollte nicht fälschlicherweise als bereits verfügbare REST API interpretiert werden.
Ist Data Donkee open source?
Es handelt sich um kein Open-Source-Projekt – es gibt weder ein offizielles Quellcode-Repository noch eine Lizenz. Auch zu den technischen Ansätzen zur Erstellung von Scraping-Programmen liegen keine offenen Code-Dokumentationen vor.
Zusammenfassung
Data Donkee vereinfacht das Webscraping durch die Beschreibung der Anforderungen, die Definition des Schemas sowie die Erstellung von Ergebnissen zur Extraktion und zum Herunterladen – ideal für Geschäfts- und Datenteams, die die manuelle Arbeit mit Scrapern reduzieren möchten.
Die wichtigste Beurteilung derzeit ist, dass es sich noch in der Probephase befindet. Vor der offiziellen Nutzung müssen Preis, Limit, Kompatibilität mit der Website, Eigentumsrechte am Code, Datenschutzdokumente sowie die Einhaltung von Datenschutzvorschriften einzeln überprüft werden.
Guigong-Netzwerk-Sicherheitsnummer: 45132202000164