NaturalReader
NaturalReader – ein intelligentes Tool, das sich auf KI-gestützte Audiodaten konzentriert.
Tags:KI-Audio-ToolsWas ist NaturalReader?
NaturalReader ist ein Text-zu-Stimme-Produkt, das von der kanadischen Firma NaturalSoft Ltd. betrieben wird. Es kann für den privaten Gebrauch, in Bildungseinrichtungen sowie für kommerzielle Zwecke eingesetzt werden.
Die persönliche Version konzentriert sich darauf, Dokumente, Webseiten und Bilder den Nutzern vorzulesen, während die kommerzielle Version AI Voice Generator Skripte in synchronisierte Sprachaufnahmen umwandelt, die veröffentlicht oder weiterverbreitet werden können; die Accountrechte, Funktionen und Lizenzen beider Versionen dürfen nicht miteinander kombiniert werden.
Hauptfunktionen der persönlichen Version
Vorlesen von Dokumenten, Webseiten und Scans
- Es können Dateien wie PDF, Word, PowerPoint, TXT, RTF, ODT sowie EPUB ohne DRM hochgeladen werden. Zudem kann Text direkt eingegeben oder eingefügt werden.
- Die Webseitenextraktionsfunktion kann gewöhnliche Artikel in eine Datenbank aufnehmen und vorlesen; dynamische Seiten, Anmeldeinhalte oder komplexe interaktive Seiten können möglicherweise nicht vollständig extrahiert werden.
- Abonnenten können mit OCR scanierte PDF-, PNG- und JPEG-Dateien verarbeiten; bei scannierten PDFs können maximal 50 Seiten pro Transformation umgewandelt werden, mehrseitige Dateien können in Chargen weiterverarbeitet werden.
- Kamerascans für mobile Geräte eignen sich für Bücher, Lehrbücher und Notizen. Unklare Bilder, geringer Kontrast, komplexe Formatierungen oder unleserliche Handschrift verringern die Genauigkeit bei der Erkennung und beim Lesen der Inhalte.
Leseunterstützung und Audio-Export
- Beim Vorlesen wird der Text synchron hervorgehoben, und es ist möglich, die Stimme, die Sprechgeschwindigkeit, die Anzeigeart sowie die Untertitel anzupassen; der Aussprachereditor dient zur Korrektur von Namen, Abkürzungen und Fachbegriffen.
- Die Kommentarfunktion ermöglicht es, Dokumente zu markieren und Notizen hinzuzufügen. Beim Export eines hervorgehobenen PDFs werden die Kommentartexte nicht enthalten.
- Der AI Smart Filter kann Seitennummern, Tabellen, Diagramme und andere störende Inhalte überspringen, doch bei komplexen Layouts muss das Filterergebnis weiterhin manuell überprüft werden.
- Das kostenpflichtige Einzelpaket unterstützt die Umwandlung in MP3; bei einer einzigen Eingabe sind maximal 50.000 Zeichen möglich. Die erstellten Dateien werden 30 Tage lang in der Audiodatenbank gespeichert.
Lernfunktion von ReadAI
- ReadAI kann für hochgeladene Dokumente Podcasts, Zusammenfassungen, Tests, Fragen-Antworten oder dialogbasierte Antworten erstellen, kann aber nicht direkt für manuell eingefügten Text verwendet werden.
- Podcast und Recap können das gesamte Dokument oder ausgewählte Seitenabschnitte verarbeiten, maximal 500 Seiten pro Mal; im Podcast dürfen maximal zwei Sprecher verwendet werden.
- Diese erstellten Inhalte dienen dem privaten Lernen und dürfen aufgrund ihrer Aufnahme in Zusammenfassungen, Tests oder Podcasts nicht für eine öffentliche Veröffentlichung genutzt werden.
- Die Ergebnisse der KI können den Kontext übergehen oder faktische Fehler aufweisen; Lernende sollten daher immer zum Originaltext zurückkehren, um Zitate, Zahlen und Schlussfolgerungen zu überprüfen.
Klang und Sprache
- Free Voices stammen von Geräten, Systemen oder Browsern; die verfügbaren Optionen unterscheiden sich je nach Plattform. Lite, Plus und Pro sind verschiedene Ebenen künstlicher Stimmen.
- Plus umfasst Stimmen für Chinesisch, Englisch, Japanisch, Koreanisch, Arabisch sowie viele weitere Sprachen und Akzente. Es werden nicht unbedingt alle in der Liste aufgeführten Sprachen unterstützt.
- Pro verwendet hochwertigere mehrsprachige Stimmen und unterstützt Lesearten, bietet aber derzeit ein geringeres Sprachangebot als Plus.
- Die persönlichen Pläne Plus und Pro ermöglichen es, bis zu zwei eigene Stimmen zu klonen. Bevor man die Stimme einer anderen Person hochlädt, muss eine gültige Genehmigung vorliegen.
Kommerzielle Version des AI Voice Generators
- Durch das Eingeben von Skripten im Browser, das Auswählen von Stimmen und die Bearbeitung nach Abschnitten können Werbespots, Videos, Podcasts, Kurse, Schulungen, Präsentationen und Spiele mit Synchronisation erstellt werden.
- Derzeit werden Sprachmodelle wie Gemini, OpenAI, Azure und ElevenLabs integriert; die verschiedenen Modelle weisen Unterschiede in Bezug auf Sprache, Kontrolle des Tonfalls sowie den Energieverbrauch pro Zeichen auf.
- Prompt Control ermöglicht es, durch Anweisungen den Tonfall, Rhythmus, Stil und Akzent anzupassen; einige Modelle unterstützen zudem Voice Design und Satzzeichen, wobei die Funktionen vom gewählten Modell abhängen.
- Es können bis zu vier künstliche Stimmen-Klone erstellt werden, mithilfe des Ausspracheditors und des Skript-Assistenten, und die Ergebnisse können als MP3 oder WAV im Format 44,1 kHz exportiert werden.
- Das aus einer Geschäftsabonnement erzeugte Audio kann in kommerziellen, öffentlichen und weiterverbreitenden Kontexten verwendet werden, wobei der Nutzer weiterhin die notwendigen Rechte an den Skripten, Musik, Stimmen der Darsteller sowie anderen Materialien besitzen muss.
Anleitung zur Verwendung
Prozess der individuellen Vorlesung
- Registrieren Sie ein Konto und melden Sie sich auf der Website, unter iOS, Android oder über Browser-Erweiterungen an – mit demselben Konto können Sie Ihre Daten zwischen verschiedenen Geräten synchronisieren.
- Man kann Dokumente, Fotos oder gescannte PDFs hochladen, außerdem Text einfügen oder normale Webseiten hinzufügen; E-Books mit DRM können nicht importiert werden.
- Wenn das System Schrift in den Bildern erkennt, wählt es den OCR-Seitenbereich aus und führt die Umwandlung durch. Anschließend wird überprüft, ob die Aufteilung der Seiten, die Überschriften sowie der Inhalt am Ende der Seite korrekt erkannt wurden.
- Wählen Sie die für die Sprache geeigneten Stimmen und Akzente aus, passen Sie die Sprechgeschwindigkeit an, filtern Sie, steuern Sie die Aussprache sowie die Einstellungen für Untertitel und Hervorhebungen und beginnen Sie dann mit dem Vorlesen.
- Für das Anhören offline ist eine kostenpflichtige MP3-Konvertierung erforderlich, und die Dateien müssen vor Ablauf des Limits oder des Audiodatums heruntergeladen werden.
Prozess der professionellen Synchronisation
- Testen Sie zunächst die Tonqualität und Funktionen mit einem kostenlosen Geschäfts-Konto. Kostenlose Nutzer können täglich bis zu 10.000 Zeichen an Audioinhalt anhören, dürfen das Audio jedoch nicht herunterladen.
- Erstellen Sie ein neues Projekt und fügen Sie eigene oder lizenzierte Skripte ein. Teilen Sie den Text in Abschnitte nach Szenen auf und wählen Sie anschließend das Modell, die Sprache sowie die Stimme aus.
- Verwenden Sie Hinweise, ein Aussprachewörterbuch, die Sprechgeschwindigkeit sowie die vom Modell unterstützten Tags zur Steuerung der Darstellung. Eine erneute Umwandlung nach den Änderungen verbraucht erneut Punkte.
- Hören Sie sich jeden Textblock an, überprüfen Sie Eigennamen, die Sprachwechsel, Pausen und den Tonfall, und exportieren Sie anschließend als MP3 oder WAV.
- Speichern Sie vor der Veröffentlichung die Genehmigungsunterlagen und stellen Sie sicher, dass die Stimme der Personen, das Drehbuch sowie die Hintergrundmaterialien für die Zielplattform, den Kunden und die Region verwendet werden dürfen.
Preise und Pakete
| Paket oder Version | Preis | Abrechnungszeitraum | Kernrechte oder -beträge | Für Nutzer geeignet |
|---|---|---|---|---|
| Persönliche kostenlose Version | Kostenlos | Langfristig verfügbar | Die von der App bereitgestellten „Free Voices“-Stimmen sowie einige KI-Stimmen und Funktionen von ReadAI sind nur in begrenztem Umfang verfügbar; kostenpflichtige OCR-Funktionen sowie die Exportierung in MP3-Format sind nicht enthalten. | Erst einmal die Möglichkeit ausprobieren, Texte vorzulesen und die Daten zwischen verschiedenen Geräten zu synchronisieren. |
| Persönlich Lite | 13,90 US-Dollar, oder 79 US-Dollar pro Jahr | Vorabzahlung monatlich oder jährlich | Bei Lite gibt es keine Beschränkungen bei der Vorlesung – monatlich sind 1 Million Lite-MP3-Zeichen möglich. Dazu gehören Funktionen wie OCR, Anmerkungen, Editieren der Aussprache, Smart Filter sowie ReadAI. | Es werden Scans für die Vorlesung sowie grundlegende Exporte von Personendaten benötigt. |
| Persönlich Plus | 20,90 US-Dollar, oder 119 US-Dollar pro Jahr | Vorabzahlung monatlich oder jährlich | Täglich werden 500.000 „Plus“-Konten mit geklonten Stimmen zur gemeinsamen Wiedergabe von Texten genutzt. Monatlich werden 1 Millionen MP3-Dateien zur gemeinsamen Nutzung bereitgestellt. Es können maximal zwei verschiedene Stimmen geklont werden. | Lernende, die mehr Sprachen und natürliche Geräusche lernen müssen |
| Persönlich Pro | 25,90 US-Dollar, oder 159 US-Dollar pro Jahr | Vorabzahlung monatlich oder jährlich | Täglich werden 500.000 Zeichen für die Nutzer von Plus und Pro zur gemeinsamen Nutzung bereitgestellt. Monatlich sind es 1 Million Zeichen – für die Nutzer von Plus, den Klon-Versionen sowie Pro – zur gemeinsamen Nutzung in Form von MP3-Dateien. Dazu gehören auch verschiedene Lesestile. | Menschen, die Wert auf hochwertigen Klang und einen guten Ausdrucksstil legen |
| Geschäfts-Startup | 29 US-Dollar pro Monat, oder 198 US-Dollar pro Jahr | Einzelnutzer, im Monats- oder Jahresabonnement | 500.000 Punkte pro Monat: Lizenzen für kommerzielle Audiodateien, vier klonierte Stimmen, Skript-Hilfsmittel sowie MP3- und WAV-Dateien. | Individuelle Kreativen mit leiser bis mittlerer Sprechlautstärke |
| Werbekreator | 49 US-Dollar pro Monat, oder 297 US-Dollar pro Jahr | Einzelnutzer, im Monats- oder Jahresabonnement | 2 Millionen Punkte pro Monat, Funktionsumfang identisch mit anderen Geschäfts-Paketen, aber höherer Betrag | Kreative, die kontinuierlich Videos, Kurse oder Podcasts erstellen |
| Business-Team | 33 US-Dollar pro Benutzer pro Monat, oder 192 US-Dollar pro Benutzer pro Jahr | Mindestens zwei Benutzer | 2 Millionen geteilte Punkte pro Benutzer pro Monat – zusammen also 4 Millionen für zwei Personen; gemeinsamer Puffer für das Team | Teams, die eine Zusammenarbeit mehrerer Personen sowie eine einheitliche Autorisierung erfordern |
| EDU-Organisationen | Plus EDU: ab 299 US-Dollar pro Jahr für 5 Personen; Lite EDU: ab 599 US-Dollar pro Jahr für 50 Personen. | Jährliche Vorauszahlung | Administratoren, optionale gemeinsame Datenbanken sowie Funktionen zum persönlichen Lesen; Lizenz für die Website ab 2.000 Personen, ab 3.300 US-Dollar pro Jahr. | Schulen, Bibliotheken und Bildungseinrichtungen |
Höchstbeträge und Hinweise zur Abrechnung
- Alle Einzelpersonen-Preismodelle beinhalten eine Website, eine Mobile-App und ein Chrome-Add-on, enthalten aber keine Business-Version; Business-Abonnements beinhalten auch keine Lesee-App für Privatpersonen.
- Für Geschäftspunkte wird pro Zeichen abgezogen; Gemini, OpenAI und Azure verlangen in der Regel 1 Punkt pro Zeichen, während ElevenLabs Turbo und HD jeweils 10 bzw. 20 Punkte kosten können.
- Chinesische, japanische und koreanische Zeichen werden als zwei Zeichen gezählt; Leerzeichen, Satzzeichen, Symbole und Tags werden ebenfalls berücksichtigt.
- Business-Abo-Points sind nur für gültige Abonnements verfügbar. Die derzeit aufgeführten 4 Millionen Points kosten 99 US-Dollar und werden im selben Verhältnis hinzugefügt; ungenutzte zusätzliche Points verfallen nicht, können aber ohne gültiges Abonnement nicht verwendet werden.
- Auf einigen Hilfeseiten werden weiterhin alte Paketoptionen oder alte Limitangaben angezeigt. Einkäufe im Store können zudem von Region, Steuern und Provisionen der Plattform beeinflusst werden; es sollte stets die Zahlungsseite nach dem Anmelden als Maßstab herangezogen werden.
Unterschied zwischen persönlichen und geschäftlichen Lizenzen
| Vergleichsmerkmale | Persönliche Version und EDU | Business-Version |
|---|---|---|
| Hauptverwendungszweck | Privates Vorlesen, Lernen und persönliches Anhören ohne weitere Verteilung | Erstellung von Synchronisationen für öffentliche Veröffentlichung, internen Gebrauch oder zur Verteilung an Kunden |
| Veröffentlichen auf Video- oder Social-Media-Plattformen | Nicht erlaubt, selbst bei Verwendung der kostenpflichtigen Versionen Plus, Pro oder EDU. | Audio, das aus einer kostenpflichtigen Abonnementlizenz erstellt wird, kann unter Einhaltung der Lizenzzusagen veröffentlicht werden. |
| Klassenzimmer und interne Schulungen zur Verteilung | Sobald es anderen vorgespielt oder geteilt wird, gilt es nicht mehr als für den persönlichen Gebrauch. | Ein Geschäftslicenz ist erforderlich. |
| Eingabemethode | Dokumente, Webseiten, Bilder, Scans und eingefügter Text | Fokussiert auf Skripte und Projektbearbeitung, es werden keine Hilfsmittel für die individuelle Lektüre bereitgestellt. |
| Ausgabe | Vorlesen und persönliches Anhören von MP3s | MP3 und WAV mit kommerzieller Lizenz |
Das in einer persönlichen Abonnementversion erzeugte Audio ist ausschließlich für die private Nutzung des Abonnenten bestimmt. Die Verwendung desselben in nicht-kommerziellen Videos, Schulungsvideos, internen Schulungen oder zur Übermittlung an Kunden gilt ebenfalls als Teilen oder Weiterverbreiten.
Die Geschäftslizenz umfasst die Nutzung zur Erstellung von Audioinhalten, löst jedoch nicht automatisch die Rechtsprobleme im Zusammenhang mit dem Hochladen von Skripten sowie der Klonierung von Stimmen, Musik oder Markenzeichen.
Plattformen, Schnittstellen und Open-Source-Status
- Die persönliche Version kann auf Webseiten, iOS und Android verwendet werden und bietet einen Chrome-Erweiterung; die Erweiterung kann auch in Edge genutzt werden.
- Die sogenannte Installation auf der Desktop-Oberfläche beinhaltet die Erstellung eines separaten Fensters sowie von Schnellzugriffen im Browser – das ist nicht dasselbe wie herkömmliche Offline-Desktop-Software. Die Hauptverarbeitung erfolgt weiterhin über Online-Dienste.
- Die Business-Version ist derzeit eine Browseranwendung; es wurden bisher weder API-, SDK-Dienste noch Geschwindigkeitsbeschränkungen oder offizielle Preise für Entwickler bekannt gegeben.
- Es wurden weder ein Quellcode-Repository noch eine Open-Source-Lizenz für die von NaturalSoft veröffentlichten Produkte bestätigt. Die Verwendung des Namens NaturalReader oder nicht öffentlicher Schnittstellen in Drittanbieterprojekten bedeutet nicht, dass die Produkte open source sind oder eine kommerzielle Lizenz haben.
Privatsphäre, Sicherheit und Datenspeicherung
- Der Service kümmert sich um Kontoinformationen, das Hochladen von Dokumenten, Webseiten, OCR-Inhalten, Skripten, Hinweisen, Übersetzungen, Zusammenfassungen, Tests, Audiodateien, Anmerkungen sowie auditive Authentifizierungssamples.
- Die aktuelle Datenschutzrichtlinie besagt ausdrücklich, dass keine Kundeninhalte oder erzeugten Ergebnisse zur Schulung von NaturalSoft oder Drittanbieter-AI-Modellen verwendet werden. Nur bei der Bereitstellung der ausgewählten Funktionen werden die notwendigen Informationen an die Sprach- oder AI-Dienstleister übermittelt.
- Persönliche Dokumente und Geschäftsprojekte werden standardmäßig maximal zwei Jahre lang gespeichert. Nicht registrierte Dateien können maximal 36 Stunden lang gespeichert werden; Audiodateien können hingegen 360 Tage lang heruntergeladen werden. Die Benutzer können die gespeicherten Inhalte jederzeit löschen.
- Nach Löschung des Kontos werden die Anmeldedaten umgehend aus dem System entfernt. Die Daten anderer Konten werden in der Regel innerhalb von 24 Stunden gelöscht; verschlüsselte Backups können bis zu 360 Tage aufbewahrt werden, wobei Ausnahmen bei steuerlichen, betrugsschutzrechtlichen und rechtlichen Aufzeichnungen bestehen.
- Das Hauptproduktionsystem befindet sich bei AWS in den USA; die Daten können auch in Kanada sowie im Land des Dienstleisters verarbeitet werden. Für die Übertragung wird TLS 1.2 oder eine höhere Version verwendet, während statische Daten mit AES-256 oder vom Cloud-Dienstleister bereitgestellten Verschlüsselungsmethoden geschützt werden.
- Derzeit wird keine Mehrfaktor-Authentifizierung für Endbenutzer angeboten. Die Benutzer sollten ein starkes, eigenständiges Passwort verwenden und ihre damit verbundenen E-Mail-, Google- oder Apple-Konten schützen.
- Das Produkt richtet sich nicht an hochsensible oder besonders streng regulierte Daten. Ohne schriftliche Zustimmung dürfen keine geschützten Gesundheitsdaten, Kreditkarteninformationen, Registrierungsdaten der Regierung oder biometrische Daten übermittelt werden.
- Stimmenproben können in einigen Regionen als biometrische Daten, Informationen über die Persönlichkeit oder als Daten mit Bezug auf das Recht auf Privatsphäre gelten; um die Stimme einer anderen Person zu klonen, ist eine nachweisbare Genehmigung erforderlich.
Rückerstattung und Verlängerung
- Für die monatliche Zahlungsvariante der persönlichen Website kann innerhalb von 3 Tagen nach Kauf oder Verlängerung ein vollständiger Rückerstattungsbetrag beantragt werden; bei der jährlichen Zahlungsvariante gilt eine Frist von 7 Tagen. Nach Ablauf dieser Frist wird kein Rückerstattungsbetrag entsprechend dem nicht genutzten Zeitraum gewährt.
- Rückerstattungen für Käufe bei Apple und Google Play werden von den jeweiligen Stores abgewickelt; die Voraussetzungen und Verfahren können unterschiedlich sein.
- Business-Abonnements werden grundsätzlich nicht rückerstattet, weder vollständig noch anteilig für den verbleibenden Zeitraum; in Ausnahmefällen entscheidet NaturalSoft selbst.
- Die automatische Verlängerung der Mitgliedschaft kann storniert werden; danach bleibt die Mitgliedschaft bis zum Ende der aktuellen Abrechnungsperiode gültig. Der Nutzer sollte die Stornierung vor dem nächsten Abbuchungstermin durchführen.
Zusammenfassung
Die persönliche Version von NaturalReader eignet sich dazu, Lernmaterialien, Scans sowie Webseiten in audible Inhalte umzuwandeln, die man mitlesen kann. Die kommerzielle Version hingegen ist für Content-Creater und Teams geeignet, die eine klare Lizenz zur weiteren Verbreitung benötigen.
Bevor man eine Entscheidung trifft, ist es am wichtigsten zunächst zu prüfen, ob der Audioinhalt für andere Personen hörbar sein soll. Anschließend sollten die Lautstärke, der Verbrauch an Zeichen oder Punkten, die Preise auf der Plattform sowie das Maß an Datensensibilität berücksichtigt werden.
Guigong-Netzwerk-Sicherheitsnummer: 45132202000164