Speechify
Webseiten, PDFs und Dokumente in natürliche Sprache umwandeln und Schreibwerkzeuge bereitstellen
Tags:KI-Audio-ToolsWas ist Speechify?
Speechify ist eine Plattform für Lesen, Erstellen und Entwickeln, die auf künstlicher Sprachtechnologie basiert. Ursprünglich wurde sie dazu verwendet, Webseiten, PDFs, Bücher sowie gescannte Texte vorzulesen. Heute umfasst sie außerdem Funktionen wie Spracherkennung, künstliche Zusammenfassungen, Podcasts, Synchronisation, Videoübersetzung, Stimmenklonierung sowie Entwickler-APIs.
Speechify Text-to-Speech-Reader, Speechify Studio und Speechify API sind drei verschiedene Produkte, wobei Abonnements und Lizenzmodelle nicht miteinander vertauscht werden können. Leser, Inhaltsersteller und Entwicklerteams sollten die jeweiligen Lösungen separat vergleichen.
Hauptfunktionen von Speechify
- Vorlesen von Webseiten, PDFs, E-Books, E-Mails und Bürodokumenten;
- Durch OCR werden gedruckte Seiten gescannt und in Sprache umgewandelt;
- Unterstützung für mehr als 1000 verschiedene Stimmen sowie mehr als 60 Sprachen und Akzente;
- Hervorhebung von Texten, Wiedergabegeschwindigkeit sowie Fortschrittsanzeige synchronisiert über verschiedene Geräte;
- KI-Zusammenfassungen, Inhaltsfragen, Tests und Sprachassistenten;
- Spracheingabe kann in unterstützten Anwendungen mündliche Äußerungen in Text umwandeln;
- Studio erstellt Kommentare, Video-Synchronisationen, Stimmenveränderungen und Stimmenklonen;
- Dubbing Studio übersetzt Videos und synthetisiert die Sprechstimmen neu;
- Kreative können Musik, Bilder, Videos und Soundeffekte hinzufügen;
- Die TTS-API unterstützt fließendes Sprachausgabe, SSML, Speech Marks und SDKs.
Text to Speech Reader
Reader kann PDF-, Word-, EPUB-Dateien sowie Webseiten und Cloud-Dateien importieren und vorlesen – auf Web, iOS, Android, Windows, Mac sowie in Chrome und Edge. Die Benutzer können die Stimme und die Geschwindigkeit anpassen; die Hervorhebungen im Text bewegen sich dabei synchron mit der Audioaufnahme.
Die kostenlose Version bietet hauptsächlich grundlegende TTS-Funktionen, 10 verschiedene mechanische Stimmen sowie eine Geschwindigkeitssteigerung von bis zu 1,5-fach. Die Premium-Version bietet natürlichere Stimmen, mehr Sprachen, eine Geschwindigkeitssteigerung von bis zu 5-fach, Funktionen zur Vortragsanalyse, AI-basierte Zusammenfassungen und Chat-Funktionen sowie Integration in Cloud-Speicher.
OCR-Scannen und Dateiimport
Mit dem Handy können Lehrmaterialien, Handouts oder Seiten aus gedruckten Büchern aufgenommen werden. Anschließend wird mithilfe von OCR der Text erkannt und vorgelesen. Die Qualität der Erkennung hängt von der Schärfe, der Formatierung, der Sprache sowie der Handschrift ab. Formeln, Tabellen und mehrspaltige Dokumente müssen manuell überprüft werden.
Die Integration von Google Drive, Dropbox und Microsoft OneDrive erleichtert das Importieren von Daten, doch der Berechtigungsumfang sollte nicht über das Notwendige hinausgehen. Vor dem Importieren sensibler Dateien sollte die Datenerfassungspolitik der Organisation überprüft werden.
AI-Zusammenfassungen, Fragen-und-Antwort-Funktionen sowie Sprachassistenten
Premium kann Zusammenfassungen von Lesetexten, Antworten auf Chat-Nachfragen und Tests erstellen sowie über den Voice AI Assistant sprachbasierte Gespräche zu Webseiten oder Büchern führen. Die KI könnte Einschränkungen übersehen oder Ansichten im Text als Fakten betrachten.
Spracheingabe und AI-Podcasts
Voice Typing wandelt gesprochene Worte in Text um und wird für E-Mails, Dokumente sowie alltägliche Schreibarbeiten verwendet. AI Podcasts hingegen organisieren Inhalte zu hörbaren Formaten, die sich zum Wiederholen und Unterwegsanhören eignen, können aber keine genaue Zitierung des Originaltextes ersetzen.
Studio AI-Synchronisation
Speechify Studio wird zur Erstellung von herunterladbaren und veröffentlichen Sprachinhalten verwendet und ist eine eigenständige Abonnementlösung vom persönlichen Reader. Die Benutzer können voreingestellte Stimmen auswählen, einen Text eingeben, Pausen, Aussprache, Sprachtempo und Stimmung anpassen und anschließend die Voiceover-Datei exportieren.
Das kostenpflichtige Studio-Paket beinhaltet das Recht auf kommerzielle Nutzung, während das kostenlose Paket dieses Recht nicht bietet. Konkrete Sounds, Stimmen berühmter Personen sowie Materialien können zudem durch separate Lizenzen eingeschränkt sein; vor der Veröffentlichung sollte man die aktuelle Lizenzbedingungen des Projekts prüfen.
Dubbing, Stimmenänderung und Stimmenklonierung
Das Dubbing Studio kann Videos übersetzen und neu synchronisieren, wobei versucht wird, den Rhythmus, den Tonfall sowie die Persönlichkeitsmerkmale des Sprechers beizubehalten. Der Voice Changer hingegen wandelt bereits aufgenommene Geräusche in andere verfügbare Stimmen um – geeignet für Charaktere, Kommentare und Lokalisierungen.
Für die Klonierung von Stimmen ist die ausdrückliche Zustimmung des Sprechers erforderlich; es darf nicht versucht werden, sich als jemand anderes auszugeben oder betrügerische Inhalte zu erzeugen. Die API-Bedingungen beschränken zudem die Nutzung von Stimmen Minderjähriger, Verstorbener sowie bekannter Politiker und verlangen eine angemessene Kennzeichnung der synthetisch erzeugten Inhalte.
Speechify TTS API
Die Speechify-API nutzt das Simba-Stimmmodell, um Sprache zu erzeugen oder in Stream-Form zurückzugeben. Sie unterstützt SSML, Zeitstempel auf Wortebene, Emotionssteuerung sowie die Klonierung von Stimmen. Die Serverseitige Authentifizierung erfolgt über API-Schlüssel; offiziell werden SDKs für Python sowie JavaScript oder TypeScript bereitgestellt.
Die Stream-API eignet sich für Sprachagenten und die Echtzeit-Auslesung, während die reguläre Generierung-API zur Erstellung speicherbarer Audiodateien geeignet ist. Die vorliegende Dokumentation gibt an, dass pro Anfrage maximal etwa 20.000 Zeichen verarbeitet werden können; konkrete Modelle und Einschränkungen richten sich nach der Konsole.
Vergleich der drei Speechify-Produktkategorien
| Produkte | Hauptverwendungszweck | Ausgabe | Abrechnungsmethode |
|---|---|---|---|
| Text to Speech Reader | Den vorhandenen Inhalt einem Einzelpользоватel vorlesen. | In-App-Vorlesen, Zusammenfassung und Fragen & Antworten | Kostenlos oder Premium-Abonnement |
| Speechify Studio | Erstellung von Kommentaren, Video-Synchronisationen und Toninhalten | Herunterladbare Audio- und Video-Dateien | Studio-Punkte-Abonnement |
| Speechify API | Einfügen von TTS in Anwendungen, Agenten und Dienste | Programmierte Audio-Streams oder -Dateien | Zeichenzahl oder Unternehmensvertrag |
| Unternehmens- und Bildungsprogramme | Einrichtung der Strukturen, Zugänglichkeit und Teammanagement | Zentrale Konten und Organisationsservices | Kontaktieren Sie den Verkauf |
Preis für Speechify Reader
Die folgende Tabelle zeigt die aktuellen monatlichen Preise in US-Dollar auf der offiziellen Website. Auf der Seite werden außerdem eine Jahreszahlungsoption sowie zeitweise Rabatte angeboten. Der endgültige Betrag, die Steuern sowie die Verlängerungsfristen richten sich nach den Angaben auf der Zahlelseite.
| Plan | Preis | Hauptanteile | Für Nutzer geeignet |
|---|---|---|---|
| Free | 0 US-Dollar | Bis zu 1,5-facher Geschwindigkeit, 10 Grundtöne, grundlegende Text-zu-Stimme-Übersetzung | Gelegentliches Vorlesen und Erleben |
| Premium | 29 Dollar pro Monat | Mehr als 1000 natürliche Geräusche, mehr als 60 Sprachen, bis zu 5-fache Verlangsamung, Scannen, Zusammenfassungen sowie Integration mit Cloud-Speicher | Hochfrequentes Lernen und Lesen |
| Enterprise oder Education | Individuelle Kostenschätzung | Massenbereitstellung, Kontoverwaltung und organisatorische Unterstützung | Schulen, Unternehmen und Barrierefreiheitsprojekte |
Für Premium-Stimmen gelten Grenzen für eine angemessene Nutzung sowie monatliche Wortzahlen. Die derzeitige garantierte Grundmenge beträgt mindestens 150.000 Wörter pro Monat; vorübergehende Erweiterungen oder Sonderangebote sollten nicht als dauerhafte Rechte angesehen werden.
Preise für Speechify Studio und API
| Produkte und Lösungen | Preis | Limit oder Ansprüche | Wichtige Einschränkungen |
|---|---|---|---|
| Studio Free | 0 US-Dollar | 600 Studio-Punkte, über 1000 verschiedene Sounds, Synchronisationen, Dubbing und Stimmenänderung | Klone ohne Ton, keine kommerziellen Nutzungsrechte |
| Studio Starter | 19 Dollar pro Monat | 7200 Punkte, Stimmenklonierung, Materialbibliothek und kommerzielle Nutzungsrechte | Punkte werden nach der Erstellung des Inhalts verbraucht. |
| Studio Creator | 49 Dollar pro Monat | 28.800 Punkte sowie alle Funktionen von Starter | Hochfrequentes Schaffen erfordert weiterhin Punkteverwaltung |
| API Starter | Kostenlos | 50.000 Zeichen, etwa 100 Minuten, SSML, Speech Marks und SDK | Ohne Klangklonierung |
| API Pay-As-You-Go | 10 US-Dollar pro 1 Million Zeichen | Nach Verbrauch – etwa 2000 Minuten, inklusive Ton-Klonierung | Die tatsächliche Anzahl der Minuten hängt vom Text und von der Sprechgeschwindigkeit ab. |
| API Enterprise | Individuelle Kostenschätzung | Verträge, Sicherheit, SLA, angepasste Stimmen und Prioritätsunterstützung | Die offizielle Website gibt einen Startbetrag von 5.000 US-Dollar pro Jahr an. |
Wie werden Studio-Punkte verbraucht?
Für die Erstellung einer Voiceover werden pro Sekunde 1 Punkt verbraucht, für Dubbing pro Sekunde 3 Punkte und für Avatare pro Sekunde 30 Punkte. Die Anpassung der Lautstärke oder die erneute Exportierung unveränderter Inhalte kostet in der Regel keine Punkte. Allerdings führt eine Änderung des Scripts, der Stimme, der Sprechgeschwindigkeit, der Tonhöhe oder der Stimmung dazu, dass der Inhalt neu erstellt werden muss – mit entsprechendem Punktverbrauch.
Anleitung zur Verwendung von Speechify
PDFs oder Webseiten in audible Inhalte umwandeln
- Registrieren Sie sich bei Speechify und wählen Sie Web, Mobil oder Browser-Erweiterung aus;
- Dateien hochladen, Webseiten einfügen oder aus der Cloud importieren;
- Überprüfen Sie den OCR-Text, die Reihenfolge der Überschriften und die Spracherkennung;
- Wählen Sie die passende Stimme, Sprache und Wiedergabegeschwindigkeit aus;
- Aktivieren Sie die synchronisierte Hervorhebung und stellen Sie das Überspringen von Seitenkopf und -fuß ein;
- Prüfen Sie zunächst die Struktur des Originaltextes, bevor Sie einen Zusammenfassung oder Fragen und Antworten verwenden.
- Nach Abschluss löschen Sie die nicht mehr benötigten sensiblen Daten.
Kommerzielle Synchronisation mit Studio erstellen
- Es wird bestätigt, dass für den jeweiligen Anwendungsfall Studio und nicht Reader erforderlich ist;
- Wählen Sie ein kostenpflichtiges Paket mit kommerziellem Nutzungsrecht;
- Importieren Sie das Skript und teilen Sie die Szenen sowie die Sprecher nach Abschnitten auf;
- Wählen Sie eine autorisierte Stimme aus und passen Sie Aussprache, Pausen und Stimmung an;
- Testen Sie mit kurzen Abschnitten, bevor Sie das vollständige Projekt erstellen;
- Überprüfung von Namen, Zahlen, mehrsprachigen Übersetzungen und Lippenbewegungen im Rhythmus;
- Sichern Sie die Genehmigungsprotokolle und geben Sie die durch KI erzeugten Inhalte gemäß den Vorgaben preis.
Über API-Anbindung an TTS
- Erstellen und Beschränken von API-Schlüsseln in der Entwicklungskonsole;
- Speichern Sie den Schlüssel in der Serverumgebung oder in Secrets.
- Installieren Sie das offizielle Python- oder TypeScript-SDK;
- Zuerst sollten Ton, Modell und Audioformat mit kurzen Texten getestet werden;
- Für Echtzeit-Szenarien wird die Stream-API verwendet, für Dateiszenarien die Speech-API.
- Lange Texte in Abschnitte aufteilen und Throttling, Zeitüberschreitungen sowie Wiederholungsversuche verarbeiten;
- Protokollieren Sie die Zeichenkosten, wechseln Sie die Schlüssel und führen Sie eine Inhaltssicherung durch.
Für welche Nutzer eignet sich Speechify?
- Anwender mit Lesebehinderung, Sehproblemen oder Konzentrationsproblemen: Umwandlung von Text in hörbaren Inhalt;
- Studenten und Forscher: Vorlesen von Lehrmaterialien, Aufsätzen und Übungsmaterialien;
- Wissensarbeiter: Dokumente während der Pendelzeit oder bei mehreren Aufgaben anhören;
- Sprachlerner: Kombination aus mehrsprachigen Audiodateien und synchronen Hervorhebungsaufgaben;
- Video- und Podcast-Ersteller: Erstellung von Kommentaren, Charakterstimmen und Lokalisierung;
- Bildung und Unternehmensteams: Einsatz von Hilfsmitteln für das Lesen sowie Schulungsinhalten;
- Entwickler: Ermöglichung von TTS für Produkte, Sprachagenten und Barrierefreiheitsfunktionen.
Vorteile von Speechify
- Lesegeräte decken Webseiten, Dateien, gescannten Text sowie verschiedene Geräte ab;
- Reichhaltige Auswahl an natürlichen Geräuschen, Sprachen und Akzenten;
- Synchronisierte Hervorhebung, Geschwindigkeitssteuerung und Synchronisierung über Geräte eignen sich für das Lesen langer Texte;
- Reader, Studio und API decken Szenarien von Privatpersonen bis hin zu Entwicklern ab;
- Studio integriert Synchronisation, Dubbing, Stimmenveränderung, Kloning und Materialien;
- Die API unterstützt fließende Ausgabe, SSML, Emotionen sowie Zeitstempel auf Wortebene;
- Es werden offizielle Python- und TypeScript-SDKs sowie Beispielprojekte bereitgestellt.
Einsatzbeschränkungen und Hinweise
- Reader, Studio und API sind eigenständige Produkte, die vor dem Kauf klar voneinander unterschieden werden müssen.
- Premium-Natursprachfunktion hat eine angemessene monatliche Zeichenzahlbeschränkung für die Nutzung;
- Die kostenlose Studio-Exportversion beinhaltet keinen kommerziellen Nutzungsrechten;
- Studio: Wenn Skripte, Geräusche oder Stimmungen geändert werden, werden wieder Punkte abgezogen.
- OCR kann Formeln, Tabellen, Handschrift und komplexe Formatierungen falsch lesen;
- Bei KI-Zusammenfassungen, Übersetzungen, Fragen-Antworten und Aussprache können immer noch Fehler auftreten;
- Die Klonierung von Stimmen erfordert nachweisbare Genehmigungen und eine entsprechende Zustimmung.
- Preise, Stimmen berühmter Persönlichkeiten, Werbeaktionen und regionale Steuern können sich ändern.
Privatsphäre, Sicherheit und Stimmenautorisierung
Die Datenschutzrichtlinien von Speechify besagen, dass keine personenbezogenen Daten verkauft oder vermietet werden. Stattdessen werden Kontoinformationen, Gerätedaten, Nutzungshistorien sowie vom Benutzer eingereichte Inhalte verarbeitet. Mitarbeiter sehen in der Regel keine Inhalte der Benutzer, können diese jedoch in Fällen wie Supportanfragen, Ermittlungen wegen Verstößen, gesetzlichen Anforderungen oder zur Verbesserung der Algorithmen einsehen.
Bevor Arbeitsdokumente, unveröffentlichte Manuskripte, Studentendaten oder geschützte Informationen hochgeladen werden, sollten die geltenden Verträge sowie die Genehmigungen der Organisation überprüft werden. Dritte Cloud-Dienste, Browser-Erweiterungen sowie externe Ressourcen führen außerdem zu zusätzlichen Datenverarbeitern.
- Laden Sie nur Texte, Audiodateien, Videos und Bilder hoch, für die Sie die Bearbeitungsrechte haben;
- Vor der Klonierung einer Stimme muss die ausdrückliche, schriftliche Zustimmung des Sprechers eingeholt werden;
- Es ist nicht zulässig, mit künstlichen Stimmen zu täuschen, Betrug zu begehen oder die Öffentlichkeit in die Irre zu führen;
- Klare AI-Stimmenangaben zu APIs und kommerziellen Fertigprodukten;
- Einschränkung der Lizenz für Cloud-Speicher, Projektmitarbeiter und Download-Rechte;
- Regelmäßig Dateien, Audiosamples, API-Schlüssel sowie ungültige Konten bereinigen.
Erklärungen zu API, GitHub und Open Source
Speechify bietet eine REST-API sowie offizielle Python- und TypeScript-SDKs an. Beispiele für die API sind auf GitHub verfügbar. Die alten SDK-Repositories sind nicht mehr in Gebrauch; Entwickler sollten die in den aktuellen Dokumentationen aufgeführten neuen Pakete und Authentifizierungsmethoden verwenden.
Die Veröffentlichung von SDKs und Beispielcode bedeutet nicht, dass die Speechify-Stimmmodellierung, der Reader oder die Studio-Plattform open source sind. Die Kernmodelle sowie die Hosted-Dienste können nicht vollständig in privater Umgebung über diese Repositorien bereitgestellt werden.
Häufige Fragen
Ist Speechify kostenlos?
Sowohl Reader als auch Studio bieten kostenlose Versionen an. Die API stellt außerdem eine Testmenge von 50.000 Zeichen zur Verfügung. Die Funktionen der kostenlosen Version sowie die Möglichkeiten bezüglich Audio, kommerzieller Nutzung und Generierung sind eingeschränkt.
Wie viel kostet Speechify Premium?
Der aktuelle Monatspreis auf der offiziellen Website beträgt 29 US-Dollar. Bei Jahreszahlungen sowie für neue Nutzer können Rabatte gewährt werden. Vor der Zahlung sollten Währung, Steuern, Verlängerungspreise sowie Bedingungen für Rückerstattungen überprüft werden.
Was ist der Unterschied zwischen Speechify Reader und Studio?
Reader wird zum Anhören von Webseiten und Dokumenten für den privaten Gebrauch verwendet, Studio dagegen zur Erstellung und Exportierung von Kommentaren, Synchronisationen und Videos. Beide sind als separate Abonnements erhältlich.
Unterstützt Speechify Chinesisch?
Chinesisch sowie mehrere andere Sprachen und Akzente werden unterstützt, doch die Sprachunterstützung für verschiedene Produkte, Stimmen und Funktionen ist nicht vollständig identisch. Vor der offiziellen Veröffentlichung sollten Aussprache und Mehrsilbenwörter getestet werden.
Ist Speechify Open Source?
Nein, die Kernprodukte und -modelle sind nicht open source. Offiziell werden nur Teile des SDKs, Beispiele sowie historische Integrationsskripte veröffentlicht.
Guigong-Netzwerk-Sicherheitsnummer: 45132202000164