Die Untertitel sagen
Online-Tools für Sprachsynthese, Untertitel und Videoerstellung – Videos können ohne eigene Auftritte erstellt werden.
Tags:KI-Audio-ToolsWas steht in den Untertiteln?
Die Untertitel besagen, dass es sich um ein AI-basiertes Tool zur Abstimmung von Ton und Text für die Videobearbeitung handelt, mit dem aus vorhandenem Audio und fertigem Text eine SRT-Untertiteltimeline erstellt werden kann.
Es löst das Problem, dass der Textinhalt bereits feststeht, aber die genauen Zeitpunkte für die Untertitel fehlen – es handelt sich dabei nicht um ein gewöhnliches Tool zur Umwandlung von Sprache in Text.
Hauptfunktionen
- Laden Sie den Audio-Datei sowie den entsprechenden fertigen Text hoch.
- Automatische Abstimmung von Text- und Sprachzeitpositionen.
- Erstellung einer SRT-Untertitel-Zeitachse in Millisekunden.
- Verringerung von Eigennamen und Fehlern bei mehrdeutigen Schriftzeichen.
- Unterstützung bei der Erstellung von Untertiteln für bereits vorhandene Scripts.
- Es werden Ausrichtungsmethoden wie Abstandsbearbeitung bereitgestellt.
- Neue Nutzer können kostenlose Probeminuten erhalten.
- Es werden Pakete mit langer Laufzeit für professionelle Abstimmung angeboten.
- In dem Konto werden Aufgaben sowie Ergebnisprotokolle gespeichert.
- Die Sprachsynthesefunktion befindet sich in einer begrenzten Beta-Phase.
Für welche Benutzer geeignet
| Benutzer | Passende Szenarien | Voraussetzung |
|---|---|---|
| Kurzvideo-Ersteller | Untertitel für Sprachaufnahmen und Kommentare erstellen | Die Aufnahme wird im Grunde nach dem Text vorgelesen. |
| Kurslehrer | Erstellung von Kursen und untertitelten Inhalten gegen Bezahlung | Vollständige Vorlesungsnotizen beibehalten |
| Unternehmensausbilder | Untertitel für Schulungsvideos bearbeiten | Erhaltung der Berechtigung zur Nutzung von Audio- und Videomaterialien |
| Podcast-Editor | Erstellung einer Zeitachse für audiovisuelle Materialien | Improvisierte Inhalte sollten nicht zu viele sein. |
| Team für audiovisuelle Inhalte | Passende Texte zu echten Aufnahmen | Einzelspur-Klang ist klar. |
| Video-Postproduktions-Mitarbeiter | Nach dem Exportieren als SRT fortfahren mit der Formatierung | Es ist weiterhin eine manuelle Stichprobenkontrolle zu den jeweiligen Zeitpunkten erforderlich. |
Unterschied zwischen Ton-Text-Alignierung und Spracherkennung
| Projekt | Phonem-Text-Alignierung | Spracherkennung |
|---|---|---|
| Ist ein Text notwendig? | Es ist ein entsprechender, endgültiger Text erforderlich. | Normalerweise ist das nicht notwendig. |
| Hauptaufgabe | Suche nach der Zeitposition jedes Textabschnitts | Textinhalt aus der Sprachstimme erraten |
| Eigennamen | Direkte Verwendung des vom Benutzer bereitgestellten Textes | Kann als Homonym erkannt werden |
| Improvisierte Inhalte | Bei großen Abweichungen kann eine Ausrichtung fehlschlagen. | Man kann versuchen, es direkt zu transkribieren. |
| Schlüsselpunkte der Ausgabe | Untertiteltimelines | Transkription des Textes |
| Eignete Materialien | Audio- und Video-Dateien mit Vortrag nach dem Manuskript | Vorträge, Interviews und freie Reden |
Wie funktioniert die Ton-Text-Abstimmung?
Das System verwendet den vom Benutzer bereitgestellten Text als Grundlage, sucht im Audio nach den entsprechenden Stellen für Anfang und Ende der Sätze und erstellt anschließend die Untertitelblöcke.
Daher ergibt sich die Genauigkeit des Textes aus dem endgültigen Entwurf, während die Zeitgenauigkeit von der Qualität der Aufnahme, der Einheitlichkeit der Vorlesung und der Satzteilung abhängt.
- Die endgültige Version des Sprechtextes vorbereiten.
- Exportieren Sie klares, unverarbeitetes Audiomaterial.
- Stellen Sie sicher, dass die Reihenfolge der Aufnahme und des Textes übereinstimmt.
- Laden Sie den Audio-Datei hoch und fügen Sie den Text ein.
- Wählen Sie die geeigneten Ausrichtungseinstellungen aus.
- Übermitteln Sie die Aufgabe und warten Sie auf die Bearbeitung.
- Voranschau der Untertiteltage und Zeichensetzung.
- Korrigiere fehlende Lesungen, zusätzliche Lesungen und Pausenpositionen.
- Exportieren Sie eine SRT-Datei für das Schnittbearbeiten.
Wie man Audio vorbereitet
| Projekt | Empfehlungen | Es sollte vermieden werden. |
|---|---|---|
| Klang | Die Stimme soll klar bleiben und der Lautstärkepegel konstant sein. | Lautstärkeüberschreitung, zu leise Tonhöhe und starke Hallwirkung |
| Hintergrund | Verwenden Sie möglichst stimmliche Aufnahmen ohne Musik. | Die Musik übertönt die Gespräche. |
| Anzahl der Personen | Es ist einfacher, eine einzelne Person beim kontinuierlichen Vorlesen in Einklang zu bringen. | Mehrere Personen unterbrechen sich gegenseitig und sprechen gleichzeitig. |
| Montage | Der Text und das auditive Material bleiben in derselben Reihenfolge. | Sätze kürzen, ohne den Text zu ändern |
| Pause | Beibehaltung der natürlichen Satzpausen | Lange Leerphasen und wiederholte Abschnitte |
| Dokumente | Verwenden Sie klaren und einwandfrei abspielbaren Audio. | Beschädigte Dateien und mehrfaches Konvertieren bei niedriger Bitrate |
Wie man Texte vorbereitet
Je näher der Text dem tatsächlichen Sprechtext ist, desto stabiler ist die Übereinstimmung; Satzzeichen und Absatztrennungen beeinflussen außerdem den Lesetakt der Untertitelblöcke.
- Verwenden Sie die tatsächlich bei der Aufnahme verwendete Version.
- Löschen Sie die unvorgelesenen Überschriften und Anmerkungen.
- Fügen Sie die tatsächlich im Aufnahmegerät vorkommenden Sätze ein.
- Einheitliche Schreibweise für Zahlen, Einheiten und Eigennamen.
- Setzen Sie natürliche Satzzeichen entsprechend der Bedeutung und des Sprachtempos.
- Fügen Sie keine Zeitcodes oder irrelevante Anmerkungen hinzu.
- Lange Texte werden zunächst in Abschnitten bearbeitet.
Was sind SRT-Untertitel?
SRT ist ein gängiges Untertitelformat, bei dem jeder Untertitelblock eine Nummer, einen Startzeitpunkt, einen Endzeitpunkt sowie den zu zeigenden Text enthält.
Nach der Erstellung kann es in die meisten Video-Editor- und Player-Programme importiert werden, doch Schriftarten, Farben und Positionen müssen in der Bearbeitungssoftware eingestellt werden.
| Überprüfungspunkte | Warum ist es wichtig? | Behandlungsmethoden |
|---|---|---|
| Startzeit | Die Untertitel dürfen nicht deutlich vor der Sprachaufnahme erscheinen. | Hören Sie sich Abschnitt für Abschnitt an und justieren Sie leicht. |
| Endezeit | Vermeiden Sie, dass die Untertitel zu früh verschwinden oder übereinanderliegen. | Bewahren Sie eine angemessene Lesezeit bei. |
| Länge einer Zeile | Zu lange Texte beeinträchtigen die Lesbarkeit auf Mobilgeräten. | In semantische Kurzsätze aufteilen |
| Anzahl der Untertitel | Zu feine Splitter können dazu führen, dass das Bild zittert. | Kombinieren von aufeinanderfolgenden Phrasen |
| Kodierung | Fehlerhafte Kodierung kann unsinnige Zeichen anzeigen. | Verwenden Sie die von dem Editor unterstützte UTF-Kodierung. |
Handhabung von Abständen und Pausen
Pausen im Vortrag, Atemzüge und leere Abschnitte beeinflussen die Aufteilung der Untertitelblöcke – man darf sich nicht nur darauf verlassen, dass der Text identisch ist.
- Kurze Pausen können im selben Untertitelblock beibehalten werden.
- Am semantischen Ende eignet sich ein neuer Untertitelsegment.
- Der vorherige Untertitel sollte rechtzeitig vor einer langen Pause beendet werden.
- Die Hintergrundmusik sollte nicht zwangsläufig zum Text passen.
- Die Einleitungs- und Abspannsequenzen können in der Videobearbeitungssoftware separat bearbeitet werden.
- Nach der Exportierung überprüfen Sie die Synchronisation erneut bei der endgültigen Framerate.
Die Untertitel besagen: Vollständige Anleitung zur Nutzung
- Gehen Sie auf die offizielle Website, wie in den Untertiteln angegeben.
- Registrieren Sie ein Konto und erhalten Sie einen Probeneinsatz.
- Wählen Sie die Funktion zur Ton-Text-Abstimmung aus.
- Klaren Audio-Dateien ohne Hintergrundmusik bereitstellen.
- Die endgültige Textversion wird so bearbeitet, dass sie mit der Aufnahme übereinstimmt.
- Entfernen Sie die unvorgelesenen Überschriften und Anmerkungen.
- Laden Sie den Audio-Datei hoch und fügen Sie den vollständigen Text ein.
- Überprüfen Sie die Dauer, die Datei- und Zeichenzahlbeschränkungen.
- Wählen Sie die Einstellungen für Ausrichtung oder Abstand aus.
- Übermitteln Sie die Aufgabe und warten Sie auf die Erstellung.
- Voranschau der Untertitel und der Synchronisation des Tonfalls.
- Achten Sie besonders auf die Pausen und die Stellen mit umfangreichen Überarbeitungen.
- Laden Sie die generierten SRT-Untertitel herunter.
- Ein Video-Editor-Programm importieren.
- Einstellen von Schriftart, Position und Untertitelformat.
- Überprüfen Sie die vollständige Wiedergabe des Endvideos.
Kostenloser Datenvolumen und Profipakete
Die aktuelle Startseite bietet bei der Anmeldung 100 Minuten kostenlos zum Ausprobieren an und zeigt außerdem ein Profipaket an, das für 125 Yuan 30.000 Minuten umfasst.
| Projekt | Preis oder Limit | Erklärung |
|---|---|---|
| Neue Benutzererfahrung | 100 Minuten | Nach der Registrierung erhältlich, die Teilnahmeregeln können sich ändern |
| Professionelles Ausrichtungspaket | 125 Yuan | Enthält 30.000 Minuten |
| Umrechnungskurs | Etwa 0,004 Yuan pro Minute | Schätzung nach Gesamtpreis des Pakets und Anzahl der Minuten |
| Sprachsynthese | Neue Preise sind noch nicht veröffentlicht. | Derzeit in begrenztem Beta-Test oder kurz vor dem Release. |
Die genauen Gültigkeitsdauer, Rückerstattungen, Rechnungen sowie Nutzungseinschränkungen richten sich nach den Bedingungen auf der Kaufseite nach dem Anmelden sowie den Zahlungsbedingungen.
Wie sieht es mit den alten Mitgliedsregeln aus?
Die alte offizielle Mitgliederseite zeigt weiterhin an, dass man durch einen Einzahlung von 100 Yuan 10.000 Punkte erhält und somit zum lebenslangen Mitglied wird, sowie die bisherigen Vorteile wie Sprachsynthese.
Da die aktuelle Startseite die Sprachsynthese als begrenzte Beta-Version ausweist, können die Rechte der alten Version nicht direkt als Verpflichtung für die neue Version angesehen werden.
| Informationen | Inhalt der alten Seite | Aktuelle Nutzungsempfehlungen |
|---|---|---|
| Mitgliedschaftsbedingungen | Einmalige Aufladung ab 100 Yuan | Prüfen Sie vor dem Kauf, ob es noch gültig ist. |
| Punkte | Erhalten Sie 10.000 Punkte, wenn Sie 100 Yuan aufladen. | Überprüfen, für welche aktuellen Funktionen es verwendet werden kann |
| Abo-Dauer | Die Seite besagt, dass es lebenslang aufbewahrt wird. | Überprüfung des tatsächlichen Kontostands |
| Sprachsynthese | Einst wurden verschiedene Mitgliedsvorteile angeboten. | Die aktuelle Startseite ist als Beta-Version gekennzeichnet. |
| Phonem-Text-Alignierung | Es gab tägliche und geschenkte Limits. | Gemäß der Seite mit den neuen Paketen. |
Der aktuelle Stand der Sprachsynthesefunktionen
Auf der aktuellen Startseite der offiziellen Website wird TTS als „bald verfügbar“ oder „in begrenztem Beta-Zustand“ angezeigt, weshalb normale Nutzer davon ausgehen müssen, dass es noch nicht vollständig verfügbar ist.
- Berücksichtigen Sie die Anzahl der aktuellen Sprecher nicht gemäß den Versprechen in älteren Artikeln.
- Laden Sie nicht erst Geld auf, bevor Sie annehmen, dass TTS verwendet werden kann.
- Die Berechtigung für die Beta-Testung, die Audiofunktionen sowie die Datenvolumina können unterschiedlich sein.
- Für die kommerzielle Nutzung der Synchronisation müssen die geltenden Lizenzbedingungen überprüft werden.
- Die Ansprüche des alten Kontos müssen nach dem Anmelden separat überprüft werden.
Wie versteht man „100% genau“?
Die Angabe einer 100%-Genauigkeit auf der offiziellen Website ist eine Marketingaussage, die hauptsächlich darauf abzielt, hervorzuheben, dass der Text der Untertitel aus dem von den Nutzern bereitgestellten Endtext stammt.
Es garantiert keine absoluten Fehler in Bezug auf den Zeitverlauf, die Trennung der Abschnitte, das Umgang mit Auslassungen sowie unter allen Audiobedingungen; vor der Veröffentlichung ist daher eine manuelle Überprüfung erforderlich.
| Situation | Mögliche Ergebnisse | Schwerpunkte der Überprüfung |
|---|---|---|
| Vorlesen nach dem Entwurf | In der Regel ist eine Abstimmung einfacher. | Pausen und Länge der Untertitelsegmente |
| Kleine Aussprachefehler | Mögliche fehlerverzeihende Ausrichtung | Zeitpunkte vor und nach dem Fehler |
| Massive Improvisation | Mögliche Fehlmatches oder Sprünge in den Abschnitten | Text umformulieren und nach der Transkription neu strukturieren |
| Mehrfachgespräch | Die Rollen und Reihenfolge können durcheinandergeraten. | Getrennte Verarbeitung oder in Abschnitten |
| Die Hintergrundmusik ist ziemlich laut. | Die Zeitbestimmung kann beeinträchtigt werden. | Mit trockener Stimme erneut einreichen |
Urheberrecht und Privatsphäre
Audio-, Text- und Videomaterial können vertrauliche Inhalte enthalten; vor dem Hochladen sollten die Richtlinien der Plattform sowie die Anforderungen an die Vertraulichkeit des Projekts überprüft werden.
- Bearbeiten Sie nur Aufnahmen, die Ihnen gehören oder für die Sie autorisiert sind.
- Für die Stimmen der Personen sowie den Inhalt der Interviews ist eine Genehmigung erforderlich.
- Der Script darf keine Kontoinformationen oder Identifikationsdaten enthalten.
- Kurse zum Thema Wirtschaft sollten die Urheberrechte an den Materialien berücksichtigen.
- Für geheime Projekte ist zunächst die Vorschrift der zuständigen Einheit zu konsultieren.
- Verwalten Sie die Cloud-Aufgaben rechtzeitig nach dem Herunterladen der Ergebnisse.
- Entfernen Sie sensible Untertitelinhalte vor der Veröffentlichung nach außen.
API und Open Source
Derzeit wurden keine Untertitel gefunden, die auf eine öffentliche API, ein offizielles SDK, ein Repository mit dem Quellcode des Produkts oder ein verifizierbares offizielles GitHub-Projekt hinweisen.
| Projekt | Aktuelle Situation | Erklärung |
|---|---|---|
| Web-Tools | Bereitgestellt | Nach der Registrierung die Ton-Schrift-Alignierung verwenden |
| Öffentliche API | Noch nicht veröffentlicht | Entwickler-Dokumentation nicht gefunden |
| Offizielles SDK | Noch nicht veröffentlicht | Kein verifizierbares Entwicklungs-Paket gefunden. |
| Quellcode des Produkts | Nicht open source | Online-Geschäftsdienste |
| Offizieller GitHub | Noch nicht bestätigt | Projekte mit demselben Namen können nicht als offiziell angesehen werden. |
Vorteile des Produkts
- Konzentrieren Sie sich auf den Zeitstrahl der Untertitel für audiodateien mit Text.
- Verringerung der Tippfehler durch die allgemeine Erkennung.
- Es ist möglich, im universellen SRT-Format zu exportieren.
- Die Registrierung bietet kostenlose Probeminuten.
- Der Preis für das Paket mit längerer Laufzeit ist niedriger.
- Geeignet für Kurse und festgelegte Texte für Sprachaufnahmen.
Nutzungsbeschränkungen
- Es muss ein Text vorbereitet werden, der zur Aufnahme passt.
- Eignet sich nicht für die direkte Transkription von umfangreichen Improvisationen.
- Hintergrundmusik und mehrere sprechende Personen erhöhen die Schwierigkeit.
- Die Genauigkeit der Marketingmaßnahmen bedeutet nicht, dass keine manuelle Überprüfung mehr notwendig ist.
- Die alten Mitgliedsregeln können sich von den aktuellen Produkten unterscheiden.
- Sprachsynthese ist derzeit nicht als vollständig verfügbare Funktion verfügbar.
- APIs, SDKs und Open-Source-Code sind derzeit noch nicht veröffentlicht.
Häufige Fragen
Was können Untertitel im Grunde tun?
Es synchronisiert die vorhandenen Audiodateien mit dem fertigen Text und erzeugt automatisch SRT-Untertiteldateien, die in Bearbeitungsprogramme importiert werden können.
Sagen die Untertitel, es handelt sich um ein Tool zur Spracherkennung?
Nein, es dient hauptsächlich der Zuordnung von Ton und Text – der Benutzer muss zunächst den entsprechenden Text bereitstellen. Freies Sprechen ohne Text eignet sich besser für Spracherkennungstools.
Sagt die Untertitelung, dass sie kostenlos genutzt werden können?
Ja, neue Nutzer können bei der Registrierung 100 Minuten kostenlose Nutzung erhalten. Die Details zu der Aktion sowie die Bedingungen für die Inanspruchnahme sind auf der Konto-Seite zu finden.
Was kostet das Professional-Paket, steht im Untertitel?
Auf der offiziellen Website wird angegeben, dass 125 Yuan 30.000 Minuten umfassen – das entspricht etwa 0,004 Yuan pro Minute. Die genaue Gültigkeitsdauer ist auf der Zahlungsseite zu entnehmen.
Sagen die Untertitel, dass die erzeugten Untertitel unbedingt genau sein müssen?
Texte, die auf den Inhalten des Benutzers basieren, können Tippfehler verringern, doch bei Zeitachsen, Satzzeichen und Abweichungen im Text können immer noch Fehler auftreten. Vor der Veröffentlichung muss alles sorgfältig überprüft werden.
Sagen die Untertitel, dass jetzt Sprachsynthese verfügbar ist?
Die aktuelle Startseite ist als bald verfügbar oder in einer begrenzten Beta-Phase gekennzeichnet; die Sprachsynthese-Funktionen der alten Mitgliederseite können nicht direkt als vollständig verfügbar angesehen werden.
Sagen die Untertitel, dass eine API oder Open-Source-Code bereitgestellt wird?
Derzeit wurden keine überprüfbaren öffentlichen APIs, offizielle SDKs, Quellcode-Repositorys für das Produkt oder offizielle GitHub-Projekte gefunden.
Guigong-Netzwerk-Sicherheitsnummer: 45132202000164