AI Dubbing You Direct
AI Dubbing You Direct – macht die Arbeit mit künstlicher Sprachsynthese effizienter und einfacher.
Tags:KI-Audio-ToolsWas ist Dubformer?
Dubformer ist eine AI-gestützte Plattform für die Synchronisation in der Film- und Fernsehindustrie sowie bei Medien- und Lokalisierungsunternehmen. Die offizielle Website betont den Ansatz „AI Dubbing You Direct“. Dabei wird Wert darauf gelegt, dass ein professionelles Team die Arbeit Schritt für Schritt begleitet und überprüft – anstatt dass die Videodateien einfach automatisch bearbeitet werden.
Die Plattform kann Audiomaterial transkribieren, die Sprecher erkennen, Dialoge übersetzen, Stimmen miteinander abgleichen, mehrere Auftritte erstellen und Versionen in verschiedenen Sprachen bereitstellen. Auf der offiziellen Website wird angegeben, dass sie mehr als 140 Sprachen sowie über 1000 verschiedene Stimmen unterstützt.
Hauptfunktionen
1. Automatische Transkription und Sprechererkennung
Nach dem Hochladen des Videos und der Auswahl der ZielSprache übersetzt das System den Ausgangsaudioinhalt, erkennt die verschiedenen Sprecher und erstellt eine Cue-Liste mit Zeitcodes. Vor der endgültigen Erstellung kann man die Segmentierung sowie die Übereinstimmung der Rollen und Materialien überprüfen.
2. Mehrsprachige Video-Synchronisation
Dubformer unterstützt mehr als 140 Sprachen und ermöglicht es, in einem Projekt mehrere Sprachversionen zu erstellen. Jede Sprache kann eigene Charaktere, Stimmen, Überprüfungsstatus sowie Ausgabeunterlagen haben.
3. Stimmenübereinstimmung der Charaktere
Das Team kann für jede Figur aus mehr als 1000 Klangfarben eine auswählen, wobei das System auch Kandidaten vorschlägt, die der ursprünglichen Figur ähneln, und diese bewertet. Beschränkte Klangfarben können nach Ordnern und Projektrechten getrennt werden.
4. Emotion Transfer
Emotion Transfer wird verwendet, um die Emotionen und den Rhythmus der ursprünglichen Darbietung in die Zielsprache zu übertragen, anstatt lediglich den übersetzten Text vorzulesen. Es eignet sich dazu, Pausen, Betonungen und Stimmungswechsel in Film- und Seriendialogen beizubehalten.
5. Anleitung zur Synchronisation Satz für Satz
Der Editor kann für jeden Ausdruck Emotionen wie Wut, Freude, Flüstern, Traurigkeit oder Überraschung auswählen und auch eigene Anweisungen für die Darbietung eingeben. Das System erzeugt mehrere Aufnahmen, die das Team anhört, um die beste Version auszuwählen.
6. Aussprache, Rhythmus und Stabilitätskontrolle
Die Plattform ermöglicht es, die Aussprache, die Art der Darstellung, die Dauer sowie den Grad der Stimmveränderungen Satz für Satz anzupassen. Der Stabilitätsregler lässt sich dazu nutzen, zwischen Konstanz der Charakterdarstellung und einer vielfältigeren Darbietung abzuwägen.
7. Mehrpersonen-Zusammenarbeit und Freigabe
Redakteure, Lektorate und Verwaltungsmitarbeiter können im selben Workflow Nachrichten hinterlassen, überprüfen und mit einer Freigabestempelung bestätigen. Rollenrechte, Projektrechte und Sprachstatus ermöglichen es, mehrere Versionen parallel voranzutreiben.
8. Export im Rundfunkformat
Studio kann Sprachspuren in 44,1 kHz Exportieren, die endgültige Mischung mit Originalmusik und Effekten, M&E-Spuren sowie MP4-Dateien mit eingebetteten Untertiteln. Auf der offiziellen Website werden außerdem Untertiteldateien im Format VTT, SRT, TTML, XLSX und CSV aufgeführt.
9. API-Schnittstelle
Die offiziellen Dokumentationen bieten eine Plattform-API für die selbstständige Video-Untertitelung sowie eine professionelle Text-zu-Stimme-API. Das Entwicklerteam kann über diese Schnittstellen Prozesse für den automatischen Upload, die Untertitelung, die Abfrage des Status sowie das Abrufen der Ergebnisse einrichten.
Für welche Benutzer geeignet
- Lokalisierungsunternehmen für die Produktion von Fernsehserien, Dokumentarfilmen, Animationsfilmen und Online-Programmen.
- Medien- und Streaming-Teams, die in der Lage sind, mehrsprachige Kanäle in großen Mengen zu veröffentlichen.
- Film- und Fernsehproduktionsteams, die die Emotionen der Charaktere sowie die schauspielerischen Details beibehalten müssen.
- Unternehmen, die eine mehrfache Überprüfung, Zugriffskontrolle und nachvollziehbare Prozesse benötigen.
- Entwickler, die durch API-Integration Video-Dubbing oder Sprachsynthese ermöglichen möchten.
Produktversionen und Preise
Stand dem 24. August 2026 gibt die offizielle Website einen festen Preis für Studio Pilot an. Für die Services „Official Studio“, „Self-Service Dubbing API“ sowie „TTS API“ werden hingegen keine einheitlichen Preise angegeben. In der folgenden Übersicht sind nur die Informationen aufgeführt, die derzeit auf der offiziellen Seite überprüft werden können. Die endgültigen Kosten, Steuern sowie Bedingungen für die Verlängerung gelten gemäß den Angaben auf der Bestell- oder Zahlelseite.
| Produkte | Offener Preis | Anwendbare Personen | Hauptinhalt |
|---|---|---|---|
| Studio Pilot | 400 US-Dollar/Zwei Wochen | Team zur Bewertung professioneller Workflows | 120 Credits, zusätzlich 3 US-Dollar pro Credit, unbegrenzte Plätze, Anleitung zur Einführung, Qualität bewertet in 6 Dimensionen pro Abschnitt |
| Professional Studio | Kontaktieren Sie den Verkauf | Lokalisierung und Filmproduktionsfirmen | Komplexe Projektverwaltung, professionelle Bearbeitung, mehrfache Überprüfung durch verschiedene Personen, Berechtigungen sowie Auslieferung in Broadcast-Qualität |
| Self-Service Dubbing API | Nach der Registrierung ansehen | Entwickler, die eine automatische Video-Synchronisation benötigen | Videos über die API einreichen, Verarbeitungsparameter konfigurieren und Ergebnisse abrufen |
| Professional TTS API | Kontaktieren Sie den Verkauf oder die Konsole zur Bestätigung. | Produktteams, die mehrsprachige Sprachsynthese benötigen | Erstellung professioneller Sprachausgaben nach Sprach- und Regionscodes |
Die offizielle Website erklärt auf den öffentlichen Seiten nicht, wie viele Minuten ein Credit entspricht, sowie welche Sprachen, Rollen oder Anzahl an Erstellungen damit möglich sind. Vor dem Kauf sollten die tatsächlichen Kosten des Projekts anhand der genauen Berechnungsvorschriften im Pilot-Protokoll oder in der Konsole ermittelt werden.
Vor dem Kauf sollte man sich vergewissern.
- Die genaue Verbrauchsweise von 120 Credits sowie ob bei fehlgeschlagenen Aufgaben Gebühren anfallen.
- Wird für Übersetzung, Transkription, Emotionsgenerierung, Neugenerierung und Export jeweils separat abgerechnet?
- Der offizielle Plan nach Ablauf der zweiwöchigen Pilotphase, die Mindestmenge sowie die Möglichkeiten zur Verlängerung.
- Einfluss der Quellsprache, Zielsprache, Video-Länge und Kanäle auf die Kosten.
- Werden eigene Klangfarben, Stimmenklonierung und Lip-Sync extra berechnet?
- Servicelevel, Konkurrenzfähigkeit, Lieferzeit und Unterstützungsumfang.
Dubformer-Anleitung
- Videomaterial, Drehbücher und Soundeffekte bereitstellen, für die Synchronisation und Übersetzungslizenzen vorliegen.
- Laden Sie das Quellvideo hoch, wählen Sie die Quellsprache sowie eine oder mehrere Zielsprachen aus.
- Überprüfen Sie die automatisch erkannten Sprecher, Zeitcodes und Dialogabschnitte.
- Überarbeiten des Transkripts und Überprüfung der Übersetzung in die Zielsprache durch Muttersprachler.
- Wählen Sie für jede Rolle einen Library-Sound oder einen lizenzierten Exklusiv-Sound aus.
- Für jeden Satz werden Stimmung, Aussprache, Rhythmus, Dauer und Stabilität festgelegt.
- Hören Sie sich mehrere Takes an und wählen Sie die Version aus, die zur Rolle und zur Szene passt.
- Die Qualitätskontrolle wird von Sprachkorrektoren, Tonspezialisten und Projektleitern durchgeführt.
- Erstelle die endgültige Sprachversion und exportiere Spuren, Mix, Video und Untertitel.
- Überprüfen Sie in der echten Wiedergabenumgebung Lautstärke, Synchronisation, Aussprache und Untertiteltiming.
Methoden zur Verbesserung der Qualität der Synchronisation
- Zuerst wird die Transkription der Quellsprache korrigiert, um zu vermeiden, dass Fehler weiter in die Übersetzung und Synchronisation übertragen werden.
- Erfassen Sie eine einheitliche Aussprachentabelle für Namen, Markennamen, Ortsnamen und Fachbegriffe.
- Prüfung der Semantik, der Umgangssprache und der kulturellen Anpassung durch Muttersprachler der Zielsprache.
- Bei der Auswahl der Stimmen für die Charaktere werden gleichzeitig das Alter, der Klang der Stimme, die Sprechgeschwindigkeit und das emotionale Spektrum berücksichtigt.
- Erst die wichtigen emotionalen Passagen bearbeiten, anschließend die gewöhnlichen Dialoge in Massen erstellen.
- Zerlegen lange Sätze in Phrasen, die dem Rhythmus des Atems und der Darstellung entsprechen.
- Hören Sie sich die endgültige Mischung jeweils auf dem Handy, Fernseher, Kopfhörern und Lautsprechern an.
Vorteile des Produkts
- Es umfasst mehr als 140 Sprachen und bietet mehr als 1000 Klangfarben.
- Unterstützung der Steuerung von Stimmung, Aussprache, Rhythmus und Stabilität Satz für Satz.
- Jeder Ausdruck kann mehrere Varianten erzeugen, aus denen man manuell wählen kann.
- Beibehaltung des Prozesses mit menschlichem Regisseur, Muttersprachlern zur Korrektur und endgültiger Unterschrift.
- Unterstützung für mehrsprachige Projekte gleichzeitig und präzise Berechtigungskontrolle.
- Es können Audiospuren, die endgültige Mischung, M&E-Daten, Video sowie verschiedene Untertitelformate ausgegeben werden.
- Gleichzeitig werden professionelle Studios, Video-Dubbing-APIs und TTS-APIs bereitgestellt.
Einsatzbeschränkungen und Hinweise
- Mehr als 140 Sprachen bedeuten nicht, dass jede Sprache, jeder Akzent und jede Stimmlagequalität genau gleich sind.
- Automatische Transkription, Übersetzung, Sprechererkennung und Zeitverschiebung können alle Fehler aufweisen.
- Emotionale Übertragung kann die Synchronisationssprecher der Muttersprache und die kulturelle Überprüfung nicht ersetzen.
- Die offizielle Website gibt keine vollständigen Preise für das Studio und die API an.
- Für die Klonierung einer Stimme ist eine klare, nachweisbare Genehmigung des Sprechers erforderlich.
- Die hochgeladenen Inhalte dürfen nicht rechtswidrig, urheberrechtsverletzend oder gegen die Rechte Dritter verstoßen.
- Vor der offiziellen Ausstrahlung müssen noch Sprach-, Audio-, Synchronisierungs- und Konformitätsprüfungen durchgeführt werden.
Daten Sicherheit und Privatsphäre
Laut der offiziellen Website werden die Kundendaten nicht zur Schulung von KI-Systemen verwendet. Bei der Übertragung sowie beim statischen Speichern werden AES-256-Verschlüsselungsmethoden eingesetzt. Das Studio bietet zudem Rollenrechte, Zugriffskontrolle auf Projekte, Single-Sign-On-Funktionen für Google oder Microsoft sowie Tonsperren an.
Laut den offiziellen Datenverarbeitungsvereinbarungen gilt der Kunde als Datenkontrolleur, während Dubformer als Verarbeiter gilt. Zudem werden Anfragen gemäß der DSGVO, Benachrichtigungen an Unterauftragnehmer sowie Meldungen bei Datenlecks innerhalb von 72 Stunden festgelegt. Auf der Website wird außerdem angegeben, dass die Konformität mit SOC 2 Type II gewährleistet wird. Unternehmen sollten bei Einkäufen stets die neuesten Prüfzertifikate sowie eine Liste der Unterauftragnehmer anfordern.
- Laden Sie nur lizenzierte Geräusche, Porträts, Videos und Untertitel hoch.
- Weisen Sie den Projektmitgliedern nur die minimal notwendigen Berechtigungen zu.
- Bestätigung der Datenregion, der grenzüberschreitenden Übertragung und der Aufbewahrungsfrist.
- Nach Beendigung des Projekts werden die Inhalte umgehend exportiert und anschließend gelöscht.
- Strengeere Zulassungsregeln für Politik, Medizin, Nachrichten und Inhalte für Minderjährige.
Inhaltsrechte und Urheberrecht an der Veröffentlichung
Laut den offiziellen Bedingungen behält der Kunde das Recht, Inhalte hochzuladen. Die erzeugten Untertitelstexte gehören dem Kunden, sind jedoch weiterhin den Lizenzbedingungen des ursprünglichen Inhalts unterworfen. Die Plattform besitzt das Recht an den Systemen, Softwaren, Modellen und Dokumenten.
Das bedeutet, dass der Kauf von Dienstleistungen nicht automatisch die Nutzungsrechte an Filmen, Drehbüchern, Musik, den Stimmen der Schauspieler oder Übersetzungen einräumt. Die Nutzer sollten die Lizenzbedingungen für die Inhalte, die Genehmigungen für die Synchronisation sowie die Angaben zum Liefergebiet aufbewahren.
API-Beschreibung
In den offiziellen Entwicklungsunterlagen werden die Schnittstellen in die Platform API für selbstständiges Video-Dubbing, das professionelle Dubformer Studio sowie die TTS API eingeteilt. API-Nutzer müssen ein Konto erstellen und sich in den Dokumentationen über die verfügbaren Sprachen und Ländercodes informieren.
- Wählen Sie je nach Bedarf die Synchronisation des gesamten Videos oder eine separate TTS-Schnittstelle aus.
- Überprüfen Sie im Testkonto die Sprache, die Dateien, die Dauer sowie die Ausgabebeschränkungen.
- Speichern Sie den Schlüssel auf der Serverseite, nicht in der Webseite oder am Client.
- Zuweisung in die Aufgabenschlange, Zeitüberschreitung, Wiederholungsversuche bei Fehlern und Kostenobergrenze.
- Einführung von Verfahren für die Genehmigung von Audioinhalten, die Überprüfung von Inhalten sowie die Überprüfung der Ausgabe.
- Vor dem Go-Live werden Konkurrenzsituationen, Verzögerungen, Datelöschung und Servicelevel überprüft.
Open-Source-Situation
Es wurden weder ein offizielles Open-Source-Repositorium noch eine Lizenz für den Quellcode der Hauptplattform, der Modelle oder des Studios von Dubformer gefunden. Es sollte als kommerzielle Dienstleistung ohne Offenlegung des Quellcodes gekennzeichnet werden – die Bereitstellung einer API bedeutet nicht, dass der Kern der Modelle oder der Produktcode offen zugänglich ist.
Die auf GitHub vorhandenen Projekte für die allgemeine Sprachaufnahme oder die mit Dubformer gleichnamigen Inhalte weisen keine überprüfbare offizielle Verbindung zum Produkt auf; sie können daher nicht als offizielle Quellcodebasis oder Grundlage für eine private Implementierung herangezogen werden.
Häufige Fragen
Wie viele Sprachen unterstützt Dubformer?
Die offizielle Website gibt an, dass sie mehr als 140 Sprachen unterstützt. Welche Sprachen, Regionen und Funktionen konkret unterstützt werden, muss in den Optionen des Projekts oder der API überprüft werden.
Wie viel kostet Studio Pilot?
Stand 24. August 2026 kostet Pilot 400 US-Dollar pro Zweimonatsperiode, beinhaltet 120 Credits sowie unbegrenzte Sitzplätze; der Zusatzpreis beträgt 3 US-Dollar pro Credit.
Kann man die Emotionen Satz für Satz steuern?
Ja. Der Benutzer kann voreingestellte Stimmungen auswählen oder eigene Anweisungen eingeben und anschließend aus mehreren generierten Versionen wählen.
Welche Dateien können exportiert werden?
Die Plattform ermöglicht die Exportierung von Audiospuren, der endgültigen Mischung, von M&E-Daten sowie von synchronisierten MP4-Dateien. Zudem können Untertitel im Format VTT, SRT, TTML, XLSX und CSV exportiert werden.
Wird der Kundeninhalt zur Schulung verwendet?
Die offizielle Website gibt ausdrücklich an, dass Kundendaten nicht zur Schulung von KI-Systemen verwendet werden, und erklärt, dass die Daten bei der Übertragung sowie beim statischen Speichern verschlüsselt werden.
Ist Dubformer open source?
Nein. Derzeit gibt es keine offiziellen Open-Source-Quellcodes oder Lizenzen für das Hauptprodukt, doch die Plattform bietet kommerzielle APIs an.
Zusammenfassung
Dubformer eignet sich für professionelle Synchronisationsteams, die Wert auf Qualität der Darbietung, mehrfache Überprüfung sowie die Auslieferung für den Rundfunk legen. Zu den Vorteilen gehören Anleitung für jeden Satz, Übertragung von Emotionen, Verwaltung von Projekten in mehreren Sprachen sowie umfangreiche Exportmöglichkeiten. Vor dem Kauf sollten insbesondere die Berechnung der Entgelte, der offizielle Kostenvoranschlag, die Lizenzen für die Nutzung der Stimmen, die Datenverarbeitung sowie die tatsächliche Sprachqualität überprüft werden.
Guigong-Netzwerk-Sicherheitsnummer: 45132202000164