Dubbing and AI
Kostenloser Mehrwert
Komplette Liste an KI-Tools KI-Audio-Tools

Dubbing and AI

Dubbing und KI – damit die KI bei der Erstellung von Audiodateien effizienter und einfacher arbeiten kann

Tags:

Dubbing und KI entsprechen in Wirklichkeit Deepdub.

„Dubbing and AI“ in der Datenbank stammt vom Titel der Produktseite; der tatsächliche Markenname ist Deepdub. Es handelt sich um eine unternehmensgerechte AI-Technologie für Synchronisierung und Sprachverarbeitung, die für Medien, Rundfunk, Postproduktion sowie Sprachassistenten verwendet wird.

Deepdub bietet außerdem die Funktionen der emotionalen Text-zu-Stimme-Umwandlung, Stimmenklonierung, Voice-to-Voice-Übersetzung, Synchronisation von Filmen und Videos, Echtzeit-Synchronisation für Live-Übertragungen sowie eine Entwickler-API. Es handelt sich dabei nicht um eine Anwendung zur sofortigen Übersetzung kurzer Videos für normale Nutzer; viele der Dienstleistungen erfordern eine Kontaktaufnahme mit dem Team zur Konfiguration.

Hauptproduktfähigkeiten

FähigkeitenEingabeAusgabePassende Szenarien
Emotionales TTSTexte, Sprache, Ton und EmotionsparameterStimme mit Rhythmus, Betonung und AusdruckAgenten, Kommentatoren, Kundenservice und Schulung
KlangklonierungGenehmigte SprachprobenDigitale Geräusche, die in verschiedenen Sprachen verwendet werden könnenMarkenstimme, Schauspieler und Moderatoren-Erweiterung
Voice-to-VoiceDie vollständige Darbietung des Schauspielers oder SynchronsprechersNeue Stimmen, die Tonfall und Rhythmus beibehaltenFilm- und Fernsehcharaktere sowie Inhalte mit starken Emotionen
MedienerzählungVideos, Tonspuren, Drehbücher und FachbegriffeÜbersetzung, Synchronisation und Qualitätskontrolle des fertigen FilmsFilme, Serien, FAST-Kanal und Streaming
Deepdub LiveEchtzeit-Programme oder Live-AudioNiedrig verzögerter mehrsprachiger SprachstromSport, Nachrichten, E-Sport und Live-Veranstaltungen
Voice APIEchtzeit- oder batchbasierte Konfiguration von Text und TonAudio in WAV, MP3, ULAW usw.Sprachintelligenzen, Telefonie und Sprache in Apps
Termin- und AkzentkontrolleWortschatz, Aussprache und regionale AnforderungenKonsistentere Fachbegriffe und regionale AkzenteMarken, Produkte und internationale Inhalte

Emotionale Text-zu-Stimme-Übersetzung

Die eTTS-Technologie von Deepdub legt Wert auf Rhythmus, Pausen, Betonung und Stimmung – anstatt nur den Text vorzulesen. Die Nutzer können die Stimme, die Sprache sowie den Ausdrucksstil wählen und über eine API ein vollständiges Audiofile erstellen oder Audioblöcke in Strömung erhalten.

  • Eignet sich für Kundenservice-Chatbots, Telefoniersysteme, Kurse, Kommentare und interaktive Charaktere.
  • Man kann den Akzent, die Geschwindigkeit, die Tonhöhe sowie die Intensität der Emotionen anpassen; die genauen Parameter variieren je nach Modell.
  • Es wird die Erstellung von Sprachaufnahmen für eine bestimmte Dauer unterstützt, um eine bessere Abstimmung zwischen der Untertiteltimeline und den Bildern zu gewährleisten.
  • Eigennamen und besondere Aussprachen können mit SSML-Phonem-Markierungen gesteuert werden.
  • Es ist möglich, bereits lizenzierte Sounds auszuwählen, oder bei entsprechenden Rechten eigene Soundreferenzen zu erstellen.
  • Bei langen Texten muss weiterhin auf Tonverschiebungen, Satzabbrüche, Zahlen sowie auf Kohärenz zwischen den Abschnitten geprüft werden.

Die aktuelle Startseite verwendet Phantom X 3.2, während die Einführungsbeispiele dd-etts-3.0 nutzen. Der Produktname stimmt nicht immer mit der API-Modellnummer überein; Entwickler sollten sich an die verfügbaren Modelle in ihrem Konto sowie an die neuesten Dokumentationen halten.

Stimmenklonierung und Voice-to-Voice

Die Stimmenklonierung erstellt digitale Stimmen anhand kurzer Sprachproben, um die Identität in verschiedenen Texten und Sprachen beizubehalten. Bei Voice-to-Voice werden der ursprüngliche Rhythmus, die Emotionen sowie die feinen Nuancen der Darbietung des Sprechers beibehalten und anschließend in eine andere, lizenzierte Stimme umgewandelt.

  • Die Tonproben müssen von der Person selbst oder von Künstlern stammen, die eine ausdrückliche Genehmigung haben.
  • Die Genehmigung sollte Training, Erstellung, Sprache, Region, Laufzeit und Vertriebskanäle umfassen.
  • Beim Hochladen von Audiodateien müssen Eigenschaften wie Sprache, Alter, Geschlecht und Sprechstil angegeben werden.
  • Die API bietet Funktionen zum Hochladen, Auflisten, Lesen und Löschen von Audiodateien.
  • Film- und Fernsehprojekte können von der Leistung einer kleinen Anzahl von Schauspielern auf mehrere Stimmen für verschiedene Charaktere erweitert werden.
  • Markenprojekte können eine konsistente Stimme und Identität über verschiedene Werbemittel, Märkte und Kanäle hinweg beibehalten.

Deepdub führt ein System für Lizenzen und Urheberrechte für Stimmen ein, doch die konkreten Vertragsbedingungen müssen noch einzeln geprüft werden. Jede technisch klonbare Stimme bedeutet nicht automatisch, dass sie rechtlich verwendet werden darf.

Prozess der Synchronisation in Film und Fernsehen sowie in den Medien

Die Lokalisierung von Medien beinhaltet die Erkennung der Sprache in Audio- und Videomaterialien, die Erstellung von Drehbüchern, die Bearbeitung von Übersetzungen und Aussprache sowie die Erstellung von Tonspuren in der ZielSprache mithilfe von Tonbibliotheken, Klonen oder Voice-to-Voice-Technologien. Bei professionellen Projekten kommen außerdem Anpassungen an die Muttersprache, ein Produktionsteam sowie Qualitätskontrollen hinzu.

  1. Geben Sie dem Team den Inhaltstyp, die Länge, die Quellsprache, die Zielsprache und den Veröffentlichungsort an.
  2. Bestätigen Sie den Umfang der Rechte an Video, Drehbuch, Schauspielerstimmen, Musik und Effektsound.
  3. Laden Sie Medien oder vorhandene Skripte hoch, um eine Transkription zu erstellen und die Dialoge aufzuteilen.
  4. Erfassung von Personen, Begriffen, Aussprache, Akzenten und Stilanforderungen.
  5. Wählen Sie für jede Rolle eine lizenzierte oder autorisierte Sprachreferenz aus.
  6. Erstellen Sie Muster und prüfen Sie Übersetzung, Darstellung, Charakterkonstanz und Zeitabstimmung.
  7. Bearbeiten der wichtigsten Abschnitte, um Musik und Effekte sowie Lautstärke und Mischung zu optimieren.
  8. Abschluss der Qualitätsprüfungen in den Bereichen Muttersprache, Kreativität, Technik und Konformität.
  9. Liefern Sie die Audiospuren sowie die fertigen Aufnahmen gemäß den Vorgaben des Senders oder der Plattform und bewahren Sie die Genehmigungsunterlagen auf.

Die Seite zur automatischen Transkription bietet mehr als 130 Sprachen an, während die Seiten für Synchronisation und Sprach-API in der Regel mehr als 100 Sprachen sowie Akzente umfassen. Der Sprachumfang der verschiedenen Module ist nicht identisch; vor Beginn des Projekts sollten die genauen Sprachpaare, Stimmen und regionalen Akzente festgelegt werden.

Deepdub Live – Echtzeit-Synchronisierung

Deepdub Live richtet sich an Sport-, Nachrichten-, E-Sport- und Live-Kanäle und wandelt die Live-Gespräche in mehrsprachige Audiosignale um. Es unterstützt Übertragungsworkflows wie SRT, HLS und MPEG-DASH und bietet eine Ausgangsgeschwindigkeit von 48 kHz.

  • Automatische Anpassung an den Sprecher und Beibehaltung der Stimme des Moderators aus kurzen Beispielen.
  • Die Emotionsanpassung folgt dem Sprechtempo, der Intensität, den Pausen und den Veränderungen in den Ereignissen vor Ort.
  • Die von der Seite angegebene Anfangszeit des Audios beträgt etwa 125 Millisekunden, doch die tatsächliche End-to-End-Latenz hängt vom gesamten Übertragungsweg ab.
  • Es können geklonte Geräusche oder vorab lizenzierte Radiogeräuschcharaktere verwendet werden.
  • Die Produktionskonfiguration bietet Berechtigungen, Datentrennung und kontinuierliche Betriebsunterstützung.
  • Namen, Spielstände, Eilmeldungen und sensible Aussagen während der Live-Übertragung müssen weiterhin manuell überwacht werden.

Auf der Seite mit den Live-Lösungen wird eine SLA von über 99,9 % angegeben; in den allgemeinen Bedingungen für APIs wird eine Monatsverfügbarkeit von 99,95 % für bezahlte APIs festgelegt. Der Messbereich ist dabei unterschiedlich. Im Vertrag sollten die Grenzen des Services, die Wartungszeiten, die Zielwerte bezüglich der Verzögerungen, die Mechanismen zur Fehlerbehebung sowie die Regeln zur Entschädigung klar definiert werden.

Anschlussmöglichkeit für Voice API

MethodeHauptmerkmaleFür Aufgaben geeignetHinweise
REST APIEine Anfrage liefert binären Audiodaten zurück.Massen-Commentare, asynchrone Aufgaben und DateienerstellungEs ist notwendig, Zeitüberschreitungen, Wiederholungsversuche sowie mehrfache Abrechnungen zu kontrollieren.
WebSocketDauerhafte Verbindung und streambasierte Empfang von AudiblöckenSprachintelligenzen und EchtzeitinteraktionEs ist notwendig, Unterbrechungen in der Übertragung, Pufferung sowie die Reihenfolge zu handhaben.
Python SDKSynchrone und asynchrone Stream-SchnittstellenPython-Backend und AI-AnwendungenDie Produktionsumgebung sollte auf eine bestimmte Version festgelegt werden.
Node SDKJavaScript-Buffern und Callbacks für das Aufteilen in BlöckeNode.js-Dienste und EchtzeitanwendungenDer Schlüssel muss auf der Serverseite verbleiben.
PlaygroundVorab-Hören von Tönen und Einstellungen im KontoTonauswahl, Modellvergleich und schnelle ÜberprüfungDie Testergebnisse spiegeln nicht die gesamte Produktionslast wider.

Schneller Einstieg in API

  1. Registrieren Sie sich mit einer Firmen-E-Mail für einen 14-tägigen Test und führen Sie den Einladungs- sowie Verifizierungsprozess durch.
  2. Gehen Sie in den Playground und überprüfen Sie den von Ihrem Konto automatisch generierten API-Schlüssel.
  3. Probieren Sie die Tonvorlagen aus und speichern Sie die gewünschte Voice Prompt-ID.
  4. Man kann das DeepDub-Python-Paket oder den Node.js-Client installieren, oder man kann auch direkt Netzwerkanfragen senden.
  5. Wählen Sie das Modell, die Sprache, den Zieltext, die Stimme und das Ausgabeformat aus.
  6. Für Batch-Aufgaben wird REST verwendet, während für dialogbasierte Anwendungen mit geringer Verzögerung vorrangig die WebSocket-Streaming-Generierung getestet wird.
  7. Speichern Sie den Schlüssel im Server-basierten Schlüsselverwaltungssystem, nicht auf Webseiten oder mobilen Clients.
  8. Testen von leeren Texten, sehr langen Texten, Sonderzeichen, Zahlen, SSML und Netzwerkunterbrechungen.
  9. Protokollierung der Anfragen zur Erstellung, der Lizenzen für die Audioverarbeitung, der Modellversionen, der Ausgabedateien sowie der Ergebnisse der manuellen Freigabe.
  10. Klären Sie vor Ablauf der Testphase mit dem Verkäufer die Abrechnung, den Speichermodus, die Konkurrenzfähigkeit, die SLA sowie die Geschäftsbedingungen ab.

Eingabe, Sprache und Ausgabe

KategorieUnterstützte InhalteGrenzen
TextNormaler Text, Aussprachekontrolle und teilweise SSMLLängen-, Zeichen- und Sprachbeschränkungen richten sich nach der Schnittstelle und dem Paket.
StimmenprobenGenehmigte Sprachaufnahmen zum Hochladen oder Live-RecordingBetrifft biometrische Merkmale, Persönlichkeitsrechte und Schauspielerverträge
Audio-VideoMedien, Live-Übertragungen und lokalisierte InhalteDie Dateigröße, der Speicherplatz sowie das Projektformat müssen schriftlich bestätigt werden.
SpracheMehr als 100 Sprachen und AkzenteAPI-Locale und spezifische Sprachabdeckung sind geringer als die in der Gesamtwerbung angegebenen Werte.
Automatische TranskriptionMehr als 130 SprachenDer Umfang der Transkription ist nicht gleich – jede Sprache verfügt nicht über die gleichen Möglichkeiten zur Sprachsynthese.
Audio-AusgangWAV 48kHz, MP3, ULAW und unkomprimierte Audio-DateienDie konkrete Abtastfrequenz und das Format variieren je nach Schnittstelle und Anwendungsszenario.
Live-ÜbertragungSRT-, HLS- und MPEG-DASH-WorkflowsProfessionelle Rundfunkintegration und Netzwerk-Redundanz erforderlich

Kostenloser Probemonat und Preise

Paket oder VersionPreisAbrechnungszeitraumKernrechte oder -beträgeFür Nutzer geeignet
API-Testversion0 US-Dollar14 TageMaximal 10.000 Zeichen, etwa 10 Minuten; Playground und API-SchlüsselEntwicklung, Überprüfung und Auswahl von Klangquellen
API-ZeitpaketNoch nicht veröffentlichtNach dem ausgewählten ZeitpaketNach dem Test können Sie die Nutzungsdauer auswählen; zusätzliche Mengen werden zu einem festen Preis berechnet.Sprachintelligenzen und Inhaltsproduktion
MedienerzählungKontaktieren Sie den VerkaufProjekt oder VertragÜbersetzung, Ton, Produktion, Qualitätskontrolle und LieferungFilm und Fernsehen, Streaming und FAST-Kanäle
Deepdub LiveKontaktieren Sie den VerkaufMaßgeschneiderte VerträgeEchtzeit-Mehrsprachiger Ton, Radio-Integration, SLA und BetriebsunterstützungLive-Übertragungs- und Rundfunkanstalten
UnternehmensbereitstellungIndividuelle KostenschätzungVertragsvereinbarungenKonkurrenzfähigkeit, Unterstützung, Sicherheit, Speicherung und Lizenzen können nach Bedarf konfiguriert werden.Großskalige Sprachplattformen

Auf der öffentlichen Seite werden weder die genauen Kosten für die Testphase angegeben, noch der Preis pro zusätzlichem Datenvolumen, noch die Mindestvertragslaufzeit oder die Servicegebühren für Unternehmen. Es ist daher nicht möglich, den Preis zu ermitteln, indem man davon ausgeht, dass 10.000 Zeichen etwa 10 Minuten entsprechen.

Steuergebühren, automatische Verlängerung, Stornierung, Rückerstattungen, ungenutzte Guthaben sowie Gebühren für fehlgeschlagene Erstellungen und Überschreitung der Konkurrenzgrenzen sind ebenfalls nicht klar definiert. Vor dem Kauf sollten die tatsächliche Abrechnungsseite, das Abonnementpaket sowie die von beiden Parteien unterzeichneten Dokumente als Maßstab herangezogen werden.

Lizenz für Töne und Ausstrahlungsrechte

Die Deepdub-Soundbibliothek umfasst lizenzierterweise verfügbare, nachverfolgbare Sounds, die für Rundfunk- und kommerzielle Zwecke geeignet sind. Allerdings gilt diese Lizenz nur für die jeweiligen Soundelemente sowie den Geltungsbereich des Vertrags. Der Benutzer muss weiterhin über alle notwendigen Rechte an Drehbüchern, Videos, Musik, Charakteren sowie eigenen Soundbeispielen verfügen.

  • Die Region, der Kanal, die Frist sowie die Marke für die voreingestellten Geräusche müssen in der Bestellung festgelegt werden.
  • Für die Verwendung eigener Schauspielerstimmen sind Lizenzen für Training, Synthese, Übersetzung und Wiederverwendung erforderlich.
  • Es darf nicht angenommen werden, dass Ergebnisse, die aus dem Hochladen von Materialien Dritter entstehen, frei weitergegeben werden können.
  • Die allgemeinen Bedingungen der API legen strenge Beschränkungen für die Ausgaben fest, die aus Eingaben erzeugt werden, die nicht vollständig im Besitz des Kunden sind.
  • Für Film- und Werbeprojekte müssen die Zustimmung der Schauspieler, die Urheberrechtsverhältnisse sowie die Genehmigung für die endgültige Verwendung aufbewahrt werden.
  • Die Pflicht zur Kennzeichnung synthetischer Stimmen hängt von den Vorschriften des jeweiligen Landes sowie den Regeln der Plattform ab.

Laut den API-Bedingungen darf die resultierende Ausgabe, sofern die eingegebenen Daten nicht vollständig im Besitz des Kunden sind, in der Regel nur an verbundene Parteien bereitgestellt werden und ausschließlich für interne, nicht-kommerzielle Zwecke genutzt werden. Bei komplexen Projekten, bei denen eine Lizenz von Dritten vorliegt, muss der Umfang der Nutzung durch einen separaten Vertrag festgelegt werden; es darf nicht allein auf allgemeine Testkonten zurückgegriffen werden.

Privatsphäre, Sicherheit und Datenspeicherung

Der Anhang zur Datenverarbeitung von Deepdub umfasst die Daten der Kundenvertreter und Schauspieler, mit denen der Verarbeiter in Kontakt tritt, einschließlich Namen, Kontaktdaten und Stimmaufnahmen. Zu den Unterauftragnehmern gehören AWS, Google und WeTransfer, und die Verarbeitung findet in der Europäischen Union und in den Vereinigten Staaten statt.

  • Die Plattform hat die Zertifizierung SOC 2 Type II erworben und wird im Medienbereich mit dem Siegel TPN Gold oder TPN-Zertifizierung gekennzeichnet.
  • Für die statische Verarbeitung personenbezogener Daten wird AES-256 verwendet, für die verschlüsselte Übertragung TLS 1.2 oder eine neuere Version.
  • Auf der Lösungsseite heißt es, dass die Kundendaten standardmäßig getrennt werden und nicht zur Trainierung von Modellen verwendet werden.
  • Der Kunde kann wählen, den Speichermodus nicht zu aktivieren, sodass die verarbeiteten Daten nicht weiter gespeichert werden.
  • Kunden können anweisen, dass personenbezogene Daten gelöscht werden, mit Ausnahme derjenigen, deren Aufbewahrung gesetzlich vorgeschrieben ist.
  • Sollte ein Sicherheitsvorfall eintreten oder vermutet werden, sieht die DPA vor, den Kunden innerhalb von 48 Stunden zu informieren.
  • Der Antrag des Datenbetroffenen wird innerhalb von 72 Stunden dem Kunden mitgeteilt und bei der Bearbeitung unterstützt.

Sofern nicht schriftlich etwas anderes vereinbart ist, ist Deepdub nicht verpflichtet, die eingegebenen Daten langfristig zu speichern. Zudem kann eine Begrenzung der Dateigröße sowie der Speicher- und Verarbeitungskapazitäten festgelegt werden. Die Nutzer müssen eigene Backups der ursprünglichen Materialien, Skripte, Lizenzen sowie der endgültigen Ergebnisse erstellen.

API SLA und Produktionszuverlässigkeit

Die allgemeinen Bedingungen für die bezahlten API-Dienste garantieren eine Verfügbarkeit von 99,95 % pro Monat – ohne Berücksichtigung von Wartungsarbeiten, die im Voraus angekündigt werden. Diese Garantie gilt nicht für kostenlose Dienste. Die hohe Verfügbarkeit bedeutet nicht, dass bei jeder Generierung eine bestimmte Verzögerungszeit, eine bestimmte Tonqualität oder eine bestimmte Genauigkeit des Inhalts gewährleistet sind.

  • Setzen Sie eine Idempotenzkontrolle für REST-Anfragen, um zu verhindern, dass wiederholte Anfragen zu doppelten Audiodateien und Kosten führen.
  • WebSocket soll Verbindungsabbrüche, die Reihenfolge der Fragmente sowie unvollständiges Audio handhaben.
  • Echtzeit-Unternehmensvorbereitung mit Ersatzstimmen oder herkömmlichem TTS-Fallback-Weg.
  • Überwachen der ersten Audio-Zeit, der Gesamtgenerierungszeit, der Fehlerrate und der Audioqualität.
  • Die Aktualisierung von Modellen oder APIs soll in die Kompatibilitätsprüfungen und Freigabeverfahren einbezogen werden.
  • Der Live-Übertragungsvertrag muss ausdrücklich Verzögerungen, SLAs, Support-Zeiten sowie Reaktionszeiten bei Störungen festlegen.

GitHub, SDK und Open-Source-Status

ProjektAktueller ZustandLizenz
Die Deepdub-Plattform und -ModelleExklusive DienstleistungenNicht offengelegte Quellcodes der Produkte lizenziert
Python SDK deepdubOffizielle öffentliche LagerhäuserMIT
AudioSampleOffizielle AudioverarbeitungsbibliothekMIT
deepdub-apiOffizielle API-Dokumentation und Beispiel-RepositorysDerzeit wird keine Lizenz festgestellt.
Node SDKKann über den Paketmanager installiert werdenGemäß der Lizenz im Paket.
Andere offizielle IntegrationenEinige Lager sind öffentlich zugänglichMIT, Apache usw. sind alle unterschiedlich.

Das Python SDK sowie AudioSample werden unter der MIT-Lizenz bereitgestellt, die lediglich die Nutzungsrechte für diese Codebibliotheken festlegt. Die Modellgewichte von Deepdub, die Soundbibliotheken, die Produktionsplattformen sowie die kommerziellen Synchronisierungsdienste sind hingegen nicht zugänglich.

Passend für Nutzer und Szenarien

  • Team für Sprachintelligenz: Entwicklung von Kundenservice-, medizinischen Orientierungs- und Finanz-Sprachoberflächen.
  • Fernseh- und Streamingunternehmen: Produktion von mehrsprachigen Serien, Filmen und Kataloginhalten.
  • Rundfunkanstalten: Liefern Echtzeit-Sprachspuren für Sport, Nachrichten und große Live-Übertragungen.
  • Sprachdienstleister: Integration von emotionaler Sprache und Stimmenklonierung in bestehende Lokalisierungsprozesse.
  • Postproduktions-Team: Mit der Deepdub Go-Kontrolloberfläche werden Akzente, Stimmung und Charakterstimmen gesteuert.
  • Marke und Schulungsteam: Aufrechterhaltung von Konsistenz in der Stimme und den Begrifflichkeiten in verschiedenen Märkten.
  • Entwickler: Erstellung von Sprache über REST, WebSocket, Python oder Node SDK.

Vorteile und wesentliche Einschränkungen

Hauptvorteile

  • Mehrschichtige Produkte, die von API TTS über Film- und Fernsehproduktion bis hin zur Live-Übertragung reichen.
  • Stimmungen, Rhythmus, Akzent und Voice-to-Voice eignen sich besser für performative Inhalte.
  • Es werden zahlreiche lizenzierte Sounds sowie ein Vergütungssystem für Schauspieler bereitgestellt.
  • Unterstützung für Integration mit REST, WebSocket, Python und Node.js.
  • SOC 2, TPN, GDPR, Verschlüsselung und optionaler Nicht-Verbleibsmodus zur Verfügung.
  • Professionelle Projekte können mit Anpassungen an die Muttersprache, einem Produktionsteam und Qualitätskontrolle kombiniert werden.

Hauptbeschränkungen

  • Nach dem Probemonat wird der genaue Preis nicht offen gegeben; es ist eine Kontoauswahl oder ein Verkaufsangebot erforderlich.
  • Sprache, Anzahl der Emotionen und SLA werden auf verschiedenen Produktseiten nach unterschiedlichen Statistikmethoden erfasst.
  • Die verfügbaren Sprachen für APIs entsprechen nicht immer genau den Sprachen der Gesamtschriftausgabe oder der Meddiendienste.
  • Für eine hochwertige Synchronisation von Medien sind weiterhin Übersetzung, Schauspielkunst und die Überprüfung durch Techniker erforderlich.
  • Die durch Drittanbieter eingegebenen Ausgaben sind streng an Vorgaben zur Verbreitung und kommerziellen Nutzung gebunden.
  • Die Kernplattform und die Modelle sind nicht offen zugänglich; ein open-source SDK bedeutet nicht, dass das Produkt selbst open source ist.

Zusammenfassung

Deepdub eignet sich für SprachkI-Systeme, Medien- und Rundfunkprojekte, die hohe Anforderungen an die Qualität der Sprachdarbietung, kommerzielle Lizenzen, Echtzeitfunktionen sowie Unternehmenssicherheit haben. Vor dem Start des Tests sollte zunächst festgelegt werden, ob API, Deepdub Go, Medienproduktion oder Live verwendet wird. Zudem müssen Preis, Sprachen, Rechte an der Stimme, Datenspeicherung sowie die Möglichkeiten zur Verbreitung der Ausgaben schriftlich geklärt werden.

Häufige Fragen

Sind Dubbing und AI Produktnamen?

Es ist der Titel, der auf der Deepdub-Seite verwendet wird; die eigentliche Marke ist Deepdub. Die in diesem Eintrag beschriebenen Funktionen, APIs und Dienste gehören alle zu Deepdub.

Kann Deepdub kostenlos getestet werden?

Ja, die aktuelle API bietet eine Probephase von 14 Tagen an. Dabei sind bis zu 10.000 Zeichen zulässig; die Länge einer Seite beträgt in der Regel etwa 10 Minuten an Inhalt. Für die Nutzung ist eine Firmen-E-Mail-Adresse erforderlich.

Wie viel kostet es nach dem Probemonat?

Auf der öffentlichen Seite wird nur angegeben, dass Pakete nach Zeit berechnet werden können, wobei für zusätzliche Mengen ein fester Preis gilt; konkrete Beträge werden nicht aufgeführt. Für Medien- und Live-Übertragungs-Lösungen ist es notwendig, sich an den Verkauf zu wenden.

Wie viele Sprachen werden unterstützt?

In der Regel werden die Produkte in über 100 Sprachen und Dialekten dargestellt; bei der automatischen Transkription sowie auf einigen technischen Seiten sind es über 130 Sprachen. Die spezifischen API-Localisierungen, Sprachfunktionen sowie die Unterstützung der Zielsprachen müssen einzeln überprüft werden.

Wird Echtzeit-Sprachkommunikation unterstützt?

Unterstützt – die WebSocket-API ermöglicht eine streambasierte Erstellung, und Deepdub Live ist ebenfalls für die Echtzeit-Übertragung von Untertiteln geeignet. Die tatsächliche Verzögerung hängt vom Modell, vom Netzwerk, von der Kodierung sowie von der gesamten Medienkette ab.

Kann eine Stimme für kommerzielle Zwecke verwendet werden?

Die Deepdub-Stimmenbibliothek bietet eine kommerzielle Lizenz an, wobei die Bedingungen von den ausgewählten Stimmen sowie dem Vertrag abhängen. Nutzer müssen weiterhin selbst die Rechte für ihre eigenen Skripte, Videos, Charaktere und Stimmproben sichern.

Wird die Kundendaten für das Training verwendet?

Die Lösungsseite gibt an, dass die Kundendaten standardmäßig isoliert sind und nicht zur Trainierung verwendet werden, und bietet außerdem einen optionalen Modus ohne Speicherung an. Die Unternehmen sollten den genauen Projekt-Einstellungen weiterhin in Verträgen und DPA festlegen.

Gibt es für Deepdub Python- und Node-SDKs?

Ja, es gibt das Python-Paket deepdub und das Node-Paket @deepdub/node. Man kann auch direkt die REST- oder WebSocket-Schnittstellen verwenden.

Ist Deepdub Open Source?

Die Kernplattformen und -modelle sind nicht open source. Die offizielle Python-SDK sowie AudioSample werden unter der MIT-Lizenz bereitgestellt, doch diese gilt nicht für die Soundbibliotheken, die Modellgewichte sowie die Hosted-Dienste.

Wird die Eingabe dauerhaft gespeichert?

Keine Garantie. Sofern nicht schriftlich etwas anderes vereinbart wurde, hat Deepdub keine Verpflichtung, die eingegebenen Daten langfristig aufzubewahren. Der Benutzer muss selbst Kopien der ursprünglichen Dateien sowie der Genehmigungen und der Ergebnisse anfertigen.

©️ Urheberrechtshinweis: Sofern nicht anders angegeben, liegen die Urheberrechte an allen Artikeln auf dieser Website beiTeilen von AI-ToolsAlle Urheberrechte liegen bei uns. Ohne Genehmigung darf keine Person, kein Medienunternehmen, keine Website oder irgendeine Gruppe den Inhalt dieser Website kopieren, nachahmen oder auf andere Weise verbreiten. Ebenso ist es nicht gestattet, Spiegelseiten auf Servern zu erstellen, die nicht uns gehören. Andernfalls behalten wir uns das Recht vor, rechtliche Schritte gegen die Verantwortlichen einzuleiten.

Tools, die dem Dubbing und der KI ähneln