ElevenLabs
Kostenloser Mehrwert
Komplette Liste an KI-Tools KI-Audio-Tools

ElevenLabs

Erstellung von natürlicher Sprachwiedergabe, Synchronisation, Soundeffekten und mehrsprachigen Audiodateien

Tags:

Was ist ElevenLabs?

ElevenLabs ist eine KI-gestützte Audio-Plattform, die Sprachgenerierung, Transkription, Synchronisation, Musik, Soundeffekte sowie Echtzeit-Sprachagenten umfasst. Nutzer können über die Web-Oberfläche einzelne Passagen oder längere Inhalte synchronisieren und die Sprachfunktionen auch über APIs in Anwendungen integrieren.

Die Plattform ist derzeit in Produktlinien wie ElevenCreative, ElevenAgents und ElevenAPI unterteilt. Kreative können Kommentare, Podcasts, Hörbücher sowie mehrsprachige Videos erstellen, während Unternehmen und Entwickler telefonische Kundenservice-Lösungen, Sprachassistenten für Webseiten sowie automatisierte Audio-Abläufe entwickeln können.

Hauptfunktionen von ElevenLabs

  • Den Text in natürliche Sprachausgabe mit Tonfall, Pausen und Emotionen umwandeln;
  • Verwenden Sie Instant Voice Cloning, um autorisierte Stimmen schnell zu kopieren;
  • Durch Professional Voice Cloning wird eine hochkonsistente persönliche Stimme trainiert;
  • Verwenden Sie einen Stimmenwechsler, um den Rhythmus der Darbietung beizubehalten und die Klangfarbe zu ändern;
  • Verwenden Sie Scribe zur Batch- und Echtzeit-Umschrift von Sprache in Text;
  • Übersetzen Sie Videos und Audio in mehrsprachige Versionen;
  • Erstellung von Musik, Umgebungsgeräuschen, Soundeffekten und anderen Klangeffekten;
  • Menschliche Stimmen von Hintergrundgeräuschen mit dem Voice Isolator trennen;
  • In Studio werden lange Audio-, Musik- und Mehrspurinhalte gestaltet;
  • Erstellung eines Echtzeit-Sprach-Agenten, der mit Wissensdatenbanken, Telefonen und externen Tools verbunden werden kann.

Text-zu-Stimme-Übersetzung und Modellauswahl

Nachdem der Benutzer Text eingegeben hat und eine Stimme sowie ein Modell ausgewählt hat, kann er Audio-Dateien im Format MP3 oder WAV erstellen. Eleven v3 legt mehr Wert auf Emotionen und die Darstellung von Charakteren, während Multilingual v2 für stabile, lange Texte in mehreren Sprachen geeignet ist. Die Flash- und Turbo-Serien eignen sich hingegen besser für Szenarien mit geringer Verzögerung und hoher Datenrate.

Die Modelle unterscheiden sich in Bezug auf die unterstützten Sprachen, die Anzahl der Zeichen pro Nachricht, die Verzögerung sowie die Gebühren für die Verarbeitung. Bei Echtzeitgesprächen ist eine geringe Verzögerung wichtig, bei längeren Erklärungen kommt es eher auf Konsistenz an, während bei dramatischen Darbietungen eine bessere Kontrolle der Emotionen erforderlich ist.

Echtzeit- und professionelle Stimmenklonierung

Starter und höhere Versionen bieten Instant Voice Cloning – ideal zur schnellen Erstellung von Stimmen anhand kurzer Aufnahmen. Creator und höhere Versionen bieten Professional Voice Cloning, wofür vollständigere, sauberere und konsistente Aufnahmen erforderlich sind, sowie eine Stimmenüberprüfung zur Bestätigung der Identität des Nutzers.

Professional Voice Cloning erlaubt es nicht, die Stimme Dritter als eigene Stimme zu verwenden. Selbst bei der Verwendung von Echtzeit-Cloning-Methoden ist die ausdrückliche Zustimmung des Stimmeninhabers erforderlich, und es müssen die Gesetze bezüglich Bildrechten, Aufführungsrechten, Privatsphäre sowie die lokalen Vorschriften zur Deep-Synthesis eingehalten werden.

Sprachtranskription und Scribe

Scribe kann die Transkription in mehreren Sprachen, Zeitstempel, die Unterscheidung der Sprecher sowie die Erkennung einiger nicht-verbaler Ereignisse bewältigen. Die Echtzeit-Version eignet sich für Untertitel und Dialogagenten. Akzente, mehrere gleichzeitig sprechende Personen, Hintergrundmusik und Fachbegriffe beeinträchtigen jedoch weiterhin die Genauigkeit der Erkennung.

Automatische Synchronisation und Dubbing Studio

Die automatische Synchronisation erkennt den Sprecher, übersetzt den Text und versucht, die ursprünglichen Klangmerkmale beizubehalten. In Dubbing Studio kann der Text, die Länge sowie die Abschnitte manuell angepasst werden. Die kostenlose Ausgabe kann Wasserzeichen enthalten; das Entfernen von Wasserzeichen sowie der Studio-Modus erfordern mehr Punkte.

Übersetzte Untertitel können die Überprüfung durch Muttersprachler nicht ersetzen – Markennamen, Witze, Zahlen und kulturelle Ausdrücke neigen zu Fehlern. Vor der Veröffentlichung sollten Untertitel, Lippenbewegungen, Sprechtempo und Lautstärke in jeder Sprache überprüft werden.

Musik, Soundeffekte und Studio

Eleven Music und Sound Effects können auf Basis von Texten Musik, Umgebungsgeräusche sowie Effekte erzeugen. Studio dient dazu, Sprache, Musik sowie umfangreichere Projekte miteinander zu kombinieren. Die Versionen Starter und höher beinhalten das Recht auf die Verwendung von kommerzieller Musik – doch die genauen Bedingungen unterliegen weiterhin den Richtlinien der Plattform sowie den geltenden Nutzungssperren.

ElevenAgents

ElevenAgents vereint Spracherkennung, Sprachmodelle, Wissensdatenbanken, Aufrufe von Tools sowie Text-zu-Stimme-Umwandlung zu einem Echtzeit-Dialogsystem. Die Agenten können auf Webseiten, mobilen Anwendungen und Telefonen eingesetzt werden, wobei Prozesse, dynamische Variablen, Haltbarkeitsdaten sowie die Speicherung von Aufnahmen festgelegt werden können.

Vergleich der Kernkompetenzen

FähigkeitenEingabeAusgabePassende Szenarien
Text to SpeechEinstellungen für Text und TonNatürliche SpracheErzählungen, Kurse, Hörbücher
Voice ChangerLive-AufnahmeBeibehaltung eines anderen Klangfarbens der DarbietungCharaktere, Spiele und Filme
ScribeAudio oder Echtzeit-SpracheTexte, Zeitstempel und SprecherUntertitel, Meetings und Agenten
DubbingVideo oder AudioMehrsprachige Synchronisation und UntertitelVideo- Lokalisierung
Musik und SFXTextbeschreibungMusik oder SoundeffekteKurzfilme, Werbung und Spiele
AgentsEchtzeit-Telefonate und WissensdatenbankZweiwege-Voice-DialogKundenservice, Terminvereinbarung und Verkauf

ElevenLabs-Preise

ElevenCreative verwendet einen gemeinsamen Punktpool – Funktionen wie Text-zu-Stimme-Umwandlung, Transkription, Musik, Effekte sowie Synchronisation werden alle aus dem gleichen monatlichen Kontingent abgezogen. In der folgenden Tabelle sind die aktuellen Monatspreise auf der offiziellen Website aufgeführt; Steuern und Gebühren werden separat berechnet.

PaketMonatspreisMonatliche PunkteHauptanteile
Free0 US-Dollar10,000Grundlegende Sprachfunktionen, Transkription, Soundeffekte, Musik, 3 Studio-Projekte, ohne kommerzielle Lizenz
Starter6 Dollar30,000Gewerbliche Lizenzen, sofortige Stimmenklonierung, 20 Studio-Projekte, Dubbing Studio
Creator22 Dollar121,000Professionelle Stimmenklonierung, zusätzliche Punkte, aktuelle Ermäßigung im ersten Monat: 11 US-Dollar
Pro99 Dollar600,000Hochwertiger PCM über API und Audio bei 192kbps
Scale299 US-Dollar1,800,0003 Plätze, Teamzusammenarbeit und 3 professionelle Stimmenklonen
Business990 US-Dollar6,000,00010 Plätze, 10 professionelle Stimmenklonen sowie niedrigere TTS-Kosten bei geringerer Verzögerung
EnterpriseKontaktieren Sie den VerkaufMaßanfertigungDPA, SLA, HIPAA BAA, SSO, höhere Konkurrenzfähigkeit und Prioritätsunterstützung

Eine jährliche Zahlung entspricht der Bezahlung für 10 Monate: Starter kostet monatlich 5 US-Dollar, Creator etwa 18,33 US-Dollar, Pro 82,50 US-Dollar, Scale rund 249,17 US-Dollar und Business 825 US-Dollar. Der Rabatt für den ersten Monat bei Creator gilt nicht für die folgenden Monatsgebühren.

Häufige Funktionsintegritätsverbrauche

FunktionenOffizielle Schätzung des VerbrauchsUmrechnungseinheitenErklärung
Text zu SpracheEtwa 1 PunktJeder ZeichenDie Flash- und Turbo-API können bei bis zu 0,5 Punkten liegen.
Sprach zu Text330 Punktepro MinuteEs gilt letztendlich das Modell und die Anfrage.
Eleven Music900 Punktepro MinuteDie Dauer der Erstellung hat direkten Einfluss auf die Kosten.
Sound Effects200 PunkteJedes Mal bei ErstellungMehrfache Varianten führen zu wiederholten Abrechnungen.
Stimmenveränderer und Isolator1.000 Punktepro MinuteBerechnet nach der Länge des verarbeiteten Audios
Automatische Synchronisation2.000 bis 3.000 PunktePro Minute pro SpracheOb das Hinzufügen eines Wasserzeichens die Verbrauchszahlen beeinflusst.
Dubbing Studio5.000 bis 10.000 PunktePro Minute pro SpracheDer Aufwand zur Entfernung von Wasserzeichen ist höher.

Bei den Pay-Plänen können ungenutzte Punkte maximal zwei Monate lang übertragen werden. Die Obergrenze für die Übertragung beträgt das Doppelte der monatlichen Höchstmenge; somit kann der verbleibende Betrag bis zu dreimal so hoch sein wie die monatliche Höchstmenge. Bei dem Free-Plan werden keine Punkte übertragen. Nach einer Herabstufung oder Kündigung verfallen die ungenutzten Pay-Punkte am Ende des Abrechnungszeitraums.

ElevenLabs-Anleitung

Erstelle eine natürliche chinesische Erzählstimme.

  1. Ordnen Sie den Script-Text und teilen Sie die langen Sätze in kürzere Abschnitte auf, die für Pausen geeignet sind;
  2. Wählen Sie eine Sprachausgabe aus, die Chinesisch unterstützt und zum jeweiligen Szenario passt;
  3. Auf der Grundlage von Modellen für Expressivität, Stabilität und Verzögerung.
  4. Testen Sie zunächst mit einem kurzen Abschnitt Namen, Zahlen und Eigennamen;
  5. Anpassung von Satzzeichen, Sprachtempo, Stabilität und Stil-Einstellungen;
  6. Nach Bestätigung wird es in Abschnitten erzeugt und die gleichen Parameter beibehalten;
  7. Laden Sie die Audiodatei herunter, gleichen Sie die Lautstärke im fertigen Film aus und überprüfen Sie sie manuell.

Sichere Erstellung eines eigenen Sprachklons

  1. Nur die eigene Stimme oder eine mit schriftlicher Genehmigung verwendete Stimme;
  2. Aufnehmen von Samples in einem ruhigen Raum ohne Reverb und ohne Hintergrundmusik;
  3. Halten Sie Mikrofon, Abstand, Lautstärke und Sprechstil konstant;
  4. Wählen Sie Instant oder Professional Voice Cloning aus;
  5. Führen Sie die Stimmenüberprüfung durch und geben Sie eine genaue Angabe zum Verwendungszweck ein;
  6. Die Ähnlichkeit wird mit Sätzen getestet, die noch nie in den Beispielen vorgekommen sind;
  7. Bei der Veröffentlichung nach außen muss die Identität der synthetischen Stimme gemäß den Vorschriften offengelegt werden.

Text-zu-Stimme-Übersetzung über API

  1. Erstellen Sie in dem Konto eine API-Schlüssel mit eingeschränktem Verwendungszweck;
  2. Installieren Sie die offiziellen Python- oder JavaScript-SDKs;
  3. Speichern Sie den Schlüssel in einer Umgebungsvariable auf der Serverseite;
  4. Wählen Sie Ton, Modell, Ausgabeformat und Spracheinstellungen aus;
  5. Lange Texte in Abschnitte unterteilen und den Kontext sowie die Parameter beibehalten;
  6. Behandlung von Fehlern bei Bandbreitenbeschränkungen, Wiederholungsversuchen, Zeitüberschreitungen und unzureichenden Punkten;
  7. Erfassen Sie die Anfragen zur Erstellung, die Quellen der Autorisierung sowie die tatsächlichen Kosten.

Für welche Benutzer geeignet

  • Video- und Podcast-Ersteller: Erstellung von Kommentaren, Titelsequenzen und mehrsprachigen Versionen;
  • Bildung und Verlag: Erstellung von Lehrplänen, Hörbüchern und barrierefreiem Audio;
  • Film und Spiele: Gestaltung von Charakterstimmen, Soundeffekten und temporärer Musik;
  • Marketing-Team: Erstellung von Werbespots, Produktpräsentationen und Markenstimme;
  • Lokalisierungsteam: Übersetzung von Untertiteln und Erstellung von Synchronisationen für mehrere Sprecher;
  • Kundenservice und Vertrieb: Einsatz von Telefon- oder Web-basierten, Echtzeit-Sprach-Agenten;
  • Entwickler: Einfügen von TTS, STT, Agenten und Audio-Generierung über API.

Vorteile von ElevenLabs

  • Die Sprachwiedergabe ist natürlich und bietet verschiedene Geschwindigkeits- sowie Qualitätsmodelle.
  • Von Sprachgenerierung bis hin zu Transkription, Synchronisation, Musik und Soundeffekten;
  • Sofortige und professionelle Klonierung decken unterschiedliche Anforderungen hinsichtlich Qualität und Kosten ab;
  • Studio eignet sich für die Erstellung von langen Inhalten und mehrspurigem Audio;
  • ElevenAgents bietet end-to-end-echtzeitige Sprachinteraktionen.
  • Die API bietet eine breite Abdeckung und verfügt über offizielle SDKs in mehreren Sprachen;
  • Unternehmen unterstützen SSO, BAA, Datenrouting und höhere Konkurrenzfähigkeit.

Einsatzbeschränkungen und Hinweise

  • Free beinhaltet keine kommerzielle Lizenz und darf nicht direkt für kommerzielle Veröffentlichungen verwendet werden;
  • Alle Erstellungsfunktionen teilen sich die Punkte, Synchronisation und lange Audiodateien verbrauchen schnell mehr Ressourcen;
  • Ein fehlgeschlagener Versuch oder unzufriedenstellendes Ergebnis garantiert nicht automatisch eine kostenlose Nachbearbeitung;
  • Die Übersetzung von Namen, Zahlen und kulturellen Ausdrücken in einer anderen Sprache kann zu Fehlübersetzungen führen.
  • Die Klonung von Stimmen wird durch die Qualität der Aufnahme, den Akzent und den Stil des Samples beeinflusst.
  • Echtzeit-Agenten werden außerdem von Netzwerk-, Modell- und Telefonleitungsverzögerungen beeinflusst;
  • Musik und Soundeffekte müssen weiterhin hinsichtlich ihrer Ähnlichkeit sowie der Risiken im Zusammenhang mit Drittrechten überprüft werden.
  • Synthetische Stimmen dürfen nicht verwendet werden, um sich als andere Personen auszugeben und so Betrug oder Täuschung zu begehen.

Urheberrecht, Zustimmung und Privatsphäre

Jede Stimmenklonierung muss über eine nachweisbare Genehmigung für die Verwendung der Stimme verfügen. Professional Voice Cloning erfordert zudem eine Überprüfung der eigenen Stimme. In den Bereichen Politik, Finanzen, Medizin, Kundenservice sowie bei Inhalten von Persönlichkeiten des öffentlichen Lebens können strengere Vorschriften bezüglich der Offenlegung und Nutzung gelten.

Unternehmen können DPA, SLA, SSO und HIPAA BAA beantragen sowie einige Optionen für die Aufzeichnung und Transkription von Agentenaktivitäten konfigurieren. Vor der Implementierung sollten weiterhin der Ort der Datenverarbeitung, die Unterverarbeiter, die Löschmechanismen sowie die Regeln bezüglich der Zustimmung zur Aufzeichnung von Anrufen festgelegt werden.

  • Aufzeichnung der Lizenzen für die Speicherung von Audiodaten, der Schauspielerverträge sowie der Nutzungsbedingungen;
  • Offen zugängliche Inhalte weisen klar darauf hin, dass es sich um von KI erzeugte oder synthetisierte Sprache handelt.
  • Laden Sie keine Trainingsaudiodateien mit unbefugten Personen im Hintergrund hoch;
  • Der Sprachagent gibt zu Beginn des Gesprächs seine Identität sowie Informationen zur Aufnahme bekannt.
  • API-Schlüssel werden je nach Umgebung und Projekt isoliert und regelmäßig ausgetauscht.

Erklärungen zu API, GitHub und Open Source

ElevenLabs bietet offizielle APIs für TTS, STT, Sprache, Synchronisation, Studio, Musik, Soundeffekte und Agents. Es werden offizielle SDKs für Python, JavaScript, Swift, Android sowie Agents bereitgestellt, außerdem MCP und Beispield Projekte.

Diese SDKs sind auf GitHub veröffentlicht und unterliegen jeweils eigenen Open-Source-Lizenzbedingungen, doch die Trainingsmodelle, die Sprachplattformen sowie die Hosting-Dienste von ElevenLabs sind nicht vollständig open source. Drittanbieter-SDKs mit demselben Namen können veraltet sein; es sollte Vorrang vor Projekten der offiziellen Organisation gegeben werden.

Häufige Fragen

Ist ElevenLabs kostenlos?

Es ist möglich, es kostenlos auszuprobieren: Free bietet monatlich 10.000 Punkte. Es werden grundlegende Funktionen wie Sprachwiedergabe, Transkription, Effekte und Musik unterstützt. Das kostenlose Angebot beinhaltet keine kommerzielle Lizenz, und die Punkte werden nicht übertragen.

Welches Paket ist für die kommerzielle Nutzung von ElevenLabs erforderlich?

Starter und höhere Versionen beinhalten eine Geschäftslizenz; der aktuelle Preis beträgt 6 US-Dollar pro Monat. Für die Stimmen und Musik in der Voice Library gelten weiterhin die Bestimmungen der jeweiligen Ressourcen und Plattformen.

Kann ElevenLabs Stimmen klonen?

Ja, Starter unterstützt die sofortige Stimmenklonierung, Creator und höhere Versionen unterstützen die professionelle Stimmenklonierung. Es muss die eigene Stimme verwendet werden oder eine ausdrückliche Genehmigung vorliegen, wobei auch die notwendigen Überprüfungen durchgeführt werden müssen.

Unterstützt ElevenLabs Chinesisch?

Unterstützung für die Erzeugung chinesischer Sprachausgaben sowie mehrsprachige Workflows. Modelle, Stimmen und Akzente beeinflussen das Ergebnis; Namen und Zahlen sollten zunächst in kleinen Tests getestet werden.

Ist ElevenLabs Open Source?

Das Kernmodell und die Plattform sind keine Open-Source-Produkte. Mehrere offizielle SDKs und Beispiele sind auf GitHub veröffentlicht und können zur Aufrufung der gehosteten API verwendet werden.

©️ Urheberrechtshinweis: Sofern nicht anders angegeben, liegen die Urheberrechte an allen Artikeln auf dieser Website beiTeilen von AI-ToolsAlle Urheberrechte liegen bei uns. Ohne Genehmigung darf keine Person, kein Medienunternehmen, keine Website oder irgendeine Gruppe den Inhalt dieser Website kopieren, nachahmen oder auf andere Weise verbreiten. Ebenso ist es nicht gestattet, Spiegelseiten auf Servern zu erstellen, die nicht uns gehören. Andernfalls behalten wir uns das Recht vor, rechtliche Schritte gegen die Verantwortlichen einzuleiten.

Werkzeuge, die den ElevenLabs ähneln