ElevenLabs
Erstellung von natürlicher Sprachwiedergabe, Synchronisation, Soundeffekten und mehrsprachigen Audiodateien
Tags:KI-Audio-ToolsWas ist ElevenLabs?
ElevenLabs ist eine KI-gestützte Audio-Plattform, die Sprachgenerierung, Transkription, Synchronisation, Musik, Soundeffekte sowie Echtzeit-Sprachagenten umfasst. Nutzer können über die Web-Oberfläche einzelne Passagen oder längere Inhalte synchronisieren und die Sprachfunktionen auch über APIs in Anwendungen integrieren.
Die Plattform ist derzeit in Produktlinien wie ElevenCreative, ElevenAgents und ElevenAPI unterteilt. Kreative können Kommentare, Podcasts, Hörbücher sowie mehrsprachige Videos erstellen, während Unternehmen und Entwickler telefonische Kundenservice-Lösungen, Sprachassistenten für Webseiten sowie automatisierte Audio-Abläufe entwickeln können.
Hauptfunktionen von ElevenLabs
- Den Text in natürliche Sprachausgabe mit Tonfall, Pausen und Emotionen umwandeln;
- Verwenden Sie Instant Voice Cloning, um autorisierte Stimmen schnell zu kopieren;
- Durch Professional Voice Cloning wird eine hochkonsistente persönliche Stimme trainiert;
- Verwenden Sie einen Stimmenwechsler, um den Rhythmus der Darbietung beizubehalten und die Klangfarbe zu ändern;
- Verwenden Sie Scribe zur Batch- und Echtzeit-Umschrift von Sprache in Text;
- Übersetzen Sie Videos und Audio in mehrsprachige Versionen;
- Erstellung von Musik, Umgebungsgeräuschen, Soundeffekten und anderen Klangeffekten;
- Menschliche Stimmen von Hintergrundgeräuschen mit dem Voice Isolator trennen;
- In Studio werden lange Audio-, Musik- und Mehrspurinhalte gestaltet;
- Erstellung eines Echtzeit-Sprach-Agenten, der mit Wissensdatenbanken, Telefonen und externen Tools verbunden werden kann.
Text-zu-Stimme-Übersetzung und Modellauswahl
Nachdem der Benutzer Text eingegeben hat und eine Stimme sowie ein Modell ausgewählt hat, kann er Audio-Dateien im Format MP3 oder WAV erstellen. Eleven v3 legt mehr Wert auf Emotionen und die Darstellung von Charakteren, während Multilingual v2 für stabile, lange Texte in mehreren Sprachen geeignet ist. Die Flash- und Turbo-Serien eignen sich hingegen besser für Szenarien mit geringer Verzögerung und hoher Datenrate.
Die Modelle unterscheiden sich in Bezug auf die unterstützten Sprachen, die Anzahl der Zeichen pro Nachricht, die Verzögerung sowie die Gebühren für die Verarbeitung. Bei Echtzeitgesprächen ist eine geringe Verzögerung wichtig, bei längeren Erklärungen kommt es eher auf Konsistenz an, während bei dramatischen Darbietungen eine bessere Kontrolle der Emotionen erforderlich ist.
Echtzeit- und professionelle Stimmenklonierung
Starter und höhere Versionen bieten Instant Voice Cloning – ideal zur schnellen Erstellung von Stimmen anhand kurzer Aufnahmen. Creator und höhere Versionen bieten Professional Voice Cloning, wofür vollständigere, sauberere und konsistente Aufnahmen erforderlich sind, sowie eine Stimmenüberprüfung zur Bestätigung der Identität des Nutzers.
Professional Voice Cloning erlaubt es nicht, die Stimme Dritter als eigene Stimme zu verwenden. Selbst bei der Verwendung von Echtzeit-Cloning-Methoden ist die ausdrückliche Zustimmung des Stimmeninhabers erforderlich, und es müssen die Gesetze bezüglich Bildrechten, Aufführungsrechten, Privatsphäre sowie die lokalen Vorschriften zur Deep-Synthesis eingehalten werden.
Sprachtranskription und Scribe
Scribe kann die Transkription in mehreren Sprachen, Zeitstempel, die Unterscheidung der Sprecher sowie die Erkennung einiger nicht-verbaler Ereignisse bewältigen. Die Echtzeit-Version eignet sich für Untertitel und Dialogagenten. Akzente, mehrere gleichzeitig sprechende Personen, Hintergrundmusik und Fachbegriffe beeinträchtigen jedoch weiterhin die Genauigkeit der Erkennung.
Automatische Synchronisation und Dubbing Studio
Die automatische Synchronisation erkennt den Sprecher, übersetzt den Text und versucht, die ursprünglichen Klangmerkmale beizubehalten. In Dubbing Studio kann der Text, die Länge sowie die Abschnitte manuell angepasst werden. Die kostenlose Ausgabe kann Wasserzeichen enthalten; das Entfernen von Wasserzeichen sowie der Studio-Modus erfordern mehr Punkte.
Übersetzte Untertitel können die Überprüfung durch Muttersprachler nicht ersetzen – Markennamen, Witze, Zahlen und kulturelle Ausdrücke neigen zu Fehlern. Vor der Veröffentlichung sollten Untertitel, Lippenbewegungen, Sprechtempo und Lautstärke in jeder Sprache überprüft werden.
Musik, Soundeffekte und Studio
Eleven Music und Sound Effects können auf Basis von Texten Musik, Umgebungsgeräusche sowie Effekte erzeugen. Studio dient dazu, Sprache, Musik sowie umfangreichere Projekte miteinander zu kombinieren. Die Versionen Starter und höher beinhalten das Recht auf die Verwendung von kommerzieller Musik – doch die genauen Bedingungen unterliegen weiterhin den Richtlinien der Plattform sowie den geltenden Nutzungssperren.
ElevenAgents
ElevenAgents vereint Spracherkennung, Sprachmodelle, Wissensdatenbanken, Aufrufe von Tools sowie Text-zu-Stimme-Umwandlung zu einem Echtzeit-Dialogsystem. Die Agenten können auf Webseiten, mobilen Anwendungen und Telefonen eingesetzt werden, wobei Prozesse, dynamische Variablen, Haltbarkeitsdaten sowie die Speicherung von Aufnahmen festgelegt werden können.
Vergleich der Kernkompetenzen
| Fähigkeiten | Eingabe | Ausgabe | Passende Szenarien |
|---|---|---|---|
| Text to Speech | Einstellungen für Text und Ton | Natürliche Sprache | Erzählungen, Kurse, Hörbücher |
| Voice Changer | Live-Aufnahme | Beibehaltung eines anderen Klangfarbens der Darbietung | Charaktere, Spiele und Filme |
| Scribe | Audio oder Echtzeit-Sprache | Texte, Zeitstempel und Sprecher | Untertitel, Meetings und Agenten |
| Dubbing | Video oder Audio | Mehrsprachige Synchronisation und Untertitel | Video- Lokalisierung |
| Musik und SFX | Textbeschreibung | Musik oder Soundeffekte | Kurzfilme, Werbung und Spiele |
| Agents | Echtzeit-Telefonate und Wissensdatenbank | Zweiwege-Voice-Dialog | Kundenservice, Terminvereinbarung und Verkauf |
ElevenLabs-Preise
ElevenCreative verwendet einen gemeinsamen Punktpool – Funktionen wie Text-zu-Stimme-Umwandlung, Transkription, Musik, Effekte sowie Synchronisation werden alle aus dem gleichen monatlichen Kontingent abgezogen. In der folgenden Tabelle sind die aktuellen Monatspreise auf der offiziellen Website aufgeführt; Steuern und Gebühren werden separat berechnet.
| Paket | Monatspreis | Monatliche Punkte | Hauptanteile |
|---|---|---|---|
| Free | 0 US-Dollar | 10,000 | Grundlegende Sprachfunktionen, Transkription, Soundeffekte, Musik, 3 Studio-Projekte, ohne kommerzielle Lizenz |
| Starter | 6 Dollar | 30,000 | Gewerbliche Lizenzen, sofortige Stimmenklonierung, 20 Studio-Projekte, Dubbing Studio |
| Creator | 22 Dollar | 121,000 | Professionelle Stimmenklonierung, zusätzliche Punkte, aktuelle Ermäßigung im ersten Monat: 11 US-Dollar |
| Pro | 99 Dollar | 600,000 | Hochwertiger PCM über API und Audio bei 192kbps |
| Scale | 299 US-Dollar | 1,800,000 | 3 Plätze, Teamzusammenarbeit und 3 professionelle Stimmenklonen |
| Business | 990 US-Dollar | 6,000,000 | 10 Plätze, 10 professionelle Stimmenklonen sowie niedrigere TTS-Kosten bei geringerer Verzögerung |
| Enterprise | Kontaktieren Sie den Verkauf | Maßanfertigung | DPA, SLA, HIPAA BAA, SSO, höhere Konkurrenzfähigkeit und Prioritätsunterstützung |
Eine jährliche Zahlung entspricht der Bezahlung für 10 Monate: Starter kostet monatlich 5 US-Dollar, Creator etwa 18,33 US-Dollar, Pro 82,50 US-Dollar, Scale rund 249,17 US-Dollar und Business 825 US-Dollar. Der Rabatt für den ersten Monat bei Creator gilt nicht für die folgenden Monatsgebühren.
Häufige Funktionsintegritätsverbrauche
| Funktionen | Offizielle Schätzung des Verbrauchs | Umrechnungseinheiten | Erklärung |
|---|---|---|---|
| Text zu Sprache | Etwa 1 Punkt | Jeder Zeichen | Die Flash- und Turbo-API können bei bis zu 0,5 Punkten liegen. |
| Sprach zu Text | 330 Punkte | pro Minute | Es gilt letztendlich das Modell und die Anfrage. |
| Eleven Music | 900 Punkte | pro Minute | Die Dauer der Erstellung hat direkten Einfluss auf die Kosten. |
| Sound Effects | 200 Punkte | Jedes Mal bei Erstellung | Mehrfache Varianten führen zu wiederholten Abrechnungen. |
| Stimmenveränderer und Isolator | 1.000 Punkte | pro Minute | Berechnet nach der Länge des verarbeiteten Audios |
| Automatische Synchronisation | 2.000 bis 3.000 Punkte | Pro Minute pro Sprache | Ob das Hinzufügen eines Wasserzeichens die Verbrauchszahlen beeinflusst. |
| Dubbing Studio | 5.000 bis 10.000 Punkte | Pro Minute pro Sprache | Der Aufwand zur Entfernung von Wasserzeichen ist höher. |
Bei den Pay-Plänen können ungenutzte Punkte maximal zwei Monate lang übertragen werden. Die Obergrenze für die Übertragung beträgt das Doppelte der monatlichen Höchstmenge; somit kann der verbleibende Betrag bis zu dreimal so hoch sein wie die monatliche Höchstmenge. Bei dem Free-Plan werden keine Punkte übertragen. Nach einer Herabstufung oder Kündigung verfallen die ungenutzten Pay-Punkte am Ende des Abrechnungszeitraums.
ElevenLabs-Anleitung
Erstelle eine natürliche chinesische Erzählstimme.
- Ordnen Sie den Script-Text und teilen Sie die langen Sätze in kürzere Abschnitte auf, die für Pausen geeignet sind;
- Wählen Sie eine Sprachausgabe aus, die Chinesisch unterstützt und zum jeweiligen Szenario passt;
- Auf der Grundlage von Modellen für Expressivität, Stabilität und Verzögerung.
- Testen Sie zunächst mit einem kurzen Abschnitt Namen, Zahlen und Eigennamen;
- Anpassung von Satzzeichen, Sprachtempo, Stabilität und Stil-Einstellungen;
- Nach Bestätigung wird es in Abschnitten erzeugt und die gleichen Parameter beibehalten;
- Laden Sie die Audiodatei herunter, gleichen Sie die Lautstärke im fertigen Film aus und überprüfen Sie sie manuell.
Sichere Erstellung eines eigenen Sprachklons
- Nur die eigene Stimme oder eine mit schriftlicher Genehmigung verwendete Stimme;
- Aufnehmen von Samples in einem ruhigen Raum ohne Reverb und ohne Hintergrundmusik;
- Halten Sie Mikrofon, Abstand, Lautstärke und Sprechstil konstant;
- Wählen Sie Instant oder Professional Voice Cloning aus;
- Führen Sie die Stimmenüberprüfung durch und geben Sie eine genaue Angabe zum Verwendungszweck ein;
- Die Ähnlichkeit wird mit Sätzen getestet, die noch nie in den Beispielen vorgekommen sind;
- Bei der Veröffentlichung nach außen muss die Identität der synthetischen Stimme gemäß den Vorschriften offengelegt werden.
Text-zu-Stimme-Übersetzung über API
- Erstellen Sie in dem Konto eine API-Schlüssel mit eingeschränktem Verwendungszweck;
- Installieren Sie die offiziellen Python- oder JavaScript-SDKs;
- Speichern Sie den Schlüssel in einer Umgebungsvariable auf der Serverseite;
- Wählen Sie Ton, Modell, Ausgabeformat und Spracheinstellungen aus;
- Lange Texte in Abschnitte unterteilen und den Kontext sowie die Parameter beibehalten;
- Behandlung von Fehlern bei Bandbreitenbeschränkungen, Wiederholungsversuchen, Zeitüberschreitungen und unzureichenden Punkten;
- Erfassen Sie die Anfragen zur Erstellung, die Quellen der Autorisierung sowie die tatsächlichen Kosten.
Für welche Benutzer geeignet
- Video- und Podcast-Ersteller: Erstellung von Kommentaren, Titelsequenzen und mehrsprachigen Versionen;
- Bildung und Verlag: Erstellung von Lehrplänen, Hörbüchern und barrierefreiem Audio;
- Film und Spiele: Gestaltung von Charakterstimmen, Soundeffekten und temporärer Musik;
- Marketing-Team: Erstellung von Werbespots, Produktpräsentationen und Markenstimme;
- Lokalisierungsteam: Übersetzung von Untertiteln und Erstellung von Synchronisationen für mehrere Sprecher;
- Kundenservice und Vertrieb: Einsatz von Telefon- oder Web-basierten, Echtzeit-Sprach-Agenten;
- Entwickler: Einfügen von TTS, STT, Agenten und Audio-Generierung über API.
Vorteile von ElevenLabs
- Die Sprachwiedergabe ist natürlich und bietet verschiedene Geschwindigkeits- sowie Qualitätsmodelle.
- Von Sprachgenerierung bis hin zu Transkription, Synchronisation, Musik und Soundeffekten;
- Sofortige und professionelle Klonierung decken unterschiedliche Anforderungen hinsichtlich Qualität und Kosten ab;
- Studio eignet sich für die Erstellung von langen Inhalten und mehrspurigem Audio;
- ElevenAgents bietet end-to-end-echtzeitige Sprachinteraktionen.
- Die API bietet eine breite Abdeckung und verfügt über offizielle SDKs in mehreren Sprachen;
- Unternehmen unterstützen SSO, BAA, Datenrouting und höhere Konkurrenzfähigkeit.
Einsatzbeschränkungen und Hinweise
- Free beinhaltet keine kommerzielle Lizenz und darf nicht direkt für kommerzielle Veröffentlichungen verwendet werden;
- Alle Erstellungsfunktionen teilen sich die Punkte, Synchronisation und lange Audiodateien verbrauchen schnell mehr Ressourcen;
- Ein fehlgeschlagener Versuch oder unzufriedenstellendes Ergebnis garantiert nicht automatisch eine kostenlose Nachbearbeitung;
- Die Übersetzung von Namen, Zahlen und kulturellen Ausdrücken in einer anderen Sprache kann zu Fehlübersetzungen führen.
- Die Klonung von Stimmen wird durch die Qualität der Aufnahme, den Akzent und den Stil des Samples beeinflusst.
- Echtzeit-Agenten werden außerdem von Netzwerk-, Modell- und Telefonleitungsverzögerungen beeinflusst;
- Musik und Soundeffekte müssen weiterhin hinsichtlich ihrer Ähnlichkeit sowie der Risiken im Zusammenhang mit Drittrechten überprüft werden.
- Synthetische Stimmen dürfen nicht verwendet werden, um sich als andere Personen auszugeben und so Betrug oder Täuschung zu begehen.
Urheberrecht, Zustimmung und Privatsphäre
Jede Stimmenklonierung muss über eine nachweisbare Genehmigung für die Verwendung der Stimme verfügen. Professional Voice Cloning erfordert zudem eine Überprüfung der eigenen Stimme. In den Bereichen Politik, Finanzen, Medizin, Kundenservice sowie bei Inhalten von Persönlichkeiten des öffentlichen Lebens können strengere Vorschriften bezüglich der Offenlegung und Nutzung gelten.
Unternehmen können DPA, SLA, SSO und HIPAA BAA beantragen sowie einige Optionen für die Aufzeichnung und Transkription von Agentenaktivitäten konfigurieren. Vor der Implementierung sollten weiterhin der Ort der Datenverarbeitung, die Unterverarbeiter, die Löschmechanismen sowie die Regeln bezüglich der Zustimmung zur Aufzeichnung von Anrufen festgelegt werden.
- Aufzeichnung der Lizenzen für die Speicherung von Audiodaten, der Schauspielerverträge sowie der Nutzungsbedingungen;
- Offen zugängliche Inhalte weisen klar darauf hin, dass es sich um von KI erzeugte oder synthetisierte Sprache handelt.
- Laden Sie keine Trainingsaudiodateien mit unbefugten Personen im Hintergrund hoch;
- Der Sprachagent gibt zu Beginn des Gesprächs seine Identität sowie Informationen zur Aufnahme bekannt.
- API-Schlüssel werden je nach Umgebung und Projekt isoliert und regelmäßig ausgetauscht.
Erklärungen zu API, GitHub und Open Source
ElevenLabs bietet offizielle APIs für TTS, STT, Sprache, Synchronisation, Studio, Musik, Soundeffekte und Agents. Es werden offizielle SDKs für Python, JavaScript, Swift, Android sowie Agents bereitgestellt, außerdem MCP und Beispield Projekte.
Diese SDKs sind auf GitHub veröffentlicht und unterliegen jeweils eigenen Open-Source-Lizenzbedingungen, doch die Trainingsmodelle, die Sprachplattformen sowie die Hosting-Dienste von ElevenLabs sind nicht vollständig open source. Drittanbieter-SDKs mit demselben Namen können veraltet sein; es sollte Vorrang vor Projekten der offiziellen Organisation gegeben werden.
Häufige Fragen
Ist ElevenLabs kostenlos?
Es ist möglich, es kostenlos auszuprobieren: Free bietet monatlich 10.000 Punkte. Es werden grundlegende Funktionen wie Sprachwiedergabe, Transkription, Effekte und Musik unterstützt. Das kostenlose Angebot beinhaltet keine kommerzielle Lizenz, und die Punkte werden nicht übertragen.
Welches Paket ist für die kommerzielle Nutzung von ElevenLabs erforderlich?
Starter und höhere Versionen beinhalten eine Geschäftslizenz; der aktuelle Preis beträgt 6 US-Dollar pro Monat. Für die Stimmen und Musik in der Voice Library gelten weiterhin die Bestimmungen der jeweiligen Ressourcen und Plattformen.
Kann ElevenLabs Stimmen klonen?
Ja, Starter unterstützt die sofortige Stimmenklonierung, Creator und höhere Versionen unterstützen die professionelle Stimmenklonierung. Es muss die eigene Stimme verwendet werden oder eine ausdrückliche Genehmigung vorliegen, wobei auch die notwendigen Überprüfungen durchgeführt werden müssen.
Unterstützt ElevenLabs Chinesisch?
Unterstützung für die Erzeugung chinesischer Sprachausgaben sowie mehrsprachige Workflows. Modelle, Stimmen und Akzente beeinflussen das Ergebnis; Namen und Zahlen sollten zunächst in kleinen Tests getestet werden.
Ist ElevenLabs Open Source?
Das Kernmodell und die Plattform sind keine Open-Source-Produkte. Mehrere offizielle SDKs und Beispiele sind auf GitHub veröffentlicht und können zur Aufrufung der gehosteten API verwendet werden.
Guigong-Netzwerk-Sicherheitsnummer: 45132202000164