Voice.ai
Kostenloser Mehrwert
Komplette Liste an KI-Tools KI-Audio-Tools

Voice.ai

Plattform mit Tools für Echtzeit-Stimmenveränderung, Stimmenerzeugung und Sprachverarbeitung

Tags:

Was ist Voice.ai?

Voice.ai ist eine Plattform für künstliche Intelligenz im Bereich der Sprachgenerierung und der Echtzeit-Veränderung der Stimme. Sie umfasst Desktop-Stimmenveränderer, Online-Funktionen zur Umwandlung von Text in Sprache, Tools zur Stimmenklonierung, Voice Agents sowie Audioverarbeitungswerkzeuge. Nutzer können die Klangqualität ihres Mikrofons in Spielen, Live-Übertragungen und Meetings in Echtzeit ändern. Zudem ist es möglich, Text in Audio umzuwandeln, autorisierte Stimmmodelle zu erstellen oder Voice Agents zu entwickeln, die Anrufe entgegennehmen können.

Voice.ai bietet derzeit ein breites Produktangebot an. Unter derselben Marke gibt es sowohl Desktop-Clienten für Windows und Mac als auch Webplattformen sowie mobile Dienste. Früher waren die Abonnements und Credits der verschiedenen Clienten nicht miteinander kompatibel. Vor dem Kauf sollte man prüfen, ob auf der Zahlelseite von einer „Desktop-Anwendung“ oder von einer „Online-TTS/Agent-Plattform“ die Rede ist. Man sollte nicht davon ausgehen, dass ein Abonnement für eine Plattform auch auf allen anderen Plattformen verwendet werden kann.

Kernfunktionen von Voice.ai

Echtzeit-AI-Stimmenveränderer

Die Desktop-Client-Anwendung verwendet Voice.ai als virtuelles Mikrofon und kann in Discord, Zoom, Spielen mit Sprachfunktionen, Streaming-Software sowie anderen Anwendungen, die ein Mikrofon benötigen, den umgewandelten Klang in Echtzeit wiedergeben. Die Übersetzung von Sprache in Sprache ermöglicht es, den Rhythmus sowie bestimmte Emotionen des ursprünglichen Sprechers beizubehalten – was natürlicher ist als ein reiner Tonhöhenwechsel. Die Qualität hängt jedoch von der Grafikkarte, den Verarbeitungszeiten, dem Mikrofon sowie der Netzwerkverbindung ab.

Aufnahmemodus und Online-Stimmenveränderung

Neben dem Echtzeitmodus kann man auch kurze Audiodateien hochladen oder aufnehmen und anschließend in die gewünschte Klangfarbe umwandeln. Der Aufnahmemodus eignet sich für Sprachnachrichten, Dialoge in Videos sowie Inhalte, die eine genaue Überarbeitung erfordern.

Die eingegebene Audioaufnahme sollte von einer einzelnen Person stammen, klar sein, ohne Echo und Hintergrundmusik. Nach der Ausgabe sollten Übersteuerungen, Verschleifen bei der Aussprache sowie Veränderungen in der Klangfarbe überprüft werden.

Instant Voice Cloning

Die Pay-Pläne bieten in verschiedenen Stufen unterschiedliche Anzahlen an Slots für die sofortige Klonierung von Stimmen an. Starter umfasst 5 Slots, Launch 10 Slots, Core 50 Slots, Scale 200 Slots und Business 2.200 Slots.

Die Desktop-Client-Versionen verfügen über weitere Modellierungsregeln für die Versionen Pro und Premium. Bei der Nutzung der Premium-Version können bis zu 15.000 Credits für die Erstellung von Sounds benötigt werden. Diese Credits dürfen nicht mit den Slots des Web-Pakets verwechselt werden.

Text-zu-Stimme und TTS Studio

Online-TTS ermöglicht die Auswahl einer Stimme und die Erstellung von Audiodateien aus Text. Im kostenlosen Angebot sind maximal 500 Zeichen pro Anfrage möglich, ohne dass eine Download-Möglichkeit besteht;

Die Obergrenze für den ersten Auftrag wurde auf 5.000 Zeichen erhöht und um die Dateiherunterladung, eine Geschäftslizenz sowie TTS Studio erweitert.

Das höhere Paket bietet mehr gleichzeitige Erstellungen sowie monatliche Credits und eignet sich für die Massenerstellung von Kommentaren, Podcasts und Veröffentlichungsinhalten.

AI Voice Agents

Die Voice Agent Platform ermöglicht die Erstellung von Sprachassistenten für Anfragenbeantwortung, Terminvereinbarung, Datenerfassung oder Kundenservice, wobei Telefonnummern sowie die Anzahl der gleichzeitigen Gespräche konfiguriert werden können. Die Preispakete reichen von einer Telefonnummer und 2 gleichzeitigen Verbindungen bis hin zu 50 Nummern und 30 gleichzeitigen Verbindungen.

Für die Produktimplementierung sind außerdem ein Wissensspeicher, Toolaufrufe, Überleitung an Menschen, Aufzeichnungen zur Benachrichtigung sowie Fehlerbehandlung erforderlich.

Online-Audio-Tools

Die Plattform integriert Tools wie Audio Enhancer, Vocal Remover, Echo Remover, Stem Splitter, Key/BPM Finder und Reverb Remover. Die verschiedenen Angebote haben unterschiedliche Beschränkungen hinsichtlich der Länge der Dateien pro Anwendung, und auch die Umrechnung in Credits unterscheidet sich.

Das Trennen von Gesang oder das Verstärken des Audios kann Artefakte erzeugen. Professionelle Master-Dateien, Beweismittel-Audioaufnahmen sowie urheberrechtlich geschützte Audiodateien dürfen sich nicht ausschließlich auf automatische Ergebnisse verlassen.

Preise für die Voice.ai-Pakete für Einzelpersonen und Kreative

Im Folgenden sind die aktuellen monatlichen Preise in US-Dollar sowie die damit verbundenen Vorteile auf der offiziellen Preisseite aufgeführt. Bei der ersten Monatsgebühr wird ein Rabatt von 50 % gewährt; die reguläre Monatsgebühr beträgt 24 US-Dollar.

Die Aktion kann jederzeit enden.

Auf der Jahresabrechnungsseite ist eine Ermäßigung von etwa 2 Monaten angegeben. Der endgültige Betrag, die Steuern sowie der Preis für die Verlängerung richten sich nach den Angaben auf der Zahlungsseite.

PaketMonatspreisKredite/MonatKlangklonierungTTS / Agent und Konkurrenz
Free0 US-Dollar5,000Ohne Instant CloneEtwa 5 Minuten TTS; Basis-Agent und Audio-Tools; 500 Zeichen pro TTS-Ausgabe
Starter5 Dollar15,0005 StückEtwa 15 Minuten für TTS oder Agent; 3 Instanzen von TTS, 2 Instanzen von Agent gleichzeitig; 1 Nummer
LaunchNormaler Preis: 24 US-Dollar; Rabatt im ersten Monat: 12 US-Dollar200,00010 StückEtwa 200 Minuten TTS oder Agent; 5 Kanäle für TTS, 4 Kanäle für Agenten gleichzeitig; 3 Nummern
Core99 Dollar1,000,00050 StückEtwa 1.000 Minuten TTS oder Agent; 10 Kanäle für TTS, 8 Kanäle für Agenten gleichzeitig; 10 Nummern

Preise für Voice.ai-Unternehmenslösungen und Erweiterungspakete

PaketMonatspreisKredite/MonatKlangklonierungHauptsächliche Beteiligungshöhe
Scale330 US-Dollar4,000,000200 Stück15 parallele TTS-Verarbeitungen, 16 parallele Agenten, 20 Nummern, höhere Generierungs-Priorität
Business880 US-Dollar22,000,0002.200 Stück15 parallele TTS-Verbindungen, 30 parallele Agentenverbindungen, 50 Nummern, Technical Success Manager
EnterpriseIndividuelle KostenschätzungAnpassenMehr Plätze und StimmenDPA/SLA, HIPAA-Kunden-BAA, maßgeschneidertes SSO, Konkurrenz- und Skalierungsrabatte

Wie lange kann man Credits verwenden?

Einheitliche Credits können für TTS, Voice Agents oder Audio-Tools verwendet werden, wobei die Umrechnungsrate je nach Funktion unterschiedlich ist. Laut der offiziellen Hilfeseite verfallen die eingegangenen Credits nicht.

Die genaue Art der Übertragung der monatlich ausgestellten Beträge richtet sich weiterhin nach den Angaben auf dem Konto sowie den Bedingungen der Mitgliedschaft.

PaketTTS ist mehr oder weniger verfügbar.Voice Agents sind in etwa verfügbar.Audio-Tools sind in etwa verfügbar.Dauer einer einzelnen Audio-Datei
Free5 MinutenNach den Grundregeln für die ProbephaseEtwa 3 Mal5 Minuten
Starter15 Minuten15 Minuten500 Minuten10 Minuten
Launch200 Minuten200 Minuten3.000 Minuten20 Minuten
Core1.000 Minuten1.000 Minuten15.000 Minuten60 Minuten
Scale4.000 Minuten4.000 Minuten50.000 Minuten180 Minuten
Business22.000 Minuten22.000 Minuten150.000 MinutenNach unternehmensweiten Regeln

Die in der Tabelle angegebenen Minutenwerte stellen den theoretischen Wert dar, wenn alle Credits für eine einzige Funktion verwendet werden. Es ist nicht möglich, gleichzeitig drei vollständige Zeitintervalle zu erhalten. Ab dem Start wird eine gebührenbasierte Abrechnung unterstützt; der Preis für die Übernutzung ist auf der offiziellen Übersichtsseite nicht klar angegeben. Vor der Aktivierung müssen Budgets und Alarme festgelegt werden.

Wie wählt man die richtige Version für verschiedene Plattformen aus

VersionHauptverwendungszweckArbeitsweisePrüfen Sie vor dem Kauf.
Windows-ClientEchtzeit-Stimmenänderung, Aufnahmen, Spiele und Live-ÜbertragungenLokaler Client und virtuelles MikrofonGrafikkartenleistung, Regeln für Desktop-Pro/Premium und Credits
Mac-KlientEchtzeit-Stimmenveränderung und SoundboardDesktop-Anwendungen für Apple-ChipsAktuelle Systemversion, Anwendungskompatibilität und Abonnementskanäle
WebplattformTTS, Stimmenklonierung, Voice Agents, Online-Stimmenänderung und Audio-ToolsBrowser und Cloud-BearbeitungEinheitliches Paket, Download-Rechte, Geschäftslizenz und Verbrauchsabrechnung
iOS / AndroidMobile Sprachkreation und zugehörige ToolsAnwendung oder mobile WebsiteIst der In-App-Kauf mit dem Web-Konto verbunden?
SDK / APITTS und Voice Agents in Produkte integrierenServerseite, Web SDK und IntegrationsteileSchlüssel, Konkurrenz, Credits, Telefonkosten und Geschäftsbedingungen

Voice.ai-Anleitung zur Echtzeit-Stimmenveränderung

  1. Gerät überprüfen:Überprüfen Sie, ob das Betriebssystem, die Grafikkarte und der Mikrofon die Anforderungen des aktuellen Clients erfüllen, und deaktivieren Sie unnötige Geräuschunterdrückungs-Plugins.
  2. Installation des Clients:Laden Sie es von der offiziellen Plattform herunter, melden Sie sich mit Ihrem Konto an und erteilen Sie die Erlaubnis zur Erstellung virtueller Audiogeräte.
  3. Eingabe auswählen:Stellen Sie das echte Mikrofon als Eingang für Voice.ai ein und setzen Sie das virtuelle Voice.ai-Mikrofon in der Zielanwendung als Ausgabquelle fest.
  4. Klangauswahl:Verwenden Sie zunächst offizielle oder persönliche Stimmen mit klarer Genehmigung, um zu vermeiden, dass Persönlichkeiten deren Klang nachahmen.
  5. Qualitätsanpassung:Ein Gleichgewicht zwischen Verzögerung, GPU-Nutzung und Tonqualität finden, um mit Kopfhörern Echo zu vermeiden.
  6. Lokale Tests:Erstellen Sie eine Audiodatei, um Aussetzer, Störgeräusche, Lautstärke und Verzögerungen zu überprüfen, bevor Sie live gehen oder an einer Konferenz teilnehmen.
  7. Aktive Erklärung:In Kommunikationen, die zu Missverständnissen bezüglich der Identität führen können, sollte klar mitgeteilt werden, dass eine Stimmenveränderungstechnologie verwendet wird.

Anleitung zur Klonierung von Stimmen und Lizenzen

  1. Erstellen Sie nur eine Stimmenprobe mit Ihrer eigenen Stimme oder mit einer schriftlichen Genehmigung; geben Sie dabei den genauen Zweck, die Region, die Dauer sowie die Möglichkeit zur Rücknahme an.
  2. In einer ruhigen Umgebung werden Audioaufnahmen von einer einzelnen Person aufgenommen – ohne Musik, ohne Reverb und mit natürlicher Stimme.
  3. Wählen Sie entweder die Methode „Instant Clone“ für Webseiten oder die Methode des Desktop-Modellierens – bestimmen Sie zunächst, ob Slots oder Credits verbraucht werden.
  4. Nach der Erstellung wird die Ähnlichkeit, die Aussprache und die Stabilität mit kurzen Texten ohne sensible Inhalte getestet.
  5. Stellen Sie die privaten Stimmen auf „nicht öffentlich“ ein, beschränken Sie die Rechte des Teams und ermöglichen Sie das sofortige Löschen der Modelle nach Ablauf der Genehmigung.

Das Klonen von Stimmen ohne Genehmigung ist verboten – insbesondere darf man keine falschen politischen, Nachrichten- oder Finanzanweisungen sowie keine pornografischen Inhalte oder Stimmen zur Identitätsüberprüfung erstellen. Selbst wenn das Modell aus einer Community-Datenbank stammt, bedeutet das nicht, dass der Hochlader die rechtliche Genehmigung besitzt. Für kommerzielle Zwecke müssen Stimmen verwendet werden, deren Herkunft nachgewiesen werden kann.

Voice Agents und Entwicklerwerkzeuge

Die offizielle GitHub-Organisation stellt das Web SDK, n8n-Node, LiveKit-Plugins sowie Beispielcodes zur Verfügung – diese können für Sprachagenten auf Webseiten, TTS-Funktionen sowie die Integration von Automatisierungen genutzt werden. Die Veröffentlichung des SDK bedeutet jedoch nicht, dass die Voice.ai-Modelle und die Cloud-Plattform offen zugänglich sind; deren Nutzung setzt weiterhin die Nutzung der offiziellen Dienste, Konten und Credits voraus.

Bei der Entwicklung sollte zwischen den für den Client offenzulegenden Einstellungen und den Server-Schlüsseln unterschieden werden. Die Signatur der Webhooks muss überprüft werden, und für Anrufe sollten Grenzen hinsichtlich der Parallelität, der maximalen Dauer sowie der Kosten festgelegt werden. Bei der Bearbeitung von Kundenanrufen müssen die lokalen Vorschriften bezüglich Aufzeichnungen, Datenschutz, Werbeanrufen sowie der Offenlegung von Informationen durch KI eingehalten werden.

Medizinische Szenarien können nur nach Inkrafttreten der entsprechenden Unternehmensverträge und BAA gemäß den Compliance-Anforderungen bewertet werden.

Ob Open Source

Das Kernmodell zur Echtzeit-Stimmenveränderung von Voice.ai, die TTS-Dienste, die Sprachplattform sowie die Voice Agents sind keine Open-Source-Produkte. Offiziell werden einige SDKs sowie Beispiele für die Integration bereitgestellt, wodurch eine Verbindung zu Cloud-Diensten möglich ist – doch sie können nicht zur Offline-Einsatz der vollständigen Plattform verwendet werden.

Für welche Benutzer geeignet

  • Benutzer, die eine Echtzeit-Stimmenveränderung für Spiele, Live-Übertragungen und Sprachchats benötigen;
  • Kreative, die Video-Erzählungen, Podcasts und audiophile Inhalte produzieren;
  • Team, das eigene oder markenlizenzierte Klangfarben erstellen möchte;
  • Unternehmen, die Agenten für Telefonbetreuung, Terminvereinbarung und Lead-Screening entwickeln;
  • Entwickler, die über Web SDK, n8n oder LiveKit auf Sprachdienste zugreifen.

Vorteile und Einschränkungen bei der Verwendung

  • Der Vorteil von Voice.ai besteht darin, dass es Echtzeit-Stimmenveränderung, TTS, Stimmenklonierung, Sprachagenten sowie Audio-Tools unter einem einzigen Markenkonzept bündelt und ein umfassendes Spektrum an Tarifen anbietet – von kostenlosen Probepaketen bis hin zu hochleistungsfähigen Unternehmenslösungen.
  • Desktop-Anwendungen eignen sich für interaktive Szenarien, während Web-Plattformen zur Erstellung von Inhalten und zur Integration von Geschäftsprozessen geeignet sind.
  • Die Einschränkung besteht darin, dass es viele Produktlinien und Abonnementskanäle gibt, wobei die alten Desktop-Mitgliedschaften möglicherweise nicht mit den Online-Diensten kompatibel sind.
  • Die Echtzeitwirkung hängt vom Hardware-Setup ab, und die Umrechnung der Credits unterscheidet sich stark je nach Funktion.
  • Bei der Klonierung von Stimmen bestehen erhebliche Risiken hinsichtlich Identität, Abbildung, Privatsphäre und Betrug. Jede Ausgabe erfordert Autorisierung, Kennzeichnung sowie manuelle Überprüfung.

Häufige Fragen

Ist Voice.ai kostenlos?

Das Web-Paket bietet eine kostenlose Version mit 5.000 Credits pro Monat. Damit können TTS-, Stimmenveränderungs- und Audio-Tools ausprobiert werden – allerdings sind keine Funktionen wie die sofortige Klonierung von Stimmen oder das Herunterladen von TTS-Dateien enthalten. Der Desktop-Klient hat wiederum eigene Regeln für kostenlose und kostenpflichtige Versionen.

Wie viel kostet Voice.ai Starter?

Der offizielle Monatspreis beträgt derzeit 5 US-Dollar und beinhaltet 15.000 Credits, 5 sofort verfügbare Stimmenklonen, TTS-Downloads sowie eine kommerzielle Lizenz.

Gilt die Voice.ai-Kreditierung ab?

Laut der offiziellen Hilfeseite verfallen die Credits nicht, doch die Vorteile bei monatlichen Abonnements sowie der Saldo auf den verschiedenen Plattformen richten sich nach den Bedingungen des Kontos.

Kann ein Abonnement auf Computer, Webseiten und Mobilgeräten verwendet werden?

Es kann nicht als selbstverständlich angesehen werden. In den offiziellen Hilfedokumenten wird ausdrücklich darauf hingewiesen, dass Abonnements für iOS, Online-Dienste und PC-Apps nicht miteinander kompatibel sind. Vor der Bezahlung sollte man daher die Produktart sowie den Anmeldekanal überprüfen.

Ist Voice.ai Open Source?

Die Kernplattform ist nicht open source. Auf GitHub werden ein Web SDK, n8n-Node sowie Beispielcodes bereitgestellt, doch diese sind lediglich Entwicklungstools zur Verbindung der Dienste.

©️ Urheberrechtshinweis: Sofern nicht anders angegeben, liegen die Urheberrechte an allen Artikeln auf dieser Website beiTeilen von AI-ToolsAlle Urheberrechte liegen bei uns. Ohne Genehmigung darf keine Person, kein Medienunternehmen, keine Website oder irgendeine Gruppe den Inhalt dieser Website kopieren, nachahmen oder auf andere Weise verbreiten. Ebenso ist es nicht gestattet, Spiegelseiten auf Servern zu erstellen, die nicht uns gehören. Andernfalls behalten wir uns das Recht vor, rechtliche Schritte gegen die Verantwortlichen einzuleiten.

Tools, die ähnlich wie Voice.ai sind