Altered Studio
KI-Studio für die Umwandlung von Tonaufnahmen, Synchronisation und Postproduktion
Tags:KI-Audio-ToolsWas ist Altered Studio?
Altered Studio ist eine AI-basierte Plattform für die Erstellung von Sprachinhalten im Medienbereich. Die Kerntechnologie dabei ist das Speech-to-Speech Voice Morphing – dabei werden menschliche Stimmen in andere Stimmen umgewandelt, wobei der ursprüngliche Rhythmus, die Pausen, die Betonungen sowie die Emotionen möglichst beibehalten werden. Sie eignet sich für ADR in Filmen und Serien, Charakterstimmen in Spielen, Dialoge in Animationsfilmen, Werbeinhalte, audiovisuelle Materialien sowie für Kommentare zu Lehrinhalten – außerdem kann sie zur Anpassung der Stimme zum Schutz der Privatsphäre verwendet werden.
Die Plattform kann im Web genutzt werden, es stehen außerdem Desktop-Anwendungen für Windows und macOS zur Verfügung. Die Desktop-Version kann lokale Rechenressourcen nutzen, um Bearbeitungen durchzuführen, die Stimme in Echtzeit zu verändern sowie bestimmte Aufgaben der lokalen Klonierung von Geräuschen zu erledigen;
Unternehmen können sich außerdem über lokale Server, APIs und Mehrplatzlösungen informieren.
Kernfunktionen von Altered Studio
Stimme-zu-Stimme-Verwandlung
Der Benutzer nimmt eine Aufnahme oder importiert ein Stück Aufnahmematerial auf, wählt anschließend die gewünschte Stimme sowie das Modell aus, um einen neuen Klang zu erzeugen. Das Timbre-Modell verändert hauptsächlich den physikalischen Klang der Stimme und bewahrt dabei weitgehend den Akzent sowie die Ausdrucksweise des Sprechers bei.
Das Clone-Modell kommt dem Zielton sowie dessen Akzent deutlicher näher; die Einstellungen Performance und Style dienen hingegen zur präziseren Steuerung der Darbietung.
Im Vergleich zur reinen Text-zu-Stimme-Umwandlung kann die Stimmenverformung die spezifische Interpretation der Dialoge durch den Schauspieler beibehalten.
Die Plattform subtrahiert die Minuten des Voice Morphing entsprechend der Länge des eingegebenen Audios. Nach der ersten Veränderung desselben Audiodateis wird bei dem Versuch, andere Stimmen oder Einstellungen zu verwenden, in der Regel nicht erneut diese Quoten verbraucht. Dadurch ist es möglich, verschiedene Charaktere, Altersgruppen, Geschlechter sowie Tonhöhen einzustellen und miteinander zu vergleichen.
Echtzeit-AI-Stimmenveränderung
Real-Time Voice Morphing ermöglicht es, „Altered“ als virtuelles Mikrofon für Spiele, Sprachchats oder Videokonferenzen zu verwenden. Laut den offiziellen Angaben wird in diesem Modus Wert auf geringe Verzögerungen gelegt. In der Regel werden 1 bis 4 CPU-Kerne verwendet; es wird empfohlen, das Programm auf Computern mit mindestens 8 Kernen auszuführen.
Der Benutzer kann das Sprachmodell sowie den Sprechstil auswählen und Parameter wie die Spracherkennung sowie die automatische Lautstärkeregelung anpassen.
Der Echtzeit-Modus unterscheidet sich vom Medienproduktionsmodus: Der Echtzeit-Modus legt den Schwerpunkt auf Geschwindigkeit, während die Offline-Medienproduktion es ermöglicht, Modelle in höherer Qualität zu erstellen und feine Anpassungen vorzunehmen. Vor der Live-Übertragung sollten der Realtime-Faktor, der Puffer, das Mikrofonrauschen sowie die Eingabegeräte der Zielanwendung überprüft werden.
Klangklonierung
Rapid Voice Cloning ermöglicht es, in kürzester Zeit – bereits nach ein paar Sekunden an sauberer Sprachaufnahme – Klone zu erstellen, die für kurze Inhalte, Entwürfe von Charakteren sowie ADR-Anpassungen verwendet werden können. Hochwertigere lokale Klone können mithilfe von Aufnahmen eines einzelnen Sprechers, die einige Minuten bis etwa eine Stunde dauern, auf der eigenen Grafikkarte des Benutzers trainiert werden.
Die von den Herstellern empfohlene Mindestausstattung umfasst eine Grafikkarte der Klasse NVIDIA RTX 2080 mit 12 GB Speicher. Empfohlen werden hingegen die Modelle RTX 3090 oder 4090 mit 24 GB Speicher. Die genaue Kompatibilität sollte durch Tests mit den jeweiligen Desktop-Anwendungen überprüft werden.
Bevor eine Stimme geklont wird, muss die Genehmigung der Eigentümerin oder des Eigentümers der Stimme eingeholt werden. Es sollten keine Musik, Hintergrundgeräusche, Reverb-Effekte oder andere Sprecher in den Proben enthalten sein. Die Testdateien sollten idealerweise von den Trainingsdateien unterschiedlich sein, um zu überprüfen, ob das Modell tatsächlich generalisieren kann.
Text-zu-Stimme-Übersetzung und mehrsprachige Sprachausgabe
Altered Studio bietet eigene professionelle Stimmen sowie mehr als 700 Stimmen von Drittanbietern wie Azure, Google, AWS Polly und IBM – diese umfassen mehr als 70 Sprachen und Akzente. Die Nutzer können die Stimme, den Sprechstil sowie den Rhythmus der Texte auswählen. Zudem ist es möglich, zunächst längere Textabschnitte mit TTS zu erzeugen und anschließend die wichtigsten Passagen mithilfe von Speech-to-Speech weiter zu bearbeiten.
Transkription, Übersetzung, Rauschreduzierung und Audio-Editing
Die Plattform vereint Funktionen wie Sprach-zu-Text-Umwandlung, Textübersetzung, AI-Denoiser, AI-Voice-Cleaner sowie herkömmliche DSP-Effekte. In einem Projekt ist es möglich, Inhalte zu schneiden, anzuordnen, zu mischen und in Batches zu verarbeiten. Für die verschiedenen Dienste werden AI-Tokens je nach Anzahl der Zeichen, Sekunden oder Minuten abgerechnet. Die Token sollten nicht mit den Minuten für Voice Morphing unter einen Hut gebracht werden.
API und Unternehmensbereitstellung
Enterprise bietet API-Zugänge, Quotenpools für mehrere Benutzer, anpassbare Stimmen, einen persönlichen Kundenmanager sowie Schutz der Geschäftsdaten. Zudem steht die Möglichkeit zur Inanspruchnahme lokaler Rechenserver zur Verfügung. Die normalen Creator- oder Professional-Pakete beinhalten keine Zugänge zu öffentlichen API-Schnittstellen.
Die Kernanwendungen, Sounds und Modelle von Altered Studio sind kein Open-Source-Software. Zum Zeitpunkt der Überprüfung existierte auch kein offizielles Open-Source-SDK-Repository, das ein vollständiges Produkt darstellt.
Vergleich der Preise und Pakete von Altered Studio
Die offizielle Website zeigt die Preise für verschiedene Regionen in Monats-, Quartals- und Jahresabonnementen an. Im Folgenden sind die Preise in US-Dollar aufgeführt; die Werte für Quartals- und Jahresabonnements sind die durchschnittlichen Monatspreise. Die tatsächliche Abrechnung erfolgt entsprechend dem jeweiligen Zeitraum.
| Paket | Monatlich / Vierteljährlich, Monatsdurchschnitt / Jährlich, Monatsdurchschnitt | Stimmveränderung und Tokens | Befugnisse und Hauptfähigkeiten |
|---|---|---|---|
| Free | 0 US-Dollar | 3 Minuten/Monat; 10.000 Tokens | Lizenz für Signatur, Rapid Voice Cloning, Grundlegende Stimmenbearbeitung; bei nicht-kommerzieller Veröffentlichung muss dies angegeben werden |
| Creator | 40 / 36 / 30 US-Dollar | 60 Minuten/Monat; 325.000 Tokens | Creator-Lizenz, lokale Stimmenklonierung, Veränderung von Akzenten und Sprechstilen |
| Professional | 120 / 108 / 90 US-Dollar | 180 Minuten/Monat; 1.000.000 Tokens; unbegrenzte Anzahl an lokalen Anpassungen in alle Richtungen | Gewerbliche Lizenzen, flexible/leistungsstarke Stimmenverformung, 48 kHz Ausgangsgeschwindigkeit |
| Enterprise | Kontaktieren Sie den Verkauf | Keine Beschränkungen bei der Anpassung von Sprachverformungen und Tokens | Anpassbare Stimmen, API, mehrere Benutzerkonten, persönlicher Manager sowie Schutz von Geschäftsdaten |
Unverwendete AI-Tokens für Creator und Professional können gemäß den offiziellen Regeln auf den nächsten Monat übertragen werden. Die Anzahl der Minuten für die Stimmenveränderung sowie die Obergrenze für die Übertragung richten sich jedoch nach den Angaben auf der Kontoübersicht. Free verwendet eine Attribution-Lizenz – es ist nur eine nicht-kommerzielle Veröffentlichung zulässig, wobei anzugeben ist, dass es sich um eine veränderte Version handelt.
Die Creator-Lizenz erlaubt Privatpersonen oder Unternehmen mit bis zu 5 Mitarbeitern, das Produkt für kommerzielle Zwecke zu nutzen – vorausgesetzt, der Umsatz oder die Finanzmittel des Unternehmens in den letzten 12 Monaten liegen unter 100.000 US-Dollar. Falls diese Bedingungen nicht erfüllt sind oder Standardkommerzielle Rechte erforderlich sind, sollte man statt dessen die Professional- oder Enterprise-Lizenz wählen.
Wie werden AI-Tokens abgezogen?
| Dienstleistungen | Abrechnungseinheit | Beispiel für die Nutzung auf der offiziellen Website |
|---|---|---|
| Text zu Sprache | Nach Zeichen | Gängige Anbieter: 1 Token pro Zeichen; Google Studio: 8 Tokens pro Zeichen |
| Sprachtranskription | Nach Sekunden | Azure 14, mit Sprecherunterscheidung 19, Google 20 Token/Sekunde |
| AI Denoiser | Nach Sekunden | 12 Tokens/Sekunde |
| AI Voice Cleaner | Nach Minuten | 720 Tokens/Minute |
Lieferanten und Verbrauchsquoten können sich ändern. Bei langen Projekten sollte vor der Verarbeitung die Anzahl der Zeichen im Script sowie die Länge des Audios geschätzt werden. Für die Sprachumwandlung von Sprache zu Sprache gilt eine eigene Minutenzuteilung, die anhand der Länge der ursprünglichen Eingabe berechnet wird.
Anleitung zur Verwendung von Altered Studio
- Arbeitsmodus auswählen:Für die gesamte Synchronisation wird Studio zur Offline-Bearbeitung verwendet, während bei Konferenzen oder Spielen, bei denen eine geringe Verzögerung erforderlich ist, Real-Time genutzt wird.
- Vorbereitung für saubere Eingabe:Näher am Mikrofon aufnehmen, um Umgebungsgeräusche, Hall, Clipping und Überschneidungen mehrerer Personen zu verringern.
- Einfügen oder Aufnehmen einer Darbietung:Zuerst sollten Rhythmus, Pausen und Stimmung festgelegt werden, danach kann das Modell den Klang verändern; das ist in der Regel natürlicher als spätere Korrekturen.
- Modell auswählen:Um nur den Klang zu ändern, kann man Timbre ausprobieren. Wenn ein Klang oder Akzent, der dem Zielklang ähnelt, gewünscht ist, sollte man statt dessen Clone oder das entsprechende Stilmodell wählen.
- Vergleichsparameter:Für dieselbe Eingabe können weiterhin Zielstimme, Alter, Geschlecht, Tonhöhe und Stil ausprobiert werden, ohne die Quoten für die erste Umwandlung erneut zu verbrauchen.
- Endbearbeitung:Verwenden Sie Geräuschunterdrückung, Reinigung, Equalisierung und andere Effekte, um das Ergebnis anschließend mit der für das Projekt erforderlichen Abtastrate zu exportieren.
Anleitung zur Verwendung von Altered Studio
Erstellung wiederverwendbarer professioneller Workflows
- Erstellen Sie einen Testdatensatz mit echtem Rauschen, Akzenten und mehrsprachigen Abschnitten;
- Vergleichen Sie die Unterschiede in der Verarbeitung von Sprach zu Sprach-Veränderungen, Echtzeit-AI-Stimmenveränderung und Stimmenklonierung;
- Beibehalten der ursprünglichen Aufnahmen und unveränderten Transkripte;
- Vor der Veröffentlichung für die Öffentlichkeit eine mündliche Anhörung anberaumen;
- Statistische Auswertung der Verarbeitungszeit, Fehlerquote und Verbrauch von Limits;
- Regelmäßige Aktualisierung des Glossars, der Lizenzen für Töne und der Löschrichtlinien;
Für welche Benutzer geeignet
- Ton-Team für die Erstellung von Spielen, Animationen, Filmen und Serien sowie für ADR und Dialoge der Charaktere;
- Sprecher und Content-Creator, die mehrere Rollen ausprobieren müssen;
- Studio für die Erstellung von Werbespots, Hörbüchern, Kursen und Marketing-Texten;
- Benutzer, die bei Spielen, Livestreams oder Meetings eine geringe Verzögerung bei der Änderung der Stimme wünschen;
- Organisationen, die Wert auf die Klonierung lokaler Stimmen, die Kontrolle über Daten, APIs sowie Unternehmensworkflows legen.
Vorteile und Bedenken
- Der Unterschied bei AlteredStudio besteht darin, dass echte Schauspielungen als Haupteingang verwendet werden, was es ermöglicht, den Rhythmus und die Emotionen der Dialoge beizubehalten – anstatt dass der TTS einfach von vorne anfängt zu lesen.
- Sowohl die Echtzeit- als auch die hochwertige Offline-Methode, lokale Kloning, Audio-Editing sowie TTS von mehreren Anbietern machen es zu einer Lösung, die einer professionellen Sound-Workstation nahekommt.
- Die Ausgabe des Modells kann weiterhin einen metallischen Klang, Aussprachefehler, Akzentunterschiede oder eine unnatürliche Atmung aufweisen.
- Hochwertige lokale Modelle erfordern leistungsstarke Grafikkarten, und der Echtzeitmodus wird zudem durch den CPU, die Treiber sowie die Konfiguration der virtuellen Audioausgabe beeinflusst.
- Wenn die Stimmen von öffentlichen Persönlichkeiten, Schauspielern, Kunden oder Mitarbeitern verwendet werden, muss eine schriftliche Genehmigung vorliegen, und die Verwendung synthetisierter Stimmen muss dem Publikum mitgeteilt werden. Es darf keine Täuschung oder Fälschung von Aussagen vorliegen.
Häufige Fragen
Ist Altered Studio kostenlos?
Es gibt ein kostenloses Angebot, das 3 Minuten an Sprachverarbeitung pro Monat sowie 10.000 Tokens beinhaltet. Creator bietet außerdem eine 7-tägige kostenlose Testphase an – ohne Kreditkarte erforderlich.
Nach Ablauf der Testphase können Sie selbst entscheiden, ob Sie upgraden möchten.
Wird bei der Veränderung der Stimme wieder Zeit abgezogen?
Für denselben Eingabeteil wird in der Regel nur beim ersten Morphen eine Quotenabzug für die Länge des Eingabes erfolgen; bei anschließenden Versuchen mit anderen Stimmen und Einstellungen werden keine weiteren Minuten für diesen Teil verbraucht.
Kann es für kommerzielle Zwecke verwendet werden?
Free bietet nur eine nicht-kommerzielle Lizenz zur Nennung des Urhebers. Creator umfasst Einschränkungen hinsichtlich Einnahmen, Finanzierung und Teamgröße, während Professional eine umfassendere kommerzielle Lizenz bereitstellt;
Formelle Geschäftsprojekte sollten je nach ihrer Größe die entsprechende Lösung wählen.
Unterstützt lokale Ausführung?
Es werden Desktop-Anwendungen für Windows und macOS unterstützt, und es steht eine Möglichkeit zur lokalen Klonierung von Audiodaten zur Verfügung. Eine hohe Klonqualität setzt eine kompatible NVIDIA-GPU voraus;
Unternehmen können sich bei lokalen Servern beraten lassen.
Ist Altered Studio Open Source?
Kein Open Source. Die Kernanwendungen, die Sprachmodelle sowie die Dienste sind alle proprietäre Produkte, und auch die Unternehmens-APIs entsprechen nicht dem Open-Source-Prinzip.
Guigong-Netzwerk-Sicherheitsnummer: 45132202000164