ChatTTS
ChatTTS – macht die Arbeit mit künstlicher Sprachausgabe effizienter und einfacher.
Tags:KI-Audio-ToolsWas ist ChatTTS?
ChatTTS ist ein von 2Noise entwickeltes generatives Text-zu-Stimme-Modell, das speziell für Chat-Assistenten, Mehrpersonengespräche und gesprochene Inhalte konzipiert ist – und nicht für die traditionelle, vorgetragene Lesart.
Das Projekt unterstützt Chinesisch und Englisch und ermöglicht die Erzeugung von Sprachausgabe lokal über Python, die Kommandozeile oder eine beispielhafte WebUI. Englisch wird in der Projektbeschreibung weiterhin als experimentell bezeichnet; man kann nicht davon ausgehen, dass es die gleiche Stabilität wie Chinesisch aufweist.
Zuerst unterscheiden zwischen offiziellen Projekten und Webseiten mit demselben Namen.
| Objekt | Betreiber oder Wartungspersonal | Aktuelle Eigenschaften | Verwendung von Prüfungen |
|---|---|---|---|
| ChatTTS-Modell und Code | 2Noise | Offizielle Open-Source-Forschungsprojekte | Code-Repositories und Modellkarten als faktische Standards |
| Offizielle Seite von ChatTTS | 2Noise | Nur Link-Code und Modell | Kein Eingang für bezahlte Cloud-Generierung |
| Website mit gleichem Namen zur Vorstellung | NEXGOE LLC | Aggregierter Seiten für die Vorstellung und Demonstration von Produkten Dritter | Es handelt sich nicht um den offiziellen Service von 2Noise. |
| Kostenlose Demo auf der Webseite | In die Community eingebettet: Hugging Face Space | Vorführung durch Drittpartei-Sprecher | Die Daten und die Verfügbarkeit werden durch externe Dienste bestimmt. |
| App des gleichnamigen Ladens | Andere Entwickler | Drittanbieter-Client | Es kann nicht als offizielle App von 2Noise angesehen werden. |
Der gleichnamige Website-Link führt zum offiziellen Repository, doch auf der Seite gibt es Widersprüche bezüglich der Anzahl der trainierten Stunden, die veröffentlichten Modelle werden weiterhin als zukünftige Pläne bezeichnet, und es werden Angaben wie ein mehrsprachiges SDK gemacht, die vom offiziellen Projekt nicht bestätigt werden. Für die tatsächliche Implementierung und Lizenzierung gelten das aktuelle Repository sowie die Modellkarten von 2Noise.
Zustand des Modells und der Trainingsdaten
| Projekt | Status | Erklärung |
|---|---|---|
| Hauptmodell | Nicht vollständig veröffentlicht | Training mit mehr als 100.000 Stunden chinesisch-deutscher Audiodaten |
| Offenes Modell | Veröffentlicht | 40.000 Stunden Vortrainingsmodell, ohne überwachtes Feintuning |
| Hauptsprache | Chinesisch und Englisch | Englisch ist noch im experimentellen Stadium. |
| Rechte an den Trainingsdaten | Das Projekt beansprucht keine Eigentumsrechte. | Die Daten stammen aus öffentlichen Quellen; das Modell dient ausschließlich wissenschaftlichen Zwecken. |
| Sichere Handhabung | Einschränkungen wurden bereits eingeführt. | Beim Training wird eine geringe Menge an Hochfrequenzstörungen hinzugefügt, und die Qualität der öffentlich verfügbaren Audiodateien wird reduziert, um das Risiko von Missbrauch zu verringern. |
Das öffentliche Modell ist weder eine vollständige Version des Hauptmodells mit 100.000 Betriebsstunden noch ein kommerzieller Sprachmotor, der für Endnutzer optimiert wurde. Die auf der Website angegebenen Trainingsmengen und die Qualität des Klangs können keine Ersatz für tatsächliche Tests der öffentlich verfügbaren Gewichte sein.
Hauptfunktionen
Dialogbasierte Sprachsynthese
- Geben Sie chinesische, englische Texte oder eine Mischung aus Chinesisch und Englisch ein – das Modell erzeugt eine Sprachausgabe, die dem Rhythmus eines alltäglichen Gesprächs näher kommt.
- Eignet sich zur Erstellung kontinuierlicher Audiodaten für LLM-Assistenten, Dialogprototypen, Forschungsdemonstrationen und mehrfachige Interaktionen.
- Die Ausgabe kann mit einer Abtastrate von 24000 Hz als WAV gespeichert werden; Beispiele für die Befehlszeile im Repository erzeugen ebenfalls MP3-Dateien.
- Es ist dafür zuständig, Text in Sprache umzuwandeln, und nicht dafür, Geschäftsprobleme zu verstehen, Wissen abzurufen oder Dialogtexte zu erzeugen.
Mehr Sprecher und zufällige Stimmtöne
- Das Modell unterstützt mehrere Sprecher, und Entwickler können zufällige Speaker-Embeddings nutzen, um unterschiedliche Stimmtöne zu erzeugen.
- Nachdem die aus den Proben gewonnenen Sprecher-Embeddings gespeichert wurden, können ähnliche Stimmen bei späteren Inferenzen wiederverwendet werden.
- Zufällige Sprecher werden nicht durch hochgeladene Beispiele zur Identitätsreplikation erstellt; der derzeit öffentlich verfügbare Repository listet die Klonierung von Stimmen ohne Beispiele nicht als abgeschlossene Funktion auf.
- Die auf der gleichnamigen Website beworbenen Funktionen zur Klonierung von Stimmen leiten auf andere Produkte weiter und können nicht als offizielle Fähigkeit des ChatTTS-Modells angesehen werden.
Lachen, Pausen und die Steuerung des Umgangssprachlichen
- Die Eingabemöglichkeiten auf Satzebene ermöglichen die Anpassung der Intensität von „oral“, „laugh“ und „break“ zur Steuerung des Grades der mündlichen Sprache, der Neigung zum Lachen sowie der Länge der Pausen.
- Die Wortebene-Kontrolle umfasst derzeit hauptsächlich laugh, uv_break und lbreak, mit denen Lacher oder verschiedene Pausen an einer bestimmten Stelle eingefügt werden können.
- Temperature, top_P und top_K dienen zur Anpassung der Zufälligkeit bei der Stichprobenziehung; Veränderungen dieser Parameter beeinflussen Klangfarbe, Rhythmus und Stabilität.
- Weitere Emotionskontrollfunktionen sind weiterhin im Roadmap enthalten; das derzeit verfügbare Modell kann nicht stabil nach beliebigen Emotionslabels Inhalte erzeugen.
Batch-Infersion und lokale Tools
- Die Python-Schnittstelle ermöglicht es, mehrere Textabschnitte auf einmal einzusenden und ein Array von Audiodaten zurückzuerhalten – ideal zur batchweisen Erstellung von Testmaterialien offline.
- Der Speicher bietet eine Kommandozeilen-Schnittstelle, über die man einen oder mehrere Textabschnitte direkt als lokales Audio speichern kann.
- Die Beispiel-WebUI erleichtert das Testen lokaler Modelle im Browser, doch es handelt sich dabei um ein Entwicklungsbeispiel und nicht um eine Produktionsplattform mit Konten, Warteschlangen und SLAs.
- Die offiziellen Repositorien bieten auch Colab-Beispiele; die Ausführung in der Cloud wird durch die Dauer der Sitzung, die GPU-Kapazitäten sowie die Regeln für den externen Speicher beeinflusst.
Eingabe, Parameter und Ausgabe
| Schritte | Eingabe | Ausgabe | Wirkung |
|---|---|---|---|
| Grundlegende Schlussfolgerungen | Chinesischer oder englischer Text | Audio-Array | Die Dialoge in Sprache umwandeln |
| Sprecherkontrolle | Zufällige oder gespeicherte Speaker-Embeddings | Spezifische Klangfarbeneigungen | Beibehaltung der Klangfarbe der Charaktere |
| Satzweise Rhythmik | oral, lachen, unterbrechen Hinweise | Umgangssprachlicher Ton, Lachen und Veränderungen in den Pausen | Verbesserung der Dialogleistung |
| Wortsprachliche Rhythmik | laugh, uv_break, lbreak-Flags | Lachen oder Pausen an einer bestimmten Stelle | Präzise Gestaltung der Dialoge |
| Probenkontrolle | Temperatur, top_P, top_K | Verschiedene Stufen an Zufälligkeit und Klangqualität | Aus mehreren Ergebnissen auswählen |
| Datei speichern | Audio-Array und Abtastrate | WAV oder Beispiel MP3 | Schneiden, Bewerten und Abspielen |
Anleitung zur lokalen Installation und Nutzung
- Erstellen Sie eine Umgebung für Python 3.11; falls eine GPU erforderlich ist, überprüfen Sie zunächst die Kompatibilität der Grafiktreiber, von CUDA, PyTorch sowie des verfügbaren RAMs.
- Klonen Sie den Code aus dem offiziellen Repository von 2Noise oder installieren Sie das ChatTTS-Paket über PyPI; holen Sie sich keine unbekannten Ausführbaren Dateien von Download-Seiten mit dem gleichen Namen.
- Installieren Sie die Projektabhängigkeiten in einer isolierten virtuellen Umgebung und überprüfen Sie vor dem ersten Ausführen die Versionen der Abhängigkeiten sowie bekannte Sicherheitsprobleme.
- Initialisieren Sie das ChatTTS.Chat-Objekt und rufen Sie die aktuelle load-Methode auf, um das Modell zu laden; die load_models-Methode aus den alten Anleitungen ist möglicherweise veraltet.
- Führen Sie zunächst Infer mit kurzen Sätzen aus, um zu überprüfen, ob das Herunterladen des Modells, die Inferenz-Infrastruktur sowie der Prozess zur Speicherung von Audio in 24000Hz ordnungsgemäß funktionieren.
- Wenn Rollen festgelegt werden müssen, werden Speaker-Embeddings abgenommen und gespeichert, um anschließend mit denselben Embeddings die Konsistenz mehrerer Dialogabschnitte zu überprüfen.
- Verwenden Sie Satz- oder Wortebene-Kontrollmarkierungen, um Sprache, Lachen und Pausen anzupassen, ändern Sie jeweils nur wenige Parameter und behalten Sie die Vergleichsbeispiele bei.
- Batch-Aufgaben umfassen Textreinigung, maximale Länge, Wiederholungsversuche bei Fehlern sowie manuelle Überprüfung, um zu vermeiden, dass fehlerhafte Eingaben den Arbeitsspeicher erschöpfen oder Audio mit schlechter Qualität erzeugen.
- Vor der öffentlichen Präsentation sollte die synthetisierte Sprache überprüft werden, außerdem müssen Lizenzen, Rechte der Beteiligten sowie Inhaltsrisiken geprüft werden. Bei Geschäftsprojekten dürfen keine Gewichte aus dem aktuellen nicht-kommerziellen Modell verwendet werden.
Hardware und Leistung
| Projekt | Referenzen vom offiziellen Lager | Tatsächlicher Einfluss |
|---|---|---|
| 30 Sekunden Audio-Speicher | Mindestens etwa 4 GB Grafikspeicher | Längere Texte, Großmengen und Parallelverarbeitung erhöhen die Anforderungen. |
| Geschwindigkeit der RTX 4090 | Etwa 7 semantische Tokens pro Sekunde | Abhängig von Version, Parametern und Eingaben; nicht auf alle Grafikkarten übertragbar. |
| Echtzeit-Faktoren | Etwa 0,3 | Die Erstellungszeit beträgt etwa 30 Prozent der Länge des Audios und unterliegt bestimmten Testbedingungen. |
| CPU-Ausführung | Der Code kann versuchen, lokal zu schließen. | Die Geschwindigkeit ist in der Regel langsamer; das Projekt bietet keinen einheitlichen CPU-Referenzwert. |
| TransformerEngine | Es wird nicht empfohlen, es zu installieren. | Die Anpassung ist noch in Entwicklung; derzeit kann sie möglicherweise nicht ordnungsgemäß funktionieren. |
| FlashAttention-2 | Es wird nicht als Beschleunigungsmaßnahme empfohlen. | Die Projektprotokolle deuten darauf hin, dass die Erstellungsgeschwindigkeit möglicherweise sogar abnimmt. |
Offizielle Leistungsangaben dienen nur zur Schätzung im Entwicklungsumfeld und garantieren nicht die Produktivitätsleistung. Der eigentliche Service sollte anhand der Länge des Zieltextes, der Konkurrenzbelastung, der Anzahl der Sprecher sowie der Hardware unter Belastungstests gestellt werden.
Fähigkeitsgrenzen und bekannte Einschränkungen
- Bei autoregressiven Modellen können Sprecherwechsel, instabile Tonqualität, ungewöhnliche Pausen oder große Unterschiede bei denselben Sätzen auftreten.
- Der Projektvorschlag empfiehlt mehrfaches Sampling zur Auswahl der besten Ergebnisse, was bedeutet, dass er nicht für unüberprüfte, Echtzeit-kritische Berichterstattung geeignet ist.
- Englisch bleibt eine experimentelle Unterstützung; komplexe Eigennamen, Abkürzungen, Zahlen, gemischte Sprachen und lange Sätze erfordern möglicherweise eine Vorverarbeitung.
- Die Festlegung eines Speaker-Embeddings kann nur die Konsistenz der Klangqualität verbessern; sie kann jedoch nicht die Identität, das Alter, das Geschlecht oder emotionale Eigenschaften genau bestimmen.
- Die derzeit verfügbaren öffentlichen Modelle bieten keine vollständige Klonierung von Stimmen ohne Vorlage, keine Kontrolle über Stimmungen und keine zuverlässige Erstellung in serieller Form.
- Synthetische Sprachaufnahmen garantieren keinen Mangel an Hochfrequenzrauschen oder Artefakten sowie keine Eignung für Rundfunkproduktionen; zudem kann eine nachträgliche Rauschreduzierung den Klang verändern.
Funktionen der Roadmap
| Funktionen | Aktueller Zustand | Verwendung von Prüfungen |
|---|---|---|
| Fließende Audioerzeugung | Roadmap | Man kann Produkte in Echtzeit nicht nach den bereits verfügbaren Fähigkeiten entwerfen. |
| Offener DVAE-Encoder | Roadmap | Warte auf den offiziellen Code und die Lizenz |
| Zero-Sample-Reasoning | Roadmap | Derzeit sollte es nicht als Stimmenklonung beworben werden. |
| Stärkere Emotionskontrolle | Roadmap | Der aktuelle Kontrollbereich ist begrenzt. |
| ChatTTS.cpp | Roadmap und Gemeinschaftsinitiativen | Wurde nicht als offizielle, plattformübergreifende stabile Version bereitgestellt |
| Detektionsmodell | Geplante Öffnung | Derzeit gibt es keine zuverlässigen öffentlichen Prüfdienste. |
Preise und Nutzungskosten
2Noise bietet für ChatTTS kein offizielles, kostenpflichtiges Cloud-Paket an; der Code sowie die Forschungsmodelle können selbst heruntergeladen werden. Unter „kostenlos“ versteht man hier, dass keine Abonnementgebühren für das Projekt anfallen – doch das bedeutet nicht, dass es keine Kosten für Hardware, Cloud-GPUs, Speicher, Energie sowie Wartung gibt.
| Paket oder Version | Preis | Abrechnungszeitraum | Kernrechte oder -beträge | Für Nutzer geeignet |
|---|---|---|---|---|
| Offizieller Code | 0 Yuan zum Erhalten | Keine Abonnementgebühr | AGPLv3+-Code, Python und Beispieltools | Forscher und Entwickler |
| Offenes Modell | 0 Yuan zum Erhalten | Keine Abonnementgebühr | 40.000 Stunden Vortrainingsgewichte, ausschließlich für Bildungs- und Forschungszwecke sowie für nicht-kommerzielle Zwecke | Akademische Experimente |
| Lokale oder cloudbasierte Rechenleistung | Abrechnung nach eigenem Hardware- oder Cloud-Setup | Einsatz der Ausrüstung oder nach Verbrauch | Logik, Speicherung und Bandbreite | Teams, die in Batch-Modus ausgeführt werden müssen |
| Vorführung der gleichnamigen Webseite | Die Seite ist als kostenlos gekennzeichnet. | Drittanbieterdienste | Eingebettet in die Community-Space – Kapazität und Verfügbarkeit nicht garantiert. | Schnelle Prühunternahme mit niedriger Empfindlichkeit |
| Kommerzielle Lizenzierung | Kein öffentlicher Preis angegeben | Nicht anwendbar | Die derzeit veröffentlichten Modelle verbieten ausdrücklich den kommerziellen Einsatz. | Kann nicht für kommerzielle Nutzung eingesetzt werden. |
Die gleichnamige Website zeigt keine offiziellen Seiten für Abonnements oder Zahlungen von ChatTTS an und kann auch keine kommerziellen Lizenzen im Namen von 2Noise bereitstellen. Jede kostenpflichtige Version, jede API-Plattform oder jeder Client muss hinsichtlich des Entwicklers, der Lizenzbedingungen für die Modelle sowie der Datennutzungsrichtlinien separat überprüft werden.
API, SDK und Bereitstellungsweisen
| Methode | Aktueller Zustand | Erklärung |
|---|---|---|
| Python-Pakete | Offiziell zur Verfügung gestellt | Hauptmethoden zur programmierten Aufrufung |
| Befehlszeile | Offizielle Beispiele | Geben Sie den Text ein und speichern Sie die lokale Audio-Datei. |
| Lokale WebUI | Offizielle Beispiele | Eignet sich für Tests, nicht für Produktionshosting-Dienste |
| API-Beispiel | Der Speicher enthält Beispieldateien und Notebooks. | Eigene Bereitstellung und Wartung erforderlich |
| 2Noise-öffentliche Cloud-API | Noch nicht verfügbar | Keine Anfragen für öffentliche Schlüssel, Preise, Bandbreitenbeschränkungen und SLA |
| Multisprachiges offizielles SDK | Noch nicht verfügbar | Allgemeine Behauptungen auf Drittanbieter-Webseiten, es gäbe keine offiziellen Belege für ein Projekt. |
- Wenn man ChatTTS selbst als Netzwerk-API bereitstellt, muss man sich mit Warteschlangen, Zeitüberschreitungen, Isolierung des Arbeitsspeichers, Eingabefilterung, Authentifizierung sowie der Überwachung von Missbrauch auseinandersetzen.
- Die OpenAI API-Notebooks in den offiziellen Repositorien sind Beispiele für die Implementierung oder Kompatibilität und stellen keine öffentlichen Schnittstellen für 2Noise dar.
- Die Community-WebUI, die API-Verpackung und die Images sind keine offiziellen Produkte; ihre Versionen, Lizenzen sowie Sicherheitsqualitäten unterscheiden sich.
Open-Source-Lizenzen und kommerzielle Beschränkungen
| Komponenten | Lizenz | Kernbeschränkungen |
|---|---|---|
| ChatTTS-Code | AGPLv3+ | Bei der Änderung, Verteilung und Bereitstellung über das Internet müssen die vollständigen Open-Source-Pflichten berücksichtigt werden. |
| Offenes Modell | CC BY-NC 4.0 | Unterschrift erforderlich, nur für nicht-kommerzielle Zwecke |
| Trainingsdaten | Das Projekt beansprucht keine Eigentumsrechte. | Öffentlicher Zugang bedeutet nicht, dass Dritte keine Rechte haben. |
| Audio erstellen | Eine vollständige kommerzielle Lizenz wird nicht separat bereitgestellt. | Die nicht-kommerziellen Beschränkungen des Modells können nicht umgangen werden. |
- „Offener Quellcode“ bedeutet nicht, dass die Modellgewichte für kommerzielle Zwecke genutzt werden dürfen; beide Lizenzen müssen getrennt voneinander eingehalten werden.
- Auf der Modellkarte ist ausdrücklich für Bildung und Forschungszwecke bestimmt, wobei die erzeugte Audio-Datei nicht für Werbung, bezahlte Produkte, Kundenservice oder gewinnorientierte Inhalte verwendet werden darf.
- AGPLv3+ legt spezifische Verpflichtungen für Netzwerkdienste und modifizierte Versionen fest; Organisationen, die eine öffentliche Bereitstellung planen, sollten ihre tatsächliche Architektur von Compliance-Experten prüfen lassen.
- Falls das Unternehmen eine kommerzielle Sprachfunktion benötigt, sollte ein Modell gewählt werden, dessen Lizenz ausdrücklich den kommerziellen Einsatz erlaubt, oder eine schriftliche Genehmigung von dem Rechteinhaber eingeholt werden.
Privatsphäre, Sicherheit und Risiken von Missbrauch
Bei einer lokalen Installation können die eingegebenen Texte sowie die erzeugten Audiodateien auf dem eigenen Gerät oder Server gespeichert werden. Das ist im Vergleich zu Demonstrationen in der Cloud eines Dritten ein erheblicher Vorteil hinsichtlich der Privatsphäre. Das Projekt selbst bietet keine Richtlinien bezüglich der Privatsphäre von Benutzerkonten, der Online-Generierung oder der Cloud-Speicherung – schließlich betreibt 2Noise keine öffentliche Generierungsplattform.
- Modelldateien müssen in der Regel von einer externen Modell-Hosting-Plattform heruntergeladen werden. Auch in der Bereitstellungsumgebung entstehen Netzwerkanfragen, Caches sowie Aufzeichnungen zur Installation von Abhängigkeiten.
- Die Demonstration der gleichnamigen Webseite überlässt die Interaktion einem eingebetteten Drittanbieter-Service; sensible Texte sollten nicht ohne Überprüfung seiner Richtlinien eingereicht werden.
- Dritte App Store-Anwendungen, Community-APIs und Spiegel werden von ihren jeweiligen Entwicklern für die Datenverarbeitung betreut und unterliegen nicht den Entscheidungsregeln des 2Noise-Lokalprojekts.
- Die Erstellung von Stimmen, die einer echten Person ähneln, kann zur Täuschung, zum Betrug und zur Irreführung genutzt werden. Daher ist eine Genehmigung für die Verwendung der Stimme sowie der gesprochenen Texte erforderlich, und synthetisierte Inhalte müssen klar als solche gekennzeichnet werden.
- Das Projekt fügt Hochfrequenzrauschen hinzu und plant, ein Detektionsmodell einzuführen, doch dies garantiert nicht, dass jeder Audioabschnitt erkannt werden kann, dass Wasserzeichen vorhanden sind oder dass die Inhalte nicht missbraucht werden können.
- externe APIs sollten eine Begrenzung der Anfragenlänge, der Konkurrenzzahl sowie gefährlicher Inhalte aufweisen, notwendige Auditing-Daten erfassen und gleichzeitig das Speichern unbedeutender personenbezogener Daten vermeiden.
Geeignet für Nutzer und typische Szenarien
- Sprachforscher: Bewertung von dialogbasiertem TTS, mehreren Sprechern und Rhythmuskontrolle.
- Python-Entwickler: Erstellung lokaler, nicht-kommerzieller Prototypen oder Forschungstools.
- Hochschulen und Labore: Durchführung von Sprachexperimenten in Chinesisch und Englisch im Rahmen der Genehmigung.
- Forscher im Bereich LLM-Anwendungen: Erstellung von gesprochenen Antworten für Prototypen von Dialogassistenten sowie Testung der Interaktion.
- Lernende der Audio-Technologie: Erforschung von Sampling-Parametern, Sprecher-Embedding und Prozessen zur Audio-Speicherung.
- Nicht geeignet für kommerzielle Produkte, Werbung, bezahlte Inhalte und unbefugte Stimmenimitationen.
Vorteile und Einschränkungen
| Aspekte | Tatsächliche Beurteilung |
|---|---|
| Dialogleistung | Der Schwerpunkt auf Umgangssprache, Lachen, Pausen und mehreren Sprechern eignet sich besser für Chat-Experimente als reine Vorlesemodelle. |
| Entwicklungsansatz | Python, Kommandozeile, WebUI sowie umfangreiche Beispiele – alles läuft vollständig lokal. |
| Sprache | Chinesisch und Englisch sind möglich, aber Englisch ist weiterhin experimentell. |
| Stabilität | Autoregressive Generierung kann zu Drift führen, wofür mehrfaches Sampling und manuelle Prüfung erforderlich sind. |
| Echtzeit und Klonen | Fließende Verarbeitung, Null-Proben-Verfahren sowie weitere Emotionsfunktionen sind weiterhin im Entwicklungsplan – sie können daher noch nicht als aktuelle Funktionen angesehen werden. |
| Kommerzielle Nutzung | Das offene Modell ist ausdrücklich nicht kommerziell – das ist die entscheidende Grenze für seine praktische Anwendung. |
| Webseiten-Erlebnis | Die gleichnamigen Webseiten und Demos helfen dabei, die Konzepte zu verstehen, sind jedoch keine offiziell betriebenen Dienste, und die Informationen weichen voneinander ab. |
Zusammenfassung
ChatTTS eignet sich zur Erforschung von dialogbasierter Sprachausgabe, mehreren Sprechern sowie einer feinkörnigen Rhythmussteuerung. Der offizielle Repository bietet einen umfassenden Einstiegsweg von der Python-Infrastruktur bis hin zu einer lokalen WebUI.
Bei der Verwendung müssen das offizielle Projekt von 2Noise, die gleichnamige Website von NEXGOE LLC, die Community-Plattform sowie Drittanbieter-Apps voneinander getrennt werden. Derzeit sind nur Bildungszwecke und nicht-kommerzielle Anwendungen zulässig; bei kommerziellen Projekten, der Verbreitung von Klangklonen sowie der Erstellung sensibler Texte im Internet ist besondere Vorsicht geboten.
Guigong-Netzwerk-Sicherheitsnummer: 45132202000164