Fish Audio
Kostenloser Mehrwert
Komplette Liste an KI-Tools KI-Audio-Tools

Fish Audio

Sprachplattform mit Mehrsprach-Text-zu-Stimme-Umwandlung, Stimmenklonierung und API

Tags:

Was ist Fish Audio?

Fish Audio ist eine KI-gestützte Sprachplattform für die Inhaltsproduktion, Synchronisation, Lokalisierung, Echtzeit-Sprachprodukte sowie die Integration für Entwickler. Nutzer können im Web Skripte eingeben, um natürliche Sprache zu erzeugen, können auch kurze Aufnahmen nutzen, um Stimmen sofort zu klonen, Sprachmodelle für langfristige Nutzung zu trainieren, mehrstimmige Hörbücher erstellen, den Klang bereits vorhandener Aufnahmen verändern sowie Transkriptionen, Musik- und Filmeffekte erzeugen und Tonspuren trennen.

Die Plattform basiert derzeit auf den Sprachmodellen S2.1 Pro, S2 Pro und S1. Zudem werden REST API, WebSocket-Streaming-Schnittstellen sowie SDKs für Python und JavaScript bereitgestellt. Für Website-Mitglieder und API-Nutzung gilt jeweils ein anderes Abrechnungssystem: Mitglieder erhalten monatlich Credits, während die API hauptsächlich nach der Anzahl der UTF-8-Bytes, der Länge des Audiomaterials oder der Anzahl der erfolgreich abgewickelten Anfragen abgerechnet wird. Vor dem Kauf sollte man zunächst festlegen, welchen Zugang man nutzen möchte.

Text zu Sprache

Die Text-zu-Stimme-Übersetzung unterstützt über 80 Sprachen und kann Chinesisch, Englisch sowie eine Mischung aus mehreren Sprachen verarbeiten. Die Benutzer können zwischen offiziellen Stimmen der Plattform, ihren eigenen klonierten Stimmen oder professionellen Stimmen wählen, die Sprechgeschwindigkeit, die Stimmung sowie den Vortragsstil anpassen und die Ergebnisse in Formaten wie MP3, WAV, PCM oder Opus exportieren.

Zahlen, Daten, Währungen, Abkürzungen, Markennamen und Fachbegriffe können weiterhin falsch ausgesprochen werden. Bei formellen Projekten sollte zunächst ein Aussprachetest-Set erstellt werden, wobei lange Texte in Abschnitte aufgeteilt und vorgespielt werden, um anschließend einheitliche Regeln für Eigennamen und Pausen festzulegen.

S2.1 Pro-Stimmmodell

S2.1 Pro ist das derzeit empfohlene Produktmodell, das sich insbesondere auf die Verbesserung der Tonqualität, der Verzögerung beim ersten Paket sowie der Durchsatzrate konzentriert. Es unterstützt Richtungsangaben in natürlicher Sprache, Gespräche mit mehr Sprechern, Sprachwechsel, sofortige Klonierung von Stimmen, strömenden Audioinhalten sowie Zeitstempel auf Wortebene. Es eignet sich für Sprachagenten, Spielcharaktere, interaktive Geschichten und umfangreiche Kommentare.

Die Verzögerung des ersten Audiossegments auf der offiziellen Website liegt bei etwa 100 Millisekunden oder im Bereich von 70 bis 90 Millisekunden. Doch das sind Werte, die unter bestimmten Hardware-, Regional-, Text- und Netzwerkbedingungen gelten – sie gelten nicht für alle Anfragen. In der Produktionsumgebung müssen zudem die End-zu-End-Netzwerkleistungen, die Wartezeiten, der Puffer des Players sowie die Konkurrenzbeschränkungen berücksichtigt werden.

S2 Pro und S1

Die S2 Pro ist das Vorgängermodell und unterstützt die Beschreibung von Emotionen, Tonfall und Handlungen in natürlicher Sprache innerhalb von eckigen Klammern. Zudem kann sie mehrere Gesprächspartner gleichzeitig darstellen. Die S1 verwendet runde Klammern für die Angabe von Emotionen und eignet sich für Workflows, die bereits vorhanden sind, sowie für bestimmte Toneffekte.

Verschiedene Modelle weisen unterschiedliche Leistungen bei Labels, Sprachen, kurzen Sätzen und komplexen Texten auf. Bei der Übernahme von Modellen sollte man nicht nur die Namen ersetzen, sondern auch die Ähnlichkeit der Klangfarben, den Rhythmus, sensible Wörter, Zeitstempel sowie die Einheitskosten erneut überprüfen.

Echtzeit-Klangklonierung

Die sofortige Klonierung ermöglicht es, aus einem Referenz-Audio den Klang und den Sprechstil zu extrahieren und diese Eigenschaften zur Erzeugung von Sprache in anderen Sprachen zu verwenden. Kurze Audiodateien eignen sich gut für schnelle Tests. Je sauberer die Aufnahme ist, je von einer einzigen Person stammt, je kein Musikanteil vorhanden ist und je stabiler die Aussprache ist, desto zuverlässiger sind in der Regel die Ergebnisse.

Eine ähnliche Stimme bedeutet nicht, dass Identität, Stimmung und Akzent vollständig nachgeahmt werden können. Jede menschliche Stimme erfordert die ausdrückliche Zustimmung des Besitzers sowie eine Vereinbarung bezüglich des Verwendungszwecks, der Dauer, des Gebiets, der zugänglichen Personen sowie der Methode zur Löschung.

Es darf nicht zur Täuschung, zum Betrug oder zur Erstellung irreführender Aussagen verwendet werden.

Verbesserung der Klonierung professioneller Stimmen

Das Webseitenkonzept unterscheidet außerdem zwischen Enhanced Clone und Professional Voice. Professional Voice erfordert in der Regel ein standardisierteres Aufnahm- und Trainingsverfahren und eignet sich für eine langfristige Markenstimme, Hörbücher sowie Projekte mit hoher Konsistenz. Zudem ist die Anzahl der Professional Voice-Plätze bei den Mitgliedern begrenzt.

Offene, private und professionelle Sprachkanäle erzeugen keine Minutenanzahl. Offene Sprachkanäle können in der von der Community einsehbaren Reichweite zugänglich sein, während private Sprachkanäle nur für das jeweilige Konto oder Team bestimmt sind.

Bei Beteiligung von Schauspielern, Kunden und unveröffentlichten Markensprüchen sollte man Vorrang vor privaten Berechtigungen geben und die Teileinstellungen überprüfen.

Voice Design – Tondesign

Voice Design ermöglicht es, mithilfe von Textangaben das Alter, den Klang, den Akzent, die Geschwindigkeit, den Charakter sowie den Verwendungszweck zu beschreiben – dadurch erzeugt das System mehrere mögliche Stimmen. Es eignet sich zur schnellen Erkundung von Stimmen für fiktive Charaktere, Werbung und Spiele, ohne dass zunächst Audio-Beispiele von echten Menschen benötigt werden.

Textbeschreibungen können ähnliche oder unzuverlässige Ergebnisse liefern. Für wichtige Rollen sollten Referenz-Audio-Dateien sowie Voice-ID-Daten gespeichert werden, um zu überprüfen, ob die kandidierten Stimmen einer echten Person oder einer geschützten Rolle allzu ähnlich sind.

Mehrpersonen-Long-Audio und Hörbücher

Im Web-Bereich können mehrere Rollen sowie längere Skripte verwaltet werden, um Podcasts, Dialoge, Hörbücher und Kommentarprojekte zu erstellen. Die integrierte Mehrspielerfunktion von S2.1 Pro ermöglicht es, bei der Erstellung den Sprecher zu wechseln, wodurch eine spätere Bearbeitung reduziert wird.

Lange Texte neigen dazu, Betonungen, Fehlzuordnungen der Rollen sowie Unterschiede in der Lautstärke aufzuweisen. Es wird empfohlen, den Text in Kapitel zu unterteilen, die Stimme jeder Rolle festzulegen und vor der endgültigen Exportierung eine vollständige Abhörung sowie eine Normalisierung der Lautstärke durchzuführen.

Stimmenveränderer

Der Voice Changer wandelt die hochgeladenen Aufnahmen in eine andere Stimme um, wobei der ursprüngliche Rhythmus und die Ausdrucksweise möglichst beibehalten werden. Er eignet sich dazu, vorübergehende Kommentare durch eine einheitliche Charakterstimme zu ersetzen, sowie für mehrsprachige oder kreative Audio-Prozesse.

Hintergrundmusik, Reverb, übereinanderliegende Sprachaufnahmen und lauter Lärm verringern die Qualität der Umwandlung. Eine Stimmanpassung ändert nichts an den Urheberrechts- und Genehmigungsanforderungen der ursprünglichen Aufnahme; sowohl die eingebende Stimme als auch die Zielstimme müssen eine legale Genehmigung haben.

Audio-Transkription

Die ASR-Technologie von Fish Audio kann Audiodateien in Text umwandeln, wobei Zeitstempel für die einzelnen Abschnitte angegeben werden. Dadurch wird das Erstellen von Untertiteln, die Suche nach Inhalten sowie die spätere Sprachaufnahme erleichtert. Die API „transcribe-1“ wird derzeit pro Stunde Audiodaten abgerechnet – wobei die Gebühr auf die nächste Sekunde aufgerundet wird.

Überlappungen mehrerer Personen, Dialekte, Störgeräusche und Eigennamen können die Genauigkeit beeinträchtigen. Rechtliche, medizinische, finanzielle Texte sowie Untertitel müssen von Menschen überprüft werden; eine automatische Transkription kann nicht direkt als wörtliches Beweismittel angesehen werden.

Musik, Soundeffekte und Audio-Tools

Webanwendungen bieten außerdem Funktionen zur Erstellung von Musik und Filmesoundeffekten, zur Trennung von Audiospuren sowie weitere audiobezogene Werkzeuge – ideal für die Erstellung von Materialien für Kurzvideos, Podcasts und Spiele. Die benötigten Credits sowie die kommerziellen Einschränkungen der verschiedenen Tools können unterschiedlich sein; diese sollten auf der jeweiligen Erstellungsseite überprüft werden.

Eine von KI erzeugte Musik garantiert keine völlige Freiheit von Urheberrechtsproblemen. Vor der Veröffentlichung sollten die Erstellungsdaten aufbewahrt werden, außerdem sollten die Bedingungen der Plattform, die Ähnlichkeit mit vorhandenen Beispielen sowie die Anforderungen der gewünschten Vertriebskanäle an Musik aus KI geprüft werden.

Kostenloses Angebot

Kostenlos: 0 US-Dollar, keine Kreditkarte erforderlich. Monatlich werden 8000 Credits zur Verfügung gestellt; nach Schätzungen der offiziellen Website beträgt die Generierungszeit maximal etwa 7 Minuten. Pro Anfrage sind maximal 500 Zeichen möglich. Es sind außerdem 3 öffentliche Tonspuren vorhanden, es gilt eine Standard-Generierungsgeschwindigkeit, es steht eine verbesserte Tonklonierung zur Verfügung – und die Funktion kann auch für kommerzielle Zwecke genutzt werden.

„Maximal 7 Minuten“ – bei einer Schätzung von 600 bis 625 Credits pro Minute. Der tatsächliche Verbrauch hängt vom Modell, den Funktionen sowie den Einstellungen ab. Die monatlichen Credits sind kein dauerhafter Guthabenbestand, und das kostenlose Angebot eignet sich nicht zur Speicherung von Audiodaten, die streng geheim gehalten werden müssen.

Preis- und Versionsvergleich

Paket oder VersionPreise, Limits und Kernvorteile
Plus-PreisDer aktuelle Jahresplan bietet einen Rabatt von durchschnittlich 5,5 US-Dollar pro Monat – insgesamt also 66 US-Dollar im Jahr. Der ursprüngliche Preis auf der Seite beträgt 15 US-Dollar pro Monat. Es werden monatlich 250.000 Credits zur Verfügung gestellt; bei normaler Nutzung entspricht das etwa 200 Minuten. Pro Transaktion sind maximal 15.000 Zeichen erlaubt. Es stehen unendlich viele öffentliche Stimmen sowie 10 private Stimmenplätze zur Verfügung. Zudem gibt es die Möglichkeit, eigene Stimmen zu erstellen, einen professionellen Stimmenplatz sowie Vorrang bei der Nutzung der neuesten Modelle. Außerdem sind Funktionen wie verbesserte Klonierung sowie kommerzielle Nutzung möglich. Die Jubiläums- oder Jahresrabatte gelten als temporäre Angebote – nach Ablauf dieser Zeit kann der ursprüngliche Preis wieder gelten. Es sollten immer der Währungstyp, die Steuern, der Preis für die Verlängerung sowie die Zahlungsfrist auf der Bezahlseite berücksichtigt werden.
Pro-PreisDer aktuelle Jahrespreis lautet 37,5 US-Dollar pro Monat, was im Jahr insgesamt 450 US-Dollar entspricht. Der ursprüngliche Preis auf der Seite lag bei 100 US-Dollar pro Monat. Pro Monat werden 2.000.000 Credits zur Verfügung gestellt – das entspricht etwa 1620 Minuten Nutzungzeit. Es gibt außerdem 3 Teamplätze, eine Begrenzung von 30.000 Zeichen pro Nachricht, unbegrenzte Anzahl an öffentlichen und privaten Sprachkanälen sowie 5 professionelle Sprachkanäle. Zudem gibt es eine 7-tägige Rückgabegarantie. Die Rückgabegarantie hängt vom Kaufweg, vom Verbrauch sowie von den geltenden Rückgaberegeln ab – nicht alle Bestellungen mit hohem Verbrauch werden automatisch erstattet. Vor dem endgültigen Kauf sollten die Teammitglieder die Berechtigungen, die gemeinsame Nutzung der Ressourcen sowie das Eigentum an den Sprachkanälen klären.
Max-PreisDer jährliche Plan von Max zeigt einen Durchschnittspreis von 749 US-Dollar pro Monat sowie 8988 US-Dollar im ganzen Jahr. Auf der Seite wird außerdem der ursprüngliche Preis von 999 US-Dollar pro Monat angegeben. Pro Monat werden 25.000.000 Credits zur Verfügung gestellt – das entspricht in etwa 6250 Minuten, 10 Teamplätzen sowie 15 professionellen Audio-Plätzen. Dies eignet sich ideal für Teams, die häufig produzieren müssen. Die Credits von Max lassen sich nicht einfach in einen einheitlichen Prozentsatz umrechnen; daher können bei verschiedenen Modellen oder Arbeitsabläufen Unterschiede bestehen. Kunden, die in großen Mengen kaufen, sollten die Kosten anhand der tatsächlichen Skripte berechnen – anstatt einfach nach der maximalen Anzahl der Minuten zu kaufen.
API-Preise nach VerbrauchDie API erfordert weder eine monatliche Mitgliedschaft noch einen Mindestumsatz pro Monat. Für S2.1 Pro, S2 Pro und S1 Text-zu-Stimme kostet es derzeit 15 US-Dollar pro 1 Million UTF-8-Zeichen. Laut offiziellen Schätzungen entsprechen 1 Million Zeichen etwa 180.000 englischen Wörtern oder 12 Stunden Sprachausgabe. Da chinesische Zeichen in der Regel mehr UTF-8-Zeichen benötigen, lässt sich dieser Umrechnungsfaktor nicht direkt auf Englischwörter anwenden. Derzeit kostet die ASR-Technologie 0,36 US-Dollar pro Stunde Audioinhalts – gerundet nach oben. Für jede erfolgreiche Anfrage von Voice Design fallen 0,01 US-Dollar an. Fehlschläge, Wiederholungsversuche, die Aufteilung langer Texte in kleinere Teile sowie die Erstellung mehrerer Versionen können die endgültigen Kosten beeinflussen.

Plus-Preis

Der aktuelle Jahresplan bietet bei der Aktion einen Preis von 5,5 US-Dollar pro Monat, was im Jahr insgesamt 66 US-Dollar entspricht. Der ursprüngliche Preis auf der Seite lag bei 15 US-Dollar pro Monat. Pro Monat werden 250.000 Credits zur Verfügung gestellt; aufgrund des durchschnittlichen Verbrauchs sind etwa 200 Minuten nutzbar.

Maximal 15.000 Zeichen pro Eintrag, inklusive unbegrenzter öffentlicher Stimmen, 10 privater Stimmslots, Voice Design, 1 professioneller Stimmslot, Vorrangige Verwendung des neuesten Modells, verbesserte Klonfunktionen und kommerzielle Nutzung.

Jahrestage- oder Jahresrabatte gehören zu den aktuellen Aktionen; nach Ablauf können die ursprünglichen Preise wieder gelten. Es gelten die auf der Zahlelseite angegebenen Währung, Steuern, Verlängerungspreise sowie Zahlungsfristen.

Pro-Preis

Der aktuelle Rabatt für das jährliche Abo beträgt 37,5 US-Dollar pro Monat, insgesamt also 450 US-Dollar im Jahr. Der ursprüngliche Preis auf der Seite lag bei 100 US-Dollar pro Monat. Pro Monat werden 2.000.000 Credits zur Verfügung gestellt – das entspricht etwa 1620 Minuten Nutzungzeit. Es sind außerdem 3 Teamplätze verfügbar, sowie eine Begrenzung von 30.000 Zeichen pro Nachricht. Es gibt unendlich viele öffentliche und private Sprachkanäle sowie 5 professionelle Sprachkanäle. Zudem gilt eine 7-tägige Geld-zurück-Garantie.

Die Rückerstattungsgarantie hängt vom Kaufweg, vom Verbrauch sowie von den geltenden Rückerstattungsregeln ab. Nicht alle Bestellungen mit hohem Verbrauch führen zwangsläufig zu einer Rückerstattung. Das Team sollte vor der offiziellen Beschaffung die Rechte der Teammitglieder, die Zusammenarbeit bei Projekten sowie das Eigentumsrecht an den Audioinhalten klären.

Max-Preis

Der jährliche Plan von Max zeigt einen Durchschnittspreis von 749 US-Dollar pro Monat sowie insgesamt 8988 US-Dollar im Jahr. Auf der Seite wird außerdem der ursprüngliche Preis von 999 US-Dollar pro Monat angegeben. Pro Monat stehen 25.000.000 Credits zur Verfügung – das entspricht in etwa 6250 Minuten Nutzungzeit, 10 Teamplätzen sowie 15 professionellen Audio-Slots. Dies eignet sich ideal für Teams, die häufig produzieren müssen.

Max’ Credits werden nicht einfach in einem einheitlichen Verhältnis zu den angegebenen Minuten umgerechnet – das zeigt, dass es Unterschiede zwischen den verschiedenen Modellen oder Workflows geben kann. Kunden mit großen Bestellungen sollten die Kosten anhand der tatsächlichen Skripte berechnen, anstatt einfach nach der maximalen Anzahl an Minuten zu kaufen.

Enterprise-Unternehmenslösung

Enterprise bietet auf Anfrage Kostenvoranschläge an und kann jährliche oder nach Verbrauch gestaltete Lösungen, Mengenrabatte, keine Datenspeicherung, Privatisierung oder lokale Implementierung sowie SOC 2-konforme Unternehmensfunktionen und maßgeschneiderte Unterstützung anbieten; SSO wird auf der aktuellen Vergleichsseite möglicherweise noch als bald verfügbar angezeigt.

Bei keiner Datenspeicherung und bei lokaler Installation ist es notwendig, Verträge abzuschließen und den Umfang der Abdeckung zu überprüfen. Man darf nicht davon ausgehen, dass alle Eingaben, Protokolle, Backups sowie Sprachmodelle automatisch nicht gespeichert werden, nur weil auf der Seite ein Firmenlogo zu sehen ist.

API-Preise nach Verbrauch

Die API erfordert weder eine monatliche Abonnementgebühr noch einen Mindestumsatz pro Monat. Für S2.1 Pro, S2 Pro und S1 Text-zu-Stimme beträgt der Preis derzeit 15 US-Dollar pro 1 Million UTF-8-Zeichen.

Offizielle Schätzungen gehen davon aus, dass 1 Million chinesische Zeichen etwa 180.000 englische Wörter oder 12 Stunden Sprachaufnahme entsprechen. Da chinesische Zeichen in der Regel mehr UTF-8-Bytes beanspruchen, lässt sich die Umrechnung nicht direkt auf englische Wörter anwenden.

Derzeit beträgt die ASR-Kosten 0,36 US-Dollar pro Audio-Stunde, wobei aufgerundet wird – jeweils nach Sekunden. Für jede erfolgreiche Anfrage bei Voice Design fallen 0,01 US-Dollar an.

Fehler, erneute Versuche, die Aufteilung langer Texte sowie die Erstellung mehrerer Versionen beeinflussen alle den Endpreis.

S2.1 Pro Free API

s2.1-pro-free kostet im Rahmen der Richtlinien für faire Nutzung 0 Dollar. Es unterstützt 83 Sprachen und eignet sich für Tests, Prototypen, die Entwicklung sowie für kleinere Unternehmen. Es verwendet dasselbe Modell wie S2.1 Pro, bietet jedoch keine Garantien bezüglich der Latenzzeit bei der Datenübertragung oder bezüglich der Unternehmensdienste. Zudem können die Bedingungen für die kostenlose Nutzung sowie die dazugehörigen Regeln geändert werden.

Kostenlose Modelle bedeuten keine unbegrenzte SLA für die Produktion. Kritische Geschäftsprozesse sollten über kostenpflichtige Modelle, Wiederholungsversuche bei Verzögerungen, Failover-Mechanismen, Caching sowie alternative Anbieter verfügen und regelmäßig die Limits für einen fairen Gebrauch überprüfen.

API-Konkurrenzniveau

Die Obergrenze für die gleichzeitige Ausführung hängt vom gesamten im Account hinterlegten Vorausbetrag ab: Nutzer mit einem gesamten Zahlungsbetrag von weniger als 100 US-Dollar haben in der Regel 5 gleichzeitige Aufgaben; Nutzer mit einem Betrag von 100 US-Dollar oder mehr haben 15 gleichzeitige Aufgaben.

Für einen High Volume von 1.000 US-Dollar sind 50 gleichzeitige Verbindungen möglich; bei Enterprise wird dies nach Vertragsvereinbarung festgelegt.

Die Anzahl der gleichzeitigen Anfragen ist nicht die Anzahl der Anfragen pro Sekunde, und es wird auch keine feste Verzögerung garantiert. Lange, kontinuierliche Anfragen beanspruchen länger die Verbindung – daher benötigen Entwickler Warteschlangen, Limitierungen, exponentielles Backoff sowie Funktionen zur Überwachung.

REST, WebSocket und SDK

Entwickler können mithilfe von REST eine normale Generierung durchführen, über WebSocket fließendes Audio empfangen und die TTS-, Transkriptions- sowie Sprachmodelle mit den offiziellen Python- und JavaScript-SDKs verwalten. Die Schnittstelle ermöglicht das Erstellen, Auflisten, Aktualisieren und Löschen von Sprachmodellen und kann außerdem mit Echtzeit-Sprachframeworks wie LiveKit und Pipecat integriert werden.

Der API-Schlüssel muss auf der Serverseite oder in einem Schlüsselverwaltungssystem gespeichert werden und darf nicht in Webseiten, Mobile-Apps oder öffentliche Repositorien geschrieben werden. In Produktivsystemen müssen außerdem die Dateitypen überprüft, die Länge des Textes begrenzt, die Anfrage-ID aufgezeichnet sowie Abbrüche von Streamverbindungen behandelt werden.

GitHub und der Open-Source-Zustand

Die Fish Audio-Webplattform, die gehosteten APIs, das Kontosystem sowie der Community-Sound-Markt sind keine vollständig open-source-Produkte. Auf GitHub werden die Quellcodes von Fish Speech, Ressourcen zu den Modellen, SDKs sowie Wartungstools bereitgestellt, doch offener Code bedeutet nicht, dass er bedingungslos für kommerzielle Zwecke genutzt werden kann.

Der Code der aktuellen Hauptversion von Fish Speech sowie die dazugehörigen Modellgewichte unterliegen der Fish Audio Research License. Für Forschungszwecke und nicht-kommerzielle Nutzung ist die Lizenz gültig.

Jede kommerzielle Nutzung, einschließlich interner Unternehmensprozesse, kostenpflichtiger Produkte, Hosting-Dienste oder APIs, erfordert eine gesonderte schriftliche Geschäftslizenz von Fish Audio.

Die Angaben auf der alten Seite zu Apache oder CC-BY-NC-SA beziehen sich möglicherweise auf eine ältere Version. Bei der Beurteilung sollte die aktuelle Lizenz, die zur verwendeten Version gehört, maßgeblich sein.

Lokale Bereitstellung

Die offiziellen Fish Speech-Dokumente bieten Anleitungen zur Installation unter Linux oder WSL, sowie für Docker, WebUI und API-Server. Für die Verarbeitung mit der S2-Serie werden etwa 24 GB an Grafikspeicher empfohlen; es werden auch Optionen für eine CPU-basierte Verarbeitung angeboten. Unternehmen können außerdem Beratung zu einer Implementierung in VPCs, lokalen Netzwerken, souveränen Clouds oder isolierten Netzwerken erhalten.

Dass man ein Modell herunterladen und ausführen kann, bedeutet nicht, dass man das Recht hat, es kommerziell einzusetzen. Bei einer selbst betriebenen Lösung müssen zudem die Kosten für GPUs, die Sicherheit des Modells, Aktualisierungen, Schutz vor Missbrauch sowie Konformität bezüglich Protokollen und Daten berücksichtigt werden. Für kommerzielle Projekte ist zunächst eine eigene Lizenz erforderlich.

Kommerzielle Nutzung und Lizenzen für Töne

Sowohl die kostenlosen als auch die kostenpflichtigen Versionen der Website sind derzeit für kommerzielle Nutzung freigegeben. Diese Genehmigung gilt jedoch nur für die Ergebnisse, die bei der Nutzung des Services erzeugt werden, sofern die Bedingungen eingehalten werden. Sie verleiht dem Nutzer keine Rechte an Skripten, Musik, menschlichen Stimmen, Charakteren, Markenzeichen oder anderen hochgeladenen Materialien.

Die Rechte zur Bereitstellung von Hosted-Diensten und die Lizenz für Forschungen im Bereich Fish Speech sind zwei verschiedene Dinge: Die Erstellung von kommerziellen Inhalten über Mitgliedschaften oder APIs bedeutet nicht, dass die heruntergeladenen Modellgewichte für kommerzielle Zwecke verwendet werden dürfen. Bei sensiblen Projekten müssen Zustimmungsnachweise, Quellen der Stimmen sowie Aufzeichnungen zur Überprüfung der Veröffentlichung aufbewahrt werden.

Anleitung für Fish Audio

Eine grundlegende Aufgabe erledigen

  1. Bestätigung der Aufnahmen, der Geräusche, der Musik sowie der Genehmigung der Teilnehmer;
  2. Laden Sie hochwertiges Audio in Fish Audio hoch oder eingeben Sie es dort ein;
  3. Wählen Sie Einstellungen wie Sprache, Sprecher und Text-zu-Stimme-Umwandlung aus;
  4. Verwenden Sie das S2.1 Pro-Sprachmodell zur Erstellung von Transkripten, Untertiteln oder zur Aufbereitung von Inhalten;
  5. Überprüfen Sie Abschnitt für Abschnitt Namen, Zahlen, Pausen, Lautstärke und Stimmung;
  6. Prüfen Sie vor der Exportierung das Format, die Lautstärke sowie die Anforderungen bezüglich Urheberrechten und Datenschutz.

Erstellung wiederverwendbarer professioneller Workflows

  1. Erstellen Sie einen Testdatensatz mit echtem Rauschen, Akzenten und mehrsprachigen Abschnitten;
  2. Vergleich der Unterschiede in der Text-zu-Stimme-Übertragung, des S2.1 Pro-Stimmmodells sowie von S2 Pro und S1 bei der Verarbeitung;
  3. Beibehalten der ursprünglichen Aufnahmen und unveränderten Transkripte;
  4. Vor der Veröffentlichung für die Öffentlichkeit eine mündliche Anhörung anberaumen;
  5. Statistische Auswertung der Verarbeitungszeit, Fehlerquote und Verbrauch von Limits;
  6. Regelmäßige Aktualisierung des Glossars, der Lizenzen für Töne und der Löschrichtlinien;

Für welche Nutzer geeignet?

  • Kreative, die Video-Erzählungen, Podcasts, Hörbücher und Audiomaterialien für Kurse erstellen;
  • Es werden ein Team für mehrsprachige Synchronisation, Dialoge der Charaktere sowie lokalisierte Inhalte benötigt;
  • Unternehmen, die eine Markenstimme oder eine Stimme für Spielcharaktere schnell entwickeln möchten;
  • Entwickler von Voice-Agenten, Kundenservice-Tools, Begleit-Apps und Produkten für Menschen mit Behinderungen;
  • Forschungs- und Bewertungsteams für Technologien, mit denen Sprachmodelle lokal ausgeführt werden können.

Vorteile des Produkts

  • Deckt mehr als 80 Sprachen ab und unterstützt den natürlichen Wechsel zwischen mehreren Sprachen;
  • S2.1 Pro unterstützt natürlichsprachige Performance-Labels und native Mehrspieler-Dialoge;
  • Die Webversion bietet gleichzeitig Tools für das Klonen, lange Audiodateien, Stimmenveränderung, Transkription und Audiobearbeitung.
  • REST, WebSocket, sowie Python- und JavaScript-SDKs sind recht umfassend;
  • Kostenlose API-Modelle unter Einschränkungen der fairen Nutzung;
  • Es gibt sowohl Hosting-Dienste als auch für Forschungszwecke nutzbare herunterladbare Modelle sowie Optionen für die Unternehmensimplementierung.

Einschränkungen und Hinweise

  • Die Credits auf der Website, der API-Bestand sowie die selbst gehosteten Lizenzen sind voneinander unabhängig – die Mitgliedsminuten können nicht direkt für die API verwendet werden.
  • Preise für Aktionen, kostenlose Modelle sowie Richtlinien zur fairen Nutzung können sich ändern. Der Budgetbetrag richtet sich nach der Abrechnungsseite und der Konsole.
  • KI-Stimmen weisen Abweichungen in Aussprache, Charakter, Stimmung und Ähnlichkeit auf;
  • Klangklonierung, Stimmenveränderung und Gemeinschaftsklänge müssen autorisiert werden, wichtige Inhalte erfordern eine manuelle Anhörung;
  • Die derzeitige Forschungslizenz von FishSpeech gewährt keinen kommerziellen Nutzungsrecht.

Häufige Fragen

Ist Fish Audio kostenlos?

Die Website Free stellt monatlich 8000 Credits zur Verfügung – das entspricht in der Regel etwa 7 Minuten Nutzungsdauer. Für die API gibt es außerdem das Modell s2.1-pro-free, das unter bestimmten Einschränkungen für einen fairen Gebrauch vorgesehen ist. Allerdings gibt es keine Garantien bezüglich der Leistung oder der Datenverarbeitung.

Wie viel kostet Fish Audio?

Im aktuellen Jahresangebot kostet Plus 66 Dollar für das ganze Jahr, Pro 450 Dollar und Max 8988 Dollar; Enterprise ist auf Anfrage verfügbar.

Die Preise für Aktionen und Verlängerungen können sich ändern; es gelten die Angaben auf der Zahlungsseite.

Wie werden API-Gebühren berechnet?

S2.1 Pro, S2 Pro und S1 TTS kosten derzeit 15 US-Dollar pro 1 Million UTF-8-Bytes; die Transkription kostet 0,36 US-Dollar pro Audio-Stunde.

Für jede erfolgreiche Anfrage bei Voice Design werden 0,01 US-Dollar berechnet.

Wird Chinesisch unterstützt?

Es werden Chinesisch und mehr als 80 weitere Sprachen unterstützt, außerdem die Mischung verschiedener Sprachen. Bei der Berechnung für Chinesisch nach UTF-8-Bytes kann man nicht einfach die Schätzungen für englische Wörter anwenden.

Kann man seine eigene Stimme klonen?

Es können sofortige, verbesserte oder professionelle Klone verwendet werden, wobei eine ausdrückliche Genehmigung des Sprechers erforderlich ist. Zudem muss je nach Datenschutzanforderungen zwischen öffentlichen und privaten Stimmspeichern gewählt werden.

Ist Fish Audio open source?

Die Hosting-Plattform ist kein Open-Source-Produkt. Die Quellcode sowie die Modelle von Fish Speech sind öffentlich zugänglich, werden jedoch derzeit unter der Fish Audio Research License bereitgestellt. Für Forschungszwecke und nicht-kommerzielle Nutzung ist diese Lizenz gültig; für kommerzielle Zwecke ist eine zusätzliche schriftliche Genehmigung erforderlich.

©️ Urheberrechtshinweis: Sofern nicht anders angegeben, liegen die Urheberrechte an allen Artikeln auf dieser Website beiTeilen von AI-ToolsAlle Urheberrechte liegen bei uns. Ohne Genehmigung darf keine Person, kein Medienunternehmen, keine Website oder irgendeine Gruppe den Inhalt dieser Website kopieren, nachahmen oder auf andere Weise verbreiten. Ebenso ist es nicht gestattet, Spiegelseiten auf Servern zu erstellen, die nicht uns gehören. Andernfalls behalten wir uns das Recht vor, rechtliche Schritte gegen die Verantwortlichen einzuleiten.

Tools, die den Fish Audio ähneln