Resemble AI
Kostenloser Mehrwert
Komplette Liste an KI-Tools KI-Audio-Tools

Resemble AI

Audio-Plattform mit Funktionen zur Klonierung, Erstellung, Erkennung von Stimmen sowie Unternehmens-APIs

Tags:

Was ist Resemble AI?

Resemble AI ist eine Plattform, die sowohl die Erzeugung von Sprachinhalten durch KI als auch die Sicherheit bei der Erstellung von generativen Medien abdeckt. Zu den Funktionen für die Erstellung und Entwicklung gehören Text-zu-Sprache-Übersetzung, Stimmenklonierung, Gestaltung von Sprachinhalten, Sprache-zu-Sprache-Übersetzung, Transkription von Sprache, Verbesserung der Audioqualität sowie Echtzeit-Sprachagenten.

Zu den Sicherheitsfähigkeiten gehören die Erkennung von Deepfakes in Audio-, Bild- und Videodaten, die Interpretation der Erkennungsergebnisse, die Echtzeit-Analyse von Meetings, die Registrierung und Abgleich von Identitäten, C2PA-Unterschriften sowie unsichtbare Wasserzeichen.

Die Produktpositionierung hat sich von einem reinen Tool für künstliche Stimmen zu einer integrierten Plattform für „Erstellung, Überprüfung und Erkennung“ entwickelt. Content-Teams können die Markenstimme sowie Untertitel in mehreren Sprachen erstellen, Entwickler können über APIs auf Echtzeit-Stimmen zugreifen, und das Sicherheitsteam kann verdächtige Medieninhalte in den Überprüfungsprozess einbeziehen und die Ergebnisse der Prüfung speichern.

Ähnelt Ultra-Text-zu-Stimme

Resemble Ultra ist das Standard-Text-zu-Stimme-Modell der aktuellen Hosting-Plattformen für die Erstellung und Aktualisierung von Sprachinhalten. Es unterstützt die synchronisierte Erstellung sowie Ausgabe über HTTP- und WebSocket-Streams. Die API wählt automatisch das entsprechende Modell anhand des voice_uuid aus – Entwickler sollten Resemble Ultra nicht als gewöhnlichen Modellparameter manuell übergeben.

Die alten Versionen von Chatterbox, Chatterbox Turbo, Chatterbox Multilingual sowie frühere TTS-Versionen werden in den offiziellen Dokumentationen als eingestellt geführt. Für die weiterhin Nutzung der Stimmen der alten Modelle ist ein Upgrade auf Ultra erforderlich. Vor dem Umstieg sollte die Audioqualität, die Aussprache, die Verzögerung sowie die Kompatibilität mit den Projekten erneut überprüft werden.

Klangklonierung

Durch die Stimmenklonierung können aus klar aufgenommenen Audiodateien von etwa 10 Sekunden Länge wiederverwendbare Stimmen erstellt werden. Die API ermöglicht es, entweder das gesamte Audio auf einmal hochzuladen und damit das Training durchzuführen, oder die Aufnahmen in Teilbereichen hochzuladen und über Callbacks Benachrichtigungen über den Abschluss des Trainings zu erhalten.

Die Clone-API erfordert derzeit ein Business- oder höheres Paket.

Kurze Samples ermöglichen ein schnelles Erstellen von Stimmen, doch Umgebungsgeräusche, Musik, Reverb, Überschneidungen mehrerer Stimmen sowie übermäßige Kompression verringern die Ähnlichkeit. Jede echte Stimme erfordert die ausdrückliche Zustimmung des Besitzers, wobei Einsatzszenarien, Zeitrahmen, Teammitglieder, Löschung des Modells sowie der Umfang der abgeleiteten Inhalte festgelegt werden müssen.

Voice Design – Tondesign

Für das Voice-Design sind keine Aufnahmen von echten Menschen notwendig. Der Benutzer beschreibt mit Text Angaben zur Alter, zum Akzent, zum Tonfall, zum Stil sowie zur Verwendung des Stimmenprofils. Anschließend erstellt das System drei mögliche Stimmenvarianten. Nach dem Anhören kann die gewünschte Variante in einen voice_uuid umgewandelt werden, der für TTS verwendet werden kann.

Die Tongestaltung eignet sich für fiktive Charaktere, Prototypen sowie Projekte, bei denen keine echten Menschen aufgenommen werden können. Es kann jedoch nicht garantiert werden, dass die ausgewählte Stimme keinerlei Ähnlichkeit mit realen Personen aufweist. Bei Marken- und Spielprojekten sollten dennoch Ähnlichkeitsprüfungen durchgeführt werden, und die endgültigen Auswahlkriterien sowie die verwendeten Parameter sollten festgehalten werden.

Sprache-zu-Sprache – Sprachumwandlung

Die Sprach-zu-Sprach-Übertragung wandelt den Rhythmus, die Intonation und die Art der Darbietung der eingegebenen Aufnahme in die Zielstimme um – sie eignet sich für Echtzeit-Charaktere, Spiele, Voice-Over-Anpassungen sowie Sprachagenten. In diesem Dokument werden Core STS v2 und v1 aufgeführt; bei v2 wird die Tonhöhenverfolgung verbessert und eine Auflösung von 48 kHz unterstützt. Für das Training sind in der Regel mehr als 10 Minuten an Daten erforderlich.

STS bewahrt die Darbietung besser als reine Textgenerierung, löst aber nicht automatisch Probleme wie Eingabestörungen, Fehlversprechen und Urheberrechtsfragen. Sowohl der eingebende Sprecher als auch die Zielstimme benötigen eine Genehmigung; für Live-Szenarien sind zudem Funktionen zur Missbrauchserkennung und manuellen Unterbrechung erforderlich.

Synchronisierte, HTTP- und WebSocket-Stream-APIs

Die synchronisierte Schnittstelle liefert den gesamten Audiodatenblock auf einmal – geeignet für kurze Sätze und Offline-Aufgaben. Die HTTP-Stream-Schnittstelle erzeugt die WAV-Daten während des Sendens und enthält im Dateiheader Zeitstempel für Zeichen und Phoneme.

WebSocket erhält eine lange Verbindung und gibt kontinuierlich Audio-Framee mit geringerer Verzögerung zurück.

WebSocket ist derzeit für Business- und höhere Anwendungsgrade konzipiert und erlaubt standardmäßig 20 parallele Sessions pro Cluster sowie 20 parallele Verbindungen pro API-Key. Mit „Parallelität“ ist nicht die Anzahl der Anfragen pro Sekunde gemeint; Entwickler müssen weiterhin mit Kapazitätsfehlern, Wiederholungsversuchen, unterbrochenen Verbindungen sowie den audio_end-Endbenachrichtigungen umgehen.

Echtzeit-Sprachagent

Real-Time-Agenten können Stimmen von Resemble mit Anweisungen, Wissensdatenbanken, Tools, Webhooks und Telefonnummern kombinieren, um Kundenservice, Terminvereinbarungen, Verkäufe, NPCs in Spielen sowie interaktives Training zu ermöglichen. Das System unterstützt Agent-APIs, Aufrufe von Tools, Wissensdatenbanken sowie Telefonverbindungen.

Die Sprachnatürlichkeit eines Echtzeit-Agents kann die Zuverlässigkeit der Informationen nicht ersetzen. Bei Transaktionen im Zusammenhang mit Konten, Zahlungen, Gesundheitsfragen, rechtlichen Angelegenheiten oder der Überprüfung von Identitäten sollten die Befugnisse der Tools eingeschränkt werden, es sollte eine Verbindung zu einem menschlichen Ansprechpartner hergestellt werden, sensible Vorgänge bestätigt werden und nachvollziehbare Protokolle aufgezeichnet werden.

Audio-Editing, -aufwertung und -Transkription

Audio Edit ermöglicht die asynchrone Bearbeitung von Audiodateien, die mit eigenen, nicht marktüblichen Sounds erstellt wurden. Audio Enhancement dient dazu, Störgeräusche zu reduzieren und die Klarheit der Sprache zu verbessern. Speech to Text ermöglicht es, Transkriptionen zu erstellen und abzurufen. Diese Funktionen eignen sich zur Aufbereitung von Aufnahmen, zur Erstellung von Untertiteln sowie zur Überarbeitung von Teilbereichen der Audioaufnahmen.

Eine Verbesserung kann die Details des Klangtons verändern; bei der Transkription können zudem Personennamen, Zahlen und Fachbegriffe falsch interpretiert werden. Wichtige Aufzeichnungen sollten in ihrer ursprünglichen Form aufbewahrt und manuell überprüft werden – die Ergebnisse der Verarbeitung dürfen nicht als fehlerfreie Beweise angesehen werden.

Deepfake-Multimodale Erkennung

Resemble Detect ist für Audio-, Bild- und Videodaten konzipiert und analysiert Spuren wie TTS, Stimmenklonierung, Gesichtsersetzung sowie generative Bilder. Er kann vertrauenswürdige Ergebnisse sowie Erklärungen bei der Hochladen von Dateien, über APIs oder in Echtzeit-Prozessen liefern. Derzeit wird DETECT-3B Omni als Unternehmensdetektionsmodell für alle drei Medientypen eingesetzt.

Die Testergebnisse sind probabilistische Beurteilungen; Komprimierung, Bearbeitung, Neuaufnahme, neue Modelle sowie Gegenmaßnahmen können alle zu Fehlbeurteilungen führen. In Szenarien mit hohem Risiko sollte ein Benutzer nicht allein aufgrund einer einzigen Zahl automatisch abgelehnt werden. Stattdessen sollten Quelle, Authentifizierung, manuelle Überprüfung sowie Verfahren zur Einlegung von Rechtsmitteln berücksichtigt werden.

Resemble Intelligence und Meetings

Intelligence dient dazu, die Ergebnisse der Überwachung mit umfassenderen Analysen zu versehen. Meetings ermöglicht es, während der Konferenzen verdächtige Medieninhalte in Echtzeit zu überwachen. Team beinhaltet Funktionen zur Analyse von Konferenzen, während Business eine Integration des Kalenders auf Organisationsebene sowie Benachrichtigungen bezüglich der Sicherheit von Konferenzen bietet.

Die Überwachung von Konferenzen beinhaltet die Audio- und Videoaufnahmen sowie Metadaten der Teilnehmer. Die Organisation sollte im Voraus informieren, die Aufbewahrungsfristen begrenzen und die Regeln bezüglich der Aufzeichnungen, der Privatsphäre sowie der Überwachung der Mitarbeiter in dem jeweiligen Gebiet prüfen.

Identitätssuche

Die Identity-API ermöglicht es, die Identität von Personen oder Marken zu registrieren, Referenzmaterialien zu verknüpfen sowie zu überprüfen, ob hochgeladene Inhalte mit den registrierten Objekten übereinstimmen. Dadurch können Fälschungen sowie unbefugt genutzte Stimmen oder Markenmaterialien aufgedeckt werden. Sie kann als zusätzlicher Mechanismus für KYC-Verfahren, Inhaltssicherung und den Schutz der Rechte von Personen dienen.

Eine ähnliche Identität allein rechtfertigt keinen Betrug, und Fehlkorrespondenzen können auch echte Benutzer beeinträchtigen. Produktionsysteme benötigen Schwellenwertkalibrierung, zweistufige Authentifizierung und manuelle Überprüfung; die Identitätssuche darf nicht als einziger Schluss aus der Biometrie angesehen werden.

PerTH-Wasserzeichen und C2PA

Resemble Watermarker kann unsichtbare Marker für die Kodierung und Dekodierung von Medien hinzufügen, während das PerTH-Projekt sich auf audiobasierte neuronale Wasserzeichen konzentriert, mit dem Ziel, die Herkunft auch nach Kompression und gängigen Bearbeitungen noch erkennen zu können. Die Plattform unterstützt außerdem die Überprüfung von SynthID sowie das Signieren von C2PA-Einträgen.

Watermarks eignen sich dazu, die Herkunft des markierten Inhalts nachzuweisen, doch das Fehlen eines Watermarks bedeutet nicht unbedingt, dass die Datei echt ist – schließlich könnten Drittanbieter-Tools keine kompatiblen Marker eingefügt haben. Eine gute Praxis besteht darin, Watermarks, Inhaltszertifikate, Deepfake-Tests sowie Veröffentlichungsprotokolle miteinander zu kombinieren.

Flex-Gratis-Modell nach Verbrauch

Die Abonnementgebühr für Flex beträgt 0 US-Dollar – eine Kreditkarte ist nicht erforderlich. Enthalten sind ein Teamplatz, die Plattform sowie die API, Funktionen zur Erkennung von Audio-, Bild- und Videodaten, Erklärungen zu den Erkennungsergebnissen, die Registrierung von Benutzern, die Echtzeit-Überwachung von Meetings, eine Überprüfung mit SynthID sowie C2PA-Unterschriften. Die Nutzer können Credits aufladen und entsprechend der tatsächlichen Verarbeitungsmenge bezahlen. Es gibt keine Mindestverpflichtungen, und Flex Credits verfallen derzeit nicht.

0 Dollar bedeutet, dass es keine monatliche Abonnementgebühr gibt – das bedeutet jedoch nicht, dass alle Verarbeitungsvorgänge kostenlos sind. Die Erstellung von Sprachinhalten, die Durchführung von Analysen, die Suche nach Identitäten sowie das Hinzufügen von Wasserzeichen verursachen Kosten, die vom verfügbaren Guthaben abgezogen werden. Vor dem Kauf sollten Sie in der Konsole die Kosten für solche Verarbeitungsvorgänge überprüfen, die nicht auf der offiziellen Seite aufgeführt sind.

Preis- und Versionsvergleich

Paket oder VersionPreise, Limits und Kernvorteile
Team-PreisTeam kostet 350 US-Dollar pro Monat; bei Jahresbezahlung sind es im Durchschnitt 280 US-Dollar pro Monat, insgesamt also 3360 US-Dollar im Jahr. Dadurch werden im Vergleich zur Monatsbezahlung 840 US-Dollar eingespart. Es umfasst 5 Benutzerplätze, alle Flex-Funktionen, niedrigere Preise für geringeren Verbrauch bestimmter Dienste, Meeting-Intelligence, sowie die Möglichkeit zum Hochladen großer Dateien und in großen Mengen. Team eignet sich für mittlere Teams, die die Überwachungsfunktionen in der Produktion einsetzen möchten – es beinhaltet jedoch keine SSO-Funktionen, keinen Kalender für Meetings auf Organisationsebene sowie keine Unternehmens-SLA-Vorgaben. Der Rabatt bei der Jahresbezahlung setzt eine einmalige jährliche Verpflichtung voraus.
Business-PreiseBusiness kostet 1000 US-Dollar pro Monat; bei jährlicher Zahlung sind es im Durchschnitt 800 US-Dollar pro Monat, was insgesamt 9600 US-Dollar im Jahr entspricht. Dadurch werden im Vergleich zur monatlichen Zahlung 2400 US-Dollar eingespart. Es umfasst 20 Plätze, eine an die Anforderungen anpassbare Konfiguration, Integration in das Unternehmenskalender-System, Benachrichtigungen bezüglich der Sicherheit von Meetings sowie SSO. Business ist außerdem der aktuelle Zugangsniveau für die Voice-Cloning-API und WebSocket-basierte Sprachübertragung. Falls die monatlichen Ausgaben über 1000 US-Dollar liegen oder eine höhere Konkurrenzfähigkeit sowie eine lokale Installation erforderlich sind, wird empfohlen, sich an den Verkauf zu wenden, um einen Unternehmenspreis zu erfragen.
Prüfung und sichere Handhabung – PreiseBei Flex beträgt die Gebühr für die Erkennung von Audio- und Bildinhalten 0,035 US-Dollar pro Sekunde, für die Videoerkennung 0,07 US-Dollar pro Sekunde und für Intelligence-Funktionen 0,025 US-Dollar pro Sekunde. In den Tarifen Team und Business beträgt die Gebühr für die Erkennung von Audio- und Bildinhalten ebenfalls 0,015 US-Dollar pro Sekunde, für Videos 0,03 US-Dollar pro Sekunde und für Intelligence-Funktionen ebenfalls 0,015 US-Dollar pro Sekunde. Die Suche nach Identitäten kostet 0,0005 US-Dollar pro Aufruf, die Kodierung mit Watermarker kostet 0,0005 US-Dollar pro Vorgang, während die Dekodierung 0,0002 US-Dollar pro Vorgang kostet. Für diese drei Dienstleistungen gelten in Flex, Team und Business dieselben Preise. Die Angabe der Preise pro Sekunde stammt aus der offiziellen Preisliste; die tatsächlichen Abrechnungseinheiten sowie die Umrechnung in Bezug auf die Dateien richten sich nach den Angaben in der Konsole.
Wie sieht der Preis für die Verwaltung von Sprachgenerierung aus?Die derzeitige Preisseite zeigt hauptsächlich Lösungen zur Sicherheit von generativer Medien sowie die Verarbeitungsgebühren. In derselben Tabelle werden die jeweiligen Preise für Resemble Ultra TTS, Cloning, STS und Agent nicht angegeben. Daher sollte der Katalog nicht weiterhin die pro Sekunde anfallenden Kosten aus alten Blogs oder früheren Paketen verwenden. Nutzer, die Sprachgenerierung benötigen, sollten sich bei Flex registrieren, um die aktuellen Preise zu sehen – oder einen Verkäufer beauftragen, einen Kostenvoranschlag je nach Sprache, Dauer, Konkurrenz und Implementierungsart erstellen zu lassen. Bei der Budgetplanung sollten Generierung, Stream-Hosting, Cloning, Agent-Dienste sowie Sicherheitsprüfungen getrennt betrachtet werden.

Team-Preis

Team: 350 US-Dollar pro Monat; bei jährlicher Zahlung sind es im Durchschnitt 280 US-Dollar pro Monat, insgesamt also 3360 US-Dollar im Jahr. Das spart im Vergleich zur monatlichen Zahlung insgesamt 840 US-Dollar.

Es umfasst 5 Plätze, alle Flex-Funktionen, niedrigere Preise für bestimmte Dienste bei geringerem Verbrauch, Meeting-Intelligenz sowie die Möglichkeit zum Hochladen großer Dateien und in Batches.

Team eignet sich für mittelgroße Teams, die Tests in die Produktion einbringen möchten, beinhaltet jedoch keine SSO, einen Kalender für Teammeetings auf Organisationsebene sowie keine Unternehmens-SLA. Der Jahresrabatt setzt eine einmalige jährliche Verpflichtung voraus.

Business-Preise

Business: 1000 US-Dollar pro Monat; bei jährlicher Zahlung sind es im Durchschnitt 800 US-Dollar pro Monat, insgesamt also 9600 US-Dollar im Jahr. Das spart im Vergleich zur monatlichen Zahlung insgesamt 2400 US-Dollar.

Es umfasst 20 Plätze, eine an die Einsatzbedingungen anpassbare Konfiguration, Integration mit dem Kalender auf Organisationsebene, Benachrichtigungen zur Sitzungssicherheit sowie SSO.

Business ist außerdem der aktuelle Zugangsniveau für Voice-Cloning-APIs sowie WebSocket-basierte Sprachströme. Wenn die monatlichen Ausgaben 1000 US-Dollar überschreiten, eine höhere Konkurrenzfähigkeit erforderlich ist oder eine lokale Installation gewünscht wird, empfiehlt man, sich an den Verkauf zu wenden, um einen Unternehmenspreis zu erfragen.

Enterprise-Unternehmenslösung

Kundenspezifische Angebote von Enterprise – es können Kapazitätsrabatte, Unternehmens-SLAs, Anpassung des Modelltrainings, lokale Implementierung, exklusiver Support, SOC 2-Dokumente sowie individuelle Zugangsrechte bereitgestellt werden. Für hohe Konkurrenzlasten, Datentrennung sowie Umgebungen im Private Cloud- oder Air-Gap-Modus ist in der Regel ein Unternehmensvertrag erforderlich.

Eine lokale Implementierung ist nicht automatisch im öffentlichen Abonnement enthalten; bei der Anschaffung müssen Modell, Erkennungsmodi, Hardware, Aktualisierungsfrequenz, Aufbewahrung von Protokollen, Support-Reaktionszeiten sowie Lizenzumfang schriftlich bestätigt werden.

Prüfung und sichere Handhabung – Preise

Bei Flex beträgt die Kosten für die Erkennung von Audio- und Bildinhalten 0,035 US-Dollar pro Sekunde, für die Videoerkennung 0,07 US-Dollar pro Sekunde und für Intelligence 0,025 US-Dollar pro Sekunde. Bei Team und Business beträgt die Kosten für die Erkennung von Audio- und Bildinhalten 0,015 US-Dollar pro Sekunde, für Videoinhalte 0,03 US-Dollar pro Sekunde und für Intelligence ebenfalls 0,015 US-Dollar pro Sekunde.

Die Suche nach der Identität kostet 0,0005 US-Dollar pro Aufruf, die Watermarker-Kodierung kostet ebenfalls 0,0005 US-Dollar pro Aufruf, während die Dekodierung 0,0002 US-Dollar pro Aufruf kostet. Für Flex-, Team- und Business-Tarife gelten für diese drei Dienstleistungen derzeit gleiche Preise. Die Anzeige von Bildern in „Pro Sekunde“ ist die Art und Weise, wie die offiziellen Preise dargestellt werden; die tatsächlichen Abrechnungseinheiten sowie die Umrechnung in Dateien richten sich nach den Angaben in der Konsole.

Wie sieht der Preis für die Verwaltung von Sprachgenerierung aus?

Die derzeitige Preisseite zeigt hauptsächlich Lösungen zur Sicherheit von generativer Medien sowie die Verarbeitungsgebühren. Die Einzelpreise für die Nutzung von Resemble Ultra TTS, Cloning, STS und Agent werden in derselben Tabelle nicht aufgeführt. Daher sollte der Preisverzeichnis nicht weiterhin nach den pro Sekunde anfallenden Preisen der alten Blogs oder historischen Pakete gestaltet werden.

Benutzer, die Sprachgenerierung benötigen, sollten sich bei Flex registrieren, um die Echtzeit-Preise einzusehen, oder den Vertrieb um ein Angebot nach Sprache, Dauer, Konkurrenz und Implementierungsart bitten. Bei der Budgetplanung sollten Generierung, Streaming-Hosts, Cloning, Agententelefone und Sicherheitsprüfungen getrennt berücksichtigt werden.

Chatterbox-Open-Source-Modell

Resemble AI hat die Chatterbox-Stimmmodell-Reihe auf GitHub veröffentlicht. Der aktuelle Repository enthält Chatterbox Turbo mit 350 M Parametern, ausgelegt für Englisch mit niedriger Latenz und für Performanz-Zwecke.

Nano mit 110 M Parametern, das auf CPU und eingeschränkten Geräten laufen kann; sowie Multilingual V3 mit 500 M Parametern, das 23 Sprachen einschließlich Chinesisch unterstützt, sowie verschiedene einzelne Sprachanpassungspakete.

Der Chatterbox-Code und die Modelle werden unter der MIT-Lizenz bereitgestellt. Sie können für persönliche, Forschungs- und Geschäftsprojekte verwendet werden, sowie in proprietären Produkten selbst gehostet werden – wobei die Lizenzhinweise beibehalten und geltende Gesetze sowie Zustimmungserfordernisse eingehalten werden müssen. Die Hosting-Plattform Resemble Ultra und der open source-basierte Chatterbox sind zwei getrennte Produktlinien. In den offiziellen Dokumenten wird die alte Version von Chatterbox ausdrücklich als eingestellt angegeben.

PerTH und das Open-Source-Projekt Resemble Enhance

GitHub stellt außerdem das unter der MIT-Lizenz verfügbare Audio-Watermarking-Tool PerTH sowie Resemble Enhance zur Geräuschreduzierung und -verbesserung bereit. Entwickler können die Watermark-Extraktion und Audioverarbeitung lokal testen, doch dies bedeutet nicht, dass Detect, Identity, Meetings sowie die gesamte Hostplattform offen quellcodebasiert sind.

Offene Quellbeispiele sowie einige alte SDKs werden möglicherweise nicht mehr gewartet; beispielsweise ist das offizielle Go SDK als veraltet markiert. Neue Projekte sollten sich an den aktuellen API-Dokumentationen sowie den Seiten zu den Client Libraries orientieren und vor einem Upgrade die Version festlegen sowie Rückgriffstests durchführen.

Anleitung zur Verwendung von Resemble AI

Eine grundlegende Aufgabe erledigen

  1. Registrieren Sie sich bei Resemble AI und erstellen Sie einen API-Schlüssel, der ausschließlich für die Testumgebung verwendet wird;
  2. Wählen Sie das Modell entsprechend der Eingabetypen, des Kontexts, der Qualität, der Geschwindigkeit und des Preises aus;
  3. Rufen Sie zunächst Resemble Ultra Text-zu-Stimme auf, um die minimale Anfrage abzuschließen und die zurückgegebene Struktur zu überprüfen;
  4. Testen Sie anschließend die Flussausgabe, Parameter und Abweichungsreaktionen mit einer Stimmen-Kloning-Testmethode;
  5. Protokollieren Sie Tokens, Anrufanzahl, Verzögerung, Fehlerrate und Kosten pro Aufruf;
  6. Tragen Sie den Schlüssel in den Server-basierten Schlüsselmanager ein, bevor Sie die eigentliche Anwendung anschließen;

Erstellung wiederverwendbarer professioneller Workflows

  1. Für die Entwicklungs-, Test- und Produktionsumgebungen werden unterschiedliche Schlüssel und Limits verwendet;
  2. Erstellen Sie ein repräsentatives Bewertungsset mit Resemble Ultra für Text-zu-Stimme, Stimmenklonierung und Voice Design für Stimmenentwicklung;
  3. Einstellen von Timeout, Konkurrenz, Wiederholungsversuchen, Limitierung sowie Budgetobergrenzen;
  4. Durchführung von Überprüfungen hinsichtlich Fakten, Sicherheit, Formatierung und sensibler Informationen am Ausgangsinhalt;
  5. Überwachung von Änderungen bei Modellversionen, Preisen, Verzögerungen und Ausfallraten;
  6. Vorbereitung von Plänen für die Herabstufung des Modells, Schutzmaßnahmen sowie manuelle Übernahme.

Für welche Nutzer geeignet?

  • Ein Content-Team, das eine Markenstimme, Spielcharaktere sowie mehrsprachige Kommentare benötigt;
  • Entwickler, die sprachbasierte Agenten mit niedriger Latenz, Kundenservice-Systeme und interaktive Anwendungen erstellen;
  • Das Sicherheits- und Risikomanagement-Team zur Überprüfung der Echtheit von Audiodateien, Bildern und Videos;
  • Organisationen, die das Anonymitätsniveau von Schauspielern, Marken und Führungskräften schützen, damit sie nicht gefälscht werden können;
  • Forschungs- und Entwicklerteam für selbstbetriebene MIT-Stimmmodell-Systeme.

Vorteile des Produkts

  • Sprachgenerierung, Identitätsprüfung, Wasserzeichen und Deepfake-Erkennung in einer einzigen Plattform integrieren;
  • Resemble Ultra umfasst Synchronisation sowie zwei Arten von Streaming-TTS;
  • Unterstützung für schnelles Sound-Klonen, Voice Design und Sprache-zu-Sprache-Übersetzung;
  • Die Überprüfung umfasst Audio, Bilder und Videos und liefert Erklärungsinformationen;
  • Flex hat keine monatliche Abonnementgebühr, und die Credits verfallen derzeit nicht.
  • Chatterbox, PerTH und Enhance bieten selbsthostbare Open-Source-Optionen.

Einschränkungen und Hinweise

  • Der Schwerpunkt der aktuellen offiziellen Preise liegt nun auf Sicherheitsprodukten; der genaue Preis für die Hosted-Voice-Generierung muss in der Konsole überprüft werden.
  • VoiceCloningAPI, WebSocket sowie bestimmte Leistungsanforderungen erfordern ein Business-Konto oder höheres; Anfänger können nicht davon ausgehen, dass alle Sprachanschlüsse kostenlos über Flex zur Verfügung stehen.
  • Die Deepfake-Erkennung führt zu Fehlalarmen und Übersehungen, und das Fehlen eines Wasserzeichens beweist nicht, dass der Inhalt echt ist.
  • Für Cloning und STS muss eine Lizenzerlaubnis eingeholt werden;
  • Die MIT-Lizenz für das Open-Source-Programm Chatterbox befreit nicht von den Pflichten bezüglich der Privatsphäre, des Persönlichkeitsrechts im Zusammenhang mit Bildern und Stimmen sowie von den Vorgaben zur Verhinderung von Täuschungen.

Häufige Fragen

Ist Resemble AI kostenlos?

Es gibt ein Flex-Paket für 0 US-Dollar pro Monat – es fallen keine Abonnementsgebühren an, und die Zahlung erfolgt nach Verbrauch durch vorab aufgeladene Credits. Die Credits verfallen derzeit nicht, doch die tatsächliche Erstellung, Überprüfung sowie Nutzung von Wasserzeichen sind weiterhin kostenpflichtig.

Wie viel kostet Resemble AI?

Team: 350 US-Dollar pro Monat, was im Monatsdurchschnitt 280 US-Dollar entspricht; Business: 1000 US-Dollar pro Monat, was im Monatsdurchschnitt 800 US-Dollar entspricht.

Enterprise-Anpassung. Flex hat keine Monatsgebühr.

Kann man seine eigene Stimme klonen?

Ja, eine klare Aufnahme von etwa 10 Sekunden reicht aus, um eine schnelle Klonierung zu erstellen. Allerdings erfordert die API derzeit ein Business- oder höheres Abo und die Zustimmung des Sprechers.

Kann man Deepfakes in Videos und Bildern erkennen?

Ja. Detect umfasst derzeit Audio, Bilder und Videos und kann mit Intelligence, Identity, Konferenzüberwachung sowie Wasserzeichen kombiniert werden;

Das Ergebnis muss dennoch manuell unter Berücksichtigung des Risikos überprüft werden.

Ähnelt Resemble AI Open Source?

Die Hosting-Plattform sowie das Ultra-Modell sind nicht vollständig open source. Das offizielle Chatterbox-Stimmmodell, das PerTH-Watermarking-Tool sowie Resemble Enhance werden als Open-Source-Projekte bereitgestellt, wobei Chatterbox und PerTH unter der MIT-Lizenz liegen.

©️ Urheberrechtshinweis: Sofern nicht anders angegeben, liegen die Urheberrechte an allen Artikeln auf dieser Website beiTeilen von AI-ToolsAlle Urheberrechte liegen bei uns. Ohne Genehmigung darf keine Person, kein Medienunternehmen, keine Website oder irgendeine Gruppe den Inhalt dieser Website kopieren, nachahmen oder auf andere Weise verbreiten. Ebenso ist es nicht gestattet, Spiegelseiten auf Servern zu erstellen, die nicht uns gehören. Andernfalls behalten wir uns das Recht vor, rechtliche Schritte gegen die Verantwortlichen einzuleiten.

Werkzeuge, die dem Resemble AI ähneln