Cartesia
Kostenloser Mehrwert
Komplette Liste an KI-Tools KI-Audio-Tools

Cartesia

Eine Plattform für die Erzeugung von Audioinhalten mit geringer Verzögerung – geeignet für Echtzeit-Sprachagenten

Tags:

Was ist Cartesia?

Cartesia ist eine Echtzeit- Sprach-KI-Plattform für Entwickler und Unternehmen. Zu den Hauptprodukten gehören Sonic für Text-zu-Sprache-Umwandlung, Ink für Spracherkennung sowie Line für sprachbasierte KI-Agenten. Die Plattform zeichnet sich durch einen geringen Latenzwert bei der Verarbeitung aus und eignet sich daher für Anwendungen, die natürliche Dialoge sowie schnelle Reaktionen erfordern.

Entwickler können die Sprachfunktionen über Playground, API, Python- oder JavaScript-SDKs sowie MCP nutzen. Neben Sprachsynthese und -Transkription bietet Cartesia auch Dienste für Stimmenklonierung, Stimmenumwandlung, Lokalisierung, Aussprachelexika sowie Unternehmensimplementierungen an.

Hauptfunktionen von Cartesia

  • Sonic TTS:Übersetzen Sie den Text in Echtzeit in natürliche Sprachausgabe und geben Sie das Audio als Stream zurück.
  • Ink STT:Für die Transkription von Sprache in Echtzeit-Dialogen – Bearbeitung von Störgeräuschen, Akzenten, Telefonqualität und strukturierten Daten.
  • Semantische Endpunkterkennung:Bestimmen Sie anhand der Bedeutung der gesprochenen Worte, wann eine Runde endet, um Fehldeutungen durch das Einhalten des Stummschalters zu verringern.
  • Echtzeit-Klonierung von Stimmen:Klare Samples für die schnelle Erstellung von Sound in etwa 10 Sekunden – ab dem Pro-Paket verfügbar.
  • Professionelle Stimmenklonierung:Anpassung des Modells durch Einzelpersonen-Recording in über 30 Minuten, ab dem Startup-Paket verfügbar.
  • Voice Changer:Beibehaltung des ursprünglichen Tonfalls und Rhythmus der Audioaufnahme, Ersetzung der Sprechstimme durch eine andere Klangfarbe.
  • Stimmenlokalisierung:Die vorhandenen Stimmen an andere Sprachen oder Dialekte anpassen.
  • Wortschatz mit Aussprache:Markennamen, Personennamen, Arzneimittelnamen und Fachbegriffe durch angepasste Aussprache und Phonemverarbeitung.
  • Emotionen und Kontrolle:Anpassen Sie Geschwindigkeit, Lautstärke, Stimmung, Pausen und Ausdruck an die Fähigkeiten des Modells.
  • Line Agents:Kombination von Spracheingabe, Sprachausgabe, Modellen und Telefonfunktionen zur Erstellung eines Echtzeit-Intelligenz-Agenten.
  • API und SDK:Es werden Schnittstellen für Python, JavaScript sowie andere HTTP/WebSocket-Anwendungen bereitgestellt.
  • MCP:Erlauben Sie es den kompatiblen AI-Clienten, direkt TTS, STT, Sprachverwaltung sowie Abfragen zur Nutzung zu nutzen.

Vergleich von Sonic, Ink und Line

ProdukteHaupteingabeHauptausgabePassende Szenarien
SonicTexte, Stimmen und AusdrucksparameterEchtzeit- oder DateivoiceErzähler, Kundenservice, Spielcharaktere und Sprachinterface
InkEchtzeit- oder aufgezeichnetes AudioSchrittweise zur endgültigen Transkription, Ereignisse pro RundeSprachagent, Telefon, Konferenzen und Transkription
LineKundengespräch und Agent-WorkflowVollständige Sprachgespräche und TelefoninteraktionenKundenservice, Terminvereinbarung, Filterung und automatische Anrufe

Vergleich der Preise für das Cartesia-Paket

Im Folgenden sind die monatlichen Preise in US-Dollar angegeben, die bei der Überprüfung auf der offiziellen Preisseite erscheinen. Alle Pakete bieten unbegrenzte Anzahl an Arbeitsplätzen. Credits sowie Agentenminuten werden separat abgerechnet. Steuern, vorab zu zahlende Beträge sowie Unternehmensrabatte richten sich nach den Angaben auf der Abrechnungsseite in der Konsole.

PaketPreisMonatliche CreditsVorauszahlungslimit für AgentenKernrechte
Free0 Dollar/Monat20,0001 Dollar pro MonatTTS, STT und grundlegende Testversionen
Pro5 Dollar/Monat100,0005 Dollar/MonatLizenz für kommerzielle Nutzung und sofortige Klonierung von Stimmen
Startup49 Dollar pro Monat1,250,00049 Dollar pro MonatProfessionelle Stimmenklonierung und -organisation
Scale299 US-Dollar/Monat8,000,000299 US-Dollar/MonatPrioritäre Unterstützung für höhere Konkurrenzfähigkeit
EnterpriseMaßanfertigungMaßanfertigungMaßanfertigungSkalierungsrabatte, SSO, DPA, BAA und exklusiver Support

Vergleich von Paketkapazität und Konkurrenzzeit

PaketUngefähr TTS-MinutenUngefähre STT-DauerTTS-KonkurrenzSTT/Agent-Konkurrenz
FreeEtwa 27 MinutenEtwa 1 Stunde 51 Minuten28
ProEtwa 133 MinutenEtwa 9 Stunden und 16 Minuten312
StartupEtwa 1667 MinutenEtwa 115 Stunden und 44 Minuten520
ScaleEtwa 10.667 MinutenEtwa 740 Stunden und 44 Minuten1560
EnterpriseMaßanfertigungMaßanfertigungMaßanfertigungMaßanfertigung

Die oben angegebenen Minutenzahlen sind Schätzwerte, die von den Behörden anhand des aktuellen Standardmodells berechnet werden; es handelt sich dabei nicht um feste Zusagen. Textvorverarbeitung, das Modell, der Ton, die Stille, die Endpunkte, professionelle Klonierung sowie verschiedene Audioaufgaben können den tatsächlichen Verbrauch beeinflussen.

Kredite und zusätzliche Abrechnungsregeln

  • Standard-TTS:In der Regel kostet jedes Zeichen etwa 1 Credit; die Vorbereitungsarbeiten können zu geringfügigen Abweichungen führen.
  • Professionelle TTS-Klonierung:Etwa 1,5 Credits pro Zeichen, was 50 % mehr ist als bei der Standardstimme.
  • Echtzeit-Klonen von TTS:Berechnet nach den Standard-TTS-Preisen, ohne professionellen Klonierungs-Faktor.
  • Professionelles Klonen-Training:Ein erfolgreicher Trainingsversuch kostet 1.000.000 Credits.
  • Umwertung des Trainings:Um das Basismodell oder die Trainingsdaten zu ändern, sind erneut Trainingscredits zu bezahlen.
  • Voice Changer:Es wird 15 Credits pro Sekunde für eingegebenes Audio berechnet.
  • Stimmenlokalisierung:Es werden 225 Credits auf einmal verbraucht.
  • Line Agent:Das Telefonat kostet 0,06 US-Dollar pro Minute; bei Verwendung der Plattform-Nummer kommt zusätzlich 0,014 US-Dollar pro Minute hinzu.
  • STT:Abgerechnet wird nach Modell, Batch-Verarbeitung oder Echtzeit-Endpunkt sowie Länge des Audios – auch die Stille wird berücksichtigt.

Anleitung zur Text-zu-Stimme-Übertragung

  1. Schlüssel erstellen:Erstellen Sie eine API-Key im Playground und teilen Sie die Entwicklung, Tests und Produktion nach Umgebungen auf.
  2. Modell auswählen:Verwenden Sie vorrangig die aktuelle, stabile Sonic-Version und speichern Sie keine alten Modell-IDs dauerhaft.
  3. Ton auswählen:Hören Sie sich die Kandidaten der Sprachbibliothek nach Sprache, Rolle, Szene und Sprechgeschwindigkeit an.
  4. Formatieren von Text:Ergänzung von Satzzeichen, Datumsangaben, Zeiten, Pausen und benutzerdefinierten Aussprachen.
  5. Verwendung des Flussverfahrens:Für Echtzeit-Dialoge werden WebSocket oder Stream-Ausgabe verwendet, um den ersten Audioabschnitt so früh wie möglich abzuspielen.
  6. Umgang mit Kontinuität:Bei der Aufteilung langer Inhalte wird die kontinuierliche Erstellung genutzt, um Sprünge in Tonfall und Rhythmus der Absätze zu verringern.
  7. Überwachungsqualität:Protokollieren Sie Verzögerungen, Fehlerraten, Credits und Benutzerunterbrechungen, um die Parameter schrittweise zu optimieren.

Anleitung zur Integration von Ink-Realzeit-Transkription

  1. Stellen Sie sicher, dass die Audio-Kodierung, die Abtastrate, die Kanäle sowie das Übertragungsprotokoll den Anforderungen einer Echtzeit-Schnittstelle entsprechen.
  2. Verbinden Sie vor dem Senden des Audios einen WebSocket und entwerfen Sie einen Zustandsautomaten für Trennungen, Neuanbindungen und Zeitüberschreitungen.
  3. Unterscheiden Sie zwischen Zwischenschrift und Endschrift – schreiben Sie unverifizierte Texte nicht direkt in die Geschäftsunterlagen.
  4. Die Ereignisse turn.start, turn.end und eager_end werden überwacht, um die Koordination zwischen dem großen Modell und den TTS-Antworten zu gewährleisten.
  5. Erstellen Sie Testdatensätze für Telefonnummern, Daten, E-Mail-Adressen, Währungen, Produktnamen und Branchenbegriffe.
  6. Echte Bewertungen unter Bedingungen von Telefonrauschen, Hintergrundgeräuschen, verschiedenen Akzenten und Stille.
  7. Erhalten Sie Aufzeichnungen zur Länge des Audios, Verzögerung, Fehlerrate und Kosten pro Anfrage sowie stellen Sie Nutzungsalarme ein.

Anleitung zur Klonierung von Stimmen

  1. Zustimmung bestätigen:Entweder wird nur die eigene Stimme geklont, oder es wird eine ausdrückliche schriftliche Genehmigung des Rechteinhabers der Stimme eingeholt.
  2. Wählen Sie den Typ aus:Testen Sie zunächst die sofortige Klonierung mit einem etwa 10 Sekunden langen Sample; falls das nicht ausreicht, betrachten Sie anschließend eine professionelle Klonierung.
  3. Vorbereitung der Materialien:Professionelles Cloning erfordert mindestens 30 Minuten für eine hochwertige Einzelaufnahme; länger als 2 Stunden ist in der Regel besser.
  4. Einheitlicher Stil:Die Trainingsaufnahmen sollten die gewünschte Sprechgeschwindigkeit, Lautstärke, den Kontext sowie die Art der Ausdrucksweise beibehalten.
  5. Training einreichen:Erstellen Sie professionelle Sounds über das Dashboard oder Datensätze sowie die Fine-Tuning-API.
  6. Akustische Überprüfung:Testen von Namen, Zahlen, Emotionen, langen Sätzen, selten verwendeten Wörtern und der Zielsprache.
  7. Veröffentlichungssteuerung:Einschränkung des Zugriffs, Dokumentation der Verwendung sowie Angabe von künstlich erzeugtem Inhalt gemäß den Vorgaben in öffentlichen Inhalten.

Kostenkontrolle für Line-Voice-Intelligenzagenten

  • Legen Sie für jeden Anruf eine maximale Dauer, eine Zeitüberschreitung ohne Ton sowie die maximale Anzahl an Wiederholungsversuchen fest;
  • Zuerst testen Sie es auf einer Webseite oder in einem Sandbox-Umfeld, bevor Sie gebührenpflichtige Telefonnummern und Ausrufe aktivieren.
  • Durch kurze Systemhinweise und Tools zur Rückkehr werden die zusätzlichen Kosten für große Modelle reduziert;
  • Erhalten Sie getrennte Aufzeichnungen für STT, LLM, TTS und Telefonkosten – schauen Sie nicht nur auf die Gesamtrechnung;
  • Für wiederholte Fragen und Antworten werden Cache oder vorab generierte Sprachaufnahmen verwendet, wobei veraltete Informationen vermieden werden.
  • Erkennen von Robotern, Sprachboxen und ungültigen Nummern, um sinnlose Anrufe so früh wie möglich zu beenden;
  • Für hochriskante Transaktionen wird eine manuelle Bestätigung hinzugefügt, damit Sprachagenten keine irreversiblen Transaktionen direkt durchführen können.

Für welche Nutzer eignet sich Cartesia?

  • Entwickler von Sprachagenten:Erstellung eines Kundenservice-, Terminbuchungs-, Verkaufssortierungs- und Interaktionsassistenten.
  • Callcenter:Verarbeiten Sie große Mengen an Gesprächen mithilfe von Echtzeit-Transkription, Synthese und Telefonfunktionen.
  • Spiele und Charakter-Apps:Erstellung von Charakterstimmen mit niedriger Verzögerung, unter Kontrolle und ausdrucksstark.
  • Bildung und barrierefreie Produkte:Es werden Vorlesen, Hörschreiben, Sprachnavigation und eine mehrsprachige Erfahrung angeboten.
  • Medien und Kreative:Erstellung von Kommentaren, lokalisierten Synchronisationen und lizenzierten Markenstimmen.
  • Unternehmensentwicklungsteam:Zugang zur Sprachinfrastruktur über API, SDK, MCP und Unternehmensbereitstellung.

Vorteile des Produkts

  • Sonic, Ink und Line umfassen die Spracheingabe, -ausgabe sowie vollständige Agenten;
  • Optimierung der Verzögerung des ersten Pakets, des strömenden Verarbeitungsansatzes sowie der Erkennung von Turnuswechseln für Echtzeit-Dialoge;
  • Unterstützung für Sprachklonierung, -umwandlung, -lokalisierung und professionelle Aussprachekontrolle;
  • Alle Pakete beinhalten unbegrenzte Arbeitsplätze für die Entwicklung sowie die Zusammenarbeit im Geschäftsbereich;
  • Es werden Python, JavaScript, MCP sowie HTTP/WebSocket-Schnittstellen bereitgestellt;
  • Die Unternehmensversion bietet SSO, Konformitätsvereinbarungen, exklusiven Support sowie anpassbare Konkurrenzfähigkeit.

Einsatzbeschränkungen und Hinweise

  • Paket-Credits können nicht einfach mit festen Minuten gleichgesetzt werden, der tatsächliche Verbrauch hängt von Inhalt und Aufgabe ab;
  • Die Qualität der Sprachübertragung in Echtzeit hängt von dem Netzwerk, den Audiogeräten, der Kodierung sowie den Parametern der Endgeräte ab.
  • STT kann weiterhin Eigennamen, Zahlen, Akzente und Hintergrundgeräusche falsch erkennen;
  • Das Grundmodell wird bei der professionellen Klonierung zur Anpassung trainiert; ein Upgrade des Modells erfordert in der Regel ein erneutes Training.
  • Alte Modelle haben eine Ablaufzeit, und das Produktionsystem muss das offizielle Änderungslog verfolgen;
  • Sprachintelligenz-Agenten beinhalten zusätzliche Kosten für Telefonie und große Modelle, weshalb Budgets und Limits festgelegt werden müssen;
  • Die Klonierung von Stimmen darf nicht zur Täuschung, zum Betrug, zu falschen Werbemaßnahmen oder zur unbefugten Nachahmung von Identitäten verwendet werden.

Sicherheit, Privatsphäre und Einhaltung von Lärmvorschriften

Unternehmensprojekte müssen den Ort der Datenverarbeitung, die Aufbewahrungsfrist, Protokolle, Unterauftragnehmer sowie Mechanismen zur Zustimmung zur Aufzeichnung festlegen. In medizinischen, finanziellen und anderen regulierten Bereichen sollten DPA-, BAA-Verträge sowie die entsprechenden Unternehmensfähigkeiten konsultiert werden; die Anwendbarkeit muss jedoch durch Vertragsvereinbarungen bestätigt werden.

  • Stimmmuster, Transkripte und Identitätsinformationen sollten mit minimalem Datenerhebungsumfang und getrennten Berechtigungen verarbeitet werden.
  • Für die Klonierung von Stimmen werden Rechteinhaber, Verwendungszweck, Region, Gültigkeitsdauer sowie Löschprotokolle gespeichert;
  • Die API-Schlüssel dürfen weder im Browser, in mobilen Paketen noch in öffentlichen Repositorien gespeichert werden.
  • Fügen Sie einer Ausgabe eine synthetische Kennung hinzu und stellen Sie Kanäle für die Verbindung mit einem Menschen sowie für Beschwerden bereit;
  • Empfindliche Gespräche sollten ohne Zustimmung weder aufgezeichnet, kopiert noch langfristig gespeichert werden.

Erklärungen zu Open Source, SDK und MCP

Die Cartesia-Hosting-Plattform sowie die Kernmodelle Sonic, Ink und Line sind keine Open-Source-Produkte. Dennoch hat der Hersteller das Python SDK, das JavaScript SDK, den MCP Server sowie einige Agent-Tools auf GitHub veröffentlicht. Das JavaScript SDK ist unter der Apache 2.0-Lizenz lizenziert; für die anderen Repositorien gilt jeweils ihre eigene Lizenz.

Das Open-Source-SDK ist lediglich ein Client zur Aufrufung der Cartesia-API und enthält keine vollständigen Modelle sowie keine Infrastruktur für die Auswertung von Daten. MCP kann über offiziell gehostete OAuth-Verbindungen genutzt werden, aber auch lokal mit dem Quellcode ausgeführt werden. Dennoch sind für die tatsächliche Erstellung und Verarbeitung von Inhalten weiterhin ein Konto sowie Credits erforderlich.

Häufige Fragen

Kann Cartesia kostenlos verwendet werden?

Das Free-Paket bietet monatlich 20.000 Credits sowie einen Vorauszahlungsbetrag von 1 US-Dollar für den Agenten – damit kann man TTS- und STT-Funktionen testen. Eine Lizenz für kommerzielle Nutzung sowie die Möglichkeit zur sofortigen Klonierung von Stimmen sind ab dem Pro-Paket verfügbar.

Wie viel kostet Cartesia Pro?

Laut der offiziellen Preisliste beträgt der Preis 5 US-Dollar pro Monat – dies umfasst 100.000 Credits sowie einen Agenten-Lizenzbetrag von 5 US-Dollar. Tatsächliche Gebühren und Kosten für zusätzlichen Gebrauch werden über die Konsole abgerechnet.

Was ist der Unterschied zwischen sofortiger und professioneller Stimmenklonierung?

Die sofortige Klonierung erfordert etwa 10 Sekunden für ein Sample und ist ab Pro verfügbar; die professionelle Klonierung benötigt mindestens 30 Minuten für eine hochwertige Aufnahme und ist ab Startup verfügbar, wobei 1 Million Credits für das Training erforderlich sind.

Unterstützt Cartesia Chinesisch?

Die aktuelle Version von Sonic unterstützt mehrere Sprachen; die offiziellen Dokumentationen zum neuesten Modell geben an, dass 42 Sprachen direkt unterstützt werden. Die genauen Eigenschaften der chinesischen Sprachausgabe sowie die Effekte in verschiedenen Regionen sollten im Playground in der Praxis getestet werden.

Ist Cartesia open source?

Die Kernsprachplattformen und -modelle sind keine Open-Source-Produkte, während die offiziellen SDKs sowie Verbindungsprojekte wie MCP ihre Quellcode bereitstellen. Auch bei der Verwendung dieser Clients werden weiterhin bezahlte Hosting-APIs aufgerufen.

©️ Urheberrechtshinweis: Sofern nicht anders angegeben, liegen die Urheberrechte an allen Artikeln auf dieser Website beiTeilen von AI-ToolsAlle Urheberrechte liegen bei uns. Ohne Genehmigung darf keine Person, kein Medienunternehmen, keine Website oder irgendeine Gruppe den Inhalt dieser Website kopieren, nachahmen oder auf andere Weise verbreiten. Ebenso ist es nicht gestattet, Spiegelseiten auf Servern zu erstellen, die nicht uns gehören. Andernfalls behalten wir uns das Recht vor, rechtliche Schritte gegen die Verantwortlichen einzuleiten.

Werkzeuge, die den Cartesia ähneln