Inworld
Kostenloser Mehrwert
KI-Bürowerkzeuge Steigerung der Effizienz durch KI

Inworld

Inworld – intelligente Werkzeuge zur Steigerung der Effizienz durch KI

Tags:

Eine kurze Beschreibung

Inworld AI ist eine Entwicklungsplattform für Echtzeit-Stimmanswendungen, die Text-zu-Stimme- und Stimme-zu-Text-Umwandlung, vollduplizierende Dialoge, Modellrouting sowie die Verwaltung von Inferenzprozessen in einem einheitlichen Konten- und Abrechnungssystem integriert.

Einführung in die Tools

Inworld AI wird von Theai, Inc. betrieben. Ursprünglich erhielt das Produkt Aufmerksamkeit wegen seiner Fähigkeiten im Umgang mit Spielcharakteren und AI-NPCs. Heute liegt der Schwerpunkt auf der Infrastruktur für Echtzeit-Sprachverarbeitung und schnelles Reasoning, die für Consumer-Anwendungen benötigt wird. Es handelt sich dabei eher um eine API-Plattform für Entwickler als um einen Editor zur Bearbeitung von Sprachaufnahmen für Endnutzer.

Zu den Hauptanwendungen gehören Sprachbegleitung, Spracherlernen, Spiele und interaktive Medien, Kundenservice sowie externe Verkaufskommunikation und intelligente Telefonassistenten. Entwickler können entweder nur ein bestimmtes Sprachmodell verwenden oder über die Realtime-API eine vollständige Dialogkette zusammenstellen.

Aktuelle Produktzusammensetzung

ProdukteHauptfähigkeitenEingabe und AusgabePassende Szenarien
Realtime TTSText-zu-Stimme mit niedriger Verzögerung, Cloning und SounddesignText-Streaming oder vollständiges AudioSprachassistenten, Synchronisation und interaktive Charaktere
Realtime STTTranskribieren und Sprechmerkmale extrahierenAudio in Text umwandeln und Sprachprofil erstellenEchtzeit-Dialog- und Anrufverständnis
Realtime APISTT, LLM und TTS in eine fortlaufende Konversation einbeziehenZweiwege-Stream für Audio, Text und EreignisseVollduplex-Stimmen-Agent
Realtime RouterZugriff auf und Routing von über 220 Modellen über eine einheitliche SchnittstelleNachrichten in Modell-Text oder Sprachantwort umwandelnModellwechsel, Umleitung und Failover
Realtime InferenceVerwaltung und Optimierung von Open-Weight-ModellenAnfrage um Ergebnisse der Inferenz mit niedrigerer VerzögerungAnwendungen für häufigen Konsum
ComputeHosted GPU-Services für Kunden mit hohem VerbrauchExklusive Deduktion und KapazitätGroßskalige stabile Produktionslast

Realtime TTS

Realtime TTS bietet zwei Modelloptionen an: TTS-2 und TTS-2 Flash. Die erste legt Wert auf natürliche Sprachsteuerung und Ausdrucksfähigkeit, die zweite auf geringere Verzögerungen und niedrigere Zeichenkosten.

ModellPositionierungOffene VerzögerungsindikatorenSpracheFür Aufgaben geeignet
Realtime TTS-2Hohe Ausdruckskraft und kontrollierbare StimmeErste Zeichen von P90 sparen 100 MillisekundenMehr als 200Charaktere, Kundenservice und emotionale Gespräche
Realtime TTS-2 FlashNiedrige Verzögerung und geringe KostenErste Zeichen von P90 sparen 20 MillisekundenMehr als 200Hohe Konkurrenzfähigkeit bei Echtzeit-Hilfen und großangelegte Erstellung

Die Verzögerungsindikatoren werden auf der Serverseite gemessen und beinhalten nicht die Zeit im Benutzernetzwerk, die Wartezeiten in der Anwendung sowie die Zeit des Wiedergabegeräts. Die tatsächliche End-to-End-Reaktionszeit hängt außerdem von der Textgenerierung, der Verbindungsqualität sowie der Implementierung auf der Client-Seite ab.

Sprachsteuerung und -ausgabe

  • Emotionen, Artikulation, Tonfall, Lautstärke, Tonhöhe, Geschwindigkeit und Sprachstil können durch natürliche Sprache gesteuert werden.
  • In den Text können Anweisungen zur Aussprache, Pausen sowie nicht-verbale Geräusche eingefügt werden.
  • Unterstützt die Stream-generierte Erstellung, geeignet für das Erstellen und Abspielen gleichzeitig.
  • Es können Wörter, Phoneme und Zeitstempel für die Lippenbewegungen zurückgegeben werden, um Untertitel sowie die Synchronisierung der Lippenbewegungen der Charaktere zu ermöglichen.
  • Unterstützung von Sprachgeschwindigkeit, Tonhöhe, benutzerdefinierter Aussprache und verschiedenen Audio-Kodierungs-Einstellungen.
  • Playground ermöglicht es, zunächst einen Probelauf durchzuführen, bevor die gleichen Tonidentifikatoren in der Programmierschnittstelle verwendet werden.

Stimmenklonierung und Sounddesign

Instant Voice Cloning ermöglicht es, innerhalb von etwa 5 bis 15 Sekunden auf der Grundlage eines Referenz-Audios eine Stimme zu erstellen, wodurch dieselbe Stimme in mehr als 200 verschiedenen Sprachen wiedergegeben werden kann. Voice Design hingegen erzeugt neue Stimmen direkt anhand von textuellen Beschreibungen wie Alter, Akzent, Klangfarbe und Energie.

  1. Bestätigen, dass der Aufnahmende ausdrücklich zugestimmt hat, die Aufnahme zu klonen, zu speichern und für vorgegebene Zwecke zu nutzen.
  2. Aufnehmen von klaren Aufnahmen ohne Hintergrundmusik, ohne Echo und nur mit einer Person.
  3. Nach der Erstellung des Sounds wird die zurückgegebene Sound-ID gespeichert.
  4. Testen Sie die Muttersprache, die Übersetzung zwischen Sprachen sowie verschiedene Ausdrucksanweisungen mit kurzen Texten.
  5. Überprüfen Sie die Ähnlichkeit, das Risiko von Täuschung, sensible Wörter und die Geschäftslizenz.
  6. Für die öffentliche Bereitstellung werden mehr Informationen zur Identifizierung, Zugriffskontrollen sowie Überwachung von Missbrauch eingeführt.

Professional Voice Cloning ist für Developer als Zusatzfunktion verfügbar, Growth enthält 1 Version, Enterprise wird nach Vertragsvereinbarung konfiguriert. Die Stimmenklonierung beinhaltet Daten, die als biometrische Informationen angesehen werden können; es sollte ohne Genehmigung keine Stimme eines anderen kopiert werden.

Realtime STT

Die Echtzeit-STT-Funktion wandelt Sprache in Text um und kann mithilfe von Voice-Profilinging Merkmale wie Alter, Tonhöhe, Stimmung, Sprechstil und Akzent erkennen. Das Produkt kann mit Inworlds eigenem Transkriptionsdienst sowie anderen Anbietern für Spracherkennung verbunden werden.

FähigkeitenWirkungVerwendungshinweise
Echtzeit-TranskriptionStändige Texteingabe für Sprachintelligenzen bereitstellenUmgang mit Netzwerkfluktuationen, Unterbrechungen und Neuvernetzungen
Voice profilingHilft dem Modell, Ausdrucksweisen und Kontexte zu verstehen.Es handelt sich um Schätzungen des Modells – sie können nicht als Identitäts- oder medizinische Diagnosen herangezogen werden.
Mehrere AnbieterWählen Sie je nach Fähigkeit Inworld oder andere STT-Dienste aus.Vergleichende Sprachen, Verzögerungen, Kosten und Reservierungsrichtlinien
Fließende VerbindungErgebnisse zurückgeben, während Audio empfangen wirdSteuerung von Konkurrenz und Lebenszyklus von Sitzungen
Abrechnung nach Audio-LängeKosten werden nach bearbeiteten Stunden abgezogenStille, erneute Versuche sowie wiederholte Hochlader können ebenfalls die Kosten beeinflussen.

Realtime API

Die Realtime-API kombiniert Spracherkennung, große Modelle und Sprachsynthese über eine fortlaufende WebSocket-Sitzung, sodass Benutzer natürlich unterbrechen, fortfahren und abwechselnd sprechen können. Sie ist kompatibel mit dem OpenAI Realtime-Protokoll und erleichtert den Umstieg von bestehenden Clients.

  • Integrierte Sprachaktivitätserkennung, um festzustellen, wann der Benutzer anfängt und aufhört zu sprechen.
  • Smart Turn hilft dabei, kurze Pausen von einer tatsächlichen Beendigung der Rede zu unterscheiden.
  • Man kann die Modelle im Router verwenden oder eigene Modelle nach Bedarf hinzufügen.
  • Audio-, Text- und teilweise Bildinhalte unterstützen die Erstellung multimodaler Sessions.
  • Die Basisservices TTS, STT und LLM werden je nach tatsächlichem Verbrauch abgerechnet.
  • Eine kontinuierliche Verbindung erfordert die Handhabung von Heartbeats, Neuanbindungen, Abbrüchen und der Wiederherstellung des Sessionzustands.

Erstellung eines Sprach-Agenten

  1. Erstellen Sie ein Konto, eine Arbeitsumgebung sowie API-Anmeldeinformationen, die ausschließlich für den Server verwendet werden.
  2. Erstmal sollten im Playground die TTS-Stimme, die STT-Einstellungen sowie das Zielmodell festgelegt werden.
  3. Entwerfen Sie Systemanweisungen, Werkzeuge, Regeln für Benutzerunterbrechungen und Regeln zum Beenden von Gesprächen.
  4. Etablierung von Echtzeit-Sessions sowie korrekte Verarbeitung von Audioformaten, Ereignissen und Stream-Wiedergabe.
  5. Es solltenFallback-Verfahren für Netzwerkunterbrechungen, Modell-Timeouts und Tool-Fehler festgelegt werden.
  6. Protokollieren Sie Verzögerungen, Transkriptionsfehler, Erfolgsrate der Unterbrechungen, Erfolgsrate bei der Aufgabenerfüllung und die Kosten pro Minute.
  7. Nach dem Betrieb in kleinem Umfang wird die Konkurrenzfähigkeit erhöht, und es wird überprüft, ob die Rechnungen mit dem tatsächlichen Verbrauch übereinstimmen.

Realtime Router

Der Realtime Router bietet über eine Schnittstelle, die mit den Anfragemethoden von OpenAI und Anthropic kompatibel ist, Zugang zu mehr als 220 Modellen. Drittanbieter-Modelle werden zu den vom Anbieter angegebenen Kosten weiterverkauft – ohne Aufpreis. Wenn eigene Schlüssel verwendet werden, wird ein zusätzlicher Servicebetrag berechnet.

Routing-FähigkeitArbeitsweiseAnwendungsbedeutung
Bedingte RoutingWählen Sie das Modell nach Sprache, Region, Paket, Absicht oder Stimmung aus.Kosten und Fähigkeiten für verschiedene Nutzer abstimmen
Traffic-TrennungDie Anfragen werden proportional auf mehrere Modelle verteilt.Durchführung von Online-A/B-Tests
Klebrige VerteilungDerselbe Benutzer verwendet kontinuierlich dieselben Experimentvariablen.Die Erfahrung konstant halten
Automatische AusfallsicherungVersuchen Sie bei Fehlern oder Geschwindigkeitsbeschränkungen Modelle als Kandidaten.Verbesserung der Servicekontinuität
AutoauswahlFiltern nach Preis, Verzögerung, Durchsatz oder ReferenzwertDynamische Optimierung von Modellkombinationen
BeobachtbarkeitAufzeichnung des ausgewählten Modells, der Versuchskette, der Zeit für den ersten Token sowie der KostenAnalyse von Qualität und Kosten
Analyse exportierenSenden von Anfragedaten an ein externes Analyse-SystemErstellung eines eigenen Betriebsdashboards
Integrierte SprachfunktionenAudioeinstellungen in die Chatanfrage aufnehmenEin Aufruf gibt Text und Sprache zurück.

Modelle und Abrechnungsmethoden

Die Preisangaben wurden am 23. August 2026 überprüft. Die tatsächlichen Beträge, Steuern, Wechselkurse sowie Rabatte können sich ändern; es gilt letztendlich das, was auf der Zahlelseite angezeigt wird.

Router umfasst Anbieter wie OpenAI, Anthropic, Google, Meta, Mistral, DeepSeek, xAI sowie open-source-optimierte Gewichtsmodelle von Inworld. Die Liste der Modelle und ihre Preise ändern sich häufig; daher sollten diese dynamisch aus dem aktuellen Modellkatalog abgerufen werden.

AufrufweisePreisregelnHinweise
Drittanbieter-Modelle für den Inworld-ResellNach den Kosten des Anbieters – ohne Aufpreis für den RouterWird weiterhin von den Eingaben, Ausgaben und Cache-Preisen der verschiedenen Modelle beeinflusst.
Eigene Anbieter-SchlüsselAnbieterkosten plus 4%Die Rechnungen werden sowohl beim Anbieter als auch bei Inworld ausgestellt.
Inworld-eigene SchlussfolgerungenNach den Tarifen des ModellsOptimierbar für den Verbrauchsumfang und die Echtzeitverzögerung
LLM in der Echtzeit-APIGetrennte Messung von TTS und STTDie Gesamtkosten sind die Summe der Kosten für die drei Ebenen.

Playground und API-Entwicklung

Die Plattform bietet Playgrounds für TTS und Echtzeit, die es ermöglichen, vor dem Schreiben von Code Stimmen, Modelle und Parameter zu testen. Für die Verwendung in echten Anwendungen wird über eine Server-API oder WebSocket Zugang gewährt; für Live-Sitzungen im Browser sollten kurze Token verwendet werden, um das Leaken der Hauptverschlüsselung zu vermeiden.

  • REST eignet sich für einmalige TTS-, STT- und Ressourcenverwaltungsanfragen.
  • Der Streaming-TTS gibt den Audiodateninhalt in mehreren JSON-Zeilen kontinuierlich zurück und erfordert eine Dekodierung Zeile für Zeile.
  • WebSocket eignet sich für vollduplizierenden, Echtzeit-Dialog und anhaltenden Status.
  • Router sind mit gängigen SDKs kompatibel; bei der Migration müssen dennoch nicht vollständig übereinstimmende Erweiterungsfelder überprüft werden.
  • Anmeldeinformationen sollten gemäß den Konkurrenzbeschränkungen pro Konto geteilt werden, nach Umgebungen getrennt aufbewahrt und regelmäßig ausgetauscht werden.
  • Das Produktionsystem muss Timeout-, exponentielles Backoff-, Quotenmanagement sowie Log-Demaskierung bereitstellen.

Abonnementpläne

PlanMonatsgebührIntegrale pro ZyklusHauptanteileFür Nutzer geeignet
On-DemandKostenloser EinstiegMit kostenlosem ProbemonatMaximal 70 Minuten TTS oder 400 Minuten STT, 100 benutzerdefinierte Stimmen, API und Router, GeschäftslicenzBewertung und Prototypen
Creator25 Dollar/Monat25 Dollar-Punkte500 Stimmen, maximal 40.000 Zeichen pro Playground, Arbeitsbereich und TeamverwaltungInhaltscreation und kleine Projekte
Builder100 Dollar/Monat100 Dollar Punkte3000 Stimmen, höhere Konkurrenzfähigkeit, gemeinsame Arbeitsbereiche und niedrigere GebührenWachstumsprojekte und kleine Teams
Developer300 Dollar/Monat300 Dollar-Punkte10.000 Stimmen, 150 parallele TTS-Verbindungen, professionelle Kloning-Funktionen sowie Unterstützung für priorisierte E-MailsProduktionsanwendung
Growth1500 US-Dollar/Monat1500 Dollar in Punkten30.000 Stimmen, 500 parallele TTS-Verarbeitungen, 1 professionelle Klone sowie zusätzliche KonformitätsfunktionenGroßskalige und konformitätsorientierte Implementierung
EnterpriseIndividuelle KostenschätzungGemäß VertragAnpassungsbeschränkungen, SLA, DPA, lokale Bereitstellung, Datenaufbewahrung und exklusiver SupportÜberaus große und maßgeschneiderte Umgebungen

Die Zahlungsoptionen sind Monats- oder Jahresbezahlung; bei der Jahresbezahlung wird die Gebühr einmalig fällig. Der Preis des Pakets wird in entsprechende Punkte umgerechnet, wobei für den Überschuss weiterhin zu den jeweiligen Tarifen gekauft werden muss oder eine automatische Auffüllung erfolgt.

Preis pro Einheit für TTS und STT

PlanTTS-2 pro Million ZeichenTTS-2 Flash pro Million ZeichenSTT 1 pro Stunde
On-Demand25 Dollar15 Dollar0,15 US-Dollar
Creator20 Dollar10 Dollar0,10 US-Dollar
Builder17,50 US-Dollar9 Dollar0,10 US-Dollar
Developer15 Dollar8 Dollar0,10 US-Dollar
Growth12,50 US-Dollar7 Dollar0,10 US-Dollar
EnterpriseAb 5 US-DollarUnter 5 DollarMaßanfertigung

Für die Überschreitung der festgelegten Menge im Rahmen desselben Plans wird der Preis pro Einheit des jeweiligen Tarifs berechnet. Die Realtime-API verfügt nicht über einen festen Preis pro Minute; stattdessen werden die tatsächlich verwendeten TTS-Zeichen, die Länge des STT-Audios sowie die LLM-Token separat abgerechnet.

Konkurrenz und Kapazität

PlanTTS-KonkurrenzgenerierungSTT-Flussbasierte KonkurrenzEchtzeit-Mehrschicht-SitzungenSchätzung der Sprachnutzer-Sessions
On-Demand51010Etwa 20
Creator102020Etwa 40
Builder50100100Etwa 200
Developer150300300Etwa 600
Growth50010001000Etwa 2000
EnterpriseMaßanfertigungMaßanfertigungMaßanfertigungMaßanfertigung

Die Limits für die gleichzeitige Verarbeitung werden pro Konto sowie pro API-Schlüssel festgelegt. Anfragen, die über dieses Limit hinausgehen, werden nur dann bearbeitet, wenn die Kapazitäten es zulassen. Die Kapazitätsplanung sollte auf Spitzenwerten und Belastungstests beruhen; die geschätzte Anzahl der Sessions darf nicht direkt als Garantie für den Service dienen.

Gültigkeitsdauer der Punkte und Änderungen des Kontos

  • Unverwendete Punkte des Pay-Plans können maximal 3 Monate übertragen werden, solange die Mitgliedschaft besteht und der Wert des Plans nicht sinkt.
  • Die monatlich ausgestellten Punkte haben ein eigenes Gültigkeitsfenster von 3 Monaten.
  • Der Mindestpreis für den Kauf zusätzlicher Punkte beträgt 10 US-Dollar. Die Gültigkeit der gekauften Punkte beträgt 1 Jahr.
  • Es kann eine automatische Aufladung eingestellt werden, um Punkte aufzufüllen, wenn der Saldo unter einen bestimmten Schwellenwert fällt.
  • Die Aufrüstung tritt umgehend in Kraft, und es werden die vollen Kosten für das neue Paket sowie die noch nicht abgerechneten Verbrauchsmengen fällig.
  • Die Herabstufung oder Aufhebung tritt am Ende des aktuellen Zyklus in Kraft, wobei die verbleibenden Punkte gelöscht werden.
  • Nach mehreren fehlgeschlagenen Zahlungen und 7 Versuchen zur Wiederholung wird das Konto auf „On-Demand“ herabgestuft und die API deaktiviert.

Verantwortung für Stimme und Privatsphäre

Die Datenschutzerklärung betrachtet Chats, Aufnahmen sowie aus der Stimme abgeleitete akustische Merkmale als mögliche zu verarbeitende Daten, wobei einige dieser Merkmale in bestimmten Regionen als biometrische Informationen gelten können. Für die Klonierung und Analyse von Stimmen ist die entsprechende Einwilligung erforderlich, und es müssen Möglichkeiten zur Löschung sowie zum Austritt bereitgestellt werden.

DatenHauptverwendungszweckRisikokontrolle
Referenz auf die AufnahmeErstellen von sofortigen oder professionellen StimmenklonenZustimmung speichern, Nutzung einschränken und das Originalaudio schützen
StimmmerkmalenErhalt der Stimmenidentität oder Unterstützung beim KontextverständnisNicht zur Identitätsverifizierung oder zu sensiblen Schlussfolgerungen.
Transkription des TextesFür Modelle und Geschäftswerkzeuge zur Verfügung gestelltDesensibilisierung und Einschränkung der Protokollierung
Dialog-AudioEchtzeitverarbeitung, Qualität und ServicebetriebKlare Ankündigung der Aufnahme und regionale Zustimmung
Konten und TransaktionenZertifizierung, Abrechnung und SupportMinimale Berechtigungen und Auditing-Zugriff
DatenanalyseProdukte verbessern und die Nutzung bewertenUnterscheidung zwischen Kundendaten und anonymisierten Forschungsdaten

Hinweise zur Datenschutzrichtlinie: Inworld kann bestimmte Informationen zur Forschung, Entwicklung sowie zum Training von Modellen verwenden. Zudem wird die Möglichkeit angeboten, dass Unternehmen keine Daten gespeichert werden. Bei sensiblen oder regulierten Anwendungen müssen im Vertrag die Bedingungen für das Beenden des Trainingsprozesses, die Dauer der Datenspeicherung sowie der Geltungsbereich des Produkts festgelegt werden.

Sicherheit und Konformität

ProjektOffener StatusGültige Erinnerungen
SOC 2Type IIAktueller Bericht anfordern und abgedeckte Dienste überprüfen
GDPRDie Erklärung ist zutreffend.Der Kunde muss weiterhin die rechtlichen Grundlagen sowie die Erfüllung der Datenrechte festlegen.
HIPAA und BAAZu Growth können Zusatzoptionen erworben werden.Unterschreiben des BAA und Festlegung des Umfangs der Verarbeitung geschützter Gesundheitsinformationen
Zero Data RetentionFür Growth können Zusatzleistungen erworben werden, Unternehmen können verhandeln.Überprüfen, ob TTS, STT, Router sowie Drittanbietermodelle vollständig abgedeckt sind.
VerschlüsselungStatisches AES, übertragungssicheres TLSÜberprüfung von Schlüsseln, Backups und Log-Umgebung
Einmaliges AnmeldenUnternehmen unterstützen SAML und OIDCKombination von Rollenrechten und automatischer Konfiguration
Lokale BereitstellungEnterprise bietet anKlare Definition der Verantwortlichkeiten für Modelle, Aktualisierungen, Hardware und Betrieb.
DatenverweilungEnterprise bietet Optionen für die EU und Indien.Überprüfen aller Unterauftragnehmer und Backup-Orte

GitHub, SDK und Open-Source-Status

Inworld verfügt über eine aktive offizielle GitHub-Organisation, die TTS-Code, API-Beispiele, Runtime-Vorlagen, MCP-Tools, Sprachmigrationstools sowie verschiedene Beispielanwendungen bereitstellt. TTS, API-Beispiele und mehrere Vorlagen werden unter der MIT-Lizenz bereitgestellt.

Offene Beispiele und Vorlagen bedeuten nicht, dass die Hostplattformen, Modelle oder alle SDKs offen zugänglich sind. Einige Runtime-Binärdateien sowie ältere Unity- und Unreal-SDKs unterliegen speziellen Lizenzen; vor der Verwendung müssen die Lizenzen für jede Bibliothek und jedes Komponente einzeln überprüft werden.

EntwicklungsressourcenÖffentliche InformationenLizenzhinweise
TTS-LagerÖffentlichMIT kennzeichnen
API ExamplesÖffentlichMIT kennzeichnen
Node Runtime-VorlageÖffentlichMIT-Vorlage, mit Binärdatei unter separaten Bedingungen
MCP-ToolÖffentlichNach der aktuellen Lizenz des Lagers verwenden
Unity- und Unreal-RessourcenEinige SDKs und Beispiele können heruntergeladen werden.Begrenzt durch SDK- oder Projektlizenzen
Verwaltungsmodelle und Cloud-PlattformenNicht open sourceDurch Geschäftsbedingungen und API-Nutzung

Für welche Benutzer geeignet

  • Aufbau eines Teams für Konsumierungs-Apps mit Sprachbegleitung, sozialen Funktionen, Sprachlerninhalten und interaktiven Elementen.
  • Entwickler, die eine TTS-Technologie mit niedriger Verzögerung sowie Sprachklonierung benötigen.
  • Es wird angestrebt, STT, LLM und TTS in ein einziges sprachbasiertes Intelligenzsystem für Echtzeit-Sessions zu integrieren.
  • Ein Plattformengineering-Team, das zwischen mehr als 220 Modellen routen, experimentieren und für Failover sorgen muss.
  • Unternehmen, die eine hohe Anzahl an gleichzeitigen Anfragen, dedizierte Kapazitäten oder eine lokale Implementierung benötigen.
  • Entwickler, die interaktive Erlebnisse mit Unity, Unreal, Node.js sowie gängigen Sprachframeworks erstellen.

Vorteile des Produkts

  • TTS, STT, Realtime-API und Modell-Router teilen sich Konten, Punkte sowie Entwicklungsdokumentation.
  • TTS-2 berücksichtigt die Kontrolle der Darstellung, während Flash auf niedrige Verzögerungen und geringe Kosten setzt.
  • Die Klangklon-Proben sind kurz und ermöglichen es, die Stimme in über 200 Sprachen beizubehalten.
  • Der Router ist mit den gängigen Aufrufmethoden kompatibel und unterstützt bedingte Routing-Logik, Experimente sowie automatische Failover-Funktionen.
  • Der Abonnementspreis wird in verfügbare Punkte umgewandelt, wobei das Premium-Paket gleichzeitig den Einzelpreis senkt und die Parallelverarbeitung erhöht.
  • Es werden SOC 2 Type II, Enterprise ZDR, lokale Implementierung sowie Optionen zur Datenspeicherung angeboten.
  • Offizielle GitHub-Beispiele und Vorlagen umfassen verschiedene Sprachen sowie Echtzeit-Sprachframeworks.

Nutzungsbeschränkungen und Kostenrisiken

  • Die Gesamtkosten für die Echtzeit-Sprachverarbeitung setzen sich aus TTS, STT und LLM zusammen; man darf nicht nur den Preis pro Zeichen betrachten.
  • Gebuchte Punkte können maximal 3 Monate übertragen werden; bei Stornierung oder Downgrade wird der ungenutzte Restbetrag gelöscht.
  • Hohe Konkurrenzlast, professionelle Stimmenklonierung, ZDR, HIPAA sowie lokale Installation erfordern höherwertige Lösungen oder Zusatzoptionen.
  • Die Serververzögerungsindikatoren beinhalten nicht die Netzwerkzeit, die Zeit zur Erstellung des Modells sowie die Wiedergabedauer am Client.
  • Stimmenprofile gehören zur probabilistischen Schätzung und können die Identitätsüberprüfung, die Emotionsdiagnose oder menschliches Urteilsvermögen nicht ersetzen.
  • Dritte Modelle und eigene Schlüssel können zusätzliche Verträge, Rückbehaltrechte und Kosten mit sich bringen.
  • Die Kern-Cloud-Dienste und -Modelle sind nicht open source; die öffentlichen Repositorien enthalten hauptsächlich Code, Vorlagen und Beispiele.

Online-Überprüfungsliste

  1. Ermitteln, ob nur TTS oder STT benötigt wird, oder ob eine vollständige Echtzeit-Sitzung sowie ein Router erforderlich sind.
  2. Prüfen Sie die Tonqualität, die Transkription und Unterbrechungen mit repräsentativen Sprachen, Geräten und Netzwerken.
  3. Schätzen Sie Zeichen, Audio-Stunden, LLM-Token und parallele Sitzungen anhand des Peaks.
  4. Vergleichen Sie Paketpunkte, Einzelpreise, Übertragungsfristen und Zusatzgebühren, um Budgetwarnungen einzurichten.
  5. Eine klare Genehmigung für die Klonierung von Stimmen einholen und die Vorschriften zu Biometrie und Aufnahmen prüfen.
  6. Der Hauptschlüssel wird auf der Serverseite gespeichert, der Browser verwendet nur vorübergehende Zugangsdaten.
  7. Überprüfung der Anforderungen an die Beibehaltung von Drittanbietermodellen, ZDR, HIPAA, Datenverbleib und -löschung.
  8. Zeitüberschreitung bei der Bereitstellung, Neuanbindung, Rückfall auf das Modell und manuelle Übernahme, anschließend schrittweise Erhöhung des Volumens.

Häufige Fragen

Was macht Inworld AI derzeit hauptsächlich?

Der Schwerpunkt liegt derzeit auf Infrastrukturen für Echtzeit-Sprache und -Logik, einschließlich TTS, STT, vollduplizierbaren Sprach-APIs, Modell-Routern sowie gehosteter Rechenleistung – und nicht nur auf früheren KI-Tool-Funktionen.

Ist Inworld AI kostenlos?

On-Demand kann kostenlos gestartet werden und umfasst bis zu etwa 70 Minuten TTS oder 400 Minuten STT. Ab dem kostenlosen Umfang wird nach tatsächlichem Verbrauch abgerechnet, und für einige fortgeschrittene Modelle ist eine Zahlungsmethode erforderlich.

Wird Chinesisch unterstützt?

Die TTS-2-Serie umfasst mehr als 200 Sprachen, einschließlich Chinesisch. Vor der offiziellen Nutzung sollten Mandarin, Akzente, Zahlen, Eigennamen sowie benutzerdefinierte Aussprachen getrennt voneinander getestet werden.

Wie viele Aufnahmen sind für die Klonierung einer Stimme erforderlich?

Die sofortige Klonierung verwendet in der Regel klarer Audio-Inhalt von etwa 5 bis 15 Sekunden Länge. Professionelle Klonierung gehört zu den höheren Paketleistungen oder Zusatzoptionen und erfordert zudem die Einhaltung von Lizenzanforderungen für den Toninhalt.

Wie wird die Gebühr für eine Realtime-API berechnet?

Es gibt keinen festen Preis pro Minute. Die Kosten für die TTS-Zeichen während der Sitzung, die Länge des STT-Audios sowie die LLM-Tokens werden nach den jeweiligen Tarifbedingungen des aktuellen Pakets berechnet.

Führt das Router-Modell zu einem höheren Preis?

Drittanbieter-Modelle werden über Inworld geroutet und nach den Kosten des Anbieters abgerechnet, ohne zusätzliche Gebühren für den Router; bei Verwendung der eigenen Schlüssel werden in der Dokumentation 4 % Servicegebühr angegeben.

Wird der Punkt übertragen?

Die monatlichen Punkte des Pay-Plans können bei Beibehaltung eines gleichwertigen oder höheren gültigen Abonnements maximal für 3 Monate übertragen werden; zusätzlich gekaufte Punkte sind ein Jahr lang gültig. Bei Kündigung oder Downgrade werden die verbleibenden Punkte gelöscht.

Ist Inworld AI Open Source?

Die Kernplattform und die Modelle sind nicht vollständig open source. Offiziell werden der TTS-Code unter der MIT-Lizenz sowie Beispiele für APIs und verschiedene Vorlagen bereitgestellt, doch einige SDK-Binärdateien unterliegen einer separaten Lizenz.

Zusammenfassung

Inworld AI eignet sich für Teams, die natürliche Sprachverarbeitung, Dialoge mit geringer Verzögerung sowie mehrfachmodellbasierte Berechnungen in großangelegten Consumer-Anwendungen einsetzen möchten. Es kann entweder allein zur TTS- oder STT-Verarbeitung genutzt werden, oder es können Realtime-APIs und Router verwendet werden, um eine vollständige Sprachintelligenz-Lösung zu schaffen.

Bei der Auswahl eines Plans müssen gleichzeitig die Anzahl der Zeichen, die Länge des Audiomaterials, die Anzahl der Modell-Token, die Konkurrenzfähigkeit sowie die Gültigkeitsdauer der Punkte berücksichtigt werden. Im Falle von Stimmenklonierung, medizinischen oder sensiblen Daten müssen zudem neben den technischen Tests auch Genehmigungen, ZDR-Vorgaben, Verträge sowie menschliche Kontrollen eingehalten werden.

©️ Urheberrechtshinweis: Sofern nicht anders angegeben, liegen die Urheberrechte an allen Artikeln auf dieser Website beiTeilen von AI-ToolsAlle Urheberrechte liegen bei uns. Ohne Genehmigung darf keine Person, kein Medienunternehmen, keine Website oder irgendeine Gruppe den Inhalt dieser Website kopieren, nachahmen oder auf andere Weise verbreiten. Ebenso ist es nicht gestattet, Spiegelseiten auf Servern zu erstellen, die nicht uns gehören. Andernfalls behalten wir uns das Recht vor, rechtliche Schritte gegen die Verantwortlichen einzuleiten.

Ähnliche Tools wie Inworld