Inworld
Inworld – intelligente Werkzeuge zur Steigerung der Effizienz durch KI
Tags:Steigerung der Effizienz durch KIEine kurze Beschreibung
Inworld AI ist eine Entwicklungsplattform für Echtzeit-Stimmanswendungen, die Text-zu-Stimme- und Stimme-zu-Text-Umwandlung, vollduplizierende Dialoge, Modellrouting sowie die Verwaltung von Inferenzprozessen in einem einheitlichen Konten- und Abrechnungssystem integriert.
Einführung in die Tools
Inworld AI wird von Theai, Inc. betrieben. Ursprünglich erhielt das Produkt Aufmerksamkeit wegen seiner Fähigkeiten im Umgang mit Spielcharakteren und AI-NPCs. Heute liegt der Schwerpunkt auf der Infrastruktur für Echtzeit-Sprachverarbeitung und schnelles Reasoning, die für Consumer-Anwendungen benötigt wird. Es handelt sich dabei eher um eine API-Plattform für Entwickler als um einen Editor zur Bearbeitung von Sprachaufnahmen für Endnutzer.
Zu den Hauptanwendungen gehören Sprachbegleitung, Spracherlernen, Spiele und interaktive Medien, Kundenservice sowie externe Verkaufskommunikation und intelligente Telefonassistenten. Entwickler können entweder nur ein bestimmtes Sprachmodell verwenden oder über die Realtime-API eine vollständige Dialogkette zusammenstellen.
Aktuelle Produktzusammensetzung
| Produkte | Hauptfähigkeiten | Eingabe und Ausgabe | Passende Szenarien |
|---|---|---|---|
| Realtime TTS | Text-zu-Stimme mit niedriger Verzögerung, Cloning und Sounddesign | Text-Streaming oder vollständiges Audio | Sprachassistenten, Synchronisation und interaktive Charaktere |
| Realtime STT | Transkribieren und Sprechmerkmale extrahieren | Audio in Text umwandeln und Sprachprofil erstellen | Echtzeit-Dialog- und Anrufverständnis |
| Realtime API | STT, LLM und TTS in eine fortlaufende Konversation einbeziehen | Zweiwege-Stream für Audio, Text und Ereignisse | Vollduplex-Stimmen-Agent |
| Realtime Router | Zugriff auf und Routing von über 220 Modellen über eine einheitliche Schnittstelle | Nachrichten in Modell-Text oder Sprachantwort umwandeln | Modellwechsel, Umleitung und Failover |
| Realtime Inference | Verwaltung und Optimierung von Open-Weight-Modellen | Anfrage um Ergebnisse der Inferenz mit niedrigerer Verzögerung | Anwendungen für häufigen Konsum |
| Compute | Hosted GPU-Services für Kunden mit hohem Verbrauch | Exklusive Deduktion und Kapazität | Großskalige stabile Produktionslast |
Realtime TTS
Realtime TTS bietet zwei Modelloptionen an: TTS-2 und TTS-2 Flash. Die erste legt Wert auf natürliche Sprachsteuerung und Ausdrucksfähigkeit, die zweite auf geringere Verzögerungen und niedrigere Zeichenkosten.
| Modell | Positionierung | Offene Verzögerungsindikatoren | Sprache | Für Aufgaben geeignet |
|---|---|---|---|---|
| Realtime TTS-2 | Hohe Ausdruckskraft und kontrollierbare Stimme | Erste Zeichen von P90 sparen 100 Millisekunden | Mehr als 200 | Charaktere, Kundenservice und emotionale Gespräche |
| Realtime TTS-2 Flash | Niedrige Verzögerung und geringe Kosten | Erste Zeichen von P90 sparen 20 Millisekunden | Mehr als 200 | Hohe Konkurrenzfähigkeit bei Echtzeit-Hilfen und großangelegte Erstellung |
Die Verzögerungsindikatoren werden auf der Serverseite gemessen und beinhalten nicht die Zeit im Benutzernetzwerk, die Wartezeiten in der Anwendung sowie die Zeit des Wiedergabegeräts. Die tatsächliche End-to-End-Reaktionszeit hängt außerdem von der Textgenerierung, der Verbindungsqualität sowie der Implementierung auf der Client-Seite ab.
Sprachsteuerung und -ausgabe
- Emotionen, Artikulation, Tonfall, Lautstärke, Tonhöhe, Geschwindigkeit und Sprachstil können durch natürliche Sprache gesteuert werden.
- In den Text können Anweisungen zur Aussprache, Pausen sowie nicht-verbale Geräusche eingefügt werden.
- Unterstützt die Stream-generierte Erstellung, geeignet für das Erstellen und Abspielen gleichzeitig.
- Es können Wörter, Phoneme und Zeitstempel für die Lippenbewegungen zurückgegeben werden, um Untertitel sowie die Synchronisierung der Lippenbewegungen der Charaktere zu ermöglichen.
- Unterstützung von Sprachgeschwindigkeit, Tonhöhe, benutzerdefinierter Aussprache und verschiedenen Audio-Kodierungs-Einstellungen.
- Playground ermöglicht es, zunächst einen Probelauf durchzuführen, bevor die gleichen Tonidentifikatoren in der Programmierschnittstelle verwendet werden.
Stimmenklonierung und Sounddesign
Instant Voice Cloning ermöglicht es, innerhalb von etwa 5 bis 15 Sekunden auf der Grundlage eines Referenz-Audios eine Stimme zu erstellen, wodurch dieselbe Stimme in mehr als 200 verschiedenen Sprachen wiedergegeben werden kann. Voice Design hingegen erzeugt neue Stimmen direkt anhand von textuellen Beschreibungen wie Alter, Akzent, Klangfarbe und Energie.
- Bestätigen, dass der Aufnahmende ausdrücklich zugestimmt hat, die Aufnahme zu klonen, zu speichern und für vorgegebene Zwecke zu nutzen.
- Aufnehmen von klaren Aufnahmen ohne Hintergrundmusik, ohne Echo und nur mit einer Person.
- Nach der Erstellung des Sounds wird die zurückgegebene Sound-ID gespeichert.
- Testen Sie die Muttersprache, die Übersetzung zwischen Sprachen sowie verschiedene Ausdrucksanweisungen mit kurzen Texten.
- Überprüfen Sie die Ähnlichkeit, das Risiko von Täuschung, sensible Wörter und die Geschäftslizenz.
- Für die öffentliche Bereitstellung werden mehr Informationen zur Identifizierung, Zugriffskontrollen sowie Überwachung von Missbrauch eingeführt.
Professional Voice Cloning ist für Developer als Zusatzfunktion verfügbar, Growth enthält 1 Version, Enterprise wird nach Vertragsvereinbarung konfiguriert. Die Stimmenklonierung beinhaltet Daten, die als biometrische Informationen angesehen werden können; es sollte ohne Genehmigung keine Stimme eines anderen kopiert werden.
Realtime STT
Die Echtzeit-STT-Funktion wandelt Sprache in Text um und kann mithilfe von Voice-Profilinging Merkmale wie Alter, Tonhöhe, Stimmung, Sprechstil und Akzent erkennen. Das Produkt kann mit Inworlds eigenem Transkriptionsdienst sowie anderen Anbietern für Spracherkennung verbunden werden.
| Fähigkeiten | Wirkung | Verwendungshinweise |
|---|---|---|
| Echtzeit-Transkription | Ständige Texteingabe für Sprachintelligenzen bereitstellen | Umgang mit Netzwerkfluktuationen, Unterbrechungen und Neuvernetzungen |
| Voice profiling | Hilft dem Modell, Ausdrucksweisen und Kontexte zu verstehen. | Es handelt sich um Schätzungen des Modells – sie können nicht als Identitäts- oder medizinische Diagnosen herangezogen werden. |
| Mehrere Anbieter | Wählen Sie je nach Fähigkeit Inworld oder andere STT-Dienste aus. | Vergleichende Sprachen, Verzögerungen, Kosten und Reservierungsrichtlinien |
| Fließende Verbindung | Ergebnisse zurückgeben, während Audio empfangen wird | Steuerung von Konkurrenz und Lebenszyklus von Sitzungen |
| Abrechnung nach Audio-Länge | Kosten werden nach bearbeiteten Stunden abgezogen | Stille, erneute Versuche sowie wiederholte Hochlader können ebenfalls die Kosten beeinflussen. |
Realtime API
Die Realtime-API kombiniert Spracherkennung, große Modelle und Sprachsynthese über eine fortlaufende WebSocket-Sitzung, sodass Benutzer natürlich unterbrechen, fortfahren und abwechselnd sprechen können. Sie ist kompatibel mit dem OpenAI Realtime-Protokoll und erleichtert den Umstieg von bestehenden Clients.
- Integrierte Sprachaktivitätserkennung, um festzustellen, wann der Benutzer anfängt und aufhört zu sprechen.
- Smart Turn hilft dabei, kurze Pausen von einer tatsächlichen Beendigung der Rede zu unterscheiden.
- Man kann die Modelle im Router verwenden oder eigene Modelle nach Bedarf hinzufügen.
- Audio-, Text- und teilweise Bildinhalte unterstützen die Erstellung multimodaler Sessions.
- Die Basisservices TTS, STT und LLM werden je nach tatsächlichem Verbrauch abgerechnet.
- Eine kontinuierliche Verbindung erfordert die Handhabung von Heartbeats, Neuanbindungen, Abbrüchen und der Wiederherstellung des Sessionzustands.
Erstellung eines Sprach-Agenten
- Erstellen Sie ein Konto, eine Arbeitsumgebung sowie API-Anmeldeinformationen, die ausschließlich für den Server verwendet werden.
- Erstmal sollten im Playground die TTS-Stimme, die STT-Einstellungen sowie das Zielmodell festgelegt werden.
- Entwerfen Sie Systemanweisungen, Werkzeuge, Regeln für Benutzerunterbrechungen und Regeln zum Beenden von Gesprächen.
- Etablierung von Echtzeit-Sessions sowie korrekte Verarbeitung von Audioformaten, Ereignissen und Stream-Wiedergabe.
- Es solltenFallback-Verfahren für Netzwerkunterbrechungen, Modell-Timeouts und Tool-Fehler festgelegt werden.
- Protokollieren Sie Verzögerungen, Transkriptionsfehler, Erfolgsrate der Unterbrechungen, Erfolgsrate bei der Aufgabenerfüllung und die Kosten pro Minute.
- Nach dem Betrieb in kleinem Umfang wird die Konkurrenzfähigkeit erhöht, und es wird überprüft, ob die Rechnungen mit dem tatsächlichen Verbrauch übereinstimmen.
Realtime Router
Der Realtime Router bietet über eine Schnittstelle, die mit den Anfragemethoden von OpenAI und Anthropic kompatibel ist, Zugang zu mehr als 220 Modellen. Drittanbieter-Modelle werden zu den vom Anbieter angegebenen Kosten weiterverkauft – ohne Aufpreis. Wenn eigene Schlüssel verwendet werden, wird ein zusätzlicher Servicebetrag berechnet.
| Routing-Fähigkeit | Arbeitsweise | Anwendungsbedeutung |
|---|---|---|
| Bedingte Routing | Wählen Sie das Modell nach Sprache, Region, Paket, Absicht oder Stimmung aus. | Kosten und Fähigkeiten für verschiedene Nutzer abstimmen |
| Traffic-Trennung | Die Anfragen werden proportional auf mehrere Modelle verteilt. | Durchführung von Online-A/B-Tests |
| Klebrige Verteilung | Derselbe Benutzer verwendet kontinuierlich dieselben Experimentvariablen. | Die Erfahrung konstant halten |
| Automatische Ausfallsicherung | Versuchen Sie bei Fehlern oder Geschwindigkeitsbeschränkungen Modelle als Kandidaten. | Verbesserung der Servicekontinuität |
| Autoauswahl | Filtern nach Preis, Verzögerung, Durchsatz oder Referenzwert | Dynamische Optimierung von Modellkombinationen |
| Beobachtbarkeit | Aufzeichnung des ausgewählten Modells, der Versuchskette, der Zeit für den ersten Token sowie der Kosten | Analyse von Qualität und Kosten |
| Analyse exportieren | Senden von Anfragedaten an ein externes Analyse-System | Erstellung eines eigenen Betriebsdashboards |
| Integrierte Sprachfunktionen | Audioeinstellungen in die Chatanfrage aufnehmen | Ein Aufruf gibt Text und Sprache zurück. |
Modelle und Abrechnungsmethoden
Die Preisangaben wurden am 23. August 2026 überprüft. Die tatsächlichen Beträge, Steuern, Wechselkurse sowie Rabatte können sich ändern; es gilt letztendlich das, was auf der Zahlelseite angezeigt wird.
Router umfasst Anbieter wie OpenAI, Anthropic, Google, Meta, Mistral, DeepSeek, xAI sowie open-source-optimierte Gewichtsmodelle von Inworld. Die Liste der Modelle und ihre Preise ändern sich häufig; daher sollten diese dynamisch aus dem aktuellen Modellkatalog abgerufen werden.
| Aufrufweise | Preisregeln | Hinweise |
|---|---|---|
| Drittanbieter-Modelle für den Inworld-Resell | Nach den Kosten des Anbieters – ohne Aufpreis für den Router | Wird weiterhin von den Eingaben, Ausgaben und Cache-Preisen der verschiedenen Modelle beeinflusst. |
| Eigene Anbieter-Schlüssel | Anbieterkosten plus 4% | Die Rechnungen werden sowohl beim Anbieter als auch bei Inworld ausgestellt. |
| Inworld-eigene Schlussfolgerungen | Nach den Tarifen des Modells | Optimierbar für den Verbrauchsumfang und die Echtzeitverzögerung |
| LLM in der Echtzeit-API | Getrennte Messung von TTS und STT | Die Gesamtkosten sind die Summe der Kosten für die drei Ebenen. |
Playground und API-Entwicklung
Die Plattform bietet Playgrounds für TTS und Echtzeit, die es ermöglichen, vor dem Schreiben von Code Stimmen, Modelle und Parameter zu testen. Für die Verwendung in echten Anwendungen wird über eine Server-API oder WebSocket Zugang gewährt; für Live-Sitzungen im Browser sollten kurze Token verwendet werden, um das Leaken der Hauptverschlüsselung zu vermeiden.
- REST eignet sich für einmalige TTS-, STT- und Ressourcenverwaltungsanfragen.
- Der Streaming-TTS gibt den Audiodateninhalt in mehreren JSON-Zeilen kontinuierlich zurück und erfordert eine Dekodierung Zeile für Zeile.
- WebSocket eignet sich für vollduplizierenden, Echtzeit-Dialog und anhaltenden Status.
- Router sind mit gängigen SDKs kompatibel; bei der Migration müssen dennoch nicht vollständig übereinstimmende Erweiterungsfelder überprüft werden.
- Anmeldeinformationen sollten gemäß den Konkurrenzbeschränkungen pro Konto geteilt werden, nach Umgebungen getrennt aufbewahrt und regelmäßig ausgetauscht werden.
- Das Produktionsystem muss Timeout-, exponentielles Backoff-, Quotenmanagement sowie Log-Demaskierung bereitstellen.
Abonnementpläne
| Plan | Monatsgebühr | Integrale pro Zyklus | Hauptanteile | Für Nutzer geeignet |
|---|---|---|---|---|
| On-Demand | Kostenloser Einstieg | Mit kostenlosem Probemonat | Maximal 70 Minuten TTS oder 400 Minuten STT, 100 benutzerdefinierte Stimmen, API und Router, Geschäftslicenz | Bewertung und Prototypen |
| Creator | 25 Dollar/Monat | 25 Dollar-Punkte | 500 Stimmen, maximal 40.000 Zeichen pro Playground, Arbeitsbereich und Teamverwaltung | Inhaltscreation und kleine Projekte |
| Builder | 100 Dollar/Monat | 100 Dollar Punkte | 3000 Stimmen, höhere Konkurrenzfähigkeit, gemeinsame Arbeitsbereiche und niedrigere Gebühren | Wachstumsprojekte und kleine Teams |
| Developer | 300 Dollar/Monat | 300 Dollar-Punkte | 10.000 Stimmen, 150 parallele TTS-Verbindungen, professionelle Kloning-Funktionen sowie Unterstützung für priorisierte E-Mails | Produktionsanwendung |
| Growth | 1500 US-Dollar/Monat | 1500 Dollar in Punkten | 30.000 Stimmen, 500 parallele TTS-Verarbeitungen, 1 professionelle Klone sowie zusätzliche Konformitätsfunktionen | Großskalige und konformitätsorientierte Implementierung |
| Enterprise | Individuelle Kostenschätzung | Gemäß Vertrag | Anpassungsbeschränkungen, SLA, DPA, lokale Bereitstellung, Datenaufbewahrung und exklusiver Support | Überaus große und maßgeschneiderte Umgebungen |
Die Zahlungsoptionen sind Monats- oder Jahresbezahlung; bei der Jahresbezahlung wird die Gebühr einmalig fällig. Der Preis des Pakets wird in entsprechende Punkte umgerechnet, wobei für den Überschuss weiterhin zu den jeweiligen Tarifen gekauft werden muss oder eine automatische Auffüllung erfolgt.
Preis pro Einheit für TTS und STT
| Plan | TTS-2 pro Million Zeichen | TTS-2 Flash pro Million Zeichen | STT 1 pro Stunde |
|---|---|---|---|
| On-Demand | 25 Dollar | 15 Dollar | 0,15 US-Dollar |
| Creator | 20 Dollar | 10 Dollar | 0,10 US-Dollar |
| Builder | 17,50 US-Dollar | 9 Dollar | 0,10 US-Dollar |
| Developer | 15 Dollar | 8 Dollar | 0,10 US-Dollar |
| Growth | 12,50 US-Dollar | 7 Dollar | 0,10 US-Dollar |
| Enterprise | Ab 5 US-Dollar | Unter 5 Dollar | Maßanfertigung |
Für die Überschreitung der festgelegten Menge im Rahmen desselben Plans wird der Preis pro Einheit des jeweiligen Tarifs berechnet. Die Realtime-API verfügt nicht über einen festen Preis pro Minute; stattdessen werden die tatsächlich verwendeten TTS-Zeichen, die Länge des STT-Audios sowie die LLM-Token separat abgerechnet.
Konkurrenz und Kapazität
| Plan | TTS-Konkurrenzgenerierung | STT-Flussbasierte Konkurrenz | Echtzeit-Mehrschicht-Sitzungen | Schätzung der Sprachnutzer-Sessions |
|---|---|---|---|---|
| On-Demand | 5 | 10 | 10 | Etwa 20 |
| Creator | 10 | 20 | 20 | Etwa 40 |
| Builder | 50 | 100 | 100 | Etwa 200 |
| Developer | 150 | 300 | 300 | Etwa 600 |
| Growth | 500 | 1000 | 1000 | Etwa 2000 |
| Enterprise | Maßanfertigung | Maßanfertigung | Maßanfertigung | Maßanfertigung |
Die Limits für die gleichzeitige Verarbeitung werden pro Konto sowie pro API-Schlüssel festgelegt. Anfragen, die über dieses Limit hinausgehen, werden nur dann bearbeitet, wenn die Kapazitäten es zulassen. Die Kapazitätsplanung sollte auf Spitzenwerten und Belastungstests beruhen; die geschätzte Anzahl der Sessions darf nicht direkt als Garantie für den Service dienen.
Gültigkeitsdauer der Punkte und Änderungen des Kontos
- Unverwendete Punkte des Pay-Plans können maximal 3 Monate übertragen werden, solange die Mitgliedschaft besteht und der Wert des Plans nicht sinkt.
- Die monatlich ausgestellten Punkte haben ein eigenes Gültigkeitsfenster von 3 Monaten.
- Der Mindestpreis für den Kauf zusätzlicher Punkte beträgt 10 US-Dollar. Die Gültigkeit der gekauften Punkte beträgt 1 Jahr.
- Es kann eine automatische Aufladung eingestellt werden, um Punkte aufzufüllen, wenn der Saldo unter einen bestimmten Schwellenwert fällt.
- Die Aufrüstung tritt umgehend in Kraft, und es werden die vollen Kosten für das neue Paket sowie die noch nicht abgerechneten Verbrauchsmengen fällig.
- Die Herabstufung oder Aufhebung tritt am Ende des aktuellen Zyklus in Kraft, wobei die verbleibenden Punkte gelöscht werden.
- Nach mehreren fehlgeschlagenen Zahlungen und 7 Versuchen zur Wiederholung wird das Konto auf „On-Demand“ herabgestuft und die API deaktiviert.
Verantwortung für Stimme und Privatsphäre
Die Datenschutzerklärung betrachtet Chats, Aufnahmen sowie aus der Stimme abgeleitete akustische Merkmale als mögliche zu verarbeitende Daten, wobei einige dieser Merkmale in bestimmten Regionen als biometrische Informationen gelten können. Für die Klonierung und Analyse von Stimmen ist die entsprechende Einwilligung erforderlich, und es müssen Möglichkeiten zur Löschung sowie zum Austritt bereitgestellt werden.
| Daten | Hauptverwendungszweck | Risikokontrolle |
|---|---|---|
| Referenz auf die Aufnahme | Erstellen von sofortigen oder professionellen Stimmenklonen | Zustimmung speichern, Nutzung einschränken und das Originalaudio schützen |
| Stimmmerkmalen | Erhalt der Stimmenidentität oder Unterstützung beim Kontextverständnis | Nicht zur Identitätsverifizierung oder zu sensiblen Schlussfolgerungen. |
| Transkription des Textes | Für Modelle und Geschäftswerkzeuge zur Verfügung gestellt | Desensibilisierung und Einschränkung der Protokollierung |
| Dialog-Audio | Echtzeitverarbeitung, Qualität und Servicebetrieb | Klare Ankündigung der Aufnahme und regionale Zustimmung |
| Konten und Transaktionen | Zertifizierung, Abrechnung und Support | Minimale Berechtigungen und Auditing-Zugriff |
| Datenanalyse | Produkte verbessern und die Nutzung bewerten | Unterscheidung zwischen Kundendaten und anonymisierten Forschungsdaten |
Hinweise zur Datenschutzrichtlinie: Inworld kann bestimmte Informationen zur Forschung, Entwicklung sowie zum Training von Modellen verwenden. Zudem wird die Möglichkeit angeboten, dass Unternehmen keine Daten gespeichert werden. Bei sensiblen oder regulierten Anwendungen müssen im Vertrag die Bedingungen für das Beenden des Trainingsprozesses, die Dauer der Datenspeicherung sowie der Geltungsbereich des Produkts festgelegt werden.
Sicherheit und Konformität
| Projekt | Offener Status | Gültige Erinnerungen |
|---|---|---|
| SOC 2 | Type II | Aktueller Bericht anfordern und abgedeckte Dienste überprüfen |
| GDPR | Die Erklärung ist zutreffend. | Der Kunde muss weiterhin die rechtlichen Grundlagen sowie die Erfüllung der Datenrechte festlegen. |
| HIPAA und BAA | Zu Growth können Zusatzoptionen erworben werden. | Unterschreiben des BAA und Festlegung des Umfangs der Verarbeitung geschützter Gesundheitsinformationen |
| Zero Data Retention | Für Growth können Zusatzleistungen erworben werden, Unternehmen können verhandeln. | Überprüfen, ob TTS, STT, Router sowie Drittanbietermodelle vollständig abgedeckt sind. |
| Verschlüsselung | Statisches AES, übertragungssicheres TLS | Überprüfung von Schlüsseln, Backups und Log-Umgebung |
| Einmaliges Anmelden | Unternehmen unterstützen SAML und OIDC | Kombination von Rollenrechten und automatischer Konfiguration |
| Lokale Bereitstellung | Enterprise bietet an | Klare Definition der Verantwortlichkeiten für Modelle, Aktualisierungen, Hardware und Betrieb. |
| Datenverweilung | Enterprise bietet Optionen für die EU und Indien. | Überprüfen aller Unterauftragnehmer und Backup-Orte |
GitHub, SDK und Open-Source-Status
Inworld verfügt über eine aktive offizielle GitHub-Organisation, die TTS-Code, API-Beispiele, Runtime-Vorlagen, MCP-Tools, Sprachmigrationstools sowie verschiedene Beispielanwendungen bereitstellt. TTS, API-Beispiele und mehrere Vorlagen werden unter der MIT-Lizenz bereitgestellt.
Offene Beispiele und Vorlagen bedeuten nicht, dass die Hostplattformen, Modelle oder alle SDKs offen zugänglich sind. Einige Runtime-Binärdateien sowie ältere Unity- und Unreal-SDKs unterliegen speziellen Lizenzen; vor der Verwendung müssen die Lizenzen für jede Bibliothek und jedes Komponente einzeln überprüft werden.
| Entwicklungsressourcen | Öffentliche Informationen | Lizenzhinweise |
|---|---|---|
| TTS-Lager | Öffentlich | MIT kennzeichnen |
| API Examples | Öffentlich | MIT kennzeichnen |
| Node Runtime-Vorlage | Öffentlich | MIT-Vorlage, mit Binärdatei unter separaten Bedingungen |
| MCP-Tool | Öffentlich | Nach der aktuellen Lizenz des Lagers verwenden |
| Unity- und Unreal-Ressourcen | Einige SDKs und Beispiele können heruntergeladen werden. | Begrenzt durch SDK- oder Projektlizenzen |
| Verwaltungsmodelle und Cloud-Plattformen | Nicht open source | Durch Geschäftsbedingungen und API-Nutzung |
Für welche Benutzer geeignet
- Aufbau eines Teams für Konsumierungs-Apps mit Sprachbegleitung, sozialen Funktionen, Sprachlerninhalten und interaktiven Elementen.
- Entwickler, die eine TTS-Technologie mit niedriger Verzögerung sowie Sprachklonierung benötigen.
- Es wird angestrebt, STT, LLM und TTS in ein einziges sprachbasiertes Intelligenzsystem für Echtzeit-Sessions zu integrieren.
- Ein Plattformengineering-Team, das zwischen mehr als 220 Modellen routen, experimentieren und für Failover sorgen muss.
- Unternehmen, die eine hohe Anzahl an gleichzeitigen Anfragen, dedizierte Kapazitäten oder eine lokale Implementierung benötigen.
- Entwickler, die interaktive Erlebnisse mit Unity, Unreal, Node.js sowie gängigen Sprachframeworks erstellen.
Vorteile des Produkts
- TTS, STT, Realtime-API und Modell-Router teilen sich Konten, Punkte sowie Entwicklungsdokumentation.
- TTS-2 berücksichtigt die Kontrolle der Darstellung, während Flash auf niedrige Verzögerungen und geringe Kosten setzt.
- Die Klangklon-Proben sind kurz und ermöglichen es, die Stimme in über 200 Sprachen beizubehalten.
- Der Router ist mit den gängigen Aufrufmethoden kompatibel und unterstützt bedingte Routing-Logik, Experimente sowie automatische Failover-Funktionen.
- Der Abonnementspreis wird in verfügbare Punkte umgewandelt, wobei das Premium-Paket gleichzeitig den Einzelpreis senkt und die Parallelverarbeitung erhöht.
- Es werden SOC 2 Type II, Enterprise ZDR, lokale Implementierung sowie Optionen zur Datenspeicherung angeboten.
- Offizielle GitHub-Beispiele und Vorlagen umfassen verschiedene Sprachen sowie Echtzeit-Sprachframeworks.
Nutzungsbeschränkungen und Kostenrisiken
- Die Gesamtkosten für die Echtzeit-Sprachverarbeitung setzen sich aus TTS, STT und LLM zusammen; man darf nicht nur den Preis pro Zeichen betrachten.
- Gebuchte Punkte können maximal 3 Monate übertragen werden; bei Stornierung oder Downgrade wird der ungenutzte Restbetrag gelöscht.
- Hohe Konkurrenzlast, professionelle Stimmenklonierung, ZDR, HIPAA sowie lokale Installation erfordern höherwertige Lösungen oder Zusatzoptionen.
- Die Serververzögerungsindikatoren beinhalten nicht die Netzwerkzeit, die Zeit zur Erstellung des Modells sowie die Wiedergabedauer am Client.
- Stimmenprofile gehören zur probabilistischen Schätzung und können die Identitätsüberprüfung, die Emotionsdiagnose oder menschliches Urteilsvermögen nicht ersetzen.
- Dritte Modelle und eigene Schlüssel können zusätzliche Verträge, Rückbehaltrechte und Kosten mit sich bringen.
- Die Kern-Cloud-Dienste und -Modelle sind nicht open source; die öffentlichen Repositorien enthalten hauptsächlich Code, Vorlagen und Beispiele.
Online-Überprüfungsliste
- Ermitteln, ob nur TTS oder STT benötigt wird, oder ob eine vollständige Echtzeit-Sitzung sowie ein Router erforderlich sind.
- Prüfen Sie die Tonqualität, die Transkription und Unterbrechungen mit repräsentativen Sprachen, Geräten und Netzwerken.
- Schätzen Sie Zeichen, Audio-Stunden, LLM-Token und parallele Sitzungen anhand des Peaks.
- Vergleichen Sie Paketpunkte, Einzelpreise, Übertragungsfristen und Zusatzgebühren, um Budgetwarnungen einzurichten.
- Eine klare Genehmigung für die Klonierung von Stimmen einholen und die Vorschriften zu Biometrie und Aufnahmen prüfen.
- Der Hauptschlüssel wird auf der Serverseite gespeichert, der Browser verwendet nur vorübergehende Zugangsdaten.
- Überprüfung der Anforderungen an die Beibehaltung von Drittanbietermodellen, ZDR, HIPAA, Datenverbleib und -löschung.
- Zeitüberschreitung bei der Bereitstellung, Neuanbindung, Rückfall auf das Modell und manuelle Übernahme, anschließend schrittweise Erhöhung des Volumens.
Häufige Fragen
Was macht Inworld AI derzeit hauptsächlich?
Der Schwerpunkt liegt derzeit auf Infrastrukturen für Echtzeit-Sprache und -Logik, einschließlich TTS, STT, vollduplizierbaren Sprach-APIs, Modell-Routern sowie gehosteter Rechenleistung – und nicht nur auf früheren KI-Tool-Funktionen.
Ist Inworld AI kostenlos?
On-Demand kann kostenlos gestartet werden und umfasst bis zu etwa 70 Minuten TTS oder 400 Minuten STT. Ab dem kostenlosen Umfang wird nach tatsächlichem Verbrauch abgerechnet, und für einige fortgeschrittene Modelle ist eine Zahlungsmethode erforderlich.
Wird Chinesisch unterstützt?
Die TTS-2-Serie umfasst mehr als 200 Sprachen, einschließlich Chinesisch. Vor der offiziellen Nutzung sollten Mandarin, Akzente, Zahlen, Eigennamen sowie benutzerdefinierte Aussprachen getrennt voneinander getestet werden.
Wie viele Aufnahmen sind für die Klonierung einer Stimme erforderlich?
Die sofortige Klonierung verwendet in der Regel klarer Audio-Inhalt von etwa 5 bis 15 Sekunden Länge. Professionelle Klonierung gehört zu den höheren Paketleistungen oder Zusatzoptionen und erfordert zudem die Einhaltung von Lizenzanforderungen für den Toninhalt.
Wie wird die Gebühr für eine Realtime-API berechnet?
Es gibt keinen festen Preis pro Minute. Die Kosten für die TTS-Zeichen während der Sitzung, die Länge des STT-Audios sowie die LLM-Tokens werden nach den jeweiligen Tarifbedingungen des aktuellen Pakets berechnet.
Führt das Router-Modell zu einem höheren Preis?
Drittanbieter-Modelle werden über Inworld geroutet und nach den Kosten des Anbieters abgerechnet, ohne zusätzliche Gebühren für den Router; bei Verwendung der eigenen Schlüssel werden in der Dokumentation 4 % Servicegebühr angegeben.
Wird der Punkt übertragen?
Die monatlichen Punkte des Pay-Plans können bei Beibehaltung eines gleichwertigen oder höheren gültigen Abonnements maximal für 3 Monate übertragen werden; zusätzlich gekaufte Punkte sind ein Jahr lang gültig. Bei Kündigung oder Downgrade werden die verbleibenden Punkte gelöscht.
Ist Inworld AI Open Source?
Die Kernplattform und die Modelle sind nicht vollständig open source. Offiziell werden der TTS-Code unter der MIT-Lizenz sowie Beispiele für APIs und verschiedene Vorlagen bereitgestellt, doch einige SDK-Binärdateien unterliegen einer separaten Lizenz.
Zusammenfassung
Inworld AI eignet sich für Teams, die natürliche Sprachverarbeitung, Dialoge mit geringer Verzögerung sowie mehrfachmodellbasierte Berechnungen in großangelegten Consumer-Anwendungen einsetzen möchten. Es kann entweder allein zur TTS- oder STT-Verarbeitung genutzt werden, oder es können Realtime-APIs und Router verwendet werden, um eine vollständige Sprachintelligenz-Lösung zu schaffen.
Bei der Auswahl eines Plans müssen gleichzeitig die Anzahl der Zeichen, die Länge des Audiomaterials, die Anzahl der Modell-Token, die Konkurrenzfähigkeit sowie die Gültigkeitsdauer der Punkte berücksichtigt werden. Im Falle von Stimmenklonierung, medizinischen oder sensiblen Daten müssen zudem neben den technischen Tests auch Genehmigungen, ZDR-Vorgaben, Verträge sowie menschliche Kontrollen eingehalten werden.
Guigong-Netzwerk-Sicherheitsnummer: 45132202000164