一句話介紹
Inworld AI是一套面向即時語音應用的開發平台,將文字轉語音、語音轉文字、全雙工對話、模型路由和託管推論整合到統一的帳戶與計費體系中。
工具簡介
Inworld AI由Theai, Inc.所運營,初期因其在遊戲角色及AI NPC功能方面的表現而受到關注。目前,其產品的重點已轉向滿足消費級應用需求所需的即時語音處理及低延遲推理基礎設施。它更像是面向開發者的API平台,而非用於普通用戶的配音編輯工具。
主要應用包括語音陪伴、語言學習、遊戲與互動媒體、客戶服務、銷售外呼以及電話智慧體。開發者可以僅使用某個語音模型,也可以透過 Realtime API 組合出完整的對話流程。
當前產品組成
| 產品 | 主要能力 | 輸入與輸出 | 適合場景 |
|---|---|---|---|
| Realtime TTS | 低延遲文字轉語音、克隆和聲音設計 | 文本轉流式或完整音頻 | 語音助手、配音和互動角色 |
| Realtime STT | 轉寫並提取說話特徵 | 音頻轉文本及語音畫像 | 即時對話和通話理解 |
| Realtime API | 把STT、LLM和TTS放入持續會話 | 雙向流式音頻、文本和事件 | 全雙工語音智能體 |
| Realtime Router | 透過統一介面訪問並路由220多種模型 | 消息轉模型文本或語音回應 | 模型切換、分流和故障轉移 |
| Realtime Inference | 託管並優化開放權重模型 | 文本請求轉低延遲推理結果 | 高頻消費應用 |
| Compute | 為高用量客戶提供託管GPU能力 | 專屬推理和容量 | 大規模穩定生產負載 |
Realtime TTS
Realtime TTS提供TTS-2和TTS-2 Flash兩條模型路線。前者強調自然語言控制與表達力,後者則強調更低的延遲及字元成本。
| 模型 | 定位 | 公開延遲指標 | 語言 | 適合任務 |
|---|---|---|---|---|
| Realtime TTS-2 | 高表達力與可控制語音 | P90首字節省100毫秒 | 200多種 | 角色、客服和情感化對話 |
| Realtime TTS-2 Flash | 低延遲和低成本 | P90首字節省20毫秒 | 200多種 | 高併發實時助手和大規模生成 |
延遲指標為服務端測量,不包含用戶網路、應用緩衝及播放設備的時間。實際的端到端回應還取決於文字生成、連線品質以及用戶端實作。
語音控制與輸出
- 可透過自然語言控制情緒、咬字、語調、音量、音高、速度和說話風格。
- 可在文本中加入表達指令、停頓和非語言聲音。
- 支援流式生成,適合邊合成邊播放。
- 可返回單詞、音素和口型時間戳,用於字幕及角色口型同步。
- 支援語速、溫度、自訂發音及不同音訊編碼設定。
- Playground便於先試聽,再把相同聲音標識用於程式介面。
聲音克隆與聲音設計
Instant Voice Cloning可利用約5至15秒的參考音頻來創建聲音,並讓同一個聲音以200多種語言呈現。而Voice Design則能根據年齡、口音、音色和能量等文字描述,直接生成新的聲音。
- 確認錄音者已經明確同意克隆、儲存和預定用途。
- 錄製無背景音樂、無迴聲且只有一個人的清晰樣本。
- 創建聲音後保存返回的聲音識別碼。
- 用短文本測試原語言、跨語言和不同表達指令。
- 檢查相似度、誤導風險、敏感詞和商業授權。
- 對公開部署增加身分披露、訪問控制與濫用監控。
Professional Voice Cloning在Developer中可作為附加項,Growth版本含1個,Enterprise版本則依合約配置。聲音克隆涉及可能被視為生物識別資訊的數據,不得在未經授權的情況下複製他人的聲音。
Realtime STT
即時 STT 負責將語音轉換為文字,並能透過聲音分析來辨別年齡層、音調、情緒、說話風格和口音等特徵。該產品可與 Inworld 自有的轉寫服務以及其他語音識別供應商相連接。
| 能力 | 作用 | 使用注意 |
|---|---|---|
| 實時轉寫 | 為語音智能體持續提供文字輸入 | 處理網路抖動、斷句和重連 |
| Voice profiling | 幫助模型理解表達方式和語境 | 特徵是模型推斷,不能作為身份或醫學結論 |
| 多供應商 | 按能力選擇Inworld或其他STT服務 | 比較語言、延遲、費用和保留政策 |
| 流式連接 | 邊接收音頻邊返回結果 | 控制併發和會話生命週期 |
| 音頻時長計費 | 按處理小時扣除費用 | 靜音、重試和重複上傳也可能影響成本 |
Realtime API
Realtime API透過持續的WebSocket會話,將語音辨識、大型模型與語音合成整合在一起,讓使用者能夠自然地中斷、繼續或交錯說話。它相容OpenAI Realtime協議,便於將現有的用戶端進行轉換。
- 內建語音活動檢測,用於判斷使用者何時開始和停止說話。
- Smart Turn可幫助區分短暫的停頓與真正的結束發言。
- 可使用Router中的模型,也能按設計接入自己的模型選擇。
- 支援音頻、文本及部分圖像內容,構成多模態會話。
- 底層TTS、STT和LLM分別按實際使用量計費。
- 持續連接需要處理心跳、重連、取消和會話狀態恢復。
構建語音智能體
- 建立帳戶、工作區,以及僅供伺服器端使用的 API 權限。
- 先在Playground確定TTS聲音、STT設定和目標模型。
- 設計系統指令、工具、使用者中斷及對話結束規則。
- 建立Realtime會話並正確處理音頻格式、事件和流式播放。
- 對網路中斷、模型超時和工具失敗設定降級路徑。
- 記錄延遲、轉寫錯誤、中斷成功率、任務完成率及單分鐘成本。
- 小範圍上線後再提高併發數,並驗證帳單與實際用量一致。
Realtime Router
Realtime Router透過一個兼容OpenAI與Anthropic呼叫方式的介面,來存取220多種模型。第三方模型則依照供應商公開的費用標準進行轉售,且不加價;若使用自帶的密鑰,則會收取額外的服務費用。
| 路由能力 | 工作方式 | 應用價值 |
|---|---|---|
| 條件路由 | 按語言、地區、套餐、意圖或情緒選擇模型 | 為不同用戶匹配成本與能力 |
| 流量拆分 | 按比例把請求分配到多個模型 | 開展線上A/B測試 |
| 黏性分配 | 同一用戶持續使用相同實驗變體 | 保持體驗一致 |
| 自動故障轉移 | 失敗或限速時嘗試候選模型 | 提高服務連續性 |
| Auto選擇 | 按價格、延遲、吞吐或基準篩選 | 動態優化模型組合 |
| 可觀測性 | 記錄所選模型、嘗試鏈、首Token時間和費用 | 分析品質與成本 |
| 分析導出 | 把請求級數據發送到外部分析系統 | 建設自有運營看板 |
| 集成語音 | 在聊天請求中加入音頻配置 | 一次調用返回文字和語音 |
模型與計費方式
價格資訊於2026年8月23日核驗,實際金額、稅費、匯率及優惠可能變動,最終以結算頁面顯示為準。
Router涵蓋OpenAI、Anthropic、Google、Meta、Mistral、DeepSeek、xAI等供應商,亦包含經Inworld優化的開放權重模型。模型名單及單價變化較快,應透過當前的模型目錄動態讀取。
| 調用方式 | 收費規則 | 注意事項 |
|---|---|---|
| Inworld轉售的第三方模型 | 按供應商成本,不收Router加價 | 仍受各模型輸入、輸出和緩存價格影響 |
| 自帶供應商密鑰 | 供應商成本外加4% | 帳單會分佈在供應商與Inworld兩處 |
| Inworld自有推理 | 按其模型費率 | 可針對消費規模和實時延遲優化 |
| Realtime API中的LLM | 與TTS和STT分別計量 | 總成本是三層用量之和 |
Playground與API開發
平台提供TTS和Realtime等Playground,便於在寫代碼前測試聲音、模型和參數。正式應用透過服務端API或WebSocket接入,瀏覽器即時會話應使用短期令牌,避免洩露主密鑰。
- REST適合一次性TTS、STT和資源管理請求。
- 流式TTS按多行JSON持續返回音頻內容,需要逐行解碼。
- WebSocket適合全雙工實時語音和持續狀態。
- 路由器相容常用SDK,遷移時仍需核對不完全一致的擴展字段。
- 憑據依賴帳戶共享與併發限制,應按環境分離並定期輪換。
- 生產系統必須實現超時、指數退避、配額保護和日誌脫敏。
訂閱方案
| 方案 | 月費 | 每週期積分 | 主要權益 | 適合用戶 |
|---|---|---|---|---|
| On-Demand | 免費起步 | 含免費試用量 | 最多70分鐘TTS或400分鐘STT、100個自訂聲音、API與Router、商業許可 | 評估和原型 |
| Creator | 25美元/月 | 25美元積分 | 500個聲音、每次Playground最多4萬字元、工作區與團隊管理 | 內容創作與小項目 |
| Builder | 100美元/月 | 100美元積分 | 3000個聲音、更高併發、工作區共享和更低費率 | 成長項目和小團隊 |
| Developer | 300美元/月 | 300美元積分 | 10000個聲音、150路TTS併發、專業克隆附加項和優先郵件支援 | 生產應用 |
| Growth | 1500美元/月 | 1500美元積分 | 30000個聲音、500路TTS併發、1個專業克隆及合規附加項 | 大規模與合規部署 |
| Enterprise | 訂製報價 | 按合約 | 訂製限制、SLA、DPA、本地部署、資料駐留及專屬支援 | 超大規模與訂製環境 |
付費方案可月付或年付,年付則一次性收取。套餐價格本身會轉換為相同數額的美元使用積分,超過部分則需按照該檔次的費率繼續購買或自動充值。
TTS與STT單價
| 方案 | TTS-2每百萬字元 | TTS-2 Flash每百萬字元 | STT 1每小時 |
|---|---|---|---|
| On-Demand | 25美元 | 15美元 | 0.15美元 |
| Creator | 20美元 | 10美元 | 0.10美元 |
| Builder | 17.50美元 | 9美元 | 0.10美元 |
| Developer | 15美元 | 8美元 | 0.10美元 |
| Growth | 12.50美元 | 7美元 | 0.10美元 |
| Enterprise | 低至5美元 | 低於5美元 | 訂製 |
同一方案的超額用量將按照該檔單價來計費。Realtime API並沒有固定的每分鐘費用,而是會根據實際的TTS字數、STT音頻的長度以及LLM Token的數量來分別計費。
併發與容量
| 方案 | TTS併發生成 | STT流式併發 | 即時並發會話 | 估算語音用戶會話 |
|---|---|---|---|---|
| On-Demand | 5 | 10 | 10 | 約20 |
| Creator | 10 | 20 | 20 | 約40 |
| Builder | 50 | 100 | 100 | 約200 |
| Developer | 150 | 300 | 300 | 約600 |
| Growth | 500 | 1000 | 1000 | 約2000 |
| Enterprise | 訂製 | 訂製 | 訂製 | 訂製 |
併發限制是依賴帳戶及API金鑰來分配的,超出保證數量的請求,將在容量允許的情況下盡力處理。容量規劃應以尖峰值和壓力測試為依據,不能直接以估算的會話數量作為服務保證的依據。
積分有效期與帳戶變更
- 付費套餐未使用積分在訂閱持續且方案價值不降低時最多結轉3個月。
- 每個月發放的積分擁有獨立的3個月有效窗口。
- 額外購買積分最低10美元,購買後有效期為1年。
- 可設定自動儲值,在餘額低於閾值時補充積分。
- 升級立即生效,並收取新方案全額及尚未結算用量。
- 降級或取消在當前週期結束時生效,剩餘積分會被清除。
- 連續付款失敗並完成7天重試後,帳戶會降為On-Demand且API停用。
聲音與隱私責任
隱私政策將聊天內容、錄音,以及從聲音中提取的語音特徵列為可能被處理的資料,而其中某些特徵在某些地區可能屬於生物識別資訊。進行聲音克隆與分析時,必須取得相關人的同意,並且要提供資料刪除及退出的相關安排。
| 數據 | 主要用途 | 風險控制 |
|---|---|---|
| 參照錄音 | 創建即時或專業聲音克隆 | 保存同意、限制用途並保護原始音頻 |
| 語音特徵 | 保持聲音身份或輔助語境理解 | 不用於身分認證或敏感推斷 |
| 轉寫文本 | 提供給模型和業務工具 | 脫敏並限制日誌保留 |
| 對話音頻 | 即時處理、品質與服務運營 | 明確錄音告知和地區性同意 |
| 帳戶與交易 | 認證、計費與支援 | 最小權限及審計訪問 |
| 分析數據 | 改進產品和評估使用情況 | 區分客戶數據與去識別研究數據 |
隱私政策說明:Inworld可能會使用部分資訊用於研究開發及模型訓練,同時也提供企業零資料保留的選項。對於那些屬於敏感或受監管的資料,則應在合約中明確規定訓練的終止時間、資料保留期限以及適用的產品範圍。
安全與合規
| 項目 | 公開狀態 | 適用提醒 |
|---|---|---|
| SOC 2 | Type II | 索取當前報告並核對覆蓋服務 |
| GDPR | 聲明符合 | 客戶仍需確定合法依據和履行數據權利 |
| HIPAA與BAA | Growth可購買附加項 | 簽署BAA並限定受保護健康資訊的處理範圍 |
| Zero Data Retention | Growth可購買附加項,企業可協商 | 確認TTS、STT、Router和第三方模型是否全部覆蓋 |
| 加密 | 靜態AES、傳輸TLS | 核對金鑰、備份和日誌環境 |
| 單點登入 | 企業支援SAML與OIDC | 結合角色權限和自動配置 |
| 本地部署 | Enterprise提供 | 明確模型、更新、硬件和運維責任 |
| 數據駐留 | Enterprise提供歐盟與印度選項 | 核對所有子處理商和備份位置 |
GitHub、SDK與開源狀態
Inworld擁有活躍的官方GitHub組織,該組織公開了TTS代碼、API範例、運行時模板、MCP工具、語音遷移工具以及多種範例應用程式。TTS、API範例及各種模板均採用MIT許可證。
公開的範例與模板並不代表託管平台、模型或所有SDK都是開源的。部分Runtime二進位檔以及舊版本的Unity、Unreal SDK適用專門的許可證,使用前必須逐一檢查每個儲存庫及每個組件的許可證內容。
| 開發資源 | 公開情況 | 許可證注意 |
|---|---|---|
| TTS倉庫 | 公開 | 標註MIT |
| API Examples | 公開 | 標註MIT |
| Node Runtime模板 | 公開 | 模板MIT,附帶二進制有單獨條款 |
| MCP工具 | 公開 | 按倉庫當前許可證使用 |
| Unity與Unreal資源 | 部分SDK和範例可下載 | 受SDK或專案許可證約束 |
| 託管模型和雲平台 | 不開源 | 透過商業條款與API使用 |
適合哪些用戶
- 構建語音陪伴、社交、語言學習和互動內容的消費應用團隊。
- 需要低延遲多語言TTS與聲音克隆的開發者。
- 希望將STT、LLM和TTS整合到單一實時會話的語音智能體團隊。
- 需要在220多種模型間路由、實驗和故障轉移的平台工程團隊。
- 需要大規模併發、專屬容量或本地部署的企業。
- 使用Unity、Unreal、Node.js及常見語音框架建構互動體驗的開發者。
產品優勢
- TTS、STT、Realtime API和模型Router共享賬戶、積分與開發文件。
- TTS-2兼顧表達控制,Flash側重低延遲和大量產品成本。
- 聲音克隆樣本短,並支援跨200多種語言保持聲音身份。
- 路由器相容常見的呼叫方式,並支援條件路由、實驗與自動故障轉移。
- 訂閱價轉為可用積分,高檔方案同時降低單價並提高併發。
- 提供SOC 2 Type II、企業ZDR、本地部署及資料駐留選項。
- 官方GitHub範例和模板涵蓋多種語言及即時語音框架。
使用限制與成本風險
- 實時語音總成本由TTS、STT和LLM三部分疊加,不能只看單一字符價。
- 付費積分最多可結轉3個月,取消或降級時未用餘額會被清除。
- 高併發、專業聲音克隆、ZDR、HIPAA及本地部署需要更高方案或附加項。
- 服務端延遲指標不包含網路、模型生成和用戶端播放時間。
- 聲音畫像屬於概率推斷,不能替代身分認證、情緒診斷或人工判斷。
- 第三方模型和自帶密鑰可能引入額外合約、保留和費用。
- 核心雲服務和模型不開源,公開倉庫主要是代碼、模板與範例。
上線檢查清單
- 確定只需TTS或STT,還是需要完整Realtime會話和Router。
- 用代表性語言、設備和網路測試聲音品質、轉寫和打斷。
- 根據峰值估算字元、音訊小時、LLM Token和併發會話。
- 比較套餐積分、單價、結轉期和超額費,建立預算告警。
- 為聲音克隆取得明確授權,並評估生物識別和錄音法規。
- 將主密鑰保存在服務端,瀏覽器只使用短期憑證。
- 驗證第三方模型保留、ZDR、HIPAA、數據駐留和刪除要求。
- 部署超時、重連、模型回退和人工接管,再逐步放量。
常見問題
Inworld AI現在主要做什麼?
當前的重點是實時語音與推理基礎設施,包括TTS、STT、全雙工語音API、模型Router及託管Compute,而非僅僅是早期的AI角色工具。
Inworld AI免費嗎?
On-Demand可免費開始,包含最多約70分鐘的TTS或400分鐘的STT。超出免費量後將按實際使用量計費,部分高級模型還需綁定支付方式。
支援中文嗎?
TTS-2系列涵蓋200多種語言,包括中文。在正式使用前,仍應分別測試普通話、口音、數字、專有名詞以及自定義發音。
聲音克隆需要多少錄音?
即時克隆通常使用約5至15秒的清晰音頻。專業克隆則屬於更高級的服務或附加項目,且需要符合相關的音聲授權要求。
Realtime API如何收費?
沒有獨立固定的每分鐘價格。會話中的TTS字元、STT音頻時長和LLM Token會依照當前套餐的各自費率扣費。
模型Router會加價嗎?
透過Inworld路由第三方模型,按供應商的費用標準計費,不收取額外的路由器加價費用;若使用自帶金鑰,文件中會列明4%的服務費用。
積分會結轉嗎?
付費方案的月度積分,在保持同等或更高有效訂閱時最多可結轉3個月,額外購買的積分則有效1年。取消或降級時,剩餘積分將被清除。
Inworld AI是開源的嗎?
核心平台與模型並非完全開源。官方公開了採用MIT許可的TTS代碼、API範例以及多項模板,但部分SDK的二進位檔則需遵循不同的許可條款。
總結
Inworld AI適合那些需要將自然語音、低延遲對話以及多模型推理功能應用到大型消費級應用程式中的團隊。它不但可以單獨提供TTS或STT功能,還能透過Realtime API和Router來構建完整的语音智慧體架構。
選擇方案時應同時計算字元數、音頻時長、模型Token、併發量以及積分有效期。若涉及聲音克隆、醫療或敏感資料,還必須在技術測試之外落實授權、ZDR、合約及人工治理。
桂公網安備45132202000164號