一句话介绍
Inworld AI是一套面向实时语音应用的开发平台,把文字转语音、语音转文字、全双工对话、模型路由和托管推理整合到统一账户与计费体系中。
工具简介
Inworld AI由Theai, Inc.运营,早期以游戏角色和AI NPC能力受到关注,目前产品重点已转向消费级应用所需的实时语音与低延迟推理基础设施。它更接近开发者API平台,而不是面向普通用户的配音编辑器。
主要应用包括语音陪伴、语言学习、游戏与互动媒体、客户服务、销售外呼和电话智能体。开发者可只使用某个语音模型,也可以通过Realtime API组合完整对话链路。
当前产品组成
| 产品 | 主要能力 | 输入与输出 | 适合场景 |
|---|---|---|---|
| Realtime TTS | 低延迟文字转语音、克隆和声音设计 | 文本转流式或完整音频 | 语音助手、配音和互动角色 |
| Realtime STT | 转写并提取说话特征 | 音频转文本及语音画像 | 实时对话和通话理解 |
| Realtime API | 把STT、LLM和TTS放入持续会话 | 双向流式音频、文本和事件 | 全双工语音智能体 |
| Realtime Router | 通过统一接口访问并路由220多种模型 | 消息转模型文本或语音响应 | 模型切换、分流和故障转移 |
| Realtime Inference | 托管并优化开放权重模型 | 文本请求转低延迟推理结果 | 高频消费应用 |
| Compute | 为高用量客户提供托管GPU能力 | 专属推理和容量 | 大规模稳定生产负载 |
Realtime TTS
Realtime TTS提供TTS-2和TTS-2 Flash两条模型路线。前者强调自然语言控制和表达力,后者强调更低延迟和字符成本。
| 模型 | 定位 | 公开延迟指标 | 语言 | 适合任务 |
|---|---|---|---|---|
| Realtime TTS-2 | 高表达力与可控语音 | P90首字节约100毫秒 | 200多种 | 角色、客服和情感化对话 |
| Realtime TTS-2 Flash | 低延迟和低成本 | P90首字节约20毫秒 | 200多种 | 高并发实时助手和大规模生成 |
延迟指标为服务端测量,不包含用户网络、应用缓冲和播放设备时间。实际端到端响应还取决于文本生成、连接质量和客户端实现。
语音控制与输出
- 可通过自然语言控制情绪、咬字、语调、音量、音高、速度和说话风格。
- 可在文本中加入表达指令、停顿和非语言声音。
- 支持流式生成,适合边合成边播放。
- 可返回单词、音素和口型时间戳,用于字幕及角色口型同步。
- 支持语速、温度、自定义发音和不同音频编码配置。
- Playground便于先试听,再把相同声音标识用于程序接口。
声音克隆与声音设计
Instant Voice Cloning可使用约5至15秒参照音频创建声音,并让同一声音身份跨200多种语言输出。Voice Design则根据年龄、口音、音色和能量等文字描述直接生成新声音。
- 确认录音者已经明确同意克隆、存储和预定用途。
- 录制无背景音乐、无回声且只有一个人的清晰样本。
- 创建声音后保存返回的声音标识。
- 用短文本测试原语言、跨语言和不同表达指令。
- 检查相似度、误导风险、敏感词和商业授权。
- 对公开部署增加身份披露、访问控制和滥用监控。
Professional Voice Cloning在Developer可作为附加项,Growth包含1个,Enterprise按合同配置。声音克隆涉及可能被视为生物识别信息的数据,不应在没有授权时复制他人声音。
Realtime STT
Realtime STT负责把语音转换为文本,并可通过voice profiling识别年龄段、音高、情绪、说话风格和口音等特征。产品可连接Inworld自有转写以及其他语音识别提供商。
| 能力 | 作用 | 使用注意 |
|---|---|---|
| 实时转写 | 为语音智能体持续提供文字输入 | 处理网络抖动、断句和重连 |
| Voice profiling | 帮助模型理解表达方式和语境 | 特征是模型推断,不能作为身份或医学结论 |
| 多提供商 | 按能力选择Inworld或其他STT服务 | 比较语言、延迟、费用和保留政策 |
| 流式连接 | 边接收音频边返回结果 | 控制并发和会话生命周期 |
| 音频时长计费 | 按处理小时扣除费用 | 静音、重试和重复上传也可能影响成本 |
Realtime API
Realtime API用一个持续的WebSocket会话组合语音识别、大模型和语音合成,使用户可以自然打断、继续和交替说话。它兼容OpenAI Realtime协议,便于迁移既有客户端。
- 内置语音活动检测,用于判断用户何时开始和停止说话。
- Smart Turn帮助区分短暂停顿与真正结束发言。
- 可使用Router中的模型,也能按设计接入自己的模型选择。
- 支持音频、文本和部分图像内容构成多模态会话。
- 底层TTS、STT和LLM分别按实际使用量计费。
- 持续连接需要处理心跳、重连、取消和会话状态恢复。
构建语音智能体
- 创建账户、工作区和仅供服务端使用的API凭据。
- 先在Playground确定TTS声音、STT设置和目标模型。
- 设计系统指令、工具、用户打断和对话结束规则。
- 建立Realtime会话并正确处理音频格式、事件和流式播放。
- 对网络中断、模型超时和工具失败设置降级路径。
- 记录延迟、转写错误、打断成功率、任务完成率和单分钟成本。
- 小范围上线后再提高并发,并验证账单与实际用量一致。
Realtime Router
Realtime Router通过一个兼容OpenAI与Anthropic调用方式的接口访问220多种模型。第三方模型按提供商公开成本转售且不加价,使用自带密钥时则收取额外服务比例。
| 路由能力 | 工作方式 | 应用价值 |
|---|---|---|
| 条件路由 | 按语言、地区、套餐、意图或情绪选择模型 | 为不同用户匹配成本与能力 |
| 流量拆分 | 按比例把请求分配到多个模型 | 开展线上A/B测试 |
| 粘性分配 | 同一用户持续使用相同实验变体 | 保持体验一致 |
| 自动故障转移 | 失败或限速时尝试候选模型 | 提高服务连续性 |
| Auto选择 | 按价格、延迟、吞吐或基准筛选 | 动态优化模型组合 |
| 可观测性 | 记录所选模型、尝试链、首Token时间和费用 | 分析质量与成本 |
| 分析导出 | 把请求级数据发送到外部分析系统 | 建设自有运营看板 |
| 集成语音 | 在聊天请求中加入音频配置 | 一次调用返回文字和语音 |
模型与计费方式
价格信息于2026年8月23日核验,实际金额、税费、汇率和优惠可能变化,最终以结算页面显示为准。
Router覆盖OpenAI、Anthropic、Google、Meta、Mistral、DeepSeek、xAI等提供商,也包含Inworld优化的开放权重模型。模型名单和单价变化较快,应通过当前模型目录动态读取。
| 调用方式 | 收费规则 | 注意事项 |
|---|---|---|
| Inworld转售的第三方模型 | 按提供商成本,不收Router加价 | 仍受各模型输入、输出和缓存价格影响 |
| 自带提供商密钥 | 提供商成本外加4% | 账单会分布在提供商与Inworld两处 |
| Inworld自有推理 | 按其模型费率 | 可针对消费规模和实时延迟优化 |
| Realtime API中的LLM | 与TTS和STT分别计量 | 总成本是三层用量之和 |
Playground与API开发
平台提供TTS和Realtime等Playground,便于在写代码前测试声音、模型和参数。正式应用通过服务端API或WebSocket接入,浏览器实时会话应使用短期令牌,避免泄露主密钥。
- REST合适一次性TTS、STT和资源管理请求。
- 流式TTS按多行JSON持续返回音频内容,需要逐行解码。
- WebSocket适合全双工实时语音和持续状态。
- Router兼容常用SDK,迁移时仍要核对不完全一致的扩展字段。
- 凭据按账户共享并发限制,应按环境分离和定期轮换。
- 生产系统必须实现超时、指数退避、配额保护和日志脱敏。
订阅方案
| 方案 | 月费 | 每周期积分 | 主要权益 | 适合用户 |
|---|---|---|---|---|
| On-Demand | 免费起步 | 含免费试用量 | 最多70分钟TTS或400分钟STT、100个自定义声音、API与Router、商业许可 | 评估和原型 |
| Creator | 25美元/月 | 25美元积分 | 500个声音、每次Playground最多4万字符、工作区和团队管理 | 内容创作与小项目 |
| Builder | 100美元/月 | 100美元积分 | 3000个声音、更高并发、工作区共享和更低费率 | 成长项目和小团队 |
| Developer | 300美元/月 | 300美元积分 | 10000个声音、150路TTS并发、专业克隆附加项和优先邮件支持 | 生产应用 |
| Growth | 1500美元/月 | 1500美元积分 | 30000个声音、500路TTS并发、1个专业克隆及合规附加项 | 大规模与合规部署 |
| Enterprise | 定制报价 | 按合同 | 定制限制、SLA、DPA、本地部署、数据驻留和专属支持 | 超大规模与定制环境 |
付费方案可月付或年付,年付一次性收取。套餐价格本身会转化为相同美元金额的使用积分,超出后按本档费率继续购买或自动充值。
TTS与STT单价
| 方案 | TTS-2每百万字符 | TTS-2 Flash每百万字符 | STT 1每小时 |
|---|---|---|---|
| On-Demand | 25美元 | 15美元 | 0.15美元 |
| Creator | 20美元 | 10美元 | 0.10美元 |
| Builder | 17.50美元 | 9美元 | 0.10美元 |
| Developer | 15美元 | 8美元 | 0.10美元 |
| Growth | 12.50美元 | 7美元 | 0.10美元 |
| Enterprise | 低至5美元 | 低于5美元 | 定制 |
同一方案的超额用量按该档单价收费。Realtime API没有单独固定每分钟价,而是把实际TTS字符、STT音频时长和LLM Token分别计费。
并发与容量
| 方案 | TTS并发生成 | STT流式并发 | Realtime并发会话 | 估算语音用户会话 |
|---|---|---|---|---|
| On-Demand | 5 | 10 | 10 | 约20 |
| Creator | 10 | 20 | 20 | 约40 |
| Builder | 50 | 100 | 100 | 约200 |
| Developer | 150 | 300 | 300 | 约600 |
| Growth | 500 | 1000 | 1000 | 约2000 |
| Enterprise | 定制 | 定制 | 定制 | 定制 |
并发限制按账户和API密钥共享,超过保证值的请求只会在容量允许时尽力处理。容量规划应以峰值和压力测试为准,不能直接把估算会话数当作服务保证。
积分有效期与账户变更
- 付费套餐未使用积分在订阅持续且方案价值不降低时最多结转3个月。
- 每个月发放的积分拥有独立的3个月有效窗口。
- 额外购买积分最低10美元,购买后有效期为1年。
- 可设置自动充值,在余额低于阈值时补充积分。
- 升级立即生效,并收取新方案全额及尚未结算用量。
- 降级或取消在当前周期结束时生效,剩余积分会被清除。
- 连续付款失败并完成7天重试后,账户会降为On-Demand且API停用。
声音与隐私责任
隐私政策把聊天、录音以及从声音中推导的语音特征纳入可能处理的数据,其中部分特征在某些地区可能属于生物识别信息。声音克隆和分析必须取得适用同意,并提供删除和退出安排。
| 数据 | 主要用途 | 风险控制 |
|---|---|---|
| 参照录音 | 创建即时或专业声音克隆 | 保存同意、限制用途并保护原始音频 |
| 语音特征 | 保持声音身份或辅助语境理解 | 不用于身份认证或敏感推断 |
| 转写文本 | 提供给模型和业务工具 | 脱敏并限制日志保留 |
| 对话音频 | 实时处理、质量和服务运营 | 明确录音告知和地区性同意 |
| 账户与交易 | 认证、计费和支持 | 最小权限及审计访问 |
| 分析数据 | 改进产品和评估使用情况 | 区分客户数据与去标识研究数据 |
隐私政策说明Inworld可能使用部分信息进行研究开发及模型训练,也提供企业零数据保留选项。对敏感或受监管工作负载,应在合同中确认训练退出、保留期限和适用产品范围。
安全与合规
| 项目 | 公开状态 | 适用提醒 |
|---|---|---|
| SOC 2 | Type II | 索取当前报告并核对覆盖服务 |
| GDPR | 声明符合 | 客户仍需确定合法依据和履行数据权利 |
| HIPAA与BAA | Growth可购买附加项 | 签署BAA并限定受保护健康信息的处理范围 |
| Zero Data Retention | Growth可购买附加项,企业可协商 | 确认TTS、STT、Router和第三方模型是否全部覆盖 |
| 加密 | 静态AES、传输TLS | 核对密钥、备份和日志环境 |
| 单点登录 | 企业支持SAML与OIDC | 结合角色权限和自动配置 |
| 本地部署 | Enterprise提供 | 明确模型、更新、硬件和运维责任 |
| 数据驻留 | Enterprise提供欧盟与印度选项 | 核对所有子处理商和备份位置 |
GitHub、SDK与开源状态
Inworld拥有活跃的官方GitHub组织,公开TTS代码、API示例、Runtime模板、MCP工具、语音迁移工具及多种示例应用。TTS、API示例和多项模板使用MIT许可证。
公开示例与模板不代表托管平台、模型或全部SDK开源。部分Runtime二进制和旧版Unity、Unreal SDK适用专门许可,使用前必须逐仓库和逐组件检查许可证。
| 开发资源 | 公开情况 | 许可证注意 |
|---|---|---|
| TTS仓库 | 公开 | 标注MIT |
| API Examples | 公开 | 标注MIT |
| Node Runtime模板 | 公开 | 模板MIT,附带二进制有单独条款 |
| MCP工具 | 公开 | 按仓库当前许可证使用 |
| Unity与Unreal资源 | 部分SDK和示例可下载 | 受SDK或项目许可证约束 |
| 托管模型和云平台 | 不开源 | 通过商业条款与API使用 |
适合哪些用户
- 构建语音陪伴、社交、语言学习和互动内容的消费应用团队。
- 需要低延迟多语言TTS与声音克隆的开发者。
- 希望将STT、LLM和TTS整合到单一实时会话的语音智能体团队。
- 需要在220多种模型间路由、实验和故障转移的平台工程团队。
- 要求大规模并发、专属容量或本地部署的企业。
- 使用Unity、Unreal、Node.js及常见语音框架构建互动体验的开发者。
产品优势
- TTS、STT、Realtime API和模型Router共享账户、积分与开发文档。
- TTS-2兼顾表达控制,Flash侧重低延迟和大规模成本。
- 声音克隆样本短,并支持跨200多种语言保持声音身份。
- Router兼容常见调用方式并支持条件路由、实验和自动故障转移。
- 订阅价转为可用积分,高档方案同时降低单价并提高并发。
- 提供SOC 2 Type II、企业ZDR、本地部署和数据驻留选项。
- 官方GitHub示例和模板覆盖多种语言及实时语音框架。
使用限制与成本风险
- 实时语音总成本由TTS、STT和LLM三部分叠加,不能只看单一字符价。
- 付费积分最多结转3个月,取消或降级时未用余额会被清除。
- 高并发、专业声音克隆、ZDR、HIPAA和本地部署需要更高方案或附加项。
- 服务端延迟指标不包含网络、模型生成和客户端播放时间。
- 声音画像属于概率推断,不能替代身份认证、情绪诊断或人工判断。
- 第三方模型和自带密钥可能引入额外合同、保留和费用。
- 核心云服务和模型不开源,公开仓库主要是代码、模板与示例。
上线检查清单
- 确定只需TTS或STT,还是需要完整Realtime会话和Router。
- 用代表性语言、设备和网络测试声音质量、转写和打断。
- 根据峰值估算字符、音频小时、LLM Token和并发会话。
- 比较套餐积分、单价、结转期和超额费,建立预算告警。
- 为声音克隆取得明确授权,并评估生物识别和录音法规。
- 将主密钥保存在服务端,浏览器只使用短期凭据。
- 验证第三方模型保留、ZDR、HIPAA、数据驻留和删除要求。
- 部署超时、重连、模型回退和人工接管,再逐步放量。
常见问题
Inworld AI现在主要做什么?
当前重点是实时语音和推理基础设施,包括TTS、STT、全双工语音API、模型Router及托管Compute,而不只是早期的AI角色工具。
Inworld AI免费吗?
On-Demand可免费开始,包含最多约70分钟TTS或400分钟STT。超出免费量后按实际使用计费,部分高级模型还需绑定支付方式。
支持中文吗?
TTS-2系列覆盖200多种语言,包括中文。正式使用前仍应分别测试普通话、口音、数字、专有名词和自定义发音。
声音克隆需要多少录音?
即时克隆通常使用约5至15秒清晰音频。专业克隆属于更高方案权益或附加项,并需要满足声音授权要求。
Realtime API如何收费?
没有独立固定每分钟价。会话中的TTS字符、STT音频时长和LLM Token按照当前套餐的各自费率扣费。
模型Router会加价吗?
通过Inworld路由第三方模型按提供商成本计费,不收额外Router加价;使用自带密钥时文档列出4%的服务费用。
积分会结转吗?
付费方案的月度积分在保持同等或更高有效订阅时最多结转3个月,额外购买积分有效1年。取消或降级时剩余积分会被清除。
Inworld AI开源吗?
核心平台和模型不是整体开源。官方公开了MIT许可的TTS代码、API示例和多项模板,但部分SDK二进制使用单独许可。
总结
Inworld AI适合需要把自然语音、低延迟对话和多模型推理部署到大规模消费应用的团队。它既能单独提供TTS或STT,也能用Realtime API和Router组成完整语音智能体链路。
选择方案时应同时计算字符、音频时长、模型Token、并发和积分有效期。涉及声音克隆、医疗或敏感数据时,还必须在技术测试之外落实授权、ZDR、合同和人工治理。
桂公网安备45132202000164号