Inworld
免费增值
AI办公工具 AI效率提升

Inworld

Inworld,专注于AI 效率提升的智能工具

标签:

一句话介绍

Inworld AI是一套面向实时语音应用的开发平台,把文字转语音、语音转文字、全双工对话、模型路由和托管推理整合到统一账户与计费体系中。

工具简介

Inworld AI由Theai, Inc.运营,早期以游戏角色和AI NPC能力受到关注,目前产品重点已转向消费级应用所需的实时语音与低延迟推理基础设施。它更接近开发者API平台,而不是面向普通用户的配音编辑器。

主要应用包括语音陪伴、语言学习、游戏与互动媒体、客户服务、销售外呼和电话智能体。开发者可只使用某个语音模型,也可以通过Realtime API组合完整对话链路。

当前产品组成

产品主要能力输入与输出适合场景
Realtime TTS低延迟文字转语音、克隆和声音设计文本转流式或完整音频语音助手、配音和互动角色
Realtime STT转写并提取说话特征音频转文本及语音画像实时对话和通话理解
Realtime API把STT、LLM和TTS放入持续会话双向流式音频、文本和事件全双工语音智能体
Realtime Router通过统一接口访问并路由220多种模型消息转模型文本或语音响应模型切换、分流和故障转移
Realtime Inference托管并优化开放权重模型文本请求转低延迟推理结果高频消费应用
Compute为高用量客户提供托管GPU能力专属推理和容量大规模稳定生产负载

Realtime TTS

Realtime TTS提供TTS-2和TTS-2 Flash两条模型路线。前者强调自然语言控制和表达力,后者强调更低延迟和字符成本。

模型定位公开延迟指标语言适合任务
Realtime TTS-2高表达力与可控语音P90首字节约100毫秒200多种角色、客服和情感化对话
Realtime TTS-2 Flash低延迟和低成本P90首字节约20毫秒200多种高并发实时助手和大规模生成

延迟指标为服务端测量,不包含用户网络、应用缓冲和播放设备时间。实际端到端响应还取决于文本生成、连接质量和客户端实现。

语音控制与输出

  • 可通过自然语言控制情绪、咬字、语调、音量、音高、速度和说话风格。
  • 可在文本中加入表达指令、停顿和非语言声音。
  • 支持流式生成,适合边合成边播放。
  • 可返回单词、音素和口型时间戳,用于字幕及角色口型同步。
  • 支持语速、温度、自定义发音和不同音频编码配置。
  • Playground便于先试听,再把相同声音标识用于程序接口。

声音克隆与声音设计

Instant Voice Cloning可使用约5至15秒参照音频创建声音,并让同一声音身份跨200多种语言输出。Voice Design则根据年龄、口音、音色和能量等文字描述直接生成新声音。

  1. 确认录音者已经明确同意克隆、存储和预定用途。
  2. 录制无背景音乐、无回声且只有一个人的清晰样本。
  3. 创建声音后保存返回的声音标识。
  4. 用短文本测试原语言、跨语言和不同表达指令。
  5. 检查相似度、误导风险、敏感词和商业授权。
  6. 对公开部署增加身份披露、访问控制和滥用监控。

Professional Voice Cloning在Developer可作为附加项,Growth包含1个,Enterprise按合同配置。声音克隆涉及可能被视为生物识别信息的数据,不应在没有授权时复制他人声音。

Realtime STT

Realtime STT负责把语音转换为文本,并可通过voice profiling识别年龄段、音高、情绪、说话风格和口音等特征。产品可连接Inworld自有转写以及其他语音识别提供商。

能力作用使用注意
实时转写为语音智能体持续提供文字输入处理网络抖动、断句和重连
Voice profiling帮助模型理解表达方式和语境特征是模型推断,不能作为身份或医学结论
多提供商按能力选择Inworld或其他STT服务比较语言、延迟、费用和保留政策
流式连接边接收音频边返回结果控制并发和会话生命周期
音频时长计费按处理小时扣除费用静音、重试和重复上传也可能影响成本

Realtime API

Realtime API用一个持续的WebSocket会话组合语音识别、大模型和语音合成,使用户可以自然打断、继续和交替说话。它兼容OpenAI Realtime协议,便于迁移既有客户端。

  • 内置语音活动检测,用于判断用户何时开始和停止说话。
  • Smart Turn帮助区分短暂停顿与真正结束发言。
  • 可使用Router中的模型,也能按设计接入自己的模型选择。
  • 支持音频、文本和部分图像内容构成多模态会话。
  • 底层TTS、STT和LLM分别按实际使用量计费。
  • 持续连接需要处理心跳、重连、取消和会话状态恢复。

构建语音智能体

  1. 创建账户、工作区和仅供服务端使用的API凭据。
  2. 先在Playground确定TTS声音、STT设置和目标模型。
  3. 设计系统指令、工具、用户打断和对话结束规则。
  4. 建立Realtime会话并正确处理音频格式、事件和流式播放。
  5. 对网络中断、模型超时和工具失败设置降级路径。
  6. 记录延迟、转写错误、打断成功率、任务完成率和单分钟成本。
  7. 小范围上线后再提高并发,并验证账单与实际用量一致。

Realtime Router

Realtime Router通过一个兼容OpenAI与Anthropic调用方式的接口访问220多种模型。第三方模型按提供商公开成本转售且不加价,使用自带密钥时则收取额外服务比例。

路由能力工作方式应用价值
条件路由按语言、地区、套餐、意图或情绪选择模型为不同用户匹配成本与能力
流量拆分按比例把请求分配到多个模型开展线上A/B测试
粘性分配同一用户持续使用相同实验变体保持体验一致
自动故障转移失败或限速时尝试候选模型提高服务连续性
Auto选择按价格、延迟、吞吐或基准筛选动态优化模型组合
可观测性记录所选模型、尝试链、首Token时间和费用分析质量与成本
分析导出把请求级数据发送到外部分析系统建设自有运营看板
集成语音在聊天请求中加入音频配置一次调用返回文字和语音

模型与计费方式

价格信息于2026年8月23日核验,实际金额、税费、汇率和优惠可能变化,最终以结算页面显示为准。

Router覆盖OpenAI、Anthropic、Google、Meta、Mistral、DeepSeek、xAI等提供商,也包含Inworld优化的开放权重模型。模型名单和单价变化较快,应通过当前模型目录动态读取。

调用方式收费规则注意事项
Inworld转售的第三方模型按提供商成本,不收Router加价仍受各模型输入、输出和缓存价格影响
自带提供商密钥提供商成本外加4%账单会分布在提供商与Inworld两处
Inworld自有推理按其模型费率可针对消费规模和实时延迟优化
Realtime API中的LLM与TTS和STT分别计量总成本是三层用量之和

Playground与API开发

平台提供TTS和Realtime等Playground,便于在写代码前测试声音、模型和参数。正式应用通过服务端API或WebSocket接入,浏览器实时会话应使用短期令牌,避免泄露主密钥。

  • REST合适一次性TTS、STT和资源管理请求。
  • 流式TTS按多行JSON持续返回音频内容,需要逐行解码。
  • WebSocket适合全双工实时语音和持续状态。
  • Router兼容常用SDK,迁移时仍要核对不完全一致的扩展字段。
  • 凭据按账户共享并发限制,应按环境分离和定期轮换。
  • 生产系统必须实现超时、指数退避、配额保护和日志脱敏。

订阅方案

方案月费每周期积分主要权益适合用户
On-Demand免费起步含免费试用量最多70分钟TTS或400分钟STT、100个自定义声音、API与Router、商业许可评估和原型
Creator25美元/月25美元积分500个声音、每次Playground最多4万字符、工作区和团队管理内容创作与小项目
Builder100美元/月100美元积分3000个声音、更高并发、工作区共享和更低费率成长项目和小团队
Developer300美元/月300美元积分10000个声音、150路TTS并发、专业克隆附加项和优先邮件支持生产应用
Growth1500美元/月1500美元积分30000个声音、500路TTS并发、1个专业克隆及合规附加项大规模与合规部署
Enterprise定制报价按合同定制限制、SLA、DPA、本地部署、数据驻留和专属支持超大规模与定制环境

付费方案可月付或年付,年付一次性收取。套餐价格本身会转化为相同美元金额的使用积分,超出后按本档费率继续购买或自动充值。

TTS与STT单价

方案TTS-2每百万字符TTS-2 Flash每百万字符STT 1每小时
On-Demand25美元15美元0.15美元
Creator20美元10美元0.10美元
Builder17.50美元9美元0.10美元
Developer15美元8美元0.10美元
Growth12.50美元7美元0.10美元
Enterprise低至5美元低于5美元定制

同一方案的超额用量按该档单价收费。Realtime API没有单独固定每分钟价,而是把实际TTS字符、STT音频时长和LLM Token分别计费。

并发与容量

方案TTS并发生成STT流式并发Realtime并发会话估算语音用户会话
On-Demand51010约20
Creator102020约40
Builder50100100约200
Developer150300300约600
Growth50010001000约2000
Enterprise定制定制定制定制

并发限制按账户和API密钥共享,超过保证值的请求只会在容量允许时尽力处理。容量规划应以峰值和压力测试为准,不能直接把估算会话数当作服务保证。

积分有效期与账户变更

  • 付费套餐未使用积分在订阅持续且方案价值不降低时最多结转3个月。
  • 每个月发放的积分拥有独立的3个月有效窗口。
  • 额外购买积分最低10美元,购买后有效期为1年。
  • 可设置自动充值,在余额低于阈值时补充积分。
  • 升级立即生效,并收取新方案全额及尚未结算用量。
  • 降级或取消在当前周期结束时生效,剩余积分会被清除。
  • 连续付款失败并完成7天重试后,账户会降为On-Demand且API停用。

声音与隐私责任

隐私政策把聊天、录音以及从声音中推导的语音特征纳入可能处理的数据,其中部分特征在某些地区可能属于生物识别信息。声音克隆和分析必须取得适用同意,并提供删除和退出安排。

数据主要用途风险控制
参照录音创建即时或专业声音克隆保存同意、限制用途并保护原始音频
语音特征保持声音身份或辅助语境理解不用于身份认证或敏感推断
转写文本提供给模型和业务工具脱敏并限制日志保留
对话音频实时处理、质量和服务运营明确录音告知和地区性同意
账户与交易认证、计费和支持最小权限及审计访问
分析数据改进产品和评估使用情况区分客户数据与去标识研究数据

隐私政策说明Inworld可能使用部分信息进行研究开发及模型训练,也提供企业零数据保留选项。对敏感或受监管工作负载,应在合同中确认训练退出、保留期限和适用产品范围。

安全与合规

项目公开状态适用提醒
SOC 2Type II索取当前报告并核对覆盖服务
GDPR声明符合客户仍需确定合法依据和履行数据权利
HIPAA与BAAGrowth可购买附加项签署BAA并限定受保护健康信息的处理范围
Zero Data RetentionGrowth可购买附加项,企业可协商确认TTS、STT、Router和第三方模型是否全部覆盖
加密静态AES、传输TLS核对密钥、备份和日志环境
单点登录企业支持SAML与OIDC结合角色权限和自动配置
本地部署Enterprise提供明确模型、更新、硬件和运维责任
数据驻留Enterprise提供欧盟与印度选项核对所有子处理商和备份位置

GitHub、SDK与开源状态

Inworld拥有活跃的官方GitHub组织,公开TTS代码、API示例、Runtime模板、MCP工具、语音迁移工具及多种示例应用。TTS、API示例和多项模板使用MIT许可证。

公开示例与模板不代表托管平台、模型或全部SDK开源。部分Runtime二进制和旧版Unity、Unreal SDK适用专门许可,使用前必须逐仓库和逐组件检查许可证。

开发资源公开情况许可证注意
TTS仓库公开标注MIT
API Examples公开标注MIT
Node Runtime模板公开模板MIT,附带二进制有单独条款
MCP工具公开按仓库当前许可证使用
Unity与Unreal资源部分SDK和示例可下载受SDK或项目许可证约束
托管模型和云平台不开源通过商业条款与API使用

适合哪些用户

  • 构建语音陪伴、社交、语言学习和互动内容的消费应用团队。
  • 需要低延迟多语言TTS与声音克隆的开发者。
  • 希望将STT、LLM和TTS整合到单一实时会话的语音智能体团队。
  • 需要在220多种模型间路由、实验和故障转移的平台工程团队。
  • 要求大规模并发、专属容量或本地部署的企业。
  • 使用Unity、Unreal、Node.js及常见语音框架构建互动体验的开发者。

产品优势

  • TTS、STT、Realtime API和模型Router共享账户、积分与开发文档。
  • TTS-2兼顾表达控制,Flash侧重低延迟和大规模成本。
  • 声音克隆样本短,并支持跨200多种语言保持声音身份。
  • Router兼容常见调用方式并支持条件路由、实验和自动故障转移。
  • 订阅价转为可用积分,高档方案同时降低单价并提高并发。
  • 提供SOC 2 Type II、企业ZDR、本地部署和数据驻留选项。
  • 官方GitHub示例和模板覆盖多种语言及实时语音框架。

使用限制与成本风险

  • 实时语音总成本由TTS、STT和LLM三部分叠加,不能只看单一字符价。
  • 付费积分最多结转3个月,取消或降级时未用余额会被清除。
  • 高并发、专业声音克隆、ZDR、HIPAA和本地部署需要更高方案或附加项。
  • 服务端延迟指标不包含网络、模型生成和客户端播放时间。
  • 声音画像属于概率推断,不能替代身份认证、情绪诊断或人工判断。
  • 第三方模型和自带密钥可能引入额外合同、保留和费用。
  • 核心云服务和模型不开源,公开仓库主要是代码、模板与示例。

上线检查清单

  1. 确定只需TTS或STT,还是需要完整Realtime会话和Router。
  2. 用代表性语言、设备和网络测试声音质量、转写和打断。
  3. 根据峰值估算字符、音频小时、LLM Token和并发会话。
  4. 比较套餐积分、单价、结转期和超额费,建立预算告警。
  5. 为声音克隆取得明确授权,并评估生物识别和录音法规。
  6. 将主密钥保存在服务端,浏览器只使用短期凭据。
  7. 验证第三方模型保留、ZDR、HIPAA、数据驻留和删除要求。
  8. 部署超时、重连、模型回退和人工接管,再逐步放量。

常见问题

Inworld AI现在主要做什么?

当前重点是实时语音和推理基础设施,包括TTS、STT、全双工语音API、模型Router及托管Compute,而不只是早期的AI角色工具。

Inworld AI免费吗?

On-Demand可免费开始,包含最多约70分钟TTS或400分钟STT。超出免费量后按实际使用计费,部分高级模型还需绑定支付方式。

支持中文吗?

TTS-2系列覆盖200多种语言,包括中文。正式使用前仍应分别测试普通话、口音、数字、专有名词和自定义发音。

声音克隆需要多少录音?

即时克隆通常使用约5至15秒清晰音频。专业克隆属于更高方案权益或附加项,并需要满足声音授权要求。

Realtime API如何收费?

没有独立固定每分钟价。会话中的TTS字符、STT音频时长和LLM Token按照当前套餐的各自费率扣费。

模型Router会加价吗?

通过Inworld路由第三方模型按提供商成本计费,不收额外Router加价;使用自带密钥时文档列出4%的服务费用。

积分会结转吗?

付费方案的月度积分在保持同等或更高有效订阅时最多结转3个月,额外购买积分有效1年。取消或降级时剩余积分会被清除。

Inworld AI开源吗?

核心平台和模型不是整体开源。官方公开了MIT许可的TTS代码、API示例和多项模板,但部分SDK二进制使用单独许可。

总结

Inworld AI适合需要把自然语音、低延迟对话和多模型推理部署到大规模消费应用的团队。它既能单独提供TTS或STT,也能用Realtime API和Router组成完整语音智能体链路。

选择方案时应同时计算字符、音频时长、模型Token、并发和积分有效期。涉及声音克隆、医疗或敏感数据时,还必须在技术测试之外落实授权、ZDR、合同和人工治理。

©️版权声明:若无特殊声明,本站所有文章版权均归AI工具分享原创和所有,未经许可,任何个人、媒体、网站、团体不得转载、抄袭或以其他方式复制发表本站内容,或在非我站所属的服务器上建立镜像。否则,我站将依法保留追究相关法律责任的权利。

类似于Inworld的工具