AssemblyAI是什么
AssemblyAI是一家面向开发者和企业的语音AI平台,核心能力是把预录或实时音频转换成结构化文字。开发团队可以通过API和官方SDK把转录、说话人识别、语音理解及语音智能体能力接入自己的产品。
平台不是普通录音转文字网页工具,而是按使用量计费的开发者基础设施。其产品覆盖异步预录转录、实时流式转录、低延迟短音频同步接口、端到端Voice Agent API、Speech Understanding和LLM Gateway。
主要产品与功能
- 预录音频转录:提交音频或视频文件,异步生成完整转录结果。
- 实时流式转录:通过WebSocket发送音频流,并在数百毫秒内接收文本事件。
- 同步短音频转录:用单次请求快速处理语音指令和听写等短片段。
- Voice Agent API:在一个实时连接中组合语音识别、语言模型、语音合成和对话编排。
- 说话人分离:判断不同发言者并为词语或话轮添加标签。
- 关键词与通用提示:通过术语或自然语言说明改善特定上下文的识别。
- 语音理解:完成实体、主题、情感、翻译和其他后处理任务。
- 隐私护栏:提供敏感信息文本或音频处理、内容审核和脏话过滤。
- LLM Gateway:使用统一凭据调用多个语言模型处理摘要和语音工作流。
语音转文字模型
| 使用方式 | 模型 | 特点 | 基础价格 |
|---|---|---|---|
| 预录异步 | Universal-3.5 Pro | 更高准确性和提示能力 | 0.21美元/音频小时 |
| 预录异步 | Universal-2 | 成本较低 | 0.15美元/音频小时 |
| 实时流式 | Universal-3.5 Pro Realtime | 更高准确性和实时提示 | 0.45美元/会话小时 |
| 实时流式 | Universal-Streaming | 英语或多语言经济方案 | 0.15美元/会话小时 |
| 同步短音频 | Universal-3.5 Pro | 单请求返回短音频结果 | 0.45美元/音频小时 |
预录、实时与同步接口如何选择
| 接口 | 适合任务 | 返回方式 | 关键取舍 |
|---|---|---|---|
| 预录异步 | 播客、会议、采访和历史录音 | 提交任务后轮询或接收回调 | 成本较低,但需等待处理 |
| 实时流式 | 字幕、客服、语音机器人和现场会议 | WebSocket持续返回事件 | 低延迟,但连接空闲时间计费 |
| 同步短音频 | 听写、语音搜索和短指令 | 一次请求直接返回结果 | 接口简单,单价高于异步 |
| Voice Agent | 端到端电话和语音助手 | 单个实时会话 | 开发简单,但整体费率更高 |
语音理解能力
- 说话人识别:区分会议、访谈或通话中的不同发言者。
- 实体检测:提取人物、组织、地点和其他结构化实体。
- 情感分析:判断话段中表达的正向、负向或中性倾向。
- 主题检测:按内容分类识别录音讨论的主题。
- 关键词与亮点:发现重复或具有代表性的短语。
- 翻译:在保留原始转录结构的同时生成目标语言文本。
- 自定义格式:按照业务规则调整数字、缩写和专业表达。
- 摘要与章节:可通过当前语言模型工作流生成更灵活的后处理结果。
适合哪些使用场景
- 会议助手:记录多人会议、区分发言者并生成行动项。
- 联络中心:转录客服通话,分析主题、情感和质量问题。
- 媒体平台:为播客、视频、直播和课程生成字幕与索引。
- 语音智能体:识别用户发言并驱动实时对话和工具调用。
- 销售分析:整理通话、异议、竞争信息和下一步跟进。
- 医疗语音:在适用语言和合规配置下处理专业术语。
- 内容审核:对音频中的敏感信息、不当内容和个人数据进行处理。
- 语音搜索:把大量音视频转换成可搜索文本。
适合哪些开发团队
- 需要在产品中嵌入语音识别API的SaaS团队。
- 开发实时字幕、语音机器人或电话自动化的工程师。
- 需要批量处理大量历史音视频的媒体和数据团队。
- 需要说话人、时间戳和结构化结果的分析平台。
- 希望用Python、JavaScript或其他SDK快速集成的开发者。
- 对数据区域、保留时间、权限和审计有企业要求的组织。
快速接入教程
- 注册账户并创建单独用于测试环境的API密钥。
- 在控制台Playground中用真实但脱敏的音频比较模型。
- 选择预录、实时、同步短音频或Voice Agent接口。
- 安装目标编程语言的官方SDK,并固定兼容版本。
- 显式指定语音模型,不要依赖可能变化的默认值。
- 配置超时、重试、回调验证和失败记录。
- 用人工校对文本计算词错误率和关键字段错误率。
- 设置余额、用量和异常费用提醒后再进入生产环境。
实时转录教程
- 确认麦克风或电话音频的采样率、编码和声道。
- 建立WebSocket连接并发送正确的会话参数。
- 持续传输音频块,并处理话轮、时间戳和错误事件。
- 根据业务术语配置关键词或提示。
- 需要时启用说话人分离、医疗模式或Voice Focus。
- 在界面中区分临时状态和不可变最终文本。
- 用户结束通话后发送会话终止消息。
- 确认连接真正关闭,并监控实际会话计费时长。
基础价格
AssemblyAI采用按量付费,没有强制月度订阅、最低消费或长期合同。新账户获得50美元免费额度,无需信用卡,额度可用于语音转文字、Voice Agent、语音理解和护栏,但不包含LLM Gateway。
| 产品 | 公开价格 | 计费依据 |
|---|---|---|
| Universal-3.5 Pro预录 | 0.21美元/小时 | 提交的音频或视频时长,精确到秒 |
| Universal-2预录 | 0.15美元/小时 | 提交的音频或视频时长,精确到秒 |
| Universal-3.5 Pro实时 | 0.45美元/小时 | WebSocket连接开启时长 |
| Universal-Streaming | 0.15美元/小时 | WebSocket连接开启时长 |
| 同步短音频 | 0.45美元/小时 | 处理的短音频时长 |
| Voice Agent API | 4.50美元/小时 | 端到端会话连接时长 |
| LLM Gateway | 按模型Token计费 | 分别计算输入和输出Token |
增值功能价格
| 功能 | 附加价格 | 说明 |
|---|---|---|
| 标准异步说话人分离 | +0.02美元/小时 | 适用于预录转录 |
| 实验异步说话人分离 | +0.065美元/小时 | 适合更多说话人或困难音频 |
| 实时说话人分离 | +0.12美元/小时 | 按完整流式会话时长计费 |
| Medical Mode | +0.15美元/小时 | 适用语言和模型有限 |
| 通用提示 | +0.05美元/小时 | Universal-3.5 Pro异步或实时测试功能 |
| Voice Focus | +0.10美元/小时 | 仅Universal-3.5 Pro实时 |
| 翻译 | +0.06美元/小时 | 预录音频,支持多个目标语言 |
| PII文本遮盖 | +0.08美元/小时 | 从转录文本中处理敏感信息 |
| PII音频遮盖 | +0.05美元/小时 | 对音频执行消音或替换 |
| 内容审核 | +0.15美元/小时 | 与基础模型费用叠加 |
计费规则与常见误区
- 预录转录按提交音频的实际秒数计算,失败的转录不收费。
- 流式转录按连接开启到关闭的总时长收费,静音和空闲也计算。
- 未正确关闭的流式会话可能在3小时后自动关闭并产生完整费用。
- 多个并发流分别累计计费时长。
- 多声道转录按每个声道分别计费,一小时三声道等于三小时用量。
- 增值功能会与基础模型价格叠加。
- Voice Agent连接的静音和恢复宽限窗口也可能计费。
- Voice Agent内部若另行调用LLM Gateway,相关Token费用可能单独累加。
成本控制教程
- 按准确率、延迟和功能要求选择最低可满足需求的模型。
- 在请求中显式指定模型,避免免费与付费账户默认值不同。
- 预处理长静音,并确认是否真的需要多声道分别转录。
- 只启用能产生实际业务价值的增值功能。
- 通话结束立即发送终止事件并关闭WebSocket。
- 按项目和API密钥拆分测试、生产及不同客户用量。
- 设置余额自动充值上限、费用提醒和异常会话监控。
- 定期比较人工校对成本、模型准确率和每条成功任务成本。
Voice Agent API
Voice Agent API把实时语音识别、语言模型、语音合成、轮次判断、打断处理和工具调用整合到一个WebSocket中。公开价格为每小时4.50美元,适合希望减少多服务编排工作的团队。
| 方案 | 优点 | 代价 |
|---|---|---|
| Voice Agent API | 单一接口、端到端编排和统一会话 | 每小时4.50美元,组件替换灵活性较低 |
| 自建STT+LLM+TTS | 可独立选择每个供应商和模型 | 需要自行处理延迟、打断、故障和多份账单 |
| 仅实时STT | 适合已有对话和语音合成架构 | 仍需承担后续模型与基础设施费用 |
数据安全与治理
- 项目隔离:不同项目拥有独立API密钥和历史数据范围。
- 角色权限:账户支持Owner、Admin和Reader三类角色。
- 多因素认证:可为成员启用并由组织强制执行。
- 数据控制:付费账户可自助设置保留时间和模型训练退出。
- 业务伙伴协议:医疗相关团队可评估并签署BAA。
- 区域处理:可选择美国或欧盟相关端点满足数据驻留要求。
- 活动日志:记录账户与管理操作,便于审计。
- PII处理:可通过增值护栏遮盖文本或音频中的敏感信息。
产品优势
- 同时覆盖预录、实时、短音频和端到端语音智能体。
- 定价按小时公开,预录音频精确到秒计费。
- 提供说话人、时间戳、提示和丰富语音理解能力。
- Python和JavaScript等官方SDK降低接入工作量。
- Playground可在编码前比较真实音频和不同模型。
- 项目、成员角色、MFA、数据保留和审计适合团队治理。
- 50美元免费额度便于完成有代表性的原型评估。
使用限制
- 识别准确率会受语言、口音、噪声、重叠说话和专业术语影响。
- 流式会话按连接时长计费,连接管理错误容易产生额外费用。
- 多声道和多个增值功能叠加后成本可能显著高于基础价格。
- 部分功能只支持特定模型、语言或预录模式。
- 旧模型参数和已弃用摘要功能可能导致迁移问题。
- 云API需要把音频发送到外部服务,不适合未经批准的敏感数据。
- LLM Gateway不包含在免费额度中,并按各模型Token单独计费。
- 生产系统仍需处理重试、回调安全、限流和人工校验。
GitHub与SDK
AssemblyAI拥有官方GitHub组织,并维护Python SDK、JavaScript SDK、示例和语音智能体起步项目。SDK开源不代表云端语音模型、训练数据和托管API整体开源。
开发者应以当前官方文档和SDK版本为准,特别注意旧实时端点、模型别名和单复数参数变化。生产环境要锁定依赖版本,并在升级前运行回归测试。
基本信息
| 项目 | 内容 |
|---|---|
| 平台名称 | AssemblyAI |
| 工具类型 | 语音转文字与语音AI开发平台 |
| 核心接口 | 预录、实时、同步短音频和Voice Agent API |
| 主要模型 | Universal-3.5 Pro与Universal-2 |
| 免费额度 | 新账户50美元,不含LLM Gateway |
| 价格模式 | 按音频、会话时长、附加功能或Token计费 |
| 官方SDK | 提供Python、JavaScript等SDK和示例 |
| API | 提供 |
| 是否开源 | SDK和示例开源,托管平台与模型不开源 |
推荐指数
综合推荐指数为4.6分,满分5分。AssemblyAI的接口、语音能力、文档和价格透明度较完整,适合构建生产级语音应用,但实时连接计费和增值功能叠加必须做好监控。
常见问题
AssemblyAI主要做什么?
它通过API把预录或实时音频转换成文字,并提供语音理解和智能体能力。
有免费额度吗?
新账户获得50美元免费额度,无需信用卡,但不包含LLM Gateway。
预录转录多少钱?
Universal-3.5 Pro为每小时0.21美元,Universal-2为每小时0.15美元。
实时转录多少钱?
Universal-3.5 Pro Realtime为每小时0.45美元,Universal-Streaming为0.15美元。
流式识别如何计费?
按WebSocket连接开启时长计费,包括静音和空闲时间。
支持说话人分离吗?
支持,预录和实时模式的附加价格不同。
Voice Agent API多少钱?
公开价格为每小时4.50美元,按会话连接时长计算。
AssemblyAI开源吗?
官方SDK和示例开源,但托管模型、训练数据和平台本身不开源。
适合医疗数据吗?
可评估医疗模式、BAA和数据控制,但仍需由组织完成自身合规审查。
桂公网安备45132202000164号