Tavus是什么?
Tavus是一款面向开发者、产品团队和企业的实时AI数字人平台。它最初以个性化数字分身视频生成受到关注,现在核心产品是Conversational Video Interface,简称CVI,用于构建能够看、听、说、记忆和调用工具的实时视频AI Agent。
CVI把数字人渲染、语音识别、LLM、文字转语音和WebRTC连接整合为一个API与托管组件。开发者无需分别采购多个语音和视频服务,就能把1080p数字人对话嵌入网页、应用、Zoom或Google Meet。
Face与PAL的区别
Face定义屏幕上的外观和声音,也就是数字人的脸、声音、表情与呈现方式。PAL定义行为、知识、提示词、目标、护栏、工具和管线配置。一个PAL可以绑定默认Face,也可以在创建会话时选择其他Face。
分开设计身份和行为有利于复用:同一客服逻辑可以使用不同人物,同一数字分身也可承担销售、培训或咨询等不同角色。
Phoenix数字人渲染模型
Phoenix负责实时生成人脸、微表情、头部运动和情绪变化。当前Phoenix-4方向支持根据语境、语气和对话线索动态调整表情,并在说话和聆听状态之间自然过渡。
它专注于Face呈现,不负责完整业务知识。外观逼真也不代表回答可靠,事实质量仍由PAL配置、LLM、知识库和工具决定。
Raven感知模型
Raven分析用户的视频、声音、身体语言、屏幕共享和环境线索,识别情绪、意图、语调与特定物体或动作。它可以在发现指定行为或声音事件时触发工具。
视觉与情绪推断可能误判,不能单独用于医疗诊断、招聘筛选、信用决策或执法。涉及敏感推断时需要明确告知、用户同意和人工复核。
Sparrow轮次管理模型
Sparrow处理对话中的停顿、节奏、轮次和打断。Sparrow-1是官方推荐版本,相比旧版和纯时间规则更快且更自然。
开发者可以设置Turn-taking Patience为低、中、高,也可以控制PAL被打断的敏感度。客服查询可偏快,访谈和咨询场景应更耐心。
从视频创建自定义Face
高质量方式是上传约1分钟训练视频,其中约30秒说话、30秒聆听。该方法能捕捉外观、声音、表情和说话习惯,质量和控制通常优于单图。
训练视频需要清晰、稳定、正面为主并符合技术要求。用户必须拥有肖像、声音和视频的必要权利。
从图片创建Face
用户也可以上传单张人物或角色图片,由系统自动生成训练数据,并选择现有Voice。该方式部署更快,但身份、动作和表达保真度低于视频训练。
图片Face适合原型和虚拟角色,不应用于未经授权的真人克隆。
100多种Stock Faces
Tavus提供100多名由真人演员录制的Stock Faces,适合快速原型、演示和没有自定义素材的团队。使用Stock资源时仍应遵守平台允许的场景和广告披露规则。
PAL Maker无代码构建
PAL Maker提供引导式界面,让非开发者配置Face、声音、行为、知识、目标和工具,并直接启动托管对话。API则适合嵌入正式产品和自动化部署。
知识库与RAG
优化的Knowledge Base可以加载公司文档,为回答提供检索上下文。文档应分版本、去除过期资料并设置访问权限。RAG能减少幻觉,但不能保证每次都检索到正确段落。
动态记忆
Dynamic Memories可以让PAL在后续会话中记住用户偏好和背景,提高连续性。记忆属于个人数据,必须提供告知、删除、修改和保留期限,不应保存密码、支付信息或不必要的敏感资料。
目标、护栏与工具调用
Objectives定义会话要完成的任务,Guardrails限制不允许的行为,Function Calling与Tools用于查询订单、安排日程或更新CRM。工具参数必须由服务端验证,并对高风险操作要求用户确认。
情绪控制
Phoenix-4支持显式和隐式情绪控制。显式设置可指定表达方向,隐式模式根据对话上下文调整。营销和娱乐可使用更明显情绪,医疗、金融和投诉处理应避免操纵性表达。
语音、发音与降噪
CVI包含TTS、24kHz音频、发音词典、先进降噪和说话人隔离。Custom Pronunciation Dictionary可修正品牌、人名和专业术语。嘈杂环境仍应提供文字确认和字幕。
视频与纯音频管线
开发者可以选择完整视频或Audio-only模式。纯音频成本和带宽通常更低,适合电话或后台Agent;视频模式提供表情和视觉感知,但对网络、设备和隐私要求更高。
套餐与价格方式对比
| 套餐 | 价格方式 | Face与用量 | 适合场景 |
|---|---|---|---|
| Free | 免费开发体验,具体分钟与并发以控制台为准 | 可使用Stock资源和基础CVI;不能创建自定义Face | 原型、API测试和功能评估 |
| Starter | 订阅或用量价格由动态控制台显示 | 开放自定义Face与更高会话额度 | 初创产品与小规模正式部署 |
| Growth | 按更高用量与能力计费 | 自定义Face、更大并发、分钟与生产能力 | 增长中的应用和多场景部署 |
| Enterprise | 定制报价 | 定制Face、容量、合规、支持和合同条件 | 高并发、受监管和大型企业项目 |
当前官网价格组件没有在公开文本中稳定返回具体金额,但确认从Free到Enterprise均提供API与端到端对话栈,付费层级扩大自定义Face、分钟和并发。购买前应登录开发者控制台核对实时单价、包含分钟、超额费、并发和录制存储。
费用包含什么?
官网说明CVI价格包含LLM、TTS和WebRTC等完整步骤,并包括1080p视频、24kHz音频、感知、RAG、记忆、护栏、工具、转录和录制方向。企业总成本还可能包含集成、数据准备、合规、上线支持和超额用量。
旧视频生成与当前CVI
Tavus仍有Videos API和数字分身视频能力,单条生成视频帮助信息曾标注最长5分钟。当前产品重心已经转向实时CVI和PAL,目录不应只把它描述为批量个性化录播视频工具。
Zoom与Google Meet
PAL可以进入Zoom和Google Meet方向的会话,适合面试、培训、销售和支持。自动加入会议前必须告知参与者这是AI,并说明是否录音、录像、转录和保存。
LiveKit与Pipecat集成
Tavus提供LiveKit与Pipecat集成方向,适合把Face渲染接入已有实时Agent和媒体基础设施。团队需要处理会话生命周期、网络重连、麦克风权限和服务端密钥。
快速嵌入流程
- 在服务端保存TAVUS_API_KEY。
- 选择Stock或自定义PAL与Face。
- 服务端调用创建Conversation接口。
- 把返回的Conversation URL嵌入iframe或应用。
- 用户离开时主动结束会话,避免持续计费。
自动测试可使用test_mode,创建不会让PAL真正加入且立即结束的会话,避免测试任务产生正常会话费用。
Conversation API
开发者可创建、结束和查询会话,并取得转录与录制。会话一旦创建就可能开始计费和占用并发,因此不能只依赖浏览器关闭来释放资源。
OpenAPI与服务端安全
官方提供完整OpenAPI合同。API Key不能放入浏览器代码、移动应用或公开仓库;前端只能调用自己的后端,由后端创建受控会话。
Face训练使用的文件URL应采用短期签名地址,日志中不得记录密钥和永久公开的敏感素材。
GitHub与示例项目
Tavus Engineering官方GitHub公开CVI示例、面试、Santa等演示项目,帮助开发者理解实时接口。搜索结果中也有第三方Python、Ruby和C# SDK,使用前要区分官方与社区维护。
开源状态
Tavus的Phoenix、Raven、Sparrow模型、Face训练、托管CVI和商业API不是开源产品。官方示例项目开放代码不等于核心模型或服务端可私有化部署。
数据、录制与合规
CVI可保存对话转录和录制,并处理视频、音频、面部、情绪和知识库。企业必须确定告知同意、合法基础、访问权限、保留、删除、数据地区和受监管信息处理。
用户可以请求数据删除方向,但企业应用还需实现自身数据系统中的同步删除。
适合哪些用户?
- 构建实时数字人客服和销售Agent的开发者;
- 需要视觉、语音与情绪感知的对话产品;
- 创建数字分身培训与互动课程的团队;
- 把AI Agent加入Zoom或Google Meet的企业;
- 需要RAG、记忆、护栏和工具调用的应用;
- 使用LiveKit或Pipecat搭建实时媒体管线的团队。
主要优势
- 端到端包含LLM、TTS、WebRTC和数字人渲染;
- Phoenix、Raven、Sparrow分别处理外观、感知和轮次;
- 支持视频或单图创建自定义Face;
- PAL整合知识、记忆、目标、护栏和工具;
- 提供1080p视频、低延迟和丰富实时控制;
- 开放API、PAL Maker、会议与实时框架集成。
限制与注意事项
实时视频比文字或语音Agent成本、带宽和隐私风险更高。视觉情绪推断可能误判,自定义Face必须授权;会话若未正确结束可能继续计费。
核心平台不开源,具体价格需登录控制台确认。LLM回答、RAG检索和工具执行仍可能出错,高风险操作必须人工确认。
常见问题
Tavus免费吗?
有Free开发体验,可使用基础CVI和Stock资源;自定义Face只在Starter、Growth和Enterprise开放。
创建自己的数字分身需要多久素材?
高质量方式使用约1分钟视频,其中约30秒说话、30秒聆听;也可使用单张图片快速创建但质量较低。
Face和PAL有什么区别?
Face负责外观和声音,PAL负责行为、知识、目标、记忆、护栏与工具。
Tavus提供API吗?
提供完整API和OpenAPI合同,可管理Faces、PALs、Conversations、Videos、Tools和Documents。
Tavus能加入Zoom吗?
支持Zoom与Google Meet集成方向,使用时需告知参与者AI身份和录制政策。
Tavus开源吗?
核心模型和托管CVI不开源;官方GitHub公开示例与演示项目。
桂公网安备45132202000164号