Tavus是什麼?
Tavus是一個專為開發者、產品團隊及企業所設計的即時型AI數位人平台。它最初因能夠生成個性化的數位分身影片而受到關注,而現在它的核心產品則是Conversational Video Interface,簡稱CVI。這個技術可用來打造能夠看、聽、說、記憶以及使用各種工具的即時型視頻AI Agent。
CVI將數字人渲染、語音識別、LLM、文字轉語音以及WebRTC連接等功能整合為一個API與托管組件。開發者無需分別購買多個語音和影片服務,就能將1080p品質的數字人對話功能嵌入到網頁、應用程式、Zoom或Google Meet中。
Face與PAL的區別
Face定義螢幕上的外觀與聲音,也就是數位人的臉龐、聲音、表情以及呈現方式。PAL則定義行為、知識、提示詞、目標、限制條件、工具以及管線配置。
一個PAL可以綁定預設的Face,也可以在建立會話時選擇其他Face。
分開設計身份和行為有利於重複使用:同一客服邏輯可以使用不同人物,同一數字分身也可承擔銷售、培訓或諮詢等不同角色。
Phoenix數字人渲染模型
Phoenix負責即時生成人臉、微表情、頭部動作以及情緒變化。目前的Phoenix-4版本能夠根據情境、語氣和對話中的線索來動態調整表情,並在說話與聆聽狀態之間自然過渡。
它專注於Face的呈現,不負責完整的業務知識。外觀逼真並不代表回答可靠,事實的品質仍由PAL配置、LLM、知識庫和工具決定。
Raven感知模型
Raven能分析使用者的影片、聲音、身體語言、螢幕共享內容以及環境中的各種線索,從而辨別出使用者的情緒、意圖、語氣,以及與特定物體或動作相關的資訊。當發現特定的行為或聲音事件時,它還能觸發相關的工具。
視覺與情緒推斷可能出現誤判,不能單獨用於醫療診斷、招聘篩選、信貸決策或執法。涉及敏感推斷時需要明確告知、使用者同意及人工複核。
Sparrow輪次管理模型
Sparrow能夠處理對話中的停頓、節奏、輪流說話的順序以及中斷的情況。Sparrow-1是官方推薦的版本,相較於舊版以及僅依賴時間規則的版本,它的表現更快且更自然。
開發者可以將 Turn-taking Patience 設定為低、中、高,也可以控制 PAL 被打斷的敏感度。客服查詢可偏快,訪談和諮詢場景應更耐心。
從影片創建自訂Face
高品質的方式是上傳約1分鐘的訓練影片,其中約30秒用於說話、30秒用於聆聽。此方法能捕捉外貌、聲音、表情以及說話習慣,其品質與控制度通常優於單張圖片。
訓練影片需要清晰、穩定、以正面畫面為主,且符合技術要求。使用者必須擁有肖像、聲音和影片的必要權利。
從圖片創建Face
使用者也可以上傳單張的人物或角色圖片,由系統自動生成訓練數據,並選擇現有的語音。這種方式的部署速度更快,但身份、動作和表達的精確度則低於以影片進行訓練的方式。
圖片Face適合原型和虛擬角色,不應用於未經授權的真人克隆。
100多種Stock Faces
Tavus提供了100多個由真實演員錄製的Stock Faces,這些資源適用於快速打造原型、進行演示,或是那些沒有自訂素材的團隊。在使用這些Stock資源時,仍需遵守平台所規定的使用場景及廣告披露規則。
PAL Maker無代碼構建
PAL Maker提供引導式介面,讓非開發人員能夠設定臉部特徵、聲音、行為模式、知識庫、目標以及工具,並直接啟動對話功能。而API則適用於嵌入正式產品及實現自動化部署。
知識庫與RAG
經優化的知識庫能夠載入公司文件,為回覆內容提供搜尋上下文。文件應區分版本、移除過期資料,並設定存取權限。
RAG能減少幻覺,但無法保證每次都檢索到正確段落。
動態記憶
動態記憶體可讓 PAL 在後續會話中記住使用者的偏好與背景資訊,進而提升連續性。此類記憶體屬於個人資料,必須提供相關的告知、刪除、修改以及保存期限的說明,且不應儲存密碼、支付資訊或不必要的敏感資料。
目標、護欄與工具調用
Objectives用於定義會話中需要完成的任務,Guardrails則用來限制不允許的行為,而Function Calling與Tools則用於查詢訂單、安排日程或更新CRM資料。工具的參數必須由伺服器端進行驗證,且對於高風險的操作,還需要使用者確認。
情緒控制
Phoenix-4支援明確與隱含的情緒控制。明確設定可指定表達方向,隱含模式則根據對話上下文進行調整。
行銷和娛樂可使用更明顯的情緒,醫療、金融和投訴處理應避免操縱性表達。
語音、發音與降噪
CVI包含TTS、24kHz音頻、發音詞典、先進降噪以及說話人隔離功能。自訂發音詞典可用於修正品牌名、人名及專業術語的發音。
嘈雜環境仍應提供文字確認和字幕。
影片與純音頻管線
開發者可以選擇完整影片或僅有音訊的模式。純音訊的成本和頻寬通常較低,適合用於電話或後台代理;
影片模式提供表情和視覺感知,但對網路、設備和隱私的要求更高。
套餐與價格方式對比
| 套餐 | 價格方式 | Face與用量 | 適合場景 |
|---|---|---|---|
| Free | 免費開發體驗,具體分鐘與併發以控制台為準 | 可使用Stock資源和基礎CVI;不能創建自定義Face | 原型、API測試和功能評估 |
| Starter | 訂閱或用量價格由動態控制台顯示 | 開放自訂Face與更高會話額度 | 創始產品與小規模正式部署 |
| Growth | 按更高用量與能力計費 | 自訂Face、更大併發、分鐘與生產能力 | 增長中的應用和多場景部署 |
| Enterprise | 訂製報價 | 訂製Face、容量、合規、支援和合約條件 | 高併發、受監管和大型企業項目 |
目前官方網站的價格資訊並未在公開文本中穩定顯示具體金額,但可確認從Free到Enterprise等各個級別皆提供API以及端到端對話架構,且付費級別越高,可自訂的Face數量、分鐘數以及同時處理的請求數也越多。購買前應登入開發者控制台,以確認實時單價,以及包含的分鐘數、超額費用、同時處理的請求數和錄製儲存空間等資訊。
費用包含什麼?
官網說明,CVI的價格已包含LLM、TTS和WebRTC等完整功能,同時還包括1080p畫質的影片、24kHz頻率的音訊,以及感知、RAG、記憶、保護機制、各種工具、轉錄和錄製等功能。企業的總成本還可能包含整合、資料準備、合規性要求、上線支援,以及超出使用量部分的費用。
舊影片生成與當前CVI
Tavus仍擁有Videos API以及數位分身影片的功能,單條影片的生成時間上限曾被標示為5分鐘。目前,該產品的發展重點已轉向即時CVI和PAL技術,因此不應僅將其描述為用於批量製作個性化錄播影片的工具。
Zoom與Google Meet
PAL可以進入Zoom和Google Meet的會議,適用於面試、培訓、銷售及支援等場合。在自動加入會議之前,必須先告知參與者這是AI,並說明是否會進行錄音、錄影、轉錄或儲存資料。
LiveKit與Pipecat集成
Tavus提供LiveKit與Pipecat的整合方案,適用於將臉部渲染功能整合到現有的即時Agent及媒體基礎架構中。團隊需處理會話的生命週期、網路重新連線、麥克風權限以及伺服器金鑰等相關問題。
快速嵌入流程
- 在服務端保存TAVUS_API_KEY。
- 選擇Stock或自訂PAL與Face。
- 服務端呼叫建立Conversation介面。
- 將返回的Conversation URL嵌入iframe或應用。
- 用戶離開時主動結束會話,避免持續計費。
自動測試可使用test_mode,建立不會讓PAL真正加入且立即結束的會話,避免測試任務產生正常會話費用。
Conversation API
開發者可以建立、結束及查詢會話,並取得轉錄與錄製的內容。一旦會話被建立,就會開始計費且佔用併發資源,因此不能僅依靠關閉瀏覽器來釋放資源。
OpenAPI與服務端安全
官方提供完整的OpenAPI合約。API Key不得放入瀏覽器代碼、行動應用或公開倉庫;
前端只能調用自己的後端,由後端創建受控會話。
Face訓練使用的檔案URL應採用短期簽名地址,日誌中不得記錄金鑰和永久公開的敏感素材。
GitHub與範例專案
Tavus Engineering在官方GitHub上公開了CVI範例、面試相關內容,以及Santa等示範專案,協助開發者了解即時介面。在搜尋結果中也有第三方的Python、Ruby和C# SDK,使用前必須區分哪些是官方提供的,哪些是由社群維護的。
開源狀態
Tavus的Phoenix、Raven、Sparrow模型、Face訓練、託管CVI和商業API並非開源產品。官方示範專案的開放代碼,並不等同於核心模型或伺服器可以被私有化部署。
數據、錄製與合規
CVI可保存對話轉錄和錄製內容,並能處理影片、音頻、面部特徵、情緒以及知識庫等資料。企業必須明確規定相關的同意程序、合法依據、存取權限、資料保留方式、刪除方式、資料儲存地點,以及受監管的資料處理方式。
用戶可以請求刪除資料,但企業應用仍需在其自身的資料系統中實現同步刪除。
Tavus使用教學
建立可重複使用的專業工作流
- 建立腳本、鏡頭表、品牌素材和禁用元素清單;
- 為Face與PAL的差異、Phoenix數字人渲染模型和Raven感知模型保存統一參數;
- 先用代表性鏡頭測試模型與額度;
- 把失敗鏡頭轉入人工剪輯或重新生成;
- 統一字幕、響度、色彩和片尾版權資訊;
- 記錄版本和審核人後再批量發布;
適合哪些用戶?
- 構建實時數字人客服和銷售Agent的開發者;
- 需要視覺、語音與情緒感知的對話產品;
- 創建數位分身培訓與互動課程的團隊;
- 將AI Agent加入Zoom或Google Meet的企業;
- 需要RAG、記憶、護欄和工具調用的應用;
- 使用LiveKit或Pipecat來建立即時媒體管線的團隊。
主要優勢
- 端到端包含LLM、TTS、WebRTC和數字人渲染;
- Phoenix、Raven、Sparrow分別處理外觀、感知和輪次;
- 支援影片或單張圖片創建自訂Face;
- PAL整合知識、記憶、目標、護欄和工具;
- 提供1080p影片、低延遲和豐富的即時控制;
- 開放API、PAL Maker、會議與即時框架整合。
限制與注意事項
- 實時影片比文字或語音Agent成本、頻寬和隱私風險更高;
- 視覺情緒推斷可能誤判,自訂Face必須授權;
- 會話若未正確結束可能繼續計費;
- 核心平台不開源,具體價格需登錄控制台確認;
- LLM回答、RAG檢索和工具執行仍可能出錯,高風險操作必須人工確認;
常見問題
Tavus免費嗎?
有免費的開發體驗,可使用基礎的CVI和Stock資源;自訂Face功能則僅在Starter、Growth和Enterprise版本中提供。
創建自己的數位分身需要多久素材?
以高品質方式使用約1分鐘的影片,其中約30秒說話、30秒聆聽;也可使用單張圖片快速創建但品質較低。
Face和PAL有什麼區別?
Face負責外觀和聲音,PAL負責行為、知識、目標、記憶、護欄與工具。
Tavus提供API嗎?
提供完整的API和OpenAPI契約,可管理Faces、PALs、Conversations、Videos、Tools和Documents。
Tavus能加入Zoom嗎?
支持Zoom與Google Meet整合,使用時需告知參與者AI身份及錄製政策。
Tavus是開源的嗎?
核心模型和託管CVI不開源;官方GitHub公開範例與演示專案。
桂公網安備45132202000164號