Cekura是什么
Cekura是一套面向语音和聊天AI智能体的自动化测试、评测与生产可观测平台,由美国公司Tatva Labs Inc.运营。团队可以在上线前模拟真实对话,上线后持续监控通话,再把发现的故障转成可重复的回归测试。
它主要服务于开发语音客服、外呼销售、预约、招聘和合规对话系统的产品、工程与质量团队。产品重点不是生成一个新的语音机器人,而是检验现有机器人在不同场景、平台和基础设施下是否可靠。
一句话介绍
Cekura可以用合成用户批量呼叫AI智能体,按自定义指标评分并监控真实生产对话,让团队在部署前后用同一套评测标准发现回归、延迟、工具调用和合规问题。
主要功能
上线前对话模拟
用户可以为预约、退款、身份验证或销售资格判断等任务建立测试场景,再让模拟用户与目标智能体完成多轮对话。测试可以加入背景噪声、口音、多语言、插话和复杂分支,而不是只比较一段固定文本。
评测器与测试人物
评测器用于定义模拟用户的身份、目标、说话方式、条件动作和预期结果。测试资料、动态变量和模拟工具响应可以重复使用,让同一套场景覆盖不同客户、地点和边界条件。
预置与自定义指标
平台提供准确性、对话质量、客户体验和语音质量等标准指标,并支持布尔、数值和分类结果。团队还可以用自然语言建立LLM裁判指标,或用Python编写确定性的自定义检查。
工具调用与基础设施测试
Cekura可以验证智能体是否在正确时间调用正确工具并传递正确参数,也能用模拟工具返回稳定结果。基础设施测试覆盖延迟、稳定性、断线、静默、打断、并发和失败恢复等语音链路问题。
A/B、负载与多语言测试
团队可以用相同场景比较两个提示词、模型、供应商或配置,并通过重复运行观察非确定性。负载测试和并发调用用于检验容量,多语言、口音和代码切换测试则用于暴露识别与理解缺陷。
生产通话监控
生产系统可通过原生集成或Webhook发送转录、录音、元数据和结束原因。Cekura会按指标评估通话,展示趋势、失败点、主题、延迟和异常,并提供告警与可下载报告。
红队与合规评测
红队功能可构造越狱、偏离脚本、有害意图和个人信息泄漏等对抗性对话。医疗、金融或其他受监管团队还可以把身份验证、录音告知和禁止披露等规则做成可重复门禁。
自我改进闭环
平台会从生产失败中生成或复现测试,聚类根因并建议提示词修正,然后重新运行发布门禁。自动建议仍需要工程人员审查,尤其是涉及业务政策、安全和合规规则的修改。
测试、监控与改进闭环
| 阶段 | 输入 | Cekura处理 | 主要输出 | 团队决策 |
|---|---|---|---|---|
| 设计 | 业务流程、风险和历史故障 | 建立人物、场景、变量与指标 | 可重复测试集 | 定义什么算通过 |
| 模拟 | 测试集与目标智能体 | 批量运行语音或聊天对话 | 转录、录音、工具调用和分数 | 修复失败或接受已知风险 |
| 发布门禁 | 新版本和基准版本 | 回归、A/B和并发测试 | 版本对比与通过状态 | 允许或阻止部署 |
| 生产监控 | 真实通话和元数据 | 评测、聚类、趋势与告警 | 失败案例和运营指标 | 确定处理优先级 |
| 改进 | 失败通话和根因 | 生成复现用例并建议修改 | 补丁候选与新回归测试 | 人工审核后重新发布 |
完整工作流程
- 创建组织和项目,按环境、产品线或客户划分智能体与访问权限。
- 连接Retell、Vapi、ElevenLabs、LiveKit、Pipecat、SIP或自定义语音系统。
- 选择关键业务流程,为正常路径、边界情况、失败恢复和合规风险建立场景。
- 设置模拟人物、口音、语言、动态变量、工具响应和通话终止条件。
- 选择预置指标,并用LLM裁判或Python补充业务专属指标和评分规则。
- 以低并发运行小样本,人工审阅转录、录音、指标解释和误判。
- 扩大到回归、A/B、负载和红队测试,把关键测试接入拉取请求或发布流水线。
- 接入生产通话监控,配置告警、个人信息处理、日志保留和访问控制。
- 把高频失败转成新的测试用例,修正提示词或基础设施后再次验证。
新手使用教程
- 免费注册后新建项目,先连接一个非生产环境的语音或聊天智能体。
- 从最重要的一条用户旅程开始,写清模拟用户目标、允许信息和通过条件。
- 创建三至五个场景,分别覆盖正常完成、用户打断、信息缺失和工具失败。
- 添加任务完成、事实正确、延迟、语音质量和合规等指标。
- 运行少量测试并逐条听取或阅读结果,检查评分是否符合人工判断。
- 调整含糊指标和模拟人物,再增加口音、噪声、语言与边界条件。
- 测试稳定后按标签组成冒烟与完整回归套件,并设置部署门禁。
接入CI/CD流程
- 在Cekura创建API密钥,并把密钥保存到代码托管平台的加密机密中。
- 记录目标智能体ID,用场景ID或标签选择需要执行的测试集。
- 在GitHub Actions工作流中调用官方Action,并设置运行频次、超时和可选电话号码。
- 让工作流在拉取请求、主分支推送、定时任务或手动触发时运行。
- 查看运行日志和测试结果,只在关键指标达到门槛时允许后续部署。
- 定期轮换密钥,并避免把电话号码、客户数据和凭据直接写进仓库。
适合哪些用户
- 语音AI开发团队:为每次提示词、模型、语音栈或工具改动运行自动回归。
- 质量与测试工程师:把对话业务要求转成场景、指标和发布门禁。
- 产品与运营团队:从生产通话中识别失败流程、掉线点和客户体验问题。
- 客服与外呼平台:测试预约、退款、资格判断、转接和人工升级路径。
- 医疗与受监管企业:验证身份、录音告知、敏感信息和业务合规规则。
- 语音平台供应商:在同一场景下比较模型、编排层和通信基础设施。
- AI咨询与实施团队:为不同客户维护隔离项目、报告和重复测试资产。
典型使用场景
- 在发布前模拟数百种预约、改期、取消和紧急升级对话。
- 比较Vapi、Retell、ElevenLabs、LiveKit或自建语音栈在同一场景下的表现。
- 检验智能体能否正确调用日历、CRM、支付或知识库工具。
- 用口音、背景噪声、插话、长静默和网络中断测试语音鲁棒性。
- 把真实生产故障重放为回归测试,防止修复后再次出现。
- 监控大量真实通话并按失败原因聚类,减少人工逐通监听。
- 在GitHub拉取请求中运行冒烟测试,阻止关键工作流退化的版本上线。
产品优势
- 把上线前模拟和上线后监控放在同一套指标体系中,便于从生产问题回到可重复测试。
- 同时支持LLM裁判和Python指标,兼顾语义判断与确定性业务检查。
- 覆盖语音细节、工具调用、基础设施、负载、红队和合规,不局限于文本问答。
- 提供多种主流语音平台原生集成,也支持SIP、WebSocket、Webhook和自定义接入。
- 公开REST API、OpenAPI规范、Python SDK、CLI、MCP和CI/CD工具,自动化入口完整。
- 按用量方案允许一个席位免费,适合先用真实智能体建立小型测试集。
使用限制与注意事项
- 模拟用户和LLM裁判本身也具有非确定性,单次通过不能证明生产环境永远可靠。
- 指标设计不清会产生误判,团队需要用人工标注样本校准评分规则和阈值。
- 语音测试分钟、聊天回复、监控通话、席位和并发分别影响成本,负载测试可能快速消耗额度。
- 不同平台的转录、录音、工具调用和时间戳格式不同,集成不完整会限制可观测深度。
- 生产通话可能包含个人、健康、支付或客户机密,需要配置脱敏、权限、保留和合同条款。
- Startup方案的额度是共享积分折算,约2000分钟测试和约10000次监控并不是同时独立赠送的两份无限额度。
- 官网基准、准确率和客户效率数据属于供应商或特定样本结果,不能直接推断到自己的智能体。
- 自动生成的提示词补丁可能改变安全边界或业务逻辑,必须经过代码审查和回归测试。
价格与套餐
截至2026年8月21日,Cekura提供按用量、Startup和Enterprise三类方案。新账户可获得300个免费积分,官网折算约为60分钟语音测试;无需信用卡即可开始。
| 套餐 | 价格 | 用量与并发 | 席位与保留 | 适合用户 |
|---|---|---|---|---|
| Pay as you go | 首位用户0美元,按实际用量付费 | 语音测试每分钟0.25美元;聊天每条回复0.025美元;监控每通0.05美元;10路并发 | 1席位免费,额外席位每月30美元;日志保留30天 | 开发者、小团队和不稳定用量 |
| Startup | 每月500美元 | 每月10000积分,约2000分钟语音测试或最多10000通监控;50路并发;5个项目 | 含10席位;日志保留90天;签署BAA与DPA;专属Slack支持 | 已进入规模化测试的语音AI团队 |
| Enterprise | 定制报价 | 定制积分、折扣、并发、项目和基础设施 | 定制席位与保留;SSO、SCIM、审计日志、VPC或本地部署可选 | 高合规、多项目和复杂部署企业 |
Startup按月订购并可随时取消,Enterprise采用年度合同并支持采购订单、发票或银行转账。费率、税费、积分换算和最终权益应以账户结算页及合同为准。
各方案关键差异
| 能力 | 按用量 | Startup | Enterprise |
|---|---|---|---|
| 项目数 | 1个 | 5个 | 定制 |
| 并发通话 | 10路 | 50路 | 定制 |
| 日志保留 | 30天 | 90天 | 定制 |
| BAA与DPA | 未包含签署版本 | 包含签署版本 | 按企业要求定制 |
| 支持 | 邮件,尽力响应 | 专属Slack,24小时响应 | 指定工程师和约定渠道 |
| SSO与SCIM | 不包含 | 不包含 | 支持SAML SSO与SCIM |
| VPC或本地部署 | 不包含 | 不包含 | 可选 |
| 访问控制与多项目 | 基础 | 5个项目 | 多项目细粒度控制 |
免费额度与计费方法
每个方案都包含生产通话模拟、生产告警、可下载报告、标准指标、Python指标、API、MCP和AI编码助手技能。免费300积分用于起步,但额外席位和实际测试或监控用量仍会产生费用。
用量估算时应分别计算语音测试分钟、聊天回复、监控通话数、并发峰值、重跑频次和日志保留。测试套件若在每次提交都重复多次运行,实际月度消耗会明显高于一次性手工测试。
支持的智能体与集成
| 平台或方式 | 测试 | 生产可观测 | 说明 |
|---|---|---|---|
| Retell | 支持 | 支持 | 可连接智能体并导入生产通话 |
| Vapi | 支持 | 支持 | 覆盖测试和生产监控 |
| ElevenLabs | 支持 | 支持 | 支持自动连接与通话分析 |
| LiveKit | 支持 | 支持 | 自动或手动房间测试,并可用Python SDK发送追踪 |
| Pipecat | 支持 | 支持 | 自动或手动会话测试及增强追踪 |
| Bland AI | 支持 | 需按文档配置 | 可作为语音智能体提供方接入 |
| SIP与电话 | 支持 | 支持日志接入 | 可测试基于SIP的系统,并可自带Twilio或Plivo号码 |
| 自定义系统 | 支持 | 支持 | 通过WebSocket、Webhook、API和自定义转录格式接入 |
| 聊天、WhatsApp和短信 | 支持部分测试流程 | 取决于集成 | 可用更低成本的文本通道验证对话逻辑 |
API、Python SDK与MCP
| 开发方式 | 提供情况 | 主要用途 | 鉴权或限制 |
|---|---|---|---|
| REST API | 提供 | 创建和管理智能体、指标、场景、运行、结果、项目、仪表板与生产通话 | 使用API密钥,受账户额度与权限限制 |
| OpenAPI规范 | 提供 | 生成客户端、检查请求结构和接口覆盖 | 仍需有效Cekura账户和密钥 |
| Python SDK | 提供 | 从Python脚本运行测试、查询结果和发送可观测数据 | 通过官方Python包安装,调用商业平台 |
| CLI | 提供 | 在终端和流水线触发测试与检查结果 | 需要登录或API密钥 |
| MCP服务器 | 提供 | 让Claude Code、Cursor、Codex等助手访问文档和平台操作 | 可用OAuth或项目级API密钥 |
| Cekura Skills | 提供 | 为编码助手提供建场景、设计指标、修复生产问题等工作流 | 技能仓库开源,但执行操作仍连接Cekura服务 |
| GitHub Action | 提供 | 按场景ID或标签在CI中执行测试 | 密钥应保存在加密Secret中 |
GitHub与开源情况
Cekura官方GitHub公开了GitHub Actions集成和面向AI编码助手的Skills仓库,两者均采用MIT许可证。Skills覆盖创建智能体、设计评测、生成场景、修复生产问题和构建基础设施测试等工作流。
这些仓库只开放集成工具、工作流和说明,不包含Cekura托管测试平台的完整源码。平台本身仍是闭源商业服务,Python SDK可调用公开API也不等于核心服务开源。
安全、隐私与数据处理
官网展示SOC 2、HIPAA和GDPR相关安全与合规能力,Startup方案包含签署BAA和DPA,企业方案可以定制。涉及受保护健康信息时,必须在上传真实通话前确认协议已经签署且所用功能在覆盖范围内。
生产监控会处理转录、录音、电话号码或标识、工具调用和业务元数据,这些内容可能包含敏感信息。文档提供个人信息脱敏能力,团队仍需决定哪些字段应在发送前移除。
子处理方
公开子处理方页面列出Supabase用于数据存储与数据库管理,并列出OpenAI、Anthropic和Replicate用于模型能力。企业应确认实际项目会调用哪些服务、数据地区、保留期限和退出后的删除安排。
保留、账户与订阅
套餐日志保留期分别为30天、90天或企业定制,隐私政策对账户个人资料采用实现目的所需的保留原则。条款表示订阅会自动续费,取消通常在当前已付费周期结束时生效,价格也可能依法通知后调整。
安全实践清单
- 优先用合成身份、测试号码和虚构敏感信息构建预发布场景。
- 生产接入前配置PII脱敏,只发送评测所需的转录、录音和元数据。
- 为开发、CI和生产使用不同API密钥,并限制权限、IP和项目范围。
- 把密钥保存在Secrets管理工具中,不写入代码、日志或测试报告。
- 根据法规和业务要求选择日志保留期,并建立删除和数据主体请求流程。
- 医疗项目确认BAA,欧洲或其他地区确认DPA、跨境传输和数据驻留。
- 定期审计指标、告警和人工访问,避免测试平台成为新的敏感数据汇集点。
基本信息
| 项目 | 信息 |
|---|---|
| 工具名称 | Cekura |
| 运营主体 | Tatva Labs Inc. |
| 工具类型 | 语音与聊天智能体测试、评测、生产监控和改进平台 |
| 核心能力 | 模拟、指标、回归、负载、红队、可观测、CI/CD和自我改进 |
| 价格模式 | 300免费积分、按用量、Startup月付、Enterprise定制 |
| 主要平台 | Web仪表板、REST API、Python SDK、CLI、MCP和GitHub Actions |
| 公开API | 有,提供API密钥和OpenAPI规范 |
| 官方SDK | 有,Python SDK |
| 官方GitHub | 有 |
| 产品是否开源 | 否 |
| 开源组件 | GitHub Action与Cekura Skills采用MIT许可证 |
| 主要界面语言 | 英文 |
| 安全与合规 | 官网展示SOC 2、HIPAA和GDPR能力,具体合同覆盖依方案而定 |
推荐指数
推荐指数为4.6分,满分5分。Cekura把场景模拟、语义与代码指标、语音基础设施测试、生产监控和CI/CD放在一个生命周期中,对已经准备上线或持续迭代语音智能体的团队价值较高。
主要门槛是高并发和频繁回归会快速产生用量成本,可靠结果还依赖团队设计清晰指标和人工校准。处理生产录音时,隐私、合同和子处理方管理也不能只依赖平台默认值。
常见问题
Cekura可以免费使用吗?
新账户有300个免费积分,官网折算约60分钟语音测试,首个席位免费且无需信用卡。之后按测试分钟、聊天回复或监控通话付费,也可以升级月付套餐。
它只能测试语音智能体吗?
核心定位是语音智能体,但也支持聊天模拟、短信、WhatsApp和文本方式的低成本逻辑测试。不同通道能覆盖的音频、延迟和打断指标并不相同。
能监控真实生产通话吗?
可以。原生集成或Webhook可发送转录、录音和元数据,再由指标评估、仪表板和告警帮助团队发现异常。
支持哪些语音平台?
官方文档列出Retell、Vapi、ElevenLabs、LiveKit、Pipecat、Bland AI、SIP、Agora和自定义集成。具体测试与监控能力应按各平台指南核对。
是否提供API和SDK?
提供公开REST API、OpenAPI规范、Python SDK和CLI,也有MCP服务器与GitHub Actions。API调用受账户权限、积分、并发和计划限制。
Cekura开源吗?
核心托管平台不开源。官方开放了MIT许可的GitHub Action和AI编码助手Skills,但不能据此将完整产品标记为开源。
LLM评测结果可靠吗?
LLM裁判适合判断语义和对话质量,但可能误判或随模型变化。重要指标应使用人工标注样本校准,能够确定性计算的规则优先使用Python指标。
Startup的额度可以同时测试2000分钟并监控10000通吗?
不能简单这样理解。两项是官网对同一月度积分容量的近似换算,混合使用时会共同消耗积分。
可以在本地或私有环境部署吗?
企业方案列出VPC和本地部署选项,需要定制合同和技术评估。按用量及Startup方案使用托管服务。
生产数据应注意什么?
先确认合法录音和处理依据,再限制转录、录音、号码与健康信息的发送。还要配置脱敏、保留、权限、DPA或BAA及删除流程。
总结
Cekura为语音智能体提供了从发布前压力测试到生产故障回放的连续质量体系。它尤其适合已有真实业务流程、需要反复发布并希望把评测放进工程流水线的团队。
工具本身不会自动保证可靠性,真正的质量来自清晰场景、可解释指标、人工校准和严格数据治理。先以小型关键路径测试集建立基线,再逐步扩大并发和生产监控,通常更可控。
桂公网安备45132202000164号