Hamming AI
免费增值
AI工具大全 AI音频工具

Hamming AI

Hamming AI,专注于AI 音频的智能工具

标签:

一句话介绍

Hamming AI是一款为语音和聊天智能体提供上线前测试、生产监控、安全红队和回归门禁的企业级质量保障平台。

工具简介

Hamming的核心工作不是替企业创建客服机器人,而是验证已有智能体是否准确、自然、稳定、安全并完成业务目标。团队可以连接现有语音平台或自研系统,自动生成测试场景,再通过真实通话链路运行和评分。

平台把测试、监控和问题修复连接成一个循环。生产通话中发现的失败可以转成可重复回归用例,提示词、模型或基础设施更新后再次执行,避免同类问题重新上线。

产品定位

能力层解决的问题典型使用阶段主要输出
模拟测试智能体在真实对话中会不会失败开发与预发布场景、录音、转写、评分和失败证据
回归测试版本更新是否破坏原有能力每次提示词、模型或代码变更版本对比与发布门禁
压力测试并发增加后系统是否稳定容量规划与重大上线前延迟、错误、吞吐和尾部指标
安全红队是否会被越狱、注入或诱导泄露数据安全验收和持续验证风险发现与可复现用例
生产监控真实客户通话是否发生质量或合规问题正式运行阶段告警、趋势、审查队列和证据
生产回放修复是否解决真实失败事故复盘与修复验证保留语音、时序和预期意图的测试

主要功能

自动生成测试场景

团队可以粘贴智能体系统提示词或连接现有平台,让Hamming生成大量正常路径、边界情况、对抗输入、口音和噪声场景。生成结果仍需要业务人员检查覆盖范围和预期答案。

音频原生评测

Hamming不仅分析转写文字,还直接检查音频层面的轮次、打断、静音、单人长讲、语音清晰度和情绪。这样可以发现文本看似正确但实际听感很差的问题。

多轮对话与跨通话流程

测试可以覆盖多轮上下文,也能构建同一角色分多次通话完成预约、改期和取消的序列。该能力适合验证状态保持和跨交互业务流程。

生产通话转回归用例

团队可把真实失败通话一键转成可重放测试,并保留调用者音频、语音识别文本、时序和预期意图。修复后使用相同条件再次运行,比重新编写近似脚本更容易验证。

安全与合规红队

预置红队场景覆盖提示注入、越狱、社会工程、敏感信息泄露、越权工具调用和偏离政策等风险。企业还可以定义行业脚本、必须披露内容和禁止回答。

IVR与DTMF测试

Hamming可以模拟传统电话菜单、发送DTMF按键音,并验证智能体是否能正确通过IVR。它同时支持入站、出站和直接WebRTC路径。

生产健康检查

平台可每隔数分钟重放一组黄金通话,发现模型变化、基础设施故障或提示词回归。指标越过阈值时可以通过邮件、Slack或其他告警渠道通知团队。

测试条件与角色模拟

  • 不同地区语言、口音和方言。
  • 办公室、街道、人群和其他背景噪声。
  • 快速或缓慢说话、长静音和意外输入。
  • 用户中途打断、抢话和代理说话过长。
  • 老年调用者、情绪激动和辱骂场景。
  • API超时、语音识别置信度低和上下文丢失。
  • 预约、付款、身份验证、转人工和取消等业务流程。
  • 提示注入、越狱、敏感数据提取和政策绕过。

评测指标

Hamming当前宣传提供50多项内置指标,并允许用自然语言定义业务专属评分器。评测分为对话质量、预期结果和合规护栏三类,不应只看单一平均分。

指标类别代表指标可以发现的问题
准确与相关事实准确、意图识别、相关性和幻觉回答错误、误解需求或编造信息
任务完成目标完成、字段采集和工具调用成功口头承诺完成但后台动作失败
延迟首词时间、轮次延迟、p50、p90和p99平均值正常但少量通话非常慢
对话流轮次数、打断、沉默、重复和独白机械感、抢话或用户无法插入
语音与音频清晰度、噪声、口音和转写质量特定人群或环境表现下降
情绪语音级情绪和趋势客户挫败或负面升级
合规脚本遵循、披露、PII、PHI和支付信息政策或监管风险
自定义评分企业规则和行业阈值通用指标无法覆盖的业务要求

端到端延迟分解

延迟分析覆盖语音活动检测、自动语音识别、LLM处理和文字转语音等完整链路。团队可以比较各组件贡献,而不是只观察用户听到的总体等待时间。

AI评分与人工校准

Hamming使用AI评估意图和整体结果,并宣称音频原生评测与人工判断的一致度约为95%至96%。这是厂商测得的指标,企业仍应在自己的语言、领域和风险等级上进行盲测与人工校准。

测试与生产监控的区别

项目上线前测试生产监控
数据合成角色与受控场景真实客户通话或生产证据
目标在发布前发现可复现问题发现漂移、事故和未知失败
风险可在沙盒中隔离副作用会接触真实个人和业务数据
运行方式按计划、版本或CI触发持续或定期健康检查
结果通过、失败、指标和回归差异趋势、告警、审查和事故证据
后续动作修复后重跑并决定是否发布转成回归用例并调整告警

两者需要共用指标和用例,但不能互相替代。模拟测试无法覆盖全部真实行为,生产监控也不应成为在真实客户身上试错的借口。

支持的语言与口音

Hamming当前宣称支持65种以上语言,包括英语、西班牙语、葡萄牙语、法语、德语、阿拉伯语、印地语、泰米尔语、日语、韩语和中文等。

语言或地区公开列出的口音或变体测试建议
英语美国、英国、澳大利亚、印度和新西兰加入本地俚语、姓名和号码格式
西班牙语拉丁美洲、欧洲和美国西语按目标市场分别设定预期
阿拉伯语现代标准、海湾、黎凡特、埃及和马格里布测试方言切换与混合语言
中文简体普通话、繁体和粤语分别评估识别、语音和数字表达
泰米尔语印度与斯里兰卡变体加入地区口音和英语混说
葡萄牙语巴西与欧洲葡语不要混用评分基线
日语与韩语标准及部分地区变体测试敬语、停顿和专有名词

语言数量不等于每种语言拥有相同音色、口音覆盖和评测准确率。上线前应为每个目标市场建立独立说话者集合、领域词汇和人工基准。

集成能力

平台或协议接入方式当前公开能力
SIP拨打测试号码或由平台呼叫入站、出站、IVR和DTMF测试
LiveKitAPI密钥或直接WebRTC同步智能体、运行测试和监控
Pipecat直接WebRTC或平台连接测试自定义语音流水线
DailyWebRTC连接网页语音智能体测试
ElevenLabs连接账号或API密钥导入智能体与运行评测
RetellAPI密钥与区域设置每5分钟自动同步智能体、录音和工具调用
Vapi平台连接导入智能体并执行一致指标评测
Bland平台连接自动测试现有语音智能体
自研系统SIP、WebRTC或REST API适配任意LLM、ASR和TTS组合
OpenTelemetry导入traces、spans和logs关联通话、组件和基础设施证据

Retell集成示例

Retell连接可导入智能体、区域、工具调用、转写和录音,并默认每5分钟同步一次。测试时应使用独立项目或测试账号,避免把负载和副作用写入正式业务。

使用教程

完成第一次语音智能体测试

  1. 创建Hamming工作区或预约演示,并确认当前方案的测试量与数据规则。
  2. 选择LiveKit、Pipecat、ElevenLabs、Retell、Vapi、Bland、SIP或自研接入。
  3. 使用测试专用密钥连接智能体,并限制可访问的项目和环境。
  4. 导入系统提示词、工具定义和必要文档,让平台生成初始场景。
  5. 由产品、QA和业务人员审查场景、期望结果与风险等级。
  6. 先运行小批量测试,检查通话能接通、录音完整和评分方向正确。
  7. 展开到口音、噪声、打断、错误边界和对抗场景。
  8. 查看失败录音、转写、工具证据和组件延迟,修复后再次运行。

建立CI/CD回归门禁

  1. 把稳定的正常路径、关键边界和历史事故整理为版本化测试集。
  2. 使用REST API在每次提示词、工具、模型或代码部署前触发测试。
  3. 设置任务完成、准确率、合规、延迟和关键用例的最低阈值。
  4. 把测试运行与具体智能体版本、提示词哈希和部署提交关联。
  5. 当关键指标下降或安全用例失败时阻止发布。
  6. 在报告中保留录音、转写、工具调用和评分理由供人工复核。
  7. 对偶发失败进行重复运行和校准,不要直接降低阈值掩盖问题。
  8. 上线后将新生产失败转为永久回归覆盖。

配置生产监控

  1. 确定需要导入全部通话、抽样通话还是仅导入异常事件。
  2. 定义音频、原始转写、脱敏转写、工具调用和元数据的权限。
  3. 为准确、合规、延迟、情绪和任务完成设置分级阈值。
  4. 将工程问题发送到工程渠道,合规问题发送到受限审查渠道。
  5. 使用黄金通话做定期健康检查并记录基线。
  6. 建立人工审查、标注、覆盖和校准流程。
  7. 把严重失败转换成回归测试并指定修复负责人。
  8. 定期复核告警噪声、数据保存和用户访问权限。

生产回放与事故闭环

传统方法常根据转写重新编写一个相似场景,容易丢失原始语音、停顿、噪声和时序。Hamming的生产回放保留这些条件,用同一失败证据测试新版本。

  • 标记产生客户影响或高风险的生产通话。
  • 确认录音、转写、工具调用和期望意图完整。
  • 去除不需要的个人数据或在受控环境使用。
  • 把通话转换为带版本和负责人信息的回归用例。
  • 在修复前后运行相同场景并比较结果。
  • 将修复证据加入发布审查和事故报告。
  • 定期检查历史事故是否仍被持续执行。

压力与并发测试

企业负载活动可运行超过50,000个并发测试通话,覆盖入站、出站和直接WebRTC。普通工作区默认并发大约50路,并可配置到100路以上,具体上限取决于方案和被测平台容量。

测试维度应观察的指标常见失败
呼叫建立接通率、建连时间和失败码号码、SIP或区域限流
语音识别WER、延迟和低置信度比例并发下队列或丢帧
LLM首Token、完成时间和错误率供应商限流或上下文过载
语音合成首音频、卡顿和失败率音频队列或配额不足
工具调用成功、超时、重试和幂等重复预约或重复写入
整体对话p50、p90、p99和任务完成平均正常但尾部崩溃
成本每通、每分钟和供应商成本测试规模导致意外费用

负载测试会同时消耗Hamming、电话、语音、模型和业务API配额。团队必须设置最大并发、预算、沙盒和紧急停止机制,不能直接冲击生产客户系统。

价格与套餐

截至2026年8月23日,Hamming没有公开固定套餐金额。定价主要根据测试量和生产使用量,而不是按成员席位,具体额度与价格在演示和入门流程中提供。

方案或阶段公开价格计费依据团队席位主要权益
个性化演示免费约25分钟演示,不是产品免费试用不适用结合实际智能体和场景展示
Startup方案联系销售数百级测试量或实际需求主要不按席位收费测试、监控和团队协作范围按报价
Growth或常规团队联系销售测试量、代理数量和生产调用可邀请整个团队更高测试量、集成和支持
Enterprise定制报价大规模测试、生产通话和合同要求不以席位为主要计价批量折扣、定制集成、专属成功支持和SLA

是否有免费试用

当前FAQ明确表示不提供传统的自助免费试用,而是通过个性化演示和入门让团队使用自己的智能体体验。网站部分资源仍出现“开始免费试用”的旧式按钮,不能据此承诺现行免费额度。

报价前应确认

  • 每月包含的测试次数、分钟、并发和生产监控通话量。
  • 电话、语音、模型和第三方平台费用由谁承担。
  • 自动生成场景、评分器和重复运行是否分别计费。
  • 数据保存、导出、单租户和地区部署是否另收费。
  • API、MCP、Webhooks、OpenTelemetry和CI/CD是否包含。
  • 超量单价、最短合同、续费、取消和退款规则。
  • 企业支持严重度、10分钟至4小时响应如何映射。
  • 50,000路并发负载活动的单独报价和前置容量要求。

支持与服务

支持方式适用范围公开说明
邮件支持所有客户日常问题和工单
在线聊天所有客户产品内快速协助
专属Slack入门客户直接联系工程团队
集成支持所有客户,企业更深入协助SIP、WebRTC、平台和API连接
企业SLAEnterprise按严重度约10分钟至4小时响应
定制集成Enterprise按需求开发和维护
客户成功管理Enterprise定期检查、培训和优化

API、MCP与开发工具

Hamming提供REST API,可安排测试、获取结果、配置智能体、管理测试用例和读取监控数据。它可以接入GitHub Actions、Jenkins和其他CI/CD流水线,并通过Webhooks驱动自动化。

当前完整文档需要访问码,并主要向入门后的客户开放。公开营销资料还提到SDK、MCP服务器和OpenTelemetry导入,但接口稳定性、权限和版本应以工作区内文档为准。

开发能力当前状态主要用途注意事项
REST API正式提供,文档受限运行测试、管理用例和读取监控需客户账号与凭证
Webhooks正式提供将测试结果与告警连接到外部流程事件签名和重试需看客户文档
CI/CD支持在每次发布前执行质量门禁需要稳定测试集和版本关联
OpenTelemetry支持导入traces、spans和logs应控制敏感属性和采样
MCP服务器官方资源称提供运行测试、查询通话和搜索转写公开安装文档有限
Python SDK公开包最后更新于2024年调用早期Hamming平台版本0.0.17,需确认与当前API兼容
JavaScript SDK公开包最后更新较早早期Evals框架不能视为当前主接口的活跃保证

GitHub与开源情况

Hamming平台本身是商业闭源服务,官网没有把完整产品代码或评测模型作为开源项目发布。公开包管理器中存在采用MIT或ISC许可证的早期SDK,但它们只覆盖客户端代码。

项目公开状态许可证或维护结论
Hamming商业平台未公开完整源码商业服务不开源
评测模型与运行系统未公开未披露不是开放权重项目
hamming-sdk Python包公开MIT,0.0.17,2024年9月更新早期SDK,不代表平台开源
hamming-sdk JavaScript包公开ISC,1.0.27,约两年前更新早期SDK,维护状态需确认
第三方C# SDK公开但由tryAGI维护MIT不是Hamming官方产品代码

新集成应优先使用客户工作区中的当前REST API文档,不要只根据旧SDK包开发。采购时应要求明确API版本支持、弃用通知、SDK路线和退出导出方式。

隐私政策

Hamming的法律运营实体为Forward Inc,现行公开隐私政策最后更新于2024年12月14日。政策适用于网站、账号、销售、营销和相关服务。

数据或规则当前政策
账号与联系信息姓名、电话、邮箱、地址、职位、用户名和密码等
付款支付工具信息由Stripe保存
自动收集IP、浏览器、设备、使用时间、Cookies和分析数据
敏感信息只有与客户签署BAA后才处理
客户数据训练不用于训练,也不用于惠及其他客户
用户生成数据销售不出售
网站分析使用Google Analytics
一般保存在账号有效和业务目的需要期间保存,法律要求可更久
无法立即删除的备份安全隔离,直到可以删除
未成年人不主动收集或营销给18岁以下用户

隐私政策没有为所有录音、转写和测试证据公布统一固定保存天数。FAQ说明测试录音会加密保存并支持按客户要求配置期限,生产使用前应在订单或DPA中确定具体数值。

数据权利

  • 符合条件的用户可请求访问、导出、更正或删除个人信息。
  • 部分地区用户可限制敏感信息使用或反对特定处理。
  • 用户可以退出营销邮件并撤回适用的同意。
  • 终止账号后,平台会删除或停用活跃数据库中的信息。
  • 为防欺诈、调查、执行条款或法律要求,部分记录可能继续保留。
  • 隐私请求和申诉通过官方联系邮箱处理。

安全与合规

Hamming在2025年12月完成SOC 2审计,当前官网标示SOC 2 Type II。医疗客户可签署BAA以支持HIPAA工作流,平台还提供美国、欧盟和英国数据驻留及单租户选项。

控制或能力当前公开状态采购核验
SOC 2 Type II已完成并在官网展示索取当前报告、期间、范围和例外
HIPAA可签署BAA在任何PHI进入平台前完成签署
加密录音与数据在传输和静态状态加密确认算法、密钥和备份范围
RBAC支持按工程、产品、QA和管理角色测试
SSO支持Okta等企业身份服务确认SAML或OIDC、强制范围和离职撤权
审计日志支持并可导出到SIEM确认事件覆盖和保存期
数据驻留美国、欧盟和英国选项确认所有分包商、备份和支持数据
单租户企业选项验证网络、密钥、升级和管理面隔离
PII检测测试和监控泄露风险不能替代完整脱敏和访问控制

SOC 2和BAA不表示客户的智能体自动符合所有法规。录音同意、支付卡、医疗信息、地区转移、营销电话和保留责任仍需由客户配置、测试和持续监督。

生产数据安全建议

  1. 先用完全合成的数据完成基础POC,不上传真实客户录音。
  2. 审查SOC 2范围、DPA、BAA、分包商、数据流和事件响应。
  3. 为音频、原始转写、脱敏转写、元数据和工具证据分别设定保存期。
  4. 配置SSO、MFA、RBAC和最小权限,并定期复核访问。
  5. 在导入前移除不需要的PII、PHI、支付卡和凭证。
  6. 限制人工支持人员访问真实生产证据的条件和审计。
  7. 验证导出、删除、备份过期和合同终止流程。
  8. 每次新增模型、平台、地区或分包商后重新执行风险审查。

适合哪些用户

  • 语音AI工程团队:验证提示词、模型、ASR、TTS、工具和延迟。
  • QA团队:建立自动化场景、回归集和发布门禁。
  • 产品经理:定义业务成功并比较不同智能体版本。
  • 客服与运营:发现生产通话中的失败和客户痛点。
  • 安全团队:执行提示注入、越狱、PII泄露和工具越权测试。
  • 合规团队:检查脚本、身份验证、披露和审计证据。
  • 医疗与金融机构:在签署适用合同后监控高风险语音流程。
  • 平台厂商和系统集成商:对多家语音提供商采用统一指标。

典型使用场景

  • 在预约机器人上线前验证创建、改期、取消和工具写入。
  • 更换LLM、ASR或TTS后比较质量、延迟和成本。
  • 对新提示词运行历史回归,防止旧问题重新出现。
  • 测试口音、噪声、打断和长达70轮以上的复杂通话。
  • 用50,000路以上并发活动评估企业峰值容量。
  • 在生产环境持续检测幻觉、偏离脚本和隐私泄露。
  • 把真实客户失败回放到修复版本并生成发布证据。
  • 把测试结果与CI、Slack、SIEM和OpenTelemetry连接。

产品优势

  • 覆盖测试、监控、红队、回放和回归的完整生命周期。
  • 直接分析音频,能发现转写文本看不出的交互问题。
  • 自动根据提示词生成大量场景,降低手工编写成本。
  • 支持65种以上语言、地区口音、噪声和不同说话行为。
  • 原生连接多种主流语音平台,也支持SIP、WebRTC和自研系统。
  • 50多项内置指标加不限数量的自定义评分器。
  • 支持CI/CD、REST API、Webhooks和OpenTelemetry。
  • 企业并发负载可扩展到50,000路以上。
  • SOC 2 Type II、BAA、数据驻留、SSO和单租户满足企业采购方向。
  • 计费主要按测试量而不是席位,跨团队协作不额外增加主要席位费。

主要限制

  • 没有公开固定套餐金额,预算需要经过演示和报价。
  • 不提供传统自助免费试用,个人开发者体验门槛较高。
  • 公开文档需要访问码,API端点和权限无法在购买前完整浏览。
  • 旧Python和JavaScript SDK已约两年未更新,兼容性需要确认。
  • AI评分即使与人工较一致,也可能在新语言或领域产生偏差。
  • 高并发测试会同时消耗电话、语音、模型和业务API费用。
  • 生产监控会处理真实录音、转写和工具证据,需要严格数据治理。
  • 厂商发布的95%预测准确、95%至96%人工一致和90%竞品胜率均需在自身场景复验。
  • 平台面向企业质量保障,不是用来直接构建语音智能体的完整运行时。

支持平台

平台或方式支持情况主要用途
Web控制台支持配置测试、查看录音、报告、趋势和监控
SIP电话支持入站、出站、IVR、DTMF与传统电话链路
WebRTC支持LiveKit、Pipecat、Daily和网页智能体
REST API支持,客户文档受限自动化测试、结果和监控
Webhooks支持连接流水线、告警和外部系统
CI/CD支持GitHub Actions、Jenkins及其他系统
OpenTelemetry支持导入追踪、跨度和日志
MCP官方资源称支持查询通话、分析质量和运行测试
移动原生应用未发现主要通过网页使用
浏览器扩展未发现无公开扩展

基本信息

项目内容
工具名称Hamming AI
法律实体Forward Inc
成立时间2024年
创始人兼CEOSumanyu Sharma
加速器Y Combinator S24
产品类型语音与聊天智能体测试、监控和安全评测
主要客户语音AI团队、企业客服、医疗、金融和高增长公司
语言65种以上
内置指标50多项
企业负载50,000路以上并发测试通话
定价定制报价,主要按测试量和使用量
传统免费试用不提供,改为个性化演示与入门
API有,完整文档客户可见
SDK有早期Python和JavaScript包,当前维护需确认
是否开源产品不开源,部分旧客户端SDK开源
SOC 2Type II
HIPAA支持签署BAA
数据驻留美国、欧盟和英国选项
核验日期2026年8月23日

推荐指数

推荐指数:4.7 / 5。Hamming把音频原生评测、真实场景模拟、生产监控、回放和CI门禁连接得较完整,特别适合已经在生产运行语音智能体的团队。

价格和完整文档不公开,且生产监控涉及高度敏感数据,因此它更适合有正式采购、安全和QA流程的组织,而不是只想免费试几个电话机器人的个人用户。

常见问题

Hamming AI是什么?

Hamming AI是语音与聊天智能体的测试和监控平台,用于自动模拟对话、评估质量、执行红队、监控生产通话并把失败转成回归用例。

Hamming会帮我创建语音机器人吗?

它的主要定位不是智能体构建器,而是连接并评测已有智能体。用户需要先有Vapi、Retell、ElevenLabs、LiveKit、Pipecat或自研语音系统。

Hamming AI多少钱?

官网没有公开固定金额。方案主要按测试量和生产使用量报价,而不是按团队成员席位收费。

Hamming有免费试用吗?

当前FAQ表示没有传统自助免费试用。团队可以预约个性化演示,并在入门中使用自身智能体和场景体验。

Hamming支持中文吗?

支持中文测试,并列出普通话简体、繁体和粤语等变体。实际识别、音频评分和业务术语表现仍需用本地说话者校准。

Hamming如何测试打断和延迟?

平台模拟抢话、长静音、快慢语速和其他真实行为,并把延迟分解到VAD、ASR、LLM和TTS,同时展示p50、p90和p99。

Hamming支持生产监控吗?

支持。它可以持续评估真实通话、按阈值告警、重放黄金通话,并把生产失败转为永久回归测试。

Hamming可以测试自研语音智能体吗?

可以。自研系统可通过SIP、WebRTC或REST API接入,不依赖固定的LLM、语音识别或语音合成提供商。

Hamming符合HIPAA吗?

Hamming可与医疗客户签署BAA并提供相关安全控制。必须先完成BAA和数据审查,不能在未签署时上传PHI。

Hamming会用客户数据训练模型吗?

公开隐私政策明确表示不使用客户数据进行训练,也不用于惠及其他客户,并且不出售用户生成数据。

Hamming开源吗?

完整平台不开源。早期Python和JavaScript SDK采用开放许可证,但客户端包开源不代表评测平台、模型或运行系统开源。

Hamming支持MCP吗?

官方2026年资源说明提供Hamming MCP服务器,可运行测试、查询通话和搜索转写。公开安装资料有限,具体权限需通过客户文档确认。

总结

Hamming适合把语音智能体从“偶尔人工拨打几次”升级为可持续的工程质量体系。它能自动生成场景、直接听音频、模拟真实干扰、比较版本,并把生产事故固化为回归测试。

采购前应确认报价、测试量、第三方通话成本、API版本、数据驻留、保存和企业合同。上线后的最佳实践是让自动评分与人工校准并存,并把每个高风险失败都转成长期发布门禁。

©️版权声明:若无特殊声明,本站所有文章版权均归AI工具分享原创和所有,未经许可,任何个人、媒体、网站、团体不得转载、抄袭或以其他方式复制发表本站内容,或在非我站所属的服务器上建立镜像。否则,我站将依法保留追究相关法律责任的权利。

类似于Hamming AI的工具