AIxBlock是什么?
AIxBlock是一家面向企业语音AI和大语言模型团队的训练数据合作伙伴,提供数据采集、转录、标注、质量控制、模型评估和自托管交付。
当前官网重点聚焦语音、音频、文本和对话数据,不再以早期宣传中的通用去中心化AI开发平台作为主要产品定位。采购与评估时应优先依据现有产品页和项目合同。
AIxBlock主要服务
1. 语音与对话数据采集
AIxBlock可组织专业配音人员或普通母语者录制脚本语音、自然对话和特定业务场景,覆盖不同语言、口音、年龄与人群。
- 脚本朗读与自发对话录制。
- 不同地区口音、方言和语码切换。
- 呼叫中心、语音助手和客服场景。
- 面向ASR、STT、TTS和对话AI的定制数据。
2. 转录与语音标注
团队可获得逐字转录、时间戳、说话人分离、音素标注、情绪和意图等标签。项目会根据模型目标设计标注规范和验收标准。
语音数据中常包含重叠说话、背景噪声、口头语和不完整句子,因此项目应在开始前明确是否保留这些真实特征。
3. 环境与工业声音数据
除了人声,AIxBlock还可采集街道、办公室、自然环境、机器、设备、家电、报警和其他声音事件,用于声学分类与异常检测。
- 声音事件检测和环境场景识别。
- 工业设备异常声音识别。
- 降噪与回声处理模型训练。
- 安全、智能家居和辅助设备开发。
4. 文本与对话数据
面向大语言模型的服务包括多轮对话标注、意图分类、实体识别、槽位填充和领域文本采集。数据可用于训练、微调、评估和安全测试。
5. SFT与RLHF偏好数据
AIxBlock可制作提示词与回答配对的监督微调数据,也可组织人员比较多个模型输出,依据正确性、安全性和任务完成度进行排序。
这类数据应围绕具体业务规则设计,而不是只收集泛化的点赞或差评。医疗、法律、金融等领域还需要相应专家参与与复核。
6. 现成呼叫中心音频库
官方提供可直接授权的真实呼叫中心音频,覆盖多种语言、口音和业务领域。企业可以先获取样本评估声学特征与数据格式,再决定大批量许可。
部分数据可额外配套转录和标注。涉及姓名、支付卡或其他个人信息时,平台说明会按需要进行PII脱敏,但采购方仍需验证具体处理标准。
7. 自托管数据平台
AIxBlock支持把采集、标注、质量控制、训练和评估工作流部署在客户本地、私有云或混合环境中。客户可从项目开始就连接自己的存储。
这种方式用于让原始数据保留在客户安全边界内,降低第三方SaaS长期保存专有数据的风险,适合银行、医疗、政府和其他受监管组织。
质量控制方式
- 通过多层身份、设备和会话验证降低代理作业与身份不符。
- 使用一致性指标、共识检查和高级审核员抽检标注。
- 利用项目专用AI助手回答标注规则问题。
- 用自动化质量监控识别异常和不一致结果。
- 由项目经理和领域专家管理交付、抽样与返工。
质量机制只能提高发现问题的概率,不能代替客户自己的基准测试。企业应在合同中写明准确率、抽样比例、错误类型、返工规则和最终验收方法。
适合哪些用户?
- 开发语音识别、语音合成和语音助手的团队。
- 需要多语言或小语种训练数据的模型公司。
- 为客服、银行和呼叫中心训练对话模型的企业。
- 进行SFT、RLHF、DPO或模型评测的大模型团队。
- 不能把敏感训练数据上传到公共SaaS的受监管组织。
- 希望参与录音、转录、语言标注或AI评估项目的贡献者。
企业采购流程
- 明确模型目标、数据类型、语言、地区、音频条件和最终交付格式。
- 说明项目规模、时间表、领域知识、隐私等级和数据使用边界。
- 向AIxBlock申请样本、目录或定制项目报价,并签署必要的保密协议。
- 核查数据来源、参与者同意、授权范围、排他性和可商用权利。
- 制定标注指南、黄金样本、质量指标、抽样与返工规则。
- 决定使用托管交付还是自托管平台,并完成安全与架构评审。
- 先运行小规模试点,在自己的模型上验证效果和偏差。
- 试点达标后分批扩展,并持续监控数据漂移、语言覆盖与模型收益。
服务版本与定价方式
截至2026年8月25日,AIxBlock没有公布统一的按行、按小时或按席位价目表。官网采用项目询价方式,费用会根据数据类型、语言、规模、专家等级、质量要求、交付速度和部署方式确定。
| 服务模式 | 主要内容 | 价格方式 | 适合场景 |
|---|---|---|---|
| 现成音频库 | 已有呼叫中心或语音数据,可选转录标注 | 按目录、样本与授权范围询价 | 需要快速获得真实生产音频 |
| 定制数据项目 | 采集、转录、标注、SFT、RLHF和评测 | 根据语言、数量、难度与质量定制 | 需要专属领域和严格规范 |
| 自托管平台 | 在客户基础设施运行数据、训练与评估工作流 | 演示与企业合同报价 | 数据主权和合规要求较高 |
官网联系表的项目规模选项从一万美元以下到五百万美元以上不等,这只是需求分级,并不是套餐售价或最低采购额。最终价格应以书面报价、工作说明和合同为准。
为什么没有固定每条价格?
通用意图标注和由临床专家复核的医疗对话,人员成本、风险和质量要求完全不同。语音项目还会受到录音环境、口音稀缺度、转录粒度和隐私处理影响。
采购方不应只比较单条数据价格,还要计算合格率、返工、项目管理、授权证明、存储与安全审计等总成本。
数据授权与版权核查
训练数据的价值不仅取决于数量,还取决于是否拥有明确的收集同意、使用许可和再训练范围。真实呼叫中心录音尤其需要核查原始告知、个人信息处理和跨境传输依据。
- 确认数据是定制独占、非独占许可还是可重复授权。
- 明确能否用于训练、微调、评测、商业部署和再分发。
- 要求保存参与者同意和数据来源证明。
- 约定删除、撤回、纠错和权利投诉的处理流程。
- 避免把“已脱敏”理解为绝对无法重新识别。
隐私与安全
AIxBlock隐私政策覆盖网站用户、客户、项目贡献者和服务中的个人数据,并提及GDPR、英国数据保护法与CCPA等框架。跨境处理可能依赖标准合同条款或其他合法机制。
官方安全页面称平台完成ISO 27001:2013认证和SOC 2 Type II合规。企业仍应索取当前有效证书、审计范围、例外项和分包商清单,而不是只依赖网站徽标。
- 明确数据控制者、处理者和分包商角色。
- 审查身份权限、日志、密钥、备份和事件响应。
- 对PII、PHI、支付信息和政府数据采用单独控制。
- 核查自托管环境中哪些组件仍需连接外部服务。
- 在项目结束后验证数据副本、缓存和临时文件的删除。
贡献者参与方式
AIxBlock也招募录音人员、转录员、语言专家、领域专家和AI评估人员。贡献者可申请项目、完成测试并按项目要求工作。
参与前应核对工作内容、数据用途、报酬方式、税务、身份验证和撤回条件。涉及生物识别、健康、种族或其他敏感信息时,平台应事先获得明确同意。
开源状态与GitHub说明
AIxBlock曾在2025年前后宣布通用AI开发平台开源,并公开过相关GitHub仓库。核验时,历史公告指向的两个官方仓库均已无法访问,返回不存在页面。
因此不能把当前企业训练数据服务和自托管产品直接标记为“可从GitHub下载的活跃开源项目”。历史开源代码、当前商业平台、数据资产和客户交付应分别判断。
产品优势
- 专注语音、音频、文本和对话数据,不是泛化标注商店。
- 支持一百多种语言与不同地区口音。
- 覆盖采集、转录、标注、偏好数据和质量控制全流程。
- 现成音频库可缩短从采购到模型实验的时间。
- 自托管交付适合有数据主权和审计要求的组织。
使用限制
- 没有公开统一定价,前期需要商务沟通、样本测试和合同谈判。
- 官网展示的案例准确率和交付周期来自特定项目,不保证其他项目相同。
- 自托管可以降低数据外流风险,但会增加客户自己的基础设施与运维责任。
- 数据质量和模型效果仍受标注规范、语言覆盖和训练方法影响。
- 历史产品资料可能与当前企业数据服务定位不一致。
- 旧GitHub仓库当前不可访问,不能据此确认仍有维护中的开源版本。
常见问题
AIxBlock现在主要做什么?
当前主要提供企业级语音、音频、文本与对话训练数据,以及现成呼叫中心音频和自托管数据平台。
可以只购买现成数据吗?
可以申请现成音频目录和样本,也可以加购转录与标注。授权范围、语言、格式和价格需要单独确认。
支持RLHF数据吗?
支持。平台可组织人员比较模型回答,并依据项目定义的正确性、安全性和任务完成度进行排序与评分。
自托管是否等于完全没有外部依赖?
不一定。采购方仍需确认身份验证、人员访问、模型、GPU市场、更新和支持组件是否连接外部服务。
AIxBlock是开源工具吗?
历史上曾发布开源公告,但相关官方GitHub仓库核验时已不可访问。当前应把企业服务视为商业项目,开源状态需等待新的官方仓库与许可证证明。
桂公网安备45132202000164号