Affinda是一款面向企业的文档AI平台,可把发票、简历、理赔材料、贷款文件和物流单据转换为结构化数据。它强调可验证、可追踪和可接入业务流程,而不只是完成一次OCR识别。
平台允许团队创建自定义文档类型、提取字段和表格,并通过规则校验、主数据匹配与人工复核提高结果可靠性。用户也可以借助Affinda Agent,用自然语言配置工作区和处理流程。
Affinda是什么
Affinda定位为生产级智能文档处理平台,核心流程包括接收文件、识别文档、拆分与分类、提取数据、验证结果和输出到业务系统。它适合处理格式多变、数量较大且需要审计记录的企业文档。
- 从PDF、扫描件和图片中识别文字与版面信息
- 将混合文件包拆分为独立文档并自动分类
- 提取字段、复杂表格、签名、复选框和手写内容
- 利用规则、置信度和主数据匹配验证结果
- 通过人工复核队列处理低置信度或异常项目
- 借助API、Webhook、电子邮件和嵌入式界面连接现有系统
核心功能
自定义文档类型
团队可以针对自身文件建立文档类型和字段架构,不必局限于平台预置模板。字段可覆盖文本、日期、金额、地址、实体、列表和嵌套数据等结构。
- 为不同业务文件定义独立的数据结构
- 设置必填字段、数据类型和字段说明
- 处理同类文档中不同供应商或版式的变化
- 在一个工作区内管理多种文档类型
文档拆分与分类
当一个PDF包含多份材料时,Affinda可识别边界、拆分文件并判断每一部分的文档类型。该能力适合贷款包、理赔包、入职资料和批量扫描档案。
- 识别多文档文件包中的起止页
- 自动路由到对应提取模型或工作队列
- 分类模式可单独运行,无需提取全部字段
- 可为不确定结果设置人工确认步骤
OCR与版面理解
平台同时处理机器打印文字、扫描内容和部分手写信息,并保留文字位置及页面结构。表格、键值对和视觉布局可作为字段判断依据。
- 识别扫描版PDF和常见图片文件
- 提取多页文档中的连续内容
- 支持复杂表格、复选框、签名和格式信息
- 覆盖50多种语言,包括简体中文和繁体中文
字段与复杂表格提取
Affinda不仅返回纯文本,还可以把关键信息映射到预先定义的字段。对于包含多行商品、费用或经历记录的文件,可输出结构化数组和表格。
- 提取名称、编号、日期、金额和地址
- 识别发票及订单中的多行明细
- 解析简历中的工作经历、教育和技能
- 对结果进行格式化、标准化和文本转换
验证规则与主数据匹配
用户可以设置自然语言验证规则,对金额关系、日期范围、字段完整性和业务条件进行检查。提取值还可与供应商、客户或产品主数据匹配,减少名称差异造成的错误。
- 检查小计、税额与总金额是否一致
- 验证证件、保单或合同日期是否有效
- 将非标准名称映射到内部主数据记录
- 标记缺失、冲突或不符合规则的字段
人工复核与质量控制
低置信度字段和规则异常可进入人工复核界面,由业务人员对照原文修正。平台记录置信度、处理时间与操作轨迹,便于质量分析和审计。
- 按队列分配待复核文档
- 在原始页面旁查看和修正字段
- 使用角色权限控制查看与操作范围
- 保留审计日志与状态变化记录
Affinda Agent
Affinda Agent是平台中的自然语言配置助手。用户可以描述需要处理的文档和字段,由Agent协助创建工作区、文档类型、提取字段及验证规则。
- 用自然语言说明文档处理目标
- 根据样例文件建议字段和数据结构
- 协助建立验证规则和输出格式
- 减少初始配置中的重复操作
Agent生成的配置仍应由熟悉业务规则的人员检查。对于监管、财务或理赔流程,不能只依赖自动建议决定最终字段和验证逻辑。
工作流与自动化
文档进入平台后,可依次经过分类、提取、规则验证和人工复核,再发送到下游系统。队列机制适合把不同优先级、客户或业务类型的文件分开处理。
- 按文档类型或结果状态进行自动路由
- 为低置信度结果建立人工复核分支
- 使用Webhook在状态变化时触发后续动作
- 将结构化数据写入ERP、ATS、CRM或自建系统
API与集成方式
Affinda提供REST API、客户端库和Webhook,开发团队可在应用中提交文档、读取结果并跟踪处理状态。非开发团队也可以通过电子邮件上传和嵌入式验证界面参与流程。
| 集成方式 | 主要用途 | 适合用户 |
|---|---|---|
| REST API | 提交文档、读取结构化结果和管理资源 | 开发团队 |
| 客户端库 | 以常用编程语言调用平台能力 | 应用开发者 |
| Webhook | 在文档完成或状态变化时接收通知 | 自动化流程 |
| 电子邮件上传 | 通过指定邮箱接收和处理附件 | 运营与财务团队 |
| 嵌入式验证界面 | 在现有应用内复核识别结果 | 软件服务商 |
| Affinda Agent | 用自然语言建立处理配置 | 业务与实施人员 |
支持的文档类型
平台可建立自定义文档类型,因此应用范围并不限于固定模板。下面是较常见的企业文档处理方向。
| 类别 | 文档示例 | 常见提取内容 |
|---|---|---|
| 财务采购 | 发票、收据、采购订单 | 供应商、日期、金额、税额、行项目 |
| 招聘人事 | 简历、申请表、证书 | 个人信息、经历、教育、技能 |
| 保险 | 理赔表、保单、证明材料 | 保单号、索赔人、损失项目、金额 |
| 金融贷款 | 申请表、银行流水、贷款资料包 | 申请人、账户、收入、风险信息 |
| 物流贸易 | 提单、装箱单、报关文件 | 货物、数量、港口、承运方 |
| 身份与合规 | 护照、身份证明、合规文件 | 姓名、证件号、有效期 |
| 法律与合同 | 合同、协议和附件 | 当事方、日期、条款、关键实体 |
适用场景
- 财务团队自动录入发票、收据和采购订单
- 招聘平台批量解析简历并写入候选人系统
- 保险机构整理理赔包并检查材料完整性
- 银行和金融科技企业处理贷款申请资料
- 物流企业提取提单、装箱单和报关数据
- 软件服务商把文档识别和人工复核嵌入产品
- 合规团队在区域部署环境中处理敏感文件
适合哪些用户
- 需要处理大量重复文档的中大型企业
- 希望用API加入文档AI能力的软件开发团队
- 需要自定义字段、规则和工作流的业务部门
- 重视权限、审计日志和区域部署的受监管组织
- 处理多语言文档和跨地区业务的国际团队
开始使用教程
- 注册试用账户并创建组织和工作区。
- 选择预置文档类型,或根据业务文件创建自定义类型。
- 上传具有代表性的样例文件,定义需要提取的字段和表格。
- 检查初次识别结果,并补充字段说明、转换和验证规则。
- 设置人工复核队列、角色权限和结果通过条件。
- 通过API、Webhook、电子邮件或嵌入式界面连接业务系统。
- 使用真实文档进行小规模测试,统计准确率、异常率和单页成本。
- 确认质量和预算后再扩大处理量,并持续抽查结果。
创建自定义文档模型
- 收集覆盖常见版式、语言和异常情况的样例文档。
- 建立文档类型,并为每个目标字段选择合适的数据结构。
- 为字段写清名称、含义和期望格式,避免语义重叠。
- 测试表格、手写、复选框和跨页字段的提取效果。
- 加入金额、日期、必填项和主数据匹配规则。
- 把低置信度字段送入人工复核,并记录错误原因。
- 根据复核结果迭代配置,直至达到业务验收标准。
API接入教程
- 在账户中创建权限范围合适的API密钥。
- 确认目标工作区和文档类型标识。
- 通过安全连接提交文件,并保存返回的文档标识。
- 轮询状态或配置签名Webhook接收完成通知。
- 读取字段值、置信度、页码和验证结果。
- 将异常结果送入复核流程,正常结果写入业务系统。
- 记录请求、耗时和积分消耗,并为失败请求设置重试。
效果评估方法
文档AI是否可上线,不能只看少量演示文件。建议分别统计字段准确率、文档通过率、人工复核比例、处理时间和实际积分成本。
| 指标 | 评估重点 | 建议做法 |
|---|---|---|
| 字段准确率 | 关键字段是否正确 | 按字段类型抽样核对 |
| 完整率 | 必填字段是否遗漏 | 统计空值和未识别比例 |
| 分类准确率 | 文档是否进入正确流程 | 使用混合文件包测试 |
| 拆分准确率 | 页边界是否判断正确 | 测试不同长度和扫描顺序 |
| 人工复核率 | 自动化能节省多少工作 | 记录低置信度和规则异常 |
| 处理时延 | 能否满足业务时效 | 分别测试常规和高峰批量 |
| 单文档成本 | 积分和人工成本总和 | 按真实平均页数核算 |
Affinda平台定价
Affinda平台采用按处理页数计费的模式,核心功能不按席位或模块分别设限。公开页面未列出统一单页价格,实际报价会结合处理量、部署方式、支持服务和附加项目确定。
| 方案 | 计费方式 | 适合情况 | 主要说明 |
|---|---|---|---|
| 免费试用 | 2周内200 Credits | 功能验证和小规模测试 | 可测试核心文档处理能力 |
| 月度用量 | 按月后付费 | 处理量不确定或波动明显 | 根据当月实际页面用量结算 |
| 年度承诺 | 预先约定年度用量 | 处理量稳定且可预测 | 超额部分按约定费率计算 |
| 定制方案 | 联系销售报价 | 高容量、特殊部署或支持需求 | 价格取决于规模、部署和附加服务 |
年度承诺中未用完的额度通常不会自动结转,因此企业应以真实平均页数和业务波动估算采购量。实施、培训、持续集成维护、定制基础设施及特殊合规支持可能作为附加服务收费。
简历解析产品价格
Affinda的招聘文档产品采用独立价格体系,按页即用即付或按年度文档量购买。以下为公开方案中的参考档位,最终价格和权益以账户或合同为准。
| 方案或年度文档量 | 参考价格 | 说明 |
|---|---|---|
| 按量付费 | 0.20美元/页 | 无年度承诺,前14天含200页试用 |
| 66,000份/年 | 3,600美元/年 | 年度起步方案 |
| 132,000份/年 | 6,000美元/年 | 超额按约定单文档费率 |
| 240,000份/年 | 9,000美元/年 | 适合中等规模招聘平台 |
| 420,000份/年 | 12,000美元/年 | 适合较高处理量 |
| 600,000份/年 | 15,000美元/年 | 适合大规模解析 |
| 780,000份/年 | 18,000美元/年 | 更高用量可定制报价 |
Credits与计费规则
- 多数文档AI产品按处理页数消耗Page Credits
- 招聘产品通常按Document Credits计算
- 仅分类模式每份文档最多消耗3个Credits
- 可配置连续页码范围,未处理页面不计入消耗
- 按量账户可购买Credits并设置自动充值
- 月度方案通常在实际使用后结算
- 高容量客户可申请定制套餐和发票结算
处理限制
平台没有统一的文档提交总量上限,但队列速度、单文档页数和账户配置会影响实际吞吐。公开文档列出的高优先级队列为每分钟20份文档,默认单文档上限为20页。
| 项目 | 公开规则 | 注意事项 |
|---|---|---|
| 提交总量 | 未设置统一总量上限 | 仍受账户额度和队列速度影响 |
| 高优先级队列 | 每分钟20份文档 | 超量任务可使用低优先级队列 |
| 默认页数 | 单文档20页 | 可联系平台申请提高 |
| 分类专用模式 | 每份最多3个Credits | 只分类,不执行完整字段提取 |
| 选择性页面 | 可指定连续页码范围 | 排除页面不处理也不计费 |
安全与部署
Affinda提供角色权限、多因素认证、审计日志和区域化服务,并公开说明其符合ISO 27001与SOC 2相关控制要求。企业仍需根据自身行业规定审查合同、数据保留、跨境传输和子处理方安排。
- 使用角色权限限制工作区和功能访问
- 支持电子邮件或身份验证器多因素认证
- API密钥可按用途控制权限范围
- 保留操作和处理状态的审计记录
- 可讨论区域部署与自托管方案
- 敏感文档接入前应完成企业安全评估
自托管与开源情况
Affinda公开了自托管部署配置和说明仓库,但核心解析服务、容器和模型并未因此成为开源软件。获得自托管镜像和相关组件通常需要商业许可及平台授权。
| 组件 | 开放状态 | 说明 |
|---|---|---|
| Affinda平台 | 商业闭源 | 核心云服务和管理平台未开源 |
| 文档解析模型 | 商业闭源 | 模型权重和训练代码未公开 |
| 自托管配置 | 公开仓库 | 提供部署说明,核心镜像需授权 |
| 客户端库 | 公开可用 | 用于调用API,不等于开放核心引擎 |
| API | 商业服务 | 按账户、用量和合同权限调用 |
产品优势
- 支持自定义文档类型,不局限于少量固定模板
- 把分类、拆分、提取、验证和复核放在同一平台
- 可处理复杂表格、手写、签名与复选框
- 提供自然语言Agent,降低初始配置门槛
- API、Webhook和嵌入式复核界面较完整
- 支持50多种语言,适合跨地区文档流程
- 提供权限、审计、区域部署和自托管选择
使用限制与注意事项
- 平台核心产品不是开源软件,自托管也需要商业授权
- 通用平台没有公开统一单页价格,预算前需获取报价
- 年度未用额度通常不结转,采购量估算过高会造成浪费
- 默认单文档页数和高优先级队列速度可能需要申请调整
- 复杂版式、低质量扫描和非标准手写仍可能需要人工复核
- 自然语言Agent可以辅助配置,但不能替代业务规则审查
- 涉及财务、保险或合规决策时必须保留人工校验环节
- 准确率会随文档类型和样本分布变化,上线前应以真实数据测试
基本信息
| 字段 | 内容 |
|---|---|
| 工具名称 | Affinda |
| 工具类型 | 企业文档AI与智能文档处理平台 |
| 核心能力 | OCR、分类、拆分、字段提取、验证和人工复核 |
| 常见文档 | 发票、简历、理赔材料、贷款包和物流单据 |
| 支持语言 | 50多种,包括简体中文和繁体中文 |
| 集成方式 | REST API、客户端库、Webhook、邮件和嵌入式界面 |
| 部署方式 | 云端、区域部署及授权自托管 |
| 免费试用 | 平台2周200 Credits |
| 价格模式 | 按页用量、年度承诺或定制报价 |
| 是否开源 | 核心产品不开源;部分配置和客户端库公开 |
推荐指数
4.5 / 5。Affinda适合需要自定义字段、复杂表格、规则验证和企业集成的文档流程,平台能力完整;但正式采购前应重点核算真实页数、复核比例、吞吐限制和商业报价。
常见问题
Affinda主要做什么?
它把PDF、扫描件和图片中的业务信息转换为结构化数据,并提供分类、拆分、验证、人工复核和系统集成能力。
Affinda只是OCR工具吗?
不是。OCR只是基础环节,平台还负责文档分类、字段和表格提取、业务规则校验、主数据匹配及工作流路由。
Affinda免费吗?
平台提供2周和200 Credits的试用额度,正式使用按页数、年度承诺或定制合同计费。
Affinda支持中文吗?
支持。官方资料将简体中文和繁体中文列入50多种支持语言,但具体文档准确率仍应使用自身样本测试。
能处理多份材料合并的PDF吗?
可以。平台能够判断文档边界、拆分多页文件包并把不同材料分类到相应流程。
能提取复杂表格吗?
可以,平台支持复杂表格和多行数据结构,但版式变化大或扫描质量差时可能需要人工复核。
Affinda提供API吗?
提供。开发者可通过REST API和客户端库提交文档、读取字段与置信度,并用Webhook接收状态通知。
Affinda可以私有部署吗?
可以讨论授权自托管和定制部署,但核心镜像、解析模型与平台仍是商业闭源产品,需要联系销售获得权限。
Affinda的年度额度会结转吗?
公开定价说明显示,未使用的年度承诺额度通常不会结转,采购前应按真实业务量评估。
Affinda开源吗?
核心平台和解析模型不开源。官方公开了部分客户端库和自托管部署配置,但这不代表核心服务可以无许可使用。
桂公网安备45132202000164号