NuMind是什么
NuMind是一家专注文档信息抽取的AI公司,当前核心产品是NuExtract平台和NuExtract3多模态模型。它能把PDF、扫描件、图片、表格和文本转换为结构化JSON或适合RAG的Markdown。
早期NuMind主要提供文本分类、实体识别和低代码NLP模型训练。现行官网已经转向文档抽取与OCR,目录介绍应以NuExtract3、NuMarkdown、API和企业私有部署为主。
核心功能
- 结构化抽取:按用户定义的JSON模板返回字段和层级关系。
- 多模态理解:同时处理文本、图片及文字与图片组合输入。
- 文档转Markdown:识别标题、段落、列表、表格和公式。
- 模板生成:根据自然语言说明或样本文档创建抽取结构。
- 示例学习:加入少量输入与标准输出改善特定任务。
- 多语言处理:面向不同语言的文件执行抽取和OCR。
- 批量接口:通过异步任务处理生产环境文档。
- Python SDK:创建项目、上传示例、提交文件并获取结果。
- 私有部署:支持企业私有云或本地环境。
- 定制模型:为高用量或高准确率场景提供微调。
NuExtract3模型
NuExtract3是统一的40亿参数视觉语言推理模型,兼顾结构化信息抽取与图像转Markdown。输入可以是文本、单页或多页图像,并可选择推理或非推理模式。
- 根据模板和指令输出可解析JSON。
- 从发票、表单、合同、收据和复杂表格读取数据。
- 将文档图像转换为带层级的Markdown。
- 识别表格并使用适合表达结构的标记。
- 保留数学公式和代码等特殊内容。
- 处理长输入和较大的结构化输出。
- 可使用公开权重在自有环境推理。
结构化数据抽取
用户先用JSON Schema或平台模板描述需要的字段,再提供文档和可选示例。模型只围绕目标结构提取信息,适合把非结构化文件写入数据库、业务系统或审查流程。
- 发票:供应商、日期、税额、总额和明细行。
- 合同:当事人、期限、金额、续约和终止条款。
- 简历:姓名、经历、技能、教育和证书。
- 保险:保单、索赔、损失、责任和附件信息。
- 医疗:表单字段、编码、药物和就诊记录。
- 银行:客户证明、交易、贷款和合规字段。
- 技术资料:部件、规格、参数和层级关系。
NuMarkdown与OCR
NuMarkdown用于把复杂文档转成干净的Markdown,尤其关注布局、表格和RAG预处理。现行NuExtract3已把Markdown转换能力整合进统一模型,旧NuMarkdown仓库仍可用于理解该技术路线。
- 把标题和段落恢复为清晰层级。
- 将复杂表格输出为Markdown或HTML结构。
- 使用LaTeX表达数学公式。
- 处理扫描件、图片型PDF和异常布局。
- 为向量检索和知识库保留可读结构。
- 通过推理先分析版面再生成最终文本。
模板与示例学习
NuExtract把抽取任务组织为项目,项目包含模板、说明、设置和示例。模板可以从自然语言描述自动生成,也能由JSON Schema转换后继续修改。
- 用空字符串表示需要抽取的文本字段。
- 用数组描述可能重复出现的明细项。
- 加入嵌套对象表达层级关系。
- 提供正确输出示例指导字段含义。
- 使用负样本测试不存在字段是否保持为空。
- 锁定验证完成的项目以减少意外修改。
API与Python SDK
NuExtract提供基于API Key的异步抽取接口和官方Python SDK。开发者可以创建项目、推断模板、管理示例、提交文本或文件、查询任务状态并导出结果。
- 从自然语言说明生成模板。
- 创建、复制、导入和导出抽取项目。
- 向项目添加或更新示例。
- 提交文本或文件进行结构化抽取。
- 将文档内容提取为Markdown。
- 轮询或流式查看异步任务状态。
- 取消任务并管理项目共享状态。
适合哪些用户
- 开发团队:将PDF和图片自动写入业务数据库。
- 数据团队:为分析、检索和模型训练准备结构化资料。
- 金融机构:处理贷款、开户、交易和审查文档。
- 保险公司:读取保单、索赔和损失材料。
- 医疗机构:抽取表单、病历和编码字段。
- 法务团队:批量识别合同条款和关键日期。
- RAG开发者:将复杂PDF转换成结构清晰的Markdown。
- 研究人员:评测或微调小型文档视觉语言模型。
典型应用场景
- 把邮箱收到的发票转换为财务系统明细。
- 从数百份合同生成条款对比表。
- 读取身份证明并填充客户验证字段。
- 将扫描档案转成可检索的Markdown知识库。
- 从保险附件提取索赔金额和损失原因。
- 解析简历并按统一结构写入招聘系统。
- 从产品手册提取规格、型号和兼容关系。
- 在私有环境处理不能发送至公共模型的文件。
产品优势
- 模型专门针对文档抽取和OCR训练,目标比通用聊天模型集中。
- 同一模型同时输出JSON和Markdown,减少多套OCR链路。
- 支持文本、图像和多语言文档。
- 可以用少量示例适配企业字段和格式。
- API采用按量计费,没有公开固定月费门槛。
- 提供开源权重、SDK、SaaS和私有部署多种路径。
- 公开模型规模较小,适合企业控制推理成本。
使用限制
- OCR和抽取仍可能漏字段、错行或错误理解复杂关系。
- 官方部分性能数据来自内部基准,需用自有文档复测。
- 输出JSON可解析不代表字段内容一定正确。
- 低清晰度、旋转、遮挡和手写内容会影响结果。
- 超长文档和大型表格会增加输入、输出与推理成本。
- 企业私有部署与微调没有公开固定报价。
- 开源模型需要显存、推理框架和运维能力。
- 旧NuMind功能和当前NuExtract资料并不完全兼容。
API定价
NuExtract3当前采用输入与输出Token分别计费的模式,注册后可免费开始。批处理、大规模调用和微调可获得更低单价,企业私有部署按分层用量定制报价。
| 项目 | 公开价格 | 说明 |
|---|---|---|
| 输入Token | 1美元/百万Token | 包含模板、示例和输入文档 |
| 输出Token | 5美元/百万Token | 按生成的JSON或文本输出计费 |
| 英文文本1页 | 约0.001美元输入费 | 按约1000个输入Token估算 |
| 英文文本100页 | 约0.10美元输入费 | 不含输出Token费用 |
| A4扫描件1页 | 约0.0015美元输入费 | 按115 dpi约1500个图像Token估算 |
| A4扫描件100页 | 约0.15美元输入费 | 不含输出Token费用 |
| 企业私有部署 | 定制报价 | 私有云或本地部署,按分层用量 |
| 模型微调 | 定制报价 | 适合高用量或专门任务 |
文本Token通常是词或子词,英文平均一个单词约1.3个Token;图像Token对应约32×32像素区域。PDF等格式化文档默认转成图像,因此实际费用应以任务统计为准。
SaaS与企业部署对比
| 方案 | 部署方式 | 适合场景 | 计费 |
|---|---|---|---|
| NuExtract API | NuMind云端 | 试验、集成和弹性生产调用 | 按输入和输出Token |
| 网页平台 | NuMind云端 | 创建模板、示例和测试项目 | 注册后开始,调用费用按页面规则 |
| 企业私有云 | 客户专属环境 | 受监管数据和内部系统集成 | 定制分层用量 |
| 本地部署 | 客户基础设施 | 数据不能离开内网的场景 | 定制报价 |
| 开源模型 | 自行部署 | 研发、评测和高度自定义 | 无API费,自付算力与运维 |
如何创建抽取项目
- 选择字段稳定、人工结果可验证的一类文档。
- 准备正常、低清晰度和异常布局的脱敏样本。
- 注册平台并新建结构化抽取项目。
- 用自然语言生成模板或导入JSON Schema。
- 明确字段类型、重复数组和嵌套关系。
- 上传少量样本并逐字段修正标准输出。
- 运行未参与配置的文档验证准确率。
- 为关键字段设置业务规则和人工复核。
- 生成API Key后再接入测试环境。
如何接入生产流程
- 统计每日文档量、平均页数和预计Token成本。
- 确定文件来源、输出系统和失败重试机制。
- 使用官方SDK创建异步任务并安全保存任务编号。
- 轮询任务状态,区分处理中、成功、失败和取消。
- 用Schema校验JSON结构并检查必填字段。
- 按置信规则或业务金额分配人工审核。
- 记录模型版本、模板版本和每次修改。
- 持续抽样对比人工结果并监控字段级错误。
- 大规模上线前评估批处理、微调或私有部署。
准确率验证建议
- 按字段计算准确率,不只统计整份文档是否成功。
- 单独评测表格行、金额、日期和枚举字段。
- 保留不存在字段的负样本,防止模型补写内容。
- 覆盖扫描、照片、旋转和多页附件。
- 把模型输出与人工金标准逐项比较。
- 模板、示例或模型升级后运行回归测试。
- 关键业务不要只依赖模型自报置信度。
隐私与企业安全
NuMind提供SaaS和私有企业部署,银行、保险和医疗等场景可选择私有云或本地环境。处理真实数据前仍应在合同中确认保存期限、子处理方、训练使用、跨境传输和删除机制。
- 测试阶段先使用脱敏或合成文档。
- API Key存放在服务端密钥系统中。
- 按项目和环境隔离开发、测试与生产权限。
- 日志不要记录完整证件、病历或财务文件。
- 明确私有部署的升级、监控和安全责任。
- 为数据导出、删除和事故响应建立流程。
GitHub与开源状态
NuMind官方GitHub公开NuExtract、NuMarkdown和NuExtract平台SDK。NuExtract代码与公开模型采用MIT许可证;商业SaaS、NuExtract PRO能力和企业托管组件不等于整体开源。
| 项目 | 状态或许可证 | 用途 |
|---|---|---|
| NuExtract3 | MIT开源 | 40亿参数文档理解、JSON抽取和Markdown转换 |
| NuExtract旧模型 | MIT开源 | 不同规模的文本结构化抽取 |
| NuMarkdown | 公开仓库与模型 | 推理式文档转Markdown |
| nuextract-platform-sdk | MIT开源 | Python客户端和接口类型 |
| NuExtract SaaS | 闭源服务 | 托管项目、任务和生产接口 |
| 企业私有部署 | 商业授权 | 私有云、本地部署和定制微调 |
基本信息
| 字段 | 内容 |
|---|---|
| 工具名称 | NuMind |
| 核心产品 | NuExtract平台与NuExtract3 |
| 工具类型 | 文档AI、结构化抽取、OCR、Markdown转换 |
| 主要输出 | JSON和Markdown |
| 输入类型 | 文本、图片、PDF、扫描件和办公文档 |
| 价格模式 | 按Token付费+企业定制 |
| API与Python SDK | 支持 |
| 私有部署 | 支持 |
| 是否开源 | 部分模型与SDK开源,商业平台闭源 |
推荐指数
4.7 / 5。NuMind适合需要将复杂文档稳定转成JSON或RAG数据的开发者和企业,公开模型、低门槛按量API与私有部署路径较完整;但生产准确率仍必须用真实业务样本验证。
常见问题
NuMind现在主要做什么?
当前主要通过NuExtract3从文档中抽取结构化JSON,并将图片或PDF转换为Markdown。
NuExtract支持扫描件吗?
支持,可处理图片型PDF、扫描件和照片,并结合视觉理解完成OCR与字段抽取。
可以自定义输出字段吗?
可以,通过JSON模板、自然语言说明和少量正确示例定义字段、数组与层级。
NuExtract API多少钱?
当前输入为每百万Token 1美元,输出为每百万Token 5美元,大规模调用可联系官方获得折扣。
网页界面免费吗?
可以注册并开始创建和测试项目,生产调用按当前Token规则计费,具体赠送额度以账户为准。
支持私有部署吗?
支持私有云和本地环境,也可提供定制微调,价格需联系销售。
NuMarkdown和NuExtract3是什么关系?
NuMarkdown专注文档转Markdown,NuExtract3已把结构化抽取和Markdown转换统一到同一个模型中。
提供Python SDK吗?
提供,可管理项目和示例、提交文本或文件、查询任务并获取JSON或Markdown结果。
NuMind是开源工具吗?
部分开源,NuExtract模型和官方SDK公开,但托管平台与企业服务不是完整开源产品。
可以完全替代人工审核吗?
不建议,金额、身份、医疗和合同等高风险字段仍需规则校验与人工抽查。
桂公网安备45132202000164号