NuMind是什麼
NuMind是一家專注於文檔資訊抽取的AI公司,目前的核心產品為NuExtract平台以及NuExtract3多模態模型。它能將PDF、掃描檔、圖片、表格和文字轉換為結構化的JSON格式,或是適用於RAG技術的Markdown格式。
早期NuMind主要提供文本分類、實體識別以及低代碼NLP模型訓練功能。現行的官網則轉向了文件抽取與OCR功能,相關說明應以NuExtract3、NuMarkdown、API以及企業私有部署為主。
核心功能
- 結構化抽取:依用戶定義的JSON模板返回欄位和層級關係。
- 多模態理解:同時處理文本、圖片及文字與圖片組合輸入。
- 文件轉換為 Markdown:識別標題、段落、清單、表格和公式。
- 模板生成:根據自然語言說明或樣本文件創建抽取結構。
- 示例學習:加入少量輸入與標準輸出改善特定任務。
- 多語言處理:面向不同語言的文件執行抽取和OCR。
- 批次接口:透過異步任務處理生產環境文件。
- Python SDK:建立專案、上傳範例、提交檔案並取得結果。
- 私有部署:支援企業私有雲或本地環境。
- 訂製模型:為高用量或高準確率場景提供微調。
NuExtract3模型
NuExtract3是一個統一的40億參數視覺語言推理模型,同時具備結構化資訊抽取與圖像轉換為Markdown的功能。輸入內容可以是文字、單頁或多頁圖像,且可選擇進行推理或非推理模式。
- 根據模板和指令輸出可解析JSON。
- 從發票、表單、合約、收據和複雜表格讀取數據。
- 將文件圖像轉換為帶層級的Markdown。
- 識別表格並使用適合表達結構的標記。
- 保留數學公式和代碼等特殊內容。
- 處理長輸入和較大的結構化輸出。
- 可使用公開權重在自有環境推理。
結構化數據抽取
使用者先使用JSON Schema或平台模板來描述所需的欄位,再提供說明文件及選用範例。該模型僅圍繞目標結構提取資訊,適合將非結構化檔案儲存至資料庫、業務系統或用於審核流程。
- 發票:供應商、日期、稅額、總金額以及明細項目。
- 合約:當事人、期限、金額、續約及終止條款。
- 簡歷:姓名、經歷、技能、教育背景及證書。
- 保險:保單、理賠、損失、責任及附件資訊。
- 醫療:表單欄位、編碼、藥物及就診記錄。
- 銀行:客戶證明、交易、貸款及合規欄位。
- 技術資料:部件、規格、參數和層級關係。
NuMarkdown與OCR
NuMarkdown用於將複雜的文件轉換為結構清晰的Markdown格式,特別注重佈局、表格以及RAG預處理的處理。現行的NuExtract3已將Markdown轉換功能整合到統一模型中,而舊版的NuMarkdown倉庫仍可用於了解該技術路線。
- 把標題和段落恢復為清晰層級。
- 將複雜表格輸出為Markdown或HTML結構。
- 使用LaTeX表達數學公式。
- 處理掃描件、圖片型PDF和異常佈局。
- 為向量檢索和知識庫保留可讀結構。
- 透過推理先分析版面再生成最終文本。
模板與範例學習
NuExtract將抽取任務組織為專案,專案包含模板、說明、設定和範例。模板可以從自然語言描述自動生成,也能透過JSON Schema轉換後再進行修改。
- 用空字串表示需要抽取的文本字段。
- 用陣列描述可能重複出現的明細項。
- 加入嵌套對象表達層級關係。
- 提供正確輸出範例指導字段含義。
- 使用負樣本測試不存在字段是否保持為空。
- 鎖定驗證完成的项目以減少意外修改。
API與Python SDK
NuExtract提供基於API Key的異步抽取介面,以及官方的Python SDK。開發者可以建立專案、設計模板、管理範例、上傳文字或檔案、查詢任務狀態,並將結果導出。
- 從自然語言說明生成模板。
- 創建、複製、導入和導出抽取項目。
- 向專案添加或更新範例。
- 提交文本或文件進行結構化抽取。
- 將文件內容提取為Markdown。
- 輪詢或流式查看異步任務狀態。
- 取消任務並管理專案共享狀態。
適合哪些用戶
- 開發團隊:將PDF和圖片自動寫入業務資料庫。
- 數據團隊:為分析、檢索和模型訓練準備結構化資料。
- 金融機構:處理貸款、開戶、交易及審查文件。
- 保險公司:閱讀保單、理賠及損失相關文件。
- 醫療機構:抽取表單、病歷和編碼字段。
- 法務團隊:批量識別合約條款和關鍵日期。
- RAG開發者:將複雜的PDF轉換成結構清晰的Markdown。
- 研究人員:評測或微調小型文件視覺語言模型。
典型應用場景
- 將信箱收到的發票轉換為財務系統明細。
- 從數百份合約生成條款對比表。
- 讀取身分證明並填入客戶驗證欄位。
- 將掃描檔案轉成可檢索的Markdown知識庫。
- 從保險附件提取理賠金額和損失原因。
- 解析簡歷並按統一結構寫入招聘系統。
- 從產品手冊提取規格、型號和相容關係。
- 在私有環境處理無法發送至公共模型的檔案。
產品優勢
- 模型專門針對文件抽取和OCR訓練,目標比通用聊天模型集中。
- 同一模型同時輸出JSON和Markdown,減少多套OCR鏈路。
- 支援文本、圖像和多語言文件。
- 可以用少量示例適配企業字段和格式。
- API採用按量計費,沒有公開固定月費門檻。
- 提供開源權重、SDK、SaaS和私有部署多種路徑。
- 公開模型規模較小,適合企業控制推理成本。
使用限制
- OCR和抽取仍可能漏字段、錯行或錯誤理解複雜關係。
- 官方部分性能數據來自內部基準,需用自有文件復測。
- 輸出JSON可解析不代表欄位內容一定正確。
- 低清晰度、旋轉、遮擋和手寫內容會影響結果。
- 超長文件和大型表格會增加輸入、輸出與推理成本。
- 企業私有部署與微調沒有公開固定報價。
- 開源模型需要顯存、推理框架和運維能力。
- 舊NuMind功能與當前NuExtract資料並不完全相容。
API定價
NuExtract3目前採用輸入與輸出Token分別計費的模式,註冊後即可免費開始使用。進行批次處理、大規模調用或微調時,可獲得更低的單價;至於企業的私有部署,則可根據使用量來訂制報價。
| 項目 | 公開價格 | 說明 |
|---|---|---|
| 輸入Token | 1美元/百萬Token | 包含模板、範例和輸入文件 |
| 輸出Token | 5美元/百萬Token | 按生成的JSON或文本輸出計費 |
| 英文文本1頁 | 約0.001美元輸入費 | 按約1000個輸入Token估算 |
| 英文文本100頁 | 約0.10美元輸入費 | 不含輸出Token費用 |
| A4掃描件1頁 | 約0.0015美元輸入費 | 按115 dpi約1500個圖像Token估算 |
| A4掃描件100頁 | 約0.15美元輸入費 | 不含輸出Token費用 |
| 企業私有部署 | 訂製報價 | 私有雲或本地部署,按層次用量 |
| 模型微調 | 訂製報價 | 適合高用量或專門任務 |
文本Token通常是詞或子詞,英文平均一個單詞約1.3個Token;圖像Token對應約32×32像素區域。PDF等格式化文件預設會轉換為圖像,因此實際費用應以任務統計結果為準。
SaaS與企業部署對比
| 方案 | 部署方式 | 適合場景 | 計費 |
|---|---|---|---|
| NuExtract API | NuMind雲端 | 試驗、集成和彈性生產調用 | 按輸入和輸出Token |
| 網頁平台 | NuMind雲端 | 創建模板、範例和測試專案 | 註冊後開始,調用費用按頁面規則 |
| 企業私有雲 | 客戶專屬環境 | 受監管數據和內部系統集成 | 訂製分層用量 |
| 本地部署 | 客戶基礎設施 | 數據不能離開內網的場景 | 訂製報價 |
| 開源模型 | 自行部署 | 研發、評測和高度自訂 | 無API費,自付算力與運維 |
如何創建抽取項目
- 選擇字段穩定、人工結果可驗證的一類文件。
- 準備正常、低清晰度及異常佈局的脫敏樣本。
- 註冊平台並新建結構化抽取項目。
- 用自然語言生成模板或導入JSON Schema。
- 明確字段類型、重複陣列和嵌套關係。
- 上傳少量樣本並逐欄位修正標準輸出。
- 運行未參與配置的文件驗證準確率。
- 為關鍵欄位設定業務規則和人工複核。
- 生成API Key後再接入測試環境。
如何接入生產流程
- 統計每日文件量、平均頁數和預計Token成本。
- 確定文件來源、輸出系統和失敗重試機制。
- 使用官方SDK創建異步任務並安全保存任務編號。
- 輪詢任務狀態,區分處理中、成功、失敗和取消。
- 用Schema校驗JSON結構並檢查必填字段。
- 按置信規則或業務金額分配人工審核。
- 記錄模型版本、模板版本和每次修改。
- 持續抽樣對比人工結果並監控字段級錯誤。
- 大規模上線前評估批次處理、微調或私有部署。
準確率驗證建議
- 按字段計算準確率,不只統計整份文件是否成功。
- 單獨評測表格行、金額、日期和枚舉字段。
- 保留不存在字段的負樣本,防止模型補寫內容。
- 覆蓋掃描、照片、旋轉和多頁附件。
- 將模型輸出與人工金標準逐項比較。
- 模板、範例或模型升級後運行回歸測試。
- 關鍵業務不要只依賴模型自報置信度。
隱私與企業安全
NuMind提供SaaS及私有企業部署服務,銀行、保險和醫療等領域可選擇私有雲或本地環境。在處理真實數據之前,仍應在合約中明確確定資料保存期限、子處理方、訓練使用方式、跨境傳輸規則以及資料刪除機制。
- 測試階段先使用脫敏或合成文件。
- API Key存放在服務端密鑰系統中。
- 按項目和環境隔離開發、測試與生產權限。
- 日誌不要記錄完整證件、病歷或財務文件。
- 明確私有部署的升級、監控和安全責任。
- 為數據導出、刪除和事故應對建立流程。
GitHub與開源狀態
NuMind官方GitHub公開了NuExtract、NuMarkdown以及NuExtract平台的SDK。NuExtract的代碼與公開的模型均採用MIT許可證;至於商業版SaaS、NuExtract PRO功能以及企業託管組件,則並不屬於開源範疇。
| 項目 | 狀態或許可證 | 用途 |
|---|---|---|
| NuExtract3 | MIT開源 | 40億參數文件理解、JSON抽取和Markdown轉換 |
| NuExtract舊模型 | MIT開源 | 不同規模的文本結構化抽取 |
| NuMarkdown | 公開倉庫與模型 | 推理式文件轉Markdown |
| nuextract-platform-sdk | MIT開源 | Python用戶端和介面類型 |
| NuExtract SaaS | 閉源服務 | 託管項目、任務和生產接口 |
| 企業私有部署 | 商業授權 | 私有雲、本地部署和訂製微調 |
基本資訊
| 字段 | 內容 |
|---|---|
| 工具名稱 | NuMind |
| 核心產品 | NuExtract平台與NuExtract3 |
| 工具類型 | 文件AI、結構化抽取、OCR、Markdown轉換 |
| 主要輸出 | JSON和Markdown |
| 輸入類型 | 文本、圖片、PDF、掃描件和辦公文件 |
| 價格模式 | 按Token付費+企業訂製 |
| API與Python SDK | 支持 |
| 私有部署 | 支持 |
| 是否開源 | 部分模型與SDK開源,商業平台閉源 |
推薦指數
4.7 / 5。NuMind適合那些需要將複雜文件穩定轉換為JSON或RAG格式數據的開發者及企業,其具有公開模型、低門檻的按量API以及完整的私有部署方案;不過,其實際應用中的準確率仍需以真實業務樣本來驗證。
常見問題
NuMind現在主要做什麼?
目前主要是透過NuExtract3從文件中抽取結構化的JSON,並將圖片或PDF轉換為Markdown。
NuExtract支援掃描檔嗎?
支持,可處理圖片型PDF、掃描件和照片,並結合視覺理解完成OCR與字段抽取。
可以自訂輸出欄位嗎?
可以,透過JSON模板、自然語言說明和少量正確範例來定義字段、陣列與層級。
NuExtract API多少錢?
目前輸入為每百萬Token 1美元,輸出為每百萬Token 5美元,大規模調用可聯繫官方獲得折扣。
網頁介面免費嗎?
可以註冊並開始創建和測試項目,生產調用按當前Token規則計費,具體贈送額度以賬戶為準。
支援私有部署嗎?
支援私有雲和本地環境,也可提供訂製微調,價格需聯繫銷售。
NuMarkdown和NuExtract3是什麼關係?
NuMarkdown專注於文件轉換為Markdown,NuExtract3則將結構化抽取與Markdown轉換整合到同一個模型中。
提供Python SDK嗎?
提供,可管理專案與範例、提交文字或檔案、查詢任務並獲取JSON或Markdown結果。
NuMind是開源工具嗎?
部分開源,NuExtract模型和官方SDK公開,但託管平台與企業服務不是完整開源產品。
可以完全替代人工審核嗎?
不建議,金額、身分、醫療和合約等高風險欄位仍需規則校驗與人工抽查。
桂公網安備45132202000164號