Reworkd是什么
Reworkd是一款面向企业和开发团队的AI网页数据抽取平台。用户描述抓取目标并定义数据Schema后,代理会理解网站结构、生成Playwright代码、运行浏览器、验证结果并保存结构化数据。
团队最初因开源AgentGPT获得关注,后来将商业重点转向可规模化维护的网页抓取。AgentGPT仍能访问,但不应再作为Reworkd当前主营产品介绍。
核心功能
- 自动生成抓取器:根据自然语言目标和Schema编写站点专用代码。
- 多模态页面理解:结合页面结构、截图和浏览器状态选择元素。
- 自修复脚本:网站变化或选择器失效时检测问题并重新生成代码。
- 动态网页处理:支持点击、展开、分页、无限滚动和等待加载。
- 结构化输出:按照字段类型和层级保存数据。
- 定时运行:以固定频率重复抓取一组来源。
- 去重与更新:使用主键判断新增、重复和变化记录。
- 文件下载:异步访问并保存PDF及其他附件。
- API与导出:通过密钥读取结果、管理会话数据和接入流程。
- 运行分析:查看成功、失败、输出数量和网站变化。
AI代码生成流程
Reworkd不是让大模型直接猜网页内容,而是先让代理理解页面,再生成可执行抓取代码。代码在托管浏览器中运行,提取结果还会经过Schema验证。
- 加载目标网站并分析可交互元素。
- 根据字段Schema寻找候选内容。
- 生成访问页面和提取数据的代码。
- 运行代码并观察浏览器事件与网络请求。
- 验证输出是否符合字段类型和结构。
- 出现错误时根据日志修改并重新部署。
自修复抓取器
网站调整布局、类名或加载逻辑后,传统选择器可能无提示地返回空值。Reworkd会监控结果与运行状态,识别失败并尝试重新生成相关代码。
- 检测选择器找不到元素或输出突然下降。
- 结合页面新结构定位对应字段。
- 生成修改后的站点专用脚本。
- 通过代码差异查看具体改动。
- 保留运行记录便于回退和人工检查。
- 对修复后的输出再次执行Schema验证。
Schema与数据类型
Schema定义每一行数据应包含哪些字段、字段类型和嵌套关系,也是代码生成与结果验证的依据。设计清晰的Schema比使用宽泛提示更容易获得稳定结果。
- 使用明确字段名表达实际业务含义。
- 为价格、日期、网址和布尔状态设置正确类型。
- 用对象和数组表达商品变体或明细列表。
- 区分必填字段与可能缺失的可选字段。
- 避免在一个字段混入多种互不兼容的值。
- 选择稳定字段作为去重主键。
分页与动态内容
官方Harambe抓取SDK用于处理分页、页面跳转、动态加载、HTML读取和数据保存。生成的脚本可以点击下一页、滚动页面或进入详情页补充字段。
- 点击页码或下一页直到没有新结果。
- 处理无限滚动和延迟加载列表。
- 打开折叠面板、标签页和弹窗。
- 从列表页进入详情页采集更多数据。
- 等待网络请求或指定元素出现。
- 在登录状态下使用Cookie和本地存储。
定时任务与模板
抓取组可以按固定周期重新运行,用于持续监控价格、库存、职位或监管文件。对于使用相同建站系统的网站,模板可复用抓取逻辑,减少代码生成Token和调试成本。
- 按业务需要设置重复运行频率。
- 把结构相同的网站加入同一模板。
- 集中查看不同来源的成功和失败情况。
- 在网站变化后统一更新复用脚本。
- 避免为每个同构网站重复生成代码。
- 用周报追踪输出量和来源波动。
去重与变化跟踪
Reworkd根据用户选择的唯一键或复合键建立物化结果视图。新记录标记为创建,已有记录的新值标记为更新,完全重复的内容则不再次插入。
- SKU、UPC和稳定页面ID适合作为单字段主键。
- 品牌、型号和颜色可组合成复合键。
- 价格、库存和更新时间不适合作为唯一键。
- 同一对象在不同来源中应使用一致的键规则。
- 修改主键前应评估历史记录是否会重复。
- API读取的结果为已经去重的物化视图。
文件与附件下载
抓取结果中包含文件地址时,Reworkd可以异步访问并下载附件,同时保存文件类型、校验值、来源地址和存储信息。该能力适合监管公告、招标资料和产品手册。
- 下载PDF、文档和网页提供的其他附件。
- 记录原始来源与文件名。
- 使用校验值识别重复或变化文件。
- 把下载任务与对应数据行关联。
- 对动态生成或需点击的文件执行浏览器下载。
- 通过API继续处理已保存文件。
API与开发者能力
组织可以创建API Key,从外部系统读取抓取组输出和运行状态。公开文档还提供Cookie、本地存储、审查状态和文件处理相关接口。
- 获取指定抓取组的去重结果。
- 查询最新人工审查状态和评论。
- 读取或设置浏览器Cookie。
- 读取或设置浏览器本地存储。
- 通过批量导出下载数据。
- 使用开放接口规范生成客户端。
- 将结果接入数据库、分析或模型训练流程。
浏览器调试与可观测性
平台提供统一浏览器Trace,将Reworkd与Playwright事件、控制台日志、网络活动和浏览器协议事件放在同一视图。内联代码差异可比较修复前后的增加与删除。
- 定位页面加载超时和资源被阻止。
- 查看控制台脚本错误。
- 检查网络请求、状态码和响应变化。
- 对比代理新旧抓取代码。
- 识别输出下降来自页面变化还是运行故障。
- 用实时流查看任务状态与输出数量。
适合哪些用户
- 电商团队:监控商品、价格、库存和评价。
- 市场研究团队:汇总企业、行业和竞争信息。
- 招聘与人才平台:采集公开职位和公司资料。
- 金融与采购团队:跟踪公告、招标和监管文件。
- AI团队:构建训练、微调和RAG数据集。
- 数据工程团队:替代大量脆弱的站点专用脚本。
- 创业公司:在没有爬虫专职工程师时快速建立管道。
典型应用场景
- 每天同步多个商城的商品价格和可售状态。
- 从公司目录提取名称、行业、团队和联系方式。
- 下载政府网站新增的法规与招标附件。
- 采集职位列表并进入详情页补充要求。
- 持续跟踪房地产、车辆或旅行列表变化。
- 为领域模型准备数百万行公开网页数据。
- 监控网站地址、服务说明和经营状态更新。
产品优势
- 从需求、代码生成、运行到修复覆盖完整抓取流程。
- 代码式抽取比直接让模型生成数据更容易验证和复现。
- 内置托管浏览器、代理、验证码处理和调度。
- 支持分页、动态内容、详情页和文件下载。
- 去重与更新机制适合长期数据监控。
- 提供API、开放接口规范和开源Harambe SDK。
- Trace与代码Diff有助于定位生产问题。
使用限制
- 自动生成代码仍可能遗漏边界页面或错误字段。
- 网站反爬、登录、地域限制和验证码会增加成本。
- 自修复后必须验证语义是否仍对应原字段。
- 抓取公开网页也可能受到条款、版权和数据库权利限制。
- 高并发会增加浏览器、代理、流量和验证码费用。
- 网站结构差异大时,模板复用效果有限。
- 官方页面保留过时停用横幅,产品信息维护不完全一致。
- 对关键数据仍需抽样和业务规则校验。
订阅套餐
公开定价页当前列出Hobby、Pro和Enterprise三档。页面同时保留一条已过时的旧产品停用横幅,但新平台登录、状态页、文档与后续更新仍可访问,购买前应向官方确认当前服务周期。
| 套餐 | 月费 | 并发浏览器 | 数据保留 | 主要说明 |
|---|---|---|---|---|
| Hobby | 0美元 | 10个 | 30天 | API访问,适合测试和小规模任务 |
| Pro | 99美元 | 50个 | 90天 | 验证码处理、定时任务和全托管 |
| Enterprise | 定制 | 定制 | 定制 | 更高规模、专属支持与合同能力 |
基础设施用量价格
除订阅费外,平台还按基础设施实际用量计费。公开页面当前展示的常规单价如下,企业方案可按合同定制。
| 计费项目 | Hobby | Pro | Enterprise |
|---|---|---|---|
| 平台基础额度或费用 | 10美元 | 49美元/月 | 定制 |
| 标准代理流量 | 0.125美元/GB | 0.125美元/GB | 定制 |
| 高级代理流量 | 8美元/GB | 8美元/GB | 定制 |
| 浏览器计算 | 0.10美元/小时 | 0.10美元/小时 | 定制 |
| 反机器人验证 | 5美元/1000次 | 5美元/1000次 | 定制 |
定价页提取结果没有完整显示第一项基础设施费用的字段标签,因此不应把它与订阅费直接相加为固定月费。结算前应在账户中确认免费额度、最低消费和各项用量名称。
如何创建第一个抓取器
- 注册Reworkd并创建新的抓取组。
- 输入目标网站和需要采集的数据说明。
- 定义字段名称、类型、嵌套关系和可选项。
- 选择稳定且唯一的去重键。
- 让代理扫描页面并生成第一版抓取代码。
- 观看浏览器运行并检查分页、点击和详情页。
- 逐行核对输出是否符合页面原文。
- 通过聊天说明缺失字段或特殊交互。
- 验证多种页面后再保存并启用调度。
如何上线长期数据管道
- 确认目标网站允许的访问方式和频率。
- 准备正常、空结果、异常布局和错误页面样本。
- 设置重试、超时、速率限制和并发上限。
- 配置稳定主键并测试新增与更新记录。
- 用API把结果写入暂存区而不是直接覆盖生产数据。
- 建立字段完整率、输出量和失败率告警。
- 人工审核自修复后的代码差异和样本结果。
- 记录模板、代码和Schema版本。
- 按月评估代理、计算、验证码和存储成本。
数据质量建议
- 将页面原始地址与每行结果一起保存。
- 为价格和日期增加格式及范围校验。
- 监控每天输出量的突然上升或下降。
- 对不同页面类型分别建立测试样本。
- 定期比较抓取结果与页面截图。
- 网站变化后重新验证字段语义。
- 不要把成功运行等同于数据完全正确。
法律与合规注意事项
企业需要自行确认目标网站条款、robots规则、版权、数据库权利、隐私法规和访问授权。能被技术读取的数据不一定可以自由复制、再发布或用于商业训练。
- 优先使用公开API或获得数据所有者许可。
- 不绕过登录、付费墙和访问控制获取未授权内容。
- 限制采集个人身份和敏感信息。
- 遵守目标网站的访问频率要求。
- 保留数据来源、采集时间和删除流程。
- 对模型训练用途单独检查许可范围。
GitHub与开源状态
Reworkd官方GitHub公开AgentGPT、Harambe、Tarsier和Bananalyzer等项目,但商业网页抓取平台的完整代理、托管基础设施和自修复服务不是开源产品。
| 项目 | 状态或许可证 | 用途 |
|---|---|---|
| Reworkd商业平台 | 闭源SaaS | 托管网页抓取与自修复 |
| AgentGPT | GPL 3.0 | 浏览器中的通用自主AI代理 |
| Harambe | 官方公开项目 | 网页抽取SDK与抓取原语 |
| Tarsier | 官方公开项目 | 网页交互代理的视觉感知工具 |
| Bananalyzer | 官方公开项目 | 网页任务AI代理评测框架与数据集 |
| perplexity-style-streaming | 官方公开示例 | 流式界面与开发实验 |
AgentGPT与现行Reworkd的区别
| 对比项 | AgentGPT | 现行Reworkd |
|---|---|---|
| 定位 | 通用自主AI代理实验 | 企业网页数据抽取平台 |
| 输入 | 名称和开放目标 | 网站、抓取目标与Schema |
| 输出 | 任务思考与执行过程 | 可验证的结构化网页数据 |
| 运行方式 | 开源网页应用 | 托管浏览器、API和调度 |
| 维护 | 用户管理模型与部署 | 平台检测并修复抓取脚本 |
| 商业重点 | 已非主营 | 当前核心产品 |
基本信息
| 字段 | 内容 |
|---|---|
| 工具名称 | Reworkd |
| 开发公司 | Reworkd AI, Inc. |
| 工具类型 | AI网页抓取、结构化数据提取、自修复爬虫 |
| 核心技术 | 多模态代码生成、Playwright和Harambe SDK |
| 价格模式 | 免费与订阅+基础设施用量费 |
| API访问 | 支持 |
| 定时任务 | 支持 |
| 开源状态 | 商业平台闭源;AgentGPT等工具开源 |
推荐指数
4.5 / 5。Reworkd适合需要维护大量站点抓取器的企业和数据团队,代码生成、自修复、去重和可观测性形成较完整管道;但用量成本、法律边界和官网信息一致性需要认真评估。
常见问题
Reworkd现在主要做什么?
当前核心是让AI生成并维护网页抓取代码,将动态网站和附件转换为结构化数据。
Reworkd和AgentGPT是什么关系?
AgentGPT是Reworkd团队早期的开源通用代理项目,现行商业产品已经转向网页数据抽取。
需要自己写爬虫代码吗?
通常不需要,用户定义目标和Schema后由代理生成代码,但复杂站点仍可能需要通过聊天指导和人工调试。
网站改版后会自动修复吗?
平台会检测失败并尝试重新生成代码,但修复后的字段语义和数据准确性仍需验证。
Reworkd有免费套餐吗?
有,Hobby为每月0美元,公开页面列出10个并发浏览器、30天保留和API访问。
Pro套餐多少钱?
公开价格为每月99美元,包含50个并发浏览器和90天数据保留,并列出定时任务与验证码处理。
基础设施费用另算吗?
是,代理流量、浏览器计算和反机器人验证等项目按用量计费,账户结算前应核对免费额度。
可以下载PDF附件吗?
可以,平台支持异步文件下载并保留来源、文件类型和校验信息。
Reworkd提供API吗?
提供,可读取去重输出、管理Cookie与本地存储,并通过开放接口规范接入。
Reworkd开源吗?
商业平台不开源,但AgentGPT、Harambe、Tarsier和Bananalyzer等官方项目公开。
桂公网安备45132202000164号