ReworkdAI
免费增值
AI工具大全 AI编程工具

ReworkdAI

@ReworkdAI,专注于AI 编程的智能工具

标签:

Reworkd是什么

Reworkd是一款面向企业和开发团队的AI网页数据抽取平台。用户描述抓取目标并定义数据Schema后,代理会理解网站结构、生成Playwright代码、运行浏览器、验证结果并保存结构化数据。

团队最初因开源AgentGPT获得关注,后来将商业重点转向可规模化维护的网页抓取。AgentGPT仍能访问,但不应再作为Reworkd当前主营产品介绍。

核心功能

  • 自动生成抓取器:根据自然语言目标和Schema编写站点专用代码。
  • 多模态页面理解:结合页面结构、截图和浏览器状态选择元素。
  • 自修复脚本:网站变化或选择器失效时检测问题并重新生成代码。
  • 动态网页处理:支持点击、展开、分页、无限滚动和等待加载。
  • 结构化输出:按照字段类型和层级保存数据。
  • 定时运行:以固定频率重复抓取一组来源。
  • 去重与更新:使用主键判断新增、重复和变化记录。
  • 文件下载:异步访问并保存PDF及其他附件。
  • API与导出:通过密钥读取结果、管理会话数据和接入流程。
  • 运行分析:查看成功、失败、输出数量和网站变化。

AI代码生成流程

Reworkd不是让大模型直接猜网页内容,而是先让代理理解页面,再生成可执行抓取代码。代码在托管浏览器中运行,提取结果还会经过Schema验证。

  • 加载目标网站并分析可交互元素。
  • 根据字段Schema寻找候选内容。
  • 生成访问页面和提取数据的代码。
  • 运行代码并观察浏览器事件与网络请求。
  • 验证输出是否符合字段类型和结构。
  • 出现错误时根据日志修改并重新部署。

自修复抓取器

网站调整布局、类名或加载逻辑后,传统选择器可能无提示地返回空值。Reworkd会监控结果与运行状态,识别失败并尝试重新生成相关代码。

  • 检测选择器找不到元素或输出突然下降。
  • 结合页面新结构定位对应字段。
  • 生成修改后的站点专用脚本。
  • 通过代码差异查看具体改动。
  • 保留运行记录便于回退和人工检查。
  • 对修复后的输出再次执行Schema验证。

Schema与数据类型

Schema定义每一行数据应包含哪些字段、字段类型和嵌套关系,也是代码生成与结果验证的依据。设计清晰的Schema比使用宽泛提示更容易获得稳定结果。

  • 使用明确字段名表达实际业务含义。
  • 为价格、日期、网址和布尔状态设置正确类型。
  • 用对象和数组表达商品变体或明细列表。
  • 区分必填字段与可能缺失的可选字段。
  • 避免在一个字段混入多种互不兼容的值。
  • 选择稳定字段作为去重主键。

分页与动态内容

官方Harambe抓取SDK用于处理分页、页面跳转、动态加载、HTML读取和数据保存。生成的脚本可以点击下一页、滚动页面或进入详情页补充字段。

  • 点击页码或下一页直到没有新结果。
  • 处理无限滚动和延迟加载列表。
  • 打开折叠面板、标签页和弹窗。
  • 从列表页进入详情页采集更多数据。
  • 等待网络请求或指定元素出现。
  • 在登录状态下使用Cookie和本地存储。

定时任务与模板

抓取组可以按固定周期重新运行,用于持续监控价格、库存、职位或监管文件。对于使用相同建站系统的网站,模板可复用抓取逻辑,减少代码生成Token和调试成本。

  • 按业务需要设置重复运行频率。
  • 把结构相同的网站加入同一模板。
  • 集中查看不同来源的成功和失败情况。
  • 在网站变化后统一更新复用脚本。
  • 避免为每个同构网站重复生成代码。
  • 用周报追踪输出量和来源波动。

去重与变化跟踪

Reworkd根据用户选择的唯一键或复合键建立物化结果视图。新记录标记为创建,已有记录的新值标记为更新,完全重复的内容则不再次插入。

  • SKU、UPC和稳定页面ID适合作为单字段主键。
  • 品牌、型号和颜色可组合成复合键。
  • 价格、库存和更新时间不适合作为唯一键。
  • 同一对象在不同来源中应使用一致的键规则。
  • 修改主键前应评估历史记录是否会重复。
  • API读取的结果为已经去重的物化视图。

文件与附件下载

抓取结果中包含文件地址时,Reworkd可以异步访问并下载附件,同时保存文件类型、校验值、来源地址和存储信息。该能力适合监管公告、招标资料和产品手册。

  • 下载PDF、文档和网页提供的其他附件。
  • 记录原始来源与文件名。
  • 使用校验值识别重复或变化文件。
  • 把下载任务与对应数据行关联。
  • 对动态生成或需点击的文件执行浏览器下载。
  • 通过API继续处理已保存文件。

API与开发者能力

组织可以创建API Key,从外部系统读取抓取组输出和运行状态。公开文档还提供Cookie、本地存储、审查状态和文件处理相关接口。

  • 获取指定抓取组的去重结果。
  • 查询最新人工审查状态和评论。
  • 读取或设置浏览器Cookie。
  • 读取或设置浏览器本地存储。
  • 通过批量导出下载数据。
  • 使用开放接口规范生成客户端。
  • 将结果接入数据库、分析或模型训练流程。

浏览器调试与可观测性

平台提供统一浏览器Trace,将Reworkd与Playwright事件、控制台日志、网络活动和浏览器协议事件放在同一视图。内联代码差异可比较修复前后的增加与删除。

  • 定位页面加载超时和资源被阻止。
  • 查看控制台脚本错误。
  • 检查网络请求、状态码和响应变化。
  • 对比代理新旧抓取代码。
  • 识别输出下降来自页面变化还是运行故障。
  • 用实时流查看任务状态与输出数量。

适合哪些用户

  • 电商团队:监控商品、价格、库存和评价。
  • 市场研究团队:汇总企业、行业和竞争信息。
  • 招聘与人才平台:采集公开职位和公司资料。
  • 金融与采购团队:跟踪公告、招标和监管文件。
  • AI团队:构建训练、微调和RAG数据集。
  • 数据工程团队:替代大量脆弱的站点专用脚本。
  • 创业公司:在没有爬虫专职工程师时快速建立管道。

典型应用场景

  • 每天同步多个商城的商品价格和可售状态。
  • 从公司目录提取名称、行业、团队和联系方式。
  • 下载政府网站新增的法规与招标附件。
  • 采集职位列表并进入详情页补充要求。
  • 持续跟踪房地产、车辆或旅行列表变化。
  • 为领域模型准备数百万行公开网页数据。
  • 监控网站地址、服务说明和经营状态更新。

产品优势

  • 从需求、代码生成、运行到修复覆盖完整抓取流程。
  • 代码式抽取比直接让模型生成数据更容易验证和复现。
  • 内置托管浏览器、代理、验证码处理和调度。
  • 支持分页、动态内容、详情页和文件下载。
  • 去重与更新机制适合长期数据监控。
  • 提供API、开放接口规范和开源Harambe SDK。
  • Trace与代码Diff有助于定位生产问题。

使用限制

  • 自动生成代码仍可能遗漏边界页面或错误字段。
  • 网站反爬、登录、地域限制和验证码会增加成本。
  • 自修复后必须验证语义是否仍对应原字段。
  • 抓取公开网页也可能受到条款、版权和数据库权利限制。
  • 高并发会增加浏览器、代理、流量和验证码费用。
  • 网站结构差异大时,模板复用效果有限。
  • 官方页面保留过时停用横幅,产品信息维护不完全一致。
  • 对关键数据仍需抽样和业务规则校验。

订阅套餐

公开定价页当前列出Hobby、Pro和Enterprise三档。页面同时保留一条已过时的旧产品停用横幅,但新平台登录、状态页、文档与后续更新仍可访问,购买前应向官方确认当前服务周期。

套餐月费并发浏览器数据保留主要说明
Hobby0美元10个30天API访问,适合测试和小规模任务
Pro99美元50个90天验证码处理、定时任务和全托管
Enterprise定制定制定制更高规模、专属支持与合同能力

基础设施用量价格

除订阅费外,平台还按基础设施实际用量计费。公开页面当前展示的常规单价如下,企业方案可按合同定制。

计费项目HobbyProEnterprise
平台基础额度或费用10美元49美元/月定制
标准代理流量0.125美元/GB0.125美元/GB定制
高级代理流量8美元/GB8美元/GB定制
浏览器计算0.10美元/小时0.10美元/小时定制
反机器人验证5美元/1000次5美元/1000次定制

定价页提取结果没有完整显示第一项基础设施费用的字段标签,因此不应把它与订阅费直接相加为固定月费。结算前应在账户中确认免费额度、最低消费和各项用量名称。

如何创建第一个抓取器

  1. 注册Reworkd并创建新的抓取组。
  2. 输入目标网站和需要采集的数据说明。
  3. 定义字段名称、类型、嵌套关系和可选项。
  4. 选择稳定且唯一的去重键。
  5. 让代理扫描页面并生成第一版抓取代码。
  6. 观看浏览器运行并检查分页、点击和详情页。
  7. 逐行核对输出是否符合页面原文。
  8. 通过聊天说明缺失字段或特殊交互。
  9. 验证多种页面后再保存并启用调度。

如何上线长期数据管道

  1. 确认目标网站允许的访问方式和频率。
  2. 准备正常、空结果、异常布局和错误页面样本。
  3. 设置重试、超时、速率限制和并发上限。
  4. 配置稳定主键并测试新增与更新记录。
  5. 用API把结果写入暂存区而不是直接覆盖生产数据。
  6. 建立字段完整率、输出量和失败率告警。
  7. 人工审核自修复后的代码差异和样本结果。
  8. 记录模板、代码和Schema版本。
  9. 按月评估代理、计算、验证码和存储成本。

数据质量建议

  • 将页面原始地址与每行结果一起保存。
  • 为价格和日期增加格式及范围校验。
  • 监控每天输出量的突然上升或下降。
  • 对不同页面类型分别建立测试样本。
  • 定期比较抓取结果与页面截图。
  • 网站变化后重新验证字段语义。
  • 不要把成功运行等同于数据完全正确。

法律与合规注意事项

企业需要自行确认目标网站条款、robots规则、版权、数据库权利、隐私法规和访问授权。能被技术读取的数据不一定可以自由复制、再发布或用于商业训练。

  • 优先使用公开API或获得数据所有者许可。
  • 不绕过登录、付费墙和访问控制获取未授权内容。
  • 限制采集个人身份和敏感信息。
  • 遵守目标网站的访问频率要求。
  • 保留数据来源、采集时间和删除流程。
  • 对模型训练用途单独检查许可范围。

GitHub与开源状态

Reworkd官方GitHub公开AgentGPT、Harambe、Tarsier和Bananalyzer等项目,但商业网页抓取平台的完整代理、托管基础设施和自修复服务不是开源产品。

项目状态或许可证用途
Reworkd商业平台闭源SaaS托管网页抓取与自修复
AgentGPTGPL 3.0浏览器中的通用自主AI代理
Harambe官方公开项目网页抽取SDK与抓取原语
Tarsier官方公开项目网页交互代理的视觉感知工具
Bananalyzer官方公开项目网页任务AI代理评测框架与数据集
perplexity-style-streaming官方公开示例流式界面与开发实验

AgentGPT与现行Reworkd的区别

对比项AgentGPT现行Reworkd
定位通用自主AI代理实验企业网页数据抽取平台
输入名称和开放目标网站、抓取目标与Schema
输出任务思考与执行过程可验证的结构化网页数据
运行方式开源网页应用托管浏览器、API和调度
维护用户管理模型与部署平台检测并修复抓取脚本
商业重点已非主营当前核心产品

基本信息

字段内容
工具名称Reworkd
开发公司Reworkd AI, Inc.
工具类型AI网页抓取、结构化数据提取、自修复爬虫
核心技术多模态代码生成、Playwright和Harambe SDK
价格模式免费与订阅+基础设施用量费
API访问支持
定时任务支持
开源状态商业平台闭源;AgentGPT等工具开源

推荐指数

4.5 / 5。Reworkd适合需要维护大量站点抓取器的企业和数据团队,代码生成、自修复、去重和可观测性形成较完整管道;但用量成本、法律边界和官网信息一致性需要认真评估。

常见问题

Reworkd现在主要做什么?

当前核心是让AI生成并维护网页抓取代码,将动态网站和附件转换为结构化数据。

Reworkd和AgentGPT是什么关系?

AgentGPT是Reworkd团队早期的开源通用代理项目,现行商业产品已经转向网页数据抽取。

需要自己写爬虫代码吗?

通常不需要,用户定义目标和Schema后由代理生成代码,但复杂站点仍可能需要通过聊天指导和人工调试。

网站改版后会自动修复吗?

平台会检测失败并尝试重新生成代码,但修复后的字段语义和数据准确性仍需验证。

Reworkd有免费套餐吗?

有,Hobby为每月0美元,公开页面列出10个并发浏览器、30天保留和API访问。

Pro套餐多少钱?

公开价格为每月99美元,包含50个并发浏览器和90天数据保留,并列出定时任务与验证码处理。

基础设施费用另算吗?

是,代理流量、浏览器计算和反机器人验证等项目按用量计费,账户结算前应核对免费额度。

可以下载PDF附件吗?

可以,平台支持异步文件下载并保留来源、文件类型和校验信息。

Reworkd提供API吗?

提供,可读取去重输出、管理Cookie与本地存储,并通过开放接口规范接入。

Reworkd开源吗?

商业平台不开源,但AgentGPT、Harambe、Tarsier和Bananalyzer等官方项目公开。

©️版权声明:若无特殊声明,本站所有文章版权均归AI工具分享原创和所有,未经许可,任何个人、媒体、网站、团体不得转载、抄袭或以其他方式复制发表本站内容,或在非我站所属的服务器上建立镜像。否则,我站将依法保留追究相关法律责任的权利。

类似于ReworkdAI的工具