Foundry
免费增值
AI工具大全 AI设计工具

Foundry

Foundry,专注于AI 设计的智能工具

标签:

Foundry是什么

Foundry是一款面向AI浏览器智能体研发团队的仿真、评测和训练数据平台。它通过可重置的企业网页环境,让开发者在不依赖持续变化的真实网站时测试和训练自动化智能体。

这里介绍的是运营于thefoundryai.com、此前使用foundryrl.com域名的浏览器智能体平台,不是Microsoft Foundry、Foundry VTT或其他同名产品。

一句话介绍

Foundry为浏览器智能体提供可复现网页仿真、逐动作评测、专家长轨迹数据和强化学习环境,并可通过Python SDK接入现有代理。

产品定位

项目Foundry的定位主要用户
仿真复刻企业网页和业务状态智能体平台与研究团队
评测记录、分类并评分每一步动作评测、质量和模型团队
数据生成面向真实企业流程的专家长轨迹监督微调团队
强化学习在可重置环境中采样大量轨迹后训练与Agent RL团队
排行榜比较标准任务上的成功率与耗时模型选择和研发决策者

为什么浏览器智能体需要仿真

真实网站会持续改版、更新数据并出现不同账号状态,导致同一智能体在不同时刻面对不同环境。验证码、反自动化、速率限制和网络波动还会让训练难以重复。

Foundry尝试把网页、账户和业务数据冻结在可控状态,使每次评测从相同起点开始。团队可以把失败归因于智能体本身,而不是无法解释的页面漂移。

可复现浏览器环境

Simulation模块强调像素级、可重复的浏览器环境,并避免页面漂移、随机噪声和外部速率限制。环境可重置到任务初始状态,适合批量回归和策略比较。

可复现性带来的价值

  • 让不同模型面对相同页面、数据和任务条件。
  • 失败后可回放并定位具体界面或策略问题。
  • 升级提示、模型或工具后执行一致的回归测试。
  • 在不污染真实业务系统的情况下测试写入操作。
  • 批量采样轨迹时不受真实站点反自动化机制干扰。

智能体评测

Evaluation模块跟踪、分类并标记智能体的每个动作。点击失败、布局变化、错误操作和未达到目标的状态不会只被简化成一个最终分数。

核心评测指标

指标含义解读方式
任务成功率完成目标的执行占比应结合任务难度和样本量
平均完成时间成功任务的平均耗时更快不一定更稳健
动作数量完成一次任务使用的步骤过多可能代表绕路或恢复
失败类型点击、布局、误操作等分类用于定位工程问题
状态变更网页与业务数据被如何修改验证结果而非只看文本
跨环境一致性仿真与真实环境结果相关性判断仿真保真度

轨迹、事件和状态记录

Python SDK示例显示,开发者可以获取任务提示、起始页面、登录凭据、支付细节和附加说明,并记录事件、最终状态及状态变更。评测器再把最终结果与标准答案比较。

适合保存的运行证据

  • 任务ID、环境版本和智能体版本。
  • 每一步观察、动作、工具返回和时间。
  • 点击、输入、导航和异常事件。
  • 初始状态、最终状态及中间状态变更。
  • 人工标准、自动评分和失败类别。
  • 模型、提示、采样参数和成本。

企业级训练数据

Data模块由专家标注人员生成自定义长轨迹数据,面向真实企业平台和跨应用工作流。此类数据可用于监督微调,让模型学习正确操作顺序、字段判断和失败恢复。

长轨迹数据的特点

  • 任务需要跨越多个页面和应用。
  • 前一步操作会改变后续页面状态。
  • 错误可能在很多步骤后才暴露。
  • 不仅包含成功路径,也需要恢复和纠错示例。
  • 任务结果由业务状态验证,而不只是最后一句回答。

强化学习环境

RL模块允许在安全仿真中重复采样和评价大量轨迹,避免真实网站的验证码、封禁和生产数据风险。开发团队可据此优化长流程中的信用分配和错误恢复。

适合强化学习的研究问题

  • 如何把最终成功奖励分配给中间动作。
  • 智能体何时应重试、回退或切换策略。
  • 跨应用工作流中的记忆和状态追踪。
  • 复杂表单中的字段对齐与验证。
  • 在动作成本、耗时和成功率之间权衡。

SDRBench基准

Foundry公开的SDRBench是一套针对销售开发代表流程的模拟、可重置浏览器基准和强化学习训练场。它包含50个确定性任务,并保留跨应用状态。

任务覆盖类似Gmail、Sheets、LinkedIn式客户开发、Apollo和Salesforce的业务流程,用于研究线索调研、外联个性化、客户管理和潜客资格判断。

基准覆盖能力

工作阶段代表任务需要的智能体能力
线索研究查找公司与联系人信息搜索、阅读和证据整合
外联准备根据线索撰写个性化内容上下文理解与文案生成
表格管理读取和更新线索列表结构化数据操作
CRM维护创建、修改和推进记录权限、字段和状态判断
资格判断根据规则评估潜客多条件推理
跨应用交接在邮件、表格和CRM间传递状态长期记忆和一致性

公开排行榜

排行榜设计为显示模型、平均成功率和成功任务平均耗时,并提供流程阶段分析。它还允许团队提交智能体、优化现有智能体或让自己的企业流程进入基准。

核验时页面标注的SDR Automation Benchmark为2025年9月版本,但表格显示没有可用的公开成绩。目录正文不应虚构模型排名或成功率。

仿真与真实环境一致性

Foundry提出在仿真和真实环境中并行执行任务,再用成功率相关性、Pearson相关和排序一致性验证保真度。系统还需要检测真实界面漂移并持续校准仿真。

评估仿真是否可信

  1. 选择一组获得授权且风险可控的真实业务任务。
  2. 在仿真与真实环境中使用相同智能体和任务定义。
  3. 比较成功率、步骤、耗时和失败类型。
  4. 计算绝对差异、相关性和模型排序一致性。
  5. 调查差异是来自页面、数据、网络还是业务规则。
  6. 修订仿真并重新运行,直到达到预设误差范围。

Python SDK接入方式

官网示例通过AWE环境对象创建任务运行,获取任务与CDP连接地址,再把浏览器会话交给已有智能体。执行后可读取最终状态、状态变更和事件。

接入流程

  1. 申请私有测试并取得平台账户、任务和密钥。
  2. 在隔离开发环境安装平台提供的Python SDK。
  3. 使用任务ID创建AWE环境并开启事件记录。
  4. 读取任务说明并把浏览器连接地址交给智能体。
  5. 运行智能体并等待其提交或达到终止条件。
  6. 获取最终状态、状态变更、事件和轨迹。
  7. 使用标准答案或业务启发式计算分数。

建立回归评测教程

  1. 按业务价值、难度和风险选择代表性任务集。
  2. 冻结任务输入、初始状态、验收条件和环境版本。
  3. 为成功、部分成功、错误修改和超时定义评分。
  4. 记录模型、提示、工具版本、参数和随机种子。
  5. 多次运行以计算均值、波动和置信区间。
  6. 按失败类型定位提示、视觉、规划或执行问题。
  7. 把阈值接入发布流程,阻止明显退化版本上线。

构建训练数据教程

  1. 确定目标平台、用户角色、权限和高价值流程。
  2. 把工作流拆成可验证的初始状态、步骤和结果。
  3. 由获得授权的专家执行并记录完整轨迹。
  4. 标注观察、动作、字段、理由、错误和恢复。
  5. 移除真实个人信息、密钥与客户机密。
  6. 通过双人复核和自动规则检查轨迹质量。
  7. 划分训练、验证和测试集,防止任务泄漏。

提交智能体评测教程

  1. 确认私有测试资格并阅读当前提交要求。
  2. 固定智能体版本、模型、工具和运行参数。
  3. 使用测试密钥验证连接、终止和错误处理。
  4. 提交智能体并让平台运行标准任务。
  5. 查看成功率、耗时、动作和失败标签。
  6. 按失败阶段修复并在同一环境中复测。
  7. 对外公布成绩时同时说明版本、日期和方法。

适合哪些用户

  • 浏览器智能体公司:需要稳定评测产品升级。
  • 大模型团队:训练网页理解和操作能力。
  • Agent RL团队:需要可重置、可规模化的环境。
  • 企业自动化团队:验证智能体能否安全操作内部系统。
  • 数据团队:采购或制作高质量长轨迹数据。
  • 研究机构:分析跨应用规划、恢复和信用分配。
  • 模型评测团队:建立带状态证据的浏览器基准。

典型使用场景

  • 比较不同模型在同一企业流程中的成功率。
  • 回归测试提示、工具或浏览器执行器升级。
  • 定位智能体在哪一步点击、输入或判断失败。
  • 训练跨邮件、表格、客户开发和CRM的代理。
  • 在不触碰生产数据时测试写入型任务。
  • 生成监督微调和强化学习轨迹。
  • 把客户的专有工作流转成内部基准。
  • 评估网页是否便于自动化智能体使用。

产品优势

  • 环境可重置,便于公平比较不同智能体。
  • 从最终状态和状态变更验证任务,而非只看回答。
  • 逐动作事件分类有助于定位真实失败原因。
  • 仿真避免真实网站验证码、封禁和速率限制。
  • 同时覆盖评测、数据和强化学习训练链路。
  • 支持长流程、跨应用和企业SaaS工作流。
  • Python SDK可接入已有浏览器智能体框架。
  • SDRBench提供公开的任务设计和研究入口。

使用限制与注意事项

  • 平台仍处于私有测试,需要申请访问。
  • 官网没有公开固定套餐、免费额度或按量价格。
  • 样例数据集页面标为即将推出,不能视为已开放下载。
  • 公开排行榜核验时没有显示可用模型成绩。
  • 仿真永远可能与真实网站存在视觉、延迟和规则差异。
  • 企业专有环境和人工轨迹可能涉及较高制作成本。
  • 真实账户、登录凭据和支付细节属于高敏感信息。
  • 基准成绩只代表指定任务和版本,不能证明通用自主能力。
  • Python SDK可使用不代表平台、环境或数据开源。
  • 没有发现官方公开GitHub仓库或明确开源许可证。
  • 隐私政策没有为各类数据给出固定保留期限。

价格与接入方式

项目当前状态费用说明
官网浏览公开免费查看产品介绍、研究和排行榜
排行榜浏览公开无需付费,但当前未显示成绩数据
私有测试申请访问未公开固定价格
完整平台申请访问按团队、环境、任务和规模洽谈
自定义企业仿真企业服务需根据网站与工作流报价
专家训练数据企业服务按领域、轨迹长度和质量要求报价
智能体提交评测联系团队公开页未列收费规则
样例数据集即将推出尚无公开价格或可用下载

价格核验日期为2026年8月22日。Foundry尚未公布标准订阅、按运行计费或企业合同金额,因此不能根据其他同名Foundry产品填写价格。

报价时需要确认什么

报价变量需要确认的内容可能影响成本的原因
环境数量需要仿真的企业应用和版本每个应用都需建模与维护
任务规模任务数、难度、平均步骤和状态长任务运行与标注更多
并发与次数每日或每月轨迹、并发和峰值影响计算和浏览器资源
数据服务是否需要专家演示、复核和纠错人工质量成本差异大
保真度视觉、行为、数据和延迟要求高保真需要更多校准
部署与安全共享、专用或私有环境隔离和合规要求影响架构
支持SLA、响应、定制和研究协助企业支持通常单独定价

支持平台与技术接口

平台或接口支持状态用途
Web官网支持产品介绍、申请和研究内容
仿真浏览器环境支持运行和重置网页任务
Python SDK私有测试提供接入现有智能体工作流
CDP浏览器连接示例显示支持让智能体控制任务浏览器
事件与状态接口示例显示支持读取事件、最终状态和变更
公开排行榜支持展示标准基准与方法
独立桌面或移动应用未发现产品主要面向研发与企业接口
公开自助控制台未发现完整能力需私有测试资格

API密钥与凭据安全

SDK示例需要Foundry密钥,任务还可能包含登录凭据和支付细节。团队应使用测试账户、虚构支付工具和隔离的密钥管理系统,不要让生产凭据进入训练集或日志。

  • 为每个环境和团队使用独立、可轮换的密钥。
  • 只给测试账户授予完成基准所需的权限。
  • 日志和轨迹中屏蔽密码、令牌、支付及个人字段。
  • 禁止智能体访问任务范围外的域名和网络。
  • 设置运行超时、动作上限和紧急终止。
  • 对数据导出和排行榜发布增加审批。
  • 定期销毁过期凭据和已完成项目的测试数据。

隐私与数据收集

隐私政策列出的用户提交信息包括邮箱、姓名、组织、智能体提交、基准结果和沟通内容。自动收集内容包括使用分析、设备、IP、Cookie、性能指标和错误日志。

这些数据用于运营服务、处理智能体提交、生成基准结果、改进产品、支持沟通和安全。托管、分析与客服服务商可能在履行职责时处理相应数据。

排行榜公开与保密

政策说明智能体性能和基准结果可能显示在公开排行榜,但未经明确同意不会公开个人身份信息。企业仍应在提交前确认智能体名称、模型配置和失败轨迹是否会公开。

数据保留、跨境与权利

个人信息会保留到提供服务和完成政策目的所需的期间,或按法律要求延长;没有列出固定天数。数据可能传输至其他国家处理,并应采用适用的数据保护措施。

根据所在地,用户可请求访问、更新、删除、限制或反对处理、数据可携带和撤回同意。服务不面向13岁以下儿童。

GitHub、SDK与开源状态

官网明确展示Python SDK接入示例,但没有找到经官方确认的公开GitHub仓库、软件包页面或开源许可证。SDK可能只向私有测试客户分发。

项目公开状态结论
Foundry平台闭源企业服务产品本身不开源
Python SDK官网展示,需获取访问公开页未说明许可证
SDRBench论文公开可读论文公开不等于环境代码开源
样例数据集标记即将推出不能按已发布处理
官方GitHub未发现可确认仓库不要混淆微软或其他同名项目
仿真环境代码未公开无法仅凭官网自行部署

与Microsoft Foundry的区别

对比项本页FoundryMicrosoft Foundry
运营主体独立的浏览器智能体平台团队Microsoft
核心用途网页仿真、评测、数据和强化学习构建、部署与治理企业AI应用和智能体
主要接口私有Python SDK和仿真浏览器Azure云平台、SDK和服务
价格私有测试、未公开按具体Azure服务与资源计费
SDRBench官方研究基准不是其产品组成
官网域名thefoundryai.com微软云服务体系

基本信息

项目内容
工具名称Foundry
曾用品牌域名foundryrl.com
工具类型浏览器智能体仿真、评测、数据与强化学习平台
核心引擎Agent Web Engine
公开基准SDRBench
任务规模SDRBench包含50个确定性任务
接入状态私有测试
价格模式未公开,申请访问与企业洽谈
主要平台Web、仿真浏览器和Python SDK
开发语言官网示例为Python
公开API未提供完整公开自助文档
官方SDK提供Python SDK访问路径
产品是否开源不开源
官方GitHub未确认
隐私政策更新日期2025年10月28日
价格核验日期2026年8月22日

推荐指数

推荐指数:4.1 / 5。Foundry针对浏览器智能体最难解决的环境漂移、长轨迹评测和训练数据问题给出完整方向,适合专业Agent研发团队。

主要不足是仍为私有测试、价格和完整文档未公开、排行榜暂无可用成绩。普通用户和只想运行网页自动化的企业不会直接受益。

常见问题

Foundry是做什么的?

它为浏览器智能体团队提供可重置网页仿真、运行评测、专家长轨迹数据和强化学习训练环境。

这是Microsoft Foundry吗?

不是。本页产品由独立团队运营,专注浏览器智能体的仿真与评测,与微软同名云平台不同。

Foundry免费吗?

官网可免费浏览,但完整平台处于私有测试,未公布免费额度、标准套餐或固定企业价格。

怎样获得使用权限?

需要在官网申请私有测试或联系团队,说明智能体、任务、环境、轨迹量和数据需求。

提供Python SDK吗?

提供接入路径,官网展示了使用AWE环境、任务ID、浏览器连接和事件读取的Python示例。

SDRBench是什么?

它是针对销售开发工作流的可重置浏览器基准和强化学习训练场,包含50个确定性跨应用任务。

排行榜有模型成绩吗?

排行榜具备模型、成功率和耗时字段,但核验时页面显示没有可用基准成绩,因此不能给出排名。

可以评测自有智能体吗?

可以申请提交智能体,也可联系团队把自己的数据集或企业工作流用于基准。具体资格和费用未公开。

可以在真实网站上训练吗?

Foundry的重点是受控仿真,避免真实网站的漂移和反自动化限制。仿真结果仍需在获得授权的真实环境中验证。

能生成训练数据吗?

可以提供专家标注的自定义长轨迹数据,面向真实企业平台的监督微调。具体规模、质量标准和价格需洽谈。

Foundry开源吗?

不开源。论文和SDK示例公开可见,但没有找到官方开源平台代码、仿真环境或明确许可证。

样例数据集可以下载吗?

核验时样例数据集仍标为即将推出,不能视为已经开放。

会公开提交结果吗?

隐私政策说明智能体性能与基准结果可能出现在公开排行榜。提交前应确认公开字段与保密要求。

数据保存多久?

隐私政策只给出完成服务目的或法律要求所需期间,没有固定保留天数。企业合同应逐类约定。

适合普通网页自动化用户吗?

通常不适合。它面向构建、训练和评测浏览器智能体的专业团队,而不是让普通用户直接录制网页流程。

总结

Foundry把网页环境、状态、事件、评分和训练轨迹放在同一套基础设施中,帮助浏览器智能体团队获得稳定、可比较和可重复的研发循环。SDRBench展示了跨应用长流程的具体方向。

有意采用的团队应先申请私有测试,用自己的代表任务验证仿真与真实环境的一致性,并在合同中确认价格、数据保密、结果公开、凭据隔离、保留期限和SDK许可证。

©️版权声明:若无特殊声明,本站所有文章版权均归AI工具分享原创和所有,未经许可,任何个人、媒体、网站、团体不得转载、抄袭或以其他方式复制发表本站内容,或在非我站所属的服务器上建立镜像。否则,我站将依法保留追究相关法律责任的权利。

类似于Foundry的工具