Foundry是什么
Foundry是一款面向AI浏览器智能体研发团队的仿真、评测和训练数据平台。它通过可重置的企业网页环境,让开发者在不依赖持续变化的真实网站时测试和训练自动化智能体。
这里介绍的是运营于thefoundryai.com、此前使用foundryrl.com域名的浏览器智能体平台,不是Microsoft Foundry、Foundry VTT或其他同名产品。
一句话介绍
Foundry为浏览器智能体提供可复现网页仿真、逐动作评测、专家长轨迹数据和强化学习环境,并可通过Python SDK接入现有代理。
产品定位
| 项目 | Foundry的定位 | 主要用户 |
|---|---|---|
| 仿真 | 复刻企业网页和业务状态 | 智能体平台与研究团队 |
| 评测 | 记录、分类并评分每一步动作 | 评测、质量和模型团队 |
| 数据 | 生成面向真实企业流程的专家长轨迹 | 监督微调团队 |
| 强化学习 | 在可重置环境中采样大量轨迹 | 后训练与Agent RL团队 |
| 排行榜 | 比较标准任务上的成功率与耗时 | 模型选择和研发决策者 |
为什么浏览器智能体需要仿真
真实网站会持续改版、更新数据并出现不同账号状态,导致同一智能体在不同时刻面对不同环境。验证码、反自动化、速率限制和网络波动还会让训练难以重复。
Foundry尝试把网页、账户和业务数据冻结在可控状态,使每次评测从相同起点开始。团队可以把失败归因于智能体本身,而不是无法解释的页面漂移。
可复现浏览器环境
Simulation模块强调像素级、可重复的浏览器环境,并避免页面漂移、随机噪声和外部速率限制。环境可重置到任务初始状态,适合批量回归和策略比较。
可复现性带来的价值
- 让不同模型面对相同页面、数据和任务条件。
- 失败后可回放并定位具体界面或策略问题。
- 升级提示、模型或工具后执行一致的回归测试。
- 在不污染真实业务系统的情况下测试写入操作。
- 批量采样轨迹时不受真实站点反自动化机制干扰。
智能体评测
Evaluation模块跟踪、分类并标记智能体的每个动作。点击失败、布局变化、错误操作和未达到目标的状态不会只被简化成一个最终分数。
核心评测指标
| 指标 | 含义 | 解读方式 |
|---|---|---|
| 任务成功率 | 完成目标的执行占比 | 应结合任务难度和样本量 |
| 平均完成时间 | 成功任务的平均耗时 | 更快不一定更稳健 |
| 动作数量 | 完成一次任务使用的步骤 | 过多可能代表绕路或恢复 |
| 失败类型 | 点击、布局、误操作等分类 | 用于定位工程问题 |
| 状态变更 | 网页与业务数据被如何修改 | 验证结果而非只看文本 |
| 跨环境一致性 | 仿真与真实环境结果相关性 | 判断仿真保真度 |
轨迹、事件和状态记录
Python SDK示例显示,开发者可以获取任务提示、起始页面、登录凭据、支付细节和附加说明,并记录事件、最终状态及状态变更。评测器再把最终结果与标准答案比较。
适合保存的运行证据
- 任务ID、环境版本和智能体版本。
- 每一步观察、动作、工具返回和时间。
- 点击、输入、导航和异常事件。
- 初始状态、最终状态及中间状态变更。
- 人工标准、自动评分和失败类别。
- 模型、提示、采样参数和成本。
企业级训练数据
Data模块由专家标注人员生成自定义长轨迹数据,面向真实企业平台和跨应用工作流。此类数据可用于监督微调,让模型学习正确操作顺序、字段判断和失败恢复。
长轨迹数据的特点
- 任务需要跨越多个页面和应用。
- 前一步操作会改变后续页面状态。
- 错误可能在很多步骤后才暴露。
- 不仅包含成功路径,也需要恢复和纠错示例。
- 任务结果由业务状态验证,而不只是最后一句回答。
强化学习环境
RL模块允许在安全仿真中重复采样和评价大量轨迹,避免真实网站的验证码、封禁和生产数据风险。开发团队可据此优化长流程中的信用分配和错误恢复。
适合强化学习的研究问题
- 如何把最终成功奖励分配给中间动作。
- 智能体何时应重试、回退或切换策略。
- 跨应用工作流中的记忆和状态追踪。
- 复杂表单中的字段对齐与验证。
- 在动作成本、耗时和成功率之间权衡。
SDRBench基准
Foundry公开的SDRBench是一套针对销售开发代表流程的模拟、可重置浏览器基准和强化学习训练场。它包含50个确定性任务,并保留跨应用状态。
任务覆盖类似Gmail、Sheets、LinkedIn式客户开发、Apollo和Salesforce的业务流程,用于研究线索调研、外联个性化、客户管理和潜客资格判断。
基准覆盖能力
| 工作阶段 | 代表任务 | 需要的智能体能力 |
|---|---|---|
| 线索研究 | 查找公司与联系人信息 | 搜索、阅读和证据整合 |
| 外联准备 | 根据线索撰写个性化内容 | 上下文理解与文案生成 |
| 表格管理 | 读取和更新线索列表 | 结构化数据操作 |
| CRM维护 | 创建、修改和推进记录 | 权限、字段和状态判断 |
| 资格判断 | 根据规则评估潜客 | 多条件推理 |
| 跨应用交接 | 在邮件、表格和CRM间传递状态 | 长期记忆和一致性 |
公开排行榜
排行榜设计为显示模型、平均成功率和成功任务平均耗时,并提供流程阶段分析。它还允许团队提交智能体、优化现有智能体或让自己的企业流程进入基准。
核验时页面标注的SDR Automation Benchmark为2025年9月版本,但表格显示没有可用的公开成绩。目录正文不应虚构模型排名或成功率。
仿真与真实环境一致性
Foundry提出在仿真和真实环境中并行执行任务,再用成功率相关性、Pearson相关和排序一致性验证保真度。系统还需要检测真实界面漂移并持续校准仿真。
评估仿真是否可信
- 选择一组获得授权且风险可控的真实业务任务。
- 在仿真与真实环境中使用相同智能体和任务定义。
- 比较成功率、步骤、耗时和失败类型。
- 计算绝对差异、相关性和模型排序一致性。
- 调查差异是来自页面、数据、网络还是业务规则。
- 修订仿真并重新运行,直到达到预设误差范围。
Python SDK接入方式
官网示例通过AWE环境对象创建任务运行,获取任务与CDP连接地址,再把浏览器会话交给已有智能体。执行后可读取最终状态、状态变更和事件。
接入流程
- 申请私有测试并取得平台账户、任务和密钥。
- 在隔离开发环境安装平台提供的Python SDK。
- 使用任务ID创建AWE环境并开启事件记录。
- 读取任务说明并把浏览器连接地址交给智能体。
- 运行智能体并等待其提交或达到终止条件。
- 获取最终状态、状态变更、事件和轨迹。
- 使用标准答案或业务启发式计算分数。
建立回归评测教程
- 按业务价值、难度和风险选择代表性任务集。
- 冻结任务输入、初始状态、验收条件和环境版本。
- 为成功、部分成功、错误修改和超时定义评分。
- 记录模型、提示、工具版本、参数和随机种子。
- 多次运行以计算均值、波动和置信区间。
- 按失败类型定位提示、视觉、规划或执行问题。
- 把阈值接入发布流程,阻止明显退化版本上线。
构建训练数据教程
- 确定目标平台、用户角色、权限和高价值流程。
- 把工作流拆成可验证的初始状态、步骤和结果。
- 由获得授权的专家执行并记录完整轨迹。
- 标注观察、动作、字段、理由、错误和恢复。
- 移除真实个人信息、密钥与客户机密。
- 通过双人复核和自动规则检查轨迹质量。
- 划分训练、验证和测试集,防止任务泄漏。
提交智能体评测教程
- 确认私有测试资格并阅读当前提交要求。
- 固定智能体版本、模型、工具和运行参数。
- 使用测试密钥验证连接、终止和错误处理。
- 提交智能体并让平台运行标准任务。
- 查看成功率、耗时、动作和失败标签。
- 按失败阶段修复并在同一环境中复测。
- 对外公布成绩时同时说明版本、日期和方法。
适合哪些用户
- 浏览器智能体公司:需要稳定评测产品升级。
- 大模型团队:训练网页理解和操作能力。
- Agent RL团队:需要可重置、可规模化的环境。
- 企业自动化团队:验证智能体能否安全操作内部系统。
- 数据团队:采购或制作高质量长轨迹数据。
- 研究机构:分析跨应用规划、恢复和信用分配。
- 模型评测团队:建立带状态证据的浏览器基准。
典型使用场景
- 比较不同模型在同一企业流程中的成功率。
- 回归测试提示、工具或浏览器执行器升级。
- 定位智能体在哪一步点击、输入或判断失败。
- 训练跨邮件、表格、客户开发和CRM的代理。
- 在不触碰生产数据时测试写入型任务。
- 生成监督微调和强化学习轨迹。
- 把客户的专有工作流转成内部基准。
- 评估网页是否便于自动化智能体使用。
产品优势
- 环境可重置,便于公平比较不同智能体。
- 从最终状态和状态变更验证任务,而非只看回答。
- 逐动作事件分类有助于定位真实失败原因。
- 仿真避免真实网站验证码、封禁和速率限制。
- 同时覆盖评测、数据和强化学习训练链路。
- 支持长流程、跨应用和企业SaaS工作流。
- Python SDK可接入已有浏览器智能体框架。
- SDRBench提供公开的任务设计和研究入口。
使用限制与注意事项
- 平台仍处于私有测试,需要申请访问。
- 官网没有公开固定套餐、免费额度或按量价格。
- 样例数据集页面标为即将推出,不能视为已开放下载。
- 公开排行榜核验时没有显示可用模型成绩。
- 仿真永远可能与真实网站存在视觉、延迟和规则差异。
- 企业专有环境和人工轨迹可能涉及较高制作成本。
- 真实账户、登录凭据和支付细节属于高敏感信息。
- 基准成绩只代表指定任务和版本,不能证明通用自主能力。
- Python SDK可使用不代表平台、环境或数据开源。
- 没有发现官方公开GitHub仓库或明确开源许可证。
- 隐私政策没有为各类数据给出固定保留期限。
价格与接入方式
| 项目 | 当前状态 | 费用说明 |
|---|---|---|
| 官网浏览 | 公开 | 免费查看产品介绍、研究和排行榜 |
| 排行榜浏览 | 公开 | 无需付费,但当前未显示成绩数据 |
| 私有测试 | 申请访问 | 未公开固定价格 |
| 完整平台 | 申请访问 | 按团队、环境、任务和规模洽谈 |
| 自定义企业仿真 | 企业服务 | 需根据网站与工作流报价 |
| 专家训练数据 | 企业服务 | 按领域、轨迹长度和质量要求报价 |
| 智能体提交评测 | 联系团队 | 公开页未列收费规则 |
| 样例数据集 | 即将推出 | 尚无公开价格或可用下载 |
价格核验日期为2026年8月22日。Foundry尚未公布标准订阅、按运行计费或企业合同金额,因此不能根据其他同名Foundry产品填写价格。
报价时需要确认什么
| 报价变量 | 需要确认的内容 | 可能影响成本的原因 |
|---|---|---|
| 环境数量 | 需要仿真的企业应用和版本 | 每个应用都需建模与维护 |
| 任务规模 | 任务数、难度、平均步骤和状态 | 长任务运行与标注更多 |
| 并发与次数 | 每日或每月轨迹、并发和峰值 | 影响计算和浏览器资源 |
| 数据服务 | 是否需要专家演示、复核和纠错 | 人工质量成本差异大 |
| 保真度 | 视觉、行为、数据和延迟要求 | 高保真需要更多校准 |
| 部署与安全 | 共享、专用或私有环境 | 隔离和合规要求影响架构 |
| 支持 | SLA、响应、定制和研究协助 | 企业支持通常单独定价 |
支持平台与技术接口
| 平台或接口 | 支持状态 | 用途 |
|---|---|---|
| Web官网 | 支持 | 产品介绍、申请和研究内容 |
| 仿真浏览器环境 | 支持 | 运行和重置网页任务 |
| Python SDK | 私有测试提供 | 接入现有智能体工作流 |
| CDP浏览器连接 | 示例显示支持 | 让智能体控制任务浏览器 |
| 事件与状态接口 | 示例显示支持 | 读取事件、最终状态和变更 |
| 公开排行榜 | 支持 | 展示标准基准与方法 |
| 独立桌面或移动应用 | 未发现 | 产品主要面向研发与企业接口 |
| 公开自助控制台 | 未发现 | 完整能力需私有测试资格 |
API密钥与凭据安全
SDK示例需要Foundry密钥,任务还可能包含登录凭据和支付细节。团队应使用测试账户、虚构支付工具和隔离的密钥管理系统,不要让生产凭据进入训练集或日志。
- 为每个环境和团队使用独立、可轮换的密钥。
- 只给测试账户授予完成基准所需的权限。
- 日志和轨迹中屏蔽密码、令牌、支付及个人字段。
- 禁止智能体访问任务范围外的域名和网络。
- 设置运行超时、动作上限和紧急终止。
- 对数据导出和排行榜发布增加审批。
- 定期销毁过期凭据和已完成项目的测试数据。
隐私与数据收集
隐私政策列出的用户提交信息包括邮箱、姓名、组织、智能体提交、基准结果和沟通内容。自动收集内容包括使用分析、设备、IP、Cookie、性能指标和错误日志。
这些数据用于运营服务、处理智能体提交、生成基准结果、改进产品、支持沟通和安全。托管、分析与客服服务商可能在履行职责时处理相应数据。
排行榜公开与保密
政策说明智能体性能和基准结果可能显示在公开排行榜,但未经明确同意不会公开个人身份信息。企业仍应在提交前确认智能体名称、模型配置和失败轨迹是否会公开。
数据保留、跨境与权利
个人信息会保留到提供服务和完成政策目的所需的期间,或按法律要求延长;没有列出固定天数。数据可能传输至其他国家处理,并应采用适用的数据保护措施。
根据所在地,用户可请求访问、更新、删除、限制或反对处理、数据可携带和撤回同意。服务不面向13岁以下儿童。
GitHub、SDK与开源状态
官网明确展示Python SDK接入示例,但没有找到经官方确认的公开GitHub仓库、软件包页面或开源许可证。SDK可能只向私有测试客户分发。
| 项目 | 公开状态 | 结论 |
|---|---|---|
| Foundry平台 | 闭源企业服务 | 产品本身不开源 |
| Python SDK | 官网展示,需获取访问 | 公开页未说明许可证 |
| SDRBench论文 | 公开可读 | 论文公开不等于环境代码开源 |
| 样例数据集 | 标记即将推出 | 不能按已发布处理 |
| 官方GitHub | 未发现可确认仓库 | 不要混淆微软或其他同名项目 |
| 仿真环境代码 | 未公开 | 无法仅凭官网自行部署 |
与Microsoft Foundry的区别
| 对比项 | 本页Foundry | Microsoft Foundry |
|---|---|---|
| 运营主体 | 独立的浏览器智能体平台团队 | Microsoft |
| 核心用途 | 网页仿真、评测、数据和强化学习 | 构建、部署与治理企业AI应用和智能体 |
| 主要接口 | 私有Python SDK和仿真浏览器 | Azure云平台、SDK和服务 |
| 价格 | 私有测试、未公开 | 按具体Azure服务与资源计费 |
| SDRBench | 官方研究基准 | 不是其产品组成 |
| 官网域名 | thefoundryai.com | 微软云服务体系 |
基本信息
| 项目 | 内容 |
|---|---|
| 工具名称 | Foundry |
| 曾用品牌域名 | foundryrl.com |
| 工具类型 | 浏览器智能体仿真、评测、数据与强化学习平台 |
| 核心引擎 | Agent Web Engine |
| 公开基准 | SDRBench |
| 任务规模 | SDRBench包含50个确定性任务 |
| 接入状态 | 私有测试 |
| 价格模式 | 未公开,申请访问与企业洽谈 |
| 主要平台 | Web、仿真浏览器和Python SDK |
| 开发语言 | 官网示例为Python |
| 公开API | 未提供完整公开自助文档 |
| 官方SDK | 提供Python SDK访问路径 |
| 产品是否开源 | 不开源 |
| 官方GitHub | 未确认 |
| 隐私政策更新日期 | 2025年10月28日 |
| 价格核验日期 | 2026年8月22日 |
推荐指数
推荐指数:4.1 / 5。Foundry针对浏览器智能体最难解决的环境漂移、长轨迹评测和训练数据问题给出完整方向,适合专业Agent研发团队。
主要不足是仍为私有测试、价格和完整文档未公开、排行榜暂无可用成绩。普通用户和只想运行网页自动化的企业不会直接受益。
常见问题
Foundry是做什么的?
它为浏览器智能体团队提供可重置网页仿真、运行评测、专家长轨迹数据和强化学习训练环境。
这是Microsoft Foundry吗?
不是。本页产品由独立团队运营,专注浏览器智能体的仿真与评测,与微软同名云平台不同。
Foundry免费吗?
官网可免费浏览,但完整平台处于私有测试,未公布免费额度、标准套餐或固定企业价格。
怎样获得使用权限?
需要在官网申请私有测试或联系团队,说明智能体、任务、环境、轨迹量和数据需求。
提供Python SDK吗?
提供接入路径,官网展示了使用AWE环境、任务ID、浏览器连接和事件读取的Python示例。
SDRBench是什么?
它是针对销售开发工作流的可重置浏览器基准和强化学习训练场,包含50个确定性跨应用任务。
排行榜有模型成绩吗?
排行榜具备模型、成功率和耗时字段,但核验时页面显示没有可用基准成绩,因此不能给出排名。
可以评测自有智能体吗?
可以申请提交智能体,也可联系团队把自己的数据集或企业工作流用于基准。具体资格和费用未公开。
可以在真实网站上训练吗?
Foundry的重点是受控仿真,避免真实网站的漂移和反自动化限制。仿真结果仍需在获得授权的真实环境中验证。
能生成训练数据吗?
可以提供专家标注的自定义长轨迹数据,面向真实企业平台的监督微调。具体规模、质量标准和价格需洽谈。
Foundry开源吗?
不开源。论文和SDK示例公开可见,但没有找到官方开源平台代码、仿真环境或明确许可证。
样例数据集可以下载吗?
核验时样例数据集仍标为即将推出,不能视为已经开放。
会公开提交结果吗?
隐私政策说明智能体性能与基准结果可能出现在公开排行榜。提交前应确认公开字段与保密要求。
数据保存多久?
隐私政策只给出完成服务目的或法律要求所需期间,没有固定保留天数。企业合同应逐类约定。
适合普通网页自动化用户吗?
通常不适合。它面向构建、训练和评测浏览器智能体的专业团队,而不是让普通用户直接录制网页流程。
总结
Foundry把网页环境、状态、事件、评分和训练轨迹放在同一套基础设施中,帮助浏览器智能体团队获得稳定、可比较和可重复的研发循环。SDRBench展示了跨应用长流程的具体方向。
有意采用的团队应先申请私有测试,用自己的代表任务验证仿真与真实环境的一致性,并在合同中确认价格、数据保密、结果公开、凭据隔离、保留期限和SDK许可证。
桂公网安备45132202000164号