Foundry是什麼
Foundry是一個專為AI瀏覽器智能體研發團隊所設計的模擬、評估及訓練數據平台。透過可重設的企業級網頁環境,開發者可以在不必依賴不斷變化的真實網站的情況下,對自動化智能體進行測試與訓練。
這裡介紹的是運作在 thefoundryai.com 上的瀏覽器智慧體平台,該平台過去使用的是 foundryrl.com 這個網域名稱,它並非 Microsoft Foundry、Foundry VTT 或其他同名的產品。
一句話介紹
Foundry為瀏覽器智能體提供可重複的網頁仿真、逐動作評估、專家長軌跡數據以及強化學習環境,並能透過Python SDK接入現有的代理。
產品定位
| 項目 | Foundry的定位 | 主要用戶 |
|---|---|---|
| 仿真 | 復刻企業網頁和業務狀態 | 智能體平台與研究團隊 |
| 評測 | 記錄、分類並評分每一步動作 | 評測、品質和模型團隊 |
| 數據 | 生成面向真實企業流程的專家長軌跡 | 監督微調團隊 |
| 強化學習 | 在可重設環境中採樣大量軌跡 | 後訓練與Agent RL團隊 |
| 排行榜 | 比較標準任務上的成功率與耗時 | 模型選擇和研發決策者 |
為什麼瀏覽器智能體需要仿真
真實網站會持續改版、更新數據並出現不同帳號狀態,導致同一智慧體在不一時刻面對不同環境。驗證碼、反自動化、速率限制和網路波動還會讓訓練難以重複。
Foundry試圖將網頁、帳戶及業務數據固定在可控制的狀態,如此一來,每次評測都能從相同的起點開始。如此一來,團隊就能將失敗的原因歸咎於智能體本身,而非那些無法解釋的頁面變化。
可復現瀏覽器環境
Simulation模組強調像素級、可重複的瀏覽器環境,並避免頁面偏移、隨機雜訊及外部速率限制。環境可重設至任務初始狀態,適合批量回歸與策略比較。
可重現性帶來的價值
- 讓不同模型面對相同頁面、數據和任務條件。
- 失敗後可回放並定位具體界面或策略問題。
- 升級提示、模型或工具後執行一致的回歸測試。
- 在不污染真實業務系統的情況下測試寫入操作。
- 批量採樣軌跡時不受真實站點反自動化機制干擾。
智能體評測
評估模組會追蹤、分類並標記智能體的每個動作。點擊失敗、佈局改變、錯誤操作以及未能達成目標的狀態,都不會僅被簡化為一個最終分數。
核心評測指標
| 指標 | 含義 | 解讀方式 |
|---|---|---|
| 任務成功率 | 完成目標的執行佔比 | 應結合任務難度和樣本量 |
| 平均完成時間 | 成功任務的平均耗時 | 更快不一定更穩健 |
| 動作數量 | 完成一次任務使用的步驟 | 過多可能代表繞路或恢復 |
| 失敗類型 | 點擊、佈局、誤操作等分類 | 用於定位工程問題 |
| 狀態變更 | 網頁與業務數據被如何修改 | 驗證結果而非只看文本 |
| 跨環境一致性 | 仿真與真實環境結果相關性 | 判斷仿真保真度 |
軌跡、事件和狀態記錄
Python SDK範例顯示,開發者可以取得任務提示、起始頁面、登入憑證、支付細節及附加說明,並記錄事件、最終狀態及狀態變更。評測器再將最終結果與標準答案進行比較。
適合保存的運行證據
- 任務ID、環境版本和智能體版本。
- 每一步觀察、動作、工具返回和時間。
- 點擊、輸入、導航和異常事件。
- 初始狀態、最終狀態及中間狀態變更。
- 人工標準、自動評分和失敗類別。
- 模型、提示、採樣參數和成本。
企業級訓練數據
Data模組由專家標註人員生成自訂長軌跡數據,用於真實企業平台及跨應用工作流程。此類數據可用於監督微調,讓模型學習正確的操作順序、欄位判斷以及失敗恢復方式。
長軌跡數據的特點
- 任務需要跨越多個頁面和應用。
- 前一步操作會改變後續頁面狀態。
- 錯誤可能在很多步驟後才暴露。
- 不僅包含成功路徑,也需要恢復和糾錯示例。
- 任務結果由業務狀態驗證,而非只有最後一句回答。
強化學習環境
RL模組允許在安全仿真中重複採樣和評估大量軌跡,避免真實網站的驗證碼、封禁以及產生數據風險。開發團隊可據此優化長流程中的信譽分配與錯誤恢復。
適合強化學習的研究問題
- 如何把最終成功獎勵分配給中間動作。
- 智能體何時應重試、回退或切換策略。
- 跨應用工作流中的記憶和狀態追蹤。
- 複雜表單中的欄位對齊與驗證。
- 在動作成本、耗時和成功率之間權衡。
SDRBench基準
Foundry公開的SDRBench是一套用於模擬銷售開發代表工作流程的工具,它是一種可重設的瀏覽器基準測試環境,同時也適用於強化學習的訓練。它包含50個確定性任務,且能保留跨應用程式的狀態。
任務涵蓋類似Gmail、Sheets、LinkedIn式的客戶開發,以及Apollo和Salesforce的業務流程,用於研究潛在客戶、進行個性化的外聯活動、管理客戶,並判斷潛在客戶的資格。
基準覆蓋能力
| 工作階段 | 代表任務 | 需要的智能體能力 |
|---|---|---|
| 線索研究 | 查找公司與聯絡人資訊 | 搜尋、閱讀和證據整合 |
| 外聯準備 | 根據線索撰寫個性化內容 | 上下文理解與文案生成 |
| 表格管理 | 讀取和更新線索列表 | 結構化數據操作 |
| CRM維護 | 創建、修改和推進記錄 | 權限、字段和狀態判斷 |
| 資格判斷 | 根據規則評估潛客 | 多條件推理 |
| 跨應用交接 | 在郵件、表格和CRM間傳遞狀態 | 長期記憶和一致性 |
公開排行榜
排行榜的設計旨在顯示模型、平均成功率以及完成任務的平均時間,同時還能提供流程階段的分析。此外,它還讓團隊能夠提交新的智能體、優化現有的智能體,或是將自身的企業流程納入基準範圍內。
核驗時頁面標註的SDR Automation Benchmark為2025年9月版本,但表格顯示沒有可用的公開成績。目錄正文不應虛構模型排名或成功率。
仿真與真實環境一致性
Foundry建議在仿真環境與真實環境中同時執行任務,並透過成功率相關性、皮爾遜相關係數以及排序一致性來驗證其精確度。此外,該系統還需要檢測真實界面中的偏差,並持續對仿真結果進行校準。
評估仿真是否可信
- 選擇一組獲得授權且風險可控的真實業務任務。
- 在仿真與真實環境中使用相同智能體和任務定義。
- 比較成功率、步驟、耗時和失敗類型。
- 計算絕對差異、相關性及模型排序一致性。
- 調查差異是來自頁面、數據、網路還是業務規則。
- 修訂仿真並重新運行,直到達到預設誤差範圍。
Python SDK接入方式
官網範例透過AWE環境對象來建立任務並執行它,進而取得任務與CDP的連線地址,再將瀏覽器會話交給已有的智慧體。執行後可讀取最終狀態、狀態變更以及相關事件。
接入流程
- 申請私有測試並取得平台帳戶、任務和密鑰。
- 在隔離開發環境安裝平台提供的Python SDK。
- 使用任務ID創建AWE環境並開啟事件記錄。
- 讀取任務說明並把瀏覽器連接地址交給智能體。
- 運行智能體並等待其提交或達到終止條件。
- 獲取最終狀態、狀態變更、事件和軌跡。
- 使用標準答案或業務啟發式計算分數。
建立回歸評測教學
- 按業務價值、難度和風險選擇代表性任務集。
- 凍結任務輸入、初始狀態、驗收條件和環境版本。
- 為成功、部分成功、錯誤修改和超時定義評分。
- 記錄模型、提示、工具版本、參數和隨機種子。
- 多次運行以計算均值、波動和置信區間。
- 按失敗類型定位提示、視覺、規劃或執行問題。
- 把閾值接入發布流程,阻止明顯退化版本上線。
構建訓練數據教學
- 確定目標平台、使用者角色、權限和高價值流程。
- 將工作流程拆分成可驗證的初始狀態、步驟和結果。
- 由獲得授權的專家執行並記錄完整軌跡。
- 標註觀察、動作、欄位、理由、錯誤和恢復。
- 移除真實個人資訊、金鑰與客戶機密。
- 透過雙人核對和自動規則檢查軌跡品質。
- 劃分訓練、驗證和測試集,防止任務洩漏。
提交智能體評測教學
- 確認私有測試資格並閱讀當前提交要求。
- 固定智能體版本、模型、工具和運行參數。
- 使用測試金鑰驗證連接、終止和錯誤處理。
- 提交智能體並讓平台運行標準任務。
- 查看成功率、耗時、動作和失敗標籤。
- 按失敗階段修復並在同一環境中複測。
- 對外公佈成績時同時說明版本、日期和方法。
適合哪些用戶
- 瀏覽器智能體公司:需要穩定評測產品升級。
- 大模型團隊:訓練網頁理解與操作能力。
- Agent RL團隊:需要可重設、可規模化的環境。
- 企業自動化團隊:驗證智慧體能否安全操作內部系統。
- 數據團隊:採購或製作高品質長軌跡數據。
- 研究機構:分析跨應用規劃、恢復和信譽分配。
- 模型評測團隊:建立帶狀態證據的瀏覽器基準。
典型使用場景
- 比較不同模型在同一企業流程中的成功率。
- 回歸測試提示、工具或瀏覽器執行器升級。
- 定位智能體在哪一步點擊、輸入或判斷失敗。
- 訓練跨郵件、表格、客戶開發和CRM的代理。
- 在不觸碰生產數據時測試寫入型任務。
- 生成監督微調與強化學習軌跡。
- 把客戶的專有工作轉化為內部基準。
- 評估網頁是否便於自動化智能體使用。
產品優勢
- 環境可重設,便於公平比較不同智能體。
- 從最終狀態和狀態變更驗證任務,而非只看回答。
- 逐動作事件分類有助於定位真實失敗原因。
- 仿真避免真實網站驗證碼、封禁和速率限制。
- 同時覆蓋評測、數據和強化學習訓練鏈路。
- 支援長流程、跨應用及企業SaaS工作流。
- Python SDK可接入已有瀏覽器智能體框架。
- SDRBench提供公開的任務設計與研究入口。
使用限制與注意事項
- 平台仍處於私有測試,需要申請訪問。
- 官網沒有公開固定套餐、免費額度或按量價格。
- 樣本資料集頁面標為即將推出,不能視為已開放下載。
- 公開排行榜核驗時沒有顯示可用模型成績。
- 仿真永遠可能與真實網站存在視覺、延遲和規則差異。
- 企業專有環境和人工軌跡可能涉及較高製作成本。
- 真實帳戶、登入憑證和支付細節屬於高敏感資訊。
- 基準成績只代表指定任務和版本,不能證明通用自主能力。
- Python SDK可使用不代表平台、環境或資料開源。
- 沒有發現官方公開的GitHub倉庫或明確的開源許可證。
- 隱私政策並未為各類數據規定固定的保留期限。
價格與接入方式
| 項目 | 當前狀態 | 費用說明 |
|---|---|---|
| 官網瀏覽 | 公開 | 免費查看產品介紹、研究和排行榜 |
| 排行榜瀏覽 | 公開 | 無需付費,但目前未顯示成績數據 |
| 私有測試 | 申請訪問 | 未公開固定價格 |
| 完整平台 | 申請訪問 | 按團隊、環境、任務和規模洽談 |
| 自訂企業仿真 | 企業服務 | 需根據網站與工作流報價 |
| 專家訓練數據 | 企業服務 | 按領域、軌跡長度和品質要求報價 |
| 智能體提交評測 | 聯絡團隊 | 公開頁未列收費規則 |
| 樣本資料集 | 即將推出 | 尚無公開價格或可用下載 |
價格核驗日期為2026年8月22日。Foundry尚未公佈標準訂閱、按運行計費或企業合約的價格,因此無法根據其他同名的Foundry產品來填寫價格。
報價時需要確認什麼
| 報價變數 | 需要確認的內容 | 可能影響成本的原因是 |
|---|---|---|
| 環境數量 | 需要仿真的企業應用和版本 | 每個應用都需建模與維護 |
| 任務規模 | 任務數、難度、平均步驟和狀態 | 長任務運行與標註更多 |
| 併發與次數 | 每日或每月軌跡、併發和峰值 | 影響計算和瀏覽器資源 |
| 數據服務 | 是否需要專家演示、複核和糾錯 | 人工質量成本差異大 |
| 保真度 | 視覺、行為、數據和延遲要求 | 高保真需要更多校準 |
| 部署與安全 | 共享、專用或私有環境 | 隔離和合規要求影響架構 |
| 支持 | SLA、回應、訂製和研究協助 | 企業支持通常單獨定價 |
支援平台與技術介面
| 平台或介面 | 支援狀態 | 用途 |
|---|---|---|
| Web官網 | 支持 | 產品介紹、申請和研究內容 |
| 仿真瀏覽器環境 | 支持 | 運行和重設網頁任務 |
| Python SDK | 私有測試提供 | 接入現有智能體工作流 |
| CDP瀏覽器連接 | 示例顯示支援 | 讓智能體控制任務瀏覽器 |
| 事件與狀態介面 | 示例顯示支援 | 讀取事件、最終狀態和變更 |
| 公開排行榜 | 支持 | 展示標準基準與方法 |
| 獨立桌面或行動應用 | 未發現 | 產品主要面向研發與企業接口 |
| 公開自助控制台 | 未發現 | 完整能力需私有測試資格 |
API密鑰與憑證安全
SDK範例需要Foundry金鑰,任務還可能包含登入憑證和支付細節。團隊應使用測試帳戶、虛構的支付工具以及隔離式的金鑰管理系統,切勿讓實際的生產用憑證進入訓練集或日誌中。
- 為每個環境和團隊使用獨立、可輪換的密鑰。
- 只給測試帳戶授予完成基準所需的權限。
- 日誌和軌跡中屏蔽密碼、令牌、支付及個人字段。
- 禁止智能體訪問任務範圍外的域名和網路。
- 設定運行超時、動作上限和緊急終止。
- 對數據導出和排行榜發布增加審批。
- 定期銷毀過期的憑證以及已完成專案的測試數據。
隱私與資料收集
隱私政策所列出的使用者提交的資訊包括電子郵件地址、姓名、所屬組織、由智慧體提交的資料、基準結果以及溝通內容。而自動收集的資訊則包括使用分析資料、裝置資訊、IP位址、Cookie、效能指標以及錯誤日誌。
這些數據用於運營服務、處理智能體提交的資料、產生基準結果、改進產品,以及支援溝通與安全。託管、分析與客服服務商在履行職責時,也可能處理相關數據。
排行榜公開與保密
政策說明:智慧體的表現及基準結果可能會顯示在公開排名榜上,但在未獲得明確同意的情況下,個人身份資訊是不會被公開的。企業仍應在提交之前確認,智慧體的名稱、模型設定以及失敗過程是否會被公開。
數據保留、跨境與權利
個人資訊會被保留到提供服務及達成相關政策目標所需的期間,或根據法律要求而延長保存時間;並未規定固定的天數。這些資料可能會被傳輸到其他國家進行處理,此時必須採取適當的資料保護措施。
根據所在地,用戶可請求訪問、更新、刪除、限制或反對處理,亦可要求數據的攜帶及撤回同意。本服務不適用於13歲以下的兒童。
GitHub、SDK與開源狀態
官網明確展示了Python SDK的接入範例,但沒有找到經官方確認的公開GitHub倉庫、軟體包頁面或開源許可證。SDK可能僅向私有測試客戶發放。
| 項目 | 公開狀態 | 結論 |
|---|---|---|
| Foundry平台 | 閉源企業服務 | 產品本身不開源 |
| Python SDK | 官網展示,需獲取訪問 | 公開頁未說明許可證 |
| SDRBench論文 | 公開可讀 | 論文公開不等於環境代碼開源 |
| 樣本資料集 | 標記即將推出 | 不能按已發布處理 |
| 官方GitHub | 未發現可確認倉庫 | 不要混淆微軟或其他同名項目 |
| 仿真環境代碼 | 未公開 | 無法僅憑官網自行部署 |
與Microsoft Foundry的差異
| 對比項 | 本頁Foundry | Microsoft Foundry |
|---|---|---|
| 運營主體 | 獨立的瀏覽器智慧體平台團隊 | Microsoft |
| 核心用途 | 網頁仿真、評測、數據和強化學習 | 構建、部署與治理企業AI應用和智能體 |
| 主要介面 | 私有Python SDK和仿真瀏覽器 | Azure雲平台、SDK和服務 |
| 價格 | 私有測試、未公開 | 按具體Azure服務與資源計費 |
| SDRBench | 官方研究基準 | 不是其產品組成 |
| 官網域名 | thefoundryai.com | 微軟雲服務體系 |
基本資訊
| 項目 | 內容 |
|---|---|
| 工具名稱 | Foundry |
| 曾用品牌域名 | foundryrl.com |
| 工具類型 | 瀏覽器智能體仿真、評測、數據與強化學習平台 |
| 核心引擎 | Agent Web Engine |
| 公開基準 | SDRBench |
| 任務規模 | SDRBench包含50個確定性任務 |
| 接入狀態 | 私有測試 |
| 價格模式 | 未公開,申請訪問與企業洽談 |
| 主要平台 | Web、仿真瀏覽器和Python SDK |
| 開發語言 | 官網示範為Python |
| 公開API | 未提供完整公開自助文件 |
| 官方SDK | 提供Python SDK訪問路徑 |
| 產品是否開源 | 不開源 |
| 官方GitHub | 未確認 |
| 隱私政策更新日期 | 2025年10月28日 |
| 價格核驗日期 | 2026年8月22日 |
推薦指數
推薦指數:4.1 / 5。Foundry針對瀏覽器智能體最難解決的環境漂移、長軌跡評測及訓練資料問題提供完整的解決方向,適合專業Agent研發團隊。
主要不足是仍為私有測試、價格和完整文件未公開、排行榜暫無可用成績。普通用戶和只想運行網頁自動化的企業不會直接受益。
常見問題
Foundry是做什麼的?
它為瀏覽器智能體團隊提供可重設的網頁仿真環境、運行評測功能、專家長軌跡數據,以及強化學習訓練環境。
這是Microsoft Foundry嗎?
不是。本頁產品由獨立團隊運營,專注於瀏覽器智能體的仿真與評測,與微軟同名的雲平台不同。
Foundry免費嗎?
官網可免費瀏覽,但完整平台處於私有測試,未公佈免費額度、標準套餐或固定企業價格。
怎樣獲得使用權限?
需要在官網申請私有測試或聯繫團隊,說明智能體、任務、環境、軌跡量及數據需求。
提供Python SDK嗎?
提供接入路徑,官網展示了使用AWE環境、任務ID、瀏覽器連接以及事件讀取的Python範例。
SDRBench是什麼?
它是一個用於銷售開發工作流程的、可重設的瀏覽器基準以及強化學習訓練場,其中包含50個具有確定性的跨應用程式任務。
排行榜有模型成績嗎?
排行榜具備模型、成功率與耗時欄位,但核驗時頁面顯示沒有可用基準成績,因此無法給出排名。
可以評測自有智能體嗎?
可以申請提交智能體,也可聯絡團隊把自己的資料集或企業工作流用於基準。具體資格和費用未公開。
可以在真實網站上訓練嗎?
Foundry的重點在於受控仿真,以避免真實網站的變動以及自動化相關的限制。仿真結果仍需在獲得授權的真實環境中進行驗證。
能生成訓練數據嗎?
可以提供專家標註的自訂長軌跡數據,用於真實企業平台的監督微調。具體規模、品質標準及價格需另行協商。
Foundry是開源的嗎?
不開源。論文和SDK範例可公開查看,但沒有找到官方開源平台的代碼、仿真環境或明確的許可證。
樣本資料集可以下載嗎?
核驗時樣本資料集仍標為即將推出,不能視為已經開放。
會公開提交結果嗎?
隱私政策說明:智慧體的表現與基準結果可能會出現在公開排行榜上。提交前應確認哪些資料屬於公開範圍,哪些則需保密。
數據保存多久?
隱私政策僅規定為了完成服務目的或符合法律要求所需的時間,並未設定固定的資料保存天數。企業合約應針對不同情況分別作出約定。
適合普通網頁自動化用戶嗎?
通常不適合。它面向構建、訓練和評測瀏覽器智能體的專業團隊,而不是讓普通用戶直接錄製網頁流程。
總結
Foundry將網頁環境、狀態、事件、評分以及訓練軌跡整合在相同的基礎設施中,這有助於瀏覽器智能體團隊建立穩定、可比較且可重複的研發循環。SDRBench則展示了跨應用程式的長期流程發展方向。
有意採用的團隊應先申請私有測試,用自己的代表任務驗證仿真與真實環境的一致性,並在合同中確認價格、資料保密、結果公開、憑據隔離、保留期限和SDK許可證。
桂公網安備45132202000164號