LiveBench是什麼
LiveBench是一套持續更新的大語言模型基準測試與公開排行榜,重點解決傳統評測題目進入模型訓練數據後的污染問題。它使用近期資料、程式化生成題目和可驗證的標準答案,讓困難任務可以自動評分。
專案論文入選ICLR 2025 Spotlight,官方同時公開網站、論文、數據及評測代碼。它適合用於研究模型能力的差異,並非面向一般用戶的聊天或內容生成工具。
為什麼需要動態基準
固定題庫公開的時間越長,就越可能被模型開發者用於訓練、微調或提示優化,此時排行榜的分數就可能反映的是記憶能力而非泛化能力。LiveBench透過定期加入新題目並更新舊任務,盡量縮短題目被使用的時間。
「污染受限」並不等於完全沒有污染,公開網頁、競賽題目及代碼倉庫仍可能被納入訓練資料中。在閱讀結果時,應結合題目發布日期、模型訓練的截止時間以及具體任務內容來分析。
核心設計
持續更新題目
LiveBench會根據新發布的資料集、論文、新聞、電影簡介以及競賽相關資料,來增加或更換題目。更新日誌則會記錄每個發布日期時的任務變更情況。
客觀標準答案
每道題目都應盡量使用可驗證的ground truth以及確定性的評分程序,而非讓另一個大型模型主觀判斷。如此一來,就能減少評分模型所帶有的偏好、順序效應以及自我偏愛。
多能力覆蓋
基準涵蓋數學、編程、推理、語言、指令遵循、資料分析以及智能體編程等維度。不同版本的類別、任務和題目數量會有所變化,因此不能將早期的「六類十八項」視為永久性的規格。
版本化排行榜
每次更新都會形成帶有日期的release option,模型成績應與具體發布版本綁定。不同版本的題目和評分邏輯不同,分數不能不加說明地直接橫向比較。
開放評測代碼
官方倉庫提供用於產生回答、評分及顯示結果的腳本,並支援API模型與相容的介面。進行智能體編程時,還需要Docker來提供隔離式的執行環境。
當前評測類別
| 類別 | 主要考察能力 | 典型任務特徵 |
|---|---|---|
| 數學 | 計算、證明與綜合推理 | 競賽題、積分與程式化數學問題 |
| 編程 | 代碼生成和代碼補全 | 真實庫使用、測試用例與執行結果 |
| 智能體編程 | 在倉庫中定位並修復問題 | 多輪工具使用、真實開發環境 |
| 推理 | 邏輯、狀態追蹤和空間導航 | 斑馬謎題、心智理論與導航 |
| 語言 | 文本結構、詞語和篇章理解 | 拼寫、劇情排序與詞語關聯 |
| 指令遵循 | 滿足明確格式與約束 | 多條件輸出和可程式驗證要求 |
| 數據分析 | 表格、事件和關係處理 | 表格連接、格式重排與連續事件識別 |
主要功能一覽
- 查看不同模型在總體和各能力類別中的分數。
- 按模型、組織、版本和推理設定比較表現。
- 透過日期版本理解題目更新和排行變化。
- 下載公開數據並查看任務結構與標準答案。
- 使用官方腳本生成模型回答和客觀評分。
- 評估商業API模型或自建相容介面模型。
- 單獨運行數學、編程、推理等任務子集。
- 提交模型評測請求或透過Issue反饋問題。
- 閱讀論文與更新日誌了解方法與局限。
- 核復異常分數對應的具體任務和模型輸出。
適合哪些用戶
- AI研究人員:分析模型泛化、污染和能力差異。
- 模型開發團隊:在新的版本題目上進行回歸評測。
- 企業技術選型人員:篩選適合特定任務的候選模型。
- API平台與模型廠商:驗證新模型並提交排行榜。
- 開源社群:復現結果、修復評分器及貢獻新任務。
- 開發工具團隊:重點比較代碼與智能體編程能力。
- 教育與媒體研究者:理解排行榜方法與常見誤讀。
哪些情況不太適合
- 只想知道一個絕對“最強模型”而不看任務差異的使用者。
- 需要中文寫作、客服語氣或行業知識專項評價的團隊。
- 希望用單次排行榜直接替代真實業務試點的採購決策。
- 沒有API預算、GPU或沙箱環境卻要完整復現全部評測的個人。
- 要求對安全、偏見、隱私和事實可靠性全面認證的機構。
- 需要行動端聊天或直接完成生產任務的普通用戶。
排行榜查看教學
- 先確認頁面顯示的LiveBench發布日期和題目版本。
- 查看模型名稱、具體版本、推理強度和上下文設定。
- 先比較目標業務對應的類別,不只看整體平均分。
- 展開任務級結果,觀察高分是否集中在少數題型。
- 檢查是否有超時、空回答、成本限制或工具差異。
- 將候選模型放入自己的數據和工作流做二次評測。
本地運行評測教學
- 獲取官方倉庫並創建獨立Python虛擬環境。
- 按項目說明安裝基礎依賴和所需任務依賴。
- 選擇固定的LiveBench release選項並記錄提交版本。
- 配置模型名稱、API地址、金鑰和生成參數。
- 先運行少量題目驗證輸出格式與費用。
- 執行推理與評分,並保存原始回答和運行日誌。
- 使用同一版本和參數比較不同模型。
- 複查異常樣本後再統計類別與總分。
智能體編程評測教學
- 準備支援Docker的隔離主機並設定資源上限。
- 安裝智能體編程任務所需的額外依賴和鏡像。
- 確認模型支援需要的工具呼叫或互動方式。
- 固定智能體框架、步數限制、超時和環境版本。
- 運行小規模樣本,檢查倉庫掛載和測試命令。
- 批量執行任務並保存軌跡、補丁、測試與成本。
- 對失敗任務區分模型錯誤、環境錯誤和超時。
- 銷毀不可信容器並清理臨時憑證。
分數如何計算
任務的評分是根據確定性規則、標準答案、測試用例或專用處理程序來決定的,之後再將這些數值彙總到各個任務及類別中。整體分數通常是各類別平均分的總和,而非將所有題目的分數簡單相加所得。
版本更新可能會增加類別、替換任務或修改評分邏輯,因此必須記錄發布日期、代碼提交時間、模型參數以及運行環境。如果只引用分數而未註明版本,就無法重現該結果了。
| 層級 | 含義 | 閱讀重點 |
|---|---|---|
| 題目分 | 單個回答是否滿足標準 | 格式、答案、測試或約束 |
| 任務分 | 同一題型的平均表現 | 樣本數量和任務難度 |
| 類別分 | 多個相關任務的綜合表現 | 業務能力是否對應 |
| 總體分 | 類別平均後的總覽 | 不能掩蓋短板和任務權重 |
| 排名 | 當前版本中相對位置 | 只對同版本、同設定有效 |
版本與結果可比性
| 比較方式 | 是否合理 | 原因 |
|---|---|---|
| 同一發布日期、同一參數的模型比較 | 較合理 | 題目、評分和設定一致 |
| 不同發布日期的總體分直接比較 | 不建議 | 任務和難度可能已變化 |
| 基礎模型與高推理強度版本比較 | 需要標註 | 計算預算和延遲不同 |
| 官方運行與廠商自報分數比較 | 需要複核 | 環境、參數和代碼可能不同 |
| 排行榜分數與真實業務效果等同 | 不合理 | 基準任務不覆蓋具體流程 |
| 單類別用於對應任務初篩 | 合理但不充分 | 仍需業務數據驗證 |
汙染控制方法
- 定期發布基於近期材料的新問題。
- 從新論文、新聞、競賽和數據集中構建任務。
- 使用程式化方式生成部分可驗證題目。
- 更新已經飽和或疑似污染的舊任務。
- 將排行榜和數據與具體發布日期綁定。
- 使用客觀答案降低人工和模型裁判偏差。
這些措施只能降低汙染機率,無法證明所有模型從未見過相關材料。尤其是公開代碼題、新聞和論文可能很快進入訓練或檢索系統。
客觀評分的優勢與邊界
| 方面 | 優勢 | 邊界 |
|---|---|---|
| 一致性 | 同一規則對所有模型執行 | 規則錯誤會系統性影響結果 |
| 可重現性 | 可保存答案並重新評分 | 依賴版本與運行環境 |
| 成本 | 無需額外LLM裁判調用 | 代碼沙箱和模型推理仍有成本 |
| 偏差 | 減少裁判模型風格偏好 | 題目設計和格式要求仍包含人為選擇 |
| 困難任務 | 測試用例可精確判斷代碼結果 | 開放式品質和創造性難以覆蓋 |
價格與運行成本
LiveBench網站、論文及開源儲存庫均可免費訪問,該專案並沒有為讀者提供會員方案。自行進行測評時,主要的成本來自於模型API、GPU、智能體沙箱、儲存空間以及所需的工程時間。
| 項目 | 平台收費 | 實際可能成本 |
|---|---|---|
| 查看排行榜 | 免費 | 網路與閱讀時間 |
| 下載代碼和公開數據 | 免費 | 本地儲存和維護 |
| 商業API模型評測 | LiveBench不收費 | 模型供應商按Token或請求計費 |
| 開源模型推理 | LiveBench不收費 | GPU租賃、電力和運維 |
| 代碼執行任務 | LiveBench不收費 | Docker主機、CPU和隔離成本 |
| 智能體編程任務 | LiveBench不收費 | 長上下文、工具調用和多輪推理成本 |
| 官方代評請求 | 未見統一公開價 | 是否接受與安排由專案團隊決定 |
模型選型應該怎麼用
LiveBench適合將候選模型從幾十個縮小到少數幾個,但不應該直接決定採購。業務方還需評估價格、延遲、吞吐量、資料政策、穩定性、工具調用以及本地語言表現。
- 先選與業務最接近的類別和任務。
- 比較同一版本、同一推理預算的結果。
- 保留一組內部真實樣本作為最終測試。
- 同時記錄品質、Token、延遲和失敗率。
- 對高風險場景加入安全與事實核驗評測。
- 按實際流量進行併發、限流和穩定性測試。
評測安全注意事項
編程和智能體任務會執行模型所產生的代碼或指令,這些操作必須在隔離的容器中進行。切勿將生產用金鑰、主機目錄以及內網憑證提供給不可信的代碼。
- 使用一次性容器、最小權限和網路隔離。
- 限制CPU、記憶體、磁碟、進程數量以及運行時間。
- 不給容器掛載Docker控制介面和宿主敏感目錄。
- 使用短期API Key並設定預算與速率限制。
- 記錄模型、參數、鏡像和代碼提交版本。
- 任務完成後銷毀容器並撤銷臨時憑證。
產品優勢
- 持續更新題目,降低固定題庫長期污染風險。
- 使用可驗證標準答案,減少LLM裁判偏差。
- 涵蓋數學、程式設計、推理、語言及資料分析等能力。
- 加入真實倉庫環境下的智能體編程評測。
- 提供版本化排行榜、論文、數據和評測代碼。
- 任務級結果便於分析模型具體強項和短板。
- 能夠評估商業API和自建相容介面模型。
- 論文與開源社群為方法複核提供基礎。
使用限制與注意事項
- 污染只能被限制,無法證明完全不存在。
- 不同發布日期的分數不能直接當作同一尺度。
- 整體排名會掩蓋類別和任務級的差異。
- 公開排行榜不一定涵蓋所有新模型和推理設定。
- API超時、價格和速率限制可能影響模型分數。
- 評測主要使用客觀任務,難以覆蓋審美與開放式寫作。
- 中文、行業知識、安全與隱私能力並非其完整的重點。
- 智能體編程結果受框架、步數和沙箱環境影響。
- 本地模型直接推理路徑目前維護有限,官方建議使用相容服務。
- 高分不能替代真實業務驗證和風險評估。
GitHub與開源狀態
LiveBench官方倉庫由LiveBench組織維護,核驗時約有1,300個Star。倉庫包含評測腳本、任務處理器、結果展示和變更記錄,並接受Issue和代碼貢獻。
其LICENSE文件整合了FastChat、LiveCodeBench等來源的許可證文本,包括Apache-2.0和MIT條款。使用、修改或再分發時應按文件來源和第三方聲明逐項遵守,不能把整個倉庫簡化為單一許可證。
基本資訊
| 字段 | 內容 |
|---|---|
| 工具名稱 | LiveBench |
| 工具類型 | 大語言模型動態基準與排行榜 |
| 核心方法 | 近期題目、客觀答案、自動評分、版本更新 |
| 主要類別 | 數學、編程、智能體編程、推理、語言、指令、資料分析 |
| 論文 | ICLR 2025 Spotlight |
| 網站使用 | 免費查看 |
| 本地評測 | 支援API模型和相容服務 |
| 代碼任務 | 需要額外依賴,智能體任務需要Docker |
| 是否開源 | 是 |
| 許可證 | 包含Apache-2.0、MIT等第三方條款 |
推薦指數
4.7 / 5。LiveBench透過動態題目與客觀評分,改善了傳統LLM排行榜所存在的污染問題及評分偏差問題,適用於研究與技術選型;不過其版本可比性、任務覆蓋範圍以及運行成本等方面仍需謹慎判斷。
常見問題
LiveBench免費嗎?
排行榜、論文、代碼和公開數據可免費訪問。自行評測會產生模型API、GPU、計算和工程維護成本。
LiveBench真的沒有污染嗎?
無法保證絕對沒有。它透過新題、近期資料以及持續更新來降低汙染機率,更準確的說法是「汙染受到限制」。
為什麼不用大模型當裁判?
專案優先使用標準答案和確定性評分,避免裁判模型的偏好、順序效應和自我偏愛。開放式品質因此覆蓋較少。
不同版本的分數能比較嗎?
不建議直接比較。題目、任務和難度可能變化,至少要同時標註發布日期、模型參數和代碼版本。
可以測試自己的模型嗎?
可以。最穩妥的方式是將模型部署為相容接口,再使用官方運行腳本生成回答和評分。
為什麼排行榜沒有某個最新模型?
官方評測需要API的可用性、穩定性、預算以及時間,過於昂貴或經常超時的模型可能無法完成公平測試。
LiveBench能直接決定模型採購嗎?
不能。它適合初篩,最終還要用真實業務數據測試品質、延遲、費用、穩定性和合規性。
LiveBench是開源的嗎?
是的,但倉庫中包含來自多個來源的程式碼以及各種許可證條款。在再次發布時,需要檢查Apache-2.0、MIT以及其他相關的規定。
桂公網安備45132202000164號