OpenCompass
免費增值
AI工具大全 AI模型評測

OpenCompass

覆蓋多模型、多資料集與多維指標的大模型評測平台

標籤:

OpenCompass是什麼

OpenCompass是由上海人工智能實驗室所發起的開源大模型評測平台,用於系統地比較基礎模型、聊天模型以及多模態模型。它提供評測框架、資料集配置、模型適配、分散式推理、指標計算、結果彙總以及排行榜等功能,非常適合研究機構、模型團隊和企業用來建立可重複的 LLM 評測流程。

OpenCompass 既指可本地安裝的开源 Python 工具,也包括官網的 LLM、VLM 排行榜及 CompassHub、CompassRank 等生態。排行榜結果反映特定版本、提示詞、數據集和評測方法,不代表模型在所有真實業務中都更好。

OpenCompass核心功能

多維能力評測

能力體系涵蓋考試、知識、語言、理解、推理和安全等通用維度,也包括長文本、代碼、工具使用、知識增強等專項能力。用戶可選擇已有評測集合,也能組合適合自己業務的數據集與指標。

百餘數據集與配置化運行

專案內建大量中英文及專業標準,透過 Python 來設定模型、資料集、Prompt、推理器與評估器。這些設定可被繼承與組合,便於在同一模型上對不同資料集進行評估,或讓多個模型在相同條件下相互比較。

本地模型與API模型

OpenCompass 可直接載入 Hugging Face、InternLM 等本機模型,也能連接 OpenAI、DeepSeek 等相容的 API。自建服務則可透過 LMDeploy、vLLM、SGLang 等工具來提升處理效率。

閉源 API 模型無需本地顯卡,但會產生 Token 費用並受供應商限流與數據政策約束。

客觀評測

對於選擇題、填空題以及有標準答案的任務,可使用判別式或生成式評測。判別式方法是比較各個候選答案的困惑度,而生成式方法則讓模型直接輸出結果,再進行規則處理。

Prompt 模板、few-shot 範例和答案提取器都會影響分數,復現實驗必須固定配置和隨機種子。

主觀評測與LLM-as-Judge

對開放回答、安全、表達和複雜推理,可使用人工或大模型裁判。GenericLLMEvaluator 允許自訂裁判 Prompt、參考答案和 Judge 模型;

CascadeEvaluator 可先用規則評測,再只把未通過樣本交給 LLM,降低呼叫成本。

LLM 裁判存在位置偏差、風格偏好、自我偏好和隨機性。高風險結論應使用多裁判、交換答案順序、人工抽檢,並公開裁判模型與模板。

分散式與高效評測

框架可拆分推理和評估任務,在多張 GPU 或多台機器上執行,並通過任務監控、失敗重跑和結果持久化管理大規模實驗。推理加速後端能夠提高吞吐,但不同後端、量化和並行設定可能改變輸出,應單獨記錄。

多模態與專項生態

OpenCompass 生態包含 VLMEvalKit、AgentCompass 等項目,分別覆蓋視覺語言模型和 Agent 能力。不同子項目有獨立安裝方式、數據集與許可證,不能把所有多模態能力理解為主倉庫中的一個命令即可完成。

排行榜與報告

官網提供公開的模型排行榜,該框架可生成表格、摘要及詳細的樣本結果。查看排行榜時,應注意模型的日期、是否為封閉式源代碼、測試集的污染程度、Prompt內容、推理預算以及樣本覆蓋範圍,而非僅看總平均分數。

OpenCompass使用方式與成本對比

方式軟體費用主要成本適合場景
官網排行榜免費瀏覽無直接運行成本初步了解模型公開基準表現
本地開源評測免費,Apache 2.0GPU、CPU、儲存、電力及工程時間開源權重、私有模型和可復現實驗
API模型評測框架免費被測模型按Token或請求計費閉源模型或不便本地部署的模型
LLM-as-Judge評測組件免費裁判模型本地算力或API費用開放問答、品質與安全評估
企業評測服務無公開固定套餐按合作與服務範圍需要訂製基準、專家評審和報告的組織

評測方法對比

方法適用任務優勢局限
規則/準確率選擇題、數學、標準答案快速、穩定、成本低答案格式變化可能誤判
生成式指標翻譯、摘要、代碼可評價自由生成自動指標未必代表真實品質
LLM Judge開放問答、解釋與安全能處理複雜語義有偏差、隨機性且可能收費
人工評審高價值和專業場景可結合領域判斷昂貴、慢且一致性難保證
級聯評測規則可覆蓋部分樣本兼顧成本與語義判斷需要設計合理分流條件

OpenCompass安裝教學

  1. 準備環境:建立獨立的 Python 環境;本地模型會根據 PyTorch、CUDA 與顯示卡安裝相對應的依賴項目。
  2. 安裝項目:從官方倉庫安裝穩定版本或開發版本,並記錄提交哈希。
  3. 準備資料集:按文件下載所需基準,確認許可證、目錄與校驗結果。
  4. 選擇模型配置:使用已有本地或 API 設定,設定模型路徑、Key、併發數與上下文。
  5. 運行小規模測試:先使用少量數據檢查 Prompt、輸出解析、顯存和費用,再運行完整集合。
  6. 查看結果:檢查 summary、日誌與樣本明細,不能只看最終平均分。
  7. 保存實驗資訊:記錄模型版本、資料集、設定、後端、硬體和時間,便於重現。

自訂資料集評測

  1. 整理 JSONL 或 CSV,明確問題、參考答案、類別和元資料欄位。
  2. 定義 Dataset Reader 的輸入列與輸出列,劃分開發集和隱藏測試集。
  3. 為模型配置 Prompt Template、Retriever 和 Inferencer。
  4. 選擇規則、專業指標或 LLM Judge,並編寫可靠的後處理函數。
  5. 用人工標註小樣本驗證評估器,再擴大規模並分析分組結果。

評測結果如何正確解讀

總分可能掩蓋單項短板,應按語言、領域、難度和安全類別查看。不同模型的上下文長度、採樣參數、推理 Token 和工具權限必須盡量一致。

公開數據可能進入訓練語料,因此還應加入組織自建、時間更新和真實業務集,避免只優化排行榜。

適合哪些用戶

  • 比較開源與閉源大模型能力的研發人員與算法團隊;
  • 需要為模型選型建立客觀基準的企業技術負責人;
  • 開發推理、代碼、安全、長文本或多模態模型的團隊;
  • 希望復現公開排行榜並分析具體樣本的開發者;
  • 需要搭建私有數據集和持續回歸評測的組織。

優勢與注意事項

  • OpenCompass的優勢在於開源、中文生態完善、資料集與模型配置豐富,並涵蓋從推理、指標到報告的完整流程;
  • 它既適合快速基準,也能擴展成組織內部評測平台;
  • 安裝和完整評測需要一定工程與算力,資料集下載也可能很大;
  • 評測分數會受Prompt、答案提取、後端和Judge影響,不能視為模型絕對排名;
  • 資料集、模型權重和API分別有自己的許可證與隱私條款,運行代碼評測還應使用隔離容器;

常見問題

OpenCompass免費嗎

開源框架免費,並採用 Apache 2.0 授權協議,官網榜單可免費查閱。本地硬體、雲端 GPU、模型 API 以及評分模型的費用則由使用者承擔。

OpenCompass可以評測閉源模型嗎

可以,透過對應 API 設定接入,但會受供應商限流、價格和數據政策影響。

OpenCompass支援多模態嗎

OpenCompass 生態提供 VLM 排行榜和 VLMEvalKit 等多模態評測工具,具體安裝與資料集應參考對應專案。

排行榜第一就一定最好嗎

不一定。榜單只代表特定基準和配置,應結合真實業務、成本、延遲、安全與人工評測來選型。

OpenCompass開源嗎

開源,主倉庫採用 Apache License 2.0。部分資料集、模型及生態子專案則遵循各自的條款。

©️版權聲明:若無特殊說明,本站所有文章版權均歸AI工具分享本網站的內容為原創作品,任何人或機構在未獲許可的情況下,都不得轉載、抄襲或以其他方式複製並發表本網站的內容,亦不得在非本網站所屬的伺服器上建立其鏡像版本。否則,本網站將依法追究相關責任人的法律責任。

類似於OpenCompass的工具