OpenCompass是什麼
OpenCompass是由上海人工智能實驗室所發起的開源大模型評測平台,用於系統地比較基礎模型、聊天模型以及多模態模型。它提供評測框架、資料集配置、模型適配、分散式推理、指標計算、結果彙總以及排行榜等功能,非常適合研究機構、模型團隊和企業用來建立可重複的 LLM 評測流程。
OpenCompass 既指可本地安裝的开源 Python 工具,也包括官網的 LLM、VLM 排行榜及 CompassHub、CompassRank 等生態。排行榜結果反映特定版本、提示詞、數據集和評測方法,不代表模型在所有真實業務中都更好。
OpenCompass核心功能
多維能力評測
能力體系涵蓋考試、知識、語言、理解、推理和安全等通用維度,也包括長文本、代碼、工具使用、知識增強等專項能力。用戶可選擇已有評測集合,也能組合適合自己業務的數據集與指標。
百餘數據集與配置化運行
專案內建大量中英文及專業標準,透過 Python 來設定模型、資料集、Prompt、推理器與評估器。這些設定可被繼承與組合,便於在同一模型上對不同資料集進行評估,或讓多個模型在相同條件下相互比較。
本地模型與API模型
OpenCompass 可直接載入 Hugging Face、InternLM 等本機模型,也能連接 OpenAI、DeepSeek 等相容的 API。自建服務則可透過 LMDeploy、vLLM、SGLang 等工具來提升處理效率。
閉源 API 模型無需本地顯卡,但會產生 Token 費用並受供應商限流與數據政策約束。
客觀評測
對於選擇題、填空題以及有標準答案的任務,可使用判別式或生成式評測。判別式方法是比較各個候選答案的困惑度,而生成式方法則讓模型直接輸出結果,再進行規則處理。
Prompt 模板、few-shot 範例和答案提取器都會影響分數,復現實驗必須固定配置和隨機種子。
主觀評測與LLM-as-Judge
對開放回答、安全、表達和複雜推理,可使用人工或大模型裁判。GenericLLMEvaluator 允許自訂裁判 Prompt、參考答案和 Judge 模型;
CascadeEvaluator 可先用規則評測,再只把未通過樣本交給 LLM,降低呼叫成本。
LLM 裁判存在位置偏差、風格偏好、自我偏好和隨機性。高風險結論應使用多裁判、交換答案順序、人工抽檢,並公開裁判模型與模板。
分散式與高效評測
框架可拆分推理和評估任務,在多張 GPU 或多台機器上執行,並通過任務監控、失敗重跑和結果持久化管理大規模實驗。推理加速後端能夠提高吞吐,但不同後端、量化和並行設定可能改變輸出,應單獨記錄。
多模態與專項生態
OpenCompass 生態包含 VLMEvalKit、AgentCompass 等項目,分別覆蓋視覺語言模型和 Agent 能力。不同子項目有獨立安裝方式、數據集與許可證,不能把所有多模態能力理解為主倉庫中的一個命令即可完成。
排行榜與報告
官網提供公開的模型排行榜,該框架可生成表格、摘要及詳細的樣本結果。查看排行榜時,應注意模型的日期、是否為封閉式源代碼、測試集的污染程度、Prompt內容、推理預算以及樣本覆蓋範圍,而非僅看總平均分數。
OpenCompass使用方式與成本對比
| 方式 | 軟體費用 | 主要成本 | 適合場景 |
|---|---|---|---|
| 官網排行榜 | 免費瀏覽 | 無直接運行成本 | 初步了解模型公開基準表現 |
| 本地開源評測 | 免費,Apache 2.0 | GPU、CPU、儲存、電力及工程時間 | 開源權重、私有模型和可復現實驗 |
| API模型評測 | 框架免費 | 被測模型按Token或請求計費 | 閉源模型或不便本地部署的模型 |
| LLM-as-Judge | 評測組件免費 | 裁判模型本地算力或API費用 | 開放問答、品質與安全評估 |
| 企業評測服務 | 無公開固定套餐 | 按合作與服務範圍 | 需要訂製基準、專家評審和報告的組織 |
評測方法對比
| 方法 | 適用任務 | 優勢 | 局限 |
|---|---|---|---|
| 規則/準確率 | 選擇題、數學、標準答案 | 快速、穩定、成本低 | 答案格式變化可能誤判 |
| 生成式指標 | 翻譯、摘要、代碼 | 可評價自由生成 | 自動指標未必代表真實品質 |
| LLM Judge | 開放問答、解釋與安全 | 能處理複雜語義 | 有偏差、隨機性且可能收費 |
| 人工評審 | 高價值和專業場景 | 可結合領域判斷 | 昂貴、慢且一致性難保證 |
| 級聯評測 | 規則可覆蓋部分樣本 | 兼顧成本與語義判斷 | 需要設計合理分流條件 |
OpenCompass安裝教學
- 準備環境:建立獨立的 Python 環境;本地模型會根據 PyTorch、CUDA 與顯示卡安裝相對應的依賴項目。
- 安裝項目:從官方倉庫安裝穩定版本或開發版本,並記錄提交哈希。
- 準備資料集:按文件下載所需基準,確認許可證、目錄與校驗結果。
- 選擇模型配置:使用已有本地或 API 設定,設定模型路徑、Key、併發數與上下文。
- 運行小規模測試:先使用少量數據檢查 Prompt、輸出解析、顯存和費用,再運行完整集合。
- 查看結果:檢查 summary、日誌與樣本明細,不能只看最終平均分。
- 保存實驗資訊:記錄模型版本、資料集、設定、後端、硬體和時間,便於重現。
自訂資料集評測
- 整理 JSONL 或 CSV,明確問題、參考答案、類別和元資料欄位。
- 定義 Dataset Reader 的輸入列與輸出列,劃分開發集和隱藏測試集。
- 為模型配置 Prompt Template、Retriever 和 Inferencer。
- 選擇規則、專業指標或 LLM Judge,並編寫可靠的後處理函數。
- 用人工標註小樣本驗證評估器,再擴大規模並分析分組結果。
評測結果如何正確解讀
總分可能掩蓋單項短板,應按語言、領域、難度和安全類別查看。不同模型的上下文長度、採樣參數、推理 Token 和工具權限必須盡量一致。
公開數據可能進入訓練語料,因此還應加入組織自建、時間更新和真實業務集,避免只優化排行榜。
適合哪些用戶
- 比較開源與閉源大模型能力的研發人員與算法團隊;
- 需要為模型選型建立客觀基準的企業技術負責人;
- 開發推理、代碼、安全、長文本或多模態模型的團隊;
- 希望復現公開排行榜並分析具體樣本的開發者;
- 需要搭建私有數據集和持續回歸評測的組織。
優勢與注意事項
- OpenCompass的優勢在於開源、中文生態完善、資料集與模型配置豐富,並涵蓋從推理、指標到報告的完整流程;
- 它既適合快速基準,也能擴展成組織內部評測平台;
- 安裝和完整評測需要一定工程與算力,資料集下載也可能很大;
- 評測分數會受Prompt、答案提取、後端和Judge影響,不能視為模型絕對排名;
- 資料集、模型權重和API分別有自己的許可證與隱私條款,運行代碼評測還應使用隔離容器;
常見問題
OpenCompass免費嗎
開源框架免費,並採用 Apache 2.0 授權協議,官網榜單可免費查閱。本地硬體、雲端 GPU、模型 API 以及評分模型的費用則由使用者承擔。
OpenCompass可以評測閉源模型嗎
可以,透過對應 API 設定接入,但會受供應商限流、價格和數據政策影響。
OpenCompass支援多模態嗎
OpenCompass 生態提供 VLM 排行榜和 VLMEvalKit 等多模態評測工具,具體安裝與資料集應參考對應專案。
排行榜第一就一定最好嗎
不一定。榜單只代表特定基準和配置,應結合真實業務、成本、延遲、安全與人工評測來選型。
OpenCompass開源嗎
開源,主倉庫採用 Apache License 2.0。部分資料集、模型及生態子專案則遵循各自的條款。
桂公網安備45132202000164號