OpenCompass是什么
OpenCompass 是由上海人工智能实验室发起的开源大模型评测平台,用于系统比较基础模型、聊天模型和多模态模型。它提供评测框架、数据集配置、模型适配、分布式推理、指标计算、结果汇总和排行榜,适合研究机构、模型团队和企业建立可复现的 LLM 评测流程。
OpenCompass 既指可本地安装的开源 Python 工具,也包括官网的 LLM、VLM 排行榜及 CompassHub、CompassRank 等生态。排行榜结果反映特定版本、提示词、数据集和评测方法,不代表模型在所有真实业务中都更好。
OpenCompass核心功能
多维能力评测
能力体系覆盖考试、知识、语言、理解、推理和安全等通用维度,也包括长文本、代码、工具使用、知识增强等专项能力。用户可选择已有评测集合,也能组合适合自己业务的数据集与指标。
百余数据集与配置化运行
项目内置大量中英文与专业基准,通过 Python 配置描述模型、数据集、Prompt、推理器和评估器。配置可继承和组合,便于同一模型跨数据集评测,或让多个模型在相同条件下比较。
本地模型与API模型
OpenCompass 可直接加载 Hugging Face、InternLM 等本地模型,也能连接 OpenAI、DeepSeek 等兼容 API。自建服务可通过 LMDeploy、vLLM、SGLang 等提高吞吐。闭源 API 模型无需本地显卡,但会产生 Token 费用并受供应商限流与数据政策约束。
客观评测
对选择题、填空和有标准答案的任务,可使用判别式或生成式评测。判别式方法比较候选答案困惑度,生成式方法让模型直接输出再进行规则处理。Prompt 模板、few-shot 示例和答案提取器都会影响分数,复现实验必须固定配置和随机种子。
主观评测与LLM-as-Judge
对开放回答、安全、表达和复杂推理,可使用人工或大模型裁判。GenericLLMEvaluator 允许自定义裁判 Prompt、参考答案和 Judge 模型;CascadeEvaluator 可先用规则评测,再只把未通过样本交给 LLM,降低调用成本。
LLM 裁判存在位置偏差、风格偏好、自我偏好和随机性。高风险结论应使用多裁判、交换答案顺序、人工抽检,并公开裁判模型与模板。
分布式与高效评测
框架可拆分推理和评估任务,在多张 GPU 或多台机器上执行,并通过任务监控、失败重跑和结果持久化管理大规模实验。推理加速后端能够提高吞吐,但不同后端、量化和并行设置可能改变输出,应单独记录。
多模态与专项生态
OpenCompass 生态包含 VLMEvalKit、AgentCompass 等项目,分别覆盖视觉语言模型和 Agent 能力。不同子项目有独立安装方式、数据集与许可证,不能把所有多模态能力理解为主仓库中的一个命令即可完成。
排行榜与报告
官网提供公开模型榜单,框架可生成表格、摘要和详细样本结果。看榜单时应关注模型日期、是否闭源、测试集污染、Prompt、推理预算与样本覆盖,而不是只看总平均分。
OpenCompass使用方式与成本对比
| 方式 | 软件费用 | 主要成本 | 适合场景 |
|---|---|---|---|
| 官网排行榜 | 免费浏览 | 无直接运行成本 | 初步了解模型公开基准表现 |
| 本地开源评测 | 免费,Apache 2.0 | GPU、CPU、存储、电力和工程时间 | 开源权重、私有模型和可复现实验 |
| API模型评测 | 框架免费 | 被测模型按Token或请求计费 | 闭源模型或不便本地部署的模型 |
| LLM-as-Judge | 评测组件免费 | 裁判模型本地算力或API费用 | 开放问答、质量与安全评估 |
| 企业评测服务 | 无公开固定套餐 | 按合作与服务范围 | 需要定制基准、专家评审和报告的组织 |
评测方法对比
| 方法 | 适用任务 | 优势 | 局限 |
|---|---|---|---|
| 规则/准确率 | 选择题、数学、标准答案 | 快速、稳定、成本低 | 答案格式变化可能误判 |
| 生成式指标 | 翻译、摘要、代码 | 可评价自由生成 | 自动指标未必代表真实质量 |
| LLM Judge | 开放问答、解释与安全 | 能处理复杂语义 | 有偏差、随机性且可能收费 |
| 人工评审 | 高价值和专业场景 | 可结合领域判断 | 昂贵、慢且一致性难保证 |
| 级联评测 | 规则可覆盖部分样本 | 兼顾成本与语义判断 | 需要设计合理分流条件 |
OpenCompass安装教程
- 准备环境:创建独立 Python 环境;本地模型根据 PyTorch、CUDA 和显卡安装对应依赖。
- 安装项目:从官方仓库安装稳定版本或开发版本,并记录提交哈希。
- 准备数据集:按文档下载所需基准,确认许可证、目录与校验结果。
- 选择模型配置:使用已有本地或 API 配置,设置模型路径、Key、并发和上下文。
- 运行小规模测试:先使用少量数据检查 Prompt、输出解析、显存和费用,再运行完整集合。
- 查看结果:检查 summary、日志与样本明细,不能只看最终平均分。
- 保存实验信息:记录模型版本、数据集、配置、后端、硬件和时间,便于复现。
自定义数据集评测
- 整理 JSONL 或 CSV,明确问题、参考答案、类别和元数据字段。
- 定义 Dataset Reader 的输入列与输出列,划分开发集和隐藏测试集。
- 为模型配置 Prompt Template、Retriever 和 Inferencer。
- 选择规则、专业指标或 LLM Judge,并编写可靠的后处理函数。
- 用人工标注小样本验证评估器,再扩大规模并分析分组结果。
评测结果如何正确解读
总分可能掩盖单项短板,应按语言、领域、难度和安全类别查看。不同模型的上下文长度、采样参数、推理 Token 和工具权限必须尽量一致。公开数据可能进入训练语料,因此还应加入组织自建、时间更新和真实业务集,避免只优化排行榜。
适合哪些用户
- 比较开源和闭源大模型能力的研究人员与算法团队;
- 需要为模型选型建立客观基准的企业技术负责人;
- 开发推理、代码、安全、长文本或多模态模型的团队;
- 希望复现公开排行榜并分析具体样本的开发者;
- 需要搭建私有数据集和持续回归评测的组织。
优势与注意事项
OpenCompass 的优势是开源、中文生态完善、数据集和模型配置丰富,并覆盖从推理、指标到报告的完整流程。它既适合快速基准,也能扩展成组织内部评测平台。
安装和完整评测需要一定工程与算力,数据集下载也可能很大。评测分数会受 Prompt、答案提取、后端和 Judge 影响,不能视为模型绝对排名。数据集、模型权重和 API 分别有自己的许可证与隐私条款,运行代码评测还应使用隔离容器。
常见问题
OpenCompass免费吗
开源框架免费并采用 Apache 2.0 许可证,官网榜单可免费查看。本地硬件、云 GPU、模型 API 和裁判模型费用由用户承担。
OpenCompass可以评测闭源模型吗
可以,通过对应 API 配置接入,但会受供应商限流、价格和数据政策影响。
OpenCompass支持多模态吗
OpenCompass 生态提供 VLM 排行榜和 VLMEvalKit 等多模态评测工具,具体安装与数据集应看对应项目。
排行榜第一就一定最好吗
不一定。榜单只代表特定基准和配置,应结合真实业务、成本、延迟、安全和人工评测选型。
OpenCompass开源吗
开源,主仓库采用 Apache License 2.0。部分数据集、模型和生态子项目遵循各自条款。
桂公网安备45132202000164号