LiveBench是什么
LiveBench是一套持续更新的大语言模型基准测试与公开排行榜,重点解决传统评测题目进入模型训练数据后的污染问题。它使用近期资料、程序化生成题目和可验证标准答案,让困难任务可以自动评分。
项目论文入选ICLR 2025 Spotlight,官方同时公开网站、论文、数据和评测代码。它适合研究模型能力差异,不是面向普通用户的聊天或内容生成工具。
为什么需要动态基准
固定题库公开时间越长,越可能被模型开发者用于训练、微调或提示优化,排行榜分数就可能反映记忆而非泛化能力。LiveBench通过定期加入新题并更新旧任务,尽量缩短题目暴露时间。
“污染受限”不等于绝对无污染,公开网页、竞赛题和代码仓库仍可能进入训练数据。阅读结果时应结合题目发布日期、模型训练截止时间和具体任务分析。
核心设计
持续更新题目
LiveBench会根据新发布的数据集、论文、新闻、电影简介和竞赛材料增加或替换题目。更新日志记录每个发布日期的任务变化。
客观标准答案
每道题尽量使用可验证的ground truth和确定性评分程序,而不是让另一个大模型主观判断。这样可以减少评审模型的偏好、顺序效应和自我偏爱。
多能力覆盖
基准覆盖数学、编程、推理、语言、指令遵循、数据分析和智能体编程等维度。不同版本的类别、任务和题目数量会变化,不能把早期“六类十八项”当成永久规格。
版本化排行榜
每次更新都会形成带日期的release option,模型成绩应与具体发布版本绑定。不同版本题目和评分逻辑不同,分数不能不加说明地直接横向比较。
开放评测代码
官方仓库提供生成回答、评分和展示结果的脚本,并支持API模型和兼容接口。智能体编程任务还需要Docker提供隔离执行环境。
当前评测类别
| 类别 | 主要考察能力 | 典型任务特征 |
|---|---|---|
| 数学 | 计算、证明与综合推理 | 竞赛题、积分与程序化数学问题 |
| 编程 | 代码生成和代码补全 | 真实库使用、测试用例与执行结果 |
| 智能体编程 | 在仓库中定位并修复问题 | 多轮工具使用、真实开发环境 |
| 推理 | 逻辑、状态追踪和空间导航 | 斑马谜题、心智理论与导航 |
| 语言 | 文本结构、词语和篇章理解 | 拼写、剧情排序与词语关联 |
| 指令遵循 | 满足明确格式与约束 | 多条件输出和可程序验证要求 |
| 数据分析 | 表格、事件和关系处理 | 表格连接、格式重排与连续事件识别 |
主要功能一览
- 查看不同模型在总体和各能力类别中的分数。
- 按模型、组织、版本和推理设置比较表现。
- 通过日期版本理解题目更新和排行变化。
- 下载公开数据并查看任务结构与标准答案。
- 使用官方脚本生成模型回答和客观评分。
- 评估商业API模型或自建兼容接口模型。
- 单独运行数学、编程、推理等任务子集。
- 提交模型评测请求或通过Issue反馈问题。
- 阅读论文与更新日志了解方法和局限。
- 复核异常分数对应的具体任务和模型输出。
适合哪些用户
- AI研究人员:分析模型泛化、污染和能力差异。
- 模型开发团队:在新版本题目上进行回归评测。
- 企业技术选型人员:筛选适合具体任务的候选模型。
- API平台与模型厂商:验证新模型并提交排行榜。
- 开源社区:复现结果、修复评分器和贡献新任务。
- 开发工具团队:重点比较代码与智能体编程能力。
- 教育与媒体研究者:理解排行榜方法和常见误读。
哪些情况不太适合
- 只想知道一个绝对“最强模型”而不看任务差异的用户。
- 需要中文写作、客服语气或行业知识专项评价的团队。
- 希望用单次排行榜直接替代真实业务试点的采购决策。
- 没有API预算、GPU或沙箱环境却要完整复现全部评测的个人。
- 要求对安全、偏见、隐私和事实可靠性全面认证的机构。
- 需要移动端聊天或直接完成生产任务的普通用户。
排行榜查看教程
- 先确认页面显示的LiveBench发布日期和题目版本。
- 查看模型名称、具体版本、推理强度和上下文设置。
- 先比较目标业务对应的类别,不只看总体平均分。
- 展开任务级结果,观察高分是否集中在少数题型。
- 检查是否有超时、空回答、成本限制或工具差异。
- 将候选模型放入自己的数据和工作流做二次评测。
本地运行评测教程
- 获取官方仓库并创建独立Python虚拟环境。
- 按项目说明安装基础依赖和所需任务依赖。
- 选择固定的LiveBench release option并记录提交版本。
- 配置模型名称、API地址、密钥和生成参数。
- 先运行少量题目验证输出格式与费用。
- 执行推理与评分,并保存原始回答和运行日志。
- 使用同一版本和参数比较不同模型。
- 复查异常样本后再汇总类别与总分。
智能体编程评测教程
- 准备支持Docker的隔离主机并设置资源上限。
- 安装智能体编程任务所需的额外依赖和镜像。
- 确认模型支持需要的工具调用或交互方式。
- 固定智能体框架、步数限制、超时和环境版本。
- 运行小规模样本,检查仓库挂载和测试命令。
- 批量执行任务并保存轨迹、补丁、测试与成本。
- 对失败任务区分模型错误、环境错误和超时。
- 销毁不可信容器并清理临时凭据。
分数如何计算
任务评分由确定性规则、标准答案、测试用例或专用处理程序完成,再汇总到任务和类别。总体分通常来自各类别平均值,而不是简单把全部题目混在一起计算。
版本更新可能增加类别、替换任务或修改评分逻辑,因此必须记录发布日期、代码提交、模型参数和运行环境。只引用一个分数而不写版本,会失去可复现性。
| 层级 | 含义 | 阅读重点 |
|---|---|---|
| 题目分 | 单个回答是否满足标准 | 格式、答案、测试或约束 |
| 任务分 | 同一题型的平均表现 | 样本数量和任务难度 |
| 类别分 | 多个相关任务的综合表现 | 业务能力是否对应 |
| 总体分 | 类别平均后的总览 | 不能掩盖短板和任务权重 |
| 排名 | 当前版本中相对位置 | 只对同版本、同设置有效 |
版本与结果可比性
| 比较方式 | 是否合理 | 原因 |
|---|---|---|
| 同一发布日期、同一参数的模型比较 | 较合理 | 题目、评分和设置一致 |
| 不同发布日期的总体分直接比较 | 不建议 | 任务和难度可能已变化 |
| 基础模型与高推理强度版本比较 | 需要标注 | 计算预算和延迟不同 |
| 官方运行与厂商自报分数比较 | 需要复核 | 环境、参数和代码可能不同 |
| 排行榜分数与真实业务效果等同 | 不合理 | 基准任务不覆盖具体流程 |
| 单类别用于对应任务初筛 | 合理但不充分 | 仍需业务数据验证 |
污染控制方法
- 定期发布基于近期材料的新问题。
- 从新论文、新闻、竞赛和数据集中构建任务。
- 使用程序化方式生成部分可验证题目。
- 更新已经饱和或疑似污染的旧任务。
- 把排行榜和数据与具体发布日期绑定。
- 使用客观答案降低人工和模型裁判偏差。
这些措施只能降低污染概率,不能证明所有模型从未见过相关材料。尤其是公开代码题、新闻和论文可能很快进入训练或检索系统。
客观评分的优势与边界
| 方面 | 优势 | 边界 |
|---|---|---|
| 一致性 | 同一规则对所有模型执行 | 规则错误会系统性影响结果 |
| 可复现性 | 可保存答案并重新评分 | 依赖版本与运行环境 |
| 成本 | 无需额外LLM裁判调用 | 代码沙箱和模型推理仍有成本 |
| 偏差 | 减少裁判模型风格偏好 | 题目设计和格式要求仍包含人为选择 |
| 困难任务 | 测试用例可精确判断代码结果 | 开放式质量和创造性难以覆盖 |
价格与运行成本
LiveBench网站、论文和开源仓库可以免费访问,项目没有面向读者的会员套餐。自行评测的主要成本来自模型API、GPU、智能体沙箱、存储和工程时间。
| 项目 | 平台收费 | 实际可能成本 |
|---|---|---|
| 查看排行榜 | 免费 | 网络与阅读时间 |
| 下载代码和公开数据 | 免费 | 本地存储和维护 |
| 商业API模型评测 | LiveBench不收费 | 模型提供商按Token或请求计费 |
| 开源模型推理 | LiveBench不收费 | GPU租赁、电力和运维 |
| 代码执行任务 | LiveBench不收费 | Docker主机、CPU和隔离成本 |
| 智能体编程任务 | LiveBench不收费 | 长上下文、工具调用和多轮推理成本 |
| 官方代评请求 | 未见统一公开价 | 是否接受与安排由项目团队决定 |
模型选型应该怎么用
LiveBench适合把候选模型从几十个缩小到少数几个,但不应该直接决定采购。业务方还需评估价格、延迟、吞吐、数据政策、稳定性、工具调用和本地语言表现。
- 先选与业务最接近的类别和任务。
- 比较同一版本、同一推理预算的结果。
- 保留一组内部真实样本作为最终测试。
- 同时记录质量、Token、延迟和失败率。
- 对高风险场景加入安全与事实核验评测。
- 按实际流量进行并发、限流和稳定性测试。
评测安全注意事项
编程和智能体任务会运行模型生成的代码或命令,必须在隔离容器中执行。不要把生产密钥、主机目录和内网凭据暴露给不可信代码。
- 使用一次性容器、最小权限和网络隔离。
- 限制CPU、内存、磁盘、进程数和运行时间。
- 不给容器挂载Docker控制接口和宿主敏感目录。
- 使用短期API Key并设置预算与速率限制。
- 记录模型、参数、镜像和代码提交版本。
- 任务完成后销毁容器并撤销临时凭据。
产品优势
- 持续更新题目,降低固定题库长期污染风险。
- 使用可验证标准答案,减少LLM裁判偏差。
- 覆盖数学、编程、推理、语言和数据分析等能力。
- 加入真实仓库环境下的智能体编程评测。
- 提供版本化排行榜、论文、数据和评测代码。
- 任务级结果便于分析模型具体强项和短板。
- 能够评估商业API和自建兼容接口模型。
- 论文与开源社区为方法复核提供基础。
使用限制与注意事项
- 污染只能被限制,无法证明完全不存在。
- 不同发布日期的分数不能直接当作同一尺度。
- 总体排名会掩盖类别和任务级差异。
- 公开排行榜不一定覆盖所有新模型和推理设置。
- API超时、价格和速率限制可能影响模型分数。
- 评测主要使用客观任务,难以覆盖审美与开放式写作。
- 中文、行业知识、安全和隐私能力不是其完整重点。
- 智能体编程结果受框架、步数和沙箱环境影响。
- 本地模型直接推理路径当前维护有限,官方建议使用兼容服务。
- 高分不能替代真实业务验证和风险评估。
GitHub与开源状态
LiveBench官方仓库由LiveBench组织维护,核验时约有1,300个Star。仓库包含评测脚本、任务处理器、结果展示和变更记录,并接受Issue和代码贡献。
其LICENSE文件整合了FastChat、LiveCodeBench等来源的许可证文本,包括Apache-2.0和MIT条款。使用、修改或再分发时应按文件来源和第三方声明逐项遵守,不能把整个仓库简化为单一许可证。
基本信息
| 字段 | 内容 |
|---|---|
| 工具名称 | LiveBench |
| 工具类型 | 大语言模型动态基准与排行榜 |
| 核心方法 | 近期题目、客观答案、自动评分、版本更新 |
| 主要类别 | 数学、编程、智能体编程、推理、语言、指令、数据分析 |
| 论文 | ICLR 2025 Spotlight |
| 网站使用 | 免费查看 |
| 本地评测 | 支持API模型和兼容服务 |
| 代码任务 | 需要额外依赖,智能体任务需要Docker |
| 是否开源 | 是 |
| 许可证 | 包含Apache-2.0、MIT等第三方条款 |
推荐指数
4.7 / 5。LiveBench通过动态题目和客观评分改善了传统LLM排行榜的污染与裁判偏差问题,适合研究和技术选型;但版本可比性、任务覆盖和运行成本仍需谨慎解释。
常见问题
LiveBench免费吗?
排行榜、论文、代码和公开数据可以免费访问。自行评测会产生模型API、GPU、计算和工程维护成本。
LiveBench真的没有污染吗?
不能保证绝对没有。它通过新题、近期材料和持续更新降低污染概率,更准确的说法是“污染受限”。
为什么不用大模型当裁判?
项目优先使用标准答案和确定性评分,避免裁判模型的偏好、顺序效应和自我偏爱。开放式质量因此覆盖较少。
不同版本的分数能比较吗?
不建议直接比较。题目、任务和难度可能变化,至少要同时标注发布日期、模型参数和代码版本。
可以测试自己的模型吗?
可以。最稳妥的方式是把模型部署为兼容接口,再使用官方运行脚本生成回答和评分。
为什么排行榜没有某个最新模型?
官方评测需要API可用性、稳定性、预算和时间,过于昂贵或频繁超时的模型可能无法完成公平测试。
LiveBench能直接决定模型采购吗?
不能。它适合初筛,最终还要用真实业务数据测试质量、延迟、费用、稳定性和合规性。
LiveBench开源吗?
是,但仓库包含多个来源的代码和复合许可证文本。再分发时需要检查Apache-2.0、MIT及其他相关声明。
桂公网安备45132202000164号