Arena AI是什么
Arena AI 是一个通过真实用户匿名对比来评估生成式 AI 模型的平台,前身为 Chatbot Arena 和 LMArena。用户输入同一提示后,会看到两个隐藏身份的模型回答,并通过投票选择更好的结果。
项目最初由 LMSYS 与加州大学伯克利研究人员推出,后来发展为独立平台。当前正式品牌已简化为 Arena,旧的 LMSYS 博客页面只适合了解历史,不应继续作为主要产品入口。
Chatbot Arena、LMArena与Arena的关系
| 名称 | 阶段与含义 | 当前使用建议 |
|---|---|---|
| Chatbot Arena | 2023年开始的原始研究项目名称 | 用于论文、历史介绍和早期开源代码 |
| LMArena | 独立站点和公司阶段的品牌名称 | 仍被大量媒体和用户使用 |
| Arena | 当前统一品牌 | 官网、排行榜和产品介绍优先使用 |
| LMSYS | 发起早期研究的学术组织 | 不能与当前Arena公司和全部产品完全等同 |
Arena如何工作
- 选择文本、图片、视频、代码或其他适合任务的竞技场。
- 输入一个能够区分模型能力的真实提示。
- 平台随机提供两个匿名模型,并同时生成结果。
- 从准确性、帮助程度、风格和任务完成度比较两边输出。
- 选择A更好、B更好、平局或两者都差。
- 提交投票后查看模型真实身份。
- 继续对话或开启新一轮,让偏好数据进入公开评测体系。
核心功能
1. 匿名模型对战
Battle 模式在投票前隐藏模型名称,以减少品牌知名度和用户先入为主的影响。回答本身仍可能暴露模型风格,因此匿名机制只能降低偏见,不能完全消除。
2. 人类偏好投票
平台不依赖固定标准答案,而是让真实用户判断哪一个结果更有用。它特别适合评估写作、对话、图片和开放式生成等难以用单一分数衡量的任务。
3. 多赛道排行榜
Arena 已从纯文本聊天扩展到图片、视频、代码、视觉和其他专门赛道。不同榜单的输入、模型池和评价目标不同,排名不能直接跨赛道比较。
4. Direct模式
除匿名对战外,用户还可以直接选择已知模型进行测试。Direct 模式适合验证特定模型,但只有符合匿名评测规则的投票才应影响排行榜。
5. 公开研究与数据集
Arena 发布研究论文、分析和经过处理的人类偏好数据集,用于研究模型评测、对抗攻击、过度拒绝和搜索能力。公开数据有自己的隐私处理与许可,不能视为完整原始平台数据。
主要功能一览
- 让两个匿名AI模型回答同一个提示并排比较。
- 支持胜负、平局和两者都差等投票选择。
- 投票后揭示模型身份,减少投票前的品牌偏见。
- 提供持续更新的文本、图像、视频和代码排行榜。
- 按类别、语言或任务查看更细分的模型表现。
- 直接选择具体模型进行体验和结果验证。
- 测试尚未正式发布或以代号出现的预览模型。
- 公开部分人类偏好数据、论文和评测方法。
- 把社区反馈汇总后用于帮助模型开发者改进产品。
排行榜分数怎么理解
Arena 将大量成对胜负关系汇总为相对能力排序,当前方法通常使用 Bradley-Terry 等成对比较统计模型,并结合重采样估计不确定性。用户常把结果统称为 Elo 分数,但具体计算方法应以榜单方法说明为准。
| 指标或概念 | 代表什么 | 不能说明什么 |
|---|---|---|
| Arena Score | 模型在当前投票数据中的相对偏好强度 | 不是绝对正确率或通用智力分数 |
| Rank | 在指定榜单与统计规则下的位置 | 不能保证真实业务中一定更好 |
| 置信区间 | 排名与分数的不确定范围 | 区间重叠时不宜强调细小名次差异 |
| 投票数量 | 可用于估计的对战样本规模 | 数量多不等于样本没有偏差 |
| 分类榜单 | 模型在特定任务或语言中的相对表现 | 不能替代组织自己的任务测试 |
如何设计有效的对比提示
- 从自己的真实任务中选择一个具体问题,而不是只问常识。
- 给出必要背景、输入数据、限制和期望输出格式。
- 避免包含个人信息、商业机密和未公开材料。
- 让两个模型完成同样任务,不在中途改变评价标准。
- 先独立检查事实、推理和指令遵循,再比较表达风格。
- 难以判断时选择平局或两者都差,不必强行分胜负。
- 对关键任务重复多个不同样本,不凭一次对战选型。
适合哪些用户
- 希望体验不同前沿模型的普通AI用户。
- 需要初步比较模型写作、推理、代码和视觉能力的开发者。
- 研究人类偏好评测和模型排序方法的学术人员。
- 跟踪新模型与预览模型相对表现的行业观察者。
- 需要为模型选型收集外部参考的产品和技术团队。
- 希望用真实用户反馈改进模型的实验室与厂商。
- 研究排行榜攻击、偏见和统计可靠性的评测人员。
不同竞技场与应用场景
- 文本对话:比较知识、推理、创作和指令遵循。
- 代码:比较代码生成、修复、界面实现和工具使用。
- 图像:比较文字生成图片、编辑和提示词遵循。
- 视频:比较文本或图片生成视频的质量与一致性。
- 视觉理解:比较图像问答、图表、OCR和多模态推理。
- 搜索与研究:比较检索、引用、时效和综合回答。
- 特定语言:观察模型在中文及其他语言中的相对偏好。
免费与账号要求
Arena 面向公众提供免费的模型对战和排行榜访问,没有面向普通用户公开收费套餐。不同模型可能有排队、速率、地区、登录或每日使用限制,平台也可能根据容量调整。
| 功能 | 价格 | 账号与限制 |
|---|---|---|
| 查看排行榜 | 免费 | 通常可直接浏览 |
| 匿名模型对战 | 免费 | 可能需要登录并受速率或容量限制 |
| Direct模型体验 | 免费 | 可用模型和次数可能变化 |
| 研究数据集 | 按对应页面开放 | 需遵守数据集许可与使用条款 |
| 模型厂商评测合作 | 未公开统一价格 | 由Arena与合作方单独协调 |
如何正确使用排行榜选模型
- 先选择与业务最接近的赛道、语言和类别榜单。
- 观察分数与置信区间,不只看第一名和细小名次差。
- 确认排行榜中的模型版本与实际可采购版本一致。
- 结合成本、延迟、上下文、数据政策和部署方式筛选。
- 建立包含真实业务输入的内部评测集。
- 对事实、代码、安全、工具调用和结构化输出分别测试。
- 上线后持续监控模型更新和业务反馈。
排行榜的优势
- 使用真实用户的开放式提示,比静态考试更接近日常体验。
- 匿名展示降低了部分品牌偏见和模型声誉影响。
- 成对比较比要求用户给绝对分数更容易判断。
- 模型与投票持续更新,可以快速反映新版本表现。
- 覆盖文本、图片、视频、代码和多模态赛道。
- 公开研究、方法和部分数据,有利于外部复核。
- 允许小型实验室与大型厂商在同一机制下接受用户评价。
使用限制与方法偏差
- 投票者和提示词来自自选用户,不能代表所有国家、行业和人群。
- 用户可能偏好更长、更自信或更有风格的回答,而非更准确答案。
- 匿名模型仍可能通过措辞、格式和拒答风格被识别。
- 排行榜是相对排序,模型池和对战分布变化会影响分数。
- 细小名次差可能没有统计意义,应结合置信区间解读。
- 预览模型与公开发布版本可能在提示、采样或配置上不同。
- 恶意投票、协调攻击和数据污染需要持续防护。
- 通用人类偏好不能替代医疗、法律、安全和企业任务评测。
隐私与内容提交
官方说明用户提交的提示会被收集,以支持公平公开评测,并可能把部分反馈分享给模型开发者。用户应把 Arena 当作公共研究评测环境,而不是处理秘密数据的私有聊天工具。
- 不要提交姓名、联系方式、账号、密码和身份信息。
- 不要粘贴公司内部代码、客户数据或未公开文档。
- 图片和视频只能使用自己拥有或获授权的素材。
- 敏感行业问题应使用合成或脱敏样本。
- 投票前检查回答是否泄露输入中的敏感内容。
- 使用公开数据集时遵守隐私过滤、许可和再分发规则。
开源项目与数据集
早期 Chatbot Arena 基于 LMSYS FastChat 项目建设,FastChat 采用 Apache-2.0 许可证并提供多模型服务、Web界面和评测相关代码。当前 Arena 平台已经发展出更多专用赛道和商业运营能力,不能用早期仓库完整代表现网。
- FastChat包含模型服务、对话界面和早期Arena实现。
- Arena在Hugging Face等平台发布处理后的人类偏好数据。
- 相关论文介绍匿名成对投票与排序方法。
- 视觉、搜索、过度拒绝和排行榜攻击均有专门研究。
- 开源代码、研究数据和在线平台是三个不同范围。
- 数据库原有StableLM GitHub链接与Arena项目无关,不应作为官方源码。
为什么不能只看Arena排名
- 业务成本和延迟不进入通用偏好分数。
- 数据驻留、隐私、合规和供应商条款需要单独评估。
- 结构化输出、工具调用和长时间稳定性可能缺少充分样本。
- 中文细分行业的提示数量可能低于通用英语任务。
- 模型更新后,排行榜版本与实际API版本可能短暂错位。
- 高风险任务更需要可复现测试和专家审核。
平台与开源状态
| 项目 | 当前情况 |
|---|---|
| 当前名称 | Arena AI,历史名称LMArena与Chatbot Arena |
| 产品形式 | 网页模型对战、Direct体验和公开排行榜 |
| 价格 | 公众功能免费,无普通用户付费套餐 |
| 开发者API | 未提供面向普通用户的统一模型推理API |
| 早期开源项目 | LMSYS FastChat,Apache-2.0许可证 |
| 公开数据 | 发布处理后的人类偏好数据集与研究论文 |
| 是否整体开源 | 否,现行完整平台不等于早期FastChat仓库 |
基本信息
| 字段 | 内容 |
|---|---|
| 工具名称 | Arena AI |
| 历史名称 | LMArena、Chatbot Arena |
| 起源 | LMSYS与加州大学伯克利研究项目 |
| 工具类型 | AI模型盲测、排行榜与人类偏好评测平台 |
| 核心机制 | 匿名成对对战与用户投票 |
| 覆盖模态 | 文本、图像、视频、代码和多模态 |
| 价格模式 | 免费 |
| 是否提供推理API | 否 |
| 是否开源 | 早期FastChat开源;当前平台不整体开源 |
推荐指数
4.7 / 5。Arena AI 是观察模型真实用户偏好和体验前沿模型的重要参考,匿名对战与公开研究具有独特价值;但排行榜不等于客观全能分数,模型选型必须结合内部任务、成本、安全和部署要求。
常见问题
LMArena和Chatbot Arena是同一个平台吗?
它们属于同一项目的发展阶段,当前品牌为Arena。Chatbot Arena是原始名称,LMArena是后续独立品牌。
Arena AI免费吗?
公众对战、Direct体验和排行榜当前免费,但模型可用性、排队和使用次数可能根据容量调整。
投票前能看到模型名称吗?
Battle模式不会显示,提交投票后才揭示身份。Direct模式则允许用户直接选择已知模型。
排行榜第一名就是最好的模型吗?
不一定。排名反映特定用户和提示分布下的相对偏好,实际选择还要考虑任务准确率、成本、延迟、隐私和部署。
Arena提供模型API吗?
没有面向普通开发者提供统一的生产推理API。它主要用于体验、对战和评测,不是模型聚合调用平台。
Arena开源吗?
早期FastChat与部分研究数据开放,但当前完整Arena网站、全部赛道和运营系统不能视为整体开源。
桂公网安备45132202000164号