数据评测安全

LMSYS Chatbot Arena 简调

LMSYS Chatbot Arena 是由 UC Berkeley / LMSYS 研究者发起、后来独立为 Arena 的真人偏好评测平台,用匿名模型对战和用户投票来生成 AI 模型排行榜。

LMSYS Chatbot Arena / Arena human-preference-evaluation llm-leaderboard model-benchmarking LMSYS Chatbot Arena 是由 UC Berkeley / LMSYS 研究者发起、后来独立为 Arena 的真人偏好评测平台,用匿名模型对战和用户投票来生成 AI 模型排行榜。

Frontmatter

结构化元信息

实体类型
产品
主分类
数据评测安全
产品状态
已上线
开放状态
部分开源
产品形态
saas
目标用户
开发者企业创作者
交付方式
SaaS
区域
us
模型策略
多模型混合
部署方式
云端SaaS
技术披露
有限公开
是否实测
未测试
融资阶段
Series A
信息截至
2026-07-08
最后复查
2026-07-08

LMSYS Chatbot Arena / Arena

1. 调研缘由

LMSYS Chatbot Arena 起初是 LMSYS / UC Berkeley SkyLab 做的一个开放评测项目,基本做法是:同一个问题同时丢给两个匿名模型,让用户投票选哪个回答更好。现在 LMSYS 官网已经把 Chatbot Arena 标成 “Graduated”,也就是它从 LMSYS 的项目线毕业,变成了独立平台 Arena / LMArena [S1][S2][S3]。

把它放进这次简调,主要是三件事赶在一块儿了:第一,Arena 已经从纯文字聊天榜扩展到 text、vision、web dev、search、video、image 等多个评测方向;第二,Arena 在 2025-2026 年完成公司化并拿到大额融资,官方称 2026 年 1 月 Series A 融资 1.5 亿美元,Reuters 报道融资后估值达到 17 亿美元;第三,围绕它的争议也从“排行榜准不准”延伸到了未发布模型测试、数据访问不对称、模型会不会针对 Arena 过拟合这些治理问题 [S5][S6][S7][S11]。

2. 简介与产品工作流

Chatbot Arena 是一个靠真人偏好来评测 AI 模型的平台。它不要求你做固定试卷,而是让你输入真实问题,平台随机抽两个匿名模型并排回答,投完票才揭晓模型身份;这些投票再被汇总成排行榜 [S2][S4]。

这个工作流大致分成四步:

  1. 用户进入 Arena,输入一个自然语言任务,比如写作、代码、数学、图像理解或者网页生成。
  2. 系统把同一个问题发给两个匿名模型,你只能看到回答,看不到模型名 [S2][S4]。
  3. 你选 A 更好、B 更好、平局或者都不好;投完票模型身份才会显示 [S2][S4]。
  4. 平台把大量 A/B 对战结果换算成模型排名,并定期公开部分偏好数据和排行榜 [S5][S8]。

它真正改变的是模型评测里的“评价环节”。传统 benchmark 一般靠固定题库、标准答案或者自动评分;Chatbot Arena 把评价者换成了真实用户,题目来源换成了真实 prompt,用偏好投票来捕捉开放式任务中“人更愿意用哪个回答” [S2][S4]。这个指标不能直接等同于事实正确率或专业可靠性,但能更快反映真实用户在开放任务里的偏好变化 [S5][S10]。

当前 Arena 官网把自己的定位说成是面向真实世界 AI 表现的评测平台,用户和服务对象包括模型实验室、企业、开发者、研究者和普通用户;2026 年 Series A 公告里也提到企业需要知道哪些模型最适合自己的使用场景,AI labs 需要可落地的模型反馈 [S6]。

3. 团队与资本背景

Chatbot Arena 最早由 LMSYS 和 UC Berkeley SkyLab 成员开发。2024 年 Chatbot Arena 论文的作者有 Wei-Lin Chiang、Lianmin Zheng、Ying Sheng、Anastasios N. Angelopoulos、Tianle Li、Michael Jordan、Joseph E. Gonzalez、Ion Stoica 等人,团队背景和 UC Berkeley 的 AI / 系统研究圈关系很深 [S4]。

LMSYS 官网现在仍然保留着 Chatbot Arena 的项目卡片,但状态标的是 “Graduated”;项目说明还是“匿名、随机对战、众包方式”的 LLM benchmark 平台 [S1]。LMSYS 在 2024 年 9 月的公告里说,Chatbot Arena 已经有了独立网站 lmarena.ai,并将继续与 LMSYS 保持 close partner 关系 [S3]。

资本层面,LMArena 在 2025 年 5 月宣布完成 1 亿美元 seed funding,由 a16z 和 UC Investments 领投,Lightspeed、Laude Ventures、Felicis、Kleiner Perkins、The House Fund 跟投 [S12]。2026 年 1 月,Arena 官方宣布完成 1.5 亿美元 Series A,由 Felicis 和 UC Investments 领投,参与方包括 Andreessen Horowitz、The House Fund、LDVP、Kleiner Perkins、Lightspeed Venture Partners 和 Laude Ventures [S6]。Reuters 同一天的报道说,这轮融资后 LMArena 估值到了 17 亿美元,并补充它的前身是 Chatbot Arena [S7]。

没有找到足够的公开资料能把 Arena 当前的收入结构、企业评测合同价格、客户名单和团队规模拆解清楚。官方只公开说过会为模型实验室和企业提供评测反馈、真实使用洞察和测试环境,没有披露标准化定价表 [S6][S12]。

4. 技术基础与生态位

Chatbot Arena 的技术路线大致可以总结成:多模型接入 + 真实用户 prompt + 匿名 A/B 对战 + 统计排名。这种 A/B 对战很像“盲测”:你先看两个回答,再决定哪个更好,事先不知道模型品牌 [S2][S4]。

早期的 Chatbot Arena 用的是 Elo rating system。Elo 常见于国际象棋和竞技游戏,意思就是把两两比赛的结果换算成选手分数 [S2]。后来 Arena 的排名方法换成了 Bradley-Terry 模型;Bradley-Terry 是一种把 A/B 胜负结果换算成相对强弱分数的统计方法。Arena 在 2025 年开源了 Arena-Rank,说这是当前排行榜用的 Python 排名包,里面包含了对低对战量模型的 reweighting、闭式置信区间计算,leaderboard 计算速度比 FastChat 版本提升了 30 倍以上 [S9]。

开放状态得拆开来看。2024 年 LMSYS 政策页说 Chatbot Arena 的 UI 前端、模型 serving 后端、评测和排名流水线都通过 FastChat 开源,任何人都可以审计或者自己跑一个实例 [S5]。但是现在 Arena 已经公司化,官网产品、商业评测服务、完整数据分发和模型接入策略并没有全部公开;LMSYS 政策页只承诺周期性分享 20% 的 arena vote data,并解释说会对未上榜模型用 anonymous 标签处理 [S5]。所以本简调把 open_status 标为 partial。

在 AI 生态里,Arena 最主要属于 data-eval-safety 层:它不是基础模型,也不是模型训练框架,而是通过真实用户偏好数据帮外界理解和比较模型表现。它同时也带着消费级产品入口,因为普通用户可以直接拿它试模型、投票、看榜;但它的核心价值还是在评测和反馈数据 [S2][S5][S6]。

5. 市场与外部信号

Arena 的外部信号主要来自三块:用户投票规模、AI 模型公司的参与度、资本化进展。

2024 年 3 月,LMSYS 政策页称 Chatbot Arena 已经吸引了几百万参与者、收集了超过 80 万 votes,评测了 90 多个 LLM,包括 GPT-4、Gemini / Bard、Llama、Mistral 这些商业和开放权重模型 [S5]。同月 Chatbot Arena 论文说平台已经运行了几个月,积累超过 24 万 votes,并认为众包问题足够多样,众包投票与专家评分的一致性不错 [S4]。

到 2026 年 1 月,Arena 官方 Series A 公告称,自 2025 年 5 月 seed round 以来,社区贡献已经达到 5000 万 votes、400+ new model evaluations,覆盖了 text、vision、web dev、search、video、image 等模态 [S6]。PRNewswire 在 2025 年 seed funding 通稿中称,LMArena 当时已有超过 300 万 votes,并帮 Google、OpenAI、Meta、xAI 等公司的模型形成了反馈 [S12]。

独立媒体也把 Arena 看作 AI 模型比较的一个重要入口。Reuters 在 2026 年 1 月的报道里说,LMArena 是一个 web-based platform,用户可以通过匿名众包评测来比较 ChatGPT、Claude、Gemini 等大模型 [S7]。不过,这些报道更多反映的是它的行业可见度和资本关注度,不能直接证明它的评测结论在所有任务上都更可靠。

6. 公开评价与主要分歧

正面评价(来源类型):

  • 官方/项目方:LMSYS 认为 Chatbot Arena 能缓解静态 benchmark 的污染问题,因为它持续接收真实用户的新 prompt;官方还强调平台、工具和部分数据是开放的,社区可以复现实验、监督评测过程 [S5]。
  • 独立媒体:Reuters 把 LMArena 描述为用于匿名众包比较 ChatGPT、Claude、Gemini 等模型的平台,并把它 2026 年的融资和生成式 AI 评测需求联系起来 [S7]。
  • 官方论文/学术论文:Chatbot Arena 论文认为,众包 prompt 足够多样,众包投票与专家评分有较好一致性,并把它定位成 open platform for evaluating LLMs by human preference [S4]。
  • 独立研究:Arena Learning 论文把在线 Chatbot Arena 的真人标注对战称为有效的评测方式,但同时也指出这种方式有人力标注成本和时间限制 [S15]。

主要批评/质疑(来源类型):

  • 官方自我修正:LMSYS 2024 年 style-control 文章承认,回答长度、Markdown 标题、加粗和列表这些风格因素会影响 Chatbot Arena 的排名;控制这些风格因素之后,部分模型的排名出现了明显变化 [S10]。
  • 独立研究:The Leaderboard Illusion 论文认为,Arena 的未公开私测机制可能让少数模型提供方在公开发布前测试多个变体,并通过选择性披露影响分数;该论文还指出闭源模型获得的 battle 数量和数据访问量高于开放权重/开源模型,并给出了 Google、OpenAI 等提供方获得数据比例的估计 [S11]。
  • 独立研究:Pluralistic Leaderboards 论文认为,把多样用户偏好压缩成一个 Bradley-Terry 全局排名,在任务和偏好高度异质时会误代表部分用户群体;该论文用 LMArena 数据说明标准 Bradley-Terry 聚合在实践中可能违反其提出的 local stability 条件 [S16]。
  • 独立研究:A Unified Perturbation Framework 论文用 Chatbot Arena 和其他 pairwise comparison 数据集做扰动分析,认为现代 leaderboard 对小比例目标扰动并不稳健,少于 1% 的目标扰动就可能改变 top-ranked model、影响 Kendall’s tau 和置信区间 [S17]。

存在分歧之处:

第一组分歧在“真人偏好能不能代表模型能力”。支持方看重 Arena 的真实 prompt、实时反馈和开放式任务覆盖;质疑方提醒,用户偏好可能受表达风格、回答长度、任务分布和平台机制影响,不能直接当成事实准确性、专业可靠性或安全性的总指标 [S5][S10][S11]。

另一组分歧在“开放平台和商业评测能不能长期共存”。官方说平台会保持开放、透明的方法,并周期性释放部分数据;批评论文则指出,未发布模型匿名测试、私下结果反馈、不同模型获得的 battle 数量不同,这些可能带来数据访问不对称和选择性披露问题 [S5][S11][S12]。

7. 同类对比(与头部/高知名度同类项目)

主要对标项目: HELM、AlpacaEval、Artificial Analysis

关键维度对比(事实,标来源):

维度LMSYS Chatbot Arena / ArenaHELMAlpacaEvalArtificial Analysis
主要评测对象开放权重、API、服务形式的模型;Arena 官方披露覆盖 text、vision、web dev、search、video、image 等模态 [S6]Foundation models / language models;HELM GitHub 说它是一个 holistic、reproducible、transparent evaluation 框架,用于 foundation models,包括 LLMs 和 multimodal models [S18]Chat / instruction-following 模型;AlpacaEval 项目页说它是 instruction-following language models 的自动评测器 [S19]AI models 和 API hosting providers;官网覆盖 quality、price、output speed、latency、context window 等指标 [S20]
题目来源真实用户 prompt,属于 live evaluation [S2][S5]标准化 datasets 和 benchmarks,例如 MMLU-Pro、GPQA、IFEval、WildBench 等 [S18]AlpacaFarm / AlpacaEval 固定评测集,模型输出由 GPT-4 based auto-annotators 比较 [S19]平台维护的模型和供应商评测,覆盖 intelligence、speed、price、latency 等维度 [S20]
评价者普通用户在匿名 A/B 对战后投票 [S2][S4]程序化指标和标准化评测流程,覆盖 accuracy、efficiency、bias、toxicity 等多个方面 [S18]自动评审器;项目页称其与人类标注有较高一致性,但也提醒不能替代高风险决策中的人工评估 [S19]平台自建评测与 API 性能测量;官网说明其用于帮助用户选择模型和 API provider [S20]
输出形式多榜单 + Bradley-Terry 排名;Arena-Rank 已开源 [S8][S9]多 benchmark leaderboard、Web UI、模型和 benchmark 对比结果 [S18]Win rate / length-controlled win rate leaderboard [S19]Intelligence Index、价格、输出速度、延迟、上下文窗口等仪表盘 [S20]
主要边界偏好投票不直接等同事实正确性;私测、数据访问和单一总榜稳定性受到独立论文质疑 [S10][S11][S16][S17]静态 benchmark 仍可能面临题库污染、覆盖不足或更新节奏问题;这是 Arena 官方提出 live eval 的理由之一 [S5]自动评审器降低成本,但项目页也提示自动评估可能偏向风格而非事实性,且不测安全风险 [S19]更偏模型/供应商选择的综合仪表盘,平台自有评测与公开学术 benchmark 的目标不同 [S20]

公开评价中的对比(标源,非个人裁决):

LMSYS 在 2023 年启动文章中把 Chatbot Arena 与 HELM / lm-evaluation-harness、OpenAI/evals、Alpaca Evaluation、Vicuna Evaluation 放在同一张方法对比表中;它把 Chatbot Arena 的差异写为 user prompts、user evaluator 和 Elo ratings,而不是固定学术数据集或 GPT-4 自动评估 [S2]。这属于官方定位,不能当成独立评价。

本次没有找到足够独立、成体系的公开材料来裁决 Arena、HELM、AlpacaEval、Artificial Analysis 谁“更好”。更稳妥的读法是:Arena 更像真实用户偏好反馈层,HELM 更像透明、标准化 benchmark 框架,AlpacaEval 更像低成本 instruction-following 自动评测,Artificial Analysis 更像面向模型和 API provider 选型的综合指标仪表盘 [S2][S18][S19][S20]。

8. 信息缺口与后续观察

  • Arena 现在的完整数据并没有全部公开。官方解释会周期性分享 20% 的 arena vote data,但外部仍然很难完全复核所有数据分布、采样策略和模型 exposure 差异。
  • 未发布模型匿名测试的边界仍需跟踪。官方政策允许模型提供方匿名测试未发布模型、在满足票数后收到私下结果和最多 20% vote samples;后续是否进一步公开私测记录、withdraw 记录和样本分配,是治理层面的核心观察点。
  • 商业评测服务缺少公开定价、客户案例和标准合同口径。Arena 已明确面向 AI labs 和 enterprises 提供评测服务,但公开资料不足以拆解收入结构。
  • 多模态和 agent 类榜单的评测方法需要单独核查。当前官方披露已覆盖 text、vision、web dev、search、video、image 等模态,但不同任务的抽样、投票质量控制和统计置信区间未必能直接套用文字聊天榜的理解。
  • 独立论文对 Arena 的批评是否会带来政策更新,需要继续观察。尤其是私测透明度、battle 分配、开放模型 exposure、单一总榜之外的分层榜单和个性化榜单。

9. 归纳洞察 ★

Chatbot Arena 的位置不只是“一个排行榜”。它把 AI 评测从固定题库,推到了由真实用户持续投票的反馈系统里。这个变化解释了为什么模型公司、开发者和普通用户都会去看它:模型公司想知道真实用户怎么选,开发者想快速比较模型,普通用户把它当成试模型的入口。

它也暴露了一个事实:评测平台一旦变得重要,治理问题就会随之而来。只要排行榜会影响模型声誉、发布节奏和商业采购,平台就必须说清楚:谁能提前测试、谁能拿到数据、不同模型拿到多少曝光、榜单分数稳不稳定、用户偏好有没有被风格因素带偏。Arena 的争议不说明真人偏好评测无效,而是说明“评测基础设施”本身也需要被评测。

从生态角度看,Arena 反映出 AI 评测正在从学术 benchmark 变成产品化的基础设施。它一边给社区提供公开榜单,一边为模型实验室和企业做评测服务。这种双重角色会带来资源,也会带来信任成本。后续做研究时,不能只看榜单排名,还要看它的方法公开到什么程度、数据开放边界划在哪里、治理规则是否跟得上影响力。

10. 来源与更新时间

  • 信息截至(as_of): 2026-07-08
  • 最后复查(last_checked): 2026-07-08
  • 最后更新(last_updated): null