LMSYS,全称大型模型系统组织(Large Model Systems Organization),是由加州大学伯克利分校、卡内基梅隆大学、加州大学圣地亚哥分校等高校研究者合作组成的开源研究组织,以研发开放、可访问、可扩展的大型模型与系统为目标 [1][2][3]。该组织始于 2023 年,2024 年 9 月注册为非营利性公司 [4]。它的两项代表性成果是 2023 年 3 月发布的开源对话模型 Vicuna 和同年 5 月 3 日上线的匿名对战评测平台 Chatbot Arena,后者之后发展为独立机构 LMArena [4][1][5][6]。
定义
LMSYS 的正式名称为大型模型系统组织(Large Model Systems Organization),简称 LMSYS,也被称作 LMSYS Org [1][5][7]。它由加州大学伯克利分校 SkyLab、加州大学圣地亚哥分校与卡内基梅隆大学等机构的研究者合作组成 [1][2][3],公开自述的宗旨是研发开放、可访问、可扩展的大型模型与系统 。其工作对象包括大规模机器学习模型以及配套的评测工具 [7]。
组织诞生于 2023 年,参与发起的高校包括加州大学伯克利分校、卡内基梅隆大学、斯坦福大学与加州大学圣地亚哥分校等;2024 年 9 月,它以非营利公司的形式完成注册,用于孵化早期的开源与研究项目 [4]。
背景
2022 年底 ChatGPT 出现之后,同类系统的训练方法与架构细节并未对外公开,学界和开源社区难以在此基础上复现与改进 [8]。2023 年初 Meta 公开 LLaMA 之后,社区很快在其基础上微调出 Alpaca、Vicuna 等一批对话模型,怎样判断这些模型孰优孰劣随之成为难题 [8][6]。
此前的评价方式大体有两类:一类由程序在学术数据集上自动算出指标,另一类由人依据事先编写的问题集打分 。前者的题目多为封闭形式,难以覆盖用户真实提出的开放式问题;后者要投入大量人力,新模型加入时又须重新组织评估,扩展性有限 。此外,大型模型的训练语料覆盖面极广,公开测试集是否已被模型见过难以确认,既有基准的区分能力因此受到怀疑 。
面对这些困难,LMSYS 先用低成本的开源模型验证了微调路线的可行性,随后转向搭建依靠普通用户投票、可以持续吸纳新模型的评测平台 [6]。
内容
2023 年 3 月 30 日,LMSYS 公布开源对话模型 Vicuna-13B。该模型以 LLaMA 基础模型为起点,使用从对话分享站点 ShareGPT 采集的约 7 万段用户对话做指令微调,训练在 8 张 A100 显卡上于一天内完成 [6]。研究者请 GPT-4 对多个模型的回答打分,称其质量约为 ChatGPT 与 Bard 的 90%,13B 版本的训练开销约 300 美元 [6][9]。在 LMSYS 随后公布的榜单中,vicuna-13b 被标注为基于 LLaMA、用用户共享对话微调得到的聊天助手 [10]。
2023 年 5 月 3 日,LMSYS 上线 Chatbot Arena 平台 [1]。用户同时向两个隐匿名称的模型提问,在不知道回答出自哪一方的情况下投票选出更好的一方,提交投票后模型身份才被揭示;系统只采纳匿名阶段的投票,并据此用 Elo 等级分 生成模型排名 [11]。平台运行约一周即收到近 4700 个有效匿名投票,首期榜单由 vicuna-13b 以 1169 分位居第一 [12][13]。
为支撑该平台,LMSYS 把服务基础设施 FastChat 开源,该框架负责匿名会话路由、模型身份隐藏与投票记录,并对外提供与主流接口兼容的调用方式 [5]。除 FastChat 之外,组织还维护面向大模型的推理引擎 SGLang、多轮对话评测基准 MT-Bench、真实对话数据集 LMSYS-Chat-1M 以及模型路由框架 RouteLLM 等开源项目 。
影响与争议
Chatbot Arena 后来脱离学术项目形态。LMArena 由该平台发展而来;受 LMSYS 资助,Anastasios N. Angelopoulos 与 Wei-Lin Chiang 在 2023 年共同创立了 Chatbot Arena,两人当时均在加州大学伯克利分校电子工程与计算机科学系攻读博士 [4]。2024 年 9 月,LMSYS 完成非营利公司注册 [4]。该平台的榜单数据准确性曾受到质疑 [4]。
评测范围此后不断扩张。截至 2026 年 3 月,该竞技场的 Elo 排名已按文本、代码、视觉、文档理解与检索等多个模态类别分别给出 [14]。也有研究把它与其他基准相互对照,例如 LivingArena 与 Chatbot Arena 的相关性约为 0.406,研究者据此讨论不同榜单的一致程度 [15];一些评测工作则以 Chatbot Arena 的分数作为参照,说明所评模型在整体区间中的相对位置 [16]。
参见
参考资料
- Ranking Elo de modelos de lenguaje . Systems-analysis [引用日期2026-09-27]
- ELO‑ранжирование моделей . Systems-analysis [引用日期2026-09-27]
- Ranking ELO de Modelos . Systems-analysis [引用日期2026-09-27]
- 给大模型排名次,两个博士一年干出120亿独角兽,却被质疑产品数据准确性 . Cyzone [引用日期2026-09-27]
- Chatbot Arena 与成对评测 . GitHub [引用日期2026-09-27]
- lmsys.org 上的网页 . lmsys.org [引用日期2026-09-27]
- articleList . 디지털투데이 [引用日期2026-09-27]
- 训练成本300美元、比肩ChatGPT和Bard,低成本开源聊天机器人Vicuna来了 . infoq.cn [引用日期2026-09-27]
- berkeley.edu 上的网页 . berkeley.edu [引用日期2026-09-27]
- SWE- Lancer [Miserendino et al . github.io [引用日期2026-09-27]
- 李开复:大模型价格战是“双输”的打法 . 网易手机 [引用日期2026-09-27]
- UC伯克利发布大语言模型榜单 清华ChatGLM冲进前五 . chinaz.com [引用日期2026-09-27]
- 大模型battle?LLM排行榜出炉,清华竟位列第五! . qq.com [引用日期2026-09-27]
- arxiv.org 上的网页 . arxiv.org [引用日期2026-09-27]
- arxiv.org 上的网页 . arxiv.org [引用日期2026-09-27]
- arxiv.org 上的网页 . arxiv.org [引用日期2026-09-27]
浏览次数:0 次
阅读量:0 次 · 阅读完成量:0 次
最近更新:2026-09-27T15:46:11Z
完成率 = 阅读完成量 ÷ 阅读量,分母是阅读量不是浏览次数 —— 关了 JS 的、秒退的都在浏览次数里、不在阅读量里。 详细口径在后台的「数据统计」页。