Skip to content

大模型测评

10个真正靠谱的大模型评测网站, 帮你30秒选出最好用的AI | 知乎@我辈不是蓬蒿人

Arena AI: Measuring AI in the real-world

BenchLM: LLM Leaderboard & AI Model Benchmarks

LiveBench: A challenging, contamination-free LLM benchmark

Aider LLM Leaderboards

Artificial Analysis

Abstract

基于测评选型时, 核心不是找"总分第一", 而是把业务场景映射到合适的评测轴, 再用对应榜单缩小候选集, 最后用自己的真实任务复测. 不同榜单测的是偏好, 客观能力, 代码编辑, 成本延迟等不同对象; 它们结论不一致往往是正常现象, 而不是数据互相打脸.

测评指标分类

常见评测大致分四类:

  1. 人类偏好: 匿名对比后由人投票, 回答"哪个回答更讨人喜欢".

  2. 客观能力: 有标准答案或可自动判分的题目, 回答"能不能做对".

  3. 任务型 / Agent 评测: 写补丁, 过单测, 多步工具调用, 回答"能不能把活干完".

  4. 工程指标: 速度, 延迟, 单价, 上下文窗口, 回答"能不能用得起, 跟得上".

例如: Arena 上更"顺口"的模型, 在 LiveBench 数学/推理子项上未必领先; Aider 上擅长按格式改代码的模型, 也不等于 SWE-bench 风格仓库修 bug 的最强者. 榜单分歧 = 测量维度不同, 选型时应先考虑自己的核心需求.

常用测评需求与选型参考

核心需求 优先参考 说明
日常对话, 写作, 开放式问答"谁更顺手" Arena 人类 pairwise 偏好, 贴近体感
推理 / 数学 / 指令遵循等"能不能做对" LiveBench 客观判分, 题目定期刷新, 抗污染
用 AI 结对编程, 按指令改仓库代码 Aider 真实编辑闭环 + 格式合规
快速横向对比质量 / 价格 / 上下文 BenchLM, Artificial Analysis 聚合或多轴对比, 适合做短名单
上线前最终拍板 自建评测集 用业务 prompt, 延迟与成本预算复测决赛圈

实用流程可以压成三步: 场景 → 短名单 (1–2 个对应榜) → 业务样本复测.

权威测评

Arena (原 Chatbot Arena / LMSYS)

  • 链接: arena.ai/leaderboard

  • 测评逻辑: 用户在真实使用中对两个匿名模型做 A/B 投票; 票数用 Bradley-Terry (习惯上仍叫 Elo) 聚合成相对排序. 另有 Text, Coding, WebDev, Agents 等分榜, 以及按任务成本看的 Pareto 视图.

  • 适用场景: 选型初期找"体感强"的通用对话 / 写作模型; 对比新模型首发口碑; 看 agent / webdev 等分榜时的用户偏好.

  • 偏好 ≠ 正确性; 文风, 长度, Markdown 排版会影响票数 (平台有 Style Control 等校正, 但无法消除主观性); 头部模型置信区间常重叠, 名次差 1–2 未必统计显著.

LiveBench

  • 链接: livebench.ai

  • 测评逻辑: 约 23 个客观任务, 覆盖推理, 编程, Agentic Coding, 数学, 数据分析, 语言, 指令遵循等类别; 用标准答案自动判分, 不用 LLM-as-judge; 题目按月补充, 约每半年整库刷新, 降低训练集污染. Overall 多为类别均分; 页面也会标出单次成功任务成本.

  • 适用场景: 需要硬能力对比 (尤其数学 / 推理 / 指令遵循); 担心静态公开题被刷分; 做研究或对"能力上限"做横向比较.

  • 弱于开放写作的主观质量; 历史跨版本分数不宜直接纵向对比; 仍需另看速度与部署成本.

Aider LLM Leaderboards

  • 链接: aider.chat/docs/leaderboards

  • 测评逻辑: 在 Aider 工作流里跑 Polyglot 基准 (多语言 Exercism 题, 常见为 225 题); 模型需按指定 edit format 产出可应用的代码补丁, 再由测试判定对错. 除正确率外, 还报告编辑格式合规率, 轮次与成本等.

  • 适用场景: 选 编码助手 / 本地结对编程 模型; 关心"能不能一次改对并被工具正确解析", 而不只是会写代码片段.

  • 强绑定 Aider 的交互与格式约定; 高分不自动等于仓库级 Agent (SWE-bench 一类) 或通用算法竞赛能力.

BenchLM

  • 链接: benchlm.ai · 评分方法

  • 测评逻辑: 聚合站, 不是单一考试. BenchAlign 把多方基准与外部榜信号归一化后合成总分; 难且不易污染的题权重大, 饱和 / 污染严重的题降权或仅展示; 缺测不按 0 分惩罚, 证据不足标为 Estimated, 证据充分标为 Supported; 价格与吞吐不进能力分, 但页面会并列展示.

  • 适用场景: 快速扫一遍 frontier / 开源权重模型的综合位次与性价比; 按 coding / agentic / knowledge 等分榜做短名单; 需要同时看上下文长度与单价时.

  • 合成权重是编辑选择, 读总分前应下钻类别与来源; Estimated 行不确定性更大, 不宜当最终判决.

Artificial Analysis

  • 链接: artificialanalysis.ai

  • 测评逻辑: 独立复跑一组能力基准合成 Intelligence Index, 并单独测量输出速度, 延迟与价格; 速度常按"模型 × 服务商"组合排名, 因为同一权重在不同 API 上差异很大.

  • 适用场景: 生产选型要同时权衡 智力 / 速度 / 成本; 比较不同云厂商托管同一模型时的体感延迟; 做预算约束下的 Pareto 选择.

  • 综合指数的权重同样是人工设定; 对"文风是否讨喜"不如 Arena 直接; 读总分时建议打开分项基准.