模型排名科学性律:五层评估框架与 AA 拆解
入档:2026-08-10 来源:跳蛛先生与桓(WorkBuddy)关于 Artificial Analysis 排名方法论的对话分析 性质:AI 评测体系拆解 / 工具认知律 / 模型选型前置方法论 关联信源:artificialanalysis.ai/methodology/intelligence-benchmarking · benjaminhan.net · gentic.news(Ethan Mollick 批评)· aiwiki.ai
一句话
完全科学的模型排名不存在(“智能”无统一定义、任何指标都被 Goodhart 定律侵蚀);但比 Artificial Analysis 现行做法更科学的框架是可定义的——从「单分数排名」转向「多维能力画像 + 元评测」,五层缺一不可。
背景:为什么写这个
跳蛛先生看到 Artificial Analysis(下称 AA)的 Video Editing Leaderboard(8 个模型、盲投 Elo),质疑”这个排名是否科学”。对话从”AA 怎么排名”推到”它的方法论是否科学”,再推到”那怎么排才科学”。本档把三轮推演的结论沉淀下来,作为日后看到任何 AI 模型榜单时的前置认知律。
一、AA Intelligence Index v4.1 是怎么排名的
核心指标是一个 0-100 分,由 9 项评估 × 4 大类别加权平均 合成:
| 类别 | 权重 | 包含评估 | 评分方法 |
|---|---|---|---|
| Agents | 34% | GDPval-AA v2 (20%) + τ³-Banking (14%) | Elo(Bradley-Terry) / pass@1 |
| Coding | 24% | Terminal-Bench v2.1 (16%) + SciCode (8%) | pass@1 |
| Scientific Reasoning | 24% | HLE (12%) + GPQA Diamond (6%) + CritPt (6%) | pass@1 |
| General | 18% | AA-Omniscience (12%) + AA-LCR (6%) | 准确率+抗幻觉 / pass@1 |
关键执行细节:
- 统一测试条件:非推理模型 T=0,推理模型 T=0.6;零样本提示
- pass@1 为主(首次尝试正确率)
- GDPval-AA v2 特殊:3 位前沿 LLM 法官盲评 → Bradley-Terry 模型 → 锚定人类专家 Elo=1000
- 神秘顾客策略:匿名账号调用 API,防”特供版”
- 95% CI < ±1%(基于 >10 次重复实验)
- 动态淘汰:饱和 benchmark(MMLU、GSM8K 已被移除)会被替换
二、做得好的部分(值得肯定的)
- 独立运行评测:不依赖厂商自报。创始人正是因为 2023 年 Google 用 32-shot CoT 在 MMLU 上刷分(使 Gemini 1.0 Ultra 看起来超过 GPT-4)才创建这个平台。
- 方法论透明:完整公开 prompt 模板、评分标准、温度参数、重试逻辑。
- 抗污染设计:CritPt 用未发表物理难题;AA-Omniscience 自建私有数据集;GDPval-AA 用内部副本。
- 统计严谨:置信区间、Bradley-Terry 模型、sandwich estimator。
- 动态更新:顶级模型得分 >90% 时主动替换 benchmark(Ceiling Effect)。
- “不可付费买排名”原则:商业模式靠企业订阅,而非卖排名。
三、结构性缺陷(需要带着批判眼光的)
⚠️ 1. LLM-as-Judge 的循环论证
GDPval-AA v2(占 20% 权重)用 3 位前沿 LLM 法官盲评。宾大沃顿教授 Ethan Mollick 公开批评这个方法”tells us nothing”——用一个模型评判另一个模型,分数反映的可能是裁判模型的偏好而非被评模型的真实能力。如果裁判模型来自 Google(Gemini),而 Google 的模型也在被评之列,是否存在 self-preference bias?AA 声称测过无此偏差,但这个测试本身也用 LLM 做,存在循环论证。
⚠️ 2. 自研基准占比过高
9 项评估中 4 项是 AA 自研(AA-Omniscience 12%、AA-LCR 6%、GDPval-AA 20%、τ³-Banking 大量定制化),合计约 32% 权重由 AA 自己设计的数据集构成。AA 既是规则制定者又是裁判。数据集具体内容不完全透明(AA-Omniscience 的 6000 题具体是什么?),存在结构性风险。
⚠️ 3. 权重分配是编辑选择,不是客观真理
Agents 占 34% 而 General 只占 18%——反映 AA 团队对”什么更重要”的主观判断。如果你的使用场景是翻译、多语言或创意写作,这个权重不代表你的需求。官方自己也承认:“it has limitations and may not apply directly to every use case”。
⚠️ 4. 仅英语、纯文本
多语言、图像、语音能力都不在 Intelligence Index 内,单独评测。对中文用户,排名参考价值需打折。
⚠️ 5. Goodhart 定律无法逃避
一旦 benchmark 成为行业事实标准,AI 实验室就会针对性优化。AA 的应对是频繁更换 benchmark,但新 benchmark 也终将饱和或被针对性训练。开发者社区(LessWrong、Reddit)已观察:GDPval 盲评”对表面流畅度比对实质性准确性更敏感”。
⚠️ 6. 单分数的误导性
两个 Intelligence Index 相同的模型,能力分布可能完全不同。头部模型分差(如 57.3 vs 57.2 vs 56.8)在 ±1% 置信区间内,统计上无法区分,但 AA 仍按精确排名展示,制造”冠军”叙事。
四、Video Arena 类榜单的额外问题
AA 的视频/图像竞技场用盲投 Elo,看似比 Intelligence Index 更”民主”,但有额外短板:
- 样本量往往极小(Video Editing 榜单仅 8 模型)
- 头部分差无统计意义(1135 vs 1125 = 10 Elo,典型 CI ±15-30)
- 任务定义过粗(“Video Editing”混合了 inpainting/延展/风格迁移/镜头切换等不同能力)
- 投票人构成未披露(大众?专家?标注员?)
- 基准锚点选择可疑(Kling=1000 恰好是基准模型,所有分数相对它算)
→ 把这类榜单当”产品陈列卡片”看没问题;当科学评测看,证据不足。
五、宣传噱头辨析
🟢 不是噱头的
- “独立第三方评测”:确实独立运行,投资方(Nat Friedman、Daniel Gross、Andrew Ng / AI Grant)不接受厂商付费买排名
- 神秘顾客策略:真实执行
- 方法论公开:不是空话
🟡 介于宣传与实质之间的
- “比现存任何其他指标都更有用”(官方原话):自我营销式断言,方法论虽严谨但绝对化表述带宣传性质
- 频繁版本迭代 + “NEW” 标签:方法论上必要(防饱和),商业上维持话题度和订阅价值
- “AI 世界的新 Gartner”定位:品牌塑造意图
🔴 存在实质性问题的
- 95% CI < ±1% 的声明:基于”某些模型”做”>10 次重复”得出,非所有模型都做了这么多重复,个别 benchmark 实际 CI 可能宽得多
- 头部模型分差无统计意义但仍排名:制造”冠军”叙事,尽管统计上这几个模型是并列的
六、科学的模型排名应该长什么样:五层架构
完全科学的排名不存在,但比 AA 更科学的框架是可定义的:
第 1 层 · 任务定义(Task Stratification)
- 按真实使用场景分层:编程 / 推理 / Agent / 多语言 / 长上下文 / 多模态
- 每层细分到具体任务类型(如编程 → 代码生成 / 调试 / 重构 / 终端操作)
- 权重按目标用户群体的真实分布设定,而非评测机构的主观判断
- 关键改进:拒绝”Video Editing”这种粗粒度分类;两个模型在不同子任务上各有所长时不应该被强制排名
第 2 层 · 数据集设计(Dataset Engineering)
- 公开题 ≤ 30%(仅作可比性锚点)
- 私有 held-out 集 ≥ 50%(从未公开发布,模型从未见过)
- 动态 LLM 生成题 ≥ 20%(每次评测用新题,防针对性训练)
- CritPt 模式(未发表难题)是正确方向,但 AA 只用了 70 题、占 6% 权重——远远不够
- 关键改进:任何公开 benchmark 最终都会失效,私有 + 动态生成是必要条件
第 3 层 · 多裁判交叉验证(Triangulated Judging)
三种裁判并行,强制交叉验证:
| 裁判类型 | 适用场景 | 优势 | 局限 |
|---|---|---|---|
| 自动化单元测试 | 编程、数学 | 完全客观 | 仅适用于有标准答案的任务 |
| 多家 LLM 法官交叉 | 开放式回答 | 可规模化 | 需披露每家模型的自家偏好测试 |
| 人类专家盲评 | 复杂任务、创意类 | 真实性强 | 成本高、样本小 |
- 强制 inter-rater reliability ≥ 0.7
- 披露裁判模型对自家模型的偏好测试结果
- 三方结果不一致时标注”争议样本”而非强行取均值
- 关键改进:单一裁判来源都有系统性偏差,三角验证是唯一解
第 4 层 · 统计严谨性(Statistical Rigor)
- 完整披露:每个对比的样本量、95% CI、效应量(Cohen’s d)、贝叶斯后验
- 头部模型分差 < CI 时不排名,显示”统计并列”(statistical tie)
- 多重比较时做 Bonferroni 校正
- 用贝叶斯方法补充频率派 Elo——前者能直接回答”模型 A 优于 B 的概率是多少”
- 关键改进:展示无统计意义的排名本身就是误导。这是 AA 当前最容易修复、但最不愿修复的问题——因为”冠军”叙事有商业价值
第 5 层 · 元评测与真实性校验(Meta-Evaluation)
- 测评测本身:排名 vs 真实部署 A/B 测试结果的相关性(至少 r ≥ 0.6)
- 时间序列:30/90 天 Elo 趋势、票数累积曲线,而非单点快照
- 公开反例:主动披露”何时排名是错的”——科学态度的标志
- 任务迁移性测试:在 A 任务上排名高的模型,在 B 任务上是否也高?如果不是,说明评测维度设计有问题
- 关键改进:一个不自证有效的评测系统,只是数字游戏
七、输出形态的根本转变
| 维度 | 现状(AA) | 理想 |
|---|---|---|
| 形态 | 单一 0-100 分排名 | 多维能力向量 + 置信带 |
| 表述 | ”模型 A 第1 · 模型 B 第2" | "A 在编程强(stat并列)·B 在 Agent 强” |
| 问题 | 隐藏能力分布 · 误导选型 | 按用例匹配 · 透明可追溯 |
八、务实结论:个人/团队怎么选模型
完全科学的排名不存在,但可以做以下降级使用:
短期(现成可用)
- AA 作为初筛工具——看模型大致落在哪个梯队(frontier / mid / budget),不要看精确排名
- 交叉参考 LMArena(人类盲投 Elo)和 SELiveBench(防污染的编程实时榜)
- 看 per-benchmark 分数而非 Intelligence Index 总分——尤其关注你实际用到的维度
中期(自建评测)
- 构建自己的私有评测集——50-100 道你真实业务场景的题,永不公开
- 用同一套 prompt 跑 3-5 个候选模型,记录失败模式而非只看通过率
- A/B 测试——在生产环境用 5% 流量跑候选模型,对比真实用户反馈
何时可以相信一个排名
只有当它同时满足以下条件时:
- ✅ 任务定义细到你的使用场景
- ✅ 数据集有 ≥50% 私有 held-out
- ✅ 多裁判交叉验证
- ✅ 披露完整置信区间且并列时不排名
- ✅ 公开过排名与真实部署结果的相关性验证
目前没有任何公开榜单同时满足这五条。 AA 满足约 2.5 条,LMArena 满足约 2 条,各家厂商自报的 system card 满足 0 条。
可复用心法
榜单用来 narrowing(缩小候选范围)
不用来 choosing(做最终决策)
最终决策必须基于你自己的数据
看到任何 AI 模型榜单,先问五个问题:
1. 任务定义细到我的使用场景吗?
2. 数据集有多少是模型没见过的私有题?
3. 裁判是谁?有没有自家模型当裁判?
4. 头部分差的置信区间是多少?统计上能区分吗?
5. 这个排名跟真实部署结果的相关性验证过吗?
"比任何其他指标都更有用"这种话
本身就是需要被验证的断言
而不是被相信的结论
关联文档
- 标签相同不等于行为相同_第三方代跑平台律_v1 —— 同属”对 AI 工具/模型行为的认知律”:同名模型 ≠ 同一份能力,判据靠验通道不靠眼睛
- 出图机制优先律_智能体原生出图vs盲调API_v1 —— 同属”工具能力边界认知”:同套 prompt,智能体看图自纠 vs 盲调 API 表现天差地别
- 伪机制解释识别_四层拆解法_v1 —— 同属”识别伪权威”:伪解释形态=现象对+机制编数字+根因错位+药方半对,裁决权归实测反证
- 打磨不等于校验律_v1 —— “看起来经过工序”抬高信任但不产生正确性证据;AA 的”95% CI < ±1%“也是同理:看起来精确 ≠ 真的精确
- 交付前实测证伪律_v1 —— 别交付”应该能行”的假方案;选模型同理,别信”应该能行”的榜单
- 故事读书笔记_工具丰饶不等于创造力丰饶 —— 工具的丰饶不等于创造力的丰饶;榜单的精确不等于模型的真实能力分布
- 个人项目免PR直推主分支_v1 —— 本文档入库遵循此律(个人仓库直接 commit & push main)