AI模型综合排行榜 — 汇总11个榜单

排名的计算方法

  1. 获取 — 每小时从下列11个榜单获取官方数据。标记为估算值的分数不予采用。
  2. 归并 — 同一模型的不同写法会被合并。对于推理强度等变体,采用该网站上的最佳结果。
  3. 标准化 — 在各网站内部对主要指标进行标准化,保留分差而不仅是名次。
  4. 等化 — 以在多个网站上出现的模型为桥梁,用因子模型校正各网站的难度和模型构成。噪声越大的网站权重越低。
  5. 缺失不扣分 — 模型只根据为其评分的网站计算得分。不确定性以90%区间显示。在2个以上网站有评分的模型参与排名。
  6. Arena — Arena(原LMArena)仅用于领域排名,不计入综合得分。新模型会自动加入。

常见问题

ARBITER是什么?

一个通过统计方法综合11个权威AI评测榜单的AI模型和厂商综合排行榜。

多久更新一次?

每小时一次。任何榜单上出现的新模型都会自动加入。

综合得分如何计算?

先将各网站的主要指标标准化,再用因子模型校正网站之间的差异,估计每个模型的共同能力。

评测榜单较少的模型会吃亏吗?

不会。缺失的评分绝不扣分,而是用90%区间表示不确定性。

目前最好的AI模型是哪个?

综合排行榜第1名的模型。最佳选择取决于用途,请同时参考各领域排名。