AIモデルランキング — 11のリーダーボードを統合

ランキングの仕組み

  1. 収集 — 下記11のリーダーボードから公式データを毎時取得します。推定値と明記されたスコアは使用しません。
  2. 照合 — 同じモデルの表記ゆれを統合します。推論強度などのバリエーションは、各サイトでの最高成績を採用します。
  3. 標準化 — 各サイトの主指標をサイト内で標準化し、順位だけでなくスコアの差も保持します。
  4. 等化 — 複数サイトに掲載されたモデルを橋渡しにした因子モデルで、各サイトの難易度と掲載モデルの違いを補正します。ばらつきの大きいサイトほど重みを小さくします。
  5. 未評価でも減点なし — 各モデルは評価されたサイトのみからスコアを算出します。不確かさは90%区間で表示します。2サイト以上で評価されたモデルを順位付けします。
  6. Arena — Arena(旧LMArena)は分野別ランキングのみに使用し、総合スコアには使用しません。新しいモデルは自動で追加されます。

よくある質問

ARBITERとは?

11の権威あるAIリーダーボードを統計的に統合した、AIモデルとAI企業の総合ランキングです。

更新頻度は?

毎時です。どのリーダーボードに新しいモデルが載っても自動で追加されます。

総合スコアはどう計算していますか?

各サイトの主指標を標準化し、因子モデルでサイト間の違いを補正して、各モデルに共通する能力を推定しています。

掲載リーダーボードが少ないモデルは不利になりますか?

いいえ。未評価による減点はありません。代わりに不確かさを90%区間で表示します。

今いちばん優れたAIモデルは?

総合ランキング1位のモデルです。最適な選択は用途によって異なるため、分野別ランキングもご確認ください。