Classement des modèles d’IA — 11 leaderboards réunis

RangModèleScore globalArtificial AnalysisLiveBenchEpoch AIARC-AGIScale SEALVals AITerminal-BenchEQ-BenchSimpleBenchBenchLM
192.5#1#2—#2—#1——#1—
292.2#3#4#1#1#1#4#1—#4#1
391.7#2#1#2#5#2#2#2—#2#2
490.6#5#3#3#6—#5#4#2—#4
5
Anthropic
90.3#4#9#4#4—#3#3#1#8#3
689.0#6#5#15——#6——#7—
788.0#8#6#6#3—#7#7#9#23#5
886.9——#5#9————#10—
9
OpenAI
86.5#7#11———#8——#15—
1085.2——#9#13——————
1185.2#10————#16————
1284.7#22#6#28——#20——#21—
1384.6#9#19———#11#6———
14
OpenAI
84.4#25#8#8#8—#22—#4#19#12
1583.3#19#31#13#6#4#9#11—#5#6
16
Moonshot AI
83.3#15#11#12#24—#21—#3#33#8
17
Alibaba (Qwen)
82.5#11#14#26——#33———#9
1882.4#13#15#18#20—#18#10—#13#11
1982.1#23#13#11#9—#17#15——#14
19
OpenAI
82.1—#15#14#16———#7—#13
2182.1#16#18#7#12—#13#9#11#53#7
2282.0#21#15#27——#23——#14—
22
Z.ai (Zhipu)
82.0#12#28#22——#24#5—#22—
2481.4#17#26#10#17—#10#8#6#23#10
2580.1—#25#19#15#9#25—#5#26—
26
Alibaba (Qwen)
78.7#20#26————————
2777.8#26#30#20——#13#13#10#34#15
2877.3#39#22#29#14#3#41—#21#9—
2976.1#29#19#24#23—#32—#18#51—
3076.0#33#33#33——#28—#8—#16
3175.5#24#31#34#32—#34#13—#18#18
3274.8—#37#25#19#10——#13#20#20
3374.2——#39—#6————#27
3474.0#36#35#30#17—#30—#24#11#21
3574.0#31#38#31#22—#29——#31—
3673.8#27#40#21#28—#12#12#19#55#17
3773.7#32#40#32#24—#26———#19
38
Alibaba (Qwen)
73.5#33#33———#36————
3973.5#27#46—#29—#19————
4070.4——#37#37#7———#12#26
4170.0——#16——————#24
4269.9—#35——#12—————
43
Z.ai (Zhipu)
69.7#17#48#41——#37————
4469.5——#23#30————#41—
4568.8#38#44#38#24—#35—#16—#30
46
Z.ai (Zhipu)
68.6#33#42#43#38—#30—#14#38#23
47
Alibaba (Qwen)
66.2#40#43#35——#38—#23—#22
48
Alibaba (Qwen)
65.8——#53—————#25—
49
OpenAI
65.2——#36#31————#58#25
50
Alibaba (Qwen)
63.4——#52—————#36—

Questions fréquentes

Qu’est-ce qu’ARBITER ?

Un classement global des modèles et entreprises d’IA qui combine statistiquement 11 leaderboards d’IA de référence.

À quelle fréquence est-il mis à jour ?

Toutes les heures. Les nouveaux modèles de n’importe quel leaderboard sont ajoutés automatiquement.

Comment le score global est-il calculé ?

La métrique principale de chaque site est standardisée, puis un modèle factoriel corrige les écarts entre sites pour estimer la capacité commune de chaque modèle.

Les modèles évalués sur moins de leaderboards sont-ils désavantagés ?

Non. Une évaluation manquante n’est jamais pénalisée. L’incertitude est plutôt affichée sous forme d’intervalle à 90 %.

Quel est le meilleur modèle d’IA en ce moment ?

Le n° 1 du classement global. Le meilleur choix dépend de votre usage : consultez aussi les classements par domaine.