Classement des modèles d’IA — 11 leaderboards réunis

RangEntrepriseScore globalMeilleur modèleModèles
186.7Claude Opus 5.527
285.2GPT-6 Astra54
377.7Muse Spark 1.323
474.4Gemini 3.8 Flash33
572.7Grok 4.713
670.1MiMo-V2.6-Pro4
769.8Kimi K35
868.1Qwen3.8 Max46
967.8DeepSeek V4.1 Flash22
1066.0GLM-5.310
1153.3—2
1242.0Inkling2
1340.3MiniMax-M35
1432.7—5
1529.6Nemotron 3 Ultra 550B A55B9
1617.6Mistral 3.526
1716.7Phi-46
1815.8—3
1913.3Mercury 2.51
2012.9Command R3

Le résultat d’une entreprise sur chaque site est celui de son meilleur modèle.

Questions fréquentes

Qu’est-ce qu’ARBITER ?

Un classement global des modèles et entreprises d’IA qui combine statistiquement 11 leaderboards d’IA de référence.

À quelle fréquence est-il mis à jour ?

Toutes les heures. Les nouveaux modèles de n’importe quel leaderboard sont ajoutés automatiquement.

Comment le score global est-il calculé ?

La métrique principale de chaque site est standardisée, puis un modèle factoriel corrige les écarts entre sites pour estimer la capacité commune de chaque modèle.

Les modèles évalués sur moins de leaderboards sont-ils désavantagés ?

Non. Une évaluation manquante n’est jamais pénalisée. L’incertitude est plutôt affichée sous forme d’intervalle à 90 %.

Quel est le meilleur modèle d’IA en ce moment ?

Le n° 1 du classement global. Le meilleur choix dépend de votre usage : consultez aussi les classements par domaine.