Performance et prix
En haut à gauche = bon marché et performant. Cliquez sur un point pour les détails.
| Rang | Entreprise | Score global | Meilleur modèle | Modèles |
|---|---|---|---|---|
| 1 | 86.7 | Claude Opus 5.5 | 27 | |
| 2 | 85.2 | GPT-6 Astra | 54 | |
| 3 | 77.7 | Muse Spark 1.3 | 23 | |
| 4 | 74.4 | Gemini 3.8 Flash | 33 | |
| 5 | 72.7 | Grok 4.7 | 13 | |
| 6 | 70.1 | MiMo-V2.6-Pro | 4 | |
| 7 | 69.8 | Kimi K3 | 5 | |
| 8 | 68.1 | Qwen3.8 Max | 46 | |
| 9 | 67.8 | DeepSeek V4.1 Flash | 22 | |
| 10 | 66.0 | GLM-5.3 | 10 | |
| 11 | 53.3 | — | 2 | |
| 12 | 42.0 | Inkling | 2 | |
| 13 | 40.3 | MiniMax-M3 | 5 | |
| 14 | 32.7 | — | 5 | |
| 15 | 29.6 | Nemotron 3 Ultra 550B A55B | 9 | |
| 16 | 17.6 | Mistral 3.5 | 26 | |
| 17 | 16.7 | Phi-4 | 6 | |
| 18 | 15.8 | — | 3 | |
| 19 | 13.3 | Mercury 2.5 | 1 | |
| 20 | 12.9 | Command R | 3 |
Le résultat d’une entreprise sur chaque site est celui de son meilleur modèle.
Un classement global des modèles et entreprises d’IA qui combine statistiquement 11 leaderboards d’IA de référence.
Toutes les heures. Les nouveaux modèles de n’importe quel leaderboard sont ajoutés automatiquement.
La métrique principale de chaque site est standardisée, puis un modèle factoriel corrige les écarts entre sites pour estimer la capacité commune de chaque modèle.
Non. Une évaluation manquante n’est jamais pénalisée. L’incertitude est plutôt affichée sous forme d’intervalle à 90 %.
Le n° 1 du classement global. Le meilleur choix dépend de votre usage : consultez aussi les classements par domaine.