Rendimiento frente a precio
Arriba a la izquierda = barato y potente. Haz clic en un punto para ver detalles.
| Puesto | Empresa | Puntuación general | Mejor modelo | Modelos |
|---|---|---|---|---|
| 1 | 86.7 | Claude Opus 5.5 | 27 | |
| 2 | 85.2 | GPT-6 Astra | 54 | |
| 3 | 77.7 | Muse Spark 1.3 | 23 | |
| 4 | 74.4 | Gemini 3.8 Flash | 33 | |
| 5 | 72.7 | Grok 4.7 | 13 | |
| 6 | 70.1 | MiMo-V2.6-Pro | 4 | |
| 7 | 69.8 | Kimi K3 | 5 | |
| 8 | 68.1 | Qwen3.8 Max | 46 | |
| 9 | 67.8 | DeepSeek V4.1 Flash | 22 | |
| 10 | 66.0 | GLM-5.3 | 10 | |
| 11 | 53.3 | — | 2 | |
| 12 | 42.0 | Inkling | 2 | |
| 13 | 40.3 | MiniMax-M3 | 5 | |
| 14 | 32.7 | — | 5 | |
| 15 | 29.6 | Nemotron 3 Ultra 550B A55B | 9 | |
| 16 | 17.6 | Mistral 3.5 | 26 | |
| 17 | 16.7 | Phi-4 | 6 | |
| 18 | 15.8 | — | 3 | |
| 19 | 13.3 | Mercury 2.5 | 1 | |
| 20 | 12.9 | Command R | 3 |
El resultado de una empresa en cada sitio es el de su mejor modelo allí.
Un ranking general de modelos y empresas de IA que combina estadísticamente 11 leaderboards de IA de referencia.
Cada hora. Los modelos nuevos de cualquier leaderboard se añaden automáticamente.
Se estandariza la métrica principal de cada sitio y un modelo factorial corrige las diferencias entre sitios para estimar la capacidad común de cada modelo.
No. Las evaluaciones que faltan nunca penalizan. En su lugar, la incertidumbre se muestra como un intervalo del 90 %.
El n.º 1 del ranking general. La mejor opción depende de tu uso, así que consulta también los rankings por área.