Ranking de modelos de IA — 11 leaderboards combinados

PuestoEmpresaPuntuación generalMejor modeloModelos
186.7Claude Opus 5.527
285.2GPT-6 Astra54
377.7Muse Spark 1.323
474.4Gemini 3.8 Flash33
572.7Grok 4.713
670.1MiMo-V2.6-Pro4
769.8Kimi K35
868.1Qwen3.8 Max46
967.8DeepSeek V4.1 Flash22
1066.0GLM-5.310
1153.3—2
1242.0Inkling2
1340.3MiniMax-M35
1432.7—5
1529.6Nemotron 3 Ultra 550B A55B9
1617.6Mistral 3.526
1716.7Phi-46
1815.8—3
1913.3Mercury 2.51
2012.9Command R3

El resultado de una empresa en cada sitio es el de su mejor modelo allí.

Preguntas frecuentes

¿Qué es ARBITER?

Un ranking general de modelos y empresas de IA que combina estadísticamente 11 leaderboards de IA de referencia.

¿Con qué frecuencia se actualiza?

Cada hora. Los modelos nuevos de cualquier leaderboard se añaden automáticamente.

¿Cómo se calcula la puntuación general?

Se estandariza la métrica principal de cada sitio y un modelo factorial corrige las diferencias entre sitios para estimar la capacidad común de cada modelo.

¿Salen perjudicados los modelos evaluados en menos leaderboards?

No. Las evaluaciones que faltan nunca penalizan. En su lugar, la incertidumbre se muestra como un intervalo del 90 %.

¿Cuál es el mejor modelo de IA ahora mismo?

El n.º 1 del ranking general. La mejor opción depende de tu uso, así que consulta también los rankings por área.