Ranking de modelos de IA — 11 leaderboards combinados

PuestoModeloPuntuación generalArtificial AnalysisLiveBenchEpoch AIARC-AGIScale SEALVals AITerminal-BenchEQ-BenchSimpleBenchBenchLM
192.5#1#2—#2—#1——#1—
292.2#3#4#1#1#1#4#1—#4#1
391.7#2#1#2#5#2#2#2—#2#2
490.6#5#3#3#6—#5#4#2—#4
5
Anthropic
90.3#4#9#4#4—#3#3#1#8#3
689.0#6#5#15——#6——#7—
788.0#8#6#6#3—#7#7#9#23#5
886.9——#5#9————#10—
9
OpenAI
86.5#7#11———#8——#15—
1085.2——#9#13——————
1185.2#10————#16————
1284.7#22#6#28——#20——#21—
1384.6#9#19———#11#6———
14
OpenAI
84.4#25#8#8#8—#22—#4#19#12
1583.3#19#31#13#6#4#9#11—#5#6
16
Moonshot AI
83.3#15#11#12#24—#21—#3#33#8
17
Alibaba (Qwen)
82.5#11#14#26——#33———#9
1882.4#13#15#18#20—#18#10—#13#11
1982.1#23#13#11#9—#17#15——#14
19
OpenAI
82.1—#15#14#16———#7—#13
2182.1#16#18#7#12—#13#9#11#53#7
2282.0#21#15#27——#23——#14—
22
Z.ai (Zhipu)
82.0#12#28#22——#24#5—#22—
2481.4#17#26#10#17—#10#8#6#23#10
2580.1—#25#19#15#9#25—#5#26—
26
Alibaba (Qwen)
78.7#20#26————————
2777.8#26#30#20——#13#13#10#34#15
2877.3#39#22#29#14#3#41—#21#9—
2976.1#29#19#24#23—#32—#18#51—
3076.0#33#33#33——#28—#8—#16
3175.5#24#31#34#32—#34#13—#18#18
3274.8—#37#25#19#10——#13#20#20
3374.2——#39—#6————#27
3474.0#36#35#30#17—#30—#24#11#21
3574.0#31#38#31#22—#29——#31—
3673.8#27#40#21#28—#12#12#19#55#17
3773.7#32#40#32#24—#26———#19
38
Alibaba (Qwen)
73.5#33#33———#36————
3973.5#27#46—#29—#19————
4070.4——#37#37#7———#12#26
4170.0——#16——————#24
4269.9—#35——#12—————
43
Z.ai (Zhipu)
69.7#17#48#41——#37————
4469.5——#23#30————#41—
4568.8#38#44#38#24—#35—#16—#30
46
Z.ai (Zhipu)
68.6#33#42#43#38—#30—#14#38#23
47
Alibaba (Qwen)
66.2#40#43#35——#38—#23—#22
48
Alibaba (Qwen)
65.8——#53—————#25—
49
OpenAI
65.2——#36#31————#58#25
50
Alibaba (Qwen)
63.4——#52—————#36—

Preguntas frecuentes

¿Qué es ARBITER?

Un ranking general de modelos y empresas de IA que combina estadísticamente 11 leaderboards de IA de referencia.

¿Con qué frecuencia se actualiza?

Cada hora. Los modelos nuevos de cualquier leaderboard se añaden automáticamente.

¿Cómo se calcula la puntuación general?

Se estandariza la métrica principal de cada sitio y un modelo factorial corrige las diferencias entre sitios para estimar la capacidad común de cada modelo.

¿Salen perjudicados los modelos evaluados en menos leaderboards?

No. Las evaluaciones que faltan nunca penalizan. En su lugar, la incertidumbre se muestra como un intervalo del 90 %.

¿Cuál es el mejor modelo de IA ahora mismo?

El n.º 1 del ranking general. La mejor opción depende de tu uso, así que consulta también los rankings por área.