Ranking de modelos de IA — 11 leaderboards combinados

Cómo se calcula el ranking

  1. Obtención — Cada hora se obtienen los datos oficiales de los 11 leaderboards siguientes. No se usan puntuaciones marcadas como estimaciones.
  2. Unificación — Se unifican las distintas grafías de un mismo modelo. Para variantes como el nivel de razonamiento, se usa el mejor resultado de cada sitio.
  3. Estandarización — La métrica principal de cada sitio se estandariza dentro de ese sitio, conservando las diferencias de puntuación y no solo los puestos.
  4. Equiparación — Un modelo factorial, con los modelos presentes en varios sitios como puente, corrige la dificultad y la selección de modelos de cada sitio. Los sitios con más ruido pesan menos.
  5. Sin penalizar los datos que faltan — Cada modelo se puntúa solo con los sitios que lo evaluaron. La incertidumbre se muestra como un intervalo del 90 %. Se clasifican los modelos evaluados en 2 o más sitios.
  6. Arena — Arena (antes LMArena) solo se usa en los rankings por área, no en la puntuación general. Los modelos nuevos se añaden automáticamente.

Preguntas frecuentes

¿Qué es ARBITER?

Un ranking general de modelos y empresas de IA que combina estadísticamente 11 leaderboards de IA de referencia.

¿Con qué frecuencia se actualiza?

Cada hora. Los modelos nuevos de cualquier leaderboard se añaden automáticamente.

¿Cómo se calcula la puntuación general?

Se estandariza la métrica principal de cada sitio y un modelo factorial corrige las diferencias entre sitios para estimar la capacidad común de cada modelo.

¿Salen perjudicados los modelos evaluados en menos leaderboards?

No. Las evaluaciones que faltan nunca penalizan. En su lugar, la incertidumbre se muestra como un intervalo del 90 %.

¿Cuál es el mejor modelo de IA ahora mismo?

El n.º 1 del ranking general. La mejor opción depende de tu uso, así que consulta también los rankings por área.