Ranking de modelos de IA — 11 leaderboards reunidos

Como o ranking é calculado

  1. Coleta — Os dados oficiais dos 11 leaderboards abaixo são buscados a cada hora. Pontuações marcadas como estimativas não são usadas.
  2. Unificação — Grafias diferentes do mesmo modelo são unificadas. Em variantes como o nível de raciocínio, usa-se o melhor resultado de cada site.
  3. Padronização — A métrica principal de cada site é padronizada dentro desse site, preservando as diferenças de pontuação e não apenas as posições.
  4. Equalização — Um modelo fatorial, que usa como ponte os modelos presentes em vários sites, corrige a dificuldade e a seleção de modelos de cada site. Sites com mais ruído pesam menos.
  5. Sem penalidade por dados ausentes — Cada modelo é pontuado apenas pelos sites que o avaliaram. A incerteza é mostrada como um intervalo de 90%. São classificados os modelos avaliados em 2 ou mais sites.
  6. Arena — A Arena (antiga LMArena) é usada apenas nos rankings por área, não na pontuação geral. Novos modelos são adicionados automaticamente.

Perguntas frequentes

O que é o ARBITER?

Um ranking geral de modelos e empresas de IA que combina estatisticamente 11 leaderboards de IA de referência.

Com que frequência é atualizado?

A cada hora. Novos modelos de qualquer leaderboard são adicionados automaticamente.

Como a pontuação geral é calculada?

A métrica principal de cada site é padronizada e um modelo fatorial corrige as diferenças entre sites para estimar a capacidade comum de cada modelo.

Modelos avaliados em menos leaderboards saem prejudicados?

Não. Avaliações ausentes nunca penalizam. Em vez disso, a incerteza é mostrada como um intervalo de 90%.

Qual é o melhor modelo de IA agora?

O nº 1 do ranking geral. A melhor escolha depende do seu uso, então confira também os rankings por área.