Рейтинг ИИ-моделей — 11 лидербордов вместе

Как считается рейтинг

  1. Сбор — Официальные данные с 11 лидербордов ниже загружаются каждый час. Оценки, отмеченные как приблизительные, не используются.
  2. Сопоставление — Разные написания одной модели объединяются. Для вариантов, например уровней рассуждения, берётся лучший результат на каждом сайте.
  3. Стандартизация — Основная метрика каждого сайта стандартизируется внутри сайта, поэтому сохраняются разрывы в баллах, а не только места.
  4. Выравнивание — Факторная модель, связывающая сайты через модели, представленные на нескольких из них, учитывает сложность и состав моделей каждого сайта. Более «шумные» сайты получают меньший вес.
  5. Без штрафа за пропуски — Модель оценивается только по сайтам, которые её оценили. Неопределённость показана 90% интервалом. В рейтинг попадают модели, оценённые на 2 сайтах и более.
  6. Arena — Arena (бывшая LMArena) используется только в рейтингах по областям, но не в общей оценке. Новые модели добавляются автоматически.

Частые вопросы

Что такое ARBITER?

Общий рейтинг ИИ-моделей и компаний, статистически объединяющий 11 авторитетных ИИ-лидербордов.

Как часто он обновляется?

Каждый час. Новые модели с любого лидерборда добавляются автоматически.

Как рассчитывается общая оценка?

Основная метрика каждого сайта стандартизируется, затем факторная модель учитывает различия между сайтами и оценивает общую способность каждой модели.

Не страдают ли модели, оценённые на меньшем числе лидербордов?

Нет. Отсутствующие оценки никогда не штрафуются. Вместо этого неопределённость показана 90% интервалом.

Какая ИИ-модель сейчас лучшая?

Модель №1 в общем рейтинге. Лучший выбор зависит от задачи, поэтому смотрите и рейтинги по областям.