Peringkat Model AI — 11 leaderboard digabung

Cara peringkat dihitung

  1. Pengumpulan — Data resmi dari 11 leaderboard di bawah diambil setiap jam. Skor yang ditandai sebagai perkiraan tidak digunakan.
  2. Pencocokan — Penulisan berbeda untuk model yang sama digabungkan. Untuk varian seperti tingkat penalaran, hasil terbaik di tiap situs yang digunakan.
  3. Standardisasi — Metrik utama tiap situs distandardisasi di dalam situs itu, sehingga selisih skor tetap terjaga, bukan hanya peringkat.
  4. Penyetaraan — Model faktor, dengan model yang muncul di beberapa situs sebagai jembatan, mengoreksi tingkat kesulitan dan komposisi model tiap situs. Situs yang lebih berisik mendapat bobot lebih kecil.
  5. Tanpa penalti untuk data yang tidak ada — Setiap model dinilai hanya dari situs yang menilainya. Ketidakpastian ditampilkan sebagai interval 90%. Model yang dinilai di 2 situs atau lebih masuk peringkat.
  6. Arena — Arena (dulu LMArena) hanya dipakai untuk peringkat bidang, bukan skor keseluruhan. Model baru ditambahkan secara otomatis.

Pertanyaan umum

Apa itu ARBITER?

Peringkat keseluruhan model dan perusahaan AI yang secara statistik menggabungkan 11 leaderboard AI terpercaya.

Seberapa sering diperbarui?

Setiap jam. Model baru dari leaderboard mana pun ditambahkan secara otomatis.

Bagaimana skor keseluruhan dihitung?

Metrik utama tiap situs distandardisasi, lalu model faktor mengoreksi perbedaan antarsitus dan memperkirakan kemampuan bersama tiap model.

Apakah model yang dinilai di lebih sedikit leaderboard dirugikan?

Tidak. Penilaian yang tidak ada tidak pernah mengurangi nilai. Sebagai gantinya, ketidakpastian ditampilkan sebagai interval 90%.

Model AI apa yang terbaik saat ini?

Model #1 di peringkat keseluruhan. Pilihan terbaik tergantung kebutuhan Anda, jadi lihat juga peringkat per bidang.