Peringkat Model AI — 11 leaderboard digabung

PeringkatModelSkor keseluruhanArtificial AnalysisLiveBenchEpoch AIARC-AGIScale SEALVals AITerminal-BenchEQ-BenchSimpleBenchBenchLM
192.5#1#2—#2—#1——#1—
292.2#3#4#1#1#1#4#1—#4#1
391.7#2#1#2#5#2#2#2—#2#2
490.6#5#3#3#6—#5#4#2—#4
5
Anthropic
90.3#4#9#4#4—#3#3#1#8#3
689.0#6#5#15——#6——#7—
788.0#8#6#6#3—#7#7#9#23#5
886.9——#5#9————#10—
9
OpenAI
86.5#7#11———#8——#15—
1085.2——#9#13——————
1185.2#10————#16————
1284.7#22#6#28——#20——#21—
1384.6#9#19———#11#6———
14
OpenAI
84.4#25#8#8#8—#22—#4#19#12
1583.3#19#31#13#6#4#9#11—#5#6
16
Moonshot AI
83.3#15#11#12#24—#21—#3#33#8
17
Alibaba (Qwen)
82.5#11#14#26——#33———#9
1882.4#13#15#18#20—#18#10—#13#11
1982.1#23#13#11#9—#17#15——#14
19
OpenAI
82.1—#15#14#16———#7—#13
2182.1#16#18#7#12—#13#9#11#53#7
2282.0#21#15#27——#23——#14—
22
Z.ai (Zhipu)
82.0#12#28#22——#24#5—#22—
2481.4#17#26#10#17—#10#8#6#23#10
2580.1—#25#19#15#9#25—#5#26—
26
Alibaba (Qwen)
78.7#20#26————————
2777.8#26#30#20——#13#13#10#34#15
2877.3#39#22#29#14#3#41—#21#9—
2976.1#29#19#24#23—#32—#18#51—
3076.0#33#33#33——#28—#8—#16
3175.5#24#31#34#32—#34#13—#18#18
3274.8—#37#25#19#10——#13#20#20
3374.2——#39—#6————#27
3474.0#36#35#30#17—#30—#24#11#21
3574.0#31#38#31#22—#29——#31—
3673.8#27#40#21#28—#12#12#19#55#17
3773.7#32#40#32#24—#26———#19
38
Alibaba (Qwen)
73.5#33#33———#36————
3973.5#27#46—#29—#19————
4070.4——#37#37#7———#12#26
4170.0——#16——————#24
4269.9—#35——#12—————
43
Z.ai (Zhipu)
69.7#17#48#41——#37————
4469.5——#23#30————#41—
4568.8#38#44#38#24—#35—#16—#30
46
Z.ai (Zhipu)
68.6#33#42#43#38—#30—#14#38#23
47
Alibaba (Qwen)
66.2#40#43#35——#38—#23—#22
48
Alibaba (Qwen)
65.8——#53—————#25—
49
OpenAI
65.2——#36#31————#58#25
50
Alibaba (Qwen)
63.4——#52—————#36—

Pertanyaan umum

Apa itu ARBITER?

Peringkat keseluruhan model dan perusahaan AI yang secara statistik menggabungkan 11 leaderboard AI terpercaya.

Seberapa sering diperbarui?

Setiap jam. Model baru dari leaderboard mana pun ditambahkan secara otomatis.

Bagaimana skor keseluruhan dihitung?

Metrik utama tiap situs distandardisasi, lalu model faktor mengoreksi perbedaan antarsitus dan memperkirakan kemampuan bersama tiap model.

Apakah model yang dinilai di lebih sedikit leaderboard dirugikan?

Tidak. Penilaian yang tidak ada tidak pernah mengurangi nilai. Sebagai gantinya, ketidakpastian ditampilkan sebagai interval 90%.

Model AI apa yang terbaik saat ini?

Model #1 di peringkat keseluruhan. Pilihan terbaik tergantung kebutuhan Anda, jadi lihat juga peringkat per bidang.