تصنيف نماذج الذكاء الاصطناعي — 11 لوحات تقييم مجتمعة

المرتبةالنموذجالدرجة الإجماليةArtificial AnalysisLiveBenchEpoch AIARC-AGIScale SEALVals AITerminal-BenchEQ-BenchSimpleBenchBenchLM
192.5#1#2—#2—#1——#1—
292.2#3#4#1#1#1#4#1—#4#1
391.7#2#1#2#5#2#2#2—#2#2
490.6#5#3#3#6—#5#4#2—#4
5
Anthropic
90.3#4#9#4#4—#3#3#1#8#3
689.0#6#5#15——#6——#7—
788.0#8#6#6#3—#7#7#9#23#5
886.9——#5#9————#10—
9
OpenAI
86.5#7#11———#8——#15—
1085.2——#9#13——————
1185.2#10————#16————
1284.7#22#6#28——#20——#21—
1384.6#9#19———#11#6———
14
OpenAI
84.4#25#8#8#8—#22—#4#19#12
1583.3#19#31#13#6#4#9#11—#5#6
16
Moonshot AI
83.3#15#11#12#24—#21—#3#33#8
17
Alibaba (Qwen)
82.5#11#14#26——#33———#9
1882.4#13#15#18#20—#18#10—#13#11
1982.1#23#13#11#9—#17#15——#14
19
OpenAI
82.1—#15#14#16———#7—#13
2182.1#16#18#7#12—#13#9#11#53#7
2282.0#21#15#27——#23——#14—
22
Z.ai (Zhipu)
82.0#12#28#22——#24#5—#22—
2481.4#17#26#10#17—#10#8#6#23#10
2580.1—#25#19#15#9#25—#5#26—
26
Alibaba (Qwen)
78.7#20#26————————
2777.8#26#30#20——#13#13#10#34#15
2877.3#39#22#29#14#3#41—#21#9—
2976.1#29#19#24#23—#32—#18#51—
3076.0#33#33#33——#28—#8—#16
3175.5#24#31#34#32—#34#13—#18#18
3274.8—#37#25#19#10——#13#20#20
3374.2——#39—#6————#27
3474.0#36#35#30#17—#30—#24#11#21
3574.0#31#38#31#22—#29——#31—
3673.8#27#40#21#28—#12#12#19#55#17
3773.7#32#40#32#24—#26———#19
38
Alibaba (Qwen)
73.5#33#33———#36————
3973.5#27#46—#29—#19————
4070.4——#37#37#7———#12#26
4170.0——#16——————#24
4269.9—#35——#12—————
43
Z.ai (Zhipu)
69.7#17#48#41——#37————
4469.5——#23#30————#41—
4568.8#38#44#38#24—#35—#16—#30
46
Z.ai (Zhipu)
68.6#33#42#43#38—#30—#14#38#23
47
Alibaba (Qwen)
66.2#40#43#35——#38—#23—#22
48
Alibaba (Qwen)
65.8——#53—————#25—
49
OpenAI
65.2——#36#31————#58#25
50
Alibaba (Qwen)
63.4——#52—————#36—

الأسئلة الشائعة

ما هو ARBITER؟

تصنيف شامل لنماذج وشركات الذكاء الاصطناعي يجمع إحصائيًا بين 11 من أبرز لوحات تقييم الذكاء الاصطناعي.

كم مرة يُحدَّث؟

كل ساعة. وتُضاف تلقائيًا النماذج الجديدة من أي لوحة تقييم.

كيف تُحسب الدرجة الإجمالية؟

يُوحَّد المقياس الرئيسي لكل موقع، ثم يصحح نموذج عاملي الفروق بين المواقع ويقدّر القدرة المشتركة لكل نموذج.

هل تتضرر النماذج المقيَّمة في عدد أقل من لوحات التقييم؟

لا. لا يُعاقَب النموذج أبدًا على التقييمات الناقصة، بل يُعرض عدم اليقين كفاصل 90%.

ما أفضل نموذج ذكاء اصطناعي حاليًا؟

النموذج الأول في التصنيف الإجمالي. يعتمد الخيار الأفضل على استخدامك، لذا راجع أيضًا تصنيف المجالات.