AI মডেল র‍্যাঙ্কিং — 11টি লিডারবোর্ড একসাথে

র‍্যাঙ্কমডেলসামগ্রিক স্কোরArtificial AnalysisLiveBenchEpoch AIARC-AGIScale SEALVals AITerminal-BenchEQ-BenchSimpleBenchBenchLM
192.5#1#2—#2—#1——#1—
292.2#3#4#1#1#1#4#1—#4#1
391.7#2#1#2#5#2#2#2—#2#2
490.6#5#3#3#6—#5#4#2—#4
5
Anthropic
90.3#4#9#4#4—#3#3#1#8#3
689.0#6#5#15——#6——#7—
788.0#8#6#6#3—#7#7#9#23#5
886.9——#5#9————#10—
9
OpenAI
86.5#7#11———#8——#15—
1085.2——#9#13——————
1185.2#10————#16————
1284.7#22#6#28——#20——#21—
1384.6#9#19———#11#6———
14
OpenAI
84.4#25#8#8#8—#22—#4#19#12
1583.3#19#31#13#6#4#9#11—#5#6
16
Moonshot AI
83.3#15#11#12#24—#21—#3#33#8
17
Alibaba (Qwen)
82.5#11#14#26——#33———#9
1882.4#13#15#18#20—#18#10—#13#11
1982.1#23#13#11#9—#17#15——#14
19
OpenAI
82.1—#15#14#16———#7—#13
2182.1#16#18#7#12—#13#9#11#53#7
2282.0#21#15#27——#23——#14—
22
Z.ai (Zhipu)
82.0#12#28#22——#24#5—#22—
2481.4#17#26#10#17—#10#8#6#23#10
2580.1—#25#19#15#9#25—#5#26—
26
Alibaba (Qwen)
78.7#20#26————————
2777.8#26#30#20——#13#13#10#34#15
2877.3#39#22#29#14#3#41—#21#9—
2976.1#29#19#24#23—#32—#18#51—
3076.0#33#33#33——#28—#8—#16
3175.5#24#31#34#32—#34#13—#18#18
3274.8—#37#25#19#10——#13#20#20
3374.2——#39—#6————#27
3474.0#36#35#30#17—#30—#24#11#21
3574.0#31#38#31#22—#29——#31—
3673.8#27#40#21#28—#12#12#19#55#17
3773.7#32#40#32#24—#26———#19
38
Alibaba (Qwen)
73.5#33#33———#36————
3973.5#27#46—#29—#19————
4070.4——#37#37#7———#12#26
4170.0——#16——————#24
4269.9—#35——#12—————
43
Z.ai (Zhipu)
69.7#17#48#41——#37————
4469.5——#23#30————#41—
4568.8#38#44#38#24—#35—#16—#30
46
Z.ai (Zhipu)
68.6#33#42#43#38—#30—#14#38#23
47
Alibaba (Qwen)
66.2#40#43#35——#38—#23—#22
48
Alibaba (Qwen)
65.8——#53—————#25—
49
OpenAI
65.2——#36#31————#58#25
50
Alibaba (Qwen)
63.4——#52—————#36—

প্রায়শই জিজ্ঞাসিত প্রশ্ন

ARBITER কী?

AI মডেল ও কোম্পানির একটি সামগ্রিক র‍্যাঙ্কিং, যা 11টি নির্ভরযোগ্য AI লিডারবোর্ড পরিসংখ্যানগতভাবে একত্র করে।

কত ঘন ঘন হালনাগাদ হয়?

প্রতি ঘণ্টায়। যেকোনো লিডারবোর্ডে আসা নতুন মডেল স্বয়ংক্রিয়ভাবে যুক্ত হয়।

সামগ্রিক স্কোর কীভাবে হিসাব হয়?

প্রতিটি সাইটের প্রধান মেট্রিক মানকরণ করে, তারপর একটি ফ্যাক্টর মডেল সাইটগুলোর পার্থক্য সংশোধন করে প্রতিটি মডেলের সাধারণ সক্ষমতা অনুমান করে।

কম লিডারবোর্ডে মূল্যায়িত মডেল কি পিছিয়ে পড়ে?

না। অনুপস্থিত মূল্যায়নের জন্য কখনো নম্বর কাটা হয় না। এর বদলে অনিশ্চয়তা ৯০% ব্যবধান হিসেবে দেখানো হয়।

এখন সেরা AI মডেল কোনটি?

সামগ্রিক র‍্যাঙ্কিংয়ের #১ মডেল। সেরা পছন্দ আপনার ব্যবহারের ওপর নির্ভর করে, তাই ক্ষেত্র র‍্যাঙ্কিংও দেখুন।