AI মডেল র‍্যাঙ্কিং — 11টি লিডারবোর্ড একসাথে

র‍্যাঙ্কিং কীভাবে হিসাব হয়

  1. সংগ্রহ — নিচের 11টি লিডারবোর্ড থেকে প্রতি ঘণ্টায় অফিশিয়াল ডেটা আনা হয়। অনুমান হিসেবে চিহ্নিত স্কোর ব্যবহার হয় না।
  2. মেলানো — একই মডেলের ভিন্ন ভিন্ন নাম একত্র করা হয়। রিজনিং স্তরের মতো ভেরিয়েন্টে প্রতিটি সাইটের সেরা ফলাফল নেওয়া হয়।
  3. মানকরণ — প্রতিটি সাইটের প্রধান মেট্রিক সেই সাইটের ভেতরেই মানকরণ করা হয়, যাতে শুধু র‍্যাঙ্ক নয়, স্কোরের ব্যবধানও বজায় থাকে।
  4. সমতাকরণ — একাধিক সাইটে থাকা মডেলকে সেতু হিসেবে ব্যবহার করে একটি ফ্যাক্টর মডেল প্রতিটি সাইটের কাঠিন্য ও মডেলের গঠন সংশোধন করে। বেশি অনিশ্চিত সাইটের ওজন কম।
  5. অনুপস্থিত ডেটার জন্য শাস্তি নেই — প্রতিটি মডেলকে শুধু যেসব সাইট মূল্যায়ন করেছে সেগুলো থেকেই স্কোর দেওয়া হয়। অনিশ্চয়তা ৯০% ব্যবধান হিসেবে দেখানো হয়। 2+ সাইটে মূল্যায়িত মডেল র‍্যাঙ্ক পায়।
  6. Arena — Arena (আগে LMArena) শুধু ক্ষেত্র র‍্যাঙ্কিংয়ে ব্যবহৃত হয়, সামগ্রিক স্কোরে নয়। নতুন মডেল স্বয়ংক্রিয়ভাবে যুক্ত হয়।

প্রায়শই জিজ্ঞাসিত প্রশ্ন

ARBITER কী?

AI মডেল ও কোম্পানির একটি সামগ্রিক র‍্যাঙ্কিং, যা 11টি নির্ভরযোগ্য AI লিডারবোর্ড পরিসংখ্যানগতভাবে একত্র করে।

কত ঘন ঘন হালনাগাদ হয়?

প্রতি ঘণ্টায়। যেকোনো লিডারবোর্ডে আসা নতুন মডেল স্বয়ংক্রিয়ভাবে যুক্ত হয়।

সামগ্রিক স্কোর কীভাবে হিসাব হয়?

প্রতিটি সাইটের প্রধান মেট্রিক মানকরণ করে, তারপর একটি ফ্যাক্টর মডেল সাইটগুলোর পার্থক্য সংশোধন করে প্রতিটি মডেলের সাধারণ সক্ষমতা অনুমান করে।

কম লিডারবোর্ডে মূল্যায়িত মডেল কি পিছিয়ে পড়ে?

না। অনুপস্থিত মূল্যায়নের জন্য কখনো নম্বর কাটা হয় না। এর বদলে অনিশ্চয়তা ৯০% ব্যবধান হিসেবে দেখানো হয়।

এখন সেরা AI মডেল কোনটি?

সামগ্রিক র‍্যাঙ্কিংয়ের #১ মডেল। সেরা পছন্দ আপনার ব্যবহারের ওপর নির্ভর করে, তাই ক্ষেত্র র‍্যাঙ্কিংও দেখুন।