تصنيف نماذج الذكاء الاصطناعي — 11 لوحات تقييم مجتمعة

كيف يُحسب التصنيف

  1. الجمع — تُجلب البيانات الرسمية من لوحات التقييم الـ11 أدناه كل ساعة. لا تُستخدم الدرجات المصنّفة كتقديرات.
  2. المطابقة — تُدمج التسميات المختلفة للنموذج نفسه. وفي المتغيرات مثل مستوى الاستدلال تُعتمد أفضل نتيجة في كل موقع.
  3. التوحيد القياسي — يُوحَّد المقياس الرئيسي لكل موقع داخل ذلك الموقع، مع الحفاظ على فروق الدرجات لا المراتب فقط.
  4. المعادلة — نموذج عاملي، يستخدم النماذج الموجودة في عدة مواقع جسرًا، يصحح صعوبة كل موقع ومجموعة النماذج فيه. المواقع الأكثر تشويشًا تحصل على وزن أقل.
  5. لا عقوبة على البيانات الناقصة — يُقيَّم كل نموذج فقط من المواقع التي قيّمته. ويُعرض عدم اليقين كفاصل 90%. تُصنَّف النماذج المقيَّمة في 2 مواقع أو أكثر.
  6. Arena — تُستخدم Arena (سابقًا LMArena) في تصنيف المجالات فقط، لا في الدرجة الإجمالية. تُضاف النماذج الجديدة تلقائيًا.

الأسئلة الشائعة

ما هو ARBITER؟

تصنيف شامل لنماذج وشركات الذكاء الاصطناعي يجمع إحصائيًا بين 11 من أبرز لوحات تقييم الذكاء الاصطناعي.

كم مرة يُحدَّث؟

كل ساعة. وتُضاف تلقائيًا النماذج الجديدة من أي لوحة تقييم.

كيف تُحسب الدرجة الإجمالية؟

يُوحَّد المقياس الرئيسي لكل موقع، ثم يصحح نموذج عاملي الفروق بين المواقع ويقدّر القدرة المشتركة لكل نموذج.

هل تتضرر النماذج المقيَّمة في عدد أقل من لوحات التقييم؟

لا. لا يُعاقَب النموذج أبدًا على التقييمات الناقصة، بل يُعرض عدم اليقين كفاصل 90%.

ما أفضل نموذج ذكاء اصطناعي حاليًا؟

النموذج الأول في التصنيف الإجمالي. يعتمد الخيار الأفضل على استخدامك، لذا راجع أيضًا تصنيف المجالات.