KI-Modell-Rangliste — 11 Leaderboards vereint

So funktioniert die Rangliste

  1. Erfassen — Offizielle Daten der 11 unten aufgeführten Leaderboards werden stündlich abgerufen. Als Schätzung markierte Werte werden nicht verwendet.
  2. Zuordnen — Unterschiedliche Schreibweisen desselben Modells werden zusammengeführt. Bei Varianten wie der Reasoning-Stufe wird das beste Ergebnis jeder Seite verwendet.
  3. Standardisieren — Die Hauptmetrik jeder Seite wird innerhalb der Seite standardisiert, sodass Abstände zwischen Werten erhalten bleiben und nicht nur Ränge.
  4. Angleichen — Ein Faktormodell, verbunden über Modelle, die auf mehreren Seiten stehen, gleicht Schwierigkeit und Modellauswahl jeder Seite aus. Seiten mit mehr Rauschen erhalten weniger Gewicht.
  5. Keine Strafe für fehlende Daten — Modelle werden nur anhand der Seiten bewertet, die sie bewertet haben. Die Unsicherheit wird als 90-%-Intervall angezeigt. Modelle mit Bewertungen auf mindestens 2 Seiten werden gelistet.
  6. Arena — Arena (früher LMArena) wird nur für Bereichsranglisten verwendet, nicht für den Gesamtwert. Neue Modelle werden automatisch hinzugefügt.

Häufige Fragen

Was ist ARBITER?

Eine Gesamtrangliste von KI-Modellen und -Anbietern, die 11 maßgebliche KI-Leaderboards statistisch vereint.

Wie oft wird aktualisiert?

Stündlich. Neue Modelle aus jedem Leaderboard werden automatisch hinzugefügt.

Wie wird der Gesamtwert berechnet?

Die Hauptmetrik jeder Seite wird standardisiert; anschließend gleicht ein Faktormodell die Unterschiede zwischen den Seiten aus und schätzt die gemeinsame Fähigkeit jedes Modells.

Sind Modelle mit weniger Leaderboards benachteiligt?

Nein. Fehlende Bewertungen werden nie bestraft. Stattdessen wird die Unsicherheit als 90-%-Intervall angezeigt.

Welches KI-Modell ist derzeit das beste?

Das Modell auf Platz 1 der Gesamtrangliste. Die beste Wahl hängt vom Einsatzzweck ab – sehen Sie sich daher auch die Bereichsranglisten an.