Rendimiento frente a precio
Arriba a la izquierda = barato y potente. Haz clic en un punto para ver detalles.
| Puesto | Modelo | Puntuación general | Artificial Analysis | LiveBench | Epoch AI | ARC-AGI | Scale SEAL | Vals AI | Terminal-Bench | EQ-Bench | SimpleBench | BenchLM |
|---|---|---|---|---|---|---|---|---|---|---|---|---|
| 1 | Anthropic | 92.5 | #1 | #2 | — | #2 | — | #1 | — | — | #1 | — |
| 2 | OpenAI | 92.2 | #3 | #4 | #1 | #1 | #1 | #4 | #1 | — | #4 | #1 |
| 3 | Anthropic | 91.7 | #2 | #1 | #2 | #5 | #2 | #2 | #2 | — | #2 | #2 |
| 4 | Anthropic | 90.6 | #5 | #3 | #3 | #6 | — | #5 | #4 | #2 | — | #4 |
| 5 | Anthropic | 90.3 | #4 | #9 | #4 | #4 | — | #3 | #3 | #1 | #8 | #3 |
| 6 | Meta | 89.0 | #6 | #5 | #15 | — | — | #6 | — | — | #7 | — |
| 7 | OpenAI | 88.0 | #8 | #6 | #6 | #3 | — | #7 | #7 | #9 | #23 | #5 |
| 8 | OpenAI | 86.9 | — | — | #5 | #9 | — | — | — | — | #10 | — |
| 9 | OpenAI | 86.5 | #7 | #11 | — | — | — | #8 | — | — | #15 | — |
| 10 | OpenAI | 85.2 | — | — | #9 | #13 | — | — | — | — | — | — |
| 11 | Xiaomi | 85.2 | #10 | — | — | — | — | #16 | — | — | — | — |
| 12 | DeepSeek | 84.7 | #22 | #6 | #28 | — | — | #20 | — | — | #21 | — |
| 13 | xAI | 84.6 | #9 | #19 | — | — | — | #11 | #6 | — | — | — |
| 14 | OpenAI | 84.4 | #25 | #8 | #8 | #8 | — | #22 | — | #4 | #19 | #12 |
| 15 | Google | 83.3 | #19 | #31 | #13 | #6 | #4 | #9 | #11 | — | #5 | #6 |
| 16 | Moonshot AI | 83.3 | #15 | #11 | #12 | #24 | — | #21 | — | #3 | #33 | #8 |
| 17 | Alibaba (Qwen) | 82.5 | #11 | #14 | #26 | — | — | #33 | — | — | — | #9 |
| 18 | xAI | 82.4 | #13 | #15 | #18 | #20 | — | #18 | #10 | — | #13 | #11 |
| 19 | Google | 82.1 | #23 | #13 | #11 | #9 | — | #17 | #15 | — | — | #14 |
| 19 | OpenAI | 82.1 | — | #15 | #14 | #16 | — | — | — | #7 | — | #13 |
| 21 | OpenAI | 82.1 | #16 | #18 | #7 | #12 | — | #13 | #9 | #11 | #53 | #7 |
| 22 | Meta | 82.0 | #21 | #15 | #27 | — | — | #23 | — | — | #14 | — |
| 22 | Z.ai (Zhipu) | 82.0 | #12 | #28 | #22 | — | — | #24 | #5 | — | #22 | — |
| 24 | Anthropic | 81.4 | #17 | #26 | #10 | #17 | — | #10 | #8 | #6 | #23 | #10 |
| 25 | Anthropic | 80.1 | — | #25 | #19 | #15 | #9 | #25 | — | #5 | #26 | — |
| 26 | Alibaba (Qwen) | 78.7 | #20 | #26 | — | — | — | — | — | — | — | — |
| 27 | Anthropic | 77.8 | #26 | #30 | #20 | — | — | #13 | #13 | #10 | #34 | #15 |
| 28 | Google | 77.3 | #39 | #22 | #29 | #14 | #3 | #41 | — | #21 | #9 | — |
| 29 | DeepSeek | 76.1 | #29 | #19 | #24 | #23 | — | #32 | — | #18 | #51 | — |
| 30 | Meta | 76.0 | #33 | #33 | #33 | — | — | #28 | — | #8 | — | #16 |
| 31 | xAI | 75.5 | #24 | #31 | #34 | #32 | — | #34 | #13 | — | #18 | #18 |
| 32 | Anthropic | 74.8 | — | #37 | #25 | #19 | #10 | — | — | #13 | #20 | #20 |
| 33 | Meta | 74.2 | — | — | #39 | — | #6 | — | — | — | — | #27 |
| 34 | Google | 74.0 | #36 | #35 | #30 | #17 | — | #30 | — | #24 | #11 | #21 |
| 35 | DeepSeek | 74.0 | #31 | #38 | #31 | #22 | — | #29 | — | — | #31 | — |
| 36 | OpenAI | 73.8 | #27 | #40 | #21 | #28 | — | #12 | #12 | #19 | #55 | #17 |
| 37 | Google | 73.7 | #32 | #40 | #32 | #24 | — | #26 | — | — | — | #19 |
| 38 | Alibaba (Qwen) | 73.5 | #33 | #33 | — | — | — | #36 | — | — | — | — |
| 39 | OpenAI | 73.5 | #27 | #46 | — | #29 | — | #19 | — | — | — | — |
| 40 | Google | 70.4 | — | — | #37 | #37 | #7 | — | — | — | #12 | #26 |
| 41 | OpenAI | 70.0 | — | — | #16 | — | — | — | — | — | — | #24 |
| 42 | OpenAI | 69.9 | — | #35 | — | — | #12 | — | — | — | — | — |
| 43 | Z.ai (Zhipu) | 69.7 | #17 | #48 | #41 | — | — | #37 | — | — | — | — |
| 44 | OpenAI | 69.5 | — | — | #23 | #30 | — | — | — | — | #41 | — |
| 45 | Anthropic | 68.8 | #38 | #44 | #38 | #24 | — | #35 | — | #16 | — | #30 |
| 46 | Z.ai (Zhipu) | 68.6 | #33 | #42 | #43 | #38 | — | #30 | — | #14 | #38 | #23 |
| 47 | Alibaba (Qwen) | 66.2 | #40 | #43 | #35 | — | — | #38 | — | #23 | — | #22 |
| 48 | Alibaba (Qwen) | 65.8 | — | — | #53 | — | — | — | — | — | #25 | — |
| 49 | OpenAI | 65.2 | — | — | #36 | #31 | — | — | — | — | #58 | #25 |
| 50 | Alibaba (Qwen) | 63.4 | — | — | #52 | — | — | — | — | — | #36 | — |
Un ranking general de modelos y empresas de IA que combina estadísticamente 11 leaderboards de IA de referencia.
Cada hora. Los modelos nuevos de cualquier leaderboard se añaden automáticamente.
Se estandariza la métrica principal de cada sitio y un modelo factorial corrige las diferencias entre sitios para estimar la capacidad común de cada modelo.
No. Las evaluaciones que faltan nunca penalizan. En su lugar, la incertidumbre se muestra como un intervalo del 90 %.
El n.º 1 del ranking general. La mejor opción depende de tu uso, así que consulta también los rankings por área.