Performance vs price
Top left = cheap and strong. Click a point for details.
| Rank | Model | Overall score | Artificial Analysis | LiveBench | Epoch AI | ARC-AGI | Scale SEAL | Vals AI | Terminal-Bench | EQ-Bench | SimpleBench | BenchLM |
|---|---|---|---|---|---|---|---|---|---|---|---|---|
| 1 | Anthropic | 92.5 | #1 | #2 | — | #2 | — | #1 | — | — | #1 | — |
| 2 | OpenAI | 92.1 | #3 | #4 | #1 | #1 | #1 | #4 | #1 | — | #4 | #1 |
| 3 | Anthropic | 91.7 | #2 | #1 | #2 | #5 | #2 | #2 | #2 | — | #2 | #2 |
| 4 | Anthropic | 90.6 | #5 | #3 | #3 | #6 | — | #5 | #4 | #2 | — | #5 |
| 5 | Anthropic | 90.2 | #4 | #9 | #4 | #4 | — | #3 | #3 | #1 | #8 | #4 |
| 6 | Meta | 89.0 | #6 | #5 | #15 | — | — | #6 | — | — | #7 | — |
| 7 | OpenAI | 88.1 | #8 | #6 | #6 | #3 | — | #7 | #7 | #9 | #23 | #3 |
| 8 | OpenAI | 86.9 | — | — | #5 | #9 | — | — | — | — | #10 | — |
| 9 | OpenAI | 86.5 | #7 | #11 | — | — | — | #8 | — | — | #15 | — |
| 10 | OpenAI | 85.2 | — | — | #9 | #13 | — | — | — | — | — | — |
| 11 | Xiaomi | 85.2 | #10 | — | — | — | — | #16 | — | — | — | — |
| 12 | DeepSeek | 84.7 | #22 | #6 | #28 | — | — | #20 | — | — | #21 | — |
| 13 | xAI | 84.6 | #9 | #19 | — | — | — | #11 | #6 | — | — | — |
| 14 | OpenAI | 84.4 | #25 | #8 | #8 | #8 | — | #22 | — | #4 | #19 | #11 |
| 15 | Moonshot AI | 83.3 | #15 | #11 | #12 | #24 | — | #21 | — | #3 | #33 | #8 |
| 16 | Google | 83.2 | #19 | #31 | #13 | #6 | #4 | #9 | #11 | — | #5 | #7 |
| 17 | Google | 82.8 | #23 | #13 | #11 | #9 | — | #17 | #15 | — | — | — |
| 18 | Alibaba (Qwen) | 82.4 | #11 | #14 | #26 | — | — | #33 | — | — | — | #9 |
| 19 | xAI | 82.3 | #13 | #15 | #18 | #20 | — | #18 | #10 | — | #13 | #12 |
| 20 | OpenAI | 82.2 | — | #15 | #14 | #16 | — | — | — | #7 | — | #12 |
| 21 | Meta | 82.0 | #21 | #15 | #27 | — | — | #23 | — | — | #14 | — |
| 21 | OpenAI | 82.0 | #16 | #18 | #7 | #12 | — | #13 | #9 | #11 | #53 | #6 |
| 23 | Z.ai (Zhipu) | 82.0 | #12 | #28 | #22 | — | — | #24 | #5 | — | #22 | — |
| 24 | Anthropic | 81.4 | #17 | #26 | #10 | #17 | — | #10 | #8 | #6 | #23 | #10 |
| 25 | Anthropic | 80.1 | — | #25 | #19 | #15 | #9 | #25 | — | #5 | #26 | — |
| 26 | Alibaba (Qwen) | 78.7 | #20 | #26 | — | — | — | — | — | — | — | — |
| 27 | Anthropic | 77.8 | #26 | #30 | #20 | — | — | #13 | #13 | #10 | #34 | #14 |
| 28 | Google | 77.3 | #39 | #22 | #29 | #14 | #3 | #41 | — | #21 | #9 | — |
| 29 | DeepSeek | 76.2 | #29 | #19 | #24 | #23 | — | #32 | — | #18 | #51 | — |
| 30 | Meta | 76.1 | #33 | #33 | #33 | — | — | #28 | — | #8 | — | #15 |
| 31 | xAI | 75.5 | #24 | #31 | #34 | #32 | — | #34 | #13 | — | #18 | #16 |
| 32 | Anthropic | 74.8 | — | #37 | #25 | #19 | #10 | — | — | #13 | #20 | #18 |
| 33 | Meta | 74.4 | — | — | #39 | — | #6 | — | — | — | — | #24 |
| 34 | DeepSeek | 74.0 | #31 | #38 | #31 | #22 | — | #29 | — | — | #31 | — |
| 35 | Google | 74.0 | #36 | #35 | #30 | #17 | — | #30 | — | #24 | #11 | #19 |
| 36 | Google | 73.7 | #32 | #40 | #32 | #24 | — | #26 | — | — | — | #17 |
| 37 | OpenAI | 73.7 | #27 | #40 | #21 | #28 | — | #12 | #12 | #19 | #55 | — |
| 38 | Alibaba (Qwen) | 73.5 | #33 | #33 | — | — | — | #36 | — | — | — | — |
| 38 | OpenAI | 73.5 | #27 | #46 | — | #29 | — | #19 | — | — | — | — |
| 40 | Google | 70.3 | — | — | #37 | #37 | #7 | — | — | — | #12 | #25 |
| 41 | OpenAI | 69.9 | — | #35 | — | — | #12 | — | — | — | — | — |
| 42 | Z.ai (Zhipu) | 69.7 | #17 | #48 | #41 | — | — | #37 | — | — | — | — |
| 43 | OpenAI | 69.5 | — | — | #23 | #30 | — | — | — | — | #41 | — |
| 44 | OpenAI | 69.2 | — | — | #16 | — | — | — | — | — | — | #23 |
| 45 | Anthropic | 68.8 | #38 | #44 | #38 | #24 | — | #35 | — | #16 | — | #28 |
| 46 | Z.ai (Zhipu) | 68.5 | #33 | #42 | #43 | #38 | — | #30 | — | #14 | #38 | #21 |
| 47 | Alibaba (Qwen) | 66.0 | #40 | #43 | #35 | — | — | #38 | — | #23 | — | #20 |
| 48 | Alibaba (Qwen) | 65.8 | — | — | #53 | — | — | — | — | — | #25 | — |
| 49 | OpenAI | 65.4 | — | — | #36 | #31 | — | — | — | — | #58 | #22 |
| 50 | Alibaba (Qwen) | 63.4 | — | — | #52 | — | — | — | — | — | #36 | — |
An overall ranking of AI models and providers that statistically combines 11 authoritative AI leaderboards.
Every hour. New models on any leaderboard are added automatically.
Each site’s main metric is standardized, then a factor model corrects for differences between sites and estimates each model’s shared ability.
No. Missing ratings are never penalized. Uncertainty is shown as a 90% interval instead.
The #1 model in the overall ranking. The best choice depends on your use case, so also check the domain rankings.