---
title: "Best LLM for math"
description: "Models ranked on FrontierMath, OTIS Mock AIME, MATH level 5 and the LMArena math arena, with per-model coverage on every row."
url: "https://aldena.ai/best-llm-for-math"
---

# Best LLM for math

Research-grade problem sets plus competition math. Contamination-resistant private sets carry the same weight as public ones.

Aldena runs these models inside your team rooms. [See what each one costs](https://aldena.ai/models).

| rank | model | vendor | score | coverage (benchmarks) | price (in / out) | FrontierMath (%) | FrontierMath tiers 1 to 3 v2 (%) | FrontierMath tier 4 (%) | OTIS Mock AIME (%) | MATH level 5 (%) | LMArena math (elo) |
| --- | --- | --- | --- | --- | --- | --- | --- | --- | --- | --- | --- |
| 1 | Claude Fable 5 (max) | Anthropic | 82.0 | 4 of 6 | $10.00 / $50.00 | 100.0% | 87.0% | 100.0% | 99.7% | — | — |
| 2 | Claude Opus 5 (max) | Anthropic | 80.5 | 4 of 6 | $5.00 / $25.00 | — | 85.6% | 73.2% | 98.9% | — | 1556 |
| 3 | GPT-5.6 Sol (max) | OpenAI | 79.3 | 3 of 6 | $5.00 / $30.00 | — | 89.1% | 82.9% | 100.0% | — | — |
| 4 | GPT-5.4 (high) | OpenAI | 78.8 | 4 of 6 | $2.50 / $15.00 | 80.0% | — | 50.0% | 97.8% | — | 1494 |
| 5 | GPT-5.6 Terra (max) | OpenAI | 77.0 | 3 of 6 | $1.00 / $6.00 | — | 86.0% | 70.7% | 99.7% | — | — |
| 6 | Claude Opus 4.8 (max) | Anthropic | 74.8 | 4 of 6 | $5.00 / $25.00 | 47.2% | 80.0% | 56.1% | 98.3% | — | — |
| 7 | GPT-5.6 Luna (max) | OpenAI | 74.6 | 3 of 6 | $0.10 / $0.60 | — | 82.1% | 61.0% | 98.3% | — | — |
| 8 | GPT 5.5 Pro Pre Release (xhigh) | OpenAI | 74.2 | 3 of 6 | — | 51.0% | — | 39.6% | 100.0% | — | — |
| 9 | Kimi K3 (max) | MoonshotAI | 74.1 | 4 of 6 | $3.00 / $15.00 | — | 72.2% | 39.0% | 97.2% | — | 1495 |
| 10 | GPT 5.5 Pre Release (xhigh) | OpenAI | 73.7 | 3 of 6 | — | 51.7% | — | 35.4% | 100.0% | — | — |
| 11 | GPT-5.5 Pro (xhigh) (partial coverage) | OpenAI | 73.5 | 2 of 6 | $30.00 / $180.00 | — | 87.7% | 78.0% | — | — | — |
| 12 | Gemini 3.5 Flash (high) | Google | 72.8 | 5 of 6 | $1.50 / $9.00 | 80.0% | 62.8% | 26.8% | 95.6% | — | 1507 |
| 13 | Qwen3.8 Max (xhigh) | Qwen | 72.7 | 3 of 6 | $2.00 / $6.00 | — | 74.7% | 46.3% | 99.4% | — | — |
| 14 | Gemini 3.1 Pro Preview | Google | 72.6 | 5 of 6 | $2.00 / $12.00 | 88.9% | 59.6% | 26.8% | 95.6% | — | 1491 |
| 15 | GPT-5.4 Pro (xhigh) | OpenAI | 72.5 | 3 of 6 | $30.00 / $180.00 | 50.0% | 82.5% | 58.5% | — | — | — |
| 16 | GPT-5.4 (xhigh) | OpenAI | 72.5 | 4 of 6 | $2.50 / $15.00 | 47.6% | 78.6% | 49.0% | 95.3% | — | — |
| 17 | GPT-5.5 (xhigh) (partial coverage) | OpenAI | 70.9 | 2 of 6 | $5.00 / $30.00 | — | 85.3% | 72.5% | — | — | — |
| 18 | GPT-5.2 (high) | OpenAI | 70.6 | 4 of 6 | $1.75 / $14.00 | 60.0% | — | 18.8% | 96.1% | — | 1458 |
| 19 | Qwen3.7 Max | Qwen | 69.9 | 4 of 6 | $1.475 / $4.425 | — | 64.6% | 34.1% | 95.6% | — | 1489 |
| 20 | Claude Opus 4.6 (64K) | Anthropic | 69.6 | 3 of 6 | $5.00 / $25.00 | 90.0% | — | 20.8% | 94.4% | — | — |
| 21 | Gemini 3.7 Flash (high) | Google | 69.2 | 3 of 6 | $0.375 / $1.875 | — | 71.6% | 36.6% | 97.2% | — | — |
| 22 | GPT-5.2 (xhigh) | OpenAI | 68.8 | 4 of 6 | $1.75 / $14.00 | 40.7% | 67.4% | 31.7% | 96.1% | — | — |
| 23 | Claude Opus 4.6 (max) | Anthropic | 68.7 | 4 of 6 | $5.00 / $25.00 | 90.0% | 66.0% | 26.8% | 91.1% | — | — |
| 24 | GPT 5.5 Pro Pre Release (high) (partial coverage) | OpenAI | 68.4 | 2 of 6 | — | 52.4% | — | 39.6% | — | — | — |
| 25 | Grok 4.6 (xhigh) | SpaceXAI | 68.1 | 3 of 6 | $2.00 / $6.00 | — | 66.0% | 31.7% | 99.2% | — | — |
| 26 | Claude Opus 4.6 (32K) | Anthropic | 67.9 | 3 of 6 | $5.00 / $25.00 | 80.0% | — | 20.8% | 93.1% | — | — |
| 27 | Kimi K2.6 | MoonshotAI | 67.2 | 5 of 6 | $0.5415 / $2.28 | 39.0% | 57.2% | 25.6% | 96.1% | — | 1478 |
| 28 | DeepSeek V4 Pro (high) (partial coverage) | DeepSeek | 67.0 | 2 of 6 | $1.168 / $2.336 | — | — | — | 95.6% | — | 1469 |
| 29 | Gemini 3.6 Flash (high) | Google | 66.6 | 4 of 6 | $0.75 / $3.75 | — | 59.0% | 21.9% | 94.2% | — | 1513 |
| 30 | GPT-5.2 (medium) | OpenAI | 66.3 | 3 of 6 | $1.75 / $14.00 | 60.0% | — | 16.7% | 93.9% | — | — |
| 31 | GLM 5.1 | Z.ai | 66.2 | 4 of 6 | $0.966 / $3.036 | 33.5% | — | 12.5% | 93.3% | — | 1481 |
| 32 | Claude Fable 5 (partial coverage) | Anthropic | 65.9 | 1 of 6 | $10.00 / $50.00 | — | — | — | — | — | 1527 |
| 33 | Qwen3.7 Plus (partial coverage) | Qwen | 65.9 | 2 of 6 | $0.32 / $1.28 | — | — | — | 93.3% | — | 1471 |
| 34 | Claude Fable 5 (high) (partial coverage) | Anthropic | 65.8 | 1 of 6 | $10.00 / $50.00 | — | — | — | 100.0% | — | — |
| 35 | Claude Opus 5 (high) (partial coverage) | Anthropic | 65.8 | 1 of 6 | $5.00 / $25.00 | — | — | — | — | — | 1525 |
| 36 | GPT-5.2 Pro (xhigh) (partial coverage) | OpenAI | 65.7 | 2 of 6 | $21.00 / $168.00 | — | 74.0% | 46.0% | — | — | — |
| 37 | Claude Opus 4.6 (high) (partial coverage) | Anthropic | 65.6 | 1 of 6 | $5.00 / $25.00 | — | — | — | — | — | 1516 |
| 38 | Qwen3.8 Max (partial coverage) | Qwen | 65.5 | 1 of 6 | $2.00 / $6.00 | — | — | — | — | — | 1513 |
| 39 | GPT-5 (high) | OpenAI | 65.5 | 6 of 6 | $1.25 / $10.00 | 32.4% | 55.4% | 21.9% | 91.4% | 98.1% | 1435 |
| 40 | Claude Opus 4.6 | Anthropic | 65.3 | 3 of 6 | $5.00 / $25.00 | 38.3% | — | 14.6% | — | — | 1506 |
| 41 | Qwen3.6 Plus | Qwen | 65.2 | 4 of 6 | $0.325 / $1.95 | 50.0% | — | 8.3% | 93.3% | — | 1454 |
| 42 | Claude Opus 4.7 (high) (partial coverage) | Anthropic | 64.9 | 1 of 6 | $5.00 / $25.00 | — | — | — | — | — | 1503 |
| 43 | GPT-5.5 (partial coverage) | OpenAI | 64.8 | 1 of 6 | $5.00 / $30.00 | — | — | — | — | — | 1499 |
| 44 | Gemini 3 Flash Preview | Google | 64.6 | 5 of 6 | $0.50 / $3.00 | 60.0% | 51.2% | 17.1% | 92.8% | — | 1476 |
| 45 | Muse Spark | Meta | 64.4 | 4 of 6 | — | 39.0% | — | 14.6% | 88.9% | — | 1461 |
| 46 | Claude Opus 4.8 (high) (partial coverage) | Anthropic | 64.4 | 1 of 6 | $5.00 / $25.00 | — | — | — | — | — | 1493 |
| 47 | GPT-5.5 (high) (partial coverage) | OpenAI | 64.2 | 1 of 6 | $5.00 / $30.00 | — | — | — | — | — | 1491 |
| 48 | Claude Opus 4.7 (partial coverage) | Anthropic | 64.1 | 1 of 6 | $5.00 / $25.00 | — | — | — | — | — | 1491 |
| 49 | Qwen3.6 Max Preview | Qwen | 64.1 | 4 of 6 | $1.027 / $6.162 | 50.0% | — | 4.2% | 91.1% | — | 1474 |
| 50 | Claude Fable 5 (low) (partial coverage) | Anthropic | 63.8 | 1 of 6 | $10.00 / $50.00 | — | — | — | 97.8% | — | — |
| 51 | Claude Opus 4.8 (low) (partial coverage) | Anthropic | 63.8 | 1 of 6 | $5.00 / $25.00 | — | — | — | 97.8% | — | — |
| 52 | Claude Opus 5 (partial coverage) | Anthropic | 63.8 | 1 of 6 | $5.00 / $25.00 | — | — | — | 97.8% | — | — |
| 53 | Grok 4.6 (high) (partial coverage) | SpaceXAI | 63.8 | 1 of 6 | $2.00 / $6.00 | — | — | — | 97.8% | — | — |
| 54 | Muse Spark 1.1 (partial coverage) | Meta | 63.6 | 1 of 6 | $1.25 / $4.25 | — | — | — | — | — | 1488 |
| 55 | GPT-5 (medium) | OpenAI | 63.6 | 4 of 6 | $1.25 / $10.00 | 27.2% | — | 6.3% | 87.2% | 97.9% | — |
| 56 | GLM 5.2 (max) | Z.ai | 63.6 | 4 of 6 | $0.462 / $1.452 | — | 59.2% | 29.3% | 86.4% | — | 1474 |
| 57 | GPT-5.6 Luna (xhigh) (partial coverage) | OpenAI | 63.5 | 1 of 6 | $0.10 / $0.60 | — | — | — | — | — | 1484 |
| 58 | GPT-5.6 Terra (xhigh) (partial coverage) | OpenAI | 63.4 | 1 of 6 | $1.00 / $6.00 | — | — | — | — | — | 1483 |
| 59 | Claude Opus 4.7 (max) | Anthropic | 63.3 | 3 of 6 | $5.00 / $25.00 | — | 70.2% | 31.7% | 86.7% | — | — |
| 60 | Hy3 (partial coverage) | Tencent | 63.2 | 1 of 6 | $0.132 / $0.528 | — | — | — | — | — | 1481 |
| 61 | Inkling (partial coverage) | Thinking Machines | 62.9 | 1 of 6 | $0.95 / $4.05 | — | — | — | — | — | 1480 |
| 62 | Grok 4.5 (partial coverage) | SpaceXAI | 62.8 | 1 of 6 | $2.00 / $6.00 | — | — | — | — | — | 1479 |
| 63 | Gemini 3 Pro (partial coverage) | Google | 62.6 | 1 of 6 | — | — | — | — | — | — | 1479 |
| 64 | GPT-5.6 Sol (xhigh) (partial coverage) | OpenAI | 62.5 | 1 of 6 | $5.00 / $30.00 | — | — | — | — | — | 1478 |
| 65 | Gemini 3 Pro Preview | Google | 62.4 | 3 of 6 | — | 37.6% | — | 18.8% | 91.4% | — | — |
| 66 | GPT-5.1 (high) | OpenAI | 62.3 | 4 of 6 | $1.25 / $10.00 | 31.0% | — | 12.5% | 88.6% | — | 1456 |
| 67 | Gemini 3.5 Flash (medium) (partial coverage) | Google | 62.2 | 1 of 6 | $1.50 / $9.00 | — | — | — | — | — | 1478 |
| 68 | MiMo-V2.5-Pro (partial coverage) | Xiaomi | 62.1 | 1 of 6 | $0.435 / $0.87 | — | — | — | — | — | 1477 |
| 69 | Ernie 5.1 (partial coverage) | Baidu | 61.9 | 1 of 6 | — | — | — | — | — | — | 1476 |
| 70 | Grok 4.5 (high) | SpaceXAI | 61.8 | 3 of 6 | $2.00 / $6.00 | — | 57.2% | 24.4% | 97.8% | — | — |
| 71 | Gemini 3 Flash Preview (high) (partial coverage) | Google | 61.6 | 1 of 6 | $0.50 / $3.00 | — | — | — | 95.6% | — | — |
| 72 | Gemini 3.1 Pro Preview (high) (partial coverage) | Google | 61.6 | 1 of 6 | $2.00 / $12.00 | — | — | — | 95.6% | — | — |
| 73 | GPT-5.4 (medium) (partial coverage) | OpenAI | 61.6 | 1 of 6 | $2.50 / $15.00 | — | — | — | 95.6% | — | — |
| 74 | GPT-5.6 Sol (low) (partial coverage) | OpenAI | 61.6 | 1 of 6 | $5.00 / $30.00 | — | — | — | 95.6% | — | — |
| 75 | Qwen3.5 397B A17B (partial coverage) | Qwen | 61.4 | 2 of 6 | $0.39 / $2.34 | — | — | — | 88.9% | — | 1449 |
| 76 | Claude Opus 4.8 (partial coverage) | Anthropic | 61.4 | 1 of 6 | $5.00 / $25.00 | — | — | — | — | — | 1472 |
| 77 | Gemma 4 31B (partial coverage) | Google | 61.2 | 1 of 6 | $0.10 / $0.34 | — | — | — | — | — | 1472 |
| 78 | Qwen3.5 Max Preview (partial coverage) | Qwen | 60.9 | 1 of 6 | — | — | — | — | — | — | 1470 |
| 79 | Gemini 2.5 Pro Preview 05-06 (partial coverage) | Google | 60.9 | 1 of 6 | $1.25 / $10.00 | — | — | — | — | 95.9% | — |
| 80 | Kimi K2.5 (thinking) (partial coverage) | MoonshotAI | 60.8 | 1 of 6 | $0.57 / $2.85 | — | — | — | — | — | 1470 |
| 81 | Claude Sonnet 5 (xhigh) (partial coverage) | Anthropic | 60.7 | 1 of 6 | $2.00 / $10.00 | — | — | — | 94.7% | — | — |
| 82 | Claude Opus 4.5 (high 32K) (partial coverage) | Anthropic | 60.7 | 1 of 6 | $5.00 / $25.00 | — | — | — | — | — | 1469 |
| 83 | DeepSeek V4 Flash 0731 (max) | DeepSeek | 60.4 | 3 of 6 | $0.14 / $0.28 | — | 57.5% | 24.4% | 94.4% | — | — |
| 84 | Claude Sonnet 5 (high) (partial coverage) | Anthropic | 60.4 | 1 of 6 | $2.00 / $10.00 | — | — | — | — | — | 1468 |
| 85 | Gemma 4 26B A4B  (partial coverage) | Google | 60.2 | 1 of 6 | $0.12 / $0.40 | — | — | — | — | — | 1468 |
| 86 | Qwen3 Max | Qwen | 60.1 | 3 of 6 | $0.78 / $3.90 | — | — | — | 73.3% | 97.1% | 1426 |
| 87 | Grok 4.20 Beta 0309 (reasoning) (partial coverage) | xAI | 60.1 | 1 of 6 | — | — | — | — | — | — | 1467 |
| 88 | Claude Sonnet 4.6 (partial coverage) | Anthropic | 59.8 | 1 of 6 | $3.00 / $15.00 | — | — | — | — | — | 1463 |
| 89 | GPT-5 Pro (high) | OpenAI | 59.6 | 3 of 6 | $15.00 / $120.00 | 60.0% | 55.8% | 19.5% | — | — | — |
| 90 | Claude Opus 5 (low) (partial coverage) | Anthropic | 59.5 | 1 of 6 | $5.00 / $25.00 | — | — | — | 93.3% | — | — |
| 91 | Kimi K3 (high) (partial coverage) | MoonshotAI | 59.5 | 1 of 6 | $3.00 / $15.00 | — | — | — | 93.3% | — | — |
| 92 | GPT-5.4 (partial coverage) | OpenAI | 59.4 | 1 of 6 | $2.50 / $15.00 | — | — | — | — | — | 1460 |
| 93 | Claude Sonnet 4.5 (high 32K) (partial coverage) | Anthropic | 58.9 | 1 of 6 | $3.00 / $15.00 | — | — | — | — | — | 1455 |
| 94 | Gemini 3 Flash Preview (thinking minimal) (partial coverage) | Google | 58.6 | 1 of 6 | $0.50 / $3.00 | — | — | — | — | — | 1453 |
| 95 | Claude Sonnet 5 (max) | Anthropic | 58.6 | 3 of 6 | $2.00 / $10.00 | — | 65.6% | 29.3% | 80.0% | — | — |
| 96 | Muse Glimmer 30B (partial coverage) | Meta | 58.4 | 1 of 6 | $0.35 / $1.50 | — | — | — | — | — | 1453 |
| 97 | Grok 4.20 Multi Agent Beta 0309 (partial coverage) | xAI | 58.4 | 1 of 6 | — | — | — | — | — | — | 1453 |
| 98 | Mimo v2 Pro (partial coverage) | Xiaomi | 58.2 | 1 of 6 | — | — | — | — | — | — | 1452 |
| 99 | GPT-5.2 Chat (partial coverage) | OpenAI | 58.1 | 1 of 6 | $1.75 / $14.00 | — | — | — | — | — | 1452 |
| 100 | Dola Seed 2.0 Pro (partial coverage) | ByteDance | 57.9 | 1 of 6 | — | — | — | — | — | — | 1451 |
| 101 | GPT-5 Mini (high) | OpenAI | 57.9 | 6 of 6 | $0.25 / $2.00 | 27.2% | 46.7% | 12.2% | 86.7% | 97.8% | 1405 |
| 102 | Qwen3.6 27B (partial coverage) | Qwen | 57.9 | 1 of 6 | $0.60 / $3.60 | — | — | — | 91.1% | — | — |
| 103 | o3 (partial coverage) | OpenAI | 57.6 | 1 of 6 | $2.00 / $8.00 | — | — | — | — | — | 1447 |
| 104 | Kimi K2p5 | Moonshot AI | 57.6 | 3 of 6 | — | 27.9% | — | 4.2% | 92.2% | — | — |
| 105 | GPT-5.4 Mini (high) | OpenAI | 57.6 | 4 of 6 | $0.75 / $4.50 | 50.0% | — | 2.1% | 87.2% | — | 1439 |
| 106 | DeepSeek V4 Pro (partial coverage) | DeepSeek | 57.5 | 1 of 6 | $1.168 / $2.336 | — | — | — | — | — | 1445 |
| 107 | Claude Opus 4.1 (thinking 16K) (partial coverage) | Anthropic | 57.4 | 1 of 6 | $15.00 / $75.00 | — | — | — | — | — | 1444 |
| 108 | GLM 5V Turbo (partial coverage) | Z.ai | 57.2 | 1 of 6 | $1.20 / $4.00 | — | — | — | — | — | 1443 |
| 109 | Grok 4.1 (thinking) (partial coverage) | xAI | 56.9 | 1 of 6 | — | — | — | — | — | — | 1442 |
| 110 | Gemini 3.5 Flash (low) (partial coverage) | Google | 56.8 | 1 of 6 | $1.50 / $9.00 | — | — | — | 88.9% | — | — |
| 111 | GPT-5.6 Terra (low) (partial coverage) | OpenAI | 56.8 | 1 of 6 | $1.00 / $6.00 | — | — | — | 88.9% | — | — |
| 112 | gpt-oss-120b (high) (partial coverage) | OpenAI | 56.8 | 1 of 6 | $0.03 / $0.17 | — | — | — | 88.9% | — | — |
| 113 | Nemotron 3 Ultra (partial coverage) | NVIDIA | 56.8 | 1 of 6 | $0.60 / $3.60 | — | — | — | — | — | 1442 |
| 114 | GPT-5 Mini (medium) | OpenAI | 56.8 | 4 of 6 | $0.25 / $2.00 | 20.3% | — | 4.2% | 78.3% | 96.8% | — |
| 115 | MiMo-V2.5 (partial coverage) | Xiaomi | 56.6 | 1 of 6 | $0.14 / $0.28 | — | — | — | — | — | 1441 |
| 116 | Kimi K2 Thinking Turbo | Moonshot AI | 56.5 | 3 of 6 | — | 20.0% | — | — | 83.1% | — | 1436 |
| 117 | DeepSeek V4 Flash 0423 (high) (partial coverage) | DeepSeek | 56.4 | 1 of 6 | $0.0643 / $0.1285 | — | — | — | — | — | 1441 |
| 118 | Claude Opus 4.7 (xhigh) | Anthropic | 56.3 | 3 of 6 | $5.00 / $25.00 | 43.8% | — | 0.0% | 97.8% | — | — |
| 119 | Kimi K2.5 Instant (partial coverage) | Moonshot AI | 56.1 | 1 of 6 | — | — | — | — | — | — | 1440 |
| 120 | Ernie 5.0 0110 (partial coverage) | Baidu | 55.8 | 1 of 6 | — | — | — | — | — | — | 1437 |
| 121 | o1 (medium) (partial coverage) | OpenAI | 55.7 | 2 of 6 | $15.00 / $60.00 | — | — | — | 73.3% | 94.4% | — |
| 122 | Gemini 3.1 Flash Lite Preview (partial coverage) | Google | 55.6 | 1 of 6 | $0.25 / $1.50 | — | — | — | — | — | 1437 |
| 123 | GPT-5.2 (low) | OpenAI | 55.5 | 3 of 6 | $1.75 / $14.00 | 40.0% | — | 6.3% | 78.9% | — | — |
| 124 | Kimi K2.7 Code | MoonshotAI | 55.3 | 3 of 6 | $0.71 / $3.50 | — | 54.0% | 12.2% | 95.6% | — | — |
| 125 | Qwen3.6 35B A3B (partial coverage) | Qwen | 55.3 | 1 of 6 | $0.15 / $1.00 | — | — | — | 86.7% | — | — |
| 126 | Qwen3.7 Flash (partial coverage) | Qwen | 55.3 | 1 of 6 | $0.03 / $0.13 | — | — | — | 86.7% | — | — |
| 127 | Mimo v2 Omni (partial coverage) | Xiaomi | 55.2 | 1 of 6 | — | — | — | — | — | — | 1435 |
| 128 | GPT-5.2 (partial coverage) | OpenAI | 54.9 | 1 of 6 | $1.75 / $14.00 | — | — | — | — | — | 1432 |
| 129 | o3 (high) | OpenAI | 54.9 | 4 of 6 | $2.00 / $8.00 | 18.7% | — | 2.1% | 83.9% | 97.8% | — |
| 130 | Qwen3.5 Plus | Qwen | 54.8 | 3 of 6 | $0.30 / $1.80 | 50.0% | — | 2.1% | 86.7% | — | — |
| 131 | Mistral Medium 3.5 (partial coverage) | Mistral | 54.8 | 1 of 6 | $1.50 / $7.50 | — | — | — | — | — | 1429 |
| 132 | DeepSeek V3.2 Exp (thinking) (partial coverage) | DeepSeek | 54.6 | 1 of 6 | $0.27 / $0.41 | — | — | — | — | — | 1429 |
| 133 | Claude Sonnet 4.6 (32K) (partial coverage) | Anthropic | 54.4 | 1 of 6 | $3.00 / $15.00 | — | — | — | 85.8% | — | — |
| 134 | o4 Mini High | OpenAI | 54.4 | 5 of 6 | $1.10 / $4.40 | 24.8% | 36.1% | 4.9% | 81.7% | 97.8% | — |
| 135 | Grok 4.1 (partial coverage) | xAI | 54.4 | 1 of 6 | — | — | — | — | — | — | 1428 |
| 136 | Qwen3.5-27B (partial coverage) | Qwen | 54.2 | 1 of 6 | $0.195 / $1.56 | — | — | — | — | — | 1428 |
| 137 | GPT-5.1 (medium) | OpenAI | 53.7 | 3 of 6 | $1.25 / $10.00 | 26.9% | — | 4.2% | 85.6% | — | — |
| 138 | MiniMax M3 (partial coverage) | MiniMax | 53.6 | 2 of 6 | $0.30 / $1.20 | — | — | — | 71.1% | — | 1440 |
| 139 | GPT-5.3 Chat (partial coverage) | OpenAI | 53.6 | 1 of 6 | — | — | — | — | — | — | 1427 |
| 140 | Claude Opus 4.8 (none) (partial coverage) | Anthropic | 53.5 | 1 of 6 | $5.00 / $25.00 | — | — | — | 84.4% | — | — |
| 141 | GPT-5.4 (low) (partial coverage) | OpenAI | 53.5 | 1 of 6 | $2.50 / $15.00 | — | — | — | 84.4% | — | — |
| 142 | GPT-5.5 (low) (partial coverage) | OpenAI | 53.5 | 1 of 6 | $5.00 / $30.00 | — | — | — | 84.4% | — | — |
| 143 | DeepSeek V4 Flash 0423 (partial coverage) | DeepSeek | 53.3 | 1 of 6 | $0.0643 / $0.1285 | — | — | — | — | — | 1425 |
| 144 | Hunyuan Hy3 Preview (partial coverage) | Tencent | 53.2 | 1 of 6 | — | — | — | — | — | — | 1425 |
| 145 | DeepSeek V3.2 (thinking) (partial coverage) | DeepSeek | 53.1 | 1 of 6 | $0.269 / $0.40 | — | — | — | — | — | 1424 |
| 146 | Inkling Small (xhigh) | Thinking Machines | 53.0 | 3 of 6 | $0.45 / $1.20 | — | 46.3% | 17.1% | 90.0% | — | — |
| 147 | GPT-5.4 Nano (high) | OpenAI | 52.9 | 5 of 6 | $0.20 / $1.25 | 25.9% | 44.9% | 12.2% | 87.8% | — | 1423 |
| 148 | Gemini 3.5 Flash Lite (partial coverage) | Google | 52.9 | 1 of 6 | $0.30 / $2.50 | — | — | — | — | — | 1423 |
| 149 | o3 (medium) (partial coverage) | OpenAI | 52.6 | 2 of 6 | $2.00 / $8.00 | 16.9% | — | — | 84.4% | — | — |
| 150 | Qwen3.5-122B-A10B (partial coverage) | Qwen | 52.6 | 1 of 6 | $0.29 / $2.40 | — | — | — | — | — | 1423 |
| 151 | Grok 4.20 0309 (reasoning) | xAI | 52.6 | 3 of 6 | — | — | 44.9% | 17.1% | 92.2% | — | — |
| 152 | GPT-5.1 (partial coverage) | OpenAI | 52.5 | 1 of 6 | $1.25 / $10.00 | — | — | — | — | — | 1423 |
| 153 | o1 (high) | OpenAI | 52.4 | 3 of 6 | $15.00 / $60.00 | 9.3% | — | — | 73.3% | 94.7% | — |
| 154 | MiniMax M2.7 (partial coverage) | MiniMax | 52.3 | 1 of 6 | $0.30 / $1.20 | — | — | — | — | — | 1423 |
| 155 | Claude Sonnet 4.6 (medium) (partial coverage) | Anthropic | 52.3 | 1 of 6 | $3.00 / $15.00 | — | — | — | 82.2% | — | — |
| 156 | Gemini 3.6 Flash (low) (partial coverage) | Google | 52.3 | 1 of 6 | $0.75 / $3.75 | — | — | — | 82.2% | — | — |
| 157 | Qwen3.5 397B A17B (none) (partial coverage) | Qwen | 52.3 | 1 of 6 | $0.39 / $2.34 | — | — | — | 82.2% | — | — |
| 158 | Claude Opus 4 (thinking 16K) (partial coverage) | Anthropic | 52.2 | 1 of 6 | $15.00 / $75.00 | — | — | — | — | — | 1421 |
| 159 | o3 Mini (medium) | OpenAI | 52.1 | 3 of 6 | $1.10 / $4.40 | 11.3% | — | — | 63.9% | 95.2% | — |
| 160 | Grok 4.3 (partial coverage) | SpaceXAI | 51.9 | 1 of 6 | $1.25 / $2.50 | — | — | — | — | — | 1419 |
| 161 | Grok 4.3 (high) | SpaceXAI | 51.8 | 3 of 6 | $1.25 / $2.50 | — | 42.8% | 14.6% | 93.3% | — | — |
| 162 | Qwen3 235B A22B Instruct 2507 (partial coverage) | Qwen | 51.8 | 1 of 6 | $0.09 / $0.55 | — | — | — | — | — | 1418 |
| 163 | Grok 4.1 Fast (reasoning) (partial coverage) | xAI | 51.6 | 1 of 6 | — | — | — | — | — | — | 1418 |
| 164 | Kimi K2 0905 (partial coverage) | MoonshotAI | 51.5 | 1 of 6 | $0.60 / $2.50 | — | — | — | — | — | 1417 |
| 165 | GPT-5.4 Mini (xhigh) | OpenAI | 51.4 | 3 of 6 | $0.75 / $4.50 | — | 51.2% | 9.8% | 88.9% | — | — |
| 166 | Claude Opus 4.5 (16K) | Anthropic | 51.4 | 3 of 6 | $5.00 / $25.00 | 40.0% | — | 2.1% | 81.7% | — | — |
| 167 | Claude Opus 4.5 | Anthropic | 51.4 | 4 of 6 | $5.00 / $25.00 | 20.7% | — | 4.2% | 48.1% | — | 1465 |
| 168 | Qwen3 Next 80B A3B Instruct (partial coverage) | Qwen | 51.3 | 1 of 6 | $0.10 / $1.10 | — | — | — | — | — | 1417 |
| 169 | DeepSeek V3.2 Exp (partial coverage) | DeepSeek | 51.2 | 1 of 6 | $0.27 / $0.41 | — | — | — | — | — | 1416 |
| 170 | DeepSeek V3.2 | DeepSeek | 51.2 | 3 of 6 | $0.269 / $0.40 | 22.1% | — | 2.1% | — | — | 1429 |
| 171 | Gemini 3.1 Flash Lite (high) (partial coverage) | Google | 51.1 | 1 of 6 | $0.25 / $1.50 | — | — | — | 80.0% | — | — |
| 172 | Gemini 3.5 Flash (minimal) (partial coverage) | Google | 51.1 | 1 of 6 | $1.50 / $9.00 | — | — | — | 80.0% | — | — |
| 173 | Gemini 3.6 Flash (minimal) (partial coverage) | Google | 51.1 | 1 of 6 | $0.75 / $3.75 | — | — | — | 80.0% | — | — |
| 174 | Qwen3.7 Plus (none) (partial coverage) | Qwen | 51.1 | 1 of 6 | $0.32 / $1.28 | — | — | — | 80.0% | — | — |
| 175 | R1 | DeepSeek | 51.1 | 3 of 6 | $0.70 / $2.50 | — | — | — | 53.3% | 93.0% | 1412 |
| 176 | o4 Mini (partial coverage) | OpenAI | 51.1 | 1 of 6 | $1.10 / $4.40 | — | — | — | — | — | 1415 |
| 177 | GLM 5 | Z.ai | 50.9 | 4 of 6 | $0.60 / $1.92 | 16.4% | — | 2.1% | 80.0% | — | 1443 |
| 178 | LongCat Flash Chat (partial coverage) | Meituan | 50.9 | 1 of 6 | — | — | — | — | — | — | 1415 |
| 179 | DeepSeek V3.1 (thinking) (partial coverage) | DeepSeek | 50.8 | 1 of 6 | $0.25 / $0.95 | — | — | — | — | — | 1414 |
| 180 | DeepSeek V3.1 (partial coverage) | DeepSeek | 50.6 | 1 of 6 | $0.25 / $0.95 | — | — | — | — | — | 1413 |
| 181 | Claude Sonnet 4.6 (16K) (partial coverage) | Anthropic | 50.6 | 2 of 6 | $3.00 / $15.00 | 80.0% | — | 0.0% | — | — | — |
| 182 | GPT 5 Chat (partial coverage) | OpenAI | 50.3 | 1 of 6 | — | — | — | — | — | — | 1413 |
| 183 | DeepSeek V4 Pro (max) | DeepSeek | 50.2 | 3 of 6 | $1.168 / $2.336 | — | 45.3% | 2.4% | 96.7% | — | — |
| 184 | Grok 4 Fast (reasoning) (partial coverage) | xAI | 50.1 | 1 of 6 | — | — | — | — | — | — | 1410 |
| 185 | Qwen3.7 Flash (none) (partial coverage) | Qwen | 50.0 | 1 of 6 | $0.03 / $0.13 | — | — | — | 77.8% | — | — |
| 186 | Ernie 5.0 Preview 1203 (partial coverage) | Baidu | 49.9 | 1 of 6 | — | — | — | — | — | — | 1409 |
| 187 | Qwen3 VL 235B A22B Instruct (partial coverage) | Qwen | 49.6 | 1 of 6 | $0.26 / $1.04 | — | — | — | — | — | 1408 |
| 188 | Claude Sonnet 4.6 (high) (partial coverage) | Anthropic | 49.5 | 1 of 6 | $3.00 / $15.00 | — | — | — | 75.6% | — | — |
| 189 | Step 3.5 Flash (partial coverage) | StepFun | 49.4 | 1 of 6 | $0.10 / $0.30 | — | — | — | — | — | 1406 |
| 190 | GPT-5 Nano (medium) | OpenAI | 49.3 | 4 of 6 | $0.05 / $0.40 | 10.0% | — | 2.1% | 74.2% | 95.2% | — |
| 191 | Claude Sonnet 4.5 (59K) (partial coverage) | Anthropic | 49.1 | 2 of 6 | $3.00 / $15.00 | 13.5% | — | — | 77.8% | — | — |
| 192 | Gemma 4 31B (minimal) (partial coverage) | Google | 48.9 | 1 of 6 | $0.10 / $0.34 | — | — | — | 73.3% | — | — |
| 193 | Mistral Large 3 (partial coverage) | Mistral AI | 48.8 | 1 of 6 | — | — | — | — | — | — | 1404 |
| 194 | Chatgpt 4o (partial coverage) | OpenAI | 48.6 | 1 of 6 | — | — | — | — | — | — | 1404 |
| 195 | Qwen3 VL 235B A22B Thinking (partial coverage) | Qwen | 48.5 | 1 of 6 | $0.40 / $4.00 | — | — | — | — | — | 1404 |
| 196 | Claude Sonnet 4 (32K) (partial coverage) | Anthropic | 48.1 | 1 of 6 | $3.00 / $15.00 | — | — | — | 71.1% | — | — |
| 197 | Claude Sonnet 4.5 (16K) (partial coverage) | Anthropic | 48.1 | 1 of 6 | $3.00 / $15.00 | — | — | — | 71.1% | — | — |
| 198 | Claude Sonnet 4.6 (max) (partial coverage) | Anthropic | 48.1 | 1 of 6 | $3.00 / $15.00 | — | — | — | 71.1% | — | — |
| 199 | Claude Sonnet 4 (thinking 32K) (partial coverage) | Anthropic | 48.1 | 1 of 6 | $3.00 / $15.00 | — | — | — | — | — | 1403 |
| 200 | Grok 4 0709 | xAI | 48.0 | 3 of 6 | — | 19.7% | — | 2.1% | — | — | 1427 |
| 201 | Hunyuan T1 (partial coverage) | Tencent | 47.9 | 1 of 6 | — | — | — | — | — | — | 1401 |
| 202 | Claude Opus 4.5 (32K) | Anthropic | 47.9 | 4 of 6 | $5.00 / $25.00 | 20.7% | 34.4% | 4.9% | 86.1% | — | — |
| 203 | Gemini 2.5 Pro Preview 06-05 (partial coverage) | Google | 47.9 | 2 of 6 | $1.25 / $10.00 | 30.0% | — | 2.1% | — | — | — |
| 204 | Qwen3.5-35B-A3B (partial coverage) | Qwen | 47.8 | 1 of 6 | $0.225 / $1.80 | — | — | — | — | — | 1400 |
| 205 | Gemini 2.5 Pro | Google | 47.7 | 6 of 6 | $1.25 / $10.00 | 14.1% | 24.6% | 0.0% | 84.7% | 95.6% | 1441 |
| 206 | Qwen3 32B (partial coverage) | Qwen | 47.6 | 1 of 6 | $0.08 / $0.28 | — | — | — | — | — | 1399 |
| 207 | Claude Sonnet 4.5 (32K) | Anthropic | 47.5 | 5 of 6 | $3.00 / $15.00 | 15.2% | 23.9% | 2.4% | 77.8% | 97.7% | — |
| 208 | Claude Haiku 4.5 (32K) | Anthropic | 47.4 | 4 of 6 | $1.00 / $5.00 | 5.9% | — | 2.1% | 66.7% | 96.4% | — |
| 209 | Mistral Medium 2508 (partial coverage) | Mistral AI | 47.3 | 1 of 6 | — | — | — | — | — | — | 1398 |
| 210 | Ernie 5.0 Preview 1022 (partial coverage) | Baidu | 47.1 | 1 of 6 | — | — | — | — | — | — | 1396 |
| 211 | Kimi K3 (low) (partial coverage) | MoonshotAI | 47.0 | 1 of 6 | $3.00 / $15.00 | — | — | — | 68.9% | — | — |
| 212 | GPT-5.4 Nano (low) (partial coverage) | OpenAI | 47.0 | 1 of 6 | $0.20 / $1.25 | — | — | — | 68.9% | — | — |
| 213 | GPT-5.6 Sol (none) (partial coverage) | OpenAI | 47.0 | 1 of 6 | $5.00 / $30.00 | — | — | — | 68.9% | — | — |
| 214 | Qwen3.6 35B A3B (none) (partial coverage) | Qwen | 47.0 | 1 of 6 | $0.15 / $1.00 | — | — | — | 68.9% | — | — |
| 215 | MiniMax M2.5 (partial coverage) | MiniMax | 46.9 | 1 of 6 | $0.22 / $0.90 | — | — | — | — | — | 1396 |
| 216 | GPT-5.1 (low) (partial coverage) | OpenAI | 46.7 | 2 of 6 | $1.25 / $10.00 | 17.3% | — | — | 63.9% | — | — |
| 217 | DeepSeek V3.1 Terminus (partial coverage) | DeepSeek | 46.6 | 1 of 6 | $0.27 / $0.95 | — | — | — | — | — | 1394 |
| 218 | Qwen3 235B A22B (nothinking) (partial coverage) | Qwen | 46.5 | 1 of 6 | $0.455 / $1.82 | — | — | — | — | — | 1393 |
| 219 | Inkling (xhigh) | Thinking Machines | 46.4 | 3 of 6 | $0.95 / $4.05 | — | 33.3% | 4.9% | 88.9% | — | — |
| 220 | R1 0528 | DeepSeek | 46.3 | 4 of 6 | $0.50 / $2.15 | — | — | 0.0% | 66.4% | 96.6% | 1395 |
| 221 | Qwen3 Next 80B A3B Thinking (partial coverage) | Qwen | 46.2 | 1 of 6 | $0.15 / $1.20 | — | — | — | — | — | 1391 |
| 222 | GPT-5.6 Luna (low) (partial coverage) | OpenAI | 46.2 | 1 of 6 | $0.10 / $0.60 | — | — | — | 66.7% | — | — |
| 223 | Qwen3.6 27B (none) (partial coverage) | Qwen | 46.2 | 1 of 6 | $0.60 / $3.60 | — | — | — | 66.7% | — | — |
| 224 | MiniMax M2.1 (partial coverage) | MiniMax | 46.1 | 1 of 6 | $0.30 / $1.20 | — | — | — | — | — | 1390 |
| 225 | GLM 4.5 Air (partial coverage) | Z.ai | 45.9 | 1 of 6 | $0.13 / $0.85 | — | — | — | — | — | 1390 |
| 226 | Qwen3 235B A22B Thinking 2507 | Qwen | 45.8 | 4 of 6 | $0.23 / $2.30 | 20.0% | — | 0.0% | 86.7% | — | 1397 |
| 227 | Grok 3 Mini Beta (low) | xAI | 45.7 | 3 of 6 | — | 2.8% | — | — | 62.2% | 90.9% | — |
| 228 | Kimi K2 0711 (partial coverage) | MoonshotAI | 45.6 | 1 of 6 | $0.57 / $2.30 | — | — | — | — | — | 1388 |
| 229 | Llama 3.3 Nemotron Super 49B v1.5 (partial coverage) | NVIDIA | 45.3 | 1 of 6 | — | — | — | — | — | — | 1386 |
| 230 | Qwen3.6 Flash | Qwen | 45.2 | 3 of 6 | $0.1875 / $1.125 | 20.0% | — | 0.0% | 84.4% | — | — |
| 231 | Claude 3.7 Sonnet (thinking 32K) (partial coverage) | Anthropic | 45.2 | 1 of 6 | — | — | — | — | — | — | 1385 |
| 232 | Trinity Large Thinking (partial coverage) | Arcee AI | 45.1 | 1 of 6 | $0.22 / $0.85 | — | — | — | — | — | 1384 |
| 233 | GPT-5.2 (none) (partial coverage) | OpenAI | 45.0 | 1 of 6 | $1.75 / $14.00 | — | — | — | 62.2% | — | — |
| 234 | INTELLECT-3 (partial coverage) | Prime Intellect | 44.9 | 1 of 6 | — | — | — | — | — | — | 1382 |
| 235 | o3 Mini (partial coverage) | OpenAI | 44.8 | 1 of 6 | $1.10 / $4.40 | — | — | — | — | — | 1382 |
| 236 | o4 Mini (medium) | OpenAI | 44.7 | 3 of 6 | $1.10 / $4.40 | 19.0% | — | 2.1% | 73.3% | — | — |
| 237 | Claude 3.7 Sonnet (32K) | Anthropic | 44.7 | 3 of 6 | — | 3.5% | — | — | 53.3% | 90.0% | — |
| 238 | gpt-oss-120b (partial coverage) | OpenAI | 44.6 | 1 of 6 | $0.03 / $0.17 | — | — | — | — | — | 1381 |
| 239 | GPT 5.5 Instant | OpenAI | 44.6 | 4 of 6 | — | — | 26.3% | 2.4% | 68.1% | — | 1462 |
| 240 | Claude Opus 4 (16K) (partial coverage) | Anthropic | 44.6 | 1 of 6 | $15.00 / $75.00 | — | — | — | 60.0% | — | — |
| 241 | Gemini 3.5 Flash Lite (low) (partial coverage) | Google | 44.6 | 1 of 6 | $0.30 / $2.50 | — | — | — | 60.0% | — | — |
| 242 | Llama 3.1 Nemotron Ultra 253B v1 (partial coverage) | NVIDIA | 44.5 | 1 of 6 | — | — | — | — | — | — | 1380 |
| 243 | Claude Opus 4.1 | Anthropic | 44.3 | 3 of 6 | $15.00 / $75.00 | 5.9% | — | — | 40.0% | — | 1434 |
| 244 | Qwen3 30B A3B Instruct 2507 (partial coverage) | Qwen | 44.3 | 1 of 6 | $0.0482 / $0.1931 | — | — | — | — | — | 1380 |
| 245 | Mimo v2 Flash (partial coverage) | Xiaomi | 44.2 | 1 of 6 | — | — | — | — | — | — | 1377 |
| 246 | Gemini 2.5 Flash | Google | 44.1 | 4 of 6 | $0.30 / $2.50 | 4.8% | — | 4.2% | 70.8% | — | 1406 |
| 247 | Nemotron 3 Super (partial coverage) | NVIDIA | 44.0 | 1 of 6 | $0.085 / $0.40 | — | — | — | — | — | 1376 |
| 248 | GPT-5.4 (none) (partial coverage) | OpenAI | 44.0 | 1 of 6 | $2.50 / $15.00 | — | — | — | 57.8% | — | — |
| 249 | GPT-5.5 (none) (partial coverage) | OpenAI | 44.0 | 1 of 6 | $5.00 / $30.00 | — | — | — | 57.8% | — | — |
| 250 | o1 | OpenAI | 43.9 | 3 of 6 | $15.00 / $60.00 | — | — | — | 31.1% | 81.7% | 1409 |
| 251 | GPT-5 Nano (high) | OpenAI | 43.9 | 6 of 6 | $0.05 / $0.40 | 20.0% | 20.0% | 2.4% | 81.1% | 94.9% | 1346 |
| 252 | Qwen3 Coder 480B A35b Instruct (partial coverage) | Qwen | 43.9 | 1 of 6 | — | — | — | — | — | — | 1376 |
| 253 | o4 Mini (low) (partial coverage) | OpenAI | 43.9 | 2 of 6 | $1.10 / $4.40 | 10.7% | — | — | 57.8% | — | — |
| 254 | GPT 4.5 Preview | OpenAI | 43.9 | 3 of 6 | — | — | — | — | 37.8% | 78.6% | 1408 |
| 255 | Mimo v2 Flash (thinking) (partial coverage) | Xiaomi | 43.8 | 1 of 6 | — | — | — | — | — | — | 1374 |
| 256 | Claude Opus 4.1 (27K) | Anthropic | 43.7 | 3 of 6 | $15.00 / $75.00 | 7.2% | — | 4.2% | 68.9% | — | — |
| 257 | GPT-5 Mini (minimal) (partial coverage) | OpenAI | 43.6 | 1 of 6 | $0.25 / $2.00 | — | — | — | 55.6% | — | — |
| 258 | o3 (low) (partial coverage) | OpenAI | 43.4 | 2 of 6 | $2.00 / $8.00 | 9.7% | — | — | 60.0% | — | — |
| 259 | MiniMax M1 (partial coverage) | MiniMax | 43.3 | 1 of 6 | $0.55 / $2.20 | — | — | — | — | — | 1371 |
| 260 | gpt-oss-20b (high) (partial coverage) | OpenAI | 43.3 | 1 of 6 | $0.03 / $0.13 | — | — | — | 53.9% | — | — |
| 261 | Grok 3 Mini Beta (partial coverage) | xAI | 43.0 | 1 of 6 | — | — | — | — | — | — | 1368 |
| 262 | Claude 3.7 Sonnet (16K) | Anthropic | 43.0 | 3 of 6 | — | 4.1% | — | — | 46.7% | 86.3% | — |
| 263 | Qwen3.5-Flash | Qwen | 43.0 | 4 of 6 | $0.065 / $0.26 | 10.0% | — | 0.0% | 84.4% | — | 1403 |
| 264 | GLM 4.7 Flash (partial coverage) | Z.ai | 42.9 | 1 of 6 | $0.06 / $0.40 | — | — | — | — | — | 1366 |
| 265 | GLM 4.6 | Z.ai | 42.9 | 3 of 6 | $0.55 / $2.20 | 3.8% | — | 2.1% | — | — | 1420 |
| 266 | Claude Sonnet 4 (16K) (partial coverage) | Anthropic | 42.9 | 1 of 6 | $3.00 / $15.00 | — | — | — | 53.3% | — | — |
| 267 | GPT-5.6 Terra (none) (partial coverage) | OpenAI | 42.9 | 1 of 6 | $1.00 / $6.00 | — | — | — | 53.3% | — | — |
| 268 | o1 (low) (partial coverage) | OpenAI | 42.9 | 1 of 6 | $15.00 / $60.00 | — | — | — | 53.3% | — | — |
| 269 | Gemini 2.5 Flash Lite (thinking) (partial coverage) | Google | 42.8 | 1 of 6 | $0.10 / $0.40 | — | — | — | — | — | 1365 |
| 270 | o3 Mini High | OpenAI | 42.8 | 6 of 6 | $1.10 / $4.40 | 12.4% | 18.6% | 0.0% | 76.9% | 96.5% | 1405 |
| 271 | Grok 3 Mini Beta (high) | xAI | 42.6 | 5 of 6 | — | 5.9% | — | 0.0% | 77.8% | 88.1% | 1387 |
| 272 | QwQ 32B (partial coverage) | Qwen | 42.6 | 1 of 6 | — | — | — | — | — | — | 1364 |
| 273 | Gemini 2.5 Flash Lite (nothinking) (partial coverage) | Google | 42.5 | 1 of 6 | $0.10 / $0.40 | — | — | — | — | — | 1364 |
| 274 | Gemini 3.5 Flash Lite (minimal) (partial coverage) | Google | 42.4 | 1 of 6 | $0.30 / $2.50 | — | — | — | 51.1% | — | — |
| 275 | GPT-4.1 Mini | OpenAI | 42.4 | 4 of 6 | $0.40 / $1.60 | 10.0% | — | — | 44.7% | 87.3% | 1354 |
| 276 | Qwen 2.5 (max) (partial coverage) | Qwen | 42.3 | 1 of 6 | — | — | — | — | — | — | 1363 |
| 277 | Claude Haiku 4.5 | Anthropic | 42.3 | 4 of 6 | $1.00 / $5.00 | 4.1% | — | — | 35.8% | 86.9% | 1398 |
| 278 | Kimi K2 Thinking (partial coverage) | MoonshotAI | 42.3 | 2 of 6 | $0.60 / $2.50 | 21.4% | — | 0.0% | — | — | — |
| 279 | O1 Mini (high) | OpenAI | 42.2 | 3 of 6 | — | 1.4% | — | — | 46.9% | 89.2% | — |
| 280 | GLM 4.7 | Z.ai | 42.1 | 4 of 6 | $0.40 / $1.75 | 2.4% | — | 0.0% | 83.3% | — | 1428 |
| 281 | Step 3 (partial coverage) | StepFun | 42.0 | 1 of 6 | — | — | — | — | — | — | 1362 |
| 282 | O1 Mini (partial coverage) | OpenAI | 41.9 | 1 of 6 | — | — | — | — | — | — | 1362 |
| 283 | Trinity Large Preview (partial coverage) | Arcee AI | 41.8 | 1 of 6 | — | — | — | — | — | — | 1362 |
| 284 | GLM 4.5V (partial coverage) | Z.ai | 41.6 | 1 of 6 | $0.60 / $1.80 | — | — | — | — | — | 1360 |
| 285 | DeepSeek V4 Pro (none) (partial coverage) | DeepSeek | 41.4 | 1 of 6 | $1.168 / $2.336 | — | — | — | 46.7% | — | — |
| 286 | GPT-5 Nano (low) (partial coverage) | OpenAI | 41.4 | 1 of 6 | $0.05 / $0.40 | — | — | — | 46.7% | — | — |
| 287 | GPT-5 (minimal) (partial coverage) | OpenAI | 41.4 | 1 of 6 | $1.25 / $10.00 | — | — | — | 46.7% | — | — |
| 288 | GPT-5.4 Nano (none) (partial coverage) | OpenAI | 41.4 | 1 of 6 | $0.20 / $1.25 | — | — | — | 46.7% | — | — |
| 289 | MiniMax M2 (partial coverage) | MiniMax | 41.3 | 1 of 6 | $0.255 / $1.02 | — | — | — | — | — | 1354 |
| 290 | Claude Opus 4 (27K) | Anthropic | 41.3 | 3 of 6 | $15.00 / $75.00 | 4.1% | — | 4.2% | 64.4% | — | — |
| 291 | Qwen3 30B A3B (partial coverage) | Qwen | 41.0 | 1 of 6 | $0.12 / $0.50 | — | — | — | — | — | 1352 |
| 292 | Ling Flash 2.0 (partial coverage) | inclusionAI | 40.9 | 1 of 6 | — | — | — | — | — | — | 1352 |
| 293 | Nemotron 3 Nano 30B A3B (partial coverage) | NVIDIA | 40.6 | 1 of 6 | $0.05 / $0.20 | — | — | — | — | — | 1351 |
| 294 | Gemini 3.1 Flash Lite (low) (partial coverage) | Google | 40.6 | 1 of 6 | $0.25 / $1.50 | — | — | — | 44.4% | — | — |
| 295 | o3 Mini (low) (partial coverage) | OpenAI | 40.6 | 1 of 6 | $1.10 / $4.40 | — | — | — | 44.4% | — | — |
| 296 | Claude Sonnet 4.5 | Anthropic | 40.3 | 4 of 6 | $3.00 / $15.00 | 9.3% | — | 2.1% | 35.6% | — | 1427 |
| 297 | Hunyuan TurboS (partial coverage) | Tencent | 40.3 | 1 of 6 | — | — | — | — | — | — | 1347 |
| 298 | GPT-5.6 Luna (none) (partial coverage) | OpenAI | 40.1 | 1 of 6 | $0.10 / $0.60 | — | — | — | 40.0% | — | — |
| 299 | Ring Flash 2.0 (partial coverage) | inclusionAI | 40.1 | 1 of 6 | — | — | — | — | — | — | 1340 |
| 300 | Mistral Small 2506 (partial coverage) | Mistral AI | 39.8 | 1 of 6 | — | — | — | — | — | — | 1338 |
| 301 | O1 Mini (medium) | OpenAI | 39.7 | 3 of 6 | — | 1.7% | — | — | 44.7% | 84.3% | — |
| 302 | Claude 3.7 Sonnet (64K) | Anthropic | 39.6 | 4 of 6 | — | 3.1% | — | 0.0% | 57.8% | 91.2% | — |
| 303 | gpt-oss-20b (partial coverage) | OpenAI | 39.6 | 1 of 6 | $0.03 / $0.13 | — | — | — | — | — | 1336 |
| 304 | Nova 2 Lite (partial coverage) | Amazon | 39.5 | 1 of 6 | $0.30 / $2.50 | — | — | — | — | — | 1333 |
| 305 | Gemini 3.1 Flash Lite (minimal) (partial coverage) | Google | 39.5 | 1 of 6 | $0.25 / $1.50 | — | — | — | 37.8% | — | — |
| 306 | Gemini 2.0 Flash Lite Preview 02 05 (partial coverage) | Google | 39.3 | 1 of 6 | — | — | — | — | — | — | 1326 |
| 307 | Granite 4.1 8B (partial coverage) | IBM | 39.0 | 1 of 6 | $0.05 / $0.10 | — | — | — | — | — | 1318 |
| 308 | Gemma 3 12B (partial coverage) | Google | 38.9 | 1 of 6 | $0.05 / $0.15 | — | — | — | — | — | 1318 |
| 309 | GPT-5 Nano (minimal) (partial coverage) | OpenAI | 38.8 | 1 of 6 | $0.05 / $0.40 | — | — | — | 35.6% | — | — |
| 310 | OLMo 3 32B Think (partial coverage) | Allen Institute for AI | 38.5 | 1 of 6 | — | — | — | — | — | — | 1311 |
| 311 | Claude Opus 4 | Anthropic | 38.4 | 5 of 6 | $15.00 / $75.00 | 4.5% | — | 0.0% | 42.2% | 85.0% | 1404 |
| 312 | Command A (03-2025) (partial coverage) | Cohere | 38.2 | 1 of 6 | — | — | — | — | — | — | 1309 |
| 313 | Grok 3 Beta | xAI | 37.9 | 5 of 6 | — | 3.8% | — | 0.0% | 55.6% | 88.8% | 1373 |
| 314 | GLM 5.2 (none) (partial coverage) | Z.ai | 37.8 | 1 of 6 | $0.462 / $1.452 | — | — | — | 28.9% | — | — |
| 315 | Claude Sonnet 4 (59K) (partial coverage) | Anthropic | 37.6 | 2 of 6 | $3.00 / $15.00 | — | — | 0.0% | 68.9% | — | — |
| 316 | OLMo 3.1 32B Instruct (partial coverage) | Allen Institute for AI | 37.6 | 1 of 6 | — | — | — | — | — | — | 1304 |
| 317 | GPT-5.4 Mini (none) (partial coverage) | OpenAI | 37.5 | 1 of 6 | $0.75 / $4.50 | — | — | — | 26.7% | — | — |
| 318 | Step 1o Turbo 202506 (partial coverage) | StepFun | 37.2 | 1 of 6 | — | — | — | — | — | — | 1297 |
| 319 | Qwen3 235B A22B | Qwen | 36.8 | 3 of 6 | $0.455 / $1.82 | 0.0% | — | — | — | 68.9% | 1392 |
| 320 | OLMo 3.1 32B Think (partial coverage) | Allen Institute for AI | 36.8 | 1 of 6 | — | — | — | — | — | — | 1296 |
| 321 | Magistral Medium 2506 (partial coverage) | Mistral AI | 36.0 | 1 of 6 | — | — | — | — | — | — | 1285 |
| 322 | GPT-4.1 | OpenAI | 35.9 | 5 of 6 | $2.00 / $8.00 | 5.5% | — | 0.0% | 38.3% | 83.0% | 1374 |
| 323 | Gemma 3 27B | Google | 35.8 | 3 of 6 | $0.08 / $0.45 | — | — | — | 22.2% | 74.0% | 1323 |
| 324 | Hunyuan Large Vision (partial coverage) | Tencent | 35.8 | 1 of 6 | — | — | — | — | — | — | 1280 |
| 325 | Gemini 1.5 Pro 002 | Google | 35.7 | 3 of 6 | — | — | — | — | 23.1% | 70.4% | 1339 |
| 326 | Claude Sonnet 4 | Anthropic | 35.7 | 5 of 6 | $3.00 / $15.00 | 4.1% | — | 0.0% | 28.9% | 84.4% | 1389 |
| 327 | Gemini 2.0 Flash 001 | Google | 35.7 | 4 of 6 | — | 1.7% | — | — | 31.1% | 82.2% | 1356 |
| 328 | Qwen2.5 Coder 32B Instruct (partial coverage) | Qwen | 35.2 | 1 of 6 | — | — | — | — | — | — | 1270 |
| 329 | Claude Opus 4.1 (16K) (partial coverage) | Anthropic | 34.9 | 2 of 6 | $15.00 / $75.00 | 0.0% | — | — | 64.4% | — | — |
| 330 | Amazon Nova Pro v1.0 (partial coverage) | Amazon | 34.9 | 1 of 6 | — | — | — | — | — | — | 1269 |
| 331 | Gemma 3n E4B (partial coverage) | Google | 34.6 | 1 of 6 | — | — | — | — | — | — | 1260 |
| 332 | GPT-5.1 (none) (partial coverage) | OpenAI | 34.5 | 2 of 6 | $1.25 / $10.00 | 2.1% | — | — | 37.8% | — | — |
| 333 | Gemma 3 4B (partial coverage) | Google | 34.3 | 1 of 6 | — | — | — | — | — | — | 1254 |
| 334 | Amazon Nova Lite v1.0 (partial coverage) | Amazon | 34.0 | 1 of 6 | — | — | — | — | — | — | 1244 |
| 335 | Claude 3.7 Sonnet | Anthropic | 33.9 | 4 of 6 | — | 3.1% | — | — | 21.9% | 68.2% | 1363 |
| 336 | Command R+ (08-2024) (partial coverage) | Cohere | 33.8 | 1 of 6 | $2.50 / $10.00 | — | — | — | — | — | 1231 |
| 337 | DeepSeek V3 0324 | DeepSeek | 33.6 | 4 of 6 | $0.27 / $1.12 | 0.0% | — | — | 37.8% | 75.5% | 1369 |
| 338 | Mistral Medium 2505 | Mistral AI | 33.6 | 4 of 6 | — | 0.3% | — | — | 32.2% | 81.6% | 1348 |
| 339 | OLMo 2 0325 32B Instruct (partial coverage) | Allen Institute for AI | 33.3 | 1 of 6 | — | — | — | — | — | — | 1227 |
| 340 | DeepSeek V3 | DeepSeek | 33.2 | 4 of 6 | $0.2574 / $1.0287 | 1.7% | — | — | 48.9% | 64.8% | 1311 |
| 341 | Claude Opus 4.1 (32K) (partial coverage) | Anthropic | 33.2 | 2 of 6 | $15.00 / $75.00 | — | 12.6% | 2.4% | — | — | — |
| 342 | Amazon Nova Micro v1.0 (partial coverage) | Amazon | 33.2 | 1 of 6 | — | — | — | — | — | — | 1224 |
| 343 | QwQ 32B Preview (partial coverage) | Qwen | 33.0 | 1 of 6 | — | — | — | — | — | — | 1210 |
| 344 | Command R (08-2024) (partial coverage) | Cohere | 32.9 | 1 of 6 | $0.15 / $0.60 | — | — | — | — | — | 1207 |
| 345 | Gemini 3.5 Flash Lite (high) | Google | 32.9 | 3 of 6 | $0.30 / $2.50 | — | 26.0% | 0.0% | 71.1% | — | — |
| 346 | Mistral Nemo (partial coverage) | Mistral | 32.8 | 1 of 6 | $0.019 / $0.03 | — | — | — | — | 10.8% | — |
| 347 | GLM 4.5 | Z.ai | 32.7 | 3 of 6 | $0.60 / $2.20 | 0.0% | — | 0.0% | — | — | 1413 |
| 348 | Qwen (max) | Qwen | 32.6 | 3 of 6 | — | 1.0% | — | — | 16.1% | 67.2% | — |
| 349 | Grok 2 1212 | xAI | 31.5 | 3 of 6 | — | 0.7% | — | — | 11.5% | 63.5% | — |
| 350 | GPT 4 1106 Preview (partial coverage) | OpenAI | 31.3 | 2 of 6 | — | — | — | — | — | 40.0% | 1303 |
| 351 | Llama 4 Maverick 17B 128e Instruct | Meta | 31.1 | 4 of 6 | — | 0.7% | — | — | 20.6% | 73.0% | 1317 |
| 352 | Qwen2.5 72B Instruct | Qwen | 31.1 | 3 of 6 | $0.36 / $0.40 | — | — | — | 8.1% | 63.2% | 1296 |
| 353 | GPT-4.1 Nano | OpenAI | 29.8 | 4 of 6 | $0.10 / $0.40 | 1.0% | — | — | 28.9% | 70.0% | 1274 |
| 354 | Magistral Small 2506 (partial coverage) | Mistral AI | 29.3 | 2 of 6 | — | 0.0% | — | — | 30.0% | — | — |
| 355 | GPT-4o (2024-05-13) | OpenAI | 29.2 | 3 of 6 | $5.00 / $15.00 | — | — | — | 6.3% | 51.0% | 1305 |
| 356 | GPT-4o-mini (2024-07-18) | OpenAI | 28.5 | 3 of 6 | $0.15 / $0.60 | — | — | — | 6.9% | 52.6% | 1276 |
| 357 | GPT-4 Turbo | OpenAI | 27.9 | 3 of 6 | $10.00 / $30.00 | — | — | — | 6.7% | 46.7% | 1296 |
| 358 | Mistral Large 2407 | Mistral | 27.4 | 3 of 6 | $2.00 / $6.00 | — | — | — | 8.5% | 44.8% | 1288 |
| 359 | GPT-4o (2024-11-20) | OpenAI | 27.2 | 3 of 6 | $2.50 / $10.00 | 0.3% | — | — | 6.3% | 49.8% | — |
| 360 | Mistral Small 3.1 24B Instruct 2503 | Mistral AI | 26.9 | 3 of 6 | — | — | — | — | 5.8% | 46.8% | 1278 |
| 361 | Mixtral 8x22B Instruct (partial coverage) | Mistral | 26.9 | 2 of 6 | $2.00 / $6.00 | — | — | — | — | 24.2% | 1228 |
| 362 | Gemini 1.5 Pro 001 | Google | 26.7 | 3 of 6 | — | — | — | — | 6.8% | 40.8% | 1299 |
| 363 | Claude 3.5 Sonnet | Anthropic | 26.7 | 5 of 6 | — | 1.0% | — | 0.0% | 8.5% | 57.0% | 1351 |
| 364 | Llama 4 Scout 17B 16e Instruct | Meta | 26.5 | 4 of 6 | — | 0.0% | — | — | 7.8% | 62.3% | 1308 |
| 365 | GPT-4o (2024-08-06) | OpenAI | 26.4 | 4 of 6 | $2.50 / $10.00 | 0.3% | — | — | 6.4% | 53.3% | 1309 |
| 366 | Claude 3 Opus | Anthropic | 26.2 | 3 of 6 | — | — | — | — | 4.7% | 37.5% | 1312 |
| 367 | Gemini 1.5 Flash 002 | Google | 26.1 | 4 of 6 | — | 0.0% | — | — | 16.3% | 61.9% | 1289 |
| 368 | Gemini 1.5 Flash 8B 001 (partial coverage) | Google | 26.0 | 2 of 6 | — | — | — | — | 4.6% | — | 1230 |
| 369 | Llama 3.3 70B Instruct | Meta | 25.9 | 3 of 6 | $0.10 / $0.32 | — | — | — | 5.1% | 41.6% | 1296 |
| 370 | Mistral Small 24B Instruct 2501 | Mistral AI | 25.3 | 3 of 6 | — | — | — | — | 5.3% | 44.8% | 1262 |
| 371 | Claude 2 (partial coverage) | Anthropic | 25.1 | 2 of 6 | — | — | — | — | 2.5% | 11.7% | — |
| 372 | Mistral Large 2411 | Mistral AI | 25.0 | 4 of 6 | — | 0.3% | — | — | 7.8% | 50.3% | 1282 |
| 373 | Llama 3.1 70B Instruct | Meta | 23.4 | 3 of 6 | $0.40 / $0.40 | — | — | — | 3.6% | 36.7% | 1269 |
| 374 | Claude 3.5 Haiku | Anthropic | 23.2 | 4 of 6 | — | 0.3% | — | — | 4.3% | 46.4% | 1286 |
| 375 | Gemini 1.5 Flash 001 | Google | 22.8 | 3 of 6 | — | — | — | — | 3.9% | 25.1% | 1258 |
| 376 | Claude 3 Sonnet | Anthropic | 21.5 | 3 of 6 | — | — | — | — | 2.5% | 18.2% | 1253 |
| 377 | Llama 3.1 8B Instruct | Meta | 21.0 | 3 of 6 | $0.05 / $0.08 | — | — | — | 2.5% | 22.9% | 1189 |
| 378 | Claude 3 Haiku | Anthropic | 20.9 | 3 of 6 | $0.25 / $1.25 | — | — | — | 1.8% | 14.9% | 1231 |

## How this ranks

Every benchmark value becomes a percentile among the models that have it, so accuracy scores, Elo ratings and word error rates compare without hand-tuned scaling. Metrics where lower is better are inverted first. Raw values are never summed or averaged across benchmarks. A model's mean percentile is then shrunk toward the mean of the models that were broadly benchmarked, so a model tested twice cannot outrank a broadly tested one on two lucky results. Turning a data source off runs that same ranking code again in your browser over the sources you left on.

A model scored on fewer than 3 of the 6 ranked benchmarks in this category still ranks here, on the benchmarks it does have, and its row carries a partial coverage mark. On an equal score it sits under the model that earned the same number across more of the board.

## Data sources

- [Epoch AI Benchmarking Hub](https://epoch.ai/benchmarks): CC BY 4.0. Benchmark runs by Epoch AI, from the AI Benchmarking Hub.
- [LMArena](https://huggingface.co/datasets/lmarena-ai/leaderboard-dataset): CC BY 4.0. Arena ratings by LMArena, from the public leaderboard dataset.
