AI Benchmarks

AI benchmark rankings, model scores, and performance data.

Track live AI benchmark rankings, coding scores, math scores, and benchmark results across leading models from OpenAI, Anthropic, Google, Meta, DeepSeek, and more.

715 of 715 models
# Model Org Intelligence ↓ CodingMathMMLU ProGPQALiveCodeBenchAIME 2025MATH 500SciCodeIFBenchHLE
1 Claude Opus 5.5 (Adaptive Reasoning, Max Effort, Default Fallback) Anthropic 57.6 ——————— 6690.0 — 6140.0
2 Claude Opus 5.5 (Adaptive Reasoning, Xhigh Effort, Default Fallback) Anthropic 56.0 ——————— 6500.0 — 5750.0
3 Claude Sonnet 5.5 (Adaptive Reasoning, Max Effort, Default Fallback) Anthropic 56.0 ——————— 6100.0 — 5500.0
4 Claude Opus 5.5 (Adaptive Reasoning, High Effort, Default Fallback) Anthropic 53.6 ——————— 6040.0 — 5560.0
5 Claude Fable 5.1 (Adaptive Reasoning, Max Effort, Default Fallback) Anthropic 53.4 81.6 —— 9370.0 ——— 6310.0 — 5910.0
6 Claude Fable 5.1 (Adaptive Reasoning, Xhigh Effort, Default Fallback) Anthropic 53.2 80.7 —— 9340.0 ——— 6090.0 — 5870.0
7 GPT-6 Astra (Max) OpenAI 52.7 76.9 —— 9610.0 ——— 5650.0 — 5470.0
8 Gemini 4 Argon (High) Google 52.6 ——————— 6180.0 — 5710.0
9 GPT-6 Astra (Xhigh) OpenAI 52.4 75.9 —— 9630.0 ——— 5570.0 — 5460.0
10 Claude Sonnet 5.5 (Adaptive Reasoning, Xhigh Effort, Default Fallback) Anthropic 51.9 ——————— 5730.0 — 5000.0
11 GPT-6.1 Sol (Max) OpenAI 51.8 ——————— 5420.0 — 5290.0
12 Claude Fable 5.1 (Adaptive Reasoning, High Effort, Default Fallback) Anthropic 51.2 79.1 —— 9060.0 ——— 5870.0 — 5590.0
13 Claude Opus 5.5 (Adaptive Reasoning, Medium Effort, Default Fallback) Anthropic 51.2 ——————— 5930.0 — 5470.0
14 GPT-6.1 Sol (Xhigh) OpenAI 51.0 ——————— 5570.0 — 5260.0
15 GPT-6 Astra (High) OpenAI 50.9 77.1 —— 9490.0 ——— 5540.0 — 5310.0
16 Claude Opus 5 (Adaptive Reasoning, Max Effort) Anthropic 50.8 78.0 —— 9320.0 ——— 5640.0 — 5490.0
17 GPT-6.1 Sol (High) OpenAI 50.2 ——————— 5580.0 — 5140.0
18 Claude Opus 5 (Adaptive Reasoning, Xhigh Effort) Anthropic 49.7 77.0 —— 9370.0 ——— 5570.0 — 5440.0
19 Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback) Anthropic 49.6 76.5 —— 9260.0 ——— 6100.0 6346.9 5550.0
20 GPT-6 Astra (Medium) OpenAI 49.6 76.7 —— 9390.0 ——— 5420.0 — 5270.0
21 Claude Fable 5.1 (Adaptive Reasoning, Medium Effort, Default Fallback) Anthropic 48.9 77.1 —— 8860.0 ——— 5640.0 — 5380.0
22 Claude Opus 5 (Adaptive Reasoning, High Effort) Anthropic 48.1 76.5 —— 9370.0 ——— 5540.0 — 5280.0
23 Muse Spark 1.3 (Max) Meta 48.1 75.8 —— 9350.0 ——— 5880.0 — 4870.0
24 GPT-6.1 Sol (Medium) OpenAI 47.8 ——————— 5320.0 — 4990.0
25 GPT-6 Sol (Max) OpenAI 47.6 ——————— 5760.0 — 4790.0