Skip to main content
← Benchmark sources

artificialanalysis.ai · benchmark source

Artificial Analysis

Independent evaluations across composite intelligence, science reasoning, and agentic terminal tasks. Multiple boards live under one publisher.

Open artificialanalysis.ai3 boards on this publisher

Expert reasoning

GPQA Diamond

A difficult question set intended to test graduate-level scientific reasoning.

Why it matters

It helps separate broad reasoning ability from surface fluency on demanding knowledge questions.

Use it when

Your work includes difficult science reasoning and you can tolerate a narrow benchmark lens.

The limitation

Scientific question answering is not the same as coding, writing, retrieval, or safe production use.

Leaderboard snapshot

GPQA Diamond results in a readable view

Use the tabs for the primary score and other published fields from this board. The source link remains authoritative for the live table.

Full Artificial Analysis GPQA Diamond table mirrored.

Local leader

Grok 4.6 (high)

94.9%

Rows shown

565

Accuracy

Snapshot date

2026-08-14

1 day old · not a live API feed

Score profile

Accuracy by published row

Higher is better in this view

Grok 4.6 (high)
94.9%
Gemini 3.7 Flash (high)
94.5%
Gemini 3.1 Pro Preview
94.1%
GPT-5.6 Sol (max)
94.1%
Claude Opus 5 (Adaptive Reasoning, High Effort)
93.7%
Claude Opus 5 (Adaptive Reasoning, Xhigh Effort)
93.7%
GPT-5.5 (xhigh)
93.5%
Kimi K3 (max)
93.5%
Claude Opus 5 (Adaptive Reasoning, Max Effort)
93.2%
GPT-5.5 (high)
93.2%
GPT-5.6 Sol (xhigh)
93.1%
Grok 4.5 (high)
93.1%
MiniMax-M3
92.9%
DeepSeek V4 Pro 0813 (max)
92.8%
Gemini 3.6 Flash (high)
92.8%
GPT-5.6 Sol (high)
92.8%
Qwen3.8 Max
92.7%
Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback)
92.6%
GPT-5.5 (medium)
92.6%
GPT-5.6 Sol (medium)
92.6%
GPT-5.6 Terra (max)
92.5%
Qwen3.7 Max
92.3%
Gemini 3.5 Flash (high)
92.2%
Gemini 3.5 Flash (medium)
92.1%
Claude Opus 4.8 (Adaptive Reasoning, Max Effort)
92%
GPT-5.4 (xhigh)
92%
Claude Opus 5 (Adaptive Reasoning, Medium Effort)
91.9%
GPT-5.3 Codex (xhigh)
91.5%
Claude Opus 4.7 (Adaptive Reasoning, Max Effort)
91.4%
Claude Sonnet 5 (Adaptive Reasoning, Max Effort)
91.1%
GPT-5.6 Luna (max)
91.1%
Grok 4.20 0309 v2 (Reasoning)
91.1%
Kimi K2.6
91.1%
GPT-5.5 (low)
91%
DeepSeek V4 Flash 0731 (Reasoning, Max Effort)
90.8%
Gemini 3 Pro Preview (high)
90.8%
GPT-5.6 Terra (xhigh)
90.8%
DeepSeek V4 Pro (Reasoning, High Effort)
90.5%
Muse Spark 1.2 (xhigh)
90.4%
GPT-5.2 (xhigh)
90.3%
Grok 4.3 (high)
90.1%
Qwen3.7 Plus
90%
GPT-5.2 Codex (xhigh)
89.9%
Gemini 3 Flash Preview (Reasoning)
89.8%
GPT-5.6 Sol (low)
89.8%
Muse Spark 1.1 (xhigh)
89.8%
Hy3
89.7%
Claude Opus 4.6 (Adaptive Reasoning, Max Effort)
89.6%
GPT-5.6 Terra (high)
89.6%
Kimi K2.7 Code
89.6%
GLM-5.2 (max)
89.5%
GPT-5.6 Luna (xhigh)
89.5%
Grok Build 0.1 0616
89.5%
Inkling Small
89.5%
DeepSeek V4 Flash (Reasoning, Max Effort)
89.4%
Qwen3.5 397B A17B (Reasoning)
89.3%
GPT-5.6 Luna (high)
89.2%
Nex-N2-Pro
89.2%
Grok 4.3 (medium)
89%
Claude Opus 5 (Adaptive Reasoning, Low Effort)
88.9%
Qwen3.6 Max Preview
88.8%
Gemini 3 Pro Preview (low)
88.7%
Claude Opus 4.7 (Non-reasoning, High Effort)
88.5%
Grok 4.20 0309 (Reasoning)
88.5%
Muse Spark
88.4%
Qwen3.6 Plus
88.2%
Kimi K2.5 (Reasoning)
87.9%
Grok 4
87.7%
Agnes 2.5 Pro Alpha
87.6%
Claude Sonnet 4.6 (Adaptive Reasoning, Max Effort)
87.5%
GPT-5.4 mini (xhigh)
87.5%
MiniMax-M2.7
87.4%
GPT-5.1 (high)
87.3%
GPT-5.6 Terra (medium)
87.2%
Inkling (xhigh)
87.2%
DeepSeek V3.2 Speciale
87.1%
GPT-5.4 (low)
87.1%
MiMo-V2-Pro
87%
Motif 3 (Beta)
86.9%
GLM-5.1 (Reasoning)
86.8%
DeepSeek V4 Flash (Reasoning, High Effort)
86.7%
Hy3-preview (Reasoning)
86.7%
Nemotron 3 Ultra 550B A55B (Reasoning)
86.7%
Claude Opus 4.5 (Reasoning)
86.6%
MiMo-V2.5-Pro
86.6%
GPT-5.2 (medium)
86.4%
Qwen3 Max Thinking
86.1%
Qwen3.5 397B A17B (Non-reasoning)
86.1%
GPT-5.1 Codex (high)
86%
GLM-4.7 (Reasoning)
85.9%
GPT-5.6 Luna (medium)
85.9%
Qwen3.5 27B (Reasoning)
85.8%
Gemma 4 31B (Reasoning)
85.7%
Qwen3.5 122B A10B (Reasoning)
85.7%
Ring-2.6-1T
85.7%
KAT Coder Pro V2
85.5%
Ling 3.0 Flash
85.5%
MiMo-V2-Omni-0327
85.5%
GPT-5 (high)
85.4%
Grok 4.1 Fast (Reasoning)
85.3%
MiMo-V2.5
84.9%
Nanbeige4.1-3B
84.9%
MiniMax-M2.5
84.8%
GLM-5-Turbo
84.7%
Grok 4 Fast (Reasoning)
84.7%
GPT-5.5 Instant (May 2026)
84.6%
MiMo-V2-Flash (Reasoning)
84.6%
JT-4.1 Flash 236B A21B
84.5%
o3-pro
84.5%
Qwen3.5 35B A3B (Reasoning)
84.5%
Gemini 2.5 Pro
84.4%
GPT-5.6 Terra (low)
84.3%
Grok 4.3 (low)
84.3%
GPT-5 (medium)
84.2%
Kimi K3 (low)
84.2%
Qwen3.5 27B (Non-reasoning)
84.2%
Qwen3.6 27B (Reasoning)
84.2%
Qwen3.6 35B A3B (Reasoning)
84.1%
Claude Opus 4.6 (Non-reasoning, High Effort)
84%
DeepSeek V3.2 (Reasoning)
84%
GLM-5.1 (Non-reasoning)
83.9%
Gemini 3.5 Flash-Lite
83.8%
Kimi K2 Thinking
83.8%
GPT-5 Codex (high)
83.7%
Gemini 2.5 Pro Preview (Mar' 25)
83.6%
GPT-5.6 Luna (low)
83.5%
MiMo-V2-Flash (Feb 2026)
83.5%
Muse Glimmer (high)
83.5%
Claude 4.5 Sonnet (Reasoning)
83.4%
Step 3.5 Flash
83.1%
MiniMax-M2.1
83%
JT-35B-Flash
82.9%
Qwen3.6 27B (Non-reasoning)
82.9%
Gemini 3.5 Flash (minimal)
82.8%
GPT-5 mini (high)
82.8%
MiMo-V2-Omni
82.8%
o3
82.7%
Qwen3.5 122B A10B (Non-reasoning)
82.7%
Qwen3.5 Omni Plus
82.6%
Step 3.5 Flash 2603
82.6%
GPT-5.4 mini (medium)
82.3%
GPT-5.5 Instant (June 2026)
82.3%
Gemini 2.5 Pro Preview (May' 25)
82.2%
Gemini 3.1 Flash-Lite
82.2%
GLM-5 (Reasoning)
82%
Qwen3.5 35B A3B (Non-reasoning)
81.9%
GPT-5.4 nano (xhigh)
81.7%
Qwen3.6 35B A3B (Non-reasoning)
81.7%
DeepSeek R1 0528 (May '25)
81.3%
GPT-5.1 Codex mini (high)
81.3%
Gemini 3 Flash Preview (Non-reasoning)
81.2%
ERNIE 4.5 300B A47B
81.1%
Nova 2.0 Lite (high)
81.1%
Claude Opus 4.5 (Non-reasoning)
81%
Claude 4.1 Opus (Reasoning)
80.9%
GLM 5V Turbo (Reasoning)
80.9%
Step 3.7 Flash
80.9%
GPT-5 (low)
80.8%
Qwen3.5 9B (Reasoning)
80.6%
GPT-5 mini (medium)
80.3%
Claude Sonnet 5 (Non-reasoning, High Effort)
80%
Nemotron 3 Super 120B A12B (Reasoning)
80%
Claude Sonnet 4.6 (Non-reasoning, High Effort)
79.9%
Claude Sonnet 4.6 (Non-reasoning, Low Effort)
79.7%
DeepSeek V3.2 Exp (Reasoning)
79.7%
Claude 4 Opus (Reasoning)
79.6%
EXAONE 4.5 33B
79.4%
Gemini 2.5 Flash Preview (Sep '25) (Reasoning)
79.3%
DeepSeek V3.1 Terminus (Reasoning)
79.2%
Gemma 4 26B A4B (Reasoning)
79.2%
Grok 3 mini Reasoning (high)
79.1%
Gemini 2.5 Flash (Reasoning)
79%
GPT-5.6 Sol (Non-reasoning)
79%
Qwen3 235B A22B 2507 (Reasoning)
79%
Kimi K2.5 (Non-reasoning)
78.9%
Kimi K2.6 (Non-reasoning)
78.8%
Qwen3.5 9B (Non-reasoning)
78.6%
Grok 4.20 0309 (Non-reasoning)
78.5%
Nova 2.0 Pro Preview (medium)
78.5%
o4-mini (high)
78.4%
K-EXAONE (Reasoning)
78.3%
GLM-4.5 (Reasoning)
78.2%
gpt-oss-120b (high)
78.2%
GLM-4.6 (Reasoning)
78%
LongCat 2.0
78%
DeepSeek V3.1 (Reasoning)
77.9%
Claude 4 Sonnet (Reasoning)
77.7%
ERNIE 5.0 Thinking Preview
77.7%
MiniMax-M2
77.7%
Grok 4.20 0309 v2 (Non-reasoning)
77.6%
Qwen3 Max Thinking (Preview)
77.6%
Ring-1T
77.4%
o3-mini (high)
77.3%
Claude 3.7 Sonnet (Reasoning)
77.2%
Qwen3 VL 235B A22B (Reasoning)
77.2%
Qwen3.5 4B (Reasoning)
77.1%
Mercury 2
77%
Mistral Small 4 (Reasoning)
76.9%
Cogito v2.1 (Reasoning)
76.8%
GPT-5.5 (Non-reasoning)
76.8%
Nova 2.0 Lite (medium)
76.8%
Kimi K2 0905
76.7%
Gemini 2.5 Flash Preview (Sep '25) (Non-reasoning)
76.6%
Kimi K2
76.6%
Doubao Seed Code
76.4%
KAT-Coder-Pro V1
76.4%
Qwen3 Max
76.4%
Qwen3 Max (Preview)
76.4%
Gemma 4 31B (Non-reasoning)
76.3%
MiMo-V2.5-Pro (Non-reasoning)
76.2%
Command A+
76.1%
GPT-5.4 nano (medium)
76.1%
INTELLECT-3
76.1%
Nova 2.0 Omni (medium)
76%
Qwen3 Next 80B A3B (Reasoning)
75.9%
Nemotron Cascade 2 30B A3B
75.8%
North Mini Code
75.7%
NVIDIA Nemotron 3 Nano 30B A3B (Reasoning)
75.7%
G9v3-39A5B
75.6%
Gemma 4 12B (Reasoning)
75.3%
Qwen3 235B A22B 2507 Instruct
75.3%
Ling-2.6-1T
75.2%
Trinity Large Thinking
75.2%
DeepSeek V3.1 Terminus (Non-reasoning)
75.1%
DeepSeek V3.2 (Non-reasoning)
75.1%
Nova 2.0 Pro Preview (low)
75.1%
GPT-5.4 (Non-reasoning)
74.8%
Llama Nemotron Super 49B v1.5 (Reasoning)
74.8%
Mistral Medium 3.5
74.8%
o3-mini
74.8%
o1
74.7%
GPT-5.6 Terra (Non-reasoning)
74.6%
Nemotron 3.5 Lightning
74.3%
Qwen3.5 Omni Flash
74.2%
EXAONE 4.0 32B (Reasoning)
73.9%
Magistral Medium 1.2
73.9%
DeepSeek V3.2 Exp (Non-reasoning)
73.8%
Qwen3 Next 80B A3B Instruct
73.8%
Sarvam 105B (high)
73.8%
Qwen3 Coder Next
73.7%
DeepSeek V3.1 (Non-reasoning)
73.5%
Ling 3.0 Tiny
73.4%
Apriel-v1.6-15B-Thinker
73.3%
GLM-4.5-Air
73.3%
HyperNova 60B 2605
73.3%
Qwen3 VL 32B (Reasoning)
73.3%
Hy3-preview (Non-reasoning)
73.2%
Llama 3.1 Nemotron Ultra 253B v1 (Reasoning)
72.8%
Claude 4.5 Sonnet (Non-reasoning)
72.7%
Grok Code Fast 1
72.7%
Hermes 4 - Llama-3.1 405B (Reasoning)
72.7%
Qwen3 Omni 30B A3B (Reasoning)
72.6%
Seed-OSS-36B-Instruct
72.6%
Ring-flash-2.0
72.5%
Solar Pro 3
72.4%
Mi:dm K 2.5 Pro Preview
72.2%
Qwen3 VL 30B A3B (Reasoning)
72%
GLM-4.6V (Reasoning)
71.9%
Ling-1T
71.9%
DeepSeek V4 Pro (Non-reasoning)
71.7%
DeepSeek V4 Flash (Non-reasoning)
71.6%
Gemma 4 26B A4B (Non-reasoning)
71.4%
Apriel-v1.5-15B-Thinker
71.3%
K2 Think V2
71.3%
GPT-5.2 (Non-reasoning)
71.2%
Qwen3 VL 235B A22B Instruct
71.2%
Qwen3.5 4B (Non-reasoning)
71.2%
Gemini 2.5 Flash-Lite Preview (Sep '25) (Reasoning)
70.9%
DeepSeek R1 (Jan '25)
70.8%
Qwen3 30B A3B 2507 (Reasoning)
70.7%
Claude 4 Opus (Non-reasoning)
70.1%
Gemini 2.0 Flash Thinking Experimental (Jan '25)
70.1%
Mi:dm K 2.5 Pro
70.1%
Qwen3 235B A22B (Reasoning)
70%
Hermes 4 - Llama-3.1 70B (Reasoning)
69.9%
Nova 2.0 Omni (low)
69.9%
Gemini 2.5 Flash Preview (Reasoning)
69.8%
Nova 2.0 Lite (low)
69.8%
MiniMax M1 80k
69.7%
K-EXAONE (Non-reasoning)
69.5%
Motif-2-12.7B-Reasoning
69.5%
Qwen3 VL 30B A3B Instruct
69.5%
Grok 3
69.3%
Step3 VL 10B
69%
gpt-oss-20b (high)
68.8%
GPT-5 mini (minimal)
68.7%
Solar Pro 2 (Reasoning)
68.7%
GLM-5.2 (Non-reasoning)
68.6%
GPT-5 (ChatGPT)
68.6%
GLM-4.5V (Reasoning)
68.4%
Claude 4 Sonnet (Non-reasoning)
68.3%
Gemini 2.5 Flash (Non-reasoning)
68.3%
MiniMax M1 40k
68.2%
K2-V2 (high)
68.1%
Mistral Large 3
68%
Magistral Medium 1
67.9%
GPT-5 nano (high)
67.6%
JT-MINI
67.6%
GPT-5 (minimal)
67.3%
Claude 4.5 Haiku (Reasoning)
67.2%
gpt-oss-120b (low)
67.2%
Llama 4 Maverick
67.1%
Qwen3 VL 32B Instruct
67.1%
GPT-5 nano (medium)
67%
DiffusionGemma 26B A4B
66.9%
Qwen3 32B (Reasoning)
66.8%
Qwen3 4B 2507 (Reasoning)
66.7%
GLM-5 (Non-reasoning)
66.6%
GPT-4.1
66.6%
GLM-4.7 (Non-reasoning)
66.4%
GPT-4.1 mini
66.4%
Magistral Small 1.2
66.3%
Falcon-H1R-7B
66.1%
Gemma 4 12B (Non-reasoning)
66.1%
Qwen3 30B A3B 2507 Instruct
65.9%
Grok 4.3 (Non-reasoning)
65.8%
Ling-flash-2.0
65.7%
Solar Open 100B (Reasoning)
65.7%
Claude 3.7 Sonnet (Non-reasoning)
65.6%
MiMo-V2-Flash (Non-reasoning)
65.6%
DeepSeek V3 0324
65.5%
GPT-4o (March 2025, chatgpt-4o-latest)
65.5%
Gemini 2.5 Flash-Lite Preview (Sep '25) (Non-reasoning)
65.1%
Claude 4.5 Haiku (Non-reasoning)
64.6%
GPT-5.6 Luna (Non-reasoning)
64.5%
GPT-5.1 (Non-reasoning)
64.3%
Llama 3.3 Nemotron Super 49B v1 (Reasoning)
64.3%
Magistral Small 1
64.1%
Grok 4.1 Fast (Non-reasoning)
63.7%
Gemini 2.0 Flash (experimental)
63.6%
LongCat Flash Lite
63.6%
Nova 2.0 Pro Preview (Non-reasoning)
63.6%
Sarvam 30B (high)
63.3%
GLM-4.6 (Non-reasoning)
63.2%
Celeris-1
63.1%
EXAONE 4.0 32B (Non-reasoning)
62.8%
Gemini 2.5 Flash-Lite (Reasoning)
62.5%
Gemini 2.0 Flash (Feb '25)
62.3%
Sonar Reasoning
62.3%
Gemini 2.0 Pro Experimental (Feb '25)
62.2%
Qwen3 Omni 30B A3B Instruct
62%
Qwen3 Coder 480B A35B Instruct
61.8%
Qwen3 30B A3B (Reasoning)
61.6%
DeepSeek R1 Distill Qwen 32B
61.5%
HyperCLOVA X SEED Think (32B)
61.5%
Qwen3 235B A22B (Non-reasoning)
61.3%
DeepSeek R1 0528 Qwen3 8B
61.2%
gpt-oss-20b (low)
61.1%
Olmo 3 32B Think
61%
GPT-5.4 mini (Non-Reasoning)
60.6%
Grok 4 Fast (Non-reasoning)
60.6%
Qwen3 14B (Reasoning)
60.4%
Nova 2.0 Lite (Non-reasoning)
60.3%
o1-mini
60.3%
Tri-21B-Think
60.1%
Claude 3.5 Sonnet (Oct '24)
59.9%
K2-V2 (medium)
59.8%
Devstral 2
59.4%
Gemini 2.5 Flash Preview (Non-reasoning)
59.4%
Ling 2.6 Flash
59.3%
QwQ 32B
59.3%
Olmo 3.1 32B Think
59.1%
Gemini 1.5 Pro (Sep '24)
58.9%
Qwen3 8B (Reasoning)
58.9%
Mistral Medium 3.1
58.8%
Llama 4 Scout
58.7%
Qwen2.5 Max
58.7%
GLM-4.7-Flash (Reasoning)
58.1%
Qwen3 VL 8B (Reasoning)
57.9%
Mistral Medium 3
57.8%
Solar Pro 2 (Preview) (Reasoning)
57.8%
Sonar Pro
57.8%
Gemma 4 E4B (Reasoning)
57.6%
Phi-4
57.5%
GLM-4.5V (Non-reasoning)
57.3%
Ministral 3 14B
57.2%
NVIDIA Nemotron Nano 12B v2 VL (Reasoning)
57.2%
Mistral Small 4 (Non-reasoning)
57.1%
NVIDIA Nemotron Nano 9B V2 (Reasoning)
57%
Nova Premier
56.9%
GLM-4.6V (Non-reasoning)
56.6%
Ling-mini-2.0
56.2%
Solar Pro 2 (Non-reasoning)
56.1%
Claude 3.5 Sonnet (June '24)
56%
GPT-5.4 nano (Non-Reasoning)
55.8%
DeepSeek V3 (Dec '24)
55.7%
NVIDIA Nemotron Nano 9B V2 (Non-reasoning)
55.7%
QwQ 32B-Preview
55.7%
Nova 2.0 Omni (Non-reasoning)
55.5%
Gemma 4 E4B (Non-reasoning)
54.9%
Solar Pro 2 (Preview) (Non-reasoning)
54.4%
GPT-4o (Nov '24)
54.3%
Gemini 2.0 Flash-Lite (Preview)
54.2%
K2-V2 (low)
54.1%
Olmo 3.1 32B Instruct
53.9%
Tri-21B-think Preview
53.8%
Hermes 4 - Llama-3.1 405B (Non-reasoning)
53.6%
Gemini 2.0 Flash-Lite (Feb '25)
53.5%
Qwen3 32B (Non-reasoning)
53.5%
Devstral Small 2
53.2%
Reka Flash 3
52.9%
Command A
52.7%
GPT-4o (May '24)
52.6%
Qwen3 4B (Reasoning)
52.2%
GPT-4o (Aug '24)
52.1%
Llama 3.3 Nemotron Super 49B v1 (Non-reasoning)
51.7%
Qwen3 4B 2507 Instruct
51.7%
Llama 3.1 Tulu3 405B
51.6%
Olmo 3 7B Think
51.6%
Qwen3 Coder 30B A3B Instruct
51.6%
Exaone 4.0 1.2B (Reasoning)
51.5%
Llama 3.1 Instruct 405B
51.5%
Qwen3 30B A3B (Non-reasoning)
51.5%
LFM2.5-8B-A1B
51.3%
NVIDIA Nemotron 3 Nano 4B
51.3%
GPT-4.1 nano
51.2%
GPT-4o (ChatGPT)
51.1%
Grok 2 (Dec '24)
51%
Mistral Small 3.2
50.5%
Pixtral Large
50.5%
Nova Pro
49.9%
Llama 3.3 Instruct 70B
49.8%
Qwen3 VL 4B (Reasoning)
49.4%
Devstral Medium
49.2%
Hermes 4 - Llama-3.1 70B (Non-reasoning)
49.1%
Qwen2.5 Instruct 72B
49.1%
Claude 3 Opus
48.9%
Mistral Large 2 (Nov '24)
48.6%
DeepSeek R1 Distill Qwen 14B
48.4%
Granite 4.1 30B
48.1%
Llama Nemotron Super 49B v1.5 (Non-reasoning)
48.1%
Gemini 2.5 Flash-Lite (Non-reasoning)
47.4%
LFM2 24B A2B
47.4%
Mistral Large 2 (Jul '24)
47.2%
Grok Beta
47.1%
Ministral 3 8B
47.1%
Sonar
47.1%
Qwen3 14B (Non-reasoning)
47%
Nemotron 3 Nano Omni 30B A3B Reasoning
46.9%
Qwen2.5 Instruct 32B
46.6%
Llama 3.1 Nemotron Instruct 70B
46.5%
Gemini 1.5 Flash (Sep '24)
46.3%
Mistral Small 3
46.2%
Qwen3.5 2B (Reasoning)
45.6%
Mistral Small 3.1
45.4%
GLM-4.7-Flash (Non-reasoning)
45.2%
Qwen3 8B (Non-reasoning)
45.2%
NVIDIA Nemotron Nano 12B v2 VL (Non-reasoning)
43.9%
G9v3-3B
43.8%
Qwen3.5 2B (Non-reasoning)
43.8%
Devstral Small (May '25)
43.4%
Gemma 4 E2B (Reasoning)
43.3%
Granite 4.1 8B
43.3%
Nova Lite
43.3%
Llama 3.2 Instruct 90B (Vision)
43.2%
Gemma 3 27B Instruct
42.8%
GPT-5 nano (minimal)
42.8%
Jamba 1.5 Large
42.7%
Qwen3 VL 8B Instruct
42.7%
GPT-4o mini
42.6%
Molmo2-8B
42.5%
Exaone 4.0 1.2B (Non-reasoning)
42.4%
Mistral Saba
42.4%
Qwen2.5 Coder Instruct 32B
41.7%
Granite 4.0 H Small
41.6%
Sarvam M (Reasoning)
41.6%
Devstral Small (Jul '25)
41.4%
Kimi Linear 48B A3B Instruct
41.2%
Qwen2.5 Turbo
41%
Llama 3.1 Instruct 70B
40.9%
Claude 3.5 Haiku
40.8%
Llama 3.1 Nemotron Nano 4B v1.1 (Reasoning)
40.8%
Gemma 4 E2B (Non-reasoning)
40.5%
DeepSeek R1 Distill Llama 70B
40.2%
Hermes 3 - Llama-3.1 70B
40.1%
Claude 3 Sonnet
40%
Olmo 3 7B Instruct
40%
NVIDIA Nemotron 3 Nano 30B A3B (Non-reasoning)
39.9%
Qwen3 4B (Non-reasoning)
39.8%
Jamba 1.7 Large
39%
Jamba 1.6 Large
38.7%
DeepHermes 3 - Mistral 24B Preview (Non-reasoning)
38.2%
Mistral Small (Sep '24)
38.1%
Llama 3 Instruct 70B
37.9%
Claude 3 Haiku
37.4%
Gemini 1.5 Pro (May '24)
37.1%
Qwen2 Instruct 72B
37.1%
Qwen3 VL 4B Instruct
37.1%
Gemini 1.5 Flash-8B
35.9%
Ministral 3 3B
35.8%
Nova Micro
35.8%
Qwen3 1.7B (Reasoning)
35.6%
Mistral Large (Feb '24)
35.1%
Gemma 3 12B Instruct
34.9%
GPT-4
34.9%
Mistral Medium
34.9%
Claude 2.0
34.4%
LFM2 8B A1B
34.4%
LFM2.5-1.2B-Thinking
33.9%
Qwen2.5 Coder Instruct 7B
33.9%
Granite 3.3 8B (Non-reasoning)
33.8%
Granite 4.0 Micro
33.6%
Jamba Reasoning 3B
33.3%
Mixtral 8x22B Instruct
33.2%
DBRX Instruct
33.1%
Phi-4 Mini Instruct
33.1%
Claude Instant
33%
OLMo 2 32B
32.8%
LFM 40B
32.7%
Llama 2 Chat 70B
32.7%
LFM2.5-1.2B-Instruct
32.6%
Gemini 1.5 Flash (May '24)
32.4%
Command-R+ (Apr '24)
32.3%
Jamba 1.7 Mini
32.2%
Llama 2 Chat 13B
32.1%
Claude 2.1
31.9%
DeepSeek Coder V2 Lite Instruct
31.9%
Phi-3 Mini Instruct 3.8B
31.9%
Phi-4 Multimodal Instruct
31.5%
Granite 4.1 3B
31.4%
LFM2 2.6B
30.6%
MiniCPM-V 4.6 1.3B
30.5%
Tiny Aya Global
30.5%
DeepSeek R1 Distill Llama 8B
30.2%
Jamba 1.5 Mini
30.2%
Mistral Small (Feb '24)
30.2%
Jamba 1.6 Mini
30%
GPT-3.5 Turbo
29.7%
Gemma 3n E4B Instruct
29.6%
Llama 3 Instruct 8B
29.6%
Mixtral 8x7B Instruct
29.2%
Gemma 3 4B Instruct
29.1%
LFM2.5-VL-1.6B
28.9%
Qwen1.5 Chat 110B
28.9%
OLMo 2 7B
28.8%
Command-R (Mar '24)
28.4%
Qwen3 1.7B (Non-reasoning)
28.3%
Granite 4.0 1B
28.1%
Gemma 3n E4B Instruct Preview (May '25)
27.8%
MiniCPM5-1B (Reasoning)
27.8%
Gemini 1.0 Pro
27.7%
Apertus 70B Instruct
27.2%
DeepHermes 3 - Llama-3.1 8B Preview (Non-reasoning)
27%
MiniCPM5-1B (Non-reasoning)
26.9%
Granite 4.0 H 1B
26.3%
Granite 4.0 350M
26.1%
Llama 3.1 Instruct 8B
25.9%
Granite 4.0 H 350M
25.7%
Apertus 8B Instruct
25.6%
Llama 3.2 Instruct 3B
25.5%
Molmo 7B-D
24%
Qwen3 0.6B (Reasoning)
23.9%
Gemma 3 1B Instruct
23.7%
Qwen3.5 0.8B (Non-reasoning)
23.6%
Qwen3 0.6B (Non-reasoning)
23.1%
OpenChat 3.5 (1210)
23%
Gemma 3n E2B Instruct
22.9%
LFM2 1.2B
22.8%
Llama 2 Chat 7B
22.7%
Gemma 3 270M
22.4%
Llama 3.2 Instruct 11B (Vision)
22.1%
Llama 3.2 Instruct 1B
19.6%
Mistral 7B Instruct
17.7%
Qwen3.5 0.8B (Reasoning)
11.1%
DeepSeek R1 Distill Qwen 1.5B
9.8%

Full Artificial Analysis GPQA Diamond table mirrored 2026-08-11 from artificialanalysis.ai, with Grok 4.6 (high) 94.9% inserted from the live AA table on 2026-08-14. GPQA Diamond has no single first-party live leaderboard; the original paper defines the 198-question split.

Open Artificial Analysis GPQA Diamond leaderboard

Evidence in this catalog

Where GPQA Diamond fits

Closest verified examples we currently carry. A missing score is not a zero.

Model examples

No directly comparable model score is verified here yet.

Harness examples

No directly comparable harness score is verified here yet.

Open this board on Artificial Analysis GPQA Diamond leaderboard