Skip to main content
← Benchmark sources

cursor.com · benchmark source

Cursor

Cursor’s first-party agent evals for IDE-native multi-file work. CursorBench is vendor-run from real Cursor sessions — useful inside Cursor, not a public reproducible harness.

Open cursor.com3 boards on this publisher

Coding agents

CursorBench

Cursor’s offline correctness suite for ambiguous, multi-file coding-agent tasks sourced from real Cursor sessions rather than public GitHub issues.

Why it matters

It separates frontier models on IDE-style agent work where SWE-bench and similar public suites are increasingly saturated or contaminated.

Use it when

You are choosing a model for Cursor’s agent loop and want a signal aligned with Cursor’s own product evals — then validate on your repo.

The limitation

First-party and not independently reproducible from a public harness. Scores move when Cursor refreshes the problem distribution (compare only within the same version).

Leaderboard snapshot

CursorBench — chart and full table

Same layout as Cursor’s public board: Cost / Tokens / Steps chart, then one full Score · Cost · Tokens · Steps table.

Local leader

Grok 4.6 Extra High

70.8%

Rows shown

56

Full CursorBench 3.2 table

Snapshot date

2026-08-14

Mirrored from cursor.com/cursorbench

CursorBench 3.2 score35%42%48%55%62%68%75%$0$3$6$9$12$15$18Average cost per taskGrok 4.6 Extra High: 70.8% · $2.81 · 41,136 tokens · 46 stepsGrok 4.6 High: 69.9% · $2.34 · 32,449 tokens · 39 stepsGrok 4.6 Medium: 67.1% · $1.28 · 17,942 tokens · 29 stepsGrok 4.6 Low: 61% · $0.70 · 10,658 tokens · 23 stepsGrok 4.6Fable 5 Max: 70.5% · $17.32 · 103,525 tokens · 72 stepsFable 5 Extra High: 68.4% · $11.73 · 64,971 tokens · 56 stepsFable 5 High: 66.5% · $8.77 · 43,747 tokens · 48 stepsFable 5 Medium: 65.2% · $6.80 · 30,366 tokens · 41 stepsFable 5 Low: 62.1% · $4.46 · 18,182 tokens · 31 stepsFable 5Opus 5 Max: 70% · $8.23 · 61,838 tokens · 78 stepsOpus 5 Extra High: 69.3% · $7.35 · 54,239 tokens · 72 stepsOpus 5 High: 66.7% · $3.91 · 27,932 tokens · 48 stepsOpus 5 Medium: 64.3% · $3.29 · 23,612 tokens · 44 stepsOpus 5 Low: 62.8% · $2.55 · 18,529 tokens · 37 stepsOpus 5GPT-5.6 Sol Max: 67.2% · $5.69 · 28,320 tokens · 48 stepsGPT-5.6 Sol Extra High: 64.5% · $3.88 · 19,699 tokens · 38 stepsGPT-5.6 Sol High: 63.5% · $2.79 · 13,867 tokens · 32 stepsGPT-5.6 Sol Medium: 60% · $1.95 · 9,747 tokens · 27 stepsGPT-5.6 Sol Low: 52.6% · $1.01 · 5,104 tokens · 19 stepsGPT-5.6 SolGPT-5.6 Terra Max: 64.9% · $2.31 · 32,969 tokens · 47 stepsGPT-5.6 Terra Extra High: 59.2% · $1.15 · 16,089 tokens · 29 stepsGPT-5.6 Terra High: 54.2% · $0.71 · 9,468 tokens · 23 stepsGPT-5.6 Terra Medium: 50.3% · $0.49 · 6,222 tokens · 20 stepsGPT-5.6 Terra Low: 46.9% · $0.42 · 5,312 tokens · 19 stepsGPT-5.6 TerraOpus 4.8 Max: 62.3% · $5.77 · 71,411 tokens · 44 stepsOpus 4.8 Extra High: 59.4% · $4.50 · 51,121 tokens · 40 stepsOpus 4.8 High: 58% · $3.15 · 33,548 tokens · 33 stepsOpus 4.8 Medium: 56.1% · $2.81 · 28,384 tokens · 32 stepsOpus 4.8 Low: 53.1% · $2.02 · 19,624 tokens · 27 stepsOpus 4.8Gemini 3.7 Flash High: 61.6% · $1.20 · 38,448 tokens · 99 stepsGemini 3.7 Flash Medium: 59% · $0.95 · 30,953 tokens · 82 stepsGemini 3.7 Flash Low: 53.8% · $0.74 · 20,594 tokens · 68 stepsGemini 3.7 FlashSonnet 5 Max: 61.5% · $4.30 · 92,882 tokens · 86 stepsSonnet 5 Extra High: 58.7% · $2.77 · 52,871 tokens · 67 stepsSonnet 5 High: 56.9% · $2.13 · 39,483 tokens · 57 stepsSonnet 5 Medium: 52.4% · $1.44 · 26,200 tokens · 46 stepsSonnet 5 Low: 47.7% · $0.87 · 16,269 tokens · 33 stepsSonnet 5GPT-5.6 Luna Max: 61.1% · $0.39 · 87,973 tokens · 61 stepsGPT-5.6 Luna Extra High: 57.7% · $0.23 · 22,480 tokens · 48 stepsGPT-5.6 Luna High: 56.8% · $0.16 · 15,141 tokens · 40 stepsGPT-5.6 Luna Medium: 47.7% · $0.08 · 7,095 tokens · 28 stepsGPT-5.6 Luna Low: 37.6% · $0.03 · 3,209 tokens · 17 stepsGPT-5.6 LunaKimi K3 Max: 60.8% · $2.70 · 38,428 tokens · 57 stepsKimi K3 High: 59.7% · $1.89 · 26,846 tokens · 47 stepsKimi K3 Low: 50.5% · $0.99 · 13,007 tokens · 33 stepsKimi K3GPT-5.5 Extra High: 58.4% · $2.85 · 17,534 tokens · 32 stepsGPT-5.5 High: 58.4% · $2.05 · 12,183 tokens · 28 stepsGPT-5.5 Medium: 53.8% · $1.51 · 8,522 tokens · 25 stepsGPT-5.5 Low: 46.6% · $0.98 · 5,168 tokens · 20 stepsGPT-5.5Composer 2.5: 56.1% · $0.44 · 14,286 tokens · 33 stepsComposer 2.5GLM 5.2 Max: 55% · $1.76 · 35,946 tokens · 58 stepsGLM 5.2 High: 51.5% · $1.19 · 21,829 tokens · 49 stepsGLM 5.2Gemini 3.6 Flash High: 53.5% · $1.56 · 30,436 tokens · 64 stepsGemini 3.6 Flash Medium: 51.2% · $1.48 · 28,511 tokens · 62 stepsGemini 3.6 Flash Low: 47.4% · $1.13 · 20,529 tokens · 50 stepsGemini 3.6 FlashKimi K2.7 Code: 49.7% · $1.43 · 31,247 tokens · 58 stepsKimi K2.7 Code

Better is toward the top-right (higher score, lower cost). X-axis is reversed to match Cursor’s public chart.

CursorBench 3.2 full leaderboard with score, cost, tokens, and steps per task
#ModelScoreCost / taskTokens / taskSteps / task
1Grok 4.6 Extra High70.8%$2.8141,13646
2Fable 5 Max70.5%$17.32103,52572
3Opus 5 Max70.0%$8.2361,83878
4Grok 4.6 High69.9%$2.3432,44939
5Opus 5 Extra High69.3%$7.3554,23972
6Fable 5 Extra High68.4%$11.7364,97156
7GPT-5.6 Sol Max67.2%$5.6928,32048
8Grok 4.6 Medium67.1%$1.2817,94229
9Opus 5 High66.7%$3.9127,93248
10Fable 5 High66.5%$8.7743,74748
11Fable 5 Medium65.2%$6.8030,36641
12GPT-5.6 Terra Max64.9%$2.3132,96947
13GPT-5.6 Sol Extra High64.5%$3.8819,69938
14Opus 5 Medium64.3%$3.2923,61244
15GPT-5.6 Sol High63.5%$2.7913,86732
16Opus 5 Low62.8%$2.5518,52937
17Opus 4.8 Max62.3%$5.7771,41144
18Fable 5 Low62.1%$4.4618,18231
19Gemini 3.7 Flash High61.6%$1.2038,44899
20Sonnet 5 Max61.5%$4.3092,88286
21GPT-5.6 Luna Max61.1%$0.3987,97361
22Grok 4.6 Low61.0%$0.7010,65823
23Kimi K3 Max60.8%$2.7038,42857
24GPT-5.6 Sol Medium60.0%$1.959,74727
25Kimi K3 High59.7%$1.8926,84647
26Opus 4.8 Extra High59.4%$4.5051,12140
27GPT-5.6 Terra Extra High59.2%$1.1516,08929
28Gemini 3.7 Flash Medium59.0%$0.9530,95382
29Sonnet 5 Extra High58.7%$2.7752,87167
30GPT-5.5 Extra High58.4%$2.8517,53432
31GPT-5.5 High58.4%$2.0512,18328
32Opus 4.8 High58.0%$3.1533,54833
33GPT-5.6 Luna Extra High57.7%$0.2322,48048
34Sonnet 5 High56.9%$2.1339,48357
35GPT-5.6 Luna High56.8%$0.1615,14140
36Composer 2.556.1%$0.4414,28633
37Opus 4.8 Medium56.1%$2.8128,38432
38GLM 5.2 Max55.0%$1.7635,94658
39GPT-5.6 Terra High54.2%$0.719,46823
40GPT-5.5 Medium53.8%$1.518,52225
41Gemini 3.7 Flash Low53.8%$0.7420,59468
42Gemini 3.6 Flash High53.5%$1.5630,43664
43Opus 4.8 Low53.1%$2.0219,62427
44GPT-5.6 Sol Low52.6%$1.015,10419
45Sonnet 5 Medium52.4%$1.4426,20046
46GLM 5.2 High51.5%$1.1921,82949
47Gemini 3.6 Flash Medium51.2%$1.4828,51162
48Kimi K3 Low50.5%$0.9913,00733
49GPT-5.6 Terra Medium50.3%$0.496,22220
50Kimi K2.7 Code49.7%$1.4331,24758
51GPT-5.6 Luna Medium47.7%$0.087,09528
52Sonnet 5 Low47.7%$0.8716,26933
53Gemini 3.6 Flash Low47.4%$1.1320,52950
54GPT-5.6 Terra Low46.9%$0.425,31219
55GPT-5.5 Low46.6%$0.985,16820
56GPT-5.6 Luna Low37.6%$0.033,20917

Avg cost / task applies each model’s published per-million-token pricing to tokens used on each task. This snapshot has no row-level training-data disclosure markers. Small score gaps may not be statistically meaningful — confirm on cursor.com/cursorbench.

Evidence in this catalog

Where CursorBench fits

Closest verified examples we currently carry. A missing score is not a zero.

Model examples

  • Grok 4.6 Extra High70.8% · $2.81 / task

    Top published CursorBench 3.2 row (full table mirrored 2026-08-12).

  • Fable 5 Max70.5% · $17.32 / task

    Within a point of Grok 4.6 Extra High — small gaps may not be meaningful.

  • Opus 5 Max70.0% · $8.23 / task

    Strong correctness at lower average cost than Fable 5 Max.

Harness examples

  • CursorIDE agent harness

    CursorBench scores models inside Cursor’s agent loop, not bare API chat.

Open this board on CursorBench (live)