findeverythingaiInteractive benchmark desk

PUBLISHED BENCHMARK RESULTS

Terminal-Bench 4.0

Agent and model runs on terminal tasks. Published accuracy, with 95% confidence intervals where reported.

These are publisher-reported model and agent runs. Agent version, reasoning effort or editing format, environment and source dates may differ. Task counts do not prove identical evaluation conditions. Compare setups before drawing conclusions.

Reported costs are evaluation totals in USD, not current API prices. Missing results are not scores of zero. No score is a universal recommendation.

Latest source result: 2026-09-29 · Source check: 2026-10-08 · Source checked successfully

Benchmark publisher ↗ · Apache-2.0 ↗ · Full methodology and provenance

Published suite

21 runs · Task success. Ranks apply within this task cohort.

  1. Filtered rank 1

    Opus 5.5

    Claude Code · 2.1.284Source run ↗
    max · 330 trials
    64.8%±3.11 pp
    95% CI half-width
    Compare
  2. Filtered rank 2

    Sonnet 5.5

    Claude Code · 2.1.284Source run ↗
    max · 330 trials
    61.8%±2.94 pp
    95% CI half-width
    Compare
  3. Filtered rank 3

    GPT-6.1 Sol

    Codex · 0.159.0Source run ↗
    max · 330 trials
    58.2%±3.11 pp
    95% CI half-width
    Compare
  4. Filtered rank 4

    Fable 5.1

    Claude Code · 2.1.257Source run ↗
    max · 330 trials
    57.9%±3.76 pp
    95% CI half-width
    Compare
  5. Filtered rank 5

    Opus 5

    Claude Code · 2.1.231Source run ↗
    max · 330 trials
    51.8%±3.39 pp
    95% CI half-width
    Compare
  6. Filtered rank 6

    GPT-6 Sol

    Codex · 0.159.0Source run ↗
    max · 330 trials
    49.4%±3.23 pp
    95% CI half-width
    Compare
  7. Filtered rank 7

    Fable 5

    Claude Code · 2.1.231Source run ↗
    max · 330 trials
    44.5%±3.85 pp
    95% CI half-width
    Compare
  8. Filtered rank 8

    GLM-5.3

    Claude Code · 2.1.207Source run ↗
    max · 330 trials
    41.8%±3.23 pp
    95% CI half-width
    Compare
  9. Filtered rank 9

    GPT-5.6 Sol

    Codex · 0.149.1Source run ↗
    max · 330 trials
    37.3%±3.78 pp
    95% CI half-width
    Compare
  10. Filtered rank 10

    GLM-5.3-Flash

    Claude Code · 2.1.285Source run ↗
    none · 330 trials
    35.8%±3.54 pp
    95% CI half-width
    Compare
  11. Filtered rank 11

    Qwen3.8-Max-0902

    Claude Code · 2.1.285Source run ↗
    max · 330 trials
    27.0%±3.78 pp
    95% CI half-width
    Compare
  12. Filtered rank 12

    Opus 4.8

    Claude Code · 2.1.231Source run ↗
    max · 330 trials
    23.6%±3.56 pp
    95% CI half-width
    Compare
  13. Filtered rank 13

    GPT-5.6 Terra

    Codex · 0.149.1Source run ↗
    max · 330 trials
    21.5%±3.25 pp
    95% CI half-width
    Compare
  14. Filtered rank 14

    Grok 4.6

    Grok Build · 1.0.5Source run ↗
    none · 330 trials
    20.3%±3.09 pp
    95% CI half-width
    Compare
  15. Filtered rank 15

    Gemini 3.8 Flash

    mini-SWE-agent · 2.4.6Source run ↗
    high · 330 trials
    19.1%±3.36 pp
    95% CI half-width
    Compare
  16. Filtered rank 16

    GPT-5.6 Luna

    Codex · 0.149.1Source run ↗
    max · 330 trials
    17.3%±2.85 pp
    95% CI half-width
    Compare
  17. Filtered rank 17

    GPT-6 Luna

    Codex · 0.159.0Source run ↗
    max · 330 trials
    16.4%±2.72 pp
    95% CI half-width
    Compare
  18. Filtered rank 18

    Muse Spark 1.3

    Muse Code · 1.4.1Source run ↗
    xhigh · 330 trials
    14.6%±2.94 pp
    95% CI half-width
    Compare
  19. Filtered rank 19

    Grok 4.5

    Grok Build · 1.0.5Source run ↗
    none · 330 trials
    12.4%±2.62 pp
    95% CI half-width
    Compare
  20. Filtered rank 20

    Sonnet 5

    Claude Code · 2.1.231Source run ↗
    max · 330 trials
    12.4%±3.06 pp
    95% CI half-width
    Compare
  21. Filtered rank 21

    Gemini 3.7 Flash

    mini-SWE-agent · 2.4.6Source run ↗
    high · 330 trials
    11.2%±2.45 pp
    95% CI half-width
    Compare