PUBLISHED BENCHMARK RESULTS
Terminal-Bench 2.1
A separate terminal task suite. Published accuracy; uncertainty is standard error, not a 95% confidence interval.
These are publisher-reported model and agent runs. Agent version, reasoning effort or editing format, environment and source dates may differ. Task counts do not prove identical evaluation conditions. Compare setups before drawing conclusions.
Reported costs are evaluation totals in USD, not current API prices. Missing results are not scores of zero. No score is a universal recommendation.
Benchmark publisher ↗ · Apache-2.0 ↗ · Full methodology and provenance
Published suite
- Filtered rank 1
Fable 5
Source run ↗xhigh83.8%±1.16 ppCompare
Standard error - Filtered rank 2
GPT-5.5
Source run ↗xhigh83.2%±1.13 ppCompare
Standard error - Filtered rank 3
Fable 5
Source run ↗high80.5%±1.16 ppCompare
Standard error - Filtered rank 4
Grok 4.5
Source run ↗high79.3%±1.46 ppCompare
Standard error - Filtered rank 5
Opus 4.8
Source run ↗high78.9%±1.31 ppCompare
Standard error - Filtered rank 6
GPT-5.6 Terra
Source run ↗max78.4%±1.25 ppCompare
Standard error - Filtered rank 7
GPT-5.5
Source run ↗xhigh78.0%±1.22 ppCompare
Standard error - Filtered rank 8
GPT-5.6 Sol
Source run ↗max76.2%±1.28 ppCompare
Standard error - Filtered rank 9
Muse Spark 1.1
Source run ↗xhigh76.2%±1.23 ppCompare
Standard error - Filtered rank 10
GPT-5.6 Luna
Source run ↗max75.7%±1.32 ppCompare
Standard error - Filtered rank 11
Sonnet 5
Source run ↗high74.6%±1.64 ppCompare
Standard error - Filtered rank 12
GPT-5.6 Terra
Source run ↗max74.4%±1.54 ppCompare
Standard error - Filtered rank 13
Gemini 3 Pro
Source run ↗high73.9%±1.29 ppCompare
Standard error - Filtered rank 14
GPT-5.6 Luna
Source run ↗max71.2%±1.39 ppCompare
Standard error - Filtered rank 15
Opus 4.7
Source run ↗max68.9%±1.41 ppCompare
Standard error - Filtered rank 16
Opus 4.7
Source run ↗max66.1%±1.37 ppCompare
Standard error - Filtered rank 17
Gemini 3 Pro
Source run ↗high65.8%±1.38 ppCompare
Standard error - Filtered rank 18
Gemini 3.1 Pro
Source run ↗high65.8%±1.67 ppCompare
Standard error - Filtered rank 19
Gemini 3.1 Pro
Source run ↗high65.6%±1.65 ppCompare
Standard error - Filtered rank 20
GLM-5.1
Source run ↗max58.6%±1.24 ppCompare
Standard error