findeverythingaiInteractive benchmark desk

PUBLISHED BENCHMARK RESULTS

Aider Polyglot

Code editing across multiple programming languages using Aider. Historical runs; filter by task count before comparing.

These are publisher-reported model and agent runs. Agent version, reasoning effort or editing format, environment and source dates may differ. Task counts do not prove identical evaluation conditions. Compare setups before drawing conclusions.

Reported costs are evaluation totals in USD, not current API prices. Missing results are not scores of zero. No score is a universal recommendation.

Historical coverage: this source contains older Aider evaluations. Refreshing the source does not make the underlying results current.

Latest source result: 2025-10-03 · Source check: 2026-10-08 · Source checked successfully

Benchmark publisher ↗ · Apache-2.0 ↗ · Full methodology and provenance

225 tasks

63 runs · Pass rate after 2 attempts. Ranks apply within this task cohort.

  1. Filtered rank 1

    gpt-5 (high)

    Aider · 0.86.2.devSource run ↗
    diff · 225 tasks
    88.0%
    Compare
  2. Filtered rank 2

    gpt-5 (medium)

    Aider · 0.86.2.devSource run ↗
    diff · 225 tasks
    86.7%
    Compare
  3. Filtered rank 3

    o3-pro (high)

    Aider · 0.85.1.devSource run ↗
    diff · 225 tasks
    84.9%
    Compare
  4. Filtered rank 4

    gemini-2.5-pro-preview-06-05 (32k think)

    Aider · 0.84.1.devSource run ↗
    diff-fenced · 225 tasks
    83.1%
    Compare
  5. Filtered rank 5

    gpt-5 (low)

    Aider · 0.86.2.devSource run ↗
    diff · 225 tasks
    81.3%
    Compare
  6. Filtered rank 6

    o3 (high)

    Aider · 0.84.1.devSource run ↗
    diff · 225 tasks
    81.3%
    Compare
  7. Filtered rank 7

    grok-4 (high)

    Aider · 0.85.2.devSource run ↗
    diff · 225 tasks
    79.6%
    Compare
  8. Filtered rank 8

    gemini-2.5-pro-preview-06-05 (default think)

    Aider · 0.84.1.devSource run ↗
    diff-fenced · 225 tasks
    79.1%
    Compare
  9. Filtered rank 9

    Gemini 2.5 Pro Preview 05-06

    Aider · 0.82.4.devSource run ↗
    diff-fenced · 225 tasks
    76.9%
    Compare
  10. Filtered rank 10

    o3

    Aider · 0.84.1.devSource run ↗
    diff · 225 tasks
    76.9%
    Compare
  11. Filtered rank 11

    DeepSeek-V3.2-Exp (Reasoner)

    Aider · 0.86.2.devSource run ↗
    diff · 225 tasks
    74.2%
    Compare
  12. Filtered rank 12

    Gemini 2.5 Pro Preview 03-25

    Aider · 0.81.3.devSource run ↗
    diff-fenced · 225 tasks
    72.9%
    Compare
  13. Filtered rank 13

    claude-opus-4-20250514 (32k thinking)

    Aider · 0.83.3.devSource run ↗
    diff · 225 tasks
    72.0%
    Compare
  14. Filtered rank 14

    o4-mini (high)

    Aider · 0.82.1.devSource run ↗
    diff · 225 tasks
    72.0%
    Compare
  15. Filtered rank 15

    claude-opus-4-20250514 (no think)

    Aider · 0.83.3.devSource run ↗
    diff · 225 tasks
    70.7%
    Compare
  16. Filtered rank 16

    DeepSeek-V3.2-Exp (Chat)

    Aider · 0.86.2.devSource run ↗
    diff · 225 tasks
    70.2%
    Compare
  17. Filtered rank 17

    claude-3-7-sonnet-20250219 (32k thinking tokens)

    Aider · 0.75.1.devSource run ↗
    diff · 225 tasks
    64.9%
    Compare
  18. Filtered rank 18

    DeepSeek R1 + claude-3-5-sonnet-20241022

    Aider · 0.72.3.devSource run ↗
    architect · 225 tasks
    64.0%
    Compare
  19. Filtered rank 19

    claude-sonnet-4-20250514 (32k thinking)

    Aider · 0.83.3.devSource run ↗
    diff · 225 tasks
    61.3%
    Compare
  20. Filtered rank 20

    claude-3-7-sonnet-20250219 (no thinking)

    Aider · 0.74.4.devSource run ↗
    diff · 225 tasks
    60.4%
    Compare
  21. Filtered rank 21

    Qwen3 235B A22B diff, no think, Alibaba API

    Aider · 0.82.4.devSource run ↗
    diff · 225 tasks
    59.6%
    Compare
  22. Filtered rank 22

    Kimi K2

    Aider · 0.85.3.devSource run ↗
    diff · 225 tasks
    59.1%
    Compare
  23. Filtered rank 23

    DeepSeek R1

    Aider · 0.71.2.devSource run ↗
    diff · 225 tasks
    56.9%
    Compare
  24. Filtered rank 24

    claude-sonnet-4-20250514 (no thinking)

    Aider · 0.83.3.devSource run ↗
    diff · 225 tasks
    56.4%
    Compare
  25. Filtered rank 25

    DeepSeek V3 (0324)

    Aider · 0.78.1.devSource run ↗
    diff · 225 tasks
    55.1%
    Compare
  26. Filtered rank 26

    gemini-2.5-flash-preview-05-20 (24k think)

    Aider · 0.83.3.devSource run ↗
    diff · 225 tasks
    55.1%
    Compare
  27. Filtered rank 27

    Quasar Alpha

    Aider · 0.80.5.devSource run ↗
    diff · 225 tasks
    54.7%
    Compare
  28. Filtered rank 28

    o3-mini (medium)

    Aider · 0.72.4.devSource run ↗
    diff · 225 tasks
    53.8%
    Compare
  29. Filtered rank 29

    Grok 3 Beta

    Aider · 0.81.2.devSource run ↗
    diff · 225 tasks
    53.3%
    Compare
  30. Filtered rank 30

    Optimus Alpha

    Aider · 0.81.2.devSource run ↗
    diff · 225 tasks
    52.9%
    Compare
  31. Filtered rank 31

    gpt-4.1

    Aider · 0.81.4.devSource run ↗
    diff · 225 tasks
    52.4%
    Compare
  32. Filtered rank 32

    claude-3-5-sonnet-20241022

    Aider · 0.71.2.devSource run ↗
    diff · 225 tasks
    51.6%
    Compare
  33. Filtered rank 33

    Grok 3 Mini Beta (high)

    Aider · 0.81.3.devSource run ↗
    whole · 225 tasks
    49.3%
    Compare
  34. Filtered rank 34

    DeepSeek Chat V3 (prev)

    Aider · 0.69.2.devSource run ↗
    diff · 225 tasks
    48.4%
    Compare
  35. Filtered rank 35

    gemini-2.5-flash-preview-04-17 (default)

    Aider · 0.82.3.devSource run ↗
    diff · 225 tasks
    47.1%
    Compare
  36. Filtered rank 36

    chatgpt-4o-latest (2025-03-29)

    Aider · 0.79.3.devSource run ↗
    diff · 225 tasks
    45.3%
    Compare
  37. Filtered rank 37

    gemini-2.5-flash-preview-05-20 (no think)

    Aider · 0.83.3.devSource run ↗
    diff · 225 tasks
    44.0%
    Compare
  38. Filtered rank 38

    gpt-oss-120b (high)

    Aider · 0.85.3.devSource run ↗
    diff · 225 tasks
    41.8%
    Compare
  39. Filtered rank 39

    Qwen3 32B

    Aider · 0.82.4.devSource run ↗
    diff · 225 tasks
    40.0%
    Compare
  40. Filtered rank 40

    gemini-exp-1206

    Aider · 0.69.2.devSource run ↗
    whole · 225 tasks
    38.2%
    Compare
  41. Filtered rank 41

    Gemini 2.0 Pro exp-02-05

    Aider · 0.75.2.devSource run ↗
    whole · 225 tasks
    35.6%
    Compare
  42. Filtered rank 42

    Grok 3 Mini Beta (low)

    Aider · 0.81.2.devSource run ↗
    whole · 225 tasks
    34.7%
    Compare
  43. Filtered rank 43

    o1-mini-2024-09-12

    Aider · 0.69.2.devSource run ↗
    whole · 225 tasks
    32.9%
    Compare
  44. Filtered rank 44

    gpt-4.1-mini

    Aider · 0.81.4.devSource run ↗
    diff · 225 tasks
    32.4%
    Compare
  45. Filtered rank 45

    claude-3-5-haiku-20241022

    Aider · 0.69.2.devSource run ↗
    diff · 225 tasks
    28.0%
    Compare
  46. Filtered rank 46

    QwQ-32B + Qwen 2.5 Coder Instruct

    Aider · 0.75.3.devSource run ↗
    architect · 225 tasks
    26.2%
    Compare
  47. Filtered rank 47

    gpt-4o-2024-08-06

    Aider · 0.70.1.devSource run ↗
    diff · 225 tasks
    23.1%
    Compare
  48. Filtered rank 48

    gemini-2.0-flash-exp

    Aider · 0.69.2.devSource run ↗
    whole · 225 tasks
    22.2%
    Compare
  49. Filtered rank 49

    qwen-max-2025-01-25

    Aider · 0.72.4.devSource run ↗
    diff · 225 tasks
    21.8%
    Compare
  50. Filtered rank 50

    QwQ-32B

    Aider · 0.75.3.devSource run ↗
    diff · 225 tasks
    20.9%
    Compare
  51. Filtered rank 51

    gemini-2.0-flash-thinking-exp-01-21

    Aider · 0.72.2.devSource run ↗
    diff · 225 tasks
    18.2%
    Compare
  52. Filtered rank 52

    gpt-4o-2024-11-20

    Aider · 0.70.1.devSource run ↗
    diff · 225 tasks
    18.2%
    Compare
  53. Filtered rank 53

    DeepSeek Chat V2.5

    Aider · 0.69.2.devSource run ↗
    diff · 225 tasks
    17.8%
    Compare
  54. Filtered rank 54

    Qwen2.5-Coder-32B-Instruct

    Aider · 0.69.2.devSource run ↗
    whole · 225 tasks
    16.4%
    Compare
  55. Filtered rank 55

    Llama 4 Maverick

    Aider · 0.81.2.devSource run ↗
    whole · 225 tasks
    15.6%
    Compare
  56. Filtered rank 56

    yi-lightning

    Aider · 0.69.2.devSource run ↗
    whole · 225 tasks
    12.9%
    Compare
  57. Filtered rank 57

    command-a-03-2025-quality

    Aider · 0.77.1.devSource run ↗
    whole · 225 tasks
    12.0%
    Compare
  58. Filtered rank 58

    Codestral 25.01

    Aider · 0.71.2.devSource run ↗
    whole · 225 tasks
    11.1%
    Compare
  59. Filtered rank 59

    openhands-lm-32b-v0.1

    Aider · 0.82.2.devSource run ↗
    whole · 225 tasks
    10.2%
    Compare
  60. Filtered rank 60

    gpt-4.1-nano

    Aider · 0.81.4.devSource run ↗
    whole · 225 tasks
    8.9%
    Compare
  61. Filtered rank 61

    Qwen2.5-Coder-32B-Instruct

    Aider · 0.69.2.devSource run ↗
    diff · 225 tasks
    8.0%
    Compare
  62. Filtered rank 62

    gemma-3-27b-it

    Aider · 0.77.1.devSource run ↗
    whole · 225 tasks
    4.9%
    Compare
  63. Filtered rank 63

    gpt-4o-mini-2024-07-18

    Aider · 0.69.2.devSource run ↗
    whole · 225 tasks
    3.6%
    Compare

224 tasks

5 runs · Pass rate after 2 attempts. Ranks apply within this task cohort.

  1. Filtered rank 1

    o3 (high) + gpt-4.1

    Aider · 0.85.1.devSource run ↗
    architect · 224 tasks
    78.2%
    Compare
  2. Filtered rank 2

    DeepSeek R1 (0528)

    Aider · 0.84.1.devSource run ↗
    diff · 224 tasks
    71.4%
    Compare
  3. Filtered rank 3

    o1-2024-12-17 (high)

    Aider · 0.69.2.devSource run ↗
    diff · 224 tasks
    61.7%
    Compare
  4. Filtered rank 4

    o3-mini (high)

    Aider · 0.72.4.devSource run ↗
    diff · 224 tasks
    60.4%
    Compare
  5. Filtered rank 5

    gpt-4.5-preview

    Aider · 0.75.2.devSource run ↗
    diff · 224 tasks
    44.9%
    Compare

223 tasks

1 runs · Pass rate after 2 attempts. Ranks apply within this task cohort.

  1. Filtered rank 1

    chatgpt-4o-latest (2025-02-15)

    Aider · 0.74.3.devSource run ↗
    diff · 223 tasks
    27.1%
    Compare