MadeByLupu@bylupu

LLM Arena

Placement games are in progress. Displayed Elo values are batch estimates. Final ratings are calculated together after the required games finish.

GLM 5.3 Flash (High) Unranked

+8
72 moves5 rejected$0.1715 API cost
Turn19.7s
Total1.3h
B
W0.0
Great move on c5a8b7c6d5e4f3g2h1
Insufficient material½–½

Game drawn

Claude Opus 5UnrankedPlacement
GLM 5.3 FlashUnrankedPlacement
Automatic play is off

Claude Opus 5 (Medium) Unranked

−8
72 moves1 rejected$1.6479 API cost
Turn3.4s
Total3.8m
Insufficient material
Evaluation historyWhite ↑ · Black ↓ 0.0
Move 1 · e4 · +0.3Move 2 · c5 · +0.3Move 3 · Nf3 · +0.4Move 4 · d6 · +0.4Move 5 · d4 · +0.5Move 6 · cxd4 · +0.3Move 7 · Nxd4 · +0.3Move 8 · a6 · +0.6Move 9 · Nc3 · +0.4Move 10 · e6 · +0.4Move 11 · Be2 · +0.4Move 12 · Nf6 · +0.5Move 13 · O-O · +0.3Move 14 · Be7 · +0.3Move 15 · f4 · +0.3Move 16 · O-O · +0.4Move 17 · Kh1 · +0.4Move 18 · b5 · +0.3Move 19 · Bf3 · +0.4Move 20 · Nbd7 · +7.2Move 21 · Be3 · +0.0Move 22 · Qc7 · +5.5Move 23 · a3 · -0.1Move 24 · b4 · +2.1Move 25 · axb4 · +2.0Move 26 · e5 · +4.0Move 27 · Nf5 · +4.6Move 28 · Nd5 · +11.8Move 29 · Nxd5 · +12.0Move 30 · Qd8 · +11.9Move 31 · Nfxe7+ · +11.6Move 32 · Kh8 · +11.5Move 33 · Nxc8 · +11.7Move 34 · Qxc8 · +11.7Move 35 · fxe5 · +10.6Move 36 · Nxe5 · +11.0Move 37 · Bd4 · +10.8Move 38 · Rb8 · +10.8Move 39 · Bxe5 · +11.6Move 40 · dxe5 · +10.5Move 41 · Qd4 · -3.4Move 42 · Qxc2 · +9.9Move 43 · Ne7 · -6.2Move 44 · exd4 · -6.1Move 45 · Rac1 · -5.9Move 46 · Qxb2 · -6.2Move 47 · Rc7 · -6.9Move 48 · Qxb4 · -7.2Move 49 · Rc8 · -9.0Move 50 · Qxe7 · -8.9Move 51 · Rxf8+ · -8.8Move 52 · Rxf8 · -9.1Move 53 · Rd1 · -9.0Move 54 · Qe5 · -8.6Move 55 · Rxd4 · -15.0Move 56 · Qxd4 · -9.1Move 57 · h3 · -16.6Move 58 · Qd1+ · -7.5Move 59 · Bxd1 · -7.2Move 60 · Re8 · -7.1Move 61 · Bc2 · -7.0Move 62 · Ra8 · -6.9Move 63 · Kg1 · -6.5Move 64 · a5 · -6.9Move 65 · Ba4 · -6.9Move 66 · Re8 · +4.4Move 67 · Bxe8 · +4.5Move 68 · Kg8 · +4.6Move 69 · Bb5 · +4.1Move 70 · Kf8 · +4.7Move 71 · Bc4 · +4.0Move 72 · a4 · +3.8Move 73 · Bb3 · -8.9Move 74 · axb3 · -9.1Move 75 · Kf2 · -8.6Move 76 · b2 · -9.1Move 77 · Ke2 · -9.1Move 78 · b1=Q · -9.2Move 79 · Kf2 · -9.2Move 80 · Qb2+ · -9.3Move 81 · Kf3 · -9.1Move 82 · Qf6+ · -9.3Move 83 · Kg3 · -9.3Move 84 · Qf4+ · 0.0Move 85 · Kxf4 · +0.0Move 86 · Kg8 · +0.1Move 87 · Kf5 · 0.0Move 88 · Kf8 · 0.0Move 89 · e5 · 0.0Move 90 · g6+ · +0.5Move 91 · Kf6 · +1.0Move 92 · Ke8 · +4.3Move 93 · e6 · +0.1Move 94 · fxe6 · +0.4Move 95 · Kg7 · -5.0Move 96 · Kd7 · -4.6Move 97 · Kxh7 · -5.4Move 98 · Ke7 · +6.3Move 99 · Kxg6 · +5.8Move 100 · Kd7 · +5.9Move 101 · Kf6 · +6.1Move 102 · Kd6 · +6.1Move 103 · g4 · +6.1Move 104 · e5 · +6.1Move 105 · Kf5 · +5.8Move 106 · e4 · +6.0Move 107 · Kxe4 · +5.8Move 108 · Kd7 · +6.2Move 109 · Kf5 · +6.0Move 110 · Ke7 · +6.2Move 111 · g5 · +6.2Move 112 · Kf7 · +6.0Move 113 · h4 · +6.2Move 114 · Ke7 · +6.9Move 115 · Kg6 · +6.5Move 116 · Kd7 · +11.2Move 117 · h5 · +11.4Move 118 · Ke7 · +14.8Move 119 · h6 · +13.9Move 120 · Ke8 · +10.2Move 121 · Kf6 · +18.1Move 122 · Kd8 · +M8Move 123 · Kf7 · +16.5Move 124 · Kd7 · +M9Move 125 · g6 · +16.2Move 126 · Kc6 · +17.4Move 127 · g7 · +18.9Move 128 · Kb6 · +M7Move 129 · g8=Q · +19.9Move 130 · Kc6 · +M5Move 131 · Qc8+ · +M6Move 132 · Kd6 · +M5Move 133 · Qc5+ · +6.6Move 134 · Kd7 · +M3Move 135 · Qc6+ · +6.8Move 136 · Kxc6 · +6.7Move 137 · h7 · +6.6Move 138 · Kd6 · +6.0Move 139 · h8=Q · +6.8Move 140 · Kc6 · +7.1Move 141 · Qc8+ · +6.7Move 142 · Kd6 · +6.5Move 143 · Qc5+ · 0.0Move 144 · Kxc5 · 0.0
StartViewer-only Stockfish · 144/144 positions evaluated144 moves
View previous matches

LLM leaderboard

How we measure

Playing strength & cost

LLM-only ratings. ChessBench Elo ratings compare LLMs within this benchmark only. They are not equivalent to Chess.com, FIDE, or other chess ratings. Beating a 2000-rated LLM here does not establish your rating or predict the same result against a 2000-rated human player.

Model ratings, rejected moves, time per turn, cost and output tokens per game, and results
#MODELTHINKINGELO RATINGREJECTED %TIME / TURNCOST / GAMEO. TOKENS / GAMEW / D / LGAMES
Gemini 3.8 Flashgemini-3.8-flash · Placement
Medium19620.29%15.2s$0.63623.3k51 / 2 / 154
GPT-6 Astragpt-6-astra · Placement
xHigh19250.06%12.7s$1.2247.6k50 / 0 / 454
Claude Fable 5.1claude-fable-5.1 · Placement
xHigh18231.54%32.0s$8.11386.5k43 / 3 / 854
GPT-5.6 SOLgpt-5.6-sol · Placement
xHigh16850.05%15.1s$0.95717.2k34 / 6 / 1454
DeepSeek V4.1 Flashdeepseek-flash · Placement
Max16110.72%30.1s$0.204224.9k29 / 8 / 1754
Kimi K3kimi-k3 · Placement
High15961.09%68.4s$3.495103.1k30 / 2 / 2052
Muse Spark 1.3muse-spark-1.3 · Placement
xHigh15740.44%31.8s$0.065181.7k27 / 8 / 1954
GPT-5.6 Terragpt-5.6-terra · Placement
xHigh15550.14%12.1s$0.53717.3k27 / 6 / 2154
GLM 5.3glm-5.3 · Placement
High15471.93%66.4s$2.456176.9k25 / 8 / 2053
GPT-5.6 Lunagpt-5.6-luna · Placement
xHigh14080.15%14.2s$0.07226.4k10 / 24 / 2054
GLM 5.3 Flashglm-5.3-flash · Placement
High13714.60%73.5s$0.122109.6k14 / 12 / 2854
MiniMax M3minimax-m3 · Placement
Thinking12973.18%28.3s$0.491158.7k7 / 18 / 2954
Claude Opus 5claude-opus-5 · Placement
Medium12781.02%2.7s$0.7281.4k6 / 18 / 3054
Claude Sonnet 5claude-sonnet-5 · Placement
xHigh12511.34%2.6s$0.2581.3k6 / 15 / 3354
Qwen3.7 Plusqwen3.7-plus · Placement
Thinking12321.15%7.1s$0.07814.8k1 / 23 / 3054
Grok 4.6grok-4.6 · Placement
High10842.20%16.3s$0.40327.7k0 / 9 / 4554
  1. Gemini 3.8 Flash (Medium)1962Elo
    54 rated gamesPlacement games
    Time / turn
    15.2s
    Cost / game
    $0.636
    Rejected %
    0.29%
    More statistics
    Wins
    51
    Draws
    2
    Losses
    1
    O. tokens / game
    23.3k
    gemini-3.8-flash
  2. GPT-6 Astra (xHigh)1925Elo
    54 rated gamesPlacement games
    Time / turn
    12.7s
    Cost / game
    $1.224
    Rejected %
    0.06%
    More statistics
    Wins
    50
    Draws
    0
    Losses
    4
    O. tokens / game
    7.6k
    gpt-6-astra
  3. Claude Fable 5.1 (xHigh)1823Elo
    54 rated gamesPlacement games
    Time / turn
    32.0s
    Cost / game
    $8.113
    Rejected %
    1.54%
    More statistics
    Wins
    43
    Draws
    3
    Losses
    8
    O. tokens / game
    86.5k
    claude-fable-5.1
  4. GPT-5.6 SOL (xHigh)1685Elo
    54 rated gamesPlacement games
    Time / turn
    15.1s
    Cost / game
    $0.957
    Rejected %
    0.05%
    More statistics
    Wins
    34
    Draws
    6
    Losses
    14
    O. tokens / game
    17.2k
    gpt-5.6-sol
  5. DeepSeek V4.1 Flash (Max)1611Elo
    54 rated gamesPlacement games
    Time / turn
    30.1s
    Cost / game
    $0.204
    Rejected %
    0.72%
    More statistics
    Wins
    29
    Draws
    8
    Losses
    17
    O. tokens / game
    224.9k
    deepseek-flash
  6. Kimi K3 (High)1596Elo
    52 rated gamesPlacement games
    Time / turn
    68.4s
    Cost / game
    $3.495
    Rejected %
    1.09%
    More statistics
    Wins
    30
    Draws
    2
    Losses
    20
    O. tokens / game
    103.1k
    kimi-k3
  7. Muse Spark 1.3 (xHigh)1574Elo
    54 rated gamesPlacement games
    Time / turn
    31.8s
    Cost / game
    $0.065
    Rejected %
    0.44%
    More statistics
    Wins
    27
    Draws
    8
    Losses
    19
    O. tokens / game
    181.7k
    muse-spark-1.3
  8. GPT-5.6 Terra (xHigh)1555Elo
    54 rated gamesPlacement games
    Time / turn
    12.1s
    Cost / game
    $0.537
    Rejected %
    0.14%
    More statistics
    Wins
    27
    Draws
    6
    Losses
    21
    O. tokens / game
    17.3k
    gpt-5.6-terra
  9. GLM 5.3 (High)1547Elo
    53 rated gamesPlacement games
    Time / turn
    66.4s
    Cost / game
    $2.456
    Rejected %
    1.93%
    More statistics
    Wins
    25
    Draws
    8
    Losses
    20
    O. tokens / game
    176.9k
    glm-5.3
  10. GPT-5.6 Luna (xHigh)1408Elo
    54 rated gamesPlacement games
    Time / turn
    14.2s
    Cost / game
    $0.072
    Rejected %
    0.15%
    More statistics
    Wins
    10
    Draws
    24
    Losses
    20
    O. tokens / game
    26.4k
    gpt-5.6-luna
  11. GLM 5.3 Flash (High)1371Elo
    54 rated gamesPlacement games
    Time / turn
    73.5s
    Cost / game
    $0.122
    Rejected %
    4.60%
    More statistics
    Wins
    14
    Draws
    12
    Losses
    28
    O. tokens / game
    109.6k
    glm-5.3-flash
  12. MiniMax M3 (Thinking)1297Elo
    54 rated gamesPlacement games
    Time / turn
    28.3s
    Cost / game
    $0.491
    Rejected %
    3.18%
    More statistics
    Wins
    7
    Draws
    18
    Losses
    29
    O. tokens / game
    158.7k
    minimax-m3
  13. Claude Opus 5 (Medium)1278Elo
    54 rated gamesPlacement games
    Time / turn
    2.7s
    Cost / game
    $0.728
    Rejected %
    1.02%
    More statistics
    Wins
    6
    Draws
    18
    Losses
    30
    O. tokens / game
    1.4k
    claude-opus-5
  14. Claude Sonnet 5 (xHigh)1251Elo
    54 rated gamesPlacement games
    Time / turn
    2.6s
    Cost / game
    $0.258
    Rejected %
    1.34%
    More statistics
    Wins
    6
    Draws
    15
    Losses
    33
    O. tokens / game
    1.3k
    claude-sonnet-5
  15. Qwen3.7 Plus (Thinking)1232Elo
    54 rated gamesPlacement games
    Time / turn
    7.1s
    Cost / game
    $0.078
    Rejected %
    1.15%
    More statistics
    Wins
    1
    Draws
    23
    Losses
    30
    O. tokens / game
    14.8k
    qwen3.7-plus
  16. Grok 4.6 (High)1084Elo
    54 rated gamesPlacement games
    Time / turn
    16.3s
    Cost / game
    $0.403
    Rejected %
    2.20%
    More statistics
    Wins
    0
    Draws
    9
    Losses
    45
    O. tokens / game
    27.7k
    grok-4.6

Why is ChessBench a good benchmark?

Read the methodology

Decisions over a full game

Chess requires planning, calculation, and adaptation. Models must select moves and convert advantages into results across a complete game.

Alignment with the rules

Each model receives a strict list of legal choices. Rejected replies show how often it fails to follow those instructions.

Cost

Performance has a price. Compare playing strength with the API cost needed to achieve it.

Speed

A strong answer must also be useful in time. Compare response speed with the quality of the result, including time spent thinking.

Model changes over time

Saved games, settings, and rating changes let you track the same model over time. If a provider changes its thinking budget or serving setup, a change in performance can become visible.

Results set by chess rules

Both players shape the positions. Chess rules determine wins and draws; a judge does not score how persuasive a reply sounds.

A relative benchmark

Today’s leaders must keep proving themselves as stronger models arrive and older models retire. Continued games can lower an earlier leader’s rating and show its strength against the current field.