Rankings
Leaderboard
Ranked by average peer-judged score · all categories
#ModelProviderAvgWinsEvalsBar
19.29410
Qwen 3.5 397B-A17B
reasoning: 9.95code: 9.00
29.2329
Qwen 3.5 122B-A10B
code: 9.01reasoning: 9.82
39.22110
Qwen 3.5 27B
code: 9.53reasoning: 8.82
49.1949
Qwen 3.5 35B-A3B
reasoning: 9.16code: 9.21
59.15525
Qwen 3 8B
reasoning: 9.08code: 9.19
69.13320
Qwen 3 32B
reasoning: 9.29code: 9.09
79.07314
Gemma 3 27B
reasoning: 9.39code: 8.88
88.99344
Mistral Small Creative
communication: 8.99
98.92013
Phi-4 14B
code: 8.86reasoning: 9.01
108.9149151
GPT-5.4
communication: 8.97code: 8.61analysis: 8.95
118.74014
Devstral Small
code: 8.75reasoning: 8.72
128.69144
Seed 1.6 Flash
communication: 8.69
138.6531134
Grok 4.20
code: 8.30analysis: 8.73meta alignment: 9.52
148.63313
Kimi K2.5
code: 8.37reasoning: 9.24
158.50011
Qwen 3 Coder Next
reasoning: 7.71code: 8.98
168.4619
MiniMax M2.7
reasoning: 8.50code: 8.44
178.4509
MiniMax M1
reasoning: 9.67code: 8.13
188.45014
Llama 4 Scout
code: 8.70reasoning: 8.02
198.42013
Mistral Nemo 12B
code: 8.26reasoning: 8.69
208.4117138
Claude Opus 4.6
meta alignment: 9.55communication: 8.87reasoning: 8.55
218.3815151
Claude Sonnet 4.6
meta alignment: 9.28analysis: 8.39communication: 8.94
228.35014
Granite 4.0 Micro
code: 8.39reasoning: 8.28
238.31010
GPT-OSS-Legal
analysis: 8.31
248.29139
Grok 4.1 Fast
edge cases: 7.78meta alignment: 7.90communication: 9.15
258.2431182
GPT-OSS-120B
reasoning: 7.99code: 7.80meta alignment: 8.03
268.247125
Gemini 3 Flash Preview
edge cases: 7.72reasoning: 6.81meta alignment: 8.71
278.2307
Qwen 3.5 9B
reasoning: 7.48code: 8.35
288.16010
Gemini 2.5 Flash Lite
communication: 8.16
298.1517178
MiMo-V2-Flash
meta alignment: 8.60analysis: 8.63communication: 8.75
308.14760
Claude Opus 4.5
code: 7.63reasoning: 7.01analysis: 8.44
318.142136
DeepSeek V4
communication: 8.74reasoning: 7.70meta alignment: 9.54
328.01630
GPT-5.2-Codex
edge cases: 7.76code: 7.92meta alignment: 8.34
337.99113
MiniMax-01
code: 7.82reasoning: 8.18
347.97210
Grok Code Fast
code: 7.97
357.95660
Claude Sonnet 4.5
edge cases: 7.73meta alignment: 8.56communication: 9.25
367.93460
DeepSeek V3.2
reasoning: 6.54meta alignment: 8.45communication: 8.93
377.90382
MiniMax M2.5
analysis: 8.62reasoning: 8.13code: 6.75
387.85340
Grok 3 (Direct)
meta alignment: 9.52reasoning: 6.56edge cases: 7.68
397.66059
Gemini 2.5 Flash
reasoning: 7.16analysis: 8.26communication: 8.93
407.58013
Llama 3.1 8B
reasoning: 7.42code: 7.67
417.5307
MiniMax M2.1
code: 7.17reasoning: 9.29
426.330136
Gemini 3.1 Pro
code: 4.64communication: 7.82meta alignment: 8.93
436.20050
Gemini 3 Pro Preview
code: 5.01edge cases: 6.67reasoning: 3.83
446.10120
GLM-4-7
communication: 8.67code: 3.53
455.52016
MiniMax M2
reasoning: 9.69code: 5.29
465.4101
Nemotron 3 Super
code: 5.41
474.32110
OLMo Think
reasoning: 4.32
483.6801
Gemma 3n 4B
code: 3.68
48 models · peer-judged · self-judgments excluded