Skip to content

Benchmarks

Intelligence test

Models are ranked by pairwise comparison, not by an absolute score. On every prompt each pair of models is compared head-to-head, and a Bradley-Terry model fits a rating from those comparisons. The win rate below turns that rating into the question it answers: how often this model beats an average model on this board. 50% is average.

How this is scored

8,228

scored runs

111,690

pairwise comparisons

24

prompts

4,629

runs without a score (provider error)

22 of 24 prompts separate models at all. The rest are answered equally well by nearly everyone and carry no ranking signal — that is what an absolute score near 100 was really measuring.

  • Coding 4/4
  • Creative 2/2
  • Factual 3/4
  • Multilingual 7/8
  • Reasoning 4/4
  • Healthcare 2/2
Rank 1OpenAI
73%±2

Win rate

Elo 1174

Won / lost / tied
1062 / 83 / 1366
prompts
20
comparisons
2511
Judge mean
96.9

By category

Coding80%
Creative89%
Factual68%
Multilingual67%
Reasoning74%
Rank 1OpenAI
73%±2

Win rate

Elo 1169

gpt-5.1
Tier B
Won / lost / tied
1047 / 97 / 1367
prompts
20
comparisons
2511
Judge mean
96.3

By category

Coding75%
Creative79%
Factual71%
Multilingual70%
Reasoning79%
Rank 1OpenAI
72%±2

Win rate

Elo 1166

Won / lost / tied
1190 / 178 / 1344
prompts
24
comparisons
2712
Judge mean
96.4

By category

Coding79%
Creative91%
Factual71%
Multilingual60%
Reasoning77%
Healthcare75%
Rank 1OpenAI
71%±2

Win rate

Elo 1157

Won / lost / tied
1085 / 133 / 1494
prompts
24
comparisons
2712
Judge mean
96.6

By category

Coding71%
Creative92%
Factual71%
Multilingual65%
Reasoning73%
Healthcare84%
Rank 1OpenAI
70%±2

Win rate

Elo 1148

gpt-5.5
Tier C
Won / lost / tied
1015 / 188 / 1308
prompts
20
comparisons
2511
Judge mean
95.1

By category

Coding69%
Creative82%
Factual74%
Multilingual66%
Reasoning74%
Rank 1OpenAI
70%±2

Win rate

Elo 1148

Won / lost / tied
1009 / 185 / 1317
prompts
20
comparisons
2511
Judge mean
95.5

By category

Coding80%
Creative78%
Factual52%
Multilingual69%
Reasoning79%
Rank 1OpenAI
70%±2

Win rate

Elo 1146

gpt-4.1
Tier B
Won / lost / tied
1060 / 184 / 1468
prompts
24
comparisons
2712
Judge mean
96.2

By category

Coding75%
Creative83%
Factual66%
Multilingual64%
Reasoning73%
Healthcare79%
Rank 1OpenAI
70%±2

Win rate

Elo 1145

gpt-5.2
Tier B
Won / lost / tied
1017 / 208 / 1286
prompts
20
comparisons
2511
Judge mean
95.7

By category

Coding64%
Creative92%
Factual72%
Multilingual66%
Reasoning74%
Rank 2OpenAI
69%±2

Win rate

Elo 1143

Won / lost / tied
1022 / 228 / 1261
prompts
20
comparisons
2511
Judge mean
95.6

By category

Coding72%
Creative92%
Factual59%
Multilingual63%
Reasoning79%
Rank 2Anthropic
69%±2

Win rate

Elo 1141

Claude Opus 4.6
Tier Barchived
Won / lost / tied
1105 / 258 / 1349
prompts
24
comparisons
2712
Judge mean
97.6

By category

Coding61%
Creative93%
Factual73%
Multilingual64%
Reasoning74%
Healthcare90%
Rank 2OpenAI
69%±2

Win rate

Elo 1140

Won / lost / tied
1042 / 204 / 1466
prompts
24
comparisons
2712
Judge mean
95.6

By category

Coding72%
Creative82%
Factual64%
Multilingual68%
Reasoning74%
Healthcare70%
Rank 2Z.ai (GLM / Zhipu)
69%±2

Win rate

Elo 1137

GLM-4.7
Tier A
Won / lost / tied
781 / 223 / 817
prompts
14
comparisons
1821
Judge mean
92.7

By category

Coding60%
Creative85%
Factual75%
Reasoning74%
Rank 4OpenAI
68%±2

Win rate

Elo 1132

Won / lost / tied
979 / 254 / 1278
prompts
20
comparisons
2511
Judge mean
96.1

By category

Coding72%
Creative89%
Factual57%
Multilingual64%
Reasoning74%
Rank 5OpenAI
68%±2

Win rate

Elo 1127

gpt-5.4
Tier A
Won / lost / tied
941 / 244 / 1326
prompts
20
comparisons
2511
Judge mean
96.0

By category

Coding65%
Creative90%
Factual57%
Multilingual68%
Reasoning74%
Rank 5OpenAI
67%±2

Win rate

Elo 1125

Won / lost / tied
903 / 223 / 1385
prompts
20
comparisons
2511
Judge mean
95.3

By category

Coding72%
Creative73%
Factual62%
Multilingual64%
Reasoning74%
Rank 5Z.ai (GLM / Zhipu)
67%±2

Win rate

Elo 1120

GLM-4.5
Tier A
Won / lost / tied
775 / 279 / 830
prompts
14
comparisons
1884
Judge mean
91.5

By category

Coding75%
Creative85%
Factual64%
Reasoning52%
Rank 6OpenAI
66%±2

Win rate

Elo 1119

gpt-4o-2024-05-13
Tier Carchived
Won / lost / tied
979 / 281 / 1452
prompts
24
comparisons
2712
Judge mean
95.9

By category

Coding64%
Creative82%
Factual66%
Multilingual64%
Reasoning73%
Healthcare75%
Rank 12OpenAI
65%±2

Win rate

Elo 1110

gpt-4o
Tier C
Won / lost / tied
979 / 344 / 1389
prompts
24
comparisons
2712
Judge mean
95.3

By category

Coding57%
Creative73%
Factual73%
Multilingual64%
Reasoning73%
Healthcare67%
Rank 12OpenAI
65%±2

Win rate

Elo 1108

Won / lost / tied
899 / 324 / 1288
prompts
20
comparisons
2511
Judge mean
94.2

By category

Coding64%
Creative89%
Factual54%
Multilingual63%
Reasoning74%
Rank 12OpenAI
65%±2

Win rate

Elo 1106

Won / lost / tied
971 / 361 / 1380
prompts
24
comparisons
2712
Judge mean
95.0

By category

Coding67%
Creative86%
Factual59%
Multilingual53%
Reasoning77%
Healthcare87%
Rank 13OpenAI
64%±2

Win rate

Elo 1103

Won / lost / tied
1008 / 417 / 1287
prompts
24
comparisons
2712
Judge mean
94.5

By category

Coding66%
Creative82%
Factual60%
Multilingual52%
Reasoning78%
Healthcare89%
Rank 13Anthropic
64%±2

Win rate

Elo 1103

Claude Opus 4.5
Tier Barchived
Won / lost / tied
976 / 386 / 1350
prompts
24
comparisons
2712
Judge mean
96.5

By category

Coding53%
Creative58%
Factual78%
Multilingual63%
Reasoning74%
Healthcare88%
Rank 14Anthropic
63%±2

Win rate

Elo 1096

Claude Sonnet 5
Tier Aarchived
Won / lost / tied
586 / 299 / 655
prompts
16
comparisons
1540
Judge mean
89.7

By category

Coding62%
Creative89%
Factual61%
Multilingual65%
Reasoning53%
Rank 16Anthropic
63%±2

Win rate

Elo 1091

Claude Opus 4.7
Tier Barchived
Won / lost / tied
953 / 448 / 1311
prompts
24
comparisons
2712
Judge mean
95.5

By category

Coding47%
Creative60%
Factual81%
Multilingual60%
Reasoning73%
Healthcare81%
Rank 18Google Gemini
62%±2

Win rate

Elo 1088

Won / lost / tied
990 / 504 / 1218
prompts
24
comparisons
2712
Judge mean
95.2

By category

Coding65%
Creative45%
Factual69%
Multilingual61%
Reasoning63%
Healthcare85%
Rank 16Z.ai (GLM / Zhipu)
62%±2

Win rate

Elo 1088

GLM-5
Tier A
Won / lost / tied
552 / 255 / 731
prompts
14
comparisons
1538
Judge mean
94.4

By category

Coding57%
Creative89%
Factual64%
Reasoning62%
Rank 17Google Gemini
62%±2

Win rate

Elo 1087

Nano Banana
Tier Barchived
Won / lost / tied
615 / 274 / 910
prompts
23
comparisons
1799
Judge mean
93.5

By category

Coding51%
Creative70%
Factual61%
Multilingual65%
Reasoning74%
Healthcare58%
Rank 18OpenAI
62%±2

Win rate

Elo 1085

Won / lost / tied
900 / 436 / 1376
prompts
24
comparisons
2712
Judge mean
90.2

By category

Coding60%
Creative72%
Factual54%
Multilingual67%
Reasoning68%
Healthcare54%
Rank 18OVH AI Endpoints (GRA)
62%±2

Win rate

Elo 1084

Won / lost / tied
850 / 429 / 1232
prompts
20
comparisons
2511
Judge mean
93.1

By category

Coding59%
Creative84%
Factual62%
Multilingual54%
Reasoning70%
Rank 18OpenAI
62%±2

Win rate

Elo 1084

Won / lost / tied
903 / 449 / 1360
prompts
24
comparisons
2712
Judge mean
92.9

By category

Coding71%
Creative66%
Factual61%
Multilingual54%
Reasoning68%
Healthcare35%
Rank 18OpenAI
62%±2

Win rate

Elo 1083

o1
Tier Carchived
Won / lost / tied
801 / 398 / 1186
prompts
20
comparisons
2385
Judge mean
89.6

By category

Coding76%
Creative55%
Factual43%
Multilingual65%
Reasoning60%
Rank 18Anthropic
62%±2

Win rate

Elo 1083

Claude Sonnet 4.6
Tier Aarchived
Won / lost / tied
893 / 446 / 1373
prompts
24
comparisons
2712
Judge mean
95.1

By category

Coding56%
Creative54%
Factual66%
Multilingual60%
Reasoning73%
Healthcare82%
Rank 19OpenAI
61%±2

Win rate

Elo 1080

o1-2024-12-17
Tier Carchived
Won / lost / tied
780 / 396 / 1209
prompts
20
comparisons
2385
Judge mean
86.0

By category

Coding76%
Creative6%
Factual60%
Multilingual68%
Reasoning60%
Rank 21Anthropic
61%±2

Win rate

Elo 1077

Claude Fable 5
Tier Aarchived
Won / lost / tied
805 / 427 / 1320
prompts
20
comparisons
2552
Judge mean
89.2

By category

Coding63%
Creative67%
Factual49%
Multilingual65%
Reasoning68%
Rank 21OpenAI
61%±2

Win rate

Elo 1076

Won / lost / tied
871 / 470 / 1371
prompts
24
comparisons
2712
Judge mean
94.8

By category

Coding53%
Creative50%
Factual71%
Multilingual58%
Reasoning72%
Healthcare86%
Rank 23OpenAI
61%±2

Win rate

Elo 1074

o4-mini
Tier Carchived
Won / lost / tied
789 / 444 / 1152
prompts
20
comparisons
2385
Judge mean
80.6

By category

Coding70%
Creative79%
Factual50%
Multilingual57%
Reasoning54%
Rank 23OpenAI
60%±2

Win rate

Elo 1074

Won / lost / tied
895 / 512 / 1305
prompts
24
comparisons
2712
Judge mean
93.2

By category

Coding52%
Creative73%
Factual68%
Multilingual62%
Reasoning60%
Healthcare72%
Rank 23OpenAI
60%±2

Win rate

Elo 1073

Won / lost / tied
902 / 524 / 1286
prompts
24
comparisons
2712
Judge mean
94.3

By category

Coding53%
Creative77%
Factual62%
Multilingual55%
Reasoning73%
Healthcare72%
Rank 23Anthropic
60%±2

Win rate

Elo 1073

Claude Sonnet 4.5
Tier Barchived
Won / lost / tied
911 / 536 / 1265
prompts
24
comparisons
2712
Judge mean
94.5

By category

Coding39%
Creative57%
Factual74%
Multilingual61%
Reasoning77%
Healthcare78%
Rank 23OpenAI
60%±2

Win rate

Elo 1072

o3
Tier C
Won / lost / tied
758 / 432 / 1123
prompts
20
comparisons
2313
Judge mean
82.6

By category

Coding64%
Creative88%
Factual57%
Multilingual53%
Reasoning54%
Rank 23Google Gemini
60%±3

Win rate

Elo 1070

Won / lost / tied
501 / 290 / 608
prompts
18
comparisons
1399
Judge mean
92.6

By category

Coding70%
Creative61%
Factual53%
Multilingual67%
Reasoning65%
Healthcare36%
Rank 23OpenAI
60%±2

Win rate

Elo 1068

o3-mini-2025-01-31
Tier Carchived
Won / lost / tied
762 / 451 / 1235
prompts
20
comparisons
2448
Judge mean
90.4

By category

Coding68%
Creative72%
Factual42%
Multilingual64%
Reasoning57%
Rank 23OpenAI
59%±2

Win rate

Elo 1066

gpt-4-turbo
Tier Carchived
Won / lost / tied
867 / 542 / 1303
prompts
24
comparisons
2712
Judge mean
94.1

By category

Coding48%
Creative71%
Factual70%
Multilingual56%
Reasoning65%
Healthcare78%
Rank 23OpenAI
59%±2

Win rate

Elo 1065

o4-mini-2025-04-16
Tier Barchived
Won / lost / tied
722 / 437 / 1154
prompts
20
comparisons
2313
Judge mean
80.4

By category

Coding57%
Creative69%
Factual45%
Multilingual70%
Reasoning61%
Rank 23OpenAI
59%±2

Win rate

Elo 1063

Won / lost / tied
788 / 505 / 1218
prompts
20
comparisons
2511
Judge mean
87.2

By category

Coding59%
Creative30%
Factual49%
Multilingual69%
Reasoning74%
Rank 26OpenAI
58%±2

Win rate

Elo 1059

o3-2025-04-16
Tier Barchived
Won / lost / tied
648 / 414 / 1161
prompts
19
comparisons
2223
Judge mean
81.0

By category

Coding65%
Creative84%
Factual43%
Multilingual56%
Reasoning54%
Rank 26Google Gemini
58%±2

Win rate

Elo 1058

Gemini 3.1 Flash Lite
Tier Barchived
Won / lost / tied
735 / 484 / 1292
prompts
20
comparisons
2511
Judge mean
93.5

By category

Coding54%
Creative42%
Factual60%
Multilingual59%
Reasoning74%
Rank 26Anthropic
58%±2

Win rate

Elo 1058

Claude Opus 4.8
Tier Aarchived
Won / lost / tied
778 / 529 / 1204
prompts
20
comparisons
2511
Judge mean
94.6

By category

Coding46%
Creative44%
Factual70%
Multilingual58%
Reasoning74%
Rank 31OpenAI
58%±2

Win rate

Elo 1055

Won / lost / tied
862 / 611 / 1239
prompts
24
comparisons
2712
Judge mean
89.4

By category

Coding61%
Creative70%
Factual49%
Multilingual58%
Reasoning63%
Healthcare49%
Rank 34OpenAI
57%±2

Win rate

Elo 1051

gpt-4.1-nano
Tier Carchived
Won / lost / tied
831 / 610 / 1271
prompts
24
comparisons
2712
Judge mean
91.7

By category

Coding57%
Creative60%
Factual66%
Multilingual53%
Reasoning64%
Healthcare21%
Rank 34OVH AI Endpoints (GRA)
57%±2

Win rate

Elo 1048

Won / lost / tied
726 / 541 / 1244
prompts
20
comparisons
2511
Judge mean
93.0

By category

Coding45%
Creative69%
Factual63%
Multilingual51%
Reasoning74%
Rank 46Anthropic
55%±2

Win rate

Elo 1032

Claude Haiku 4.5
Tier Aarchived
Won / lost / tied
807 / 720 / 1185
prompts
24
comparisons
2712
Judge mean
92.1

By category

Coding60%
Creative55%
Factual50%
Multilingual55%
Reasoning58%
Healthcare33%
Rank 49OVH AI Endpoints (GRA)
54%±2

Win rate

Elo 1029

Won / lost / tied
737 / 682 / 1092
prompts
20
comparisons
2511
Judge mean
92.5

By category

Coding65%
Creative41%
Factual50%
Multilingual50%
Reasoning58%
Rank 50OVH AI Endpoints (GRA)
54%±2

Win rate

Elo 1027

Won / lost / tied
784 / 741 / 986
prompts
20
comparisons
2511
Judge mean
90.4

By category

Coding58%
Creative36%
Factual52%
Multilingual53%
Reasoning62%
Rank 50OVH AI Endpoints (GRA)
54%±2

Win rate

Elo 1024

Won / lost / tied
734 / 707 / 1070
prompts
20
comparisons
2511
Judge mean
92.4

By category

Coding55%
Creative65%
Factual34%
Multilingual52%
Reasoning74%
Rank 52OpenAI
52%±2

Win rate

Elo 1016

Won / lost / tied
776 / 802 / 933
prompts
20
comparisons
2511
Judge mean
87.1

By category

Coding53%
Creative32%
Factual33%
Multilingual68%
Reasoning64%
Rank 52Google Gemini
50%±2

Win rate

Elo 1003

Won / lost / tied
485 / 536 / 778
prompts
23
comparisons
1799
Judge mean
79.3

By category

Coding44%
Creative82%
Factual43%
Multilingual55%
Reasoning43%
Healthcare43%
Rank 55Google Gemini
50%±2

Win rate

Elo 998

Gemini 2.5 Flash-Lite
Tier Barchived
Won / lost / tied
766 / 925 / 1021
prompts
24
comparisons
2712
Judge mean
91.2

By category

Coding38%
Creative51%
Factual49%
Multilingual57%
Reasoning58%
Healthcare53%
Rank 55OpenAI
50%±2

Win rate

Elo 998

o3-mini
Tier Carchived
Won / lost / tied
585 / 719 / 1081
prompts
20
comparisons
2385
Judge mean
84.0

By category

Coding57%
Creative30%
Factual31%
Multilingual57%
Reasoning61%
Rank 55OpenAI
49%±2

Win rate

Elo 995

Won / lost / tied
515 / 647 / 1078
prompts
20
comparisons
2240
Judge mean
74.0

By category

Coding59%
Creative50%
Factual40%
Multilingual45%
Reasoning54%
Rank 56Anthropic
49%±2

Win rate

Elo 993

Claude Opus 5
Tier Aarchived
Won / lost / tied
521 / 671 / 824
prompts
18
comparisons
2016
Judge mean
83.0

By category

Coding26%
Creative86%
Factual48%
Multilingual41%
Reasoning61%
Rank 56OpenAI
49%±2

Win rate

Elo 992

gpt-4
Tier Carchived
Won / lost / tied
778 / 979 / 955
prompts
24
comparisons
2712
Judge mean
88.9

By category

Coding55%
Creative33%
Factual34%
Multilingual54%
Reasoning58%
Healthcare43%
Rank 57OpenAI
48%±2

Win rate

Elo 986

gpt-4-0613
Tier Carchived
Won / lost / tied
728 / 973 / 1011
prompts
24
comparisons
2712
Judge mean
90.8

By category

Coding47%
Creative53%
Factual38%
Multilingual48%
Reasoning62%
Healthcare51%
Rank 57OpenAI
46%±2

Win rate

Elo 973

gpt-3.5-turbo-1106
Tier Carchived
Won / lost / tied
680 / 1012 / 1020
prompts
24
comparisons
2712
Judge mean
83.0

By category

Coding55%
Creative54%
Factual22%
Multilingual56%
Reasoning48%
Healthcare18%
Rank 60OpenAI
45%±2

Win rate

Elo 967

gpt-5-mini-2025-08-07
Tier Barchived
Won / lost / tied
515 / 824 / 974
prompts
20
comparisons
2313
Judge mean
70.7

By category

Coding63%
Creative35%
Factual40%
Multilingual32%
Reasoning54%
Rank 61OpenAI
45%±2

Win rate

Elo 964

gpt-3.5-turbo-0125
Tier Carchived
Won / lost / tied
669 / 1065 / 978
prompts
24
comparisons
2712
Judge mean
83.5

By category

Coding57%
Creative46%
Factual20%
Multilingual51%
Reasoning51%
Healthcare25%
Rank 65OpenAI
42%±2

Win rate

Elo 944

gpt-3.5-turbo-16k
Tier Carchived
Won / lost / tied
662 / 1194 / 856
prompts
24
comparisons
2712
Judge mean
82.0

By category

Coding62%
Creative30%
Factual23%
Multilingual47%
Reasoning35%
Healthcare20%
Rank 64Z.ai (GLM / Zhipu)
42%±3

Win rate

Elo 944

GLM-5.2
Tier A
Won / lost / tied
361 / 639 / 538
prompts
14
comparisons
1538
Judge mean
58.3

By category

Coding56%
Creative4%
Factual55%
Reasoning20%
Rank 67OpenAI
40%±2

Win rate

Elo 933

gpt-3.5-turbo
Tier Carchived
Won / lost / tied
624 / 1236 / 852
prompts
24
comparisons
2712
Judge mean
83.1

By category

Coding45%
Creative54%
Factual20%
Multilingual43%
Reasoning49%
Healthcare22%
Rank 67OpenAI
40%±2

Win rate

Elo 932

gpt-5
Tier C
Won / lost / tied
378 / 811 / 812
prompts
19
comparisons
2001
Judge mean
60.3

By category

Coding56%
Creative7%
Factual39%
Multilingual38%
Reasoning37%
Rank 67Google Gemini
40%±2

Win rate

Elo 930

Won / lost / tied
617 / 1245 / 850
prompts
24
comparisons
2712
Judge mean
77.6

By category

Coding34%
Creative21%
Factual50%
Multilingual42%
Reasoning45%
Healthcare23%
Rank 67Z.ai (GLM / Zhipu)
40%±2

Win rate

Elo 928

Won / lost / tied
378 / 798 / 633
prompts
14
comparisons
1809
Judge mean
54.8

By category

Coding49%
Creative31%
Factual44%
Reasoning24%
Rank 67OpenAI
39%±2

Win rate

Elo 922

gpt-5-2025-08-07
Tier Barchived
Won / lost / tied
432 / 983 / 825
prompts
20
comparisons
2240
Judge mean
57.2

By category

Coding55%
Creative3%
Factual24%
Multilingual37%
Reasoning54%
Rank 67OVH AI Endpoints (GRA)
39%±2

Win rate

Elo 921

Won / lost / tied
518 / 1119 / 748
prompts
20
comparisons
2385
Judge mean
80.1

By category

Coding45%
Creative45%
Factual34%
Multilingual25%
Reasoning54%
Rank 67Z.ai (GLM / Zhipu)
38%±3

Win rate

Elo 916

GLM-5.1
Tier A
Won / lost / tied
372 / 758 / 408
prompts
14
comparisons
1538
Judge mean
69.1

By category

Coding32%
Creative13%
Factual50%
Reasoning43%
Rank 68OVH AI Endpoints (GRA)
37%±2

Win rate

Elo 911

Won / lost / tied
555 / 1254 / 702
prompts
20
comparisons
2511
Judge mean
77.8

By category

Coding49%
Creative10%
Factual29%
Multilingual39%
Reasoning41%
Rank 69Z.ai (GLM / Zhipu)
37%±2

Win rate

Elo 906

Won / lost / tied
348 / 841 / 559
prompts
14
comparisons
1748
Judge mean
67.4

By category

Coding49%
Creative46%
Factual31%
Reasoning15%
Rank 75Google Gemini
34%±2

Win rate

Elo 885

Won / lost / tied
559 / 1484 / 669
prompts
24
comparisons
2712
Judge mean
63.7

By category

Coding32%
Creative31%
Factual46%
Multilingual29%
Reasoning31%
Healthcare9%
Rank 75Z.ai (GLM / Zhipu)
33%±2

Win rate

Elo 879

Won / lost / tied
284 / 803 / 451
prompts
14
comparisons
1538
Judge mean
55.9

By category

Coding53%
Creative8%
Factual39%
Reasoning6%
Rank 80OpenAI
28%±2

Win rate

Elo 839

gpt-5-nano-2025-08-07
Tier Barchived
Won / lost / tied
240 / 990 / 516
prompts
18
comparisons
1746
Judge mean
37.9

By category

Coding27%
Creative7%
Factual48%
Multilingual27%
Reasoning6%
Rank 80OVH AI Endpoints (GRA)
28%±2

Win rate

Elo 835

Won / lost / tied
441 / 1573 / 497
prompts
20
comparisons
2511
Judge mean
72.5

By category

Coding33%
Creative11%
Factual25%
Multilingual27%
Reasoning30%
Rank 80Z.ai (GLM / Zhipu)
28%±2

Win rate

Elo 835

GLM-4.6
Tier A
Won / lost / tied
221 / 853 / 373
prompts
13
comparisons
1447
Judge mean
52.2

By category

Coding49%
Creative1%
Factual36%
Reasoning5%
Rank 80OVH AI Endpoints (GRA)
26%±2

Win rate

Elo 820

Won / lost / tied
294 / 1235 / 464
prompts
19
comparisons
1993
Judge mean
42.5

By category

Coding53%
Creative6%
Factual6%
Multilingual28%
Reasoning4%
Rank 81Google Gemini
24%±2

Win rate

Elo 803

Gemini 3.5 Flash
Tier Aarchived
Won / lost / tied
381 / 1673 / 457
prompts
20
comparisons
2511
Judge mean
51.7

By category

Coding9%
Creative48%
Factual39%
Multilingual25%
Reasoning10%
Rank 82OpenAI
24%±2

Win rate

Elo 798

Won / lost / tied
208 / 1154 / 485
prompts
20
comparisons
1847
Judge mean
36.6

By category

Coding18%
Creative4%
Factual50%
Multilingual18%
Reasoning7%
Rank 82Z.ai (GLM / Zhipu)
24%±2

Win rate

Elo 796

Won / lost / tied
179 / 971 / 388
prompts
14
comparisons
1538
Judge mean
47.2

By category

Coding38%
Creative4%
Factual27%
Reasoning5%
Rank 83OVH AI Endpoints (GRA)
23%±2

Win rate

Elo 794

Qwen3-32B
Tier B
Won / lost / tied
426 / 1763 / 322
prompts
20
comparisons
2511
Judge mean
77.5

By category

Coding18%
Creative14%
Factual23%
Multilingual27%
Reasoning27%
Rank 82Google Gemini
23%±2

Win rate

Elo 792

Won / lost / tied
192 / 915 / 292
prompts
18
comparisons
1399
Judge mean
41.4

By category

Coding19%
Creative14%
Factual44%
Multilingual4%
Reasoning3%
Healthcare54%
Rank 84Google Gemini
22%±2

Win rate

Elo 780

Won / lost / tied
250 / 1275 / 353
prompts
24
comparisons
1878
Judge mean
44.1

By category

Coding4%
Creative38%
Factual42%
Multilingual19%
Reasoning13%
Healthcare3%
Rank 84OVH AI Endpoints (GRA)
21%±2

Win rate

Elo 771

Won / lost / tied
209 / 1338 / 446
prompts
19
comparisons
1993
Judge mean
44.0

By category

Coding36%
Creative5%
Factual11%
Multilingual24%
Reasoning3%
Rank 85Google Gemini
21%±2

Win rate

Elo 768

Won / lost / tied
384 / 1958 / 370
prompts
24
comparisons
2712
Judge mean
48.1

By category

Coding5%
Creative51%
Factual45%
Multilingual16%
Reasoning7%
Healthcare5%
Rank 89Google Gemini
19%±2

Win rate

Elo 750

Won / lost / tied
338 / 1996 / 378
prompts
24
comparisons
2712
Judge mean
44.4

By category

Coding5%
Creative23%
Factual45%
Multilingual17%
Reasoning8%
Healthcare2%
Rank 92Google Gemini
17%±2

Win rate

Elo 726

Gemini 2.5 Pro
Tier Aarchived
Won / lost / tied
182 / 1437 / 345
prompts
24
comparisons
1964
Judge mean
30.7

By category

Coding17%
Creative3%
Factual34%
Multilingual8%
Reasoning3%
Healthcare54%
Rank 93Google Gemini
15%±1

Win rate

Elo 692

Gemini 2.5 Flash
Tier Aarchived
Won / lost / tied
284 / 2181 / 247
prompts
24
comparisons
2712
Judge mean
37.3

By category

Coding3%
Creative24%
Factual28%
Multilingual11%
Reasoning10%
Healthcare2%

94 models ranked from 111,690 pairwise comparisons across 24 prompts.

Provisional

Too little evidence to rank: needs at least 5 prompts and 30 comparisons.

ProvisionalZ.ai (GLM / Zhipu)
1%±1

Win rate

Elo 155

CogView-4
Tier B
Won / lost / tied
0 / 361 / 6
prompts
4
comparisons
367
Judge mean
0.0

By category

Coding1%
Creative<1% · thin