Skip to content

Benchmarks

Intelligence test

Models are ranked by pairwise comparison, not by an absolute score. On every prompt each pair of models is compared head-to-head, and a Bradley-Terry model fits a rating from those comparisons. The win rate below turns that rating into the question it answers: how often this model beats an average model on this board. 50% is average.

How this is scored

7,836

scored runs

105,499

pairwise comparisons

24

prompts

4,586

runs without a score (provider error)

22 of 24 prompts separate models at all. The rest are answered equally well by nearly everyone and carry no ranking signal — that is what an absolute score near 100 was really measuring.

  • Coding 4/4
  • Creative 2/2
  • Factual 3/4
  • Multilingual 7/8
  • Reasoning 4/4
  • Healthcare 2/2
Rank 1OpenAI
74%±2

Win rate

Elo 1179

gpt-5.1
Tier B
Won / lost / tied
983 / 38 / 1334
prompts
20
comparisons
2355
Judge mean
97.2

By category

Coding75%
Creative91%
Factual71%
Multilingual68%
Reasoning79%
Rank 1Z.ai (GLM / Zhipu)
74%±2

Win rate

Elo 1178

GLM-4.7
Tier A
Won / lost / tied
790 / 88 / 861
prompts
14
comparisons
1739
Judge mean
95.8

By category

Coding73%
Creative85%
Factual75%
Reasoning74%
Rank 1OpenAI
72%±2

Win rate

Elo 1162

Won / lost / tied
924 / 70 / 1361
prompts
20
comparisons
2355
Judge mean
96.9

By category

Coding76%
Creative90%
Factual68%
Multilingual65%
Reasoning74%
Rank 1OpenAI
71%±2

Win rate

Elo 1152

Won / lost / tied
1044 / 178 / 1334
prompts
24
comparisons
2556
Judge mean
96.3

By category

Coding75%
Creative89%
Factual71%
Multilingual57%
Reasoning77%
Healthcare75%
Rank 1OpenAI
71%±2

Win rate

Elo 1152

Won / lost / tied
982 / 119 / 1455
prompts
24
comparisons
2556
Judge mean
96.6

By category

Coding71%
Creative90%
Factual71%
Multilingual63%
Reasoning73%
Healthcare84%
Rank 1Anthropic
70%±2

Win rate

Elo 1149

Claude Opus 4.6
Tier Barchived
Won / lost / tied
1045 / 199 / 1312
prompts
24
comparisons
2556
Judge mean
97.7

By category

Coding61%
Creative91%
Factual73%
Multilingual67%
Reasoning74%
Healthcare90%
Rank 2OpenAI
70%±2

Win rate

Elo 1146

Won / lost / tied
931 / 168 / 1256
prompts
20
comparisons
2355
Judge mean
96.5

By category

Coding76%
Creative90%
Factual59%
Multilingual61%
Reasoning79%
Rank 2OpenAI
70%±2

Win rate

Elo 1145

gpt-5.2
Tier B
Won / lost / tied
917 / 161 / 1277
prompts
20
comparisons
2355
Judge mean
96.7

By category

Coding66%
Creative90%
Factual72%
Multilingual64%
Reasoning74%
Rank 3OpenAI
69%±2

Win rate

Elo 1142

gpt-5.5
Tier C
Won / lost / tied
919 / 179 / 1257
prompts
20
comparisons
2355
Judge mean
95.1

By category

Coding68%
Creative80%
Factual74%
Multilingual64%
Reasoning74%
Rank 3OpenAI
69%±2

Win rate

Elo 1139

gpt-4.1
Tier B
Won / lost / tied
957 / 170 / 1429
prompts
24
comparisons
2556
Judge mean
96.2

By category

Coding75%
Creative81%
Factual66%
Multilingual62%
Reasoning73%
Healthcare79%
Rank 3OpenAI
69%±2

Win rate

Elo 1138

Won / lost / tied
894 / 176 / 1285
prompts
20
comparisons
2355
Judge mean
96.4

By category

Coding71%
Creative90%
Factual57%
Multilingual67%
Reasoning74%
Rank 3OpenAI
68%±2

Win rate

Elo 1132

Won / lost / tied
872 / 186 / 1297
prompts
20
comparisons
2355
Judge mean
95.6

By category

Coding76%
Creative78%
Factual52%
Multilingual67%
Reasoning79%
Rank 4OpenAI
68%±2

Win rate

Elo 1131

Won / lost / tied
848 / 170 / 1337
prompts
20
comparisons
2355
Judge mean
95.9

By category

Coding72%
Creative76%
Factual62%
Multilingual67%
Reasoning74%
Rank 4OpenAI
68%±2

Win rate

Elo 1130

Won / lost / tied
937 / 206 / 1413
prompts
24
comparisons
2556
Judge mean
95.6

By category

Coding71%
Creative76%
Factual64%
Multilingual66%
Reasoning74%
Healthcare70%
Rank 4OpenAI
67%±2

Win rate

Elo 1123

gpt-4o-2024-05-13
Tier Carchived
Won / lost / tied
904 / 221 / 1431
prompts
24
comparisons
2556
Judge mean
96.0

By category

Coding68%
Creative80%
Factual66%
Multilingual61%
Reasoning73%
Healthcare75%
Rank 4OpenAI
67%±2

Win rate

Elo 1122

gpt-5.4
Tier A
Won / lost / tied
850 / 224 / 1281
prompts
20
comparisons
2355
Judge mean
96.1

By category

Coding65%
Creative89%
Factual57%
Multilingual66%
Reasoning74%
Rank 6Anthropic
67%±2

Win rate

Elo 1120

Claude Opus 4.5
Tier Barchived
Won / lost / tied
950 / 287 / 1319
prompts
24
comparisons
2556
Judge mean
96.8

By category

Coding56%
Creative62%
Factual78%
Multilingual66%
Reasoning74%
Healthcare88%
Rank 7OpenAI
66%±2

Win rate

Elo 1117

Won / lost / tied
960 / 311 / 1285
prompts
24
comparisons
2556
Judge mean
95.0

By category

Coding68%
Creative86%
Factual60%
Multilingual54%
Reasoning78%
Healthcare89%
Rank 7OpenAI
66%±2

Win rate

Elo 1117

gpt-4o
Tier C
Won / lost / tied
923 / 280 / 1353
prompts
24
comparisons
2556
Judge mean
95.5

By category

Coding58%
Creative82%
Factual73%
Multilingual62%
Reasoning73%
Healthcare67%
Rank 9Z.ai (GLM / Zhipu)
65%±2

Win rate

Elo 1110

GLM-4.5
Tier A
Won / lost / tied
721 / 291 / 790
prompts
14
comparisons
1802
Judge mean
90.9

By category

Coding75%
Creative80%
Factual64%
Reasoning52%
Rank 11OpenAI
65%±2

Win rate

Elo 1109

Won / lost / tied
819 / 272 / 1264
prompts
20
comparisons
2355
Judge mean
95.2

By category

Coding69%
Creative85%
Factual54%
Multilingual60%
Reasoning74%
Rank 12Anthropic
65%±2

Win rate

Elo 1108

Claude Opus 4.7
Tier Barchived
Won / lost / tied
920 / 335 / 1301
prompts
24
comparisons
2556
Judge mean
96.2

By category

Coding51%
Creative61%
Factual81%
Multilingual63%
Reasoning73%
Healthcare81%
Rank 12Google Gemini
65%±2

Win rate

Elo 1106

Won / lost / tied
967 / 392 / 1197
prompts
24
comparisons
2556
Judge mean
95.5

By category

Coding68%
Creative59%
Factual69%
Multilingual64%
Reasoning63%
Healthcare85%
Rank 12Anthropic
64%±3

Win rate

Elo 1102

Claude Sonnet 5
Tier Aarchived
Won / lost / tied
513 / 232 / 639
prompts
15
comparisons
1384
Judge mean
88.7

By category

Coding68%
Creative90%
Factual61%
Multilingual61%
Reasoning53%
Rank 15OpenAI
64%±2

Win rate

Elo 1100

Won / lost / tied
888 / 349 / 1319
prompts
24
comparisons
2556
Judge mean
95.1

By category

Coding62%
Creative82%
Factual59%
Multilingual55%
Reasoning77%
Healthcare87%
Rank 12Z.ai (GLM / Zhipu)
64%±2

Win rate

Elo 1100

GLM-5
Tier A
Won / lost / tied
560 / 217 / 756
prompts
14
comparisons
1533
Judge mean
94.3

By category

Coding62%
Creative89%
Factual64%
Reasoning62%
Rank 18Anthropic
63%±2

Win rate

Elo 1090

Claude Sonnet 4.5
Tier Barchived
Won / lost / tied
889 / 420 / 1247
prompts
24
comparisons
2556
Judge mean
95.2

By category

Coding43%
Creative59%
Factual74%
Multilingual64%
Reasoning77%
Healthcare78%
Rank 19Anthropic
62%±2

Win rate

Elo 1089

Claude Sonnet 4.6
Tier Aarchived
Won / lost / tied
845 / 384 / 1327
prompts
24
comparisons
2556
Judge mean
95.4

By category

Coding55%
Creative55%
Factual66%
Multilingual63%
Reasoning73%
Healthcare82%
Rank 19OpenAI
62%±2

Win rate

Elo 1089

Won / lost / tied
870 / 409 / 1277
prompts
24
comparisons
2556
Judge mean
94.5

By category

Coding57%
Creative72%
Factual62%
Multilingual60%
Reasoning73%
Healthcare72%
Rank 18Google Gemini
62%±2

Win rate

Elo 1087

Nano Banana
Tier Barchived
Won / lost / tied
615 / 274 / 910
prompts
23
comparisons
1799
Judge mean
93.5

By category

Coding51%
Creative70%
Factual61%
Multilingual65%
Reasoning74%
Healthcare58%
Rank 20OVH AI Endpoints (GRA)
62%±2

Win rate

Elo 1087

Won / lost / tied
793 / 377 / 1185
prompts
20
comparisons
2355
Judge mean
93.0

By category

Coding58%
Creative82%
Factual62%
Multilingual56%
Reasoning70%
Rank 20OpenAI
62%±2

Win rate

Elo 1083

Won / lost / tied
830 / 404 / 1322
prompts
24
comparisons
2556
Judge mean
95.1

By category

Coding53%
Creative49%
Factual71%
Multilingual61%
Reasoning72%
Healthcare86%
Rank 20OpenAI
62%±2

Win rate

Elo 1082

Won / lost / tied
818 / 403 / 1335
prompts
24
comparisons
2556
Judge mean
90.1

By category

Coding58%
Creative77%
Factual54%
Multilingual66%
Reasoning68%
Healthcare54%
Rank 20OpenAI
61%±2

Win rate

Elo 1081

Won / lost / tied
751 / 371 / 1233
prompts
20
comparisons
2355
Judge mean
89.2

By category

Coding71%
Creative31%
Factual49%
Multilingual67%
Reasoning74%
Rank 20Anthropic
61%±2

Win rate

Elo 1080

Claude Fable 5
Tier Aarchived
Won / lost / tied
744 / 364 / 1288
prompts
20
comparisons
2396
Judge mean
89.1

By category

Coding67%
Creative71%
Factual49%
Multilingual62%
Reasoning68%
Rank 21OpenAI
61%±2

Win rate

Elo 1079

Won / lost / tied
826 / 426 / 1304
prompts
24
comparisons
2556
Judge mean
92.9

By category

Coding68%
Creative60%
Factual61%
Multilingual56%
Reasoning68%
Healthcare35%
Rank 23OpenAI
61%±2

Win rate

Elo 1078

gpt-4.1-nano
Tier Carchived
Won / lost / tied
825 / 436 / 1295
prompts
24
comparisons
2556
Judge mean
92.0

By category

Coding68%
Creative66%
Factual66%
Multilingual55%
Reasoning64%
Healthcare21%
Rank 22OpenAI
61%±2

Win rate

Elo 1078

o1
Tier Carchived
Won / lost / tied
684 / 342 / 1132
prompts
20
comparisons
2158
Judge mean
89.1

By category

Coding76%
Creative58%
Factual43%
Multilingual63%
Reasoning60%
Rank 24OpenAI
61%±2

Win rate

Elo 1076

Won / lost / tied
838 / 457 / 1261
prompts
24
comparisons
2556
Judge mean
93.3

By category

Coding54%
Creative76%
Factual68%
Multilingual60%
Reasoning60%
Healthcare72%
Rank 24Google Gemini
60%±3

Win rate

Elo 1070

Won / lost / tied
501 / 290 / 608
prompts
18
comparisons
1399
Judge mean
92.6

By category

Coding70%
Creative61%
Factual53%
Multilingual68%
Reasoning65%
Healthcare36%
Rank 25Anthropic
60%±2

Win rate

Elo 1069

Claude Opus 4.8
Tier Aarchived
Won / lost / tied
748 / 439 / 1168
prompts
20
comparisons
2355
Judge mean
95.0

By category

Coding49%
Creative44%
Factual70%
Multilingual61%
Reasoning74%
Rank 25OpenAI
60%±2

Win rate

Elo 1068

gpt-4-turbo
Tier Carchived
Won / lost / tied
818 / 491 / 1247
prompts
24
comparisons
2556
Judge mean
94.2

By category

Coding48%
Creative65%
Factual70%
Multilingual58%
Reasoning65%
Healthcare78%
Rank 26OpenAI
59%±2

Win rate

Elo 1067

o1-2024-12-17
Tier Carchived
Won / lost / tied
629 / 349 / 1180
prompts
20
comparisons
2158
Judge mean
85.1

By category

Coding71%
Creative1%
Factual60%
Multilingual66%
Reasoning60%
Rank 27OpenAI
59%±2

Win rate

Elo 1063

Won / lost / tied
801 / 511 / 1244
prompts
24
comparisons
2556
Judge mean
89.4

By category

Coding61%
Creative76%
Factual49%
Multilingual61%
Reasoning63%
Healthcare49%
Rank 27Google Gemini
59%±2

Win rate

Elo 1062

Gemini 3.1 Flash Lite
Tier Barchived
Won / lost / tied
687 / 422 / 1246
prompts
20
comparisons
2355
Judge mean
94.2

By category

Coding53%
Creative44%
Factual60%
Multilingual62%
Reasoning74%
Rank 27OpenAI
59%±2

Win rate

Elo 1062

o4-mini-2025-04-16
Tier Barchived
Won / lost / tied
631 / 377 / 1149
prompts
20
comparisons
2157
Judge mean
79.9

By category

Coding60%
Creative66%
Factual45%
Multilingual68%
Reasoning61%
Rank 30OpenAI
58%±2

Win rate

Elo 1058

o4-mini
Tier Carchived
Won / lost / tied
640 / 412 / 1095
prompts
20
comparisons
2147
Judge mean
78.7

By category

Coding61%
Creative77%
Factual50%
Multilingual60%
Reasoning54%
Rank 31OpenAI
58%±2

Win rate

Elo 1055

o3-mini-2025-01-31
Tier Carchived
Won / lost / tied
663 / 443 / 1186
prompts
20
comparisons
2292
Judge mean
89.7

By category

Coding67%
Creative69%
Factual42%
Multilingual61%
Reasoning57%
Rank 37OVH AI Endpoints (GRA)
57%±2

Win rate

Elo 1049

Won / lost / tied
677 / 492 / 1186
prompts
20
comparisons
2355
Judge mean
93.1

By category

Coding45%
Creative63%
Factual63%
Multilingual53%
Reasoning74%
Rank 37OpenAI
57%±2

Win rate

Elo 1048

o3-2025-04-16
Tier Barchived
Won / lost / tied
561 / 397 / 1109
prompts
19
comparisons
2067
Judge mean
79.5

By category

Coding63%
Creative85%
Factual43%
Multilingual53%
Reasoning54%
Rank 40OpenAI
57%±2

Win rate

Elo 1046

o3
Tier C
Won / lost / tied
604 / 441 / 1112
prompts
20
comparisons
2157
Judge mean
80.8

By category

Coding55%
Creative86%
Factual57%
Multilingual49%
Reasoning54%
Rank 47OVH AI Endpoints (GRA)
54%±2

Win rate

Elo 1031

Won / lost / tied
729 / 656 / 970
prompts
20
comparisons
2355
Judge mean
90.6

By category

Coding60%
Creative52%
Factual52%
Multilingual49%
Reasoning62%
Rank 47OVH AI Endpoints (GRA)
54%±2

Win rate

Elo 1029

Won / lost / tied
701 / 639 / 1015
prompts
20
comparisons
2355
Judge mean
92.8

By category

Coding56%
Creative67%
Factual34%
Multilingual55%
Reasoning74%
Rank 47OVH AI Endpoints (GRA)
54%±2

Win rate

Elo 1028

Won / lost / tied
677 / 623 / 1055
prompts
20
comparisons
2355
Judge mean
92.6

By category

Coding62%
Creative49%
Factual50%
Multilingual51%
Reasoning58%
Rank 48Anthropic
54%±2

Win rate

Elo 1028

Claude Haiku 4.5
Tier Aarchived
Won / lost / tied
737 / 682 / 1137
prompts
24
comparisons
2556
Judge mean
92.0

By category

Coding60%
Creative43%
Factual50%
Multilingual57%
Reasoning58%
Healthcare33%
Rank 52OpenAI
52%±2

Win rate

Elo 1013

Won / lost / tied
686 / 728 / 941
prompts
20
comparisons
2355
Judge mean
87.5

By category

Coding55%
Creative32%
Factual33%
Multilingual66%
Reasoning64%
Rank 52OpenAI
51%±2

Win rate

Elo 1005

o3-mini
Tier Carchived
Won / lost / tied
554 / 630 / 1045
prompts
20
comparisons
2229
Judge mean
83.3

By category

Coding60%
Creative32%
Factual31%
Multilingual59%
Reasoning61%
Rank 52Google Gemini
51%±2

Win rate

Elo 1003

Won / lost / tied
485 / 536 / 778
prompts
23
comparisons
1799
Judge mean
79.3

By category

Coding44%
Creative83%
Factual43%
Multilingual56%
Reasoning43%
Healthcare43%
Rank 52Google Gemini
50%±2

Win rate

Elo 1003

Gemini 2.5 Flash-Lite
Tier Barchived
Won / lost / tied
736 / 850 / 970
prompts
24
comparisons
2556
Judge mean
91.4

By category

Coding35%
Creative59%
Factual49%
Multilingual59%
Reasoning58%
Healthcare53%
Rank 56Anthropic
49%±2

Win rate

Elo 990

Claude Opus 5
Tier Aarchived
Won / lost / tied
471 / 618 / 771
prompts
17
comparisons
1860
Judge mean
81.4

By category

Coding21%
Creative81%
Factual48%
Multilingual42%
Reasoning61%
Rank 56OpenAI
48%±2

Win rate

Elo 989

gpt-4-0613
Tier Carchived
Won / lost / tied
691 / 897 / 968
prompts
24
comparisons
2556
Judge mean
90.8

By category

Coding50%
Creative45%
Factual38%
Multilingual50%
Reasoning62%
Healthcare51%
Rank 56OpenAI
48%±2

Win rate

Elo 988

gpt-4
Tier Carchived
Won / lost / tied
694 / 905 / 957
prompts
24
comparisons
2556
Judge mean
88.9

By category

Coding49%
Creative34%
Factual34%
Multilingual60%
Reasoning58%
Healthcare43%
Rank 57OpenAI
46%±2

Win rate

Elo 974

Won / lost / tied
417 / 646 / 1023
prompts
20
comparisons
2086
Judge mean
71.6

By category

Coding53%
Creative51%
Factual40%
Multilingual39%
Reasoning54%
Rank 60OpenAI
45%±2

Win rate

Elo 968

gpt-3.5-turbo-1106
Tier Carchived
Won / lost / tied
613 / 954 / 989
prompts
24
comparisons
2556
Judge mean
82.7

By category

Coding54%
Creative67%
Factual22%
Multilingual52%
Reasoning48%
Healthcare18%
Rank 60OpenAI
45%±2

Win rate

Elo 963

gpt-3.5-turbo-0125
Tier Carchived
Won / lost / tied
610 / 985 / 961
prompts
24
comparisons
2556
Judge mean
83.4

By category

Coding56%
Creative50%
Factual20%
Multilingual53%
Reasoning51%
Healthcare25%
Rank 63OpenAI
42%±2

Win rate

Elo 946

gpt-5-mini-2025-08-07
Tier Barchived
Won / lost / tied
406 / 805 / 946
prompts
20
comparisons
2157
Judge mean
67.6

By category

Coding52%
Creative36%
Factual40%
Multilingual31%
Reasoning54%
Rank 64OpenAI
42%±2

Win rate

Elo 943

gpt-3.5-turbo
Tier Carchived
Won / lost / tied
607 / 1112 / 837
prompts
24
comparisons
2556
Judge mean
83.1

By category

Coding54%
Creative49%
Factual20%
Multilingual44%
Reasoning49%
Healthcare22%
Rank 64OpenAI
41%±2

Win rate

Elo 940

gpt-3.5-turbo-16k
Tier Carchived
Won / lost / tied
577 / 1101 / 878
prompts
24
comparisons
2556
Judge mean
81.8

By category

Coding57%
Creative31%
Factual23%
Multilingual51%
Reasoning35%
Healthcare20%
Rank 65Google Gemini
41%±2

Win rate

Elo 938

Won / lost / tied
596 / 1133 / 827
prompts
24
comparisons
2556
Judge mean
78.4

By category

Coding37%
Creative23%
Factual50%
Multilingual43%
Reasoning45%
Healthcare23%
Rank 66Z.ai (GLM / Zhipu)
40%±2

Win rate

Elo 930

Won / lost / tied
356 / 765 / 681
prompts
14
comparisons
1802
Judge mean
52.1

By category

Coding51%
Creative28%
Factual44%
Reasoning24%
Rank 66Z.ai (GLM / Zhipu)
39%±3

Win rate

Elo 922

GLM-5.1
Tier A
Won / lost / tied
365 / 726 / 442
prompts
14
comparisons
1533
Judge mean
68.8

By category

Coding34%
Creative13%
Factual50%
Reasoning43%
Rank 66Z.ai (GLM / Zhipu)
39%±2

Win rate

Elo 921

Won / lost / tied
332 / 737 / 599
prompts
14
comparisons
1668
Judge mean
65.4

By category

Coding56%
Creative47%
Factual31%
Reasoning15%
Rank 66Z.ai (GLM / Zhipu)
39%±3

Win rate

Elo 921

GLM-5.2
Tier A
Won / lost / tied
297 / 639 / 515
prompts
14
comparisons
1451
Judge mean
54.9

By category

Coding49%
Creative4%
Factual55%
Reasoning20%
Rank 68OVH AI Endpoints (GRA)
38%±2

Win rate

Elo 912

Won / lost / tied
452 / 1054 / 723
prompts
20
comparisons
2229
Judge mean
79.2

By category

Coding40%
Creative39%
Factual34%
Multilingual27%
Reasoning54%
Rank 70OpenAI
36%±2

Win rate

Elo 904

gpt-5
Tier C
Won / lost / tied
285 / 805 / 749
prompts
19
comparisons
1839
Judge mean
57.4

By category

Coding51%
Creative7%
Factual39%
Multilingual30%
Reasoning37%
Rank 71OVH AI Endpoints (GRA)
35%±2

Win rate

Elo 890

Won / lost / tied
455 / 1195 / 623
prompts
20
comparisons
2273
Judge mean
77.2

By category

Coding47%
Creative9%
Factual29%
Multilingual33%
Reasoning41%
Rank 74Google Gemini
34%±2

Win rate

Elo 885

Won / lost / tied
522 / 1383 / 651
prompts
24
comparisons
2556
Judge mean
63.1

By category

Coding32%
Creative37%
Factual46%
Multilingual28%
Reasoning31%
Healthcare9%
Rank 74OpenAI
34%±2

Win rate

Elo 881

gpt-5-2025-08-07
Tier Barchived
Won / lost / tied
290 / 964 / 749
prompts
20
comparisons
2003
Judge mean
53.1

By category

Coding35%
Creative3%
Factual24%
Multilingual37%
Reasoning54%
Rank 75Z.ai (GLM / Zhipu)
32%±2

Win rate

Elo 871

Won / lost / tied
257 / 803 / 473
prompts
14
comparisons
1533
Judge mean
52.5

By category

Coding50%
Creative8%
Factual39%
Reasoning6%
Rank 80OVH AI Endpoints (GRA)
27%±2

Win rate

Elo 831

Won / lost / tied
395 / 1468 / 492
prompts
20
comparisons
2355
Judge mean
73.3

By category

Coding29%
Creative13%
Factual25%
Multilingual30%
Reasoning30%
Rank 80Z.ai (GLM / Zhipu)
26%±2

Win rate

Elo 817

GLM-4.6
Tier A
Won / lost / tied
185 / 866 / 391
prompts
13
comparisons
1442
Judge mean
48.3

By category

Coding42%
Creative1%
Factual36%
Reasoning5%
Rank 80OpenAI
26%±2

Win rate

Elo 816

gpt-5-nano-2025-08-07
Tier Barchived
Won / lost / tied
197 / 990 / 485
prompts
18
comparisons
1672
Judge mean
36.1

By category

Coding27%
Creative7%
Factual48%
Multilingual18%
Reasoning6%
Rank 80Google Gemini
26%±2

Win rate

Elo 815

Gemini 3.5 Flash
Tier Aarchived
Won / lost / tied
369 / 1522 / 464
prompts
20
comparisons
2355
Judge mean
52.0

By category

Coding8%
Creative54%
Factual39%
Multilingual29%
Reasoning10%
Rank 80OVH AI Endpoints (GRA)
25%±2

Win rate

Elo 812

Won / lost / tied
267 / 1235 / 486
prompts
19
comparisons
1988
Judge mean
41.6

By category

Coding50%
Creative6%
Factual6%
Multilingual28%
Reasoning4%
Rank 80Z.ai (GLM / Zhipu)
25%±2

Win rate

Elo 812

Won / lost / tied
186 / 925 / 422
prompts
14
comparisons
1533
Judge mean
45.5

By category

Coding44%
Creative4%
Factual27%
Reasoning5%
Rank 80OVH AI Endpoints (GRA)
25%±2

Win rate

Elo 805

Qwen3-32B
Tier B
Won / lost / tied
418 / 1617 / 320
prompts
20
comparisons
2355
Judge mean
79.0

By category

Coding23%
Creative16%
Factual23%
Multilingual26%
Reasoning27%
Rank 80OpenAI
24%±2

Win rate

Elo 797

Won / lost / tied
208 / 1154 / 485
prompts
20
comparisons
1847
Judge mean
36.6

By category

Coding18%
Creative4%
Factual50%
Multilingual18%
Reasoning7%
Rank 80Google Gemini
23%±2

Win rate

Elo 793

Won / lost / tied
192 / 915 / 292
prompts
18
comparisons
1399
Judge mean
41.4

By category

Coding19%
Creative14%
Factual44%
Multilingual4%
Reasoning3%
Healthcare54%
Rank 81Google Gemini
22%±2

Win rate

Elo 784

Won / lost / tied
381 / 1783 / 392
prompts
24
comparisons
2556
Judge mean
48.3

By category

Coding8%
Creative51%
Factual45%
Multilingual17%
Reasoning7%
Healthcare5%
Rank 81Google Gemini
22%±2

Win rate

Elo 780

Won / lost / tied
250 / 1275 / 353
prompts
24
comparisons
1878
Judge mean
44.1

By category

Coding4%
Creative39%
Factual42%
Multilingual19%
Reasoning13%
Healthcare3%
Rank 86Google Gemini
21%±2

Win rate

Elo 772

Won / lost / tied
356 / 1818 / 382
prompts
24
comparisons
2556
Judge mean
44.5

By category

Coding5%
Creative39%
Factual45%
Multilingual19%
Reasoning8%
Healthcare2%
Rank 87OVH AI Endpoints (GRA)
20%±2

Win rate

Elo 761

Won / lost / tied
187 / 1348 / 453
prompts
19
comparisons
1988
Judge mean
42.3

By category

Coding33%
Creative5%
Factual11%
Multilingual24%
Reasoning3%
Rank 92Google Gemini
17%±2

Win rate

Elo 726

Gemini 2.5 Pro
Tier Aarchived
Won / lost / tied
182 / 1437 / 345
prompts
24
comparisons
1964
Judge mean
30.7

By category

Coding17%
Creative3%
Factual34%
Multilingual8%
Reasoning3%
Healthcare54%
Rank 93Google Gemini
15%±1

Win rate

Elo 704

Gemini 2.5 Flash
Tier Aarchived
Won / lost / tied
284 / 2026 / 246
prompts
24
comparisons
2556
Judge mean
38.6

By category

Coding4%
Creative26%
Factual28%
Multilingual12%
Reasoning10%
Healthcare2%

94 models ranked from 105,499 pairwise comparisons across 24 prompts.

Provisional

Too little evidence to rank: needs at least 5 prompts and 30 comparisons.

ProvisionalZ.ai (GLM / Zhipu)
1%±1

Win rate

Elo 155

CogView-4
Tier B
Won / lost / tied
0 / 361 / 6
prompts
4
comparisons
367
Judge mean
0.0

By category

Coding1%
Creative<1% · thin