Skip to content

Benchmarks

Intelligence test

Models are ranked by pairwise comparison, not by an absolute score. On every prompt each pair of models is compared head-to-head, and a Bradley-Terry model fits a rating from those comparisons. The win rate below turns that rating into the question it answers: how often this model beats an average model on this board. 50% is average.

How this is scored

8,603

scored runs

117,970

pairwise comparisons

24

prompts

4,699

runs without a score (provider error)

22 of 24 prompts separate models at all. The rest are answered equally well by nearly everyone and carry no ranking signal — that is what an absolute score near 100 was really measuring.

  • Coding 4/4
  • Creative 2/2
  • Factual 3/4
  • Multilingual 7/8
  • Reasoning 4/4
  • Healthcare 2/2
Rank 1OpenAI
73%±2

Win rate

Elo 1175

Won / lost / tied
1296 / 172 / 1402
prompts
24
comparisons
2870
Judge mean
96.0

By category

Coding80%
Creative91%
Factual74%
Multilingual60%
Reasoning77%
Healthcare75%
Rank 1OpenAI
73%±2

Win rate

Elo 1172

gpt-5.1
Tier B
Won / lost / tied
1125 / 101 / 1443
prompts
20
comparisons
2669
Judge mean
95.0

By category

Coding76%
Creative79%
Factual71%
Multilingual70%
Reasoning78%
Rank 1OpenAI
73%±2

Win rate

Elo 1171

Won / lost / tied
1149 / 132 / 1388
prompts
20
comparisons
2669
Judge mean
95.9

By category

Coding78%
Creative89%
Factual76%
Multilingual67%
Reasoning66%
Rank 1OpenAI
70%±2

Win rate

Elo 1149

gpt-5.5
Tier C
Won / lost / tied
1074 / 193 / 1402
prompts
20
comparisons
2669
Judge mean
93.9

By category

Coding70%
Creative82%
Factual72%
Multilingual66%
Reasoning74%
Rank 1OpenAI
70%±2

Win rate

Elo 1149

Won / lost / tied
1142 / 193 / 1535
prompts
24
comparisons
2870
Judge mean
96.0

By category

Coding72%
Creative92%
Factual72%
Multilingual65%
Reasoning66%
Healthcare84%
Rank 2OpenAI
70%±2

Win rate

Elo 1144

Won / lost / tied
1062 / 216 / 1391
prompts
20
comparisons
2669
Judge mean
93.9

By category

Coding75%
Creative78%
Factual57%
Multilingual69%
Reasoning78%
Rank 3OpenAI
69%±2

Win rate

Elo 1142

gpt-5.4
Tier A
Won / lost / tied
1047 / 214 / 1408
prompts
20
comparisons
2669
Judge mean
94.8

By category

Coding68%
Creative90%
Factual63%
Multilingual68%
Reasoning74%
Rank 4OpenAI
69%±2

Win rate

Elo 1141

gpt-5.2
Tier B
Won / lost / tied
1062 / 235 / 1372
prompts
20
comparisons
2669
Judge mean
94.2

By category

Coding66%
Creative92%
Factual67%
Multilingual66%
Reasoning74%
Rank 4OpenAI
69%±2

Win rate

Elo 1139

gpt-4.1
Tier B
Won / lost / tied
1128 / 249 / 1493
prompts
24
comparisons
2870
Judge mean
95.7

By category

Coding74%
Creative83%
Factual69%
Multilingual64%
Reasoning66%
Healthcare79%
Rank 4OpenAI
69%±2

Win rate

Elo 1139

Won / lost / tied
1099 / 220 / 1551
prompts
24
comparisons
2870
Judge mean
95.1

By category

Coding69%
Creative82%
Factual67%
Multilingual68%
Reasoning73%
Healthcare70%
Rank 4Anthropic
69%±2

Win rate

Elo 1135

Won / lost / tied
1162 / 309 / 1399
prompts
24
comparisons
2870
Judge mean
97.0

By category

Coding63%
Creative93%
Factual73%
Multilingual64%
Reasoning67%
Healthcare90%
Rank 4OpenAI
68%±2

Win rate

Elo 1133

Won / lost / tied
1067 / 292 / 1310
prompts
20
comparisons
2669
Judge mean
94.1

By category

Coding71%
Creative92%
Factual61%
Multilingual63%
Reasoning71%
Rank 4Z.ai (GLM / Zhipu)
68%±2

Win rate

Elo 1132

GLM-4.7
Tier A
Won / lost / tied
838 / 259 / 882
prompts
14
comparisons
1979
Judge mean
91.1

By category

Coding61%
Creative85%
Factual70%
Reasoning74%
Rank 4OpenAI
68%±2

Win rate

Elo 1129

Won / lost / tied
1035 / 289 / 1345
prompts
20
comparisons
2669
Judge mean
94.6

By category

Coding74%
Creative89%
Factual55%
Multilingual64%
Reasoning74%
Rank 4OpenAI
67%±2

Win rate

Elo 1127

Won / lost / tied
987 / 252 / 1430
prompts
20
comparisons
2669
Judge mean
94.0

By category

Coding75%
Creative73%
Factual59%
Multilingual64%
Reasoning74%
Rank 6OpenAI
66%±2

Win rate

Elo 1117

Won / lost / tied
981 / 315 / 1373
prompts
20
comparisons
2669
Judge mean
93.0

By category

Coding65%
Creative89%
Factual59%
Multilingual63%
Reasoning74%
Rank 6Z.ai (GLM / Zhipu)
66%±2

Win rate

Elo 1115

GLM-4.5
Tier A
Won / lost / tied
843 / 337 / 862
prompts
14
comparisons
2042
Judge mean
90.0

By category

Coding71%
Creative85%
Factual66%
Reasoning55%
Rank 12OpenAI
65%±2

Win rate

Elo 1106

gpt-4o
Tier C
Won / lost / tied
1034 / 390 / 1446
prompts
24
comparisons
2870
Judge mean
94.8

By category

Coding58%
Creative73%
Factual68%
Multilingual64%
Reasoning73%
Healthcare67%
Rank 14OpenAI
64%±2

Win rate

Elo 1101

Won / lost / tied
1026 / 421 / 1423
prompts
24
comparisons
2870
Judge mean
94.5

By category

Coding66%
Creative86%
Factual61%
Multilingual53%
Reasoning70%
Healthcare87%
Rank 14OpenAI
64%±2

Win rate

Elo 1101

Won / lost / tied
1060 / 455 / 1355
prompts
24
comparisons
2870
Judge mean
94.0

By category

Coding62%
Creative82%
Factual62%
Multilingual52%
Reasoning77%
Healthcare89%
Rank 14OpenAI
64%±2

Win rate

Elo 1101

Won / lost / tied
1004 / 401 / 1465
prompts
24
comparisons
2870
Judge mean
95.2

By category

Coding62%
Creative82%
Factual62%
Multilingual64%
Reasoning66%
Healthcare75%
Rank 15Anthropic
64%±2

Win rate

Elo 1100

Won / lost / tied
1038 / 437 / 1395
prompts
24
comparisons
2870
Judge mean
95.1

By category

Coding51%
Creative60%
Factual79%
Multilingual60%
Reasoning73%
Healthcare81%
Rank 16Google Gemini
64%±2

Win rate

Elo 1098

Won / lost / tied
1069 / 483 / 1318
prompts
24
comparisons
2870
Judge mean
94.8

By category

Coding67%
Creative45%
Factual71%
Multilingual61%
Reasoning64%
Healthcare85%
Rank 16Anthropic
63%±2

Win rate

Elo 1094

Won / lost / tied
919 / 401 / 1390
prompts
20
comparisons
2710
Judge mean
88.9

By category

Coding64%
Creative67%
Factual59%
Multilingual65%
Reasoning69%
Rank 16OpenAI
63%±2

Win rate

Elo 1092

o1
Tier C
Won / lost / tied
879 / 398 / 1262
prompts
20
comparisons
2539
Judge mean
90.4

By category

Coding77%
Creative55%
Factual48%
Multilingual65%
Reasoning63%
Rank 16Anthropic
63%±2

Win rate

Elo 1090

Won / lost / tied
1008 / 484 / 1378
prompts
24
comparisons
2870
Judge mean
95.8

By category

Coding54%
Creative58%
Factual71%
Multilingual63%
Reasoning67%
Healthcare88%
Rank 16Z.ai (GLM / Zhipu)
63%±2

Win rate

Elo 1089

GLM-5
Tier A
Won / lost / tied
553 / 252 / 733
prompts
14
comparisons
1538
Judge mean
94.6

By category

Coding57%
Creative89%
Factual64%
Reasoning61%
Rank 16Google Gemini
62%±2

Win rate

Elo 1087

Won / lost / tied
615 / 274 / 910
prompts
23
comparisons
1799
Judge mean
93.5

By category

Coding51%
Creative70%
Factual61%
Multilingual65%
Reasoning73%
Healthcare58%
Rank 17OpenAI
62%±2

Win rate

Elo 1086

Won / lost / tied
826 / 396 / 1246
prompts
20
comparisons
2468
Judge mean
86.8

By category

Coding77%
Creative6%
Factual61%
Multilingual68%
Reasoning63%
Rank 17OVH AI Endpoints (GRA)
62%±2

Win rate

Elo 1085

Won / lost / tied
901 / 450 / 1318
prompts
20
comparisons
2669
Judge mean
92.0

By category

Coding60%
Creative84%
Factual61%
Multilingual54%
Reasoning70%
Rank 18OpenAI
62%±2

Win rate

Elo 1083

Won / lost / tied
987 / 519 / 1364
prompts
24
comparisons
2870
Judge mean
92.8

By category

Coding51%
Creative73%
Factual72%
Multilingual62%
Reasoning62%
Healthcare72%
Rank 18OpenAI
62%±2

Win rate

Elo 1082

Won / lost / tied
940 / 479 / 1451
prompts
24
comparisons
2870
Judge mean
94.3

By category

Coding53%
Creative50%
Factual71%
Multilingual58%
Reasoning71%
Healthcare86%
Rank 18Google Gemini
61%±2

Win rate

Elo 1079

Won / lost / tied
853 / 444 / 1372
prompts
20
comparisons
2669
Judge mean
92.8

By category

Coding55%
Creative42%
Factual70%
Multilingual59%
Reasoning74%
Rank 19OpenAI
61%±2

Win rate

Elo 1076

o3
Tier C
Won / lost / tied
792 / 432 / 1169
prompts
20
comparisons
2393
Judge mean
83.3

By category

Coding65%
Creative88%
Factual57%
Multilingual53%
Reasoning58%
Rank 19Anthropic
61%±2

Win rate

Elo 1075

Won / lost / tied
935 / 521 / 1414
prompts
24
comparisons
2870
Judge mean
94.5

By category

Coding56%
Creative54%
Factual64%
Multilingual60%
Reasoning67%
Healthcare82%
Rank 19OpenAI
61%±2

Win rate

Elo 1075

Won / lost / tied
927 / 516 / 1427
prompts
24
comparisons
2870
Judge mean
89.1

By category

Coding60%
Creative72%
Factual46%
Multilingual67%
Reasoning69%
Healthcare54%
Rank 19OpenAI
61%±2

Win rate

Elo 1074

Won / lost / tied
926 / 520 / 1424
prompts
24
comparisons
2870
Judge mean
92.3

By category

Coding66%
Creative66%
Factual59%
Multilingual54%
Reasoning69%
Healthcare35%
Rank 19OpenAI
60%±2

Win rate

Elo 1074

Won / lost / tied
788 / 437 / 1239
prompts
20
comparisons
2464
Judge mean
81.6

By category

Coding58%
Creative69%
Factual50%
Multilingual70%
Reasoning63%
Rank 23Anthropic
60%±2

Win rate

Elo 1073

Won / lost / tied
961 / 564 / 1345
prompts
24
comparisons
2870
Judge mean
94.0

By category

Coding40%
Creative57%
Factual70%
Multilingual61%
Reasoning77%
Healthcare78%
Rank 22OpenAI
60%±2

Win rate

Elo 1073

o4-mini
Tier C
Won / lost / tied
850 / 497 / 1192
prompts
20
comparisons
2539
Judge mean
81.3

By category

Coding71%
Creative79%
Factual54%
Multilingual57%
Reasoning49%
Rank 23OpenAI
60%±2

Win rate

Elo 1072

Won / lost / tied
965 / 573 / 1332
prompts
24
comparisons
2870
Judge mean
93.6

By category

Coding56%
Creative77%
Factual57%
Multilingual55%
Reasoning73%
Healthcare72%
Rank 19Google Gemini
60%±3

Win rate

Elo 1070

Won / lost / tied
501 / 290 / 608
prompts
18
comparisons
1399
Judge mean
92.6

By category

Coding70%
Creative61%
Factual53%
Multilingual67%
Reasoning64%
Healthcare36%
Rank 23Anthropic
60%±2

Win rate

Elo 1069

Won / lost / tied
598 / 400 / 700
prompts
17
comparisons
1698
Judge mean
86.9

By category

Coding54%
Creative89%
Factual53%
Multilingual65%
Reasoning59%
Rank 24OpenAI
60%±2

Win rate

Elo 1068

Won / lost / tied
714 / 414 / 1246
prompts
19
comparisons
2374
Judge mean
82.1

By category

Coding65%
Creative84%
Factual49%
Multilingual56%
Reasoning58%
Rank 25OpenAI
59%±2

Win rate

Elo 1064

Won / lost / tied
817 / 516 / 1269
prompts
20
comparisons
2602
Judge mean
90.5

By category

Coding67%
Creative72%
Factual41%
Multilingual64%
Reasoning60%
Rank 25OpenAI
59%±2

Win rate

Elo 1064

Won / lost / tied
848 / 544 / 1277
prompts
20
comparisons
2669
Judge mean
85.2

By category

Coding63%
Creative30%
Factual44%
Multilingual69%
Reasoning74%
Rank 27OpenAI
59%±2

Win rate

Elo 1060

Won / lost / tied
899 / 601 / 1370
prompts
24
comparisons
2870
Judge mean
93.4

By category

Coding49%
Creative71%
Factual69%
Multilingual56%
Reasoning59%
Healthcare78%
Rank 27Anthropic
58%±2

Win rate

Elo 1058

Won / lost / tied
840 / 578 / 1251
prompts
20
comparisons
2669
Judge mean
93.8

By category

Coding48%
Creative44%
Factual72%
Multilingual58%
Reasoning67%
Rank 34OpenAI
57%±2

Win rate

Elo 1052

Won / lost / tied
876 / 641 / 1353
prompts
24
comparisons
2870
Judge mean
91.1

By category

Coding56%
Creative60%
Factual64%
Multilingual53%
Reasoning65%
Healthcare21%
Rank 34OpenAI
57%±2

Win rate

Elo 1050

Won / lost / tied
904 / 681 / 1285
prompts
24
comparisons
2870
Judge mean
88.5

By category

Coding61%
Creative70%
Factual44%
Multilingual58%
Reasoning65%
Healthcare49%
Rank 34OVH AI Endpoints (GRA)
57%±2

Win rate

Elo 1048

Won / lost / tied
778 / 584 / 1307
prompts
20
comparisons
2669
Judge mean
91.9

By category

Coding46%
Creative69%
Factual60%
Multilingual51%
Reasoning74%
Rank 47Anthropic
55%±2

Win rate

Elo 1035

Won / lost / tied
862 / 754 / 1254
prompts
24
comparisons
2870
Judge mean
91.7

By category

Coding58%
Creative55%
Factual53%
Multilingual55%
Reasoning61%
Healthcare33%
Rank 47OVH AI Endpoints (GRA)
55%±2

Win rate

Elo 1033

Won / lost / tied
828 / 744 / 1097
prompts
20
comparisons
2669
Judge mean
89.2

By category

Coding55%
Creative36%
Factual57%
Multilingual53%
Reasoning64%
Rank 49OVH AI Endpoints (GRA)
54%±2

Win rate

Elo 1027

Won / lost / tied
792 / 746 / 1131
prompts
20
comparisons
2669
Judge mean
90.9

By category

Coding66%
Creative41%
Factual46%
Multilingual50%
Reasoning61%
Rank 50OVH AI Endpoints (GRA)
53%±2

Win rate

Elo 1024

Won / lost / tied
791 / 767 / 1111
prompts
20
comparisons
2669
Judge mean
91.5

By category

Coding56%
Creative65%
Factual33%
Multilingual52%
Reasoning74%
Rank 52OpenAI
53%±2

Win rate

Elo 1019

Won / lost / tied
835 / 845 / 989
prompts
20
comparisons
2669
Judge mean
84.3

By category

Coding55%
Creative32%
Factual32%
Multilingual68%
Reasoning66%
Rank 52OpenAI
51%±2

Win rate

Elo 1009

gpt-4
Tier C
Won / lost / tied
867 / 957 / 1046
prompts
24
comparisons
2870
Judge mean
88.6

By category

Coding58%
Creative33%
Factual41%
Multilingual54%
Reasoning60%
Healthcare43%
Rank 53OpenAI
51%±2

Win rate

Elo 1005

o3-mini
Tier C
Won / lost / tied
627 / 722 / 1119
prompts
20
comparisons
2468
Judge mean
84.8

By category

Coding58%
Creative30%
Factual31%
Multilingual57%
Reasoning64%
Rank 53Google Gemini
50%±2

Win rate

Elo 1003

Won / lost / tied
485 / 536 / 778
prompts
23
comparisons
1799
Judge mean
79.3

By category

Coding44%
Creative82%
Factual43%
Multilingual55%
Reasoning43%
Healthcare43%
Rank 54OpenAI
50%±2

Win rate

Elo 1003

Won / lost / tied
549 / 641 / 1130
prompts
20
comparisons
2320
Judge mean
75.1

By category

Coding60%
Creative50%
Factual40%
Multilingual45%
Reasoning58%
Rank 54Anthropic
50%±2

Win rate

Elo 999

Won / lost / tied
586 / 716 / 868
prompts
18
comparisons
2170
Judge mean
82.7

By category

Coding31%
Creative86%
Factual53%
Multilingual41%
Reasoning55%
Rank 56Google Gemini
49%±2

Win rate

Elo 996

Won / lost / tied
801 / 988 / 1081
prompts
24
comparisons
2870
Judge mean
90.7

By category

Coding38%
Creative51%
Factual45%
Multilingual57%
Reasoning60%
Healthcare53%
Rank 59OpenAI
47%±2

Win rate

Elo 977

Won / lost / tied
730 / 1061 / 1079
prompts
24
comparisons
2870
Judge mean
82.2

By category

Coding55%
Creative54%
Factual23%
Multilingual56%
Reasoning52%
Healthcare18%
Rank 59OpenAI
47%±2

Win rate

Elo 977

gpt-4-0613
Tier Carchived
Won / lost / tied
754 / 1085 / 1031
prompts
24
comparisons
2870
Judge mean
90.0

By category

Coding45%
Creative53%
Factual37%
Multilingual48%
Reasoning56%
Healthcare51%
Rank 58OpenAI
47%±2

Win rate

Elo 976

Won / lost / tied
549 / 818 / 1026
prompts
20
comparisons
2393
Judge mean
71.9

By category

Coding64%
Creative35%
Factual40%
Multilingual32%
Reasoning58%
Rank 63OpenAI
43%±2

Win rate

Elo 952

Won / lost / tied
691 / 1203 / 976
prompts
24
comparisons
2870
Judge mean
82.4

By category

Coding58%
Creative46%
Factual18%
Multilingual51%
Reasoning43%
Healthcare25%
Rank 66Google Gemini
42%±2

Win rate

Elo 944

Won / lost / tied
686 / 1258 / 926
prompts
24
comparisons
2870
Judge mean
77.5

By category

Coding35%
Creative21%
Factual52%
Multilingual42%
Reasoning50%
Healthcare23%
Rank 66OpenAI
42%±2

Win rate

Elo 942

gpt-5
Tier C
Won / lost / tied
407 / 813 / 861
prompts
19
comparisons
2081
Judge mean
62.0

By category

Coding56%
Creative7%
Factual39%
Multilingual38%
Reasoning45%
Rank 66OpenAI
41%±2

Win rate

Elo 939

Won / lost / tied
688 / 1291 / 891
prompts
24
comparisons
2870
Judge mean
82.3

By category

Coding49%
Creative54%
Factual18%
Multilingual43%
Reasoning53%
Healthcare22%
Rank 66OpenAI
41%±2

Win rate

Elo 936

Won / lost / tied
681 / 1307 / 882
prompts
24
comparisons
2870
Judge mean
81.1

By category

Coding63%
Creative30%
Factual21%
Multilingual47%
Reasoning33%
Healthcare20%
Rank 66OpenAI
40%±2

Win rate

Elo 933

Won / lost / tied
466 / 977 / 877
prompts
20
comparisons
2320
Judge mean
59.1

By category

Coding56%
Creative3%
Factual24%
Multilingual37%
Reasoning58%
Rank 67OVH AI Endpoints (GRA)
39%±2

Win rate

Elo 922

Won / lost / tied
559 / 1195 / 781
prompts
20
comparisons
2535
Judge mean
79.8

By category

Coding50%
Creative45%
Factual31%
Multilingual25%
Reasoning49%
Rank 68Z.ai (GLM / Zhipu)
38%±2

Win rate

Elo 912

Won / lost / tied
358 / 847 / 611
prompts
14
comparisons
1816
Judge mean
54.5

By category

Coding43%
Creative31%
Factual44%
Reasoning24%
Rank 68Z.ai (GLM / Zhipu)
37%±2

Win rate

Elo 909

GLM-5.2
Tier A
Won / lost / tied
367 / 846 / 538
prompts
14
comparisons
1751
Judge mean
54.0

By category

Coding50%
Creative4%
Factual42%
Reasoning20%
Rank 70Z.ai (GLM / Zhipu)
37%±2

Win rate

Elo 907

Won / lost / tied
367 / 881 / 578
prompts
14
comparisons
1826
Judge mean
64.5

By category

Coding50%
Creative46%
Factual31%
Reasoning15%
Rank 71Z.ai (GLM / Zhipu)
37%±2

Win rate

Elo 904

GLM-5.1
Tier A
Won / lost / tied
375 / 831 / 412
prompts
14
comparisons
1618
Judge mean
69.1

By category

Coding32%
Creative13%
Factual50%
Reasoning34%
Rank 73OVH AI Endpoints (GRA)
35%±2

Win rate

Elo 890

Won / lost / tied
555 / 1438 / 676
prompts
20
comparisons
2669
Judge mean
75.9

By category

Coding42%
Creative10%
Factual29%
Multilingual39%
Reasoning36%
Rank 73Google Gemini
34%±2

Win rate

Elo 887

Won / lost / tied
605 / 1574 / 691
prompts
24
comparisons
2870
Judge mean
63.9

By category

Coding32%
Creative31%
Factual49%
Multilingual29%
Reasoning28%
Healthcare9%
Rank 77Z.ai (GLM / Zhipu)
31%±2

Win rate

Elo 864

Won / lost / tied
303 / 941 / 449
prompts
14
comparisons
1693
Judge mean
54.4

By category

Coding50%
Creative8%
Factual39%
Reasoning6%
Rank 77Z.ai (GLM / Zhipu)
31%±2

Win rate

Elo 862

GLM-4.6
Tier A
Won / lost / tied
303 / 974 / 463
prompts
13
comparisons
1740
Judge mean
55.8

By category

Coding46%
Creative1%
Factual37%
Reasoning16%
Rank 78OpenAI
30%±2

Win rate

Elo 856

Won / lost / tied
268 / 990 / 568
prompts
18
comparisons
1826
Judge mean
39.6

By category

Coding27%
Creative7%
Factual48%
Multilingual27%
Reasoning21%
Rank 79OVH AI Endpoints (GRA)
28%±2

Win rate

Elo 835

Won / lost / tied
476 / 1684 / 509
prompts
20
comparisons
2669
Judge mean
71.7

By category

Coding35%
Creative11%
Factual27%
Multilingual27%
Reasoning24%
Rank 81Z.ai (GLM / Zhipu)
26%±2

Win rate

Elo 818

Won / lost / tied
230 / 1025 / 421
prompts
14
comparisons
1676
Judge mean
46.4

By category

Coding43%
Creative4%
Factual29%
Reasoning5%
Rank 82Google Gemini
25%±2

Win rate

Elo 812

Won / lost / tied
418 / 1752 / 499
prompts
20
comparisons
2669
Judge mean
50.5

By category

Coding9%
Creative48%
Factual43%
Multilingual25%
Reasoning10%
Rank 83OpenAI
24%±2

Win rate

Elo 799

Won / lost / tied
219 / 1207 / 501
prompts
20
comparisons
1927
Judge mean
38.0

By category

Coding18%
Creative4%
Factual50%
Multilingual18%
Reasoning10%
Rank 83Google Gemini
23%±2

Win rate

Elo 792

Won / lost / tied
192 / 915 / 292
prompts
18
comparisons
1399
Judge mean
41.4

By category

Coding19%
Creative14%
Factual44%
Multilingual4%
Reasoning3%
Healthcare54%
Rank 83OVH AI Endpoints (GRA)
23%±2

Win rate

Elo 790

Won / lost / tied
255 / 1313 / 428
prompts
19
comparisons
1996
Judge mean
43.4

By category

Coding42%
Creative6%
Factual6%
Multilingual28%
Reasoning5%
Rank 83OVH AI Endpoints (GRA)
23%±2

Win rate

Elo 789

Qwen3-32B
Tier B
Won / lost / tied
440 / 1893 / 336
prompts
20
comparisons
2669
Judge mean
75.8

By category

Coding18%
Creative14%
Factual21%
Multilingual27%
Reasoning24%
Rank 83Google Gemini
22%±2

Win rate

Elo 780

Won / lost / tied
250 / 1275 / 353
prompts
24
comparisons
1878
Judge mean
44.1

By category

Coding4%
Creative38%
Factual42%
Multilingual19%
Reasoning13%
Healthcare3%
Rank 85OVH AI Endpoints (GRA)
21%±2

Win rate

Elo 770

Won / lost / tied
211 / 1343 / 442
prompts
19
comparisons
1996
Judge mean
44.1

By category

Coding36%
Creative5%
Factual11%
Multilingual24%
Reasoning3%
Rank 85Google Gemini
21%±2

Win rate

Elo 767

Won / lost / tied
404 / 2080 / 386
prompts
24
comparisons
2870
Judge mean
47.4

By category

Coding5%
Creative51%
Factual43%
Multilingual16%
Reasoning7%
Healthcare5%
Rank 86Google Gemini
20%±2

Win rate

Elo 761

Won / lost / tied
371 / 2077 / 422
prompts
24
comparisons
2870
Judge mean
43.9

By category

Coding4%
Creative23%
Factual49%
Multilingual17%
Reasoning7%
Healthcare2%
Rank 92Google Gemini
17%±2

Win rate

Elo 726

Won / lost / tied
182 / 1437 / 345
prompts
24
comparisons
1964
Judge mean
30.7

By category

Coding17%
Creative3%
Factual34%
Multilingual8%
Reasoning3%
Healthcare54%
Rank 93Google Gemini
14%±1

Win rate

Elo 687

Won / lost / tied
295 / 2327 / 248
prompts
24
comparisons
2870
Judge mean
36.6

By category

Coding3%
Creative24%
Factual25%
Multilingual11%
Reasoning10%
Healthcare2%

94 models ranked from 117,970 pairwise comparisons across 24 prompts.

Provisional

Too little evidence to rank: needs at least 5 prompts and 30 comparisons.

ProvisionalZ.ai (GLM / Zhipu)
1%±1

Win rate

Elo 155

CogView-4
Tier B
Won / lost / tied
0 / 361 / 6
prompts
4
comparisons
367
Judge mean
0.0

By category

Coding1%
Creative<1% · thin