Skip to content

Benchmarks

Intelligence test

Models are ranked by pairwise comparison, not by an absolute score. On every prompt each pair of models is compared head-to-head, and a Bradley-Terry model fits a rating from those comparisons. The win rate below turns that rating into the question it answers: how often this model beats an average model on this board. 50% is average.

How this is scored

8,879

scored runs

121,133

pairwise comparisons

24

prompts

4,760

runs without a score (provider error)

22 of 24 prompts separate models at all. The rest are answered equally well by nearly everyone and carry no ranking signal — that is what an absolute score near 100 was really measuring.

  • Coding 4/4
  • Creative 2/2
  • Factual 3/4
  • Multilingual 7/8
  • Reasoning 4/4
  • Healthcare 2/2
Rank 1OpenAI
72%±2

Win rate

Elo 1165

Won / lost / tied
1308 / 197 / 1485
prompts
24
comparisons
2990
Judge mean
96.0

By category

Coding78%
Creative91%
Factual74%
Multilingual60%
Reasoning76%
Healthcare75%
Rank 1OpenAI
71%±2

Win rate

Elo 1156

gpt-5.1
Tier B
Won / lost / tied
1147 / 174 / 1468
prompts
20
comparisons
2789
Judge mean
95.1

By category

Coding76%
Creative79%
Factual71%
Multilingual63%
Reasoning78%
Rank 1OpenAI
71%±2

Win rate

Elo 1156

Won / lost / tied
1171 / 199 / 1419
prompts
20
comparisons
2789
Judge mean
95.8

By category

Coding78%
Creative89%
Factual76%
Multilingual61%
Reasoning66%
Rank 1OpenAI
70%±2

Win rate

Elo 1148

Won / lost / tied
1189 / 201 / 1600
prompts
24
comparisons
2990
Judge mean
96.0

By category

Coding74%
Creative92%
Factual71%
Multilingual64%
Reasoning66%
Healthcare84%
Rank 1OpenAI
70%±2

Win rate

Elo 1146

gpt-5.4
Tier A
Won / lost / tied
1115 / 208 / 1466
prompts
20
comparisons
2789
Judge mean
95.0

By category

Coding72%
Creative90%
Factual63%
Multilingual67%
Reasoning74%
Rank 1OpenAI
69%±2

Win rate

Elo 1141

gpt-5.5
Tier C
Won / lost / tied
1122 / 252 / 1415
prompts
20
comparisons
2789
Judge mean
94.0

By category

Coding74%
Creative81%
Factual71%
Multilingual61%
Reasoning74%
Rank 1OpenAI
69%±2

Win rate

Elo 1138

Won / lost / tied
1147 / 228 / 1615
prompts
24
comparisons
2990
Judge mean
95.1

By category

Coding71%
Creative81%
Factual66%
Multilingual67%
Reasoning73%
Healthcare70%
Rank 2OpenAI
69%±2

Win rate

Elo 1135

Won / lost / tied
1081 / 249 / 1459
prompts
20
comparisons
2789
Judge mean
94.1

By category

Coding76%
Creative78%
Factual57%
Multilingual64%
Reasoning78%
Rank 2OpenAI
68%±2

Win rate

Elo 1135

gpt-5.2
Tier B
Won / lost / tied
1110 / 282 / 1397
prompts
20
comparisons
2789
Judge mean
93.6

By category

Coding65%
Creative91%
Factual67%
Multilingual62%
Reasoning77%
Rank 2Z.ai (GLM / Zhipu)
68%±2

Win rate

Elo 1130

GLM-4.7
Tier A
Won / lost / tied
855 / 268 / 904
prompts
14
comparisons
2027
Judge mean
91.3

By category

Coding62%
Creative84%
Factual70%
Reasoning73%
Rank 4OpenAI
67%±2

Win rate

Elo 1127

Won / lost / tied
1071 / 297 / 1421
prompts
20
comparisons
2789
Judge mean
94.7

By category

Coding74%
Creative89%
Factual54%
Multilingual63%
Reasoning73%
Rank 4Anthropic
67%±2

Win rate

Elo 1126

Won / lost / tied
1183 / 354 / 1453
prompts
24
comparisons
2990
Judge mean
96.9

By category

Coding61%
Creative92%
Factual73%
Multilingual62%
Reasoning66%
Healthcare90%
Rank 4OpenAI
67%±2

Win rate

Elo 1126

gpt-4.1
Tier B
Won / lost / tied
1140 / 311 / 1539
prompts
24
comparisons
2990
Judge mean
95.3

By category

Coding69%
Creative83%
Factual69%
Multilingual64%
Reasoning66%
Healthcare79%
Rank 4Z.ai (GLM / Zhipu)
67%±2

Win rate

Elo 1121

GLM-4.5
Tier A
Won / lost / tied
865 / 325 / 837
prompts
14
comparisons
2027
Judge mean
89.9

By category

Coding74%
Creative85%
Factual66%
Reasoning56%
Rank 5OpenAI
67%±2

Win rate

Elo 1120

Won / lost / tied
1065 / 339 / 1385
prompts
20
comparisons
2789
Judge mean
93.5

By category

Coding72%
Creative91%
Factual61%
Multilingual63%
Reasoning62%
Rank 6OpenAI
66%±2

Win rate

Elo 1118

Won / lost / tied
1036 / 328 / 1425
prompts
20
comparisons
2789
Judge mean
92.5

By category

Coding64%
Creative88%
Factual59%
Multilingual62%
Reasoning77%
Rank 6OpenAI
66%±2

Win rate

Elo 1115

Won / lost / tied
1010 / 320 / 1459
prompts
20
comparisons
2789
Judge mean
94.0

By category

Coding76%
Creative73%
Factual59%
Multilingual58%
Reasoning74%
Rank 10OpenAI
64%±2

Win rate

Elo 1102

gpt-4o
Tier C
Won / lost / tied
1058 / 412 / 1520
prompts
24
comparisons
2990
Judge mean
94.7

By category

Coding57%
Creative72%
Factual67%
Multilingual64%
Reasoning73%
Healthcare67%
Rank 14Anthropic
64%±2

Win rate

Elo 1098

Won / lost / tied
1080 / 463 / 1447
prompts
24
comparisons
2990
Judge mean
94.9

By category

Coding47%
Creative59%
Factual79%
Multilingual63%
Reasoning73%
Healthcare81%
Rank 14OpenAI
64%±2

Win rate

Elo 1098

Won / lost / tied
1089 / 472 / 1429
prompts
24
comparisons
2990
Judge mean
94.0

By category

Coding62%
Creative81%
Factual62%
Multilingual54%
Reasoning76%
Healthcare89%
Rank 14OpenAI
64%±2

Win rate

Elo 1098

Won / lost / tied
1033 / 421 / 1536
prompts
24
comparisons
2990
Judge mean
95.2

By category

Coding61%
Creative82%
Factual61%
Multilingual63%
Reasoning66%
Healthcare75%
Rank 14Google Gemini
64%±2

Win rate

Elo 1097

Won / lost / tied
1102 / 496 / 1392
prompts
24
comparisons
2990
Judge mean
94.8

By category

Coding67%
Creative44%
Factual71%
Multilingual61%
Reasoning64%
Healthcare85%
Rank 14OpenAI
64%±2

Win rate

Elo 1097

Won / lost / tied
1077 / 474 / 1439
prompts
24
comparisons
2990
Judge mean
94.3

By category

Coding61%
Creative85%
Factual61%
Multilingual58%
Reasoning70%
Healthcare87%
Rank 14OpenAI
63%±2

Win rate

Elo 1095

o1
Tier C
Won / lost / tied
931 / 404 / 1321
prompts
20
comparisons
2656
Judge mean
90.8

By category

Coding79%
Creative55%
Factual48%
Multilingual64%
Reasoning62%
Rank 15Anthropic
63%±2

Win rate

Elo 1092

Won / lost / tied
947 / 416 / 1467
prompts
20
comparisons
2830
Judge mean
89.2

By category

Coding64%
Creative66%
Factual59%
Multilingual64%
Reasoning68%
Rank 17Anthropic
62%±2

Win rate

Elo 1088

Won / lost / tied
1038 / 499 / 1453
prompts
24
comparisons
2990
Judge mean
95.8

By category

Coding54%
Creative58%
Factual71%
Multilingual62%
Reasoning66%
Healthcare88%
Rank 16Z.ai (GLM / Zhipu)
62%±3

Win rate

Elo 1086

GLM-5
Tier A
Won / lost / tied
539 / 251 / 731
prompts
14
comparisons
1521
Judge mean
94.6

By category

Coding57%
Creative89%
Factual63%
Reasoning61%
Rank 18OpenAI
62%±2

Win rate

Elo 1084

Won / lost / tied
846 / 417 / 1304
prompts
19
comparisons
2567
Judge mean
83.3

By category

Coding69%
Creative83%
Factual48%
Multilingual61%
Reasoning58%
Rank 18Google Gemini
62%±2

Win rate

Elo 1083

Won / lost / tied
600 / 274 / 907
prompts
23
comparisons
1781
Judge mean
93.5

By category

Coding50%
Creative69%
Factual61%
Multilingual64%
Reasoning73%
Healthcare58%
Rank 18OpenAI
62%±2

Win rate

Elo 1082

Won / lost / tied
840 / 415 / 1331
prompts
20
comparisons
2586
Judge mean
87.4

By category

Coding75%
Creative6%
Factual60%
Multilingual67%
Reasoning63%
Rank 18OpenAI
61%±2

Win rate

Elo 1081

o3
Tier C
Won / lost / tied
846 / 435 / 1230
prompts
20
comparisons
2511
Judge mean
84.2

By category

Coding64%
Creative88%
Factual57%
Multilingual58%
Reasoning58%
Rank 18OpenAI
61%±2

Win rate

Elo 1081

Won / lost / tied
973 / 493 / 1524
prompts
24
comparisons
2990
Judge mean
94.3

By category

Coding53%
Creative49%
Factual71%
Multilingual59%
Reasoning71%
Healthcare86%
Rank 18Google Gemini
61%±2

Win rate

Elo 1079

Won / lost / tied
884 / 451 / 1454
prompts
20
comparisons
2789
Judge mean
92.8

By category

Coding55%
Creative41%
Factual70%
Multilingual60%
Reasoning74%
Rank 18OpenAI
61%±2

Win rate

Elo 1075

o4-mini
Tier C
Won / lost / tied
892 / 502 / 1262
prompts
20
comparisons
2656
Judge mean
81.8

By category

Coding72%
Creative78%
Factual54%
Multilingual57%
Reasoning52%
Rank 18OpenAI
61%±2

Win rate

Elo 1075

Won / lost / tied
819 / 440 / 1322
prompts
20
comparisons
2581
Judge mean
82.6

By category

Coding58%
Creative68%
Factual50%
Multilingual69%
Reasoning63%
Rank 19OpenAI
60%±2

Win rate

Elo 1073

Won / lost / tied
999 / 579 / 1412
prompts
24
comparisons
2990
Judge mean
92.1

By category

Coding46%
Creative72%
Factual71%
Multilingual62%
Reasoning61%
Healthcare72%
Rank 19Anthropic
60%±2

Win rate

Elo 1073

Won / lost / tied
990 / 572 / 1428
prompts
24
comparisons
2990
Judge mean
94.0

By category

Coding40%
Creative56%
Factual70%
Multilingual61%
Reasoning76%
Healthcare78%
Rank 22OpenAI
60%±2

Win rate

Elo 1071

Won / lost / tied
970 / 569 / 1451
prompts
24
comparisons
2990
Judge mean
89.0

By category

Coding64%
Creative71%
Factual46%
Multilingual62%
Reasoning69%
Healthcare54%
Rank 24Anthropic
59%±2

Win rate

Elo 1066

Won / lost / tied
636 / 434 / 759
prompts
19
comparisons
1829
Judge mean
86.1

By category

Coding53%
Creative88%
Factual52%
Multilingual62%
Reasoning60%
Rank 25OVH AI Endpoints (GRA)
59%±2

Win rate

Elo 1066

Won / lost / tied
911 / 575 / 1303
prompts
20
comparisons
2789
Judge mean
90.9

By category

Coding59%
Creative84%
Factual61%
Multilingual52%
Reasoning62%
Rank 21Google Gemini
59%±3

Win rate

Elo 1066

Won / lost / tied
489 / 290 / 607
prompts
18
comparisons
1386
Judge mean
92.6

By category

Coding70%
Creative60%
Factual52%
Multilingual66%
Reasoning64%
Healthcare36%
Rank 25Anthropic
59%±2

Win rate

Elo 1065

Won / lost / tied
909 / 583 / 1297
prompts
20
comparisons
2789
Judge mean
93.9

By category

Coding48%
Creative43%
Factual71%
Multilingual62%
Reasoning66%
Rank 25OpenAI
59%±2

Win rate

Elo 1064

Won / lost / tied
848 / 531 / 1344
prompts
20
comparisons
2723
Judge mean
89.8

By category

Coding67%
Creative71%
Factual41%
Multilingual63%
Reasoning59%
Rank 26OpenAI
59%±2

Win rate

Elo 1064

Won / lost / tied
984 / 634 / 1372
prompts
24
comparisons
2990
Judge mean
93.4

By category

Coding56%
Creative76%
Factual56%
Multilingual52%
Reasoning73%
Healthcare72%
Rank 26OpenAI
59%±2

Win rate

Elo 1064

Won / lost / tied
909 / 592 / 1288
prompts
20
comparisons
2789
Judge mean
86.2

By category

Coding65%
Creative30%
Factual43%
Multilingual66%
Reasoning74%
Rank 27Anthropic
59%±2

Win rate

Elo 1060

Won / lost / tied
947 / 631 / 1412
prompts
24
comparisons
2990
Judge mean
94.3

By category

Coding56%
Creative53%
Factual64%
Multilingual54%
Reasoning66%
Healthcare82%
Rank 27OpenAI
58%±2

Win rate

Elo 1059

Won / lost / tied
927 / 616 / 1447
prompts
24
comparisons
2990
Judge mean
93.3

By category

Coding48%
Creative70%
Factual69%
Multilingual57%
Reasoning59%
Healthcare78%
Rank 27OpenAI
58%±2

Win rate

Elo 1056

Won / lost / tied
923 / 636 / 1431
prompts
24
comparisons
2990
Judge mean
91.9

By category

Coding61%
Creative66%
Factual58%
Multilingual51%
Reasoning69%
Healthcare35%
Rank 38OpenAI
57%±2

Win rate

Elo 1046

Won / lost / tied
887 / 685 / 1418
prompts
24
comparisons
2990
Judge mean
91.1

By category

Coding60%
Creative59%
Factual63%
Multilingual46%
Reasoning68%
Healthcare21%
Rank 39OpenAI
56%±2

Win rate

Elo 1040

Won / lost / tied
907 / 751 / 1332
prompts
24
comparisons
2990
Judge mean
88.2

By category

Coding60%
Creative70%
Factual43%
Multilingual55%
Reasoning63%
Healthcare49%
Rank 40OVH AI Endpoints (GRA)
55%±2

Win rate

Elo 1038

Won / lost / tied
792 / 664 / 1333
prompts
20
comparisons
2789
Judge mean
91.5

By category

Coding43%
Creative69%
Factual59%
Multilingual50%
Reasoning73%
Rank 49Anthropic
54%±2

Win rate

Elo 1028

Won / lost / tied
881 / 820 / 1289
prompts
24
comparisons
2990
Judge mean
91.6

By category

Coding58%
Creative54%
Factual53%
Multilingual52%
Reasoning60%
Healthcare33%
Rank 49OVH AI Endpoints (GRA)
54%±2

Win rate

Elo 1025

Won / lost / tied
845 / 814 / 1130
prompts
20
comparisons
2789
Judge mean
89.1

By category

Coding55%
Creative36%
Factual56%
Multilingual50%
Reasoning64%
Rank 49OpenAI
53%±2

Win rate

Elo 1021

Won / lost / tied
889 / 889 / 1011
prompts
20
comparisons
2789
Judge mean
84.7

By category

Coding54%
Creative31%
Factual31%
Multilingual70%
Reasoning61%
Rank 51OVH AI Endpoints (GRA)
52%±2

Win rate

Elo 1013

Won / lost / tied
804 / 865 / 1120
prompts
20
comparisons
2789
Judge mean
90.6

By category

Coding66%
Creative40%
Factual45%
Multilingual46%
Reasoning57%
Rank 51OVH AI Endpoints (GRA)
52%±2

Win rate

Elo 1011

Won / lost / tied
784 / 855 / 1150
prompts
20
comparisons
2789
Judge mean
91.3

By category

Coding50%
Creative64%
Factual32%
Multilingual51%
Reasoning74%
Rank 52Anthropic
51%±2

Win rate

Elo 1007

Won / lost / tied
656 / 749 / 891
prompts
20
comparisons
2296
Judge mean
82.4

By category

Coding26%
Creative85%
Factual52%
Multilingual51%
Reasoning55%
Rank 52OpenAI
51%±2

Win rate

Elo 1005

Won / lost / tied
560 / 641 / 1171
prompts
20
comparisons
2372
Judge mean
75.6

By category

Coding59%
Creative50%
Factual40%
Multilingual47%
Reasoning58%
Rank 52OpenAI
50%±2

Win rate

Elo 1002

o3-mini
Tier C
Won / lost / tied
670 / 797 / 1186
prompts
20
comparisons
2653
Judge mean
85.1

By category

Coding56%
Creative29%
Factual31%
Multilingual54%
Reasoning65%
Rank 52Google Gemini
50%±2

Win rate

Elo 1001

Won / lost / tied
473 / 532 / 776
prompts
23
comparisons
1781
Judge mean
79.3

By category

Coding44%
Creative82%
Factual43%
Multilingual55%
Reasoning43%
Healthcare43%
Rank 54Google Gemini
49%±2

Win rate

Elo 995

Won / lost / tied
827 / 1031 / 1132
prompts
24
comparisons
2990
Judge mean
90.5

By category

Coding35%
Creative50%
Factual44%
Multilingual58%
Reasoning60%
Healthcare53%
Rank 57OpenAI
47%±2

Win rate

Elo 981

Won / lost / tied
565 / 810 / 1069
prompts
20
comparisons
2444
Judge mean
73.0

By category

Coding64%
Creative36%
Factual39%
Multilingual35%
Reasoning58%
Rank 60OpenAI
46%±2

Win rate

Elo 974

gpt-4
Tier C
Won / lost / tied
793 / 1157 / 1040
prompts
24
comparisons
2990
Judge mean
87.7

By category

Coding45%
Creative32%
Factual40%
Multilingual48%
Reasoning59%
Healthcare43%
Rank 60OpenAI
46%±2

Win rate

Elo 974

Won / lost / tied
746 / 1112 / 1132
prompts
24
comparisons
2990
Judge mean
81.8

By category

Coding55%
Creative54%
Factual23%
Multilingual54%
Reasoning52%
Healthcare18%
Rank 61OpenAI
46%±2

Win rate

Elo 969

gpt-4-0613
Tier Carchived
Won / lost / tied
763 / 1166 / 1061
prompts
24
comparisons
2990
Judge mean
89.3

By category

Coding44%
Creative52%
Factual37%
Multilingual46%
Reasoning54%
Healthcare51%
Rank 63OpenAI
42%±2

Win rate

Elo 947

gpt-5
Tier C
Won / lost / tied
414 / 803 / 916
prompts
19
comparisons
2133
Judge mean
62.8

By category

Coding56%
Creative7%
Factual38%
Multilingual41%
Reasoning45%
Rank 65Google Gemini
42%±2

Win rate

Elo 947

Won / lost / tied
709 / 1285 / 996
prompts
24
comparisons
2990
Judge mean
77.3

By category

Coding33%
Creative20%
Factual52%
Multilingual46%
Reasoning48%
Healthcare23%
Rank 65OpenAI
42%±2

Win rate

Elo 946

Won / lost / tied
692 / 1272 / 1026
prompts
24
comparisons
2990
Judge mean
82.0

By category

Coding57%
Creative45%
Factual18%
Multilingual48%
Reasoning42%
Healthcare25%
Rank 66OpenAI
42%±2

Win rate

Elo 942

Won / lost / tied
716 / 1330 / 944
prompts
24
comparisons
2990
Judge mean
82.6

By category

Coding49%
Creative53%
Factual18%
Multilingual44%
Reasoning54%
Healthcare22%
Rank 66OpenAI
41%±2

Win rate

Elo 940

Won / lost / tied
483 / 967 / 922
prompts
20
comparisons
2372
Judge mean
59.9

By category

Coding57%
Creative3%
Factual23%
Multilingual40%
Reasoning58%
Rank 66OpenAI
41%±2

Win rate

Elo 937

Won / lost / tied
698 / 1349 / 943
prompts
24
comparisons
2990
Judge mean
81.2

By category

Coding62%
Creative29%
Factual21%
Multilingual46%
Reasoning34%
Healthcare20%
Rank 66OVH AI Endpoints (GRA)
39%±2

Win rate

Elo 920

Won / lost / tied
577 / 1261 / 814
prompts
20
comparisons
2652
Judge mean
80.3

By category

Coding50%
Creative45%
Factual31%
Multilingual27%
Reasoning48%
Rank 69Z.ai (GLM / Zhipu)
38%±2

Win rate

Elo 913

Won / lost / tied
356 / 838 / 607
prompts
14
comparisons
1801
Judge mean
54.5

By category

Coding43%
Creative31%
Factual44%
Reasoning25%
Rank 72Z.ai (GLM / Zhipu)
37%±2

Win rate

Elo 905

Won / lost / tied
357 / 873 / 579
prompts
14
comparisons
1809
Judge mean
65.4

By category

Coding50%
Creative46%
Factual31%
Reasoning15%
Rank 72Z.ai (GLM / Zhipu)
36%±2

Win rate

Elo 903

GLM-5.1
Tier A
Won / lost / tied
366 / 823 / 411
prompts
14
comparisons
1600
Judge mean
69.1

By category

Coding32%
Creative13%
Factual50%
Reasoning34%
Rank 72Z.ai (GLM / Zhipu)
36%±2

Win rate

Elo 899

GLM-5.2
Tier A
Won / lost / tied
358 / 901 / 540
prompts
14
comparisons
1799
Judge mean
52.3

By category

Coding50%
Creative4%
Factual42%
Reasoning17%
Rank 73Google Gemini
35%±2

Win rate

Elo 892

Won / lost / tied
621 / 1600 / 769
prompts
24
comparisons
2990
Judge mean
63.0

By category

Coding29%
Creative31%
Factual49%
Multilingual35%
Reasoning27%
Healthcare9%
Rank 73Z.ai (GLM / Zhipu)
34%±2

Win rate

Elo 882

GLM-4.6
Tier A
Won / lost / tied
348 / 993 / 524
prompts
14
comparisons
1865
Judge mean
58.4

By category

Coding48%
Creative1%
Factual37%
Reasoning25%
Rank 75OVH AI Endpoints (GRA)
32%±2

Win rate

Elo 873

Won / lost / tied
572 / 1611 / 606
prompts
20
comparisons
2789
Judge mean
74.4

By category

Coding44%
Creative9%
Factual29%
Multilingual32%
Reasoning29%
Rank 76Z.ai (GLM / Zhipu)
31%±2

Win rate

Elo 863

Won / lost / tied
295 / 933 / 447
prompts
14
comparisons
1675
Judge mean
54.9

By category

Coding49%
Creative8%
Factual38%
Reasoning6%
Rank 78OpenAI
29%±2

Win rate

Elo 848

Won / lost / tied
264 / 1048 / 569
prompts
18
comparisons
1881
Judge mean
40.9

By category

Coding27%
Creative7%
Factual47%
Multilingual24%
Reasoning21%
Rank 80OVH AI Endpoints (GRA)
28%±2

Win rate

Elo 833

Won / lost / tied
343 / 1299 / 485
prompts
19
comparisons
2127
Judge mean
45.7

By category

Coding50%
Creative6%
Factual5%
Multilingual32%
Reasoning5%
Rank 80Z.ai (GLM / Zhipu)
27%±2

Win rate

Elo 831

Won / lost / tied
249 / 1035 / 450
prompts
14
comparisons
1734
Judge mean
47.9

By category

Coding45%
Creative4%
Factual28%
Reasoning5%
Rank 81Google Gemini
26%±2

Win rate

Elo 816

Won / lost / tied
426 / 1808 / 555
prompts
20
comparisons
2789
Judge mean
49.4

By category

Coding9%
Creative48%
Factual43%
Multilingual27%
Reasoning10%
Rank 82OVH AI Endpoints (GRA)
26%±2

Win rate

Elo 814

Won / lost / tied
463 / 1854 / 472
prompts
20
comparisons
2789
Judge mean
70.9

By category

Coding28%
Creative12%
Factual26%
Multilingual24%
Reasoning23%
Rank 83OpenAI
24%±2

Win rate

Elo 796

Won / lost / tied
217 / 1252 / 512
prompts
20
comparisons
1981
Judge mean
39.4

By category

Coding18%
Creative4%
Factual50%
Multilingual18%
Reasoning10%
Rank 83Google Gemini
23%±2

Win rate

Elo 792

Won / lost / tied
188 / 907 / 291
prompts
18
comparisons
1386
Judge mean
41.4

By category

Coding19%
Creative14%
Factual43%
Multilingual4%
Reasoning3%
Healthcare54%
Rank 85Google Gemini
22%±2

Win rate

Elo 780

Won / lost / tied
245 / 1263 / 351
prompts
24
comparisons
1859
Judge mean
44.1

By category

Coding4%
Creative37%
Factual42%
Multilingual20%
Reasoning13%
Healthcare3%
Rank 86Google Gemini
21%±2

Win rate

Elo 775

Won / lost / tied
417 / 2131 / 442
prompts
24
comparisons
2990
Judge mean
47.0

By category

Coding5%
Creative50%
Factual43%
Multilingual19%
Reasoning7%
Healthcare5%
Rank 86OVH AI Endpoints (GRA)
21%±2

Win rate

Elo 772

Won / lost / tied
207 / 1328 / 439
prompts
19
comparisons
1974
Judge mean
44.8

By category

Coding37%
Creative5%
Factual10%
Multilingual24%
Reasoning4%
Rank 86Google Gemini
21%±2

Win rate

Elo 769

Won / lost / tied
384 / 2127 / 479
prompts
24
comparisons
2990
Judge mean
43.4

By category

Coding4%
Creative23%
Factual49%
Multilingual20%
Reasoning8%
Healthcare2%
Rank 88Google Gemini
19%±2

Win rate

Elo 748

Won / lost / tied
197 / 1422 / 401
prompts
24
comparisons
2020
Judge mean
31.3

By category

Coding17%
Creative3%
Factual34%
Multilingual15%
Reasoning3%
Healthcare54%
Rank 93Google Gemini
14%±1

Win rate

Elo 685

Won / lost / tied
296 / 2434 / 260
prompts
24
comparisons
2990
Judge mean
36.4

By category

Coding3%
Creative25%
Factual25%
Multilingual11%
Reasoning10%
Healthcare2%

93 models ranked from 121,133 pairwise comparisons across 24 prompts.

Provisional

Too little evidence to rank: needs at least 5 prompts and 30 comparisons.

ProvisionalZ.ai (GLM / Zhipu)
1%±1

Win rate

Elo 160

CogView-4
Tier B
Won / lost / tied
0 / 357 / 6
prompts
4
comparisons
363
Judge mean
0.0

By category

Coding1%
Creative<1% · thin