Aller au contenu

Benchmarks

Test d'intelligence

Les modèles sont classés par comparaison deux à deux, non par une note absolue. Sur chaque prompt, chaque paire de modèles est comparée en duel, et un modèle de Bradley-Terry en déduit une cote. Le taux de victoire ci-dessous traduit cette cote en la question à laquelle elle répond : à quelle fréquence ce modèle bat un modèle moyen de ce tableau. 50 % est la moyenne.

Comment la note est calculée

7 836

exécutions notées

105 499

comparaisons deux à deux

24

prompts

4 586

exécutions sans note (erreur du fournisseur)

22 des 24 prompts distinguent réellement les modèles. Les autres reçoivent la même qualité de réponse de presque tout le monde et n’apportent aucun signal de classement — c’est ce qu’un score absolu proche de 100 mesurait en réalité.

  • Code 4/4
  • Créatif 2/2
  • Factuel 3/4
  • Multilingue 7/8
  • Raisonnement 4/4
  • Santé 2/2
Rang 1OpenAI
74%±2

Taux de victoire

Elo 1179

gpt-5.1
Tier B
Gagné / perdu / à égalité
983 / 38 / 1334
prompts
20
comparaisons
2355
Moyenne du juge
97.2

Par catégorie

Code75%
Créatif91%
Factuel71%
Multilingue68%
Raisonnement79%
Rang 1Z.ai (GLM / Zhipu)
74%±2

Taux de victoire

Elo 1178

GLM-4.7
Tier A
Gagné / perdu / à égalité
790 / 88 / 861
prompts
14
comparaisons
1739
Moyenne du juge
95.8

Par catégorie

Code73%
Créatif85%
Factuel75%
Raisonnement74%
Rang 1OpenAI
72%±2

Taux de victoire

Elo 1162

Gagné / perdu / à égalité
924 / 70 / 1361
prompts
20
comparaisons
2355
Moyenne du juge
96.9

Par catégorie

Code76%
Créatif90%
Factuel68%
Multilingue65%
Raisonnement74%
Rang 1OpenAI
71%±2

Taux de victoire

Elo 1152

Gagné / perdu / à égalité
1044 / 178 / 1334
prompts
24
comparaisons
2556
Moyenne du juge
96.3

Par catégorie

Code75%
Créatif89%
Factuel71%
Multilingue57%
Raisonnement77%
Santé75%
Rang 1OpenAI
71%±2

Taux de victoire

Elo 1152

Gagné / perdu / à égalité
982 / 119 / 1455
prompts
24
comparaisons
2556
Moyenne du juge
96.6

Par catégorie

Code71%
Créatif90%
Factuel71%
Multilingue63%
Raisonnement73%
Santé84%
Rang 1Anthropic
70%±2

Taux de victoire

Elo 1149

Claude Opus 4.6
Tier Barchived
Gagné / perdu / à égalité
1045 / 199 / 1312
prompts
24
comparaisons
2556
Moyenne du juge
97.7

Par catégorie

Code61%
Créatif91%
Factuel73%
Multilingue67%
Raisonnement74%
Santé90%
Rang 2OpenAI
70%±2

Taux de victoire

Elo 1146

Gagné / perdu / à égalité
931 / 168 / 1256
prompts
20
comparaisons
2355
Moyenne du juge
96.5

Par catégorie

Code76%
Créatif90%
Factuel59%
Multilingue61%
Raisonnement79%
Rang 2OpenAI
70%±2

Taux de victoire

Elo 1145

gpt-5.2
Tier B
Gagné / perdu / à égalité
917 / 161 / 1277
prompts
20
comparaisons
2355
Moyenne du juge
96.7

Par catégorie

Code66%
Créatif90%
Factuel72%
Multilingue64%
Raisonnement74%
Rang 3OpenAI
69%±2

Taux de victoire

Elo 1142

gpt-5.5
Tier C
Gagné / perdu / à égalité
919 / 179 / 1257
prompts
20
comparaisons
2355
Moyenne du juge
95.1

Par catégorie

Code68%
Créatif80%
Factuel74%
Multilingue64%
Raisonnement74%
Rang 3OpenAI
69%±2

Taux de victoire

Elo 1139

gpt-4.1
Tier B
Gagné / perdu / à égalité
957 / 170 / 1429
prompts
24
comparaisons
2556
Moyenne du juge
96.2

Par catégorie

Code75%
Créatif81%
Factuel66%
Multilingue62%
Raisonnement73%
Santé79%
Rang 3OpenAI
69%±2

Taux de victoire

Elo 1138

Gagné / perdu / à égalité
894 / 176 / 1285
prompts
20
comparaisons
2355
Moyenne du juge
96.4

Par catégorie

Code71%
Créatif90%
Factuel57%
Multilingue67%
Raisonnement74%
Rang 3OpenAI
68%±2

Taux de victoire

Elo 1132

Gagné / perdu / à égalité
872 / 186 / 1297
prompts
20
comparaisons
2355
Moyenne du juge
95.6

Par catégorie

Code76%
Créatif78%
Factuel52%
Multilingue67%
Raisonnement79%
Rang 4OpenAI
68%±2

Taux de victoire

Elo 1131

Gagné / perdu / à égalité
848 / 170 / 1337
prompts
20
comparaisons
2355
Moyenne du juge
95.9

Par catégorie

Code72%
Créatif76%
Factuel62%
Multilingue67%
Raisonnement74%
Rang 4OpenAI
68%±2

Taux de victoire

Elo 1130

Gagné / perdu / à égalité
937 / 206 / 1413
prompts
24
comparaisons
2556
Moyenne du juge
95.6

Par catégorie

Code71%
Créatif76%
Factuel64%
Multilingue66%
Raisonnement74%
Santé70%
Rang 4OpenAI
67%±2

Taux de victoire

Elo 1123

gpt-4o-2024-05-13
Tier Carchived
Gagné / perdu / à égalité
904 / 221 / 1431
prompts
24
comparaisons
2556
Moyenne du juge
96.0

Par catégorie

Code68%
Créatif80%
Factuel66%
Multilingue61%
Raisonnement73%
Santé75%
Rang 4OpenAI
67%±2

Taux de victoire

Elo 1122

gpt-5.4
Tier A
Gagné / perdu / à égalité
850 / 224 / 1281
prompts
20
comparaisons
2355
Moyenne du juge
96.1

Par catégorie

Code65%
Créatif89%
Factuel57%
Multilingue66%
Raisonnement74%
Rang 6Anthropic
67%±2

Taux de victoire

Elo 1120

Claude Opus 4.5
Tier Barchived
Gagné / perdu / à égalité
950 / 287 / 1319
prompts
24
comparaisons
2556
Moyenne du juge
96.8

Par catégorie

Code56%
Créatif62%
Factuel78%
Multilingue66%
Raisonnement74%
Santé88%
Rang 7OpenAI
66%±2

Taux de victoire

Elo 1117

Gagné / perdu / à égalité
960 / 311 / 1285
prompts
24
comparaisons
2556
Moyenne du juge
95.0

Par catégorie

Code68%
Créatif86%
Factuel60%
Multilingue54%
Raisonnement78%
Santé89%
Rang 7OpenAI
66%±2

Taux de victoire

Elo 1117

gpt-4o
Tier C
Gagné / perdu / à égalité
923 / 280 / 1353
prompts
24
comparaisons
2556
Moyenne du juge
95.5

Par catégorie

Code58%
Créatif82%
Factuel73%
Multilingue62%
Raisonnement73%
Santé67%
Rang 9Z.ai (GLM / Zhipu)
65%±2

Taux de victoire

Elo 1110

GLM-4.5
Tier A
Gagné / perdu / à égalité
721 / 291 / 790
prompts
14
comparaisons
1802
Moyenne du juge
90.9

Par catégorie

Code75%
Créatif80%
Factuel64%
Raisonnement52%
Rang 11OpenAI
65%±2

Taux de victoire

Elo 1109

Gagné / perdu / à égalité
819 / 272 / 1264
prompts
20
comparaisons
2355
Moyenne du juge
95.2

Par catégorie

Code69%
Créatif85%
Factuel54%
Multilingue60%
Raisonnement74%
Rang 12Anthropic
65%±2

Taux de victoire

Elo 1108

Claude Opus 4.7
Tier Barchived
Gagné / perdu / à égalité
920 / 335 / 1301
prompts
24
comparaisons
2556
Moyenne du juge
96.2

Par catégorie

Code51%
Créatif61%
Factuel81%
Multilingue63%
Raisonnement73%
Santé81%
Rang 12Google Gemini
65%±2

Taux de victoire

Elo 1106

Gagné / perdu / à égalité
967 / 392 / 1197
prompts
24
comparaisons
2556
Moyenne du juge
95.5

Par catégorie

Code68%
Créatif59%
Factuel69%
Multilingue64%
Raisonnement63%
Santé85%
Rang 12Anthropic
64%±3

Taux de victoire

Elo 1102

Claude Sonnet 5
Tier Aarchived
Gagné / perdu / à égalité
513 / 232 / 639
prompts
15
comparaisons
1384
Moyenne du juge
88.7

Par catégorie

Code68%
Créatif90%
Factuel61%
Multilingue61%
Raisonnement53%
Rang 15OpenAI
64%±2

Taux de victoire

Elo 1100

Gagné / perdu / à égalité
888 / 349 / 1319
prompts
24
comparaisons
2556
Moyenne du juge
95.1

Par catégorie

Code62%
Créatif82%
Factuel59%
Multilingue55%
Raisonnement77%
Santé87%
Rang 12Z.ai (GLM / Zhipu)
64%±2

Taux de victoire

Elo 1100

GLM-5
Tier A
Gagné / perdu / à égalité
560 / 217 / 756
prompts
14
comparaisons
1533
Moyenne du juge
94.3

Par catégorie

Code62%
Créatif89%
Factuel64%
Raisonnement62%
Rang 18Anthropic
63%±2

Taux de victoire

Elo 1090

Claude Sonnet 4.5
Tier Barchived
Gagné / perdu / à égalité
889 / 420 / 1247
prompts
24
comparaisons
2556
Moyenne du juge
95.2

Par catégorie

Code43%
Créatif59%
Factuel74%
Multilingue64%
Raisonnement77%
Santé78%
Rang 19Anthropic
62%±2

Taux de victoire

Elo 1089

Claude Sonnet 4.6
Tier Aarchived
Gagné / perdu / à égalité
845 / 384 / 1327
prompts
24
comparaisons
2556
Moyenne du juge
95.4

Par catégorie

Code55%
Créatif55%
Factuel66%
Multilingue63%
Raisonnement73%
Santé82%
Rang 19OpenAI
62%±2

Taux de victoire

Elo 1089

Gagné / perdu / à égalité
870 / 409 / 1277
prompts
24
comparaisons
2556
Moyenne du juge
94.5

Par catégorie

Code57%
Créatif72%
Factuel62%
Multilingue60%
Raisonnement73%
Santé72%
Rang 18Google Gemini
62%±2

Taux de victoire

Elo 1087

Nano Banana
Tier Barchived
Gagné / perdu / à égalité
615 / 274 / 910
prompts
23
comparaisons
1799
Moyenne du juge
93.5

Par catégorie

Code51%
Créatif70%
Factuel61%
Multilingue65%
Raisonnement74%
Santé58%
Rang 20OVH AI Endpoints (GRA)
62%±2

Taux de victoire

Elo 1087

Gagné / perdu / à égalité
793 / 377 / 1185
prompts
20
comparaisons
2355
Moyenne du juge
93.0

Par catégorie

Code58%
Créatif82%
Factuel62%
Multilingue56%
Raisonnement70%
Rang 20OpenAI
62%±2

Taux de victoire

Elo 1083

Gagné / perdu / à égalité
830 / 404 / 1322
prompts
24
comparaisons
2556
Moyenne du juge
95.1

Par catégorie

Code53%
Créatif49%
Factuel71%
Multilingue61%
Raisonnement72%
Santé86%
Rang 20OpenAI
62%±2

Taux de victoire

Elo 1082

Gagné / perdu / à égalité
818 / 403 / 1335
prompts
24
comparaisons
2556
Moyenne du juge
90.1

Par catégorie

Code58%
Créatif77%
Factuel54%
Multilingue66%
Raisonnement68%
Santé54%
Rang 20OpenAI
61%±2

Taux de victoire

Elo 1081

Gagné / perdu / à égalité
751 / 371 / 1233
prompts
20
comparaisons
2355
Moyenne du juge
89.2

Par catégorie

Code71%
Créatif31%
Factuel49%
Multilingue67%
Raisonnement74%
Rang 20Anthropic
61%±2

Taux de victoire

Elo 1080

Claude Fable 5
Tier Aarchived
Gagné / perdu / à égalité
744 / 364 / 1288
prompts
20
comparaisons
2396
Moyenne du juge
89.1

Par catégorie

Code67%
Créatif71%
Factuel49%
Multilingue62%
Raisonnement68%
Rang 21OpenAI
61%±2

Taux de victoire

Elo 1079

Gagné / perdu / à égalité
826 / 426 / 1304
prompts
24
comparaisons
2556
Moyenne du juge
92.9

Par catégorie

Code68%
Créatif60%
Factuel61%
Multilingue56%
Raisonnement68%
Santé35%
Rang 23OpenAI
61%±2

Taux de victoire

Elo 1078

gpt-4.1-nano
Tier Carchived
Gagné / perdu / à égalité
825 / 436 / 1295
prompts
24
comparaisons
2556
Moyenne du juge
92.0

Par catégorie

Code68%
Créatif66%
Factuel66%
Multilingue55%
Raisonnement64%
Santé21%
Rang 22OpenAI
61%±2

Taux de victoire

Elo 1078

o1
Tier Carchived
Gagné / perdu / à égalité
684 / 342 / 1132
prompts
20
comparaisons
2158
Moyenne du juge
89.1

Par catégorie

Code76%
Créatif58%
Factuel43%
Multilingue63%
Raisonnement60%
Rang 24OpenAI
61%±2

Taux de victoire

Elo 1076

Gagné / perdu / à égalité
838 / 457 / 1261
prompts
24
comparaisons
2556
Moyenne du juge
93.3

Par catégorie

Code54%
Créatif76%
Factuel68%
Multilingue60%
Raisonnement60%
Santé72%
Rang 24Google Gemini
60%±3

Taux de victoire

Elo 1070

Gagné / perdu / à égalité
501 / 290 / 608
prompts
18
comparaisons
1399
Moyenne du juge
92.6

Par catégorie

Code70%
Créatif61%
Factuel53%
Multilingue68%
Raisonnement65%
Santé36%
Rang 25Anthropic
60%±2

Taux de victoire

Elo 1069

Claude Opus 4.8
Tier Aarchived
Gagné / perdu / à égalité
748 / 439 / 1168
prompts
20
comparaisons
2355
Moyenne du juge
95.0

Par catégorie

Code49%
Créatif44%
Factuel70%
Multilingue61%
Raisonnement74%
Rang 25OpenAI
60%±2

Taux de victoire

Elo 1068

gpt-4-turbo
Tier Carchived
Gagné / perdu / à égalité
818 / 491 / 1247
prompts
24
comparaisons
2556
Moyenne du juge
94.2

Par catégorie

Code48%
Créatif65%
Factuel70%
Multilingue58%
Raisonnement65%
Santé78%
Rang 26OpenAI
59%±2

Taux de victoire

Elo 1067

o1-2024-12-17
Tier Carchived
Gagné / perdu / à égalité
629 / 349 / 1180
prompts
20
comparaisons
2158
Moyenne du juge
85.1

Par catégorie

Code71%
Créatif1%
Factuel60%
Multilingue66%
Raisonnement60%
Rang 27OpenAI
59%±2

Taux de victoire

Elo 1063

Gagné / perdu / à égalité
801 / 511 / 1244
prompts
24
comparaisons
2556
Moyenne du juge
89.4

Par catégorie

Code61%
Créatif76%
Factuel49%
Multilingue61%
Raisonnement63%
Santé49%
Rang 27Google Gemini
59%±2

Taux de victoire

Elo 1062

Gemini 3.1 Flash Lite
Tier Barchived
Gagné / perdu / à égalité
687 / 422 / 1246
prompts
20
comparaisons
2355
Moyenne du juge
94.2

Par catégorie

Code53%
Créatif44%
Factuel60%
Multilingue62%
Raisonnement74%
Rang 27OpenAI
59%±2

Taux de victoire

Elo 1062

o4-mini-2025-04-16
Tier Barchived
Gagné / perdu / à égalité
631 / 377 / 1149
prompts
20
comparaisons
2157
Moyenne du juge
79.9

Par catégorie

Code60%
Créatif66%
Factuel45%
Multilingue68%
Raisonnement61%
Rang 30OpenAI
58%±2

Taux de victoire

Elo 1058

o4-mini
Tier Carchived
Gagné / perdu / à égalité
640 / 412 / 1095
prompts
20
comparaisons
2147
Moyenne du juge
78.7

Par catégorie

Code61%
Créatif77%
Factuel50%
Multilingue60%
Raisonnement54%
Rang 31OpenAI
58%±2

Taux de victoire

Elo 1055

o3-mini-2025-01-31
Tier Carchived
Gagné / perdu / à égalité
663 / 443 / 1186
prompts
20
comparaisons
2292
Moyenne du juge
89.7

Par catégorie

Code67%
Créatif69%
Factuel42%
Multilingue61%
Raisonnement57%
Rang 37OVH AI Endpoints (GRA)
57%±2

Taux de victoire

Elo 1049

Gagné / perdu / à égalité
677 / 492 / 1186
prompts
20
comparaisons
2355
Moyenne du juge
93.1

Par catégorie

Code45%
Créatif63%
Factuel63%
Multilingue53%
Raisonnement74%
Rang 37OpenAI
57%±2

Taux de victoire

Elo 1048

o3-2025-04-16
Tier Barchived
Gagné / perdu / à égalité
561 / 397 / 1109
prompts
19
comparaisons
2067
Moyenne du juge
79.5

Par catégorie

Code63%
Créatif85%
Factuel43%
Multilingue53%
Raisonnement54%
Rang 40OpenAI
57%±2

Taux de victoire

Elo 1046

o3
Tier C
Gagné / perdu / à égalité
604 / 441 / 1112
prompts
20
comparaisons
2157
Moyenne du juge
80.8

Par catégorie

Code55%
Créatif86%
Factuel57%
Multilingue49%
Raisonnement54%
Rang 47OVH AI Endpoints (GRA)
54%±2

Taux de victoire

Elo 1031

Gagné / perdu / à égalité
729 / 656 / 970
prompts
20
comparaisons
2355
Moyenne du juge
90.6

Par catégorie

Code60%
Créatif52%
Factuel52%
Multilingue49%
Raisonnement62%
Rang 47OVH AI Endpoints (GRA)
54%±2

Taux de victoire

Elo 1029

Gagné / perdu / à égalité
701 / 639 / 1015
prompts
20
comparaisons
2355
Moyenne du juge
92.8

Par catégorie

Code56%
Créatif67%
Factuel34%
Multilingue55%
Raisonnement74%
Rang 47OVH AI Endpoints (GRA)
54%±2

Taux de victoire

Elo 1028

Gagné / perdu / à égalité
677 / 623 / 1055
prompts
20
comparaisons
2355
Moyenne du juge
92.6

Par catégorie

Code62%
Créatif49%
Factuel50%
Multilingue51%
Raisonnement58%
Rang 48Anthropic
54%±2

Taux de victoire

Elo 1028

Claude Haiku 4.5
Tier Aarchived
Gagné / perdu / à égalité
737 / 682 / 1137
prompts
24
comparaisons
2556
Moyenne du juge
92.0

Par catégorie

Code60%
Créatif43%
Factuel50%
Multilingue57%
Raisonnement58%
Santé33%
Rang 52OpenAI
52%±2

Taux de victoire

Elo 1013

Gagné / perdu / à égalité
686 / 728 / 941
prompts
20
comparaisons
2355
Moyenne du juge
87.5

Par catégorie

Code55%
Créatif32%
Factuel33%
Multilingue66%
Raisonnement64%
Rang 52OpenAI
51%±2

Taux de victoire

Elo 1005

o3-mini
Tier Carchived
Gagné / perdu / à égalité
554 / 630 / 1045
prompts
20
comparaisons
2229
Moyenne du juge
83.3

Par catégorie

Code60%
Créatif32%
Factuel31%
Multilingue59%
Raisonnement61%
Rang 52Google Gemini
51%±2

Taux de victoire

Elo 1003

Gagné / perdu / à égalité
485 / 536 / 778
prompts
23
comparaisons
1799
Moyenne du juge
79.3

Par catégorie

Code44%
Créatif83%
Factuel43%
Multilingue56%
Raisonnement43%
Santé43%
Rang 52Google Gemini
50%±2

Taux de victoire

Elo 1003

Gemini 2.5 Flash-Lite
Tier Barchived
Gagné / perdu / à égalité
736 / 850 / 970
prompts
24
comparaisons
2556
Moyenne du juge
91.4

Par catégorie

Code35%
Créatif59%
Factuel49%
Multilingue59%
Raisonnement58%
Santé53%
Rang 56Anthropic
49%±2

Taux de victoire

Elo 990

Claude Opus 5
Tier Aarchived
Gagné / perdu / à égalité
471 / 618 / 771
prompts
17
comparaisons
1860
Moyenne du juge
81.4

Par catégorie

Code21%
Créatif81%
Factuel48%
Multilingue42%
Raisonnement61%
Rang 56OpenAI
48%±2

Taux de victoire

Elo 989

gpt-4-0613
Tier Carchived
Gagné / perdu / à égalité
691 / 897 / 968
prompts
24
comparaisons
2556
Moyenne du juge
90.8

Par catégorie

Code50%
Créatif45%
Factuel38%
Multilingue50%
Raisonnement62%
Santé51%
Rang 56OpenAI
48%±2

Taux de victoire

Elo 988

gpt-4
Tier Carchived
Gagné / perdu / à égalité
694 / 905 / 957
prompts
24
comparaisons
2556
Moyenne du juge
88.9

Par catégorie

Code49%
Créatif34%
Factuel34%
Multilingue60%
Raisonnement58%
Santé43%
Rang 57OpenAI
46%±2

Taux de victoire

Elo 974

Gagné / perdu / à égalité
417 / 646 / 1023
prompts
20
comparaisons
2086
Moyenne du juge
71.6

Par catégorie

Code53%
Créatif51%
Factuel40%
Multilingue39%
Raisonnement54%
Rang 60OpenAI
45%±2

Taux de victoire

Elo 968

gpt-3.5-turbo-1106
Tier Carchived
Gagné / perdu / à égalité
613 / 954 / 989
prompts
24
comparaisons
2556
Moyenne du juge
82.7

Par catégorie

Code54%
Créatif67%
Factuel22%
Multilingue52%
Raisonnement48%
Santé18%
Rang 60OpenAI
45%±2

Taux de victoire

Elo 963

gpt-3.5-turbo-0125
Tier Carchived
Gagné / perdu / à égalité
610 / 985 / 961
prompts
24
comparaisons
2556
Moyenne du juge
83.4

Par catégorie

Code56%
Créatif50%
Factuel20%
Multilingue53%
Raisonnement51%
Santé25%
Rang 63OpenAI
42%±2

Taux de victoire

Elo 946

gpt-5-mini-2025-08-07
Tier Barchived
Gagné / perdu / à égalité
406 / 805 / 946
prompts
20
comparaisons
2157
Moyenne du juge
67.6

Par catégorie

Code52%
Créatif36%
Factuel40%
Multilingue31%
Raisonnement54%
Rang 64OpenAI
42%±2

Taux de victoire

Elo 943

gpt-3.5-turbo
Tier Carchived
Gagné / perdu / à égalité
607 / 1112 / 837
prompts
24
comparaisons
2556
Moyenne du juge
83.1

Par catégorie

Code54%
Créatif49%
Factuel20%
Multilingue44%
Raisonnement49%
Santé22%
Rang 64OpenAI
41%±2

Taux de victoire

Elo 940

gpt-3.5-turbo-16k
Tier Carchived
Gagné / perdu / à égalité
577 / 1101 / 878
prompts
24
comparaisons
2556
Moyenne du juge
81.8

Par catégorie

Code57%
Créatif31%
Factuel23%
Multilingue51%
Raisonnement35%
Santé20%
Rang 65Google Gemini
41%±2

Taux de victoire

Elo 938

Gagné / perdu / à égalité
596 / 1133 / 827
prompts
24
comparaisons
2556
Moyenne du juge
78.4

Par catégorie

Code37%
Créatif23%
Factuel50%
Multilingue43%
Raisonnement45%
Santé23%
Rang 66Z.ai (GLM / Zhipu)
40%±2

Taux de victoire

Elo 930

Gagné / perdu / à égalité
356 / 765 / 681
prompts
14
comparaisons
1802
Moyenne du juge
52.1

Par catégorie

Code51%
Créatif28%
Factuel44%
Raisonnement24%
Rang 66Z.ai (GLM / Zhipu)
39%±3

Taux de victoire

Elo 922

GLM-5.1
Tier A
Gagné / perdu / à égalité
365 / 726 / 442
prompts
14
comparaisons
1533
Moyenne du juge
68.8

Par catégorie

Code34%
Créatif13%
Factuel50%
Raisonnement43%
Rang 66Z.ai (GLM / Zhipu)
39%±2

Taux de victoire

Elo 921

Gagné / perdu / à égalité
332 / 737 / 599
prompts
14
comparaisons
1668
Moyenne du juge
65.4

Par catégorie

Code56%
Créatif47%
Factuel31%
Raisonnement15%
Rang 66Z.ai (GLM / Zhipu)
39%±3

Taux de victoire

Elo 921

GLM-5.2
Tier A
Gagné / perdu / à égalité
297 / 639 / 515
prompts
14
comparaisons
1451
Moyenne du juge
54.9

Par catégorie

Code49%
Créatif4%
Factuel55%
Raisonnement20%
Rang 68OVH AI Endpoints (GRA)
38%±2

Taux de victoire

Elo 912

Gagné / perdu / à égalité
452 / 1054 / 723
prompts
20
comparaisons
2229
Moyenne du juge
79.2

Par catégorie

Code40%
Créatif39%
Factuel34%
Multilingue27%
Raisonnement54%
Rang 70OpenAI
36%±2

Taux de victoire

Elo 904

gpt-5
Tier C
Gagné / perdu / à égalité
285 / 805 / 749
prompts
19
comparaisons
1839
Moyenne du juge
57.4

Par catégorie

Code51%
Créatif7%
Factuel39%
Multilingue30%
Raisonnement37%
Rang 71OVH AI Endpoints (GRA)
35%±2

Taux de victoire

Elo 890

Gagné / perdu / à égalité
455 / 1195 / 623
prompts
20
comparaisons
2273
Moyenne du juge
77.2

Par catégorie

Code47%
Créatif9%
Factuel29%
Multilingue33%
Raisonnement41%
Rang 74Google Gemini
34%±2

Taux de victoire

Elo 885

Gagné / perdu / à égalité
522 / 1383 / 651
prompts
24
comparaisons
2556
Moyenne du juge
63.1

Par catégorie

Code32%
Créatif37%
Factuel46%
Multilingue28%
Raisonnement31%
Santé9%
Rang 74OpenAI
34%±2

Taux de victoire

Elo 881

gpt-5-2025-08-07
Tier Barchived
Gagné / perdu / à égalité
290 / 964 / 749
prompts
20
comparaisons
2003
Moyenne du juge
53.1

Par catégorie

Code35%
Créatif3%
Factuel24%
Multilingue37%
Raisonnement54%
Rang 75Z.ai (GLM / Zhipu)
32%±2

Taux de victoire

Elo 871

Gagné / perdu / à égalité
257 / 803 / 473
prompts
14
comparaisons
1533
Moyenne du juge
52.5

Par catégorie

Code50%
Créatif8%
Factuel39%
Raisonnement6%
Rang 80OVH AI Endpoints (GRA)
27%±2

Taux de victoire

Elo 831

Gagné / perdu / à égalité
395 / 1468 / 492
prompts
20
comparaisons
2355
Moyenne du juge
73.3

Par catégorie

Code29%
Créatif13%
Factuel25%
Multilingue30%
Raisonnement30%
Rang 80Z.ai (GLM / Zhipu)
26%±2

Taux de victoire

Elo 817

GLM-4.6
Tier A
Gagné / perdu / à égalité
185 / 866 / 391
prompts
13
comparaisons
1442
Moyenne du juge
48.3

Par catégorie

Code42%
Créatif1%
Factuel36%
Raisonnement5%
Rang 80OpenAI
26%±2

Taux de victoire

Elo 816

gpt-5-nano-2025-08-07
Tier Barchived
Gagné / perdu / à égalité
197 / 990 / 485
prompts
18
comparaisons
1672
Moyenne du juge
36.1

Par catégorie

Code27%
Créatif7%
Factuel48%
Multilingue18%
Raisonnement6%
Rang 80Google Gemini
26%±2

Taux de victoire

Elo 815

Gemini 3.5 Flash
Tier Aarchived
Gagné / perdu / à égalité
369 / 1522 / 464
prompts
20
comparaisons
2355
Moyenne du juge
52.0

Par catégorie

Code8%
Créatif54%
Factuel39%
Multilingue29%
Raisonnement10%
Rang 80OVH AI Endpoints (GRA)
25%±2

Taux de victoire

Elo 812

Gagné / perdu / à égalité
267 / 1235 / 486
prompts
19
comparaisons
1988
Moyenne du juge
41.6

Par catégorie

Code50%
Créatif6%
Factuel6%
Multilingue28%
Raisonnement4%
Rang 80Z.ai (GLM / Zhipu)
25%±2

Taux de victoire

Elo 812

Gagné / perdu / à égalité
186 / 925 / 422
prompts
14
comparaisons
1533
Moyenne du juge
45.5

Par catégorie

Code44%
Créatif4%
Factuel27%
Raisonnement5%
Rang 80OVH AI Endpoints (GRA)
25%±2

Taux de victoire

Elo 805

Qwen3-32B
Tier B
Gagné / perdu / à égalité
418 / 1617 / 320
prompts
20
comparaisons
2355
Moyenne du juge
79.0

Par catégorie

Code23%
Créatif16%
Factuel23%
Multilingue26%
Raisonnement27%
Rang 80OpenAI
24%±2

Taux de victoire

Elo 797

Gagné / perdu / à égalité
208 / 1154 / 485
prompts
20
comparaisons
1847
Moyenne du juge
36.6

Par catégorie

Code18%
Créatif4%
Factuel50%
Multilingue18%
Raisonnement7%
Rang 80Google Gemini
23%±2

Taux de victoire

Elo 793

Gagné / perdu / à égalité
192 / 915 / 292
prompts
18
comparaisons
1399
Moyenne du juge
41.4

Par catégorie

Code19%
Créatif14%
Factuel44%
Multilingue4%
Raisonnement3%
Santé54%
Rang 81Google Gemini
22%±2

Taux de victoire

Elo 784

Gagné / perdu / à égalité
381 / 1783 / 392
prompts
24
comparaisons
2556
Moyenne du juge
48.3

Par catégorie

Code8%
Créatif51%
Factuel45%
Multilingue17%
Raisonnement7%
Santé5%
Rang 81Google Gemini
22%±2

Taux de victoire

Elo 780

Gagné / perdu / à égalité
250 / 1275 / 353
prompts
24
comparaisons
1878
Moyenne du juge
44.1

Par catégorie

Code4%
Créatif39%
Factuel42%
Multilingue19%
Raisonnement13%
Santé3%
Rang 86Google Gemini
21%±2

Taux de victoire

Elo 772

Gagné / perdu / à égalité
356 / 1818 / 382
prompts
24
comparaisons
2556
Moyenne du juge
44.5

Par catégorie

Code5%
Créatif39%
Factuel45%
Multilingue19%
Raisonnement8%
Santé2%
Rang 87OVH AI Endpoints (GRA)
20%±2

Taux de victoire

Elo 761

Gagné / perdu / à égalité
187 / 1348 / 453
prompts
19
comparaisons
1988
Moyenne du juge
42.3

Par catégorie

Code33%
Créatif5%
Factuel11%
Multilingue24%
Raisonnement3%
Rang 92Google Gemini
17%±2

Taux de victoire

Elo 726

Gemini 2.5 Pro
Tier Aarchived
Gagné / perdu / à égalité
182 / 1437 / 345
prompts
24
comparaisons
1964
Moyenne du juge
30.7

Par catégorie

Code17%
Créatif3%
Factuel34%
Multilingue8%
Raisonnement3%
Santé54%
Rang 93Google Gemini
15%±1

Taux de victoire

Elo 704

Gemini 2.5 Flash
Tier Aarchived
Gagné / perdu / à égalité
284 / 2026 / 246
prompts
24
comparaisons
2556
Moyenne du juge
38.6

Par catégorie

Code4%
Créatif26%
Factuel28%
Multilingue12%
Raisonnement10%
Santé2%

94 modèles classés à partir de 105 499 comparaisons deux à deux sur 24 prompts.

Provisoire

Trop peu d'éléments pour classer : il faut au moins 5 prompts et 30 comparaisons.

ProvisoireZ.ai (GLM / Zhipu)
1%±1

Taux de victoire

Elo 155

CogView-4
Tier B
Gagné / perdu / à égalité
0 / 361 / 6
prompts
4
comparaisons
367
Moyenne du juge
0.0

Par catégorie

Code1%
Créatif<1% · mince