Ir al contenido

Benchmarks

Prueba de inteligencia

Los modelos se clasifican por comparación por pares, no por una puntuación absoluta. En cada prompt se compara cada par de modelos cara a cara, y un modelo de Bradley-Terry ajusta una valoración a partir de esas comparaciones. La tasa de victoria de abajo convierte esa valoración en la pregunta que responde: con qué frecuencia este modelo gana a un modelo medio de esta tabla. El 50 % es la media.

Cómo se puntúa

7836

ejecuciones puntuadas

105.499

comparaciones por pares

24

prompts

4586

ejecuciones sin puntuación (error del proveedor)

22 de 24 prompts distinguen realmente entre modelos. El resto recibe la misma calidad de respuesta de casi todos y no aporta señal de clasificación: eso es lo que medía en realidad una puntuación absoluta cercana a 100.

  • Programación 4/4
  • Creativo 2/2
  • Factual 3/4
  • Multilingüe 7/8
  • Razonamiento 4/4
  • Sanidad 2/2
Puesto 1OpenAI
74%±2

Tasa de victoria

Elo 1179

gpt-5.1
Tier B
Ganadas / perdidas / empatadas
983 / 38 / 1334
prompts
20
comparaciones
2355
Media del juez
97.2

Por categoría

Programación75%
Creativo91%
Factual71%
Multilingüe68%
Razonamiento79%
Puesto 1Z.ai (GLM / Zhipu)
74%±2

Tasa de victoria

Elo 1178

GLM-4.7
Tier A
Ganadas / perdidas / empatadas
790 / 88 / 861
prompts
14
comparaciones
1739
Media del juez
95.8

Por categoría

Programación73%
Creativo85%
Factual75%
Razonamiento74%
Puesto 1OpenAI
72%±2

Tasa de victoria

Elo 1162

Ganadas / perdidas / empatadas
924 / 70 / 1361
prompts
20
comparaciones
2355
Media del juez
96.9

Por categoría

Programación76%
Creativo90%
Factual68%
Multilingüe65%
Razonamiento74%
Puesto 1OpenAI
71%±2

Tasa de victoria

Elo 1152

Ganadas / perdidas / empatadas
1044 / 178 / 1334
prompts
24
comparaciones
2556
Media del juez
96.3

Por categoría

Programación75%
Creativo89%
Factual71%
Multilingüe57%
Razonamiento77%
Sanidad75%
Puesto 1OpenAI
71%±2

Tasa de victoria

Elo 1152

Ganadas / perdidas / empatadas
982 / 119 / 1455
prompts
24
comparaciones
2556
Media del juez
96.6

Por categoría

Programación71%
Creativo90%
Factual71%
Multilingüe63%
Razonamiento73%
Sanidad84%
Puesto 1Anthropic
70%±2

Tasa de victoria

Elo 1149

Claude Opus 4.6
Tier Barchived
Ganadas / perdidas / empatadas
1045 / 199 / 1312
prompts
24
comparaciones
2556
Media del juez
97.7

Por categoría

Programación61%
Creativo91%
Factual73%
Multilingüe67%
Razonamiento74%
Sanidad90%
Puesto 2OpenAI
70%±2

Tasa de victoria

Elo 1146

Ganadas / perdidas / empatadas
931 / 168 / 1256
prompts
20
comparaciones
2355
Media del juez
96.5

Por categoría

Programación76%
Creativo90%
Factual59%
Multilingüe61%
Razonamiento79%
Puesto 2OpenAI
70%±2

Tasa de victoria

Elo 1145

gpt-5.2
Tier B
Ganadas / perdidas / empatadas
917 / 161 / 1277
prompts
20
comparaciones
2355
Media del juez
96.7

Por categoría

Programación66%
Creativo90%
Factual72%
Multilingüe64%
Razonamiento74%
Puesto 3OpenAI
69%±2

Tasa de victoria

Elo 1142

gpt-5.5
Tier C
Ganadas / perdidas / empatadas
919 / 179 / 1257
prompts
20
comparaciones
2355
Media del juez
95.1

Por categoría

Programación68%
Creativo80%
Factual74%
Multilingüe64%
Razonamiento74%
Puesto 3OpenAI
69%±2

Tasa de victoria

Elo 1139

gpt-4.1
Tier B
Ganadas / perdidas / empatadas
957 / 170 / 1429
prompts
24
comparaciones
2556
Media del juez
96.2

Por categoría

Programación75%
Creativo81%
Factual66%
Multilingüe62%
Razonamiento73%
Sanidad79%
Puesto 3OpenAI
69%±2

Tasa de victoria

Elo 1138

Ganadas / perdidas / empatadas
894 / 176 / 1285
prompts
20
comparaciones
2355
Media del juez
96.4

Por categoría

Programación71%
Creativo90%
Factual57%
Multilingüe67%
Razonamiento74%
Puesto 3OpenAI
68%±2

Tasa de victoria

Elo 1132

Ganadas / perdidas / empatadas
872 / 186 / 1297
prompts
20
comparaciones
2355
Media del juez
95.6

Por categoría

Programación76%
Creativo78%
Factual52%
Multilingüe67%
Razonamiento79%
Puesto 4OpenAI
68%±2

Tasa de victoria

Elo 1131

Ganadas / perdidas / empatadas
848 / 170 / 1337
prompts
20
comparaciones
2355
Media del juez
95.9

Por categoría

Programación72%
Creativo76%
Factual62%
Multilingüe67%
Razonamiento74%
Puesto 4OpenAI
68%±2

Tasa de victoria

Elo 1130

Ganadas / perdidas / empatadas
937 / 206 / 1413
prompts
24
comparaciones
2556
Media del juez
95.6

Por categoría

Programación71%
Creativo76%
Factual64%
Multilingüe66%
Razonamiento74%
Sanidad70%
Puesto 4OpenAI
67%±2

Tasa de victoria

Elo 1123

gpt-4o-2024-05-13
Tier Carchived
Ganadas / perdidas / empatadas
904 / 221 / 1431
prompts
24
comparaciones
2556
Media del juez
96.0

Por categoría

Programación68%
Creativo80%
Factual66%
Multilingüe61%
Razonamiento73%
Sanidad75%
Puesto 4OpenAI
67%±2

Tasa de victoria

Elo 1122

gpt-5.4
Tier A
Ganadas / perdidas / empatadas
850 / 224 / 1281
prompts
20
comparaciones
2355
Media del juez
96.1

Por categoría

Programación65%
Creativo89%
Factual57%
Multilingüe66%
Razonamiento74%
Puesto 6Anthropic
67%±2

Tasa de victoria

Elo 1120

Claude Opus 4.5
Tier Barchived
Ganadas / perdidas / empatadas
950 / 287 / 1319
prompts
24
comparaciones
2556
Media del juez
96.8

Por categoría

Programación56%
Creativo62%
Factual78%
Multilingüe66%
Razonamiento74%
Sanidad88%
Puesto 7OpenAI
66%±2

Tasa de victoria

Elo 1117

Ganadas / perdidas / empatadas
960 / 311 / 1285
prompts
24
comparaciones
2556
Media del juez
95.0

Por categoría

Programación68%
Creativo86%
Factual60%
Multilingüe54%
Razonamiento78%
Sanidad89%
Puesto 7OpenAI
66%±2

Tasa de victoria

Elo 1117

gpt-4o
Tier C
Ganadas / perdidas / empatadas
923 / 280 / 1353
prompts
24
comparaciones
2556
Media del juez
95.5

Por categoría

Programación58%
Creativo82%
Factual73%
Multilingüe62%
Razonamiento73%
Sanidad67%
Puesto 9Z.ai (GLM / Zhipu)
65%±2

Tasa de victoria

Elo 1110

GLM-4.5
Tier A
Ganadas / perdidas / empatadas
721 / 291 / 790
prompts
14
comparaciones
1802
Media del juez
90.9

Por categoría

Programación75%
Creativo80%
Factual64%
Razonamiento52%
Puesto 11OpenAI
65%±2

Tasa de victoria

Elo 1109

Ganadas / perdidas / empatadas
819 / 272 / 1264
prompts
20
comparaciones
2355
Media del juez
95.2

Por categoría

Programación69%
Creativo85%
Factual54%
Multilingüe60%
Razonamiento74%
Puesto 12Anthropic
65%±2

Tasa de victoria

Elo 1108

Claude Opus 4.7
Tier Barchived
Ganadas / perdidas / empatadas
920 / 335 / 1301
prompts
24
comparaciones
2556
Media del juez
96.2

Por categoría

Programación51%
Creativo61%
Factual81%
Multilingüe63%
Razonamiento73%
Sanidad81%
Puesto 12Google Gemini
65%±2

Tasa de victoria

Elo 1106

Ganadas / perdidas / empatadas
967 / 392 / 1197
prompts
24
comparaciones
2556
Media del juez
95.5

Por categoría

Programación68%
Creativo59%
Factual69%
Multilingüe64%
Razonamiento63%
Sanidad85%
Puesto 12Anthropic
64%±3

Tasa de victoria

Elo 1102

Claude Sonnet 5
Tier Aarchived
Ganadas / perdidas / empatadas
513 / 232 / 639
prompts
15
comparaciones
1384
Media del juez
88.7

Por categoría

Programación68%
Creativo90%
Factual61%
Multilingüe61%
Razonamiento53%
Puesto 15OpenAI
64%±2

Tasa de victoria

Elo 1100

Ganadas / perdidas / empatadas
888 / 349 / 1319
prompts
24
comparaciones
2556
Media del juez
95.1

Por categoría

Programación62%
Creativo82%
Factual59%
Multilingüe55%
Razonamiento77%
Sanidad87%
Puesto 12Z.ai (GLM / Zhipu)
64%±2

Tasa de victoria

Elo 1100

GLM-5
Tier A
Ganadas / perdidas / empatadas
560 / 217 / 756
prompts
14
comparaciones
1533
Media del juez
94.3

Por categoría

Programación62%
Creativo89%
Factual64%
Razonamiento62%
Puesto 18Anthropic
63%±2

Tasa de victoria

Elo 1090

Claude Sonnet 4.5
Tier Barchived
Ganadas / perdidas / empatadas
889 / 420 / 1247
prompts
24
comparaciones
2556
Media del juez
95.2

Por categoría

Programación43%
Creativo59%
Factual74%
Multilingüe64%
Razonamiento77%
Sanidad78%
Puesto 19Anthropic
62%±2

Tasa de victoria

Elo 1089

Claude Sonnet 4.6
Tier Aarchived
Ganadas / perdidas / empatadas
845 / 384 / 1327
prompts
24
comparaciones
2556
Media del juez
95.4

Por categoría

Programación55%
Creativo55%
Factual66%
Multilingüe63%
Razonamiento73%
Sanidad82%
Puesto 19OpenAI
62%±2

Tasa de victoria

Elo 1089

Ganadas / perdidas / empatadas
870 / 409 / 1277
prompts
24
comparaciones
2556
Media del juez
94.5

Por categoría

Programación57%
Creativo72%
Factual62%
Multilingüe60%
Razonamiento73%
Sanidad72%
Puesto 18Google Gemini
62%±2

Tasa de victoria

Elo 1087

Nano Banana
Tier Barchived
Ganadas / perdidas / empatadas
615 / 274 / 910
prompts
23
comparaciones
1799
Media del juez
93.5

Por categoría

Programación51%
Creativo70%
Factual61%
Multilingüe65%
Razonamiento74%
Sanidad58%
Puesto 20OVH AI Endpoints (GRA)
62%±2

Tasa de victoria

Elo 1087

Ganadas / perdidas / empatadas
793 / 377 / 1185
prompts
20
comparaciones
2355
Media del juez
93.0

Por categoría

Programación58%
Creativo82%
Factual62%
Multilingüe56%
Razonamiento70%
Puesto 20OpenAI
62%±2

Tasa de victoria

Elo 1083

Ganadas / perdidas / empatadas
830 / 404 / 1322
prompts
24
comparaciones
2556
Media del juez
95.1

Por categoría

Programación53%
Creativo49%
Factual71%
Multilingüe61%
Razonamiento72%
Sanidad86%
Puesto 20OpenAI
62%±2

Tasa de victoria

Elo 1082

Ganadas / perdidas / empatadas
818 / 403 / 1335
prompts
24
comparaciones
2556
Media del juez
90.1

Por categoría

Programación58%
Creativo77%
Factual54%
Multilingüe66%
Razonamiento68%
Sanidad54%
Puesto 20OpenAI
61%±2

Tasa de victoria

Elo 1081

Ganadas / perdidas / empatadas
751 / 371 / 1233
prompts
20
comparaciones
2355
Media del juez
89.2

Por categoría

Programación71%
Creativo31%
Factual49%
Multilingüe67%
Razonamiento74%
Puesto 20Anthropic
61%±2

Tasa de victoria

Elo 1080

Claude Fable 5
Tier Aarchived
Ganadas / perdidas / empatadas
744 / 364 / 1288
prompts
20
comparaciones
2396
Media del juez
89.1

Por categoría

Programación67%
Creativo71%
Factual49%
Multilingüe62%
Razonamiento68%
Puesto 21OpenAI
61%±2

Tasa de victoria

Elo 1079

Ganadas / perdidas / empatadas
826 / 426 / 1304
prompts
24
comparaciones
2556
Media del juez
92.9

Por categoría

Programación68%
Creativo60%
Factual61%
Multilingüe56%
Razonamiento68%
Sanidad35%
Puesto 23OpenAI
61%±2

Tasa de victoria

Elo 1078

gpt-4.1-nano
Tier Carchived
Ganadas / perdidas / empatadas
825 / 436 / 1295
prompts
24
comparaciones
2556
Media del juez
92.0

Por categoría

Programación68%
Creativo66%
Factual66%
Multilingüe55%
Razonamiento64%
Sanidad21%
Puesto 22OpenAI
61%±2

Tasa de victoria

Elo 1078

o1
Tier Carchived
Ganadas / perdidas / empatadas
684 / 342 / 1132
prompts
20
comparaciones
2158
Media del juez
89.1

Por categoría

Programación76%
Creativo58%
Factual43%
Multilingüe63%
Razonamiento60%
Puesto 24OpenAI
61%±2

Tasa de victoria

Elo 1076

Ganadas / perdidas / empatadas
838 / 457 / 1261
prompts
24
comparaciones
2556
Media del juez
93.3

Por categoría

Programación54%
Creativo76%
Factual68%
Multilingüe60%
Razonamiento60%
Sanidad72%
Puesto 24Google Gemini
60%±3

Tasa de victoria

Elo 1070

Ganadas / perdidas / empatadas
501 / 290 / 608
prompts
18
comparaciones
1399
Media del juez
92.6

Por categoría

Programación70%
Creativo61%
Factual53%
Multilingüe68%
Razonamiento65%
Sanidad36%
Puesto 25Anthropic
60%±2

Tasa de victoria

Elo 1069

Claude Opus 4.8
Tier Aarchived
Ganadas / perdidas / empatadas
748 / 439 / 1168
prompts
20
comparaciones
2355
Media del juez
95.0

Por categoría

Programación49%
Creativo44%
Factual70%
Multilingüe61%
Razonamiento74%
Puesto 25OpenAI
60%±2

Tasa de victoria

Elo 1068

gpt-4-turbo
Tier Carchived
Ganadas / perdidas / empatadas
818 / 491 / 1247
prompts
24
comparaciones
2556
Media del juez
94.2

Por categoría

Programación48%
Creativo65%
Factual70%
Multilingüe58%
Razonamiento65%
Sanidad78%
Puesto 26OpenAI
59%±2

Tasa de victoria

Elo 1067

o1-2024-12-17
Tier Carchived
Ganadas / perdidas / empatadas
629 / 349 / 1180
prompts
20
comparaciones
2158
Media del juez
85.1

Por categoría

Programación71%
Creativo1%
Factual60%
Multilingüe66%
Razonamiento60%
Puesto 27OpenAI
59%±2

Tasa de victoria

Elo 1063

Ganadas / perdidas / empatadas
801 / 511 / 1244
prompts
24
comparaciones
2556
Media del juez
89.4

Por categoría

Programación61%
Creativo76%
Factual49%
Multilingüe61%
Razonamiento63%
Sanidad49%
Puesto 27Google Gemini
59%±2

Tasa de victoria

Elo 1062

Gemini 3.1 Flash Lite
Tier Barchived
Ganadas / perdidas / empatadas
687 / 422 / 1246
prompts
20
comparaciones
2355
Media del juez
94.2

Por categoría

Programación53%
Creativo44%
Factual60%
Multilingüe62%
Razonamiento74%
Puesto 27OpenAI
59%±2

Tasa de victoria

Elo 1062

o4-mini-2025-04-16
Tier Barchived
Ganadas / perdidas / empatadas
631 / 377 / 1149
prompts
20
comparaciones
2157
Media del juez
79.9

Por categoría

Programación60%
Creativo66%
Factual45%
Multilingüe68%
Razonamiento61%
Puesto 30OpenAI
58%±2

Tasa de victoria

Elo 1058

o4-mini
Tier Carchived
Ganadas / perdidas / empatadas
640 / 412 / 1095
prompts
20
comparaciones
2147
Media del juez
78.7

Por categoría

Programación61%
Creativo77%
Factual50%
Multilingüe60%
Razonamiento54%
Puesto 31OpenAI
58%±2

Tasa de victoria

Elo 1055

o3-mini-2025-01-31
Tier Carchived
Ganadas / perdidas / empatadas
663 / 443 / 1186
prompts
20
comparaciones
2292
Media del juez
89.7

Por categoría

Programación67%
Creativo69%
Factual42%
Multilingüe61%
Razonamiento57%
Puesto 37OVH AI Endpoints (GRA)
57%±2

Tasa de victoria

Elo 1049

Ganadas / perdidas / empatadas
677 / 492 / 1186
prompts
20
comparaciones
2355
Media del juez
93.1

Por categoría

Programación45%
Creativo63%
Factual63%
Multilingüe53%
Razonamiento74%
Puesto 37OpenAI
57%±2

Tasa de victoria

Elo 1048

o3-2025-04-16
Tier Barchived
Ganadas / perdidas / empatadas
561 / 397 / 1109
prompts
19
comparaciones
2067
Media del juez
79.5

Por categoría

Programación63%
Creativo85%
Factual43%
Multilingüe53%
Razonamiento54%
Puesto 40OpenAI
57%±2

Tasa de victoria

Elo 1046

o3
Tier C
Ganadas / perdidas / empatadas
604 / 441 / 1112
prompts
20
comparaciones
2157
Media del juez
80.8

Por categoría

Programación55%
Creativo86%
Factual57%
Multilingüe49%
Razonamiento54%
Puesto 47OVH AI Endpoints (GRA)
54%±2

Tasa de victoria

Elo 1031

Ganadas / perdidas / empatadas
729 / 656 / 970
prompts
20
comparaciones
2355
Media del juez
90.6

Por categoría

Programación60%
Creativo52%
Factual52%
Multilingüe49%
Razonamiento62%
Puesto 47OVH AI Endpoints (GRA)
54%±2

Tasa de victoria

Elo 1029

Ganadas / perdidas / empatadas
701 / 639 / 1015
prompts
20
comparaciones
2355
Media del juez
92.8

Por categoría

Programación56%
Creativo67%
Factual34%
Multilingüe55%
Razonamiento74%
Puesto 47OVH AI Endpoints (GRA)
54%±2

Tasa de victoria

Elo 1028

Ganadas / perdidas / empatadas
677 / 623 / 1055
prompts
20
comparaciones
2355
Media del juez
92.6

Por categoría

Programación62%
Creativo49%
Factual50%
Multilingüe51%
Razonamiento58%
Puesto 48Anthropic
54%±2

Tasa de victoria

Elo 1028

Claude Haiku 4.5
Tier Aarchived
Ganadas / perdidas / empatadas
737 / 682 / 1137
prompts
24
comparaciones
2556
Media del juez
92.0

Por categoría

Programación60%
Creativo43%
Factual50%
Multilingüe57%
Razonamiento58%
Sanidad33%
Puesto 52OpenAI
52%±2

Tasa de victoria

Elo 1013

Ganadas / perdidas / empatadas
686 / 728 / 941
prompts
20
comparaciones
2355
Media del juez
87.5

Por categoría

Programación55%
Creativo32%
Factual33%
Multilingüe66%
Razonamiento64%
Puesto 52OpenAI
51%±2

Tasa de victoria

Elo 1005

o3-mini
Tier Carchived
Ganadas / perdidas / empatadas
554 / 630 / 1045
prompts
20
comparaciones
2229
Media del juez
83.3

Por categoría

Programación60%
Creativo32%
Factual31%
Multilingüe59%
Razonamiento61%
Puesto 52Google Gemini
51%±2

Tasa de victoria

Elo 1003

Ganadas / perdidas / empatadas
485 / 536 / 778
prompts
23
comparaciones
1799
Media del juez
79.3

Por categoría

Programación44%
Creativo83%
Factual43%
Multilingüe56%
Razonamiento43%
Sanidad43%
Puesto 52Google Gemini
50%±2

Tasa de victoria

Elo 1003

Gemini 2.5 Flash-Lite
Tier Barchived
Ganadas / perdidas / empatadas
736 / 850 / 970
prompts
24
comparaciones
2556
Media del juez
91.4

Por categoría

Programación35%
Creativo59%
Factual49%
Multilingüe59%
Razonamiento58%
Sanidad53%
Puesto 56Anthropic
49%±2

Tasa de victoria

Elo 990

Claude Opus 5
Tier Aarchived
Ganadas / perdidas / empatadas
471 / 618 / 771
prompts
17
comparaciones
1860
Media del juez
81.4

Por categoría

Programación21%
Creativo81%
Factual48%
Multilingüe42%
Razonamiento61%
Puesto 56OpenAI
48%±2

Tasa de victoria

Elo 989

gpt-4-0613
Tier Carchived
Ganadas / perdidas / empatadas
691 / 897 / 968
prompts
24
comparaciones
2556
Media del juez
90.8

Por categoría

Programación50%
Creativo45%
Factual38%
Multilingüe50%
Razonamiento62%
Sanidad51%
Puesto 56OpenAI
48%±2

Tasa de victoria

Elo 988

gpt-4
Tier Carchived
Ganadas / perdidas / empatadas
694 / 905 / 957
prompts
24
comparaciones
2556
Media del juez
88.9

Por categoría

Programación49%
Creativo34%
Factual34%
Multilingüe60%
Razonamiento58%
Sanidad43%
Puesto 57OpenAI
46%±2

Tasa de victoria

Elo 974

Ganadas / perdidas / empatadas
417 / 646 / 1023
prompts
20
comparaciones
2086
Media del juez
71.6

Por categoría

Programación53%
Creativo51%
Factual40%
Multilingüe39%
Razonamiento54%
Puesto 60OpenAI
45%±2

Tasa de victoria

Elo 968

gpt-3.5-turbo-1106
Tier Carchived
Ganadas / perdidas / empatadas
613 / 954 / 989
prompts
24
comparaciones
2556
Media del juez
82.7

Por categoría

Programación54%
Creativo67%
Factual22%
Multilingüe52%
Razonamiento48%
Sanidad18%
Puesto 60OpenAI
45%±2

Tasa de victoria

Elo 963

gpt-3.5-turbo-0125
Tier Carchived
Ganadas / perdidas / empatadas
610 / 985 / 961
prompts
24
comparaciones
2556
Media del juez
83.4

Por categoría

Programación56%
Creativo50%
Factual20%
Multilingüe53%
Razonamiento51%
Sanidad25%
Puesto 63OpenAI
42%±2

Tasa de victoria

Elo 946

gpt-5-mini-2025-08-07
Tier Barchived
Ganadas / perdidas / empatadas
406 / 805 / 946
prompts
20
comparaciones
2157
Media del juez
67.6

Por categoría

Programación52%
Creativo36%
Factual40%
Multilingüe31%
Razonamiento54%
Puesto 64OpenAI
42%±2

Tasa de victoria

Elo 943

gpt-3.5-turbo
Tier Carchived
Ganadas / perdidas / empatadas
607 / 1112 / 837
prompts
24
comparaciones
2556
Media del juez
83.1

Por categoría

Programación54%
Creativo49%
Factual20%
Multilingüe44%
Razonamiento49%
Sanidad22%
Puesto 64OpenAI
41%±2

Tasa de victoria

Elo 940

gpt-3.5-turbo-16k
Tier Carchived
Ganadas / perdidas / empatadas
577 / 1101 / 878
prompts
24
comparaciones
2556
Media del juez
81.8

Por categoría

Programación57%
Creativo31%
Factual23%
Multilingüe51%
Razonamiento35%
Sanidad20%
Puesto 65Google Gemini
41%±2

Tasa de victoria

Elo 938

Ganadas / perdidas / empatadas
596 / 1133 / 827
prompts
24
comparaciones
2556
Media del juez
78.4

Por categoría

Programación37%
Creativo23%
Factual50%
Multilingüe43%
Razonamiento45%
Sanidad23%
Puesto 66Z.ai (GLM / Zhipu)
40%±2

Tasa de victoria

Elo 930

Ganadas / perdidas / empatadas
356 / 765 / 681
prompts
14
comparaciones
1802
Media del juez
52.1

Por categoría

Programación51%
Creativo28%
Factual44%
Razonamiento24%
Puesto 66Z.ai (GLM / Zhipu)
39%±3

Tasa de victoria

Elo 922

GLM-5.1
Tier A
Ganadas / perdidas / empatadas
365 / 726 / 442
prompts
14
comparaciones
1533
Media del juez
68.8

Por categoría

Programación34%
Creativo13%
Factual50%
Razonamiento43%
Puesto 66Z.ai (GLM / Zhipu)
39%±2

Tasa de victoria

Elo 921

Ganadas / perdidas / empatadas
332 / 737 / 599
prompts
14
comparaciones
1668
Media del juez
65.4

Por categoría

Programación56%
Creativo47%
Factual31%
Razonamiento15%
Puesto 66Z.ai (GLM / Zhipu)
39%±3

Tasa de victoria

Elo 921

GLM-5.2
Tier A
Ganadas / perdidas / empatadas
297 / 639 / 515
prompts
14
comparaciones
1451
Media del juez
54.9

Por categoría

Programación49%
Creativo4%
Factual55%
Razonamiento20%
Puesto 68OVH AI Endpoints (GRA)
38%±2

Tasa de victoria

Elo 912

Ganadas / perdidas / empatadas
452 / 1054 / 723
prompts
20
comparaciones
2229
Media del juez
79.2

Por categoría

Programación40%
Creativo39%
Factual34%
Multilingüe27%
Razonamiento54%
Puesto 70OpenAI
36%±2

Tasa de victoria

Elo 904

gpt-5
Tier C
Ganadas / perdidas / empatadas
285 / 805 / 749
prompts
19
comparaciones
1839
Media del juez
57.4

Por categoría

Programación51%
Creativo7%
Factual39%
Multilingüe30%
Razonamiento37%
Puesto 71OVH AI Endpoints (GRA)
35%±2

Tasa de victoria

Elo 890

Ganadas / perdidas / empatadas
455 / 1195 / 623
prompts
20
comparaciones
2273
Media del juez
77.2

Por categoría

Programación47%
Creativo9%
Factual29%
Multilingüe33%
Razonamiento41%
Puesto 74Google Gemini
34%±2

Tasa de victoria

Elo 885

Ganadas / perdidas / empatadas
522 / 1383 / 651
prompts
24
comparaciones
2556
Media del juez
63.1

Por categoría

Programación32%
Creativo37%
Factual46%
Multilingüe28%
Razonamiento31%
Sanidad9%
Puesto 74OpenAI
34%±2

Tasa de victoria

Elo 881

gpt-5-2025-08-07
Tier Barchived
Ganadas / perdidas / empatadas
290 / 964 / 749
prompts
20
comparaciones
2003
Media del juez
53.1

Por categoría

Programación35%
Creativo3%
Factual24%
Multilingüe37%
Razonamiento54%
Puesto 75Z.ai (GLM / Zhipu)
32%±2

Tasa de victoria

Elo 871

Ganadas / perdidas / empatadas
257 / 803 / 473
prompts
14
comparaciones
1533
Media del juez
52.5

Por categoría

Programación50%
Creativo8%
Factual39%
Razonamiento6%
Puesto 80OVH AI Endpoints (GRA)
27%±2

Tasa de victoria

Elo 831

Ganadas / perdidas / empatadas
395 / 1468 / 492
prompts
20
comparaciones
2355
Media del juez
73.3

Por categoría

Programación29%
Creativo13%
Factual25%
Multilingüe30%
Razonamiento30%
Puesto 80Z.ai (GLM / Zhipu)
26%±2

Tasa de victoria

Elo 817

GLM-4.6
Tier A
Ganadas / perdidas / empatadas
185 / 866 / 391
prompts
13
comparaciones
1442
Media del juez
48.3

Por categoría

Programación42%
Creativo1%
Factual36%
Razonamiento5%
Puesto 80OpenAI
26%±2

Tasa de victoria

Elo 816

gpt-5-nano-2025-08-07
Tier Barchived
Ganadas / perdidas / empatadas
197 / 990 / 485
prompts
18
comparaciones
1672
Media del juez
36.1

Por categoría

Programación27%
Creativo7%
Factual48%
Multilingüe18%
Razonamiento6%
Puesto 80Google Gemini
26%±2

Tasa de victoria

Elo 815

Gemini 3.5 Flash
Tier Aarchived
Ganadas / perdidas / empatadas
369 / 1522 / 464
prompts
20
comparaciones
2355
Media del juez
52.0

Por categoría

Programación8%
Creativo54%
Factual39%
Multilingüe29%
Razonamiento10%
Puesto 80OVH AI Endpoints (GRA)
25%±2

Tasa de victoria

Elo 812

Ganadas / perdidas / empatadas
267 / 1235 / 486
prompts
19
comparaciones
1988
Media del juez
41.6

Por categoría

Programación50%
Creativo6%
Factual6%
Multilingüe28%
Razonamiento4%
Puesto 80Z.ai (GLM / Zhipu)
25%±2

Tasa de victoria

Elo 812

Ganadas / perdidas / empatadas
186 / 925 / 422
prompts
14
comparaciones
1533
Media del juez
45.5

Por categoría

Programación44%
Creativo4%
Factual27%
Razonamiento5%
Puesto 80OVH AI Endpoints (GRA)
25%±2

Tasa de victoria

Elo 805

Qwen3-32B
Tier B
Ganadas / perdidas / empatadas
418 / 1617 / 320
prompts
20
comparaciones
2355
Media del juez
79.0

Por categoría

Programación23%
Creativo16%
Factual23%
Multilingüe26%
Razonamiento27%
Puesto 80OpenAI
24%±2

Tasa de victoria

Elo 797

Ganadas / perdidas / empatadas
208 / 1154 / 485
prompts
20
comparaciones
1847
Media del juez
36.6

Por categoría

Programación18%
Creativo4%
Factual50%
Multilingüe18%
Razonamiento7%
Puesto 80Google Gemini
23%±2

Tasa de victoria

Elo 793

Ganadas / perdidas / empatadas
192 / 915 / 292
prompts
18
comparaciones
1399
Media del juez
41.4

Por categoría

Programación19%
Creativo14%
Factual44%
Multilingüe4%
Razonamiento3%
Sanidad54%
Puesto 81Google Gemini
22%±2

Tasa de victoria

Elo 784

Ganadas / perdidas / empatadas
381 / 1783 / 392
prompts
24
comparaciones
2556
Media del juez
48.3

Por categoría

Programación8%
Creativo51%
Factual45%
Multilingüe17%
Razonamiento7%
Sanidad5%
Puesto 81Google Gemini
22%±2

Tasa de victoria

Elo 780

Ganadas / perdidas / empatadas
250 / 1275 / 353
prompts
24
comparaciones
1878
Media del juez
44.1

Por categoría

Programación4%
Creativo39%
Factual42%
Multilingüe19%
Razonamiento13%
Sanidad3%
Puesto 86Google Gemini
21%±2

Tasa de victoria

Elo 772

Ganadas / perdidas / empatadas
356 / 1818 / 382
prompts
24
comparaciones
2556
Media del juez
44.5

Por categoría

Programación5%
Creativo39%
Factual45%
Multilingüe19%
Razonamiento8%
Sanidad2%
Puesto 87OVH AI Endpoints (GRA)
20%±2

Tasa de victoria

Elo 761

Ganadas / perdidas / empatadas
187 / 1348 / 453
prompts
19
comparaciones
1988
Media del juez
42.3

Por categoría

Programación33%
Creativo5%
Factual11%
Multilingüe24%
Razonamiento3%
Puesto 92Google Gemini
17%±2

Tasa de victoria

Elo 726

Gemini 2.5 Pro
Tier Aarchived
Ganadas / perdidas / empatadas
182 / 1437 / 345
prompts
24
comparaciones
1964
Media del juez
30.7

Por categoría

Programación17%
Creativo3%
Factual34%
Multilingüe8%
Razonamiento3%
Sanidad54%
Puesto 93Google Gemini
15%±1

Tasa de victoria

Elo 704

Gemini 2.5 Flash
Tier Aarchived
Ganadas / perdidas / empatadas
284 / 2026 / 246
prompts
24
comparaciones
2556
Media del juez
38.6

Por categoría

Programación4%
Creativo26%
Factual28%
Multilingüe12%
Razonamiento10%
Sanidad2%

94 modelos clasificados a partir de 105.499 comparaciones por pares en 24 prompts.

Provisional

Pruebas insuficientes para clasificar: hacen falta al menos 5 prompts y 30 comparaciones.

ProvisionalZ.ai (GLM / Zhipu)
1%±1

Tasa de victoria

Elo 155

CogView-4
Tier B
Ganadas / perdidas / empatadas
0 / 361 / 6
prompts
4
comparaciones
367
Media del juez
0.0

Por categoría

Programación1%
Creativo<1% · escasa