Ir al contenido

Benchmarks

Prueba de inteligencia

Los modelos se clasifican por comparación por pares, no por una puntuación absoluta. En cada prompt se compara cada par de modelos cara a cara, y un modelo de Bradley-Terry ajusta una valoración a partir de esas comparaciones. La tasa de victoria de abajo convierte esa valoración en la pregunta que responde: con qué frecuencia este modelo gana a un modelo medio de esta tabla. El 50 % es la media.

Cómo se puntúa

8603

ejecuciones puntuadas

117.970

comparaciones por pares

24

prompts

4699

ejecuciones sin puntuación (error del proveedor)

22 de 24 prompts distinguen realmente entre modelos. El resto recibe la misma calidad de respuesta de casi todos y no aporta señal de clasificación: eso es lo que medía en realidad una puntuación absoluta cercana a 100.

  • Programación 4/4
  • Creativo 2/2
  • Factual 3/4
  • Multilingüe 7/8
  • Razonamiento 4/4
  • Sanidad 2/2
Puesto 1OpenAI
73%±2

Tasa de victoria

Elo 1175

Ganadas / perdidas / empatadas
1296 / 172 / 1402
prompts
24
comparaciones
2870
Media del juez
96.0

Por categoría

Programación80%
Creativo91%
Factual74%
Multilingüe60%
Razonamiento77%
Sanidad75%
Puesto 1OpenAI
73%±2

Tasa de victoria

Elo 1172

gpt-5.1
Tier B
Ganadas / perdidas / empatadas
1125 / 101 / 1443
prompts
20
comparaciones
2669
Media del juez
95.0

Por categoría

Programación76%
Creativo79%
Factual71%
Multilingüe70%
Razonamiento78%
Puesto 1OpenAI
73%±2

Tasa de victoria

Elo 1171

Ganadas / perdidas / empatadas
1149 / 132 / 1388
prompts
20
comparaciones
2669
Media del juez
95.9

Por categoría

Programación78%
Creativo89%
Factual76%
Multilingüe67%
Razonamiento66%
Puesto 1OpenAI
70%±2

Tasa de victoria

Elo 1149

gpt-5.5
Tier C
Ganadas / perdidas / empatadas
1074 / 193 / 1402
prompts
20
comparaciones
2669
Media del juez
93.9

Por categoría

Programación70%
Creativo82%
Factual72%
Multilingüe66%
Razonamiento74%
Puesto 1OpenAI
70%±2

Tasa de victoria

Elo 1149

Ganadas / perdidas / empatadas
1142 / 193 / 1535
prompts
24
comparaciones
2870
Media del juez
96.0

Por categoría

Programación72%
Creativo92%
Factual72%
Multilingüe65%
Razonamiento66%
Sanidad84%
Puesto 2OpenAI
70%±2

Tasa de victoria

Elo 1144

Ganadas / perdidas / empatadas
1062 / 216 / 1391
prompts
20
comparaciones
2669
Media del juez
93.9

Por categoría

Programación75%
Creativo78%
Factual57%
Multilingüe69%
Razonamiento78%
Puesto 3OpenAI
69%±2

Tasa de victoria

Elo 1142

gpt-5.4
Tier A
Ganadas / perdidas / empatadas
1047 / 214 / 1408
prompts
20
comparaciones
2669
Media del juez
94.8

Por categoría

Programación68%
Creativo90%
Factual63%
Multilingüe68%
Razonamiento74%
Puesto 4OpenAI
69%±2

Tasa de victoria

Elo 1141

gpt-5.2
Tier B
Ganadas / perdidas / empatadas
1062 / 235 / 1372
prompts
20
comparaciones
2669
Media del juez
94.2

Por categoría

Programación66%
Creativo92%
Factual67%
Multilingüe66%
Razonamiento74%
Puesto 4OpenAI
69%±2

Tasa de victoria

Elo 1139

gpt-4.1
Tier B
Ganadas / perdidas / empatadas
1128 / 249 / 1493
prompts
24
comparaciones
2870
Media del juez
95.7

Por categoría

Programación74%
Creativo83%
Factual69%
Multilingüe64%
Razonamiento66%
Sanidad79%
Puesto 4OpenAI
69%±2

Tasa de victoria

Elo 1139

Ganadas / perdidas / empatadas
1099 / 220 / 1551
prompts
24
comparaciones
2870
Media del juez
95.1

Por categoría

Programación69%
Creativo82%
Factual67%
Multilingüe68%
Razonamiento73%
Sanidad70%
Puesto 4Anthropic
69%±2

Tasa de victoria

Elo 1135

Ganadas / perdidas / empatadas
1162 / 309 / 1399
prompts
24
comparaciones
2870
Media del juez
97.0

Por categoría

Programación63%
Creativo93%
Factual73%
Multilingüe64%
Razonamiento67%
Sanidad90%
Puesto 4OpenAI
68%±2

Tasa de victoria

Elo 1133

Ganadas / perdidas / empatadas
1067 / 292 / 1310
prompts
20
comparaciones
2669
Media del juez
94.1

Por categoría

Programación71%
Creativo92%
Factual61%
Multilingüe63%
Razonamiento71%
Puesto 4Z.ai (GLM / Zhipu)
68%±2

Tasa de victoria

Elo 1132

GLM-4.7
Tier A
Ganadas / perdidas / empatadas
838 / 259 / 882
prompts
14
comparaciones
1979
Media del juez
91.1

Por categoría

Programación61%
Creativo85%
Factual70%
Razonamiento74%
Puesto 4OpenAI
68%±2

Tasa de victoria

Elo 1129

Ganadas / perdidas / empatadas
1035 / 289 / 1345
prompts
20
comparaciones
2669
Media del juez
94.6

Por categoría

Programación74%
Creativo89%
Factual55%
Multilingüe64%
Razonamiento74%
Puesto 4OpenAI
67%±2

Tasa de victoria

Elo 1127

Ganadas / perdidas / empatadas
987 / 252 / 1430
prompts
20
comparaciones
2669
Media del juez
94.0

Por categoría

Programación75%
Creativo73%
Factual59%
Multilingüe64%
Razonamiento74%
Puesto 6OpenAI
66%±2

Tasa de victoria

Elo 1117

Ganadas / perdidas / empatadas
981 / 315 / 1373
prompts
20
comparaciones
2669
Media del juez
93.0

Por categoría

Programación65%
Creativo89%
Factual59%
Multilingüe63%
Razonamiento74%
Puesto 6Z.ai (GLM / Zhipu)
66%±2

Tasa de victoria

Elo 1115

GLM-4.5
Tier A
Ganadas / perdidas / empatadas
843 / 337 / 862
prompts
14
comparaciones
2042
Media del juez
90.0

Por categoría

Programación71%
Creativo85%
Factual66%
Razonamiento55%
Puesto 12OpenAI
65%±2

Tasa de victoria

Elo 1106

gpt-4o
Tier C
Ganadas / perdidas / empatadas
1034 / 390 / 1446
prompts
24
comparaciones
2870
Media del juez
94.8

Por categoría

Programación58%
Creativo73%
Factual68%
Multilingüe64%
Razonamiento73%
Sanidad67%
Puesto 14OpenAI
64%±2

Tasa de victoria

Elo 1101

Ganadas / perdidas / empatadas
1026 / 421 / 1423
prompts
24
comparaciones
2870
Media del juez
94.5

Por categoría

Programación66%
Creativo86%
Factual61%
Multilingüe53%
Razonamiento70%
Sanidad87%
Puesto 14OpenAI
64%±2

Tasa de victoria

Elo 1101

Ganadas / perdidas / empatadas
1060 / 455 / 1355
prompts
24
comparaciones
2870
Media del juez
94.0

Por categoría

Programación62%
Creativo82%
Factual62%
Multilingüe52%
Razonamiento77%
Sanidad89%
Puesto 14OpenAI
64%±2

Tasa de victoria

Elo 1101

Ganadas / perdidas / empatadas
1004 / 401 / 1465
prompts
24
comparaciones
2870
Media del juez
95.2

Por categoría

Programación62%
Creativo82%
Factual62%
Multilingüe64%
Razonamiento66%
Sanidad75%
Puesto 15Anthropic
64%±2

Tasa de victoria

Elo 1100

Ganadas / perdidas / empatadas
1038 / 437 / 1395
prompts
24
comparaciones
2870
Media del juez
95.1

Por categoría

Programación51%
Creativo60%
Factual79%
Multilingüe60%
Razonamiento73%
Sanidad81%
Puesto 16Google Gemini
64%±2

Tasa de victoria

Elo 1098

Ganadas / perdidas / empatadas
1069 / 483 / 1318
prompts
24
comparaciones
2870
Media del juez
94.8

Por categoría

Programación67%
Creativo45%
Factual71%
Multilingüe61%
Razonamiento64%
Sanidad85%
Puesto 16Anthropic
63%±2

Tasa de victoria

Elo 1094

Ganadas / perdidas / empatadas
919 / 401 / 1390
prompts
20
comparaciones
2710
Media del juez
88.9

Por categoría

Programación64%
Creativo67%
Factual59%
Multilingüe65%
Razonamiento69%
Puesto 16OpenAI
63%±2

Tasa de victoria

Elo 1092

o1
Tier C
Ganadas / perdidas / empatadas
879 / 398 / 1262
prompts
20
comparaciones
2539
Media del juez
90.4

Por categoría

Programación77%
Creativo55%
Factual48%
Multilingüe65%
Razonamiento63%
Puesto 16Anthropic
63%±2

Tasa de victoria

Elo 1090

Ganadas / perdidas / empatadas
1008 / 484 / 1378
prompts
24
comparaciones
2870
Media del juez
95.8

Por categoría

Programación54%
Creativo58%
Factual71%
Multilingüe63%
Razonamiento67%
Sanidad88%
Puesto 16Z.ai (GLM / Zhipu)
63%±2

Tasa de victoria

Elo 1089

GLM-5
Tier A
Ganadas / perdidas / empatadas
553 / 252 / 733
prompts
14
comparaciones
1538
Media del juez
94.6

Por categoría

Programación57%
Creativo89%
Factual64%
Razonamiento61%
Puesto 16Google Gemini
62%±2

Tasa de victoria

Elo 1087

Ganadas / perdidas / empatadas
615 / 274 / 910
prompts
23
comparaciones
1799
Media del juez
93.5

Por categoría

Programación51%
Creativo70%
Factual61%
Multilingüe65%
Razonamiento73%
Sanidad58%
Puesto 17OpenAI
62%±2

Tasa de victoria

Elo 1086

Ganadas / perdidas / empatadas
826 / 396 / 1246
prompts
20
comparaciones
2468
Media del juez
86.8

Por categoría

Programación77%
Creativo6%
Factual61%
Multilingüe68%
Razonamiento63%
Puesto 17OVH AI Endpoints (GRA)
62%±2

Tasa de victoria

Elo 1085

Ganadas / perdidas / empatadas
901 / 450 / 1318
prompts
20
comparaciones
2669
Media del juez
92.0

Por categoría

Programación60%
Creativo84%
Factual61%
Multilingüe54%
Razonamiento70%
Puesto 18OpenAI
62%±2

Tasa de victoria

Elo 1083

Ganadas / perdidas / empatadas
987 / 519 / 1364
prompts
24
comparaciones
2870
Media del juez
92.8

Por categoría

Programación51%
Creativo73%
Factual72%
Multilingüe62%
Razonamiento62%
Sanidad72%
Puesto 18OpenAI
62%±2

Tasa de victoria

Elo 1082

Ganadas / perdidas / empatadas
940 / 479 / 1451
prompts
24
comparaciones
2870
Media del juez
94.3

Por categoría

Programación53%
Creativo50%
Factual71%
Multilingüe58%
Razonamiento71%
Sanidad86%
Puesto 18Google Gemini
61%±2

Tasa de victoria

Elo 1079

Ganadas / perdidas / empatadas
853 / 444 / 1372
prompts
20
comparaciones
2669
Media del juez
92.8

Por categoría

Programación55%
Creativo42%
Factual70%
Multilingüe59%
Razonamiento74%
Puesto 19OpenAI
61%±2

Tasa de victoria

Elo 1076

o3
Tier C
Ganadas / perdidas / empatadas
792 / 432 / 1169
prompts
20
comparaciones
2393
Media del juez
83.3

Por categoría

Programación65%
Creativo88%
Factual57%
Multilingüe53%
Razonamiento58%
Puesto 19Anthropic
61%±2

Tasa de victoria

Elo 1075

Ganadas / perdidas / empatadas
935 / 521 / 1414
prompts
24
comparaciones
2870
Media del juez
94.5

Por categoría

Programación56%
Creativo54%
Factual64%
Multilingüe60%
Razonamiento67%
Sanidad82%
Puesto 19OpenAI
61%±2

Tasa de victoria

Elo 1075

Ganadas / perdidas / empatadas
927 / 516 / 1427
prompts
24
comparaciones
2870
Media del juez
89.1

Por categoría

Programación60%
Creativo72%
Factual46%
Multilingüe67%
Razonamiento69%
Sanidad54%
Puesto 19OpenAI
61%±2

Tasa de victoria

Elo 1074

Ganadas / perdidas / empatadas
926 / 520 / 1424
prompts
24
comparaciones
2870
Media del juez
92.3

Por categoría

Programación66%
Creativo66%
Factual59%
Multilingüe54%
Razonamiento69%
Sanidad35%
Puesto 19OpenAI
60%±2

Tasa de victoria

Elo 1074

Ganadas / perdidas / empatadas
788 / 437 / 1239
prompts
20
comparaciones
2464
Media del juez
81.6

Por categoría

Programación58%
Creativo69%
Factual50%
Multilingüe70%
Razonamiento63%
Puesto 23Anthropic
60%±2

Tasa de victoria

Elo 1073

Ganadas / perdidas / empatadas
961 / 564 / 1345
prompts
24
comparaciones
2870
Media del juez
94.0

Por categoría

Programación40%
Creativo57%
Factual70%
Multilingüe61%
Razonamiento77%
Sanidad78%
Puesto 22OpenAI
60%±2

Tasa de victoria

Elo 1073

o4-mini
Tier C
Ganadas / perdidas / empatadas
850 / 497 / 1192
prompts
20
comparaciones
2539
Media del juez
81.3

Por categoría

Programación71%
Creativo79%
Factual54%
Multilingüe57%
Razonamiento49%
Puesto 23OpenAI
60%±2

Tasa de victoria

Elo 1072

Ganadas / perdidas / empatadas
965 / 573 / 1332
prompts
24
comparaciones
2870
Media del juez
93.6

Por categoría

Programación56%
Creativo77%
Factual57%
Multilingüe55%
Razonamiento73%
Sanidad72%
Puesto 19Google Gemini
60%±3

Tasa de victoria

Elo 1070

Ganadas / perdidas / empatadas
501 / 290 / 608
prompts
18
comparaciones
1399
Media del juez
92.6

Por categoría

Programación70%
Creativo61%
Factual53%
Multilingüe67%
Razonamiento64%
Sanidad36%
Puesto 23Anthropic
60%±2

Tasa de victoria

Elo 1069

Ganadas / perdidas / empatadas
598 / 400 / 700
prompts
17
comparaciones
1698
Media del juez
86.9

Por categoría

Programación54%
Creativo89%
Factual53%
Multilingüe65%
Razonamiento59%
Puesto 24OpenAI
60%±2

Tasa de victoria

Elo 1068

Ganadas / perdidas / empatadas
714 / 414 / 1246
prompts
19
comparaciones
2374
Media del juez
82.1

Por categoría

Programación65%
Creativo84%
Factual49%
Multilingüe56%
Razonamiento58%
Puesto 25OpenAI
59%±2

Tasa de victoria

Elo 1064

Ganadas / perdidas / empatadas
817 / 516 / 1269
prompts
20
comparaciones
2602
Media del juez
90.5

Por categoría

Programación67%
Creativo72%
Factual41%
Multilingüe64%
Razonamiento60%
Puesto 25OpenAI
59%±2

Tasa de victoria

Elo 1064

Ganadas / perdidas / empatadas
848 / 544 / 1277
prompts
20
comparaciones
2669
Media del juez
85.2

Por categoría

Programación63%
Creativo30%
Factual44%
Multilingüe69%
Razonamiento74%
Puesto 27OpenAI
59%±2

Tasa de victoria

Elo 1060

Ganadas / perdidas / empatadas
899 / 601 / 1370
prompts
24
comparaciones
2870
Media del juez
93.4

Por categoría

Programación49%
Creativo71%
Factual69%
Multilingüe56%
Razonamiento59%
Sanidad78%
Puesto 27Anthropic
58%±2

Tasa de victoria

Elo 1058

Ganadas / perdidas / empatadas
840 / 578 / 1251
prompts
20
comparaciones
2669
Media del juez
93.8

Por categoría

Programación48%
Creativo44%
Factual72%
Multilingüe58%
Razonamiento67%
Puesto 34OpenAI
57%±2

Tasa de victoria

Elo 1052

Ganadas / perdidas / empatadas
876 / 641 / 1353
prompts
24
comparaciones
2870
Media del juez
91.1

Por categoría

Programación56%
Creativo60%
Factual64%
Multilingüe53%
Razonamiento65%
Sanidad21%
Puesto 34OpenAI
57%±2

Tasa de victoria

Elo 1050

Ganadas / perdidas / empatadas
904 / 681 / 1285
prompts
24
comparaciones
2870
Media del juez
88.5

Por categoría

Programación61%
Creativo70%
Factual44%
Multilingüe58%
Razonamiento65%
Sanidad49%
Puesto 34OVH AI Endpoints (GRA)
57%±2

Tasa de victoria

Elo 1048

Ganadas / perdidas / empatadas
778 / 584 / 1307
prompts
20
comparaciones
2669
Media del juez
91.9

Por categoría

Programación46%
Creativo69%
Factual60%
Multilingüe51%
Razonamiento74%
Puesto 47Anthropic
55%±2

Tasa de victoria

Elo 1035

Ganadas / perdidas / empatadas
862 / 754 / 1254
prompts
24
comparaciones
2870
Media del juez
91.7

Por categoría

Programación58%
Creativo55%
Factual53%
Multilingüe55%
Razonamiento61%
Sanidad33%
Puesto 47OVH AI Endpoints (GRA)
55%±2

Tasa de victoria

Elo 1033

Ganadas / perdidas / empatadas
828 / 744 / 1097
prompts
20
comparaciones
2669
Media del juez
89.2

Por categoría

Programación55%
Creativo36%
Factual57%
Multilingüe53%
Razonamiento64%
Puesto 49OVH AI Endpoints (GRA)
54%±2

Tasa de victoria

Elo 1027

Ganadas / perdidas / empatadas
792 / 746 / 1131
prompts
20
comparaciones
2669
Media del juez
90.9

Por categoría

Programación66%
Creativo41%
Factual46%
Multilingüe50%
Razonamiento61%
Puesto 50OVH AI Endpoints (GRA)
53%±2

Tasa de victoria

Elo 1024

Ganadas / perdidas / empatadas
791 / 767 / 1111
prompts
20
comparaciones
2669
Media del juez
91.5

Por categoría

Programación56%
Creativo65%
Factual33%
Multilingüe52%
Razonamiento74%
Puesto 52OpenAI
53%±2

Tasa de victoria

Elo 1019

Ganadas / perdidas / empatadas
835 / 845 / 989
prompts
20
comparaciones
2669
Media del juez
84.3

Por categoría

Programación55%
Creativo32%
Factual32%
Multilingüe68%
Razonamiento66%
Puesto 52OpenAI
51%±2

Tasa de victoria

Elo 1009

gpt-4
Tier C
Ganadas / perdidas / empatadas
867 / 957 / 1046
prompts
24
comparaciones
2870
Media del juez
88.6

Por categoría

Programación58%
Creativo33%
Factual41%
Multilingüe54%
Razonamiento60%
Sanidad43%
Puesto 53OpenAI
51%±2

Tasa de victoria

Elo 1005

o3-mini
Tier C
Ganadas / perdidas / empatadas
627 / 722 / 1119
prompts
20
comparaciones
2468
Media del juez
84.8

Por categoría

Programación58%
Creativo30%
Factual31%
Multilingüe57%
Razonamiento64%
Puesto 53Google Gemini
50%±2

Tasa de victoria

Elo 1003

Ganadas / perdidas / empatadas
485 / 536 / 778
prompts
23
comparaciones
1799
Media del juez
79.3

Por categoría

Programación44%
Creativo82%
Factual43%
Multilingüe55%
Razonamiento43%
Sanidad43%
Puesto 54OpenAI
50%±2

Tasa de victoria

Elo 1003

Ganadas / perdidas / empatadas
549 / 641 / 1130
prompts
20
comparaciones
2320
Media del juez
75.1

Por categoría

Programación60%
Creativo50%
Factual40%
Multilingüe45%
Razonamiento58%
Puesto 54Anthropic
50%±2

Tasa de victoria

Elo 999

Ganadas / perdidas / empatadas
586 / 716 / 868
prompts
18
comparaciones
2170
Media del juez
82.7

Por categoría

Programación31%
Creativo86%
Factual53%
Multilingüe41%
Razonamiento55%
Puesto 56Google Gemini
49%±2

Tasa de victoria

Elo 996

Ganadas / perdidas / empatadas
801 / 988 / 1081
prompts
24
comparaciones
2870
Media del juez
90.7

Por categoría

Programación38%
Creativo51%
Factual45%
Multilingüe57%
Razonamiento60%
Sanidad53%
Puesto 59OpenAI
47%±2

Tasa de victoria

Elo 977

Ganadas / perdidas / empatadas
730 / 1061 / 1079
prompts
24
comparaciones
2870
Media del juez
82.2

Por categoría

Programación55%
Creativo54%
Factual23%
Multilingüe56%
Razonamiento52%
Sanidad18%
Puesto 59OpenAI
47%±2

Tasa de victoria

Elo 977

gpt-4-0613
Tier Carchived
Ganadas / perdidas / empatadas
754 / 1085 / 1031
prompts
24
comparaciones
2870
Media del juez
90.0

Por categoría

Programación45%
Creativo53%
Factual37%
Multilingüe48%
Razonamiento56%
Sanidad51%
Puesto 58OpenAI
47%±2

Tasa de victoria

Elo 976

Ganadas / perdidas / empatadas
549 / 818 / 1026
prompts
20
comparaciones
2393
Media del juez
71.9

Por categoría

Programación64%
Creativo35%
Factual40%
Multilingüe32%
Razonamiento58%
Puesto 63OpenAI
43%±2

Tasa de victoria

Elo 952

Ganadas / perdidas / empatadas
691 / 1203 / 976
prompts
24
comparaciones
2870
Media del juez
82.4

Por categoría

Programación58%
Creativo46%
Factual18%
Multilingüe51%
Razonamiento43%
Sanidad25%
Puesto 66Google Gemini
42%±2

Tasa de victoria

Elo 944

Ganadas / perdidas / empatadas
686 / 1258 / 926
prompts
24
comparaciones
2870
Media del juez
77.5

Por categoría

Programación35%
Creativo21%
Factual52%
Multilingüe42%
Razonamiento50%
Sanidad23%
Puesto 66OpenAI
42%±2

Tasa de victoria

Elo 942

gpt-5
Tier C
Ganadas / perdidas / empatadas
407 / 813 / 861
prompts
19
comparaciones
2081
Media del juez
62.0

Por categoría

Programación56%
Creativo7%
Factual39%
Multilingüe38%
Razonamiento45%
Puesto 66OpenAI
41%±2

Tasa de victoria

Elo 939

Ganadas / perdidas / empatadas
688 / 1291 / 891
prompts
24
comparaciones
2870
Media del juez
82.3

Por categoría

Programación49%
Creativo54%
Factual18%
Multilingüe43%
Razonamiento53%
Sanidad22%
Puesto 66OpenAI
41%±2

Tasa de victoria

Elo 936

Ganadas / perdidas / empatadas
681 / 1307 / 882
prompts
24
comparaciones
2870
Media del juez
81.1

Por categoría

Programación63%
Creativo30%
Factual21%
Multilingüe47%
Razonamiento33%
Sanidad20%
Puesto 66OpenAI
40%±2

Tasa de victoria

Elo 933

Ganadas / perdidas / empatadas
466 / 977 / 877
prompts
20
comparaciones
2320
Media del juez
59.1

Por categoría

Programación56%
Creativo3%
Factual24%
Multilingüe37%
Razonamiento58%
Puesto 67OVH AI Endpoints (GRA)
39%±2

Tasa de victoria

Elo 922

Ganadas / perdidas / empatadas
559 / 1195 / 781
prompts
20
comparaciones
2535
Media del juez
79.8

Por categoría

Programación50%
Creativo45%
Factual31%
Multilingüe25%
Razonamiento49%
Puesto 68Z.ai (GLM / Zhipu)
38%±2

Tasa de victoria

Elo 912

Ganadas / perdidas / empatadas
358 / 847 / 611
prompts
14
comparaciones
1816
Media del juez
54.5

Por categoría

Programación43%
Creativo31%
Factual44%
Razonamiento24%
Puesto 68Z.ai (GLM / Zhipu)
37%±2

Tasa de victoria

Elo 909

GLM-5.2
Tier A
Ganadas / perdidas / empatadas
367 / 846 / 538
prompts
14
comparaciones
1751
Media del juez
54.0

Por categoría

Programación50%
Creativo4%
Factual42%
Razonamiento20%
Puesto 70Z.ai (GLM / Zhipu)
37%±2

Tasa de victoria

Elo 907

Ganadas / perdidas / empatadas
367 / 881 / 578
prompts
14
comparaciones
1826
Media del juez
64.5

Por categoría

Programación50%
Creativo46%
Factual31%
Razonamiento15%
Puesto 71Z.ai (GLM / Zhipu)
37%±2

Tasa de victoria

Elo 904

GLM-5.1
Tier A
Ganadas / perdidas / empatadas
375 / 831 / 412
prompts
14
comparaciones
1618
Media del juez
69.1

Por categoría

Programación32%
Creativo13%
Factual50%
Razonamiento34%
Puesto 73OVH AI Endpoints (GRA)
35%±2

Tasa de victoria

Elo 890

Ganadas / perdidas / empatadas
555 / 1438 / 676
prompts
20
comparaciones
2669
Media del juez
75.9

Por categoría

Programación42%
Creativo10%
Factual29%
Multilingüe39%
Razonamiento36%
Puesto 73Google Gemini
34%±2

Tasa de victoria

Elo 887

Ganadas / perdidas / empatadas
605 / 1574 / 691
prompts
24
comparaciones
2870
Media del juez
63.9

Por categoría

Programación32%
Creativo31%
Factual49%
Multilingüe29%
Razonamiento28%
Sanidad9%
Puesto 77Z.ai (GLM / Zhipu)
31%±2

Tasa de victoria

Elo 864

Ganadas / perdidas / empatadas
303 / 941 / 449
prompts
14
comparaciones
1693
Media del juez
54.4

Por categoría

Programación50%
Creativo8%
Factual39%
Razonamiento6%
Puesto 77Z.ai (GLM / Zhipu)
31%±2

Tasa de victoria

Elo 862

GLM-4.6
Tier A
Ganadas / perdidas / empatadas
303 / 974 / 463
prompts
13
comparaciones
1740
Media del juez
55.8

Por categoría

Programación46%
Creativo1%
Factual37%
Razonamiento16%
Puesto 78OpenAI
30%±2

Tasa de victoria

Elo 856

Ganadas / perdidas / empatadas
268 / 990 / 568
prompts
18
comparaciones
1826
Media del juez
39.6

Por categoría

Programación27%
Creativo7%
Factual48%
Multilingüe27%
Razonamiento21%
Puesto 79OVH AI Endpoints (GRA)
28%±2

Tasa de victoria

Elo 835

Ganadas / perdidas / empatadas
476 / 1684 / 509
prompts
20
comparaciones
2669
Media del juez
71.7

Por categoría

Programación35%
Creativo11%
Factual27%
Multilingüe27%
Razonamiento24%
Puesto 81Z.ai (GLM / Zhipu)
26%±2

Tasa de victoria

Elo 818

Ganadas / perdidas / empatadas
230 / 1025 / 421
prompts
14
comparaciones
1676
Media del juez
46.4

Por categoría

Programación43%
Creativo4%
Factual29%
Razonamiento5%
Puesto 82Google Gemini
25%±2

Tasa de victoria

Elo 812

Ganadas / perdidas / empatadas
418 / 1752 / 499
prompts
20
comparaciones
2669
Media del juez
50.5

Por categoría

Programación9%
Creativo48%
Factual43%
Multilingüe25%
Razonamiento10%
Puesto 83OpenAI
24%±2

Tasa de victoria

Elo 799

Ganadas / perdidas / empatadas
219 / 1207 / 501
prompts
20
comparaciones
1927
Media del juez
38.0

Por categoría

Programación18%
Creativo4%
Factual50%
Multilingüe18%
Razonamiento10%
Puesto 83Google Gemini
23%±2

Tasa de victoria

Elo 792

Ganadas / perdidas / empatadas
192 / 915 / 292
prompts
18
comparaciones
1399
Media del juez
41.4

Por categoría

Programación19%
Creativo14%
Factual44%
Multilingüe4%
Razonamiento3%
Sanidad54%
Puesto 83OVH AI Endpoints (GRA)
23%±2

Tasa de victoria

Elo 790

Ganadas / perdidas / empatadas
255 / 1313 / 428
prompts
19
comparaciones
1996
Media del juez
43.4

Por categoría

Programación42%
Creativo6%
Factual6%
Multilingüe28%
Razonamiento5%
Puesto 83OVH AI Endpoints (GRA)
23%±2

Tasa de victoria

Elo 789

Qwen3-32B
Tier B
Ganadas / perdidas / empatadas
440 / 1893 / 336
prompts
20
comparaciones
2669
Media del juez
75.8

Por categoría

Programación18%
Creativo14%
Factual21%
Multilingüe27%
Razonamiento24%
Puesto 83Google Gemini
22%±2

Tasa de victoria

Elo 780

Ganadas / perdidas / empatadas
250 / 1275 / 353
prompts
24
comparaciones
1878
Media del juez
44.1

Por categoría

Programación4%
Creativo38%
Factual42%
Multilingüe19%
Razonamiento13%
Sanidad3%
Puesto 85OVH AI Endpoints (GRA)
21%±2

Tasa de victoria

Elo 770

Ganadas / perdidas / empatadas
211 / 1343 / 442
prompts
19
comparaciones
1996
Media del juez
44.1

Por categoría

Programación36%
Creativo5%
Factual11%
Multilingüe24%
Razonamiento3%
Puesto 85Google Gemini
21%±2

Tasa de victoria

Elo 767

Ganadas / perdidas / empatadas
404 / 2080 / 386
prompts
24
comparaciones
2870
Media del juez
47.4

Por categoría

Programación5%
Creativo51%
Factual43%
Multilingüe16%
Razonamiento7%
Sanidad5%
Puesto 86Google Gemini
20%±2

Tasa de victoria

Elo 761

Ganadas / perdidas / empatadas
371 / 2077 / 422
prompts
24
comparaciones
2870
Media del juez
43.9

Por categoría

Programación4%
Creativo23%
Factual49%
Multilingüe17%
Razonamiento7%
Sanidad2%
Puesto 92Google Gemini
17%±2

Tasa de victoria

Elo 726

Ganadas / perdidas / empatadas
182 / 1437 / 345
prompts
24
comparaciones
1964
Media del juez
30.7

Por categoría

Programación17%
Creativo3%
Factual34%
Multilingüe8%
Razonamiento3%
Sanidad54%
Puesto 93Google Gemini
14%±1

Tasa de victoria

Elo 687

Ganadas / perdidas / empatadas
295 / 2327 / 248
prompts
24
comparaciones
2870
Media del juez
36.6

Por categoría

Programación3%
Creativo24%
Factual25%
Multilingüe11%
Razonamiento10%
Sanidad2%

94 modelos clasificados a partir de 117.970 comparaciones por pares en 24 prompts.

Provisional

Pruebas insuficientes para clasificar: hacen falta al menos 5 prompts y 30 comparaciones.

ProvisionalZ.ai (GLM / Zhipu)
1%±1

Tasa de victoria

Elo 155

CogView-4
Tier B
Ganadas / perdidas / empatadas
0 / 361 / 6
prompts
4
comparaciones
367
Media del juez
0.0

Por categoría

Programación1%
Creativo<1% · escasa