Zum Inhalt

Benchmarks

Intelligenztest

Modelle werden über paarweise Vergleiche platziert, nicht über eine absolute Note. Bei jedem Prompt wird jedes Modellpaar direkt verglichen, und ein Bradley-Terry-Modell schätzt daraus eine Bewertung. Die Siegquote unten übersetzt diese Bewertung in die Frage, die sie beantwortet: wie oft dieses Modell ein durchschnittliches Modell dieser Tabelle schlägt. 50 % ist Durchschnitt.

Wie hier gewertet wird

8.603

gewertete Läufe

117.970

paarweise Vergleiche

24

Prompts

4.699

Läufe ohne Wertung (Anbieterfehler)

22 von 24 Prompts unterscheiden Modelle überhaupt. Der Rest wird von fast allen gleich gut beantwortet und trägt kein Ranking-Signal — genau das hat ein absoluter Wert nahe 100 in Wahrheit gemessen.

  • Programmieren 4/4
  • Kreativ 2/2
  • Faktenwissen 3/4
  • Mehrsprachig 7/8
  • Schlussfolgern 4/4
  • Gesundheitswesen 2/2
Platz 1OpenAI
73%±2

Siegquote

Elo 1175

Gewonnen / verloren / unentschieden
1296 / 172 / 1402
Prompts
24
Vergleiche
2870
Jury-Mittelwert
96.0

Nach Kategorie

Programmieren80%
Kreativ91%
Faktenwissen74%
Mehrsprachig60%
Schlussfolgern77%
Gesundheitswesen75%
Platz 1OpenAI
73%±2

Siegquote

Elo 1172

gpt-5.1
Tier B
Gewonnen / verloren / unentschieden
1125 / 101 / 1443
Prompts
20
Vergleiche
2669
Jury-Mittelwert
95.0

Nach Kategorie

Programmieren76%
Kreativ79%
Faktenwissen71%
Mehrsprachig70%
Schlussfolgern78%
Platz 1OpenAI
73%±2

Siegquote

Elo 1171

Gewonnen / verloren / unentschieden
1149 / 132 / 1388
Prompts
20
Vergleiche
2669
Jury-Mittelwert
95.9

Nach Kategorie

Programmieren78%
Kreativ89%
Faktenwissen76%
Mehrsprachig67%
Schlussfolgern66%
Platz 1OpenAI
70%±2

Siegquote

Elo 1149

gpt-5.5
Tier C
Gewonnen / verloren / unentschieden
1074 / 193 / 1402
Prompts
20
Vergleiche
2669
Jury-Mittelwert
93.9

Nach Kategorie

Programmieren70%
Kreativ82%
Faktenwissen72%
Mehrsprachig66%
Schlussfolgern74%
Platz 1OpenAI
70%±2

Siegquote

Elo 1149

Gewonnen / verloren / unentschieden
1142 / 193 / 1535
Prompts
24
Vergleiche
2870
Jury-Mittelwert
96.0

Nach Kategorie

Programmieren72%
Kreativ92%
Faktenwissen72%
Mehrsprachig65%
Schlussfolgern66%
Gesundheitswesen84%
Platz 2OpenAI
70%±2

Siegquote

Elo 1144

Gewonnen / verloren / unentschieden
1062 / 216 / 1391
Prompts
20
Vergleiche
2669
Jury-Mittelwert
93.9

Nach Kategorie

Programmieren75%
Kreativ78%
Faktenwissen57%
Mehrsprachig69%
Schlussfolgern78%
Platz 3OpenAI
69%±2

Siegquote

Elo 1142

gpt-5.4
Tier A
Gewonnen / verloren / unentschieden
1047 / 214 / 1408
Prompts
20
Vergleiche
2669
Jury-Mittelwert
94.8

Nach Kategorie

Programmieren68%
Kreativ90%
Faktenwissen63%
Mehrsprachig68%
Schlussfolgern74%
Platz 4OpenAI
69%±2

Siegquote

Elo 1141

gpt-5.2
Tier B
Gewonnen / verloren / unentschieden
1062 / 235 / 1372
Prompts
20
Vergleiche
2669
Jury-Mittelwert
94.2

Nach Kategorie

Programmieren66%
Kreativ92%
Faktenwissen67%
Mehrsprachig66%
Schlussfolgern74%
Platz 4OpenAI
69%±2

Siegquote

Elo 1139

gpt-4.1
Tier B
Gewonnen / verloren / unentschieden
1128 / 249 / 1493
Prompts
24
Vergleiche
2870
Jury-Mittelwert
95.7

Nach Kategorie

Programmieren74%
Kreativ83%
Faktenwissen69%
Mehrsprachig64%
Schlussfolgern66%
Gesundheitswesen79%
Platz 4OpenAI
69%±2

Siegquote

Elo 1139

Gewonnen / verloren / unentschieden
1099 / 220 / 1551
Prompts
24
Vergleiche
2870
Jury-Mittelwert
95.1

Nach Kategorie

Programmieren69%
Kreativ82%
Faktenwissen67%
Mehrsprachig68%
Schlussfolgern73%
Gesundheitswesen70%
Platz 4Anthropic
69%±2

Siegquote

Elo 1135

Gewonnen / verloren / unentschieden
1162 / 309 / 1399
Prompts
24
Vergleiche
2870
Jury-Mittelwert
97.0

Nach Kategorie

Programmieren63%
Kreativ93%
Faktenwissen73%
Mehrsprachig64%
Schlussfolgern67%
Gesundheitswesen90%
Platz 4OpenAI
68%±2

Siegquote

Elo 1133

Gewonnen / verloren / unentschieden
1067 / 292 / 1310
Prompts
20
Vergleiche
2669
Jury-Mittelwert
94.1

Nach Kategorie

Programmieren71%
Kreativ92%
Faktenwissen61%
Mehrsprachig63%
Schlussfolgern71%
Platz 4Z.ai (GLM / Zhipu)
68%±2

Siegquote

Elo 1132

GLM-4.7
Tier A
Gewonnen / verloren / unentschieden
838 / 259 / 882
Prompts
14
Vergleiche
1979
Jury-Mittelwert
91.1

Nach Kategorie

Programmieren61%
Kreativ85%
Faktenwissen70%
Schlussfolgern74%
Platz 4OpenAI
68%±2

Siegquote

Elo 1129

Gewonnen / verloren / unentschieden
1035 / 289 / 1345
Prompts
20
Vergleiche
2669
Jury-Mittelwert
94.6

Nach Kategorie

Programmieren74%
Kreativ89%
Faktenwissen55%
Mehrsprachig64%
Schlussfolgern74%
Platz 4OpenAI
67%±2

Siegquote

Elo 1127

Gewonnen / verloren / unentschieden
987 / 252 / 1430
Prompts
20
Vergleiche
2669
Jury-Mittelwert
94.0

Nach Kategorie

Programmieren75%
Kreativ73%
Faktenwissen59%
Mehrsprachig64%
Schlussfolgern74%
Platz 6OpenAI
66%±2

Siegquote

Elo 1117

Gewonnen / verloren / unentschieden
981 / 315 / 1373
Prompts
20
Vergleiche
2669
Jury-Mittelwert
93.0

Nach Kategorie

Programmieren65%
Kreativ89%
Faktenwissen59%
Mehrsprachig63%
Schlussfolgern74%
Platz 6Z.ai (GLM / Zhipu)
66%±2

Siegquote

Elo 1115

GLM-4.5
Tier A
Gewonnen / verloren / unentschieden
843 / 337 / 862
Prompts
14
Vergleiche
2042
Jury-Mittelwert
90.0

Nach Kategorie

Programmieren71%
Kreativ85%
Faktenwissen66%
Schlussfolgern55%
Platz 12OpenAI
65%±2

Siegquote

Elo 1106

gpt-4o
Tier C
Gewonnen / verloren / unentschieden
1034 / 390 / 1446
Prompts
24
Vergleiche
2870
Jury-Mittelwert
94.8

Nach Kategorie

Programmieren58%
Kreativ73%
Faktenwissen68%
Mehrsprachig64%
Schlussfolgern73%
Gesundheitswesen67%
Platz 14OpenAI
64%±2

Siegquote

Elo 1101

Gewonnen / verloren / unentschieden
1026 / 421 / 1423
Prompts
24
Vergleiche
2870
Jury-Mittelwert
94.5

Nach Kategorie

Programmieren66%
Kreativ86%
Faktenwissen61%
Mehrsprachig53%
Schlussfolgern70%
Gesundheitswesen87%
Platz 14OpenAI
64%±2

Siegquote

Elo 1101

Gewonnen / verloren / unentschieden
1060 / 455 / 1355
Prompts
24
Vergleiche
2870
Jury-Mittelwert
94.0

Nach Kategorie

Programmieren62%
Kreativ82%
Faktenwissen62%
Mehrsprachig52%
Schlussfolgern77%
Gesundheitswesen89%
Platz 14OpenAI
64%±2

Siegquote

Elo 1101

Gewonnen / verloren / unentschieden
1004 / 401 / 1465
Prompts
24
Vergleiche
2870
Jury-Mittelwert
95.2

Nach Kategorie

Programmieren62%
Kreativ82%
Faktenwissen62%
Mehrsprachig64%
Schlussfolgern66%
Gesundheitswesen75%
Platz 15Anthropic
64%±2

Siegquote

Elo 1100

Gewonnen / verloren / unentschieden
1038 / 437 / 1395
Prompts
24
Vergleiche
2870
Jury-Mittelwert
95.1

Nach Kategorie

Programmieren51%
Kreativ60%
Faktenwissen79%
Mehrsprachig60%
Schlussfolgern73%
Gesundheitswesen81%
Platz 16Google Gemini
64%±2

Siegquote

Elo 1098

Gewonnen / verloren / unentschieden
1069 / 483 / 1318
Prompts
24
Vergleiche
2870
Jury-Mittelwert
94.8

Nach Kategorie

Programmieren67%
Kreativ45%
Faktenwissen71%
Mehrsprachig61%
Schlussfolgern64%
Gesundheitswesen85%
Platz 16Anthropic
63%±2

Siegquote

Elo 1094

Gewonnen / verloren / unentschieden
919 / 401 / 1390
Prompts
20
Vergleiche
2710
Jury-Mittelwert
88.9

Nach Kategorie

Programmieren64%
Kreativ67%
Faktenwissen59%
Mehrsprachig65%
Schlussfolgern69%
Platz 16OpenAI
63%±2

Siegquote

Elo 1092

o1
Tier C
Gewonnen / verloren / unentschieden
879 / 398 / 1262
Prompts
20
Vergleiche
2539
Jury-Mittelwert
90.4

Nach Kategorie

Programmieren77%
Kreativ55%
Faktenwissen48%
Mehrsprachig65%
Schlussfolgern63%
Platz 16Anthropic
63%±2

Siegquote

Elo 1090

Gewonnen / verloren / unentschieden
1008 / 484 / 1378
Prompts
24
Vergleiche
2870
Jury-Mittelwert
95.8

Nach Kategorie

Programmieren54%
Kreativ58%
Faktenwissen71%
Mehrsprachig63%
Schlussfolgern67%
Gesundheitswesen88%
Platz 16Z.ai (GLM / Zhipu)
63%±2

Siegquote

Elo 1089

GLM-5
Tier A
Gewonnen / verloren / unentschieden
553 / 252 / 733
Prompts
14
Vergleiche
1538
Jury-Mittelwert
94.6

Nach Kategorie

Programmieren57%
Kreativ89%
Faktenwissen64%
Schlussfolgern61%
Platz 16Google Gemini
62%±2

Siegquote

Elo 1087

Gewonnen / verloren / unentschieden
615 / 274 / 910
Prompts
23
Vergleiche
1799
Jury-Mittelwert
93.5

Nach Kategorie

Programmieren51%
Kreativ70%
Faktenwissen61%
Mehrsprachig65%
Schlussfolgern73%
Gesundheitswesen58%
Platz 17OpenAI
62%±2

Siegquote

Elo 1086

Gewonnen / verloren / unentschieden
826 / 396 / 1246
Prompts
20
Vergleiche
2468
Jury-Mittelwert
86.8

Nach Kategorie

Programmieren77%
Kreativ6%
Faktenwissen61%
Mehrsprachig68%
Schlussfolgern63%
Platz 17OVH AI Endpoints (GRA)
62%±2

Siegquote

Elo 1085

Gewonnen / verloren / unentschieden
901 / 450 / 1318
Prompts
20
Vergleiche
2669
Jury-Mittelwert
92.0

Nach Kategorie

Programmieren60%
Kreativ84%
Faktenwissen61%
Mehrsprachig54%
Schlussfolgern70%
Platz 18OpenAI
62%±2

Siegquote

Elo 1083

Gewonnen / verloren / unentschieden
987 / 519 / 1364
Prompts
24
Vergleiche
2870
Jury-Mittelwert
92.8

Nach Kategorie

Programmieren51%
Kreativ73%
Faktenwissen72%
Mehrsprachig62%
Schlussfolgern62%
Gesundheitswesen72%
Platz 18OpenAI
62%±2

Siegquote

Elo 1082

Gewonnen / verloren / unentschieden
940 / 479 / 1451
Prompts
24
Vergleiche
2870
Jury-Mittelwert
94.3

Nach Kategorie

Programmieren53%
Kreativ50%
Faktenwissen71%
Mehrsprachig58%
Schlussfolgern71%
Gesundheitswesen86%
Platz 18Google Gemini
61%±2

Siegquote

Elo 1079

Gewonnen / verloren / unentschieden
853 / 444 / 1372
Prompts
20
Vergleiche
2669
Jury-Mittelwert
92.8

Nach Kategorie

Programmieren55%
Kreativ42%
Faktenwissen70%
Mehrsprachig59%
Schlussfolgern74%
Platz 19OpenAI
61%±2

Siegquote

Elo 1076

o3
Tier C
Gewonnen / verloren / unentschieden
792 / 432 / 1169
Prompts
20
Vergleiche
2393
Jury-Mittelwert
83.3

Nach Kategorie

Programmieren65%
Kreativ88%
Faktenwissen57%
Mehrsprachig53%
Schlussfolgern58%
Platz 19Anthropic
61%±2

Siegquote

Elo 1075

Gewonnen / verloren / unentschieden
935 / 521 / 1414
Prompts
24
Vergleiche
2870
Jury-Mittelwert
94.5

Nach Kategorie

Programmieren56%
Kreativ54%
Faktenwissen64%
Mehrsprachig60%
Schlussfolgern67%
Gesundheitswesen82%
Platz 19OpenAI
61%±2

Siegquote

Elo 1075

Gewonnen / verloren / unentschieden
927 / 516 / 1427
Prompts
24
Vergleiche
2870
Jury-Mittelwert
89.1

Nach Kategorie

Programmieren60%
Kreativ72%
Faktenwissen46%
Mehrsprachig67%
Schlussfolgern69%
Gesundheitswesen54%
Platz 19OpenAI
61%±2

Siegquote

Elo 1074

Gewonnen / verloren / unentschieden
926 / 520 / 1424
Prompts
24
Vergleiche
2870
Jury-Mittelwert
92.3

Nach Kategorie

Programmieren66%
Kreativ66%
Faktenwissen59%
Mehrsprachig54%
Schlussfolgern69%
Gesundheitswesen35%
Platz 19OpenAI
60%±2

Siegquote

Elo 1074

Gewonnen / verloren / unentschieden
788 / 437 / 1239
Prompts
20
Vergleiche
2464
Jury-Mittelwert
81.6

Nach Kategorie

Programmieren58%
Kreativ69%
Faktenwissen50%
Mehrsprachig70%
Schlussfolgern63%
Platz 23Anthropic
60%±2

Siegquote

Elo 1073

Gewonnen / verloren / unentschieden
961 / 564 / 1345
Prompts
24
Vergleiche
2870
Jury-Mittelwert
94.0

Nach Kategorie

Programmieren40%
Kreativ57%
Faktenwissen70%
Mehrsprachig61%
Schlussfolgern77%
Gesundheitswesen78%
Platz 22OpenAI
60%±2

Siegquote

Elo 1073

o4-mini
Tier C
Gewonnen / verloren / unentschieden
850 / 497 / 1192
Prompts
20
Vergleiche
2539
Jury-Mittelwert
81.3

Nach Kategorie

Programmieren71%
Kreativ79%
Faktenwissen54%
Mehrsprachig57%
Schlussfolgern49%
Platz 23OpenAI
60%±2

Siegquote

Elo 1072

Gewonnen / verloren / unentschieden
965 / 573 / 1332
Prompts
24
Vergleiche
2870
Jury-Mittelwert
93.6

Nach Kategorie

Programmieren56%
Kreativ77%
Faktenwissen57%
Mehrsprachig55%
Schlussfolgern73%
Gesundheitswesen72%
Platz 19Google Gemini
60%±3

Siegquote

Elo 1070

Gewonnen / verloren / unentschieden
501 / 290 / 608
Prompts
18
Vergleiche
1399
Jury-Mittelwert
92.6

Nach Kategorie

Programmieren70%
Kreativ61%
Faktenwissen53%
Mehrsprachig67%
Schlussfolgern64%
Gesundheitswesen36%
Platz 23Anthropic
60%±2

Siegquote

Elo 1069

Gewonnen / verloren / unentschieden
598 / 400 / 700
Prompts
17
Vergleiche
1698
Jury-Mittelwert
86.9

Nach Kategorie

Programmieren54%
Kreativ89%
Faktenwissen53%
Mehrsprachig65%
Schlussfolgern59%
Platz 24OpenAI
60%±2

Siegquote

Elo 1068

Gewonnen / verloren / unentschieden
714 / 414 / 1246
Prompts
19
Vergleiche
2374
Jury-Mittelwert
82.1

Nach Kategorie

Programmieren65%
Kreativ84%
Faktenwissen49%
Mehrsprachig56%
Schlussfolgern58%
Platz 25OpenAI
59%±2

Siegquote

Elo 1064

Gewonnen / verloren / unentschieden
817 / 516 / 1269
Prompts
20
Vergleiche
2602
Jury-Mittelwert
90.5

Nach Kategorie

Programmieren67%
Kreativ72%
Faktenwissen41%
Mehrsprachig64%
Schlussfolgern60%
Platz 25OpenAI
59%±2

Siegquote

Elo 1064

Gewonnen / verloren / unentschieden
848 / 544 / 1277
Prompts
20
Vergleiche
2669
Jury-Mittelwert
85.2

Nach Kategorie

Programmieren63%
Kreativ30%
Faktenwissen44%
Mehrsprachig69%
Schlussfolgern74%
Platz 27OpenAI
59%±2

Siegquote

Elo 1060

Gewonnen / verloren / unentschieden
899 / 601 / 1370
Prompts
24
Vergleiche
2870
Jury-Mittelwert
93.4

Nach Kategorie

Programmieren49%
Kreativ71%
Faktenwissen69%
Mehrsprachig56%
Schlussfolgern59%
Gesundheitswesen78%
Platz 27Anthropic
58%±2

Siegquote

Elo 1058

Gewonnen / verloren / unentschieden
840 / 578 / 1251
Prompts
20
Vergleiche
2669
Jury-Mittelwert
93.8

Nach Kategorie

Programmieren48%
Kreativ44%
Faktenwissen72%
Mehrsprachig58%
Schlussfolgern67%
Platz 34OpenAI
57%±2

Siegquote

Elo 1052

Gewonnen / verloren / unentschieden
876 / 641 / 1353
Prompts
24
Vergleiche
2870
Jury-Mittelwert
91.1

Nach Kategorie

Programmieren56%
Kreativ60%
Faktenwissen64%
Mehrsprachig53%
Schlussfolgern65%
Gesundheitswesen21%
Platz 34OpenAI
57%±2

Siegquote

Elo 1050

Gewonnen / verloren / unentschieden
904 / 681 / 1285
Prompts
24
Vergleiche
2870
Jury-Mittelwert
88.5

Nach Kategorie

Programmieren61%
Kreativ70%
Faktenwissen44%
Mehrsprachig58%
Schlussfolgern65%
Gesundheitswesen49%
Platz 34OVH AI Endpoints (GRA)
57%±2

Siegquote

Elo 1048

Gewonnen / verloren / unentschieden
778 / 584 / 1307
Prompts
20
Vergleiche
2669
Jury-Mittelwert
91.9

Nach Kategorie

Programmieren46%
Kreativ69%
Faktenwissen60%
Mehrsprachig51%
Schlussfolgern74%
Platz 47Anthropic
55%±2

Siegquote

Elo 1035

Gewonnen / verloren / unentschieden
862 / 754 / 1254
Prompts
24
Vergleiche
2870
Jury-Mittelwert
91.7

Nach Kategorie

Programmieren58%
Kreativ55%
Faktenwissen53%
Mehrsprachig55%
Schlussfolgern61%
Gesundheitswesen33%
Platz 47OVH AI Endpoints (GRA)
55%±2

Siegquote

Elo 1033

Gewonnen / verloren / unentschieden
828 / 744 / 1097
Prompts
20
Vergleiche
2669
Jury-Mittelwert
89.2

Nach Kategorie

Programmieren55%
Kreativ36%
Faktenwissen57%
Mehrsprachig53%
Schlussfolgern64%
Platz 49OVH AI Endpoints (GRA)
54%±2

Siegquote

Elo 1027

Gewonnen / verloren / unentschieden
792 / 746 / 1131
Prompts
20
Vergleiche
2669
Jury-Mittelwert
90.9

Nach Kategorie

Programmieren66%
Kreativ41%
Faktenwissen46%
Mehrsprachig50%
Schlussfolgern61%
Platz 50OVH AI Endpoints (GRA)
53%±2

Siegquote

Elo 1024

Gewonnen / verloren / unentschieden
791 / 767 / 1111
Prompts
20
Vergleiche
2669
Jury-Mittelwert
91.5

Nach Kategorie

Programmieren56%
Kreativ65%
Faktenwissen33%
Mehrsprachig52%
Schlussfolgern74%
Platz 52OpenAI
53%±2

Siegquote

Elo 1019

Gewonnen / verloren / unentschieden
835 / 845 / 989
Prompts
20
Vergleiche
2669
Jury-Mittelwert
84.3

Nach Kategorie

Programmieren55%
Kreativ32%
Faktenwissen32%
Mehrsprachig68%
Schlussfolgern66%
Platz 52OpenAI
51%±2

Siegquote

Elo 1009

gpt-4
Tier C
Gewonnen / verloren / unentschieden
867 / 957 / 1046
Prompts
24
Vergleiche
2870
Jury-Mittelwert
88.6

Nach Kategorie

Programmieren58%
Kreativ33%
Faktenwissen41%
Mehrsprachig54%
Schlussfolgern60%
Gesundheitswesen43%
Platz 53OpenAI
51%±2

Siegquote

Elo 1005

o3-mini
Tier C
Gewonnen / verloren / unentschieden
627 / 722 / 1119
Prompts
20
Vergleiche
2468
Jury-Mittelwert
84.8

Nach Kategorie

Programmieren58%
Kreativ30%
Faktenwissen31%
Mehrsprachig57%
Schlussfolgern64%
Platz 53Google Gemini
50%±2

Siegquote

Elo 1003

Gewonnen / verloren / unentschieden
485 / 536 / 778
Prompts
23
Vergleiche
1799
Jury-Mittelwert
79.3

Nach Kategorie

Programmieren44%
Kreativ82%
Faktenwissen43%
Mehrsprachig55%
Schlussfolgern43%
Gesundheitswesen43%
Platz 54OpenAI
50%±2

Siegquote

Elo 1003

Gewonnen / verloren / unentschieden
549 / 641 / 1130
Prompts
20
Vergleiche
2320
Jury-Mittelwert
75.1

Nach Kategorie

Programmieren60%
Kreativ50%
Faktenwissen40%
Mehrsprachig45%
Schlussfolgern58%
Platz 54Anthropic
50%±2

Siegquote

Elo 999

Gewonnen / verloren / unentschieden
586 / 716 / 868
Prompts
18
Vergleiche
2170
Jury-Mittelwert
82.7

Nach Kategorie

Programmieren31%
Kreativ86%
Faktenwissen53%
Mehrsprachig41%
Schlussfolgern55%
Platz 56Google Gemini
49%±2

Siegquote

Elo 996

Gewonnen / verloren / unentschieden
801 / 988 / 1081
Prompts
24
Vergleiche
2870
Jury-Mittelwert
90.7

Nach Kategorie

Programmieren38%
Kreativ51%
Faktenwissen45%
Mehrsprachig57%
Schlussfolgern60%
Gesundheitswesen53%
Platz 59OpenAI
47%±2

Siegquote

Elo 977

Gewonnen / verloren / unentschieden
730 / 1061 / 1079
Prompts
24
Vergleiche
2870
Jury-Mittelwert
82.2

Nach Kategorie

Programmieren55%
Kreativ54%
Faktenwissen23%
Mehrsprachig56%
Schlussfolgern52%
Gesundheitswesen18%
Platz 59OpenAI
47%±2

Siegquote

Elo 977

gpt-4-0613
Tier Carchived
Gewonnen / verloren / unentschieden
754 / 1085 / 1031
Prompts
24
Vergleiche
2870
Jury-Mittelwert
90.0

Nach Kategorie

Programmieren45%
Kreativ53%
Faktenwissen37%
Mehrsprachig48%
Schlussfolgern56%
Gesundheitswesen51%
Platz 58OpenAI
47%±2

Siegquote

Elo 976

Gewonnen / verloren / unentschieden
549 / 818 / 1026
Prompts
20
Vergleiche
2393
Jury-Mittelwert
71.9

Nach Kategorie

Programmieren64%
Kreativ35%
Faktenwissen40%
Mehrsprachig32%
Schlussfolgern58%
Platz 63OpenAI
43%±2

Siegquote

Elo 952

Gewonnen / verloren / unentschieden
691 / 1203 / 976
Prompts
24
Vergleiche
2870
Jury-Mittelwert
82.4

Nach Kategorie

Programmieren58%
Kreativ46%
Faktenwissen18%
Mehrsprachig51%
Schlussfolgern43%
Gesundheitswesen25%
Platz 66Google Gemini
42%±2

Siegquote

Elo 944

Gewonnen / verloren / unentschieden
686 / 1258 / 926
Prompts
24
Vergleiche
2870
Jury-Mittelwert
77.5

Nach Kategorie

Programmieren35%
Kreativ21%
Faktenwissen52%
Mehrsprachig42%
Schlussfolgern50%
Gesundheitswesen23%
Platz 66OpenAI
42%±2

Siegquote

Elo 942

gpt-5
Tier C
Gewonnen / verloren / unentschieden
407 / 813 / 861
Prompts
19
Vergleiche
2081
Jury-Mittelwert
62.0

Nach Kategorie

Programmieren56%
Kreativ7%
Faktenwissen39%
Mehrsprachig38%
Schlussfolgern45%
Platz 66OpenAI
41%±2

Siegquote

Elo 939

Gewonnen / verloren / unentschieden
688 / 1291 / 891
Prompts
24
Vergleiche
2870
Jury-Mittelwert
82.3

Nach Kategorie

Programmieren49%
Kreativ54%
Faktenwissen18%
Mehrsprachig43%
Schlussfolgern53%
Gesundheitswesen22%
Platz 66OpenAI
41%±2

Siegquote

Elo 936

Gewonnen / verloren / unentschieden
681 / 1307 / 882
Prompts
24
Vergleiche
2870
Jury-Mittelwert
81.1

Nach Kategorie

Programmieren63%
Kreativ30%
Faktenwissen21%
Mehrsprachig47%
Schlussfolgern33%
Gesundheitswesen20%
Platz 66OpenAI
40%±2

Siegquote

Elo 933

Gewonnen / verloren / unentschieden
466 / 977 / 877
Prompts
20
Vergleiche
2320
Jury-Mittelwert
59.1

Nach Kategorie

Programmieren56%
Kreativ3%
Faktenwissen24%
Mehrsprachig37%
Schlussfolgern58%
Platz 67OVH AI Endpoints (GRA)
39%±2

Siegquote

Elo 922

Gewonnen / verloren / unentschieden
559 / 1195 / 781
Prompts
20
Vergleiche
2535
Jury-Mittelwert
79.8

Nach Kategorie

Programmieren50%
Kreativ45%
Faktenwissen31%
Mehrsprachig25%
Schlussfolgern49%
Platz 68Z.ai (GLM / Zhipu)
38%±2

Siegquote

Elo 912

Gewonnen / verloren / unentschieden
358 / 847 / 611
Prompts
14
Vergleiche
1816
Jury-Mittelwert
54.5

Nach Kategorie

Programmieren43%
Kreativ31%
Faktenwissen44%
Schlussfolgern24%
Platz 68Z.ai (GLM / Zhipu)
37%±2

Siegquote

Elo 909

GLM-5.2
Tier A
Gewonnen / verloren / unentschieden
367 / 846 / 538
Prompts
14
Vergleiche
1751
Jury-Mittelwert
54.0

Nach Kategorie

Programmieren50%
Kreativ4%
Faktenwissen42%
Schlussfolgern20%
Platz 70Z.ai (GLM / Zhipu)
37%±2

Siegquote

Elo 907

Gewonnen / verloren / unentschieden
367 / 881 / 578
Prompts
14
Vergleiche
1826
Jury-Mittelwert
64.5

Nach Kategorie

Programmieren50%
Kreativ46%
Faktenwissen31%
Schlussfolgern15%
Platz 71Z.ai (GLM / Zhipu)
37%±2

Siegquote

Elo 904

GLM-5.1
Tier A
Gewonnen / verloren / unentschieden
375 / 831 / 412
Prompts
14
Vergleiche
1618
Jury-Mittelwert
69.1

Nach Kategorie

Programmieren32%
Kreativ13%
Faktenwissen50%
Schlussfolgern34%
Platz 73OVH AI Endpoints (GRA)
35%±2

Siegquote

Elo 890

Gewonnen / verloren / unentschieden
555 / 1438 / 676
Prompts
20
Vergleiche
2669
Jury-Mittelwert
75.9

Nach Kategorie

Programmieren42%
Kreativ10%
Faktenwissen29%
Mehrsprachig39%
Schlussfolgern36%
Platz 73Google Gemini
34%±2

Siegquote

Elo 887

Gewonnen / verloren / unentschieden
605 / 1574 / 691
Prompts
24
Vergleiche
2870
Jury-Mittelwert
63.9

Nach Kategorie

Programmieren32%
Kreativ31%
Faktenwissen49%
Mehrsprachig29%
Schlussfolgern28%
Gesundheitswesen9%
Platz 77Z.ai (GLM / Zhipu)
31%±2

Siegquote

Elo 864

Gewonnen / verloren / unentschieden
303 / 941 / 449
Prompts
14
Vergleiche
1693
Jury-Mittelwert
54.4

Nach Kategorie

Programmieren50%
Kreativ8%
Faktenwissen39%
Schlussfolgern6%
Platz 77Z.ai (GLM / Zhipu)
31%±2

Siegquote

Elo 862

GLM-4.6
Tier A
Gewonnen / verloren / unentschieden
303 / 974 / 463
Prompts
13
Vergleiche
1740
Jury-Mittelwert
55.8

Nach Kategorie

Programmieren46%
Kreativ1%
Faktenwissen37%
Schlussfolgern16%
Platz 78OpenAI
30%±2

Siegquote

Elo 856

Gewonnen / verloren / unentschieden
268 / 990 / 568
Prompts
18
Vergleiche
1826
Jury-Mittelwert
39.6

Nach Kategorie

Programmieren27%
Kreativ7%
Faktenwissen48%
Mehrsprachig27%
Schlussfolgern21%
Platz 79OVH AI Endpoints (GRA)
28%±2

Siegquote

Elo 835

Gewonnen / verloren / unentschieden
476 / 1684 / 509
Prompts
20
Vergleiche
2669
Jury-Mittelwert
71.7

Nach Kategorie

Programmieren35%
Kreativ11%
Faktenwissen27%
Mehrsprachig27%
Schlussfolgern24%
Platz 81Z.ai (GLM / Zhipu)
26%±2

Siegquote

Elo 818

Gewonnen / verloren / unentschieden
230 / 1025 / 421
Prompts
14
Vergleiche
1676
Jury-Mittelwert
46.4

Nach Kategorie

Programmieren43%
Kreativ4%
Faktenwissen29%
Schlussfolgern5%
Platz 82Google Gemini
25%±2

Siegquote

Elo 812

Gewonnen / verloren / unentschieden
418 / 1752 / 499
Prompts
20
Vergleiche
2669
Jury-Mittelwert
50.5

Nach Kategorie

Programmieren9%
Kreativ48%
Faktenwissen43%
Mehrsprachig25%
Schlussfolgern10%
Platz 83OpenAI
24%±2

Siegquote

Elo 799

Gewonnen / verloren / unentschieden
219 / 1207 / 501
Prompts
20
Vergleiche
1927
Jury-Mittelwert
38.0

Nach Kategorie

Programmieren18%
Kreativ4%
Faktenwissen50%
Mehrsprachig18%
Schlussfolgern10%
Platz 83Google Gemini
23%±2

Siegquote

Elo 792

Gewonnen / verloren / unentschieden
192 / 915 / 292
Prompts
18
Vergleiche
1399
Jury-Mittelwert
41.4

Nach Kategorie

Programmieren19%
Kreativ14%
Faktenwissen44%
Mehrsprachig4%
Schlussfolgern3%
Gesundheitswesen54%
Platz 83OVH AI Endpoints (GRA)
23%±2

Siegquote

Elo 790

Gewonnen / verloren / unentschieden
255 / 1313 / 428
Prompts
19
Vergleiche
1996
Jury-Mittelwert
43.4

Nach Kategorie

Programmieren42%
Kreativ6%
Faktenwissen6%
Mehrsprachig28%
Schlussfolgern5%
Platz 83OVH AI Endpoints (GRA)
23%±2

Siegquote

Elo 789

Qwen3-32B
Tier B
Gewonnen / verloren / unentschieden
440 / 1893 / 336
Prompts
20
Vergleiche
2669
Jury-Mittelwert
75.8

Nach Kategorie

Programmieren18%
Kreativ14%
Faktenwissen21%
Mehrsprachig27%
Schlussfolgern24%
Platz 83Google Gemini
22%±2

Siegquote

Elo 780

Gewonnen / verloren / unentschieden
250 / 1275 / 353
Prompts
24
Vergleiche
1878
Jury-Mittelwert
44.1

Nach Kategorie

Programmieren4%
Kreativ38%
Faktenwissen42%
Mehrsprachig19%
Schlussfolgern13%
Gesundheitswesen3%
Platz 85OVH AI Endpoints (GRA)
21%±2

Siegquote

Elo 770

Gewonnen / verloren / unentschieden
211 / 1343 / 442
Prompts
19
Vergleiche
1996
Jury-Mittelwert
44.1

Nach Kategorie

Programmieren36%
Kreativ5%
Faktenwissen11%
Mehrsprachig24%
Schlussfolgern3%
Platz 85Google Gemini
21%±2

Siegquote

Elo 767

Gewonnen / verloren / unentschieden
404 / 2080 / 386
Prompts
24
Vergleiche
2870
Jury-Mittelwert
47.4

Nach Kategorie

Programmieren5%
Kreativ51%
Faktenwissen43%
Mehrsprachig16%
Schlussfolgern7%
Gesundheitswesen5%
Platz 86Google Gemini
20%±2

Siegquote

Elo 761

Gewonnen / verloren / unentschieden
371 / 2077 / 422
Prompts
24
Vergleiche
2870
Jury-Mittelwert
43.9

Nach Kategorie

Programmieren4%
Kreativ23%
Faktenwissen49%
Mehrsprachig17%
Schlussfolgern7%
Gesundheitswesen2%
Platz 92Google Gemini
17%±2

Siegquote

Elo 726

Gewonnen / verloren / unentschieden
182 / 1437 / 345
Prompts
24
Vergleiche
1964
Jury-Mittelwert
30.7

Nach Kategorie

Programmieren17%
Kreativ3%
Faktenwissen34%
Mehrsprachig8%
Schlussfolgern3%
Gesundheitswesen54%
Platz 93Google Gemini
14%±1

Siegquote

Elo 687

Gewonnen / verloren / unentschieden
295 / 2327 / 248
Prompts
24
Vergleiche
2870
Jury-Mittelwert
36.6

Nach Kategorie

Programmieren3%
Kreativ24%
Faktenwissen25%
Mehrsprachig11%
Schlussfolgern10%
Gesundheitswesen2%

94 Modelle eingestuft aus 117.970 paarweisen Vergleichen über 24 Prompts.

Vorläufig

Zu wenig Datenlage für eine Platzierung: mindestens 5 Prompts und 30 Vergleiche nötig.

VorläufigZ.ai (GLM / Zhipu)
1%±1

Siegquote

Elo 155

CogView-4
Tier B
Gewonnen / verloren / unentschieden
0 / 361 / 6
Prompts
4
Vergleiche
367
Jury-Mittelwert
0.0

Nach Kategorie

Programmieren1%
Kreativ<1% · dünn