Skip to content

Benchmarks

Intelligence test

Model quality scored 0–100 by an impartial judge LLM (Claude Sonnet 4.6, blind). Six categories: reasoning, coding, creativity, factual accuracy, instruction-following, and safety.

#1Anthropic
100
Reasoning95
Coding90
Factual100
#2Anthropic
100
Reasoning95
Coding90
Factual100
#3Anthropic
100
Reasoning95
Coding90
Factual100
#4Anthropic
100
Reasoning95
Coding90
Factual100
#5Anthropic
100
Reasoning95
Coding90
Factual100
#6Anthropic
100
Reasoning95
Coding90
Factual100
#7OpenAI
100
Reasoning95
Coding90
Factual100
#8OpenAI
100
Reasoning95
Coding90
Factual100
#9OpenAI
100
gpt-4-0613
Tier Carchived
Reasoning95
Coding90
Factual100
#10OpenAI
100
gpt-4
Tier C
Reasoning95
Coding90
Factual100
#11OpenAI
100
gpt-3.5-turbo-1106
Tier Carchived
Reasoning95
Coding90
Factual100
#12OpenAI
100
Reasoning95
Coding90
Factual100
#13OpenAI
100
Reasoning95
Coding90
Factual100
#14OpenAI
100
Reasoning95
Coding90
Factual100
#15OpenAI
100
gpt-4o
Tier C
Reasoning95
Coding90
Factual100
#16OpenAI
100
Reasoning95
Coding90
Factual100
#17OpenAI
100
Reasoning95
Coding90
Factual100
#18OpenAI
100
Reasoning95
Coding90
Factual100
#19OpenAI
100
Reasoning95
Coding90
Factual100
#20OpenAI
100
Reasoning95
Coding90
Factual100
#21OpenAI
100
o1
Tier C
Reasoning95
Coding90
Factual100
#22OpenAI
100
o3-mini
Tier C
Reasoning95
Coding90
Factual100
#23OpenAI
100
Reasoning95
Coding90
Factual100
#24OpenAI
100
Reasoning95
Coding90
Factual100
#25OpenAI
100
Reasoning95
Coding90
Factual100
#26OpenAI
100
Reasoning95
Coding90
Factual100
#27OpenAI
100
Reasoning95
Coding90
Factual100
#28OpenAI
100
o3
Tier C
Reasoning95
Coding90
Factual100
#29OpenAI
100
o4-mini
Tier C
Reasoning95
Coding90
Factual100
#30OpenAI
100
Reasoning95
Coding90
Factual100
#31OpenAI
100
gpt-4.1
Tier B
Reasoning95
Coding90
Factual100
#32OpenAI
100
Reasoning95
Coding90
Factual100
#33OpenAI
100
Reasoning95
Coding90
Factual100
#34OpenAI
100
Reasoning95
Coding90
Factual100
#35OpenAI
100
Reasoning95
Coding90
Factual100
#36OpenAI
100
Reasoning95
Coding90
Factual100
#37OpenAI
100
gpt-5
Tier C
Reasoning95
Coding90
Factual100
#38OpenAI
100
Reasoning95
Coding90
Factual100
#39OpenAI
100
Reasoning95
Coding90
Factual100
#40OpenAI
100
Reasoning95
Coding90
Factual100
#41OpenAI
100
Reasoning95
Coding90
Factual100
#42OpenAI
100
Reasoning95
Coding90
Factual100
#43OpenAI
100
gpt-5.1
Tier B
Reasoning95
Coding90
Factual100
#44OpenAI
100
Reasoning95
Coding90
Factual100
#45OpenAI
100
gpt-5.2
Tier B
Reasoning95
Coding90
Factual100
#46OpenAI
100
gpt-5.2-chat-latest
Tier Carchived
Reasoning95
Coding90
Factual100
#47OpenAI
100
Reasoning95
Coding90
Factual100
#48OpenAI
100
gpt-5.3-chat-latest
Tier Carchived
Reasoning95
Coding90
Factual100
#49OpenAI
100
Reasoning95
Coding90
Factual100
#50OpenAI
100
gpt-5.4
Tier A
Reasoning95
Coding90
Factual100
#51OpenAI
100
Reasoning95
Coding90
Factual100
#52OpenAI
100
Reasoning95
Coding90
Factual100
#53OpenAI
100
Reasoning95
Coding90
Factual100
#54OpenAI
100
Reasoning95
Coding90
Factual100
#55OpenAI
100
gpt-5.5
Tier C
Reasoning95
Coding90
Factual100
#56OpenAI
100
Reasoning95
Coding90
Factual100
#57Google Gemini
100
Reasoning95
Coding90
Factual100
#58Google Gemini
100
Reasoning95
Coding90
Factual100
#59OVH AI Endpoints (GRA)
100
Reasoning95
Coding90
Factual100
#60OVH AI Endpoints (GRA)
100
Reasoning95
Coding90
Factual100
#61OVH AI Endpoints (GRA)
100
Reasoning95
Coding90
Factual100
#62OVH AI Endpoints (GRA)
100
Reasoning95
Coding90
Factual100
#63OVH AI Endpoints (GRA)
100
Reasoning95
Coding90
Factual100
#64Google Gemini
100
Reasoning95
Coding90
Factual100
#65Anthropic
100
Reasoning95
Coding90
Factual100
#66Anthropic
100
Reasoning95
Coding90
Factual100
#67Z.ai (GLM / Zhipu)
100
GLM-5
Tier A
Reasoning95
Coding90
Factual100
#68Z.ai (GLM / Zhipu)
100
GLM-4.7
Tier A
Reasoning95
Coding90
Factual100
#69Z.ai (GLM / Zhipu)
100
GLM-4.5
Tier A
Reasoning95
Coding90
Factual100
#70Anthropic
100
Reasoning95
Coding90
Factual100
#71Anthropic
100
Reasoning95
Coding90
Factual100
#72OVH AI Endpoints (GRA)
99
Reasoning94
Coding89
Factual99
#73Google Gemini
97
Reasoning92
Coding87
Factual97
#74Google Gemini
97
Reasoning92
Coding87
Factual97
#75OVH AI Endpoints (GRA)
95
Qwen3-32B
Tier B
Reasoning90
Coding86
Factual95
#76OVH AI Endpoints (GRA)
93
Reasoning88
Coding84
Factual93
#77Google Gemini
91
Reasoning86
Coding82
Factual91
#78Z.ai (GLM / Zhipu)
78
GLM-5.2
Tier A
Reasoning74
Coding70
Factual78
#79OVH AI Endpoints (GRA)
61
Reasoning58
Coding55
Factual61
#80Google Gemini
50
Reasoning48
Coding45
Factual50
#81Google Gemini
45
Reasoning43
Coding41
Factual45
#82Z.ai (GLM / Zhipu)
45
Reasoning43
Coding41
Factual45
#83Google Gemini
40
Reasoning38
Coding36
Factual40
#84Google Gemini
40
Reasoning38
Coding36
Factual40
#85Google Gemini
5
Reasoning5
Coding5
Factual5
#86OpenAI
0
Reasoning0
Coding0
Factual0
#87OpenAI
0
Reasoning0
Coding0
Factual0
#88Google Gemini
0
Reasoning0
Coding0
Factual0
#89Google Gemini
0
Reasoning0
Coding0
Factual0
#90Google Gemini
0
Reasoning0
Coding0
Factual0
#91Google Gemini
0
Reasoning0
Coding0
Factual0
#92OVH AI Endpoints (GRA)
0
Reasoning0
Coding0
Factual0
#93OVH AI Endpoints (GRA)
0
Reasoning0
Coding0
Factual0
#94Z.ai (GLM / Zhipu)
0
GLM-5.1
Tier A
Reasoning0
Coding0
Factual0
#95Z.ai (GLM / Zhipu)
0
Reasoning0
Coding0
Factual0
#96Z.ai (GLM / Zhipu)
0
GLM-4.6
Tier A
Reasoning0
Coding0
Factual0
#97Z.ai (GLM / Zhipu)
0
Reasoning0
Coding0
Factual0
#98Z.ai (GLM / Zhipu)
0
Reasoning0
Coding0
Factual0
#99Z.ai (GLM / Zhipu)
0
CogView-4
Tier B
Reasoning0
Coding0
Factual0

99 models scored · category breakdown estimated (full per-category scoring in Q3 2026)