Skip to content

Benchmarks

Intelligence test

Model quality scored 0–100 by an impartial judge LLM (Claude Sonnet 4.6, blind). Six categories: reasoning, coding, creativity, factual accuracy, instruction-following, and safety.

#1Anthropic
100
Reasoning95
Coding90
Factual100
#2Anthropic
100
Reasoning95
Coding90
Factual100
#3Anthropic
100
Reasoning95
Coding90
Factual100
#4Anthropic
100
Reasoning95
Coding90
Factual100
#5Anthropic
100
Reasoning95
Coding90
Factual100
#6Anthropic
100
Reasoning95
Coding90
Factual100
#7Anthropic
100
Reasoning95
Coding90
Factual100
#8OpenAI
100
Reasoning95
Coding90
Factual100
#9OpenAI
100
Reasoning95
Coding90
Factual100
#10OpenAI
100
Reasoning95
Coding90
Factual100
#11OpenAI
100
gpt-4
Tier C
Reasoning95
Coding90
Factual100
#12OpenAI
100
Reasoning95
Coding90
Factual100
#13OpenAI
100
Reasoning95
Coding90
Factual100
#14OpenAI
100
Reasoning95
Coding90
Factual100
#15OpenAI
100
gpt-4o
Tier C
Reasoning95
Coding90
Factual100
#16OpenAI
100
Reasoning95
Coding90
Factual100
#17OpenAI
100
Reasoning95
Coding90
Factual100
#18OpenAI
100
Reasoning95
Coding90
Factual100
#19OpenAI
100
Reasoning95
Coding90
Factual100
#20OpenAI
100
Reasoning95
Coding90
Factual100
#21OpenAI
100
o1
Tier C
Reasoning95
Coding90
Factual100
#22OpenAI
100
o3-mini
Tier C
Reasoning95
Coding90
Factual100
#23OpenAI
100
Reasoning95
Coding90
Factual100
#24OpenAI
100
Reasoning95
Coding90
Factual100
#25OpenAI
100
Reasoning95
Coding90
Factual100
#26OpenAI
100
Reasoning95
Coding90
Factual100
#27OpenAI
100
Reasoning95
Coding90
Factual100
#28OpenAI
100
o3
Tier C
Reasoning95
Coding90
Factual100
#29OpenAI
100
o4-mini
Tier C
Reasoning95
Coding90
Factual100
#30OpenAI
100
Reasoning95
Coding90
Factual100
#31OpenAI
100
gpt-4.1
Tier B
Reasoning95
Coding90
Factual100
#32OpenAI
100
Reasoning95
Coding90
Factual100
#33OpenAI
100
Reasoning95
Coding90
Factual100
#34OpenAI
100
Reasoning95
Coding90
Factual100
#35OpenAI
100
Reasoning95
Coding90
Factual100
#36OpenAI
100
Reasoning95
Coding90
Factual100
#37OpenAI
100
gpt-5
Tier C
Reasoning95
Coding90
Factual100
#38OpenAI
100
Reasoning95
Coding90
Factual100
#39OpenAI
100
Reasoning95
Coding90
Factual100
#40OpenAI
100
Reasoning95
Coding90
Factual100
#41OpenAI
100
Reasoning95
Coding90
Factual100
#42OpenAI
100
Reasoning95
Coding90
Factual100
#43OpenAI
100
Reasoning95
Coding90
Factual100
#44OpenAI
100
gpt-5.1
Tier B
Reasoning95
Coding90
Factual100
#45OpenAI
100
Reasoning95
Coding90
Factual100
#46OpenAI
100
gpt-5.2
Tier B
Reasoning95
Coding90
Factual100
#47OpenAI
100
Reasoning95
Coding90
Factual100
#48OpenAI
100
Reasoning95
Coding90
Factual100
#49OpenAI
100
Reasoning95
Coding90
Factual100
#50OpenAI
100
Reasoning95
Coding90
Factual100
#51OpenAI
100
Reasoning95
Coding90
Factual100
#52OpenAI
100
gpt-5.4
Tier A
Reasoning95
Coding90
Factual100
#53OpenAI
100
Reasoning95
Coding90
Factual100
#54OpenAI
100
Reasoning95
Coding90
Factual100
#55OpenAI
100
Reasoning95
Coding90
Factual100
#56OpenAI
100
Reasoning95
Coding90
Factual100
#57OpenAI
100
gpt-5.5
Tier C
Reasoning95
Coding90
Factual100
#58OpenAI
100
Reasoning95
Coding90
Factual100
#59Google Gemini
100
Reasoning95
Coding90
Factual100
#60Google Gemini
100
Reasoning95
Coding90
Factual100
#61OVH AI Endpoints (GRA)
100
Reasoning95
Coding90
Factual100
#62OVH AI Endpoints (GRA)
100
Reasoning95
Coding90
Factual100
#63OVH AI Endpoints (GRA)
100
Reasoning95
Coding90
Factual100
#64OVH AI Endpoints (GRA)
100
Reasoning95
Coding90
Factual100
#65OVH AI Endpoints (GRA)
100
Reasoning95
Coding90
Factual100
#66OVH AI Endpoints (GRA)
100
Reasoning95
Coding90
Factual100
#67OVH AI Endpoints (GRA)
100
Reasoning95
Coding90
Factual100
#68Google Gemini
100
Reasoning95
Coding90
Factual100
#69Anthropic
100
Reasoning95
Coding90
Factual100
#70Z.ai (GLM / Zhipu)
100
GLM-5.2
Tier A
Reasoning95
Coding90
Factual100
#71Z.ai (GLM / Zhipu)
100
GLM-5
Tier A
Reasoning95
Coding90
Factual100
#72Z.ai (GLM / Zhipu)
100
Reasoning95
Coding90
Factual100
#73Z.ai (GLM / Zhipu)
100
GLM-4.7
Tier A
Reasoning95
Coding90
Factual100
#74Z.ai (GLM / Zhipu)
100
GLM-4.6
Tier A
Reasoning95
Coding90
Factual100
#75Z.ai (GLM / Zhipu)
100
GLM-4.5
Tier A
Reasoning95
Coding90
Factual100
#76Z.ai (GLM / Zhipu)
100
Reasoning95
Coding90
Factual100
#77Z.ai (GLM / Zhipu)
100
Reasoning95
Coding90
Factual100
#78Z.ai (GLM / Zhipu)
100
Reasoning95
Coding90
Factual100
#79OpenAI
98
Reasoning93
Coding88
Factual98
#80OpenAI
98
Reasoning93
Coding88
Factual98
#81Google Gemini
98
Reasoning93
Coding88
Factual98
#82OVH AI Endpoints (GRA)
98
Reasoning93
Coding88
Factual98
#83Google Gemini
97
Reasoning92
Coding87
Factual97
#84Google Gemini
95
Reasoning90
Coding86
Factual95
#85OVH AI Endpoints (GRA)
95
Reasoning90
Coding86
Factual95
#86Google Gemini
93
Reasoning88
Coding84
Factual93
#87OVH AI Endpoints (GRA)
93
Reasoning88
Coding84
Factual93
#88Google Gemini
91
Reasoning86
Coding82
Factual91
#89Google Gemini
90
Reasoning86
Coding81
Factual90
#90Google Gemini
90
Reasoning86
Coding81
Factual90
#91OVH AI Endpoints (GRA)
87
Reasoning83
Coding78
Factual87
#92Google Gemini
35
Reasoning33
Coding32
Factual35
#93Google Gemini
5
Reasoning5
Coding5
Factual5
#94OpenAI
0
Reasoning0
Coding0
Factual0
#95OpenAI
0
Reasoning0
Coding0
Factual0
#96OpenAI
0
Reasoning0
Coding0
Factual0
#97Google Gemini
0
Reasoning0
Coding0
Factual0
#98Google Gemini
0
Reasoning0
Coding0
Factual0
#99Google Gemini
0
Reasoning0
Coding0
Factual0
#100Google Gemini
0
Reasoning0
Coding0
Factual0
#101Z.ai (GLM / Zhipu)
0
GLM-5.1
Tier A
Reasoning0
Coding0
Factual0
#102Z.ai (GLM / Zhipu)
0
CogView-4
Tier B
Reasoning0
Coding0
Factual0

102 models scored · category breakdown estimated (full per-category scoring in Q3 2026)