Naar inhoud

Benchmarks

Leaderboard

Elk actief tekstmodel dat we kunnen bereiken, met hoe lang het duurt voor een antwoord en hoe vaak het een directe vergelijking wint. Niets wordt verborgen: een model dat we niet gemeten hebben krijgt gewoon een rij, en die rij zegt waarom.

Normaal
Hoe lang een gewoon antwoord duurt. De helft van de aanroepen kwam sneller terug, de helft trager — dit is dus wat je bij een normale vraag mag verwachten.
Traagste geval
Hoe erg het wordt op een slechte dag. Ongeveer één op de twintig aanroepen is trager dan dit. Een model met een lage normale tijd maar een hoog traagste geval is snel tot het dat niet is.
Winkans
Van 100 directe vergelijkingen met een gemiddeld model op dit bord: hoeveel er gewonnen worden. 50 is gemiddeld, hoger is beter. Berekend uit élke beoordeelde vergelijking, niet uit één losse score.

104 van 109 modellen volledig gemeten · 0 één keer geklokt · 0 wacht op een eerste run · 5 kunnen we niet meten.

Filter:
#
1Mistral-Nemo-Instruct-2407C105 ms
2Mistral-Small-3.2-24B-Instruct-2506B115 ms
3Meta-Llama-3_3-70B-InstructB120 ms
4Mistral-7B-Instruct-v0.3C129 ms
5Qwen2.5-VL-72B-InstructB159 ms
6NVIDIA Nemotron Super 49B v1.5A173 ms
7Qwen3.5-397B-A17BA184 ms
8Cohere Command-AA279 ms
9gpt-oss-20bC282 ms
10Llama 4 ScoutA400 ms
11Gemini 2.5 FlashA417 ms
12Gemini 2.5 Flash-LiteB417 ms
13Qwen 2.5 VL 72B InstructA418 ms
14Nous Hermes 3 70BA425 ms
15Llama 3.3 70B InstructA430 ms
16Qwen3-32BB432 ms
17Qwen3-Coder-30B-A3B-InstructB476 ms
18gpt-4.1B482 ms
19gpt-oss-120bC490 ms
20gpt-4o-2024-05-13C505 ms
21gpt-3.5-turbo-16kC513 ms
22gpt-4.1-miniC519 ms
23Qwen3.5-9BB519 ms
24Gemini 3.1 Flash LiteB530 ms
25gpt-4o-2024-11-20C532 ms
26gpt-4o-mini-2024-07-18C535 ms
27gpt-5.4-nano-2026-03-17A539 ms
28gpt-5.4-nanoC553 ms
29Qwen 3.6 PlusA571 ms
30gpt-4.1-2025-04-14C579 ms
31gpt-4o-miniC581 ms
32Claude Haiku 4.5A587 ms
33o3-miniC587 ms
34gpt-5.4-mini-2026-03-17A598 ms
35gpt-4.1-nanoC610 ms
36gpt-4o-2024-08-06C615 ms
37gpt-4.1-mini-2025-04-14C632 ms
38o3-mini-2025-01-31C646 ms
39gpt-4.1-nano-2025-04-14C648 ms
40o3C657 ms
41gpt-5.4-2026-03-05B659 ms
42gpt-5.1-2025-11-13B660 ms
43gpt-5.1B672 ms
44gpt-4oC677 ms
45gpt-5-nano-2025-08-07B689 ms
46gpt-4C700 ms
47MiniMax M2.5A703 ms
48o1C704 ms
49Qwen 3.7 MaxA705 ms
50gpt-5-2025-08-07B728 ms
51gpt-3.5-turboC729 ms
52o4-mini-2025-04-16B729 ms
53gpt-5-nanoC730 ms
54gpt-5-miniC746 ms
55gpt-5.4-miniA747 ms
56DeepSeek v4 ProA753 ms
57gpt-5-mini-2025-08-07B768 ms
58gpt-5C770 ms
59gpt-5.4A782 ms
60o3-2025-04-16B789 ms
61gpt-3.5-turbo-0125C856 ms
62gpt-5.2-2025-12-11B858 ms
63Claude Opus 4.5B899 ms
64o4-miniC899 ms
65Llama 4 MaverickA934 ms
66gpt-5.2B971 ms
67o1-2024-12-17C971 ms
68Qwen3.7 PlusB971 ms
69Qwen3.7 MaxA999 ms
70GLM-4.6A1.0 s
71Gemini 3 Flash PreviewC1.0 s
72gpt-4-turboC1.0 s
73Gemini Flash-Lite LatestC1.1 s
74Claude Opus 4.8A1.1 s
75Claude Sonnet 4.6A1.1 s
76Claude Sonnet 5A1.2 s
77Claude Opus 4.7B1.2 s
78gpt-4-0613C1.2 s
79DeepSeek v3.2A1.2 s
80gpt-3.5-turbo-1106C1.2 s
81Gemini 2.5 ProA1.3 s
82Gemini 3.1 Pro Preview Custom ToolsC1.3 s
83GLM-4.6V (vision)A1.3 s
84gpt-5.5C1.3 s
85Claude Sonnet 4.5B1.4 s
86GLM-4.5V (vision)A1.4 s
87gpt-5-search-apiC1.5 s
88Claude Opus 5A1.5 s
89gpt-5.5-2026-04-23A1.6 s
90gpt-4-turbo-2024-04-09C1.7 s
91gpt-5-search-api-2025-10-14B1.7 s
92Gemini 3.1 Pro PreviewC2.1 s
93Gemini Pro LatestC2.1 s
94GLM-5A2.2 s
95Claude Opus 4.6B2.7 s
96GLM-5.2A2.9 s
97GLM-4.5A3.3 s
98Claude Fable 5A3.4 s
99GLM-4.7A4.2 s
100GLM-4.5 AirB4.5 s
101Gemini 3.5 FlashA4.5 s
102GLM-5 TurboB6.4 s
103Gemini Flash LatestB6.6 s
104GLM-5.1A7.7 s
·Deep Research Max Preview (Apr-21-2026)BNiet te meten — antwoordt via een andere API
·Deep Research Preview (Apr-21-2026)BNiet te meten — antwoordt via een andere API
·Deep Research Pro Preview (Dec-12-2025)BNiet te meten — antwoordt via een andere API
·Gemini 2.5 Computer Use Preview 10-2025BNiet te meten — antwoordt via een andere API
·gpt-5.6-terraNiet te meten — geen meting voor deze aanbieder

109 van 109 modellen · klik op een kolom om te sorteren

“Niet te meten” betekent dat het model niet antwoordt via de chat-API die wij klokken, of dat de aanbieder een protocol gebruikt dat onze meting nog niet spreekt. Wachten helpt hier niet.

Snel (onder 500 ms)
Gemiddeld (500–1000 ms)
Traag (boven 1000 ms)
Vier keer per dag gemeten (02:00, 08:00, 14:00, 20:00 UTC) vanuit Amsterdam.