Zum Inhalt

Benchmarks

Leaderboard

Jedes aktive Textmodell, das wir erreichen können — mit der Antwortzeit und der Trefferquote im direkten Vergleich. Nichts wird versteckt: Ein ungemessenes Modell bekommt trotzdem eine Zeile, und die Zeile sagt, warum.

Normalfall
Wie lange eine normale Antwort dauert. Die Hälfte der Aufrufe kam schneller zurück, die Hälfte langsamer — das ist also, was bei einer gewöhnlichen Anfrage zu erwarten ist.
Langsamfall
Wie schlimm es an einem schlechten Tag wird. Etwa jeder zwanzigste Aufruf ist langsamer als das. Ein Modell mit niedrigem Normalfall, aber hohem Langsamfall ist schnell — bis es das nicht mehr ist.
Siegquote
Von 100 direkten Vergleichen gegen ein durchschnittliches Modell dieser Tabelle: wie viele dieses Modell gewinnt. 50 ist Durchschnitt, höher ist besser. Errechnet aus jedem bewerteten Vergleich, nicht aus einer Einzelnote.

104 von 109 Modellen vollständig gemessen · 0 einmal gestoppt · 0 warten auf den ersten Lauf · 5 können wir nicht messen.

Filter:
#
1Mistral-Nemo-Instruct-2407C90 ms
2Mistral-Small-3.2-24B-Instruct-2506B115 ms
3Meta-Llama-3_3-70B-InstructB121 ms
4Mistral-7B-Instruct-v0.3C122 ms
5Qwen2.5-VL-72B-InstructB138 ms
6NVIDIA Nemotron Super 49B v1.5A173 ms
7Nous Hermes 3 70BA193 ms
8Llama 3.3 70B InstructA219 ms
9Cohere Command-AA242 ms
10gpt-oss-20bC248 ms
11gpt-oss-120bC254 ms
12Qwen3.5-397B-A17BA254 ms
13Gemini 2.5 Flash-LiteB371 ms
14Gemini 2.5 FlashA415 ms
15Qwen 2.5 VL 72B InstructA418 ms
16Llama 4 ScoutA452 ms
17Qwen3-32BB465 ms
18gpt-4.1B468 ms
19Gemini Flash-Lite LatestC469 ms
20gpt-4o-mini-2024-07-18C489 ms
21gpt-4.1-miniC493 ms
22gpt-4o-2024-05-13C493 ms
23Qwen3.5-9BB502 ms
24gpt-4.1-nano-2025-04-14C506 ms
25Qwen3-Coder-30B-A3B-InstructB506 ms
26gpt-4C509 ms
27gpt-4.1-nanoC509 ms
28gpt-4.1-2025-04-14C515 ms
29gpt-4o-miniC522 ms
30gpt-4o-2024-11-20C524 ms
31gpt-5.1B535 ms
32Gemini 3.1 Flash LiteB540 ms
33gpt-4.1-mini-2025-04-14C545 ms
34o3-mini-2025-01-31C550 ms
35gpt-5.4-nano-2026-03-17A555 ms
36Qwen 3.7 MaxA565 ms
37gpt-5-mini-2025-08-07B572 ms
38gpt-4o-2024-08-06C575 ms
39gpt-4oC585 ms
40o3-miniC599 ms
41gpt-3.5-turbo-1106C611 ms
42gpt-5-nanoC612 ms
43o4-mini-2025-04-16B616 ms
44gpt-5.4-miniA621 ms
45gpt-5.2-2025-12-11B626 ms
46gpt-5-nano-2025-08-07B635 ms
47Qwen 3.6 PlusA637 ms
48gpt-5.4-nanoC641 ms
49gpt-5.1-2025-11-13B643 ms
50o4-miniC646 ms
51Claude Haiku 4.5A672 ms
52gpt-5-miniC682 ms
53gpt-5-2025-08-07B687 ms
54o3-2025-04-16B689 ms
55gpt-4-0613C692 ms
56gpt-3.5-turbo-0125C694 ms
57gpt-5.4A701 ms
58gpt-3.5-turboC709 ms
59gpt-5.4-mini-2026-03-17A711 ms
60gpt-5C724 ms
61o1C734 ms
62gpt-3.5-turbo-16kC757 ms
63o3C770 ms
64MiniMax M2.5A773 ms
65o1-2024-12-17C776 ms
66gpt-5.4-2026-03-05B800 ms
67Claude Opus 4.5B820 ms
68Gemini 3.5 FlashA831 ms
69Gemini Flash LatestB848 ms
70gpt-4-turboC883 ms
71gpt-5.2B894 ms
72Qwen3.7 MaxA906 ms
73gpt-5.5C959 ms
74Gemini 3 Flash PreviewC1.0 s
75Claude Sonnet 4.5B1.1 s
76Claude Opus 4.8A1.1 s
77Claude Opus 4.7B1.1 s
78gpt-5.5-2026-04-23A1.1 s
79Llama 4 MaverickA1.1 s
80Claude Sonnet 5A1.2 s
81Qwen3.7 PlusB1.2 s
82Claude Sonnet 4.6A1.3 s
83Gemini 3.1 Pro Preview Custom ToolsC1.3 s
84DeepSeek v3.2A1.4 s
85gpt-4-turbo-2024-04-09C1.4 s
86gpt-5-search-apiC1.4 s
87Claude Opus 5A1.4 s
88gpt-5-search-api-2025-10-14B1.5 s
89Gemini 2.5 ProA1.5 s
90DeepSeek v4 ProA1.6 s
91GLM-4.5V (vision)A1.6 s
92Gemini Pro LatestC1.9 s
93Claude Opus 4.6B2.0 s
94Gemini 3.1 Pro PreviewC2.0 s
95GLM-4.5 AirB2.0 s
96GLM-5A2.1 s
97GLM-5.2A2.3 s
98GLM-4.6V (vision)A2.7 s
99GLM-4.7A3.3 s
100GLM-4.5A3.3 s
101Claude Fable 5A3.4 s
102GLM-5.1A4.8 s
103GLM-5 TurboB6.2 s
104GLM-4.6A9.9 s
·Deep Research Max Preview (Apr-21-2026)BNicht messbar — antwortet über eine andere API
·Deep Research Preview (Apr-21-2026)BNicht messbar — antwortet über eine andere API
·Deep Research Pro Preview (Dec-12-2025)BNicht messbar — antwortet über eine andere API
·Gemini 2.5 Computer Use Preview 10-2025BNicht messbar — antwortet über eine andere API
·gpt-5.6-terraNicht messbar — keine Messung für diesen Anbieter

109 von 109 Modellen · Spalte anklicken zum Sortieren

„Nicht messbar“ heißt: Das Modell antwortet nicht über die Chat-API, die wir stoppen, oder sein Anbieter nutzt ein Protokoll, das unsere Messung noch nicht spricht. Warten hilft hier nicht.

Schnell (unter 500 ms)
Mittel (500–1000 ms)
Langsam (über 1000 ms)
Viermal täglich gemessen (02:00, 08:00, 14:00, 20:00 UTC) aus Amsterdam.