Benchmarks
Leaderboard
Every active text model we can reach, with how long it takes to answer and how often it wins a head-to-head. Nothing is hidden: a model we have not measured still gets a row, and the row says why.
- Typical
- How long a normal answer takes. Half of the calls came back faster than this, half slower — so it is what you should expect on an ordinary request.
- Slow case
- How bad it gets on an off day. Roughly one call in twenty is slower than this. A model with a low typical time but a high slow case is fast until it is not.
- Win rate
- Out of 100 head-to-head comparisons against an average model on this board, how many this one wins. 50 is average, higher is better. It is worked out from every judged comparison, not from a single score.
104 of 109 models fully measured · 0 timed once · 0 awaiting a first run · 5 we cannot measure.
Filter:
| # | |||||||
|---|---|---|---|---|---|---|---|
| 1 | Qwen3-Coder-30B-A3B-InstructB | OVH AI Endpoints (GRA) | B | 82 ms | 84 ms | 55% | 2026-09-14 |
| 2 | Meta-Llama-3_3-70B-InstructB | OVH AI Endpoints (GRA) | B | 136 ms | 138 ms | 57% | 2026-09-14 |
| 3 | Qwen2.5-VL-72B-InstructB | OVH AI Endpoints (GRA) | B | 145 ms | 394 ms | 53% | 2026-09-14 |
| 4 | Mistral-Nemo-Instruct-2407C | OVH AI Endpoints (GRA) | C | 158 ms | 190 ms | 35% | 2026-09-14 |
| 5 | NVIDIA Nemotron Super 49B v1.5A | OpenRouter | A | 173 ms | 199 ms | not compared | 2026-07-17 |
| 6 | Mistral-Small-3.2-24B-Instruct-2506B | OVH AI Endpoints (GRA) | B | 174 ms | 691 ms | 54% | 2026-09-14 |
| 7 | MiniMax M2.5A | OpenRouter | A | 175 ms | 204 ms | not compared | 2026-09-14 |
| 8 | Llama 4 ScoutA | OpenRouter | A | 202 ms | 210 ms | not compared | 2026-09-14 |
| 9 | gpt-oss-120bC | OVH AI Endpoints (GRA) | C | 209 ms | 359 ms | 62% | 2026-09-14 |
| 10 | Nous Hermes 3 70BA | OpenRouter | A | 212 ms | 635 ms | not compared | 2026-09-14 |
| 11 | Mistral-7B-Instruct-v0.3C | OVH AI Endpoints (GRA) | C | 228 ms | 784 ms | 28% | 2026-09-14 |
| 12 | gpt-oss-20bC | OVH AI Endpoints (GRA) | C | 273 ms | 311 ms | 39% | 2026-09-14 |
| 13 | Qwen3.5-397B-A17BA | OVH AI Endpoints (GRA) | A | 320 ms | 400 ms | 23% | 2026-09-14 |
| 14 | Cohere Command-AA | OpenRouter | A | 402 ms | 755 ms | not compared | 2026-09-14 |
| 15 | gpt-4.1-mini-2025-04-14C | OpenAI | C | 446 ms | 455 ms | 69% | 2026-09-14 |
| 16 | gpt-4.1-nanoC | OpenAI | C | 488 ms | 604 ms | 57% | 2026-09-14 |
| 17 | gpt-5.4-mini-2026-03-17A | OpenAI | A | 516 ms | 562 ms | 66% | 2026-09-14 |
| 18 | Gemini 2.5 FlashA | Google Gemini | A | 518 ms | 543 ms | 14% | 2026-09-14 |
| 19 | Gemini 2.5 Flash-LiteB | Google Gemini | B | 532 ms | 2.8 s | 49% | 2026-09-14 |
| 20 | Qwen3.5-9BB | OVH AI Endpoints (GRA) | B | 538 ms | 729 ms | 21% | 2026-09-14 |
| 21 | Gemini 3.1 Flash LiteB | Google Gemini | B | 542 ms | 671 ms | 61% | 2026-09-14 |
| 22 | o1-2024-12-17C | OpenAI | C | 543 ms | 911 ms | 62% | 2026-09-14 |
| 23 | gpt-4.1B | OpenAI | B | 544 ms | 620 ms | 69% | 2026-09-14 |
| 24 | gpt-4o-2024-05-13C | OpenAI | C | 544 ms | 633 ms | 64% | 2026-09-14 |
| 25 | gpt-5.4-miniA | OpenAI | A | 548 ms | 1.1 s | 68% | 2026-09-14 |
| 26 | Llama 4 MaverickA | OpenRouter | A | 548 ms | 653 ms | not compared | 2026-09-14 |
| 27 | Qwen3-32BB | OVH AI Endpoints (GRA) | B | 548 ms | 622 ms | 23% | 2026-09-14 |
| 28 | gpt-4.1-nano-2025-04-14C | OpenAI | C | 550 ms | 601 ms | 61% | 2026-09-14 |
| 29 | gpt-4o-mini-2024-07-18C | OpenAI | C | 554 ms | 593 ms | 57% | 2026-09-14 |
| 30 | Claude Haiku 4.5A | Anthropic | A | 561 ms | 577 ms | 55% | 2026-09-14 |
| 31 | Gemini Flash-Lite LatestC | Google Gemini | C | 562 ms | 587 ms | 64% | 2026-09-14 |
| 32 | Llama 3.3 70B InstructA | OpenRouter | A | 567 ms | 870 ms | not compared | 2026-09-14 |
| 33 | gpt-4o-miniC | OpenAI | C | 570 ms | 636 ms | 61% | 2026-09-14 |
| 34 | gpt-4.1-miniC | OpenAI | C | 572 ms | 882 ms | 73% | 2026-09-14 |
| 35 | o3-miniC | OpenAI | C | 579 ms | 619 ms | 51% | 2026-09-14 |
| 36 | Qwen 2.5 VL 72B InstructA | OpenRouter | A | 582 ms | 638 ms | not compared | 2026-09-14 |
| 37 | gpt-3.5-turbo-0125C | OpenAI | C | 590 ms | 777 ms | 43% | 2026-09-14 |
| 38 | gpt-5.1B | OpenAI | B | 613 ms | 705 ms | 73% | 2026-09-14 |
| 39 | gpt-4o-2024-11-20C | OpenAI | C | 617 ms | 1.4 s | 62% | 2026-09-14 |
| 40 | Qwen 3.6 PlusA | OpenRouter | A | 622 ms | 863 ms | not compared | 2026-09-14 |
| 41 | gpt-5.4A | OpenAI | A | 646 ms | 696 ms | 69% | 2026-09-14 |
| 42 | gpt-5.4-nanoC | OpenAI | C | 668 ms | 687 ms | 53% | 2026-09-14 |
| 43 | gpt-4.1-2025-04-14C | OpenAI | C | 669 ms | 816 ms | 70% | 2026-09-14 |
| 44 | gpt-4o-2024-08-06C | OpenAI | C | 691 ms | 1.7 s | 62% | 2026-09-14 |
| 45 | Qwen 3.7 MaxA | OpenRouter | A | 742 ms | 837 ms | not compared | 2026-09-14 |
| 46 | gpt-5-nanoC | OpenAI | C | 755 ms | 777 ms | 24% | 2026-09-14 |
| 47 | o3-2025-04-16B | OpenAI | B | 765 ms | 1.1 s | 60% | 2026-09-14 |
| 48 | gpt-5.4-nano-2026-03-17A | OpenAI | A | 776 ms | 934 ms | 59% | 2026-09-14 |
| 49 | Claude Sonnet 4.5B | Anthropic | B | 782 ms | 838 ms | 60% | 2026-09-14 |
| 50 | o3C | OpenAI | C | 822 ms | not measured | 61% | 2026-09-14 |
| 51 | Gemini 3 Flash PreviewC | Google Gemini | C | 834 ms | 859 ms | 42% | 2026-09-14 |
| 52 | Claude Opus 4.5B | Anthropic | B | 845 ms | 1.8 s | 63% | 2026-09-14 |
| 53 | Claude Opus 4.7B | Anthropic | B | 846 ms | 861 ms | 64% | 2026-09-14 |
| 54 | gpt-4-turboC | OpenAI | C | 849 ms | 966 ms | 59% | 2026-09-14 |
| 55 | gpt-5.4-2026-03-05B | OpenAI | B | 850 ms | 1.3 s | 68% | 2026-09-14 |
| 56 | gpt-5.2-2025-12-11B | OpenAI | B | 851 ms | 1.1 s | 70% | 2026-09-14 |
| 57 | gpt-5.1-2025-11-13B | OpenAI | B | 853 ms | 914 ms | 67% | 2026-09-14 |
| 58 | gpt-3.5-turbo-16kC | OpenAI | C | 884 ms | 1.6 s | 41% | 2026-09-14 |
| 59 | gpt-5-mini-2025-08-07B | OpenAI | B | 893 ms | 1.3 s | 47% | 2026-09-14 |
| 60 | gpt-5-2025-08-07B | OpenAI | B | 919 ms | 2.8 s | 40% | 2026-09-14 |
| 61 | Gemini 3.5 FlashA | Google Gemini | A | 925 ms | 1.4 s | 25% | 2026-09-14 |
| 62 | gpt-4-0613C | OpenAI | C | 925 ms | 1.4 s | 47% | 2026-09-14 |
| 63 | o4-miniC | OpenAI | C | 934 ms | 1.0 s | 60% | 2026-09-14 |
| 64 | o4-mini-2025-04-16B | OpenAI | B | 960 ms | 1.1 s | 60% | 2026-09-14 |
| 65 | gpt-4-turbo-2024-04-09C | OpenAI | C | 972 ms | 1.4 s | 60% | 2026-09-14 |
| 66 | DeepSeek v4 ProA | OpenRouter | A | 973 ms | 2.0 s | not compared | 2026-09-14 |
| 67 | Claude Opus 4.8A | Anthropic | A | 987 ms | 1.1 s | 58% | 2026-09-14 |
| 68 | o3-mini-2025-01-31C | OpenAI | C | 988 ms | 3.2 s | 59% | 2026-09-14 |
| 69 | gpt-4C | OpenAI | C | 993 ms | 1.0 s | 51% | 2026-09-14 |
| 70 | o1C | OpenAI | C | 1.0 s | 2.7 s | 63% | 2026-09-14 |
| 71 | Claude Sonnet 5A | Anthropic | A | 1.1 s | 1.4 s | 60% | 2026-09-14 |
| 72 | Qwen3.7 MaxA | Alibaba Cloud Qwen (DashScope Intl) | A | 1.1 s | 1.2 s | not compared | 2026-09-14 |
| 73 | Gemini Flash LatestB | Google Gemini | B | 1.1 s | 2.6 s | 34% | 2026-09-14 |
| 74 | Qwen3.7 PlusB | Alibaba Cloud Qwen (DashScope Intl) | B | 1.1 s | 1.3 s | not compared | 2026-09-14 |
| 75 | gpt-5C | OpenAI | C | 1.2 s | 1.2 s | 42% | 2026-09-14 |
| 76 | gpt-5.5C | OpenAI | C | 1.2 s | 1.7 s | 70% | 2026-09-14 |
| 77 | gpt-5-miniC | OpenAI | C | 1.2 s | 1.6 s | 50% | 2026-09-14 |
| 78 | Gemini 3.1 Pro Preview Custom ToolsC | Google Gemini | C | 1.3 s | 1.8 s | 22% | 2026-05-31 |
| 79 | Claude Opus 4.6B | Anthropic | B | 1.3 s | 1.5 s | 69% | 2026-09-14 |
| 80 | gpt-4oC | OpenAI | C | 1.3 s | 2.6 s | 65% | 2026-09-14 |
| 81 | Gemini 2.5 ProA | Google Gemini | A | 1.4 s | 1.9 s | 17% | 2026-09-14 |
| 82 | DeepSeek v3.2A | OpenRouter | A | 1.4 s | 2.1 s | not compared | 2026-09-14 |
| 83 | gpt-3.5-turbo-1106C | OpenAI | C | 1.4 s | 2.6 s | 47% | 2026-09-14 |
| 84 | gpt-5.2B | OpenAI | B | 1.4 s | 1.4 s | 69% | 2026-09-14 |
| 85 | GLM-4.5V (vision)A | Z.ai (GLM / Zhipu) | A | 1.5 s | 4.9 s | 31% | 2026-09-14 |
| 86 | gpt-5-search-apiC | OpenAI | C | 1.5 s | 2.0 s | 64% | 2026-09-14 |
| 87 | gpt-5-search-api-2025-10-14B | OpenAI | B | 1.5 s | 2.7 s | 64% | 2026-09-14 |
| 88 | gpt-3.5-turboC | OpenAI | C | 1.6 s | 2.4 s | 41% | 2026-09-14 |
| 89 | Claude Opus 5A | Anthropic | A | 1.9 s | 2.6 s | 50% | 2026-09-14 |
| 90 | Gemini 3.1 Pro PreviewC | Google Gemini | C | 2.0 s | 2.3 s | 21% | 2026-09-14 |
| 91 | GLM-4.5 AirB | Z.ai (GLM / Zhipu) | B | 2.0 s | 2.7 s | 37% | 2026-09-14 |
| 92 | GLM-4.6V (vision)A | Z.ai (GLM / Zhipu) | A | 2.0 s | 2.4 s | 26% | 2026-09-14 |
| 93 | Gemini Pro LatestC | Google Gemini | C | 2.1 s | not measured | 20% | 2026-09-14 |
| 94 | gpt-5.5-2026-04-23A | OpenAI | A | 2.1 s | 4.1 s | 73% | 2026-09-14 |
| 95 | GLM-4.5A | Z.ai (GLM / Zhipu) | A | 2.2 s | 3.0 s | 66% | 2026-09-14 |
| 96 | Claude Sonnet 4.6A | Anthropic | A | 2.2 s | 2.3 s | 61% | 2026-09-14 |
| 97 | gpt-5-nano-2025-08-07B | OpenAI | B | 2.5 s | 4.3 s | 30% | 2026-09-14 |
| 98 | GLM-5A | Z.ai (GLM / Zhipu) | A | 2.7 s | 2.7 s | 63% | 2026-09-14 |
| 99 | Claude Fable 5A | Anthropic | A | 2.9 s | 3.2 s | 63% | 2026-09-14 |
| 100 | GLM-5.2A | Z.ai (GLM / Zhipu) | A | 3.1 s | 3.2 s | 37% | 2026-09-14 |
| 101 | GLM-4.6A | Z.ai (GLM / Zhipu) | A | 4.2 s | 26.7 s | 31% | 2026-09-14 |
| 102 | GLM-5.1A | Z.ai (GLM / Zhipu) | A | 4.3 s | 6.2 s | 37% | 2026-09-14 |
| 103 | GLM-4.7A | Z.ai (GLM / Zhipu) | A | 4.4 s | 4.4 s | 68% | 2026-09-14 |
| 104 | GLM-5 TurboB | Z.ai (GLM / Zhipu) | B | 5.8 s | 7.5 s | 38% | 2026-09-14 |
| · | Deep Research Max Preview (Apr-21-2026)B | Google Gemini | B | Cannot be measured — answers on a different API | not measured | not compared | — |
| · | Deep Research Preview (Apr-21-2026)B | Google Gemini | B | Cannot be measured — answers on a different API | not measured | not compared | — |
| · | Deep Research Pro Preview (Dec-12-2025)B | Google Gemini | B | Cannot be measured — answers on a different API | not measured | not compared | — |
| · | Gemini 2.5 Computer Use Preview 10-2025B | Google Gemini | B | Cannot be measured — answers on a different API | not measured | not compared | — |
| · | gpt-5.6-terra | Azure OpenAI (EU - Sweden) | unrated | Cannot be measured — no probe for this provider | not measured | not compared | — |
109 of 109 models · click a column to sort
“Cannot be measured” means the model does not answer on the chat API we time, or its provider uses a protocol our prober does not speak yet. Waiting will not fill these in.
Fast (under 500 ms)
Medium (500–1000 ms)
Slow (over 1000 ms)
Measured four times a day (02:00, 08:00, 14:00, 20:00 UTC) from Amsterdam.