Benchmarks
Leaderboard
Every active text model we can reach, with how long it takes to answer and how often it wins a head-to-head. Nothing is hidden: a model we have not measured still gets a row, and the row says why.
- Typical
- How long a normal answer takes. Half of the calls came back faster than this, half slower — so it is what you should expect on an ordinary request.
- Slow case
- How bad it gets on an off day. Roughly one call in twenty is slower than this. A model with a low typical time but a high slow case is fast until it is not.
- Win rate
- Out of 100 head-to-head comparisons against an average model on this board, how many this one wins. 50 is average, higher is better. It is worked out from every judged comparison, not from a single score.
103 of 108 models fully measured · 0 timed once · 0 awaiting a first run · 5 we cannot measure.
Filter:
| # | |||||||
|---|---|---|---|---|---|---|---|
| 1 | Qwen3-Coder-30B-A3B-InstructB | OVH AI Endpoints (GRA) | B | 81 ms | 86 ms | 54% | 2026-09-25 |
| 2 | Meta-Llama-3_3-70B-InstructB | OVH AI Endpoints (GRA) | B | 129 ms | 261 ms | 55% | 2026-09-25 |
| 3 | Mistral-Nemo-Instruct-2407C | OVH AI Endpoints (GRA) | C | 132 ms | 146 ms | 32% | 2026-09-25 |
| 4 | Qwen2.5-VL-72B-InstructB | OVH AI Endpoints (GRA) | B | 141 ms | 148 ms | 52% | 2026-09-25 |
| 5 | Mistral-7B-Instruct-v0.3C | OVH AI Endpoints (GRA) | C | 171 ms | 818 ms | 26% | 2026-09-25 |
| 6 | NVIDIA Nemotron Super 49B v1.5A | OpenRouter | A | 173 ms | 199 ms | not compared | 2026-07-17 |
| 7 | Llama 4 ScoutA | OpenRouter | A | 186 ms | 427 ms | not compared | 2026-09-25 |
| 8 | Nous Hermes 3 70BA | OpenRouter | A | 188 ms | 195 ms | not compared | 2026-09-25 |
| 9 | Llama 3.3 70B InstructA | OpenRouter | A | 210 ms | 378 ms | not compared | 2026-09-25 |
| 10 | gpt-oss-20bC | OVH AI Endpoints (GRA) | C | 244 ms | 308 ms | 39% | 2026-09-25 |
| 11 | Qwen3.5-397B-A17BA | OVH AI Endpoints (GRA) | A | 279 ms | 387 ms | 28% | 2026-09-25 |
| 12 | Qwen 2.5 VL 72B InstructA | OpenRouter | A | 329 ms | 369 ms | not compared | 2026-09-25 |
| 13 | gpt-4o-miniC | OpenAI | C | 459 ms | 536 ms | 60% | 2026-09-25 |
| 14 | gpt-5.4-mini-2026-03-17A | OpenAI | A | 493 ms | 569 ms | 66% | 2026-09-25 |
| 15 | gpt-4.1-miniC | OpenAI | C | 511 ms | 625 ms | 72% | 2026-09-25 |
| 16 | Cohere Command-AA | OpenRouter | A | 539 ms | 743 ms | not compared | 2026-09-25 |
| 17 | gpt-4-0613C | OpenAI | C | 547 ms | 759 ms | 46% | 2026-09-25 |
| 18 | gpt-5.4-miniA | OpenAI | A | 552 ms | 596 ms | 67% | 2026-09-25 |
| 19 | gpt-4.1-mini-2025-04-14C | OpenAI | C | 557 ms | 4.4 s | 69% | 2026-09-25 |
| 20 | gpt-3.5-turbo-16kC | OpenAI | C | 559 ms | 959 ms | 41% | 2026-09-25 |
| 21 | Gemini 2.5 Flash-LiteB | Google Gemini | B | 560 ms | 615 ms | 49% | 2026-09-25 |
| 22 | gpt-4o-mini-2024-07-18C | OpenAI | C | 564 ms | 637 ms | 56% | 2026-09-25 |
| 23 | gpt-4o-2024-05-13C | OpenAI | C | 572 ms | 580 ms | 64% | 2026-09-25 |
| 24 | DeepSeek v4 ProA | OpenRouter | A | 581 ms | 1.8 s | not compared | 2026-09-25 |
| 25 | Qwen3.5-9BB | OVH AI Endpoints (GRA) | B | 583 ms | 595 ms | 21% | 2026-09-25 |
| 26 | gpt-5-nanoC | OpenAI | C | 584 ms | 648 ms | 24% | 2026-09-25 |
| 27 | Llama 4 MaverickA | OpenRouter | A | 588 ms | 605 ms | not compared | 2026-09-25 |
| 28 | gpt-5.4-nanoC | OpenAI | C | 592 ms | 865 ms | 53% | 2026-09-25 |
| 29 | Claude Haiku 4.5A | Anthropic | A | 593 ms | 677 ms | 54% | 2026-09-25 |
| 30 | gpt-4C | OpenAI | C | 593 ms | 1.1 s | 46% | 2026-09-25 |
| 31 | gpt-4.1-nano-2025-04-14C | OpenAI | C | 600 ms | 631 ms | 58% | 2026-09-25 |
| 32 | o3-mini-2025-01-31C | OpenAI | C | 604 ms | 626 ms | 59% | 2026-09-25 |
| 33 | Gemini 2.5 FlashA | Google Gemini | A | 608 ms | 638 ms | 14% | 2026-09-25 |
| 34 | gpt-5-nano-2025-08-07B | OpenAI | B | 608 ms | 752 ms | 29% | 2026-09-25 |
| 35 | gpt-5-2025-08-07B | OpenAI | B | 625 ms | 717 ms | 41% | 2026-09-25 |
| 36 | gpt-3.5-turbo-1106C | OpenAI | C | 631 ms | 1.3 s | 46% | 2026-09-25 |
| 37 | gpt-5.4-nano-2026-03-17A | OpenAI | A | 642 ms | 838 ms | 59% | 2026-09-25 |
| 38 | o3-miniC | OpenAI | C | 644 ms | 1.1 s | 50% | 2026-09-25 |
| 39 | o3C | OpenAI | C | 646 ms | 653 ms | 61% | 2026-09-25 |
| 40 | gpt-5C | OpenAI | C | 687 ms | 1.0 s | 42% | 2026-09-25 |
| 41 | gpt-4oC | OpenAI | C | 694 ms | 707 ms | 64% | 2026-09-25 |
| 42 | gpt-4o-2024-11-20C | OpenAI | C | 707 ms | 2.0 s | 61% | 2026-09-25 |
| 43 | gpt-4o-2024-08-06C | OpenAI | C | 710 ms | 832 ms | 60% | 2026-09-25 |
| 44 | o4-mini-2025-04-16B | OpenAI | B | 718 ms | 764 ms | 61% | 2026-09-25 |
| 45 | gpt-5.1-2025-11-13B | OpenAI | B | 723 ms | 774 ms | 66% | 2026-09-25 |
| 46 | o4-miniC | OpenAI | C | 727 ms | 801 ms | 61% | 2026-09-25 |
| 47 | o3-2025-04-16B | OpenAI | B | 736 ms | 848 ms | 62% | 2026-09-25 |
| 48 | gpt-5-mini-2025-08-07B | OpenAI | B | 737 ms | 744 ms | 47% | 2026-09-25 |
| 49 | gpt-oss-120bC | OVH AI Endpoints (GRA) | C | 741 ms | 834 ms | 59% | 2026-09-25 |
| 50 | gpt-5.1B | OpenAI | B | 755 ms | 794 ms | 71% | 2026-09-25 |
| 51 | gpt-5.4A | OpenAI | A | 766 ms | 807 ms | 70% | 2026-09-25 |
| 52 | gpt-5.4-2026-03-05B | OpenAI | B | 766 ms | 834 ms | 67% | 2026-09-25 |
| 53 | gpt-4.1B | OpenAI | B | 773 ms | 852 ms | 67% | 2026-09-25 |
| 54 | o1-2024-12-17C | OpenAI | C | 782 ms | 886 ms | 62% | 2026-09-25 |
| 55 | Gemini 3.5 FlashA | Google Gemini | A | 784 ms | 807 ms | 26% | 2026-09-25 |
| 56 | Gemini 3.1 Flash LiteB | Google Gemini | B | 797 ms | 855 ms | 61% | 2026-09-25 |
| 57 | Claude Opus 4.7B | Anthropic | B | 817 ms | 836 ms | 64% | 2026-09-25 |
| 58 | gpt-4.1-nanoC | OpenAI | C | 832 ms | 959 ms | 57% | 2026-09-25 |
| 59 | gpt-5.2-2025-12-11B | OpenAI | B | 842 ms | 1.0 s | 69% | 2026-09-25 |
| 60 | Claude Sonnet 4.5B | Anthropic | B | 844 ms | 909 ms | 60% | 2026-09-25 |
| 61 | Claude Opus 4.5B | Anthropic | B | 857 ms | 975 ms | 62% | 2026-09-25 |
| 62 | Gemini Flash-Lite LatestC | Google Gemini | C | 860 ms | 1.4 s | 64% | 2026-09-25 |
| 63 | gpt-5.2B | OpenAI | B | 873 ms | 1.2 s | 68% | 2026-09-25 |
| 64 | o1C | OpenAI | C | 875 ms | 988 ms | 63% | 2026-09-25 |
| 65 | Qwen 3.7 MaxA | OpenRouter | A | 893 ms | 1.0 s | not compared | 2026-09-25 |
| 66 | MiniMax M2.5A | OpenRouter | A | 907 ms | 2.0 s | not compared | 2026-09-25 |
| 67 | Claude Sonnet 4.6A | Anthropic | A | 918 ms | 929 ms | 59% | 2026-09-25 |
| 68 | Claude Sonnet 5A | Anthropic | A | 924 ms | 1.4 s | 59% | 2026-09-25 |
| 69 | gpt-4-turbo-2024-04-09C | OpenAI | C | 934 ms | 1.1 s | 59% | 2026-09-25 |
| 70 | gpt-5.5C | OpenAI | C | 939 ms | 1.1 s | 69% | 2026-09-25 |
| 71 | DeepSeek v3.2A | OpenRouter | A | 963 ms | 1.3 s | not compared | 2026-09-25 |
| 72 | Gemini Flash LatestB | Google Gemini | B | 981 ms | 1.1 s | 35% | 2026-09-25 |
| 73 | Qwen3.7 PlusB | Alibaba Cloud Qwen (DashScope Intl) | B | 981 ms | 1.3 s | not compared | 2026-09-25 |
| 74 | Gemini 3 Flash PreviewC | Google Gemini | C | 989 ms | 1.1 s | 42% | 2026-09-25 |
| 75 | gpt-5-miniC | OpenAI | C | 992 ms | 1.1 s | 51% | 2026-09-25 |
| 76 | Claude Opus 4.8A | Anthropic | A | 1.0 s | 1.1 s | 59% | 2026-09-25 |
| 77 | Qwen 3.6 PlusA | OpenRouter | A | 1.1 s | 1.2 s | not compared | 2026-09-25 |
| 78 | gpt-4.1-2025-04-14C | OpenAI | C | 1.1 s | 1.2 s | 70% | 2026-09-25 |
| 79 | Qwen3.7 MaxA | Alibaba Cloud Qwen (DashScope Intl) | A | 1.1 s | 1.3 s | not compared | 2026-09-25 |
| 80 | gpt-4-turboC | OpenAI | C | 1.1 s | 3.6 s | 58% | 2026-09-25 |
| 81 | gpt-3.5-turbo-0125C | OpenAI | C | 1.2 s | 1.4 s | 42% | 2026-09-25 |
| 82 | gpt-3.5-turboC | OpenAI | C | 1.3 s | 1.7 s | 42% | 2026-09-25 |
| 83 | Gemini 3.1 Pro Preview Custom ToolsC | Google Gemini | C | 1.3 s | 1.8 s | 22% | 2026-05-31 |
| 84 | gpt-5.5-2026-04-23A | OpenAI | A | 1.3 s | 3.0 s | 71% | 2026-09-25 |
| 85 | GLM-4.5V (vision)A | Z.ai (GLM / Zhipu) | A | 1.4 s | 2.7 s | 31% | 2026-09-25 |
| 86 | gpt-5-search-api-2025-10-14B | OpenAI | B | 1.5 s | 1.9 s | 64% | 2026-09-25 |
| 87 | Claude Opus 5A | Anthropic | A | 1.6 s | 1.7 s | 51% | 2026-09-25 |
| 88 | Gemini 2.5 ProA | Google Gemini | A | 1.7 s | 3.0 s | 19% | 2026-09-25 |
| 89 | GLM-4.6V (vision)A | Z.ai (GLM / Zhipu) | A | 1.8 s | 1.8 s | 27% | 2026-09-25 |
| 90 | gpt-5-search-apiC | OpenAI | C | 1.8 s | 2.6 s | 64% | 2026-09-25 |
| 91 | Mistral-Small-3.2-24B-Instruct-2506B | OVH AI Endpoints (GRA) | B | 1.8 s | 4.0 s | 52% | 2026-09-25 |
| 92 | Claude Opus 4.6B | Anthropic | B | 1.8 s | 1.9 s | 67% | 2026-09-25 |
| 93 | Gemini Pro LatestC | Google Gemini | C | 2.0 s | 3.3 s | 21% | 2026-09-25 |
| 94 | Gemini 3.1 Pro PreviewC | Google Gemini | C | 2.0 s | 2.6 s | 21% | 2026-09-25 |
| 95 | GLM-4.5 AirB | Z.ai (GLM / Zhipu) | B | 2.4 s | 2.7 s | 37% | 2026-09-25 |
| 96 | Claude Fable 5A | Anthropic | A | 2.5 s | 2.5 s | 63% | 2026-09-25 |
| 97 | GLM-5A | Z.ai (GLM / Zhipu) | A | 2.7 s | 3.6 s | 62% | 2026-09-25 |
| 98 | GLM-5.2A | Z.ai (GLM / Zhipu) | A | 3.1 s | 4.9 s | 36% | 2026-09-25 |
| 99 | GLM-5.1A | Z.ai (GLM / Zhipu) | A | 5.1 s | 6.8 s | 36% | 2026-09-25 |
| 100 | GLM-5 TurboB | Z.ai (GLM / Zhipu) | B | 5.3 s | 8.5 s | 38% | 2026-09-25 |
| 101 | GLM-4.5A | Z.ai (GLM / Zhipu) | A | 6.6 s | 6.7 s | 67% | 2026-09-25 |
| 102 | GLM-4.6A | Z.ai (GLM / Zhipu) | A | 6.7 s | 7.7 s | 34% | 2026-09-25 |
| 103 | GLM-4.7A | Z.ai (GLM / Zhipu) | A | 7.1 s | 8.0 s | 68% | 2026-09-25 |
| · | Deep Research Max Preview (Apr-21-2026)B | Google Gemini | B | Cannot be measured — answers on a different API | not measured | not compared | — |
| · | Deep Research Preview (Apr-21-2026)B | Google Gemini | B | Cannot be measured — answers on a different API | not measured | not compared | — |
| · | Deep Research Pro Preview (Dec-12-2025)B | Google Gemini | B | Cannot be measured — answers on a different API | not measured | not compared | — |
| · | Gemini 2.5 Computer Use Preview 10-2025B | Google Gemini | B | Cannot be measured — answers on a different API | not measured | not compared | — |
| · | gpt-5.6-terra | Azure OpenAI (EU - Sweden) | unrated | Cannot be measured — no probe for this provider | not measured | not compared | — |
108 of 108 models · click a column to sort
“Cannot be measured” means the model does not answer on the chat API we time, or its provider uses a protocol our prober does not speak yet. Waiting will not fill these in.
Fast (under 500 ms)
Medium (500–1000 ms)
Slow (over 1000 ms)
Measured four times a day (02:00, 08:00, 14:00, 20:00 UTC) from Amsterdam.