Benchmarks
Leaderboard
Every active text model we can reach, with how long it takes to answer and how often it wins a head-to-head. Nothing is hidden: a model we have not measured still gets a row, and the row says why.
- Typical
- How long a normal answer takes. Half of the calls came back faster than this, half slower — so it is what you should expect on an ordinary request.
- Slow case
- How bad it gets on an off day. Roughly one call in twenty is slower than this. A model with a low typical time but a high slow case is fast until it is not.
- Win rate
- Out of 100 head-to-head comparisons against an average model on this board, how many this one wins. 50 is average, higher is better. It is worked out from every judged comparison, not from a single score.
104 of 109 models fully measured · 0 timed once · 0 awaiting a first run · 5 we cannot measure.
Filter:
| # | |||||||
|---|---|---|---|---|---|---|---|
| 1 | Qwen3-Coder-30B-A3B-InstructB | OVH AI Endpoints (GRA) | B | 73 ms | 90 ms | 54% | 2026-09-10 |
| 2 | Meta-Llama-3_3-70B-InstructB | OVH AI Endpoints (GRA) | B | 127 ms | 296 ms | 57% | 2026-09-10 |
| 3 | Mistral-Small-3.2-24B-Instruct-2506B | OVH AI Endpoints (GRA) | B | 157 ms | 599 ms | 54% | 2026-09-10 |
| 4 | NVIDIA Nemotron Super 49B v1.5A | OpenRouter | A | 173 ms | 199 ms | not compared | 2026-07-17 |
| 5 | Qwen2.5-VL-72B-InstructB | OVH AI Endpoints (GRA) | B | 187 ms | 203 ms | 54% | 2026-09-10 |
| 6 | Qwen3.5-397B-A17BA | OVH AI Endpoints (GRA) | A | 229 ms | 242 ms | 26% | 2026-09-10 |
| 7 | Mistral-7B-Instruct-v0.3C | OVH AI Endpoints (GRA) | C | 230 ms | 357 ms | 28% | 2026-09-10 |
| 8 | gpt-oss-20bC | OVH AI Endpoints (GRA) | C | 239 ms | 335 ms | 39% | 2026-09-10 |
| 9 | Mistral-Nemo-Instruct-2407C | OVH AI Endpoints (GRA) | C | 288 ms | 332 ms | 37% | 2026-09-10 |
| 10 | Nous Hermes 3 70BA | OpenRouter | A | 362 ms | 424 ms | not compared | 2026-09-10 |
| 11 | Llama 4 ScoutA | OpenRouter | A | 408 ms | 439 ms | not compared | 2026-09-10 |
| 12 | gpt-4o-miniC | OpenAI | C | 424 ms | 454 ms | 62% | 2026-09-10 |
| 13 | Qwen 2.5 VL 72B InstructA | OpenRouter | A | 430 ms | 684 ms | not compared | 2026-09-10 |
| 14 | gpt-5.4-miniA | OpenAI | A | 431 ms | 466 ms | 69% | 2026-09-10 |
| 15 | gpt-3.5-turbo-0125C | OpenAI | C | 451 ms | 838 ms | 45% | 2026-09-10 |
| 16 | Gemini Flash-Lite LatestC | Google Gemini | C | 462 ms | 567 ms | 62% | 2026-09-10 |
| 17 | gpt-4.1-mini-2025-04-14C | OpenAI | C | 470 ms | 502 ms | 69% | 2026-09-10 |
| 18 | gpt-oss-120bC | OVH AI Endpoints (GRA) | C | 489 ms | 783 ms | 62% | 2026-09-10 |
| 19 | Gemini 3.1 Flash LiteB | Google Gemini | B | 494 ms | 776 ms | 58% | 2026-09-10 |
| 20 | Qwen3-32BB | OVH AI Endpoints (GRA) | B | 495 ms | 514 ms | 23% | 2026-09-10 |
| 21 | Llama 3.3 70B InstructA | OpenRouter | A | 499 ms | 5.6 s | not compared | 2026-09-10 |
| 22 | gpt-4o-mini-2024-07-18C | OpenAI | C | 501 ms | 563 ms | 58% | 2026-09-10 |
| 23 | Llama 4 MaverickA | OpenRouter | A | 501 ms | 667 ms | not compared | 2026-09-10 |
| 24 | gpt-3.5-turbo-16kC | OpenAI | C | 502 ms | 615 ms | 42% | 2026-09-10 |
| 25 | Gemini 2.5 Flash-LiteB | Google Gemini | B | 512 ms | 586 ms | 50% | 2026-09-10 |
| 26 | gpt-3.5-turboC | OpenAI | C | 518 ms | 677 ms | 40% | 2026-09-10 |
| 27 | gpt-4.1-nanoC | OpenAI | C | 520 ms | 600 ms | 57% | 2026-09-10 |
| 28 | gpt-4.1-2025-04-14C | OpenAI | C | 543 ms | 886 ms | 71% | 2026-09-10 |
| 29 | gpt-4o-2024-05-13C | OpenAI | C | 554 ms | 580 ms | 66% | 2026-09-10 |
| 30 | Cohere Command-AA | OpenRouter | A | 558 ms | 1.0 s | not compared | 2026-09-10 |
| 31 | o3-miniC | OpenAI | C | 561 ms | 633 ms | 50% | 2026-09-10 |
| 32 | Qwen3.5-9BB | OVH AI Endpoints (GRA) | B | 566 ms | 574 ms | 21% | 2026-09-10 |
| 33 | o1-2024-12-17C | OpenAI | C | 567 ms | 645 ms | 61% | 2026-09-10 |
| 34 | gpt-4.1-nano-2025-04-14C | OpenAI | C | 568 ms | 581 ms | 62% | 2026-09-10 |
| 35 | gpt-4o-2024-11-20C | OpenAI | C | 576 ms | 628 ms | 61% | 2026-09-10 |
| 36 | gpt-4o-2024-08-06C | OpenAI | C | 578 ms | 620 ms | 60% | 2026-09-10 |
| 37 | Gemini 3.5 FlashA | Google Gemini | A | 581 ms | 765 ms | 24% | 2026-09-10 |
| 38 | o1C | OpenAI | C | 587 ms | 751 ms | 62% | 2026-09-10 |
| 39 | Gemini 2.5 FlashA | Google Gemini | A | 589 ms | 1.8 s | 15% | 2026-09-10 |
| 40 | gpt-4.1-miniC | OpenAI | C | 592 ms | 600 ms | 72% | 2026-09-10 |
| 41 | Gemini 3 Flash PreviewC | Google Gemini | C | 594 ms | 608 ms | 40% | 2026-09-10 |
| 42 | gpt-5.1-2025-11-13B | OpenAI | B | 597 ms | 876 ms | 67% | 2026-09-10 |
| 43 | gpt-4.1B | OpenAI | B | 600 ms | 697 ms | 70% | 2026-09-10 |
| 44 | o4-miniC | OpenAI | C | 612 ms | 712 ms | 61% | 2026-09-10 |
| 45 | gpt-4oC | OpenAI | C | 614 ms | 768 ms | 65% | 2026-09-10 |
| 46 | gpt-5.4-mini-2026-03-17A | OpenAI | A | 619 ms | 654 ms | 65% | 2026-09-10 |
| 47 | o4-mini-2025-04-16B | OpenAI | B | 662 ms | 739 ms | 59% | 2026-09-10 |
| 48 | gpt-5.1B | OpenAI | B | 664 ms | 754 ms | 73% | 2026-09-10 |
| 49 | Claude Haiku 4.5A | Anthropic | A | 674 ms | 780 ms | 55% | 2026-09-10 |
| 50 | o3C | OpenAI | C | 674 ms | 849 ms | 60% | 2026-09-10 |
| 51 | o3-2025-04-16B | OpenAI | B | 676 ms | 686 ms | 58% | 2026-09-10 |
| 52 | gpt-5.4-2026-03-05B | OpenAI | B | 701 ms | 941 ms | 68% | 2026-09-10 |
| 53 | Qwen 3.6 PlusA | OpenRouter | A | 706 ms | 1.3 s | not compared | 2026-09-10 |
| 54 | gpt-5.4-nanoC | OpenAI | C | 712 ms | 747 ms | 52% | 2026-09-10 |
| 55 | gpt-5-nanoC | OpenAI | C | 738 ms | 774 ms | 24% | 2026-09-10 |
| 56 | gpt-5-nano-2025-08-07B | OpenAI | B | 746 ms | 769 ms | 28% | 2026-09-10 |
| 57 | MiniMax M2.5A | OpenRouter | A | 761 ms | 1.2 s | not compared | 2026-09-10 |
| 58 | gpt-5C | OpenAI | C | 763 ms | 797 ms | 40% | 2026-09-10 |
| 59 | gpt-5.2-2025-12-11B | OpenAI | B | 779 ms | 1.7 s | 70% | 2026-09-10 |
| 60 | gpt-5.2B | OpenAI | B | 814 ms | 1.0 s | 70% | 2026-09-10 |
| 61 | Gemini Flash LatestB | Google Gemini | B | 820 ms | 2.6 s | 34% | 2026-09-10 |
| 62 | gpt-5.4-nano-2026-03-17A | OpenAI | A | 829 ms | 866 ms | 59% | 2026-09-10 |
| 63 | gpt-5-mini-2025-08-07B | OpenAI | B | 842 ms | 858 ms | 45% | 2026-09-10 |
| 64 | gpt-4C | OpenAI | C | 867 ms | 897 ms | 49% | 2026-09-10 |
| 65 | gpt-5.4A | OpenAI | A | 871 ms | 910 ms | 68% | 2026-09-10 |
| 66 | o3-mini-2025-01-31C | OpenAI | C | 892 ms | 1.1 s | 60% | 2026-09-10 |
| 67 | DeepSeek v3.2A | OpenRouter | A | 893 ms | 1.9 s | not compared | 2026-09-10 |
| 68 | Claude Opus 4.5B | Anthropic | B | 902 ms | 1.2 s | 64% | 2026-09-10 |
| 69 | gpt-5-miniC | OpenAI | C | 929 ms | 1.0 s | 49% | 2026-09-10 |
| 70 | Claude Sonnet 4.5B | Anthropic | B | 963 ms | 963 ms | 60% | 2026-09-10 |
| 71 | gpt-5-2025-08-07B | OpenAI | B | 983 ms | 2.5 s | 39% | 2026-09-10 |
| 72 | Qwen 3.7 MaxA | OpenRouter | A | 992 ms | 1.1 s | not compared | 2026-09-10 |
| 73 | gpt-4-0613C | OpenAI | C | 1.0 s | 1.1 s | 48% | 2026-09-10 |
| 74 | Gemini 2.5 ProA | Google Gemini | A | 1.1 s | 1.2 s | 17% | 2026-09-10 |
| 75 | Claude Opus 4.8A | Anthropic | A | 1.1 s | 1.1 s | 58% | 2026-09-10 |
| 76 | gpt-4-turboC | OpenAI | C | 1.1 s | 1.4 s | 59% | 2026-09-10 |
| 77 | gpt-5.5C | OpenAI | C | 1.2 s | 1.2 s | 70% | 2026-09-10 |
| 78 | Qwen3.7 PlusB | Alibaba Cloud Qwen (DashScope Intl) | B | 1.2 s | 1.3 s | not compared | 2026-09-10 |
| 79 | Claude Sonnet 5A | Anthropic | A | 1.2 s | 2.5 s | 63% | 2026-09-10 |
| 80 | Gemini 3.1 Pro Preview Custom ToolsC | Google Gemini | C | 1.3 s | 1.8 s | 22% | 2026-05-31 |
| 81 | gpt-5.5-2026-04-23A | OpenAI | A | 1.4 s | 3.3 s | 73% | 2026-09-10 |
| 82 | gpt-5-search-apiC | OpenAI | C | 1.4 s | 1.5 s | 65% | 2026-09-10 |
| 83 | gpt-4-turbo-2024-04-09C | OpenAI | C | 1.5 s | 1.8 s | 60% | 2026-09-10 |
| 84 | gpt-5-search-api-2025-10-14B | OpenAI | B | 1.6 s | 1.9 s | 64% | 2026-09-10 |
| 85 | Claude Opus 4.7B | Anthropic | B | 1.6 s | 1.9 s | 63% | 2026-09-10 |
| 86 | GLM-4.6V (vision)A | Z.ai (GLM / Zhipu) | A | 1.9 s | 3.1 s | 24% | 2026-09-10 |
| 87 | Claude Opus 5A | Anthropic | A | 1.9 s | 1.9 s | 49% | 2026-09-10 |
| 88 | Gemini 3.1 Pro PreviewC | Google Gemini | C | 2.1 s | 2.3 s | 21% | 2026-09-10 |
| 89 | DeepSeek v4 ProA | OpenRouter | A | 2.2 s | 2.2 s | not compared | 2026-09-10 |
| 90 | Gemini Pro LatestC | Google Gemini | C | 2.3 s | 2.3 s | 19% | 2026-09-10 |
| 91 | gpt-3.5-turbo-1106C | OpenAI | C | 2.5 s | 3.8 s | 46% | 2026-09-10 |
| 92 | GLM-4.5V (vision)A | Z.ai (GLM / Zhipu) | A | 2.5 s | 3.5 s | 33% | 2026-09-10 |
| 93 | Qwen3.7 MaxA | Alibaba Cloud Qwen (DashScope Intl) | A | 2.9 s | 4.2 s | not compared | 2026-09-10 |
| 94 | GLM-5A | Z.ai (GLM / Zhipu) | A | 2.9 s | 4.0 s | 62% | 2026-09-10 |
| 95 | GLM-5.2A | Z.ai (GLM / Zhipu) | A | 3.3 s | 4.8 s | 42% | 2026-09-10 |
| 96 | Claude Fable 5A | Anthropic | A | 3.6 s | 3.8 s | 61% | 2026-09-10 |
| 97 | Claude Sonnet 4.6A | Anthropic | A | 4.1 s | 4.4 s | 62% | 2026-09-10 |
| 98 | GLM-4.5 AirB | Z.ai (GLM / Zhipu) | B | 4.5 s | 4.6 s | 37% | 2026-09-10 |
| 99 | Claude Opus 4.6B | Anthropic | B | 8.0 s | 9.5 s | 69% | 2026-09-10 |
| 100 | GLM-5 TurboB | Z.ai (GLM / Zhipu) | B | 8.6 s | 9.6 s | 40% | 2026-09-10 |
| 101 | GLM-5.1A | Z.ai (GLM / Zhipu) | A | 8.8 s | 9.7 s | 38% | 2026-09-10 |
| 102 | GLM-4.7A | Z.ai (GLM / Zhipu) | A | 9.0 s | 22.9 s | 69% | 2026-09-10 |
| 103 | GLM-4.6A | Z.ai (GLM / Zhipu) | A | 9.3 s | 11.4 s | 28% | 2026-09-10 |
| 104 | GLM-4.5A | Z.ai (GLM / Zhipu) | A | 15.6 s | 20.6 s | 67% | 2026-09-10 |
| · | Deep Research Max Preview (Apr-21-2026)B | Google Gemini | B | Cannot be measured — answers on a different API | not measured | not compared | — |
| · | Deep Research Preview (Apr-21-2026)B | Google Gemini | B | Cannot be measured — answers on a different API | not measured | not compared | — |
| · | Deep Research Pro Preview (Dec-12-2025)B | Google Gemini | B | Cannot be measured — answers on a different API | not measured | not compared | — |
| · | Gemini 2.5 Computer Use Preview 10-2025B | Google Gemini | B | Cannot be measured — answers on a different API | not measured | not compared | — |
| · | gpt-5.6-terra | Azure OpenAI (EU - Sweden) | unrated | Cannot be measured — no probe for this provider | not measured | not compared | — |
109 of 109 models · click a column to sort
“Cannot be measured” means the model does not answer on the chat API we time, or its provider uses a protocol our prober does not speak yet. Waiting will not fill these in.
Fast (under 500 ms)
Medium (500–1000 ms)
Slow (over 1000 ms)
Measured four times a day (02:00, 08:00, 14:00, 20:00 UTC) from Amsterdam.