Aller au contenu

Benchmarks

Classement

Chaque modèle de texte actif que nous pouvons joindre, avec son temps de réponse et sa fréquence de victoire en duel. Rien n'est masqué : un modèle non mesuré garde sa ligne, et cette ligne dit pourquoi.

Cas normal
Le temps que prend une réponse ordinaire. La moitié des appels sont revenus plus vite, l'autre moitié plus lentement — c'est donc ce qu'il faut attendre d'une requête courante.
Cas lent
L'ampleur des mauvais jours. Environ un appel sur vingt est plus lent que cela. Un modèle au cas normal bas mais au cas lent élevé est rapide — jusqu'à ce qu'il ne le soit plus.
Taux de victoire
Sur 100 duels face à un modèle moyen de ce tableau, combien celui-ci en gagne. 50 est la moyenne, plus haut est meilleur. Calculé à partir de toutes les comparaisons évaluées, pas d'une note isolée.

104 modèles sur 109 entièrement mesurés · 0 chronométrés une fois · 0 en attente d'un premier passage · 5 que nous ne pouvons pas mesurer.

Filtre :
#
1Mistral-Nemo-Instruct-2407C100 ms
2Meta-Llama-3_3-70B-InstructB122 ms
3Mistral-Small-3.2-24B-Instruct-2506B127 ms
4Qwen2.5-VL-72B-InstructB144 ms
5NVIDIA Nemotron Super 49B v1.5A173 ms
6Mistral-7B-Instruct-v0.3C184 ms
7Qwen3.5-397B-A17BA189 ms
8Nous Hermes 3 70BA196 ms
9Qwen3-Coder-30B-A3B-InstructB199 ms
10Llama 4 ScoutA211 ms
11gpt-oss-120bC226 ms
12gpt-oss-20bC237 ms
13Cohere Command-AA283 ms
14gpt-4o-2024-05-13C366 ms
15Gemini 2.5 Flash-LiteB372 ms
16Gemini 2.5 FlashA373 ms
17Qwen 2.5 VL 72B InstructA374 ms
18Gemini Flash-Lite LatestC383 ms
19gpt-4o-miniC431 ms
20gpt-3.5-turboC434 ms
21gpt-4.1-2025-04-14C443 ms
22gpt-4.1B445 ms
23gpt-5.4-nano-2026-03-17A452 ms
24o3-miniC459 ms
25gpt-4.1-mini-2025-04-14C460 ms
26gpt-4o-2024-11-20C460 ms
27gpt-5.4-miniA464 ms
28gpt-4.1-nanoC481 ms
29gpt-4.1-nano-2025-04-14C485 ms
30Gemini 3.1 Flash LiteB489 ms
31Llama 4 MaverickA500 ms
32gpt-5.4-mini-2026-03-17A511 ms
33gpt-4o-mini-2024-07-18C519 ms
34gpt-5.4-nanoC520 ms
35gpt-5-nano-2025-08-07B520 ms
36gpt-4oC536 ms
37gpt-5-nanoC539 ms
38gpt-4o-2024-08-06C541 ms
39gpt-5C545 ms
40o3C555 ms
41Qwen3.5-9BB556 ms
42gpt-5.2-2025-12-11B561 ms
43gpt-4.1-miniC564 ms
44o4-miniC565 ms
45o3-mini-2025-01-31C572 ms
46o1-2024-12-17C574 ms
47Qwen3-32BB577 ms
48gpt-5.4A587 ms
49gpt-3.5-turbo-1106C589 ms
50o3-2025-04-16B611 ms
51gpt-5-2025-08-07B622 ms
52Gemini 3 Flash PreviewC633 ms
53gpt-5.1-2025-11-13B635 ms
54o4-mini-2025-04-16B653 ms
55gpt-5.1B660 ms
56gpt-3.5-turbo-16kC672 ms
57Qwen 3.7 MaxA673 ms
58Claude Haiku 4.5A680 ms
59o1C682 ms
60Llama 3.3 70B InstructA698 ms
61gpt-5.2B705 ms
62gpt-5.4-2026-03-05B706 ms
63gpt-5-miniC711 ms
64gpt-3.5-turbo-0125C738 ms
65Gemini Flash LatestB743 ms
66Claude Opus 4.5B789 ms
67GLM-4.5V (vision)A795 ms
68gpt-5-mini-2025-08-07B797 ms
69Claude Opus 4.8A829 ms
70DeepSeek v4 ProA829 ms
71Gemini 3.5 FlashA832 ms
72gpt-4C849 ms
73gpt-4-0613C909 ms
74Claude Sonnet 4.5B936 ms
75gpt-4-turbo-2024-04-09C945 ms
76DeepSeek v3.2A957 ms
77Claude Opus 4.7B1.0 s
78gpt-5.5C1.1 s
79Qwen3.7 MaxA1.1 s
80Qwen3.7 PlusB1.2 s
81GLM-4.6V (vision)A1.2 s
82gpt-5-search-apiC1.2 s
83Gemini 3.1 Pro Preview Custom ToolsC1.3 s
84Claude Sonnet 4.6A1.3 s
85gpt-5.5-2026-04-23A1.3 s
86Gemini 2.5 ProA1.3 s
87Claude Sonnet 5A1.4 s
88Claude Opus 5A1.4 s
89Gemini Pro LatestC1.5 s
90MiniMax M2.5A1.5 s
91gpt-4-turboC1.6 s
92Claude Opus 4.6B1.8 s
93gpt-5-search-api-2025-10-14B2.0 s
94Gemini 3.1 Pro PreviewC2.0 s
95GLM-5A2.1 s
96GLM-4.6A2.3 s
97GLM-5.2A2.4 s
98GLM-4.5 AirB3.1 s
99Claude Fable 5A3.3 s
100GLM-4.7A3.6 s
101Qwen 3.6 PlusA3.6 s
102GLM-5.1A5.8 s
103GLM-4.5A6.5 s
104GLM-5 TurboB6.6 s
·Deep Research Max Preview (Apr-21-2026)BNon mesurable — répond via une autre API
·Deep Research Preview (Apr-21-2026)BNon mesurable — répond via une autre API
·Deep Research Pro Preview (Dec-12-2025)BNon mesurable — répond via une autre API
·Gemini 2.5 Computer Use Preview 10-2025BNon mesurable — répond via une autre API
·gpt-5.6-terraNon mesurable — pas de sonde pour ce fournisseur

109 sur 109 modèles · cliquez sur une colonne pour trier

« Non mesurable » signifie que le modèle ne répond pas sur l'API de chat que nous chronométrons, ou que son fournisseur utilise un protocole que notre sonde ne parle pas encore. Attendre n'y changera rien.

Rapide (moins de 500 ms)
Moyen (500–1000 ms)
Lent (plus de 1000 ms)
Mesuré quatre fois par jour (02:00, 08:00, 14:00, 20:00 UTC) depuis Amsterdam.