Ir al contenido

Benchmarks

Clasificación

Todos los modelos de texto activos a los que podemos llegar, con lo que tardan en responder y con qué frecuencia ganan un duelo. No se oculta nada: un modelo sin medir conserva su fila, y esa fila explica por qué.

Caso normal
Lo que tarda una respuesta corriente. La mitad de las llamadas volvió antes y la otra mitad después — así que es lo que cabe esperar en una petición normal.
Caso lento
Lo malo que se pone en un mal día. Aproximadamente una llamada de cada veinte es más lenta que esto. Un modelo con caso normal bajo pero caso lento alto es rápido hasta que deja de serlo.
Tasa de victoria
De 100 duelos frente a un modelo medio de esta tabla, cuántos gana este. 50 es la media, más alto es mejor. Se calcula con todas las comparaciones evaluadas, no con una puntuación suelta.

104 de 109 modelos medidos por completo · 0 cronometrados una vez · 0 a la espera de una primera pasada · 5 que no podemos medir.

Filtro:
#
1Mistral-Nemo-Instruct-2407C100 ms
2Meta-Llama-3_3-70B-InstructB122 ms
3Mistral-Small-3.2-24B-Instruct-2506B127 ms
4Qwen2.5-VL-72B-InstructB144 ms
5NVIDIA Nemotron Super 49B v1.5A173 ms
6Mistral-7B-Instruct-v0.3C184 ms
7Qwen3.5-397B-A17BA189 ms
8Nous Hermes 3 70BA196 ms
9Qwen3-Coder-30B-A3B-InstructB199 ms
10Llama 4 ScoutA211 ms
11gpt-oss-120bC226 ms
12gpt-oss-20bC237 ms
13Cohere Command-AA283 ms
14gpt-4o-2024-05-13C366 ms
15Gemini 2.5 Flash-LiteB372 ms
16Gemini 2.5 FlashA373 ms
17Qwen 2.5 VL 72B InstructA374 ms
18Gemini Flash-Lite LatestC383 ms
19gpt-4o-miniC431 ms
20gpt-3.5-turboC434 ms
21gpt-4.1-2025-04-14C443 ms
22gpt-4.1B445 ms
23gpt-5.4-nano-2026-03-17A452 ms
24o3-miniC459 ms
25gpt-4.1-mini-2025-04-14C460 ms
26gpt-4o-2024-11-20C460 ms
27gpt-5.4-miniA464 ms
28gpt-4.1-nanoC481 ms
29gpt-4.1-nano-2025-04-14C485 ms
30Gemini 3.1 Flash LiteB489 ms
31Llama 4 MaverickA500 ms
32gpt-5.4-mini-2026-03-17A511 ms
33gpt-4o-mini-2024-07-18C519 ms
34gpt-5.4-nanoC520 ms
35gpt-5-nano-2025-08-07B520 ms
36gpt-4oC536 ms
37gpt-5-nanoC539 ms
38gpt-4o-2024-08-06C541 ms
39gpt-5C545 ms
40o3C555 ms
41Qwen3.5-9BB556 ms
42gpt-5.2-2025-12-11B561 ms
43gpt-4.1-miniC564 ms
44o4-miniC565 ms
45o3-mini-2025-01-31C572 ms
46o1-2024-12-17C574 ms
47Qwen3-32BB577 ms
48gpt-5.4A587 ms
49gpt-3.5-turbo-1106C589 ms
50o3-2025-04-16B611 ms
51gpt-5-2025-08-07B622 ms
52Gemini 3 Flash PreviewC633 ms
53gpt-5.1-2025-11-13B635 ms
54o4-mini-2025-04-16B653 ms
55gpt-5.1B660 ms
56gpt-3.5-turbo-16kC672 ms
57Qwen 3.7 MaxA673 ms
58Claude Haiku 4.5A680 ms
59o1C682 ms
60Llama 3.3 70B InstructA698 ms
61gpt-5.2B705 ms
62gpt-5.4-2026-03-05B706 ms
63gpt-5-miniC711 ms
64gpt-3.5-turbo-0125C738 ms
65Gemini Flash LatestB743 ms
66Claude Opus 4.5B789 ms
67GLM-4.5V (vision)A795 ms
68gpt-5-mini-2025-08-07B797 ms
69Claude Opus 4.8A829 ms
70DeepSeek v4 ProA829 ms
71Gemini 3.5 FlashA832 ms
72gpt-4C849 ms
73gpt-4-0613C909 ms
74Claude Sonnet 4.5B936 ms
75gpt-4-turbo-2024-04-09C945 ms
76DeepSeek v3.2A957 ms
77Claude Opus 4.7B1.0 s
78gpt-5.5C1.1 s
79Qwen3.7 MaxA1.1 s
80Qwen3.7 PlusB1.2 s
81GLM-4.6V (vision)A1.2 s
82gpt-5-search-apiC1.2 s
83Gemini 3.1 Pro Preview Custom ToolsC1.3 s
84Claude Sonnet 4.6A1.3 s
85gpt-5.5-2026-04-23A1.3 s
86Gemini 2.5 ProA1.3 s
87Claude Sonnet 5A1.4 s
88Claude Opus 5A1.4 s
89Gemini Pro LatestC1.5 s
90MiniMax M2.5A1.5 s
91gpt-4-turboC1.6 s
92Claude Opus 4.6B1.8 s
93gpt-5-search-api-2025-10-14B2.0 s
94Gemini 3.1 Pro PreviewC2.0 s
95GLM-5A2.1 s
96GLM-4.6A2.3 s
97GLM-5.2A2.4 s
98GLM-4.5 AirB3.1 s
99Claude Fable 5A3.3 s
100GLM-4.7A3.6 s
101Qwen 3.6 PlusA3.6 s
102GLM-5.1A5.8 s
103GLM-4.5A6.5 s
104GLM-5 TurboB6.6 s
·Deep Research Max Preview (Apr-21-2026)BNo se puede medir — responde por otra API
·Deep Research Preview (Apr-21-2026)BNo se puede medir — responde por otra API
·Deep Research Pro Preview (Dec-12-2025)BNo se puede medir — responde por otra API
·Gemini 2.5 Computer Use Preview 10-2025BNo se puede medir — responde por otra API
·gpt-5.6-terraNo se puede medir — sin sonda para este proveedor

109 de 109 modelos · pulse una columna para ordenar

«No se puede medir» significa que el modelo no responde por la API de chat que cronometramos, o que su proveedor usa un protocolo que nuestra sonda todavía no habla. Esperar no lo arreglará.

Rápido (menos de 500 ms)
Medio (500–1000 ms)
Lento (más de 1000 ms)
Medido cuatro veces al día (02:00, 08:00, 14:00, 20:00 UTC) desde Ámsterdam.