Benchmarks
Clasificación
Todos los modelos de texto activos a los que podemos llegar, con lo que tardan en responder y con qué frecuencia ganan un duelo. No se oculta nada: un modelo sin medir conserva su fila, y esa fila explica por qué.
- Caso normal
- Lo que tarda una respuesta corriente. La mitad de las llamadas volvió antes y la otra mitad después — así que es lo que cabe esperar en una petición normal.
- Caso lento
- Lo malo que se pone en un mal día. Aproximadamente una llamada de cada veinte es más lenta que esto. Un modelo con caso normal bajo pero caso lento alto es rápido hasta que deja de serlo.
- Tasa de victoria
- De 100 duelos frente a un modelo medio de esta tabla, cuántos gana este. 50 es la media, más alto es mejor. Se calcula con todas las comparaciones evaluadas, no con una puntuación suelta.
104 de 109 modelos medidos por completo · 0 cronometrados una vez · 0 a la espera de una primera pasada · 5 que no podemos medir.
| # | |||||||
|---|---|---|---|---|---|---|---|
| 1 | Mistral-Nemo-Instruct-2407C | OVH AI Endpoints (GRA) | C | 100 ms | 138 ms | 35% | 2026-09-05 |
| 2 | Meta-Llama-3_3-70B-InstructB | OVH AI Endpoints (GRA) | B | 122 ms | 123 ms | 57% | 2026-09-05 |
| 3 | Mistral-Small-3.2-24B-Instruct-2506B | OVH AI Endpoints (GRA) | B | 127 ms | 743 ms | 54% | 2026-09-05 |
| 4 | Qwen2.5-VL-72B-InstructB | OVH AI Endpoints (GRA) | B | 144 ms | 3.2 s | 54% | 2026-09-05 |
| 5 | NVIDIA Nemotron Super 49B v1.5A | OpenRouter | A | 173 ms | 199 ms | sin comparar | 2026-07-17 |
| 6 | Mistral-7B-Instruct-v0.3C | OVH AI Endpoints (GRA) | C | 184 ms | 214 ms | 27% | 2026-09-05 |
| 7 | Qwen3.5-397B-A17BA | OVH AI Endpoints (GRA) | A | 189 ms | 729 ms | 25% | 2026-09-05 |
| 8 | Nous Hermes 3 70BA | OpenRouter | A | 196 ms | 442 ms | sin comparar | 2026-09-05 |
| 9 | Qwen3-Coder-30B-A3B-InstructB | OVH AI Endpoints (GRA) | B | 199 ms | 345 ms | 54% | 2026-09-05 |
| 10 | Llama 4 ScoutA | OpenRouter | A | 211 ms | 503 ms | sin comparar | 2026-09-05 |
| 11 | gpt-oss-120bC | OVH AI Endpoints (GRA) | C | 226 ms | 434 ms | 62% | 2026-09-05 |
| 12 | gpt-oss-20bC | OVH AI Endpoints (GRA) | C | 237 ms | 385 ms | 38% | 2026-09-05 |
| 13 | Cohere Command-AA | OpenRouter | A | 283 ms | 687 ms | sin comparar | 2026-09-05 |
| 14 | gpt-4o-2024-05-13C | OpenAI | C | 366 ms | 418 ms | 67% | 2026-09-05 |
| 15 | Gemini 2.5 Flash-LiteB | Google Gemini | B | 372 ms | 432 ms | 50% | 2026-09-05 |
| 16 | Gemini 2.5 FlashA | Google Gemini | A | 373 ms | 491 ms | 15% | 2026-09-05 |
| 17 | Qwen 2.5 VL 72B InstructA | OpenRouter | A | 374 ms | 1.5 s | sin comparar | 2026-09-05 |
| 18 | Gemini Flash-Lite LatestC | Google Gemini | C | 383 ms | 415 ms | 65% | 2026-09-05 |
| 19 | gpt-4o-miniC | OpenAI | C | 431 ms | 435 ms | 62% | 2026-09-05 |
| 20 | gpt-3.5-turboC | OpenAI | C | 434 ms | 435 ms | 42% | 2026-09-05 |
| 21 | gpt-4.1-2025-04-14C | OpenAI | C | 443 ms | 490 ms | 71% | 2026-09-05 |
| 22 | gpt-4.1B | OpenAI | B | 445 ms | 740 ms | 69% | 2026-09-05 |
| 23 | gpt-5.4-nano-2026-03-17A | OpenAI | A | 452 ms | 454 ms | 61% | 2026-09-05 |
| 24 | o3-miniC | OpenAI | C | 459 ms | 502 ms | 51% | 2026-09-05 |
| 25 | gpt-4.1-mini-2025-04-14C | OpenAI | C | 460 ms | 479 ms | 68% | 2026-09-05 |
| 26 | gpt-4o-2024-11-20C | OpenAI | C | 460 ms | 484 ms | 62% | 2026-09-05 |
| 27 | gpt-5.4-miniA | OpenAI | A | 464 ms | 464 ms | 70% | 2026-09-05 |
| 28 | gpt-4.1-nanoC | OpenAI | C | 481 ms | 617 ms | 61% | 2026-09-05 |
| 29 | gpt-4.1-nano-2025-04-14C | OpenAI | C | 485 ms | 613 ms | 61% | 2026-09-05 |
| 30 | Gemini 3.1 Flash LiteB | Google Gemini | B | 489 ms | 498 ms | 59% | 2026-09-05 |
| 31 | Llama 4 MaverickA | OpenRouter | A | 500 ms | 522 ms | sin comparar | 2026-09-05 |
| 32 | gpt-5.4-mini-2026-03-17A | OpenAI | A | 511 ms | 543 ms | 65% | 2026-09-05 |
| 33 | gpt-4o-mini-2024-07-18C | OpenAI | C | 519 ms | 557 ms | 59% | 2026-09-05 |
| 34 | gpt-5.4-nanoC | OpenAI | C | 520 ms | 531 ms | 52% | 2026-09-05 |
| 35 | gpt-5-nano-2025-08-07B | OpenAI | B | 520 ms | 607 ms | 26% | 2026-09-05 |
| 36 | gpt-4oC | OpenAI | C | 536 ms | 553 ms | 66% | 2026-09-05 |
| 37 | gpt-5-nanoC | OpenAI | C | 539 ms | 590 ms | 24% | 2026-09-05 |
| 38 | gpt-4o-2024-08-06C | OpenAI | C | 541 ms | 557 ms | 61% | 2026-09-05 |
| 39 | gpt-5C | OpenAI | C | 545 ms | 549 ms | 36% | 2026-09-05 |
| 40 | o3C | OpenAI | C | 555 ms | 559 ms | 57% | 2026-09-05 |
| 41 | Qwen3.5-9BB | OVH AI Endpoints (GRA) | B | 556 ms | 592 ms | 20% | 2026-09-05 |
| 42 | gpt-5.2-2025-12-11B | OpenAI | B | 561 ms | 657 ms | 68% | 2026-09-05 |
| 43 | gpt-4.1-miniC | OpenAI | C | 564 ms | 731 ms | 71% | 2026-09-05 |
| 44 | o4-miniC | OpenAI | C | 565 ms | 623 ms | 58% | 2026-09-05 |
| 45 | o3-mini-2025-01-31C | OpenAI | C | 572 ms | 794 ms | 58% | 2026-09-05 |
| 46 | o1-2024-12-17C | OpenAI | C | 574 ms | 575 ms | 59% | 2026-09-05 |
| 47 | Qwen3-32BB | OVH AI Endpoints (GRA) | B | 577 ms | 596 ms | 25% | 2026-09-05 |
| 48 | gpt-5.4A | OpenAI | A | 587 ms | 593 ms | 67% | 2026-09-05 |
| 49 | gpt-3.5-turbo-1106C | OpenAI | C | 589 ms | 745 ms | 45% | 2026-09-05 |
| 50 | o3-2025-04-16B | OpenAI | B | 611 ms | 649 ms | 57% | 2026-09-05 |
| 51 | gpt-5-2025-08-07B | OpenAI | B | 622 ms | 672 ms | 34% | 2026-09-05 |
| 52 | Gemini 3 Flash PreviewC | Google Gemini | C | 633 ms | 641 ms | 41% | 2026-09-05 |
| 53 | gpt-5.1-2025-11-13B | OpenAI | B | 635 ms | 973 ms | 68% | 2026-09-05 |
| 54 | o4-mini-2025-04-16B | OpenAI | B | 653 ms | 734 ms | 59% | 2026-09-05 |
| 55 | gpt-5.1B | OpenAI | B | 660 ms | 674 ms | 74% | 2026-09-05 |
| 56 | gpt-3.5-turbo-16kC | OpenAI | C | 672 ms | 674 ms | 41% | 2026-09-05 |
| 57 | Qwen 3.7 MaxA | OpenRouter | A | 673 ms | 735 ms | sin comparar | 2026-09-05 |
| 58 | Claude Haiku 4.5A | Anthropic | A | 680 ms | 699 ms | 54% | 2026-09-05 |
| 59 | o1C | OpenAI | C | 682 ms | 794 ms | 61% | 2026-09-05 |
| 60 | Llama 3.3 70B InstructA | OpenRouter | A | 698 ms | 5.2 s | sin comparar | 2026-09-05 |
| 61 | gpt-5.2B | OpenAI | B | 705 ms | 928 ms | 70% | 2026-09-05 |
| 62 | gpt-5.4-2026-03-05B | OpenAI | B | 706 ms | 730 ms | 69% | 2026-09-05 |
| 63 | gpt-5-miniC | OpenAI | C | 711 ms | 832 ms | 46% | 2026-09-05 |
| 64 | gpt-3.5-turbo-0125C | OpenAI | C | 738 ms | 746 ms | 45% | 2026-09-05 |
| 65 | Gemini Flash LatestB | Google Gemini | B | 743 ms | 1.2 s | 34% | 2026-09-05 |
| 66 | Claude Opus 4.5B | Anthropic | B | 789 ms | 835 ms | 67% | 2026-09-05 |
| 67 | GLM-4.5V (vision)A | Z.ai (GLM / Zhipu) | A | 795 ms | 1.6 s | 32% | 2026-09-05 |
| 68 | gpt-5-mini-2025-08-07B | OpenAI | B | 797 ms | 923 ms | 42% | 2026-09-05 |
| 69 | Claude Opus 4.8A | Anthropic | A | 829 ms | 909 ms | 60% | 2026-09-05 |
| 70 | DeepSeek v4 ProA | OpenRouter | A | 829 ms | 1.2 s | sin comparar | 2026-09-05 |
| 71 | Gemini 3.5 FlashA | Google Gemini | A | 832 ms | 884 ms | 26% | 2026-09-05 |
| 72 | gpt-4C | OpenAI | C | 849 ms | 858 ms | 48% | 2026-09-05 |
| 73 | gpt-4-0613C | OpenAI | C | 909 ms | 1.6 s | 48% | 2026-09-05 |
| 74 | Claude Sonnet 4.5B | Anthropic | B | 936 ms | 966 ms | 63% | 2026-09-05 |
| 75 | gpt-4-turbo-2024-04-09C | OpenAI | C | 945 ms | 1.6 s | 62% | 2026-09-05 |
| 76 | DeepSeek v3.2A | OpenRouter | A | 957 ms | 992 ms | sin comparar | 2026-09-05 |
| 77 | Claude Opus 4.7B | Anthropic | B | 1.0 s | 1.7 s | 65% | 2026-09-05 |
| 78 | gpt-5.5C | OpenAI | C | 1.1 s | 1.4 s | 69% | 2026-09-05 |
| 79 | Qwen3.7 MaxA | Alibaba Cloud Qwen (DashScope Intl) | A | 1.1 s | 1.4 s | sin comparar | 2026-09-05 |
| 80 | Qwen3.7 PlusB | Alibaba Cloud Qwen (DashScope Intl) | B | 1.2 s | 1.2 s | sin comparar | 2026-09-05 |
| 81 | GLM-4.6V (vision)A | Z.ai (GLM / Zhipu) | A | 1.2 s | 1.3 s | 25% | 2026-09-05 |
| 82 | gpt-5-search-apiC | OpenAI | C | 1.2 s | 1.3 s | 64% | 2026-09-05 |
| 83 | Gemini 3.1 Pro Preview Custom ToolsC | Google Gemini | C | 1.3 s | 1.8 s | 22% | 2026-05-31 |
| 84 | Claude Sonnet 4.6A | Anthropic | A | 1.3 s | 1.3 s | 62% | 2026-09-05 |
| 85 | gpt-5.5-2026-04-23A | OpenAI | A | 1.3 s | 1.8 s | 72% | 2026-09-05 |
| 86 | Gemini 2.5 ProA | Google Gemini | A | 1.3 s | 2.0 s | 17% | 2026-09-05 |
| 87 | Claude Sonnet 5A | Anthropic | A | 1.4 s | 1.6 s | 64% | 2026-09-05 |
| 88 | Claude Opus 5A | Anthropic | A | 1.4 s | 1.4 s | 49% | 2026-09-05 |
| 89 | Gemini Pro LatestC | Google Gemini | C | 1.5 s | 1.6 s | 21% | 2026-09-05 |
| 90 | MiniMax M2.5A | OpenRouter | A | 1.5 s | 1.5 s | sin comparar | 2026-09-05 |
| 91 | gpt-4-turboC | OpenAI | C | 1.6 s | 2.3 s | 60% | 2026-09-05 |
| 92 | Claude Opus 4.6B | Anthropic | B | 1.8 s | 2.3 s | 70% | 2026-09-05 |
| 93 | gpt-5-search-api-2025-10-14B | OpenAI | B | 2.0 s | 2.2 s | 66% | 2026-09-05 |
| 94 | Gemini 3.1 Pro PreviewC | Google Gemini | C | 2.0 s | 17.9 s | 22% | 2026-09-05 |
| 95 | GLM-5A | Z.ai (GLM / Zhipu) | A | 2.1 s | 2.1 s | 64% | 2026-09-05 |
| 96 | GLM-4.6A | Z.ai (GLM / Zhipu) | A | 2.3 s | 2.9 s | 26% | 2026-09-05 |
| 97 | GLM-5.2A | Z.ai (GLM / Zhipu) | A | 2.4 s | 2.8 s | 39% | 2026-09-05 |
| 98 | GLM-4.5 AirB | Z.ai (GLM / Zhipu) | B | 3.1 s | 7.5 s | 39% | 2026-09-05 |
| 99 | Claude Fable 5A | Anthropic | A | 3.3 s | 3.5 s | 61% | 2026-09-05 |
| 100 | GLM-4.7A | Z.ai (GLM / Zhipu) | A | 3.6 s | 15.6 s | 74% | 2026-09-05 |
| 101 | Qwen 3.6 PlusA | OpenRouter | A | 3.6 s | 4.3 s | sin comparar | 2026-09-05 |
| 102 | GLM-5.1A | Z.ai (GLM / Zhipu) | A | 5.8 s | 7.7 s | 39% | 2026-09-05 |
| 103 | GLM-4.5A | Z.ai (GLM / Zhipu) | A | 6.5 s | 8.6 s | 65% | 2026-09-05 |
| 104 | GLM-5 TurboB | Z.ai (GLM / Zhipu) | B | 6.6 s | 7.2 s | 40% | 2026-09-05 |
| · | Deep Research Max Preview (Apr-21-2026)B | Google Gemini | B | No se puede medir — responde por otra API | sin medir | sin comparar | — |
| · | Deep Research Preview (Apr-21-2026)B | Google Gemini | B | No se puede medir — responde por otra API | sin medir | sin comparar | — |
| · | Deep Research Pro Preview (Dec-12-2025)B | Google Gemini | B | No se puede medir — responde por otra API | sin medir | sin comparar | — |
| · | Gemini 2.5 Computer Use Preview 10-2025B | Google Gemini | B | No se puede medir — responde por otra API | sin medir | sin comparar | — |
| · | gpt-5.6-terra | Azure OpenAI (EU - Sweden) | sin nivel | No se puede medir — sin sonda para este proveedor | sin medir | sin comparar | — |
109 de 109 modelos · pulse una columna para ordenar
«No se puede medir» significa que el modelo no responde por la API de chat que cronometramos, o que su proveedor usa un protocolo que nuestra sonda todavía no habla. Esperar no lo arreglará.