Ir al contenido

Benchmarks

Language performance

How well does each AI model perform when prompted in different languages? Within each language, models are ranked by head-to-head comparison on the same native prompts — 1000 is the average of the models measured in that language.

Tests run weekly · Models with image/audio/TTS capabilities excluded

🇬🇧

English

prompts: 2 · 430 ejecuciones puntuadas · English

🇳🇱

Nederlands

prompts: 2 · 328 ejecuciones puntuadas · Dutch

#ModelTasa de victoriaRuns
1gpt-4oOpenAI80%±56
1gpt-4.1-mini-2025-04-14OpenAI78%±66
1Claude Fable 5Anthropic77%±63
1Claude Sonnet 5Anthropic77%±62
1gpt-5OpenAI77%±62
🇩🇪

Deutsch

prompts: 1 · 169 ejecuciones puntuadas · German

Por ahora solo 1 prompt en este idioma: esto muestra las pruebas recogidas, no una clasificación. Hacen falta más prompts para que el orden signifique algo.

🇫🇷

Français

prompts: 1 · 365 ejecuciones puntuadas · French

Por ahora solo 1 prompt en este idioma: esto muestra las pruebas recogidas, no una clasificación. Hacen falta más prompts para que el orden signifique algo.

🇪🇸

Español

prompts: 1 · 363 ejecuciones puntuadas · Spanish

Por ahora solo 1 prompt en este idioma: esto muestra las pruebas recogidas, no una clasificación. Hacen falta más prompts para que el orden signifique algo.

🇹🇷

Türkçe

prompts: 1 · 120 ejecuciones puntuadas · Turkish

Por ahora solo 1 prompt en este idioma: esto muestra las pruebas recogidas, no una clasificación. Hacen falta más prompts para que el orden signifique algo.