Benchmarks
Language performance
How well does each AI model perform when prompted in different languages? Within each language, models are ranked by head-to-head comparison on the same native prompts — 1000 is the average of the models measured in that language.
Tests run weekly · Models with image/audio/TTS capabilities excluded
English
prompt: 2 · 430 puanlanan çalıştırma · English
| # | Model | Kazanma oranı | Runs |
|---|---|---|---|
| 1 | Claude Opus 4.6Anthropic | 93%±3 | 8 |
| 1 | Claude Opus 4.5Anthropic | 92%±4 | 8 |
| 1 | gpt-5-search-api-2025-10-14OpenAI | 91%±4 | 8 |
| 1 | Gemini 2.5 Flash-LiteGoogle Gemini | 90%±4 | 8 |
| 1 | Gemini Flash-Lite LatestGoogle Gemini | 89%±5 | 8 |
Nederlands
prompt: 2 · 253 puanlanan çalıştırma · Dutch
| # | Model | Kazanma oranı | Runs |
|---|---|---|---|
| 1 | Claude Opus 4.5Anthropic | 80%±7 | 5 |
| 1 | Claude Opus 4.6Anthropic | 80%±7 | 5 |
| 1 | Nano BananaGoogle Gemini | 79%±12 | 3 |
| 1 | Claude Sonnet 4.6Anthropic | 78%±7 | 5 |
| 1 | Gemini Flash-Lite LatestGoogle Gemini | 78%±7 | 5 |
Deutsch
prompt: 1 · 169 puanlanan çalıştırma · German
Bu dilde şimdilik yalnızca 1 prompt var — bu, toplanan kanıtı gösterir, bir sıralamayı değil. Sıralamanın anlam taşıması için daha fazla prompt gerekiyor.
| # | Model | Kazanma oranı | Runs |
|---|---|---|---|
| 1 | Claude Fable 5Anthropic | 54%±11 | 1 |
| 1 | Claude Haiku 4.5Anthropic | 54%±11 | 3 |
| 1 | Claude Opus 4.5Anthropic | 54%±11 | 3 |
| 1 | Claude Opus 4.6Anthropic | 54%±11 | 3 |
| 1 | Claude Opus 4.7Anthropic | 54%±11 | 3 |
Français
prompt: 1 · 365 puanlanan çalıştırma · French
Bu dilde şimdilik yalnızca 1 prompt var — bu, toplanan kanıtı gösterir, bir sıralamayı değil. Sıralamanın anlam taşıması için daha fazla prompt gerekiyor.
| # | Model | Kazanma oranı | Runs |
|---|---|---|---|
| 1 | Gemini Flash-Lite LatestGoogle Gemini | 86%±7 | 6 |
| 1 | gpt-5.1OpenAI | 86%±7 | 3 |
| 1 | o3OpenAI | 86%±7 | 3 |
| 1 | o4-mini-2025-04-16OpenAI | 86%±7 | 3 |
| 1 | Gemini 3.1 Flash LiteGoogle Gemini | 85%±7 | 6 |
Español
prompt: 1 · 363 puanlanan çalıştırma · Spanish
Bu dilde şimdilik yalnızca 1 prompt var — bu, toplanan kanıtı gösterir, bir sıralamayı değil. Sıralamanın anlam taşıması için daha fazla prompt gerekiyor.
| # | Model | Kazanma oranı | Runs |
|---|---|---|---|
| 1 | Gemini Flash-Lite LatestGoogle Gemini | 80%±6 | 5 |
| 1 | gpt-3.5-turboOpenAI | 80%±6 | 6 |
| 1 | gpt-3.5-turbo-0125OpenAI | 80%±6 | 6 |
| 1 | gpt-3.5-turbo-1106OpenAI | 80%±6 | 6 |
| 1 | gpt-3.5-turbo-16kOpenAI | 80%±6 | 5 |
Türkçe
prompt: 1 · 120 puanlanan çalıştırma · Turkish
Bu dilde şimdilik yalnızca 1 prompt var — bu, toplanan kanıtı gösterir, bir sıralamayı değil. Sıralamanın anlam taşıması için daha fazla prompt gerekiyor.
| # | Model | Kazanma oranı | Runs |
|---|---|---|---|
| 1 | Claude Fable 5Anthropic | 57%±11 | 2 |
| 1 | Claude Haiku 4.5Anthropic | 57%±11 | 2 |
| 1 | Claude Opus 4.5Anthropic | 57%±11 | 2 |
| 1 | Claude Opus 4.6Anthropic | 57%±11 | 2 |
| 1 | Claude Opus 4.7Anthropic | 57%±11 | 2 |