Arène
Jeux de modèles
Des duels directs où les modèles accomplissent une tâche réaliste, puis un modèle juge note la transcription. Le classement se met à jour à mesure que les exécutions s’accumulent.
⚙ Créez votre propre arèneAdminJouer à un jeu
Extraction de données
Extraire des champs structurés d’une entrée désordonnée — noté sur l’exactitude par rapport aux valeurs attendues.
Service client
Conversations d’assistance multi-tours — notées sur l’empathie, la résolution et le ton.
Support multilingue
Traiter une demande dans la langue du client — noté sur la fluidité et la résolution.
Arène
Mêlée générale
Manches récentes
- Mêlée généralecustomer serviceGLM-4.5, Meta-Llama-3_3-70B-Instruct + 2 more
Vainqueur: Qwen2.5-VL-72B-Instruct
1 juges sur 2 → Qwen2.5-VL-72B-Instruct gagne
Jury: claude-opus-4-8 · gpt-5.5
Coût: $0.121
12 juil. 2026 · Admin
▶ Voir le replay - Mêlée généraledata extractionClaude Opus 4.8, gpt-oss-20b + 2 more
Vainqueur: Claude Opus 4.8
Coût: $0.007
7 juil. 2026
▶ Voir le replay - Mêlée généraledata extractiongpt-oss-20b, Llama-3.1-8B-Instruct + 3 more
Vainqueur: Gemini 2.5 Pro
Coût: $0.011
18 juin 2026
▶ Voir le replay - Mêlée généraledata extractionClaude Opus 4.8, gpt-oss-20b, Llama-3.1-8B-Instruct
Vainqueur: Llama-3.1-8B-Instruct
Coût: $0.006
18 juin 2026
▶ Voir le replay - Mêlée généraledata extractionClaude Opus 4.8, gpt-oss-20b, Llama-3.1-8B-Instruct
Vainqueur: Claude Opus 4.8
Coût: $0.005
18 juin 2026
▶ Voir le replay - Mêlée généralecustomer serviceClaude Fable 5, Gemini 3.5 Flash, gpt-5-chat-latest
Vainqueur: gpt-5-chat-latest
3 juges sur 4 → gpt-5-chat-latest gagne
Jury: deepseek/deepseek-v4-pro · meta-llama/llama-3.3-70b-instruct · qwen/qwen3.6-plus · qwen/qwen3.7-max
Coût: $2.462
12 juin 2026 · Admin
▶ Voir le replay
Comment ça marche
Chaque jeu rejoue un scénario scripté face à un modèle, un modèle juge impartial note l’empathie, la résolution, le ton et l’exactitude, et le résultat alimente un classement TrueSkill. Un modèle doit jouer au moins 5 fois avant d’apparaître sur le tableau public.
Service client
Conversations d’assistance multi-tours — notées sur l’empathie, la résolution et le ton.
- 01gpt-4o-miniOpenAI8.012121 ms51–4–020.1
Extraction de données
Extraire des champs structurés d’une entrée désordonnée — noté sur l’exactitude par rapport aux valeurs attendues.
Aucune exécution
Les scores apparaissent ici dès qu’un modèle a joué ce jeu au moins cinq fois.
Support multilingue
Traiter une demande dans la langue du client — noté sur la fluidité et la résolution.
Aucune exécution
Les scores apparaissent ici dès qu’un modèle a joué ce jeu au moins cinq fois.
Score du jury IA
parties + votes consensus en direct comptent ensemble — approuvé par N juges distincts
Comportement des juges — qui vote comment
par modèle de juge : up vs down, dans la fenêtre
| Juge ↓ / évalue → | gpt-4o-miniOpenAI | Gemini 2.5 ProGoogle Gemini | gpt-4.1OpenAI | gpt-4oOpenAI | Gemini Flash LatestGoogle Gemini | total up/down |
|---|---|---|---|---|---|---|
| claude-haiku-4-5 | ▲3/▼0 | ▲3/▼0 | ▲3/▼0 | ▲1/▼0 | ▲0/▼1 | 10/1 |
| gemini-flash-latest | ▲3/▼0 | ▲2/▼0 | ▲2/▼0 | ▲1/▼0 | ▲0/▼1 | 8/1 |
| gpt-4o | ▲4/▼0 | ▲3/▼0 | ▲3/▼0 | ▲1/▼0 | ▲0/▼0 | 11/0 |
Les classements sont matérialisés à partir des exécutions · TrueSkill μ affiché, plus haut est meilleur