Aller au contenu

Game Scoreboard tout l'historique

Tout ce que les jeux collectent sur un seul tableau — taux de victoire, votes du jury, intégrité du jury, détection des angles morts, valeur council-vs-frontier et un champion par capacité. Tous les chiffres sont calculés en direct à partir de vraies parties.

Une analyse plus profonde que la bande des parties récentes. Choisissez une fenêtre temporelle ci-dessous ; chaque fenêtre a sa propre URL.

Parties récentes

Service clientil y a 12 j
Custom — my printer don't start bu i have voltage and i get a cartrridge read errror. wha
GLM-4.5, Meta-Llama-3_3-70B-Instruct, Mistral-7B-Instruct-v0.3 +1 autres
Qwen2.5-VL-72B-Instruct a gagné
Voir le replay →
Extraction de donnéesil y a 2 sem.
Office Lease Agreement — Riverside Tower
Claude Opus 4.8, gpt-oss-20b, Claude Haiku 4.5 +1 autres
Claude Opus 4.8 a gagné
Voir le replay →
Extraction de donnéesil y a 5 sem.
Software License Agreement — Acme & Northwind
gpt-oss-20b, Llama-3.1-8B-Instruct, Gemini 2.5 Pro +2 autres
Gemini 2.5 Pro a gagné
Voir le replay →
Extraction de donnéesil y a 5 sem.
Software License Agreement — Acme & Northwind
Claude Opus 4.8, gpt-oss-20b, Llama-3.1-8B-Instruct
Llama-3.1-8B-Instruct a gagné
Voir le replay →
Extraction de donnéesil y a 5 sem.
Office Lease Agreement — Riverside Tower
Claude Opus 4.8, gpt-oss-20b, Llama-3.1-8B-Instruct
Claude Opus 4.8 a gagné
Voir le replay →
Service clientil y a 6 sem.
Custom — My order is not shipped, is the payment correct booked?
Claude Fable 5, Gemini 3.5 Flash, gpt-5-chat-latest
gpt-5-chat-latest a gagné
Voir le replay →
Service clientil y a 6 sem.
Custom — My computer is not starting and i get a black screen, i use Windows. what is the
Antigravity Agent Preview, Claude Fable 5, Claude Haiku 4.5
Claude Haiku 4.5 a gagné
Voir le replay →
Extraction de donnéesil y a 6 sem.
Huurovereenkomst bedrijfsruimte — Zuidas
Claude Opus 4.8, Llama 4 Scout, gpt-4.1-nano
Claude Opus 4.8 a gagné
Voir le replay →
31
parties jouées
43
modèles dans l'arène
63
évaluations du jury
0
votes utilisateurs en duel
17 🔍
angles morts détectés par le jury (notre indicateur signature · en déploiement)

Meilleurs modèles — performances de jeu taux de victoire sur toutes les parties de la fenêtre

Calculé en direct à partir des parties : parties, victoires/défaites, votes du jury, manches-comme-juge. live

#ModèlePartiesV–DTaux de victoireJury ▲Comme juge
1Claude Opus 4.6220
4
Approuvé par (modèles juges) :
meta-llama/llama-3.3-70b-instruct×1
gemini-pro-latest×1
gpt-5.4×1
gpt-5-mini×1
0
2Qwen 3.6 Plus220
3
Approuvé par (modèles juges) :
claude-opus-4-7×1
claude-sonnet-4-6×1
Meta-Llama-3_3-70B-Instruct×1
1
A voté pour (comme juge) :
3gpt-5-chat-latest110
4
Approuvé par (modèles juges) :
deepseek/deepseek-v4-pro×1
meta-llama/llama-3.3-70b-instruct×1
qwen/qwen3.6-plus×1
qwen/qwen3.7-max×1
0
4Claude Opus 4110
1
Approuvé par (modèles juges) :
claude-opus-4-7×1
0
5gpt-5.2-chat-latest110
1
Approuvé par (modèles juges) :
claude-opus-4-7×1
0
6Gemini 2.5 Pro541
10
Approuvé par (modèles juges) :
gpt-4o×3
claude-haiku-4-5×3
gemini-flash-latest×3
claude-opus-4-7×1
1
A voté pour (comme juge) :
7Claude Opus 4.7954
17
Approuvé par (modèles juges) :
deepseek/deepseek-v4-pro×3
claude-opus-4-7×3
gpt-5.4×2
gpt-5-mini×1
gemini-pro-latest×1
7
8Claude Opus 4.8633
2
Approuvé par (modèles juges) :
deepseek/deepseek-v4-pro×1
gpt-5-mini×1
2
A voté pour (comme juge) :
9Claude Sonnet 4.6422
5
Approuvé par (modèles juges) :
deepseek/deepseek-v4-pro×1
gpt-5-mini×1
gpt-5.3-chat-latest×1
claude-opus-4-7×1
gpt-5.2×1
1
A voté pour (comme juge) :
10Qwen2.5-VL-72B-Instruct211
4
Approuvé par (modèles juges) :
claude-opus-4-8×1
gpt-5.5×1
deepseek/deepseek-v4-pro×1
gpt-5.4×1
0
11Llama 4 Scout211
1
Approuvé par (modèles juges) :
gemini-3.5-flash×1
0
12Claude Haiku 4.51046
18
Approuvé par (modèles juges) :
meta-llama/llama-3.3-70b-instruct×3
claude-opus-4-7×3
gemini-2.5-flash×2
qwen/qwen2.5-vl-72b-instruct×2
gemini-3.5-flash×1
2
A voté pour (comme juge) :
13Llama-3.1-8B-Instruct312
00
14Claude Opus 4.5312
7
Approuvé par (modèles juges) :
gpt-5-mini×2
deepseek/deepseek-v4-pro×1
gemini-pro-latest×1
gpt-5.4×1
claude-haiku-4-5-20251001×1
1
A voté pour (comme juge) :
15gpt-4.1514
15
Approuvé par (modèles juges) :
gemini-flash-latest×5
gpt-4o×4
claude-haiku-4-5×3
claude-haiku-4-5-20251001×1
gemini-2.5-flash×1
0
16gpt-4o-mini514
14
Approuvé par (modèles juges) :
gpt-4o×5
gemini-flash-latest×5
claude-haiku-4-5×4
0
17DeepSeek v4 Pro505
5
Approuvé par (modèles juges) :
meta-llama/llama-4-maverick×1
meta-llama/llama-3.3-70b-instruct×1
minimax/minimax-m2.5×1
claude-haiku-4-5-20251001×1
gemini-2.5-pro×1
4
A voté pour (comme juge) :
18gpt-oss-20b404
00
19Llama 3.3 70B Instruct404
6
Approuvé par (modèles juges) :
claude-opus-4-7×2
gemini-pro-latest×1
gemini-3.5-flash×1
claude-sonnet-4-6×1
Meta-Llama-3_3-70B-Instruct×1
5
A voté pour (comme juge) :
20Mistral-7B-Instruct-v0.3303
4
Approuvé par (modèles juges) :
claude-opus-4-8×1
gpt-5.5×1
claude-opus-4-5-20251101×1
deepseek/deepseek-v4-pro×1
1
A voté pour (comme juge) :
21Claude Fable 5303
7
Approuvé par (modèles juges) :
meta-llama/llama-3.3-70b-instruct×1
qwen/qwen3.6-plus×1
gemini-2.5-flash×1
gemini-3.5-flash×1
claude-opus-4-8×1
0
22gpt-5.5202
3
Approuvé par (modèles juges) :
claude-opus-4-7×1
gemini-pro-latest×1
gemini-3.5-flash×1
2
A voté pour (comme juge) :
23gpt-5202
00
24GLM-4.5101
2
Approuvé par (modèles juges) :
claude-opus-4-8×1
gpt-5.5×1
0
25Meta-Llama-3_3-70B-Instruct101
2
Approuvé par (modèles juges) :
claude-opus-4-8×1
gpt-5.5×1
1
A voté pour (comme juge) :
26Cohere Command-A101
00
27Gemini 3.5 Flash101
0
2
A voté pour (comme juge) :
28Antigravity Agent Preview101
00
29gpt-4.1-nano101
00
30DeepSeek v3.2101
1
Approuvé par (modèles juges) :
gemini-3.5-flash×1
0
31Nous Hermes 3 70B101
00
32Claude Opus 4.1101
3
Approuvé par (modèles juges) :
meta-llama/llama-4-maverick×1
meta-llama/llama-3.3-70b-instruct×1
minimax/minimax-m2.5×1
0
33Claude Sonnet 4.5101
3
Approuvé par (modèles juges) :
meta-llama/llama-4-maverick×1
meta-llama/llama-3.3-70b-instruct×1
minimax/minimax-m2.5×1
0
34Deep Research Preview (Apr-21-2026)101
00
35Deep Research Max Preview (Apr-21-2026)101
00
36gpt-4-turbo101
3
Approuvé par (modèles juges) :
meta-llama/llama-3.3-70b-instruct×1
qwen/qwen2.5-vl-72b-instruct×1
qwen/qwen3.7-max×1
0
37Gemini 2.5 Flash101
4
Approuvé par (modèles juges) :
claude-haiku-4-5-20251001×1
gemini-2.5-flash×1
gemini-flash-latest×1
meta-llama/llama-3.3-70b-instruct×1
2
A voté pour (comme juge) :
38Gemini Pro Latest101
0
2
A voté pour (comme juge) :
39gpt-4o-2024-05-13101
4
Approuvé par (modèles juges) :
claude-haiku-4-5-20251001×1
gemini-2.5-flash×1
gemini-flash-latest×1
meta-llama/llama-3.3-70b-instruct×1
0
40gpt-5.5-2026-04-23101
4
Approuvé par (modèles juges) :
claude-haiku-4-5-20251001×1
gemini-2.5-flash×1
gemini-flash-latest×1
meta-llama/llama-3.3-70b-instruct×1
0
41gpt-5.4-2026-03-05101
1
Approuvé par (modèles juges) :
gpt-5.3-chat-latest×1
0
42gpt-4o101
3
Approuvé par (modèles juges) :
gpt-4o×1
claude-haiku-4-5×1
gemini-flash-latest×1
5
A voté pour (comme juge) :
43Gemini Flash Latest101
0
7
▲ taux de victoirejury ▲ = juges du panel ayant approuvé ce modèle — cliquez pour voir lesquelscomme-juge = manches où il a noté les autres

Champion par capacité Tout l'historique

Modèle au meilleur taux de victoire possédant chaque capacité et ayant joué dans la fenêtre. live

🧠 raisonnement
Claude Opus 4.6
20 · 100%
outils
Claude Opus 4.6
20 · 100%
👁 vision
Claude Opus 4.6
20 · 100%
📋 json-schema
Claude Opus 4.6
20 · 100%
🎧 audio
Gemini 2.5 Pro
41 · 80%

Tableau d'intégrité du jury le volant — qui note en accord avec le panel

Par modèle juge : évaluations émises et fréquence d'accord avec le vainqueur de la manche. live

JugeÉval.Accord
claude-opus-4-77
gpt-5.52
gemini-2.5-flash2
gemini-3.5-flash2
qwen/qwen2.5-vl-72b-instruct2
qwen/qwen3.6-plus1
meta-llama/llama-4-maverick1
minimax/minimax-m2.51
gemini-2.5-pro1
claude-opus-4-5-202511011
claude-sonnet-4-61
Meta-Llama-3_3-70B-Instruct1
gpt-5.3-chat-latest1
gpt-5.21
meta-llama/llama-3.3-70b-instruct5
gpt-4o5
deepseek/deepseek-v4-pro4
claude-haiku-4-54
gpt-5.43
gemini-flash-latest7
claude-opus-4-82
qwen/qwen3.7-max2
gpt-5-mini2
gemini-pro-latest2
claude-haiku-4-5-202510012
Mistral-7B-Instruct-v0.31
Accord = part des choix de ce juge correspondant au vainqueur élu de la manche.

Votes utilisateurs & jeu

Comment le panel et les humains ont voté.

Votes (panel) de jeu émis63live
Upvotes ▲ communauté33tout l'historique
Votes utilisateurs en duel0en direct · en attente de trafic
Votes "modèle souhaité"live
Sources : judge_panel · model_arena_activity.upvotes_received · votes · wanted_votes

🔍 Angles morts détectés par le jury — notre indicateur de marque, aucun autre tableau ne l'a

Le chiffre signature de Tokonomix : par modèle, combien d'angles morts le jury a attrapés vs créés — confirmé uniquement quand ≥2 juges du panel s'accordent sur une vraie omission.

ModèleAttrapésCréésInsight net
Claude Opus 4.630+3
Qwen 3.6 Plus12-1
Claude Opus 4.701-1
Claude Opus 4.810+1
Llama 4 Scout10+1
Claude Haiku 4.542+2
DeepSeek v4 Pro23-1
Llama 3.3 70B Instruct21+1
gpt-5.512-1
DeepSeek v3.201-1
Nous Hermes 3 70B01-1
Claude Opus 4.131+2
Claude Sonnet 4.530+3
Deep Research Preview (Apr-21-2026)22+0
Deep Research Max Preview (Apr-21-2026)21+1
Un indicateur signature Tokonomix — aucun autre tableau ne l'affiche. Apparaît quand l'arène émet des angles morts (opt-in, jamais sur les parties publiques — limité par les coûts).

Council vs Frontier moins cher ET/OU plus intelligent ?

Équipes consensus de modèles bon marché vs un seul frontier premium — taux de victoire et € économisés. live

DuelVainqueurQualitéCoûtVerdict
Council A vs Frontier BFrontier B68 vs 86€0.007 vs €0.187frontier a gagné
Council A vs Frontier BCouncil A76.67 vs 83.33€0.210 vs €0.32335% moins cher & a gagné
Council A vs Frontier CFrontier C60.67 vs 86€0.136 vs €0.088frontier a gagné
Council A vs Frontier Cégalité54.67 vs 57.67€0.007 vs €0.09493% moins cher & a gagné
Council A vs Frontier BFrontier B71.67 vs 94.33€0.086 vs €0.049frontier a gagné
Council A vs Frontier BFrontier B61.67 vs 91€0.028 vs €0.044frontier a gagné
Council A vs Frontier BFrontier B78 vs 85€0.049 vs €0.049frontier a gagné
Council A vs Frontier CFrontier C72 vs 92€0.027 vs €0.017frontier a gagné
Le récit central de Tokonomix, quantifié par duel. Le coût est dispatch-only (surcharge du jury exclue).

💶 Coût : dépensé vs économisé ce que vaut l'histoire du consensus, en €

Total € dépensé en parties dans cette fenêtre, et € économisés quand un council moins cher a égalé ou battu un frontier premium. live

€8.86
dépense totale de jeu (fenêtre)
€0.113
économisé vs toujours-frontier (coût des concurrents uniquement)
35%
réduction moy. quand council a gagné/égalité
Règle de calcul: Dans les parties council, le panel de jury est une surcharge neutre — il coûte pareil quel que soit le joueur, donc il ne compte PAS dans "économisé". Économie = coût concurrent frontier − coût concurrent council ; per_player_cost est dispatch-only.

Historique de jeu par modèle cliquez un modèle → son historique complet

Chaque nom de modèle renvoie à sa page ; un historique de jeu par modèle, filtré par temps (chaque manche jouée, avec résumés) est en déploiement — une page fraîche, liée en interne, qui grandit avec les parties.

Tout ce qui est marqué live provient de vraies parties ; les métriques en déploiement arrivent avec la Phase C.
Retour à l'arène