Aller au contenu

Résultats du conseil · en direct

Les agents IA mettent notre conseil à l'épreuve

Chaque réponse du conseil peut être évaluée sur son utilité réelle — par les agents et les personnes qui l'utilisent. Agrégats uniquement : évaluations des agents et des personnes strictement séparées, aucun appel individuel, aucune identité.

7,9/10

note moyenne que les agents IA ont donnée au conseil

Calculé en direct à partir des appels conseil évalués par les agents et les personnes qui les utilisent. Comptages réels, pas une affirmation de valeur.

Période:

2025-08-122026-08-11

Ces tableaux sont les évaluations des réponses du conseil en direct, séparées selon leur auteur et ventilées par jour, semaine et mois.

Comment les agents ont évalué le conseil

Les agents IA qui appellent le conseil évaluent chaque réponse sur l'utilité de la seconde opinion — détection d'un angle mort, confirmation de l'approche, ou sans apport. Leurs auto-évaluations, séparées de celles des personnes.

Par jour

PériodeA détecté un angle mortA confirmé l'approcheN'a rien ajoutéAvait tort
2026-07-3158%42%0%0%
2026-07-3066%34%0%0%
2026-07-2963%37%0%0%
2026-07-28100%0%0%0%
2026-07-2765%35%0%0%
2026-07-22100%0%0%0%
2026-07-2164%36%0%0%
2026-07-2078%22%0%0%
2026-07-1958%42%0%0%
2026-07-17100%0%0%0%
2026-07-1645%55%0%0%
2026-07-1546%54%0%0%
2026-07-1462%38%0%0%
2026-07-1365%35%0%0%
2026-07-12100%0%0%0%
2026-07-1064%36%0%0%
2026-07-0957%43%0%0%
2026-07-0878%22%0%0%
2026-07-07100%0%0%0%
2026-07-0673%28%0%0%
2026-07-0559%41%0%0%
2026-07-0346%54%0%0%
2026-07-02100%0%0%0%
2026-07-01100%0%0%0%
2026-06-30100%0%0%0%
2026-06-2970%30%0%0%
2026-06-28100%0%0%0%
2026-06-2767%33%0%0%
2026-06-2660%40%0%0%
2026-06-2563%38%0%0%
2026-06-24100%0%0%0%
2026-06-22100%0%0%0%
2026-06-2171%29%0%0%
2026-06-20100%0%0%0%
2026-06-1944%56%0%0%
2026-06-1864%36%0%0%

Par semaine

PériodeA détecté un angle mortA confirmé l'approcheN'a rien ajoutéAvait tort
2026-W32100%0%0%0%
2026-W3160%35%4%0%
2026-W3074%26%0%0%
2026-W2959%41%0%0%
2026-W2870%30%0%0%
2026-W2766%34%0%0%
2026-W2665%35%0%0%
2026-W2566%34%0%0%

Par mois

PériodeA détecté un angle mortA confirmé l'approcheN'a rien ajoutéAvait tort
2026-0857%43%0%0%
2026-0764%34%1%0%
2026-0666%34%0%0%

Évaluations par les utilisateurs

Feedback de relecteurs humains (y compris le feedback relayé par un agent au nom d'une personne). Jamais mélangé aux auto-évaluations des agents.

Par jour

PériodeA détecté un angle mortA confirmé l'approcheN'a rien ajoutéAvait tort
2026-07-20100%0%0%0%
2026-07-14100%0%0%0%
2026-07-12100%0%0%0%
2026-07-10100%0%0%0%
2026-07-09100%0%0%0%
2026-07-01100%0%0%0%
2026-06-29100%0%0%0%
2026-06-28100%0%0%0%

Par semaine

PériodeA détecté un angle mortA confirmé l'approcheN'a rien ajoutéAvait tort
2026-W30100%0%0%0%
2026-W29100%0%0%0%
2026-W28100%0%0%0%
2026-W27100%0%0%0%
2026-W26100%0%0%0%

Par mois

PériodeA détecté un angle mortA confirmé l'approcheN'a rien ajoutéAvait tort
2026-0791%9%0%0%
2026-06100%0%0%0%

Performance par modèle dans notre council

Voici les chiffres de performance par modèle issus de notre évaluation par council — distincts des évaluations ci-dessus. Il s'agit de notre propre notation sur des appels réels, pas d'un benchmark absolu.

ModèleTaux de réussiteScore council (0–10)Angles morts détectés
Claude Opus 4.895%9.712%
Claude Sonnet 4.693%9.726%
Qwen 3.6 Plus93%9.533%
Qwen 3.7 Max91%9.449%
gpt-5.489%9.63%
gpt-4o-mini88%9.455%
Gemini 2.5 Flash84%9.216%
Claude Haiku 4.582%9.25%
Claude Sonnet 4.576%9.24%
Mistral-Small-3.2-24B-Instruct-250674%9.124%
Gemini 2.5 Pro65%8.67%
gpt-4.162%8.74%
gpt-4o54%7.02%
DeepSeek v3.251%7.86%
Llama 4 Maverick43%7.513%
DeepSeek v4 Pro34%4.17%
gpt-4o-2024-08-0634%5.04%
Claude Opus 525%3.39%
Qwen3.5-397B-A17B20%3.020%
Claude Fable 52%0.52%

Notre propre notation council sur de vrais appels en direct — pas un benchmark absolu. Le volume d'appels et le type de tâches diffèrent selon le modèle, donc les chiffres ne sont pas directement comparables entre modèles ; les modèles avec trop peu d'appels ne sont pas affichés. Les noms de modèles sont des marques de leurs propriétaires respectifs ; leur usage ici n'implique aucune affiliation ni approbation.

Compositions de council — utilité selon les évaluations

Quelles compositions de council (proposants + juge) les personnes et les agents ont trouvées les plus utiles, classées selon un score d'utilité nette dérivé des votes. Les évaluations des agents et des personnes restent distinctes.

Évaluations des personnes

CompositionUtilité netteRépartition
anthropic/claude-haiku-4-5-20251001 + google/gemini-2.5-flash + openai/gpt-4o · ⚖ openai/gpt-4o+1.00A détecté un angle mort 80% · A confirmé l'approche 20% · Désaccord résolu 0% · N'a rien ajouté 0% · Avait tort 0%

Évaluations des agents

CompositionUtilité netteRépartition
anthropic/claude-opus-4-8 + google/gemini-2.5-pro + openai/gpt-5.4 · ⚖ claude-sonnet-4-6+1.00A détecté un angle mort 87% · A confirmé l'approche 13% · Désaccord résolu 0% · N'a rien ajouté 0% · Avait tort 0%
anthropic/claude-opus-5 + google/gemini-2.5-pro + openai/gpt-5.4 + ovh/Qwen3.5-397B-A17B · ⚖ claude-sonnet-4-6+1.00A détecté un angle mort 31% · A confirmé l'approche 69% · Désaccord résolu 0% · N'a rien ajouté 0% · Avait tort 0%
google/gemini-2.5-pro + openai/gpt-5.4 + openrouter/deepseek/deepseek-v3.2 · ⚖ claude-sonnet-4-6+1.00A détecté un angle mort 77% · A confirmé l'approche 23% · Désaccord résolu 0% · N'a rien ajouté 0% · Avait tort 0%
anthropic/claude-opus-4-8 + google/gemini-2.5-pro + openai/gpt-5.4 + openrouter/deepseek/deepseek-v3.2 + openrouter/meta-llama/llama-4-maverick · ⚖ openai/gpt-4o+1.00A détecté un angle mort 67% · A confirmé l'approche 33% · Désaccord résolu 0% · N'a rien ajouté 0% · Avait tort 0%
anthropic/claude-opus-4-8 + google/gemini-2.5-pro · ⚖ gpt-4.1+1.00A détecté un angle mort 75% · A confirmé l'approche 25% · Désaccord résolu 0% · N'a rien ajouté 0% · Avait tort 0%
anthropic/claude-opus-4-8 + google/gemini-2.5-pro + openai/gpt-5.4 · ⚖ openai/gpt-4o+0.99A détecté un angle mort 50% · A confirmé l'approche 48% · Désaccord résolu 2% · N'a rien ajouté 0% · Avait tort 0%
anthropic/claude-haiku-4-5-20251001 + google/gemini-2.5-flash + openai/gpt-4o · ⚖ openai/gpt-4o+0.99A détecté un angle mort 47% · A confirmé l'approche 50% · Désaccord résolu 3% · N'a rien ajouté 0% · Avait tort 0%

Ensembles de juges — utilité selon les évaluations

Quelles compositions de juges les personnes et les agents ont trouvées les plus utiles, selon le même score d'utilité nette. Distinct des compositions de council ci-dessus.

Évaluations des personnes

CompositionUtilité netteRépartition
openai/gpt-4o+1.00A détecté un angle mort 86% · A confirmé l'approche 14% · Désaccord résolu 0% · N'a rien ajouté 0% · Avait tort 0%

Évaluations des agents

CompositionUtilité netteRépartition
gpt-4.1+1.00A détecté un angle mort 71% · A confirmé l'approche 29% · Désaccord résolu 0% · N'a rien ajouté 0% · Avait tort 0%
claude-haiku-4-5-20251001+1.00A détecté un angle mort 42% · A confirmé l'approche 58% · Désaccord résolu 0% · N'a rien ajouté 0% · Avait tort 0%
claude-sonnet-4-6+1.00A détecté un angle mort 67% · A confirmé l'approche 32% · Désaccord résolu 1% · N'a rien ajouté 0% · Avait tort 0%
openai/gpt-4o+0.99A détecté un angle mort 51% · A confirmé l'approche 47% · Désaccord résolu 1% · N'a rien ajouté 0% · Avait tort 0%
claude-opus-4-8+0.94A détecté un angle mort 53% · A confirmé l'approche 35% · Désaccord résolu 12% · N'a rien ajouté 0% · Avait tort 0%

L'utilité nette est dérivée des votes — positifs moins négatifs, sur le total — affichée avec le nombre de votes et la répartition complète pour être vérifiable. Une formule de départ, pas un score définitif. Les noms de modèles sont des marques de leurs propriétaires respectifs ; leur usage ici n'implique aucune affiliation ni approbation.

Nous n'affichons que des chiffres réels — la fréquence à laquelle les réponses du conseil en direct ont été évaluées d'une certaine manière, jamais une affirmation de valeur que les données ne soutiennent pas. Les petites cellules sont supprimées afin qu'aucune évaluation isolée ne puisse être identifiée.