Preuve en direct
Pourquoi un seul modèle ne suffit pas
Données réelles de chaque exécution du conseil que nous traitons — mises à jour toutes les 15 minutes. Pas de simulations, pas d'exemples triés sur le volet.
Couverture des angles morts
Un angle mort est une vraie vulnérabilité ou erreur qu'un modèle rate silencieusement pendant qu'un autre modèle du même conseil la détecte. Le graphique montre quels modèles fournissent le plus souvent la découverte unique — le résultat qu'aucun autre modèle du panel n'avait signalé.
Modèle · Taux de détection unique
- 1Gpt 4o Mini54.6%100.0%
- 2Qwen3.7 Max48.7%89.2%
- 3Qwen3.6 Plus33.3%61.0%
- 4Claude Sonnet 4 626.3%48.2%
- 5Mistral Small 3.2 24B Instruct 250623.5%43.0%
- 6Qwen3.5 397B A17B17.5%32.1%
- 7Gemini 2.5 Flash16.1%29.5%
- 8Llama 4 Maverick13.1%24.0%
Classé par taux de détection unique. Seuls les modèles avec suffisamment de données sont affichés. Les taux sont des pourcentages des propres événements d'un modèle.
Scores de qualité
Score de qualité moyen (0–100) et taux ok, calculés sur toutes les évaluations de juge où le modèle agissait comme proposant. Taux ok = fraction des verdicts évalués comme entièrement corrects.
| Modèle | Qualité moy. (0–100) | Taux ok |
|---|---|---|
| Gpt 5.2 Chat Latest | 99.5 | 100.0% |
| Gpt 5.3 Chat Latest | 99.3 | 100.0% |
| Gpt 5 Chat Latest | 99.2 | 98.3% |
| Gpt 5.1 Chat Latest | 99.1 | 100.0% |
| Claude Opus 4 6 | 97.6 | 98.4% |
| Claude Opus 4 1 20250805 | 97.6 | 96.8% |
| Gpt 5.1 | 97.6 | 95.1% |
| Gpt 5.5 2026 04 23 | 97.5 | 97.6% |
Fiabilité
Taux de bruit = fraction des réponses du modèle que le classificateur du conseil marque comme hors-sujet ou à faible signal. Taux d'erreur = fraction des appels API ayant retourné une erreur. Les deux sont des moyennes sur tous les modèles qualifiés.
Taux de bruit moy.
9.09%
Part des réponses marquées comme bruit par le classificateur.
Taux d'erreur API moy.
1.17%
Part des appels de modèle ayant retourné une erreur.
Benchmark d'analyse de sécurité & validation de la valeur du consensus (INT-1929, INT-2126)
Test en aveugle pré-enregistré · 12 vulnérabilités ensemencées + 4 contrôles propres · évaluateur aveugle : modèle indépendant non dans le conseil · coût : 0,43 €
Nous avons créé une tâche réaliste d'examen de code avec 12 vraies classes de vulnérabilité et 4 contrôles propres. Chaque bras a fonctionné indépendamment. L'évaluateur aveugle ne savait pas quel bras avait produit quelle sortie.
| Bras | Rappel (sur 12) | Faux positifs (sur 4) |
|---|---|---|
| GPT-4o (single) | 7 / 12 | 1 |
| Gemini 2.5 Flash (single) | 11 / 12 | 5 |
| Claude Haiku 4.5 (single) | 12 / 12 | 5 |
| Conseil — consensus | 12 / 12 | 7 |
GPT-4o a silencieusement signalé "Aucun problème de sécurité trouvé" pour 5 des 12 vraies vulnérabilités — le canal latéral de timing, l'IDOR, la vérification d'autorisation manquante, le token de réinitialisation prévisible et la course TOCTOU. Ce sont les bugs de contexte et de logique, pas les erreurs manuelles. Le conseil les a tous trouvés.
Le rappel par modèle unique variait de 58% (GPT-4o) à 100% (Claude Haiku) sur les mêmes tâches. On ne sait pas à l'avance quel modèle est le plus fort pour le bug en question. Le conseil délivre un rappel de premier plan sans ce pari.
Dans un test de suivi plus large et pré-enregistré portant sur 30 vrais bugs externes (non rédigés par nous), le conseil n'a pas surpassé un simple second avis, net des fausses alertes — un résultat que nous avons mesuré et publié intégralement. Cela confirme le même plafond honnête que ce benchmark de 12 éléments montrait déjà : le conseil égale le meilleur relecteur disponible, il ne le surpasse pas.
Un rappel plus élevé coûte un peu de précision. Faux positifs sur code propre : GPT-4o a obtenu 1 (conservateur mais a raté 5 vrais bugs), tandis que le conseil a obtenu 7. Un humain examine les signalements supplémentaires — ce triage est le coût de ne pas manquer le canal latéral de timing.
Signal croissant
Un signal de rétroaction d'agent et humain est en croissance active. Nous publierons des évaluations et des statistiques d'accord une fois que l'ensemble de données sera assez grand pour être significatif.
Données en direct récupérées à 28 août 2026, 19:13