Live bewijs
Waarom één model niet genoeg is
Echte data van elke council-run die we verwerken — elke 15 minuten bijgewerkt. Geen simulaties, geen handgeplukte voorbeelden.
Blinde-vlek dekking
Een blinde vlek is een echte kwetsbaarheid of fout die één model stil mist terwijl een ander model in dezelfde council het wél oppikt. De grafiek toont welke modellen het vaakst de unieke vondst leveren — de bevinding die geen enkel ander model in het panel had gemarkeerd.
Model · Uniek-vangst percentage
- 1Gpt 4o Mini54.6%100.0%
- 2Qwen3.7 Max48.7%89.2%
- 3Qwen3.6 Plus33.3%61.0%
- 4Claude Sonnet 4 626.3%48.2%
- 5Mistral Small 3.2 24B Instruct 250623.5%43.0%
- 6Qwen3.5 397B A17B17.5%32.1%
- 7Gemini 2.5 Flash16.1%29.5%
- 8Llama 4 Maverick13.1%24.0%
Gerangschikt op uniek-vangst percentage. Alleen modellen met voldoende data worden getoond. Percentages zijn relatief aan het eigen aantal events van een model.
Kwaliteitsscores
Gemiddelde kwaliteitsscore (0–100) en ok-percentage, berekend over alle rechter-evaluaties waarbij het model als voorsteller optrad. Ok-percentage = deel van de uitspraken dat volledig correct is beoordeeld.
| Model | Gem. kwaliteit (0–100) | Ok-percentage |
|---|---|---|
| Gpt 5.2 Chat Latest | 99.5 | 100.0% |
| Gpt 5.3 Chat Latest | 99.3 | 100.0% |
| Gpt 5 Chat Latest | 99.2 | 98.3% |
| Gpt 5.1 Chat Latest | 99.1 | 100.0% |
| Claude Opus 4 6 | 97.6 | 98.4% |
| Claude Opus 4 1 20250805 | 97.6 | 96.8% |
| Gpt 5.1 | 97.6 | 95.1% |
| Gpt 5.5 2026 04 23 | 97.5 | 97.6% |
Betrouwbaarheid
Ruispercentage = deel van modelreacties dat de council-classifier als off-topic of laagwaardig markeert. Foutpercentage = deel van API-aanroepen dat een fout retourneerde. Beide zijn gemiddelden over alle kwalificerende modellen.
Gem. ruispercentage
9.09%
Deel van reacties dat als ruis is gemarkeerd door de council-classifier.
Gem. API-foutpercentage
1.17%
Deel van modelaanroepen dat een fout retourneerde.
Beveiligingsreview benchmark & validatie van consensus-waarde (INT-1929, INT-2126)
Vooraf geregistreerde blinde test · 12 ingezaaide kwetsbaarheden + 4 schone controles · blinde beoordelaar: onafhankelijk model niet in de council · kosten: €0,43
We hebben een realistische code-review taak opgezet met 12 echte kwetsbaarheidsklassen en 4 schone controles. Elke arm liep onafhankelijk. De blinde beoordelaar wist niet welke arm welke uitvoer had geproduceerd.
| Arm | Recall (van 12) | Valse positieven (van 4) |
|---|---|---|
| GPT-4o (single) | 7 / 12 | 1 |
| Gemini 2.5 Flash (single) | 11 / 12 | 5 |
| Claude Haiku 4.5 (single) | 12 / 12 | 5 |
| Council — consensus | 12 / 12 | 7 |
GPT-4o rapporteerde stil "geen beveiligingsproblemen gevonden" bij 5 van de 12 echte kwetsbaarheden — het timing side-channel, de IDOR, de ontbrekende autorisatiecontrole, het voorspelbare reset-token en de TOCTOU-race. Dit zijn de context- en logicabugs, niet de leerboekfouten. De council vond ze alle vijf.
De recall per single model varieerde van 58% (GPT-4o) tot 100% (Claude Haiku) op dezelfde taken. Je weet van tevoren niet welk model het sterkst is voor de bug die voor je ligt. De council levert top-panel recall zonder dat gokje.
In een grotere, vooraf geregistreerde vervolgtest tegen 30 echte, externe bugs (niet door ons geschreven), versloeg de council een gewone tweede blik niet, na aftrek van valse meldingen — een resultaat dat we hebben gemeten en volledig gepubliceerd. Dit bevestigt hetzelfde eerlijke plafond dat deze benchmark van 12 items al liet zien: de council evenaart de beste beschikbare reviewer, maar verslaat hem niet.
Hogere recall kost wat precisie. Valse positieven op schone code: GPT-4o scoorde 1 (conservatief maar miste 5 echte bugs), terwijl de council 7 scoorde. Een mens bekijkt de extra markeringen — die triage is de prijs voor het niet missen van het timing side-channel.
Groeiend signaal
Een agent- en menselijk feedbacksignaal groeit actief. We publiceren beoordelingen en overeenkomststatistieken zodra de dataset groot genoeg is om betekenisvol te zijn.
Livedata opgehaald om 28 aug 2026, 18:28