Naar inhoud

Live bewijs

Waarom één model niet genoeg is

Echte data van elke council-run die we verwerken — elke 15 minuten bijgewerkt. Geen simulaties, geen handgeplukte voorbeelden.

Blinde-vlek dekking

Een blinde vlek is een echte kwetsbaarheid of fout die één model stil mist terwijl een ander model in dezelfde council het wél oppikt. De grafiek toont welke modellen het vaakst de unieke vondst leveren — de bevinding die geen enkel ander model in het panel had gemarkeerd.

Model · Uniek-vangst percentage

  • 1Gpt 4o Mini
    100.0%
    54.6%
  • 2Qwen3.7 Max
    89.2%
    48.7%
  • 3Qwen3.6 Plus
    61.0%
    33.3%
  • 4Claude Sonnet 4 6
    48.2%
    26.3%
  • 5Mistral Small 3.2 24B Instruct 2506
    43.0%
    23.5%
  • 6Qwen3.5 397B A17B
    32.1%
    17.5%
  • 7Gemini 2.5 Flash
    29.5%
    16.1%
  • 8Llama 4 Maverick
    24.0%
    13.1%

Gerangschikt op uniek-vangst percentage. Alleen modellen met voldoende data worden getoond. Percentages zijn relatief aan het eigen aantal events van een model.

Kwaliteitsscores

Gemiddelde kwaliteitsscore (0–100) en ok-percentage, berekend over alle rechter-evaluaties waarbij het model als voorsteller optrad. Ok-percentage = deel van de uitspraken dat volledig correct is beoordeeld.

ModelGem. kwaliteit (0–100)Ok-percentage
Gpt 5.2 Chat Latest99.5100.0%
Gpt 5.3 Chat Latest99.3100.0%
Gpt 5 Chat Latest99.298.3%
Gpt 5.1 Chat Latest99.1100.0%
Claude Opus 4 697.698.4%
Claude Opus 4 1 2025080597.696.8%
Gpt 5.197.695.1%
Gpt 5.5 2026 04 2397.597.6%

Betrouwbaarheid

Ruispercentage = deel van modelreacties dat de council-classifier als off-topic of laagwaardig markeert. Foutpercentage = deel van API-aanroepen dat een fout retourneerde. Beide zijn gemiddelden over alle kwalificerende modellen.

Gem. ruispercentage

9.09%

Deel van reacties dat als ruis is gemarkeerd door de council-classifier.

Gem. API-foutpercentage

1.17%

Deel van modelaanroepen dat een fout retourneerde.

Beveiligingsreview benchmark & validatie van consensus-waarde (INT-1929, INT-2126)

Vooraf geregistreerde blinde test · 12 ingezaaide kwetsbaarheden + 4 schone controles · blinde beoordelaar: onafhankelijk model niet in de council · kosten: €0,43

We hebben een realistische code-review taak opgezet met 12 echte kwetsbaarheidsklassen en 4 schone controles. Elke arm liep onafhankelijk. De blinde beoordelaar wist niet welke arm welke uitvoer had geproduceerd.

ArmRecall (van 12)Valse positieven (van 4)
GPT-4o (single)7 / 121
Gemini 2.5 Flash (single)11 / 125
Claude Haiku 4.5 (single)12 / 125
Council — consensus12 / 127
Kernbevinding

GPT-4o rapporteerde stil "geen beveiligingsproblemen gevonden" bij 5 van de 12 echte kwetsbaarheden — het timing side-channel, de IDOR, de ontbrekende autorisatiecontrole, het voorspelbare reset-token en de TOCTOU-race. Dit zijn de context- en logicabugs, niet de leerboekfouten. De council vond ze alle vijf.

Geen modelkeuze-gok

De recall per single model varieerde van 58% (GPT-4o) tot 100% (Claude Haiku) op dezelfde taken. Je weet van tevoren niet welk model het sterkst is voor de bug die voor je ligt. De council levert top-panel recall zonder dat gokje.

Eerlijk plafond

In een grotere, vooraf geregistreerde vervolgtest tegen 30 echte, externe bugs (niet door ons geschreven), versloeg de council een gewone tweede blik niet, na aftrek van valse meldingen — een resultaat dat we hebben gemeten en volledig gepubliceerd. Dit bevestigt hetzelfde eerlijke plafond dat deze benchmark van 12 items al liet zien: de council evenaart de beste beschikbare reviewer, maar verslaat hem niet.

Precisie afweging

Hogere recall kost wat precisie. Valse positieven op schone code: GPT-4o scoorde 1 (conservatief maar miste 5 echte bugs), terwijl de council 7 scoorde. Een mens bekijkt de extra markeringen — die triage is de prijs voor het niet missen van het timing side-channel.

Groeiend signaal

Een agent- en menselijk feedbacksignaal groeit actief. We publiceren beoordelingen en overeenkomststatistieken zodra de dataset groot genoeg is om betekenisvol te zijn.

Livedata opgehaald om 28 aug 2026, 18:28