Claude Fable 5 van Anthropic is een vision-en-redeneermodel, en de variant waar wij het meest op leunen — claude-fable-5[1m] — heeft een contextvenster van één miljoen tokens. We gaan geen specsheet opdreunen. Wat we wél kunnen bieden is iets dat de meeste stukken niet hebben: cijfers uit onze eigen metingen, mét datums en steekproefgroottes, en een eerlijke kanttekening waar het bewijs dun is.
Waarom dit onze standaard vision-proposer werd
Op 9 juni 2026 draaiden we een vision-QC-pilot — een set beelden, elk met een bekende mediakwaliteitsfout om te vangen, gevoed aan meerdere vision-modellen zodat we hun gedrag konden vergelijken. Fable 5 viel op om één eigenschap die zwaarder weegt dan pure slimheid: stabiliteit.
Over herhaalde runs op de pilotset was het 88% van de tijd run-identiek, met een flip-rate van 3,9% — het veranderde dus zelden van mening over hetzelfde beeld tussen twee passages. Op die pilotset leverde het nul fout-positieven op: het verzon geen defecten die er niet waren. Het ving ook blinde vlekken die andere modellen in het panel misten.
Stabiliteit is precies wat je van een proposer wilt. Wie vandaag een echt defect markeert en morgen hetzelfde beeld negeert, is een lastige basis voor een proces. Wie elke keer hetzelfde antwoordt — en geen vals alarm slaat — kun je vooraan in een pijplijn zetten. Dat deden we: Fable 5 is de standaard vision-proposer in ons image-consensuspanel. (Een bewuste productbeslissing, genomen op basis van de pilot.) Het zit niet in onze text-judge-pools — zijn taak hier is naar beelden kijken, niet tekst scoren.
De baseline van vandaag: 300 beelden, live gemeten
Een pilot is klein. Dus lieten we het model een grotere run draaien en publiceren we het resultaat live op onze vision-QC-benchmark.
Op 10 juni 2026, tegen de dataset mediaqc-v3-2026-06-10 van 300 beelden, scoorde Fable 5 solo:
- 66,9% recall — het aandeel echte defecten dat het ving. Dat deelde de beste solo-score van de run.
- 7,1% vals-alarmpercentage — hoe vaak het een schoon beeld markeerde. Een ander sterk vision-model in dezelfde run zat daar ruim twee keer zo hoog, precies het verschil dat bepaalt of een QC-stap tijd bespaart of verspilt.
- 60,3% klasse-correct — gevallen waarin het niet alleen het defect ving maar ook de juiste categorie benoemde.
Twee derde recall, solo, is bruikbaar maar geen afgerond verhaal — daarom draaien we een panel in plaats van één model. Met Fable 5 in het consensuspanel steeg de recall naar 87,5%. De stabiliteit van de proposer geeft de raad iets betrouwbaars om op te bouwen; de raad dicht het gat dat één model openlaat.
Redeneren en code: vroeg, eerlijk signaal
Bij vision hebben we het meeste bewijs. Over algemene capaciteit minder, en dat zeggen we gewoon.
In een interne evaluatie op 9 juni 2026 — een harness van 682 tests die we over modellen draaien — scheidden de resultaten van Fable 5 zich scherp af: het scoorde 91% en 73% op de twee helften van die harness, waar de modellen waarmee we vergeleken 3% en 0% scoorden op dezelfde taken. Een groot gat, dat we behandelen als sterk signaal en niet als eindoordeel, want één harness kan een model vleien of straffen op manieren die een tweede zou corrigeren.
Onze eerste intelligentie-run op het platform, vandaag, gaf een redeneerscore van 100 en een codeerscore van 97. Voorlopig — één run, n=1. We melden ze omdat vroege cijfers verzwijgen ook een vorm van oneerlijkheid is, maar één run is één run. Volg de leaderboard terwijl de steekproef groeit.
Waar de 1M-contextvariant voor is
De variant claude-fable-5[1m] bestaat voor de gevallen waar context de bottleneck is, niet het redeneren. Zo'n breed venster laat je een lange documentset, veel referentiemateriaal of een uitgebreide interactie in één keer voor het model houden in plaats van te knippen en te hopen dat niets belangrijks uit beeld valt. Gecombineerd met vision past het bij werk waar het model over veel materiaal moet redeneren én naar de beelden erin moet kijken — lange rapporten, documentsets met figuren, screenshots in context.
Hoe je deze cijfers leest
Alles hierboven is gemeten, gedateerd en begrensd door een benoemde steekproefgrootte. De vision-QC-pilot was klein; de baseline van 300 beelden is groter maar is één dataset op één dag; de redeneer- en codeercijfers zijn vroeg. We geven je liever die nuance dan een glad verhaal, want het gladde verhaal overleeft meestal de volgende run niet.
Claude Fable 5 is beschikbaar via de Tokonomix-gateway en -catalogus. Je kunt het op je eigen beelden zetten via onze vision-QC-benchmark of het volgen over taken op de leaderboard.