Anthropics Claude Fable 5 ist ein Vision-und-Reasoning-Modell, und die Variante, auf die wir uns am meisten stützen — claude-fable-5[1m] — hat ein Kontextfenster von einer Million Token. Wir werden kein Datenblatt herunterbeten. Stattdessen bieten wir, was die meisten Texte nicht haben: Zahlen aus unseren eigenen Messungen, mit Datum und Stichprobengröße, und einen ehrlichen Hinweis darauf, wo die Belege dünn werden.
Warum es unser Standard-Vision-Proposer wurde
Am 9. Juni 2026 führten wir einen Bild-QC-Piloten durch — eine Reihe von Bildern mit jeweils einem bekannten Medienqualitätsfehler, die mehreren Vision-Modellen vorgelegt wurden, um ihr Verhalten zu vergleichen. Fable 5 stach durch eine Eigenschaft hervor, die schwerer wiegt als reine Cleverness: Stabilität.
Über wiederholte Läufe auf dem Pilot-Set war es zu 88% lauf-identisch, bei einer Flip-Rate von 3,9% — es änderte also selten seine Meinung über dasselbe Bild von einem Durchlauf zum nächsten. Auf diesem Set produzierte es null Falsch-Positive: keine erfundenen Defekte. Es fing auch blinde Flecken, die andere Modelle im Panel übersahen.
Stabilität ist genau das, was man von einem Proposer will. Ein Modell, das heute einen echten Defekt meldet und morgen dasselbe Bild ignoriert, taugt schlecht als Prozessgrundlage. Eines, das jedes Mal gleich antwortet — und keinen Fehlalarm schlägt — kann man an den Anfang einer Pipeline stellen. Genau das taten wir: Fable 5 ist der Standard-Vision-Proposer in unserem Bild-Konsenspanel. (Eine bewusste Produktentscheidung auf Basis des Piloten.) Es ist nicht in unseren Text-Judge-Pools — seine Aufgabe hier ist, Bilder anzusehen, nicht Text zu bewerten.
Die heutige Baseline: 300 Bilder, live gemessen
Ein Pilot ist klein. Also ließen wir das Modell einen größeren Lauf absolvieren und veröffentlichen das Ergebnis live auf unserem Vision-QC-Benchmark.
Am 10. Juni 2026, gegen den Datensatz mediaqc-v3-2026-06-10 mit 300 Bildern, erreichte Fable 5 solo:
- 66,9% Recall — der Anteil echter Defekte, den es fing. Das war das beste Einzelmodell-Ergebnis des Laufs (gleichauf).
- 7,1% Fehlalarmrate — wie oft es ein sauberes Bild markierte. Ein anderes starkes Vision-Modell im selben Lauf lag dabei mehr als doppelt so hoch — genau der Unterschied, der entscheidet, ob ein QC-Schritt Zeit spart oder verschwendet.
- 60,3% klassenkorrekt — Fälle, in denen es nicht nur den Defekt fing, sondern auch die richtige Kategorie benannte.
Zwei Drittel Recall solo ist brauchbar, aber keine fertige Geschichte — deshalb betreiben wir ein Panel statt eines einzelnen Modells. Mit Fable 5 im Konsenspanel stieg der Recall auf 87,5%. Die Stabilität des Proposers gibt dem Rat etwas Verlässliches; der Rat schließt die Lücke, die ein Modell allein offenlässt.
Reasoning und Coding: frühes, ehrliches Signal
Bei Vision haben wir die meisten Belege. Zur allgemeinen Fähigkeit weniger — und das sagen wir offen.
In einer internen Evaluierung am 9. Juni 2026 — ein Harness aus 682 Tests, das wir über Modelle laufen lassen — trennten sich Fable 5s Ergebnisse scharf vom Feld: es erreichte 91% und 73% auf den beiden Hälften, wo die Vergleichsmodelle 3% und 0% auf identischen Aufgaben erzielten. Ein großer Abstand, den wir als starkes Signal behandeln, nicht als endgültiges Urteil, denn ein einzelnes Harness kann ein Modell schmeicheln oder bestrafen.
Unser erster Intelligenz-Lauf auf der Plattform, heute, ergab eine Reasoning-Punktzahl von 100 und eine Coding-Punktzahl von 97. Vorläufig — ein einziger Lauf, n=1. Wir berichten sie, weil das Verschweigen früher Zahlen seine eigene Unehrlichkeit ist, aber ein Lauf bleibt ein Lauf. Verfolgen Sie die Bestenliste, während die Stichprobe wächst.
Wofür die 1M-Kontextvariante da ist
Die Variante claude-fable-5[1m] existiert für Fälle, in denen der Kontext der Engpass ist, nicht das Reasoning. Ein so breites Fenster lässt einen langen Dokumentsatz, viel Referenzmaterial oder eine ausgedehnte Interaktion auf einmal vor das Modell legen, statt zu zerstückeln. Kombiniert mit Vision passt es zu Arbeit, bei der das Modell über viel Material schließen und die eingebetteten Bilder ansehen muss — lange Berichte, Dokumentsätze mit Abbildungen, Screenshots im Kontext.
Wie diese Zahlen zu lesen sind
Alles oben ist gemessen, datiert und durch eine benannte Stichprobengröße begrenzt. Der Vision-QC-Pilot war klein; die 300-Bilder-Baseline ist größer, aber ein Datensatz an einem Tag; die Reasoning- und Coding-Zahlen sind früh. Wir geben Ihnen lieber diese Textur als eine glatte Geschichte, denn die glatte überlebt meist den nächsten Lauf nicht.
Claude Fable 5 ist über das Tokonomix-Gateway und den Katalog verfügbar. Sie können es auf Ihren eigenen Bildern testen über unseren Vision-QC-Benchmark oder über Aufgaben hinweg auf der Bestenliste verfolgen.