Zum Inhalt
Tier A — Frontier
Läuft in:USErstellt in:United States
Anthropic

Claude Fable 5

Tier A — Frontier · 1M Tokens

Tokonomix-Redaktionsteam·Geprüft von Mes Kalkan·

Claude Fable 5 ist Anthropics Vision-und-Reasoning-Modell mit einer Kontextvariante von einer Million Token. In unserem eigenen Bild-QC-Piloten war es der stabilste Prüfer, den wir getestet haben — deshalb haben wir es zum Standard-Vision-Proposer in unserem Bild-Konsenspanel gemacht. Das ist, was wir gemessen haben, und was nicht.

Was wir von einem Vision-Proposer wollten, war nicht Cleverness, sondern Stabilität — und auf unserem Pilot-Set war Fable 5 der stabilste.

Tokonomix Vision-QC-Pilot, 9. Juni 2026
Abschnitt 01

Preisverlauf

Direkte Provider-Tarife pro Million Tokens, plus eine typische Gesprächskostenschätzung.

💰
API-Tarife — Claude Fable 5
$10.00 pro 1M Input-Tokens
$50.00 pro 1M Output-Tokens
≈ $0.0160 pro typischem Gespräch (800 Tokens)
Input- vs. Output-Preis (pro 1M Tokens)
pro 1M Input-Tokens$10.00
pro 1M Output-Tokens$50.00

Pricing over time

Input & output per 1M tokens · step-line = price changes

$10.00

input / 1M

— stable

$50.00

output / 1M

— stable

2026-06-102026-06-142026-06-14
Input
Output
Price change
⟳ synced weekly
Abschnitt 02

Stärken & Schwächen

Basierend auf Benchmark-Ergebnissen und aggregiertem Community-Feedback zu realen Anwendungsfällen.

Stärken

Stabilster Vision-Proposer im Piloten (88% lauf-identisch)Niedrige Fehlalarmrate (7,1% auf der 300-Bilder-Baseline)Fing blinde Flecken, die andere Panel-Modelle übersahen1M-Token-Kontextvariante für lange, bildreiche Inhalte

Schwächen

Solo-Recall 66,9% — ein Panel braucht es für 87,5%Reasoning-/Coding-Zahlen sind früh (ein Lauf, n=1)
Abschnitt 03

Fähigkeiten

toolssource: manualvisionjson modepdf inputreasoningjson schemamodel class: mythosprompt cachingmax output tokens: 128000
Abschnitt 04

Häufig gestellte Fragen

In unserem Piloten vom 9. Juni 2026 war es zu 88% lauf-identisch, änderte nur in 3,9% der Fälle seine Antwort und produzierte null Falsch-Positive — die Stabilität, die man am Anfang einer QC-Pipeline will. Eine bewusste Produktentscheidung auf Basis dieses Piloten.

Wir geben Ihnen lieber die Textur — kleiner Pilot, Eintages-Baseline, frühe Reasoning-Zahlen — als eine glatte Geschichte, die den nächsten Lauf nicht übersteht.

Tokonomix Redaktion
Abschnitt 05

Verfügbarkeit

Verfügbarkeit

Wie oft dieses Modell antwortet, wenn wir es aufrufen — gemessen anhand echter API-Anfragen und Live-Tests der letzten 30 Tage. Dies ist unabhängig von der Qualität: Diese Zahlen zeigen nur, ob das Modell antwortet, nicht wie gut die Antwort ist.

Letzte 7 Tage

100.0%

n=1

Letzte 30 Tage

100.0%

n=1

Mediane Antwortzeit

3,294ms

n=1

Basierend auf 4 Messungen in den letzten 30 Tagen.

Technische Details

Nur echte API-Aufrufe und Live-Test-Anfragen werden gezählt — interne Proben und Benchmark-Läufe sind ausgeschlossen.

Aufrufe mit einem eigenen API-Schlüssel (BYOK) sind ausgeschlossen: Diese Fehler sind schlüsselspezifisch und kein Zeichen für Modellausfälle.

Fehlgeschlagene Aufrufe werden NICHT in Qualitätswerten berücksichtigt — Qualität wird nur für erfolgreiche Antworten gemessen. Verfügbarkeit und Qualität sind unabhängige Signale.

Mediane Antwortzeit (p50) über erfolgreiche Aufrufe mit aufgezeichneter Dauer. Ausreißer beeinflussen den Median weniger als den Durchschnitt.

Gesamte Aufrufe (30d)

1

OK-Antworten (30d)

1

Gesamte Aufrufe (7d)

1

OK-Antworten (7d)

1

Bildqualitäts-Pilot (2026-06-10)

Recall

66.9%

n=300

Fehlalarmrate

7.1%

n=300

Abschnitt 06

Tokonomix-Benchmark-Urteile

⚖️
Endorsed by 2 judges
Independent LLM judges evaluated this model on our weekly intelligence tests
cohere/command-a100/100 · 1 runs
1 correct0 partial0 wrong100% accuracy
claude-sonnet-4-591/100 · 25 runs
22 correct1 partial2 wrong88% accuracy
2026-06-14

Claude Fable 5 shows improved coding, but reasoning and factual decline

Claude Fable 5 demonstrates a mixed performance shift from the previous window. The overall quality score decreased from 88.4 to 85.7, driven primarily by notable declines in reasoning and factual accuracy. Reasoning performance dropped significantly from a perfect 100 to 83, representing the most substantial category decline. Factual accuracy also fell from 68 to 60, continuing weakness in this area. However, coding performance improved from 97 to 98, maintaining strength in technical tasks. Latency showed marginal improvement, with p50 decreasing from 8318ms to 7986ms, though this remains relatively slow for real-time applications. The test sample size increased from 5 to 8 runs, providing somewhat greater statistical confidence. No new capabilities were detected in this window, suggesting a focus on performance tuning rather than feature expansion. Users should be aware that while coding tasks remain highly reliable, applications requiring strong reasoning or factual retrieval may see degraded results compared to the previous benchmark period. The overall trend indicates some regression in core capabilities that may warrant attention from development teams relying on this model for production workloads.

Quality

Latency p50

Test runs

0

Reasoning dropped from 100 to 83 Factual accuracy declined to 60 Coding improved slightly to 98 Latency improved to 7986ms
Abschnitt 07

Vollständiges Modellprofil

Claude Fable 5: der stabilste Prüfer, den wir getestet haben

Anthropics Claude Fable 5 ist ein Vision-und-Reasoning-Modell, und die Variante, auf die wir uns am meisten stützen — claude-fable-5[1m] — hat ein Kontextfenster von einer Million Token. Wir werden kein Datenblatt herunterbeten. Stattdessen bieten wir, was die meisten Texte nicht haben: Zahlen aus unseren eigenen Messungen, mit Datum und Stichprobengröße, und einen ehrlichen Hinweis darauf, wo die Belege dünn werden.

Warum es unser Standard-Vision-Proposer wurde

Am 9. Juni 2026 führten wir einen Bild-QC-Piloten durch — eine Reihe von Bildern mit jeweils einem bekannten Medienqualitätsfehler, die mehreren Vision-Modellen vorgelegt wurden, um ihr Verhalten zu vergleichen. Fable 5 stach durch eine Eigenschaft hervor, die schwerer wiegt als reine Cleverness: Stabilität.

Über wiederholte Läufe auf dem Pilot-Set war es zu 88% lauf-identisch, bei einer Flip-Rate von 3,9% — es änderte also selten seine Meinung über dasselbe Bild von einem Durchlauf zum nächsten. Auf diesem Set produzierte es null Falsch-Positive: keine erfundenen Defekte. Es fing auch blinde Flecken, die andere Modelle im Panel übersahen.

Stabilität ist genau das, was man von einem Proposer will. Ein Modell, das heute einen echten Defekt meldet und morgen dasselbe Bild ignoriert, taugt schlecht als Prozessgrundlage. Eines, das jedes Mal gleich antwortet — und keinen Fehlalarm schlägt — kann man an den Anfang einer Pipeline stellen. Genau das taten wir: Fable 5 ist der Standard-Vision-Proposer in unserem Bild-Konsenspanel. (Eine bewusste Produktentscheidung auf Basis des Piloten.) Es ist nicht in unseren Text-Judge-Pools — seine Aufgabe hier ist, Bilder anzusehen, nicht Text zu bewerten.

Die heutige Baseline: 300 Bilder, live gemessen

Ein Pilot ist klein. Also ließen wir das Modell einen größeren Lauf absolvieren und veröffentlichen das Ergebnis live auf unserem Vision-QC-Benchmark.

Am 10. Juni 2026, gegen den Datensatz mediaqc-v3-2026-06-10 mit 300 Bildern, erreichte Fable 5 solo:

  • 66,9% Recall — der Anteil echter Defekte, den es fing. Das war das beste Einzelmodell-Ergebnis des Laufs (gleichauf).
  • 7,1% Fehlalarmrate — wie oft es ein sauberes Bild markierte. Ein anderes starkes Vision-Modell im selben Lauf lag dabei mehr als doppelt so hoch — genau der Unterschied, der entscheidet, ob ein QC-Schritt Zeit spart oder verschwendet.
  • 60,3% klassenkorrekt — Fälle, in denen es nicht nur den Defekt fing, sondern auch die richtige Kategorie benannte.

Zwei Drittel Recall solo ist brauchbar, aber keine fertige Geschichte — deshalb betreiben wir ein Panel statt eines einzelnen Modells. Mit Fable 5 im Konsenspanel stieg der Recall auf 87,5%. Die Stabilität des Proposers gibt dem Rat etwas Verlässliches; der Rat schließt die Lücke, die ein Modell allein offenlässt.

Reasoning und Coding: frühes, ehrliches Signal

Bei Vision haben wir die meisten Belege. Zur allgemeinen Fähigkeit weniger — und das sagen wir offen.

In einer internen Evaluierung am 9. Juni 2026 — ein Harness aus 682 Tests, das wir über Modelle laufen lassen — trennten sich Fable 5s Ergebnisse scharf vom Feld: es erreichte 91% und 73% auf den beiden Hälften, wo die Vergleichsmodelle 3% und 0% auf identischen Aufgaben erzielten. Ein großer Abstand, den wir als starkes Signal behandeln, nicht als endgültiges Urteil, denn ein einzelnes Harness kann ein Modell schmeicheln oder bestrafen.

Unser erster Intelligenz-Lauf auf der Plattform, heute, ergab eine Reasoning-Punktzahl von 100 und eine Coding-Punktzahl von 97. Vorläufig — ein einziger Lauf, n=1. Wir berichten sie, weil das Verschweigen früher Zahlen seine eigene Unehrlichkeit ist, aber ein Lauf bleibt ein Lauf. Verfolgen Sie die Bestenliste, während die Stichprobe wächst.

Wofür die 1M-Kontextvariante da ist

Die Variante claude-fable-5[1m] existiert für Fälle, in denen der Kontext der Engpass ist, nicht das Reasoning. Ein so breites Fenster lässt einen langen Dokumentsatz, viel Referenzmaterial oder eine ausgedehnte Interaktion auf einmal vor das Modell legen, statt zu zerstückeln. Kombiniert mit Vision passt es zu Arbeit, bei der das Modell über viel Material schließen und die eingebetteten Bilder ansehen muss — lange Berichte, Dokumentsätze mit Abbildungen, Screenshots im Kontext.

Wie diese Zahlen zu lesen sind

Alles oben ist gemessen, datiert und durch eine benannte Stichprobengröße begrenzt. Der Vision-QC-Pilot war klein; die 300-Bilder-Baseline ist größer, aber ein Datensatz an einem Tag; die Reasoning- und Coding-Zahlen sind früh. Wir geben Ihnen lieber diese Textur als eine glatte Geschichte, denn die glatte überlebt meist den nächsten Lauf nicht.

Claude Fable 5 ist über das Tokonomix-Gateway und den Katalog verfügbar. Sie können es auf Ihren eigenen Bildern testen über unseren Vision-QC-Benchmark oder über Aufgaben hinweg auf der Bestenliste verfolgen.

Letzter automatisierter Test
25. Juli 2026 · 02:02 UTC · Geschwindigkeits-Benchmark
P50-Latenz
2990 ms
P95-Latenz
3377 ms
Fehler
0 / 6 Läufe
Zuletzt geprüft von Tokonomix-Team·10. Juni 2026