İçeriğe geç
Seviye A — Öncü
Çalıştığı yer:USYapıldığı yer:United States
Anthropic

Claude Fable 5

Seviye A — Öncü · 1M token

Tokonomix Editöryel Ekibi·İnceleyen Mes Kalkan·

Claude Fable 5, Anthropic'in bir milyon token bağlam çeşidine sahip görü-ve-akıl yürütme modelidir. Kendi görsel kalite-kontrol pilotumuzda test ettiğimiz en istikrarlı değerlendiriciydi — bu yüzden onu görsel konsensüs panelimizde varsayılan görü öneren modeli yaptık. İşte ölçtüklerimiz ve ölçmediklerimiz.

Bir görü öneren modelden istediğimiz zeka değil istikrardı — ve pilot kümemizde en istikrarlısı Fable 5 idi.

Tokonomix görsel-QC pilotu, 9 Haziran 2026
Bölüm 01

Fiyat geçmişi

Milyon token başına doğrudan sağlayıcı tarifeleri, artı tipik bir konuşma maliyet tahmini.

💰
API tarifeleri — Claude Fable 5
$10.00 1M giriş token başına
$50.00 1M çıkış token başına
≈ $0.0160 tipik konuşma başına (800 token)
Giriş vs çıkış fiyatı (1M token başına)
1M giriş token başına$10.00
1M çıkış token başına$50.00

Pricing over time

Input & output per 1M tokens · step-line = price changes

$10.00

input / 1M

— stable

$50.00

output / 1M

— stable

2026-06-102026-06-142026-06-14
Input
Output
Price change
⟳ synced weekly
Bölüm 02

Güçlü & zayıf yönler

Benchmark sonuçları ve gerçek kullanım senaryolarına dair toplu topluluk geri bildirimine dayanır.

Güçlü yönler

Pilotta en istikrarlı görü öneren model (%88 özdeş)Düşük yanlış-alarm oranı (300 görsellik referansta %7,1)Diğer panel modellerinin kaçırdığı kör noktaları yakaladıUzun, görsel-yoğun içerik için 1M-token bağlam çeşidi

Zayıf yönler

Tek başına duyarlılık %66,9 — %87,5 için panel gerekirAkıl yürütme/kod rakamları erken (tek koşum, n=1)
Bölüm 03

Yetenekler

toolssource: manualvisionjson modepdf inputreasoningjson schemamodel class: mythosprompt cachingmax output tokens: 128000
Bölüm 04

Sık sorulan sorular

9 Haziran 2026 pilotumuzda zamanın %88’inde çalışma-özdeşti, yalnızca %3,9 fikir değiştirdi ve sıfır yanlış pozitif üretti — bir QC hattının başında istenen istikrar. O pilota dayanan bilinçli bir ürün kararı.

Sana cilalı bir hikâye yerine dokuyu vermeyi tercih ederiz — küçük pilot, tek günlük referans, erken akıl yürütme rakamları — çünkü cilalı hikâye bir sonraki koşumu atlatamaz.

Tokonomix yayın kurulu
Bölüm 05

Kullanılabilirlik

Kullanılabilirlik

Bu modelin çağrıldığında ne sıklıkla yanıt verdiği — son 30 gün içindeki gerçek API istekleri ve canlı testler üzerinden ölçülmüştür. Bu kaliteden bağımsızdır: bu sayılar yalnızca modelin yanıt verip vermediğini gösterir, yanıtın ne kadar iyi olduğunu değil.

Son 7 gün

100.0%

n=1

Son 30 gün

100.0%

n=1

Medyan yanıt süresi

3,294ms

n=1

Baz alınan 4 ölçüm son 30 gün içinde.

Teknik detaylar

Yalnızca gerçek API çağrıları ve canlı test istekleri sayılır — dahili yoklamalar ve kıyaslama çalıştırmaları hariçtir.

Özel API anahtarıyla (BYOK) yapılan çağrılar hariçtir: bu hatalar anahtara özgüdür, model kesintisinin işareti değildir.

Başarısız çağrılar kalite puanlarına DAHİL EDİLMEZ — kalite yalnızca başarılı yanıtlar üzerinden ölçülür. Kullanılabilirlik ve kalite bağımsız sinyallerdir.

Kaydedilmiş süreye sahip başarılı çağrılarda medyan yanıt süresi (p50). Aykırı değerler medyanı ortalamadan daha az etkiler.

Toplam çağrı (30d)

1

OK yanıtlar (30d)

1

Toplam çağrı (7d)

1

OK yanıtlar (7d)

1

Görüntü kalite kontrolü pilotu (2026-06-10)

Geri çağırma

66.9%

n=300

Yanlış alarm

7.1%

n=300

Bölüm 06

Tokonomix kıyaslama kararları

⚖️
Endorsed by 2 judges
Independent LLM judges evaluated this model on our weekly intelligence tests
cohere/command-a100/100 · 1 runs
1 correct0 partial0 wrong100% accuracy
claude-sonnet-4-591/100 · 25 runs
22 correct1 partial2 wrong88% accuracy
2026-06-14

Claude Fable 5 shows improved coding, but reasoning and factual decline

Claude Fable 5 demonstrates a mixed performance shift from the previous window. The overall quality score decreased from 88.4 to 85.7, driven primarily by notable declines in reasoning and factual accuracy. Reasoning performance dropped significantly from a perfect 100 to 83, representing the most substantial category decline. Factual accuracy also fell from 68 to 60, continuing weakness in this area. However, coding performance improved from 97 to 98, maintaining strength in technical tasks. Latency showed marginal improvement, with p50 decreasing from 8318ms to 7986ms, though this remains relatively slow for real-time applications. The test sample size increased from 5 to 8 runs, providing somewhat greater statistical confidence. No new capabilities were detected in this window, suggesting a focus on performance tuning rather than feature expansion. Users should be aware that while coding tasks remain highly reliable, applications requiring strong reasoning or factual retrieval may see degraded results compared to the previous benchmark period. The overall trend indicates some regression in core capabilities that may warrant attention from development teams relying on this model for production workloads.

Quality

Latency p50

Test runs

0

Reasoning dropped from 100 to 83 Factual accuracy declined to 60 Coding improved slightly to 98 Latency improved to 7986ms
Bölüm 07

Tam model profili

Claude Fable 5: test ettiğimiz en istikrarlı değerlendirici

Anthropic'in Claude Fable 5 modeli bir görü-ve-akıl yürütme modelidir ve en çok yaslandığımız çeşit — claude-fable-5[1m] — bir milyon token'lık bağlam penceresi taşır. Bir teknik föy okumayacağız. Bunun yerine çoğu yazının sunamadığını sunuyoruz: kendi ölçümlerimizden gelen, tarih ve örneklem büyüklüğü ekli rakamlar ve kanıtın inceldiği yere dair dürüst bir not.

Neden onu varsayılan görü öneren modelimiz yaptık

9 Haziran 2026'da bir görsel kalite-kontrol pilotu yürüttük — her birinde yakalanması gereken bilinen bir medya-kalite kusuru olan bir görsel kümesi, davranışlarını karşılaştırabilmek için birden çok görü modeline verildi. Fable 5, ham zekadan daha çok önem taşıyan bir nitelikle öne çıktı: istikrar.

Pilot küme üzerindeki tekrarlı çalışmalarda zamanın %88'inde çalışma-özdeşti, %3,9 fikir-değiştirme oranıyla — yani aynı görsel hakkında bir geçişten diğerine nadiren fikir değiştirdi. O kümede sıfır yanlış pozitif üretti: var olmayan kusurlar uydurmadı. Paneldeki diğer modellerin kaçırdığı kör noktaları da yakaladı.

İstikrar, bir öneren modelden tam da istenen şeydir. Bugün gerçek bir kusuru işaretleyip yarın aynı görseli görmezden gelen bir model, sürece kötü bir temel oluşturur. Her seferinde aynı yanıtı veren — ve boş yere alarm vermeyen — bir model ise bir hattın başına konabilir. Biz de öyle yaptık: Fable 5, görsel konsensüs panelimizdeki varsayılan görü öneren modeldir. (Pilota dayanarak alınmış bilinçli bir ürün kararı.) Metin-yargıç havuzlarımızda değildir — buradaki görevi görsellere bakmak, metin puanlamak değil.

Bugünün referansı: 300 görsel, canlı ölçüldü

Pilot küçük bir şeydir. Bu yüzden modeli daha büyük bir çalışmadan geçirdik ve sonucu canlı olarak görsel-QC kıyaslamamızda yayımlıyoruz.

10 Haziran 2026'da, 300 görsellik mediaqc-v3-2026-06-10 veri kümesine karşı Fable 5 tek başına şu sonucu aldı:

  • %66,9 duyarlılık — yakaladığı gerçek kusurların oranı. Çalışmanın en iyi tekil-model sonucuyla başa baştı.
  • %7,1 yanlış-alarm oranı — temiz bir görseli ne sıklıkta işaretlediği. Aynı çalışmadaki bir başka güçlü görü modeli bunun iki katından fazlasındaydı — bir QC adımının zaman kazandırması mı yoksa harcaması mı olacağını belirleyen tam da bu fark.
  • %60,3 sınıf-uyumlu — yalnızca kusuru yakalamakla kalmayıp doğru kategoriyi de adlandırdığı durumlar.

Tek başına üçte iki duyarlılık yararlıdır ama bitmiş bir hikâye değildir — tek bir model yerine panel çalıştırmamızın nedeni budur. Fable 5 konsensüs panelinde yer aldığında duyarlılık %87,5'e yükseldi. Önerenin istikrarı, kurula güvenilir bir temel verir; kurul, tek bir modelin açık bıraktığı boşluğu kapatır.

Akıl yürütme ve kod: erken, dürüst sinyal

En çok kanıta görüde sahibiz. Genel yetenek konusunda daha az — ve bunu açıkça söylüyoruz.

9 Haziran 2026'daki bir iç değerlendirmede — modeller üzerinde çalıştırdığımız 682 testlik bir koşum — Fable 5'in sonuçları alandan keskince ayrıldı: koşumun iki yarısında %91 ve %73 puan aldı; karşılaştırdığımız modeller ise aynı görevlerde %3 ve %0 aldı. Büyük bir fark; bunu kesin bir hüküm değil güçlü bir sinyal olarak ele alıyoruz, çünkü tek bir koşum bir modeli kayırabilir ya da cezalandırabilir.

Platformdaki ilk zeka koşumumuz, bugün, 100 akıl yürütme ve 97 kod puanı döndürdü. Ön sonuçlar — tek koşum, n=1. Bunları bildiriyoruz çünkü erken rakamları gizlemek kendi başına bir dürüstsüzlüktür, ama bir koşum bir koşumdur. Örneklem büyüdükçe sıralamayı izleyin.

1M-bağlam çeşidi ne işe yarar

claude-fable-5[1m] çeşidi, darboğazın akıl yürütme değil bağlam olduğu durumlar için vardır. Bu denli geniş bir pencere, uzun bir belge kümesini, büyük bir kaynak gövdesini ya da uzun bir etkileşimi modelin önünde bir kerede tutmanı sağlar — parçalayıp önemli bir şeyin gözden kaçmamasını ummak yerine. Görüyle birlikte, modelin hem çok sayıda materyal üzerinde akıl yürütmesi hem de içindeki gömülü görsellere bakması gereken işlere uyar — uzun raporlar, şekil içeren belge kümeleri, bağlam içindeki ekran görüntüleri.

Bu rakamlar nasıl okunmalı

Yukarıdaki her şey ölçülmüş, tarihlenmiş ve adını koyduğumuz bir örneklem büyüklüğüyle sınırlandırılmıştır. Görsel-QC pilotu küçüktü; 300 görsellik referans daha büyük ama tek günde tek bir veri kümesidir; akıl yürütme ve kod rakamları erkendir. Sana cilalı bir hikâye yerine bu dokuyu vermeyi tercih ederiz, çünkü cilalı hikâye genellikle bir sonraki koşumu atlatamaz.

Claude Fable 5, Tokonomix ağ geçidi ve kataloğu üzerinden erişilebilir. Onu kendi görsellerinin karşısına görsel-QC kıyaslamamızda koyabilir ya da görevler boyunca sıralamada izleyebilirsin.

Son otomatik test
25 Tem 2026 · 02:02 UTC · Hız testi
P50 gecikme
2990 ms
P95 gecikme
3377 ms
Hatalar
0 / 6 çalıştırma
Son inceleyen Tokonomix Ekibi·10 Haziran 2026