İçeriğe geç
Seviye A — Öncü
Çalıştığı yer:USYapıldığı yer:United States

Kullanımdan kaldırma tarihi

Sağlayıcı 9 Haziran 2027 tarihini geçici bir kullanımdan kaldırma tarihi olarak belirtiyor. Model şu an her zamanki gibi kullanılabilir.

Anthropic

Claude Fable 5

Seviye A — Öncü · 1M token

Tokonomix Editöryel Ekibi·İnceleyen Mes Kalkan·

Claude Fable 5, Anthropic'in bir milyon token bağlam çeşidine sahip görü-ve-akıl yürütme modelidir. Kendi görsel kalite-kontrol pilotumuzda test ettiğimiz en istikrarlı değerlendiriciydi — bu yüzden onu görsel konsensüs panelimizde varsayılan görü öneren modeli yaptık. İşte ölçtüklerimiz ve ölçmediklerimiz.

Bir görü öneren modelden istediğimiz zeka değil istikrardı — ve pilot kümemizde en istikrarlısı Fable 5 idi.

Tokonomix görsel-QC pilotu, 9 Haziran 2026
Bölüm 01

Hız analizi

Tüm benchmark çalıştırmalarında ölçülen gecikme. P50 (medyan) ve P95 (95. yüzdelik) normal ve yoğun yük altında yanıt hızının gerçekçi bir resmini verir.

P50 gecikme (medyan)P95 gecikme100 runs
2251388555207154878808-2109-14ms
Bölüm 02

Kalite puanları

Bu modelin her soru kategorisinde sahanın geri kalanına göre nerede durduğu; aynı sorular üzerinde ikili karşılaştırmayla hesaplanır. Ham jüri puanı her sayının altındadır.

64%
Kod üretimi
jüri ortalaması 97
67%
Yaratıcı
jüri ortalaması 89
59%
Olgusal
jüri ortalaması 67
65%
Çok dilli
jüri ortalaması 99
69%
Akıl yürütme
jüri ortalaması 98

Kategori başına kazanma oranı: bu modelin o kategoriden bir soruda ortalama bir modeli ne sıklıkla yendiği. %50 ortalamadır, kalma notu değildir. Doğru cevap yüzdesi de değildir.

Bölüm 03

Fiyatlar

Bu modeli Tokonomix üzerinden kullandığınızda milyon token başına ödediğiniz tutar ve tipik bir konuşma için tahmini maliyet.

💰
API tarifeleri — Claude Fable 5
$13.00 1M giriş token başına
$65.00 1M çıkış token başına
≈ $0.0208 tipik konuşma başına (800 token)
Giriş vs çıkış fiyatı (1M token başına)
1M giriş token başına$13.00
1M çıkış token başına$65.00
Bölüm 04

Saniye başına token

Ölçülen P50 gecikmesinden türetilen saniye başına token verimi. Yüksek daha iyidir; dalgalanmalar sağlayıcı tarafındaki yükü yansıtır.

Verim (token / s)69 / avg 60
8832

P50 gecikme × 200 çıkış token tahmininden hesaplandı — mutlak rakam bu varsayıma bağlıdır; önemli olan eğilimdir.

Bölüm 05

Güçlü & zayıf yönler

Benchmark sonuçları ve gerçek kullanım senaryolarına dair toplu topluluk geri bildirimine dayanır.

Güçlü yönler

Pilotta en istikrarlı görü öneren model (%88 özdeş)Düşük yanlış-alarm oranı (300 görsellik referansta %7,1)Diğer panel modellerinin kaçırdığı kör noktaları yakaladıUzun, görsel-yoğun içerik için 1M-token bağlam çeşidi

Zayıf yönler

Tek başına duyarlılık %66,9 — %87,5 için panel gerekirAkıl yürütme/kod rakamları erken (tek koşum, n=1)
Bölüm 06

Yetenekler

toolssource: manualvisionjson modepdf inputreasoningjson schemamodel class: mythosprompt cachingmax output tokens: 128000
Bölüm 07

Sık sorulan sorular

9 Haziran 2026 pilotumuzda zamanın %88’inde çalışma-özdeşti, yalnızca %3,9 fikir değiştirdi ve sıfır yanlış pozitif üretti — bir QC hattının başında istenen istikrar. O pilota dayanan bilinçli bir ürün kararı.

Sana cilalı bir hikâye yerine dokuyu vermeyi tercih ederiz — küçük pilot, tek günlük referans, erken akıl yürütme rakamları — çünkü cilalı hikâye bir sonraki koşumu atlatamaz.

Tokonomix yayın kurulu
Bölüm 08

Kullanılabilirlik

Kullanılabilirlik

Bu modelin çağrıldığında ne sıklıkla yanıt verdiği — son 30 gün içindeki gerçek API istekleri ve canlı testler üzerinden ölçülmüştür. Bu kaliteden bağımsızdır: bu sayılar yalnızca modelin yanıt verip vermediğini gösterir, yanıtın ne kadar iyi olduğunu değil.

Son 7 gün

62.5%

n=48

Son 30 gün

70.5%

n=61

Medyan yanıt süresi

16,774ms

n=43

Baz alınan 448 ölçüm son 30 gün içinde.

Teknik detaylar

Yalnızca gerçek API çağrıları ve canlı test istekleri sayılır — dahili yoklamalar ve kıyaslama çalıştırmaları hariçtir.

Özel API anahtarıyla (BYOK) yapılan çağrılar hariçtir: bu hatalar anahtara özgüdür, model kesintisinin işareti değildir.

Başarısız çağrılar kalite puanlarına DAHİL EDİLMEZ — kalite yalnızca başarılı yanıtlar üzerinden ölçülür. Kullanılabilirlik ve kalite bağımsız sinyallerdir.

Kaydedilmiş süreye sahip başarılı çağrılarda medyan yanıt süresi (p50). Aykırı değerler medyanı ortalamadan daha az etkiler.

Toplam çağrı (30d)

61

OK yanıtlar (30d)

43

Toplam çağrı (7d)

48

OK yanıtlar (7d)

30

Görüntü kalite kontrolü pilotu (2026-06-10)

Geri çağırma

66.9%

n=300

Yanlış alarm

7.1%

n=300

Bölüm 09

Tokonomix kıyaslama kararları

⚖️
Endorsed by 2 judges
Independent LLM judges evaluated this model on our weekly intelligence tests
cohere/command-a100/100 · 2 runs
2 correct0 partial0 wrong100% accuracy
claude-sonnet-4-589/100 · 65 runs
55 correct4 partial6 wrong85% accuracy
2026-09-13

Claude Fable 5 shows reasoning gains but latency degrades 20%

Claude Fable 5 demonstrates a modest overall quality improvement, rising from 86.9 to 88.0 across the benchmark window. The most significant development is perfect reasoning performance at 100, showing strong capabilities in logical tasks and problem-solving scenarios. Coding performance remains exceptionally stable, improving only marginally from 95 to 96, indicating consistent strength in programming tasks. However, the model faces a notable performance tradeoff. Latency has increased substantially from 7361ms to 8825ms at the median, representing a 20% slowdown in response times. This degradation may impact user experience in time-sensitive applications despite the quality improvements. Category coverage has shifted between windows, with factual question performance now measured at 68, suggesting room for improvement in knowledge retrieval tasks. Previous strengths in creative writing (66) and multilingual capabilities (100) are not reflected in current testing, making direct comparison difficult. The overall quality gain of 1.1 points suggests incremental refinement rather than transformative changes. Users should weigh the reasoning improvements against increased wait times when evaluating this model for production deployment.

Kalite

88.0

Gecikme p50

8,825 ms

Test çalıştırmaları

5

Perfect reasoning score achieved Coding remains exceptionally strong Latency increased 20% Factual performance needs improvement
Bölüm 10

Tam model profili

Claude Fable 5: test ettiğimiz en istikrarlı değerlendirici

Anthropic'in Claude Fable 5 modeli bir görü-ve-akıl yürütme modelidir ve en çok yaslandığımız çeşit — claude-fable-5[1m] — bir milyon token'lık bağlam penceresi taşır. Bir teknik föy okumayacağız. Bunun yerine çoğu yazının sunamadığını sunuyoruz: kendi ölçümlerimizden gelen, tarih ve örneklem büyüklüğü ekli rakamlar ve kanıtın inceldiği yere dair dürüst bir not.

Neden onu varsayılan görü öneren modelimiz yaptık

9 Haziran 2026'da bir görsel kalite-kontrol pilotu yürüttük — her birinde yakalanması gereken bilinen bir medya-kalite kusuru olan bir görsel kümesi, davranışlarını karşılaştırabilmek için birden çok görü modeline verildi. Fable 5, ham zekadan daha çok önem taşıyan bir nitelikle öne çıktı: istikrar.

Pilot küme üzerindeki tekrarlı çalışmalarda zamanın %88'inde çalışma-özdeşti, %3,9 fikir-değiştirme oranıyla — yani aynı görsel hakkında bir geçişten diğerine nadiren fikir değiştirdi. O kümede sıfır yanlış pozitif üretti: var olmayan kusurlar uydurmadı. Paneldeki diğer modellerin kaçırdığı kör noktaları da yakaladı.

İstikrar, bir öneren modelden tam da istenen şeydir. Bugün gerçek bir kusuru işaretleyip yarın aynı görseli görmezden gelen bir model, sürece kötü bir temel oluşturur. Her seferinde aynı yanıtı veren — ve boş yere alarm vermeyen — bir model ise bir hattın başına konabilir. Biz de öyle yaptık: Fable 5, görsel konsensüs panelimizdeki varsayılan görü öneren modeldir. (Pilota dayanarak alınmış bilinçli bir ürün kararı.) Metin-yargıç havuzlarımızda değildir — buradaki görevi görsellere bakmak, metin puanlamak değil.

Bugünün referansı: 300 görsel, canlı ölçüldü

Pilot küçük bir şeydir. Bu yüzden modeli daha büyük bir çalışmadan geçirdik ve sonucu canlı olarak görsel-QC kıyaslamamızda yayımlıyoruz.

10 Haziran 2026'da, 300 görsellik mediaqc-v3-2026-06-10 veri kümesine karşı Fable 5 tek başına şu sonucu aldı:

  • %66,9 duyarlılık — yakaladığı gerçek kusurların oranı. Çalışmanın en iyi tekil-model sonucuyla başa baştı.
  • %7,1 yanlış-alarm oranı — temiz bir görseli ne sıklıkta işaretlediği. Aynı çalışmadaki bir başka güçlü görü modeli bunun iki katından fazlasındaydı — bir QC adımının zaman kazandırması mı yoksa harcaması mı olacağını belirleyen tam da bu fark.
  • %60,3 sınıf-uyumlu — yalnızca kusuru yakalamakla kalmayıp doğru kategoriyi de adlandırdığı durumlar.

Tek başına üçte iki duyarlılık yararlıdır ama bitmiş bir hikâye değildir — tek bir model yerine panel çalıştırmamızın nedeni budur. Fable 5 konsensüs panelinde yer aldığında duyarlılık %87,5'e yükseldi. Önerenin istikrarı, kurula güvenilir bir temel verir; kurul, tek bir modelin açık bıraktığı boşluğu kapatır.

Akıl yürütme ve kod: erken, dürüst sinyal

En çok kanıta görüde sahibiz. Genel yetenek konusunda daha az — ve bunu açıkça söylüyoruz.

9 Haziran 2026'daki bir iç değerlendirmede — modeller üzerinde çalıştırdığımız 682 testlik bir koşum — Fable 5'in sonuçları alandan keskince ayrıldı: koşumun iki yarısında %91 ve %73 puan aldı; karşılaştırdığımız modeller ise aynı görevlerde %3 ve %0 aldı. Büyük bir fark; bunu kesin bir hüküm değil güçlü bir sinyal olarak ele alıyoruz, çünkü tek bir koşum bir modeli kayırabilir ya da cezalandırabilir.

Platformdaki ilk zeka koşumumuz, bugün, 100 akıl yürütme ve 97 kod puanı döndürdü. Ön sonuçlar — tek koşum, n=1. Bunları bildiriyoruz çünkü erken rakamları gizlemek kendi başına bir dürüstsüzlüktür, ama bir koşum bir koşumdur. Örneklem büyüdükçe sıralamayı izleyin.

1M-bağlam çeşidi ne işe yarar

claude-fable-5[1m] çeşidi, darboğazın akıl yürütme değil bağlam olduğu durumlar için vardır. Bu denli geniş bir pencere, uzun bir belge kümesini, büyük bir kaynak gövdesini ya da uzun bir etkileşimi modelin önünde bir kerede tutmanı sağlar — parçalayıp önemli bir şeyin gözden kaçmamasını ummak yerine. Görüyle birlikte, modelin hem çok sayıda materyal üzerinde akıl yürütmesi hem de içindeki gömülü görsellere bakması gereken işlere uyar — uzun raporlar, şekil içeren belge kümeleri, bağlam içindeki ekran görüntüleri.

Bu rakamlar nasıl okunmalı

Yukarıdaki her şey ölçülmüş, tarihlenmiş ve adını koyduğumuz bir örneklem büyüklüğüyle sınırlandırılmıştır. Görsel-QC pilotu küçüktü; 300 görsellik referans daha büyük ama tek günde tek bir veri kümesidir; akıl yürütme ve kod rakamları erkendir. Sana cilalı bir hikâye yerine bu dokuyu vermeyi tercih ederiz, çünkü cilalı hikâye genellikle bir sonraki koşumu atlatamaz.

Claude Fable 5, Tokonomix ağ geçidi ve kataloğu üzerinden erişilebilir. Onu kendi görsellerinin karşısına görsel-QC kıyaslamamızda koyabilir ya da görevler boyunca sıralamada izleyebilirsin.

Son otomatik test
14 Eyl 2026 · 20:02 UTC · Hız testi
P50 gecikme
2913 ms
P95 gecikme
3228 ms
Hatalar
0 / 6 çalıştırma
Son inceleyen Tokonomix Ekibi·10 Haziran 2026