Anthropic'in Claude Fable 5 modeli bir görü-ve-akıl yürütme modelidir ve en çok yaslandığımız çeşit — claude-fable-5[1m] — bir milyon token'lık bağlam penceresi taşır. Bir teknik föy okumayacağız. Bunun yerine çoğu yazının sunamadığını sunuyoruz: kendi ölçümlerimizden gelen, tarih ve örneklem büyüklüğü ekli rakamlar ve kanıtın inceldiği yere dair dürüst bir not.
Neden onu varsayılan görü öneren modelimiz yaptık
9 Haziran 2026'da bir görsel kalite-kontrol pilotu yürüttük — her birinde yakalanması gereken bilinen bir medya-kalite kusuru olan bir görsel kümesi, davranışlarını karşılaştırabilmek için birden çok görü modeline verildi. Fable 5, ham zekadan daha çok önem taşıyan bir nitelikle öne çıktı: istikrar.
Pilot küme üzerindeki tekrarlı çalışmalarda zamanın %88'inde çalışma-özdeşti, %3,9 fikir-değiştirme oranıyla — yani aynı görsel hakkında bir geçişten diğerine nadiren fikir değiştirdi. O kümede sıfır yanlış pozitif üretti: var olmayan kusurlar uydurmadı. Paneldeki diğer modellerin kaçırdığı kör noktaları da yakaladı.
İstikrar, bir öneren modelden tam da istenen şeydir. Bugün gerçek bir kusuru işaretleyip yarın aynı görseli görmezden gelen bir model, sürece kötü bir temel oluşturur. Her seferinde aynı yanıtı veren — ve boş yere alarm vermeyen — bir model ise bir hattın başına konabilir. Biz de öyle yaptık: Fable 5, görsel konsensüs panelimizdeki varsayılan görü öneren modeldir. (Pilota dayanarak alınmış bilinçli bir ürün kararı.) Metin-yargıç havuzlarımızda değildir — buradaki görevi görsellere bakmak, metin puanlamak değil.
Bugünün referansı: 300 görsel, canlı ölçüldü
Pilot küçük bir şeydir. Bu yüzden modeli daha büyük bir çalışmadan geçirdik ve sonucu canlı olarak görsel-QC kıyaslamamızda yayımlıyoruz.
10 Haziran 2026'da, 300 görsellik mediaqc-v3-2026-06-10 veri kümesine karşı Fable 5 tek başına şu sonucu aldı:
- %66,9 duyarlılık — yakaladığı gerçek kusurların oranı. Çalışmanın en iyi tekil-model sonucuyla başa baştı.
- %7,1 yanlış-alarm oranı — temiz bir görseli ne sıklıkta işaretlediği. Aynı çalışmadaki bir başka güçlü görü modeli bunun iki katından fazlasındaydı — bir QC adımının zaman kazandırması mı yoksa harcaması mı olacağını belirleyen tam da bu fark.
- %60,3 sınıf-uyumlu — yalnızca kusuru yakalamakla kalmayıp doğru kategoriyi de adlandırdığı durumlar.
Tek başına üçte iki duyarlılık yararlıdır ama bitmiş bir hikâye değildir — tek bir model yerine panel çalıştırmamızın nedeni budur. Fable 5 konsensüs panelinde yer aldığında duyarlılık %87,5'e yükseldi. Önerenin istikrarı, kurula güvenilir bir temel verir; kurul, tek bir modelin açık bıraktığı boşluğu kapatır.
Akıl yürütme ve kod: erken, dürüst sinyal
En çok kanıta görüde sahibiz. Genel yetenek konusunda daha az — ve bunu açıkça söylüyoruz.
9 Haziran 2026'daki bir iç değerlendirmede — modeller üzerinde çalıştırdığımız 682 testlik bir koşum — Fable 5'in sonuçları alandan keskince ayrıldı: koşumun iki yarısında %91 ve %73 puan aldı; karşılaştırdığımız modeller ise aynı görevlerde %3 ve %0 aldı. Büyük bir fark; bunu kesin bir hüküm değil güçlü bir sinyal olarak ele alıyoruz, çünkü tek bir koşum bir modeli kayırabilir ya da cezalandırabilir.
Platformdaki ilk zeka koşumumuz, bugün, 100 akıl yürütme ve 97 kod puanı döndürdü. Ön sonuçlar — tek koşum, n=1. Bunları bildiriyoruz çünkü erken rakamları gizlemek kendi başına bir dürüstsüzlüktür, ama bir koşum bir koşumdur. Örneklem büyüdükçe sıralamayı izleyin.
1M-bağlam çeşidi ne işe yarar
claude-fable-5[1m] çeşidi, darboğazın akıl yürütme değil bağlam olduğu durumlar için vardır. Bu denli geniş bir pencere, uzun bir belge kümesini, büyük bir kaynak gövdesini ya da uzun bir etkileşimi modelin önünde bir kerede tutmanı sağlar — parçalayıp önemli bir şeyin gözden kaçmamasını ummak yerine. Görüyle birlikte, modelin hem çok sayıda materyal üzerinde akıl yürütmesi hem de içindeki gömülü görsellere bakması gereken işlere uyar — uzun raporlar, şekil içeren belge kümeleri, bağlam içindeki ekran görüntüleri.
Bu rakamlar nasıl okunmalı
Yukarıdaki her şey ölçülmüş, tarihlenmiş ve adını koyduğumuz bir örneklem büyüklüğüyle sınırlandırılmıştır. Görsel-QC pilotu küçüktü; 300 görsellik referans daha büyük ama tek günde tek bir veri kümesidir; akıl yürütme ve kod rakamları erkendir. Sana cilalı bir hikâye yerine bu dokuyu vermeyi tercih ederiz, çünkü cilalı hikâye genellikle bir sonraki koşumu atlatamaz.
Claude Fable 5, Tokonomix ağ geçidi ve kataloğu üzerinden erişilebilir. Onu kendi görsellerinin karşısına görsel-QC kıyaslamamızda koyabilir ya da görevler boyunca sıralamada izleyebilirsin.