İçeriğe geç
Seviye A — Öncü
Çalıştığı yer:USYapıldığı yer:United States

Kullanımdan kaldırma tarihi

Sağlayıcı 30 Haziran 2027 tarihini geçici bir kullanımdan kaldırma tarihi olarak belirtiyor. Model şu an her zamanki gibi kullanılabilir.

Anthropic

Claude Sonnet 5

Seviye A — Öncü · 1M token

Tokonomix Editöryel Ekibi·İnceleyen Mes Kalkan·
Bölüm 01

Hız analizi

Tüm benchmark çalıştırmalarında ölçülen gecikme. P50 (medyan) ve P95 (95. yüzdelik) normal ve yoğun yük altında yanıt hızının gerçekçi bir resmini verir.

P50 gecikme (medyan)P95 gecikme100 runs
8483324580082751075108-2109-14ms
Bölüm 02

Kalite puanları

Bu modelin her soru kategorisinde sahanın geri kalanına göre nerede durduğu; aynı sorular üzerinde ikili karşılaştırmayla hesaplanır. Ham jüri puanı her sayının altındadır.

54%
Kod üretimi
jüri ortalaması 93
89%
Yaratıcı
jüri ortalaması 92
53%
Olgusal
jüri ortalaması 73
65%
Çok dilli
jüri ortalaması 98
59%
Akıl yürütme
jüri ortalaması 75

Kategori başına kazanma oranı: bu modelin o kategoriden bir soruda ortalama bir modeli ne sıklıkla yendiği. %50 ortalamadır, kalma notu değildir. Doğru cevap yüzdesi de değildir.

Bölüm 03

Fiyatlar

Bu modeli Tokonomix üzerinden kullandığınızda milyon token başına ödediğiniz tutar ve tipik bir konuşma için tahmini maliyet.

💰
API tarifeleri — Claude Sonnet 5
$2.60 1M giriş token başına
$13.00 1M çıkış token başına
≈ $0.0042 tipik konuşma başına (800 token)
Giriş vs çıkış fiyatı (1M token başına)
1M giriş token başına$2.60
1M çıkış token başına$13.00
Bölüm 04

Saniye başına token

Ölçülen P50 gecikmesinden türetilen saniye başına token verimi. Yüksek daha iyidir; dalgalanmalar sağlayıcı tarafındaki yükü yansıtır.

Verim (token / s)187 / avg 160
23427

P50 gecikme × 200 çıkış token tahmininden hesaplandı — mutlak rakam bu varsayıma bağlıdır; önemli olan eğilimdir.

Bölüm 05

Yetenekler

toolssource: manualvisionjson modepdf inputreasoningjson schemaprompt cachingmax output tokens: 128000
Bölüm 06

Kullanılabilirlik

Kullanılabilirlik

Bu modelin çağrıldığında ne sıklıkla yanıt verdiği — son 30 gün içindeki gerçek API istekleri ve canlı testler üzerinden ölçülmüştür. Bu kaliteden bağımsızdır: bu sayılar yalnızca modelin yanıt verip vermediğini gösterir, yanıtın ne kadar iyi olduğunu değil.

Son 7 gün

100.0%

n=13

Son 30 gün

100.0%

n=13

Medyan yanıt süresi

30,020ms

n=13

Baz alınan 398 ölçüm son 30 gün içinde.

Teknik detaylar

Yalnızca gerçek API çağrıları ve canlı test istekleri sayılır — dahili yoklamalar ve kıyaslama çalıştırmaları hariçtir.

Özel API anahtarıyla (BYOK) yapılan çağrılar hariçtir: bu hatalar anahtara özgüdür, model kesintisinin işareti değildir.

Başarısız çağrılar kalite puanlarına DAHİL EDİLMEZ — kalite yalnızca başarılı yanıtlar üzerinden ölçülür. Kullanılabilirlik ve kalite bağımsız sinyallerdir.

Kaydedilmiş süreye sahip başarılı çağrılarda medyan yanıt süresi (p50). Aykırı değerler medyanı ortalamadan daha az etkiler.

Toplam çağrı (30d)

13

OK yanıtlar (30d)

13

Toplam çağrı (7d)

13

OK yanıtlar (7d)

13

Bölüm 07

Tokonomix kıyaslama kararları

⚖️
Endorsed by 1 judge
Independent LLM judges evaluated this model on our weekly intelligence tests
claude-sonnet-4-587/100 · 30 runs
26 correct1 partial3 wrong87% accuracy
2026-09-13

Claude Sonnet 5 quality drops 16 points with slower response times

Claude Sonnet 5 experienced a significant performance regression in this benchmark window. Overall quality declined from 93.2 to 77.3, representing a 15.9 point drop that affects most capabilities. The model maintained exceptional reasoning performance at a perfect 100 score, but coding ability decreased substantially from 95 to 81. Most concerning is the factual accuracy category, which scored just 52 compared to previous strong performance. Response latency also degraded, with the median increasing from 4.8 to 6.5 seconds, a 36% slowdown that will be noticeable to users. The benchmark categories shifted between windows, making direct comparison challenging for creative and multilingual tasks which were not retested. This change pattern suggests either a model update that traded accuracy for other characteristics, infrastructure issues affecting performance, or possible variations in test composition. Users relying on factual accuracy should exercise additional caution, while those prioritizing reasoning tasks may see less impact. The latency increase affects all use cases and may require timeout adjustments in production environments.

Kalite

77.3

Gecikme p50

6,457 ms

Test çalıştırmaları

5

Quality dropped 16 points Factual accuracy scored only 52 Response time increased 36% Reasoning remains perfect at 100
Bölüm 08

Tam model profili

Claude Sonnet 5: sadece yanıt vermek için değil, harekete geçmek için inşa edilen orta katman Claude

Claude Sonnet 5, Anthropic'in orta katman modelidir; Sonnet 4.6'nın halefi olarak 30 Haziran 2026'da piyasaya sürülmüştür. Anthropic bunu şirketin şimdiye kadar gönderdiği en ajan (agentic) Sonnet olarak konumlandırıyor: bir görevi planlamak, tarayıcı veya terminal gibi araçları kullanmak ve önceki Sonnet nesillerinin ihtiyaç duyduğundan daha az adım adım denetimle çok adımlı bir işi ileriye taşımak için tasarlanmış bir model. Anthropic'in kendi konumlandırması, Sonnet 5'in Sonnet katmanında kalırken amiral gemisi Opus hattına olan farkın büyük kısmını kapattığı yönünde.

Öne çıktığı noktalar

Model, tek turluk sohbetten çok sürdürülen araç kullanımı etrafında inşa edilmiştir. Fonksiyon çağırmayı, bir şemaya karşı yapılandırılmış JSON çıktısını, PDF girdisini ve görüntüyü destekler; ayrıca yanıt vermeden önce bir sorunu çözebilmesi için bir akıl yürütme modu sunar. Bu kombinasyon ajan iş akışlarına iyi uyuyor: bir belgeyi okumayı, bir aracı çağırmayı, sonucu kontrol etmeyi ve sonraki adıma karar vermeyi gerektiren bir görev, Anthropic'in bu sürümün hedeflediğini söylediği tam olarak bu şekildir. Anthropic, bilgisayar kullanımı kıyaslaması olan OSWorld-Verified'da %78,5 ve modelin araç kullanmasına izin verildiğinde Humanity's Last Exam'de %46,8 bildiriyor — her ikisi de Anthropic'in kendi yayımladığı rakamlardır, bağımsız olarak yeniden üretilmiş sayılar değildir; dolayısıyla tarafsız bir üçüncü taraf sonucundan çok, satıcının modelin ilerlemesine dair kendi anlatımını yansıtırlar.

Kaputun altında

Sonnet 5, yanıt başına en fazla 128.000 token senkron çıktıyla birlikte 1.000.000 tokenlik bir bağlam penceresi taşıyor. Çıktı yalnızca metindir — Sonnet'in bu nesli görüntü veya ses üretmez. Prompt önbellekleme desteklenir; bu, aynı oturumun birçok turunda büyük, büyük ölçüde değişmeyen bir bağlamı (bir kod tabanı, uzun bir belge, bir araç şeması) tekrar tekrar gönderen ajan döngüleri için önemlidir.

Nerede zayıf kalıyor

Anthropic'in bu sürüme ilişkin kendi duyurusu bir bilgi kesim tarihi belirtmiyor; bu nedenle modele çok yakın tarihli olaylar veya yeni yayımlanmış kütüphaneler için güvenenlerin varsaymak yerine doğrulaması gerekir. Modelin güçlü yönleri araç kullanan, çok adımlı işlerde yoğunlaşmıştır; kısa tek turluk sorular veya basit sınıflandırma için ajan makinesi fayda değil yük getirir ve aynı ailedeki daha hafif bir model genellikle aynı derecede iyi yanıt verecektir. Anthropic'in kendi kıyaslama iddiaları da, satıcı kendi modelini test ettiği için, kesin değil yol gösterici olarak ele alınmayı hak eder — Sonnet 4.6'ya göre iyileşmenin ölçeği, bağımsız iş yüklerine karşı doğrulanana kadar Anthropic'in kendi tanımlamasıdır.

Ne zaman tercih edilmeli

Sonnet 5; kodlama ajanları, araştırma ajanları ve modelin her adımda bir insan tarafından yeniden yönlendirilmeden birkaç araç çağrısı boyunca çalışmaya devam etmesi gereken her iş akışı için uygundur — başarısız olan bir test paketini hata ayıklamak, çok dosyalı bir yeniden yapılandırmayı ilerletmek veya baştan sona bir tarama-ve-özetleme görevini yürütmek gibi. Ayrıca araç kullanımıyla birlikte gerçekten büyük bir bağlam penceresine ihtiyaç duyan iş yükleri için de uygundur; örneğin büyük bir kod tabanını veya uzun bir belge kümesini tek bir oturumda incelemek.

Bu özerkliğe ihtiyaç duymayan işler için — kısa biçimli üretim, basit çıkarım, tek çağrılık sınıflandırma — ajan yükü hiçbir yararlı iş yapmaz ve daha küçük, daha hızlı bir model genellikle daha mantıklı varsayılan seçim olur.

Karşılaştırmaya değer alternatifler

Anthropic'in kendi ürün yelpazesinde, Claude Opus 5 en karmaşık ajan ve kurumsal işler için amiral gemisi olarak Sonnet 5'in üzerinde yer alır ve Claude Fable 5 da Anthropic'in geniş çapta yayımladığı en yetenekli modeli olarak onun da üzerinde yer alır — bir iş yükünün Sonnet 5'in sağladığından daha fazla alana ihtiyaç duyduğu ortaya çıkarsa her ikisi de seçenektir. Anthropic'in kendi konumlandırması Sonnet 5'i birçok görevde Opus sınıfı performansa yaklaşan bir model olarak sunuyor; bu da daha büyük bir modele geçmeden önce buradan başlamayı mantıklı kılıyor ve yalnızca iş yükü ekstra kapasiteye ihtiyaç duyduğunu özellikle gösterdiğinde bir üst seviyeye çıkmayı öneriyor.

Devreye alma notları

Sonnet 5 uzun, araç ağırlıklı oturumlar etrafında inşa edildiği için, entegrasyonlar tek bir istek/yanıt alışverişi yerine çok turlu araç çağrısı döngülerini beklemeli ve yönetebilmelidir — zaman aşımları, yeniden deneme mantığı ve araç sonucu biçimlendirmesinin tümü, tamamlanması birkaç tur sürebilecek bir görevi hesaba katmalıdır. 128.000 tokenlik çıktı tavanı cömerttir ama sonludur; tek bir çağrının büyük, üretilmiş bir eserin tamamını döndürmesini bekleyen bir iş akışı, üretimde buna güvenmeden önce bunun bu sınırın altına sığdığını doğrulamalıdır.

Son otomatik test
14 Eyl 2026 · 20:02 UTC · Hız testi
P50 gecikme
1067 ms
P95 gecikme
1416 ms
Hatalar
0 / 6 çalıştırma
Son inceleyen Tokonomix Ekibi·14 Eylül 2026