İçeriğe geç
Seviye A — Öncü
Çalıştığı yer:USYapıldığı yer:United States

Kullanımdan kaldırma tarihi

Sağlayıcı 24 Temmuz 2027 tarihini geçici bir kullanımdan kaldırma tarihi olarak belirtiyor. Model şu an her zamanki gibi kullanılabilir.

Anthropic

Claude Opus 5

Seviye A — Öncü · 1M token

Tokonomix Editöryel Ekibi·İnceleyen Mes Kalkan··
Bölüm 01

Hız analizi

Tüm benchmark çalıştırmalarında ölçülen gecikme. P50 (medyan) ve P95 (95. yüzdelik) normal ve yoğun yük altında yanıt hızının gerçekçi bir resmini verir.

P50 gecikme (medyan)P95 gecikme100 runs
97141197267104141356208-2109-14ms
Bölüm 02

Kalite puanları

Bu modelin her soru kategorisinde sahanın geri kalanına göre nerede durduğu; aynı sorular üzerinde ikili karşılaştırmayla hesaplanır. Ham jüri puanı her sayının altındadır.

31%
Kod üretimi
jüri ortalaması 69
86%
Yaratıcı
jüri ortalaması 92
53%
Olgusal
jüri ortalaması 86
41%
Çok dilli
jüri ortalaması 88
55%
Akıl yürütme
jüri ortalaması 88

Kategori başına kazanma oranı: bu modelin o kategoriden bir soruda ortalama bir modeli ne sıklıkla yendiği. %50 ortalamadır, kalma notu değildir. Doğru cevap yüzdesi de değildir.

Bölüm 03

Fiyatlar

Bu modeli Tokonomix üzerinden kullandığınızda milyon token başına ödediğiniz tutar ve tipik bir konuşma için tahmini maliyet.

💰
API tarifeleri — Claude Opus 5
$6.50 1M giriş token başına
$32.50 1M çıkış token başına
≈ $0.0104 tipik konuşma başına (800 token)
Giriş vs çıkış fiyatı (1M token başına)
1M giriş token başına$6.50
1M çıkış token başına$32.50
Bölüm 04

Saniye başına token

Ölçülen P50 gecikmesinden türetilen saniye başına token verimi. Yüksek daha iyidir; dalgalanmalar sağlayıcı tarafındaki yükü yansıtır.

Verim (token / s)107 / avg 133
20419

P50 gecikme × 200 çıkış token tahmininden hesaplandı — mutlak rakam bu varsayıma bağlıdır; önemli olan eğilimdir.

Bölüm 05

Yetenekler

toolssource: manualvisionjson modepdf inputreasoningjson schemaprompt cachingmax output tokens: 128000
Bölüm 06

Kullanılabilirlik

Kullanılabilirlik

Bu modelin çağrıldığında ne sıklıkla yanıt verdiği — son 30 gün içindeki gerçek API istekleri ve canlı testler üzerinden ölçülmüştür. Bu kaliteden bağımsızdır: bu sayılar yalnızca modelin yanıt verip vermediğini gösterir, yanıtın ne kadar iyi olduğunu değil.

Son 7 gün

88.6%

n=44

Son 30 gün

91.7%

n=72

Medyan yanıt süresi

25,106ms

n=66

Baz alınan 457 ölçüm son 30 gün içinde.

Teknik detaylar

Yalnızca gerçek API çağrıları ve canlı test istekleri sayılır — dahili yoklamalar ve kıyaslama çalıştırmaları hariçtir.

Özel API anahtarıyla (BYOK) yapılan çağrılar hariçtir: bu hatalar anahtara özgüdür, model kesintisinin işareti değildir.

Başarısız çağrılar kalite puanlarına DAHİL EDİLMEZ — kalite yalnızca başarılı yanıtlar üzerinden ölçülür. Kullanılabilirlik ve kalite bağımsız sinyallerdir.

Kaydedilmiş süreye sahip başarılı çağrılarda medyan yanıt süresi (p50). Aykırı değerler medyanı ortalamadan daha az etkiler.

Toplam çağrı (30d)

72

OK yanıtlar (30d)

66

Toplam çağrı (7d)

44

OK yanıtlar (7d)

39

Bölüm 07

Tokonomix kıyaslama kararları

⚖️
Endorsed by 2 judges
Independent LLM judges evaluated this model on our weekly intelligence tests
cohere/command-a100/100 · 1 runs
1 correct0 partial0 wrong100% accuracy
claude-sonnet-4-583/100 · 38 runs
29 correct4 partial5 wrong76% accuracy
2026-09-13

Claude Opus 5 shows quality decline, particularly in coding performance

Claude Opus 5's overall quality score has dropped to 85.3 from 92.0 in the previous benchmark window, representing a 6.7 point decline. The most significant regression appears in coding performance, which fell from 92 to 64, a substantial 28-point decrease that suggests potential issues with code generation or analysis capabilities. Factual accuracy remains a bright spot, achieving a perfect 100 score, while reasoning performance stayed strong at 92. The model's latency has increased slightly from 8541ms to 9811ms at the median, representing about 15% slower response times. The current benchmark window includes fewer test runs (4 versus 5), though this should not materially affect score validity. The previous window included creative and multilingual category testing, which were not evaluated in the current window, making direct comparison limited to the available categories. Users relying on Claude Opus 5 for coding tasks should exercise additional caution and validation, while those focused on factual retrieval and reasoning can expect continued strong performance. The quality decline warrants monitoring in subsequent benchmark windows to determine if this represents a temporary anomaly or a sustained trend.

Kalite

85.3

Gecikme p50

9,811 ms

Test çalıştırmaları

4

Coding score dropped 28 points Overall quality down 6.7 points Latency increased 15 percent Factual accuracy remains perfect
Bölüm 08

Tam model profili

Claude Opus 5 — model derinlemesine inceleme

Claude Opus 5, Anthropic'in Opus serisindeki yeni amiral gemisi modeldir; 24 Temmuz 2026'da Opus 4.8'in halefi olarak yayınlandı. Anthropic bu modeli "karmaşık agentic kodlama ve kurumsal iş için" konumlandırıyor ve artık Anthropic'in kendi kodlama ajanı olan Claude Code'daki varsayılan model. Claude API (model kimliği claude-opus-5), Amazon Bedrock, Google Cloud Vertex AI, Microsoft Foundry ve Claude Platform on AWS üzerinden erişilebiliyor.

Fiyat ve bağlam penceresi

Anthropic'e göre "Opus 5, Fable 5'in birçok yeteneğini yarı fiyatına eşliyor" — bu, bağımsız olarak doğrulanmamış, Anthropic'in kendi ifadesidir. Bağlam penceresi 1.000.000 token'a ulaşıyor; senkron bir çağrıda azami çıkış 128 bin token — büyük kod tabanlarını veya uzun belge kümelerini tek bir bağlamda kapsamaya yetecek kadar.

Adaptive thinking ve bilgi kesim tarihi

Eski genişletilmiş düşünme mekanizmasının elle ayarlanan budget_tokens parametresi yerine Opus 5, beş kademeli bir effort parametresiyle yönetilen adaptive thinking kullanıyor: low, medium, high, xhigh ve max (varsayılan: high). Eğitim verisi güvenilir biçimde Mayıs 2026'ya kadar uzanıyor — Anthropic'e göre şu anda sunulan tüm Claude modelleri arasında en güncel kesim tarihi.

Uzun soluklu özerklik

Anthropic'in Opus 5 için öne çıkardığı temel iddia, uzun ve gözetimsiz görevlerde dayanıklılıkla ilgili: saatlerce bağımsız çalışabilme, kendi hatalarından toparlanabilme, tıkanma noktalarında durmak yerine etrafından dolaşabilme ve kendi işini ara ara denetleyebilme. Anthropic bunu kendi rakamlarıyla destekliyor: Frontier-Bench v0.1'de %43,3 (Opus 4.8'de %18,7'ye karşılık) ve DeepSWE v1.1'de %68,8 (Opus 4.8'de %59,0'a karşılık). Bunlar Anthropic'in kendi yayımladığı sonuçlardır, Tokonomix tarafından bağımsız olarak yeniden üretilmemiştir.

Daha iyi muhakeme

Anthropic ayrıca daha iyi muhakemeyi öne çıkarıyor: model, belirsiz bir talimat karşısında tahmin yürütmeden önce daha sık açıklayıcı soru soruyor, hatalı veya eksik tanımlanmış bir talimatı harfiyen uygulamak yerine daha sık itiraz ediyor ve bir değişikliği uygulamadan önce sonuçlarını daha sık değerlendiriyor. Anthropic bu davranış için nicel bir ölçüm yayımlamıyor — bu, niteliksel olarak tarif edilen bir tasarım amacı.

Opus 5'i ne zaman seçmeli

Anthropic, Opus 5'i karmaşık agentic kodlama ve kurumsal görevler için yeni varsayılan seçim, kendi ifadesiyle birçok alanda benzer yeteneklere sahip olduğu Fable 5'e göre daha ucuz alternatif olarak konumlandırıyor. Daha basit işler için — kısa sohbetler, sınıflandırma, hafif çıkarım — daha küçük ve daha ucuz bir model genellikle daha maliyet etkin seçim olmaya devam ediyor; Opus 5, yüksek hacimli basit işler için değil, uzun süreli, karmaşık ve yüksek riskli işler için tasarlandı.

Tokonomix'te kullanılabilirlik

Claude Opus 5, Tokonomix'te claude-opus-5 slug'ı altında, tier A, Anthropic direct üzerinden ABD'de barındırılıyor olarak listelenmiştir. Tokonomix'in kendi test koşucularından bağımsız kıyaslama puanları bu model için henüz mevcut değil — model bir sonraki test döngüsüne dahil edildiğinde bu sayfada otomatik olarak görünecektir.

Son otomatik test
14 Eyl 2026 · 20:02 UTC · Hız testi
P50 gecikme
1862 ms
P95 gecikme
2597 ms
Hatalar
0 / 6 çalıştırma
Son inceleyen Tokonomix Ekibi·15 Eylül 2026