İçeriğe geç
Seviye B — Üretim
Çalıştığı yer:USYapıldığı yer:United States
Anthropic

Claude Opus 4.6

Seviye B — Üretim · 200K token

Tokonomix Editöryel Ekibi·İnceleyen Mes Kalkan··

Claude Opus 4.6, Anthropic tarafından geliştirilen ve şirketin Claude 4 serisindeki en yetenekli kademeyi temsil eden büyük bir dil modelidir. Karmaşık akıl yürütme görevleri, kapsamlı analiz ve bağlam ile talimatların ince ayrıntılarıyla kavranmasını gerektiren uygulamalar için tasarlanmıştır. Model; teknik yazım, kod üretimi, matematiksel akıl yürütme ve birden fazla alanda ayrıntılı soru yanıtlama dahil olmak üzere geniş bir metin tabanlı görev yelpazesini ele alır. Model, 200,000 token'lık bir bağlam penceresine sahip olup tek bir etkileşimde uzun belgeler, kod tabanları veya kapsamlı geçmişe sahip çok turlu görüşmeler gibi önemli miktarda metni işleyebilmesini sağlar. Bu genişletilmiş bağlam kapasitesi, modeli belge analizi, araştırma sentezi ve geniş bilgi gövdelerine başvuruyu gerektiren görevler için uygun kılar. Claude Opus 4.6, çok modlu özellikler olmadan metin girdilerini işleyerek metin çıktıları üreten standart metin üretim yeteneklerini destekler. Anthropic'in model yelpazesinde Opus, Claude 4 serisindeki Sonnet ve Haiku varyantlarının üzerinde konumlanan en yüksek performans kademesini işgal eder. Özellikle karmaşık problem çözme, ayrıntılı talimat takibi veya sofistike içerik üretimini içeren, azami yeteneğin önceliklendirildiği kullanım senaryoları için tasarlanmıştır. Model, yardımsever, zararsız ve dürüst yapay zeka sistemleri oluşturmayı hedefleyen Anthropic'in Anayasal Yapay Zeka eğitim yaklaşımındaki sürekli gelişimini yansıtır.

Anthropic'in güvenlik odaklı mimarisi, bu modeli karmaşık görevlerde güvenilir kılıyor.

Tokonomix benchmark özeti
Bölüm 01

Hız analizi

Tüm benchmark çalıştırmalarında ölçülen gecikme. P50 (medyan) ve P95 (95. yüzdelik) normal ve yoğun yük altında yanıt hızının gerçekçi bir resmini verir.

P50 gecikme (medyan)P95 gecikme101 runs
1249612110993158642073607-0507-30ms
Bölüm 02

Kalite puanları

Çeşitli görev kategorilerinde yargıç modelin puanlarından elde edilen değerlendirme sonuçları. Puanlar tutarlılık, doğruluk ve talimat takibini yansıtır.

99
Yaratıcı
94
Olgusal
100
Çok dilli
100
Akıl yürütme
Bölüm 03

Fiyat geçmişi

Milyon token başına doğrudan sağlayıcı tarifeleri, artı tipik bir konuşma maliyet tahmini.

💰
API tarifeleri — Claude Opus 4.6
$5.00 1M giriş token başına
$25.00 1M çıkış token başına
≈ $0.0080 tipik konuşma başına (800 token)
Giriş vs çıkış fiyatı (1M token başına)
1M giriş token başına$5.00
1M çıkış token başına$25.00

Pricing over time

Input & output per 1M tokens · step-line = price changes

$5.00

input / 1M

— stable

$25.00

output / 1M

— stable

2026-05-242026-06-282026-07-26
Input
Output
Price change
⟳ synced weekly
Bölüm 04

Saniye başına token

Ölçülen P50 gecikmesinden türetilen saniye başına token verimi. Yüksek daha iyidir; dalgalanmalar sağlayıcı tarafındaki yükü yansıtır.

Verim (token / s)13 / avg 99
15911

P50 gecikme × 200 çıkış token tahmininden hesaplandı — mutlak rakam bu varsayıma bağlıdır; önemli olan eğilimdir.

Bölüm 05

Güçlü & zayıf yönler

Benchmark sonuçları ve gerçek kullanım senaryolarına dair toplu topluluk geri bildirimine dayanır.

Güçlü yönler

200K token uzun bağlamConstitutional AI güvenlik katmanıKarmaşık talimat takibiDerin analiz ve nüanslı çıktıUzun belge işleme kapasitesiMetin üretimi ve özetleme

Zayıf yönler

İnternet erişimi bulunmuyorGörsel işleme desteği yokBilgi kesim tarihi sonrası veri yok
Bölüm 06

Yetenekler

toolssource: litellmvisionjson modepdf inputreasoningjson schemaprompt cachingmax output tokens: 128000
Bölüm 07

Sık sorulan sorular

Metin üretimi, içerik oluşturma, soru-cevap ve özetleme görevlerini destekleyen geniş bir uygulama yelpazesi sunuyor.

Constitutional AI eğitim yöntemi zararlı çıktıları minimize eder ve uzun vadeli kullanım güvenliğini artırır.

Tokonomix benchmark özeti
Bölüm 08

Kullanılabilirlik

Kullanılabilirlik

Bu modelin çağrıldığında ne sıklıkla yanıt verdiği — son 30 gün içindeki gerçek API istekleri ve canlı testler üzerinden ölçülmüştür. Bu kaliteden bağımsızdır: bu sayılar yalnızca modelin yanıt verip vermediğini gösterir, yanıtın ne kadar iyi olduğunu değil.

Son 7 gün

Son 30 gün

100.0%

n=29

Medyan yanıt süresi

16,281ms

n=29

Baz alınan 409 ölçüm son 30 gün içinde.

Teknik detaylar

Yalnızca gerçek API çağrıları ve canlı test istekleri sayılır — dahili yoklamalar ve kıyaslama çalıştırmaları hariçtir.

Özel API anahtarıyla (BYOK) yapılan çağrılar hariçtir: bu hatalar anahtara özgüdür, model kesintisinin işareti değildir.

Başarısız çağrılar kalite puanlarına DAHİL EDİLMEZ — kalite yalnızca başarılı yanıtlar üzerinden ölçülür. Kullanılabilirlik ve kalite bağımsız sinyallerdir.

Kaydedilmiş süreye sahip başarılı çağrılarda medyan yanıt süresi (p50). Aykırı değerler medyanı ortalamadan daha az etkiler.

Toplam çağrı (30d)

29

OK yanıtlar (30d)

29

Toplam çağrı (7d)

0

OK yanıtlar (7d)

0

Bölüm 09

Tokonomix kıyaslama kararları

⚖️
Endorsed by 2 judges
Independent LLM judges evaluated this model on our weekly intelligence tests
cohere/command-a100/100 · 1 runs
1 correct0 partial0 wrong100% accuracy
claude-sonnet-4-598/100 · 115 runs
114 correct1 partial0 wrong99% accuracy
2026-07-26

Claude Opus 4.6 expands capabilities with tools, vision, and reasoning

Claude Opus 4.6 introduces significant new capabilities including tool use, vision processing, JSON mode and schema support, PDF input handling, reasoning features, and prompt caching. These additions represent a substantial expansion of the model's functionality beyond text-only interactions. However, no benchmark performance data is available for this window, making it impossible to assess the model's actual performance on standard evaluation tasks. Without metrics on accuracy, reasoning quality, coding ability, or comparative performance against other models, users should approach this release with the understanding that capability additions don't automatically translate to performance improvements. The lack of benchmark data means we cannot verify claims about the quality of vision understanding, tool use reliability, or reasoning effectiveness. Users interested in these new features will need to conduct their own testing to determine if the model meets their specific requirements. The addition of prompt caching suggests potential efficiency improvements for certain use cases, but again, without performance data, the practical impact remains unclear.

Quality

Latency p50

Test runs

0

Added vision and PDF support New tool use capabilities Reasoning and caching features
Bölüm 10

Tam model profili

Claude Opus 4.6 — illustration 1
Claude Opus 4.6: hattı sessizce tutan ara Opus

Claude Opus 4.6 (claude-opus-4-6), Anthropic amiral gemisi serisinde 4.5 ile 4.7 arasına oturan anlık görüntüdür. İki yüz bin token context window. Metin ve görüntü girişi. 4.x ailesinin geri kalanıyla aynı giriş yüzeyi.

Çoğu ekibin 4.5'ten uzun context'li 4.7'ye yükseltirken atladığı model. Aynı zamanda, milyon token penceresinin 4.7'de getirdiği gecikme profili değişikliğini istemeksizin 4.5 sonrası iyileştirmeleri isteyen hatırı sayılır bir grubun prodüksiyon trafiğini sessizce taşıdığı model.

4.5 ile 4.6 arasında ne değişti

Anthropic'in 4.6 sürüm notları, başlık yaratacak akıl yürütme iyileştirmeleri yerine tool-use cilası ve yapılandırılmış çıktı tutarlılığını ön plana çıkardı. Pratikte bu şu anlama geldi:

  • 4.5'in zaman zaman alan adlarında saptığı karmaşık iç içe şemalarda daha temiz JSON şema uyumu.
  • Biraz daha sıkı reddetme tutumu — 4.5'in işaretlediği zararsız prompt'larda daha az aşırı reddetme.
  • System prompt ve kullanıcı prompt'u çakışan talimatlar içerdiğinde daha tahmin edilebilir davranış. Önceki Opus anlık görüntüleri system prompt'u daha agresif biçimde önceliklendirirdi; 4.6 bunları daha dikkatli tartar ve çoğunlukla sessizce seçmek yerine açıklama ister.

Bunların hiçbiri başlık rakamları değil. Tümü, on bin istek başına arızaları sayarken ajan döngüsünü ölçekte çalıştırdığınızda önem taşıyor.

200k context, dikkat ve nerede eğildiği

Opus 4.6, 4.5'teki 200.000 token penceresini koruyor ve yaklaşık aynı dikkat profilini miras aldı. Tamponun ön kısmında iyi tutuyor. Ortada makul biçimde tutuyor. Modelin bağlamın ortasına gömülü gerçekleri kaçırma olasılığının arttığı 150k token girişinin ötesinde zayıflamaya başlıyor.

Pencerenin içine rahatça sığan iş yükleri için 4.6 iyi bir seçim. Düzenli olarak 150k tokenin ötesine geçen iş yükleri için, Opus 4.7 daha iyi derinlik dikkatiyle milyon token penceresi sunuyor ve doğal yükseltme hedefi o. Güncel gecikme karşılaştırması /benchmarks/speed sayfasında.

İşini yapan görüntü girişi

4.6'daki görüntü yetenekleri 4.5'ten anlamlı biçimde değişmedi. Belge ekran görüntüleri, taranmış PDF'ler, pano yakaları, diyagramlar — model bunları metne gösterdiği özenle okuyor. Tablo çıkarımı temiz. Grafik tanımları, etiketler tam çözünürlükte okunabilir olduğunda doğru.

Aynı zayıf noktalar geçerli. El yazısı tutarsız. Küçük eksen etiketli yoğun bilimsel şekiller kısmen yanlış okunuyor. Bir insanın yakınlaştırması gerekecek her şey, döngüde insan doğrulama adımından yararlanıyor.

Sahada ne durumda

2026 ortasında Opus 4.6 için rekabet tablosu, birden fazla rakip seçenek arasında orta konumda oturduğundan gerçekten ilginç.

Daha yeni Anthropic Opus anlık görüntülerine karşı: Opus 4.7, uzun context avantajına sahip ve gecikme profili değişikliğini karşılayabiliyorsanız daha iyi seçim. İkisi, 200k altı iş yükleri için tercih büyük ölçüde yetenek değil operasyonel kararla belirleniyor.

GPT-5 ve Gemini 3 Pro Preview'a karşı: Opus 4.6, kategoriye göre dönüşümlü zaferler paylaşıyor. Reddetme tutarlılığı, Avrupalı dillerde idari düzyazı ve yapılandırılmış çıktı güvenilirliğinde kazanıyor. Kısa konuşmalı durumlarda ham hız ve görüntülerin ötesinde yerel çok modalite girişinde kaybediyor. Kategori bazındaki tablo /benchmarks/leaderboard sayfasında.

Dürüst çerçeveleme: 2026'da sıfırdan seçim yapıyorsanız Opus 4.7 genellikle başlanacak doğru Opus. Opus 4.6, mevcut dağıtımınız 4.5 üzerindeyse ve iki adım yerine tek adım yükseltme istiyorsanız ya da 4.7'nin gecikme profilinden kaçınmak için özel nedenleriniz varsa mantıklı.

Yanlış araç olduğu durumlar

200k tokenden fazla context gerektiren iş yükleri. Opus 4.7 tam bu durum için var.

Yüksek hacimli ucuz sınıflandırma. Milyonlarca kısa prompt göndermek için amiral gemisi hesaplama yanlış bütçe kullanımı. Claude Haiku 4.5 veya küçük Gemini Flash varyantlarından biri, basit görevlerde anlamlı kalite kaybı olmaksızın bunu farklı bir maliyet katmanında yapıyor.

Gerçek zamanlı ses. Opus 4.6'da audio girişi yok. Önüne bir transkripsiyon modeli koyun ya da /usecases/voice sayfasındaki ses hattı anketine bakın.

Çok hızlı gelişen framework'lerde kod üretimi. Opus muhafazakâr; ayrıntılı, savunmacı kod yazıyor. IDE uyumlu çalışmada deyimsel çıktı güvenlilikten daha önemliyse /usecases/code sayfasındaki model karşılaştırması alternatifleri kapsıyor.

Kendi kendinize barındırma veya denetimli ince ayar. Anthropic ağırlık dağıtmıyor ve Opus katmanında ince ayar sunmuyor. Bu kısıtlamalar geçerliyse /usecases/local anketi doğru başlangıç noktası.

Dağıtım notları

Standart Anthropic API. REST. Streaming. System prompt'lar beklenen biçimde davranıyor. Tool-use çağrı kalitesi, savunmacı parsing yazmaksızın prodüksiyon ajanı inşa etmeye yetecek kadar yüksek.

Veri yerleşimi tablosu, Claude serisinin geri kalanıyla aynı. Inference AWS ve Google Cloud üzerinde çalışıyor; public API bölge seçim parametresi sunmuyor. AB yerleşimi, bir ayar değil kurumsal sözleşme müzakeresi gerektiriyor. Zorunlu yerleşim kısıtlamaları için /usecases/local sayfasındaki OVH-hosted açık ağırlıklı seçeneklere bakın.

Günlükler varsayılan olarak kötüye kullanım izleme için otuz gün saklanıyor. API girişleri opt-in olmadıkça eğitimde kullanılmıyor. Sıfır saklama kurumsal sözleşme maddesi.

Tercih kriteri

Claude Opus 4.6'ya şu durumlarda uzanın:

  • Halihazırda Opus 4.5 üzerindesiniz ve gecikme profilini değiştirmeksizin tek adım iyileştirme yükseltmesi istiyorsunuz.
  • Tool-use güvenilirliği ve JSON şema uyumu işlem hattınız için kritikse.
  • İş yükü 200k token context içine sığıyorsa.

Atlayın:

  • 2026'da sıfırdan Opus seçiyorsanız. Opus 4.7 genellikle daha iyi başlangıç noktası.
  • İş yükü 200k tokenden fazla context gerektiriyorsa.
  • Maliyet, gecikme veya güçlü kod üretimi, akıl yürütme tarzından daha belirleyiciyse.
  • Audio, gerçek zamanlı ses, video veya kendi kendinize barındırılan ağırlıklar gerekiyorsa.

Özet. Opus 4.6, "4.5 ile 4.7 arasında kullandığımız" olarak anılan iyileştirme sürümü. Bu sorun değil. Penceresinde işini iyi yapıyor ve 4.5'ten tek sıçrama yükseltmesi doğru şekil taşıyan ekipler için makul hedef.

/live-test sayfasında aynı prompt üzerinde alternatifleriyle deneyin.

Son teknik inceleme: 2026-05-22 — Tokonomix.ai

Claude Opus 4.6 — illustration 2
Son otomatik test
30 Tem 2026 · 08:04 UTC · Hız testi
P50 gecikme
15178 ms
P95 gecikme
15497 ms
Hatalar
2 / 6 çalıştırma
Son inceleyen Tokonomix Ekibi·24 Mayıs 2026