İçeriğe geç
Seviye A — Öncü
Çalıştığı yer:FranceYapıldığı yer:China
OVH AI Endpoints (GRA)

Qwen3.5-397B-A17B

Seviye A — Öncü

Tokonomix Editöryel Ekibi·İnceleyen Mes Kalkan·
Bölüm 01

Hız analizi

Tüm benchmark çalıştırmalarında ölçülen gecikme. P50 (medyan) ve P95 (95. yüzdelik) normal ve yoğun yük altında yanıt hızının gerçekçi bir resmini verir.

P50 gecikme (medyan)P95 gecikme100 runs
149256049717382979308-2109-14ms
Bölüm 02

Kalite puanları

Bu modelin her soru kategorisinde sahanın geri kalanına göre nerede durduğu; aynı sorular üzerinde ikili karşılaştırmayla hesaplanır. Ham jüri puanı her sayının altındadır.

42%
Kod üretimi
jüri ortalaması 89
6%
Yaratıcı
jüri ortalaması 43
6%
Olgusal
jüri ortalaması 14
28%
Çok dilli
jüri ortalaması 38
5%
Akıl yürütme
jüri ortalaması 1

Kategori başına kazanma oranı: bu modelin o kategoriden bir soruda ortalama bir modeli ne sıklıkla yendiği. %50 ortalamadır, kalma notu değildir. Doğru cevap yüzdesi de değildir.

Bölüm 03

Fiyatlar

Bu modeli Tokonomix üzerinden kullandığınızda milyon token başına ödediğiniz tutar ve tipik bir konuşma için tahmini maliyet.

💰
API tarifeleri — Qwen3.5-397B-A17B
$1.07 1M giriş token başına
$6.36 1M çıkış token başına
≈ $0.0019 tipik konuşma başına (800 token)
Giriş vs çıkış fiyatı (1M token başına)
1M giriş token başına$1.07
1M çıkış token başına$6.36
Bölüm 04

Saniye başına token

Ölçülen P50 gecikmesinden türetilen saniye başına token verimi. Yüksek daha iyidir; dalgalanmalar sağlayıcı tarafındaki yükü yansıtır.

Verim (token / s)625 / avg 865
132651

P50 gecikme × 200 çıkış token tahmininden hesaplandı — mutlak rakam bu varsayıma bağlıdır; önemli olan eğilimdir.

Bölüm 05

Yetenekler

ownedBy: Qwen
Bölüm 06

Kullanılabilirlik

Kullanılabilirlik

Bu modelin çağrıldığında ne sıklıkla yanıt verdiği — son 30 gün içindeki gerçek API istekleri ve canlı testler üzerinden ölçülmüştür. Bu kaliteden bağımsızdır: bu sayılar yalnızca modelin yanıt verip vermediğini gösterir, yanıtın ne kadar iyi olduğunu değil.

Son 7 gün

100.0%

n=16

Son 30 gün

100.0%

n=16

Medyan yanıt süresi

17,684ms

n=16

Baz alınan 401 ölçüm son 30 gün içinde.

Teknik detaylar

Yalnızca gerçek API çağrıları ve canlı test istekleri sayılır — dahili yoklamalar ve kıyaslama çalıştırmaları hariçtir.

Özel API anahtarıyla (BYOK) yapılan çağrılar hariçtir: bu hatalar anahtara özgüdür, model kesintisinin işareti değildir.

Başarısız çağrılar kalite puanlarına DAHİL EDİLMEZ — kalite yalnızca başarılı yanıtlar üzerinden ölçülür. Kullanılabilirlik ve kalite bağımsız sinyallerdir.

Kaydedilmiş süreye sahip başarılı çağrılarda medyan yanıt süresi (p50). Aykırı değerler medyanı ortalamadan daha az etkiler.

Toplam çağrı (30d)

16

OK yanıtlar (30d)

16

Toplam çağrı (7d)

16

OK yanıtlar (7d)

16

Bölüm 07

Tokonomix kıyaslama kararları

⚖️
Endorsed by 2 judges
Independent LLM judges evaluated this model on our weekly intelligence tests
cohere/command-a100/100 · 1 runs
1 correct0 partial0 wrong100% accuracy
claude-sonnet-4-543/100 · 69 runs
24 correct3 partial42 wrong35% accuracy
2026-09-13

Qwen3.5-397B-A17B quality drops 25 points with slower response times

Qwen3.5-397B-A17B has experienced a notable performance decline in this benchmark window. The overall quality score dropped from a perfect 100 to 75 points, a 25-point decrease that represents a significant regression. The coding category score mirrors this decline, falling from 100 to 75. Response times have also degraded, with the median latency increasing by 34 percent from 3362ms to 4505ms. This means users can expect responses to take approximately 1.1 seconds longer on average. The combination of quality degradation and slower performance suggests potential infrastructure issues or model serving problems that warrant investigation. With only two test runs in the current window compared to one in the previous period, the sample size remains limited but the trend is concerning. Users relying on this endpoint for coding tasks should be aware of the reduced quality scores and prepare for longer wait times. The model appears to have shifted from excellent performance to merely adequate results across measured dimensions.

Kalite

75.0

Gecikme p50

4,505 ms

Test çalıştırmaları

2

Quality dropped 25 points Latency increased 34% Coding score fell to 75 Response times now 4.5 seconds
Bölüm 08

Tam model profili

Qwen3.5-397B-A17B: aynı anda yalnızca 17 milyarını uyandıran 397 milyar parametrelik bir model

Qwen3.5-397B-A17B, Alibaba'nın Qwen ekibinin Qwen3 neslinin devamıdır; 2026'nın başında Apache 2.0 lisansı altında açık ağırlıklar olarak yayımlanmıştır. İsim mimariyi doğrudan söylüyor: toplam 397 milyar parametre, herhangi bir token için yaklaşık 17 milyarı aktif. Bu, seyrek bir Mixture-of-Experts modelidir ve Qwen onu birleşik bir görü-dil temel modeli olarak konumlandırıyor — sonradan eklenmiş bir görü adaptörüne sahip bir metin modeli yerine, en baştan metin, görüntü ve video üzerinde birlikte eğitilmiş tek bir model.

Kaputun altında

Qwen'in kendi model belgelerine göre mimari, doğrusal bir dikkat mekanizması olan Gated DeltaNet'i, 60 katman boyunca seyrek MoE yönlendirmesiyle eşleştiriyor; bunlar, aralara periyodik olarak tam dikkat katmanları serpiştirilmiş, tekrarlayan doğrusal-dikkat-artı-MoE blokları biçiminde düzenlenmiş. MoE katmanının kendisi 512 uzman taşıyor; bunlardan 11'i token başına etkinleştiriliyor: dinamik olarak seçilen 10 yönlendirilmiş uzman artı her zaman aktif olan bir paylaşılan uzman. Bu kombinasyon — verimlilik için büyük ölçüde doğrusal dikkat, kapasite için MoE, yalnızca doğrusal dikkatin tek başına zorlandığı türden uzun menzilli bağımlılıklar için ara sıra tam dikkat — toplam 397 milyar parametreli bir modelin, token başına yaklaşık 17 milyar parametrelik yoğun bir modelin hesaplama maliyetinde çalışmasını sağlayan şey budur.

Bağlam uzunluğu doğal olarak 262.144 token'dır ve Qwen, YaRN ölçeklendirmesi yoluyla yaklaşık 1.010.000 tokene kadar bir genişletmeyi belgeliyor — bu, modelin konumsal kodlamasını eğitildiği bağlam uzunluğunun ötesinde genelleyebilmesi için ayarlayan bir teknik; genellikle bir istek doğal pencerenin ne kadar ötesine geçerse o kadar kalite ödünü içerir.

Öne çıktığı noktalar

Qwen kendi kıyaslama paketinde güçlü sonuçlar bildiriyor: MMLU-Pro'da 87,8, SuperGPQA'da 70,4 ve Şubat 2025 HMMT matematik yarışma setinde 94,8; buna ek olarak görüntü ve video anlama için sırasıyla MMMU'da 85,0 ve MLVU'da 86,7. Bunlar Qwen'in kendi yayımladığı rakamlardır, bağımsız olarak yeniden üretilmiş sayılar değildir; bu yüzden satıcının kendi modelinin ilerlemesine dair kendi anlatımı olarak okunmalıdır — ama bir araya geldiklerinde, dar bir uzman modelden çok, geniş, genel amaçlı akıl yürütme ve çok modlu anlama için inşa edilmiş bir modeli tarif ediyorlar.

Açık ağırlık lisansının kendisi pratik bir avantajdır: Apache 2.0, kapalı ve yalnızca API üzerinden erişilebilen bir modelin getirdiği lisans sürtünmesi olmadan kendi kendine barındırmaya, ince ayara ve yeniden dağıtıma izin verir; bu da kendi altyapısında çıkarım çalıştırması ya da modeli dar bir alana uyarlaması gereken ekipler için önemlidir.

Nerede zayıf kalıyor

Qwen'in kendi belgeleri bu sürümü birçok boyutta "Qwen3 ile nesiller arası paritede" olarak çerçeveliyor — yani önceki nesle göre kazanımlar keskin bir sıçrama olarak değil, geniş ve artımlı olarak sunuluyor ve model kartındaki dil dramatik bir atılım iddia etmekten özenle kaçınıyor. Herhangi bir Mixture-of-Experts modelinde olduğu gibi, toplam ve aktif parametreler arasındaki fark, modelin token başına hesaplama maliyetinin ima ettiğinden çok daha fazla belleğe ihtiyaç duyduğu anlamına gelir — herhangi bir istekte yalnızca bir kısmı ateşlense de 397 milyar parametrenin bir yerde tutulması gerekir; bu da kendi kendine barındırmanın gerçekte hangi donanımı gerektirdiğini belirler.

Ne zaman tercih edilmeli

Bu model, bir ekibin kendi kendine barındırma seçeneğini ya da istek başına tam yoğun model hesaplamasını ödemeden çok büyük bir modelin maliyet profilini istediği genel amaçlı akıl yürütme, kodlama ve çok modlu iş yükleri için uygundur. Zaten Qwen ekosistemine yatırım yapmış ekipler için makul bir varsayılan seçimdir, ya da agresif ölçeklendirme hilelerine dayanmadan gerçekten büyük bir doğal bağlam penceresine ihtiyaç duyan iş yükleri için.

Karşılaştırmaya değer alternatifler

Öncül Qwen3 nesli, bu sürümün eklediği ek görüntü ve video anlamaya ihtiyaç duymayan ekipler için hâlâ mevcuttur. Daha küçük bir ayak izine ihtiyaç duyan iş yükleri için Qwen, aynı aile hattında, biraz yetenekten ödün verip çok daha hafif bir bellek ayak izi sunan önemli ölçüde daha küçük modeller de yayımladı — daha büyük modele karar vermeden önce belirli görevinizde bu modelle doğrudan kıyaslamaya değer.

Son otomatik test
14 Eyl 2026 · 20:02 UTC · Hız testi
P50 gecikme
320 ms
P95 gecikme
400 ms
Hatalar
0 / 6 çalıştırma
Son inceleyen Tokonomix Ekibi·14 Eylül 2026