Qwen3.5-397B-A17B, Alibaba'nın Qwen ekibinin Qwen3 neslinin devamıdır; 2026'nın başında Apache 2.0 lisansı altında açık ağırlıklar olarak yayımlanmıştır. İsim mimariyi doğrudan söylüyor: toplam 397 milyar parametre, herhangi bir token için yaklaşık 17 milyarı aktif. Bu, seyrek bir Mixture-of-Experts modelidir ve Qwen onu birleşik bir görü-dil temel modeli olarak konumlandırıyor — sonradan eklenmiş bir görü adaptörüne sahip bir metin modeli yerine, en baştan metin, görüntü ve video üzerinde birlikte eğitilmiş tek bir model.
Kaputun altında
Qwen'in kendi model belgelerine göre mimari, doğrusal bir dikkat mekanizması olan Gated DeltaNet'i, 60 katman boyunca seyrek MoE yönlendirmesiyle eşleştiriyor; bunlar, aralara periyodik olarak tam dikkat katmanları serpiştirilmiş, tekrarlayan doğrusal-dikkat-artı-MoE blokları biçiminde düzenlenmiş. MoE katmanının kendisi 512 uzman taşıyor; bunlardan 11'i token başına etkinleştiriliyor: dinamik olarak seçilen 10 yönlendirilmiş uzman artı her zaman aktif olan bir paylaşılan uzman. Bu kombinasyon — verimlilik için büyük ölçüde doğrusal dikkat, kapasite için MoE, yalnızca doğrusal dikkatin tek başına zorlandığı türden uzun menzilli bağımlılıklar için ara sıra tam dikkat — toplam 397 milyar parametreli bir modelin, token başına yaklaşık 17 milyar parametrelik yoğun bir modelin hesaplama maliyetinde çalışmasını sağlayan şey budur.
Bağlam uzunluğu doğal olarak 262.144 token'dır ve Qwen, YaRN ölçeklendirmesi yoluyla yaklaşık 1.010.000 tokene kadar bir genişletmeyi belgeliyor — bu, modelin konumsal kodlamasını eğitildiği bağlam uzunluğunun ötesinde genelleyebilmesi için ayarlayan bir teknik; genellikle bir istek doğal pencerenin ne kadar ötesine geçerse o kadar kalite ödünü içerir.
Öne çıktığı noktalar
Qwen kendi kıyaslama paketinde güçlü sonuçlar bildiriyor: MMLU-Pro'da 87,8, SuperGPQA'da 70,4 ve Şubat 2025 HMMT matematik yarışma setinde 94,8; buna ek olarak görüntü ve video anlama için sırasıyla MMMU'da 85,0 ve MLVU'da 86,7. Bunlar Qwen'in kendi yayımladığı rakamlardır, bağımsız olarak yeniden üretilmiş sayılar değildir; bu yüzden satıcının kendi modelinin ilerlemesine dair kendi anlatımı olarak okunmalıdır — ama bir araya geldiklerinde, dar bir uzman modelden çok, geniş, genel amaçlı akıl yürütme ve çok modlu anlama için inşa edilmiş bir modeli tarif ediyorlar.
Açık ağırlık lisansının kendisi pratik bir avantajdır: Apache 2.0, kapalı ve yalnızca API üzerinden erişilebilen bir modelin getirdiği lisans sürtünmesi olmadan kendi kendine barındırmaya, ince ayara ve yeniden dağıtıma izin verir; bu da kendi altyapısında çıkarım çalıştırması ya da modeli dar bir alana uyarlaması gereken ekipler için önemlidir.
Nerede zayıf kalıyor
Qwen'in kendi belgeleri bu sürümü birçok boyutta "Qwen3 ile nesiller arası paritede" olarak çerçeveliyor — yani önceki nesle göre kazanımlar keskin bir sıçrama olarak değil, geniş ve artımlı olarak sunuluyor ve model kartındaki dil dramatik bir atılım iddia etmekten özenle kaçınıyor. Herhangi bir Mixture-of-Experts modelinde olduğu gibi, toplam ve aktif parametreler arasındaki fark, modelin token başına hesaplama maliyetinin ima ettiğinden çok daha fazla belleğe ihtiyaç duyduğu anlamına gelir — herhangi bir istekte yalnızca bir kısmı ateşlense de 397 milyar parametrenin bir yerde tutulması gerekir; bu da kendi kendine barındırmanın gerçekte hangi donanımı gerektirdiğini belirler.
Ne zaman tercih edilmeli
Bu model, bir ekibin kendi kendine barındırma seçeneğini ya da istek başına tam yoğun model hesaplamasını ödemeden çok büyük bir modelin maliyet profilini istediği genel amaçlı akıl yürütme, kodlama ve çok modlu iş yükleri için uygundur. Zaten Qwen ekosistemine yatırım yapmış ekipler için makul bir varsayılan seçimdir, ya da agresif ölçeklendirme hilelerine dayanmadan gerçekten büyük bir doğal bağlam penceresine ihtiyaç duyan iş yükleri için.
Karşılaştırmaya değer alternatifler
Öncül Qwen3 nesli, bu sürümün eklediği ek görüntü ve video anlamaya ihtiyaç duymayan ekipler için hâlâ mevcuttur. Daha küçük bir ayak izine ihtiyaç duyan iş yükleri için Qwen, aynı aile hattında, biraz yetenekten ödün verip çok daha hafif bir bellek ayak izi sunan önemli ölçüde daha küçük modeller de yayımladı — daha büyük modele karar vermeden önce belirli görevinizde bu modelle doğrudan kıyaslamaya değer.