Qwen3.5-397B-A17B est la suite donnée par l'équipe Qwen d'Alibaba à la génération Qwen3, publiée en poids ouverts sous licence Apache 2.0 début 2026. Le nom indique directement l'architecture : 397 milliards de paramètres au total, avec environ 17 milliards actifs pour un token donné. C'est un modèle Mixture-of-Experts creux, et Qwen le positionne comme un socle vision-langage unifié — un seul modèle entraîné dès le départ sur du texte, des images et de la vidéo ensemble, plutôt qu'un modèle texte avec un adaptateur vision greffé après coup.
Sous le capot
Selon la documentation propre de Qwen, l'architecture associe Gated DeltaNet — un mécanisme d'attention linéaire — à un routage MoE creux sur 60 couches, organisées en blocs répétés d'attention linéaire plus MoE, avec des couches d'attention complète intercalées périodiquement. La couche MoE elle-même comporte 512 experts, dont 11 sont activés par token : 10 experts routés choisis dynamiquement plus un expert partagé toujours actif. Cette combinaison — attention majoritairement linéaire pour l'efficacité, MoE pour la capacité, attention complète occasionnelle pour le type de dépendance à longue portée avec lequel l'attention linéaire seule peine — est ce qui permet à un modèle de 397 milliards de paramètres au total de tourner à un coût de calcul par token proche de celui d'un modèle dense de 17 milliards de paramètres.
La longueur de contexte native est de 262 144 tokens, et Qwen documente une extension jusqu'à environ 1 010 000 tokens via le scaling YaRN — une technique qui ajuste l'encodage positionnel du modèle pour généraliser au-delà de sa longueur de contexte d'entraînement, généralement avec un certain compromis de qualité à mesure qu'une requête s'éloigne de la fenêtre native.
Là où il excelle
Qwen rapporte de solides résultats sur sa propre suite de benchmarks : 87,8 sur MMLU-Pro, 70,4 sur SuperGPQA et 94,8 sur l'ensemble de compétition mathématique HMMT de février 2025, ainsi que 85,0 sur MMMU et 86,7 sur MLVU pour la compréhension d'image et de vidéo respectivement. Ce sont les chiffres publiés par Qwen lui-même plutôt que des résultats reproduits de façon indépendante ; ils doivent donc être lus comme le récit du fournisseur sur la progression de son propre modèle — mais pris ensemble, ils décrivent un modèle conçu pour un raisonnement large et généraliste et une compréhension multimodale plutôt qu'un spécialiste étroit.
La licence à poids ouverts est en elle-même un avantage pratique : Apache 2.0 autorise l'auto-hébergement, le fine-tuning et la redistribution sans la friction de licence d'un modèle fermé accessible uniquement par API — ce qui compte pour les équipes qui doivent exécuter l'inférence sur leur propre infrastructure ou adapter le modèle à un domaine restreint.
Là où il montre ses limites
La documentation propre de Qwen présente cette version comme une « parité intergénérationnelle avec Qwen3 » sur de nombreuses dimensions — c'est-à-dire que les gains par rapport à la génération précédente sont présentés comme larges et incrémentaux plutôt que comme un changement radical, et le langage de la fiche du modèle évite soigneusement de revendiquer un bond spectaculaire. Comme pour tout modèle Mixture-of-Experts, l'écart entre paramètres totaux et actifs signifie que le modèle nécessite bien plus de mémoire pour être entièrement chargé que ne le suggérerait son coût de calcul par token — 397 milliards de paramètres doivent résider quelque part, même si seule une fraction s'active pour une requête donnée, ce qui détermine le matériel réellement nécessaire pour l'auto-hébergement.
Quand le choisir
Ce modèle convient au raisonnement généraliste, au codage et aux workloads multimodaux où une équipe veut soit l'option de l'auto-hébergement, soit le profil de coût d'un très grand modèle sans payer le coût de calcul complet d'un modèle dense par requête. C'est un choix par défaut raisonnable pour les équipes déjà investies dans l'écosystème Qwen, ou pour les workloads qui ont besoin d'une fenêtre de contexte native véritablement large sans s'appuyer sur des astuces de mise à l'échelle agressives.
Alternatives à comparer
La génération précédente Qwen3 reste disponible pour les équipes qui n'ont pas besoin de la compréhension d'image et de vidéo ajoutée par cette version. Pour les workloads ayant besoin d'une empreinte plus réduite, Qwen a aussi publié des modèles nettement plus petits dans la même famille, qui échangent un peu de capacité contre une empreinte mémoire bien plus légère — cela vaut la peine de les comparer directement à ce modèle sur la tâche précise avant de s'engager sur le plus grand.