Qwen3.5-397B-A17B es la continuación del equipo Qwen de Alibaba a la generación Qwen3, lanzada como pesos abiertos bajo licencia Apache 2.0 a principios de 2026. El nombre indica la arquitectura directamente: 397.000 millones de parámetros totales, de los cuales unos 17.000 millones están activos para cualquier token dado. Es un modelo disperso de Mixture-of-Experts, y Qwen lo posiciona como una base unificada de visión y lenguaje — un único modelo entrenado desde el principio con texto, imágenes y video juntos, en lugar de un modelo de texto con un adaptador de visión añadido después.
Bajo el capó
Según la propia documentación de Qwen, la arquitectura combina Gated DeltaNet — un mecanismo de atención lineal — con enrutamiento disperso de MoE a lo largo de 60 capas, organizadas en bloques repetidos de atención lineal más MoE con capas de atención completa intercaladas periódicamente. La propia capa de MoE tiene 512 expertos, de los cuales 11 se activan por token: 10 expertos enrutados elegidos dinámicamente más un experto compartido que siempre está activo. Esa combinación — atención mayormente lineal por eficiencia, MoE por capacidad, atención completa ocasional para el tipo de dependencia de largo alcance con la que la atención lineal por sí sola tiene problemas — es lo que permite que un modelo con 397.000 millones de parámetros totales funcione a un coste computacional por token similar al de un modelo denso de 17.000 millones de parámetros.
La longitud de contexto es de 262.144 tokens de forma nativa, y Qwen documenta una extensión hasta aproximadamente 1.010.000 tokens mediante escalado YaRN — una técnica que ajusta la codificación posicional del modelo para generalizar más allá de su longitud de contexto entrenada, típicamente con cierta pérdida de calidad cuanto más se sobrepasa la ventana nativa en una solicitud.
Dónde destaca
Qwen reporta resultados sólidos en su propia suite de benchmarks: 87,8 en MMLU-Pro, 70,4 en SuperGPQA y 94,8 en el conjunto de matemáticas de la competición HMMT de febrero de 2025, junto con 85,0 en MMMU y 86,7 en MLVU para comprensión de imagen y video respectivamente. Son cifras publicadas por la propia Qwen, no números reproducidos de forma independiente, así que deben leerse como la versión del fabricante sobre el progreso de su propio modelo — pero en conjunto describen un modelo construido para el razonamiento general de propósito amplio y la comprensión multimodal, más que un especialista de nicho.
La licencia de pesos abiertos es en sí misma una ventaja práctica: Apache 2.0 permite el autoalojamiento, el ajuste fino y la redistribución sin la fricción de licencia que conlleva un modelo cerrado solo accesible por API, lo cual importa para equipos que necesitan ejecutar la inferencia en su propia infraestructura o adaptar el modelo a un dominio concreto.
Dónde se queda corto
La propia documentación de Qwen enmarca este lanzamiento como "paridad intergeneracional con Qwen3" en muchas dimensiones — es decir, las mejoras respecto a la generación anterior se presentan como amplias e incrementales, no como un salto brusco, y el lenguaje de la ficha del modelo evita cuidadosamente afirmar un avance dramático. Como con cualquier modelo Mixture-of-Experts, la discrepancia entre parámetros totales y activos significa que el modelo necesita mucha más memoria para mantenerse completo en memoria de la que su coste computacional por token sugeriría — los 397.000 millones de parámetros tienen que residir en algún sitio aunque solo una fracción se active en cada solicitud, lo cual condiciona qué hardware requiere realmente el autoalojamiento.
Cuándo elegirlo
Este modelo encaja en cargas de trabajo de razonamiento general, programación y multimodalidad donde un equipo quiere tanto la opción de autoalojar como el perfil de coste de un modelo muy grande sin pagar el coste computacional completo de un modelo denso por solicitud. Es una opción razonable por defecto para equipos ya invertidos en el ecosistema Qwen, o para cargas de trabajo que necesitan una ventana de contexto nativa genuinamente grande sin apoyarse en trucos de escalado agresivos.
Alternativas que vale la pena comparar
La generación anterior Qwen3 sigue disponible para equipos que no necesitan la comprensión de visión y video añadida que aporta este lanzamiento. Para cargas de trabajo que necesitan una huella más pequeña, Qwen también ha lanzado modelos considerablemente más pequeños dentro de la misma familia que sacrifican algo de capacidad por una huella de memoria mucho más ligera — vale la pena comparar directamente con este modelo en la tarea concreta antes de comprometerse con el más grande.