Ir al contenido
Tier A — Frontera
Se ejecuta en:FranceCreado en:China
OVH AI Endpoints (GRA)

Qwen3.5-397B-A17B

Tier A — Frontera

Equipo editorial Tokonomix·Revisado por Mes Kalkan·
Sección 01

Análisis de velocidad

Latencia medida en todas las ejecuciones de benchmark. P50 (mediana) y P95 (percentil 95) dan una imagen realista de la velocidad de respuesta bajo carga normal y máxima.

Latencia P50 (mediana)Latencia P95100 runs
149256049717382979308-2109-14ms
Sección 02

Puntuaciones de calidad

Cómo se sitúa este modelo frente al resto del campo en cada categoría de prompts, a partir de un ajuste por pares sobre los mismos prompts. La nota bruta del juez aparece debajo de cada número.

42%
Generación de código
media del juez 89
6%
Creativo
media del juez 43
6%
Factual
media del juez 14
28%
Multilingüe
media del juez 38
5%
Razonamiento
media del juez 1

Tasa de victorias por categoría: con qué frecuencia este modelo vence a un modelo medio en un prompt de esa categoría. 50% es la media, no un suspenso. No es un porcentaje de aciertos.

Sección 03

Precios

Lo que pagas por millón de tokens al usar este modelo en Tokonomix, más una estimación para una conversación típica.

💰
Tarifas API — Qwen3.5-397B-A17B
$1.07 por 1M de tokens de entrada
$6.36 por 1M de tokens de salida
≈ $0.0019 por conversación típica (800 tokens)
Precio entrada vs salida (por 1M de tokens)
por 1M de tokens de entrada$1.07
por 1M de tokens de salida$6.36
Sección 04

Tokens por segundo

Rendimiento en tokens por segundo, derivado de la latencia P50 medida. Más alto es mejor; las fluctuaciones reflejan la carga del lado del proveedor.

Rendimiento (tokens / s)625 / avg 865
132651

Estimado a partir de latencia P50 × 200 tokens de salida — el número absoluto depende de esta suposición; lo que importa es la tendencia.

Sección 05

Capacidades

ownedBy: Qwen
Sección 06

Disponibilidad

Disponibilidad

Con qué frecuencia responde este modelo cuando lo llamamos — medido en solicitudes reales de API y pruebas en vivo durante los últimos 30 días. Esto es independiente de la calidad: estos números solo indican si el modelo responde, no qué tan buena es la respuesta.

Últimos 7 días

100.0%

n=16

Últimos 30 días

100.0%

n=16

Tiempo de respuesta mediano

17,684ms

n=16

Basado en 401 mediciones en los últimos 30 días.

Detalles técnicos

Solo cuentan las llamadas reales a la API y las solicitudes de prueba en vivo — las sondas internas y las ejecuciones de referencia están excluidas.

Las llamadas con una clave API propia (BYOK) están excluidas: esos fallos son específicos de la clave, no una señal de inactividad del modelo.

Las llamadas fallidas NO se incluyen en las puntuaciones de calidad — la calidad se mide solo en respuestas exitosas. Disponibilidad y calidad son señales independientes.

Tiempo de respuesta mediano (p50) en llamadas exitosas con una duración registrada. Los valores atípicos afectan menos a la mediana que a la media.

Total de llamadas (30d)

16

Respuestas OK (30d)

16

Total de llamadas (7d)

16

Respuestas OK (7d)

16

Sección 07

Veredictos del benchmark Tokonomix

⚖️
Endorsed by 2 judges
Independent LLM judges evaluated this model on our weekly intelligence tests
cohere/command-a100/100 · 1 runs
1 correct0 partial0 wrong100% accuracy
claude-sonnet-4-543/100 · 69 runs
24 correct3 partial42 wrong35% accuracy
2026-09-13

Qwen3.5-397B-A17B quality drops 25 points with slower response times

Qwen3.5-397B-A17B has experienced a notable performance decline in this benchmark window. The overall quality score dropped from a perfect 100 to 75 points, a 25-point decrease that represents a significant regression. The coding category score mirrors this decline, falling from 100 to 75. Response times have also degraded, with the median latency increasing by 34 percent from 3362ms to 4505ms. This means users can expect responses to take approximately 1.1 seconds longer on average. The combination of quality degradation and slower performance suggests potential infrastructure issues or model serving problems that warrant investigation. With only two test runs in the current window compared to one in the previous period, the sample size remains limited but the trend is concerning. Users relying on this endpoint for coding tasks should be aware of the reduced quality scores and prepare for longer wait times. The model appears to have shifted from excellent performance to merely adequate results across measured dimensions.

Calidad

75.0

Latencia p50

4,505 ms

Ejecuciones de test

2

Quality dropped 25 points Latency increased 34% Coding score fell to 75 Response times now 4.5 seconds
Sección 08

Perfil completo del modelo

Qwen3.5-397B-A17B: un modelo de 397.000 millones de parámetros que solo despierta 17.000 millones a la vez

Qwen3.5-397B-A17B es la continuación del equipo Qwen de Alibaba a la generación Qwen3, lanzada como pesos abiertos bajo licencia Apache 2.0 a principios de 2026. El nombre indica la arquitectura directamente: 397.000 millones de parámetros totales, de los cuales unos 17.000 millones están activos para cualquier token dado. Es un modelo disperso de Mixture-of-Experts, y Qwen lo posiciona como una base unificada de visión y lenguaje — un único modelo entrenado desde el principio con texto, imágenes y video juntos, en lugar de un modelo de texto con un adaptador de visión añadido después.

Bajo el capó

Según la propia documentación de Qwen, la arquitectura combina Gated DeltaNet — un mecanismo de atención lineal — con enrutamiento disperso de MoE a lo largo de 60 capas, organizadas en bloques repetidos de atención lineal más MoE con capas de atención completa intercaladas periódicamente. La propia capa de MoE tiene 512 expertos, de los cuales 11 se activan por token: 10 expertos enrutados elegidos dinámicamente más un experto compartido que siempre está activo. Esa combinación — atención mayormente lineal por eficiencia, MoE por capacidad, atención completa ocasional para el tipo de dependencia de largo alcance con la que la atención lineal por sí sola tiene problemas — es lo que permite que un modelo con 397.000 millones de parámetros totales funcione a un coste computacional por token similar al de un modelo denso de 17.000 millones de parámetros.

La longitud de contexto es de 262.144 tokens de forma nativa, y Qwen documenta una extensión hasta aproximadamente 1.010.000 tokens mediante escalado YaRN — una técnica que ajusta la codificación posicional del modelo para generalizar más allá de su longitud de contexto entrenada, típicamente con cierta pérdida de calidad cuanto más se sobrepasa la ventana nativa en una solicitud.

Dónde destaca

Qwen reporta resultados sólidos en su propia suite de benchmarks: 87,8 en MMLU-Pro, 70,4 en SuperGPQA y 94,8 en el conjunto de matemáticas de la competición HMMT de febrero de 2025, junto con 85,0 en MMMU y 86,7 en MLVU para comprensión de imagen y video respectivamente. Son cifras publicadas por la propia Qwen, no números reproducidos de forma independiente, así que deben leerse como la versión del fabricante sobre el progreso de su propio modelo — pero en conjunto describen un modelo construido para el razonamiento general de propósito amplio y la comprensión multimodal, más que un especialista de nicho.

La licencia de pesos abiertos es en sí misma una ventaja práctica: Apache 2.0 permite el autoalojamiento, el ajuste fino y la redistribución sin la fricción de licencia que conlleva un modelo cerrado solo accesible por API, lo cual importa para equipos que necesitan ejecutar la inferencia en su propia infraestructura o adaptar el modelo a un dominio concreto.

Dónde se queda corto

La propia documentación de Qwen enmarca este lanzamiento como "paridad intergeneracional con Qwen3" en muchas dimensiones — es decir, las mejoras respecto a la generación anterior se presentan como amplias e incrementales, no como un salto brusco, y el lenguaje de la ficha del modelo evita cuidadosamente afirmar un avance dramático. Como con cualquier modelo Mixture-of-Experts, la discrepancia entre parámetros totales y activos significa que el modelo necesita mucha más memoria para mantenerse completo en memoria de la que su coste computacional por token sugeriría — los 397.000 millones de parámetros tienen que residir en algún sitio aunque solo una fracción se active en cada solicitud, lo cual condiciona qué hardware requiere realmente el autoalojamiento.

Cuándo elegirlo

Este modelo encaja en cargas de trabajo de razonamiento general, programación y multimodalidad donde un equipo quiere tanto la opción de autoalojar como el perfil de coste de un modelo muy grande sin pagar el coste computacional completo de un modelo denso por solicitud. Es una opción razonable por defecto para equipos ya invertidos en el ecosistema Qwen, o para cargas de trabajo que necesitan una ventana de contexto nativa genuinamente grande sin apoyarse en trucos de escalado agresivos.

Alternativas que vale la pena comparar

La generación anterior Qwen3 sigue disponible para equipos que no necesitan la comprensión de visión y video añadida que aporta este lanzamiento. Para cargas de trabajo que necesitan una huella más pequeña, Qwen también ha lanzado modelos considerablemente más pequeños dentro de la misma familia que sacrifican algo de capacidad por una huella de memoria mucho más ligera — vale la pena comparar directamente con este modelo en la tarea concreta antes de comprometerse con el más grande.

Última prueba automática
14 sept 2026 · 20:02 UTC · Benchmark de velocidad
Latencia P50
320 ms
Latencia P95
400 ms
Errores
0 / 6 ejecuciones
Última revisión por Equipo Tokonomix·14 de septiembre de 2026