Aller au contenu
Tier A — Frontier
Fonctionne en :FranceCréé en :China
OVH AI Endpoints (GRA)

Qwen3.5-397B-A17B

Tier A — Frontier

Équipe éditoriale Tokonomix·Relu par Mes Kalkan·
Section 01

Analyse de vitesse

Latence mesurée sur toutes les exécutions de benchmark. P50 (médiane) et P95 (95e percentile) donnent une image réaliste de la vitesse de réponse en charge normale et de pointe.

Latence P50 (médiane)Latence P95100 runs
149256049717382979308-2109-15ms
Section 02

Scores de qualité

Comment ce modèle se situe par rapport au reste du champ sur chaque catégorie de prompts, à partir d'un ajustement par paires sur les mêmes prompts. La note brute du juge figure sous chaque nombre.

42%
Génération de code
moyenne du juge 89
6%
Créatif
moyenne du juge 43
6%
Factuel
moyenne du juge 14
28%
Multilingue
moyenne du juge 38
5%
Raisonnement
moyenne du juge 1

Taux de victoire par catégorie : la fréquence à laquelle ce modèle bat un modèle moyen sur un prompt de cette catégorie. 50% est la moyenne, pas un échec. Ce n'est pas un pourcentage de bonnes réponses.

Section 03

Tarifs

Ce que vous payez par million de tokens en utilisant ce modèle sur Tokonomix, avec une estimation pour une conversation type.

💰
Tarifs API — Qwen3.5-397B-A17B
$1.07 par 1M de tokens d'entrée
$6.36 par 1M de tokens de sortie
≈ $0.0019 par conversation typique (800 tokens)
Prix entrée vs sortie (par 1M de tokens)
par 1M de tokens d'entrée$1.07
par 1M de tokens de sortie$6.36
Section 04

Tokens par seconde

Débit en tokens par seconde, dérivé de la latence P50 mesurée. Plus haut est mieux ; les fluctuations reflètent la charge côté fournisseur.

Débit (tokens / s)707 / avg 862
132651

Estimé à partir de la latence P50 × 200 tokens de sortie — le chiffre absolu dépend de cette hypothèse ; c'est la tendance qui compte.

Section 05

Capacités

ownedBy: Qwen
Section 06

Disponibilité

Disponibilité

La fréquence à laquelle ce modèle répond lorsqu'on l'appelle — mesurée sur de vraies requêtes API et des tests en direct au cours des 30 derniers jours. C'est indépendant de la qualité : ces chiffres indiquent seulement si le modèle répond, pas la qualité de sa réponse.

7 derniers jours

100.0%

n=16

30 derniers jours

100.0%

n=16

Temps de réponse médian

17,684ms

n=16

Basé sur 401 mesures au cours des 30 derniers jours.

Détails techniques

Seuls les vrais appels API et les requêtes de test en direct sont comptés — les sondes internes et les benchmarks sont exclus.

Les appels avec une clé API personnalisée (BYOK) sont exclus : ces échecs sont spécifiques à la clé, pas un signe de défaillance du modèle.

Les appels échoués ne sont PAS inclus dans les scores de qualité — la qualité est mesurée uniquement sur les réponses réussies. Disponibilité et qualité sont des signaux indépendants.

Temps de réponse médian (p50) sur les appels réussis avec une durée enregistrée. Les valeurs extrêmes influencent moins la médiane que la moyenne.

Total des appels (30d)

16

Réponses OK (30d)

16

Total des appels (7d)

16

Réponses OK (7d)

16

Section 07

Verdicts benchmark Tokonomix

⚖️
Endorsed by 2 judges
Independent LLM judges evaluated this model on our weekly intelligence tests
cohere/command-a100/100 · 1 runs
1 correct0 partial0 wrong100% accuracy
claude-sonnet-4-543/100 · 69 runs
24 correct3 partial42 wrong35% accuracy
2026-09-13

Qwen3.5-397B-A17B quality drops 25 points with slower response times

Qwen3.5-397B-A17B has experienced a notable performance decline in this benchmark window. The overall quality score dropped from a perfect 100 to 75 points, a 25-point decrease that represents a significant regression. The coding category score mirrors this decline, falling from 100 to 75. Response times have also degraded, with the median latency increasing by 34 percent from 3362ms to 4505ms. This means users can expect responses to take approximately 1.1 seconds longer on average. The combination of quality degradation and slower performance suggests potential infrastructure issues or model serving problems that warrant investigation. With only two test runs in the current window compared to one in the previous period, the sample size remains limited but the trend is concerning. Users relying on this endpoint for coding tasks should be aware of the reduced quality scores and prepare for longer wait times. The model appears to have shifted from excellent performance to merely adequate results across measured dimensions.

Qualité

75.0

Latence p50

4,505 ms

Exécutions de test

2

Quality dropped 25 points Latency increased 34% Coding score fell to 75 Response times now 4.5 seconds
Section 08

Profil complet du modèle

Qwen3.5-397B-A17B : un modèle de 397 milliards de paramètres qui n'en réveille que 17 milliards à la fois

Qwen3.5-397B-A17B est la suite donnée par l'équipe Qwen d'Alibaba à la génération Qwen3, publiée en poids ouverts sous licence Apache 2.0 début 2026. Le nom indique directement l'architecture : 397 milliards de paramètres au total, avec environ 17 milliards actifs pour un token donné. C'est un modèle Mixture-of-Experts creux, et Qwen le positionne comme un socle vision-langage unifié — un seul modèle entraîné dès le départ sur du texte, des images et de la vidéo ensemble, plutôt qu'un modèle texte avec un adaptateur vision greffé après coup.

Sous le capot

Selon la documentation propre de Qwen, l'architecture associe Gated DeltaNet — un mécanisme d'attention linéaire — à un routage MoE creux sur 60 couches, organisées en blocs répétés d'attention linéaire plus MoE, avec des couches d'attention complète intercalées périodiquement. La couche MoE elle-même comporte 512 experts, dont 11 sont activés par token : 10 experts routés choisis dynamiquement plus un expert partagé toujours actif. Cette combinaison — attention majoritairement linéaire pour l'efficacité, MoE pour la capacité, attention complète occasionnelle pour le type de dépendance à longue portée avec lequel l'attention linéaire seule peine — est ce qui permet à un modèle de 397 milliards de paramètres au total de tourner à un coût de calcul par token proche de celui d'un modèle dense de 17 milliards de paramètres.

La longueur de contexte native est de 262 144 tokens, et Qwen documente une extension jusqu'à environ 1 010 000 tokens via le scaling YaRN — une technique qui ajuste l'encodage positionnel du modèle pour généraliser au-delà de sa longueur de contexte d'entraînement, généralement avec un certain compromis de qualité à mesure qu'une requête s'éloigne de la fenêtre native.

Là où il excelle

Qwen rapporte de solides résultats sur sa propre suite de benchmarks : 87,8 sur MMLU-Pro, 70,4 sur SuperGPQA et 94,8 sur l'ensemble de compétition mathématique HMMT de février 2025, ainsi que 85,0 sur MMMU et 86,7 sur MLVU pour la compréhension d'image et de vidéo respectivement. Ce sont les chiffres publiés par Qwen lui-même plutôt que des résultats reproduits de façon indépendante ; ils doivent donc être lus comme le récit du fournisseur sur la progression de son propre modèle — mais pris ensemble, ils décrivent un modèle conçu pour un raisonnement large et généraliste et une compréhension multimodale plutôt qu'un spécialiste étroit.

La licence à poids ouverts est en elle-même un avantage pratique : Apache 2.0 autorise l'auto-hébergement, le fine-tuning et la redistribution sans la friction de licence d'un modèle fermé accessible uniquement par API — ce qui compte pour les équipes qui doivent exécuter l'inférence sur leur propre infrastructure ou adapter le modèle à un domaine restreint.

Là où il montre ses limites

La documentation propre de Qwen présente cette version comme une « parité intergénérationnelle avec Qwen3 » sur de nombreuses dimensions — c'est-à-dire que les gains par rapport à la génération précédente sont présentés comme larges et incrémentaux plutôt que comme un changement radical, et le langage de la fiche du modèle évite soigneusement de revendiquer un bond spectaculaire. Comme pour tout modèle Mixture-of-Experts, l'écart entre paramètres totaux et actifs signifie que le modèle nécessite bien plus de mémoire pour être entièrement chargé que ne le suggérerait son coût de calcul par token — 397 milliards de paramètres doivent résider quelque part, même si seule une fraction s'active pour une requête donnée, ce qui détermine le matériel réellement nécessaire pour l'auto-hébergement.

Quand le choisir

Ce modèle convient au raisonnement généraliste, au codage et aux workloads multimodaux où une équipe veut soit l'option de l'auto-hébergement, soit le profil de coût d'un très grand modèle sans payer le coût de calcul complet d'un modèle dense par requête. C'est un choix par défaut raisonnable pour les équipes déjà investies dans l'écosystème Qwen, ou pour les workloads qui ont besoin d'une fenêtre de contexte native véritablement large sans s'appuyer sur des astuces de mise à l'échelle agressives.

Alternatives à comparer

La génération précédente Qwen3 reste disponible pour les équipes qui n'ont pas besoin de la compréhension d'image et de vidéo ajoutée par cette version. Pour les workloads ayant besoin d'une empreinte plus réduite, Qwen a aussi publié des modèles nettement plus petits dans la même famille, qui échangent un peu de capacité contre une empreinte mémoire bien plus légère — cela vaut la peine de les comparer directement à ce modèle sur la tâche précise avant de s'engager sur le plus grand.

Dernier test automatisé
15 sept. 2026 · 02:05 UTC · Benchmark de vitesse
Latence P50
283 ms
Latence P95
410 ms
Erreurs
0 / 6 exécutions
Dernière revue par Équipe Tokonomix·14 septembre 2026