Naar inhoud
Tier A — Frontier
Draait in:FranceGemaakt in:China
OVH AI Endpoints (GRA)

Qwen3.5-397B-A17B

Tier A — Frontier

Tokonomix-redactie·Gecontroleerd door Mes Kalkan·
Sectie 01

Snelheidsanalyse

Latency gemeten over alle benchmark-runs. P50 (mediaan) en P95 (95e percentiel) geven een realistisch beeld van de responssnelheid onder normale en piekbelasting.

P50 latency (mediaan)P95 latency100 runs
149256049717382979308-2109-15ms
Sectie 02

Kwaliteitsscores

Hoe dit model zich per promptcategorie verhoudt tot de rest van het veld, uit een paarsgewijze berekening over dezelfde prompts. Het ruwe jurycijfer staat onder elk getal.

42%
Code generatie
jurygemiddelde 89
6%
Creatief
jurygemiddelde 43
6%
Feitelijk
jurygemiddelde 14
28%
Meertaligheid
jurygemiddelde 38
5%
Redeneren
jurygemiddelde 1

Winstpercentage per categorie: hoe vaak dit model een gemiddeld model verslaat op een prompt uit die categorie. 50% is gemiddeld, geen onvoldoende. Het is geen percentage goede antwoorden.

Sectie 03

Prijzen

Wat je per miljoen tokens betaalt als je dit model via Tokonomix gebruikt, plus een schatting voor een gemiddeld gesprek.

💰
API-tarieven — Qwen3.5-397B-A17B
$1.07 per 1M input-tokens
$6.36 per 1M output-tokens
≈ $0.0019 per typisch gesprek (800 tokens)
Input vs output prijs (per 1M tokens)
per 1M input-tokens$1.07
per 1M output-tokens$6.36
Sectie 04

Tokens per seconde

Doorvoersnelheid in tokens per seconde, afgeleid uit gemeten P50-latency. Hogere waarden zijn beter; fluctuaties weerspiegelen serverbelasting bij de provider.

Doorvoer (tokens / s)707 / avg 862
132651

Geschat uit P50-latency × 200 output-tokens — het absolute getal hangt af van deze aanname; de trend is wat telt.

Sectie 05

Mogelijkheden

ownedBy: Qwen
Sectie 06

Beschikbaarheid

Beschikbaarheid

Hoe vaak dit model antwoordt als we het aanroepen — gemeten over echte API-aanvragen en live-tests in de afgelopen 30 dagen. Dit staat los van kwaliteit: deze cijfers laten alleen zien of het model reageert, niet hoe goed het antwoord is.

Afgelopen 7 dagen

100.0%

n=16

Afgelopen 30 dagen

100.0%

n=16

Mediane responstijd

17,684ms

n=16

Gebaseerd op 401 metingen in de afgelopen 30 dagen.

Technische details

Alleen echte API-aanroepen en live-testverzoeken tellen mee — interne probes en benchmarkruns zijn uitgesloten.

Aanroepen met een eigen API-sleutel (BYOK) zijn uitgesloten: die fouten zijn sleutelspecifiek en geen teken van modelneergang.

Mislukte aanroepen worden NIET meegeteld in kwaliteitsscores — kwaliteit wordt gemeten op geslaagde responses. Beschikbaarheid en kwaliteit zijn onafhankelijke signalen.

Mediane responstijd (p50) over geslaagde aanroepen met een vastgelegde duur. Uitschieters trekken de mediaan minder dan het gemiddelde.

Totaal aanroepen (30d)

16

OK-reacties (30d)

16

Totaal aanroepen (7d)

16

OK-reacties (7d)

16

Sectie 07

Tokonomix benchmark-oordelen

⚖️
Endorsed by 2 judges
Independent LLM judges evaluated this model on our weekly intelligence tests
cohere/command-a100/100 · 1 runs
1 correct0 partial0 wrong100% accuracy
claude-sonnet-4-543/100 · 69 runs
24 correct3 partial42 wrong35% accuracy
2026-09-13

Qwen3.5-397B-A17B quality drops 25 points with slower response times

Qwen3.5-397B-A17B has experienced a notable performance decline in this benchmark window. The overall quality score dropped from a perfect 100 to 75 points, a 25-point decrease that represents a significant regression. The coding category score mirrors this decline, falling from 100 to 75. Response times have also degraded, with the median latency increasing by 34 percent from 3362ms to 4505ms. This means users can expect responses to take approximately 1.1 seconds longer on average. The combination of quality degradation and slower performance suggests potential infrastructure issues or model serving problems that warrant investigation. With only two test runs in the current window compared to one in the previous period, the sample size remains limited but the trend is concerning. Users relying on this endpoint for coding tasks should be aware of the reduced quality scores and prepare for longer wait times. The model appears to have shifted from excellent performance to merely adequate results across measured dimensions.

Kwaliteit

75.0

Latency p50

4,505 ms

Testruns

2

Quality dropped 25 points Latency increased 34% Coding score fell to 75 Response times now 4.5 seconds
Sectie 08

Volledig modelprofiel

Qwen3.5-397B-A17B: een model met 397 miljard parameters dat er maar 17 miljard tegelijk wakker maakt

Qwen3.5-397B-A17B is het vervolg van Alibaba's Qwen-team op de Qwen3-generatie, uitgebracht als open weights onder een Apache 2.0-licentie begin 2026. De naam vermeldt de architectuur direct: 397 miljard parameters in totaal, met ruwweg 17 miljard actief voor elk gegeven token. Het is een sparse Mixture-of-Experts-model, en Qwen positioneert het als een verenigd vision-language-fundament — één model dat vanaf het begin samen is getraind op tekst, afbeeldingen en video, in plaats van een tekstmodel met een vision-adapter die er achteraf op is geplakt.

Onder de motorkap

Volgens Qwens eigen modeldocumentatie combineert de architectuur Gated DeltaNet — een lineair-attentiemechanisme — met sparse MoE-routing over 60 lagen, opgezet als herhalende blokken van lineaire-attentie-plus-MoE met periodieke full-attention-lagen ertussen. De MoE-laag zelf heeft 512 experts, waarvan er 11 per token worden geactiveerd: 10 dynamisch gekozen routed experts plus één shared expert die altijd actief is. Die combinatie — grotendeels lineaire attentie voor efficiëntie, MoE voor capaciteit, af en toe volledige attentie voor het soort langeafstandsafhankelijkheid waar lineaire attentie alleen mee worstelt — is wat een model met 397 miljard parameters in totaal laat draaien tegen ongeveer de rekenkosten van een dicht model met 17 miljard parameters per token.

De contextlengte is native 262.144 tokens, en Qwen documenteert uitbreiding tot ruwweg 1.010.000 tokens via YaRN-schaling — een techniek die de positionele encodering van het model aanpast om te generaliseren voorbij zijn getrainde contextlengte, doorgaans met enige kwaliteitsafweging naarmate een aanvraag verder voorbij het native venster duwt.

Waar het uitblinkt

Qwen rapporteert sterke resultaten op zijn eigen benchmarksuite: 87,8 op MMLU-Pro, 70,4 op SuperGPQA en 94,8 op de HMMT-wiskundewedstrijd van februari 2025, naast 85,0 op MMMU en 86,7 op MLVU voor respectievelijk beeld- en videobegrip. Dit zijn Qwens eigen gepubliceerde cijfers in plaats van onafhankelijk gereproduceerde getallen, dus ze moeten worden gelezen als het verhaal van de leverancier over de voortgang van zijn eigen model — maar samen beschrijven ze een model gebouwd voor breed, algemeen redeneren en multimodaal begrip in plaats van een smalle specialist.

De open-weights-licentie is zelf een praktisch voordeel: Apache 2.0 staat self-hosting, fine-tuning en herdistributie toe zonder de licentiewrijving die bij een gesloten API-only model hoort, wat van belang is voor teams die inferentie op hun eigen infrastructuur moeten draaien of het model moeten aanpassen aan een smal domein.

Waar het tekortschiet

Qwens eigen documentatie kadert deze release als "generatie-overstijgende pariteit met Qwen3" op veel dimensies — wat betekent dat de winst ten opzichte van de vorige generatie wordt gepresenteerd als breed en incrementeel in plaats van een sprongsgewijze verandering, en de taal in de modelkaart is voorzichtig om geen dramatische sprong te claimen. Zoals bij elk Mixture-of-Experts-model betekent de discrepantie tussen totale en actieve parameters dat het model veel meer geheugen nodig heeft om volledig te bewatten dan zijn rekenkosten per token zou suggereren — 397 miljard parameters moeten ergens resident zijn, ook al vuurt maar een fractie daarvan af bij een gegeven aanvraag, wat bepaalt wat self-hosting hardwarematig echt vereist.

Wanneer je dit kiest

Dit model past bij algemeen redeneren, coderen en multimodale workloads waarbij een team ofwel de optie wil om self te hosten, ofwel het kostenprofiel van een zeer groot model wil zonder volledige dicht-model-rekenkosten per aanvraag te betalen. Het is een redelijke standaardkeuze voor teams die al geïnvesteerd zijn in het Qwen-ecosysteem, of voor workloads die een echt groot native contextvenster nodig hebben zonder te leunen op agressieve schaaltrucs.

Alternatieven om te overwegen

De voorganger Qwen3-generatie blijft beschikbaar voor teams die het extra vision- en videobegrip van deze release niet nodig hebben. Voor workloads die een kleinere footprint nodig hebben, heeft Qwen ook aanzienlijk kleinere modellen uitgebracht in dezelfde familielijn die wat capaciteit inruilen voor een veel lichtere geheugenfootprint — de moeite waard om direct te benchmarken tegen dit model op de specifieke taak voordat je je vastlegt op het grotere model.

Laatste automatische test
15 sep 2026 · 02:05 UTC · Snelheidstest
P50 latency
283 ms
P95 latency
410 ms
Fouten
0 / 6 runs
Laatst beoordeeld door Tokonomix-team·14 september 2026