Naar inhoud
Tier B — Productie
Draait in:FranceGemaakt in:China
OVH AI Endpoints (GRA)

Qwen3-32B

Tier B — Productie

Tokonomix-redactie·Gecontroleerd door Mes Kalkan··
Sectie 01

Snelheidsanalyse

Latency gemeten over alle benchmark-runs. P50 (mediaan) en P95 (95e percentiel) geven een realistisch beeld van de responssnelheid onder normale en piekbelasting.

P50 latency (mediaan)P95 latency100 runs
367139924323464449608-2109-14ms
Sectie 02

Kwaliteitsscores

Hoe dit model zich per promptcategorie verhoudt tot de rest van het veld, uit een paarsgewijze berekening over dezelfde prompts. Het ruwe jurycijfer staat onder elk getal.

18%
Code generatie
jurygemiddelde 79
14%
Creatief
jurygemiddelde 66
21%
Feitelijk
jurygemiddelde 53
27%
Meertaligheid
jurygemiddelde 88
24%
Redeneren
jurygemiddelde 86

Winstpercentage per categorie: hoe vaak dit model een gemiddeld model verslaat op een prompt uit die categorie. 50% is gemiddeld, geen onvoldoende. Het is geen percentage goede antwoorden.

Sectie 03

Prijzen

Wat je per miljoen tokens betaalt als je dit model via Tokonomix gebruikt, plus een schatting voor een gemiddeld gesprek.

💰
API-tarieven — Qwen3-32B
$0.2100 per 1M input-tokens
$0.6000 per 1M output-tokens
≈ $0.0002 per typisch gesprek (800 tokens)
Input vs output prijs (per 1M tokens)
per 1M input-tokens$0.2100
per 1M output-tokens$0.6000
Sectie 04

Tokens per seconde

Doorvoersnelheid in tokens per seconde, afgeleid uit gemeten P50-latency. Hogere waarden zijn beter; fluctuaties weerspiegelen serverbelasting bij de provider.

Doorvoer (tokens / s)365 / avg 397
540169

Geschat uit P50-latency × 200 output-tokens — het absolute getal hangt af van deze aanname; de trend is wat telt.

Sectie 05

Mogelijkheden

ownedBy: Qwen
Sectie 06

Beschikbaarheid

Beschikbaarheid

Hoe vaak dit model antwoordt als we het aanroepen — gemeten over echte API-aanvragen en live-tests in de afgelopen 30 dagen. Dit staat los van kwaliteit: deze cijfers laten alleen zien of het model reageert, niet hoe goed het antwoord is.

Afgelopen 7 dagen

100.0%

n=6

Afgelopen 30 dagen

100.0%

n=6

Mediane responstijd

50,588ms

n=6

Gebaseerd op 391 metingen in de afgelopen 30 dagen.

Technische details

Alleen echte API-aanroepen en live-testverzoeken tellen mee — interne probes en benchmarkruns zijn uitgesloten.

Aanroepen met een eigen API-sleutel (BYOK) zijn uitgesloten: die fouten zijn sleutelspecifiek en geen teken van modelneergang.

Mislukte aanroepen worden NIET meegeteld in kwaliteitsscores — kwaliteit wordt gemeten op geslaagde responses. Beschikbaarheid en kwaliteit zijn onafhankelijke signalen.

Mediane responstijd (p50) over geslaagde aanroepen met een vastgelegde duur. Uitschieters trekken de mediaan minder dan het gemiddelde.

Totaal aanroepen (30d)

6

OK-reacties (30d)

6

Totaal aanroepen (7d)

6

OK-reacties (7d)

6

Sectie 07

Tokonomix benchmark-oordelen

⚖️
Endorsed by 2 judges
Independent LLM judges evaluated this model on our weekly intelligence tests
cohere/command-a95/100 · 1 runs
1 correct0 partial0 wrong100% accuracy
claude-sonnet-4-576/100 · 82 runs
51 correct16 partial15 wrong62% accuracy
2026-09-13

Qwen3-32B drops to 56.8 quality, latency improves 17% to 18.0s

Qwen3-32B shows a mixed performance shift in this benchmark window, with overall quality declining slightly from 58.0 to 56.8 while latency improved meaningfully from 21.7s to 18.0s. The 17% latency improvement brings response times closer to acceptable levels, though they remain notably high for a 32B parameter model. Category performance reveals dramatic swings: reasoning capability jumped impressively to 89 from a previous coding score of 52, and coding maintained strong performance at 72. However, factual accuracy collapsed to just 10, a concerning regression that suggests significant reliability issues with knowledge-based queries. The previous window's multilingual strength at 91 and creative capabilities are not represented in current testing categories, making direct comparison incomplete. This benchmarking period captures only 5 test runs, matching the previous window's sample size. Users should exercise caution with factual queries given the severe accuracy drop, while those prioritizing reasoning tasks may find improved utility. The latency gains are welcome but the model still requires substantial patience per request. Overall trajectory remains uncertain given the quality decline despite operational improvements.

Kwaliteit

56.8

Latency p50

17,953 ms

Testruns

5

Latency improved 17% Quality dropped to 56.8 Factual accuracy collapsed to 10 Reasoning strong at 89
Laatste automatische test
14 sep 2026 · 20:02 UTC · Snelheidstest
P50 latency
548 ms
P95 latency
622 ms
Fouten
0 / 6 runs
Laatst beoordeeld door Tokonomix-team·14 september 2026