Snelheidsanalyse
Latency gemeten over alle benchmark-runs. P50 (mediaan) en P95 (95e percentiel) geven een realistisch beeld van de responssnelheid onder normale en piekbelasting.
Kwaliteitsscores
Hoe dit model zich per promptcategorie verhoudt tot de rest van het veld, uit een paarsgewijze berekening over dezelfde prompts. Het ruwe jurycijfer staat onder elk getal.
Winstpercentage per categorie: hoe vaak dit model een gemiddeld model verslaat op een prompt uit die categorie. 50% is gemiddeld, geen onvoldoende. Het is geen percentage goede antwoorden.
Prijzen
Wat je per miljoen tokens betaalt als je dit model via Tokonomix gebruikt, plus een schatting voor een gemiddeld gesprek.
Tokens per seconde
Doorvoersnelheid in tokens per seconde, afgeleid uit gemeten P50-latency. Hogere waarden zijn beter; fluctuaties weerspiegelen serverbelasting bij de provider.
Geschat uit P50-latency × 200 output-tokens — het absolute getal hangt af van deze aanname; de trend is wat telt.
Mogelijkheden
Beschikbaarheid
Beschikbaarheid
Hoe vaak dit model antwoordt als we het aanroepen — gemeten over echte API-aanvragen en live-tests in de afgelopen 30 dagen. Dit staat los van kwaliteit: deze cijfers laten alleen zien of het model reageert, niet hoe goed het antwoord is.
Afgelopen 7 dagen
100.0%
n=6
Afgelopen 30 dagen
100.0%
n=6
Mediane responstijd
50,588ms
n=6
Gebaseerd op 391 metingen in de afgelopen 30 dagen.
Technische details
Alleen echte API-aanroepen en live-testverzoeken tellen mee — interne probes en benchmarkruns zijn uitgesloten.
Aanroepen met een eigen API-sleutel (BYOK) zijn uitgesloten: die fouten zijn sleutelspecifiek en geen teken van modelneergang.
Mislukte aanroepen worden NIET meegeteld in kwaliteitsscores — kwaliteit wordt gemeten op geslaagde responses. Beschikbaarheid en kwaliteit zijn onafhankelijke signalen.
Mediane responstijd (p50) over geslaagde aanroepen met een vastgelegde duur. Uitschieters trekken de mediaan minder dan het gemiddelde.
Totaal aanroepen (30d)
6
OK-reacties (30d)
6
Totaal aanroepen (7d)
6
OK-reacties (7d)
6
Tokonomix benchmark-oordelen
Qwen3-32B drops to 56.8 quality, latency improves 17% to 18.0s
Qwen3-32B shows a mixed performance shift in this benchmark window, with overall quality declining slightly from 58.0 to 56.8 while latency improved meaningfully from 21.7s to 18.0s. The 17% latency improvement brings response times closer to acceptable levels, though they remain notably high for a 32B parameter model. Category performance reveals dramatic swings: reasoning capability jumped impressively to 89 from a previous coding score of 52, and coding maintained strong performance at 72. However, factual accuracy collapsed to just 10, a concerning regression that suggests significant reliability issues with knowledge-based queries. The previous window's multilingual strength at 91 and creative capabilities are not represented in current testing categories, making direct comparison incomplete. This benchmarking period captures only 5 test runs, matching the previous window's sample size. Users should exercise caution with factual queries given the severe accuracy drop, while those prioritizing reasoning tasks may find improved utility. The latency gains are welcome but the model still requires substantial patience per request. Overall trajectory remains uncertain given the quality decline despite operational improvements.
Kwaliteit
56.8
Latency p50
17,953 ms
Testruns
5
Qwen3-32B
door OVH AI Endpoints (GRA)
- Uitgebracht
- 29 april 2025
- Contextvenster
- — tokens
- Inputprijs
- $0.2100 / 1M
- Outputprijs
- $0.6000 / 1M
- Tier
- Tier B — Productie
- Modaliteit
- Tekst
- API-type
- REST · streaming
- Benchmark-runs
- 522
Meer van OVH AI Endpoints (GRA)