Zum Inhalt
Tier B — Produktion
Läuft in:FranceErstellt in:China
OVH AI Endpoints (GRA)

Qwen3-32B

Tier B — Produktion

Tokonomix-Redaktionsteam·Geprüft von Mes Kalkan··
Abschnitt 01

Geschwindigkeitsanalyse

Latenz über alle Benchmark-Läufe gemessen. P50 (Median) und P95 (95. Perzentil) zeigen ein realistisches Bild der Antwortgeschwindigkeit bei normaler und Spitzenlast.

P50-Latenz (Median)P95-Latenz100 runs
367139924323464449608-2109-14ms
Abschnitt 02

Qualitätswerte

Wie sich dieses Modell je Prompt-Kategorie zum übrigen Feld verhält, aus einem paarweisen Fit über dieselben Prompts. Die rohe Jury-Wertung steht unter jeder Zahl.

18%
Codegenerierung
Jury-Mittel 79
14%
Kreativ
Jury-Mittel 66
21%
Faktisch
Jury-Mittel 53
27%
Mehrsprachig
Jury-Mittel 88
24%
Schlussfolgern
Jury-Mittel 86

Gewinnrate je Kategorie: wie oft dieses Modell ein durchschnittliches Modell bei einem Prompt dieser Kategorie schlägt. 50% ist der Durchschnitt, keine schlechte Note. Es ist kein Prozentsatz richtiger Antworten.

Abschnitt 03

Preise

Was Sie pro Million Tokens zahlen, wenn Sie dieses Modell über Tokonomix nutzen, plus eine Schätzung für ein typisches Gespräch.

💰
API-Tarife — Qwen3-32B
$0.2100 pro 1M Input-Tokens
$0.6000 pro 1M Output-Tokens
≈ $0.0002 pro typischem Gespräch (800 Tokens)
Input- vs. Output-Preis (pro 1M Tokens)
pro 1M Input-Tokens$0.2100
pro 1M Output-Tokens$0.6000
Abschnitt 04

Tokens pro Sekunde

Durchsatz in Tokens pro Sekunde, abgeleitet aus gemessener P50-Latenz. Höhere Werte sind besser; Schwankungen spiegeln die Provider-seitige Last wider.

Durchsatz (Tokens / s)365 / avg 397
540169

Geschätzt aus P50-Latenz × 200 Output-Tokens — die absolute Zahl hängt von dieser Annahme ab; entscheidend ist der Trend.

Abschnitt 05

Fähigkeiten

ownedBy: Qwen
Abschnitt 06

Verfügbarkeit

Verfügbarkeit

Wie oft dieses Modell antwortet, wenn wir es aufrufen — gemessen anhand echter API-Anfragen und Live-Tests der letzten 30 Tage. Dies ist unabhängig von der Qualität: Diese Zahlen zeigen nur, ob das Modell antwortet, nicht wie gut die Antwort ist.

Letzte 7 Tage

100.0%

n=6

Letzte 30 Tage

100.0%

n=6

Mediane Antwortzeit

50,588ms

n=6

Basierend auf 391 Messungen in den letzten 30 Tagen.

Technische Details

Nur echte API-Aufrufe und Live-Test-Anfragen werden gezählt — interne Proben und Benchmark-Läufe sind ausgeschlossen.

Aufrufe mit einem eigenen API-Schlüssel (BYOK) sind ausgeschlossen: Diese Fehler sind schlüsselspezifisch und kein Zeichen für Modellausfälle.

Fehlgeschlagene Aufrufe werden NICHT in Qualitätswerten berücksichtigt — Qualität wird nur für erfolgreiche Antworten gemessen. Verfügbarkeit und Qualität sind unabhängige Signale.

Mediane Antwortzeit (p50) über erfolgreiche Aufrufe mit aufgezeichneter Dauer. Ausreißer beeinflussen den Median weniger als den Durchschnitt.

Gesamte Aufrufe (30d)

6

OK-Antworten (30d)

6

Gesamte Aufrufe (7d)

6

OK-Antworten (7d)

6

Abschnitt 07

Tokonomix-Benchmark-Urteile

⚖️
Endorsed by 2 judges
Independent LLM judges evaluated this model on our weekly intelligence tests
cohere/command-a95/100 · 1 runs
1 correct0 partial0 wrong100% accuracy
claude-sonnet-4-576/100 · 82 runs
51 correct16 partial15 wrong62% accuracy
2026-09-13

Qwen3-32B drops to 56.8 quality, latency improves 17% to 18.0s

Qwen3-32B shows a mixed performance shift in this benchmark window, with overall quality declining slightly from 58.0 to 56.8 while latency improved meaningfully from 21.7s to 18.0s. The 17% latency improvement brings response times closer to acceptable levels, though they remain notably high for a 32B parameter model. Category performance reveals dramatic swings: reasoning capability jumped impressively to 89 from a previous coding score of 52, and coding maintained strong performance at 72. However, factual accuracy collapsed to just 10, a concerning regression that suggests significant reliability issues with knowledge-based queries. The previous window's multilingual strength at 91 and creative capabilities are not represented in current testing categories, making direct comparison incomplete. This benchmarking period captures only 5 test runs, matching the previous window's sample size. Users should exercise caution with factual queries given the severe accuracy drop, while those prioritizing reasoning tasks may find improved utility. The latency gains are welcome but the model still requires substantial patience per request. Overall trajectory remains uncertain given the quality decline despite operational improvements.

Qualität

56.8

Latenz p50

17,953 ms

Testläufe

5

Latency improved 17% Quality dropped to 56.8 Factual accuracy collapsed to 10 Reasoning strong at 89
Letzter automatisierter Test
14. Sept. 2026 · 20:02 UTC · Geschwindigkeits-Benchmark
P50-Latenz
548 ms
P95-Latenz
622 ms
Fehler
0 / 6 Läufe
Zuletzt geprüft von Tokonomix-Team·14. September 2026