Zum Inhalt
Tier A — Frontier
Läuft in:FranceErstellt in:China
OVH AI Endpoints (GRA)

Qwen3.5-397B-A17B

Tier A — Frontier

Tokonomix-Redaktionsteam·Geprüft von Mes Kalkan·
Abschnitt 01

Geschwindigkeitsanalyse

Latenz über alle Benchmark-Läufe gemessen. P50 (Median) und P95 (95. Perzentil) zeigen ein realistisches Bild der Antwortgeschwindigkeit bei normaler und Spitzenlast.

P50-Latenz (Median)P95-Latenz100 runs
149256049717382979308-2109-14ms
Abschnitt 02

Qualitätswerte

Wie sich dieses Modell je Prompt-Kategorie zum übrigen Feld verhält, aus einem paarweisen Fit über dieselben Prompts. Die rohe Jury-Wertung steht unter jeder Zahl.

42%
Codegenerierung
Jury-Mittel 89
6%
Kreativ
Jury-Mittel 43
6%
Faktisch
Jury-Mittel 14
28%
Mehrsprachig
Jury-Mittel 38
5%
Schlussfolgern
Jury-Mittel 1

Gewinnrate je Kategorie: wie oft dieses Modell ein durchschnittliches Modell bei einem Prompt dieser Kategorie schlägt. 50% ist der Durchschnitt, keine schlechte Note. Es ist kein Prozentsatz richtiger Antworten.

Abschnitt 03

Preise

Was Sie pro Million Tokens zahlen, wenn Sie dieses Modell über Tokonomix nutzen, plus eine Schätzung für ein typisches Gespräch.

💰
API-Tarife — Qwen3.5-397B-A17B
$1.07 pro 1M Input-Tokens
$6.36 pro 1M Output-Tokens
≈ $0.0019 pro typischem Gespräch (800 Tokens)
Input- vs. Output-Preis (pro 1M Tokens)
pro 1M Input-Tokens$1.07
pro 1M Output-Tokens$6.36
Abschnitt 04

Tokens pro Sekunde

Durchsatz in Tokens pro Sekunde, abgeleitet aus gemessener P50-Latenz. Höhere Werte sind besser; Schwankungen spiegeln die Provider-seitige Last wider.

Durchsatz (Tokens / s)625 / avg 865
132651

Geschätzt aus P50-Latenz × 200 Output-Tokens — die absolute Zahl hängt von dieser Annahme ab; entscheidend ist der Trend.

Abschnitt 05

Fähigkeiten

ownedBy: Qwen
Abschnitt 06

Verfügbarkeit

Verfügbarkeit

Wie oft dieses Modell antwortet, wenn wir es aufrufen — gemessen anhand echter API-Anfragen und Live-Tests der letzten 30 Tage. Dies ist unabhängig von der Qualität: Diese Zahlen zeigen nur, ob das Modell antwortet, nicht wie gut die Antwort ist.

Letzte 7 Tage

100.0%

n=16

Letzte 30 Tage

100.0%

n=16

Mediane Antwortzeit

17,684ms

n=16

Basierend auf 401 Messungen in den letzten 30 Tagen.

Technische Details

Nur echte API-Aufrufe und Live-Test-Anfragen werden gezählt — interne Proben und Benchmark-Läufe sind ausgeschlossen.

Aufrufe mit einem eigenen API-Schlüssel (BYOK) sind ausgeschlossen: Diese Fehler sind schlüsselspezifisch und kein Zeichen für Modellausfälle.

Fehlgeschlagene Aufrufe werden NICHT in Qualitätswerten berücksichtigt — Qualität wird nur für erfolgreiche Antworten gemessen. Verfügbarkeit und Qualität sind unabhängige Signale.

Mediane Antwortzeit (p50) über erfolgreiche Aufrufe mit aufgezeichneter Dauer. Ausreißer beeinflussen den Median weniger als den Durchschnitt.

Gesamte Aufrufe (30d)

16

OK-Antworten (30d)

16

Gesamte Aufrufe (7d)

16

OK-Antworten (7d)

16

Abschnitt 07

Tokonomix-Benchmark-Urteile

⚖️
Endorsed by 2 judges
Independent LLM judges evaluated this model on our weekly intelligence tests
cohere/command-a100/100 · 1 runs
1 correct0 partial0 wrong100% accuracy
claude-sonnet-4-543/100 · 69 runs
24 correct3 partial42 wrong35% accuracy
2026-09-13

Qwen3.5-397B-A17B quality drops 25 points with slower response times

Qwen3.5-397B-A17B has experienced a notable performance decline in this benchmark window. The overall quality score dropped from a perfect 100 to 75 points, a 25-point decrease that represents a significant regression. The coding category score mirrors this decline, falling from 100 to 75. Response times have also degraded, with the median latency increasing by 34 percent from 3362ms to 4505ms. This means users can expect responses to take approximately 1.1 seconds longer on average. The combination of quality degradation and slower performance suggests potential infrastructure issues or model serving problems that warrant investigation. With only two test runs in the current window compared to one in the previous period, the sample size remains limited but the trend is concerning. Users relying on this endpoint for coding tasks should be aware of the reduced quality scores and prepare for longer wait times. The model appears to have shifted from excellent performance to merely adequate results across measured dimensions.

Qualität

75.0

Latenz p50

4,505 ms

Testläufe

2

Quality dropped 25 points Latency increased 34% Coding score fell to 75 Response times now 4.5 seconds
Abschnitt 08

Vollständiges Modellprofil

Qwen3.5-397B-A17B: ein Modell mit 397 Milliarden Parametern, das jeweils nur 17 Milliarden aufweckt

Qwen3.5-397B-A17B ist die Weiterentwicklung des Qwen-Teams von Alibaba nach der Qwen3-Generation, Anfang 2026 als offene Weights unter einer Apache-2.0-Lizenz veröffentlicht. Der Name nennt die Architektur direkt: 397 Milliarden Parameter insgesamt, davon rund 17 Milliarden aktiv für jedes gegebene Token. Es ist ein spärliches Mixture-of-Experts-Modell, und Qwen positioniert es als ein vereintes Vision-Language-Fundament — ein einziges Modell, das von Anfang an gemeinsam auf Text, Bildern und Video trainiert wurde, statt ein Textmodell mit nachträglich aufgesetztem Vision-Adapter.

Unter der Haube

Laut Qwens eigener Modelldokumentation kombiniert die Architektur Gated DeltaNet — einen linearen Attention-Mechanismus — mit spärlichem MoE-Routing über 60 Schichten, angeordnet als wiederkehrende Blöcke aus linearer Attention plus MoE mit gelegentlich eingestreuten Full-Attention-Schichten. Die MoE-Schicht selbst trägt 512 Experten, von denen 11 pro Token aktiviert werden: 10 dynamisch ausgewählte Routed Experts plus ein Shared Expert, der stets aktiv ist. Diese Kombination — überwiegend lineare Attention für Effizienz, MoE für Kapazität, gelegentliche Full-Attention für jene Art langreichweitiger Abhängigkeit, mit der lineare Attention allein zu kämpfen hat — ist es, die ein Modell mit 397 Milliarden Gesamtparametern zu ungefähr den Rechenkosten eines dichten 17-Milliarden-Parameter-Modells pro Token laufen lässt.

Die Kontextlänge beträgt nativ 262.144 Token, und Qwen dokumentiert eine Erweiterung auf rund 1.010.000 Token über YaRN-Skalierung — eine Technik, die die Positionskodierung des Modells anpasst, um über die trainierte Kontextlänge hinaus zu generalisieren, typischerweise mit einem gewissen Qualitätskompromiss, je weiter eine Anfrage über das native Fenster hinausgeht.

Wo es glänzt

Qwen berichtet von starken Ergebnissen auf seiner eigenen Benchmark-Suite: 87,8 auf MMLU-Pro, 70,4 auf SuperGPQA und 94,8 auf dem HMMT-Februar-2025-Mathematikwettbewerb, dazu 85,0 auf MMMU und 86,7 auf MLVU für Bild- beziehungsweise Videoverständnis. Das sind Qwens eigene veröffentlichte Zahlen statt unabhängig reproduzierter Werte, sollten also als die Darstellung des Anbieters über den Fortschritt seines eigenen Modells gelesen werden — zusammengenommen beschreiben sie aber ein Modell, das für breites, allgemeines Reasoning und multimodales Verständnis gebaut ist, nicht für einen engen Spezialisten.

Die Open-Weights-Lizenz ist selbst ein praktischer Vorteil: Apache 2.0 erlaubt Self-Hosting, Fine-Tuning und Weiterverbreitung ohne die Lizenzreibung eines geschlossenen, reinen API-Modells — wichtig für Teams, die Inferenz auf eigener Infrastruktur betreiben oder das Modell an eine enge Domäne anpassen müssen.

Wo es an Grenzen stößt

Qwens eigene Dokumentation rahmt diese Version in vielen Dimensionen als „generationsübergreifende Parität mit Qwen3" — die Gewinne gegenüber der vorherigen Generation werden also als breit und inkrementell dargestellt statt als Sprung, und die Sprache in der Modellkarte vermeidet bewusst die Behauptung eines dramatischen Fortschritts. Wie bei jedem Mixture-of-Experts-Modell bedeutet die Diskrepanz zwischen Gesamt- und aktiven Parametern, dass das Modell weit mehr Speicher braucht, um vollständig vorgehalten zu werden, als seine Rechenkosten pro Token vermuten lassen — 397 Milliarden Parameter müssen irgendwo resident sein, auch wenn bei jeder einzelnen Anfrage nur ein Bruchteil davon feuert, was bestimmt, welche Hardware Self-Hosting tatsächlich erfordert.

Wann Sie es wählen

Dieses Modell passt zu allgemeinem Reasoning, Coding und multimodalen Workloads, bei denen ein Team entweder die Option zum Self-Hosting oder das Kostenprofil eines sehr großen Modells möchte, ohne die vollen Rechenkosten eines dichten Modells pro Anfrage zu zahlen. Es ist eine vernünftige Standardwahl für Teams, die bereits ins Qwen-Ökosystem investiert haben, oder für Workloads, die ein wirklich großes natives Kontextfenster brauchen, ohne sich auf aggressive Skalierungstricks zu verlassen.

Alternativen im Vergleich

Die vorherige Qwen3-Generation bleibt für Teams verfügbar, die das zusätzliche Bild- und Videoverständnis dieser Version nicht benötigen. Für Workloads, die einen kleineren Fußabdruck brauchen, hat Qwen zudem deutlich kleinere Modelle in derselben Produktfamilie veröffentlicht, die etwas Leistungsfähigkeit gegen einen viel leichteren Speicherbedarf eintauschen — es lohnt sich, diese direkt gegen dieses Modell auf der konkreten Aufgabe zu benchmarken, bevor man sich auf das größere festlegt.

Letzter automatisierter Test
14. Sept. 2026 · 20:02 UTC · Geschwindigkeits-Benchmark
P50-Latenz
320 ms
P95-Latenz
400 ms
Fehler
0 / 6 Läufe
Zuletzt geprüft von Tokonomix-Team·14. September 2026