Zum Inhalt
Tier A — Frontier
Läuft in:CNErstellt in:China
Z.ai (GLM / Zhipu)

GLM-4.6V (vision)

Tier A — Frontier · 205K Tokens

Tokonomix-Redaktionsteam·Geprüft von Mes Kalkan··

GLM-4.6V ist das vision-fähige Modell der GLM-4.6-Reihe: Es akzeptiert Bilder neben Text und räsoniert über beide. Es verbindet multimodales Verständnis mit dem großen Kontextfenster der GLM-4.6-Reihe zu einem auffällig niedrigen Preis.

Abschnitt 01

Geschwindigkeitsanalyse

Latenz über alle Benchmark-Läufe gemessen. P50 (Median) und P95 (95. Perzentil) zeigen ein realistisches Bild der Antwortgeschwindigkeit bei normaler und Spitzenlast.

P50-Latenz (Median)P95-Latenz57 runs
821849116161238303150007-0807-22ms
Abschnitt 02

Qualitätswerte

Auswertungsergebnisse aus Judge-Model-Bewertungen über verschiedene Aufgabenkategorien. Werte spiegeln Kohärenz, Genauigkeit und Anweisungsbefolgung wider.

75
Codegenerierung
45
Kreativ
Abschnitt 03

Preisverlauf

Direkte Provider-Tarife pro Million Tokens, plus eine typische Gesprächskostenschätzung.

💰
API-Tarife — GLM-4.6V (vision)
$0.3000 pro 1M Input-Tokens
$0.9000 pro 1M Output-Tokens
≈ $0.0004 pro typischem Gespräch (800 Tokens)
Input- vs. Output-Preis (pro 1M Tokens)
pro 1M Input-Tokens$0.3000
pro 1M Output-Tokens$0.9000

Pricing over time

Input & output per 1M tokens · step-line = price changes

$0.3000

input / 1M

— stable

$0.9000

output / 1M

— stable

2026-07-122026-07-192026-07-19
Input
Output
Price change
⟳ synced weekly
Abschnitt 04

Tokens pro Sekunde

Durchsatz in Tokens pro Sekunde, abgeleitet aus gemessener P50-Latenz. Höhere Werte sind besser; Schwankungen spiegeln die Provider-seitige Last wider.

Durchsatz (Tokens / s)116 / avg 139
2415

Geschätzt aus P50-Latenz × 200 Output-Tokens — die absolute Zahl hängt von dieser Annahme ab; entscheidend ist der Trend.

Abschnitt 05

Fähigkeiten

jsonnotes: GLM emits a non-standard reasoning_content field beside content; read content for the answer.toolsvision
Abschnitt 06

Verfügbarkeit

Verfügbarkeit

Wie oft dieses Modell antwortet, wenn wir es aufrufen — gemessen anhand echter API-Anfragen und Live-Tests der letzten 30 Tage. Dies ist unabhängig von der Qualität: Diese Zahlen zeigen nur, ob das Modell antwortet, nicht wie gut die Antwort ist.

Letzte 7 Tage

Letzte 30 Tage

100.0%

n=1

Mediane Antwortzeit

3,997ms

n=1

Basierend auf 175 Messungen in den letzten 30 Tagen.

Technische Details

Nur echte API-Aufrufe und Live-Test-Anfragen werden gezählt — interne Proben und Benchmark-Läufe sind ausgeschlossen.

Aufrufe mit einem eigenen API-Schlüssel (BYOK) sind ausgeschlossen: Diese Fehler sind schlüsselspezifisch und kein Zeichen für Modellausfälle.

Fehlgeschlagene Aufrufe werden NICHT in Qualitätswerten berücksichtigt — Qualität wird nur für erfolgreiche Antworten gemessen. Verfügbarkeit und Qualität sind unabhängige Signale.

Mediane Antwortzeit (p50) über erfolgreiche Aufrufe mit aufgezeichneter Dauer. Ausreißer beeinflussen den Median weniger als den Durchschnitt.

Gesamte Aufrufe (30d)

1

OK-Antworten (30d)

1

Gesamte Aufrufe (7d)

0

OK-Antworten (7d)

0

Abschnitt 07

Tokonomix-Benchmark-Urteile

⚖️
Endorsed by 1 judge
Independent LLM judges evaluated this model on our weekly intelligence tests
claude-sonnet-4-561/100 · 6 runs
3 correct0 partial3 wrong50% accuracy
2026-07-19

GLM-4.6V debuts with vision capabilities and multimodal support

GLM-4.6V enters the benchmark landscape as a new multimodal model from Zhipu AI, bringing vision capabilities alongside text processing. The model demonstrates solid performance across vision tasks, achieving 49.0% on MMMU and 71.6% on MathVista, placing it in the competitive middle tier for multimodal understanding. On text-only benchmarks, it scores 56.3% on MMLU and 49.8% on GPQA Diamond, showing respectable but not leading-edge performance. The model supports both JSON output and tool use, making it suitable for structured applications and agentic workflows. Notably, it handles Chinese language tasks well at 71.8% on MMMLU, reflecting its origins from a Chinese research team. The addition of vision capabilities expands the GLM series into multimodal territory, though performance metrics suggest it targets practical applications rather than state-of-the-art benchmarks. Users seeking a capable multimodal model with good Chinese language support and standard API features will find GLM-4.6V a workable option, though those requiring top-tier performance on complex reasoning or vision tasks may need to consider alternatives.

Quality

Latency p50

Test runs

0

Vision capabilities added JSON and tool support Strong Chinese language performance
Abschnitt 08

Vollständiges Modellprofil

GLM-4.6V: Langkontext-Vision von Zhipu

GLM-4.6V ist das vision-fähige Modell der GLM-4.6-Reihe: Es akzeptiert Bilder neben Text und räsoniert über beide. Es verbindet multimodales Verständnis mit dem großen Kontextfenster der GLM-4.6-Reihe zu einem auffällig niedrigen Preis.

z.ai veröffentlicht GLM-4.6V zu $0,30 pro 1M Eingabe-Tokens und $0,90 pro 1M Ausgabe-Tokens — ein aggressiv niedriger Preis für ein vision-fähiges Modell.

Es wirbt mit einem großen ~200K-Token-Kontextfenster, sodass Bilder mit umfangreichem Text in einem einzigen Aufruf kombiniert werden können.

Architektur & Trainingssignale

GLM-4.6V ist die Vision-Variante von Zhipu AIs GLM-4.6. Es erweitert das Textmodell um Bildeingabe und liefert Textausgabe, die über die bereitgestellten Bilder räsoniert. Es bietet Tool-Aufrufe und JSON über ein OpenAI-kompatibles Endpoint. Die Ausgabemodalität ist Text (es beschreibt/räsoniert über Bilder, es generiert sie nicht). Wie der Rest der GLM-Reihe liefert es ein nicht standardmäßiges reasoning_content-Feld neben content; Integrationen sollten content für die endgültige Antwort lesen und reasoning_content als optionale Spur behandeln.

Wo es glänzt

  • Bildverständnis — Beschreiben, Vergleichen, Extrahieren von Informationen aus Fotos und Screenshots.
  • Kombination von Bildern mit langem Textkontext in einem einzigen Aufruf.
  • Sehr niedriger Preis für ein multimodales Modell.

Wo es schwächelt

  • Es liest Bilder, es generiert sie nicht — für Bildgenerierung nutzen Sie z.ais GLM-Image-/CogView-Modelle.
  • Noch keine Tokonomix-Benchmark-Daten; prüfen Sie die Vision-Qualität an eigenen Bildern.
  • Nicht-EU-Hosting.

Anwendungsfälle aus der Praxis

  • Dokumenten-, Diagramm- und Screenshot-Verständnis.
  • Visuelle Frage-Antwort und multimodale Analyse im großen Maßstab.
  • Ein günstiger Vision-Proposer in einem multimodalen Konsens-Panel.

Tokonomix-Benchmark-Momentaufnahme

GLM-4.6V ist neu bei Tokonomix registriert und noch nicht aktiviert, daher haben wir es noch nicht durch unseren wöchentlichen Intelligenztest oder Geschwindigkeits-Benchmark laufen lassen. Es gibt noch keine Tokonomix-Werte zu berichten — und wir erfinden keine.

Sobald es live geht, durchläuft es dieselbe wöchentliche Testumgebung wie jedes andere Modell: identische Prompts, ein unabhängiger, familienfremder Judge und reproduzierbare Latenz- und Kostenmessungen. Behandeln Sie bis dahin die Preis- und Fähigkeitsangaben auf dieser Seite als vom Anbieter veröffentlichten Ausgangspunkt, nicht als gemessene Tokonomix-Ergebnisse.

EU-Datenschutz & Datenresidenz

GLM-4.6V wird von Zhipu AI (z.ai) entwickelt, einem Labor mit Sitz in China, und von Nicht-EU-Infrastruktur aus bereitgestellt. Das muss klar gesagt werden: einen Prompt an dieses Modell zu senden ist keine Entscheidung für EU-Datenresidenz oder DSGVO-Souveränität, und Tokonomix wird es nie als solche kennzeichnen.

Wenn Ihr Anwendungsfall erfordert, dass Daten in der EU bleiben, wählen Sie ein EU-gehostetes Modell (etwa unsere OVH- oder Azure-EU-Routen) statt eines GLM-Modells. Tokonomix hält z.ai standardmäßig aus jedem EU-only-/souveränen Routing-Set heraus. Nutzen Sie GLM dort, wo Fähigkeit oder Preis im Vordergrund stehen und grenzüberschreitende Verarbeitung für diese Aufgabe akzeptabel ist.

Fazit & Alternativen

GLM-4.6V ist ein Vision-Modell mit starkem Preis-Leistungs-Verhältnis: multimodales Verständnis plus langer Kontext zu niedrigem Preis. Für eine kostenlose Vision-Option GLM-4.6V Flash; für Bildgenerierung (kein Verständnis) die GLM-Image-/CogView-Modelle.

Letzter automatisierter Test
22. Juli 2026 · 08:04 UTC · Geschwindigkeits-Benchmark
P50-Latenz
1723 ms
P95-Latenz
1997 ms
Fehler
0 / 6 Läufe
Zuletzt geprüft von Tokonomix-Team·8. Juli 2026