Zum Inhalt
Tier A — Frontier
Läuft in:CNErstellt in:China
Z.ai (GLM / Zhipu)

GLM-4.6

Tier A — Frontier · 205K Tokens

Tokonomix-Redaktionsteam·Geprüft von Mes Kalkan··

GLM-4.6 ist ein etabliertes Modell in Zhipus GLM-4-Reihe, aufgebaut um ein großes Kontextfenster und einen Fokus auf Code und agentische Tool-Nutzung. Es bietet den größten Teil des praktischen Werts von GLM-4.7 und ist eines der reiferen GLM-Chatmodelle.

Abschnitt 01

Geschwindigkeitsanalyse

Latenz über alle Benchmark-Läufe gemessen. P50 (Median) und P95 (95. Perzentil) zeigen ein realistisches Bild der Antwortgeschwindigkeit bei normaler und Spitzenlast.

P50-Latenz (Median)P95-Latenz57 runs
1004862816252238763150007-0807-22ms
Abschnitt 02

Qualitätswerte

Auswertungsergebnisse aus Judge-Model-Bewertungen über verschiedene Aufgabenkategorien. Werte spiegeln Kohärenz, Genauigkeit und Anweisungsbefolgung wider.

93
Codegenerierung
0
Kreativ
Abschnitt 03

Preisverlauf

Direkte Provider-Tarife pro Million Tokens, plus eine typische Gesprächskostenschätzung.

💰
API-Tarife — GLM-4.6
$0.6000 pro 1M Input-Tokens
$2.20 pro 1M Output-Tokens
≈ $0.0008 pro typischem Gespräch (800 Tokens)
Input- vs. Output-Preis (pro 1M Tokens)
pro 1M Input-Tokens$0.6000
pro 1M Output-Tokens$2.20

Pricing over time

Input & output per 1M tokens · step-line = price changes

$0.6000

input / 1M

— stable

$2.20

output / 1M

— stable

2026-07-122026-07-192026-07-19
Input
Output
Price change
⟳ synced weekly
Abschnitt 04

Tokens pro Sekunde

Durchsatz in Tokens pro Sekunde, abgeleitet aus gemessener P50-Latenz. Höhere Werte sind besser; Schwankungen spiegeln die Provider-seitige Last wider.

Durchsatz (Tokens / s)55 / avg 61
19812

Geschätzt aus P50-Latenz × 200 Output-Tokens — die absolute Zahl hängt von dieser Annahme ab; entscheidend ist der Trend.

Abschnitt 05

Fähigkeiten

jsonnotes: GLM emits a non-standard reasoning_content field beside content; read content for the answer.toolsreasoning
Abschnitt 06

Verfügbarkeit

Verfügbarkeit

Wie oft dieses Modell antwortet, wenn wir es aufrufen — gemessen anhand echter API-Anfragen und Live-Tests der letzten 30 Tage. Dies ist unabhängig von der Qualität: Diese Zahlen zeigen nur, ob das Modell antwortet, nicht wie gut die Antwort ist.

Letzte 7 Tage

Letzte 30 Tage

100.0%

n=17

Mediane Antwortzeit

65,035ms

n=17

Basierend auf 194 Messungen in den letzten 30 Tagen.

Technische Details

Nur echte API-Aufrufe und Live-Test-Anfragen werden gezählt — interne Proben und Benchmark-Läufe sind ausgeschlossen.

Aufrufe mit einem eigenen API-Schlüssel (BYOK) sind ausgeschlossen: Diese Fehler sind schlüsselspezifisch und kein Zeichen für Modellausfälle.

Fehlgeschlagene Aufrufe werden NICHT in Qualitätswerten berücksichtigt — Qualität wird nur für erfolgreiche Antworten gemessen. Verfügbarkeit und Qualität sind unabhängige Signale.

Mediane Antwortzeit (p50) über erfolgreiche Aufrufe mit aufgezeichneter Dauer. Ausreißer beeinflussen den Median weniger als den Durchschnitt.

Gesamte Aufrufe (30d)

17

OK-Antworten (30d)

17

Gesamte Aufrufe (7d)

0

OK-Antworten (7d)

0

Abschnitt 07

Tokonomix-Benchmark-Urteile

⚖️
Endorsed by 1 judge
Independent LLM judges evaluated this model on our weekly intelligence tests
claude-sonnet-4-577/100 · 5 runs
4 correct0 partial1 wrong80% accuracy
2026-07-19

GLM-4.6 maintains strong coding with new JSON and tool capabilities

GLM-4.6 from Zhipu continues to demonstrate solid performance in the current benchmark window, building on its established strengths. The model shows consistent coding capabilities, maintaining its position as a competent option for development tasks. New capabilities have been added including native JSON output formatting, tool use functionality, and reasoning features, expanding the model's practical applications beyond its core competencies. Performance remains stable across key evaluation areas, with the model showing particular reliability in structured tasks. The addition of JSON mode and tool calling capabilities makes GLM-4.6 more versatile for integration into production workflows where formatted outputs and function calling are essential. The reasoning capability addition suggests an attempt to handle more complex multi-step problems, though the extent of improvement in this area would require further evaluation. For developers and teams considering GLM-4.6, the model presents a balanced option with established coding performance now supplemented by practical features like tool use and structured output. The stability in core performance combined with incremental capability additions positions it as a reliable choice for applications requiring consistent behavior alongside modern API features.

Quality

Latency p50

Test runs

0

JSON output mode added Tool calling capability enabled Reasoning feature introduced Stable coding performance maintained
Abschnitt 08

Vollständiges Modellprofil

GLM-4.6: Long-Context, code-fokussiertes GLM

GLM-4.6 ist ein etabliertes Modell in Zhipus GLM-4-Reihe, aufgebaut um ein großes Kontextfenster und einen Fokus auf Code und agentische Tool-Nutzung. Es bietet den größten Teil des praktischen Werts von GLM-4.7 und ist eines der reiferen GLM-Chatmodelle.

z.ai veröffentlicht GLM-4.6 zu $0,60 pro 1M Eingabe-Tokens und $2,20 pro 1M Ausgabe-Tokens, dieselbe Preis-Leistungs-Stufe wie GLM-4.7.

Es wirbt mit einem großen ~200K-Token-Kontextfenster — ein bestimmendes Merkmal von GLM-4.6 für Arbeit an langen Dateien und in Repository-Größe.

Architektur & Trainingssignale

GLM-4.6 gehört zur GLM-4-Reihe von Zhipu AI, die für leistungsfähige Open-Weight-Modelle mit Fokus auf Code, agentische Aufgaben und langen Kontext Aufmerksamkeit erhielt. Es ist ein reasoning-fähiges Chatmodell mit Tool-Aufrufen und JSON über einen OpenAI-kompatiblen Endpunkt. Wie der Rest der GLM-Reihe liefert es ein nicht standardmäßiges reasoning_content-Feld neben content; Integrationen sollten content für die endgültige Antwort lesen und reasoning_content als optionale Spur behandeln.

Wo es glänzt

  • Arbeit mit langem Kontext — das große Fenster ist das Aushängeschild.
  • Code und agentische Tool-Nutzung.
  • Eine kosteneffiziente, gut erprobte GLM-Option.

Wo es schwächelt

  • GLM-4.7 und die GLM-5-Generation können es bei neueren Fähigkeiten knapp übertreffen.
  • Noch keine Tokonomix-Benchmark-Werte; validieren Sie an Ihrer Arbeitslast.
  • Nicht-EU-Hosting.

Anwendungsfälle aus der Praxis

  • Code-Verständnis und -Generierung in Repository-Größe.
  • Analyse langer Dokumente, bei der der gesamte Text in einen Aufruf passen muss.
  • Agentische Pipelines, die zuverlässige Tool-Aufrufe benötigen.

Tokonomix-Benchmark-Momentaufnahme

GLM-4.6 ist neu bei Tokonomix registriert und noch nicht aktiviert, daher haben wir es noch nicht durch unseren wöchentlichen Intelligenztest oder Geschwindigkeits-Benchmark laufen lassen. Es gibt noch keine Tokonomix-Werte zu berichten — und wir erfinden keine.

Sobald es live geht, durchläuft es dieselbe wöchentliche Testumgebung wie jedes andere Modell: identische Prompts, ein unabhängiger, familienfremder Judge und reproduzierbare Latenz- und Kostenmessungen. Behandeln Sie bis dahin die Preis- und Fähigkeitsangaben auf dieser Seite als vom Anbieter veröffentlichten Ausgangspunkt, nicht als gemessene Tokonomix-Ergebnisse.

EU-Datenschutz & Datenresidenz

GLM-4.6 wird von Zhipu AI (z.ai) entwickelt, einem Labor mit Sitz in China, und von Nicht-EU-Infrastruktur aus bereitgestellt. Das muss klar gesagt werden: einen Prompt an dieses Modell zu senden ist keine Entscheidung für EU-Datenresidenz oder DSGVO-Souveränität, und Tokonomix wird es nie als solche kennzeichnen.

Wenn Ihr Anwendungsfall erfordert, dass Daten in der EU bleiben, wählen Sie ein EU-gehostetes Modell (etwa unsere OVH- oder Azure-EU-Routen) statt eines GLM-Modells. Tokonomix hält z.ai standardmäßig aus jedem EU-only-/souveränen Routing-Set heraus. Nutzen Sie GLM dort, wo Fähigkeit oder Preis im Vordergrund stehen und grenzüberschreitende Verarbeitung für diese Aufgabe akzeptabel ist.

Fazit & Alternativen

GLM-4.6 ist eine verlässliche, long-context-, code-fokussierte GLM zu einem günstigen Preis. Wollen Sie die neueste Iteration, dann GLM-4.7; wollen Sie die neueste Generation, dann GLM-5.x. Für kostenloses Experimentieren kombinieren Sie es mit den GLM-Flash-Stufen.

Letzter automatisierter Test
22. Juli 2026 · 08:01 UTC · Geschwindigkeits-Benchmark
P50-Latenz
3642 ms
P95-Latenz
4888 ms
Fehler
0 / 6 Läufe
Zuletzt geprüft von Tokonomix-Team·8. Juli 2026