Zum Inhalt
Tier B — Produktion
Läuft in:CNErstellt in:China
Z.ai (GLM / Zhipu)

GLM-4.5 Air

Tier B — Produktion · 131K Tokens

Tokonomix-Redaktionsteam·Geprüft von Mes Kalkan··

GLM-4.5 Air ist das leichtgewichtige Geschwister von GLM-4.5 — ein kleineres, günstigeres Modell, abgestimmt auf Geschwindigkeit und Volumen. Es ist die GLM, zu der man greift, wenn Kosten pro Token und Durchsatz wichtiger sind als Spitzenqualität.

Abschnitt 01

Geschwindigkeitsanalyse

Latenz über alle Benchmark-Läufe gemessen. P50 (Median) und P95 (95. Perzentil) zeigen ein realistisches Bild der Antwortgeschwindigkeit bei normaler und Spitzenlast.

P50-Latenz (Median)P95-Latenz57 runs
369815215935237173150007-0807-22ms
Abschnitt 02

Qualitätswerte

Auswertungsergebnisse aus Judge-Model-Bewertungen über verschiedene Aufgabenkategorien. Werte spiegeln Kohärenz, Genauigkeit und Anweisungsbefolgung wider.

100
Codegenerierung
45
Kreativ
Abschnitt 03

Preisverlauf

Direkte Provider-Tarife pro Million Tokens, plus eine typische Gesprächskostenschätzung.

💰
API-Tarife — GLM-4.5 Air
$0.2000 pro 1M Input-Tokens
$1.10 pro 1M Output-Tokens
≈ $0.0003 pro typischem Gespräch (800 Tokens)
Input- vs. Output-Preis (pro 1M Tokens)
pro 1M Input-Tokens$0.2000
pro 1M Output-Tokens$1.10

Pricing over time

Input & output per 1M tokens · step-line = price changes

$0.2000

input / 1M

— stable

$1.10

output / 1M

— stable

2026-07-122026-07-192026-07-19
Input
Output
Price change
⟳ synced weekly
Abschnitt 04

Tokens pro Sekunde

Durchsatz in Tokens pro Sekunde, abgeleitet aus gemessener P50-Latenz. Höhere Werte sind besser; Schwankungen spiegeln die Provider-seitige Last wider.

Durchsatz (Tokens / s)46 / avg 47
5366

Geschätzt aus P50-Latenz × 200 Output-Tokens — die absolute Zahl hängt von dieser Annahme ab; entscheidend ist der Trend.

Abschnitt 05

Fähigkeiten

jsonnotes: GLM emits a non-standard reasoning_content field beside content; read content for the answer.toolsreasoning
Abschnitt 06

Verfügbarkeit

Verfügbarkeit

Wie oft dieses Modell antwortet, wenn wir es aufrufen — gemessen anhand echter API-Anfragen und Live-Tests der letzten 30 Tage. Dies ist unabhängig von der Qualität: Diese Zahlen zeigen nur, ob das Modell antwortet, nicht wie gut die Antwort ist.

Letzte 7 Tage

Letzte 30 Tage

100.0%

n=1

Mediane Antwortzeit

5,107ms

n=1

Basierend auf 175 Messungen in den letzten 30 Tagen.

Technische Details

Nur echte API-Aufrufe und Live-Test-Anfragen werden gezählt — interne Proben und Benchmark-Läufe sind ausgeschlossen.

Aufrufe mit einem eigenen API-Schlüssel (BYOK) sind ausgeschlossen: Diese Fehler sind schlüsselspezifisch und kein Zeichen für Modellausfälle.

Fehlgeschlagene Aufrufe werden NICHT in Qualitätswerten berücksichtigt — Qualität wird nur für erfolgreiche Antworten gemessen. Verfügbarkeit und Qualität sind unabhängige Signale.

Mediane Antwortzeit (p50) über erfolgreiche Aufrufe mit aufgezeichneter Dauer. Ausreißer beeinflussen den Median weniger als den Durchschnitt.

Gesamte Aufrufe (30d)

1

OK-Antworten (30d)

1

Gesamte Aufrufe (7d)

0

OK-Antworten (7d)

0

Abschnitt 07

Tokonomix-Benchmark-Urteile

⚖️
Endorsed by 1 judge
Independent LLM judges evaluated this model on our weekly intelligence tests
claude-sonnet-4-574/100 · 6 runs
4 correct0 partial2 wrong67% accuracy
2026-07-19

GLM-4.5 Air adds tool support, reasoning; core performance unchanged

GLM-4.5 Air has expanded its capabilities with the addition of JSON mode, tool calling, and reasoning features, marking a significant enhancement to its functional toolkit. However, performance metrics across core tasks remain largely consistent with the previous benchmark window. The model continues to demonstrate strong competency in coding tasks while showing weaknesses in creative writing domains. The addition of tool support positions GLM-4.5 Air as more versatile for enterprise and application development scenarios, enabling function calling and structured output generation that were previously unavailable. The reasoning capability suggests potential for more complex problem-solving workflows, though benchmark scores indicate the fundamental quality of outputs has not shifted dramatically. Users evaluating this model should note that while the feature set has grown substantially, making it suitable for a broader range of use cases, the underlying performance characteristics remain steady. Creative writing tasks still represent a relative weakness compared to technical applications. The expanded capabilities make GLM-4.5 Air a more complete offering for developers seeking structured interactions and tool integration, while those prioritizing creative or narrative generation may still find limitations.

Quality

Latency p50

Test runs

0

JSON and tool support added New reasoning capability introduced Creative writing remains weak Core performance metrics unchanged
Abschnitt 08

Vollständiges Modellprofil

GLM-4.5 Air: die leichtgewichtige, günstige GLM

GLM-4.5 Air ist das leichtgewichtige Geschwister von GLM-4.5 — ein kleineres, günstigeres Modell, abgestimmt auf Geschwindigkeit und Volumen. Es ist die GLM, zu der man greift, wenn Kosten pro Token und Durchsatz wichtiger sind als Spitzenqualität.

z.ai veröffentlicht GLM-4.5 Air zu $0,20 pro 1M Eingabe-Tokens und $1,10 pro 1M Ausgabe-Tokens — die günstigste kostenpflichtige GLM-Stufe, deutlich unter der Standard-GLM-4.5.

Es wirbt mit einem 128K-Token-Kontextfenster.

Architektur & Trainingssignale

GLM-4.5 Air ist die kleinere, auf Effizienz ausgerichtete Variante von GLM-4.5 von Zhipu AI. Es behält Tool-Aufrufe und JSON-Unterstützung in einem leichteren, auf Durchsatz und Kosten ausgerichteten Paket über einen OpenAI-kompatiblen Endpunkt bei. Wie der Rest der GLM-Reihe liefert es ein nicht standardmäßiges reasoning_content-Feld neben content; Integrationen sollten content für die endgültige Antwort lesen und reasoning_content als optionale Spur behandeln.

Wo es glänzt

  • Hochvolumen-, kostensensitive Arbeitslasten — Klassifizierung, Extraktion, Massen-Entwürfe.
  • Geringere Latenz als das vollständige GLM-4.5.
  • Der günstigste kostenpflichtige GLM-Preispunkt.

Wo es schwächelt

  • Niedrigeres Limit als die vollwertigen Modelle — nicht für das schwierigste Reasoning.
  • Noch keine Tokonomix-Benchmark-Daten; validieren Sie an Ihren eigenen Aufgaben.
  • Nicht-EU-Hosting.

Anwendungsfälle aus der Praxis

  • Massenhafte Datenverarbeitung, bei der Kosten dominieren.
  • Interaktive Funktionen, die schnelle, günstige Antworten benötigen.
  • Ein erster Entwurf, bevor ein stärkeres Modell verfeinert.

Tokonomix-Benchmark-Momentaufnahme

GLM-4.5 Air ist neu bei Tokonomix registriert und noch nicht aktiviert, daher haben wir es noch nicht durch unseren wöchentlichen Intelligenztest oder Geschwindigkeits-Benchmark laufen lassen. Es gibt noch keine Tokonomix-Werte zu berichten — und wir erfinden keine.

Sobald es live geht, durchläuft es dieselbe wöchentliche Testumgebung wie jedes andere Modell: identische Prompts, ein unabhängiger, familienfremder Judge und reproduzierbare Latenz- und Kostenmessungen. Behandeln Sie bis dahin die Preis- und Fähigkeitsangaben auf dieser Seite als vom Anbieter veröffentlichten Ausgangspunkt, nicht als gemessene Tokonomix-Ergebnisse.

EU-Datenschutz & Datenresidenz

GLM-4.5 Air wird von Zhipu AI (z.ai) entwickelt, einem Labor mit Sitz in China, und von Nicht-EU-Infrastruktur aus bereitgestellt. Das muss klar gesagt werden: einen Prompt an dieses Modell zu senden ist keine Entscheidung für EU-Datenresidenz oder DSGVO-Souveränität, und Tokonomix wird es nie als solche kennzeichnen.

Wenn Ihr Anwendungsfall erfordert, dass Daten in der EU bleiben, wählen Sie ein EU-gehostetes Modell (etwa unsere OVH- oder Azure-EU-Routen) statt eines GLM-Modells. Tokonomix hält z.ai standardmäßig aus jedem EU-only-/souveränen Routing-Set heraus. Nutzen Sie GLM dort, wo Fähigkeit oder Preis im Vordergrund stehen und grenzüberschreitende Verarbeitung für diese Aufgabe akzeptabel ist.

Fazit & Alternativen

GLM-4.5 Air ist die GLM-Economy-Stufe: günstig und schnell, mit einem sinnvoll niedrigeren Limit. Wenn Kosten noch mehr zählen, sind die GLM-4.7/4.5-Flash-Stufen kostenlos; wenn Qualität mehr zählt, steigen Sie auf das vollständige GLM-4.5 oder höher um.

Letzter automatisierter Test
22. Juli 2026 · 08:00 UTC · Geschwindigkeits-Benchmark
P50-Latenz
4376 ms
P95-Latenz
15384 ms
Fehler
0 / 6 Läufe
Zuletzt geprüft von Tokonomix-Team·8. Juli 2026