Naar inhoud
Tier A — Frontier
Draait in:CNGemaakt in:China
Z.ai (GLM / Zhipu)

GLM-5

Tier A — Frontier · 205K tokens

Tokonomix-redactie·Gecontroleerd door Mes Kalkan··

GLM-5 is het basismodel van Zhipu’s GLM-5-generatie op z.ai — het werkpaard van de generatie, geprijsd onder het GLM-5.2-vlaggenschip. Het is een OpenAI-compatibel redeneer-chatmodel met tool- en JSON-ondersteuning.

Sectie 01

Snelheidsanalyse

Latency gemeten over alle benchmark-runs. P50 (mediaan) en P95 (95e percentiel) geven een realistisch beeld van de responssnelheid onder normale en piekbelasting.

P50 latency (mediaan)P95 latency104 runs
91542657614109641431308-1209-07ms
Sectie 02

Kwaliteitsscores

Hoe dit model zich per promptcategorie verhoudt tot de rest van het veld, uit een paarsgewijze berekening over dezelfde prompts. Het ruwe jurycijfer staat onder elk getal.

57%
Code generatie
jurygemiddelde 93
89%
Creatief
jurygemiddelde 98
64%
Feitelijk
jurygemiddelde 91
62%
Redeneren
jurygemiddelde 98

Winstpercentage per categorie: hoe vaak dit model een gemiddeld model verslaat op een prompt uit die categorie. 50% is gemiddeld, geen onvoldoende. Het is geen percentage goede antwoorden.

Sectie 03

Prijsgeschiedenis

Directe provider-tarieven per miljoen tokens, plus een typische gespreks-kostschatting.

💰
API-tarieven — GLM-5
$1.00 per 1M input-tokens
$3.20 per 1M output-tokens
≈ $0.0012 per typisch gesprek (800 tokens)
Input vs output prijs (per 1M tokens)
per 1M input-tokens$1.00
per 1M output-tokens$3.20

Pricing over time

Input & output per 1M tokens · step-line = price changes

$1.00

input / 1M

— stable

$3.20

output / 1M

— stable

2026-07-122026-08-162026-09-06
Input
Output
Price change
⟳ synced weekly
Sectie 04

Tokens per seconde

Doorvoersnelheid in tokens per seconde, afgeleid uit gemeten P50-latency. Hogere waarden zijn beter; fluctuaties weerspiegelen serverbelasting bij de provider.

Doorvoer (tokens / s)74 / avg 92
21741

Geschat uit P50-latency × 200 output-tokens — het absolute getal hangt af van deze aanname; de trend is wat telt.

Sectie 05

Mogelijkheden

jsonnotes: GLM emits a non-standard reasoning_content field beside content; read content for the answer.toolsreasoning
Sectie 06

Beschikbaarheid

Beschikbaarheid

Hoe vaak dit model antwoordt als we het aanroepen — gemeten over echte API-aanvragen en live-tests in de afgelopen 30 dagen. Dit staat los van kwaliteit: deze cijfers laten alleen zien of het model reageert, niet hoe goed het antwoord is.

Afgelopen 7 dagen

Afgelopen 30 dagen

33.3%

n=6

Mediane responstijd

91,708ms

n=2

Gebaseerd op 385 metingen in de afgelopen 30 dagen.

Technische details

Alleen echte API-aanroepen en live-testverzoeken tellen mee — interne probes en benchmarkruns zijn uitgesloten.

Aanroepen met een eigen API-sleutel (BYOK) zijn uitgesloten: die fouten zijn sleutelspecifiek en geen teken van modelneergang.

Mislukte aanroepen worden NIET meegeteld in kwaliteitsscores — kwaliteit wordt gemeten op geslaagde responses. Beschikbaarheid en kwaliteit zijn onafhankelijke signalen.

Mediane responstijd (p50) over geslaagde aanroepen met een vastgelegde duur. Uitschieters trekken de mediaan minder dan het gemiddelde.

Totaal aanroepen (30d)

6

OK-reacties (30d)

2

Totaal aanroepen (7d)

0

OK-reacties (7d)

0

Sectie 07

Tokonomix benchmark-oordelen

⚖️
Endorsed by 1 judge
Independent LLM judges evaluated this model on our weekly intelligence tests
claude-sonnet-4-594/100 · 28 runs
26 correct0 partial2 wrong93% accuracy
2026-09-06

GLM-5 shows slight quality decline with increased latency

GLM-5 has returned with limited benchmark data, showing a modest decline from previous performance levels. The overall quality score dropped from 97.0 to 96.0, while latency increased by 18% from 7051ms to 8287ms at the median. The current testing window includes only two test runs, compared to three in the previous period, which limits the statistical confidence of these results. Coding performance specifically declined from a perfect 100 to 96, though this remains a strong absolute score. Notably absent from the current window are factual and reasoning category results, which previously showed excellent performance at 100 and 91 respectively. This makes it difficult to assess whether the model has changed in these areas or if testing coverage has simply narrowed. The reduced test run count and missing category data suggest either limited evaluation activity or a more focused testing approach. Users should note that while the current scores remain competitive, the directional trend shows degradation across both performance and speed metrics. The model continues to demonstrate strong coding capabilities, but the incomplete picture from this benchmark window makes it challenging to draw definitive conclusions about overall capability changes.

Kwaliteit

96.0

Latency p50

8,287 ms

Testruns

2

Quality score decreased to 96 Latency increased 18% Coding score dropped from 100 Limited category coverage
Sectie 08

Volledig modelprofiel

GLM-5: de basis van Zhipu’s nieuwste generatie

GLM-5 is het basismodel van Zhipu’s GLM-5-generatie op z.ai — het werkpaard van de generatie, geprijsd onder het GLM-5.2-vlaggenschip. Het is een OpenAI-compatibel redeneer-chatmodel met tool- en JSON-ondersteuning.

z.ai publiceert GLM-5 voor $1,00 per 1M invoertokens en $3,20 per 1M uitvoertokens — goedkoper dan het GLM-5.2-vlaggenschip, terwijl het binnen dezelfde generatie blijft.

We registreerden het met een groot (~200K-token) contextvenster als voorlopige waarde; documentatie over de GLM-5-generatie is schaars, dus bevestig het exacte venster op z.ai voordat je erop vertrouwt.

Architectuur & trainingssignalen

GLM-5 is de basis van Zhipu AI’s GLM-5-generatie. Openbare technische details zijn per juli 2026 nog beperkt; we beschouwen het als een groot, op redeneren gericht chatmodel met tool-aanroepen en gestructureerde JSON via een OpenAI-compatibel eindpunt. Zoals de rest van de GLM-lijn levert het een niet-standaard reasoning_content-veld naast content; integraties moeten content lezen voor het uiteindelijke antwoord en reasoning_content als optioneel spoor behandelen.

Waar het uitblinkt

  • Een evenwichtig kwaliteit-versus-prijspunt binnen de nieuwste GLM-generatie.
  • Redeneren en analyse met lange context.
  • Cross-family diversiteit in een consensuspanel.

Waar het tekortschiet

  • Nog steeds duurder dan de GLM-4.x-lijn en de gratis flash-lagen.
  • Beperkte reproduceerbare benchmarkdata; verifieer op je werklast.
  • Niet-EU-hosting.

Praktijkvoorbeelden

  • Algemeen redeneren waarbij je huidige-generatie GLM-kwaliteit wilt zonder de vlaggenschipprijs.
  • Documentanalyse en samenvatting.
  • Agentische tool-gebruikspijplijnen.

Tokonomix-benchmarkmomentopname

GLM-5 is nieuw geregistreerd op Tokonomix en nog niet geactiveerd, dus we hebben het nog niet door onze wekelijkse intelligentietest of snelheidsbenchmark gehaald. Er zijn nog geen Tokonomix-scores om te melden — en we verzinnen ze niet.

Zodra het live gaat, komt het in dezelfde wekelijkse harnas als elk ander model: identieke prompts, een onafhankelijke cross-family-jury en reproduceerbare latentie- en kostenmetingen. Behandel tot die tijd de prijs- en capaciteitsnotities op deze pagina als het door de leverancier opgegeven startpunt, niet als gemeten Tokonomix-resultaten.

EU-privacy & dataresidentie

GLM-5 is gebouwd door Zhipu AI (z.ai), een lab met hoofdkantoor in China, en wordt geserveerd vanaf niet-EU-infrastructuur. Dit moeten we duidelijk stellen: een prompt naar dit model sturen is geen keuze voor EU-dataresidentie of GDPR-soevereiniteit, en Tokonomix zal het nooit als zodanig bestempelen.

Als uw gebruikssituatie vereist dat data binnen de EU blijft, kies dan een EU-gehost model (bijvoorbeeld onze OVH- of Azure-EU-routes) in plaats van een GLM-model. Tokonomix houdt z.ai standaard buiten elke EU-only/soevereine routeringsset. Gebruik GLM waar de capaciteit of prijs de prioriteit is en grensoverschrijdende verwerking voor die taak aanvaardbaar is.

Oordeel & alternatieven

GLM-5 is de verstandige standaard binnen de GLM-5-generatie: het grootste deel van de nieuwste-generatiekwaliteit tegen een lagere prijs dan GLM-5.2. Heb je de absolute top nodig, ga dan naar GLM-5.2; domineert budget, stap dan af naar GLM-4.6/4.5 of de gratis flash-modellen.

Laatste automatische test
7 sep 2026 · 14:02 UTC · Snelheidstest
P50 latency
2714 ms
P95 latency
3145 ms
Fouten
0 / 6 runs
Laatst beoordeeld door Tokonomix-team·8 juli 2026