Naar inhoud
Tier B — Productie
Draait in:CNGemaakt in:China
Z.ai (GLM / Zhipu)

GLM-5 Turbo

Tier B — Productie · 205K tokens

Tokonomix-redactie·Gecontroleerd door Mes Kalkan··

GLM-5 Turbo is de snelheidsgerichte variant van de GLM-5-generatie op z.ai. ‘Turbo’-GLM-lagen ruilen historisch een beetje piekkwaliteit in voor lagere latentie en kosten, wat ze de doorvoeroptie binnen een generatie maakt.

Sectie 01

Snelheidsanalyse

Latency gemeten over alle benchmark-runs. P50 (mediaan) en P95 (95e percentiel) geven een realistisch beeld van de responssnelheid onder normale en piekbelasting.

P50 latency (mediaan)P95 latency57 runs
1293884516397239483150007-0807-22ms
Sectie 02

Kwaliteitsscores

Evaluatieresultaten van judge-model beoordelingen over diverse taakcategorieën. Scores weerspiegelen coherentie, accuratesse en instructieopvolging.

90
Code generatie
45
Creatief
Sectie 03

Prijsgeschiedenis

Directe provider-tarieven per miljoen tokens, plus een typische gespreks-kostschatting.

💰
API-tarieven — GLM-5 Turbo
$1.20 per 1M input-tokens
$4.00 per 1M output-tokens
≈ $0.0015 per typisch gesprek (800 tokens)
Input vs output prijs (per 1M tokens)
per 1M input-tokens$1.20
per 1M output-tokens$4.00

Pricing over time

Input & output per 1M tokens · step-line = price changes

$1.20

input / 1M

— stable

$4.00

output / 1M

— stable

2026-07-122026-07-192026-07-19
Input
Output
Price change
⟳ synced weekly
Sectie 04

Tokens per seconde

Doorvoersnelheid in tokens per seconde, afgeleid uit gemeten P50-latency. Hogere waarden zijn beter; fluctuaties weerspiegelen serverbelasting bij de provider.

Doorvoer (tokens / s)49 / avg 70
1545

Geschat uit P50-latency × 200 output-tokens — het absolute getal hangt af van deze aanname; de trend is wat telt.

Sectie 05

Mogelijkheden

jsonnotes: GLM emits a non-standard reasoning_content field beside content; read content for the answer.toolsreasoningprice note: No published price on 2026-07-06
Sectie 06

Beschikbaarheid

Beschikbaarheid

Hoe vaak dit model antwoordt als we het aanroepen — gemeten over echte API-aanvragen en live-tests in de afgelopen 30 dagen. Dit staat los van kwaliteit: deze cijfers laten alleen zien of het model reageert, niet hoe goed het antwoord is.

Afgelopen 7 dagen

Afgelopen 30 dagen

100.0%

n=1

Mediane responstijd

6,573ms

n=1

Gebaseerd op 178 metingen in de afgelopen 30 dagen.

Technische details

Alleen echte API-aanroepen en live-testverzoeken tellen mee — interne probes en benchmarkruns zijn uitgesloten.

Aanroepen met een eigen API-sleutel (BYOK) zijn uitgesloten: die fouten zijn sleutelspecifiek en geen teken van modelneergang.

Mislukte aanroepen worden NIET meegeteld in kwaliteitsscores — kwaliteit wordt gemeten op geslaagde responses. Beschikbaarheid en kwaliteit zijn onafhankelijke signalen.

Mediane responstijd (p50) over geslaagde aanroepen met een vastgelegde duur. Uitschieters trekken de mediaan minder dan het gemiddelde.

Totaal aanroepen (30d)

1

OK-reacties (30d)

1

Totaal aanroepen (7d)

0

OK-reacties (7d)

0

Sectie 07

Tokonomix benchmark-oordelen

⚖️
Endorsed by 1 judge
Independent LLM judges evaluated this model on our weekly intelligence tests
claude-sonnet-4-557/100 · 6 runs
2 correct1 partial3 wrong33% accuracy
2026-07-19

GLM-5 Turbo adds tool support while maintaining baseline performance

GLM-5 Turbo has expanded its capabilities with the addition of JSON mode, tool calling, and reasoning features in this benchmark window. Performance metrics show general stability across most evaluated tasks, with the model maintaining its previous positioning in the competitive landscape. The model continues to demonstrate solid coding abilities and mathematical reasoning comparable to its initial debut. Its performance on standard benchmarks remains consistent, showing neither significant gains nor regressions in core competencies. The newly added tool calling and structured output capabilities extend the model's practical utility for application developers, though benchmark data on these specific features is still limited. GLM-5 Turbo appears positioned as a capable mid-tier option for developers seeking a balance of reasoning, coding, and now function-calling abilities. The stability in performance metrics suggests reliable iteration from Zhipu, though the model has not made dramatic leaps in benchmark standings. Users evaluating this model should consider it for applications requiring multi-modal capability support rather than expecting cutting-edge performance in any single domain. The addition of tool support makes it more viable for agent-based workflows and structured data extraction tasks.

Quality

Latency p50

Test runs

0

Added tool calling support JSON mode now available Performance remains stable
Sectie 08

Volledig modelprofiel

GLM-5 Turbo: de snelheidsgeoptimaliseerde GLM-5-variant

GLM-5 Turbo is de snelheidsgerichte variant van de GLM-5-generatie op z.ai. ‘Turbo’-GLM-lagen ruilen historisch een beetje piekkwaliteit in voor lagere latentie en kosten, wat ze de doorvoeroptie binnen een generatie maakt.

z.ai had bij registratie (juli 2026) geen publieke prijs voor GLM-5 Turbo gepubliceerd, dus we slaan geen facturatiecijfers op. Turbo-lagen zijn doorgaans goedkoper dan het basismodel, maar bevestig het werkelijke tarief op z.ai voordat je activeert.

We registreerden het met een groot (~200K-token) contextvenster als voorlopige waarde; documentatie over de GLM-5-generatie is schaars, dus bevestig het exacte venster op z.ai voordat je erop vertrouwt.

Architectuur & trainingssignalen

GLM-5 Turbo is een op latentie/doorvoer gericht lid van de GLM-5-generatie van Zhipu AI. Gedetailleerde openbare documentatie is per juli 2026 beperkt. We beschouwen het als een snel, redeneer-capabel chatmodel met tool- en JSON-ondersteuning via een OpenAI-compatibel eindpunt. Zoals de rest van de GLM-lijn levert het een niet-standaard reasoning_content-veld naast content; integraties moeten content lezen voor het uiteindelijke antwoord en reasoning_content als optioneel spoor behandelen.

Waar het uitblinkt

  • Taken met hogere doorvoer of latentiegevoeligheid binnen de GLM-5-generatie.
  • Bulkverwerking waarbij snelheid en kosten zwaarder wegen dan de laatste paar punten kwaliteit.
  • Tool-aanroepen en JSON-uitvoer.

Waar het tekortschiet

  • Geen gepubliceerde prijs bij registratie — bevestig voor activatie.
  • Waarschijnlijk een kleine kwaliteitsruil ten opzichte van de GLM-5-basis; verifieer als kwaliteit cruciaal is.
  • Niet-EU-hosting.

Praktijkvoorbeelden

  • Classificatie, extractie of opstellen met hoog volume waarbij latentie telt.
  • Interactieve ervaringen die snellere reacties nodig hebben.
  • Agentische lussen met veel korte aanroepen.

Tokonomix-benchmarkmomentopname

GLM-5 Turbo is nieuw geregistreerd op Tokonomix en nog niet geactiveerd, dus we hebben het nog niet door onze wekelijkse intelligentietest of snelheidsbenchmark gehaald. Er zijn nog geen Tokonomix-scores om te melden — en we verzinnen ze niet.

Zodra het live gaat, komt het in dezelfde wekelijkse harnas als elk ander model: identieke prompts, een onafhankelijke cross-family-jury en reproduceerbare latentie- en kostenmetingen. Behandel tot die tijd de prijs- en capaciteitsnotities op deze pagina als het door de leverancier opgegeven startpunt, niet als gemeten Tokonomix-resultaten.

EU-privacy & dataresidentie

GLM-5 Turbo is gebouwd door Zhipu AI (z.ai), een lab met hoofdkantoor in China, en wordt geserveerd vanaf niet-EU-infrastructuur. Dit moeten we duidelijk stellen: een prompt naar dit model sturen is geen keuze voor EU-dataresidentie of GDPR-soevereiniteit, en Tokonomix zal het nooit als zodanig bestempelen.

Als uw gebruikssituatie vereist dat data binnen de EU blijft, kies dan een EU-gehost model (bijvoorbeeld onze OVH- of Azure-EU-routes) in plaats van een GLM-model. Tokonomix houdt z.ai standaard buiten elke EU-only/soevereine routeringsset. Gebruik GLM waar de capaciteit of prijs de prioriteit is en grensoverschrijdende verwerking voor die taak aanvaardbaar is.

Oordeel & alternatieven

GLM-5 Turbo is de doorvoeroptie van de GLM-5-generatie. Kies het wanneer snelheid en kosten belangrijker zijn dan het laatste beetje kwaliteit — maar bevestig eerst de ongepubliceerde prijs. Voor maximale kwaliteit gebruik je GLM-5 of GLM-5.2; voor gratis doorvoer de GLM Flash-lagen.

Laatste automatische test
22 jul 2026 · 08:03 UTC · Snelheidstest
P50 latency
4056 ms
P95 latency
4150 ms
Fouten
0 / 6 runs
Laatst beoordeeld door Tokonomix-team·8 juli 2026