Ir al contenido
Tier A — Frontera
Se ejecuta en:CNCreado en:China
Z.ai (GLM / Zhipu)

GLM-5

Tier A — Frontera · 205K tokens

Equipo editorial Tokonomix·Revisado por Mes Kalkan··

GLM-5 es el modelo base de la generación GLM-5 de Zhipu en z.ai — el caballo de batalla de la generación, con un precio inferior al del buque insignia GLM-5.2. Es un modelo de chat de razonamiento compatible con OpenAI, con soporte de herramientas y JSON.

Sección 01

Análisis de velocidad

Latencia medida en todas las ejecuciones de benchmark. P50 (mediana) y P95 (percentil 95) dan una imagen realista de la velocidad de respuesta bajo carga normal y máxima.

Latencia P50 (mediana)Latencia P95104 runs
91542657614109641431308-1209-07ms
Sección 02

Puntuaciones de calidad

Cómo se sitúa este modelo frente al resto del campo en cada categoría de prompts, a partir de un ajuste por pares sobre los mismos prompts. La nota bruta del juez aparece debajo de cada número.

57%
Generación de código
media del juez 93
89%
Creativo
media del juez 98
64%
Factual
media del juez 91
62%
Razonamiento
media del juez 98

Tasa de victorias por categoría: con qué frecuencia este modelo vence a un modelo medio en un prompt de esa categoría. 50% es la media, no un suspenso. No es un porcentaje de aciertos.

Sección 03

Historial de precios

Tarifas directas del proveedor por millón de tokens, más una estimación del coste de una conversación típica.

💰
Tarifas API — GLM-5
$1.00 por 1M de tokens de entrada
$3.20 por 1M de tokens de salida
≈ $0.0012 por conversación típica (800 tokens)
Precio entrada vs salida (por 1M de tokens)
por 1M de tokens de entrada$1.00
por 1M de tokens de salida$3.20

Pricing over time

Input & output per 1M tokens · step-line = price changes

$1.00

input / 1M

— stable

$3.20

output / 1M

— stable

2026-07-122026-08-162026-09-06
Input
Output
Price change
⟳ synced weekly
Sección 04

Tokens por segundo

Rendimiento en tokens por segundo, derivado de la latencia P50 medida. Más alto es mejor; las fluctuaciones reflejan la carga del lado del proveedor.

Rendimiento (tokens / s)74 / avg 92
21741

Estimado a partir de latencia P50 × 200 tokens de salida — el número absoluto depende de esta suposición; lo que importa es la tendencia.

Sección 05

Capacidades

jsonnotes: GLM emits a non-standard reasoning_content field beside content; read content for the answer.toolsreasoning
Sección 06

Disponibilidad

Disponibilidad

Con qué frecuencia responde este modelo cuando lo llamamos — medido en solicitudes reales de API y pruebas en vivo durante los últimos 30 días. Esto es independiente de la calidad: estos números solo indican si el modelo responde, no qué tan buena es la respuesta.

Últimos 7 días

Últimos 30 días

33.3%

n=6

Tiempo de respuesta mediano

91,708ms

n=2

Basado en 385 mediciones en los últimos 30 días.

Detalles técnicos

Solo cuentan las llamadas reales a la API y las solicitudes de prueba en vivo — las sondas internas y las ejecuciones de referencia están excluidas.

Las llamadas con una clave API propia (BYOK) están excluidas: esos fallos son específicos de la clave, no una señal de inactividad del modelo.

Las llamadas fallidas NO se incluyen en las puntuaciones de calidad — la calidad se mide solo en respuestas exitosas. Disponibilidad y calidad son señales independientes.

Tiempo de respuesta mediano (p50) en llamadas exitosas con una duración registrada. Los valores atípicos afectan menos a la mediana que a la media.

Total de llamadas (30d)

6

Respuestas OK (30d)

2

Total de llamadas (7d)

0

Respuestas OK (7d)

0

Sección 07

Veredictos del benchmark Tokonomix

⚖️
Endorsed by 1 judge
Independent LLM judges evaluated this model on our weekly intelligence tests
claude-sonnet-4-594/100 · 28 runs
26 correct0 partial2 wrong93% accuracy
2026-09-06

GLM-5 shows slight quality decline with increased latency

GLM-5 has returned with limited benchmark data, showing a modest decline from previous performance levels. The overall quality score dropped from 97.0 to 96.0, while latency increased by 18% from 7051ms to 8287ms at the median. The current testing window includes only two test runs, compared to three in the previous period, which limits the statistical confidence of these results. Coding performance specifically declined from a perfect 100 to 96, though this remains a strong absolute score. Notably absent from the current window are factual and reasoning category results, which previously showed excellent performance at 100 and 91 respectively. This makes it difficult to assess whether the model has changed in these areas or if testing coverage has simply narrowed. The reduced test run count and missing category data suggest either limited evaluation activity or a more focused testing approach. Users should note that while the current scores remain competitive, the directional trend shows degradation across both performance and speed metrics. The model continues to demonstrate strong coding capabilities, but the incomplete picture from this benchmark window makes it challenging to draw definitive conclusions about overall capability changes.

Calidad

96.0

Latencia p50

8,287 ms

Ejecuciones de test

2

Quality score decreased to 96 Latency increased 18% Coding score dropped from 100 Limited category coverage
Sección 08

Perfil completo del modelo

GLM-5: la base de la nueva generación de Zhipu

GLM-5 es el modelo base de la generación GLM-5 de Zhipu en z.ai — el caballo de batalla de la generación, con un precio inferior al del buque insignia GLM-5.2. Es un modelo de chat de razonamiento compatible con OpenAI, con soporte de herramientas y JSON.

z.ai publica GLM-5 a 1,00 $ por 1M de tokens de entrada y 3,20 $ por 1M de tokens de salida — más barato que el buque insignia GLM-5.2 dentro de la misma generación.

Lo registramos con una gran ventana de contexto (~200K tokens) como cifra provisional; la documentación de la generación GLM-5 es escasa, así que confirma la ventana exacta en z.ai antes de confiar en ella.

Arquitectura y señales de entrenamiento

GLM-5 es la base de la generación GLM-5 de Zhipu AI. Los detalles técnicos públicos siguen siendo limitados a julio de 2026; lo consideramos un gran modelo de chat orientado al razonamiento, con llamada a herramientas y JSON estructurado a través de un endpoint compatible con OpenAI. Como el resto de la gama GLM, devuelve un campo no estándar reasoning_content junto a content; las integraciones deben leer content para la respuesta final y tratar reasoning_content como una traza opcional.

Dónde destaca

  • Un punto equilibrado de calidad frente a precio dentro de la generación GLM más reciente.
  • Razonamiento y análisis de contexto largo.
  • Diversidad entre familias en un panel de consenso.

Dónde se queda corto

  • Aún más caro que la gama GLM-4.x y los niveles flash gratuitos.
  • Datos de benchmark reproducibles limitados; verifica en tu carga de trabajo.
  • Alojamiento fuera de la UE.

Casos de uso reales

  • Razonamiento general cuando quieres la calidad GLM de la generación actual sin el precio del buque insignia.
  • Análisis de documentos y resumen.
  • Tuberías agénticas de uso de herramientas.

Instantánea del benchmark de Tokonomix

GLM-5 está recién registrado en Tokonomix y aún no activado, por lo que todavía no lo hemos sometido a nuestra prueba de inteligencia semanal ni a nuestro benchmark de velocidad. Aún no hay puntuaciones de Tokonomix que informar — y no las inventaremos.

Cuando se active, entra en el mismo banco de pruebas semanal que cualquier otro modelo: prompts idénticos, un juez independiente de otra familia y mediciones reproducibles de latencia y coste. Hasta entonces, trate las notas de precio y capacidad de esta página como el punto de partida publicado por el proveedor, no como resultados medidos por Tokonomix.

Privacidad en la UE y residencia de datos

GLM-5 está desarrollado por Zhipu AI (z.ai), un laboratorio con sede en China, y se sirve desde infraestructura fuera de la UE. Conviene decirlo con claridad: enviar un prompt a este modelo no es una opción de residencia de datos en la UE ni de soberanía RGPD, y Tokonomix nunca lo etiquetará como tal.

Si su caso de uso exige que los datos permanezcan dentro de la UE, elija un modelo alojado en la UE (por ejemplo nuestras rutas OVH o Azure-EU) en lugar de un modelo GLM. Tokonomix mantiene a z.ai fuera de cualquier conjunto de enrutamiento solo-UE/soberano por diseño. Use GLM donde la capacidad o el precio sean la prioridad y el procesamiento transfronterizo sea aceptable para esa tarea.

Veredicto y alternativas

GLM-5 es la opción por defecto sensata dentro de la generación GLM-5: la mayor parte de la calidad de la generación más reciente a un precio inferior al de GLM-5.2. Si necesitas el máximo absoluto, opta por GLM-5.2; si el presupuesto domina, baja a GLM-4.6/4.5 o a los modelos flash gratuitos.

Última prueba automática
7 sept 2026 · 14:02 UTC · Benchmark de velocidad
Latencia P50
2714 ms
Latencia P95
3145 ms
Errores
0 / 6 ejecuciones
Última revisión por Equipo Tokonomix·8 de julio de 2026