Ir al contenido
Tier B — Producción
Se ejecuta en:CNCreado en:China
Z.ai (GLM / Zhipu)

GLM-5 Turbo

Tier B — Producción · 205K tokens

Equipo editorial Tokonomix·Revisado por Mes Kalkan··

GLM-5 Turbo es la variante orientada a la velocidad de la generación GLM-5 en z.ai. Los niveles GLM «Turbo» históricamente sacrifican algo de calidad máxima a cambio de menor latencia y coste, lo que los convierte en la opción de rendimiento dentro de una generación.

Sección 01

Análisis de velocidad

Latencia medida en todas las ejecuciones de benchmark. P50 (mediana) y P95 (percentil 95) dan una imagen realista de la velocidad de respuesta bajo carga normal y máxima.

Latencia P50 (mediana)Latencia P95104 runs
1340888016420239603150008-1209-07ms
Sección 02

Puntuaciones de calidad

Cómo se sitúa este modelo frente al resto del campo en cada categoría de prompts, a partir de un ajuste por pares sobre los mismos prompts. La nota bruta del juez aparece debajo de cada número.

49%
Generación de código
media del juez 71
31%
Creativo
media del juez 50
44%
Factual
media del juez 57
24%
Razonamiento
media del juez 27

Tasa de victorias por categoría: con qué frecuencia este modelo vence a un modelo medio en un prompt de esa categoría. 50% es la media, no un suspenso. No es un porcentaje de aciertos.

Sección 03

Historial de precios

Tarifas directas del proveedor por millón de tokens, más una estimación del coste de una conversación típica.

💰
Tarifas API — GLM-5 Turbo
$1.20 por 1M de tokens de entrada
$4.00 por 1M de tokens de salida
≈ $0.0015 por conversación típica (800 tokens)
Precio entrada vs salida (por 1M de tokens)
por 1M de tokens de entrada$1.20
por 1M de tokens de salida$4.00

Pricing over time

Input & output per 1M tokens · step-line = price changes

$1.20

input / 1M

— stable

$4.00

output / 1M

— stable

2026-07-122026-08-092026-09-06
Input
Output
Price change
⟳ synced weekly
Sección 04

Tokens por segundo

Rendimiento en tokens por segundo, derivado de la latencia P50 medida. Más alto es mejor; las fluctuaciones reflejan la carga del lado del proveedor.

Rendimiento (tokens / s)25 / avg 73
14821

Estimado a partir de latencia P50 × 200 tokens de salida — el número absoluto depende de esta suposición; lo que importa es la tendencia.

Sección 05

Capacidades

jsonnotes: GLM emits a non-standard reasoning_content field beside content; read content for the answer.toolsreasoningprice note: No published price on 2026-07-06
Sección 06

Disponibilidad

Disponibilidad

Sin datos todavía

Aún no hemos registrado suficientes llamadas a la API para mostrar estadísticas de disponibilidad de este modelo. Los datos aparecen una vez que el modelo comienza a recibir tráfico en vivo.

Sección 07

Veredictos del benchmark Tokonomix

⚖️
Endorsed by 1 judge
Independent LLM judges evaluated this model on our weekly intelligence tests
claude-sonnet-4-555/100 · 32 runs
14 correct1 partial17 wrong44% accuracy
2026-09-06

GLM-5 Turbo adds JSON, tools, and reasoning capabilities

GLM-5 Turbo has expanded its feature set with the addition of JSON mode, tool calling, and reasoning capabilities, marking a significant evolution in the model's functionality. These new capabilities bring the model in line with modern LLM expectations for structured outputs and agentic workflows. The additions of JSON mode and tools support enable developers to build more reliable integrations and multi-step applications. The reasoning capability suggests enhanced analytical performance for complex tasks. However, no benchmark performance data is available for this window, making it impossible to assess the model's actual capabilities in areas like accuracy, speed, or cost-effectiveness. Without comparative metrics on language understanding, code generation, or reasoning quality, users cannot evaluate how GLM-5 Turbo stacks up against alternatives. The lack of benchmark results also prevents verification of whether these new features perform competitively. Users interested in GLM-5 Turbo should wait for comprehensive benchmark data before making integration decisions, as feature availability alone doesn't indicate production readiness or competitive performance.

Calidad

Latencia p50

Ejecuciones de test

0

JSON mode added Tool calling support added Reasoning capability introduced No benchmark data available
Sección 08

Perfil completo del modelo

GLM-5 Turbo: la variante GLM-5 optimizada para la velocidad

GLM-5 Turbo es la variante orientada a la velocidad de la generación GLM-5 en z.ai. Los niveles GLM «Turbo» históricamente sacrifican algo de calidad máxima a cambio de menor latencia y coste, lo que los convierte en la opción de rendimiento dentro de una generación.

z.ai no había publicado un precio público para GLM-5 Turbo en el registro (julio de 2026), por lo que no almacenamos cifras de facturación. Los niveles Turbo suelen ser más baratos que el modelo base, pero confirma la tarifa real en z.ai antes de activarlo.

Lo registramos con una gran ventana de contexto (~200K tokens) como cifra provisional; la documentación de la generación GLM-5 es escasa, así que confirma la ventana exacta en z.ai antes de confiar en ella.

Arquitectura y señales de entrenamiento

GLM-5 Turbo es un miembro de la generación GLM-5 de Zhipu AI orientado a la latencia/rendimiento. La documentación pública detallada sigue siendo limitada a julio de 2026. Lo consideramos un modelo de chat rápido, capaz de razonar, con soporte de herramientas y JSON a través de un endpoint compatible con OpenAI. Como el resto de la gama GLM, devuelve un campo no estándar reasoning_content junto a content; las integraciones deben leer content para la respuesta final y tratar reasoning_content como una traza opcional.

Dónde destaca

  • Tareas de mayor rendimiento o sensibles a la latencia dentro de la generación GLM-5.
  • Procesamiento masivo donde la velocidad y el coste superan a exprimir los últimos puntos de calidad.
  • Llamada a herramientas y salida JSON.

Dónde se queda corto

  • Sin precio publicado en el registro — confirmar antes de activar.
  • Probablemente un pequeño sacrificio de calidad frente a la base GLM-5; verifica si la calidad es crítica.
  • Alojamiento fuera de la UE.

Casos de uso reales

  • Clasificación, extracción o redacción de alto volumen donde la latencia importa.
  • Experiencias interactivas que necesitan respuestas más rápidas.
  • Bucles agénticos con muchas llamadas cortas.

Instantánea del benchmark de Tokonomix

GLM-5 Turbo está recién registrado en Tokonomix y aún no activado, por lo que todavía no lo hemos sometido a nuestra prueba de inteligencia semanal ni a nuestro benchmark de velocidad. Aún no hay puntuaciones de Tokonomix que informar — y no las inventaremos.

Cuando se active, entra en el mismo banco de pruebas semanal que cualquier otro modelo: prompts idénticos, un juez independiente de otra familia y mediciones reproducibles de latencia y coste. Hasta entonces, trate las notas de precio y capacidad de esta página como el punto de partida publicado por el proveedor, no como resultados medidos por Tokonomix.

Privacidad en la UE y residencia de datos

GLM-5 Turbo está desarrollado por Zhipu AI (z.ai), un laboratorio con sede en China, y se sirve desde infraestructura fuera de la UE. Conviene decirlo con claridad: enviar un prompt a este modelo no es una opción de residencia de datos en la UE ni de soberanía RGPD, y Tokonomix nunca lo etiquetará como tal.

Si su caso de uso exige que los datos permanezcan dentro de la UE, elija un modelo alojado en la UE (por ejemplo nuestras rutas OVH o Azure-EU) en lugar de un modelo GLM. Tokonomix mantiene a z.ai fuera de cualquier conjunto de enrutamiento solo-UE/soberano por diseño. Use GLM donde la capacidad o el precio sean la prioridad y el procesamiento transfronterizo sea aceptable para esa tarea.

Veredicto y alternativas

GLM-5 Turbo es la opción de rendimiento de la generación GLM-5. Elígelo cuando la velocidad y el coste importen más que el último incremento de calidad — pero confirma primero su precio no publicado. Para máxima calidad, usa GLM-5 o GLM-5.2; para rendimiento gratuito, los niveles GLM Flash.

Última prueba automática
7 sept 2026 · 08:05 UTC · Benchmark de velocidad
Latencia P50
7854 ms
Latencia P95
8680 ms
Errores
0 / 6 ejecuciones
Última revisión por Equipo Tokonomix·8 de julio de 2026