Ir al contenido
Tier B — Producción
Se ejecuta en:CNCreado en:China
Z.ai (GLM / Zhipu)

GLM-4.5 Air

Tier B — Producción · 131K tokens

Equipo editorial Tokonomix·Revisado por Mes Kalkan··

GLM-4.5 Air es el hermano ligero de GLM-4.5 — un modelo más pequeño y barato, ajustado para la velocidad y el volumen. Es la GLM a la que recurrir cuando el coste por token y el rendimiento importan más que la calidad máxima.

Sección 01

Análisis de velocidad

Latencia medida en todas las ejecuciones de benchmark. P50 (mediana) y P95 (percentil 95) dan una imagen realista de la velocidad de respuesta bajo carga normal y máxima.

Latencia P50 (mediana)Latencia P9557 runs
369815215935237173150007-0807-22ms
Sección 02

Puntuaciones de calidad

Resultados de evaluación de modelos juez en diversas categorías de tareas. Las puntuaciones reflejan coherencia, precisión y seguimiento de instrucciones.

100
Generación de código
45
Creativo
Sección 03

Historial de precios

Tarifas directas del proveedor por millón de tokens, más una estimación del coste de una conversación típica.

💰
Tarifas API — GLM-4.5 Air
$0.2000 por 1M de tokens de entrada
$1.10 por 1M de tokens de salida
≈ $0.0003 por conversación típica (800 tokens)
Precio entrada vs salida (por 1M de tokens)
por 1M de tokens de entrada$0.2000
por 1M de tokens de salida$1.10

Pricing over time

Input & output per 1M tokens · step-line = price changes

$0.2000

input / 1M

— stable

$1.10

output / 1M

— stable

2026-07-122026-07-192026-07-19
Input
Output
Price change
⟳ synced weekly
Sección 04

Tokens por segundo

Rendimiento en tokens por segundo, derivado de la latencia P50 medida. Más alto es mejor; las fluctuaciones reflejan la carga del lado del proveedor.

Rendimiento (tokens / s)46 / avg 47
5366

Estimado a partir de latencia P50 × 200 tokens de salida — el número absoluto depende de esta suposición; lo que importa es la tendencia.

Sección 05

Capacidades

jsonnotes: GLM emits a non-standard reasoning_content field beside content; read content for the answer.toolsreasoning
Sección 06

Disponibilidad

Disponibilidad

Con qué frecuencia responde este modelo cuando lo llamamos — medido en solicitudes reales de API y pruebas en vivo durante los últimos 30 días. Esto es independiente de la calidad: estos números solo indican si el modelo responde, no qué tan buena es la respuesta.

Últimos 7 días

Últimos 30 días

100.0%

n=1

Tiempo de respuesta mediano

5,107ms

n=1

Basado en 178 mediciones en los últimos 30 días.

Detalles técnicos

Solo cuentan las llamadas reales a la API y las solicitudes de prueba en vivo — las sondas internas y las ejecuciones de referencia están excluidas.

Las llamadas con una clave API propia (BYOK) están excluidas: esos fallos son específicos de la clave, no una señal de inactividad del modelo.

Las llamadas fallidas NO se incluyen en las puntuaciones de calidad — la calidad se mide solo en respuestas exitosas. Disponibilidad y calidad son señales independientes.

Tiempo de respuesta mediano (p50) en llamadas exitosas con una duración registrada. Los valores atípicos afectan menos a la mediana que a la media.

Total de llamadas (30d)

1

Respuestas OK (30d)

1

Total de llamadas (7d)

0

Respuestas OK (7d)

0

Sección 07

Veredictos del benchmark Tokonomix

⚖️
Endorsed by 1 judge
Independent LLM judges evaluated this model on our weekly intelligence tests
claude-sonnet-4-574/100 · 6 runs
4 correct0 partial2 wrong67% accuracy
2026-07-19

GLM-4.5 Air adds tool support, reasoning; core performance unchanged

GLM-4.5 Air has expanded its capabilities with the addition of JSON mode, tool calling, and reasoning features, marking a significant enhancement to its functional toolkit. However, performance metrics across core tasks remain largely consistent with the previous benchmark window. The model continues to demonstrate strong competency in coding tasks while showing weaknesses in creative writing domains. The addition of tool support positions GLM-4.5 Air as more versatile for enterprise and application development scenarios, enabling function calling and structured output generation that were previously unavailable. The reasoning capability suggests potential for more complex problem-solving workflows, though benchmark scores indicate the fundamental quality of outputs has not shifted dramatically. Users evaluating this model should note that while the feature set has grown substantially, making it suitable for a broader range of use cases, the underlying performance characteristics remain steady. Creative writing tasks still represent a relative weakness compared to technical applications. The expanded capabilities make GLM-4.5 Air a more complete offering for developers seeking structured interactions and tool integration, while those prioritizing creative or narrative generation may still find limitations.

Quality

Latency p50

Test runs

0

JSON and tool support added New reasoning capability introduced Creative writing remains weak Core performance metrics unchanged
Sección 08

Perfil completo del modelo

GLM-4.5 Air: la GLM ligera y económica

GLM-4.5 Air es el hermano ligero de GLM-4.5 — un modelo más pequeño y barato, ajustado para la velocidad y el volumen. Es la GLM a la que recurrir cuando el coste por token y el rendimiento importan más que la calidad máxima.

z.ai publica GLM-4.5 Air a 0,20 $ por 1M de tokens de entrada y 1,10 $ por 1M de tokens de salida — el nivel GLM de pago más barato, muy por debajo del GLM-4.5 estándar.

Anuncia una ventana de contexto de 128K tokens.

Arquitectura y señales de entrenamiento

GLM-4.5 Air es la variante más pequeña y orientada a la eficiencia de GLM-4.5 de Zhipu AI. Mantiene la llamada a herramientas y el soporte de JSON en un paquete más ligero orientado al rendimiento y al coste, a través de un endpoint compatible con OpenAI. Como el resto de la gama GLM, devuelve un campo no estándar reasoning_content junto a content; las integraciones deben leer content para la respuesta final y tratar reasoning_content como una traza opcional.

Dónde destaca

  • Cargas de trabajo de alto volumen y sensibles al coste — clasificación, extracción, redacción masiva.
  • Menor latencia que el GLM-4.5 completo.
  • El punto de precio GLM de pago más bajo.

Dónde se queda corto

  • Techo más bajo que los modelos completos — no apto para el razonamiento más difícil.
  • Aún no hay datos de benchmark de Tokonomix; valida en tus propias tareas.
  • Alojamiento fuera de la UE.

Casos de uso reales

  • Procesamiento de datos masivo donde el coste domina.
  • Funciones interactivas que necesitan respuestas rápidas y baratas.
  • Un primer borrador antes de que un modelo más fuerte lo refine.

Instantánea del benchmark de Tokonomix

GLM-4.5 Air está recién registrado en Tokonomix y aún no activado, por lo que todavía no lo hemos sometido a nuestra prueba de inteligencia semanal ni a nuestro benchmark de velocidad. Aún no hay puntuaciones de Tokonomix que informar — y no las inventaremos.

Cuando se active, entra en el mismo banco de pruebas semanal que cualquier otro modelo: prompts idénticos, un juez independiente de otra familia y mediciones reproducibles de latencia y coste. Hasta entonces, trate las notas de precio y capacidad de esta página como el punto de partida publicado por el proveedor, no como resultados medidos por Tokonomix.

Privacidad en la UE y residencia de datos

GLM-4.5 Air está desarrollado por Zhipu AI (z.ai), un laboratorio con sede en China, y se sirve desde infraestructura fuera de la UE. Conviene decirlo con claridad: enviar un prompt a este modelo no es una opción de residencia de datos en la UE ni de soberanía RGPD, y Tokonomix nunca lo etiquetará como tal.

Si su caso de uso exige que los datos permanezcan dentro de la UE, elija un modelo alojado en la UE (por ejemplo nuestras rutas OVH o Azure-EU) en lugar de un modelo GLM. Tokonomix mantiene a z.ai fuera de cualquier conjunto de enrutamiento solo-UE/soberano por diseño. Use GLM donde la capacidad o el precio sean la prioridad y el procesamiento transfronterizo sea aceptable para esa tarea.

Veredicto y alternativas

GLM-4.5 Air es el nivel económico de GLM: barato y rápido, con un techo sensatamente más bajo. Cuando el coste importa aún más, los niveles GLM-4.7/4.5 Flash son gratuitos; cuando la calidad importa más, sube al GLM-4.5 completo o superior.

Última prueba automática
22 jul 2026 · 08:00 UTC · Benchmark de velocidad
Latencia P50
4376 ms
Latencia P95
15384 ms
Errores
0 / 6 ejecuciones
Última revisión por Equipo Tokonomix·8 de julio de 2026