Ir al contenido
Tier A — Frontera
Se ejecuta en:CNCreado en:China
Z.ai (GLM / Zhipu)

GLM-4.7

Tier A — Frontera · 205K tokens

Equipo editorial Tokonomix·Revisado por Mes Kalkan··

GLM-4.7 es el modelo más reciente de la consolidada gama GLM-4 de Zhipu, posicionado como un modelo generalista y de código/agéntico sólido a un precio intermedio. Para muchas cargas de trabajo es el punto dulce de la familia GLM — más barato que la generación GLM-5 pero aún capaz.

Sección 01

Análisis de velocidad

Latencia medida en todas las ejecuciones de benchmark. P50 (mediana) y P95 (percentil 95) dan una imagen realista de la velocidad de respuesta bajo carga normal y máxima.

Latencia P50 (mediana)Latencia P95104 runs
1447896016474239873150008-1509-10ms
Sección 02

Puntuaciones de calidad

Cómo se sitúa este modelo frente al resto del campo en cada categoría de prompts, a partir de un ajuste por pares sobre los mismos prompts. La nota bruta del juez aparece debajo de cada número.

60%
Generación de código
media del juez 91
85%
Creativo
media del juez 96
75%
Factual
media del juez 88
74%
Razonamiento
media del juez 99

Tasa de victorias por categoría: con qué frecuencia este modelo vence a un modelo medio en un prompt de esa categoría. 50% es la media, no un suspenso. No es un porcentaje de aciertos.

Sección 03

Historial de precios

Tarifas directas del proveedor por millón de tokens, más una estimación del coste de una conversación típica.

💰
Tarifas API — GLM-4.7
$0.6000 por 1M de tokens de entrada
$2.20 por 1M de tokens de salida
≈ $0.0008 por conversación típica (800 tokens)
Precio entrada vs salida (por 1M de tokens)
por 1M de tokens de entrada$0.6000
por 1M de tokens de salida$2.20

Pricing over time

Input & output per 1M tokens · step-line = price changes

$0.6000

input / 1M

— stable

$2.20

output / 1M

— stable

2026-07-122026-08-162026-09-06
Input
Output
Price change
⟳ synced weekly
Sección 04

Tokens por segundo

Rendimiento en tokens por segundo, derivado de la latencia P50 medida. Más alto es mejor; las fluctuaciones reflejan la carga del lado del proveedor.

Rendimiento (tokens / s)22 / avg 53
1379

Estimado a partir de latencia P50 × 200 tokens de salida — el número absoluto depende de esta suposición; lo que importa es la tendencia.

Sección 05

Capacidades

jsonnotes: GLM emits a non-standard reasoning_content field beside content; read content for the answer.toolsreasoning
Sección 06

Disponibilidad

Disponibilidad

Sin datos todavía

Aún no hemos registrado suficientes llamadas a la API para mostrar estadísticas de disponibilidad de este modelo. Los datos aparecen una vez que el modelo comienza a recibir tráfico en vivo.

Sección 07

Veredictos del benchmark Tokonomix

⚖️
Endorsed by 1 judge
Independent LLM judges evaluated this model on our weekly intelligence tests
claude-sonnet-4-593/100 · 33 runs
30 correct0 partial3 wrong91% accuracy
2026-09-06

GLM-4.7 quality drops 22 points with latency degradation across benchmarks

GLM-4.7 experienced significant performance degradation in the current benchmark window, with overall quality falling from a perfect 100.0 to 77.7 points. The most severe decline occurred in coding performance, dropping from 100 to 63 points, representing a substantial regression in technical task handling. Creative performance remains the model's strongest category at 92 points, down from a perfect score but still demonstrating relative competency. Latency deteriorated notably, with p50 response times increasing 80% from 18413ms to 33220ms, now exceeding 33 seconds for typical requests. The benchmark window included only 4 test runs, matching the previous period's sample size. Factual and reasoning categories were not evaluated in the current window, making it unclear whether these capabilities have similarly regressed. The combination of quality decline and increased latency suggests potential issues with model deployment, infrastructure changes, or alterations to the underlying model configuration. Users should expect slower responses and reduced coding capabilities compared to the previous benchmark period, though creative tasks may still yield acceptable results.

Calidad

77.7

Latencia p50

33,220 ms

Ejecuciones de test

4

Quality dropped 22.3 points Coding performance fell to 63 Latency increased 80% Creative tasks remain strong
Sección 08

Perfil completo del modelo

GLM-4.7: el caballo de batalla económico de la gama GLM-4

GLM-4.7 es el modelo más reciente de la consolidada gama GLM-4 de Zhipu, posicionado como un modelo generalista y de código/agéntico sólido a un precio intermedio. Para muchas cargas de trabajo es el punto dulce de la familia GLM — más barato que la generación GLM-5 pero aún capaz.

z.ai publica GLM-4.7 a 0,60 $ por 1M de tokens de entrada y 2,20 $ por 1M de tokens de salida — un precio intermedio muy por debajo de la generación GLM-5.

Anuncia una gran ventana de contexto (~200K tokens en nuestro registro), adecuada para archivos largos y ejecuciones de agente de varios pasos.

Arquitectura y señales de entrenamiento

GLM-4.7 continúa la gama GLM-4 de Zhipu, notable por lanzamientos de pesos abiertos capaces y centrados en código y uso agéntico de herramientas. Es un modelo de chat apto para el razonamiento, con llamada a herramientas y JSON estructurado a través de un endpoint compatible con OpenAI. Como el resto de la gama GLM, devuelve un campo no estándar reasoning_content junto a content; las integraciones deben leer content para la respuesta final y tratar reasoning_content como una traza opcional.

Dónde destaca

  • Código y uso agéntico de herramientas — una fortaleza tradicional de la gama GLM-4.
  • Gran calidad por euro; una buena opción por defecto cuando los precios de GLM-5 son excesivos.
  • Tareas de contexto largo dentro de su ventana de ~200K.

Dónde se queda corto

  • No posicionado como un modelo frontera absoluto — para el razonamiento más difícil, GLM-5.2 o un modelo frontera estadounidense pueden superarlo por poco.
  • Aún no hay datos de benchmark independientes de Tokonomix; verifica en tus tareas.
  • Alojamiento fuera de la UE.

Casos de uso reales

  • Asistentes de código, refactorizaciones y bucles de build agénticos.
  • Redacción general, análisis y resumen a escala.
  • Un proponente de consenso rentable y descorrelacionado.

Instantánea del benchmark de Tokonomix

GLM-4.7 está recién registrado en Tokonomix y aún no activado, por lo que todavía no lo hemos sometido a nuestra prueba de inteligencia semanal ni a nuestro benchmark de velocidad. Aún no hay puntuaciones de Tokonomix que informar — y no las inventaremos.

Cuando se active, entra en el mismo banco de pruebas semanal que cualquier otro modelo: prompts idénticos, un juez independiente de otra familia y mediciones reproducibles de latencia y coste. Hasta entonces, trate las notas de precio y capacidad de esta página como el punto de partida publicado por el proveedor, no como resultados medidos por Tokonomix.

Privacidad en la UE y residencia de datos

GLM-4.7 está desarrollado por Zhipu AI (z.ai), un laboratorio con sede en China, y se sirve desde infraestructura fuera de la UE. Conviene decirlo con claridad: enviar un prompt a este modelo no es una opción de residencia de datos en la UE ni de soberanía RGPD, y Tokonomix nunca lo etiquetará como tal.

Si su caso de uso exige que los datos permanezcan dentro de la UE, elija un modelo alojado en la UE (por ejemplo nuestras rutas OVH o Azure-EU) en lugar de un modelo GLM. Tokonomix mantiene a z.ai fuera de cualquier conjunto de enrutamiento solo-UE/soberano por diseño. Use GLM donde la capacidad o el precio sean la prioridad y el procesamiento transfronterizo sea aceptable para esa tarea.

Veredicto y alternativas

GLM-4.7 es el caballo de batalla económico de la familia GLM: capaz, apto para código y con precio pensado para el volumen. Pasa a GLM-5.x solo cuando necesites específicamente el razonamiento de la última generación; para trabajo sin coste, el nivel gratuito GLM-4.7 Flash es el compañero natural.

Última prueba automática
10 sept 2026 · 08:03 UTC · Benchmark de velocidad
Latencia P50
8989 ms
Latencia P95
22941 ms
Errores
0 / 6 ejecuciones
Última revisión por Equipo Tokonomix·8 de julio de 2026