Ir al contenido
Tier A — Frontera
Se ejecuta en:CNCreado en:China
Z.ai (GLM / Zhipu)

GLM-4.6

Tier A — Frontera · 205K tokens

Equipo editorial Tokonomix·Revisado por Mes Kalkan··

GLM-4.6 es un modelo consolidado de la gama GLM-4 de Zhipu, construido en torno a una gran ventana de contexto y un enfoque en el código y el uso agéntico de herramientas. Ofrece la mayor parte del valor práctico de GLM-4.7 y es uno de los modelos de chat GLM más maduros.

Sección 01

Análisis de velocidad

Latencia medida en todas las ejecuciones de benchmark. P50 (mediana) y P95 (percentil 95) dan una imagen realista de la velocidad de respuesta bajo carga normal y máxima.

Latencia P50 (mediana)Latencia P9557 runs
1004862816252238763150007-0807-22ms
Sección 02

Puntuaciones de calidad

Resultados de evaluación de modelos juez en diversas categorías de tareas. Las puntuaciones reflejan coherencia, precisión y seguimiento de instrucciones.

93
Generación de código
0
Creativo
Sección 03

Historial de precios

Tarifas directas del proveedor por millón de tokens, más una estimación del coste de una conversación típica.

💰
Tarifas API — GLM-4.6
$0.6000 por 1M de tokens de entrada
$2.20 por 1M de tokens de salida
≈ $0.0008 por conversación típica (800 tokens)
Precio entrada vs salida (por 1M de tokens)
por 1M de tokens de entrada$0.6000
por 1M de tokens de salida$2.20

Pricing over time

Input & output per 1M tokens · step-line = price changes

$0.6000

input / 1M

— stable

$2.20

output / 1M

— stable

2026-07-122026-07-192026-07-19
Input
Output
Price change
⟳ synced weekly
Sección 04

Tokens por segundo

Rendimiento en tokens por segundo, derivado de la latencia P50 medida. Más alto es mejor; las fluctuaciones reflejan la carga del lado del proveedor.

Rendimiento (tokens / s)55 / avg 61
19812

Estimado a partir de latencia P50 × 200 tokens de salida — el número absoluto depende de esta suposición; lo que importa es la tendencia.

Sección 05

Capacidades

jsonnotes: GLM emits a non-standard reasoning_content field beside content; read content for the answer.toolsreasoning
Sección 06

Disponibilidad

Disponibilidad

Con qué frecuencia responde este modelo cuando lo llamamos — medido en solicitudes reales de API y pruebas en vivo durante los últimos 30 días. Esto es independiente de la calidad: estos números solo indican si el modelo responde, no qué tan buena es la respuesta.

Últimos 7 días

Últimos 30 días

100.0%

n=17

Tiempo de respuesta mediano

65,035ms

n=17

Basado en 194 mediciones en los últimos 30 días.

Detalles técnicos

Solo cuentan las llamadas reales a la API y las solicitudes de prueba en vivo — las sondas internas y las ejecuciones de referencia están excluidas.

Las llamadas con una clave API propia (BYOK) están excluidas: esos fallos son específicos de la clave, no una señal de inactividad del modelo.

Las llamadas fallidas NO se incluyen en las puntuaciones de calidad — la calidad se mide solo en respuestas exitosas. Disponibilidad y calidad son señales independientes.

Tiempo de respuesta mediano (p50) en llamadas exitosas con una duración registrada. Los valores atípicos afectan menos a la mediana que a la media.

Total de llamadas (30d)

17

Respuestas OK (30d)

17

Total de llamadas (7d)

0

Respuestas OK (7d)

0

Sección 07

Veredictos del benchmark Tokonomix

⚖️
Endorsed by 1 judge
Independent LLM judges evaluated this model on our weekly intelligence tests
claude-sonnet-4-577/100 · 5 runs
4 correct0 partial1 wrong80% accuracy
2026-07-19

GLM-4.6 maintains strong coding with new JSON and tool capabilities

GLM-4.6 from Zhipu continues to demonstrate solid performance in the current benchmark window, building on its established strengths. The model shows consistent coding capabilities, maintaining its position as a competent option for development tasks. New capabilities have been added including native JSON output formatting, tool use functionality, and reasoning features, expanding the model's practical applications beyond its core competencies. Performance remains stable across key evaluation areas, with the model showing particular reliability in structured tasks. The addition of JSON mode and tool calling capabilities makes GLM-4.6 more versatile for integration into production workflows where formatted outputs and function calling are essential. The reasoning capability addition suggests an attempt to handle more complex multi-step problems, though the extent of improvement in this area would require further evaluation. For developers and teams considering GLM-4.6, the model presents a balanced option with established coding performance now supplemented by practical features like tool use and structured output. The stability in core performance combined with incremental capability additions positions it as a reliable choice for applications requiring consistent behavior alongside modern API features.

Quality

Latency p50

Test runs

0

JSON output mode added Tool calling capability enabled Reasoning feature introduced Stable coding performance maintained
Sección 08

Perfil completo del modelo

GLM-4.6: GLM de contexto largo, centrado en código

GLM-4.6 es un modelo consolidado de la gama GLM-4 de Zhipu, construido en torno a una gran ventana de contexto y un enfoque en el código y el uso agéntico de herramientas. Ofrece la mayor parte del valor práctico de GLM-4.7 y es uno de los modelos de chat GLM más maduros.

z.ai publica GLM-4.6 a 0,60 $ por 1M de tokens de entrada y 2,20 $ por 1M de tokens de salida, el mismo nivel de valor que GLM-4.7.

Anuncia una gran ventana de contexto de ~200K tokens — una característica definitoria de GLM-4.6 para el trabajo con archivos largos y a escala de repositorio.

Arquitectura y señales de entrenamiento

GLM-4.6 forma parte de la gama GLM-4 de Zhipu AI, que llamó la atención por sus modelos de pesos abiertos capaces, centrados en el código, las tareas agénticas y el contexto largo. Es un modelo de chat apto para el razonamiento, con llamada a herramientas y JSON a través de un endpoint compatible con OpenAI. Como el resto de la gama GLM, devuelve un campo no estándar reasoning_content junto a content; las integraciones deben leer content para la respuesta final y tratar reasoning_content como una traza opcional.

Dónde destaca

  • Trabajo de contexto largo — su gran ventana es el atractivo principal.
  • Código y uso agéntico de herramientas.
  • Una opción GLM rentable y bien probada.

Dónde se queda corto

  • GLM-4.7 y la generación GLM-5 pueden superarlo por poco en capacidades más recientes.
  • Aún no hay puntuaciones de benchmark de Tokonomix; valida en tu carga de trabajo.
  • Alojamiento fuera de la UE.

Casos de uso reales

  • Comprensión y generación de código a escala de repositorio.
  • Análisis de documentos largos donde todo el texto debe caber en una sola llamada.
  • Tuberías agénticas que necesitan llamadas a herramientas fiables.

Instantánea del benchmark de Tokonomix

GLM-4.6 está recién registrado en Tokonomix y aún no activado, por lo que todavía no lo hemos sometido a nuestra prueba de inteligencia semanal ni a nuestro benchmark de velocidad. Aún no hay puntuaciones de Tokonomix que informar — y no las inventaremos.

Cuando se active, entra en el mismo banco de pruebas semanal que cualquier otro modelo: prompts idénticos, un juez independiente de otra familia y mediciones reproducibles de latencia y coste. Hasta entonces, trate las notas de precio y capacidad de esta página como el punto de partida publicado por el proveedor, no como resultados medidos por Tokonomix.

Privacidad en la UE y residencia de datos

GLM-4.6 está desarrollado por Zhipu AI (z.ai), un laboratorio con sede en China, y se sirve desde infraestructura fuera de la UE. Conviene decirlo con claridad: enviar un prompt a este modelo no es una opción de residencia de datos en la UE ni de soberanía RGPD, y Tokonomix nunca lo etiquetará como tal.

Si su caso de uso exige que los datos permanezcan dentro de la UE, elija un modelo alojado en la UE (por ejemplo nuestras rutas OVH o Azure-EU) en lugar de un modelo GLM. Tokonomix mantiene a z.ai fuera de cualquier conjunto de enrutamiento solo-UE/soberano por diseño. Use GLM donde la capacidad o el precio sean la prioridad y el procesamiento transfronterizo sea aceptable para esa tarea.

Veredicto y alternativas

GLM-4.6 es un GLM fiable, de contexto largo y centrado en código, a buen precio. Para la última iteración, GLM-4.7; para la última generación entera, GLM-5.x. Para experimentar gratis, combínalo con los niveles GLM Flash.

Última prueba automática
22 jul 2026 · 08:01 UTC · Benchmark de velocidad
Latencia P50
3642 ms
Latencia P95
4888 ms
Errores
0 / 6 ejecuciones
Última revisión por Equipo Tokonomix·8 de julio de 2026