Ir al contenido
Tier A — Frontera
Se ejecuta en:CNCreado en:China
Z.ai (GLM / Zhipu)

GLM-4.6V (vision)

Tier A — Frontera · 205K tokens

Equipo editorial Tokonomix·Revisado por Mes Kalkan··

GLM-4.6V es el modelo con capacidad de visión de la gama GLM-4.6: acepta imágenes junto con texto y razona sobre ambos. Combina comprensión multimodal con la gran ventana de contexto de la gama GLM-4.6, a un precio notablemente bajo.

Sección 01

Análisis de velocidad

Latencia medida en todas las ejecuciones de benchmark. P50 (mediana) y P95 (percentil 95) dan una imagen realista de la velocidad de respuesta bajo carga normal y máxima.

Latencia P50 (mediana)Latencia P95104 runs
85441597463107681407208-1509-10ms
Sección 02

Puntuaciones de calidad

Cómo se sitúa este modelo frente al resto del campo en cada categoría de prompts, a partir de un ajuste por pares sobre los mismos prompts. La nota bruta del juez aparece debajo de cada número.

38%
Generación de código
media del juez 68
4%
Creativo
media del juez 40
27%
Factual
media del juez 49
5%
Razonamiento
media del juez 16

Tasa de victorias por categoría: con qué frecuencia este modelo vence a un modelo medio en un prompt de esa categoría. 50% es la media, no un suspenso. No es un porcentaje de aciertos.

Sección 03

Historial de precios

Tarifas directas del proveedor por millón de tokens, más una estimación del coste de una conversación típica.

💰
Tarifas API — GLM-4.6V (vision)
$0.3000 por 1M de tokens de entrada
$0.9000 por 1M de tokens de salida
≈ $0.0004 por conversación típica (800 tokens)
Precio entrada vs salida (por 1M de tokens)
por 1M de tokens de entrada$0.3000
por 1M de tokens de salida$0.9000

Pricing over time

Input & output per 1M tokens · step-line = price changes

$0.3000

input / 1M

— stable

$0.9000

output / 1M

— stable

2026-07-122026-08-092026-09-06
Input
Output
Price change
⟳ synced weekly
Sección 04

Tokens por segundo

Rendimiento en tokens por segundo, derivado de la latencia P50 medida. Más alto es mejor; las fluctuaciones reflejan la carga del lado del proveedor.

Rendimiento (tokens / s)124 / avg 130
23228

Estimado a partir de latencia P50 × 200 tokens de salida — el número absoluto depende de esta suposición; lo que importa es la tendencia.

Sección 05

Capacidades

jsonnotes: GLM emits a non-standard reasoning_content field beside content; read content for the answer.toolsvision
Sección 06

Disponibilidad

Disponibilidad

Sin datos todavía

Aún no hemos registrado suficientes llamadas a la API para mostrar estadísticas de disponibilidad de este modelo. Los datos aparecen una vez que el modelo comienza a recibir tráfico en vivo.

Sección 07

Veredictos del benchmark Tokonomix

⚖️
Endorsed by 1 judge
Independent LLM judges evaluated this model on our weekly intelligence tests
claude-sonnet-4-547/100 · 27 runs
10 correct0 partial17 wrong37% accuracy
2026-09-06

GLM-4.6V debuts with vision, tools, and JSON mode support

GLM-4.6V from Zhipu AI enters the benchmark with a full suite of modern capabilities including vision processing, tool calling, and structured JSON output. The model shows balanced performance across core reasoning tasks, achieving 70.8% on MMLU and 49.7% on GPQA Diamond, placing it in the middle tier of current vision-language models. Its mathematical reasoning capabilities are modest, with 54.1% on MATH and 71.2% on GSM8K. The vision component handles both image understanding and multimodal reasoning, though specific vision benchmark scores are not yet available in this window. Tool calling and JSON mode support make it suitable for agentic workflows and structured data extraction tasks. The model represents Zhipu's continued expansion of their GLM series into multimodal territory, offering developers a Chinese-developed alternative with comprehensive API features. Performance is solid but not exceptional compared to leading models, suggesting it may find its niche in applications where regional deployment, language support, or specific integration requirements matter more than raw benchmark scores. The inclusion of vision capabilities alongside structured output modes positions it well for practical enterprise applications.

Calidad

Latencia p50

Ejecuciones de test

0

Vision capability added Tool calling support launched JSON mode now available Solid MMLU performance at 70.8%
Sección 08

Perfil completo del modelo

GLM-4.6V: visión de contexto largo de Zhipu

GLM-4.6V es el modelo con capacidad de visión de la gama GLM-4.6: acepta imágenes junto con texto y razona sobre ambos. Combina comprensión multimodal con la gran ventana de contexto de la gama GLM-4.6, a un precio notablemente bajo.

z.ai publica GLM-4.6V a 0,30 $ por 1M de tokens de entrada y 0,90 $ por 1M de tokens de salida — un precio agresivamente bajo para un modelo con capacidad de visión.

Anuncia una gran ventana de contexto de ~200K tokens, por lo que las imágenes pueden combinarse con texto sustancial en una sola llamada.

Arquitectura y señales de entrenamiento

GLM-4.6V es la variante de visión del GLM-4.6 de Zhipu AI. Amplía el modelo de texto con entrada de imágenes, produciendo salida de texto que razona sobre las imágenes proporcionadas. Expone llamadas a herramientas y JSON a través de un endpoint compatible con OpenAI. Su modalidad de salida es texto (describe/razona sobre imágenes, no las genera). Como el resto de la gama GLM, devuelve un campo no estándar reasoning_content junto a content; las integraciones deben leer content para la respuesta final y tratar reasoning_content como una traza opcional.

Dónde destaca

  • Comprensión de imágenes: describir, comparar, extraer información de fotos y capturas de pantalla.
  • Combinar imágenes con contexto de texto largo en una sola llamada.
  • Precio muy bajo para un modelo multimodal.

Dónde se queda corto

  • Lee imágenes, no las genera; para generación de imágenes usa los modelos GLM-Image / CogView de z.ai.
  • Aún no hay datos de benchmark de Tokonomix; verifica la calidad de visión con tus propias imágenes.
  • Alojamiento fuera de la UE.

Casos de uso reales

  • Comprensión de documentos, gráficos y capturas de pantalla.
  • Preguntas y respuestas visuales y análisis multimodal a escala.
  • Un proponente de visión económico en un panel de consenso multimodal.

Instantánea del benchmark de Tokonomix

GLM-4.6V está recién registrado en Tokonomix y aún no activado, por lo que todavía no lo hemos sometido a nuestra prueba de inteligencia semanal ni a nuestro benchmark de velocidad. Aún no hay puntuaciones de Tokonomix que informar — y no las inventaremos.

Cuando se active, entra en el mismo banco de pruebas semanal que cualquier otro modelo: prompts idénticos, un juez independiente de otra familia y mediciones reproducibles de latencia y coste. Hasta entonces, trate las notas de precio y capacidad de esta página como el punto de partida publicado por el proveedor, no como resultados medidos por Tokonomix.

Privacidad en la UE y residencia de datos

GLM-4.6V está desarrollado por Zhipu AI (z.ai), un laboratorio con sede en China, y se sirve desde infraestructura fuera de la UE. Conviene decirlo con claridad: enviar un prompt a este modelo no es una opción de residencia de datos en la UE ni de soberanía RGPD, y Tokonomix nunca lo etiquetará como tal.

Si su caso de uso exige que los datos permanezcan dentro de la UE, elija un modelo alojado en la UE (por ejemplo nuestras rutas OVH o Azure-EU) en lugar de un modelo GLM. Tokonomix mantiene a z.ai fuera de cualquier conjunto de enrutamiento solo-UE/soberano por diseño. Use GLM donde la capacidad o el precio sean la prioridad y el procesamiento transfronterizo sea aceptable para esa tarea.

Veredicto y alternativas

GLM-4.6V es un modelo de visión con una excelente relación calidad-precio: comprensión multimodal más contexto largo a precio bajo. Para una opción de visión gratuita, GLM-4.6V Flash; para generación de imágenes (no comprensión), los modelos GLM-Image / CogView.

Última prueba automática
10 sept 2026 · 02:03 UTC · Benchmark de velocidad
Latencia P50
1612 ms
Latencia P95
5790 ms
Errores
0 / 6 ejecuciones
Última revisión por Equipo Tokonomix·8 de julio de 2026