GLM-4.6V es el modelo con capacidad de visión de la gama GLM-4.6: acepta imágenes junto con texto y razona sobre ambos. Combina comprensión multimodal con la gran ventana de contexto de la gama GLM-4.6, a un precio notablemente bajo.
z.ai publica GLM-4.6V a 0,30 $ por 1M de tokens de entrada y 0,90 $ por 1M de tokens de salida — un precio agresivamente bajo para un modelo con capacidad de visión.
Anuncia una gran ventana de contexto de ~200K tokens, por lo que las imágenes pueden combinarse con texto sustancial en una sola llamada.
Arquitectura y señales de entrenamiento
GLM-4.6V es la variante de visión del GLM-4.6 de Zhipu AI. Amplía el modelo de texto con entrada de imágenes, produciendo salida de texto que razona sobre las imágenes proporcionadas. Expone llamadas a herramientas y JSON a través de un endpoint compatible con OpenAI. Su modalidad de salida es texto (describe/razona sobre imágenes, no las genera). Como el resto de la gama GLM, devuelve un campo no estándar reasoning_content junto a content; las integraciones deben leer content para la respuesta final y tratar reasoning_content como una traza opcional.
Dónde destaca
- Comprensión de imágenes: describir, comparar, extraer información de fotos y capturas de pantalla.
- Combinar imágenes con contexto de texto largo en una sola llamada.
- Precio muy bajo para un modelo multimodal.
Dónde se queda corto
- Lee imágenes, no las genera; para generación de imágenes usa los modelos GLM-Image / CogView de z.ai.
- Aún no hay datos de benchmark de Tokonomix; verifica la calidad de visión con tus propias imágenes.
- Alojamiento fuera de la UE.
Casos de uso reales
- Comprensión de documentos, gráficos y capturas de pantalla.
- Preguntas y respuestas visuales y análisis multimodal a escala.
- Un proponente de visión económico en un panel de consenso multimodal.
Instantánea del benchmark de Tokonomix
GLM-4.6V está recién registrado en Tokonomix y aún no activado, por lo que todavía no lo hemos sometido a nuestra prueba de inteligencia semanal ni a nuestro benchmark de velocidad. Aún no hay puntuaciones de Tokonomix que informar — y no las inventaremos.
Cuando se active, entra en el mismo banco de pruebas semanal que cualquier otro modelo: prompts idénticos, un juez independiente de otra familia y mediciones reproducibles de latencia y coste. Hasta entonces, trate las notas de precio y capacidad de esta página como el punto de partida publicado por el proveedor, no como resultados medidos por Tokonomix.
Privacidad en la UE y residencia de datos
GLM-4.6V está desarrollado por Zhipu AI (z.ai), un laboratorio con sede en China, y se sirve desde infraestructura fuera de la UE. Conviene decirlo con claridad: enviar un prompt a este modelo no es una opción de residencia de datos en la UE ni de soberanía RGPD, y Tokonomix nunca lo etiquetará como tal.
Si su caso de uso exige que los datos permanezcan dentro de la UE, elija un modelo alojado en la UE (por ejemplo nuestras rutas OVH o Azure-EU) en lugar de un modelo GLM. Tokonomix mantiene a z.ai fuera de cualquier conjunto de enrutamiento solo-UE/soberano por diseño. Use GLM donde la capacidad o el precio sean la prioridad y el procesamiento transfronterizo sea aceptable para esa tarea.
Veredicto y alternativas
GLM-4.6V es un modelo de visión con una excelente relación calidad-precio: comprensión multimodal más contexto largo a precio bajo. Para una opción de visión gratuita, GLM-4.6V Flash; para generación de imágenes (no comprensión), los modelos GLM-Image / CogView.