
Nota — perfil prospectivo. Esta página describe un modelo que está en vista previa temprana, anunciado pero no disponible generalmente, o proyectado con base en señales de la hoja de ruta. Las especificaciones y capacidades pueden cambiar antes del lanzamiento público. Los datos de benchmark en vivo en esta página reflejan cualquier endpoint que nuestro sistema de pruebas pueda alcanzar hoy.
gpt-5.2 es el slug flotante para la generación 5.2. Cuando lo llamas a través de la API, alcanzas cualquier endpoint al que OpenAI mapee actualmente ese nombre. Ese mapeo se mueve. De forma silenciosa, deliberada y sin forzar a tu código a cambiar. Para muchos equipos eso es exactamente lo que quieren. Para otros — cualquiera que ejecute auditorías de cumplimiento, verificaciones de reproducibilidad o características de cara al cliente bloqueadas por versión — es un riesgo operativo silencioso.
Qué significa realmente el slug flotante
El patrón de OpenAI con cada generación es publicar un nombre base (gpt-5.2) y una instantánea fechada (gpt-5.2-2025-12-11). La versión fechada fija los pesos exactos. La flotante rastrea cualquier instantánea que OpenAI considere actualmente el endpoint 5.2 recomendado. Las actualizaciones avanzan sin aviso en la mayoría de los casos. El comportamiento cambia. Las salidas cambian. Los perfiles de latencia cambian. Los costos de tokens ocasionalmente cambian también.
Esto está bien para prototipos y para productos donde el espacio de respuestas es amplio y una alineación aproximada con la calidad actual es más valiosa que la reproducibilidad exacta. Es un problema para los sistemas de evaluación que comparan las salidas de hoy con las del mes pasado, para flujos de trabajo regulados que necesitan saber qué modelo produjo una decisión dada, y para cualquier contrato que vincule criterios de aceptación a comportamientos específicos del modelo.
La solución es simple: fija la instantánea fechada en producción, apunta al slug flotante solo para desarrollo. El costo es pequeño. El riesgo evitado es real.
Bajo el capó
GPT-5.2 se ubica en la familia más amplia de GPT-5 de decodificadores transformer, multimodal a través de entradas de texto y visión. OpenAI no ha publicado recuentos de parámetros ni detalles de enrutamiento de expertos. El modelo acepta imágenes junto con texto, con salida que permanece solo como texto — sin generación de imágenes, sin salida de audio desde este endpoint.
El límite de entrenamiento se ubica en algún punto a finales de 2025 basándose en el conocimiento observado de estándares de lenguaje principales, versiones actuales de frameworks y eventos públicos recientes. Los detalles más allá de eso son especulativos hasta que OpenAI los publique. Las capacidades de visión cubren la superficie habitual: comprensión de gráficos y diagramas, extracción de texto con sabor a OCR, descripción de escenas y análisis de diseño de documentos.
La tokenización es el vocabulario BPE de GPT-5. Las entradas de imagen se codifican en mosaicos con un costo fijo de tokens por mosaico. Para documentos con texto mixto y capturas de pantalla esto se acumula más rápido de lo que la gente espera; presupuesta el costo de tokens de imagen en tus prompts antes de pasar a producción.
Dónde se ubica hoy
Para trabajo de propósito general — chat, generación de salida estructurada, análisis asistido por visión — GPT-5.2 se sitúa en el nivel superior de los modelos de frontera actualmente disponibles. La tabla de clasificación de inteligencia rastrea la posición comparativa; las clasificaciones cambian a medida que Anthropic, Google y otros publican actualizaciones.
El modelo está cómodo con salida estructurada, restricciones de esquema JSON y bucles de uso de herramientas. El rendimiento de visión en comprensión de gráficos es fuerte, en diagramas técnicos densos sigue siendo irregular, y en diseños adversariales (escaneos de múltiples columnas, texto rotado, capturas de pantalla de baja resolución) comete los mismos tipos de errores que hizo la generación anterior.
Para flujos de trabajo de contenido el modelo es una opción predeterminada creíble. Para extracción de datos de documentos mixtos de texto e imagen, la capacidad de visión es una ventaja genuina sobre competidores de solo texto.
El problema de la deriva en la práctica
Si conectas el slug flotante a un producto de cara al cliente y OpenAI publica una nueva instantánea 5.2 que maneja un tipo particular de consulta de manera diferente, tus usuarios lo notarán antes que tú. El cambio podría ser positivo en calidad en promedio y negativo en calidad en casos específicos de borde. Sin un sistema de evaluación ejecutándose contra las instantáneas antigua y nueva, no detectarás la regresión hasta que alguien presente un ticket de soporte.
Tres patrones ayudan. Primero, fija la instantánea fechada en producción y lee el slug flotante solo en entornos de pre-lanzamiento donde puedas comparar salidas lado a lado. Segundo, mantén un conjunto canario de prompts representativos que se ejecute contra ambas versiones en cada actualización del modelo — suficientemente pequeño para ejecutarse rápidamente, suficientemente amplio para detectar deriva en las consultas que importan. Tercero, decide explícitamente cuándo adoptarás una nueva instantánea: no "cuando OpenAI publique una," sino "cuando nuestro conjunto canario pase y nuestra evaluación de cara al cliente no muestre regresiones en las veinte intenciones principales."
Dónde se queda corto
La alucinación en temas de nicho sigue presente. El modelo está bien calibrado en conocimiento común y es confiablemente seguro en material técnico ampliamente documentado, pero fabricará hechos de sonido plausible sobre eventos históricos oscuros, publicaciones oscuras recientes y organizaciones pequeñas. Trata cualquier afirmación del modelo como una hipótesis hasta verificarla.
La coherencia de contexto largo es buena pero no perfecta. A través de entradas muy largas el modelo ocasionalmente pierde el rastro de restricciones establecidas temprano en el prompt. Para flujos de trabajo que requieren adherencia estricta a instrucciones extensas, estructura el prompt para repetir restricciones críticas cerca del punto de generación.
La salida en idiomas distintos al inglés es sólida pero desigual. Los principales idiomas europeos y del este asiático son fuertes. Los idiomas de recursos más bajos caen notablemente en fluidez. Ejecuta una verificación de muestra en cualquier idioma objetivo antes de comprometerte.
Cuándo usar el slug flotante versus la instantánea
Usa gpt-5.2 (flotante) para desarrollo, experimentación, herramientas internas y cualquier flujo de trabajo donde la adopción automática de nuevas instantáneas sea genuinamente una característica en lugar de un riesgo. Ejemplos: un chatbot para búsqueda de conocimiento interno donde cambios leves de comportamiento son tolerables, una herramienta de redacción de contenido donde el humano siempre revisa la salida, un sistema de triaje asistido por visión donde el humano toma la acción final.
Usa gpt-5.2-2025-12-11 (o la instantánea fechada que sea actual cuando publiques) para flujos de trabajo de producción que requieran reproducibilidad, características de cara al cliente con SLAs de calidad, decisiones reguladas, comparaciones de evaluación a través del tiempo, y cualquier caso donde una regresión sería costosa de descubrir tarde.
La combinación — flotante para interno, fechada para externo — te da tanto el comportamiento más reciente como la estabilidad operacional. Ese es el patrón al que la mayoría de los equipos convergen después de la primera vez que una actualización silenciosa del modelo cambia algo visible para los clientes.
Alternativas
Si la capacidad de visión no es fundamental para tu flujo de trabajo, los competidores de solo texto en niveles de calidad similares pueden ejecutarse más baratos o más rápidos. Compara en la carga de trabajo específica que importa; la diferencia entre modelos suele ser mayor en tareas estrechas de lo que sugieren los resúmenes de la tabla de clasificación.
Si necesitas visión fuerte más despliegue on-prem, los modelos multimodales de pesos abiertos — elige el más grande que se ajuste a tu presupuesto de inferencia — te dan la historia de residencia que este endpoint no puede. La brecha de precisión es real pero se cierra rápidamente en trabajo de extracción de documentos donde la entrada está estructurada.
Última revisión técnica: 2026-05-22 — Tokonomix.ai

