
Nota — perfil prospectivo. Esta página describe un modelo que está en vista previa temprana, anunciado pero no disponible de forma general, o proyectado basándose en señales de la hoja de ruta. Las especificaciones y capacidades pueden cambiar antes del lanzamiento público. Los datos de benchmark en vivo en esta página reflejan el endpoint que nuestro sistema de pruebas puede alcanzar hoy.
GPT-5.4 es el lanzamiento de consolidación de mitad de ciclo de OpenAI dentro de la familia más amplia 5.x. No es un cambio arquitectónico fundamental, no es un salto dramático de capacidades — lo que es, es un refinamiento cuidadoso de las cosas que han estado molestando a los equipos en producción desde las generaciones anteriores. Mejor seguimiento de instrucciones en casos extremos. Comportamiento de salida estructurada más ajustado. Reducción de alucinaciones en los tipos de temas de nicho que terminan constantemente en tickets de soporte. El tipo de lanzamiento que gusta más a los ingenieros que a los especialistas en marketing.
Lo que 5.4 realmente cambia
Las mejoras principales son discretas. La tasa de alucinación sobre hechos fuera de distribución ha bajado en comparación con 5.2 y 5.3. La reducción no es a cero, y el modelo todavía fabricará con confianza afirmaciones plausibles sobre temas oscuros. Pero la tasa a la que ocurre en consultas rutinarias ha caído de manera significativa, lo que se manifiesta en producción como menos casos de soporte que requieren corrección.
La salida estructurada es más confiable. La salida en modo JSON contra esquemas profundamente anidados produce salida válida con más consistencia que las generaciones anteriores. El llamado a funciones con llamadas paralelas a herramientas se comporta de manera más predecible. El tipo de casos extremos que solían requerir análisis defensivo — JSON casi válido, adherencia al esquema ligeramente desviada — son menos comunes.
La coherencia de contexto largo es incrementalmente mejor. El modelo retiene las restricciones establecidas temprano en prompts largos de forma más confiable que la generación anterior. Para flujos de trabajo que empaquetan instrucciones extensas en el prompt del sistema, menos instrucciones se pierden en ejecuciones largas.
Ninguno de estos cambios es individualmente dramático. Juntos hacen de 5.4 el valor predeterminado correcto para equipos que han estado esperando "la versión que hace lo que le pedimos a la anterior que hiciera."
Bajo el capó
GPT-5.4 es un decodificador transformer que acepta entradas de texto e imagen intercaladas, con salida únicamente de texto. Las capacidades de visión cubren la superficie habitual: comprensión de gráficos y diagramas, extracción de texto tipo OCR, análisis de diseño de documentos, descripción de escenas. La salida sigue siendo solo texto — sin generación de imágenes, sin audio desde este endpoint.
OpenAI no ha publicado recuentos de parámetros, detalles de enrutamiento de expertos, o cambios arquitectónicos precisos respecto a 5.2 y 5.3. El modelo acepta ventanas de contexto más largas que las generaciones anteriores en la familia, aunque el techo práctico de coherencia se sitúa por debajo del límite nominal de tokens en tareas de razonamiento difíciles.
La tokenización utiliza el vocabulario BPE estándar de GPT-5. Las entradas de imagen se codifican en mosaicos con un costo fijo de tokens por mosaico. El corte de entrenamiento se sitúa a principios de 2026 para esta generación, lo que adelanta varios meses el límite de lo que el modelo sabe sobre eventos recientes y versiones actuales de bibliotecas en comparación con las generaciones anteriores.
Dónde se sitúa hoy
Para trabajo de propósito general — chat, salida estructurada, análisis asistido por visión, bucles de agentes — GPT-5.4 se sitúa en el nivel superior de modelos actualmente desplegables. La clasificación de inteligencia rastrea la posición comparativa contra el nivel más fuerte de Anthropic y el equivalente de Google. Las clasificaciones cambian semanalmente a medida que llegan nuevos lanzamientos, pero 5.4 es competitivo en la mayoría de categorías en lugar de dominante en alguna en particular.
El modelo es el valor predeterminado correcto para nuevo desarrollo en el stack de OpenAI a menos que tengas razones específicas para fijar una instantánea más antigua, ejecutar un nivel más pequeño por costo, o escalar al nivel Pro para razonamiento difícil.
Para flujos de trabajo de contenido la mejora en coherencia de contexto largo se rentabiliza en flujos de trabajo con guías de estilo extensas. Para extracción de datos el comportamiento de salida estructurada más ajustado reduce el trabajo de limpieza posterior.
Dónde aún se sitúan los límites
La alucinación se reduce pero no se elimina. El modelo está bien calibrado en conocimiento común y es confiablemente seguro en material técnico ampliamente documentado. Sobre eventos históricos oscuros, publicaciones de nicho recientes y organizaciones pequeñas, todavía fabricará. Trata cualquier afirmación factual específica como una hipótesis hasta verificarla.
Los idiomas de recursos más bajos siguen siendo más débiles que los principales europeos y de Asia Oriental. La brecha se ha estrechado a través de las generaciones pero no se ha cerrado. Ejecuta verificaciones de muestra en cualquier idioma objetivo antes de desplegar.
La coherencia de contexto largo es buena pero no infinita. Pasados aproximadamente 100k tokens de entrada densa, las restricciones establecidas muy temprano en el prompt comienzan a desviarse. Estructura los prompts largos para repetir restricciones críticas cerca del punto de generación.
El nivel Pro todavía gana en las tareas de razonamiento más difíciles. El 5.4 base es un gran predeterminado para la mayoría del trabajo pero no es el modelo que eliges cuando la carga de trabajo requiere planificación profunda de múltiples pasos bajo incertidumbre genuina.
Cuándo 5.4 es el valor predeterminado correcto
Elige el 5.4 base para chat general, generación de contenido, salida estructurada, análisis asistido por visión y bucles de agentes de complejidad moderada. Es la elección de endpoint único más simple para equipos cuya carga de trabajo de IA es mayormente amplia en lugar de mayormente difícil.
Elígelo para migración desde generaciones 5.x anteriores donde las limitaciones de esas generaciones han estado causando fricción. Las mejoras son reales y se acumulan a través de tráfico de alto volumen.
Para flujos de trabajo de contenido en el extremo de formato largo del espectro, 5.4 es el valor predeterminado correcto. Para flujos de trabajo de documentos mixtos de texto y visión, la capacidad de visión más la confiabilidad de salida estructurada lo hacen un ajuste natural.
Cuándo elegir algo diferente
Para autocompletado interactivo y tráfico por lotes optimizado por costo, los niveles mini y nano en la familia 5.4 manejan la carga de trabajo con menor costo y latencia.
Para cargas de trabajo de razonamiento difícil — bucles de agentes con planificación profunda, salida estructurada contra esquemas altamente complejos, análisis que requieren sopesar cuidadosamente muchos factores — escala al nivel Pro.
Para cargas de trabajo específicas de código, las variantes Codex en la familia 5.x más amplia están mejor ajustadas. El 5.4 base produce código funcional pero no iguala a un especialista de código en calidad de modismos.
Para cargas de trabajo sensibles a la reproducibilidad, fija la instantánea fechada gpt-5.4-2026-03-05 en lugar de leer el slug flotante gpt-5.4.
Alternativas
Para cargas de trabajo donde el razonamiento de nivel superior importa más que el ajuste al ecosistema OpenAI, el nivel de razonamiento más fuerte de Anthropic y las ofertas equivalentes de Google merecen una comparación directa en tu carga de trabajo específica.
Para despliegues aislados de red o con residencia estricta, los modelos frontera de pesos abiertos te dan la historia de residencia que ningún endpoint de OpenAI proporciona. La brecha de precisión se ha estrechado considerablemente y es manejable para la mayoría de las cargas de trabajo.
Para tráfico rutinario optimizado por costo, ejecutar un enrutador entre el 5.4 base y hermanos de nivel más pequeño mantiene la factura manejable mientras preserva el acceso a la capacidad completa cuando importa.
Última revisión técnica: 2026-05-22 — Tokonomix.ai
