Ir al contenido
Tier A — Frontera
Se ejecuta en:USCreado en:United States
OpenAI

gpt-5.4

Tier A — Frontera

Equipo editorial Tokonomix·Revisado por Mes Kalkan··

GPT-5.4 es un modelo de lenguaje grande desarrollado por OpenAI para tareas de generación de texto de propósito general. Está diseñado para procesar y generar texto similar al humano en una amplia gama de aplicaciones, incluyendo creación de contenido, respuesta a preguntas, generación de código, análisis e interacciones conversacionales. El modelo opera con capacidades estándar de generación de texto, aceptando entradas de texto y produciendo respuestas coherentes basadas en patrones aprendidos durante el entrenamiento. Como parte de la serie GPT de OpenAI, este modelo representa una continuación de la arquitectura establecida en generaciones anteriores, utilizando redes neuronales basadas en transformadores para procesar datos secuenciales. El tamaño de la ventana de contexto para GPT-5.4 no ha sido revelado públicamente, aunque se espera que maneje conversaciones de múltiples turnos y documentos moderadamente largos. El modelo procesa texto mediante tokenización y genera resultados usando métodos de muestreo probabilístico comunes a los modelos de lenguaje autoregresivos. GPT-5.4 se integra dentro de la línea más amplia de modelos de lenguaje de OpenAI como una oferta estándar para cargas de trabajo de generación de texto. Está posicionado para servir a usuarios que requieren capacidades confiables de procesamiento de lenguaje natural sin características especializadas como entrada multimodal, llamadas a funciones o manejo de contexto extendido. El modelo es accesible a través de la infraestructura API de OpenAI, permitiendo la integración en diversas aplicaciones y servicios. Como otros modelos de la familia GPT, ha sido entrenado con datos de texto diversos de internet, aunque los detalles específicos de entrenamiento y las composiciones de conjuntos de datos no han sido completamente revelados por el proveedor.

GPT-5.4 se ubica como una opción confiable de OpenAI para tareas generales de generación de texto, sin pretender ser el modelo insignia de su catálogo.

Resumen editorial de Tokonomix
Sección 01

Análisis de velocidad

Latencia medida en todas las ejecuciones de benchmark. P50 (mediana) y P95 (percentil 95) dan una imagen realista de la velocidad de respuesta bajo carga normal y máxima.

Latencia P50 (mediana)Latencia P95105 runs
449781715185225532992108-1009-05ms
Sección 02

Puntuaciones de calidad

Cómo se sitúa este modelo frente al resto del campo en cada categoría de prompts, a partir de un ajuste por pares sobre los mismos prompts. La nota bruta del juez aparece debajo de cada número.

65%
Generación de código
media del juez 99
89%
Creativo
media del juez 97
57%
Factual
media del juez 86
66%
Multilingüe
media del juez 99
74%
Razonamiento
media del juez 99

Tasa de victorias por categoría: con qué frecuencia este modelo vence a un modelo medio en un prompt de esa categoría. 50% es la media, no un suspenso. No es un porcentaje de aciertos.

Sección 03

Historial de precios

Tarifas directas del proveedor por millón de tokens, más una estimación del coste de una conversación típica.

💰
Tarifas API — gpt-5.4
$2.50 por 1M de tokens de entrada
$15.00 por 1M de tokens de salida
≈ $0.0045 por conversación típica (800 tokens)
Precio entrada vs salida (por 1M de tokens)
por 1M de tokens de entrada$2.50
por 1M de tokens de salida$15.00

Pricing over time

Input & output per 1M tokens · step-line = price changes

$2.50

input / 1M

— stable

$15.00

output / 1M

— stable

2026-05-242026-07-262026-08-30
Input
Output
Price change
⟳ synced weekly
Sección 04

Tokens por segundo

Rendimiento en tokens por segundo, derivado de la latencia P50 medida. Más alto es mejor; las fluctuaciones reflejan la carga del lado del proveedor.

Rendimiento (tokens / s)341 / avg 283
441144

Estimado a partir de latencia P50 × 200 tokens de salida — el número absoluto depende de esta suposición; lo que importa es la tendencia.

Sección 05

Fortalezas & debilidades

Basado en resultados de benchmarks y comentarios agregados de la comunidad sobre casos de uso reales.

Fortalezas

Generación de texto coherenteBuen manejo conversacional multivueltaTier A de calidad generalIntegración vía API de OpenAISoporte sólido para generación de códigoCobertura amplia de dominios y temasComprensión lectora y análisis textualEcosistema maduro de herramientas

Debilidades

Ventana de contexto no divulgadaSin capacidades multimodales confirmadasFunción calling no documentadoFecha de corte de conocimiento incierta
Sección 06

Capacidades

toolssource: litellmvisionjson modepdf inputreasoningjson schemaparallel toolsprompt cachingmax output tokens: 128000
Sección 07

Preguntas frecuentes

Está orientado a tareas generales de generación de texto como redacción, preguntas y respuestas, análisis y código. No es la opción ideal si necesitas entradas multimodales o ventanas de contexto muy extensas.

Una elección sensata cuando se necesita un modelo de tier A bien soportado, aunque conviene revisar si sus capacidades cubren casos que exigen multimodalidad o contextos largos.

Veredicto editorial de Tokonomix
Sección 08

Disponibilidad

Disponibilidad

Con qué frecuencia responde este modelo cuando lo llamamos — medido en solicitudes reales de API y pruebas en vivo durante los últimos 30 días. Esto es independiente de la calidad: estos números solo indican si el modelo responde, no qué tan buena es la respuesta.

Últimos 7 días

Últimos 30 días

100.0%

n=36

Tiempo de respuesta mediano

7,057ms

n=36

Basado en 416 mediciones en los últimos 30 días.

Detalles técnicos

Solo cuentan las llamadas reales a la API y las solicitudes de prueba en vivo — las sondas internas y las ejecuciones de referencia están excluidas.

Las llamadas con una clave API propia (BYOK) están excluidas: esos fallos son específicos de la clave, no una señal de inactividad del modelo.

Las llamadas fallidas NO se incluyen en las puntuaciones de calidad — la calidad se mide solo en respuestas exitosas. Disponibilidad y calidad son señales independientes.

Tiempo de respuesta mediano (p50) en llamadas exitosas con una duración registrada. Los valores atípicos afectan menos a la mediana que a la media.

Total de llamadas (30d)

36

Respuestas OK (30d)

36

Total de llamadas (7d)

0

Respuestas OK (7d)

0

Sección 09

Veredictos del benchmark Tokonomix

⚖️
Endorsed by 2 judges
Independent LLM judges evaluated this model on our weekly intelligence tests
cohere/command-a100/100 · 1 runs
1 correct0 partial0 wrong100% accuracy
claude-sonnet-4-596/100 · 45 runs
44 correct0 partial1 wrong98% accuracy
2026-08-30

Major quality leap with 12.8-point gain; 29% faster response times

GPT-5.4 demonstrates substantial improvements across nearly all measured dimensions in this benchmark window. The overall quality score jumped from 82.5 to 95.3, representing a 12.8-point increase that places this model among the top performers we've evaluated. Response latency improved significantly, with p50 times dropping from 2219ms to 1585ms, a 29% reduction that should be noticeable in production use. Coding performance reached a perfect 100 score, up 8 points from the previous window, while factual accuracy showed dramatic improvement, rising from 56 to 94. Creative writing capabilities scored 91, and reasoning tasks achieved 96, both strong results. The previous window's perfect multilingual score of 100 was not retested in this cycle, so we cannot confirm whether that capability remains at the same level. The addition of creative writing and reasoning categories to the test suite this window provides new insight into the model's capabilities. With only 5 test runs in each window, these results should be considered preliminary, but the consistency of improvements across categories suggests genuine advancement rather than statistical noise.

Calidad

95.3

Latencia p50

1,585 ms

Ejecuciones de test

5

Quality improved 12.8 points 29% faster response times Coding reached perfect score Factual accuracy up 38 points
Sección 10

Perfil completo del modelo

gpt-5.4 — illustration 1
GPT-5.4: la generación de consolidación

Nota — perfil prospectivo. Esta página describe un modelo que está en vista previa temprana, anunciado pero no disponible de forma general, o proyectado basándose en señales de la hoja de ruta. Las especificaciones y capacidades pueden cambiar antes del lanzamiento público. Los datos de benchmark en vivo en esta página reflejan el endpoint que nuestro sistema de pruebas puede alcanzar hoy.

GPT-5.4 es el lanzamiento de consolidación de mitad de ciclo de OpenAI dentro de la familia más amplia 5.x. No es un cambio arquitectónico fundamental, no es un salto dramático de capacidades — lo que es, es un refinamiento cuidadoso de las cosas que han estado molestando a los equipos en producción desde las generaciones anteriores. Mejor seguimiento de instrucciones en casos extremos. Comportamiento de salida estructurada más ajustado. Reducción de alucinaciones en los tipos de temas de nicho que terminan constantemente en tickets de soporte. El tipo de lanzamiento que gusta más a los ingenieros que a los especialistas en marketing.

Lo que 5.4 realmente cambia

Las mejoras principales son discretas. La tasa de alucinación sobre hechos fuera de distribución ha bajado en comparación con 5.2 y 5.3. La reducción no es a cero, y el modelo todavía fabricará con confianza afirmaciones plausibles sobre temas oscuros. Pero la tasa a la que ocurre en consultas rutinarias ha caído de manera significativa, lo que se manifiesta en producción como menos casos de soporte que requieren corrección.

La salida estructurada es más confiable. La salida en modo JSON contra esquemas profundamente anidados produce salida válida con más consistencia que las generaciones anteriores. El llamado a funciones con llamadas paralelas a herramientas se comporta de manera más predecible. El tipo de casos extremos que solían requerir análisis defensivo — JSON casi válido, adherencia al esquema ligeramente desviada — son menos comunes.

La coherencia de contexto largo es incrementalmente mejor. El modelo retiene las restricciones establecidas temprano en prompts largos de forma más confiable que la generación anterior. Para flujos de trabajo que empaquetan instrucciones extensas en el prompt del sistema, menos instrucciones se pierden en ejecuciones largas.

Ninguno de estos cambios es individualmente dramático. Juntos hacen de 5.4 el valor predeterminado correcto para equipos que han estado esperando "la versión que hace lo que le pedimos a la anterior que hiciera."

Bajo el capó

GPT-5.4 es un decodificador transformer que acepta entradas de texto e imagen intercaladas, con salida únicamente de texto. Las capacidades de visión cubren la superficie habitual: comprensión de gráficos y diagramas, extracción de texto tipo OCR, análisis de diseño de documentos, descripción de escenas. La salida sigue siendo solo texto — sin generación de imágenes, sin audio desde este endpoint.

OpenAI no ha publicado recuentos de parámetros, detalles de enrutamiento de expertos, o cambios arquitectónicos precisos respecto a 5.2 y 5.3. El modelo acepta ventanas de contexto más largas que las generaciones anteriores en la familia, aunque el techo práctico de coherencia se sitúa por debajo del límite nominal de tokens en tareas de razonamiento difíciles.

La tokenización utiliza el vocabulario BPE estándar de GPT-5. Las entradas de imagen se codifican en mosaicos con un costo fijo de tokens por mosaico. El corte de entrenamiento se sitúa a principios de 2026 para esta generación, lo que adelanta varios meses el límite de lo que el modelo sabe sobre eventos recientes y versiones actuales de bibliotecas en comparación con las generaciones anteriores.

Dónde se sitúa hoy

Para trabajo de propósito general — chat, salida estructurada, análisis asistido por visión, bucles de agentes — GPT-5.4 se sitúa en el nivel superior de modelos actualmente desplegables. La clasificación de inteligencia rastrea la posición comparativa contra el nivel más fuerte de Anthropic y el equivalente de Google. Las clasificaciones cambian semanalmente a medida que llegan nuevos lanzamientos, pero 5.4 es competitivo en la mayoría de categorías en lugar de dominante en alguna en particular.

El modelo es el valor predeterminado correcto para nuevo desarrollo en el stack de OpenAI a menos que tengas razones específicas para fijar una instantánea más antigua, ejecutar un nivel más pequeño por costo, o escalar al nivel Pro para razonamiento difícil.

Para flujos de trabajo de contenido la mejora en coherencia de contexto largo se rentabiliza en flujos de trabajo con guías de estilo extensas. Para extracción de datos el comportamiento de salida estructurada más ajustado reduce el trabajo de limpieza posterior.

Dónde aún se sitúan los límites

La alucinación se reduce pero no se elimina. El modelo está bien calibrado en conocimiento común y es confiablemente seguro en material técnico ampliamente documentado. Sobre eventos históricos oscuros, publicaciones de nicho recientes y organizaciones pequeñas, todavía fabricará. Trata cualquier afirmación factual específica como una hipótesis hasta verificarla.

Los idiomas de recursos más bajos siguen siendo más débiles que los principales europeos y de Asia Oriental. La brecha se ha estrechado a través de las generaciones pero no se ha cerrado. Ejecuta verificaciones de muestra en cualquier idioma objetivo antes de desplegar.

La coherencia de contexto largo es buena pero no infinita. Pasados aproximadamente 100k tokens de entrada densa, las restricciones establecidas muy temprano en el prompt comienzan a desviarse. Estructura los prompts largos para repetir restricciones críticas cerca del punto de generación.

El nivel Pro todavía gana en las tareas de razonamiento más difíciles. El 5.4 base es un gran predeterminado para la mayoría del trabajo pero no es el modelo que eliges cuando la carga de trabajo requiere planificación profunda de múltiples pasos bajo incertidumbre genuina.

Cuándo 5.4 es el valor predeterminado correcto

Elige el 5.4 base para chat general, generación de contenido, salida estructurada, análisis asistido por visión y bucles de agentes de complejidad moderada. Es la elección de endpoint único más simple para equipos cuya carga de trabajo de IA es mayormente amplia en lugar de mayormente difícil.

Elígelo para migración desde generaciones 5.x anteriores donde las limitaciones de esas generaciones han estado causando fricción. Las mejoras son reales y se acumulan a través de tráfico de alto volumen.

Para flujos de trabajo de contenido en el extremo de formato largo del espectro, 5.4 es el valor predeterminado correcto. Para flujos de trabajo de documentos mixtos de texto y visión, la capacidad de visión más la confiabilidad de salida estructurada lo hacen un ajuste natural.

Cuándo elegir algo diferente

Para autocompletado interactivo y tráfico por lotes optimizado por costo, los niveles mini y nano en la familia 5.4 manejan la carga de trabajo con menor costo y latencia.

Para cargas de trabajo de razonamiento difícil — bucles de agentes con planificación profunda, salida estructurada contra esquemas altamente complejos, análisis que requieren sopesar cuidadosamente muchos factores — escala al nivel Pro.

Para cargas de trabajo específicas de código, las variantes Codex en la familia 5.x más amplia están mejor ajustadas. El 5.4 base produce código funcional pero no iguala a un especialista de código en calidad de modismos.

Para cargas de trabajo sensibles a la reproducibilidad, fija la instantánea fechada gpt-5.4-2026-03-05 en lugar de leer el slug flotante gpt-5.4.

Alternativas

Para cargas de trabajo donde el razonamiento de nivel superior importa más que el ajuste al ecosistema OpenAI, el nivel de razonamiento más fuerte de Anthropic y las ofertas equivalentes de Google merecen una comparación directa en tu carga de trabajo específica.

Para despliegues aislados de red o con residencia estricta, los modelos frontera de pesos abiertos te dan la historia de residencia que ningún endpoint de OpenAI proporciona. La brecha de precisión se ha estrechado considerablemente y es manejable para la mayoría de las cargas de trabajo.

Para tráfico rutinario optimizado por costo, ejecutar un enrutador entre el 5.4 base y hermanos de nivel más pequeño mantiene la factura manejable mientras preserva el acceso a la capacidad completa cuando importa.

Última revisión técnica: 2026-05-22 — Tokonomix.ai

gpt-5.4 — illustration 2
Última prueba automática
5 sept 2026 · 08:02 UTC · Benchmark de velocidad
Latencia P50
587 ms
Latencia P95
593 ms
Errores
0 / 6 ejecuciones
Última revisión por Equipo Tokonomix·26 de mayo de 2026