Ir al contenido
Tier A — Frontera
Se ejecuta en:USCreado en:United States
OpenAI

gpt-5.4-nano-2026-03-17

Tier A — Frontera

Equipo editorial Tokonomix·Revisado por Mes Kalkan··

GPT-5.4-nano-2026-03-17 es un modelo de generación de texto desarrollado por OpenAI, lanzado en marzo de 2026. Como parte de la serie "nano", este modelo representa una variante más pequeña y eficiente dentro de la familia GPT-5 de OpenAI. Está diseñado para manejar tareas estándar de generación de texto, incluyendo conversación, creación de contenido, resumen y respuesta a preguntas. El modelo procesa entrada de texto y produce respuestas escritas coherentes en una variedad de aplicaciones de propósito general. Esta variante prioriza requisitos computacionales reducidos mientras mantiene capacidades funcionales de generación de texto. La designación "nano" indica que ocupa el nivel inferior de la serie GPT-5 en términos de recuento de parámetros y consumo de recursos, haciéndolo adecuado para aplicaciones donde la eficiencia de implementación es una consideración junto con el rendimiento. El modelo admite técnicas estándar de prompting y puede seguir instrucciones para diversas tareas basadas en texto, aunque sus especificaciones de ventana de contexto no han sido divulgadas públicamente por OpenAI. Dentro de la línea de modelos de OpenAI, GPT-5.4-nano se sitúa por debajo de variantes más grandes como los modelos estándar GPT-5 y GPT-5-turbo. La fecha de lanzamiento de marzo de 2026 sugiere que se trata de una actualización de mitad de generación dentro de la serie GPT-5.4, probablemente incorporando refinamientos a la arquitectura base. Este modelo sirve a usuarios que requieren capacidades básicas a intermedias de generación de texto sin la sobrecarga de modelos más grandes, posicionándolo como una opción accesible para tareas rutinarias de procesamiento de lenguaje.

GPT-5.4 Nano de marzo 2026 es la variante más pequeña y eficiente de la cuarta actualización de GPT-5, optimizada para velocidad en producción de alto volumen.

Resumen de benchmark Tokonomix
Sección 01

Análisis de velocidad

Latencia medida en todas las ejecuciones de benchmark. P50 (mediana) y P95 (percentil 95) dan una imagen realista de la velocidad de respuesta bajo carga normal y máxima.

Latencia P50 (mediana)Latencia P9596 runs
33989814572015257408-2209-14ms
Sección 02

Puntuaciones de calidad

Cómo se sitúa este modelo frente al resto del campo en cada categoría de prompts, a partir de un ajuste por pares sobre los mismos prompts. La nota bruta del juez aparece debajo de cada número.

63%
Generación de código
media del juez 95
30%
Creativo
media del juez 64
44%
Factual
media del juez 55
69%
Multilingüe
media del juez 99
74%
Razonamiento
media del juez 99

Tasa de victorias por categoría: con qué frecuencia este modelo vence a un modelo medio en un prompt de esa categoría. 50% es la media, no un suspenso. No es un porcentaje de aciertos.

Sección 03

Precios

Lo que pagas por millón de tokens al usar este modelo en Tokonomix, más una estimación para una conversación típica.

💰
Tarifas API — gpt-5.4-nano-2026-03-17
$0.3900 por 1M de tokens de entrada
$2.44 por 1M de tokens de salida
≈ $0.0007 por conversación típica (800 tokens)
Precio entrada vs salida (por 1M de tokens)
por 1M de tokens de entrada$0.3900
por 1M de tokens de salida$2.44
Sección 04

Tokens por segundo

Rendimiento en tokens por segundo, derivado de la latencia P50 medida. Más alto es mejor; las fluctuaciones reflejan la carga del lado del proveedor.

Rendimiento (tokens / s)258 / avg 361
58499

Estimado a partir de latencia P50 × 200 tokens de salida — el número absoluto depende de esta suposición; lo que importa es la tendencia.

Sección 05

Fortalezas & debilidades

Basado en resultados de benchmarks y comentarios agregados de la comunidad sobre casos de uso reales.

Fortalezas

Máxima velocidad en familia GPT-5.4Mínimo consumo computacionalEscalable para volúmenes masivosSnapshot fijo de marzo 2026Latencia óptima para tiempo realArquitectura GPT-5.4 en tamaño nano

Debilidades

Capacidad de razonamiento muy limitadaContexto no documentadoSolo para tareas sencillasSin capacidad para análisis complejos
Sección 06

Capacidades

toolssource: litellmvisionjson modepdf inputreasoningjson schemaparallel toolsprompt cachingmax output tokens: 128000
Sección 07

Preguntas frecuentes

Hereda los refinamientos acumulados de la serie 5.4 aplicados a la arquitectura nano; mayor precisión en comprensión que versiones nano anteriores.

La arquitectura nano en la serie GPT-5.4 lleva años de mejoras a la categoría de modelos ultra-eficientes para casos de uso básicos.

Resumen de benchmark Tokonomix
Sección 08

Disponibilidad

Disponibilidad

Sin datos todavía

Aún no hemos registrado suficientes llamadas a la API para mostrar estadísticas de disponibilidad de este modelo. Los datos aparecen una vez que el modelo comienza a recibir tráfico en vivo.

Sección 09

Veredictos del benchmark Tokonomix

⚖️
Endorsed by 2 judges
Independent LLM judges evaluated this model on our weekly intelligence tests
cohere/command-a100/100 · 1 runs
1 correct0 partial0 wrong100% accuracy
claude-sonnet-4-585/100 · 55 runs
43 correct4 partial8 wrong78% accuracy
2026-09-13

Coding and reasoning excel, but factual accuracy drops sharply

The latest benchmark window for gpt-5.4-nano-2026-03-17 reveals a mixed performance profile with significant trade-offs. The model demonstrates exceptional capability in coding tasks, achieving a perfect score of 100, and maintains equally strong reasoning performance at 100. These represent substantial improvements from the previous window where coding scored 73. However, this comes at a considerable cost to factual accuracy, which plummeted to just 15 from unmeasured in the previous period. The overall quality score improved modestly from 67.0 to 71.5, suggesting the gains in technical domains partially offset the factual knowledge weakness. Latency has increased by 21 percent, with the median response time rising from 1531ms to 1857ms, indicating slower performance that users will likely notice in production environments. The absence of creative and multilingual scores in this window, compared to scores of 28 and 100 previously, makes it difficult to assess stability in those domains. Users requiring strong coding and reasoning capabilities may benefit from this version, but those needing reliable factual retrieval or time-sensitive applications should carefully evaluate whether these trade-offs align with their requirements.

Calidad

71.5

Latencia p50

1,857 ms

Ejecuciones de test

5

Coding performance reaches perfect score Reasoning capabilities remain excellent Factual accuracy severely degraded Response latency increased 21%
Sección 10

Perfil completo del modelo

gpt-5.4-nano-2026-03-17 — illustration 1
GPT-5.4 Nano (instantánea 2026-03-17): fijando el nivel más pequeño

Nota — perfil prospectivo. Esta página describe un modelo que está en fase de vista previa temprana, anunciado pero no disponible de forma general, o proyectado en base a señales de la hoja de ruta. Las especificaciones y capacidades pueden cambiar antes del lanzamiento público. Los datos de evaluación en vivo en esta página reflejan el endpoint que nuestra infraestructura de pruebas puede alcanzar hoy.

Esta es la instantánea fechada de GPT-5.4 Nano, congelada en el lanzamiento del 17 de marzo de 2026. El slug flotante gpt-5.4-nano continúa moviéndose. Fijar el nivel nano es la misma disciplina operacional que fijar cualquier otro nivel, con un matiz importante: los niveles más pequeños tienden a tener las ventanas de obsolescencia más cortas.

El riesgo de obsolescencia que golpea más duramente a nano

El patrón de obsolescencia de OpenAI a través de generaciones de modelos ha sido consistente: las instantáneas fechadas quedan obsoletas según un calendario publicado, generalmente uno o dos años después del lanzamiento, a veces más rápido. Los plazos publicados se aplican a todas las instantáneas, pero la presión práctica sobre operar instantáneas antiguas difiere según el nivel.

Los niveles más grandes tienden a envejecer con más elegancia. Una instantánea base o Pro de hace un año todavía realiza trabajo útil para la mayoría de las tareas; la brecha con las instantáneas actuales es real pero absorbible para muchas cargas de trabajo. Los equipos que utilizan esos niveles en producción a menudo tienen tiempo para migrar cuidadosamente cuando se anuncia la obsolescencia.

Los niveles más pequeños envejecen con menos elegancia. Las mejoras de Nano entre generaciones han sido sustanciales, y la brecha entre el nano de hoy y el nano del año pasado en la misma carga de trabajo suele ser mayor que la brecha equivalente en el nivel base. Cuando una instantánea nano queda obsoleta, es más probable que la migración implique una reingeniería significativa de prompts y ajustes en los pipelines descendentes porque los cambios de comportamiento entre generaciones son mayores.

Esto no es una razón para omitir la fijación en el nivel nano. Es una razón para instrumentar la fijación con más cuidado y planificar la migración con mayor antelación.

Qué captura esta instantánea

El lanzamiento de marzo de 2026 de GPT-5.4 Nano: pesos de lanzamiento, comportamiento de lanzamiento en clasificación y tareas simples de extracción, perfil de latencia de lanzamiento, configuración del codificador de visión de lanzamiento para la clase de tamaño.

Las mejoras que 5.4 aporta sobre los niveles nano anteriores — mejor precisión de clasificación en problemas multiclase, manejo más ajustado de salidas estructuradas cortas, calidad mejorada de completado por pulsación de tecla — están todas capturadas en la forma de lanzamiento. Los refinamientos posteriores del slug flotante no aparecen aquí.

Bajo el capó

Arquitectónicamente este es el decodificador transformer de GPT-5.4 Nano que acepta entradas de texto e imagen intercaladas, con salida solo de texto. OpenAI no ha publicado los recuentos de parámetros. La capacidad de visión está presente pero notablemente más débil que los niveles más grandes — lectura estándar de gráficos y trabajo OCR funcionan, diagramas complejos y diseños adversariales a menudo no.

La tokenización utiliza el vocabulario BPE estándar de GPT-5. La ventana de contexto es más corta que los niveles más grandes en términos absolutos, y la coherencia cae mucho antes del límite nominal. El corte de entrenamiento se sitúa a principios de 2026.

Los perfiles de coste por token y latencia por solicitud están bloqueados en los valores de lanzamiento. Estos son los que hacen viable a nano para cargas de trabajo de alto volumen, y son parte de lo que estás fijando cuando fijas esta instantánea.

Dónde se sitúa hoy

Frente a las ofertas actuales de nivel más pequeño, la instantánea de marzo de 2026 de GPT-5.4 Nano es competitiva en clasificación, extracción simple y salida estructurada de formato corto. La tabla de clasificación de inteligencia rastrea la posición comparativa entre niveles; espera que la brecha con un nano de slug flotante actual crezca con el tiempo a medida que la familia continúa evolucionando.

Para extracción de datos en el extremo simple — extrayendo campos nombrados específicos con ubicaciones predecibles — la instantánea maneja el trabajo con ahorros de coste significativos sobre los niveles más grandes. Para flujos de trabajo de contenido en el extremo de formato corto (líneas de asunto, texto de botones, resúmenes de una sola oración), la instantánea suele ser suficiente por sí misma.

Cuándo fijar esta instantánea

Los casos se superponen con el argumento más amplio de fijación pero se agudizan por el perfil de alto volumen de nano:

Tienes pipelines automatizados que consumen salida de nano y esperan formato específico. La fijación previene que la deriva silenciosa del formato rompa los analizadores descendentes.

Has evaluado esta instantánea contra tu carga de trabajo específica y tienes prompts, ejemplos few-shot y umbrales de calidad calibrados a su comportamiento. Reajustar a través de una migración de instantánea cuesta tiempo de ingeniería y arriesga regresiones sutiles.

Estás ejecutando cargas de trabajo de clasificación o extracción donde los cambios en la distribución de salida tienen consecuencias descendentes medibles — decisiones de enrutamiento, umbrales de alerta, categorización automática que alimenta métricas de negocio.

Estás en un contexto regulado donde cualquier modelo que toque decisiones de cara al cliente debe ser identificable en auditoría a una versión específica.

El argumento de planificación de obsolescencia

Más allá de las razones estándar de fijación, el argumento específico de nano trata sobre la planificación de obsolescencia. Debido a que las instantáneas nano tienden a ver cambios de comportamiento más grandes entre generaciones que los niveles más grandes, la migración desde esta instantánea a su eventual sucesora probablemente implicará más trabajo que la migración equivalente en base o Pro.

Fijar esta instantánea ahora y tratar la eventual migración como un proyecto planificado — con evaluación, reajuste de prompts, ajuste de pipeline y pruebas de rollback — es significativamente diferente de derivar del slug flotante y descubrir después del hecho que algo cambió. La fijación te da la fecha para planificar. El slug flotante te da incidentes a los que reaccionar.

Cuando OpenAI publique el cronograma de obsolescencia para esta instantánea, trata la fecha como un plazo de proyecto firme. Presupuesta el trabajo de migración. Ejecuta la evaluación contra la siguiente instantánea mucho antes del día de obsolescencia, no después.

Dónde permanecen los límites

Los límites de capacidad de nano se aplican igualmente a esta instantánea. El razonamiento es superficial. La coherencia de contexto largo es pobre. La salida estructurada funciona en esquemas simples y falla en los complejos. La alucinación en temas de nicho es mayor que en los niveles más grandes.

Ninguno de estos cambia con la fijación. Estás fijando el comportamiento de lanzamiento de un modelo de nivel más pequeño. Las cargas de trabajo que ya han aceptado esos límites a cambio del perfil de coste y latencia son las cargas de trabajo que se benefician de la fijación.

Alternativas

Para cargas de trabajo que necesitan comportamiento fijado de nivel más pequeño en una familia de modelos diferente, las ofertas equivalentes a nano comparables de Anthropic y Google también se envían con instantáneas fechadas. El patrón de fijación es estándar de la industria en este nivel.

Para cargas de trabajo donde el perfil de coste y latencia de nano es necesario pero el comportamiento específico de OpenAI no lo es, pequeños clasificadores de pesos abiertos ejecutándose en tu propia infraestructura te dan la historia de residencia y la previsibilidad operacional que los slugs flotantes no pueden. El coste de configuración es significativo pero el perfil operacional a largo plazo es más estable.

Para cargas de trabajo donde la reproducibilidad importa pero nano no es capacidad suficiente, fija una instantánea fechada mini o base de la línea 5.4 en su lugar.

Última revisión técnica: 2026-05-22 — Tokonomix.ai

gpt-5.4-nano-2026-03-17 — illustration 2
Última prueba automática
14 sept 2026 · 20:03 UTC · Benchmark de velocidad
Latencia P50
776 ms
Latencia P95
934 ms
Errores
0 / 6 ejecuciones
Última revisión por Equipo Tokonomix·26 de mayo de 2026