
Nota — perfil prospectivo. Esta página describe un modelo que está en vista previa temprana, anunciado pero no disponible de forma general, o proyectado basándose en señales de roadmap. Las especificaciones y capacidades pueden cambiar antes del lanzamiento público. Los datos de benchmark en vivo en esta página reflejan cualquier endpoint al que nuestro sistema de pruebas pueda acceder hoy.
GPT-5.4 Nano es el nivel más pequeño de la generación 5.4. Por debajo de mini, optimizado para el tipo de cargas de trabajo donde la velocidad y el coste dominan cualquier otra consideración: clasificación, extracción simple, completaciones estilo autocompletado, la cola larga de alto volumen de tareas pequeñas de IA que no necesitan capacidad real de razonamiento. Nano existe para la carga de trabajo que, antes de que existieran los modelos frontier, habría sido un clasificador BERT ajustado o un pequeño encoder-decoder ejecutándose en una sola CPU.
Las cargas de trabajo para las que nano está construido
Los casos de uso que encajan con nano se agrupan alrededor de una forma común: cada llamada individual es simple, el volumen es enorme, y la latencia por llamada afecta directamente a la experiencia del usuario o al rendimiento del sistema.
La clasificación es el ejemplo canónico. Enrutar un correo electrónico de cliente en una de quince categorías. Etiquetar un ticket de soporte con severidad y área de producto. Identificar cuál de cuarenta intenciones expresa un mensaje de chat. Estas tareas tienen un espacio de salida pequeño y bien definido y raramente se benefician de la profundidad de razonamiento de un modelo frontier. Nano las maneja bien a una fracción del coste.
La extracción simple es la segunda categoría. Extraer campos nombrados específicos de un documento — números de pedido, fechas, precios, nombres de clientes — cuando las ubicaciones de los campos son razonablemente predecibles y la estructura de salida es simple. Nano obtiene la respuesta correcta la mayoría de las veces, y el coste del fallo ocasional es lo suficientemente pequeño como para que los ahorros dominen.
Las rutas de autocompletado por pulsación de tecla y sugerencia en línea son la tercera. Los presupuestos de latencia aquí están por debajo de 100ms después de la sobrecarga de red. Nano es el único nivel de OpenAI que encaja, y aun así la red añade latencia que la inferencia local no tiene.
El prefiltro de moderación de contenido masiva es el cuarto. Ejecutar nano primero para puntuar cada entrada, escalar solo los casos límite a un modelo más grande para un juicio cuidadoso. Los ahorros de coste en el prefiltro pagan el juicio cuidadoso en las escaladas.
Bajo el capó
GPT-5.4 Nano es un decoder transformer a una escala de parámetros sustancialmente menor que mini, multimodal a través de texto y visión pero con la capacidad de visión notablemente más débil que los niveles más grandes. OpenAI no ha publicado conteos exactos de parámetros.
La tokenización utiliza el vocabulario BPE estándar de GPT-5. Las entradas de imagen se codifican en mosaico con un coste de token fijo por mosaico. La ventana de contexto es más corta que los niveles más grandes en términos absolutos y el techo práctico de coherencia se sitúa muy por debajo del límite nominal.
El modelo es significativamente más barato por token que mini, más rápido por solicitud, y la brecha con mini en coste y latencia es mayor que la brecha de mini a base. El corte de entrenamiento cae a principios de 2026, coincidiendo con la línea 5.4 más amplia.
Dónde se sitúan los límites
El razonamiento es superficial. Cualquier cosa que requiera planificación de múltiples pasos, inferencia cuidadosa o novedad genuina es inadecuada para nano. Úsalo donde la tarea sea "reconocer" en lugar de "pensar".
La coherencia de contexto largo es pobre. Nano maneja bien prompts cortos y comienza a perder restricciones en cualquier cosa sustancial. Mantén los prompts compactos.
La salida estructurada funciona en esquemas simples y falla en los complejos. JSON de un solo nivel con un puñado de campos está bien. Esquemas profundamente anidados con uniones discriminadas y validación condicional producen salida malformada con demasiada frecuencia como para ser útiles.
La alucinación en temas de nicho es mayor que en los niveles más grandes. El modelo tiene menos capacidad para suprimir respuestas incorrectas confiadas. Para cualquier salida donde la precisión factual sea crítica, enruta a través de un nivel más grande o añade recuperación.
La calidad de visión cae notablemente respecto a los niveles más grandes. La lectura estándar de gráficos y OCR funcionan; diagramas complejos y diseños adversarios a menudo no.
El rendimiento en idiomas no ingleses es más débil, especialmente en idiomas de recursos más bajos. Prueba en cualquier idioma objetivo antes de lanzar.
Dónde se sitúa hoy
Para las cargas de trabajo para las que está construido — clasificación, extracción simple, completación por pulsación de tecla, prefiltrado de alto volumen — GPT-5.4 Nano es competitivo con las ofertas de nivel más pequeño de otros proveedores frontier y dramáticamente más barato que ejecutar las mismas cargas de trabajo en los niveles base o mini. El ranking de inteligencia rastrea la posición comparativa entre niveles.
El perfil de coste y latencia es todo el argumento de venta. En tareas de razonamiento la puntuación del ranking no es impresionante, y ese es el resultado correcto — el razonamiento no es para lo que nano está diseñado.
Para extracción de datos en el extremo simple del espectro, nano maneja extracciones estructuradas de documentos a una fracción del coste de niveles más grandes. Para flujos de trabajo de contenido donde el trabajo es de formato corto (líneas de asunto, texto de botones, resúmenes de una sola oración), nano es a menudo suficiente.
Cuándo nano es la elección correcta
Usa nano cuando la carga de trabajo sea genuinamente simple y el volumen sea alto. Los ahorros de coste se acumulan a través de millones de llamadas.
Úsalo como la primera etapa de un enrutador. Clasifica, extrae o prefiltra en nano. Escala los casos límite o los complejos a niveles más grandes. Este patrón mantiene la factura manejable mientras preserva el acceso a capacidad de razonamiento donde importa.
Úsalo para rutas interactivas donde la latencia es la restricción principal. Autocompletado por pulsación de tecla, sugerencia en línea, cualquier cosa que necesite sentirse instantánea.
Cuándo nano es la elección incorrecta
Omite nano para cualquier cosa que requiera razonamiento. Chat difícil, análisis de múltiples pasos, salida estructurada contra esquemas complejos, bucles de agente, generación de contenido que necesita leerse bien — escala a mini como mínimo.
Omítelo para cualquier carga de trabajo donde el coste de una respuesta incorrecta sea significativamente mayor que los ahorros de usar el nivel más pequeño. Los ahorros solo compensan cuando las respuestas incorrectas son baratas.
Omítelo para tareas pesadas en visión donde la entrada sea adversaria. El codificador de visión del modelo más pequeño comete más errores que los niveles más grandes en diagramas densos, escaneos de baja resolución y texto rotado.
Notas operacionales
La monitorización de costes importa más que en los niveles más grandes porque las cargas de trabajo tienden a ser de volumen mucho mayor. Un pequeño bug que dispara llamadas nano en un bucle puede acumular facturas rápidamente. Para cargas de trabajo donde la reproducibilidad importa, fija el snapshot fechado gpt-5.4-nano-2026-03-17 en lugar de leer el slug flotante.
Alternativas
Los modelos pequeños de pesos abiertos ejecutándose en GPUs locales pueden igualar a nano en tareas estrechas a menor coste marginal más allá del gasto de GPU. La sobrecarga operacional y la falta de mejoras continuas de OpenAI son las compensaciones.
Para cargas de trabajo sensibles al precio por token, las ofertas comparables de nivel más pequeño de otros proveedores frontier merecen una comparación directa cara a cara. Las dinámicas de precios en la parte inferior del stack difieren significativamente entre proveedores.
Última revisión técnica: 2026-05-22 — Tokonomix.ai
