Ir al contenido
Tier A — Frontera
Se ejecuta en:USCreado en:United States
OpenAI

gpt-5.4-mini

Tier A — Frontera

Equipo editorial Tokonomix·Revisado por Mes Kalkan··

GPT-5.4-mini es un modelo de lenguaje compacto desarrollado por OpenAI, posicionado como una opción eficiente dentro del portafolio de modelos de la organización. Como parte de la serie GPT-5, representa una variante reducida diseñada para equilibrar rendimiento con eficiencia computacional. El modelo proporciona capacidades estándar de generación de texto, manejando una variedad de tareas de procesamiento de lenguaje natural incluyendo creación de contenido, resumen, respuesta a preguntas e interacciones conversacionales. Las especificaciones técnicas de GPT-5.4-mini incluyen un tamaño de ventana de contexto no revelado, aunque mantiene la arquitectura transformer central característica de la familia GPT de OpenAI. Como variante "mini", este modelo está optimizado para requisitos de recursos reducidos mientras retiene capacidades funcionales de generación de texto. Procesa y genera texto similar al humano a través de múltiples dominios y casos de uso, aunque con sofisticación potencialmente reducida comparado con modelos más grandes de la misma generación. Dentro de la línea de modelos de OpenAI, GPT-5.4-mini ocupa el nivel enfocado en eficiencia, sirviendo aplicaciones donde tiempos de respuesta rápidos y menor sobrecarga computacional tienen prioridad sobre rendimiento máximo. Este posicionamiento lo hace adecuado para desarrolladores y organizaciones que requieren capacidades confiables de modelo de lenguaje sin las demandas de recursos de los modelos insignia. El modelo sigue el patrón establecido de OpenAI de ofrecer tamaños de modelo graduados para abordar diferentes escenarios de implementación y requisitos técnicos.

GPT-5.4-mini se posiciona como una opción eficiente dentro de la familia GPT-5, pensada para cargas de trabajo donde la latencia y el coste pesan tanto como la calidad de salida.

Resumen editorial de Tokonomix
Sección 01

Análisis de velocidad

Latencia medida en todas las ejecuciones de benchmark. P50 (mediana) y P95 (percentil 95) dan una imagen realista de la velocidad de respuesta bajo carga normal y máxima.

Latencia P50 (mediana)Latencia P95105 runs
34038387336108341433208-1009-05ms
Sección 02

Puntuaciones de calidad

Cómo se sitúa este modelo frente al resto del campo en cada categoría de prompts, a partir de un ajuste por pares sobre los mismos prompts. La nota bruta del juez aparece debajo de cada número.

76%
Generación de código
media del juez 100
90%
Creativo
media del juez 97
59%
Factual
media del juez 86
61%
Multilingüe
media del juez 98
79%
Razonamiento
media del juez 100

Tasa de victorias por categoría: con qué frecuencia este modelo vence a un modelo medio en un prompt de esa categoría. 50% es la media, no un suspenso. No es un porcentaje de aciertos.

Sección 03

Historial de precios

Tarifas directas del proveedor por millón de tokens, más una estimación del coste de una conversación típica.

💰
Tarifas API — gpt-5.4-mini
$0.7500 por 1M de tokens de entrada
$4.50 por 1M de tokens de salida
≈ $0.0014 por conversación típica (800 tokens)
Precio entrada vs salida (por 1M de tokens)
por 1M de tokens de entrada$0.7500
por 1M de tokens de salida$4.50

Pricing over time

Input & output per 1M tokens · step-line = price changes

$0.7500

input / 1M

— stable

$4.50

output / 1M

— stable

2026-05-242026-07-262026-08-30
Input
Output
Price change
⟳ synced weekly
Sección 04

Tokens por segundo

Rendimiento en tokens por segundo, derivado de la latencia P50 medida. Más alto es mejor; las fluctuaciones reflejan la carga del lado del proveedor.

Rendimiento (tokens / s)431 / avg 353
583119

Estimado a partir de latencia P50 × 200 tokens de salida — el número absoluto depende de esta suposición; lo que importa es la tendencia.

Sección 05

Fortalezas & debilidades

Basado en resultados de benchmarks y comentarios agregados de la comunidad sobre casos de uso reales.

Fortalezas

Respuestas de baja latenciaCoste operativo reducidoBuen ajuste para tareas rutinarias de NLPGeneración de texto coherenteEscalable en cargas conversacionalesRespaldo del ecosistema OpenAIIntegración sencilla vía APIApto para resumen y Q&A

Debilidades

Ventana de contexto no documentadaRazonamiento limitado frente a modelos mayoresSin capacidades multimodales confirmadasFecha de corte de conocimiento no publicada
Sección 06

Capacidades

toolssource: litellmvisionjson modepdf inputreasoningjson schemaparallel toolsprompt cachingmax output tokens: 128000
Sección 07

Preguntas frecuentes

Es ideal para tareas de alto volumen como chatbots, resúmenes, clasificación de texto y generación de contenido donde se prioriza la rapidez y el coste sobre el razonamiento complejo.

Una elección sólida para equipos que necesitan generación de texto fiable a gran escala sin asumir el coste de un modelo insignia. Si tu caso de uso no exige razonamiento profundo, cumple con creces.

Veredicto de Tokonomix
Sección 08

Disponibilidad

Disponibilidad

Con qué frecuencia responde este modelo cuando lo llamamos — medido en solicitudes reales de API y pruebas en vivo durante los últimos 30 días. Esto es independiente de la calidad: estos números solo indican si el modelo responde, no qué tan buena es la respuesta.

Últimos 7 días

Últimos 30 días

100.0%

n=4

Tiempo de respuesta mediano

1,654ms

n=4

Basado en 384 mediciones en los últimos 30 días.

Detalles técnicos

Solo cuentan las llamadas reales a la API y las solicitudes de prueba en vivo — las sondas internas y las ejecuciones de referencia están excluidas.

Las llamadas con una clave API propia (BYOK) están excluidas: esos fallos son específicos de la clave, no una señal de inactividad del modelo.

Las llamadas fallidas NO se incluyen en las puntuaciones de calidad — la calidad se mide solo en respuestas exitosas. Disponibilidad y calidad son señales independientes.

Tiempo de respuesta mediano (p50) en llamadas exitosas con una duración registrada. Los valores atípicos afectan menos a la mediana que a la media.

Total de llamadas (30d)

4

Respuestas OK (30d)

4

Total de llamadas (7d)

0

Respuestas OK (7d)

0

Sección 09

Veredictos del benchmark Tokonomix

⚖️
Endorsed by 2 judges
Independent LLM judges evaluated this model on our weekly intelligence tests
cohere/command-a100/100 · 1 runs
1 correct0 partial0 wrong100% accuracy
claude-sonnet-4-597/100 · 45 runs
44 correct0 partial1 wrong98% accuracy
2026-08-30

gpt-5.4-mini adds reasoning, PDF input, and advanced schema capabilities

The gpt-5.4-mini model represents a significant expansion of the mini model line with the addition of eight new capabilities. Most notably, reasoning capabilities have been integrated, bringing advanced problem-solving features to the smaller model variant. PDF input support allows direct document processing without preprocessing, while vision capabilities enable multimodal applications. The model now supports JSON mode with both basic and advanced schema validation, alongside parallel tool execution for improved efficiency. Prompt caching has been added to optimize repeated interactions. These additions position gpt-5.4-mini as a more versatile option that bridges the gap between lightweight and full-featured models. Users gain access to document understanding, visual analysis, and structured output generation in a compact package. The reasoning feature is particularly significant, as it historically has been reserved for larger models. For applications requiring multimodal input, structured outputs, or cost-effective reasoning, this release substantially expands what can be accomplished with the mini tier. Users should evaluate whether these new capabilities meet their needs for tasks previously requiring larger models.

Calidad

Latencia p50

Ejecuciones de test

0

Reasoning capability added PDF and vision input support Advanced JSON schema validation Parallel tools and caching enabled
Sección 10

Perfil completo del modelo

gpt-5.4-mini — illustration 1
GPT-5.4 Mini: cuando el nivel mini se convierte en la opción predeterminada correcta

Nota — perfil prospectivo. Esta página describe un modelo que está en vista previa temprana, anunciado pero no disponible generalmente, o proyectado según señales de la hoja de ruta. Las especificaciones y capacidades pueden cambiar antes del lanzamiento público. Los datos de benchmark en vivo en esta página reflejan cualquier endpoint que nuestro arnés de pruebas pueda alcanzar hoy.

GPT-5.4 Mini es el nivel pequeño pero capaz de la generación 5.4. El patrón resulta familiar de los niveles mini anteriores: modelo más pequeño, inferencia más rápida, menor costo por token, menos capacidad bruta que el nivel base superior. Lo que es diferente en la generación 5.4 es que mini ha cruzado un umbral de calidad donde se convierte en la opción predeterminada correcta para un rango mucho más amplio de cargas de trabajo que los niveles mini anteriores.

Cuando mini deja de ser un compromiso

Los niveles mini anteriores en la familia GPT-5 eran la opción obvia para cargas de trabajo rápidas y económicas, y la opción obviamente incorrecta para cualquier cosa que necesitara capacidad real. La decisión era binaria: usar base para trabajo serio, escalar a mini solo cuando el costo dominaba.

La generación 5.4 desplaza el límite. GPT-5.4 Mini maneja la mayor parte del trabajo que base 5.2 y 5.3 solían hacer, a una fracción del costo y significativamente más rápido. Para equipos cuya mezcla de carga de trabajo es principalmente chat, principalmente generación de salida estructurada, principalmente tareas de contenido sencillas — el tipo de tráfico que no estresa la profundidad de razonamiento — base 5.4 es a menudo la elección incorrecta. Mini hace el mismo trabajo por menos.

La decisión se convierte en: ¿cuándo la carga de trabajo realmente se beneficia de la capacidad extra del nivel base? La respuesta es más estrecha de lo que la mayoría de los equipos asumen. Razonamiento difícil, bucles de agentes con planificación profunda, salida estructurada contra esquemas extremadamente complejos, coherencia de contexto largo bajo carga pesada — esas son las cargas de trabajo donde base gana. La mayoría de otras cosas, mini las maneja competentemente.

Bajo el capó

GPT-5.4 Mini es un decodificador transformer, multimodal a través de entradas de texto y visión, con salida solo de texto. La arquitectura refleja la familia 5.4 más amplia a una escala de parámetros más pequeña. OpenAI no ha publicado recuentos exactos de parámetros.

La capacidad de visión está presente y es ampliamente comparable a base 5.4 en tareas estándar: comprensión de gráficos, extracción con sabor a OCR, análisis de diseño de documentos, descripción de escenas. En las tareas de visión más difíciles — diseños adversarios, diagramas técnicos densos, entradas de baja resolución — la brecha con base 5.4 es más visible.

La tokenización utiliza el vocabulario BPE estándar de GPT-5. Las entradas de imagen se codifican en mosaico con un costo fijo de tokens por mosaico. La ventana de contexto coincide con la línea 5.4 más amplia, aunque la coherencia en entradas extremadamente largas cae antes que en el nivel base.

El límite de entrenamiento cae a principios de 2026. El modelo conoce los estándares de lenguaje principales y las versiones de frameworks actuales durante ese período.

Dónde se ubica hoy

Para chat, generación de contenido, flujos de trabajo de salida estructurada y tareas asistidas por visión de dificultad rutinaria, GPT-5.4 Mini es competitivo con los niveles base de generaciones anteriores y significativamente más económico y rápido que el actual base 5.4. La tabla de clasificación de inteligencia rastrea el rendimiento comparativo entre niveles.

El perfil de latencia es el verdadero punto de venta. El tiempo hasta el primer token de Mini es significativamente menor que base 5.4 en la misma solicitud, lo cual importa para cargas de trabajo interactivas donde los usuarios sienten el tiempo de respuesta directamente. Para chatbots, asistencia en línea y cualquier otra aplicación con sensación de tiempo real, mini es la mejor experiencia incluso cuando base produciría una salida marginalmente mejor.

Para flujos de trabajo de contenido en el extremo rutinario del espectro, mini es la opción predeterminada correcta. Para extracción de datos en formatos de documentos estándar, mini maneja el trabajo con ahorros significativos de costo sobre base.

Donde la brecha con base aún se muestra

El razonamiento difícil es la brecha más clara. Planificación de múltiples pasos, ponderación cuidadosa de muchos factores, problemas de satisfacción de restricciones expresados en lenguaje natural — base 5.4 supera a mini notablemente en estos. Si tu carga de trabajo llega rutinariamente a los límites de sobre qué puede razonar mini, escala.

La coherencia de contexto largo cae antes. Mini maneja bien las solicitudes largas hasta cierto punto, luego comienza a perder restricciones establecidas temprano. Base 5.4 mantiene el hilo conductor más lejos. Para flujos de trabajo que empaquetan instrucciones extensas o documentos de referencia grandes en la solicitud del sistema, el nivel base es más confiable.

La salida estructurada contra esquemas extremadamente complejos es más propensa a errores en mini. Las salidas JSON simples funcionan bien. Los esquemas profundamente anidados con muchas uniones discriminadas ocasionalmente producen salida casi válida que necesita limpieza.

La alucinación en temas de nicho es algo más común que en base. La reducción en la tasa de alucinación que 5.4 trae sobre generaciones anteriores se aplica a ambos niveles, pero el modelo más pequeño tiene menos capacidad para suprimir respuestas incorrectas pero confiadas sobre hechos de casos extremos.

El rendimiento en idiomas no ingleses en idiomas con menos recursos cae más visiblemente en mini que en base. Los principales idiomas europeos y del este asiático son fuertes. Las comunidades de idiomas más pequeñas ven una caída de calidad más pronunciada.

Cuando mini es la opción predeterminada correcta

El patrón de nivel predeterminado para nuevo desarrollo en la línea 5.4 es: comenzar con mini, escalar a base o Pro solo cuando la carga de trabajo demuestre que necesita la capacidad extra. Esto invierte el patrón antiguo de "comenzar con base, bajar a mini solo para ahorrar dinero."

Usa mini para chat, flujos de trabajo de servicio al cliente, borrador de contenido, salida estructurada en esquemas rutinarios, análisis asistido por visión de documentos estándar, y cualquier carga de trabajo donde el usuario está esperando la respuesta en tiempo real.

Úsalo para tráfico de alto volumen donde los ahorros de costo se acumulan. Una carga de trabajo que ejecuta miles de completaciones por día verá facturas significativamente diferentes entre mini y base, y si la calidad es suficientemente buena en mini, los ahorros son pura ganancia.

Cuándo escalar a base o Pro

Escala a base cuando la carga de trabajo involucra rutinariamente razonamiento de múltiples pasos que mini hace mal, cuando la coherencia de contexto largo importa y mini pierde restricciones, o cuando la salida estructurada contra esquemas complejos produce demasiada limpieza posterior.

Escala más allá a Pro cuando incluso base 5.4 no es suficiente — bucles de agentes con planificación profunda, análisis difíciles, trabajo de razonamiento de nivel superior. Pro es excesivo para la mayoría de las cargas de trabajo pero la elección correcta cuando el trabajo lo demanda.

Un enrutador que ejecuta mini primero y escala basándose en verificaciones de calidad o heurísticas de tipo de carga de trabajo mantiene el perfil de costo sensato mientras reserva los niveles más pesados para los casos que los necesitan.

Alternativas

Para autocompletado interactivo con latencia aún menor, el nivel nano en la línea 5.4 intercambia más capacidad por más velocidad. Las variantes nano son la elección correcta para rutas de completado por pulsación de tecla.

Para optimización de costos más allá de lo que mini proporciona, modelos de pesos abiertos más pequeños ejecutándose en tu propia infraestructura pueden igualar la calidad de mini en tareas estrechas a costo marginal casi cero. La sobrecarga operacional es el compromiso.

Para cargas de trabajo donde la reproducibilidad importa, fija la instantánea fechada gpt-5.4-mini-2026-03-17 en lugar de leer el slug flotante.

Última revisión técnica: 2026-05-22 — Tokonomix.ai

gpt-5.4-mini — illustration 2gpt-5.4-mini — illustration 3
Última prueba automática
5 sept 2026 · 08:02 UTC · Benchmark de velocidad
Latencia P50
464 ms
Latencia P95
464 ms
Errores
0 / 6 ejecuciones
Última revisión por Equipo Tokonomix·26 de mayo de 2026