Ir al contenido
Tier C — Especialista
Se ejecuta en:USCreado en:United States
OpenAI

gpt-4o-mini-2024-07-18

Tier C — Especialista

Equipo editorial Tokonomix·Revisado por Mes Kalkan··

GPT-4o-mini-2024-07-18 es un modelo de lenguaje compacto desarrollado por OpenAI, lanzado en julio de 2024 como parte de la familia de modelos GPT-4o. Representa una variante más pequeña y eficiente de la arquitectura GPT-4o, diseñada para proporcionar generación de texto capaz mientras requiere menos recursos computacionales que sus contrapartes más grandes. El modelo mantiene la base de arquitectura multimodal de la serie GPT-4o, aunque esta variante se enfoca principalmente en tareas basadas en texto. Este modelo está diseñado para aplicaciones que requieren capacidades estándar de generación de texto con latencia y requisitos de recursos reducidos. Maneja tareas como creación de contenido, respuesta a preguntas, resumen, generación de código e interacciones conversacionales. La designación "mini" indica su posición como una opción más ligera adecuada para casos de uso donde las capacidades completas de modelos más grandes pueden no ser necesarias, haciéndolo apropiado para aplicaciones de mayor volumen o escenarios de despliegue con restricciones de recursos. Dentro de la línea de modelos de OpenAI, GPT-4o-mini se sitúa por debajo de los modelos insignia GPT-4o y GPT-4 Turbo en términos de capacidad, ofreciendo un equilibrio entre rendimiento y eficiencia. Sucedió a modelos compactos anteriores en el portafolio de OpenAI, proporcionando características de rendimiento mejoradas en comparación con alternativas basadas en GPT-3.5 mientras mantiene accesibilidad para una gama más amplia de aplicaciones. El modelo representa el esfuerzo continuo de OpenAI de ofrecer opciones variadas a través de diferentes perfiles de rendimiento y eficiencia.

GPT-4o-mini se posiciona como la opción ligera de OpenAI para equipos que necesitan respuestas rápidas y económicas sin renunciar a la calidad básica de la familia GPT-4o.

Resumen editorial de Tokonomix
Sección 01

Análisis de velocidad

Latencia medida en todas las ejecuciones de benchmark. P50 (mediana) y P95 (percentil 95) dan una imagen realista de la velocidad de respuesta bajo carga normal y máxima.

Latencia P50 (mediana)Latencia P9596 runs
372185133294808628608-2209-14ms
Sección 02

Puntuaciones de calidad

Cómo se sitúa este modelo frente al resto del campo en cada categoría de prompts, a partir de un ajuste por pares sobre los mismos prompts. La nota bruta del juez aparece debajo de cada número.

61%
Generación de código
media del juez 98
70%
Creativo
media del juez 94
44%
Factual
media del juez 67
58%
Multilingüe
media del juez 95
65%
Razonamiento
media del juez 95
49%
Salud
media del juez 67

Tasa de victorias por categoría: con qué frecuencia este modelo vence a un modelo medio en un prompt de esa categoría. 50% es la media, no un suspenso. No es un porcentaje de aciertos.

Sección 03

Precios

Lo que pagas por millón de tokens al usar este modelo en Tokonomix, más una estimación para una conversación típica.

💰
Tarifas API — gpt-4o-mini-2024-07-18
$0.3000 por 1M de tokens de entrada
$1.17 por 1M de tokens de salida
≈ $0.0004 por conversación típica (800 tokens)
Precio entrada vs salida (por 1M de tokens)
por 1M de tokens de entrada$0.3000
por 1M de tokens de salida$1.17
Sección 04

Tokens por segundo

Rendimiento en tokens por segundo, derivado de la latencia P50 medida. Más alto es mejor; las fluctuaciones reflejan la carga del lado del proveedor.

Rendimiento (tokens / s)361 / avg 385
532154

Estimado a partir de latencia P50 × 200 tokens de salida — el número absoluto depende de esta suposición; lo que importa es la tendencia.

Sección 05

Fortalezas & debilidades

Basado en resultados de benchmarks y comentarios agregados de la comunidad sobre casos de uso reales.

Fortalezas

Latencia baja en producciónCosto operativo reducidoGeneración de texto fluidaBuen desempeño conversacionalIntegración sencilla vía APIResúmenes y extracción confiablesGeneración de código básicaEscalable a alto volumen

Debilidades

Razonamiento complejo limitadoCapacidades multimodales reducidasCorte de conocimiento desactualizadoMenor precisión en dominios técnicos
Sección 06

Capacidades

toolssource: litellmvisionjson modepdf inputjson schemaparallel toolsprompt cachingmax output tokens: 16384
Sección 07

Preguntas frecuentes

Es ideal cuando el volumen de peticiones es alto y las tareas son relativamente sencillas, como clasificación, resúmenes o asistentes conversacionales. Para razonamiento avanzado o análisis multimodal extenso, GPT-4o completo sigue siendo mejor opción.

Una elección sólida cuando el volumen y la latencia importan más que el razonamiento profundo; para tareas críticas, conviene escalar al GPT-4o completo.

Veredicto de Tokonomix
Sección 08

Disponibilidad

Disponibilidad

Sin datos todavía

Aún no hemos registrado suficientes llamadas a la API para mostrar estadísticas de disponibilidad de este modelo. Los datos aparecen una vez que el modelo comienza a recibir tráfico en vivo.

Sección 09

Veredictos del benchmark Tokonomix

⚖️
Endorsed by 2 judges
Independent LLM judges evaluated this model on our weekly intelligence tests
cohere/command-a100/100 · 1 runs
1 correct0 partial0 wrong100% accuracy
claude-sonnet-4-588/100 · 146 runs
118 correct14 partial14 wrong81% accuracy
2026-09-13

Significant quality decline with increased latency and narrowed test coverage

The gpt-4o-mini model shows concerning degradation in this benchmark window, with overall quality dropping 19.2 points to 67.7 from the previous 86.9. Latency has worsened considerably, increasing 47% from 1689ms to 2479ms at the median, suggesting possible infrastructure or optimization issues. The current testing window reveals a dramatically different performance profile, with only three categories evaluated compared to the previous window's broader assessment. Reasoning performance stands at a perfect 100 and coding remains strong at 92, indicating the model maintains capabilities in technical domains. However, factual accuracy has collapsed to just 11, representing a critical weakness that users should be aware of. The absence of multilingual and creative category scores in the current window makes direct comparison difficult, though the previous window showed these at 92 and 74 respectively. The substantial quality drop combined with increased response times suggests either a model regression, changes in evaluation methodology, or infrastructure challenges. Users relying on factual accuracy should exercise particular caution, while those focused on coding and reasoning tasks may still find adequate performance despite the slower responses.

Calidad

67.7

Latencia p50

2,479 ms

Ejecuciones de test

5

Quality dropped 19.2 points Latency increased 47% Factual accuracy at 11 Reasoning performance remains perfect
Sección 10

Perfil completo del modelo

gpt-4o-mini-2024-07-18 — illustration 1
gpt-4o-mini-2024-07-18: la congelación mini original

gpt-4o-mini-2024-07-18 es la instantánea fechada de julio de 2024 del modelo GPT-4o pequeño de OpenAI. La primera congelación estable de la línea mini. La que se lanzó cuando OpenAI retiró gpt-3.5-turbo del espacio de modelo-barato-por-defecto y colocó mini en su lugar.

Esto es lo que fijas cuando "gpt-4o-mini" avanzó y rompió algo para ti, o cuando un contrato downstream requiere el comportamiento exacto del lanzamiento original.

Qué es esta instantánea

La congelación de julio de 2024 es la instantánea mini inaugural. Para ese lanzamiento el modelo había:

  • Asentado la ventana de contexto de 128k que se ha mantenido constante en toda la línea.
  • Bloqueado el soporte de entrada de visión como una capacidad estándar en lugar de un endpoint separado.
  • Establecido la ergonomía de uso de herramientas que las instantáneas mini más nuevas heredaron.

Lo que no tiene, en relación con el alias rodante a mediados de 2026:

  • El pulido de seguimiento de instrucciones que las instantáneas mini posteriores añadieron.
  • Las mejoras de fiabilidad de salida estructurada que llegaron a través de las revisiones de 2025.
  • Los refinamientos de postura de rechazo que suavizaron la cautela excesiva ocasional del lanzamiento original.

Para un despliegue de producción que fue construido y validado contra esta instantánea exacta, esas brechas pueden ser el tipo equivocado de "mejora" — te estabilizaste en un comportamiento específico, y avanzar significa revalidar todo.

Cuándo la fijación fechada vale la pena

El caso para quedarse con 2024-07-18 en lugar del alias rodante gpt-4o-mini es el mismo que para cualquier instantánea fechada: intercambias acceso a mejoras por predictibilidad de comportamiento.

Situaciones concretas donde la fijación rinde frutos:

  • Cargas de trabajo reguladas con evidencia de versión del modelo en el rastro de auditoría. El oficial de cumplimiento quiere el mismo comportamiento del modelo mañana que la documentación describe hoy. La instantánea fechada es lo que hace esa promesa honesta.
  • Pipelines de producción con plantillas de prompts afinadas contra peculiaridades específicas del modelo. Las instantáneas más nuevas pueden manejar el mismo prompt de manera ligeramente diferente — mejor en promedio, peor en los casos extremos para los que tus prompts fueron afinados.
  • Pruebas A/B de larga duración donde el brazo de control necesita permanecer constante durante meses.
  • Productos de cara al cliente donde la consistencia de voz y lenguaje de rechazo importa más que las mejoras de calidad incrementales.

Para la mayoría de los demás casos de uso, rodar con el alias es el mejor predeterminado.

Cuándo migrar de ella

El camino de migración honesto es hacia adelante — a una instantánea mini más reciente o a un modelo diferente por completo.

La forma de la decisión:

  • Vuelve a ejecutar el conjunto de evaluación completo contra el alias rodante actual y contra la instantánea fechada más reciente.
  • Compara en las métricas que importan para tu producto, no en las métricas de las notas de lanzamiento de OpenAI.
  • Migra cuando la instantánea más nueva gane en tu evaluación. Quédate cuando no lo haga.

La política de depreciación de OpenAI da aviso anticipado antes de retirar instantáneas fechadas, pero la política es el piso, no el techo. Trata la fijación fechada como un contrato transitorio, no como un hogar permanente.

Dónde falla

Las mismas limitaciones que el resto de la línea mini.

Razonamiento difícil en la frontera. Mini cede terreno aquí a GPT-4o más grande y a la familia GPT-5. La comparación a nivel de categoría está en /benchmarks/leaderboard.

Audio, voz en tiempo real o video. Esos viven en los hermanos especializados.

Despliegue auto-alojado. Sin pesos, sin opción on-prem. La encuesta /usecases/local es la referencia correcta cuando esas limitaciones se imponen.

Robustez adversarial. Los modelos pequeños son objetivos más fáciles para la inyección de prompts que los grandes. Los modelos de clase mini de cualquier proveedor comparten esta debilidad.

Cuándo fijar esta instantánea exacta

Elige gpt-4o-mini-2024-07-18 cuando:

  • Lanzaste un producto con el comportamiento mini de julio de 2024 y el costo de revalidación contra una instantánea más nueva supera el beneficio.
  • Un flujo de trabajo regulado requiere fijación de versión a nivel de modelo para propósitos de auditoría.
  • Una prueba A/B o protocolo de investigación necesita una referencia de modelo fija a lo largo del tiempo.

Omítela cuando:

  • Estás comenzando desde cero — fija la instantánea mini más reciente en su lugar.
  • Las mejoras en instantáneas posteriores han ganado demostrablemente en tu arnés de evaluación.
  • El despliegue puede tolerar el alias rodante y se beneficia de las actualizaciones automáticas.

Notas de despliegue

API estándar de Chat Completions. El comportamiento de uso de herramientas y salida estructurada no ha cambiado desde cómo estaban el día que la instantánea se congeló. La entrada de visión funciona idénticamente en todas las instantáneas mini.

El fine-tuning alojado está soportado, lo que hace de esta instantánea una base razonable para una variante mini afinada si necesitas calidad de dominio estrecho sin pagar costos de inferencia de frontera.

La lectura pragmática. Esta es la primera congelación estable de la línea mini. Sigue usándola cuando la estabilidad de comportamiento sea la prioridad. Muévete a una instantánea más nueva cuando tu evaluación te lo indique, no porque OpenAI lanzó una nota de lanzamiento. Compara lado a lado en /live-test antes de cualquier migración.

Última revisión técnica: 2026-05-22 — Tokonomix.ai

gpt-4o-mini-2024-07-18 — illustration 2
Última prueba automática
14 sept 2026 · 20:04 UTC · Benchmark de velocidad
Latencia P50
554 ms
Latencia P95
593 ms
Errores
0 / 6 ejecuciones
Última revisión por Equipo Tokonomix·26 de mayo de 2026