Ir al contenido
Tier C — Especialista
Se ejecuta en:USCreado en:United States

Fecha de retirada

El proveedor retirará este modelo el 23 de octubre de 2026. Hasta entonces funciona con normalidad.

OpenAI

o3-mini-2025-01-31

Tier C — Especialista

Equipo editorial Tokonomix·Revisado por Mes Kalkan··

o3-mini-2025-01-31 es un modelo de lenguaje orientado al razonamiento desarrollado por OpenAI, lanzado en enero de 2025 como parte de la serie de modelos o3. Representa una variante compacta diseñada para equilibrar capacidades avanzadas de razonamiento con mayor eficiencia en comparación con modelos más grandes de la misma familia. El modelo emplea computación extendida en tiempo de inferencia, lo que le permite dedicar ciclos adicionales de procesamiento a problemas complejos antes de generar respuestas. Esta arquitectura lo hace particularmente adecuado para tareas que requieren razonamiento lógico de múltiples pasos, resolución de problemas matemáticos y generación de código. El modelo se basa en el marco de razonamiento introducido con los modelos de la serie o de OpenAI, que enfatizan la resolución deliberativa de problemas por encima de la generación inmediata de respuestas. Aunque los detalles técnicos específicos sobre el recuento de parámetros y la arquitectura no han sido revelados, o3-mini se posiciona como una alternativa más accesible al modelo o3 completo, ofreciendo un sólido rendimiento en pruebas de razonamiento mientras requiere menos recursos computacionales. El tamaño de su ventana de contexto no ha sido especificado públicamente por OpenAI al momento del lanzamiento. Dentro de la línea de modelos de OpenAI, o3-mini-2025-01-31 se sitúa junto a otros modelos orientados al razonamiento como una opción más ligera para aplicaciones donde la calidad del razonamiento es prioritaria pero las restricciones de recursos son una consideración. Está dirigido a casos de uso que incluyen asistencia en desarrollo de software, razonamiento científico, computación matemática y tareas analíticas estructuradas. El modelo admite capacidades estándar de generación de texto mientras mantiene el enfoque de razonamiento en cadena característico de la serie o3, haciéndolo adecuado tanto para aplicaciones de propósito general como para cargas de trabajo de razonamiento especializadas.

o3-mini-2025-01-31 representa el esfuerzo de OpenAI por democratizar el razonamiento avanzado, ofreciendo capacidades deliberativas en un paquete más eficiente que sus hermanos mayores de la serie o3.

Análisis Tokonomix, enero 2025
Sección 01

Análisis de velocidad

Latencia medida en todas las ejecuciones de benchmark. P50 (mediana) y P95 (percentil 95) dan una imagen realista de la velocidad de respuesta bajo carga normal y máxima.

Latencia P50 (mediana)Latencia P9596 runs
423175630894421575408-2209-14ms
Sección 02

Puntuaciones de calidad

Cómo se sitúa este modelo frente al resto del campo en cada categoría de prompts, a partir de un ajuste por pares sobre los mismos prompts. La nota bruta del juez aparece debajo de cada número.

67%
Generación de código
media del juez 96
72%
Creativo
media del juez 93
41%
Factual
media del juez 80
64%
Multilingüe
media del juez 99
60%
Razonamiento
media del juez 77

Tasa de victorias por categoría: con qué frecuencia este modelo vence a un modelo medio en un prompt de esa categoría. 50% es la media, no un suspenso. No es un porcentaje de aciertos.

Sección 03

Precios

Lo que pagas por millón de tokens al usar este modelo en Tokonomix, más una estimación para una conversación típica.

💰
Tarifas API — o3-mini-2025-01-31
$1.65 por 1M de tokens de entrada
$6.58 por 1M de tokens de salida
≈ $0.0023 por conversación típica (800 tokens)
Precio entrada vs salida (por 1M de tokens)
por 1M de tokens de entrada$1.65
por 1M de tokens de salida$6.58
Sección 04

Tokens por segundo

Rendimiento en tokens por segundo, derivado de la latencia P50 medida. Más alto es mejor; las fluctuaciones reflejan la carga del lado del proveedor.

Rendimiento (tokens / s)202 / avg 315
46977

Estimado a partir de latencia P50 × 200 tokens de salida — el número absoluto depende de esta suposición; lo que importa es la tendencia.

Sección 05

Fortalezas & debilidades

Basado en resultados de benchmarks y comentarios agregados de la comunidad sobre casos de uso reales.

Fortalezas

Razonamiento matemático multi-paso robustoGeneración de código con análisis profundoEficiencia mejorada vs modelos o3 completosComputación extendida en tiempo de inferenciaResolución de problemas estructurados complejosPrecisión en tareas analíticas científicasIntegración nativa con ecosistema OpenAIAsistencia sólida para desarrollo de software

Debilidades

Latencia variable por procesamiento deliberativoVentana de contexto no especificada públicamenteDisponibilidad regional puede ser limitadaSin soporte multimodal confirmado al lanzamiento
Sección 06

Capacidades

toolssource: litellmjson modereasoningjson schemaprompt cachingmax output tokens: 100000
Sección 07

Preguntas frecuentes

El tiempo de inferencia varía según la complejidad del problema, pudiendo ser varios segundos más largo que modelos tradicionales. OpenAI diseñó este comportamiento intencionalmente para problemas que se benefician de razonamiento extendido, no para todas las consultas.

Para equipos que priorizan calidad de razonamiento sobre velocidad pura y pueden tolerar latencias variables, o3-mini ofrece una propuesta convincente en el espacio de modelos especializados en pensamiento lógico.

Tokonomix benchmark summary
Sección 08

Disponibilidad

Disponibilidad

Sin datos todavía

Aún no hemos registrado suficientes llamadas a la API para mostrar estadísticas de disponibilidad de este modelo. Los datos aparecen una vez que el modelo comienza a recibir tráfico en vivo.

Sección 09

Veredictos del benchmark Tokonomix

⚖️
Endorsed by 2 judges
Independent LLM judges evaluated this model on our weekly intelligence tests
cohere/command-a100/100 · 1 runs
1 correct0 partial0 wrong100% accuracy
claude-sonnet-4-591/100 · 52 runs
45 correct3 partial4 wrong87% accuracy
2026-09-13

o3-mini quality drops 5.7 points with notable coding performance decline

The o3-mini model shows a significant quality regression in the current benchmark window, dropping from 98.7 to 93.0 overall. The most pronounced decline occurred in coding performance, which fell from 97 to 87, representing a 10-point decrease. Reasoning capabilities remain exceptional at a perfect 100 score, while factual accuracy holds steady at 92. The multilingual category from the previous window is not present in current results, making direct comparison incomplete. Latency increased modestly from 2989ms to 3305ms at the median, representing approximately an 11% slowdown. Both benchmark windows included only 4 test runs, suggesting limited sample size for drawing definitive conclusions. The combination of reduced coding performance and increased response times indicates potential model changes or deployment issues that have impacted practical performance. Users relying on o3-mini for code generation tasks should be aware of this decline, though reasoning-heavy applications appear unaffected. The stable factual performance suggests knowledge retrieval remains intact. Given the previous verdict mentioned tool use and caching additions, these features may still be present but overall execution quality has regressed from the prior excellent baseline.

Calidad

93.0

Latencia p50

3,305 ms

Ejecuciones de test

4

Quality dropped 5.7 points Coding score fell from 97 to 87 Latency increased 11% Reasoning remains perfect at 100
Sección 10

Perfil completo del modelo

o3-mini-2025-01-31 — illustration 1

⚠️ Modelo obsoleto. OpenAI lo ha reemplazado con o4-mini (abril 2025), que ofrece precisión de razonamiento mejorada a coste similar. Los proyectos nuevos deben usar o4-mini directamente. Las integraciones existentes de o3-mini deben planificar la migración antes de que el endpoint de la API sea descontinuado.

o3-mini-2025-01-31: la instantánea fechada del modelo de razonamiento de nivel volumen obsoleto de OpenAI

El alias fechado de enero de 2025 de o3-mini captura la instantánea que fijó el comportamiento de producción del primer modelo de razonamiento de nivel volumen de OpenAI. Con o3-mini ahora obsoleto en favor de o4-mini, esta instantánea cumple un propósito limitado pero real: un ancla de estabilidad para flujos de trabajo de producción ejecutándose en o3-mini que necesitan mantener comportamiento consistente durante su ventana de migración hacia el sucesor.

Qué representa esta instantánea

La instantánea de enero es o3-mini tal como se distribuyó para uso estable en producción. El conjunto de capacidades es lo que describe la página flotante de o3-mini: generación centrada en razonamiento en el nivel mini, ventana de contexto de 200,000 tokens, perfil de costes que escalaba a cargas de trabajo de volumen, precisión que se situaba por debajo del o3 completo pero por encima de lo que los modelos reflex podían entregar en problemas orientados al razonamiento.

Para equipos ejecutando despliegues de producción calibrados contra esta instantánea, el alias fechado ha sido el anclaje seguro mientras los mensajes del ciclo de vida de OpenAI sobre o3-mini se estabilizaban. Ahora que la obsolescencia en favor de o4-mini está anunciada, la instantánea anclada sirve a la ventana de migración en lugar de a la estabilidad de producción a largo plazo.

El contrato de anclaje sigue vigente. Los pesos de la instantánea de enero no cambiarán, y el comportamiento del modelo no cambiará por debajo de ti. Lo que sí cambia es la línea temporal de disponibilidad del endpoint. Una vez que OpenAI descontinúe el endpoint de o3-mini, el alias fechado desaparecerá con él. Planifica la migración a o4-mini antes de ese límite abrupto.

La ventana de migración

Para despliegues de producción ejecutándose en o3-mini-2025-01-31, el objetivo de migración es o4-mini en el alias flotante o o4-mini-2025-04-16 en la instantánea fechada. La migración es directa en la superficie de la API. Ambos modelos comparten la misma forma de petición y respuesta, por lo que el código de integración no cambia.

Los deltas de comportamiento son reales pero generalmente favorables. o4-mini fue entrenado para mejorar los puntos débiles específicos de o3-mini: mejor precisión en síntesis de código compleja, rendimiento más confiable en razonamiento de múltiples pasos bajo restricciones interactuantes, y un perfil de latencia ligeramente mejor en promedio. La mayoría de las cargas de trabajo ven mejoras en lugar de regresiones cuando realizan la transición.

Los patrones de prompts que fueron ajustados a la distribución de razonamiento específica de o3-mini pueden necesitar ajustes para obtener resultados equivalentes en o4-mini. Planifica una pista de evaluación paralela donde ejecutes tu corpus de prueba contra ambos modelos, documentes los deltas y realices la transición cuando los deltas sean aceptables. No asumas que la migración es gratuita aunque la superficie de la API sea idéntica.

La línea temporal de obsolescencia no ha sido publicada en detalle preciso. El patrón de OpenAI con modelos de razonamiento obsoletos ha sido una ventana de descontinuación de varios meses con aviso explícito anticipado. Incorpora la migración en tu calendario de lanzamientos en lugar de esperar el aviso de obsolescencia.

Dónde falla y qué nunca fue

Las mismas limitaciones que se aplicaban a o3-mini se aplican a esta instantánea. Las aplicaciones conversacionales en tiempo real encajan mal porque la latencia de razonamiento es incompatible con la UX de chat. La resumición y extracción simples desperdician el cómputo de razonamiento. La escritura creativa produce prosa plana y cautelosa sin estilo.

Dentro del nivel de razonamiento, esta instantánea nunca fue la opción de máxima precisión. El o3 completo o o1-pro y sus instantáneas fechadas eran las variantes para los problemas más difíciles. El nivel mini era el nivel económicamente viable para volumen, nunca el nivel de precisión frontera.

Para flujos de trabajo que han crecido más allá del conjunto de capacidades del nivel mini durante el tiempo en esta instantánea, el objetivo de migración puede situarse por encima de o4-mini en un nivel superior en lugar de en el mismo nivel de volumen. o3-2025-04-16 es la instantánea fechada del o3 completo si tu carga de trabajo ahora justifica el mayor coste para mejor precisión. Ejecuta la comparación apropiadamente en lugar de optar por defecto por la migración de mismo nivel.

Notas prácticas

El patrón operacional para la gestión de instantáneas durante una ventana de obsolescencia es establecer evaluación paralela contra el modelo sucesor inmediatamente, documentar los deltas de comportamiento a través de tu corpus completo de pruebas y realizar la transición en un lanzamiento planificado en lugar de bajo presión de fecha límite de obsolescencia. Para múltiples flujos de trabajo de producción anclados a instantáneas obsoletas, prioriza las migraciones por riesgo de carga de trabajo e impacto en ingresos en lugar de procesarlas en orden aleatorio.

Para flujos de trabajo de investigación que necesitan integración de fuentes externas junto con razonamiento, o4-mini-deep-research es la variante dedicada al modo investigación en la generación o4. Esto aborda cargas de trabajo para las que o3-mini a veces era forzado a manejar pero para las que realmente no estaba bien adaptado.

La residencia de datos en la UE no se satisface por defecto en esta instantánea ni en ninguno de los endpoints de razonamiento relacionados de OpenAI. El patrón de gateway regional sigue siendo la solución práctica para despliegues europeos regulados, y esa restricción no cambia con la migración a o4-mini.

Última revisión técnica: 2026-05-22 — Tokonomix.ai

o3-mini-2025-01-31 — illustration 2o3-mini-2025-01-31 — illustration 3
Última prueba automática
14 sept 2026 · 20:02 UTC · Benchmark de velocidad
Latencia P50
988 ms
Latencia P95
3163 ms
Errores
0 / 6 ejecuciones
Última revisión por Equipo Tokonomix·26 de mayo de 2026