Aller au contenu
Tier B — Production
Fonctionne en :USCréé en :United States

Date de retrait

Le fournisseur retirera ce modèle le 11 décembre 2026. D’ici là, il fonctionne normalement.

OpenAI

gpt-5-mini-2025-08-07

Tier B — Production

Équipe éditoriale Tokonomix·Relu par Mes Kalkan··

GPT-5-mini-2025-08-07 est un modèle de génération de texte développé par OpenAI, publié dans le cadre de la famille GPT-5 en 2025. Comme l'indique sa désignation "mini", ce modèle représente une variante plus petite et plus efficiente au sein de la gamme, conçue pour équilibrer capacité et efficacité computationnelle. Il traite et génère du texte similaire au langage humain à partir d'instructions en entrée, adapté aux applications incluant la génération de contenu, les agents conversationnels, l'analyse de texte et les tâches linguistiques polyvalentes. Le modèle présente des capacités standard de génération de texte sans fonctions multimodales spécialisées, se concentrant sur la compréhension et la production langagières fondamentales. La taille de sa fenêtre de contexte n'a pas été divulguée publiquement, bien qu'il conserve les caractéristiques architecturales essentielles de la série GPT-5, notamment des capacités de raisonnement améliorées et des réponses factuelles plus précises comparées aux générations précédentes. La date de publication en août 2025 suggère qu'il intègre des données d'entraînement et des raffinements architecturaux disponibles jusqu'à ce moment. Au sein de la gamme de modèles OpenAI, GPT-5-mini occupe une position d'option accessible pour les développeurs et organisations nécessitant un traitement du langage performant sans la surcharge computationnelle des modèles GPT-5 complets. Il sert les cas d'usage où la vitesse de réponse et l'efficience des ressources sont priorisées parallèlement à la qualité, le rendant approprié pour les applications à haut débit, les systèmes embarqués, ou les scénarios avec contraintes d'infrastructure. Le modèle maintient la compatibilité avec l'infrastructure API standard d'OpenAI et l'écosystème d'outils.

GPT-5-mini incarne la philosophie « mini » d'OpenAI portée à sa cinquième génération : des capacités de raisonnement améliorées dans un format optimisé pour la production à grande échelle.

Analyse Tokonomix, série GPT-5
Section 01

Analyse de vitesse

Latence mesurée sur toutes les exécutions de benchmark. P50 (médiane) et P95 (95e percentile) donnent une image réaliste de la vitesse de réponse en charge normale et de pointe.

Latence P50 (médiane)Latence P9597 runs
479161827573896503508-2209-15ms
Section 02

Scores de qualité

Comment ce modèle se situe par rapport au reste du champ sur chaque catégorie de prompts, à partir d'un ajustement par paires sur les mêmes prompts. La note brute du juge figure sous chaque nombre.

64%
Génération de code
moyenne du juge 74
35%
Créatif
moyenne du juge 59
40%
Factuel
moyenne du juge 77
32%
Multilingue
moyenne du juge 78
58%
Raisonnement
moyenne du juge 63

Taux de victoire par catégorie : la fréquence à laquelle ce modèle bat un modèle moyen sur un prompt de cette catégorie. 50% est la moyenne, pas un échec. Ce n'est pas un pourcentage de bonnes réponses.

Section 03

Tarifs

Ce que vous payez par million de tokens en utilisant ce modèle sur Tokonomix, avec une estimation pour une conversation type.

💰
Tarifs API — gpt-5-mini-2025-08-07
$0.3800 par 1M de tokens d'entrée
$2.99 par 1M de tokens de sortie
≈ $0.0008 par conversation typique (800 tokens)
Prix entrée vs sortie (par 1M de tokens)
par 1M de tokens d'entrée$0.3800
par 1M de tokens de sortie$2.99
Section 04

Tokens par seconde

Débit en tokens par seconde, dérivé de la latence P50 mesurée. Plus haut est mieux ; les fluctuations reflètent la charge côté fournisseur.

Débit (tokens / s)318 / avg 279
41370

Estimé à partir de la latence P50 × 200 tokens de sortie — le chiffre absolu dépend de cette hypothèse ; c'est la tendance qui compte.

Section 05

Forces & faiblesses

Basé sur les résultats de benchmarks et les retours communautaires agrégés sur des cas d'usage réels.

Forces

Latence réduite pour applications temps réelRaisonnement GPT-5 dans format compactAdapté aux volumes de requêtes élevésCompatible API standard OpenAIRapport qualité-coût optimiséPrécision factuelle améliorée vs GPT-4Infrastructure OpenAI éprouvée et stableEmpreinte mémoire réduite

Faiblesses

Fenêtre de contexte non divulguéeAbsence de capacités multimodalesPerformances inférieures aux modèles GPT-5 completsConnaissances limitées à mi-2025
Section 06

Capacités

toolssource: litellmvisionjson modepdf inputreasoningjson schemaparallel toolsprompt cachingmax output tokens: 128000
Section 07

Questions fréquentes

GPT-5-mini privilégie l'efficacité computationnelle et la vitesse de réponse tout en conservant l'architecture de raisonnement GPT-5. Il convient aux applications nécessitant un débit élevé ou des contraintes d'infrastructure, tandis que les modèles complets offrent des capacités maximales pour les tâches complexes.

Pour les équipes cherchant un équilibre entre intelligence moderne et déploiement économique, GPT-5-mini s'impose comme un choix pragmatique dans l'écosystème OpenAI de 2025.

Évaluation éditoriale Tokonomix
Section 08

Disponibilité

Disponibilité

Pas encore de données

Nous n'avons pas encore enregistré suffisamment d'appels API pour afficher les statistiques de disponibilité de ce modèle. Les données apparaîtront dès que le modèle reçoit du trafic en direct.

Section 09

Verdicts benchmark Tokonomix

⚖️
Endorsed by 2 judges
Independent LLM judges evaluated this model on our weekly intelligence tests
cohere/command-a100/100 · 1 runs
1 correct0 partial0 wrong100% accuracy
claude-sonnet-4-572/100 · 49 runs
32 correct1 partial16 wrong65% accuracy
2026-09-13

Quality reaches perfect score with 26% latency improvement

The gpt-5-mini-2025-08-07 model demonstrates significant performance gains in this benchmark window, achieving a perfect 100.0 quality score compared to the previous 94.7. This 5.3-point improvement comes alongside a substantial 26% reduction in latency, with p50 response times dropping from 6998ms to 5163ms. Both coding and reasoning categories now score at maximum levels, maintaining the perfect coding performance from the previous window while showing enhanced reasoning capabilities. However, the current benchmark window includes only 2 test runs compared to 5 previously, which limits the statistical confidence of these results. The previous window evaluated creative and multilingual capabilities at 92 points each, but these categories were not tested in the current window, making it impossible to assess whether improvements extend across all capability areas. Users should note that while coding and reasoning performance appears exceptional, the reduced test coverage means some use cases remain unverified in this evaluation period. The latency improvements suggest meaningful optimization work, making the model both faster and more capable for coding and reasoning tasks.

Qualité

100.0

Latence p50

5,163 ms

Exécutions de test

2

Perfect 100.0 quality score 26% faster response times Reasoning category now at maximum Limited test coverage this window
Section 10

Profil complet du modèle

gpt-5-mini-2025-08-07 — illustration 1
GPT-5 Mini (snapshot 2025-08-07) : le plus ancien pin daté de la gamme mini

Il s'agit du snapshot daté du GPT-5 Mini original, figé à la date de lancement du 7 août 2025. C'est le snapshot daté le plus ancien de la famille GPT-5 Mini — épinglé par les équipes qui ont adopté Mini dès le lancement de GPT-5 et qui n'ont pas migré depuis. La question opérationnelle qui définit ce pin n'est plus « faut-il l'épingler » mais « quand vais-je planifier la migration hors de ce pin, et vers quoi vais-je basculer ».

L'argument du délai de dépréciation

OpenAI publie des calendriers de dépréciation pour ses snapshots datés. Le schéma observé d'une génération de modèles à l'autre reste cohérent : les snapshots finissent par être retirés, avec au moins quelques mois de préavis. La date exacte est annoncée au moment où elle est annoncée, et n'est pas prévisible à l'avance.

Pour un snapshot présent depuis le lancement de GPT-5, la question n'est pas de savoir si la dépréciation arrive. Il s'agit de savoir si vous disposez d'un plan de migration prêt à exécuter le jour où OpenAI publie le calendrier. Les équipes qui opèrent sur ce pin depuis le plus longtemps sont aussi celles qui ont accumulé le plus d'investissement technique — des prompts calibrés sur le comportement spécifique du modèle, du parsing en aval qui dépend des particularités de ses sorties, des harnais d'évaluation qui prennent ce snapshot comme référence de base. Tout cela devra bouger lorsque le snapshot sera retiré.

La parade consiste à anticiper. Identifiez vers quel Mini plus récent vous comptez migrer. Lancez des évaluations périodiques contre cette cible. Construisez le travail d'ingénierie des prompts lié à la migration comme un projet identifié, et non comme une réponse en mode crise. Le coût est faible s'il est planifié. Il devient bien plus lourd s'il faut le réaliser sous la pression d'une échéance lorsque la date de dépréciation tombe.

Ce que ce snapshot capture

Le lancement d'août 2025 de GPT-5 Mini : poids de lancement, comportement de lancement sur la classification et l'extraction, profil de latence de lancement, configuration de l'encodeur visuel de lancement pour cette catégorie de taille. Le modèle n'a pas changé depuis.

Les améliorations que la ligne GPT-5 dans son ensemble a accumulées au fil des générations suivantes — meilleure précision en classification, sorties structurées plus rigoureuses, capacités visuelles améliorées, connaissance des évolutions postérieures à mi-2025 — aucune de ces avancées n'apparaît ici.

Sous le capot

Sur le plan architectural, il s'agit du décodeur transformer GPT-5 Mini à une échelle de paramètres inférieure à celle de la base 5.0. Le modèle accepte des entrées entrelacées de texte et d'images et produit une sortie uniquement textuelle. OpenAI n'a pas publié de nombre de paramètres.

La tokenisation utilise le vocabulaire BPE standard de GPT-5. Les entrées image sont encodées par tuiles, avec un coût en tokens fixe par tuile. La date de coupure d'entraînement se situe à mi-2025. Le modèle connaît les standards de langage et versions de frameworks courants jusqu'à cette période.

Les profils de coût par token et de latence par requête sont verrouillés sur les valeurs de lancement.

Où il se situe aujourd'hui

Comparé aux offres actuelles de la catégorie petite, le snapshot d'août 2025 de GPT-5 Mini se situe nettement en dessous des Mini GPT-5 plus récents sur la plupart des dimensions de benchmark. Le classement d'intelligence suit la position relative ; l'écart par rapport aux snapshots actuels s'est creusé à mesure que de nouvelles générations sont arrivées.

Pour les charges de travail courantes — classification basique, extraction simple, sorties structurées courtes, automatisation du service client sur des schémas bien rodés — le snapshot continue de produire un travail utile. Dès que l'on a besoin de connaissances postérieures à mi-2025, de capacités visuelles récentes ou des gains qualitatifs des Mini plus récents, ce modèle devient de plus en plus le mauvais choix.

Pour les workflows de contenu sur la partie très routinière du spectre et pour l'extraction de données sur des documents standards, le snapshot reste fonctionnel. Pour des charges de travail plus exigeantes, l'écart avec les pins plus récents devient visible.

Quand conserver ce pin en place

Les cas qui justifient de rester sur ce snapshot sont étroits et se réduisent :

Vous avez un outillage aval finement calibré sur les schémas de sortie spécifiques de ce modèle, et le coût de migration reste supérieur au coût cumulé de l'immobilisme.

Vous évoluez dans un contexte réglementé où ce pin précis fait partie d'un cycle d'audit actif, et changer de modèle exige une recertification qui n'a pas encore été déclenchée.

Votre charge de travail est réellement routinière et l'écart qualitatif avec les Mini plus récents n'affecte aucun résultat de façon mesurable.

Vous menez des expérimentations A/B au long cours où le bras de contrôle doit rester réellement figé pendant toute la durée du test, et le test n'est pas encore conclu.

Quand migrer maintenant

Les déclencheurs clairs :

OpenAI a publié le calendrier de dépréciation de ce snapshot, et la date est suffisamment proche pour exiger une planification active de la migration.

Votre charge de travail a évolué et nécessite désormais des capacités que cette génération ne possède pas — connaissances post-coupure, qualité visuelle, fiabilité des sorties structurées qu'offrent les Mini plus récents.

Votre harnais d'évaluation montre que l'écart qualitatif cumulé coûte cher en résultats concrets — plus de tickets de support, plus de travail de nettoyage, plus d'incidents visibles côté client.

Vous êtes à un point de refonte naturel de votre pipeline où le coût de migration est plus faible qu'à l'ordinaire.

Choisir la cible de migration

Les cibles naturelles sont les snapshots datés des générations Mini plus récentes : 5.2 Mini, 5.4 Mini, 5.5 Mini, ou la version courante au moment de votre migration. Le choix dépend des mêmes considérations que tout choix de Mini : besoins de capacité, sensibilité au coût, volonté de remigrer plus tard versus épingler la dernière version disponible.

La plupart des équipes qui quittent ce snapshot atterrissent sur le dernier Mini daté stable, présent depuis suffisamment longtemps pour que les correctifs de début de vie se soient stabilisés. Vous obtenez ainsi les gains qualitatifs de la nouvelle génération avec la stabilité opérationnelle d'un pin mature.

Le schéma de migration

Épinglez le snapshot cible en pré-production. Faites passer vos prompts existants à travers lui. Attendez-vous à devoir réaliser quelques ajustements, car les schémas de sortie diffèrent légèrement d'une génération à l'autre. Validez contre votre suite d'évaluation. Mettez à jour le parsing aval si des particularités de format ont changé. Basculez le trafic de production. Retirez l'ancien pin.

L'ensemble du projet prend généralement quelques semaines-ingénieur pour une charge de travail de complexité moyenne. Fait en amont de la dépréciation, c'est un projet planifié. Fait sous la pression d'une échéance, c'est un exercice d'urgence.

Alternatives

Pour les charges de travail nécessitant un comportement épinglé en catégorie mini chez un autre fournisseur, les snapshots datés comparables d'Anthropic et de Google offrent le même schéma d'épinglage avec des rapports coût/qualité potentiellement différents.

Pour les charges de travail optimisées en coût où l'écosystème OpenAI n'est pas structurant, de petits classificateurs open-weights tournant sur votre propre infrastructure offrent l'histoire de résidence des données et la prévisibilité opérationnelle que des slugs flottants ne peuvent pas garantir.

Dernière revue technique : 2026-05-22 — Tokonomix.ai

gpt-5-mini-2025-08-07 — illustration 2gpt-5-mini-2025-08-07 — illustration 3
Dernier test automatisé
15 sept. 2026 · 02:05 UTC · Benchmark de vitesse
Latence P50
628 ms
Latence P95
709 ms
Erreurs
0 / 6 exécutions
Dernière revue par Équipe Tokonomix·26 mai 2026