Aller au contenu
Tier A — Frontier
Fonctionne en :USCréé en :United States
OpenAI

gpt-5.4-mini

Tier A — Frontier

Équipe éditoriale Tokonomix·Relu par Mes Kalkan··

GPT-5.4-mini est un modèle de langage compact développé par OpenAI, positionné comme une option efficiente au sein du portefeuille de modèles de l'organisation. Faisant partie de la série GPT-5, il représente une variante allégée conçue pour équilibrer performance et efficacité computationnelle. Le modèle offre des capacités standard de génération de texte, traitant un éventail de tâches de traitement du langage naturel, notamment la création de contenu, la synthèse, les questions-réponses et les interactions conversationnelles. Les spécifications techniques de GPT-5.4-mini incluent une taille de fenêtre de contexte non divulguée, bien qu'il conserve l'architecture transformer caractéristique de la famille GPT d'OpenAI. En tant que variante « mini », ce modèle est optimisé pour des exigences en ressources réduites tout en conservant des capacités fonctionnelles de génération de texte. Il traite et génère du texte de qualité humaine dans de multiples domaines et cas d'usage, bien qu'avec une sophistication potentiellement moindre par rapport aux modèles plus volumineux de la même génération. Au sein de la gamme de modèles d'OpenAI, GPT-5.4-mini occupe le segment axé sur l'efficience, servant les applications où les temps de réponse rapides et une charge computationnelle réduite priment sur la performance maximale. Ce positionnement le rend adapté aux développeurs et aux organisations nécessitant des capacités fiables de modèle de langage sans les exigences en ressources des modèles phares. Le modèle suit le schéma établi par OpenAI consistant à proposer des tailles de modèles graduées pour répondre à différents scénarios de déploiement et exigences techniques.

GPT-5.4-mini se positionne comme l'option compacte de la série GPT-5, taillée pour les charges de travail où la latence et le coût priment sur la sophistication maximale.

Synthèse éditoriale Tokonomix
Section 01

Analyse de vitesse

Latence mesurée sur toutes les exécutions de benchmark. P50 (médiane) et P95 (95e percentile) donnent une image réaliste de la vitesse de réponse en charge normale et de pointe.

Latence P50 (médiane)Latence P95105 runs
34038387336108341433208-1009-05ms
Section 02

Scores de qualité

Comment ce modèle se situe par rapport au reste du champ sur chaque catégorie de prompts, à partir d'un ajustement par paires sur les mêmes prompts. La note brute du juge figure sous chaque nombre.

76%
Génération de code
moyenne du juge 100
90%
Créatif
moyenne du juge 97
59%
Factuel
moyenne du juge 86
61%
Multilingue
moyenne du juge 98
79%
Raisonnement
moyenne du juge 100

Taux de victoire par catégorie : la fréquence à laquelle ce modèle bat un modèle moyen sur un prompt de cette catégorie. 50% est la moyenne, pas un échec. Ce n'est pas un pourcentage de bonnes réponses.

Section 03

Historique des tarifs

Tarifs directs du fournisseur par million de tokens, plus une estimation du coût d'une conversation typique.

💰
Tarifs API — gpt-5.4-mini
$0.7500 par 1M de tokens d'entrée
$4.50 par 1M de tokens de sortie
≈ $0.0014 par conversation typique (800 tokens)
Prix entrée vs sortie (par 1M de tokens)
par 1M de tokens d'entrée$0.7500
par 1M de tokens de sortie$4.50

Pricing over time

Input & output per 1M tokens · step-line = price changes

$0.7500

input / 1M

— stable

$4.50

output / 1M

— stable

2026-05-242026-07-262026-08-30
Input
Output
Price change
⟳ synced weekly
Section 04

Tokens par seconde

Débit en tokens par seconde, dérivé de la latence P50 mesurée. Plus haut est mieux ; les fluctuations reflètent la charge côté fournisseur.

Débit (tokens / s)431 / avg 353
583119

Estimé à partir de la latence P50 × 200 tokens de sortie — le chiffre absolu dépend de cette hypothèse ; c'est la tendance qui compte.

Section 05

Forces & faiblesses

Basé sur les résultats de benchmarks et les retours communautaires agrégés sur des cas d'usage réels.

Forces

Temps de réponse rapidesCoût d'inférence réduitBon pour la synthèse de texteAdapté aux interactions conversationnellesIdéal pour le déploiement à grande échelleIntégration simple via l'API OpenAIGénération de contenu polyvalenteTier A fiable pour tâches courantes

Faiblesses

Fenêtre de contexte non communiquéeRaisonnement limité face aux modèles pharesCapacités multimodales non préciséesDate de coupure des connaissances floue
Section 06

Capacités

toolssource: litellmvisionjson modepdf inputreasoningjson schemaparallel toolsprompt cachingmax output tokens: 128000
Section 07

Questions fréquentes

Il convient particulièrement aux chatbots, à la synthèse de documents courts, à la classification et à la génération de contenu à fort volume. Pour des tâches exigeant un raisonnement complexe, un modèle plus large de la même génération sera préférable.

Un choix pragmatique pour industrialiser des cas d'usage textuels à grande échelle, sans viser les performances d'un modèle phare. À considérer dès que le volume compte plus que la profondeur de raisonnement.

Verdict Tokonomix
Section 08

Disponibilité

Disponibilité

La fréquence à laquelle ce modèle répond lorsqu'on l'appelle — mesurée sur de vraies requêtes API et des tests en direct au cours des 30 derniers jours. C'est indépendant de la qualité : ces chiffres indiquent seulement si le modèle répond, pas la qualité de sa réponse.

7 derniers jours

30 derniers jours

100.0%

n=4

Temps de réponse médian

1,654ms

n=4

Basé sur 384 mesures au cours des 30 derniers jours.

Détails techniques

Seuls les vrais appels API et les requêtes de test en direct sont comptés — les sondes internes et les benchmarks sont exclus.

Les appels avec une clé API personnalisée (BYOK) sont exclus : ces échecs sont spécifiques à la clé, pas un signe de défaillance du modèle.

Les appels échoués ne sont PAS inclus dans les scores de qualité — la qualité est mesurée uniquement sur les réponses réussies. Disponibilité et qualité sont des signaux indépendants.

Temps de réponse médian (p50) sur les appels réussis avec une durée enregistrée. Les valeurs extrêmes influencent moins la médiane que la moyenne.

Total des appels (30d)

4

Réponses OK (30d)

4

Total des appels (7d)

0

Réponses OK (7d)

0

Section 09

Verdicts benchmark Tokonomix

⚖️
Endorsed by 2 judges
Independent LLM judges evaluated this model on our weekly intelligence tests
cohere/command-a100/100 · 1 runs
1 correct0 partial0 wrong100% accuracy
claude-sonnet-4-597/100 · 45 runs
44 correct0 partial1 wrong98% accuracy
2026-08-30

gpt-5.4-mini adds reasoning, PDF input, and advanced schema capabilities

The gpt-5.4-mini model represents a significant expansion of the mini model line with the addition of eight new capabilities. Most notably, reasoning capabilities have been integrated, bringing advanced problem-solving features to the smaller model variant. PDF input support allows direct document processing without preprocessing, while vision capabilities enable multimodal applications. The model now supports JSON mode with both basic and advanced schema validation, alongside parallel tool execution for improved efficiency. Prompt caching has been added to optimize repeated interactions. These additions position gpt-5.4-mini as a more versatile option that bridges the gap between lightweight and full-featured models. Users gain access to document understanding, visual analysis, and structured output generation in a compact package. The reasoning feature is particularly significant, as it historically has been reserved for larger models. For applications requiring multimodal input, structured outputs, or cost-effective reasoning, this release substantially expands what can be accomplished with the mini tier. Users should evaluate whether these new capabilities meet their needs for tasks previously requiring larger models.

Qualité

Latence p50

Exécutions de test

0

Reasoning capability added PDF and vision input support Advanced JSON schema validation Parallel tools and caching enabled
Section 10

Profil complet du modèle

gpt-5.4-mini — illustration 1
GPT-5.4 Mini : quand le niveau mini devient le choix par défaut pertinent

Note — profil prospectif. Cette page décrit un modèle qui est soit en aperçu précoce, annoncé mais non disponible publiquement, soit projeté sur la base de signaux de feuille de route. Les spécifications et capacités peuvent évoluer avant le lancement public. Les données de benchmark en temps réel sur cette page reflètent l'endpoint que notre dispositif de test peut atteindre aujourd'hui.

GPT-5.4 Mini est le niveau compact mais performant de la génération 5.4. Le modèle est familier des niveaux mini précédents — modèle plus petit, inférence plus rapide, coût par jeton inférieur, capacités brutes moindres que le niveau de base supérieur. Ce qui est différent avec la génération 5.4, c'est que mini a franchi un seuil de qualité où il constitue le choix par défaut pertinent pour un éventail beaucoup plus large de charges de travail que ne l'étaient les anciens niveaux mini.

Quand mini cesse d'être un compromis

Les niveaux mini antérieurs de la famille GPT-5 étaient le choix évident pour les charges de travail économiques et rapides, et le choix manifestement inadapté pour tout ce qui nécessitait une capacité réelle. La décision était binaire : utiliser le niveau de base pour un travail sérieux, n'escalader vers mini que lorsque le coût dominait.

La génération 5.4 déplace la frontière. GPT-5.4 Mini gère la majeure partie du travail que les niveaux de base 5.2 et 5.3 effectuaient auparavant, pour une fraction du coût et de manière significativement plus rapide. Pour les équipes dont la combinaison de charges de travail est principalement du chat, principalement de la génération de sorties structurées, principalement des tâches de contenu simples — le type de trafic qui ne sollicite pas la profondeur de raisonnement — le niveau de base 5.4 est souvent le mauvais choix. Mini effectue le même travail pour moins cher.

La question devient : quand la charge de travail bénéficie-t-elle réellement de la capacité supplémentaire du niveau de base ? La réponse est plus étroite que la plupart des équipes ne le supposent. Raisonnement difficile, boucles d'agents avec planification approfondie, sortie structurée par rapport à des schémas extrêmement complexes, cohérence de contexte long sous charge importante — ce sont les charges de travail où le niveau de base l'emporte. La plupart des autres tâches, mini les gère avec compétence.

Sous le capot

GPT-5.4 Mini est un décodeur transformeur, multimodal pour les entrées texte et vision, avec sortie texte uniquement. L'architecture reflète la famille 5.4 plus large à une échelle de paramètres inférieure. OpenAI n'a pas publié de nombres de paramètres exacts.

La capacité vision est présente et globalement comparable au niveau de base 5.4 sur les tâches standard : compréhension de graphiques, extraction de type OCR, analyse de mise en page de documents, description de scènes. Sur les tâches vision les plus difficiles — mises en page adversariales, diagrammes techniques denses, entrées à basse résolution — l'écart avec le niveau de base 5.4 est plus visible.

La tokenisation utilise le vocabulaire BPE standard de GPT-5. Les entrées image sont encodées par tuiles avec un coût en jetons fixe par tuile. La fenêtre de contexte correspond à la ligne 5.4 plus large, bien que la cohérence sur les entrées extrêmement longues diminue plus tôt que sur le niveau de base.

La date limite d'entraînement se situe au début de 2026. Le modèle connaît les standards de langage principaux et les versions de frameworks actuelles jusqu'à cette période.

Où il se situe aujourd'hui

Pour le chat, la génération de contenu, les flux de travail de sortie structurée et les tâches assistées par vision de difficulté routinière, GPT-5.4 Mini est compétitif avec les niveaux de base des générations plus anciennes et significativement moins cher et plus rapide que l'actuel niveau de base 5.4. Le classement d'intelligence suit les performances comparatives entre les niveaux.

Le profil de latence est le véritable argument de vente. Le temps jusqu'au premier jeton de Mini est significativement inférieur à celui du niveau de base 5.4 sur la même invite, ce qui compte pour les charges de travail interactives où les utilisateurs ressentent directement le temps de réponse. Pour les chatbots, l'assistance en ligne et toute autre application à sensation temps réel, mini offre une meilleure expérience même lorsque le niveau de base produirait une sortie marginalement meilleure.

Pour les flux de travail de contenu à l'extrémité routinière du spectre, mini est le choix par défaut pertinent. Pour l'extraction de données sur des formats de documents standard, mini gère le travail avec des économies de coûts significatives par rapport au niveau de base.

Où l'écart avec le niveau de base se manifeste encore

Le raisonnement difficile est l'écart le plus clair. Planification multi-étapes, évaluation attentive de nombreux facteurs, problèmes de satisfaction de contraintes exprimés en langage naturel — le niveau de base 5.4 surpasse mini de manière notable sur ces aspects. Si votre charge de travail atteint régulièrement les limites de ce que mini peut raisonner, escaladez.

La cohérence de contexte long diminue plus tôt. Mini gère bien les invites longues jusqu'à un certain point, puis commence à perdre les contraintes définies tôt. Le niveau de base 5.4 maintient le fil conducteur plus loin. Pour les flux de travail qui intègrent des instructions étendues ou de grands documents de référence dans l'invite système, le niveau de base est plus fiable.

La sortie structurée par rapport à des schémas extrêmement complexes est plus sujette aux erreurs sur mini. Les sorties JSON simples fonctionnent bien. Les schémas profondément imbriqués avec de nombreuses unions discriminées produisent occasionnellement une sortie presque valide nécessitant un nettoyage.

L'hallucination sur des sujets de niche est quelque peu plus courante que sur le niveau de base. La réduction du taux d'hallucination que la version 5.4 apporte par rapport aux générations précédentes s'applique aux deux niveaux, mais le modèle plus petit a moins de capacité à supprimer les réponses erronées confiantes sur des faits marginaux.

Les performances en langues non anglaises sur les langues à ressources limitées diminuent plus visiblement sur mini que sur le niveau de base. Les principales langues européennes et est-asiatiques sont solides. Les communautés linguistiques plus petites voient une baisse de qualité plus prononcée.

Quand mini est le choix par défaut pertinent

Le modèle de niveau par défaut pour le nouveau développement sur la ligne 5.4 est : commencer avec mini, escalader vers le niveau de base ou Pro uniquement lorsque la charge de travail démontre qu'elle a besoin de la capacité supplémentaire. Cela inverse l'ancien modèle de « commencer avec le niveau de base, descendre à mini uniquement pour économiser de l'argent ».

Utilisez mini pour le chat, les flux de travail de service client, la rédaction de contenu, la sortie structurée sur des schémas routiniers, l'analyse assistée par vision de documents standard, et toute charge de travail où l'utilisateur attend la réponse en temps réel.

Utilisez-le pour le trafic à volume élevé où les économies de coûts se cumulent. Une charge de travail exécutant des milliers de complétions par jour verra des factures significativement différentes entre mini et le niveau de base, et si la qualité est suffisante sur mini, les économies sont un pur gain.

Quand escalader vers le niveau de base ou Pro

Escaladez vers le niveau de base lorsque la charge de travail implique régulièrement un raisonnement multi-étapes que mini fait mal, lorsque la cohérence de contexte long importe et que mini perd des contraintes, ou lorsque la sortie structurée par rapport à des schémas complexes produit trop de nettoyage en aval.

Escaladez davantage vers Pro lorsque même le niveau de base 5.4 n'est pas suffisant — boucles d'agents avec planification approfondie, analyses difficiles, travail de raisonnement au sommet de la pile. Pro est excessif pour la plupart des charges de travail mais le bon choix lorsque le travail l'exige.

Un routeur qui exécute mini d'abord et escalade en fonction de contrôles de qualité ou d'heuristiques de type de charge de travail maintient le profil de coût raisonnable tout en réservant les niveaux plus lourds pour les cas qui en ont besoin.

Alternatives

Pour l'autocomplétion interactive avec une latence encore plus faible, le niveau nano de la ligne 5.4 échange plus de capacité contre plus de vitesse. Les variantes nano sont le bon choix pour les chemins de complétion par frappe de touche.

Pour l'optimisation des coûts au-delà de ce que mini fournit, des modèles à poids ouverts plus petits fonctionnant sur votre propre infrastructure peuvent égaler la qualité de mini sur des tâches étroites à un coût marginal quasi nul. La charge opérationnelle est le compromis.

Pour les charges de travail où la reproductibilité importe, épinglez l'instantané daté gpt-5.4-mini-2026-03-17 plutôt que de lire le slug flottant.

Dernière revue technique : 2026-05-22 — Tokonomix.ai

gpt-5.4-mini — illustration 2gpt-5.4-mini — illustration 3
Dernier test automatisé
5 sept. 2026 · 08:02 UTC · Benchmark de vitesse
Latence P50
464 ms
Latence P95
464 ms
Erreurs
0 / 6 exécutions
Dernière revue par Équipe Tokonomix·26 mai 2026