Aller au contenu
Tier A — Frontier
Fonctionne en :USCréé en :United States
OpenAI

gpt-5.4

Tier A — Frontier

Équipe éditoriale Tokonomix·Relu par Mes Kalkan··

GPT-5.4 est un grand modèle de langage développé par OpenAI pour des tâches générales de génération de texte. Il est conçu pour traiter et générer du texte semblable à celui produit par un humain dans un large éventail d'applications, notamment la création de contenu, la réponse à des questions, la génération de code, l'analyse et les interactions conversationnelles. Le modèle fonctionne avec des capacités standard de génération de texte, acceptant des entrées textuelles et produisant des réponses cohérentes à partir de schémas appris durant l'entraînement. Dans la série GPT d'OpenAI, ce modèle s'inscrit dans la continuité de l'architecture établie par les générations précédentes, en s'appuyant sur des réseaux de neurones de type transformeur pour traiter des données séquentielles. La taille de la fenêtre de contexte de GPT-5.4 n'a pas été divulguée publiquement, bien qu'il soit prévu pour gérer des conversations multi-tours et des documents de longueur modérée. Le modèle traite le texte via la tokenisation et génère des sorties à l'aide de méthodes d'échantillonnage probabiliste courantes aux modèles de langage autorégressifs. GPT-5.4 s'inscrit dans la gamme plus large de modèles de langage d'OpenAI comme une offre standard pour les charges de travail de génération de texte. Il est positionné pour répondre aux besoins des utilisateurs recherchant des capacités fiables de traitement du langage naturel, sans fonctionnalités spécialisées telles que l'entrée multimodale, l'appel de fonctions ou la gestion de contextes étendus. Le modèle est accessible via l'infrastructure API d'OpenAI, permettant son intégration dans diverses applications et services. Comme les autres modèles de la famille GPT, il a été entraîné sur des données textuelles variées issues d'Internet, bien que les détails précis de l'entraînement et la composition des jeux de données n'aient pas été entièrement communiqués par le fournisseur.

GPT-5.4 s'inscrit dans la continuité de la lignée GPT d'OpenAI comme une option polyvalente de génération de texte, sans fioritures mais solidement positionnée en tier A.

Synthèse éditoriale Tokonomix
Section 01

Analyse de vitesse

Latence mesurée sur toutes les exécutions de benchmark. P50 (médiane) et P95 (95e percentile) donnent une image réaliste de la vitesse de réponse en charge normale et de pointe.

Latence P50 (médiane)Latence P95105 runs
449781715185225532992108-1009-05ms
Section 02

Scores de qualité

Comment ce modèle se situe par rapport au reste du champ sur chaque catégorie de prompts, à partir d'un ajustement par paires sur les mêmes prompts. La note brute du juge figure sous chaque nombre.

65%
Génération de code
moyenne du juge 99
89%
Créatif
moyenne du juge 97
57%
Factuel
moyenne du juge 86
66%
Multilingue
moyenne du juge 99
74%
Raisonnement
moyenne du juge 99

Taux de victoire par catégorie : la fréquence à laquelle ce modèle bat un modèle moyen sur un prompt de cette catégorie. 50% est la moyenne, pas un échec. Ce n'est pas un pourcentage de bonnes réponses.

Section 03

Historique des tarifs

Tarifs directs du fournisseur par million de tokens, plus une estimation du coût d'une conversation typique.

💰
Tarifs API — gpt-5.4
$2.50 par 1M de tokens d'entrée
$15.00 par 1M de tokens de sortie
≈ $0.0045 par conversation typique (800 tokens)
Prix entrée vs sortie (par 1M de tokens)
par 1M de tokens d'entrée$2.50
par 1M de tokens de sortie$15.00

Pricing over time

Input & output per 1M tokens · step-line = price changes

$2.50

input / 1M

— stable

$15.00

output / 1M

— stable

2026-05-242026-07-262026-08-30
Input
Output
Price change
⟳ synced weekly
Section 04

Tokens par seconde

Débit en tokens par seconde, dérivé de la latence P50 mesurée. Plus haut est mieux ; les fluctuations reflètent la charge côté fournisseur.

Débit (tokens / s)341 / avg 283
441144

Estimé à partir de la latence P50 × 200 tokens de sortie — le chiffre absolu dépend de cette hypothèse ; c'est la tendance qui compte.

Section 05

Forces & faiblesses

Basé sur les résultats de benchmarks et les retours communautaires agrégés sur des cas d'usage réels.

Forces

Génération de texte fluideSolide en conversation multi-toursPolyvalence sur tâches variéesBon support du codeClassement tier A confirméIntégration API OpenAI matureCouverture multilingue largeRéponses cohérentes sur documents moyens

Faiblesses

Fenêtre de contexte non divulguéePas de support multimodal annoncéFunction calling non documentéDate limite de connaissances opaque
Section 06

Capacités

toolssource: litellmvisionjson modepdf inputreasoningjson schemaparallel toolsprompt cachingmax output tokens: 128000
Section 07

Questions fréquentes

Oui, son positionnement tier A et son intégration à l'API OpenAI en font un candidat solide pour la génération de contenu, le Q&A ou le code. Il faut toutefois valider en interne si ses limites de contexte non publiées correspondent à votre cas d'usage.

Un choix rassurant pour les équipes qui recherchent la fiabilité du nom OpenAI sur des charges textuelles classiques, à condition d'accepter le flou autour des spécifications techniques précises.

Verdict éditorial Tokonomix
Section 08

Disponibilité

Disponibilité

La fréquence à laquelle ce modèle répond lorsqu'on l'appelle — mesurée sur de vraies requêtes API et des tests en direct au cours des 30 derniers jours. C'est indépendant de la qualité : ces chiffres indiquent seulement si le modèle répond, pas la qualité de sa réponse.

7 derniers jours

30 derniers jours

100.0%

n=36

Temps de réponse médian

7,057ms

n=36

Basé sur 416 mesures au cours des 30 derniers jours.

Détails techniques

Seuls les vrais appels API et les requêtes de test en direct sont comptés — les sondes internes et les benchmarks sont exclus.

Les appels avec une clé API personnalisée (BYOK) sont exclus : ces échecs sont spécifiques à la clé, pas un signe de défaillance du modèle.

Les appels échoués ne sont PAS inclus dans les scores de qualité — la qualité est mesurée uniquement sur les réponses réussies. Disponibilité et qualité sont des signaux indépendants.

Temps de réponse médian (p50) sur les appels réussis avec une durée enregistrée. Les valeurs extrêmes influencent moins la médiane que la moyenne.

Total des appels (30d)

36

Réponses OK (30d)

36

Total des appels (7d)

0

Réponses OK (7d)

0

Section 09

Verdicts benchmark Tokonomix

⚖️
Endorsed by 2 judges
Independent LLM judges evaluated this model on our weekly intelligence tests
cohere/command-a100/100 · 1 runs
1 correct0 partial0 wrong100% accuracy
claude-sonnet-4-596/100 · 45 runs
44 correct0 partial1 wrong98% accuracy
2026-08-30

Major quality leap with 12.8-point gain; 29% faster response times

GPT-5.4 demonstrates substantial improvements across nearly all measured dimensions in this benchmark window. The overall quality score jumped from 82.5 to 95.3, representing a 12.8-point increase that places this model among the top performers we've evaluated. Response latency improved significantly, with p50 times dropping from 2219ms to 1585ms, a 29% reduction that should be noticeable in production use. Coding performance reached a perfect 100 score, up 8 points from the previous window, while factual accuracy showed dramatic improvement, rising from 56 to 94. Creative writing capabilities scored 91, and reasoning tasks achieved 96, both strong results. The previous window's perfect multilingual score of 100 was not retested in this cycle, so we cannot confirm whether that capability remains at the same level. The addition of creative writing and reasoning categories to the test suite this window provides new insight into the model's capabilities. With only 5 test runs in each window, these results should be considered preliminary, but the consistency of improvements across categories suggests genuine advancement rather than statistical noise.

Qualité

95.3

Latence p50

1,585 ms

Exécutions de test

5

Quality improved 12.8 points 29% faster response times Coding reached perfect score Factual accuracy up 38 points
Section 10

Profil complet du modèle

gpt-5.4 — illustration 1
GPT-5.4 : la génération de consolidation

Note — profil prospectif. Cette page décrit un modèle qui est soit en version préliminaire, annoncé mais pas généralement disponible, soit projeté sur la base de signaux de feuille de route. Les spécifications et capacités peuvent évoluer avant le lancement public. Les données de benchmark en direct sur cette page reflètent quel que soit le point de terminaison que notre infrastructure de test peut atteindre aujourd'hui.

GPT-5.4 est la version de consolidation à mi-cycle d'OpenAI dans la famille plus large 5.x. Ce n'est pas un changement architectural fondamental, ce n'est pas un bond spectaculaire de capacités — ce que c'est, c'est un raffinement minutieux des éléments qui ont causé des problèmes aux équipes en production depuis les générations antérieures. Meilleur suivi des instructions dans les cas limites. Comportement de sortie structurée plus strict. Réduction des hallucinations sur les types de sujets de niche qui finissent constamment dans les tickets de support. Le genre de version que les ingénieurs apprécient davantage que les responsables marketing.

Ce que 5.4 change réellement

Les améliorations phares sont discrètes. Le taux d'hallucination sur les faits hors distribution est en baisse par rapport à 5.2 et 5.3. La réduction n'est pas nulle, et le modèle fabriquera toujours avec assurance des affirmations plausibles sur des sujets obscurs. Mais le taux auquel cela se produit sur les requêtes de routine a diminué de manière significative, ce qui se traduit en production par moins de cas de support nécessitant des corrections.

La sortie structurée est plus fiable. La sortie en mode JSON contre des schémas profondément imbriqués produit une sortie valide de manière plus cohérente que les générations précédentes. L'appel de fonction avec des appels d'outils parallèles se comporte de manière plus prévisible. Les types de cas limites qui nécessitaient auparavant une analyse défensive — JSON presque valide, adhésion légèrement décalée au schéma — sont moins fréquents.

La cohérence de contexte long est progressivement meilleure. Le modèle conserve les contraintes définies tôt dans les longues invites de manière plus fiable que la génération précédente. Pour les flux de travail qui intègrent des instructions étendues dans l'invite système, moins d'instructions sont perdues lors de longues exécutions.

Aucune de ces améliorations n'est individuellement spectaculaire. Ensemble, elles font de 5.4 le choix par défaut approprié pour les équipes qui attendaient « la version qui fait ce que nous avons demandé à la précédente de faire ».

Sous le capot

GPT-5.4 est un décodeur transformateur acceptant des entrées texte et image entrelacées, avec une sortie texte uniquement. Les capacités de vision couvrent la surface habituelle : compréhension de graphiques et diagrammes, extraction de texte de type OCR, analyse de mise en page de document, description de scène. La sortie reste texte uniquement — pas de génération d'image, pas d'audio depuis ce point de terminaison.

OpenAI n'a pas publié le nombre de paramètres, les détails de routage d'experts, ou les changements architecturaux précis par rapport à 5.2 et 5.3. Le modèle accepte des fenêtres de contexte plus longues que les générations précédentes de la famille, bien que le plafond de cohérence pratique se situe en dessous de la limite nominale de tokens sur les tâches de raisonnement difficiles.

La tokenisation utilise le vocabulaire BPE standard de GPT-5. Les entrées d'image sont encodées par tuiles à un coût fixe en tokens par tuile. La coupure d'entraînement se situe au début de 2026 pour cette génération, ce qui déplace de plusieurs mois la frontière de ce que le modèle sait des événements récents et des versions actuelles de bibliothèques par rapport aux générations précédentes.

Où il se positionne aujourd'hui

Pour le travail généraliste — chat, sortie structurée, analyse assistée par vision, boucles d'agent — GPT-5.4 se situe au niveau supérieur des modèles actuellement déployables. Le classement d'intelligence suit la position comparative par rapport au niveau le plus élevé d'Anthropic et à l'équivalent de Google. Les classements évoluent chaque semaine à mesure que de nouvelles versions arrivent, mais 5.4 est compétitif dans la plupart des catégories plutôt que dominant dans une seule.

Le modèle est le choix par défaut approprié pour le nouveau développement sur la pile OpenAI, sauf si vous avez des raisons spécifiques de figer un instantané plus ancien, d'exécuter un niveau plus petit pour le coût, ou d'escalader vers le niveau Pro pour un raisonnement difficile.

Pour les flux de travail de contenu, l'amélioration de la cohérence de contexte long est payante sur les flux de travail avec des guides de style étendus. Pour l'extraction de données, le comportement de sortie structurée plus strict réduit le travail de nettoyage en aval.

Où se situent encore les limites

L'hallucination est réduite mais non éliminée. Le modèle est bien calibré sur les connaissances communes et fiablement confiant sur les matériaux techniques largement documentés. Sur les événements historiques obscurs, les publications de niche récentes et les petites organisations, il fabriquera toujours des informations. Traitez toute affirmation factuelle spécifique comme une hypothèse jusqu'à vérification.

Les langues à faibles ressources restent plus faibles que les principales langues européennes et est-asiatiques. L'écart s'est réduit au fil des générations mais ne s'est pas refermé. Effectuez des vérifications d'échantillons dans toute langue cible avant le déploiement.

La cohérence de contexte long est bonne mais pas infinie. Au-delà d'environ 100 000 tokens d'entrée dense, les contraintes définies très tôt dans l'invite commencent à dériver. Structurez les longues invites pour répéter les contraintes critiques près du point de génération.

Le niveau Pro gagne toujours sur les tâches de raisonnement les plus difficiles. La base 5.4 est un excellent choix par défaut pour la plupart des travaux, mais ce n'est pas le modèle que vous choisissez lorsque la charge de travail nécessite une planification approfondie en plusieurs étapes dans une véritable incertitude.

Quand 5.4 est le bon choix par défaut

Choisissez la base 5.4 pour le chat général, la génération de contenu, la sortie structurée, l'analyse assistée par vision et les boucles d'agent de complexité modérée. C'est le choix de point de terminaison unique le plus simple pour les équipes dont la charge de travail IA est principalement large plutôt que principalement difficile.

Choisissez-le pour la migration depuis les générations 5.x antérieures où les limitations de ces générations ont causé des frictions. Les améliorations sont réelles et s'accumulent sur le trafic à volume élevé.

Pour les flux de travail de contenu à l'extrémité longue du spectre, 5.4 est le bon choix par défaut. Pour les flux de travail de documents mixtes texte et vision, la capacité de vision plus la fiabilité de sortie structurée en font un ajustement naturel.

Quand choisir autre chose

Pour l'autocomplétion interactive et le trafic par lots optimisé en termes de coûts, les niveaux mini et nano de la famille 5.4 gèrent la charge de travail à moindre coût et latence.

Pour les charges de travail de raisonnement difficiles — boucles d'agent avec planification approfondie, sortie structurée contre des schémas hautement complexes, analyses nécessitant une évaluation minutieuse de nombreux facteurs — escaladez vers le niveau Pro.

Pour les charges de travail spécifiques au code, les variantes Codex de la famille plus large 5.x sont mieux ajustées. La base 5.4 produit du code fonctionnel mais n'égale pas un spécialiste du code sur la qualité idiomatique.

Pour les charges de travail sensibles à la reproductibilité, fixez l'instantané daté gpt-5.4-2026-03-05 plutôt que de lire le slug flottant gpt-5.4.

Alternatives

Pour les charges de travail où le raisonnement de niveau supérieur compte plus que l'adéquation à l'écosystème OpenAI, le niveau de raisonnement le plus fort d'Anthropic et les offres équivalentes de Google méritent une comparaison directe sur votre charge de travail spécifique.

Pour les déploiements isolés ou avec résidence stricte, les modèles frontières à poids ouverts vous donnent l'histoire de résidence qu'aucun point de terminaison OpenAI ne fournit. L'écart de précision s'est considérablement réduit et est gérable pour la plupart des charges de travail.

Pour le trafic routinier optimisé en termes de coûts, l'exécution d'un routeur sur la base 5.4 et les frères de niveau inférieur maintient la facture gérable tout en préservant l'accès à la capacité complète lorsque cela compte.

Dernière revue technique : 2026-05-22 — Tokonomix.ai

gpt-5.4 — illustration 2
Dernier test automatisé
5 sept. 2026 · 08:02 UTC · Benchmark de vitesse
Latence P50
587 ms
Latence P95
593 ms
Erreurs
0 / 6 exécutions
Dernière revue par Équipe Tokonomix·26 mai 2026