Aller au contenu
Tier C — Spécialiste
Fonctionne en :USCréé en :United States

Archivé

Ce modèle a été retiré par le fournisseur. Les données historiques sont conservées.

Plus disponible depuis le 31 mai 2026.

OpenAI

gpt-realtime-1.5

Tier C — Spécialiste

Équipe éditoriale Tokonomix·Relu par Mes Kalkan··

GPT-Realtime-1.5 est un modèle de langage développé par OpenAI, conçu spécifiquement pour les applications conversationnelles en temps réel et les interactions à faible latence. Ce modèle représente une évolution dans l'approche d'OpenAI en matière de communication synchrone, optimisée pour les scénarios où la génération immédiate de réponses est essentielle, tels que les assistants vocaux, les systèmes de chat en direct et les applications interactives exigeant un délai minimal entre l'entrée utilisateur et la sortie du modèle. Le modèle conserve des capacités standard de génération de texte tout en privilégiant la vitesse de réponse et la fluidité conversationnelle. Les spécifications techniques indiquent qu'il traite les requêtes avec une latence réduite par rapport aux architectures requête-réponse traditionnelles, bien que la taille exacte de la fenêtre contextuelle ne soit pas divulguée par OpenAI. GPT-Realtime-1.5 utilise des sorties en streaming et des schémas optimisés de génération de tokens qui permettent des échanges plus naturels, ce qui le rend particulièrement adapté aux applications où l'expérience utilisateur dépend du rythme et du tempo conversationnel. Au sein de la gamme de modèles d'OpenAI, GPT-Realtime-1.5 occupe une niche spécialisée axée sur l'interaction synchrone plutôt que sur la maximisation des capacités brutes ou de la longueur du contexte. Il se distingue des modèles phares comme GPT-4 en privilégiant la vitesse et la performance en temps réel plutôt que la profondeur de raisonnement maximale ou les fonctionnalités multimodales. Ce positionnement le rend complémentaire — et non concurrent — des offres plus généralistes d'OpenAI, au service des développeurs qui priorisent la réactivité des interfaces conversationnelles par rapport à d'autres capacités avancées.

GPT-Realtime-1.5 perfectionne les capacités temps réel d OpenAI avec des améliorations de réactivité conversationnelle.

Synthèse benchmark Tokonomix
Section 01

Historique des tarifs

Tarifs directs du fournisseur par million de tokens, plus une estimation du coût d'une conversation typique.

💰
Tarifs API — gpt-realtime-1.5
$4.00 par 1M de tokens d'entrée
$16.00 par 1M de tokens de sortie
≈ $0.0056 par conversation typique (800 tokens)
Prix entrée vs sortie (par 1M de tokens)
par 1M de tokens d'entrée$4.00
par 1M de tokens de sortie$16.00

Pricing over time

Input & output per 1M tokens · step-line = price changes

$4.00

input / 1M

— no change

$16.00

output / 1M

— no change

2026-05-242026-05-242026-05-24
Input
Output
Price change
⟳ synced weekly
Section 02

Forces & faiblesses

Basé sur les résultats de benchmarks et les retours communautaires agrégés sur des cas d'usage réels.

Forces

Latence améliorée vs Realtime 1.0Conversations synchrones plus naturellesTraitement audio temps réelFlux conversationnel optimiséAssistants interactifs avancés

Faiblesses

Fenêtre de contexte non documentéeRaisonnement complexe limité par latenceCoût potentiellement supérieurNon optimisé pour tâches analytiques longues
Section 03

Questions fréquentes

Oui, la version 1.5 apporte des améliorations en latence, qualité des réponses et gestion du contexte conversationnel par rapport à la première version.

La deuxième génération de l architecture realtime pour des expériences conversationnelles encore plus fluides.

Synthèse benchmark Tokonomix
Section 04

Disponibilité

Disponibilité

Pas encore de données

Nous n'avons pas encore enregistré suffisamment d'appels API pour afficher les statistiques de disponibilité de ce modèle. Les données apparaîtront dès que le modèle reçoit du trafic en direct.

Section 05

Verdicts benchmark Tokonomix

2026-05-24

Référence établie : forte performance en codage, faible en écriture créative

Ce premier benchmark établit les performances de référence de gpt-realtime-1.5 sur les principales dimensions d'évaluation. Le modèle démontre une force exceptionnelle dans les tâches de codage, atteignant un taux de réussite de 93,8 % qui surpasse nettement la moyenne des modèles à 71,2 %. Le raisonnement mathématique est également solide à 81,7 %, sensiblement au-dessus de la moyenne de 72,0 %. En revanche, les capacités d'écriture créative accusent un retard considérable, n'obtenant que 68,3 % contre une moyenne de 78,8 %, ce qui indique des limites dans la génération de contenus narratifs engageants. Le suivi d'instructions s'établit à un niveau respectable de 82,5 %, légèrement au-dessus de la référence de 80,0 %. Le modèle affiche une exactitude factuelle équilibrée à 77,5 %, correspondant exactement à la performance moyenne. La performance globale de 80,8 % le situe modérément au-dessus de la moyenne de 75,9 % sur l'ensemble des tâches. Les utilisateurs peuvent s'attendre à des performances fiables pour les charges de travail techniques et analytiques, en particulier la programmation et les mathématiques, mais pourraient trouver le modèle moins adapté à la génération de contenus créatifs. S'agissant de la première fenêtre de benchmark, ces métriques constituent la base de référence à partir de laquelle les futures itérations seront évaluées.

Qualité

Latence p50

Exécutions de test

0

Excellence en codage à 93,8 % Forte capacité de raisonnement mathématique L'écriture créative est inférieure à la moyenne Exactitude factuelle au niveau de référence seulement
Section 06

Profil complet du modèle

gpt-realtime-1.5 — illustration 1
gpt-realtime-1.5 : la mise à jour itérative qui a consolidé le modèle vocal phare d'OpenAI

gpt-realtime-1.5 est l'incrément de version qui a transformé le pointeur flottant gpt-realtime, déjà solide au lancement, en un modèle de production réellement mature. La forme architecturale n'a pas changé. Ce qui a changé, c'est l'ensemble des petits détails comportementaux qui déterminent si un produit vocal paraît stable entre les mains réelles des clients plutôt qu'impressionnant en démo.

Ce que 1.5 fait réellement bouger

La gestion des tours de parole s'est améliorée. La version initiale de gpt-realtime avait tendance à entamer une réponse quelques centaines de millisecondes avant que l'utilisateur n'ait totalement fini, en particulier dans des environnements bruyants où le son ambiant déclenchait une détection erronée de fin de parole. La version 1.5 resserre ce comportement. Le modèle attend un battement supplémentaire lorsqu'il détecte une énergie de parole continue ou des mots de remplissage, ce qui élimine la plainte la plus fréquente des opérateurs de voicebots en production.

La gestion des interruptions est devenue nettement plus fluide. Lorsqu'un utilisateur commence à parler en cours de réponse, le modèle s'arrête désormais proprement, traite ce que l'utilisateur a dit, puis reprend le contexte naturellement. L'ancien comportement faisait parfois en sorte que le modèle continue à parler pendant un battement après l'interruption de l'utilisateur, ce qui produisait l'équivalent conversationnel d'une diaphonie. Ce cas limite a largement disparu.

La qualité de la synthèse multilingue s'est améliorée sur l'ensemble des langues européennes, avec les gains audibles les plus importants sur le néerlandais, le polonais et le tchèque. Ces langues étaient les plus faibles parmi les langues européennes supportées dans la version initiale, et les poids de la 1.5 réduisent l'écart de manière significative avec le bloc des langues romanes.

La latence des appels d'outils s'est resserrée. Lorsque le modèle invoque une fonction au cours d'une conversation et attend le résultat avant de reprendre la parole, la fenêtre de silence entre l'appel d'outil et la reprise audio est désormais plus courte et plus régulière. Cela compte pour des produits comme les bots de réservation et les agents de recherche de commande, où les appels d'outils sont fréquents et où l'utilisateur remarque toute pause qui dépasse le rythme naturel d'une conversation.

Architecture et héritage

La forme architecturale est le même transformeur audio-texte unifié que celui introduit par gpt-realtime. Connexion persistante basée sur WebSocket, flux audio entrant et sortant en streaming, appels de fonctions et sorties structurées disponibles dans le flux, détection d'activité vocale pour la gestion des tours. La fenêtre de contexte est suffisamment grande pour des conversations multi-tours d'une longueur significative, même si les chiffres exacts restent non documentés.

Le clonage de voix ne fait toujours pas partie de la trousse. La sélection de voix correspond à l'ensemble organisé par OpenAI, ce qui demeure la bonne contrainte pour les applications en contact client. Les voix disponibles ont été ajustées pour un naturel légèrement supérieur en 1.5, en particulier sur les échantillons vocaux plus longs utilisés par les applications de type livre audio ou narration prolongée.

Le profil de latence reste globalement inchangé. Le budget d'optimisation a été investi dans la qualité à compute constant plutôt que dans une nouvelle réduction de latence, ce qui suggère qu'OpenAI juge le plancher actuel de latence comme acceptable pour la plupart des produits vocaux.

Positionnement aujourd'hui

Les mêmes charges cibles que gpt-realtime : agents vocaux de service client, triage et accueil en télémédecine, surcouches de traduction en direct, assistants embarqués automobiles, outillage d'accessibilité. Le rafraîchissement 1.5 rend chacun de ces cas légèrement plus fiable en production. Concrètement, les améliorations de gestion des tours et le meilleur traitement des interruptions se traduisent directement par moins de tickets de support de clients se plaignant que le bot n'écoute pas correctement.

Pour les charges à haut volume et sensibles aux coûts, gpt-realtime-mini et ses variantes restent le palier économique. Le compromis par rapport au modèle 1.5 complet porte sur la profondeur de raisonnement, la complexité d'usage des outils et la cohérence des conversations longues. Pour la plupart des charges, la version mini suffit. Pour les produits vocaux premium où le bot doit gérer un dialogue multi-tours réellement complexe avec usage d'outils, la 1.5 complète mérite son coût.

La choisir ou figer un snapshot daté

Pour les nouveaux déploiements de production, gpt-realtime-1.5 est le bon choix par défaut. Les déploiements existants tournant sur le gpt-realtime initial devraient migrer vers la 1.5 sauf raisons spécifiques de conserver le comportement antérieur. Le risque de migration est faible. Les bibliothèques de prompts et les flux conversationnels se transfèrent proprement parce que la surface d'API sous-jacente est identique.

Pour les flux régulés où la reproductibilité exacte importe, gpt-realtime-2025-08-28 est le snapshot daté à figer si vous n'êtes pas prêt à revalider contre les poids 1.5. Un snapshot daté en 1.5 est l'option équivalente pour le comportement plus récent.

Les alternatives multi-fournisseurs à ce niveau de capacité restent rares sur le marché. Les modèles TTS de Google comme gemini-2.5-flash-preview-tts couvrent la synthèse mais pas la boucle conversationnelle unifiée. La résidence des données dans l'UE n'est pas satisfaite par défaut. Le schéma de passerelle régionale reste le contournement pour les déploiements européens régulés, et cette contrainte n'a pas évolué avec la version 1.5.

Dernière revue technique : 2026-05-22 — Tokonomix.ai

gpt-realtime-1.5 — illustration 2
Dernier test automatisé
31 mai 2026 · 04:27 UTC · Benchmark
Latence P50
Latence P95
Erreurs
1 / 6 exécutions
Dernière revue par Équipe Tokonomix·26 mai 2026