Aller au contenu
Tier C — Spécialiste
Fonctionne en :USCréé en :United States

Archivé

Ce modèle a été retiré par le fournisseur. Les données historiques sont conservées.

Plus disponible depuis le 23 octobre 2026.

OpenAI

o1-2024-12-17

Tier C — Spécialiste

Équipe éditoriale Tokonomix·Relu par Mes Kalkan··

o1-2024-12-17 est un grand modèle de langage développé par OpenAI, sorti en décembre 2024 dans le cadre de la série o1. Ce modèle est conçu pour effectuer un raisonnement prolongé avant de générer ses réponses, en s'appuyant sur des techniques d'apprentissage par renforcement qui lui permettent de consacrer davantage d'effort computationnel aux tâches complexes de résolution de problèmes. Il convient particulièrement aux applications nécessitant un raisonnement en plusieurs étapes, telles que les mathématiques avancées, la programmation, l'analyse scientifique et la déduction logique. Le modèle produit en interne des chaînes de pensée structurées, bien que ces traces de raisonnement ne soient pas exposées aux utilisateurs dans l'interface standard. La sortie de o1-2024-12-17 marque une évolution au sein de la famille o1 d'OpenAI, après des versions antérieures comme o1-preview et o1-mini. Il offre des capacités de raisonnement et une précision améliorées par rapport à ses prédécesseurs, tout en conservant les fonctionnalités standard de génération de texte. Le modèle ne prend pas actuellement en charge les entrées multimodales étendues telles que le traitement d'images ou l'appel de fonctions, se concentrant plutôt sur les tâches de raisonnement et de génération basées sur le texte. La taille de sa fenêtre contextuelle n'a pas été divulguée publiquement au moment de sa sortie. Au sein de la gamme de modèles d'OpenAI, o1-2024-12-17 occupe une position spécialisée en tant que modèle axé sur le raisonnement, distinct de la série GPT-4 à usage général. Il est conçu pour des cas d'usage où la profondeur d'analyse et l'exactitude priment sur la rapidité ou la fluidité conversationnelle. Les utilisateurs y recourent généralement pour aborder des problèmes qui bénéficient d'une réflexion délibérée et structurée plutôt que d'une génération de réponse rapide.

o1-2024-12-17 est la version production de la série o1 d OpenAI, avec un raisonnement étendu pour les tâches analytiques complexes.

Synthèse benchmark Tokonomix
Section 01

Analyse de vitesse

Latence mesurée sur toutes les exécutions de benchmark. P50 (médiane) et P95 (95e percentile) donnent une image réaliste de la vitesse de réponse en charge normale et de pointe.

Latence P50 (médiane)Latence P9556 runs
405227941546028790208-2209-04ms
Section 02

Scores de qualité

Comment ce modèle se situe par rapport au reste du champ sur chaque catégorie de prompts, à partir d'un ajustement par paires sur les mêmes prompts. La note brute du juge figure sous chaque nombre.

71%
Génération de code
moyenne du juge 99
1%
Créatif
moyenne du juge 34
60%
Factuel
moyenne du juge 88
66%
Multilingue
moyenne du juge 99
60%
Raisonnement
moyenne du juge 66

Taux de victoire par catégorie : la fréquence à laquelle ce modèle bat un modèle moyen sur un prompt de cette catégorie. 50% est la moyenne, pas un échec. Ce n'est pas un pourcentage de bonnes réponses.

Section 03

Historique des tarifs

Tarifs directs du fournisseur par million de tokens, plus une estimation du coût d'une conversation typique.

💰
Tarifs API — o1-2024-12-17
$15.00 par 1M de tokens d'entrée
$60.00 par 1M de tokens de sortie
≈ $0.0210 par conversation typique (800 tokens)
Prix entrée vs sortie (par 1M de tokens)
par 1M de tokens d'entrée$15.00
par 1M de tokens de sortie$60.00

Pricing over time

Input & output per 1M tokens · step-line = price changes

$15.00

input / 1M

— stable

$60.00

output / 1M

— stable

2026-05-242026-07-262026-08-30
Input
Output
Price change
⟳ synced weekly
Section 04

Tokens par seconde

Débit en tokens par seconde, dérivé de la latence P50 mesurée. Plus haut est mieux ; les fluctuations reflètent la charge côté fournisseur.

Débit (tokens / s)258 / avg 273
488103

Estimé à partir de la latence P50 × 200 tokens de sortie — le chiffre absolu dépend de cette hypothèse ; c'est la tendance qui compte.

Section 05

Forces & faiblesses

Basé sur les résultats de benchmarks et les retours communautaires agrégés sur des cas d'usage réels.

Forces

Raisonnement analytique profondRésolution de problèmes multi-étapesPerformance en coding avancéAnalyse scientifique rigoureuseSnapshot décembre 2024 stable

Faiblesses

Temps de traitement plus longNon optimisé pour dialogues rapidesFenêtre de contexte non documentéeMoins adapté à la rédaction créative
Section 06

Capacités

toolssource: litellmvisionjson modepdf inputreasoningjson schemaparallel toolsprompt cachingmax output tokens: 100000
Section 07

Questions fréquentes

o1 utilise un processus de raisonnement étendu par chaîne de pensée qui lui permet de résoudre des problèmes complexes que GPT-4o gère moins bien.

Le modèle de raisonnement de référence d OpenAI en production pour les problèmes nécessitant une rigueur analytique.

Synthèse benchmark Tokonomix
Section 08

Disponibilité

Disponibilité

Pas encore de données

Nous n'avons pas encore enregistré suffisamment d'appels API pour afficher les statistiques de disponibilité de ce modèle. Les données apparaîtront dès que le modèle reçoit du trafic en direct.

Section 09

Verdicts benchmark Tokonomix

⚖️
Endorsed by 2 judges
Independent LLM judges evaluated this model on our weekly intelligence tests
cohere/command-a100/100 · 1 runs
1 correct0 partial0 wrong100% accuracy
claude-sonnet-4-585/100 · 42 runs
34 correct1 partial7 wrong81% accuracy
2026-08-30

o1-2024-12-17 adds multimodal capabilities while maintaining core strengths

The o1-2024-12-17 model continues to demonstrate exceptional performance in reasoning-intensive tasks while adding significant new capabilities. This release introduces multimodal support including vision and PDF input, along with tool use functionality through both standard and parallel tool calling modes. The model maintains its strong performance in mathematics and coding benchmarks, though specific comparative data against the previous window is not available in the current results. New features include JSON mode with schema support and prompt caching, expanding the model's utility for structured output tasks and improving efficiency for repeated prompts. The addition of these capabilities represents a substantial expansion of the model's versatility without apparent degradation to its core reasoning strengths. Users should note that while the model gains flexibility through tool use and multimodal inputs, the fundamental architecture continues to prioritize deliberative reasoning over speed. These enhancements position the model as a more comprehensive solution for complex tasks requiring both advanced reasoning and practical integration capabilities.

Qualité

Latence p50

Exécutions de test

0

Multimodal vision and PDF support Tool use and parallel calling JSON schema and caching added Core reasoning performance maintained
Section 10

Profil complet du modèle

o1-2024-12-17 — illustration 1
o1-2024-12-17 : le snapshot de production de décembre 2024 du premier modèle de raisonnement d'OpenAI

L'alias daté de décembre 2024 d'o1 est le snapshot qui fige le comportement prêt pour la production du premier modèle de raisonnement d'OpenAI. C'est la version à épingler lorsque vous avez bâti des workflows autour du style de raisonnement spécifique d'o1 et que vous avez besoin d'un comportement stable dans le temps, en particulier pour des travaux réglementés ou des pistes d'audit exigeant une reproductibilité exacte.

Ce que représente ce snapshot

Il s'agit d'o1 tel qu'il a été livré pour un usage de production, succédant au checkpoint de recherche antérieur o1-preview. L'enveloppe de capacités correspond à ce que décrit la page flottante o1 : génération centrée sur le raisonnement avec chaîne de pensée interne, fenêtre de contexte de 200 000 tokens, fortes performances en mathématiques et en synthèse de code, profil de latence mesuré en secondes plutôt qu'en millisecondes.

Le snapshot de décembre est celui auquel la plupart des déploiements de production tournant sur o1 sont effectivement épinglés. Le checkpoint preview antérieur présentait des particularités comportementales qui ont été corrigées pour la version de production, et la majorité des équipes ayant bâti contre o1 l'ont fait contre ce snapshot ou un ultérieur. Si votre application est en production et fonctionne correctement, c'est probablement le snapshot sur lequel elle s'exécute.

L'épinglage compte davantage pour les modèles de raisonnement que pour les modèles réflexes. L'étape de raisonnement est sensible à de petites variations dans la manière dont le modèle aborde un problème. Un déplacement subtil de la distribution de la chaîne de pensée peut changer quels problèmes le modèle résout correctement et lesquels il rate, même si la précision moyenne reste stable. Pour les workflows où vous avez validé empiriquement qu'o1 résout votre classe de problèmes spécifique, le snapshot daté constitue le contrat qui protège ce comportement validé.

Quand il convient d'épingler ce snapshot

Workflows réglementés où les pistes d'audit exigent une reproductibilité exacte des sorties du modèle sur de longues périodes. Applications de legal-tech effectuant de l'analyse contractuelle où le chemin de raisonnement exact importe pour la revue en aval. Applications scientifiques où la reproductibilité du raisonnement assisté par modèle est une exigence méthodologique. Applications de services financiers où les régulateurs pourront un jour demander pourquoi une recommandation spécifique a été émise.

Pour les travaux exploratoires, les prototypes et tout workflow où vous souhaitez suivre les améliorations continues qu'OpenAI déploie dans des modèles de raisonnement plus récents, ce snapshot n'est pas le bon point de départ. Les nouveaux travaux devraient utiliser o3 ou o4-mini, qui représentent des améliorations significatives de capacité par rapport à la génération o1.

Le risque de migration de ce snapshot vers un modèle de raisonnement plus récent n'est pas négligeable. Le comportement de raisonnement diffère suffisamment entre o1 et o3 pour que les schémas de prompts calibrés contre o1 ne se transfèrent pas proprement. Prévoyez un travail de revalidation, pas une mise à niveau transparente.

Là où il déçoit

Applications conversationnelles en temps réel. Le profil de latence d'o1 est incompatible avec les interfaces de chat qui exigent des réponses sub-seconde. Utilisez des modèles réflexes pour ces charges et réservez o1 aux tours difficiles.

Tâches simples de résumé et d'extraction. L'étape de raisonnement est gaspillée sur des tâches qui ne la requièrent pas, et vous payez pour ce calcul gaspillé. Les modèles réflexes gèrent ces tâches plus rapidement et à moindre coût.

Écriture créative où le flow compte. o1 produit une prose soignée et correcte. Ce n'est pas le bon outil quand vous recherchez une voix, un rythme ou un panache stylistique. Les modèles de la tier chat produisent souvent de meilleurs résultats créatifs.

Workflows d'agents intensifs en utilisation d'outils avec de nombreuses boucles serrées. La latence de raisonnement se compose au fil des tours. Pour des agents devant appeler des outils rapidement avec du raisonnement entre les appels, le temps d'attente cumulé rend la boucle lourde de manière qui affecte l'UX du produit.

Notes pratiques et alternatives

Pour un raisonnement à effort plus élevé sur la même génération, o1-pro et son snapshot daté o1-pro-2025-03-19 consacrent davantage de calcul de raisonnement par prompt pour les problèmes où la précision maximale justifie le coût supplémentaire. La variante pro est le bon choix pour les problèmes de raisonnement les plus difficiles où vous voulez maximiser la probabilité d'obtenir une réponse correcte du premier coup.

Pour le raisonnement de génération plus récente, o3 et son snapshot daté o3-2025-04-16 représentent la capacité successeure. o4-mini est le modèle de raisonnement intermédiaire économique pour de nombreuses charges qui utilisaient auparavant o1.

Pour les workflows de recherche nécessitant navigation, synthèse et raisonnement à travers des sources externes, o4-mini-deep-research est la variante dédiée au mode recherche. C'est une forme opérationnelle différente d'o1 et elle adresse une charge pour laquelle o1 n'a jamais vraiment été le bon outil.

La résidence des données dans l'UE n'est pas satisfaite par défaut sur ce snapshot ni sur aucun des endpoints de raisonnement OpenAI apparentés. Les passerelles régionales avec accords de traitement des données restent le contournement pratique pour les déploiements européens réglementés. Le calendrier de dépréciation de l'alias daté n'est pas actuellement annoncé, mais les snapshots de modèles de raisonnement ont généralement bénéficié de fenêtres de support plus longues que les snapshots de modèles réflexes, étant donné le coût de revalidation plus élevé d'une migration.

Dernière revue technique : 2026-05-22 — Tokonomix.ai

o1-2024-12-17 — illustration 2
Dernier test automatisé
4 sept. 2026 · 20:06 UTC · Benchmark de vitesse
Latence P50
776 ms
Latence P95
816 ms
Erreurs
0 / 6 exécutions
Dernière revue par Équipe Tokonomix·26 mai 2026