Aller au contenu
Tier A — Frontier
Fonctionne en :USCréé en :United States

Archivé

Ce modèle a été retiré par le fournisseur. Les données historiques sont conservées.

Plus disponible depuis le 20 octobre 2026.

Google Gemini

Gemini 2.5 Pro

Tier A — Frontier · 1.048576M tokens

Équipe éditoriale Tokonomix·Relu par Mes Kalkan··

Gemini 2.5 Pro est un grand modèle de langage développé par Google et publié dans le cadre de la famille de modèles Gemini. Il est conçu pour des tâches de génération de texte à usage général, notamment la réponse aux questions, la création de contenu, la synthèse et la génération de code. Le modèle représente une amélioration itérative par rapport aux versions antérieures de Gemini, intégrant des raffinements architecturaux et des données d'entraînement élargies pour améliorer les performances sur une gamme de références en compréhension et génération du langage naturel. Une caractéristique technique clé de Gemini 2.5 Pro est sa fenêtre de contexte étendue de 1 048 576 tokens, équivalant à environ un million de tokens. Cette longueur de contexte substantielle permet au modèle de traiter et d'analyser des documents extrêmement longs, des bases de code étendues ou des conversations à plusieurs tours tout en maintenant la cohérence et la pertinence tout au long de l'interaction. Le modèle prend en charge les capacités standard de génération de texte, en se concentrant sur la fourniture de résultats fiables et cohérents pour les cas d'usage professionnels et développeurs. Au sein de la gamme Gemini de Google, la variante 2.5 Pro occupe une position entre les modèles Gemini Flash plus compacts, optimisés pour la rapidité et l'efficacité, et les modèles phares Gemini Ultra, qui visent des performances de pointe sur les tâches les plus exigeantes. Gemini 2.5 Pro est positionné comme une option équilibrée, offrant de solides capacités de raisonnement et de génération avec une gestion de contexte significative pour les applications nécessitant le traitement de grands volumes d'informations sans requérir le niveau de performance maximal.

Gemini 2.5 Pro se positionne comme le couteau suisse haut de gamme de Google : une fenêtre de contexte massive et un raisonnement solide, sans le coût d'un modèle ultra.

Synthèse éditoriale Tokonomix
Section 01

Analyse de vitesse

Latence mesurée sur toutes les exécutions de benchmark. P50 (médiane) et P95 (95e percentile) donnent une image réaliste de la vitesse de réponse en charge normale et de pointe.

Latence P50 (médiane)Latence P95100 runs
7943300580783131081908-1309-07ms
Section 02

Scores de qualité

Comment ce modèle se situe par rapport au reste du champ sur chaque catégorie de prompts, à partir d'un ajustement par paires sur les mêmes prompts. La note brute du juge figure sous chaque nombre.

17%
Génération de code
moyenne du juge 35
3%
Créatif
moyenne du juge 41
34%
Factuel
moyenne du juge 59
8%
Multilingue
moyenne du juge 10
3%
Raisonnement
moyenne du juge 0
54%
Santé
moyenne du juge 67

Taux de victoire par catégorie : la fréquence à laquelle ce modèle bat un modèle moyen sur un prompt de cette catégorie. 50% est la moyenne, pas un échec. Ce n'est pas un pourcentage de bonnes réponses.

Section 03

Historique des tarifs

Tarifs directs du fournisseur par million de tokens, plus une estimation du coût d'une conversation typique.

💰
Tarifs API — Gemini 2.5 Pro
$1.25 par 1M de tokens d'entrée
$10.00 par 1M de tokens de sortie
≈ $0.0028 par conversation typique (800 tokens)
Prix entrée vs sortie (par 1M de tokens)
par 1M de tokens d'entrée$1.25
par 1M de tokens de sortie$10.00

Pricing over time

Input & output per 1M tokens · step-line = price changes

$1.25

input / 1M

— stable

$10.00

output / 1M

— stable

2026-06-212026-08-022026-09-06
Input
Output
Price change
⟳ synced weekly
Section 04

Tokens par seconde

Débit en tokens par seconde, dérivé de la latence P50 mesurée. Plus haut est mieux ; les fluctuations reflètent la charge côté fournisseur.

Débit (tokens / s)160 / avg 166
25020

Estimé à partir de la latence P50 × 200 tokens de sortie — le chiffre absolu dépend de cette hypothèse ; c'est la tendance qui compte.

Section 05

Forces & faiblesses

Basé sur les résultats de benchmarks et les retours communautaires agrégés sur des cas d'usage réels.

Forces

Fenêtre de contexte d'un million de tokensRaisonnement multi-étapes robusteGénération de code fiableRésumés longs et cohérentsÉquilibre coût-performance pertinentCouverture multilingue étendueIntégration native à l'écosystème GoogleSorties stables sur tâches professionnelles

Faiblesses

Latence accrue sur très longs contextesDisponibilité régionale parfois limitéeDate de coupure des connaissances figéeFiltrages de contenu parfois trop stricts
Section 06

Capacités

toolssource: litellmvisionjson modepdf inputreasoningaudio inputjson schemaprompt cachingoutputTokenLimit: 65536max output tokens: 65535
Section 07

Questions fréquentes

Oui, le modèle gère effectivement de très longs documents et conserve une bonne cohérence, mais la qualité de récupération peut diminuer sur des détails très spécifiques au-delà de quelques centaines de milliers de tokens. Il est recommandé de structurer les prompts pour les cas critiques.

Pour les équipes qui traitent de longs documents ou de vastes bases de code, Gemini 2.5 Pro reste un choix par défaut difficile à battre dans la catégorie Tier A.

Verdict Tokonomix
Section 08

Disponibilité

Disponibilité

La fréquence à laquelle ce modèle répond lorsqu'on l'appelle — mesurée sur de vraies requêtes API et des tests en direct au cours des 30 derniers jours. C'est indépendant de la qualité : ces chiffres indiquent seulement si le modèle répond, pas la qualité de sa réponse.

7 derniers jours

100.0%

n=9

30 derniers jours

100.0%

n=23

Temps de réponse médian

11,475ms

n=23

Basé sur 408 mesures au cours des 30 derniers jours.

Détails techniques

Seuls les vrais appels API et les requêtes de test en direct sont comptés — les sondes internes et les benchmarks sont exclus.

Les appels avec une clé API personnalisée (BYOK) sont exclus : ces échecs sont spécifiques à la clé, pas un signe de défaillance du modèle.

Les appels échoués ne sont PAS inclus dans les scores de qualité — la qualité est mesurée uniquement sur les réponses réussies. Disponibilité et qualité sont des signaux indépendants.

Temps de réponse médian (p50) sur les appels réussis avec une durée enregistrée. Les valeurs extrêmes influencent moins la médiane que la moyenne.

Total des appels (30d)

23

Réponses OK (30d)

23

Total des appels (7d)

9

Réponses OK (7d)

9

Pilote contrôle qualité image (2026-06-10)

Rappel

60.6%

n=300

Faux positifs

3.6%

n=300

Section 09

Verdicts benchmark Tokonomix

⚖️
Endorsed by 2 judges
Independent LLM judges evaluated this model on our weekly intelligence tests
cohere/command-a100/100 · 1 runs
1 correct0 partial0 wrong100% accuracy
claude-sonnet-4-531/100 · 130 runs
26 correct2 partial102 wrong20% accuracy
🏟️
Activité de l’arène
Arène de modèles quotidienne — jugée en face-à-face
Ce mois-ci
En tant que concurrent
0Parties jouées
0 / 0Gagné / perdu
0Votes ▲
En tant que juge
0Manches comme juge
Angles morts détectés
Depuis le début
En tant que concurrent
3Parties jouées
3 / 0Gagné / perdu
8Votes ▲
En tant que juge
0Manches comme juge
Angles morts détectés

La détection des angles morts s’active dès que les juges signalent des points manqués lors des prochaines manches.

Historique mensuel (1)
MoisParties jouéesGagné / perduVotes ▲Manches comme juge
2026-0633 / 080
2026-09-06

Gemini 2.5 Pro adds eight capabilities; benchmarks remain unavailable

Gemini 2.5 Pro has expanded its feature set significantly with the addition of eight new capabilities: tools, vision, json_mode, pdf_input, reasoning, audio_input, json_schema, and prompt_caching. This represents a substantial evolution in the model's functionality, moving from a text-only interface to a multimodal platform with structured output options and caching support. The additions suggest Google is positioning this model for more complex, production-ready applications that require document processing, visual understanding, and audio analysis. However, no performance benchmarks are available for either the current or previous evaluation windows. Without quantitative metrics on accuracy, reasoning ability, or task performance, users cannot assess how Gemini 2.5 Pro compares to competing models or evaluate whether the expanded capabilities translate to practical advantages. The absence of benchmark data makes it impossible to determine the model's strengths, weaknesses, or appropriate use cases based on objective measures. Organizations considering Gemini 2.5 Pro will need to conduct their own testing to validate performance for their specific requirements.

Qualité

Latence p50

Exécutions de test

0

Eight new capabilities added Multimodal support now available Structured output options enabled No performance benchmarks available
Section 10

Profil complet du modèle

Gemini 2.5 Pro — illustration 1
Gemini 2.5 Pro : le niveau supérieur de production de la ligne Gemini

Gemini 2.5 Pro (gemini-2.5-pro) est le niveau supérieur de production de la famille Gemini grand public de Google. Une fenêtre de contexte de 1 048 576 tokens. Entrée texte-plus-vision. Une profondeur de raisonnement qui rivalise avec la ligne Opus d'Anthropic et les grands variants GPT-5 d'OpenAI.

Si vous avez discuté avec une équipe solutions Google fin 2025 du "bon Gemini pour les travaux de raisonnement difficile en production", c'est ce modèle qu'on vous a indiqué. C'est le cheval de bataille du niveau Pro et il a porté la majeure partie des déploiements Gemini de haute qualité jusqu'en 2026.

Ce qui le distingue

La combinaison est spécifique :

  • Une fenêtre de contexte d'un million de tokens avec une qualité d'attention qui tient en profondeur. Pas seulement un chiffre de fiche technique — la longue fenêtre est genuinement utilisable pour la synthèse sur de très longues entrées.
  • Qualité de raisonnement de niveau supérieur sur les tâches multi-étapes, les sorties structurées et les travaux d'extraction complexes.
  • Traitement multimodal natif avec une forte qualité vision. Documents, graphiques, diagrammes, captures d'écran — gérés avec le soin qu'un niveau Pro devrait apporter.
  • Fiabilité des appels d'outils suffisamment solide pour construire des boucles d'agent en production sans couches de parsing défensif.
  • Latence qui n'est pas la meilleure de sa catégorie mais raisonnable pour un modèle de niveau supérieur avec cette fenêtre de contexte.

L'avantage spécifique qui distingue 2.5 Pro des concurrents est la combinaison de la qualité d'attention long-contexte et du traitement multimodal natif au niveau Pro. Certains concurrents égalent l'un ou l'autre ; peu égalent les deux.

La fenêtre d'un million de tokens, bien utilisée

La fenêtre 1M mérite sa place sur les charges de travail qui en ont besoin. Due diligence multi-documents, analyse de base de code complète, état conversationnel long, synthèse multi-documents — tout cela correspond bien à 2.5 Pro.

La qualité d'attention se maintient bien au-delà de 200 000 tokens d'entrée et reste utilisable dans les centaines de milliers supplémentaires. Au-delà d'environ 600 000 tokens, la latence s'allonge et le coût par appel augmente significativement. Le tableau de vitesse en temps réel est sur /benchmarks/speed.

Deux patterns pratiques comptent à cette taille de contexte :

  • Le prompt caching est le bon schéma pour les requêtes répétées sur un même large corpus. Recharger 800 000 tokens de contexte à chaque appel coûte cher en temps réel même quand l'appel API réussit.
  • Structurer les longues entrées avec des en-têtes de section clairs aide le modèle à trouver ce qui compte. Le modèle est bon pour l'attention long-contexte, pas magique ; une structure claire fait la différence entre une réponse utilisable et une qui perd le fil.

Vision au niveau Pro

La qualité vision sur 2.5 Pro est genuinement solide. Captures d'écran de documents, PDF scannés, tableaux de bord, graphiques, diagrammes. L'extraction de tableaux est fiable sur les mises en page complexes multi-lignes. La description de graphiques inclut les unités d'axe, l'échelle et des estimations de grandeur précises. Le raisonnement sur les diagrammes — comprendre les flux et les relations dans une représentation visuelle — fonctionne à un niveau que les niveaux Gemini inférieurs approchent mais n'atteignent pas.

L'écriture manuscrite reste le point faible. Tout comme les très petits éléments d'UI. Tout ce qu'un humain peinerait à lire en pleine résolution bénéficie d'une étape de vérification.

Pour les charges de travail lourdes en vision où vous avez aussi besoin de raisonner sur ce qui est vu, 2.5 Pro est l'une des options actuelles les plus solides. Le niveau Opus de la famille Claude est compétitif en qualité mais ne correspond pas à la fenêtre 1M pour les entrées combinées vision-plus-texte.

Positionnement face à la concurrence

Face au niveau supérieur d'Anthropic. Claude Opus 4.5 et 4.6 sont compétitifs en qualité de raisonnement. Opus 4.7 offre la même fenêtre 1M. Là où ils diffèrent : Opus est plus prudent dans la posture de refus, plus fort sur la prose administrative en langues européennes ; 2.5 Pro est plus rapide sur la plupart des charges de travail et plus fort sur le traitement multimodal natif.

Face au niveau supérieur d'OpenAI. GPT-5 rivalise sur le raisonnement et est souvent plus rapide sur les prompts courts. 2.5 Pro gagne sur le multimodal natif au-delà des images et sur l'utilisation significative de la fenêtre 1M.

Face aux nouveaux instantanés Gemini. Gemini 3 Pro Preview est l'upgrade pour les capacités les plus récentes, avec les réserves habituelles des préversions sur les limites de taux et la stabilité du comportement. Pour la stabilité de production et un comportement bien compris, 2.5 Pro reste le bon point de départ.

Le tableau par catégorie est sur /benchmarks/leaderboard et les scores par catégorie sur /benchmarks/intelligence.

Quand ce n'est pas le bon outil

La classification à faible coût et volume élevé. Le compute de niveau supérieur n'est pas adapté à l'envoi de millions de prompts courts. Descendez vers 2.5 Flash ou Flash-Lite pour ces charges de travail.

La voix conversationnelle en temps réel. Pas d'entrée audio native. Le guide de pipeline vocal sur /usecases/voice couvre l'architecture adaptée.

La génération de code où la meilleure adaptation à l'IDE compte plus que la profondeur de raisonnement. 2.5 Pro est compétent sur le code mais pas spécialisé. L'étude de modèles sur /usecases/code couvre les alternatives.

Le déploiement auto-hébergé. Google ne livre pas les poids Gemini. Pour les charges de travail nécessitant un déploiement on-premise, l'étude open-weight sur /usecases/local est le bon point de départ.

Tout ce qui nécessite une réponse en moins d'une seconde sur de très longues entrées. La latence en profondeur dans la fenêtre de contexte est réelle ; pour les applications sensibles au temps, un modèle plus petit avec des stratégies de prompt caching peut mieux convenir.

Notes de déploiement

API Google Gemini standard. REST, streaming, appels d'outils, sortie structurée — tout se comporte comme prévu pour un modèle de niveau supérieur. L'intégration avec l'outillage Vertex AI plus large pour la surveillance, la journalisation et les contrôles de sécurité est propre.

La disponibilité régionale suit le schéma Vertex AI de Google. Les régions UE sont disponibles sur les contrats Enterprise. L'accès à l'API grand public n'épingle pas de région.

La tarification est au niveau supérieur de la famille Gemini. Pour les charges de travail à volume élevé, le coût par appel est significatif — le cas pour rester sur 2.5 Pro versus monter ou descendre dépend de si votre charge de travail spécifique nécessite genuinement la qualité de niveau supérieur.

Quand l'adopter

Choisissez Gemini 2.5 Pro quand :

  • Vous avez besoin d'un raisonnement de niveau supérieur combiné avec la fenêtre 1M.
  • La charge de travail inclut de l'entrée vision sur des documents, graphiques ou diagrammes nécessitant une lecture soigneuse.
  • Le traitement multimodal natif compte plus que la posture de refus de style Claude.
  • Vous êtes déjà sur la pile Google et avez besoin d'un modèle grand public de niveau Pro.

Choisissez autre chose quand :

  • La charge de travail s'adapte à un modèle de niveau Flash. Descendez pour le coût.
  • Vous avez besoin des capacités les plus récentes et pouvez tolérer un comportement de préversion. Montez vers 3 Pro Preview.
  • La cohérence des refus et la prose administrative en langues européennes dominent. Passez à Claude Opus.
  • Le travail est audio-natif, voix-natif ou vidéo-natif.

En résumé. Gemini 2.5 Pro est le choix de niveau supérieur de production pour les déploiements Google qui nécessitent un vrai raisonnement et une vraie gestion long-contexte. Les préversions 3.x plus récentes peuvent être plus performantes sur des benchmarks spécifiques, mais pour la stabilité, les limites de taux et un comportement bien compris sur la surface de production, 2.5 Pro est le bon point de départ.

Testez-le face aux alternatives sur vos propres prompts à /live-test.

Dernière vérification technique : 2026-05-22 — Tokonomix.ai

Gemini 2.5 Pro — illustration 2Gemini 2.5 Pro — illustration 3
Dernier test automatisé
7 sept. 2026 · 08:04 UTC · Benchmark de vitesse
Latence P50
1250 ms
Latence P95
1263 ms
Erreurs
0 / 6 exécutions
Dernière revue par Équipe Tokonomix·10 juin 2026