Aller au contenu
Tier B — Production
Fonctionne en :USCréé en :United States

Date de retrait

Le fournisseur indique le 7 mai 2027 comme date de retrait provisoire. Le modèle reste disponible normalement pour l’instant.

Google Gemini

Gemini 3.1 Flash Lite

Tier B — Production · 1.048576M tokens

Équipe éditoriale Tokonomix·Relu par Mes Kalkan·
Section 01

Analyse de vitesse

Latence mesurée sur toutes les exécutions de benchmark. P50 (médiane) et P95 (95e percentile) donnent une image réaliste de la vitesse de réponse en charge normale et de pointe.

Latence P50 (médiane)Latence P9597 runs
288520752984121608-2209-15ms
Section 02

Scores de qualité

Comment ce modèle se situe par rapport au reste du champ sur chaque catégorie de prompts, à partir d'un ajustement par paires sur les mêmes prompts. La note brute du juge figure sous chaque nombre.

55%
Génération de code
moyenne du juge 93
42%
Créatif
moyenne du juge 82
70%
Factuel
moyenne du juge 85
59%
Multilingue
moyenne du juge 99
74%
Raisonnement
moyenne du juge 99

Taux de victoire par catégorie : la fréquence à laquelle ce modèle bat un modèle moyen sur un prompt de cette catégorie. 50% est la moyenne, pas un échec. Ce n'est pas un pourcentage de bonnes réponses.

Section 03

Tarifs

Ce que vous payez par million de tokens en utilisant ce modèle sur Tokonomix, avec une estimation pour une conversation type.

💰
Tarifs API — Gemini 3.1 Flash Lite
$0.4900 par 1M de tokens d'entrée
$2.93 par 1M de tokens de sortie
≈ $0.0009 par conversation typique (800 tokens)
Prix entrée vs sortie (par 1M de tokens)
par 1M de tokens d'entrée$0.4900
par 1M de tokens de sortie$2.93
Section 04

Tokens par seconde

Débit en tokens par seconde, dérivé de la latence P50 mesurée. Plus haut est mieux ; les fluctuations reflètent la charge côté fournisseur.

Débit (tokens / s)388 / avg 389
688208

Estimé à partir de la latence P50 × 200 tokens de sortie — le chiffre absolu dépend de cette hypothèse ; c'est la tendance qui compte.

Section 05

Capacités

toolssource: litellmvisionjson modepdf inputreasoningaudio inputjson schemaparallel toolsprompt cachingoutputTokenLimit: 65536max output tokens: 65536
Section 06

Disponibilité

Disponibilité

La fréquence à laquelle ce modèle répond lorsqu'on l'appelle — mesurée sur de vraies requêtes API et des tests en direct au cours des 30 derniers jours. C'est indépendant de la qualité : ces chiffres indiquent seulement si le modèle répond, pas la qualité de sa réponse.

7 derniers jours

100.0%

n=8

30 derniers jours

100.0%

n=8

Temps de réponse médian

5,288ms

n=8

Basé sur 321 mesures au cours des 30 derniers jours.

Détails techniques

Seuls les vrais appels API et les requêtes de test en direct sont comptés — les sondes internes et les benchmarks sont exclus.

Les appels avec une clé API personnalisée (BYOK) sont exclus : ces échecs sont spécifiques à la clé, pas un signe de défaillance du modèle.

Les appels échoués ne sont PAS inclus dans les scores de qualité — la qualité est mesurée uniquement sur les réponses réussies. Disponibilité et qualité sont des signaux indépendants.

Temps de réponse médian (p50) sur les appels réussis avec une durée enregistrée. Les valeurs extrêmes influencent moins la médiane que la moyenne.

Total des appels (30d)

8

Réponses OK (30d)

8

Total des appels (7d)

8

Réponses OK (7d)

8

Section 07

Verdicts benchmark Tokonomix

⚖️
Endorsed by 2 judges
Independent LLM judges evaluated this model on our weekly intelligence tests
cohere/command-a100/100 · 1 runs
1 correct0 partial0 wrong100% accuracy
claude-sonnet-4-593/100 · 82 runs
71 correct6 partial5 wrong87% accuracy
2026-09-13

Quality gains of 6.8 points offset by 20% latency regression

Gemini 3.1 Flash Lite demonstrates meaningful quality improvements in this benchmark window, climbing from 77.2 to 84.0 overall. The most striking change appears in reasoning performance, which reached a perfect 100 score compared to its absence in previous testing. Factual response quality measured at 65, representing a new category in this evaluation period. Coding performance decreased from 95 to 87, indicating some regression in code generation capabilities despite the overall quality gains. Latency characteristics shifted notably, with p50 response times increasing from 1472ms to 1762ms, representing a 20% slowdown. This timing regression may impact user experience in latency-sensitive applications, though the model remains within reasonable response parameters for most use cases. The model previously excelled at multilingual tasks with a score of 92, though this category was not evaluated in the current window. Creative output had scored 45 previously, suggesting room for improvement in generative tasks. The current benchmark window shows a model that has strengthened its reasoning capabilities and maintained solid coding performance, though users should be aware of the latency tradeoff and the noted decline in code generation quality from previous levels.

Qualité

84.0

Latence p50

1,762 ms

Exécutions de test

5

Quality improved 6.8 points Reasoning reached perfect score Latency increased 20% Coding dropped from 95 to 87
Section 08

Profil complet du modèle

Gemini 3.1 Flash-Lite : le cheval de trait haut volume de Google, conçu pour la vitesse plutôt que la profondeur

Gemini 3.1 Flash-Lite est le modèle le plus léger de la gamme Gemini 3 de Google, construit sur les fondations de Gemini 3 Pro et positionné par Google comme le modèle le plus rapide et le plus rentable de cette génération. Une version preview est sortie le 3 mars 2026, suivie par la version généralement disponible vendue ici ; Google n'a pas publié de date GA précise. Google mesure ses gains de vitesse par rapport à Gemini 2.5 Flash, et positionne le modèle pour les workloads qui tournent à grande échelle et ont besoin d'une réponse rapide plutôt que pour les tâches de raisonnement les plus exigeantes.

Là où il excelle

Google recommande ce palier pour la traduction, la modération de contenu, la génération d'interfaces utilisateur et de tableaux de bord, l'exécution de simulations, et le suivi général d'instructions à grande échelle — des tâches où la latence par requête et le débit comptent plus que d'extraire le dernier point de qualité de raisonnement. Selon Google, le modèle offre un temps jusqu'au premier token 2,5 fois plus rapide et une vitesse de sortie supérieure de 45 % par rapport à Gemini 2.5 Flash, ce qui est la raison pratique d'y recourir : un pipeline envoyant des milliers de requêtes par jour bénéficie bien plus d'une latence faible et constante que de gains de précision marginaux sur un seul appel.

Malgré l'étiquette « lite », Google rapporte des scores honorables en culture générale et en raisonnement multimodal : 86,9 % sur GPQA Diamond et 76,8 % sur MMMU-Pro, selon les chiffres publiés par Google lui-même. Il est véritablement multimodal en entrée, acceptant texte, images, audio et vidéo, avec une fenêtre de contexte d'entrée de 1 000 000 de tokens.

Sous le capot

La sortie est plafonnée à 65 536 tokens et uniquement textuelle — ce palier ne génère ni images ni audio, il ne fait que raisonner dessus. L'appel d'outils, la sortie JSON structurée conforme à un schéma et la mise en cache des prompts sont tous pris en charge, ce qui le rend adapté aux pipelines nécessitant une extraction structurée fiable plutôt qu'un chat libre.

Là où il montre ses limites

Le seul point faible clairement documenté est la récupération en contexte long. Sur le propre benchmark de contexte long MRCR v2 de Google, le modèle obtient 60,1 % à une fenêtre de contexte de 128k tokens et chute à 12,3 % à la fenêtre complète de 1 000 000 de tokens. En termes pratiques : la fenêtre de contexte est assez large pour accepter un document très long, mais la capacité du modèle à retrouver précisément un détail spécifique dans ce document se dégrade substantiellement à mesure que l'entrée approche du plafond. Pour les workloads qui ont réellement besoin d'un rappel fiable près du sommet d'une fenêtre d'un million de tokens, ce n'est pas le bon palier — tournez-vous plutôt vers un modèle Gemini plus grand. Ce n'est pas non plus, par conception, le modèle à privilégier pour les tâches de raisonnement ou de codage agentique les plus exigeantes ; Google l'a conçu pour le volume et la vitesse, pas pour la capacité de pointe.

Quand le choisir

Choisissez Flash-Lite pour un travail à fort volume et sensible à la latence : traduction en masse, files de modération, classification à grande échelle, génération d'interfaces ou de tableaux de bord à partir d'entrées structurées, ou tout pipeline où le même type de requête s'exécute des milliers de fois par jour. Il convient mal aux tâches nécessitant soit un raisonnement de pointe, soit un rappel fiable à partir de documents très longs.

Alternatives à comparer

Dans la propre gamme de Google, Gemini 3 Pro est le modèle de base dont ce palier est distillé, et constitue le meilleur choix lorsqu'une tâche nécessite un raisonnement plus profond que ce que le palier Lite peut fournir de façon fiable. Google a depuis livré un Gemini 3.5 Flash-Lite plus récent, qu'il vaut la peine de comparer à cette génération pour tout workload sensible aux dernières améliorations de qualité au sein de ce même palier axé sur la vitesse.

Une note sur le nommage

Tokonomix vend la version généralement disponible gemini-3.1-flash-lite, pas la version preview antérieure. La preview était une version distincte et limitée dans le temps que Google a utilisée pour recueillir des retours avant la disponibilité générale ; le comportement et la qualité peuvent différer entre la preview et la GA, donc les résultats mesurés sur la preview devraient être revérifiés sur le modèle GA avant d'être utilisés en production.

Dernier test automatisé
15 sept. 2026 · 02:05 UTC · Benchmark de vitesse
Latence P50
515 ms
Latence P95
660 ms
Erreurs
0 / 6 exécutions
Dernière revue par Équipe Tokonomix·14 septembre 2026