Gemini 3.1 Flash-Lite est le modèle le plus léger de la gamme Gemini 3 de Google, construit sur les fondations de Gemini 3 Pro et positionné par Google comme le modèle le plus rapide et le plus rentable de cette génération. Une version preview est sortie le 3 mars 2026, suivie par la version généralement disponible vendue ici ; Google n'a pas publié de date GA précise. Google mesure ses gains de vitesse par rapport à Gemini 2.5 Flash, et positionne le modèle pour les workloads qui tournent à grande échelle et ont besoin d'une réponse rapide plutôt que pour les tâches de raisonnement les plus exigeantes.
Là où il excelle
Google recommande ce palier pour la traduction, la modération de contenu, la génération d'interfaces utilisateur et de tableaux de bord, l'exécution de simulations, et le suivi général d'instructions à grande échelle — des tâches où la latence par requête et le débit comptent plus que d'extraire le dernier point de qualité de raisonnement. Selon Google, le modèle offre un temps jusqu'au premier token 2,5 fois plus rapide et une vitesse de sortie supérieure de 45 % par rapport à Gemini 2.5 Flash, ce qui est la raison pratique d'y recourir : un pipeline envoyant des milliers de requêtes par jour bénéficie bien plus d'une latence faible et constante que de gains de précision marginaux sur un seul appel.
Malgré l'étiquette « lite », Google rapporte des scores honorables en culture générale et en raisonnement multimodal : 86,9 % sur GPQA Diamond et 76,8 % sur MMMU-Pro, selon les chiffres publiés par Google lui-même. Il est véritablement multimodal en entrée, acceptant texte, images, audio et vidéo, avec une fenêtre de contexte d'entrée de 1 000 000 de tokens.
Sous le capot
La sortie est plafonnée à 65 536 tokens et uniquement textuelle — ce palier ne génère ni images ni audio, il ne fait que raisonner dessus. L'appel d'outils, la sortie JSON structurée conforme à un schéma et la mise en cache des prompts sont tous pris en charge, ce qui le rend adapté aux pipelines nécessitant une extraction structurée fiable plutôt qu'un chat libre.
Là où il montre ses limites
Le seul point faible clairement documenté est la récupération en contexte long. Sur le propre benchmark de contexte long MRCR v2 de Google, le modèle obtient 60,1 % à une fenêtre de contexte de 128k tokens et chute à 12,3 % à la fenêtre complète de 1 000 000 de tokens. En termes pratiques : la fenêtre de contexte est assez large pour accepter un document très long, mais la capacité du modèle à retrouver précisément un détail spécifique dans ce document se dégrade substantiellement à mesure que l'entrée approche du plafond. Pour les workloads qui ont réellement besoin d'un rappel fiable près du sommet d'une fenêtre d'un million de tokens, ce n'est pas le bon palier — tournez-vous plutôt vers un modèle Gemini plus grand. Ce n'est pas non plus, par conception, le modèle à privilégier pour les tâches de raisonnement ou de codage agentique les plus exigeantes ; Google l'a conçu pour le volume et la vitesse, pas pour la capacité de pointe.
Quand le choisir
Choisissez Flash-Lite pour un travail à fort volume et sensible à la latence : traduction en masse, files de modération, classification à grande échelle, génération d'interfaces ou de tableaux de bord à partir d'entrées structurées, ou tout pipeline où le même type de requête s'exécute des milliers de fois par jour. Il convient mal aux tâches nécessitant soit un raisonnement de pointe, soit un rappel fiable à partir de documents très longs.
Alternatives à comparer
Dans la propre gamme de Google, Gemini 3 Pro est le modèle de base dont ce palier est distillé, et constitue le meilleur choix lorsqu'une tâche nécessite un raisonnement plus profond que ce que le palier Lite peut fournir de façon fiable. Google a depuis livré un Gemini 3.5 Flash-Lite plus récent, qu'il vaut la peine de comparer à cette génération pour tout workload sensible aux dernières améliorations de qualité au sein de ce même palier axé sur la vitesse.
Une note sur le nommage
Tokonomix vend la version généralement disponible gemini-3.1-flash-lite, pas la version preview antérieure. La preview était une version distincte et limitée dans le temps que Google a utilisée pour recueillir des retours avant la disponibilité générale ; le comportement et la qualité peuvent différer entre la preview et la GA, donc les résultats mesurés sur la preview devraient être revérifiés sur le modèle GA avant d'être utilisés en production.