Naar inhoud
Tier B — Productie
Draait in:USGemaakt in:United States

Einddatum

De aanbieder noemt 7 mei 2027 als voorlopige einddatum voor dit model. Het model is nu gewoon beschikbaar.

Google Gemini

Gemini 3.1 Flash Lite

Tier B — Productie · 1.048576M tokens

Tokonomix-redactie·Gecontroleerd door Mes Kalkan·
Sectie 01

Snelheidsanalyse

Latency gemeten over alle benchmark-runs. P50 (mediaan) en P95 (95e percentiel) geven een realistisch beeld van de responssnelheid onder normale en piekbelasting.

P50 latency (mediaan)P95 latency96 runs
288520752984121608-2209-14ms
Sectie 02

Kwaliteitsscores

Hoe dit model zich per promptcategorie verhoudt tot de rest van het veld, uit een paarsgewijze berekening over dezelfde prompts. Het ruwe jurycijfer staat onder elk getal.

55%
Code generatie
jurygemiddelde 93
42%
Creatief
jurygemiddelde 82
70%
Feitelijk
jurygemiddelde 85
59%
Meertaligheid
jurygemiddelde 99
74%
Redeneren
jurygemiddelde 99

Winstpercentage per categorie: hoe vaak dit model een gemiddeld model verslaat op een prompt uit die categorie. 50% is gemiddeld, geen onvoldoende. Het is geen percentage goede antwoorden.

Sectie 03

Prijzen

Wat je per miljoen tokens betaalt als je dit model via Tokonomix gebruikt, plus een schatting voor een gemiddeld gesprek.

💰
API-tarieven — Gemini 3.1 Flash Lite
$0.4900 per 1M input-tokens
$2.93 per 1M output-tokens
≈ $0.0009 per typisch gesprek (800 tokens)
Input vs output prijs (per 1M tokens)
per 1M input-tokens$0.4900
per 1M output-tokens$2.93
Sectie 04

Tokens per seconde

Doorvoersnelheid in tokens per seconde, afgeleid uit gemeten P50-latency. Hogere waarden zijn beter; fluctuaties weerspiegelen serverbelasting bij de provider.

Doorvoer (tokens / s)369 / avg 389
688208

Geschat uit P50-latency × 200 output-tokens — het absolute getal hangt af van deze aanname; de trend is wat telt.

Sectie 05

Mogelijkheden

toolssource: litellmvisionjson modepdf inputreasoningaudio inputjson schemaparallel toolsprompt cachingoutputTokenLimit: 65536max output tokens: 65536
Sectie 06

Beschikbaarheid

Beschikbaarheid

Hoe vaak dit model antwoordt als we het aanroepen — gemeten over echte API-aanvragen en live-tests in de afgelopen 30 dagen. Dit staat los van kwaliteit: deze cijfers laten alleen zien of het model reageert, niet hoe goed het antwoord is.

Afgelopen 7 dagen

100.0%

n=8

Afgelopen 30 dagen

100.0%

n=8

Mediane responstijd

5,288ms

n=8

Gebaseerd op 321 metingen in de afgelopen 30 dagen.

Technische details

Alleen echte API-aanroepen en live-testverzoeken tellen mee — interne probes en benchmarkruns zijn uitgesloten.

Aanroepen met een eigen API-sleutel (BYOK) zijn uitgesloten: die fouten zijn sleutelspecifiek en geen teken van modelneergang.

Mislukte aanroepen worden NIET meegeteld in kwaliteitsscores — kwaliteit wordt gemeten op geslaagde responses. Beschikbaarheid en kwaliteit zijn onafhankelijke signalen.

Mediane responstijd (p50) over geslaagde aanroepen met een vastgelegde duur. Uitschieters trekken de mediaan minder dan het gemiddelde.

Totaal aanroepen (30d)

8

OK-reacties (30d)

8

Totaal aanroepen (7d)

8

OK-reacties (7d)

8

Sectie 07

Tokonomix benchmark-oordelen

⚖️
Endorsed by 2 judges
Independent LLM judges evaluated this model on our weekly intelligence tests
cohere/command-a100/100 · 1 runs
1 correct0 partial0 wrong100% accuracy
claude-sonnet-4-593/100 · 82 runs
71 correct6 partial5 wrong87% accuracy
2026-09-13

Quality gains of 6.8 points offset by 20% latency regression

Gemini 3.1 Flash Lite demonstrates meaningful quality improvements in this benchmark window, climbing from 77.2 to 84.0 overall. The most striking change appears in reasoning performance, which reached a perfect 100 score compared to its absence in previous testing. Factual response quality measured at 65, representing a new category in this evaluation period. Coding performance decreased from 95 to 87, indicating some regression in code generation capabilities despite the overall quality gains. Latency characteristics shifted notably, with p50 response times increasing from 1472ms to 1762ms, representing a 20% slowdown. This timing regression may impact user experience in latency-sensitive applications, though the model remains within reasonable response parameters for most use cases. The model previously excelled at multilingual tasks with a score of 92, though this category was not evaluated in the current window. Creative output had scored 45 previously, suggesting room for improvement in generative tasks. The current benchmark window shows a model that has strengthened its reasoning capabilities and maintained solid coding performance, though users should be aware of the latency tradeoff and the noted decline in code generation quality from previous levels.

Kwaliteit

84.0

Latency p50

1,762 ms

Testruns

5

Quality improved 6.8 points Reasoning reached perfect score Latency increased 20% Coding dropped from 95 to 87
Sectie 08

Volledig modelprofiel

Gemini 3.1 Flash-Lite: Googles workpaard voor hoog volume, gebouwd voor snelheid boven diepgang

Gemini 3.1 Flash-Lite is het lichtste model in Googles Gemini 3-lijn, gebouwd op het fundament van Gemini 3 Pro en door Google gepositioneerd als het snelste, meest kosteneffectieve model in die generatie. Een previewversie verscheen op 3 maart 2026, gevolgd door de algemeen beschikbare versie die hier wordt verkocht; Google heeft geen specifieke GA-datum gepubliceerd. Google meet zijn snelheidswinst tegen Gemini 2.5 Flash, en positioneert het model voor workloads die op schaal draaien en snel een antwoord nodig hebben in plaats van voor de zwaarste redeneertaken.

Waar het uitblinkt

Google beveelt dit niveau aan voor vertaling, contentmoderatie, het genereren van gebruikersinterfaces en dashboards, het draaien van simulaties, en algemene instructienaleving op volume — taken waarbij latency per aanvraag en doorvoer belangrijker zijn dan het laatste punt reasoning-kwaliteit eruit persen. Volgens Google levert het model 2,5 keer snellere time-to-first-token en 45% hogere outputsnelheid dan Gemini 2.5 Flash, wat de praktische reden is om ernaar te grijpen: een pipeline die duizenden aanvragen per dag verstuurt, profiteert veel meer van consistente lage latency dan van marginale nauwkeurigheidswinst per individuele aanroep.

Ondanks het label "lite" rapporteert Google respectabele scores op algemene kennis en multimodaal redeneren: 86,9% op GPQA Diamond en 76,8% op MMMU-Pro, volgens Googles eigen gepubliceerde cijfers. Het is echt multimodaal aan de invoerkant, en accepteert tekst, afbeeldingen, audio en video, met een contextvenster van 1.000.000 tokens voor invoer.

Onder de motorkap

Output is beperkt tot 65.536 tokens en is alleen tekst — dit niveau genereert geen afbeeldingen of audio, het redeneert er alleen over. Tool calling, gestructureerde JSON-output tegen een schema en prompt caching worden allemaal ondersteund, waardoor het past in pipelines die betrouwbare gestructureerde extractie nodig hebben in plaats van vrije chat.

Waar het tekortschiet

Het enige duidelijk gedocumenteerde zwakke punt is long-context-retrieval. Op Googles eigen MRCR v2 long-context-benchmark scoort het model 60,1% bij een contextvenster van 128k tokens en zakt het naar 12,3% bij het volledige venster van 1.000.000 tokens. In praktische termen: het contextvenster is groot genoeg om een zeer lang document te accepteren, maar het vermogen van het model om een specifiek detail nauwkeurig uit dat document terug te halen verslechtert aanzienlijk naarmate de invoer het plafond nadert. Voor workloads die echt betrouwbare recall dicht bij de top van een venster van een miljoen tokens nodig hebben, is dit niet het juiste niveau — grijp in plaats daarvan naar een groter Gemini-model. Het is ook, per ontwerp, niet het model om naar te grijpen voor de zwaarste reasoning- of agentische codeertaken; Google heeft het gebouwd voor volume en snelheid, niet voor frontier-capaciteit.

Wanneer je dit kiest

Kies Flash-Lite voor werk met hoog volume dat latency-gevoelig is: bulkvertaling, moderatiewachtrijen, classificatie op schaal, UI- of dashboardgeneratie vanuit gestructureerde invoer, of elke pipeline waarbij hetzelfde soort aanvraag duizenden keren per dag draait. Het is een slechte match voor taken die ofwel frontier-reasoning ofwel betrouwbare recall uit zeer lange documenten nodig hebben.

Alternatieven om te overwegen

Binnen Googles eigen line-up is Gemini 3 Pro het basismodel waaruit dit niveau is gedistilleerd, en het is de betere keuze wanneer een taak dieper redeneren nodig heeft dan het Lite-niveau betrouwbaar kan leveren. Google heeft sindsdien ook een nieuwere Gemini 3.5 Flash-Lite uitgebracht, die de moeite waard is om tegen deze generatie af te zetten voor elke workload die gevoelig is voor de nieuwste kwaliteitsverbeteringen op hetzelfde snelheidsgerichte niveau.

Een noot over naamgeving

Tokonomix verkoopt de algemeen beschikbare gemini-3.1-flash-lite, niet de eerdere previewbuild. De preview was een aparte, tijdgebonden release die Google gebruikte om feedback te verzamelen voordat het model algemeen beschikbaar werd; gedrag en kwaliteit kunnen verschillen tussen preview en GA, dus resultaten die tegen de preview zijn gemeten, moeten opnieuw tegen het GA-model worden geverifieerd voordat erop wordt vertrouwd in productie.

Laatste automatische test
14 sep 2026 · 20:03 UTC · Snelheidstest
P50 latency
542 ms
P95 latency
671 ms
Fouten
0 / 6 runs
Laatst beoordeeld door Tokonomix-team·14 september 2026