Zum Inhalt
Tier B — Produktion
Läuft in:USErstellt in:United States

Einstellungsdatum

Der Anbieter nennt den 7. Mai 2027 als vorläufiges Einstellungsdatum. Das Modell ist derzeit wie gewohnt verfügbar.

Google Gemini

Gemini 3.1 Flash Lite

Tier B — Produktion · 1.048576M Tokens

Tokonomix-Redaktionsteam·Geprüft von Mes Kalkan·
Abschnitt 01

Geschwindigkeitsanalyse

Latenz über alle Benchmark-Läufe gemessen. P50 (Median) und P95 (95. Perzentil) zeigen ein realistisches Bild der Antwortgeschwindigkeit bei normaler und Spitzenlast.

P50-Latenz (Median)P95-Latenz96 runs
288520752984121608-2209-14ms
Abschnitt 02

Qualitätswerte

Wie sich dieses Modell je Prompt-Kategorie zum übrigen Feld verhält, aus einem paarweisen Fit über dieselben Prompts. Die rohe Jury-Wertung steht unter jeder Zahl.

55%
Codegenerierung
Jury-Mittel 93
42%
Kreativ
Jury-Mittel 82
70%
Faktisch
Jury-Mittel 85
59%
Mehrsprachig
Jury-Mittel 99
74%
Schlussfolgern
Jury-Mittel 99

Gewinnrate je Kategorie: wie oft dieses Modell ein durchschnittliches Modell bei einem Prompt dieser Kategorie schlägt. 50% ist der Durchschnitt, keine schlechte Note. Es ist kein Prozentsatz richtiger Antworten.

Abschnitt 03

Preise

Was Sie pro Million Tokens zahlen, wenn Sie dieses Modell über Tokonomix nutzen, plus eine Schätzung für ein typisches Gespräch.

💰
API-Tarife — Gemini 3.1 Flash Lite
$0.4900 pro 1M Input-Tokens
$2.93 pro 1M Output-Tokens
≈ $0.0009 pro typischem Gespräch (800 Tokens)
Input- vs. Output-Preis (pro 1M Tokens)
pro 1M Input-Tokens$0.4900
pro 1M Output-Tokens$2.93
Abschnitt 04

Tokens pro Sekunde

Durchsatz in Tokens pro Sekunde, abgeleitet aus gemessener P50-Latenz. Höhere Werte sind besser; Schwankungen spiegeln die Provider-seitige Last wider.

Durchsatz (Tokens / s)369 / avg 389
688208

Geschätzt aus P50-Latenz × 200 Output-Tokens — die absolute Zahl hängt von dieser Annahme ab; entscheidend ist der Trend.

Abschnitt 05

Fähigkeiten

toolssource: litellmvisionjson modepdf inputreasoningaudio inputjson schemaparallel toolsprompt cachingoutputTokenLimit: 65536max output tokens: 65536
Abschnitt 06

Verfügbarkeit

Verfügbarkeit

Wie oft dieses Modell antwortet, wenn wir es aufrufen — gemessen anhand echter API-Anfragen und Live-Tests der letzten 30 Tage. Dies ist unabhängig von der Qualität: Diese Zahlen zeigen nur, ob das Modell antwortet, nicht wie gut die Antwort ist.

Letzte 7 Tage

100.0%

n=8

Letzte 30 Tage

100.0%

n=8

Mediane Antwortzeit

5,288ms

n=8

Basierend auf 321 Messungen in den letzten 30 Tagen.

Technische Details

Nur echte API-Aufrufe und Live-Test-Anfragen werden gezählt — interne Proben und Benchmark-Läufe sind ausgeschlossen.

Aufrufe mit einem eigenen API-Schlüssel (BYOK) sind ausgeschlossen: Diese Fehler sind schlüsselspezifisch und kein Zeichen für Modellausfälle.

Fehlgeschlagene Aufrufe werden NICHT in Qualitätswerten berücksichtigt — Qualität wird nur für erfolgreiche Antworten gemessen. Verfügbarkeit und Qualität sind unabhängige Signale.

Mediane Antwortzeit (p50) über erfolgreiche Aufrufe mit aufgezeichneter Dauer. Ausreißer beeinflussen den Median weniger als den Durchschnitt.

Gesamte Aufrufe (30d)

8

OK-Antworten (30d)

8

Gesamte Aufrufe (7d)

8

OK-Antworten (7d)

8

Abschnitt 07

Tokonomix-Benchmark-Urteile

⚖️
Endorsed by 2 judges
Independent LLM judges evaluated this model on our weekly intelligence tests
cohere/command-a100/100 · 1 runs
1 correct0 partial0 wrong100% accuracy
claude-sonnet-4-593/100 · 82 runs
71 correct6 partial5 wrong87% accuracy
2026-09-13

Quality gains of 6.8 points offset by 20% latency regression

Gemini 3.1 Flash Lite demonstrates meaningful quality improvements in this benchmark window, climbing from 77.2 to 84.0 overall. The most striking change appears in reasoning performance, which reached a perfect 100 score compared to its absence in previous testing. Factual response quality measured at 65, representing a new category in this evaluation period. Coding performance decreased from 95 to 87, indicating some regression in code generation capabilities despite the overall quality gains. Latency characteristics shifted notably, with p50 response times increasing from 1472ms to 1762ms, representing a 20% slowdown. This timing regression may impact user experience in latency-sensitive applications, though the model remains within reasonable response parameters for most use cases. The model previously excelled at multilingual tasks with a score of 92, though this category was not evaluated in the current window. Creative output had scored 45 previously, suggesting room for improvement in generative tasks. The current benchmark window shows a model that has strengthened its reasoning capabilities and maintained solid coding performance, though users should be aware of the latency tradeoff and the noted decline in code generation quality from previous levels.

Qualität

84.0

Latenz p50

1,762 ms

Testläufe

5

Quality improved 6.8 points Reasoning reached perfect score Latency increased 20% Coding dropped from 95 to 87
Abschnitt 08

Vollständiges Modellprofil

Gemini 3.1 Flash-Lite: Googles Arbeitspferd für hohes Volumen, gebaut für Geschwindigkeit statt Tiefe

Gemini 3.1 Flash-Lite ist das leichteste Modell in Googles Gemini-3-Reihe, aufgebaut auf dem Fundament von Gemini 3 Pro und von Google als das schnellste, kosteneffizienteste Modell dieser Generation positioniert. Eine Preview-Version erschien am 3. März 2026, gefolgt von der allgemein verfügbaren Version, die hier verkauft wird; ein konkretes GA-Datum hat Google nicht veröffentlicht. Google misst seine Geschwindigkeitsgewinne gegen Gemini 2.5 Flash und positioniert das Modell für Workloads, die im großen Maßstab laufen und schnelle Antworten brauchen statt der anspruchsvollsten Reasoning-Aufgaben.

Wo es glänzt

Google empfiehlt dieses Tier für Übersetzung, Content-Moderation, das Erzeugen von Benutzeroberflächen und Dashboards, das Ausführen von Simulationen und allgemeine Instruktionsbefolgung im großen Maßstab — Aufgaben, bei denen Latenz pro Anfrage und Durchsatz wichtiger sind, als den letzten Punkt Reasoning-Qualität herauszuholen. Laut Google liefert das Modell eine 2,5-fach schnellere Time-to-First-Token und eine um 45 % höhere Ausgabegeschwindigkeit als Gemini 2.5 Flash — das ist der praktische Grund, danach zu greifen: Eine Pipeline, die täglich Tausende Anfragen verschickt, profitiert weit mehr von konstant niedriger Latenz als von marginalen Genauigkeitsgewinnen bei einem einzelnen Aufruf.

Trotz des Labels „Lite" berichtet Google von respektablen Werten bei Allgemeinwissen und multimodalem Reasoning: 86,9 % auf GPQA Diamond und 76,8 % auf MMMU-Pro, laut Googles eigenen veröffentlichten Zahlen. Auf der Eingabeseite ist es echt multimodal und akzeptiert Text, Bilder, Audio und Video, mit einem Kontextfenster von 1.000.000 Token für die Eingabe.

Unter der Haube

Die Ausgabe ist auf 65.536 Token begrenzt und reiner Text — dieses Tier erzeugt keine Bilder oder Audio, es reasoniert nur darüber. Function Calling, strukturierte JSON-Ausgabe gegen ein Schema und Prompt-Caching werden alle unterstützt, wodurch es in Pipelines passt, die zuverlässige strukturierte Extraktion statt freien Chat brauchen.

Wo es an Grenzen stößt

Der einzige klar dokumentierte Schwachpunkt ist Long-Context-Retrieval. Auf Googles eigenem MRCR-v2-Long-Context-Benchmark erzielt das Modell 60,1 % bei einem Kontext von 128k Token und fällt auf 12,3 % beim vollen Fenster von 1.000.000 Token. Praktisch bedeutet das: Das Kontextfenster ist groß genug, um ein sehr langes Dokument aufzunehmen, aber die Fähigkeit des Modells, ein bestimmtes Detail präzise aus diesem Dokument wieder herauszuholen, verschlechtert sich erheblich, je näher die Eingabe an die Obergrenze heranreicht. Für Workloads, die wirklich zuverlässigen Abruf nahe der Spitze eines Fensters von einer Million Token brauchen, ist dies nicht das richtige Tier — greifen Sie stattdessen zu einem größeren Gemini-Modell. Es ist auch, per Design, nicht das Modell für die anspruchsvollsten Reasoning- oder agentischen Coding-Aufgaben; Google hat es für Volumen und Geschwindigkeit gebaut, nicht für Frontier-Fähigkeiten.

Wann Sie es wählen

Wählen Sie Flash-Lite für hochvolumige, latenzempfindliche Arbeit: Massenübersetzung, Moderationswarteschlangen, Klassifikation im großen Maßstab, UI- oder Dashboard-Generierung aus strukturierter Eingabe, oder jede Pipeline, bei der dieselbe Art von Anfrage tausende Male täglich läuft. Es passt schlecht zu Aufgaben, die entweder Frontier-Reasoning oder zuverlässigen Abruf aus sehr langen Dokumenten benötigen.

Alternativen im Vergleich

Innerhalb von Googles eigener Reihe ist Gemini 3 Pro das Basismodell, aus dem dieses Tier destilliert wurde, und die bessere Wahl, wenn eine Aufgabe tieferes Reasoning braucht, als das Lite-Tier zuverlässig liefern kann. Google hat inzwischen auch ein neueres Gemini 3.5 Flash-Lite veröffentlicht, das es sich lohnt, gegen diese Generation zu prüfen — bei jedem Workload, der empfindlich auf die neuesten Qualitätsverbesserungen im selben geschwindigkeitsfokussierten Tier reagiert.

Ein Hinweis zur Benennung

Tokonomix verkauft das allgemein verfügbare gemini-3.1-flash-lite, nicht den früheren Preview-Build. Die Preview war eine separate, zeitlich begrenzte Version, die Google zum Sammeln von Feedback vor der GA-Veröffentlichung nutzte; Verhalten und Qualität können sich zwischen Preview und GA unterscheiden, daher sollten Ergebnisse, die an der Preview gemessen wurden, vor dem produktiven Einsatz erneut gegen das GA-Modell überprüft werden.

Letzter automatisierter Test
14. Sept. 2026 · 20:03 UTC · Geschwindigkeits-Benchmark
P50-Latenz
542 ms
P95-Latenz
671 ms
Fehler
0 / 6 Läufe
Zuletzt geprüft von Tokonomix-Team·14. September 2026