Zum Inhalt
Tier B — Produktion
Läuft in:USErstellt in:United States

Einstellungsdatum

Der Anbieter nennt den 20. Oktober 2026 als vorläufiges Einstellungsdatum. Das Modell ist derzeit wie gewohnt verfügbar.

Google Gemini

Gemini 2.5 Flash-Lite

Tier B — Produktion · 1.048576M Tokens

Tokonomix-Redaktionsteam·Geprüft von Mes Kalkan··

Gemini 2.5 Flash-Lite ist ein Large Language Model, das von Google als Teil der Gemini-Familie entwickelt wurde. Es ist für standardmäßige Textgenerierungsaufgaben konzipiert und bietet ein ausgewogenes Verhältnis zwischen Leistung und Ressourceneffizienz. Das Modell ist als leichtgewichtige Variante innerhalb der Gemini 2.5-Reihe positioniert und für Anwendungen optimiert, bei denen ein reduzierter Rechenaufwand vorteilhaft ist, während gleichzeitig ein leistungsfähiges Verständnis und eine Generierung natürlicher Sprache erhalten bleiben. Ein zentrales technisches Merkmal von Gemini 2.5 Flash-Lite ist sein Kontextfenster von 1.048.576 Tokens, was etwa einer Million Tokens entspricht. Diese erweiterte Kontextkapazität ermöglicht es dem Modell, große Textmengen in einem einzigen Inferenzaufruf zu verarbeiten und zu analysieren, wodurch es sich für Aufgaben mit langen Dokumenten, umfangreichen Konversationsverläufen oder komplexen mehrstufigen Interaktionen eignet. Das Modell unterstützt standardmäßige Textgenerierungsfunktionen, einschließlich Frage-Antwort-Systemen, Zusammenfassungen, Inhaltserstellung und Dialoganwendungen. Innerhalb der Gemini-Reihe von Google liegt die 2.5 Flash-Lite-Variante hinsichtlich Rechenintensität unter den Standardmodellen Flash und Pro und bietet eine zugänglichere Option für Entwickler und Anwendungen mit Einschränkungen bei Latenz- oder Durchsatzanforderungen. Sie steht für Googles Ansatz, gestaffelte Modelloptionen bereitzustellen, die unterschiedlichen Anwendungsanforderungen gerecht werden – von durchsatzstarken Produktionsumgebungen bis hin zu experimentellen oder ressourcenbeschränkten Deployments. Das Modell ist über Googles AI Platform-Dienste und standardmäßige API-Zugangspunkte verfügbar.

Gemini 2.5 Flash-Lite bringt einen Millionen-Token-Kontext in ein ressourcenoptimiertes Paket.

Tokonomix-Benchmark-Zusammenfassung
Abschnitt 01

Geschwindigkeitsanalyse

Latenz über alle Benchmark-Läufe gemessen. P50 (Median) und P95 (95. Perzentil) zeigen ein realistisches Bild der Antwortgeschwindigkeit bei normaler und Spitzenlast.

P50-Latenz (Median)P95-Latenz100 runs
296234743976448849808-2109-14ms
Abschnitt 02

Qualitätswerte

Wie sich dieses Modell je Prompt-Kategorie zum übrigen Feld verhält, aus einem paarweisen Fit über dieselben Prompts. Die rohe Jury-Wertung steht unter jeder Zahl.

38%
Codegenerierung
Jury-Mittel 95
51%
Kreativ
Jury-Mittel 90
45%
Faktisch
Jury-Mittel 83
57%
Mehrsprachig
Jury-Mittel 96
60%
Schlussfolgern
Jury-Mittel 96
53%
Gesundheit
Jury-Mittel 68

Gewinnrate je Kategorie: wie oft dieses Modell ein durchschnittliches Modell bei einem Prompt dieser Kategorie schlägt. 50% ist der Durchschnitt, keine schlechte Note. Es ist kein Prozentsatz richtiger Antworten.

Abschnitt 03

Preise

Was Sie pro Million Tokens zahlen, wenn Sie dieses Modell über Tokonomix nutzen, plus eine Schätzung für ein typisches Gespräch.

💰
API-Tarife — Gemini 2.5 Flash-Lite
$0.2600 pro 1M Input-Tokens
$1.04 pro 1M Output-Tokens
≈ $0.0004 pro typischem Gespräch (800 Tokens)
Input- vs. Output-Preis (pro 1M Tokens)
pro 1M Input-Tokens$0.2600
pro 1M Output-Tokens$1.04
Abschnitt 04

Tokens pro Sekunde

Durchsatz in Tokens pro Sekunde, abgeleitet aus gemessener P50-Latenz. Höhere Werte sind besser; Schwankungen spiegeln die Provider-seitige Last wider.

Durchsatz (Tokens / s)376 / avg 472
669301

Geschätzt aus P50-Latenz × 200 Output-Tokens — die absolute Zahl hängt von dieser Annahme ab; entscheidend ist der Trend.

Abschnitt 05

Stärken & Schwächen

Basierend auf Benchmark-Ergebnissen und aggregiertem Community-Feedback zu realen Anwendungsfällen.

Stärken

Ressourceneffizient bei großem Kontext1-Million-Token-KontextfensterGeringer Durchsatz-OverheadPraktisch für Throughput-SystemeStandardsprachaufgaben abgedecktZugänglich über Google AI Platform

Schwächen

Unterhalb Flash und Pro in ReasoningBegrenzte kreative TiefeNicht für komplexe Analyse
Abschnitt 06

Fähigkeiten

toolssource: litellmvisionjson modepdf inputreasoningjson schemaparallel toolsprompt cachingoutputTokenLimit: 65536max output tokens: 65535
Abschnitt 07

Häufig gestellte Fragen

Flash-Lite ist noch effizienter und ressourcenschonender als der Standard-Flash, eignet sich für Szenarien mit Kapazitäts- oder Latenzbeschränkungen.

Die Lite-Variante beweist, dass schlankes Design und riesige Kontextfenster kein Widerspruch sein müssen.

Tokonomix-Benchmark-Zusammenfassung
Abschnitt 08

Verfügbarkeit

Verfügbarkeit

Noch keine Messdaten

Es wurden noch nicht genug API-Aufrufe aufgezeichnet, um Verfügbarkeitsstatistiken für dieses Modell anzuzeigen. Daten erscheinen, sobald das Modell Live-Traffic erhält.

Abschnitt 09

Tokonomix-Benchmark-Urteile

⚖️
Endorsed by 2 judges
Independent LLM judges evaluated this model on our weekly intelligence tests
cohere/command-a100/100 · 1 runs
1 correct0 partial0 wrong100% accuracy
claude-sonnet-4-591/100 · 146 runs
117 correct23 partial6 wrong80% accuracy
2026-09-13

Gemini 2.5 Flash-Lite shows mixed performance with latency regression

Gemini 2.5 Flash-Lite demonstrates uneven performance across evaluation categories in the current benchmark window. The model achieved perfect reasoning scores at 100 and maintained strong coding capabilities at 92, showing particular strength in logic-intensive tasks. However, factual accuracy dropped significantly to 48, indicating potential reliability concerns for knowledge-based queries. The overall quality score decreased from 84.0 to 80.0, reflecting these category imbalances. Latency performance regressed notably, with median response times increasing 16 percent from 1751ms to 2033ms. This slowdown may impact user experience in latency-sensitive applications. The current benchmark window includes fewer test runs compared to the previous period, with 4 runs versus 5, though this sample size remains sufficient for evaluation. The shift in tested categories from multilingual and creative tasks to factual and reasoning assessments makes direct comparisons challenging. Users should note the model excels in reasoning and coding scenarios but may require additional verification for factual queries. The latency increase warrants attention for production deployments where response time is critical.

Qualität

80.0

Latenz p50

2,033 ms

Testläufe

4

Perfect reasoning score achieved Factual accuracy dropped significantly Latency increased 16 percent Overall quality score declined
Abschnitt 10

Vollständiges Modellprofil

Gemini 2.5 Flash-Lite — illustration 1
Gemini 2.5 Flash-Lite: die Kostenstufe der produktiven Flash-Familie

Gemini 2.5 Flash-Lite (gemini-2.5-flash-lite) ist der kostengünstige Einstieg in die produktive 2.5-Flash-Familie. Ein Kontextfenster von 1.048.576 Token — das gleiche Fenster wie die volle 2.5-Flash-Variante. Text- und Vision-Eingabe. Gebaut für hochvolumige Arbeit, bei der der Preis pro Aufruf wichtiger ist als absolute Leistungsfähigkeit.

Die treffendste Beschreibung: Flash-Lite ist die richtige Wahl, wenn man den vollen Flash angeschaut und entschieden hat, dass die Qualität mehr ist als der Workload tatsächlich braucht, und die Pro-Stufe angeschaut und entschieden hat, dass die Kosten mehr sind als der Workload rechtfertigt. Es sitzt bewusst im Budget-Band und macht das Budget-Band gut.

Warum dieser Snapshot sich durchgesetzt hat

Mehrere Dinge trafen in 2.5 Flash-Lite ein, die es zum Standard-Upgrade-Ziel für Teams machten, die 2.0 Flash-Lite liefen:

  • Schärferes Reasoning als die 2.0-Generation, insbesondere bei mehrstufigen Extraktionsaufgaben, bei denen 2.0 Flash-Lite manchmal streckte.
  • Sauberere Einhaltung strukturierter Ausgaben. JSON-Schemas halten auch auf der Lite-Stufe zuverlässig.
  • Bessere Long-Context-Aufmerksamkeitsqualität in der Tiefe. Das 1M-Fenster ist jenseits von 200k Token nützlicher als im 2.0-Lite-Snapshot.
  • Verbesserte Vision-Qualität bei Dokumentenleseaufgaben.
  • Ablehnungshaltung stärker auf die größeren Gemini-Modelle ausgerichtet — weniger uneinheitliche Behandlung von grenzwertigen Prompts.

Für die meisten Workloads auf 2.0 Flash-Lite war die Migrationskostenrechnung einfach genug, dass Teams gewechselt sind.

Was es gut kann

Das 1M-Kontextfenster zu einem Lite-Tier-Preis ist die Schlagzeile. Wenige Konkurrenten im gleichen Band bieten so viel Kontext, und 2.5 Flash-Lite nutzt es sinnvoll besser als die 2.0-Generation.

Latenz hält bei kurzen Prompts gut stand. Das Modell streamt schnell und bleibt reaktionsfähig, wenn die Eingabe wächst. Für Echtzeit-Chat-Erlebnisse zu niedrigen Kosten ist das Latenzprofil wirklich nutzbar.

Multimodale Eingabe funktioniert für routinemäßige Dokumentenlese-Workloads. Screenshots, gescannte Formulare, Dashboard-Aufnahmen — das Modell behandelt sie mit ausreichender Sorgfalt für die meisten Extraktions-Pipelines. Nicht beste Klasse für Vision, aber solide in dem Band, bei dem man der Ausgabe für Standardaufgaben vertrauen kann.

Tool-Use und strukturierte Ausgabe sind zuverlässig genug für die meisten agentisch geformten Workloads dieser Stufe. Schema-Einhaltung ist sauber; Tool-Call-Payloads sind gut geformt.

Was es schlecht kann

Reasoning-Tiefe ist die sichtbare Einschränkung. Das Modell behandelt unkomplizierte Extraktion und Klassifizierung sauber, streckt sich aber bei mehrstufigem Reasoning. Für Aufgaben, die sorgfältige Synthese erfordern, ist die volle 2.5-Flash-Variante der richtige Aufstieg.

Long-Context-Aufmerksamkeitsqualität ist merklich besser als die 2.0-Lite-Generation, bleibt aber bei der Synthese über verstreute Fakten hinter der vollen 2.5-Flash-Variante. Für reine Retrieval-Anfragen gegen gut strukturierte Eingaben hält die Lite-Stufe stand. Für Synthese in der Tiefe aufsteigen.

Vision-Qualität liegt unter der vollen 2.5-Flash-Variante und deutlich unter der 2.5-Pro-Variante. Für vision-lastige Workloads, bei denen Bildqualität wichtiger ist als Kosten, ist dies der falsche Ausgangspunkt.

Code-Generierung ist kompetent für einfache Aufgaben, aber konservativ bei komplexen. Die Lite-Stufe ist nicht das richtige Band für IDE-passendes Code-Arbeiten.

Einordnung in die Modelllandschaft

Gegenüber neueren Lite-Tier-Snapshots — dem 3.1 Flash Lite Preview — ist 2.5 Flash-Lite die produktionsstabilere Wahl. Der 3.1-Preview zeigt Verbesserungen in einigen Kategorien, trägt aber Preview-Tier-Ratenlimit- und Verhaltensüberlegungen.

Gegenüber Konkurrenten im gleichen Band: Claude Haiku 4.5 ist bei reasoning-lastigeren Workloads fähiger, entspricht aber nicht dem 1M-Kontextfenster. Kleinere OpenAI-Varianten konkurrieren bei Geschwindigkeit, typischerweise mit kürzeren Kontexten. Für reine Kosten pro Aufruf bei hohem Volumen mit langem Kontext ist 2.5 Flash-Lite eine der stärksten aktuellen Optionen.

Für Sub-Cent-Kosten pro Aufruf bei kleineren Kontextgrößen konkurrieren die OVH-gehosteten Open-Weight-Optionen auf /usecases/local auf einer anderen Achse.

Das Kategorie-Bild finden Sie auf /benchmarks/leaderboard und die Kategorie-Scores auf /benchmarks/intelligence.

Wo es seinen Sweet-Spot hat

Einige Workloads, bei denen 2.5 Flash-Lite seinen Sweet-Spot trifft:

  • Hochvolumiges FAQ-Routing, bei dem der entscheidende Faktor der Durchsatz ist, nicht die Reasoning-Tiefe.
  • Kundenservice-Triage und -Klassifizierung in großem Maßstab.
  • Long-Context-Retrieval gegen strukturierte Dokumente, bei dem das Modell nur Fakten finden muss, statt darüber zu synthesieren.
  • Prototyping, bei dem die Kosten pro Aufruf niedrig genug sind, dass Experimentieren keine Budgetgenehmigung erfordert.
  • Mehrsprachiger Kundensupport für Routineanfragen — das Modell behandelt gängige europäische Sprachen ausreichend auch auf der Lite-Stufe.

Wann es das falsche Werkzeug ist

Alles, das tiefes mehrstufiges Reasoning erfordert. Zur vollen 2.5-Flash-Variante oder zur Pro-Stufe wechseln.

Vision-lastige Workloads, bei denen Bildqualität wichtig ist. Die vollen 2.5-Flash- und 2.5-Pro-Varianten produzieren merklich bessere Ausgaben.

Sicherheitskritische Anwendungen ohne nachgelagerte Verifizierung. Ablehnungshaltung ist vernünftig, aber nicht auf dem Niveau der größeren Gemini-Modelle.

Code-Generierung unter sich schnell entwickelnden Frameworks. Die Lite-Stufe ist nicht das richtige Band. Die Modellübersicht auf /usecases/code deckt die Alternativen ab.

Echtzeit-Sprache. Keine Audio-Eingabe. Den Voice-Pipeline-Leitfaden auf /usecases/voice konsultieren.

Deployment-Hinweise

Standard-Google-Gemini-API. REST, Streaming, Tool-Use, strukturierte Ausgabe — alles verhält sich erwartungsgemäß für die zugrunde liegende Fähigkeitsoberfläche.

Regionale Verfügbarkeit folgt Googles Vertex-AI-Muster. EU-Regionen sind auf Enterprise-Verträgen verfügbar. Der Standard-Consumer-API-Zugang pinnt keine Region. Bei strikten Residenzanforderungen ist die regionale Vertex-AI-Dokumentation die richtige Referenz.

Preise sind der historische Differenziator für diese Stufe. Die aktuellen Vertex-AI-Preise sollten die Referenz sein, nicht Launch-Zahlen. Für sehr hochvolumige Workloads ist das Delta der Kosten pro Aufruf gegenüber dem vollen 2.5 Flash bedeutend; prüfen Sie, ob die tatsächlich benötigte Qualität den Aufstieg rechtfertigt.

Wann Sie es einsetzen sollten

Greifen Sie zu Gemini 2.5 Flash-Lite, wenn:

  • Der Workload hochvolumig ist und Kosten pro Aufruf wichtig sind.
  • Sie das 1M-Kontextfenster zu einem Lite-Tier-Preis benötigen.
  • Die Aufgabe Extraktion, Klassifizierung, Retrieval oder Routing ist, kein tiefes Reasoning.
  • Sie bereits auf dem Google-Stack sind und dort bleiben wollen.

Wählen Sie etwas anderes, wenn:

  • Der Workload Reasoning-Tiefe oder sorgfältige Synthese benötigt. Zum vollen 2.5 Flash wechseln.
  • Vision-Qualität wichtiger ist als Kosten.
  • Sicherheitskritische Anwendung ohne nachgelagerte Verifizierung. Ein größeres Modell verwenden.
  • Die Arbeit Audio, Sprache oder Video ist.

Zusammenfassung: Solides Kostenstufen-Modell, das sein Band gut macht. Für hochvolumige Arbeit, bei der die Qualitätsanforderungen bescheiden sind und das Kontextfenster wichtig ist, ist 2.5 Flash-Lite eine der stärksten Optionen auf dem Markt.

Vergleichen Sie mit den Alternativen auf eigenen Prompts unter /live-test.

Letzte technische Überprüfung: 2026-05-22 — Tokonomix.ai

Gemini 2.5 Flash-Lite — illustration 2Gemini 2.5 Flash-Lite — illustration 3
Letzter automatisierter Test
14. Sept. 2026 · 20:03 UTC · Geschwindigkeits-Benchmark
P50-Latenz
532 ms
P95-Latenz
2767 ms
Fehler
0 / 6 Läufe
Zuletzt geprüft von Tokonomix-Team·24. Mai 2026