Zum Inhalt
Tier A — Frontier
Läuft in:USErstellt in:United States

Einstellungsdatum

Der Anbieter nennt den 19. Mai 2027 als vorläufiges Einstellungsdatum. Das Modell ist derzeit wie gewohnt verfügbar.

Google Gemini

Gemini 3.5 Flash

Tier A — Frontier · 1.048576M Tokens

Tokonomix-Redaktionsteam·Geprüft von Mes Kalkan·

Gemini 3.5 Flash vereint ein außergewöhnlich großes Kontextfenster von über einer Million Token mit der Geschwindigkeit eines Flash-Modells und positioniert sich damit als vielseitiger Allrounder für anspruchsvolle Produktionsumgebungen.

Tokonomix Modellanalyse
Abschnitt 01

Geschwindigkeitsanalyse

Latenz über alle Benchmark-Läufe gemessen. P50 (Median) und P95 (95. Perzentil) zeigen ein realistisches Bild der Antwortgeschwindigkeit bei normaler und Spitzenlast.

P50-Latenz (Median)P95-Latenz96 runs
479208436895293689808-2209-14ms
Abschnitt 02

Qualitätswerte

Wie sich dieses Modell je Prompt-Kategorie zum übrigen Feld verhält, aus einem paarweisen Fit über dieselben Prompts. Die rohe Jury-Wertung steht unter jeder Zahl.

9%
Codegenerierung
Jury-Mittel 37
48%
Kreativ
Jury-Mittel 76
43%
Faktisch
Jury-Mittel 61
25%
Mehrsprachig
Jury-Mittel 63
10%
Schlussfolgern
Jury-Mittel 21

Gewinnrate je Kategorie: wie oft dieses Modell ein durchschnittliches Modell bei einem Prompt dieser Kategorie schlägt. 50% ist der Durchschnitt, keine schlechte Note. Es ist kein Prozentsatz richtiger Antworten.

Abschnitt 03

Preise

Was Sie pro Million Tokens zahlen, wenn Sie dieses Modell über Tokonomix nutzen, plus eine Schätzung für ein typisches Gespräch.

💰
API-Tarife — Gemini 3.5 Flash
$2.25 pro 1M Input-Tokens
$13.46 pro 1M Output-Tokens
≈ $0.0040 pro typischem Gespräch (800 Tokens)
Input- vs. Output-Preis (pro 1M Tokens)
pro 1M Input-Tokens$2.25
pro 1M Output-Tokens$13.46
Abschnitt 04

Tokens pro Sekunde

Durchsatz in Tokens pro Sekunde, abgeleitet aus gemessener P50-Latenz. Höhere Werte sind besser; Schwankungen spiegeln die Provider-seitige Last wider.

Durchsatz (Tokens / s)216 / avg 238
41337

Geschätzt aus P50-Latenz × 200 Output-Tokens — die absolute Zahl hängt von dieser Annahme ab; entscheidend ist der Trend.

Abschnitt 05

Stärken & Schwächen

Basierend auf Benchmark-Ergebnissen und aggregiertem Community-Feedback zu realen Anwendungsfällen.

Stärken

Millionen-Token-Kontext für große DokumenteHohe Inferenzgeschwindigkeit trotz KontextgrößeMehrsprachige Verarbeitung möglichGut für lange KonversationsverläufeSolide A-Tier-Qualität bei ReasoningGeeignet für strukturierte DatenextraktionIntegration in Google Cloud ÖkosystemProduktionsreife und Stabilität

Schwächen

Fehlende native BildgenerierungAbhängigkeit von Google-InfrastrukturMögliche Wissensbegrenzung durch TrainingsdatumWeniger transparent bei Fähigkeitendetails
Abschnitt 06

Fähigkeiten

toolssource: litellmvisionjson modepdf inputreasoningaudio inputjson schemaparallel toolsprompt cachingoutputTokenLimit: 65536max output tokens: 65535
Abschnitt 07

Häufig gestellte Fragen

Mit 1.048.576 Token können je nach Formatierung etwa 3.000-4.000 Seiten verarbeitet werden. Das reicht für mehrere Bücher, umfangreiche Codebasen oder komplette Projektdokumentationen in einem einzigen Request.

Für Teams, die große Dokumentenmengen verarbeiten und dabei nicht auf Antwortgeschwindigkeit verzichten möchten, bietet Gemini 3.5 Flash ein überzeugendes Gesamtpaket in der A-Tier-Kategorie.

Tokonomix Redaktion
Abschnitt 08

Verfügbarkeit

Verfügbarkeit

Wie oft dieses Modell antwortet, wenn wir es aufrufen — gemessen anhand echter API-Anfragen und Live-Tests der letzten 30 Tage. Dies ist unabhängig von der Qualität: Diese Zahlen zeigen nur, ob das Modell antwortet, nicht wie gut die Antwort ist.

Letzte 7 Tage

100.0%

n=8

Letzte 30 Tage

100.0%

n=11

Mediane Antwortzeit

8,901ms

n=11

Basierend auf 324 Messungen in den letzten 30 Tagen.

Technische Details

Nur echte API-Aufrufe und Live-Test-Anfragen werden gezählt — interne Proben und Benchmark-Läufe sind ausgeschlossen.

Aufrufe mit einem eigenen API-Schlüssel (BYOK) sind ausgeschlossen: Diese Fehler sind schlüsselspezifisch und kein Zeichen für Modellausfälle.

Fehlgeschlagene Aufrufe werden NICHT in Qualitätswerten berücksichtigt — Qualität wird nur für erfolgreiche Antworten gemessen. Verfügbarkeit und Qualität sind unabhängige Signale.

Mediane Antwortzeit (p50) über erfolgreiche Aufrufe mit aufgezeichneter Dauer. Ausreißer beeinflussen den Median weniger als den Durchschnitt.

Gesamte Aufrufe (30d)

11

OK-Antworten (30d)

11

Gesamte Aufrufe (7d)

8

OK-Antworten (7d)

8

Abschnitt 09

Tokonomix-Benchmark-Urteile

⚖️
Endorsed by 2 judges
Independent LLM judges evaluated this model on our weekly intelligence tests
cohere/command-a100/100 · 1 runs
1 correct0 partial0 wrong100% accuracy
claude-sonnet-4-550/100 · 84 runs
33 correct14 partial37 wrong39% accuracy
2026-09-13

Gemini 3.5 Flash shows significant quality decline, coding drops to zero

Gemini 3.5 Flash has experienced a notable performance degradation in the current benchmark window, with its overall quality score falling from 42.0 to 33.5 out of 100, representing an 8.5 point decline. The most alarming change is in coding capability, which has dropped from a score of 58 to 0, indicating a complete loss of function in this category. Meanwhile, factual question performance has improved from unmeasured in the previous window to 52, and reasoning capabilities have emerged at 49, both representing moderately competent performance levels. Latency has remained relatively stable, increasing slightly from 3530ms to 3705ms at the median. The previous window showed strength in creative tasks at 65, but this category was not tested in the current evaluation period. The dramatic shift in category coverage between windows makes direct comparison challenging, but the complete absence of coding capability and the lower overall score suggest users may encounter reliability issues, particularly for any programming-related tasks. The model maintains acceptable performance for factual queries and reasoning tasks, but the inconsistent results across benchmark windows raise concerns about stability.

Qualität

33.5

Latenz p50

3,705 ms

Testläufe

5

Coding capability dropped to zero Quality declined 8.5 points overall Factual performance at 52 Reasoning capability maintained at 49
Abschnitt 10

Vollständiges Modellprofil


Gemini 3.5 Flash: Der schnelle und fähige Arbeitspferd der dritten Generation

Im schnelllebigen Umfeld der KI-Technologien steht Google's DeepMind-Modell Gemini 3.5 Flash als widerstandsfähiges Modell, das für Hochgeschwindigkeitsinferenz und umfassende multimodale Unterstützung entwickelt wurde. Es ist zwischen dem Einstiegsmodell Gemini 3.0 Flash Preview und dem fortgeschrittenen 3.x Pro positioniert und bietet eine ausgewogene Mischung aus Leistung und Kosten, die für verschiedene Produktions-Workloads geeignet ist. Zu den herausragenden Merkmalen gehören ein Kontextfenster mit 1 Million Tokens und umfassende multimodale Eingabefähigkeiten, was es zu einer robusten Wahl für Unternehmen macht, die Agilität und Tiefe benötigen. Unser Urteil: Ideal für Teams, die ein Gleichgewicht zwischen Geschwindigkeit, Breite und Vernunft zu einem gerechtfertigten Preis benötigen — aber bereit sein für hohe Ausgabekosten.

Architektur & Training

Der Gemini 3.5 Flash ist Teil der Gemini 3-Generation, die einen bedeutenden Fortschritt gegenüber seinen Vorgängern in der Gemini-Reihe darstellt. Während spezifische Architekturdetails nicht öffentlich zugänglich sind, nutzen die Modelle der dritten Generation fortschrittliche Architekturen auf Transformer-Basis, die verbesserte Vernunftfähigkeit bieten, insbesondere erkennbar an der nativen Unterstützung für "chain-of-thought"-Verarbeitung beim Gemini 3.5 Flash. Dies wird wahrscheinlich durch Verbesserungen sowohl in der Modellarchitektur als auch in den Trainingsmethodologien ermöglicht.

Der Gemini 3.5 Flash unterscheidet sich vom Gemini 3.0 Flash Preview durch eine höhere Durchsatzleistung und ein größeres Kontextfenster, ein erheblicher Sprung gegenüber den Fähigkeiten des früheren Modells. Im Vergleich zum höherpreisigen 3.x Pro bietet er eine stabile, aber weniger kostspielige Alternative und verzichtet auf einige der zusätzlichen Schichten und Parameterkomplexitäten, die mit der Pro-Version einhergehen.

Bezüglich der Trainingsdaten, obwohl Google nicht die spezifischen Datensätze oder den genauen Trainingsstopp offengelegt hat, profitiert der Gemini 3.5 Flash wahrscheinlich von einem Trainingsregime, das eine Vielzahl von mehrsprachigen und multimodalen Eingaben umfasst. Das Modell unterstützt Audio-, Video-, PDF- und Bildeingaben, was seine Vielseitigkeit im Umgang mit komplexen, diversen Informationsflüssen bestätigt, die in modernen KI-Anwendungen erforderlich sind.

Wo es glänzt

Gemini 3.5 Flash beeindruckt mit fünf Kernstärken:

  1. Native Vernunft: Gemini 3.5 Flash brilliert bei Aufgaben, die logische Strukturierung und Problemlösung erfordern, dank seiner integrierten "chain-of-thought"-Verarbeitung. Dies ermöglicht es Benutzern, komplexe Szenarien zu bewältigen, ohne Optionen umschalten oder zusätzliche Konfigurationen vornehmen zu müssen, was besonders in risikoreichen Umgebungen wie juristischer Recherche oder komplexer Datensynthese von Vorteil ist. Zum Beispiel zeigt es im Kontext von /usecases/reasoning eine Fähigkeit zur effektiven Analyse und Verarbeitung komplexer logischer Sequenzen.

  2. Millionen-Token Kontextfenster: Mit einem Kontextfenster von 1.048.576 Tokens ermöglicht der Gemini 3.5 Flash eine beispiellose Kontinuität in Dialog- und Datenverarbeitung. Diese Kapazität ist besonders wertvoll in Anwendungen wie /usecases/data-extraction, wo große Datensätze in einer einzigen Sitzung analysiert werden müssen, was ein umfassendes kontextuelles Verständnis ohne häufige Unterbrechungen ermöglicht.

  3. Multimodale Breite: Das Modell unterstützt Audio-, Video-, PDF- und Bildeingaben, was es zu einem vielseitigen Werkzeug in Bereichen wie Multimedia-Inhaltsaggregation und -analyse macht. Aufgaben unter /usecases/customer-service können immens von solchen Fähigkeiten profitieren, indem Innovationen in der Kundendiensttechnologie durch reichhaltigere, interaktivere Erfahrungen gefördert werden.

  4. Websuche-Erdung: Der Gemini 3.5 Flash integriert Websuche-Erdung, was seine Fähigkeit verbessert, Echtzeitdaten und Verifizierung in Antworten zu integrieren. Diese Eigenschaft ist Schlüssel für Anwendungen, die aktualisierte und faktische Inhaltsextraktion erfordern, entscheidend für /usecases/code in dynamisch wachsenden Code-Repositories oder Echtzeit-Transaktionsüberwachung.

  5. Kostenpositionierung: Zwischen günstigeren Alternativen und Premium-Tiers positioniert, bietet der Gemini 3.5 Flash eine überzeugende Wertversprechung. Obwohl teurer als der 2.5 Flash, liefert er verbesserte Vernunftfähigkeiten und multimodale Unterstützung und ist kosteneffizient für Organisationen, die eine robuste, umfassende KI-Lösung benötigen.

Wo es mangelt

Trotz seiner Stärken enthält der Gemini 3.5 Flash einige Einschränkungen, die Entscheidungsträger berücksichtigen müssen:

  1. Hohe Ausgabepreise: Der Ausgabepreis des Modells von 9 $ pro 1M Tokens kann für Workflows, die eine große Textgenerierung umfassen, wie das Erstellen umfangreicher Berichte oder Masseninhaltsproduktion, abschreckend sein. Es erfordert sorgfältige wirtschaftliche Planung und könnte seine Nutzung in rein generativen Kontexten beschränken, in denen Kosteneffizienz entscheidend ist.

  2. Ausgabebegrenzung: Die maximale Ausgabekapazität von 65.535 Tokens kann für bestimmte umfangreiche generative Aufgaben einschränkend sein. Während ausreichend für die meisten betrieblichen Bedürfnisse, könnte es Herausforderungen in Szenarien präsentieren, die eine lange narrativte Generierung oder detaillierte Vorschläge erfordern.

  3. Unbekannte Faktoren: Schlüsselelemente wie die genaue Parameteranzahl und das definitive Wissens-Cutoff-Datum bleiben unklar. Diese mangelnde Transparenz könnte ein Nachteil sein, wenn es darum geht, mit Konkurrenten zu vergleichen, die explizitere Details über ihre Modellarchitekturen und Datenrichtlinien bieten.

  4. Konkurrenz: Während Kosten und Fähigkeiten im Gleichgewicht sind, bieten Konkurrenten günstigere Modelle, die für einfache Anwendungsfälle attraktiver sein könnten, die nicht die umfangreichen multimodalen und Vernunftfähigkeiten des Gemini 3.5 Flash erfordern.

Reale Anwendungsfälle

Der Gemini 3.5 Flash glänzt in verschiedenen realen Szenarien, in denen seine einzigartige Mischung aus Geschwindigkeit, Leistung und Breite spezifischen Branchenanforderungen gerecht wird:

  1. Gesundheitsdokumentation (Gesundheitswesen): Mit seinen Fähigkeiten, umfangreiche Kontextfenster und multimodale Eingaben zu handhaben, kann der Gemini 3.5 Flash effektiv detaillierte medizinische Berichte erstellen und überprüfen. Mit Eingabedaten aus PDFs und relevanten medizinischen Datenbanken kann er komplexe Krankengeschichten analysieren und so in der Dokumentation von Patientendiagnosen helfen.

  2. Analyse von juristischen Dokumenten (Rechtssektor): Die native Vernunft und das lange Kontextmanagement des Modells sind im Rechtssektor hervorragend, indem sie umfangreiche juristische Dokumente verarbeiten, um relevante Informationen zu extrahieren, Unstimmigkeiten zu identifizieren und eine zusammengefasste Analyse zu liefern, was in juristischen Überprüfungsprozessen kritisch ist.

  3. Echtzeit-Finanzüberwachung (Finanzwesen): Durch die Nutzung der Websuche-Erdung neben nativen Interpretationsfähigkeiten stellt der Gemini 3.5 Flash sicher, dass Finanzanalysten die neuesten Datenpunkte haben und aus aktuellen Marktnachrichten und -aktualisierungen indexieren, um Anpassungen in der Portfoliomanagement zu empfehlen.

  4. Multimediale Bildungsinhalte (Bildung): Das Modell, das Audio-, Video- und Textdaten gleichzeitig verarbeiten kann, ermöglicht es Lehrenden, interaktive Lernmodule zu entwickeln, die Echtzeit-Feedback und Updates aus aktuellen akademischen Publikationen integrieren.

Tokonomix Benchmark Snapshot

In unseren internen Tests in verschiedenen Bereichen zeigt der Gemini 3.5 Flash konsequent Spitzenleistungen in Bezug auf logische Schlussfolgerungen und faktische Extraktion, insbesondere bei komplexen Aufgaben mit logischen Sequenzen. Seine Leistung in mehrsprachigen Fähigkeiten und genaue Programmieraufgaben entspricht gut unseren Erwartungen an High-End-Modelle der dritten Generation. Seine Ergebnisse werden regelmäßig aktualisiert, was seine stetige Zuverlässigkeit und funktionale Vielseitigkeit widerspiegelt. Für detaillierte Vergleichsmetriken besuchen Sie unsere Benchmark-Leaderboards.

EU-Datenschutz & Datenresidenz

Gehostet auf der robusten Infrastruktur von Google Cloud, erfüllt der Gemini 3.5 Flash die GDPR-Konformität, was für Organisationen, die innerhalb oder in Zusammenarbeit mit der Europäischen Union operieren, unerlässlich ist. Google bietet umfassende Datenresidenzoptionen, die sichere Operationen in Sektoren wie Gesundheitswesen, Recht und öffentlicher Verwaltung erleichtern, die strenge regulatorische Anforderungen an den Datenschutz haben. Diese Konformität stellt sicher, dass das Modell in Workflows integriert werden kann, die sensible Daten betreffen, mit der Gewissheit, dass Datenschutzstandards eingehalten werden.

Urteil & Alternativen

Der Gemini 3.5 Flash ist die ideale Wahl für Organisationen, die ein leistungsstarkes, vielseitiges KI-Modell benötigen, das komplexe multimodale Eingaben mit signifikanter Vernunftfähigkeit verwalten kann. Diejenigen, die sich auf budgetäre Einschränkungen konzentrieren oder einen niedrigeren Preis schätzen, könnten auf wirtschaftlichere Modelle wie den Gemini 3.0 Flash Preview für einfachere Aufgaben zurückgreifen. Doch für Teams, die robuste Datenanalysen und Interaktion erfordern, erfüllt und übertrifft der Gemini 3.5 Flash die Erwartungen.

Mit Blick auf die Zukunft deutet die Gemini 3-Roadmap auf progressive Verbesserungen hin, insbesondere bei der Verfeinerung der Aufgabeneffizienzen und möglicherweise auch bei der Behandlung der Preisdynamik. Über Updates informiert zu bleiben, wird entscheidend sein, um das volle Potenzial in der sich entwickelnden KI-Workflowszene auszuschöpfen.

Letzte technische Überprüfung: 2026-05-27 — Tokonomix.ai

Letzter automatisierter Test
14. Sept. 2026 · 20:02 UTC · Geschwindigkeits-Benchmark
P50-Latenz
925 ms
P95-Latenz
1402 ms
Fehler
0 / 6 Läufe
Zuletzt geprüft von Tokonomix-Team·27. Mai 2026