İçeriğe geç
Seviye B — Üretim
Çalıştığı yer:USYapıldığı yer:United States

Kullanımdan kaldırma tarihi

Sağlayıcı 7 Mayıs 2027 tarihini geçici bir kullanımdan kaldırma tarihi olarak belirtiyor. Model şu an her zamanki gibi kullanılabilir.

Google Gemini

Gemini 3.1 Flash Lite

Seviye B — Üretim · 1.048576M token

Tokonomix Editöryel Ekibi·İnceleyen Mes Kalkan·
Bölüm 01

Hız analizi

Tüm benchmark çalıştırmalarında ölçülen gecikme. P50 (medyan) ve P95 (95. yüzdelik) normal ve yoğun yük altında yanıt hızının gerçekçi bir resmini verir.

P50 gecikme (medyan)P95 gecikme96 runs
288520752984121608-2209-14ms
Bölüm 02

Kalite puanları

Bu modelin her soru kategorisinde sahanın geri kalanına göre nerede durduğu; aynı sorular üzerinde ikili karşılaştırmayla hesaplanır. Ham jüri puanı her sayının altındadır.

55%
Kod üretimi
jüri ortalaması 93
42%
Yaratıcı
jüri ortalaması 82
70%
Olgusal
jüri ortalaması 85
59%
Çok dilli
jüri ortalaması 99
74%
Akıl yürütme
jüri ortalaması 99

Kategori başına kazanma oranı: bu modelin o kategoriden bir soruda ortalama bir modeli ne sıklıkla yendiği. %50 ortalamadır, kalma notu değildir. Doğru cevap yüzdesi de değildir.

Bölüm 03

Fiyatlar

Bu modeli Tokonomix üzerinden kullandığınızda milyon token başına ödediğiniz tutar ve tipik bir konuşma için tahmini maliyet.

💰
API tarifeleri — Gemini 3.1 Flash Lite
$0.4900 1M giriş token başına
$2.93 1M çıkış token başına
≈ $0.0009 tipik konuşma başına (800 token)
Giriş vs çıkış fiyatı (1M token başına)
1M giriş token başına$0.4900
1M çıkış token başına$2.93
Bölüm 04

Saniye başına token

Ölçülen P50 gecikmesinden türetilen saniye başına token verimi. Yüksek daha iyidir; dalgalanmalar sağlayıcı tarafındaki yükü yansıtır.

Verim (token / s)369 / avg 389
688208

P50 gecikme × 200 çıkış token tahmininden hesaplandı — mutlak rakam bu varsayıma bağlıdır; önemli olan eğilimdir.

Bölüm 05

Yetenekler

toolssource: litellmvisionjson modepdf inputreasoningaudio inputjson schemaparallel toolsprompt cachingoutputTokenLimit: 65536max output tokens: 65536
Bölüm 06

Kullanılabilirlik

Kullanılabilirlik

Bu modelin çağrıldığında ne sıklıkla yanıt verdiği — son 30 gün içindeki gerçek API istekleri ve canlı testler üzerinden ölçülmüştür. Bu kaliteden bağımsızdır: bu sayılar yalnızca modelin yanıt verip vermediğini gösterir, yanıtın ne kadar iyi olduğunu değil.

Son 7 gün

100.0%

n=8

Son 30 gün

100.0%

n=8

Medyan yanıt süresi

5,288ms

n=8

Baz alınan 321 ölçüm son 30 gün içinde.

Teknik detaylar

Yalnızca gerçek API çağrıları ve canlı test istekleri sayılır — dahili yoklamalar ve kıyaslama çalıştırmaları hariçtir.

Özel API anahtarıyla (BYOK) yapılan çağrılar hariçtir: bu hatalar anahtara özgüdür, model kesintisinin işareti değildir.

Başarısız çağrılar kalite puanlarına DAHİL EDİLMEZ — kalite yalnızca başarılı yanıtlar üzerinden ölçülür. Kullanılabilirlik ve kalite bağımsız sinyallerdir.

Kaydedilmiş süreye sahip başarılı çağrılarda medyan yanıt süresi (p50). Aykırı değerler medyanı ortalamadan daha az etkiler.

Toplam çağrı (30d)

8

OK yanıtlar (30d)

8

Toplam çağrı (7d)

8

OK yanıtlar (7d)

8

Bölüm 07

Tokonomix kıyaslama kararları

⚖️
Endorsed by 2 judges
Independent LLM judges evaluated this model on our weekly intelligence tests
cohere/command-a100/100 · 1 runs
1 correct0 partial0 wrong100% accuracy
claude-sonnet-4-593/100 · 82 runs
71 correct6 partial5 wrong87% accuracy
2026-09-13

Quality gains of 6.8 points offset by 20% latency regression

Gemini 3.1 Flash Lite demonstrates meaningful quality improvements in this benchmark window, climbing from 77.2 to 84.0 overall. The most striking change appears in reasoning performance, which reached a perfect 100 score compared to its absence in previous testing. Factual response quality measured at 65, representing a new category in this evaluation period. Coding performance decreased from 95 to 87, indicating some regression in code generation capabilities despite the overall quality gains. Latency characteristics shifted notably, with p50 response times increasing from 1472ms to 1762ms, representing a 20% slowdown. This timing regression may impact user experience in latency-sensitive applications, though the model remains within reasonable response parameters for most use cases. The model previously excelled at multilingual tasks with a score of 92, though this category was not evaluated in the current window. Creative output had scored 45 previously, suggesting room for improvement in generative tasks. The current benchmark window shows a model that has strengthened its reasoning capabilities and maintained solid coding performance, though users should be aware of the latency tradeoff and the noted decline in code generation quality from previous levels.

Kalite

84.0

Gecikme p50

1,762 ms

Test çalıştırmaları

5

Quality improved 6.8 points Reasoning reached perfect score Latency increased 20% Coding dropped from 95 to 87
Bölüm 08

Tam model profili

Gemini 3.1 Flash-Lite: Google'ın yüksek hacimli iş atı, derinlik yerine hız için inşa edildi

Gemini 3.1 Flash-Lite, Google'ın Gemini 3 hattındaki en hafif modeldir; Gemini 3 Pro temeli üzerine inşa edilmiş ve Google tarafından o neslin en hızlı, en maliyet-etkin modeli olarak konumlandırılmıştır. Bir önizleme (preview) sürümü 3 Mart 2026'da çıktı ve burada satılan genel kullanıma açık (GA) sürüm bunu izledi; Google belirli bir GA tarihi yayımlamadı. Google, hız kazanımlarını Gemini 2.5 Flash'a karşı ölçüyor ve modeli en zor akıl yürütme görevleri için değil, ölçekte çalışan ve hızlı yanıt gerektiren iş yükleri için konumlandırıyor.

Öne çıktığı noktalar

Google bu katmanı çeviri, içerik moderasyonu, kullanıcı arayüzü ve panel üretimi, simülasyon çalıştırma ve hacimli genel talimat takibi için öneriyor — istek başına gecikme ve verimin, son bir akıl yürütme kalitesi puanını sıkıştırmaktan daha çok önem taşıdığı görevler. Google'a göre model, Gemini 2.5 Flash'a kıyasla 2,5 kat daha hızlı ilk-token süresi ve %45 daha yüksek çıktı hızı sağlıyor; bu da ona yönelmenin pratik nedeni: günde binlerce istek gönderen bir hat, herhangi bir tek çağrıdaki marjinal doğruluk kazanımlarından çok, tutarlı düşük gecikmeden fayda görür.

"Lite" etiketine rağmen Google, genel bilgi ve çok modlu akıl yürütmede saygın puanlar bildiriyor: Google'ın kendi yayımladığı rakamlara göre GPQA Diamond'da %86,9 ve MMMU-Pro'da %76,8. Girdi tarafında gerçek anlamda çok modludur; metin, görüntü, ses ve video kabul eder ve girdi için 1.000.000 tokenlik bir bağlam penceresine sahiptir.

Kaputun altında

Çıktı 65.536 tokenle sınırlıdır ve yalnızca metindir — bu katman görüntü veya ses üretmez, yalnızca onlar üzerinde akıl yürütür. Araç çağırma, bir şemaya karşı yapılandırılmış JSON çıktısı ve prompt önbellekleme desteklenir; bu nedenle serbest biçimli sohbetten çok güvenilir yapılandırılmış çıkarıma ihtiyaç duyan hatlara uyar.

Nerede zayıf kalıyor

Açıkça belgelenen tek zayıf nokta uzun bağlamdan geri getirmedir (retrieval). Google'ın kendi MRCR v2 uzun bağlam kıyaslamasında model, 128 bin tokenlik bir bağlamda %60,1 puan alırken tam 1.000.000 tokenlik pencerede %12,3'e düşüyor. Pratik anlamda: bağlam penceresi çok uzun bir belgeyi kabul edecek kadar büyük, ama modelin o belgeden belirli bir ayrıntıyı doğru biçimde geri çekme yeteneği, girdi tavana yaklaştıkça belirgin şekilde bozuluyor. Bir milyon tokenlik pencerenin tepesine yakın güvenilir hatırlamaya gerçekten ihtiyaç duyan iş yükleri için bu doğru katman değildir — bunun yerine daha büyük bir Gemini modeline yönelin. Ayrıca, tasarım gereği, en zor akıl yürütme veya ajan kodlama görevleri için başvurulacak model de değildir; Google onu sınır (frontier) yetenek için değil, hacim ve hız için inşa etmiştir.

Ne zaman tercih edilmeli

Flash-Lite'ı yüksek hacimli, gecikmeye duyarlı işler için seçin: toplu çeviri, moderasyon kuyrukları, ölçekte sınıflandırma, yapılandırılmış girdiden arayüz veya panel üretimi ya da aynı türde isteğin günde binlerce kez çalıştığı herhangi bir hat. Sınır düzeyinde akıl yürütme veya çok uzun belgelerden güvenilir hatırlama gerektiren görevler için kötü bir seçimdir.

Karşılaştırmaya değer alternatifler

Google'ın kendi ürün yelpazesinde Gemini 3 Pro, bu katmanın damıtıldığı temel modeldir ve bir görev Lite katmanının güvenilir biçimde sağlayabileceğinden daha derin bir akıl yürütmeye ihtiyaç duyduğunda daha iyi seçimdir. Google o günden bu yana daha yeni bir Gemini 3.5 Flash-Lite de yayımladı; aynı hız odaklı katmandaki en son kalite iyileştirmelerine duyarlı herhangi bir iş yükünde bunu bu nesille karşılaştırmaya değer.

İsimlendirme hakkında bir not

Tokonomix, daha önceki önizleme sürümünü değil, genel kullanıma açık gemini-3.1-flash-lite modelini satıyor. Önizleme, Google'ın GA öncesinde geri bildirim toplamak için kullandığı ayrı, süreyle sınırlı bir sürümdü; önizleme ile GA arasında davranış ve kalite farklılık gösterebilir, bu nedenle önizlemeye karşı ölçülen sonuçlar üretimde güvenilmeden önce GA modeline karşı yeniden doğrulanmalıdır.

Son otomatik test
14 Eyl 2026 · 20:03 UTC · Hız testi
P50 gecikme
542 ms
P95 gecikme
671 ms
Hatalar
0 / 6 çalıştırma
Son inceleyen Tokonomix Ekibi·14 Eylül 2026