Ir al contenido
Tier B — Producción
Se ejecuta en:USCreado en:United States

Fecha de retirada

El proveedor indica el 7 de mayo de 2027 como fecha de retirada provisional. Por ahora el modelo funciona con normalidad.

Google Gemini

Gemini 3.1 Flash Lite

Tier B — Producción · 1.048576M tokens

Equipo editorial Tokonomix·Revisado por Mes Kalkan·
Sección 01

Análisis de velocidad

Latencia medida en todas las ejecuciones de benchmark. P50 (mediana) y P95 (percentil 95) dan una imagen realista de la velocidad de respuesta bajo carga normal y máxima.

Latencia P50 (mediana)Latencia P9596 runs
288520752984121608-2209-14ms
Sección 02

Puntuaciones de calidad

Cómo se sitúa este modelo frente al resto del campo en cada categoría de prompts, a partir de un ajuste por pares sobre los mismos prompts. La nota bruta del juez aparece debajo de cada número.

55%
Generación de código
media del juez 93
42%
Creativo
media del juez 82
70%
Factual
media del juez 85
59%
Multilingüe
media del juez 99
74%
Razonamiento
media del juez 99

Tasa de victorias por categoría: con qué frecuencia este modelo vence a un modelo medio en un prompt de esa categoría. 50% es la media, no un suspenso. No es un porcentaje de aciertos.

Sección 03

Precios

Lo que pagas por millón de tokens al usar este modelo en Tokonomix, más una estimación para una conversación típica.

💰
Tarifas API — Gemini 3.1 Flash Lite
$0.4900 por 1M de tokens de entrada
$2.93 por 1M de tokens de salida
≈ $0.0009 por conversación típica (800 tokens)
Precio entrada vs salida (por 1M de tokens)
por 1M de tokens de entrada$0.4900
por 1M de tokens de salida$2.93
Sección 04

Tokens por segundo

Rendimiento en tokens por segundo, derivado de la latencia P50 medida. Más alto es mejor; las fluctuaciones reflejan la carga del lado del proveedor.

Rendimiento (tokens / s)369 / avg 389
688208

Estimado a partir de latencia P50 × 200 tokens de salida — el número absoluto depende de esta suposición; lo que importa es la tendencia.

Sección 05

Capacidades

toolssource: litellmvisionjson modepdf inputreasoningaudio inputjson schemaparallel toolsprompt cachingoutputTokenLimit: 65536max output tokens: 65536
Sección 06

Disponibilidad

Disponibilidad

Con qué frecuencia responde este modelo cuando lo llamamos — medido en solicitudes reales de API y pruebas en vivo durante los últimos 30 días. Esto es independiente de la calidad: estos números solo indican si el modelo responde, no qué tan buena es la respuesta.

Últimos 7 días

100.0%

n=8

Últimos 30 días

100.0%

n=8

Tiempo de respuesta mediano

5,288ms

n=8

Basado en 321 mediciones en los últimos 30 días.

Detalles técnicos

Solo cuentan las llamadas reales a la API y las solicitudes de prueba en vivo — las sondas internas y las ejecuciones de referencia están excluidas.

Las llamadas con una clave API propia (BYOK) están excluidas: esos fallos son específicos de la clave, no una señal de inactividad del modelo.

Las llamadas fallidas NO se incluyen en las puntuaciones de calidad — la calidad se mide solo en respuestas exitosas. Disponibilidad y calidad son señales independientes.

Tiempo de respuesta mediano (p50) en llamadas exitosas con una duración registrada. Los valores atípicos afectan menos a la mediana que a la media.

Total de llamadas (30d)

8

Respuestas OK (30d)

8

Total de llamadas (7d)

8

Respuestas OK (7d)

8

Sección 07

Veredictos del benchmark Tokonomix

⚖️
Endorsed by 2 judges
Independent LLM judges evaluated this model on our weekly intelligence tests
cohere/command-a100/100 · 1 runs
1 correct0 partial0 wrong100% accuracy
claude-sonnet-4-593/100 · 82 runs
71 correct6 partial5 wrong87% accuracy
2026-09-13

Quality gains of 6.8 points offset by 20% latency regression

Gemini 3.1 Flash Lite demonstrates meaningful quality improvements in this benchmark window, climbing from 77.2 to 84.0 overall. The most striking change appears in reasoning performance, which reached a perfect 100 score compared to its absence in previous testing. Factual response quality measured at 65, representing a new category in this evaluation period. Coding performance decreased from 95 to 87, indicating some regression in code generation capabilities despite the overall quality gains. Latency characteristics shifted notably, with p50 response times increasing from 1472ms to 1762ms, representing a 20% slowdown. This timing regression may impact user experience in latency-sensitive applications, though the model remains within reasonable response parameters for most use cases. The model previously excelled at multilingual tasks with a score of 92, though this category was not evaluated in the current window. Creative output had scored 45 previously, suggesting room for improvement in generative tasks. The current benchmark window shows a model that has strengthened its reasoning capabilities and maintained solid coding performance, though users should be aware of the latency tradeoff and the noted decline in code generation quality from previous levels.

Calidad

84.0

Latencia p50

1,762 ms

Ejecuciones de test

5

Quality improved 6.8 points Reasoning reached perfect score Latency increased 20% Coding dropped from 95 to 87
Sección 08

Perfil completo del modelo

Gemini 3.1 Flash-Lite: el caballo de batalla de alto volumen de Google, construido para la velocidad antes que la profundidad

Gemini 3.1 Flash-Lite es el modelo más ligero de la línea Gemini 3 de Google, construido sobre la base de Gemini 3 Pro y posicionado por Google como el modelo más rápido y rentable de esa generación. Una versión preliminar (preview) salió el 3 de marzo de 2026, y después llegó la versión de disponibilidad general que se vende aquí; Google no ha publicado una fecha de disponibilidad general específica. Google mide sus ganancias de velocidad frente a Gemini 2.5 Flash, y posiciona el modelo para cargas de trabajo que se ejecutan a escala y necesitan una respuesta rápida, más que para las tareas de razonamiento más exigentes.

Dónde destaca

Google recomienda este nivel para traducción, moderación de contenido, generación de interfaces de usuario y paneles, ejecución de simulaciones y seguimiento de instrucciones en general a gran volumen — tareas donde la latencia por solicitud y el rendimiento importan más que exprimir el último punto de calidad de razonamiento. Según Google, el modelo ofrece un tiempo hasta el primer token 2,5 veces más rápido y una velocidad de salida un 45% mayor que Gemini 2.5 Flash, que es la razón práctica para recurrir a él: una canalización que envía miles de solicitudes al día se beneficia mucho más de una latencia baja y constante que de mejoras marginales de precisión en una sola llamada.

A pesar de la etiqueta "lite", Google reporta puntuaciones respetables en conocimiento general y razonamiento multimodal: 86,9% en GPQA Diamond y 76,8% en MMMU-Pro, según las propias cifras publicadas por Google. Es genuinamente multimodal en la entrada, aceptando texto, imágenes, audio y video, con una ventana de contexto de 1.000.000 de tokens para la entrada.

Bajo el capó

La salida está limitada a 65.536 tokens y es solo de texto — este nivel no genera imágenes ni audio, solo razona sobre ellos. Las llamadas a herramientas, la salida JSON estructurada contra un esquema y la caché de prompts están todas soportadas, así que encaja en canalizaciones que necesitan extracción estructurada fiable en lugar de chat de formato libre.

Dónde se queda corto

El único punto débil claramente documentado es la recuperación de contexto largo. En el propio benchmark de contexto largo MRCR v2 de Google, el modelo puntúa 60,1% con un contexto de 128k tokens y cae a 12,3% con la ventana completa de 1.000.000 de tokens. En términos prácticos: la ventana de contexto es lo bastante grande para aceptar un documento muy largo, pero la capacidad del modelo para recuperar con precisión un detalle concreto de ese documento se degrada sustancialmente a medida que la entrada se acerca al límite. Para cargas de trabajo que realmente necesitan una recuperación fiable cerca de la cima de una ventana de un millón de tokens, este no es el nivel adecuado — hay que recurrir a un modelo Gemini más grande. Tampoco es, por diseño, el modelo al que recurrir para las tareas de razonamiento o programación agéntica más difíciles; Google lo construyó para el volumen y la velocidad, no para la capacidad de frontera.

Cuándo elegirlo

Elige Flash-Lite para trabajo de alto volumen y sensible a la latencia: traducción masiva, colas de moderación, clasificación a escala, generación de interfaces o paneles a partir de entrada estructurada, o cualquier canalización donde el mismo tipo de solicitud se ejecute miles de veces al día. Encaja mal en tareas que necesitan razonamiento de frontera o recuperación fiable de documentos muy largos.

Alternativas que vale la pena comparar

Dentro de la propia gama de Google, Gemini 3 Pro es el modelo base del que se destila este nivel, y es la mejor opción cuando una tarea necesita un razonamiento más profundo del que el nivel Lite puede ofrecer de forma fiable. Google también ha lanzado desde entonces un Gemini 3.5 Flash-Lite más nuevo, que vale la pena comparar con esta generación en cualquier carga de trabajo sensible a las últimas mejoras de calidad en el mismo nivel centrado en la velocidad.

Una nota sobre el nombre

Tokonomix vende la versión de disponibilidad general gemini-3.1-flash-lite, no la versión preliminar anterior. La preview fue un lanzamiento separado y de duración limitada que Google usó para recoger comentarios antes de la disponibilidad general; el comportamiento y la calidad entre la preview y la versión GA pueden diferir, así que los resultados medidos contra la preview deberían reverificarse contra el modelo GA antes de depender de ellos en producción.

Última prueba automática
14 sept 2026 · 20:03 UTC · Benchmark de velocidad
Latencia P50
542 ms
Latencia P95
671 ms
Errores
0 / 6 ejecuciones
Última revisión por Equipo Tokonomix·14 de septiembre de 2026