Ir al contenido
Tier C — Especialista
Se ejecuta en:USCreado en:United States
OpenAI

gpt-5-search-api

Tier C — Especialista

Equipo editorial Tokonomix·Revisado por Mes Kalkan··

GPT-5-Search-API es un modelo de lenguaje desarrollado por OpenAI que integra capacidades estándar de generación de texto con funcionalidad de búsqueda. Este modelo representa una evolución en el enfoque de OpenAI hacia la recuperación y síntesis de información, diseñado para combinar las habilidades de razonamiento de los grandes modelos de lenguaje con el acceso a información actualizada mediante mecanismos de búsqueda integrados. El modelo está orientado a tareas que requieren tanto comprensión del lenguaje como la capacidad de consultar o recuperar información externa. Las especificaciones técnicas de GPT-5-Search-API incluyen capacidades estándar de generación de texto, aunque OpenAI no ha divulgado públicamente parámetros detallados como el tamaño del modelo y la composición de los datos de entrenamiento. La longitud de la ventana de contexto no se especifica en la documentación disponible. La característica distintiva del modelo es su integración de búsqueda, lo que lo diferencia de los modelos puros de generación de texto al habilitar flujos de trabajo de recuperación de información dentro del proceso de generación. Dentro de la gama de modelos de OpenAI, GPT-5-Search-API ocupa un nicho especializado centrado en tareas de generación aumentada con búsqueda. Se sitúa junto a otras variantes de GPT-5 que pueden ofrecer distintos perfiles de capacidades u objetivos de optimización. El modelo es adecuado para aplicaciones que requieren recuperación de información factual, asistencia en investigación, respuesta a preguntas con datos actuales y otros casos de uso en los que combinar generación de lenguaje con funcionalidad de búsqueda aporta valor. Se dirige a desarrolladores y organizaciones que construyen aplicaciones que se benefician de modelos capaces tanto de generar texto coherente como de acceder a información más allá de sus datos de entrenamiento.

GPT-5 Search API combina las capacidades de razonamiento avanzado de GPT-5 con acceso a búsqueda web, ofreciendo respuestas informadas con datos actuales.

Resumen de benchmark Tokonomix
Sección 01

Análisis de velocidad

Latencia medida en todas las ejecuciones de benchmark. P50 (mediana) y P95 (percentil 95) dan una imagen realista de la velocidad de respuesta bajo carga normal y máxima.

Latencia P50 (mediana)Latencia P9596 runs
87443587842113251480908-2209-14ms
Sección 02

Puntuaciones de calidad

Cómo se sitúa este modelo frente al resto del campo en cada categoría de prompts, a partir de un ajuste por pares sobre los mismos prompts. La nota bruta del juez aparece debajo de cada número.

66%
Generación de código
media del juez 99
86%
Creativo
media del juez 96
61%
Factual
media del juez 84
53%
Multilingüe
media del juez 95
70%
Razonamiento
media del juez 100
87%
Salud
media del juez 91

Tasa de victorias por categoría: con qué frecuencia este modelo vence a un modelo medio en un prompt de esa categoría. 50% es la media, no un suspenso. No es un porcentaje de aciertos.

Sección 03

Precios

Lo que pagas por millón de tokens al usar este modelo en Tokonomix, más una estimación para una conversación típica.

💰
Tarifas API — gpt-5-search-api
$1.63 por 1M de tokens de entrada
$13.00 por 1M de tokens de salida
≈ $0.0036 por conversación típica (800 tokens)
Precio entrada vs salida (por 1M de tokens)
por 1M de tokens de entrada$1.63
por 1M de tokens de salida$13.00
Sección 04

Tokens por segundo

Rendimiento en tokens por segundo, derivado de la latencia P50 medida. Más alto es mejor; las fluctuaciones reflejan la carga del lado del proveedor.

Rendimiento (tokens / s)134 / avg 142
22745

Estimado a partir de latencia P50 × 200 tokens de salida — el número absoluto depende de esta suposición; lo que importa es la tendencia.

Sección 05

Fortalezas & debilidades

Basado en resultados de benchmarks y comentarios agregados de la comunidad sobre casos de uso reales.

Fortalezas

Búsqueda web integrada con GPT-5Razonamiento avanzado sobre resultadosInformación actualizada en tiempo realSíntesis con citas de fuentesAnálisis de información recienteConsultas sobre noticias y eventos actuales

Debilidades

Mayor latencia por búsqueda webContexto no documentadoDependiente de la calidad de fuentes webCosto mayor por incluir búsqueda
Sección 06

Capacidades

toolssource: litellmvisionjson modepdf inputjson schemaparallel toolsprompt cachingmax output tokens: 128000
Sección 07

Preguntas frecuentes

Preguntas sobre eventos posteriores al corte de entrenamiento, información de mercado actualizada y fact-checking en tiempo real.

La combinación de razonamiento GPT-5 con búsqueda en tiempo real representa el estado del arte en asistentes de información actualizados.

Resumen de benchmark Tokonomix
Sección 08

Disponibilidad

Disponibilidad

Sin datos todavía

Aún no hemos registrado suficientes llamadas a la API para mostrar estadísticas de disponibilidad de este modelo. Los datos aparecen una vez que el modelo comienza a recibir tráfico en vivo.

Sección 09

Veredictos del benchmark Tokonomix

⚖️
Endorsed by 2 judges
Independent LLM judges evaluated this model on our weekly intelligence tests
cohere/command-a100/100 · 1 runs
1 correct0 partial0 wrong100% accuracy
claude-sonnet-4-595/100 · 146 runs
136 correct5 partial5 wrong93% accuracy
2026-09-13

Search API shows significant latency increase and factual accuracy decline

The latest benchmark window reveals concerning performance degradation for gpt-5-search-api. Overall quality dropped 10.1 points to 82.3, while latency increased dramatically from 2.9 seconds to 7.6 seconds at the median—a 161% slowdown that may impact real-time applications. The most striking change appears in category performance: factual accuracy scored only 59, a notable weak point compared to previous windows. However, coding performance remains exceptional at 96, nearly matching the prior window's 97, and reasoning capabilities improved to an impressive 92. The shift in tested categories makes direct comparison challenging, as multilingual and creative assessments from the previous window are absent from current results. The substantial latency increase suggests possible infrastructure changes or expanded search operations per query. Users requiring fast response times should evaluate whether the current performance meets their latency budgets. Those focused on coding and reasoning tasks will find strong capabilities, but applications demanding high factual accuracy may need additional verification layers. The limited test run count of five in each window means these results should be monitored across future benchmarks to confirm whether these trends persist.

Calidad

82.3

Latencia p50

7,620 ms

Ejecuciones de test

5

Latency increased 161% Quality dropped 10.1 points Factual accuracy scores only 59 Coding remains strong at 96
Sección 10

Perfil completo del modelo

gpt-5-search-api — illustration 1
GPT-5 Search API: GPT-5 con grounding web cableado

GPT-5 Search API es la variante con grounding de búsqueda de la línea GPT-5. El modelo recupera información de fuentes web actuales antes de generar una respuesta y, a continuación, sintetiza el contenido recuperado en una respuesta. El argumento de venta es el evidente: en lugar de inventar acerca de eventos posteriores al corte de entrenamiento, el modelo los consulta. Los compromisos también son evidentes, y son los que determinan dónde encaja realmente este endpoint en un stack de producción.

Qué resuelve y qué no resuelve la capa de búsqueda

El problema de alucinación en la línea base de GPT-5 se concentra en dos puntos: temas de nicho donde los datos de entrenamiento son escasos, y eventos actuales posteriores al corte de entrenamiento. El grounding de búsqueda aborda el segundo más que el primero. Cuando el modelo recupera un artículo actual sobre un evento reciente antes de generar, la respuesta queda anclada en texto real en lugar de en una fabricación confiada.

Lo que la capa no resuelve es la brecha entre recuperación y síntesis. El modelo todavía tiene que elegir qué recuperar, juzgar qué fuentes son fiables y sintetizar entre fuentes a veces contradictorias. Cada uno de esos pasos puede fallar. Consultas de recuperación deficientes devuelven fuentes irrelevantes. El ranking de fuentes puede promocionar páginas poco fiables. La síntesis puede mezclar hechos correctos de una fuente con contexto alucinado que los enlaza entre sí.

El efecto práctico es que Search API cambia una clase de error (alucinación por corte de entrenamiento) por otra clase distinta (fallos de recuperación y síntesis). Si ese intercambio es bueno depende de la carga de trabajo. Para consultas sobre eventos actuales la respuesta suele ser que sí. Para consultas sobre conocimiento estático la respuesta es a menudo que no: es mejor consultar al modelo base y aceptar el corte que introducir los modos de fallo de la recuperación.

Dónde encaja realmente Search API

Los casos claros son consultas donde la respuesta depende de información reciente. Preguntas relacionadas con noticias. Precios y disponibilidad actuales. Lanzamientos de software recientes. Cambios regulatorios recientes. Cualquier cosa donde la respuesta correcta no fuera conocible en el momento del entrenamiento.

El segundo caso son consultas donde la respuesta requiere citar fuentes. Algunas aplicaciones aguas abajo necesitan mostrar al usuario de dónde proviene la información: flujos de trabajo de verificación de hechos, herramientas periodísticas, asistentes de investigación. Search API puede devolver citas junto con la respuesta sintetizada, algo que la línea base de GPT-5 no puede.

El tercer caso son consultas que se benefician del grounding incluso cuando el conocimiento subyacente está en los datos de entrenamiento. Pedir al modelo que "busque" la respuesta en lugar de recordarla puede reducir la alucinación en temas de nicho, porque el modelo se ve obligado a reconciliar su generación con texto recuperado en lugar de apoyarse únicamente en la memoria paramétrica.

Bajo el capó

GPT-5 Search API es el decoder transformer de GPT-5 emparejado con una capa de búsqueda y recuperación. El sistema de recuperación consulta la web, clasifica los resultados y suministra las principales fuentes como contexto al modelo junto con la consulta del usuario. El modelo genera entonces una respuesta que integra el contenido recuperado.

El modelo en sí es la generación GPT-5, con la tokenización BPE estándar de GPT-5. La ventana de contexto incluye tanto el prompt del usuario como el contenido recuperado, lo que significa que las fuentes recuperadas consumen parte del presupuesto disponible: para consultas que recuperan muchas fuentes, el margen del modelo para razonar es proporcionalmente menor.

OpenAI no ha publicado el pipeline de recuperación exacto, el algoritmo de ranking ni los criterios de selección de fuentes. El sistema de recuperación forma parte de la infraestructura de OpenAI y no es configurable por separado.

Dónde se sitúa hoy

Para consultas sobre eventos actuales y flujos de trabajo que requieren citas, la oferta Search API produce respuestas significativamente mejores que la línea base de GPT-5. La recuperación ancla la generación en fuentes reales.

Para consultas sobre conocimiento estático el valor añadido es menor y, en ocasiones, negativo. El modelo GPT-5 base ya conoce la mayor parte de lo que está en fuentes bien documentadas, y el paso de recuperación puede introducir errores procedentes de fuentes pobres o de decisiones de ranking deficientes.

El intelligence leaderboard realiza el seguimiento de la posición comparativa; Search API se encuentra en una categoría aparte porque el perfil de la carga de trabajo difiere significativamente de la generación sin grounding.

Dónde están los límites

La calidad de la recuperación es el cuello de botella. El sistema recupera lo que recupera; tú no controlas qué fuentes son clasificadas en lo alto del ranking. Páginas con puntuaciones SEO altas pueden situarse por encima de fuentes más autorizadas. Contenido reciente optimizado para SEO y generado por IA a veces desplaza al reportaje original.

La fiabilidad de las fuentes no siempre se gestiona bien. El modelo trata el contenido recuperado como entrada, lo que significa que la desinformación bien formateada puede ser citada con la misma autoridad que el contenido preciso bien formateado. El modelo no siempre señala las preocupaciones sobre la fiabilidad de las fuentes.

La latencia es mayor que la del modelo base sin grounding. Cada consulta implica recuperación más generación, y el viaje de ida y vuelta de la recuperación añade un tiempo perceptible. Para cargas de trabajo interactivas esto importa.

El coste es mayor que el de la base sin grounding. Estás pagando por la infraestructura de recuperación más la ventana de contexto ampliada que incluye las fuentes recuperadas.

El corte de recuperación no elimina la alucinación. El modelo todavía puede inventar dentro del paso de síntesis, especialmente cuando las fuentes recuperadas son escasas o contradictorias.

Cuándo recurrir a ella

Usa Search API para consultas sobre eventos actuales donde la respuesta correcta depende de información reciente que no está en los datos de entrenamiento.

Úsala para flujos de trabajo que necesitan citar fuentes junto con las respuestas: investigación, periodismo, verificación de hechos.

Úsala para consultas sobre temas de nicho donde las respuestas ancladas por recuperación tienden a ser más fiables que el recuerdo paramétrico, incluso cuando el tema estaba cubierto en los datos de entrenamiento.

Para flujos de contenido que implican resumir noticias actuales o desarrollos recientes, el grounding es una ventaja real. Para extracción de datos donde los documentos fuente son las propias entradas del usuario en lugar de contenido web recuperado, utiliza en su lugar la línea base de GPT-5.

Cuándo la base es la elección correcta

Sáltate Search API para consultas sobre conocimiento estático donde los datos de entrenamiento son suficientes y el paso de recuperación añade latencia, coste y superficie de error sin aportar valor.

Sáltatela para flujos de trabajo donde tú controlas los documentos fuente: sistemas RAG internos con tu propia base de conocimiento. Construye tú mismo el pipeline de recuperación contra el modelo base y obtendrás un mejor control sobre la selección de fuentes.

Sáltatela para aplicaciones interactivas sensibles a la latencia donde el viaje de ida y vuelta de la recuperación es inaceptable.

Alternativas

Para cargas de trabajo que necesitan generación anclada por búsqueda con más control sobre la capa de recuperación, construir tu propio pipeline RAG contra la línea base de GPT-5 te da un mejor control sobre la selección y el ranking de fuentes. El compromiso es la sobrecarga operativa.

Para cargas de trabajo donde la generación anclada por citas importa y deseas un proveedor distinto, existen ofertas similares con grounding de búsqueda de otros proveedores frontera con calidades de recuperación variables. Pruébalas sobre tu distribución específica de consultas.

Para cargas de trabajo que pueden tolerar el límite del corte de entrenamiento en el conocimiento, la línea base de GPT-5 en la generación relevante suele ser más barata, más rápida y más predecible.

Última revisión técnica: 2026-05-22 — Tokonomix.ai

gpt-5-search-api — illustration 2
Última prueba automática
14 sept 2026 · 20:04 UTC · Benchmark de velocidad
Latencia P50
1496 ms
Latencia P95
2033 ms
Errores
0 / 6 ejecuciones
Última revisión por Equipo Tokonomix·26 de mayo de 2026