Naar inhoud
Tier C — Specialist
Draait in:USGemaakt in:United States
OpenAI

gpt-5-search-api

Tier C — Specialist

Tokonomix-redactie·Gecontroleerd door Mes Kalkan··

GPT-5-Search-API is een taalmodel ontwikkeld door OpenAI dat standaard tekstgeneratiecapaciteiten integreert met zoekfunctionaliteit. Dit model vertegenwoordigt een evolutie in OpenAI's benadering van informatieophaling en -synthese, ontworpen om de redeneercapaciteiten van grote taalmodellen te combineren met toegang tot actuele informatie via geïntegreerde zoekmechanismen. Het model is gepositioneerd om taken af te handelen die zowel taalbegrip vereisen als het vermogen om externe informatie te raadplegen of op te halen. De technische specificaties van GPT-5-Search-API omvatten standaard tekstgeneratiecapaciteiten, hoewel gedetailleerde parameters zoals modelgrootte en samenstelling van trainingsdata niet publiekelijk zijn vrijgegeven door OpenAI. De lengte van het contextvenster blijft ongespecificeerd in beschikbare documentatie. Het onderscheidende kenmerk van het model is de zoekintegratie, die het differentieert van pure tekstgeneratiemodellen door informatieophaling-workflows mogelijk te maken binnen het generatieproces. Binnen OpenAI's modelportfolio neemt GPT-5-Search-API een gespecialiseerde niche in gericht op zoekondersteunde generatietaken. Het staat naast andere GPT-5-varianten die mogelijk verschillende capaciteitsprofielen of optimalisatiedoelen bieden. Het model is geschikt voor toepassingen die feitelijke informatieophaling vereisen, onderzoeksondersteuning, het beantwoorden van vragen met actuele data, en andere gebruikssituaties waarbij het combineren van taalgeneratie met zoekfunctionaliteit waarde biedt. Het richt zich op ontwikkelaars en organisaties die toepassingen bouwen die profiteren van modellen die zowel coherente tekst kunnen genereren als toegang hebben tot informatie buiten hun trainingsdata.

gpt-5-search-api combineert taalmodelkracht met realtime webzoekfuncties voor actuele antwoorden.

Tokonomix benchmark-samenvatting
Sectie 01

Snelheidsanalyse

Latency gemeten over alle benchmark-runs. P50 (mediaan) en P95 (95e percentiel) geven een realistisch beeld van de responssnelheid onder normale en piekbelasting.

P50 latency (mediaan)P95 latency96 runs
87443587842113251480908-2209-14ms
Sectie 02

Kwaliteitsscores

Hoe dit model zich per promptcategorie verhoudt tot de rest van het veld, uit een paarsgewijze berekening over dezelfde prompts. Het ruwe jurycijfer staat onder elk getal.

66%
Code generatie
jurygemiddelde 99
86%
Creatief
jurygemiddelde 96
61%
Feitelijk
jurygemiddelde 84
53%
Meertaligheid
jurygemiddelde 95
70%
Redeneren
jurygemiddelde 100
87%
Zorg
jurygemiddelde 91

Winstpercentage per categorie: hoe vaak dit model een gemiddeld model verslaat op een prompt uit die categorie. 50% is gemiddeld, geen onvoldoende. Het is geen percentage goede antwoorden.

Sectie 03

Prijzen

Wat je per miljoen tokens betaalt als je dit model via Tokonomix gebruikt, plus een schatting voor een gemiddeld gesprek.

💰
API-tarieven — gpt-5-search-api
$1.63 per 1M input-tokens
$13.00 per 1M output-tokens
≈ $0.0036 per typisch gesprek (800 tokens)
Input vs output prijs (per 1M tokens)
per 1M input-tokens$1.63
per 1M output-tokens$13.00
Sectie 04

Tokens per seconde

Doorvoersnelheid in tokens per seconde, afgeleid uit gemeten P50-latency. Hogere waarden zijn beter; fluctuaties weerspiegelen serverbelasting bij de provider.

Doorvoer (tokens / s)134 / avg 142
22745

Geschat uit P50-latency × 200 output-tokens — het absolute getal hangt af van deze aanname; de trend is wat telt.

Sectie 05

Sterke & zwakke punten

Gebaseerd op benchmark-resultaten en geaggregeerde community-feedback over echte use-cases.

Sterke punten

Realtime webzoekopdrachtenActuele informatie beschikbaarBronvermeldingen bij antwoordenCombinatie van kennis en zoekdataSnelle zoek- en antwoordcyclusBrede webdekking bij queries

Zwakke punten

Meerkosten voor zoekfunctionaliteitIets hogere latentie door zoekopdrachtBeperkte toegang tot afgesloten bronnen
Sectie 06

Mogelijkheden

toolssource: litellmvisionjson modepdf inputjson schemaparallel toolsprompt cachingmax output tokens: 128000
Sectie 07

Veelgestelde vragen

gpt-5-search-api combineert taalmodelcapaciteiten met realtime webzoekopdrachten, waardoor antwoorden actuele informatie bevatten.

Ideaal wanneer actuele informatie en bronvermelding essentieel zijn voor de toepassing.

Tokonomix benchmark-samenvatting
Sectie 08

Beschikbaarheid

Beschikbaarheid

Nog geen meetdata

Er zijn nog niet genoeg API-aanroepen geregistreerd om beschikbaarheidsstatistieken voor dit model te tonen. Data verschijnt zodra het model live verkeer ontvangt.

Sectie 09

Tokonomix benchmark-oordelen

⚖️
Endorsed by 2 judges
Independent LLM judges evaluated this model on our weekly intelligence tests
cohere/command-a100/100 · 1 runs
1 correct0 partial0 wrong100% accuracy
claude-sonnet-4-595/100 · 146 runs
136 correct5 partial5 wrong93% accuracy
2026-09-13

Search API shows significant latency increase and factual accuracy decline

The latest benchmark window reveals concerning performance degradation for gpt-5-search-api. Overall quality dropped 10.1 points to 82.3, while latency increased dramatically from 2.9 seconds to 7.6 seconds at the median—a 161% slowdown that may impact real-time applications. The most striking change appears in category performance: factual accuracy scored only 59, a notable weak point compared to previous windows. However, coding performance remains exceptional at 96, nearly matching the prior window's 97, and reasoning capabilities improved to an impressive 92. The shift in tested categories makes direct comparison challenging, as multilingual and creative assessments from the previous window are absent from current results. The substantial latency increase suggests possible infrastructure changes or expanded search operations per query. Users requiring fast response times should evaluate whether the current performance meets their latency budgets. Those focused on coding and reasoning tasks will find strong capabilities, but applications demanding high factual accuracy may need additional verification layers. The limited test run count of five in each window means these results should be monitored across future benchmarks to confirm whether these trends persist.

Kwaliteit

82.3

Latency p50

7,620 ms

Testruns

5

Latency increased 161% Quality dropped 10.1 points Factual accuracy scores only 59 Coding remains strong at 96
Sectie 10

Volledig modelprofiel

gpt-5-search-api — illustration 1
GPT-5 Search API: GPT-5 met ingebouwde webgrounding

GPT-5 Search API is de search-gegrounde variant van de GPT-5-lijn. Het model haalt eerst actuele webbronnen op voordat het een antwoord genereert, en synthetiseert de opgehaalde inhoud vervolgens tot een antwoord. Het verkoopargument is voor de hand liggend: in plaats van te fabriceren over gebeurtenissen na de post-training-cutoff, zoekt het model ze op. De afwegingen liggen even voor de hand, en ze bepalen waar dit endpoint daadwerkelijk past binnen een productie-stack.

Wat de search-wrapper wel en niet oplost

Het hallucinatieprobleem op de basis-GPT-5-lijn concentreert zich op twee plekken: nichetopics waar de trainingsdata dun is, en actuele gebeurtenissen voorbij de training-cutoff. Search grounding adresseert vooral het tweede, minder het eerste. Wanneer het model een recent artikel over een recente gebeurtenis ophaalt voordat het genereert, wordt het antwoord verankerd in echte tekst in plaats van in zelfverzekerde fabricatie.

Wat de wrapper niet oplost, is de kloof tussen retrieval en synthese. Het model moet nog steeds kiezen wát het ophaalt, beoordelen welke bronnen betrouwbaar zijn en synthetiseren over soms-tegenstrijdige bronnen heen. Elk van die stappen kan falen. Slechte retrieval queries leveren irrelevante bronnen op. Bronranking kan onbetrouwbare pagina's omhoog stuwen. Synthese kan correcte feiten uit één bron mengen met gehallucineerde context die ze aan elkaar lijmt.

Het praktische effect is dat Search API één klasse fouten (training-cutoff hallucinatie) inruilt voor een andere klasse (retrieval-en-synthese-falen). Of die ruil goed uitpakt, hangt af van de workload. Voor actualiteitsvragen is het antwoord meestal ja. Voor statische kennisvragen is het antwoord vaak nee — beter om een basismodel te bevragen en de cutoff te accepteren dan om retrieval-faalmodi te introduceren.

Waar Search API daadwerkelijk past

De duidelijke gevallen zijn vragen waarbij het antwoord afhangt van recente informatie. Nieuwsgerelateerde vragen. Actuele prijzen en beschikbaarheid. Recente softwarereleases. Recente regelgevingswijzigingen. Alles waarvan het juiste antwoord ten tijde van training niet kenbaar was.

Het tweede geval zijn vragen waarbij het antwoord bronvermelding vereist. Sommige downstream-applicaties moeten de gebruiker tonen waar informatie vandaan komt — fact-check workflows, journalistieke tools, onderzoeksassistenten. Search API kan citaties retourneren naast het gesynthetiseerde antwoord, wat de basis-GPT-5-lijn niet kan.

Het derde geval zijn vragen die baat hebben bij grounding, zelfs wanneer de onderliggende kennis in de trainingsdata zit. Het model vragen om het antwoord "op te zoeken" in plaats van te herinneren kan hallucinatie op nichetopics verminderen, omdat het model gedwongen wordt zijn generatie te verzoenen met opgehaalde tekst in plaats van uitsluitend te leunen op parametrisch geheugen.

Onder de motorkap

GPT-5 Search API is de GPT-5 transformer-decoder gekoppeld aan een search-en-retrieval-laag. Het retrievalsysteem bevraagt het web, rankt resultaten en levert de topbronnen als context aan het model, samen met de query van de gebruiker. Het model genereert vervolgens een antwoord dat de opgehaalde inhoud integreert.

Het model zelf is de GPT-5-generatie, met de standaard GPT-5 BPE-tokenisatie. Het contextvenster omvat zowel de prompt van de gebruiker als de opgehaalde inhoud, wat betekent dat opgehaalde bronnen een deel van het beschikbare budget verbruiken — voor queries die veel bronnen ophalen, is de ruimte van het model om te redeneren navenant kleiner.

OpenAI heeft de exacte retrieval-pijplijn, het ranking-algoritme of de criteria voor bronselectie niet gepubliceerd. Het retrievalsysteem maakt deel uit van de OpenAI-infrastructuur en is niet afzonderlijk configureerbaar.

Waar het vandaag staat

Voor actualiteitsvragen en workflows waarbij citaties vereist zijn, produceert het Search API-aanbod merkbaar betere antwoorden dan de basis-GPT-5-lijn. De retrieval verankert de generatie in echte bronnen.

Voor statische kennisvragen is de toegevoegde waarde kleiner en soms negatief. Het basis-GPT-5-model kent al het meeste van wat in goed gedocumenteerde bronnen staat, en de retrieval-stap kan fouten introduceren door slechte bronnen of foute rankingbeslissingen.

Het intelligence leaderboard volgt de vergelijkende positie; Search API zit in een aparte categorie omdat het workloadprofiel aanzienlijk verschilt van niet-gegrounde generatie.

Waar de grenzen liggen

Retrievalkwaliteit is de bottleneck. Het systeem haalt op wat het ophaalt; je controleert niet welke bronnen hoog worden gerankt. Pagina's met hoge SEO-scores kunnen autoritatievere bronnen voorbijstreven. Recente SEO-geoptimaliseerde AI-gegenereerde content verdringt soms originele berichtgeving.

Bronbetrouwbaarheid wordt niet altijd goed afgehandeld. Het model behandelt opgehaalde inhoud als input, wat betekent dat goed opgemaakte desinformatie even autoritair kan worden geciteerd als goed opgemaakte accurate content. Het model markeert niet altijd zorgen over bronbetrouwbaarheid.

Latency is hoger dan de niet-gegrounde basis. Elke query omvat retrieval plus generatie, en de retrieval-roundtrip voegt merkbare tijd toe. Voor interactieve workloads telt dit.

Kosten zijn hoger dan de niet-gegrounde basis. Je betaalt voor de retrieval-infrastructuur plus het grotere contextvenster dat opgehaalde bronnen omvat.

De retrieval-cutoff elimineert hallucinatie niet. Het model kan nog steeds fabriceren binnen de synthesestap, vooral wanneer de opgehaalde bronnen schaars of tegenstrijdig zijn.

Wanneer hiernaar grijpen

Gebruik Search API voor actualiteitsvragen waarbij het juiste antwoord afhangt van recente informatie die niet in de trainingsdata zit.

Gebruik het voor workflows die naast antwoorden bronnen moeten citeren — onderzoek, journalistiek, fact-checking.

Gebruik het voor vragen over nichetopics waarbij retrieval-gegrounde antwoorden doorgaans betrouwbaarder zijn dan parametrische recall, zelfs wanneer het onderwerp in de trainingsdata werd behandeld.

Voor content-workflows waarbij actueel nieuws of recente ontwikkelingen worden samengevat, is de grounding een reëel voordeel. Voor data-extractie waarbij de brondocumenten de eigen inputs van de gebruiker zijn in plaats van opgehaalde webinhoud, gebruik je in plaats daarvan de basis-GPT-5-lijn.

Wanneer het basismodel de juiste keuze is

Sla Search API over voor statische kennisvragen waarbij de trainingsdata volstaat en de retrieval-stap latency, kosten en foutoppervlak toevoegt zonder waarde toe te voegen.

Sla het over voor workflows waarbij je zelf de brondocumenten beheert — interne RAG-systemen met je eigen knowledge base. Bouw de retrieval-pijplijn zelf tegen het basismodel en je krijgt betere controle over bronselectie.

Sla het over voor latency-gevoelige interactieve applicaties waar de retrieval-roundtrip onacceptabel is.

Alternatieven

Voor workloads die search-gegrounde generatie nodig hebben met meer controle over de retrievallaag, geeft het zelf bouwen van een RAG-pijplijn tegen de basis-GPT-5-lijn je betere controle over bronselectie en ranking. De afweging is operationele overhead.

Voor workloads waarbij citatie-gegrounde generatie ertoe doet en je een andere provider wilt, bestaan vergelijkbare search-gegrounde aanbiedingen van andere frontier-providers met wisselende retrievalkwaliteit. Test op je specifieke queryverdeling.

Voor workloads die de training-cutoff op kennis kunnen verdragen, is de basis-GPT-5-lijn in de relevante generatie meestal goedkoper, sneller en voorspelbaarder.

Laatste technische review: 2026-05-22 — Tokonomix.ai

gpt-5-search-api — illustration 2
Laatste automatische test
14 sep 2026 · 20:04 UTC · Snelheidstest
P50 latency
1496 ms
P95 latency
2033 ms
Fouten
0 / 6 runs
Laatst beoordeeld door Tokonomix-team·26 mei 2026