Naar inhoud
Tier C — Specialist
Draait in:USGemaakt in:United States
Google Gemini

Gemini 3.1 Pro Preview Custom Tools

Tier C — Specialist · 1.048576M tokens

Tokonomix-redactie·Gecontroleerd door Mes Kalkan··

Gemini 3.1 Pro Preview Custom Tools is een experimentele versie van Google's Gemini 3.1 Pro model die uitgebreide mogelijkheden voor tool-gebruik integreert. Deze variant is ontworpen voor ontwikkelaars en onderzoekers die geavanceerde functie-aanroepen en externe tool-integratie binnen large language model applicaties verkennen. Het stelt het model in staat om te interageren met aangepaste API's, databases en externe diensten via een gestructureerde tool-aanroep interface, waardoor het geschikt is voor het bouwen van complexe AI-agenten en workflow-automatiseringssystemen. Het model beschikt over een contextvenster van ongeveer 1,048 miljoen tokens, waardoor het extreem lange gesprekken, documenten of meerstapsredeneerketens kan verwerken en behouden. Deze uitgebreide contextcapaciteit is bijzonder waardevol voor applicaties die analyse van langdurige codebases, uitgebreide documentbeoordeling of verlengde dialoogsessies vereisen. Het model biedt standaard tekstgeneratiemogelijkheden naast zijn verbeterde tool-gebruik functionaliteit, en ondersteunt zowel conversationele AI-applicaties als taakgerichte implementaties die externe datatoegang of actie-uitvoering vereisen. Binnen Google's modelaanbod staat deze variant als een gespecialiseerde preview-release van de Gemini 3.1 Pro tier, gepositioneerd tussen standaard productiemodellen en geavanceerde experimentele releases. Het biedt ontwikkelaars vroege toegang tot Google's evoluerende tool-gebruik architectuur, terwijl het de kern redeneringen generatiemogelijkheden van de Gemini 3.1 Pro basis behoudt. De "Preview" aanduiding geeft aan dat dit een pre-release versie is bedoeld voor testen en feedback in plaats van productie-implementatie.

Gemini 3.1 Pro Preview Custom Tools is geoptimaliseerd voor snelheid en kostenefficiëntie bij hoge verwerkingsvolumes.

Tokonomix benchmark-samenvatting
Sectie 01

Kwaliteitsscores

Hoe dit model zich per promptcategorie verhoudt tot de rest van het veld, uit een paarsgewijze berekening over dezelfde prompts. Het ruwe jurycijfer staat onder elk getal.

4%
Code generatie
jurygemiddelde 37
38%
Creatief
jurygemiddelde 90
42%
Feitelijk
jurygemiddelde 66
19%
Meertaligheid
jurygemiddelde 39
13%
Redeneren
jurygemiddelde 19
3%
Zorg
jurygemiddelde 12

Winstpercentage per categorie: hoe vaak dit model een gemiddeld model verslaat op een prompt uit die categorie. 50% is gemiddeld, geen onvoldoende. Het is geen percentage goede antwoorden.

Sectie 02

Prijzen

Wat je per miljoen tokens betaalt als je dit model via Tokonomix gebruikt, plus een schatting voor een gemiddeld gesprek.

💰
API-tarieven — Gemini 3.1 Pro Preview Custom Tools
$2.60 per 1M input-tokens
$15.60 per 1M output-tokens
≈ $0.0047 per typisch gesprek (800 tokens)
Input vs output prijs (per 1M tokens)
per 1M input-tokens$2.60
per 1M output-tokens$15.60
Sectie 03

Sterke & zwakke punten

Gebaseerd op benchmark-resultaten en geaggregeerde community-feedback over echte use-cases.

Sterke punten

Extreem snelle responstijdenLage kosten per queryHoog volume verwerkenGeschikt voor edge-toepassingenEenvoudige API-integratieMeertalige basisfunctionaliteit

Zwakke punten

Beperkter redeneer-vermogenMinder gedetailleerde analysesSlechter bij complexe opdrachtenKleiner contextvenster dan groot model
Sectie 04

Mogelijkheden

toolssource: litellmvisionjson modepdf inputreasoningaudio inputjson schemaprompt cachingoutputTokenLimit: 65536max output tokens: 65536
Sectie 05

Veelgestelde vragen

Gemini 3.1 Pro Preview Custom Tools is ideaal voor hoog-volume toepassingen zoals classificatie, samenvatting, eenvoudige Q&A en chatbot-basisrespons waar snelheid en kosten prioriteit hebben.

De slimme keuze voor schaalbare toepassingen waarbij elke milliseconde en cent telt.

Tokonomix benchmark-samenvatting
Sectie 06

Beschikbaarheid

Beschikbaarheid

Hoe vaak dit model antwoordt als we het aanroepen — gemeten over echte API-aanvragen en live-tests in de afgelopen 30 dagen. Dit staat los van kwaliteit: deze cijfers laten alleen zien of het model reageert, niet hoe goed het antwoord is.

Afgelopen 7 dagen

0.0%

n=1

Afgelopen 30 dagen

0.0%

n=1

Gebaseerd op 1 metingen in de afgelopen 30 dagen.

Technische details

Alleen echte API-aanroepen en live-testverzoeken tellen mee — interne probes en benchmarkruns zijn uitgesloten.

Aanroepen met een eigen API-sleutel (BYOK) zijn uitgesloten: die fouten zijn sleutelspecifiek en geen teken van modelneergang.

Mislukte aanroepen worden NIET meegeteld in kwaliteitsscores — kwaliteit wordt gemeten op geslaagde responses. Beschikbaarheid en kwaliteit zijn onafhankelijke signalen.

Totaal aanroepen (30d)

1

OK-reacties (30d)

0

Totaal aanroepen (7d)

1

OK-reacties (7d)

0

Sectie 07

Tokonomix benchmark-oordelen

⚖️
Endorsed by 1 judge
Independent LLM judges evaluated this model on our weekly intelligence tests
claude-sonnet-4-544/100 · 91 runs
31 correct12 partial48 wrong34% accuracy
2026-09-13

Gemini 3.1 Pro Preview Custom Tools debuts with eight capabilities

Gemini 3.1 Pro Preview Custom Tools enters benchmarking as a new model variant with a substantial feature set. The model launches with eight capabilities including tools, vision, JSON mode, PDF input, reasoning, audio input, JSON schema, and prompt caching. This represents Google's expansion of the Gemini 3.1 Pro lineup with a specialized version emphasizing custom tooling support. As a preview release, this model appears positioned for developers requiring multimodal processing combined with structured outputs and function calling. The inclusion of prompt caching suggests optimization for repeated interactions with similar contexts. Without performance benchmark data from the current or previous windows, the model's computational efficiency and accuracy remain uncharted. The broad capability profile indicates versatility across text, vision, and audio modalities, though real-world performance validation is pending. Users should treat this as an early-access offering where feature availability is established but production-readiness requires further evaluation through hands-on testing and community feedback.

Kwaliteit

Latency p50

Testruns

0

Eight capabilities at launch Multimodal support included Custom tools and JSON schema No benchmark performance data
Sectie 08

Volledig modelprofiel

Gemini 3.1 Pro Preview Custom Tools — illustration 1
Gemini 3.1 Pro Preview Custom Tools: de agent-lus specialist

Let op — vooruitblikkend profiel. Gemini 3.1 Pro Preview Custom Tools (gemini-3.1-pro-preview-customtools) is een preview-snapshot. Gedrag, mogelijkheden en rate limits veranderen vóór algemene beschikbaarheid.

Een gespecialiseerde variant van de 3.1 Pro Preview gebouwd voor workloads die sterk leunen op gestructureerde tool-integratie. Een context window van 1.048.576 tokens. Tekst- én vision-input. Hetzelfde onderliggende mogelijkhedenoppervlak als de basis 3.1 Pro Preview, plus verbeterd tool-use-gedrag afgestemd voor productie-agent-lussen.

Als je een agent-systeem hebt gebouwd bovenop een top-tier Gemini-model en je hebt gemerkt dat je defensieve parsinglagen schrijft rondom tool-call-output, is deze variant gebouwd voor jouw situatie.

Wat "Custom Tools" werkelijk toevoegt

De Custom Tools-variant is hetzelfde onderliggende model met specifieke training en inferentie-tijdafstemming voor tool-integratie. De verschillen met de basis 3.1 Pro Preview zien er zo uit:

  • Betrouwbaardere tool-call-payloads onder complexe schema's. De basis 3.1 Pro Preview is al sterk hier; de Custom Tools-variant is sterker.
  • Betere verwerking van lange tool-resultatenketens waarbij het model output van één tool moet interpreteren om te beslissen welke tool daarna aan te roepen.
  • Schonere foutherstel als een tool een onverwacht resultaat teruggeeft of volledig faalt.
  • Verbeterde adherentie aan tool-use-beleid — instructies over wanneer tools aan te roepen, wanneer de gebruiker te vragen, wanneer te weigeren.
  • Consistentere zichtbaarheid van redenering wanneer de agent beslist tussen meerdere tool-opties.

De basis 3.1 Pro Preview dekt de meeste workloads. De Custom Tools-variant is voor workloads waarbij de marginale verbetering in agent-lus-betrouwbaarheid genoeg waarde heeft om het gespecialiseerde model te rechtvaardigen.

Wat het goed doet

Erft de onderliggende 3.1 Pro Preview-sterktes. Het 1M context window met aandachtskwaliteit die op diepte standhoudt. Sterke multimodale verwerking. Top-tier redeneerdiepte. Native vision-input.

Daarboven de tool-use-polish. Productie-agent-lussen die eerder defensieve parsinglagen, retry-harnesses of zorgvuldige schema-engineering vereisten werken doorgaans schoner out-of-the-box op deze variant.

Het latency-profiel is vergelijkbaar met de basis 3.1 Pro Preview. De Custom Tools-afstemming voegt geen betekenisvolle latency-overhead toe.

Wat het slecht doet

Preview-tier-overwegingen gelden. Rate limits, regionale beschikbaarheid en specifiek gedrag kunnen verschuiven.

Voor workloads die niet sterk op tool-integratie leunen, levert de Custom Tools-variant marginale meerwaarde ten opzichte van de basis 3.1 Pro Preview. De gespecialiseerde afstemming is gebouwd voor tool-zware workloads; voor chat-achtige of extractie-achtige use cases is de basisvariant het juiste startpunt.

Kosten-per-call op de Pro-tier zijn betekenisvol. Voor hoogvolume-agent-lussen hangt de kostencase af van of de betrouwbaarheidsverbeteringen de uitgave bij schaal compenseren.

Self-hosted deployment is niet beschikbaar. Google levert geen Gemini-weights.

Waar het uitblinkt

Workloads waarbij de Custom Tools-variant zijn gespecialiseerde positionering verdient:

  • Productie-agent-lussen die veel tool-calls per taak orchestreren en hoge betrouwbaarheid over de keten nodig hebben.
  • Complexe tool-ecosystemen met diep geneste schema's waarbij schema-adherentie onder druk telt.
  • Workflows waarbij tool-outputs zelf complex zijn en het model ze zorgvuldig moet interpreteren om te beslissen wat te doen.
  • Agent-systemen met strikte tool-use-beleidsregels — wanneer tools aan te roepen, wanneer te escaleren — waarbij adherentie aan die beleidsregels het operationele ontwerp bepaalt.
  • Use cases waarbij de kosten van een agent-lus-faling hoog genoeg zijn dat de marginale betrouwbaarheidsverbetering het gespecialiseerde model rechtvaardigt.

Wanneer het het verkeerde gereedschap is

Workloads die niet sterk op tools leunen. De basis 3.1 Pro Preview is het juiste startpunt — zelfde modeloppervlak, bredere toepasbaarheid.

Productie-workloads die vandaag stabiel gedrag nodig hebben. De basis 2.5 Pro dekt tool-use solide voor de meeste workloads.

Hoogvolume goedkope classificatie of korte-prompt-werk. Top-tier compute is de verkeerde kostvorm voor deze workloads.

Alles buiten tekst-plus-vision-input. Voice, audio, video zijn andere modelfamilies.

Vergelijking met alternatieven

Vergeleken met de basis 3.1 Pro Preview: marginale verbetering op tool-use-betrouwbaarheid voor tool-zware workloads. Voor niet-tool-zwaar werk is de basisvariant de juiste keuze.

Vergeleken met 2.5 Pro met aangepast tool-use-prompting: voor workloads waarbij je al geïnvesteerd hebt in zorgvuldige prompt-engineering en defensieve parsing rondom 2.5 Pro's tool-use-gedrag, hangt de migratierekensom af van of de Custom Tools-variant die omringende architectuur betekenisvol vereenvoudigt.

Vergeleken met Claude Opus met tool-use ingeschakeld: Opus heeft zijn eigen sterke tool-use-gedrag met de Anthropic-stijl weigerhouding. Voor workloads waarbij Opus-stijl zorgvuldige redenering beter past, is dat de juiste keuze. Voor workloads waarbij Gemini's snellere, directere output beter past, is de Custom Tools-variant de meer agent-lus-georiënteerde keuze.

Praktische patronen

Dingen de moeite waard om te weten voor je op de Custom Tools-variant bouwt:

  • Schema-ontwerp telt net zo hard als modelkeuze. Zelfs een sterk tool-use-model profiteert van duidelijke, goed-getypte schema's met expliciete velddocumentatie.
  • Tool-beschrijvingen in de system prompt hebben echte invloed. Vage beschrijvingen produceren inconsistente tool-selectie; specifieke beschrijvingen met voorbeelden produceren betrouwbaarder gedrag.
  • Lange agent-lussen profiteren nog steeds van expliciete staptellers en reset-mechanismen.
  • Het model verwerkt tool-fouten gracieuzer dan de basisvariant, maar downstream-systemen moeten nog steeds occasionele onjuiste tool-selecties verwachten.
  • Voor workloads die tool-use mixen met vision of langcontextredenering, erft de Custom Tools-variant de onderliggende 3.1 Pro Preview-sterktes op beide dimensies.

Deployment

Standaard Google Gemini API. De Custom Tools-variant gebruikt hetzelfde surface als de basis 3.1 Pro Preview, met dezelfde parameterstructuur voor tool-integratie.

Regionale beschikbaarheid volgt het standaard Vertex AI-patroon van Google. EU-regio's zijn beschikbaar op enterprise-contracten.

Valideer voor productie-migratieplanning het Custom Tools-gedrag tegen je specifieke tool-ecosysteem. De verbeteringen ten opzichte van de basisvariant zijn het meest zichtbaar in tool-zware workloads.

Wanneer je het kiest

Kies Gemini 3.1 Pro Preview Custom Tools als:

  • De workload een productie-agent-lus is met zware tool-integratie.
  • De basis 3.1 Pro Preview's tool-use-gedrag goed is maar je de marginale betrouwbaarheidsverbetering nodig hebt.
  • Preview-tier rate limits en gedragsoverwegingen acceptabel zijn.
  • De kosten van agent-lus-falingen hoog genoeg zijn om het gespecialiseerde model te rechtvaardigen.

Kies iets anders als:

  • De workload niet sterk op tool-integratie leunt. Gebruik de basis 3.1 Pro Preview.
  • Je vandaag productie-stabiel gedrag nodig hebt. Gebruik 2.5 Pro.
  • De workload kostgevoelig is bij schaal. Stap af naar een Flash-variant.
  • Je self-hosted of fine-tuned deployment nodig hebt.

Samenvatting: gespecialiseerde variant van 3.1 Pro Preview voor tool-zware agent-workloads. Voor de specifieke workloads waarbij de specialisatie ertoe doet, is het de juiste keuze. Voor al het andere is de basis 3.1 Pro Preview of 2.5 Pro het betere startpunt.

Test het op je eigen agent-lus op /live-test. De delta's zijn het duidelijkst in echte tool-use-scenario's.

Laatste technische beoordeling: 2026-05-22 — Tokonomix.ai

Gemini 3.1 Pro Preview Custom Tools — illustration 2
Laatste automatische test
21 jun 2026 · 04:57 UTC · Benchmark
P50 latency
7298 ms
P95 latency
Fouten
0 / 6 runs
Laatst beoordeeld door Tokonomix-team·24 mei 2026