Naar inhoud
Multi-model consensus & judge — één API

Stop met gokken op de uitvoer van één model.

Stuur één prompt parallel naar de beste frontier-modellen en laat een cross-family judge ze samenvatten tot één antwoord dat je kunt vertrouwen. OpenAI-compatibel. EU-gehost. Je betaalt voor de tokens die je verbruikt, plus een transparante consensus-marge.

Live consensus, gestreamdOpenAI & Anthropic SDK drop-inEU-gehost · GDPR
Wat je terugkrijgt

Één prompt erin. Het antwoord van elk model + een beredeneerd oordeel eruit.

Een consensus-run, precies in de vorm van de gestreamde API-response en de gratis publieke demo.

POST /api/v1/chat/completions · model: tokonomix-consensus · mode: best_of
Prompt

We zijn een SaaS-bedrijf met 12 mensen. Moeten we de komende 12 maanden een LLM zelf hosten of bij hosted API's blijven? Geef een aanbeveling in één alinea.

claude-opus-4.8412 tok

Stay on hosted APIs. At 12 people your bottleneck is product velocity, not inference cost; self-hosting adds GPU ops, eval and on-call burden that will not pay back below roughly €8k/mo in spend…

gpt-5.1388 tok

Hosted, with one caveat: route through a gateway so you can switch providers without code changes. Self-hosting only makes sense once a workload is both high-volume and latency-critical…

gemini-3-pro401 tok

Remain on hosted APIs for 12 months. Revisit only if data-residency or a >70% cost reduction at scale becomes a hard requirement; otherwise the operational tax outweighs the savings…

Judge · best_of

Alle drie komen uit op "blijf bij hosted", dus de betrouwbaarheid is hoog. De winnaar wordt beloond voor het benoemen van de echte beslissingsgrens in plaats van te omzeilen, en voor het koppelen van de keuze aan teamgrootte — de meest bruikbare aanpak.

claude-opus-4.8 94gpt-5.1 89gemini-3-pro 86overeenstemming: hoog
3 proposers + 1 judgetokens 1 601kosten / aanroep ≈ €0.033latentie 5.4s

Illustratief voorbeeld — synthetische data, geen klant-run

Waarom één model een risico is

Een zelfverzekerd fout antwoord ziet er precies uit als een correct antwoord.

01

Blinde vlekken van één model

Één model betekent één set blinde vlekken. Je ziet de meningsverschillen nooit die je nooit hebt gesampled — en een zelfverzekerde hallucinatie is identiek aan een feit.

02

Handmatig vergelijken schaalt niet

Dezelfde prompt in drie chatvensters plakken werkt één keer. Niet in een pipeline, een supportflow, of een agent-loop die duizenden keren per dag draait.

03

Lijmcode vergaat

Fan-out, streaming multiplex, een judge-prompt, per-model kostenbewaking, provider-failover — dat is een systeem om te onderhouden. Of het is één model-slug.

Vier synthesemodi

Kies hoe de antwoorden worden samengebracht.

Dezelfde fan-out, ander judge-gedrag. Wissel met één veld — geen herarchitectuur nodig.

Consensus

Gesynthetiseerde overeenkomst

standaard voor "geef me het beste enkele antwoord"

Verschil

Benadruk meningsverschillen

onderzoek, due-diligence, risicoanalyse

Beste van

Rechter kiest de beste respons

pipelines die één schone uitvoer nodig hebben

Onbewerkt

Geen synthese, alleen parallel

jij beheert de samenvatting zelf

Drop-in

Als je OpenAI kunt aanroepen, kun je consensus aanroepen.

Verander de basis-URL en de model-slug. Voeg een x_council-blok toe om de pool, de judge en de modus te kiezen. Dat is de integratie.

cURL — OpenAI-compatibel
curl https://tokonomix.ai/api/v1/chat/completions \
  -H "Authorization: Bearer tok_live_…" \
  -d '{
    "model": "tokonomix-consensus",
    "messages": [{"role":"user","content":"…"}],
    "x_council": {
      "mode": "best_of",
      "models": ["claude-opus-4.8","gpt-5.1","gemini-3-pro"],
      "judge_model": "gpt-5.1"
    }
  }'
MCP — voor agents (Claude, Cursor, …)
// tokonomix MCP server
tokonomix_consensus_ask({
  prompt: "…",
  models: ["claude-opus-4.8","gpt-5.1"],
  mode: "full",   // answers + reasoning + verdict
  judge_model: "gpt-5.1"
})

één tool-aanroep → multi-model oordeel, verrekend met je Tokonomix-saldo

Vision — image-consensus (nieuw)
IMG=$(base64 -w0 product-shot.png)
curl https://tokonomix.ai/api/v1/chat/completions \
  -H "Authorization: Bearer tok_live_…" \
  -d '{
    "model": "tokonomix-consensus",
    "stream": false,
    "messages": [{"role":"user","content":[
      {"type":"text","text":"Inspect this image for publication-blocking defects. Verdict: DEFECT or CLEAN + findings."},
      {"type":"image_url","image_url":{"url":"data:image/png;base64,'$IMG'"}}
    ]}]
  }'

Alleen inline base64 (geen URL-fetch) · jpeg/png/webp/gif · max 5MB/image · non-streaming · vision-modellen automatisch geselecteerd

Wat je betaalt

Geen fee op losse calls. De fee betaal je alleen bij consensus.

Vraag je één model, dan betaal je alleen de tokens plus een kleine tier-marge — geen platformfee. De per-call-fee geldt uitsluitend voor multi-model consensuschecks. 100 consensuschecks gratis per maand, geen kaart nodig; bundels vanaf €10/maand voor 500 calls. Elke token uitgesplitst, niets verborgen.

Losse model-call

tokens + marge

Geen call-fee — alleen consensuschecks dragen de per-call-fee. Je betaalt de tokenprijs van de modelprovider plus je tier-marge (+2–5%). Voorbeeld: een klein model op ~4k tokens ≈ €0,001.

Consensuscall

call-fee + tokens + marge

De call-fee varieert per pakket (PAYG founders: 2c/proposer + 3c/judge, een 3+1-council = 9c; bundels: telt mee met je maandquotum; boven quotum: 1,5c/call). Daarboven: de tokens van de provider + je tier-marge.

Eigen sleutel (BYOK)

alleen call-fee

Bij consensus betaal je alleen de pakket-call-fee — je eigen sleutel rekent rechtstreeks bij de provider af, geen tokenkosten en geen marge van ons. Een losse model-BYOK-call kost niets.

EU-gehost

Inferentie en logs in de EU. Standaard GDPR-conform.

Geen lock-in

Standaard SDK's. Wissel van provider zonder je code aan te raken.

Pay-as-you-go

Prepaid saldo. Geen seats, geen minimum, stop wanneer je wilt.

Observeerbaar

Per-model tokens, kosten en latentie bij elke aanroep.

FAQ

Eerlijke antwoorden

Vermindert multi-model-consensus hallucinatie?

Het is een recall-versterker, geen waarheidsorakel. Meerdere modellen antwoorden parallel en een onafhankelijke jury verzoent ze, zodat een fout van één model eerder wordt opgemerkt en onenigheid zichtbaar wordt in plaats van verborgen. Het vermindert de fout van één model — het garandeert geen juistheid, want frontier-modellen delen trainingsdata en kunnen samen met overtuiging fout zitten. Onderbouw belangrijke feiten.

Hoe blijft de jury onafhankelijk?

De jury staat los van de voorstellers en komt uit een andere modelfamilie; de voorstellers antwoorden blind en parallel, dus de jury beoordeelt nooit haar eigen antwoord. Dit is een ontwerpeigenschap van hoe de council is gebouwd, geen gebenchmarkte claim.

Kan ik mijn data in de EU houden?

Ja. Je kunt een council vastzetten op EU-gehoste modellen op basis van hostingregio, zodat prompts met persoonsgegevens alleen naar EU-gehoste modellen worden gerouteerd. Regio-routering is per call.

Ship met consensus

Probeer het gratis. Geen aanmelding nodig om te testen.

Voer nu meteen consensus uit in de browser, en haal een API-sleutel op als je er klaar voor bent om het in te bouwen.