Zum Inhalt
Multi-Modell-Consensus & Judge — eine API

Hören Sie auf, Ihr Ergebnis auf ein Modell zu setzen.

Senden Sie einen Prompt parallel an die führenden Frontier-Modelle und lassen Sie einen familienübergreifenden Judge die Antworten zu einer verlässlichen Aussage zusammenführen. OpenAI-kompatibel. EU-gehostet. Sie zahlen für die genutzten Token plus eine transparente Consensus-Marge.

Live-Consensus, gestreamtOpenAI & Anthropic SDK Drop-inEU-gehostet · GDPR
Was Sie zurückbekommen

Ein Prompt rein. Die Antwort jedes Modells plus ein begründetes Urteil heraus.

Ein Consensus-Durchlauf, der exakt dem gestreamten Response der API und der kostenlosen öffentlichen Demo entspricht.

POST /api/v1/chat/completions · model: tokonomix-consensus · mode: best_of
Prompt

Wir sind ein 12-köpfiges SaaS-Team. Sollten wir in den nächsten 12 Monaten ein LLM selbst hosten oder bei gehosteten APIs bleiben? Bitte eine Empfehlung in einem Absatz.

claude-opus-4.8412 tok

Stay on hosted APIs. At 12 people your bottleneck is product velocity, not inference cost; self-hosting adds GPU ops, eval and on-call burden that will not pay back below roughly €8k/mo in spend…

gpt-5.1388 tok

Hosted, with one caveat: route through a gateway so you can switch providers without code changes. Self-hosting only makes sense once a workload is both high-volume and latency-critical…

gemini-3-pro401 tok

Remain on hosted APIs for 12 months. Revisit only if data-residency or a >70% cost reduction at scale becomes a hard requirement; otherwise the operational tax outweighs the savings…

Judge · best_of

Alle drei Modelle konvergieren auf "gehostet bleiben", die Konfidenz ist daher hoch. Der Gewinner wird für das klare Benennen der echten Entscheidungsgrenze belohnt — statt abzusichern — und dafür, die Wahl an der Teamgröße festzumachen: das umsetzbarste Framing.

claude-opus-4.8 94gpt-5.1 89gemini-3-pro 86Übereinstimmung: hoch
3 Proposer + 1 JudgeToken 1 601Kosten / Aufruf ≈ €0.033Latenz 5.4s

Illustratives Beispiel — synthetische Daten, kein Kunden-Run

Warum ein einzelnes Modell ein Risiko ist

Eine selbstbewusste falsche Antwort sieht genauso aus wie eine richtige.

01

Blinde Flecken des Einzelmodells

Ein Modell bedeutet einen einzigen Satz blinder Flecken. Die Uneinigkeit, die Sie nie abgefragt haben, bleibt unsichtbar — und eine selbstsichere Halluzination sieht aus wie eine Tatsache.

02

Manueller Vergleich skaliert nicht

Den gleichen Prompt in drei Chat-Fenster einfügen funktioniert einmal. Nicht in einer Pipeline, einem Support-Flow oder einer Agent-Schleife mit Tausenden von Durchläufen täglich.

03

Glue-Code fault ab

Fan-out, Streaming-Multiplex, ein Judge-Prompt, modellgenaue Kostenerfassung, Provider-Failover — das ist ein System, das gepflegt werden muss. Oder es ist ein einziger Modell-Slug.

Vier Synthese-Modi

Wählen Sie, wie Antworten zusammengeführt werden.

Gleicher Fan-out, unterschiedliches Judge-Verhalten. Umschalten mit einem einzigen Feld — kein Umbau der Architektur.

Konsens

Synthetisierte Übereinstimmung

Standard für "gib mir die beste Einzelantwort"

Unterschied

Meinungsverschiedenheiten hervorheben

Recherche, Due-Diligence, Risikoprüfung

Beste von

Richter wählt die beste Antwort

Pipelines, die einen sauberen Output benötigen

Roh

Keine Synthese, nur parallel

Sie übernehmen die Zusammenführung selbst

Drop-in

Wer OpenAI aufrufen kann, kann Consensus aufrufen.

Ändern Sie die Base-URL und den Modell-Slug. Fügen Sie einen x_council-Block hinzu, um Pool, Judge und Modus zu wählen. Das ist die gesamte Integration.

cURL — OpenAI-kompatibel
curl https://tokonomix.ai/api/v1/chat/completions \
  -H "Authorization: Bearer tok_live_…" \
  -d '{
    "model": "tokonomix-consensus",
    "messages": [{"role":"user","content":"…"}],
    "x_council": {
      "mode": "best_of",
      "models": ["claude-opus-4.8","gpt-5.1","gemini-3-pro"],
      "judge_model": "gpt-5.1"
    }
  }'
MCP — für Agenten (Claude, Cursor, …)
// tokonomix MCP server
tokonomix_consensus_ask({
  prompt: "…",
  models: ["claude-opus-4.8","gpt-5.1"],
  mode: "full",   // answers + reasoning + verdict
  judge_model: "gpt-5.1"
})

ein Tool-Aufruf → Multi-Modell-Urteil, abgerechnet über Ihr Tokonomix-Guthaben

Vision — Image-Consensus (neu)
IMG=$(base64 -w0 product-shot.png)
curl https://tokonomix.ai/api/v1/chat/completions \
  -H "Authorization: Bearer tok_live_…" \
  -d '{
    "model": "tokonomix-consensus",
    "stream": false,
    "messages": [{"role":"user","content":[
      {"type":"text","text":"Inspect this image for publication-blocking defects. Verdict: DEFECT or CLEAN + findings."},
      {"type":"image_url","image_url":{"url":"data:image/png;base64,'$IMG'"}}
    ]}]
  }'

Nur Inline-Base64 (kein URL-Fetch) · jpeg/png/webp/gif · max. 5 MB/Bild · non-streaming · Vision-Modelle automatisch ausgewählt

Was Sie zahlen

Keine Gebühr auf einzelne Anfragen. Die Gebühr fällt nur bei Konsensus an.

Fragen Sie ein einzelnes Modell, zahlen Sie nur die Token plus eine kleine Tier-Marge — keine Plattformgebühr. Die Pro-Call-Gebühr gilt ausschließlich für Multi-Modell-Konsensus-Prüfungen. 100 Konsensus-Prüfungen pro Monat kostenlos, keine Kreditkarte nötig; Pakete ab €10/Monat für 500 Anfragen. Jeder Token aufgelistet, nichts versteckt.

Einzelne Modellanfrage

Token + Marge

Keine Anfrage-Gebühr — nur Konsensus-Prüfungen tragen die Pro-Call-Gebühr. Sie zahlen den Token-Preis des Modellanbieters plus Ihre Tier-Marge (+2–5 %). Beispiel: kleines Modell auf ~4k Token ≈ €0,001.

Konsensus-Anfrage

Anfrage-Gebühr + Token + Marge

Die Gebühr variiert je nach Paket (PAYG Gründerpreis: 2 Ct/Proposer + 3 Ct/Judge, ein 3+1-Council = 9 Ct; Pakete: zählt gegen Ihr Monatskontingent; über Kontingent: 1,5 Ct/Call). Dazu: Token des Anbieters + Ihre Tier-Marge.

Eigenen API-Schlüssel mitbringen (BYOK)

nur Anfrage-Gebühr

Bei Konsensus zahlen Sie nur die paketspezifische Gebühr — Ihr eigener Schlüssel rechnet direkt mit dem Anbieter ab, keine Token-Kosten und keine Marge von uns. Eine einzelne BYOK-Anfrage kostet nichts.

EU-gehostet

Inferenz und Logs in der EU. Standardmäßig GDPR-konform.

Kein Lock-in

Standard-SDKs. Provider wechseln, ohne Ihren Code anzufassen.

Pay-as-you-go

Prepaid-Guthaben. Keine Lizenzen, kein Minimum, jederzeit kündbar.

Vollständig einsehbar

Token, Kosten und Latenz pro Modell bei jedem Aufruf.

FAQ

Ehrliche Antworten

Reduziert Multi-Modell-Konsens Halluzinationen?

Es ist ein Recall-Verstärker, kein Wahrheitsorakel. Mehrere Modelle antworten parallel und ein unabhängiger Richter führt sie zusammen, sodass ein Fehler eines Modells eher erkannt und Uneinigkeit sichtbar statt verborgen wird. Es reduziert den Fehler eines einzelnen Modells — es garantiert keine Korrektheit, da Frontier-Modelle Trainingsdaten teilen und gemeinsam überzeugt falsch liegen können. Belegen Sie wichtige Fakten.

Wie bleibt der Richter unabhängig?

Der Richter ist von den Vorschlagenden getrennt und stammt aus einer anderen Modellfamilie; die Vorschlagenden antworten blind und parallel, sodass der Richter nie seine eigene Antwort bewertet. Das ist eine Design-Eigenschaft des Council-Aufbaus, keine gebenchmarkte Behauptung.

Kann ich meine Daten in der EU halten?

Ja. Sie können einen Council per Hosting-Region auf EU-gehostete Modelle festlegen, sodass Prompts mit personenbezogenen Daten nur an EU-gehostete Modelle geleitet werden. Das Regions-Routing erfolgt pro Aufruf.

Mit Consensus liefern

Kostenlos testen. Kein Sign-up zum Ausprobieren.

Führen Sie jetzt direkt im Browser einen Consensus-Durchlauf aus — und holen Sie sich einen API-Key, sobald Sie ihn einbinden möchten.