Aller au contenu
Consensus multi-modèles & juge — une seule API

Cessez de parier votre résultat sur un seul modèle.

Distribuez un prompt en parallèle aux meilleurs modèles frontier, puis laissez un juge inter-famille les réconcilier en une réponse de confiance. Compatible OpenAI. Hébergé en UE. Vous payez les tokens consommés, plus une marge de consensus transparente.

Consensus en direct, streaméCompatible SDK OpenAI & AnthropicHébergé en UE · RGPD
Ce que vous récupérez

Un prompt en entrée. La réponse de chaque modèle + un verdict motivé en sortie.

Un appel consensus, structuré exactement comme la réponse streamée de l'API et la démo publique gratuite.

POST /api/v1/chat/completions · model: tokonomix-consensus · mode: best_of
Prompt

Nous sommes une SaaS de 12 personnes. Devons-nous héberger nous-mêmes un LLM ou rester sur des API hébergées pour les 12 prochains mois ? Donnez une recommandation en un paragraphe.

claude-opus-4.8412 tok

Stay on hosted APIs. At 12 people your bottleneck is product velocity, not inference cost; self-hosting adds GPU ops, eval and on-call burden that will not pay back below roughly €8k/mo in spend…

gpt-5.1388 tok

Hosted, with one caveat: route through a gateway so you can switch providers without code changes. Self-hosting only makes sense once a workload is both high-volume and latency-critical…

gemini-3-pro401 tok

Remain on hosted APIs for 12 months. Revisit only if data-residency or a >70% cost reduction at scale becomes a hard requirement; otherwise the operational tax outweighs the savings…

Juge · best_of

Les trois convergent vers « rester hébergé », la confiance est donc élevée. Le gagnant est récompensé pour avoir nommé la vraie frontière de décision plutôt que de temporiser, et pour avoir lié le choix à la taille de l'équipe — le cadrage le plus actionnable.

claude-opus-4.8 94gpt-5.1 89gemini-3-pro 86accord : élevé
3 proposants + 1 jugetokens 1 601coût / appel ≈ €0.033latence 5.4s

Exemple illustratif — données synthétiques, pas un appel client

Pourquoi un seul modèle est un risque

Une mauvaise réponse confiante ressemble exactement à une bonne.

01

Angles morts du modèle unique

Un seul modèle signifie un seul ensemble d'angles morts. Vous ne voyez pas le désaccord que vous n'avez jamais échantillonné — et une hallucination confiante est identique à un fait.

02

La comparaison manuelle ne passe pas à l'échelle

Coller le même prompt dans trois fenêtres de chat fonctionne une fois. Pas dans un pipeline, un flux support ou une boucle d'agent qui tourne des milliers de fois par jour.

03

Le code de collage se dégrade

Distribution en éventail, multiplexage streamé, prompt de juge, comptabilité par modèle, basculement de fournisseur — c'est un système à maintenir. Ou c'est un seul slug de modèle.

Quatre modes de synthèse

Choisissez comment les réponses sont réconciliées.

Même distribution en éventail, comportement du juge différent. Changez d'un seul champ — sans refactorisation.

Consensus

Accord synthétisé

par défaut pour « donne-moi la meilleure réponse unique »

Différences

Mettre en évidence les désaccords

recherche, due diligence, revue des risques

Meilleure réponse

Le juge choisit la meilleure réponse

pipelines nécessitant une sortie propre et unique

Brut

Pas de synthèse, parallèle uniquement

vous gérez la réconciliation

Intégration directe

Si vous pouvez appeler OpenAI, vous pouvez appeler le consensus.

Changez l'URL de base et le slug du modèle. Ajoutez un bloc x_council pour choisir le pool, le juge et le mode. C'est tout ce qu'il faut pour l'intégration.

cURL — compatible OpenAI
curl https://tokonomix.ai/api/v1/chat/completions \
  -H "Authorization: Bearer tok_live_…" \
  -d '{
    "model": "tokonomix-consensus",
    "messages": [{"role":"user","content":"…"}],
    "x_council": {
      "mode": "best_of",
      "models": ["claude-opus-4.8","gpt-5.1","gemini-3-pro"],
      "judge_model": "gpt-5.1"
    }
  }'
MCP — pour les agents (Claude, Cursor, …)
// tokonomix MCP server
tokonomix_consensus_ask({
  prompt: "…",
  models: ["claude-opus-4.8","gpt-5.1"],
  mode: "full",   // answers + reasoning + verdict
  judge_model: "gpt-5.1"
})

un appel outil → verdict multi-modèles, facturé sur votre solde Tokonomix

Vision — image consensus (nouveau)
IMG=$(base64 -w0 product-shot.png)
curl https://tokonomix.ai/api/v1/chat/completions \
  -H "Authorization: Bearer tok_live_…" \
  -d '{
    "model": "tokonomix-consensus",
    "stream": false,
    "messages": [{"role":"user","content":[
      {"type":"text","text":"Inspect this image for publication-blocking defects. Verdict: DEFECT or CLEAN + findings."},
      {"type":"image_url","image_url":{"url":"data:image/png;base64,'$IMG'"}}
    ]}]
  }'

Base64 inline uniquement (pas de fetch URL) · jpeg/png/webp/gif · 5 Mo/image max · non-streaming · modèles vision sélectionnés automatiquement

Ce que vous payez

Pas de frais sur les appels simples. La commission ne s'applique qu'au consensus.

Interrogez un seul modèle et vous ne payez que ses tokens plus une petite marge de palier — aucuns frais de plateforme. La commission par appel s'applique uniquement aux vérifications de consensus multi-modèles. 100 vérifications gratuites par mois, sans carte bancaire ; formules à partir de €10/mois pour 500 appels. Chaque token détaillé, rien de caché.

Appel modèle unique

tokens + marge

Aucune commission — seules les vérifications de consensus comportent une commission par appel. Vous payez le prix des tokens du fournisseur plus votre marge de palier (+2–5 %). Exemple : un petit modèle sur ~4k tokens ≈ €0,001.

Appel consensus

commission + tokens + marge

La commission varie selon la formule (PAYG fondateurs : 2c/proposant + 3c/juge, un conseil 3+1 = 9c ; formules : décompte sur votre quota mensuel ; au-delà du quota : 1,5c/appel). En plus : les tokens du fournisseur + votre marge de palier.

Apportez votre propre clé (BYOK)

commission uniquement

Pour le consensus, vous ne payez que la commission par formule — votre clé facture directement le fournisseur, sans frais de tokens ni marge de notre part. Un appel BYOK modèle unique ne coûte rien.

Hébergé en UE

Inférence et journaux en UE. Conforme au RGPD par défaut.

Sans engagement

SDK standard. Changez de fournisseur sans modifier votre code.

À la demande

Solde prépayé. Pas de siège, pas de minimum, arrêtez quand vous voulez.

Observable

Tokens, coût et latence par modèle à chaque appel.

FAQ

Réponses honnêtes

Le consensus multi-modèles réduit-il les hallucinations ?

C'est un amplificateur de rappel, pas un oracle de vérité. Plusieurs modèles répondent en parallèle et un juge indépendant les réconcilie, de sorte qu'une erreur d'un modèle a plus de chances d'être détectée et que les désaccords sont exposés plutôt que masqués. Cela réduit l'erreur d'un modèle unique — cela ne garantit pas l'exactitude, car les modèles de pointe partagent des données d'entraînement et peuvent se tromper ensemble avec assurance. Vérifiez les faits importants.

Comment le juge reste-t-il indépendant ?

Le juge est distinct des proposeurs et choisi dans une autre famille de modèles ; les proposeurs répondent à l'aveugle et en parallèle, donc le juge n'évalue jamais sa propre réponse. C'est une propriété de conception du council, pas une affirmation mesurée.

Puis-je garder mes données dans l'UE ?

Oui. Vous pouvez restreindre un council aux modèles hébergés dans l'UE par région d'hébergement, afin que les prompts contenant des données personnelles ne soient routés que vers des modèles hébergés dans l'UE. Le routage par région se fait par appel.

Déployez avec le consensus

Essayez gratuitement. Sans inscription pour tester.

Lancez le consensus dans le navigateur dès maintenant, puis récupérez une clé API quand vous êtes prêt à l'intégrer.