Cessez de parier votre résultat sur un seul modèle.
Distribuez un prompt en parallèle aux meilleurs modèles frontier, puis laissez un juge inter-famille les réconcilier en une réponse de confiance. Compatible OpenAI. Hébergé en UE. Vous payez les tokens consommés, plus une marge de consensus transparente.
Un prompt en entrée. La réponse de chaque modèle + un verdict motivé en sortie.
Un appel consensus, structuré exactement comme la réponse streamée de l'API et la démo publique gratuite.
Nous sommes une SaaS de 12 personnes. Devons-nous héberger nous-mêmes un LLM ou rester sur des API hébergées pour les 12 prochains mois ? Donnez une recommandation en un paragraphe.
Stay on hosted APIs. At 12 people your bottleneck is product velocity, not inference cost; self-hosting adds GPU ops, eval and on-call burden that will not pay back below roughly €8k/mo in spend…
Hosted, with one caveat: route through a gateway so you can switch providers without code changes. Self-hosting only makes sense once a workload is both high-volume and latency-critical…
Remain on hosted APIs for 12 months. Revisit only if data-residency or a >70% cost reduction at scale becomes a hard requirement; otherwise the operational tax outweighs the savings…
Les trois convergent vers « rester hébergé », la confiance est donc élevée. Le gagnant est récompensé pour avoir nommé la vraie frontière de décision plutôt que de temporiser, et pour avoir lié le choix à la taille de l'équipe — le cadrage le plus actionnable.
Exemple illustratif — données synthétiques, pas un appel client
Une mauvaise réponse confiante ressemble exactement à une bonne.
Angles morts du modèle unique
Un seul modèle signifie un seul ensemble d'angles morts. Vous ne voyez pas le désaccord que vous n'avez jamais échantillonné — et une hallucination confiante est identique à un fait.
La comparaison manuelle ne passe pas à l'échelle
Coller le même prompt dans trois fenêtres de chat fonctionne une fois. Pas dans un pipeline, un flux support ou une boucle d'agent qui tourne des milliers de fois par jour.
Le code de collage se dégrade
Distribution en éventail, multiplexage streamé, prompt de juge, comptabilité par modèle, basculement de fournisseur — c'est un système à maintenir. Ou c'est un seul slug de modèle.
Choisissez comment les réponses sont réconciliées.
Même distribution en éventail, comportement du juge différent. Changez d'un seul champ — sans refactorisation.
Accord synthétisé
→ par défaut pour « donne-moi la meilleure réponse unique »
Mettre en évidence les désaccords
→ recherche, due diligence, revue des risques
Le juge choisit la meilleure réponse
→ pipelines nécessitant une sortie propre et unique
Pas de synthèse, parallèle uniquement
→ vous gérez la réconciliation
Si vous pouvez appeler OpenAI, vous pouvez appeler le consensus.
Changez l'URL de base et le slug du modèle. Ajoutez un bloc x_council pour choisir le pool, le juge et le mode. C'est tout ce qu'il faut pour l'intégration.
curl https://tokonomix.ai/api/v1/chat/completions \
-H "Authorization: Bearer tok_live_…" \
-d '{
"model": "tokonomix-consensus",
"messages": [{"role":"user","content":"…"}],
"x_council": {
"mode": "best_of",
"models": ["claude-opus-4.8","gpt-5.1","gemini-3-pro"],
"judge_model": "gpt-5.1"
}
}'// tokonomix MCP server
tokonomix_consensus_ask({
prompt: "…",
models: ["claude-opus-4.8","gpt-5.1"],
mode: "full", // answers + reasoning + verdict
judge_model: "gpt-5.1"
})un appel outil → verdict multi-modèles, facturé sur votre solde Tokonomix
IMG=$(base64 -w0 product-shot.png)
curl https://tokonomix.ai/api/v1/chat/completions \
-H "Authorization: Bearer tok_live_…" \
-d '{
"model": "tokonomix-consensus",
"stream": false,
"messages": [{"role":"user","content":[
{"type":"text","text":"Inspect this image for publication-blocking defects. Verdict: DEFECT or CLEAN + findings."},
{"type":"image_url","image_url":{"url":"data:image/png;base64,'$IMG'"}}
]}]
}'Base64 inline uniquement (pas de fetch URL) · jpeg/png/webp/gif · 5 Mo/image max · non-streaming · modèles vision sélectionnés automatiquement
Pas de frais sur les appels simples. La commission ne s'applique qu'au consensus.
Interrogez un seul modèle et vous ne payez que ses tokens plus une petite marge de palier — aucuns frais de plateforme. La commission par appel s'applique uniquement aux vérifications de consensus multi-modèles. 100 vérifications gratuites par mois, sans carte bancaire ; formules à partir de €10/mois pour 500 appels. Chaque token détaillé, rien de caché.
Appel modèle unique
Aucune commission — seules les vérifications de consensus comportent une commission par appel. Vous payez le prix des tokens du fournisseur plus votre marge de palier (+2–5 %). Exemple : un petit modèle sur ~4k tokens ≈ €0,001.
Appel consensus
La commission varie selon la formule (PAYG fondateurs : 2c/proposant + 3c/juge, un conseil 3+1 = 9c ; formules : décompte sur votre quota mensuel ; au-delà du quota : 1,5c/appel). En plus : les tokens du fournisseur + votre marge de palier.
Apportez votre propre clé (BYOK)
Pour le consensus, vous ne payez que la commission par formule — votre clé facture directement le fournisseur, sans frais de tokens ni marge de notre part. Un appel BYOK modèle unique ne coûte rien.
Inférence et journaux en UE. Conforme au RGPD par défaut.
SDK standard. Changez de fournisseur sans modifier votre code.
Solde prépayé. Pas de siège, pas de minimum, arrêtez quand vous voulez.
Tokens, coût et latence par modèle à chaque appel.
Réponses honnêtes
Le consensus multi-modèles réduit-il les hallucinations ?
C'est un amplificateur de rappel, pas un oracle de vérité. Plusieurs modèles répondent en parallèle et un juge indépendant les réconcilie, de sorte qu'une erreur d'un modèle a plus de chances d'être détectée et que les désaccords sont exposés plutôt que masqués. Cela réduit l'erreur d'un modèle unique — cela ne garantit pas l'exactitude, car les modèles de pointe partagent des données d'entraînement et peuvent se tromper ensemble avec assurance. Vérifiez les faits importants.
Comment le juge reste-t-il indépendant ?
Le juge est distinct des proposeurs et choisi dans une autre famille de modèles ; les proposeurs répondent à l'aveugle et en parallèle, donc le juge n'évalue jamais sa propre réponse. C'est une propriété de conception du council, pas une affirmation mesurée.
Puis-je garder mes données dans l'UE ?
Oui. Vous pouvez restreindre un council aux modèles hébergés dans l'UE par région d'hébergement, afin que les prompts contenant des données personnelles ne soient routés que vers des modèles hébergés dans l'UE. Le routage par région se fait par appel.
Essayez gratuitement. Sans inscription pour tester.
Lancez le consensus dans le navigateur dès maintenant, puis récupérez une clé API quand vous êtes prêt à l'intégrer.