Ir al contenido
Consenso multimodelo y juez — una sola API

Deje de apostar su resultado a un solo modelo.

Distribuya un único prompt a los mejores modelos de frontera en paralelo y deje que un juez entre familias los reconcilie en una respuesta de confianza. Compatible con OpenAI. Alojado en la UE. Paga por los tokens que consume, más un margen de consenso transparente.

Consenso en vivo, con streamingCompatible con SDK de OpenAI y AnthropicAlojado en la UE · GDPR
Qué obtiene

Un prompt de entrada. La respuesta de cada modelo más un veredicto razonado de salida.

Una ejecución de consenso con el mismo formato que la respuesta con streaming de la API y la demo pública gratuita.

POST /api/v1/chat/completions · model: tokonomix-consensus · mode: best_of
Prompt

Somos un SaaS de 12 personas. ¿Deberíamos autoalojar un LLM o seguir con APIs alojadas los próximos 12 meses? Dé una recomendación en un párrafo.

claude-opus-4.8412 tok

Stay on hosted APIs. At 12 people your bottleneck is product velocity, not inference cost; self-hosting adds GPU ops, eval and on-call burden that will not pay back below roughly €8k/mo in spend…

gpt-5.1388 tok

Hosted, with one caveat: route through a gateway so you can switch providers without code changes. Self-hosting only makes sense once a workload is both high-volume and latency-critical…

gemini-3-pro401 tok

Remain on hosted APIs for 12 months. Revisit only if data-residency or a >70% cost reduction at scale becomes a hard requirement; otherwise the operational tax outweighs the savings…

Juez · best_of

Los tres convergen en "seguir en la nube", por lo que la confianza es alta. El ganador es recompensado por identificar el verdadero criterio de decisión en lugar de dar rodeos, y por vincular la elección al tamaño del equipo — el enfoque más accionable.

claude-opus-4.8 94gpt-5.1 89gemini-3-pro 86acuerdo: alto
3 proponentes + 1 jueztokens 1 601coste / llamada ≈ €0.033latencia 5.4s

Ejemplo ilustrativo — datos sintéticos, no una llamada de cliente

Por qué un solo modelo es un riesgo

Una respuesta errónea y segura parece exactamente igual que una correcta.

01

Puntos ciegos del modelo único

Un solo modelo implica un único conjunto de puntos ciegos. No puede ver la discrepancia que nunca muestreó — y una alucinación segura es indistinguible de un hecho.

02

La comparación manual no escala

Pegar el mismo prompt en tres ventanas de chat funciona una vez. No funciona en una pipeline, un flujo de soporte o un bucle de agentes que se ejecuta miles de veces al día.

03

El código de pegamento se deteriora

Distribución en abanico, multiplexación con streaming, un prompt de juez, contabilidad de costes por modelo, failover de proveedor — eso es un sistema que hay que mantener. O es un solo slug de modelo.

Cuatro modos de síntesis

Elija cómo se reconcilian las respuestas.

Misma distribución, diferente comportamiento del juez. Cambie con un solo campo — sin rediseño arquitectónico.

Consenso

Acuerdo sintetizado

predeterminado para "dame la mejor respuesta única"

Diferencias

Resaltar desacuerdos

investigación, due diligence, revisión de riesgos

La mejor

El juez elige la mejor respuesta

pipelines que necesitan una salida limpia

Sin procesar

Sin síntesis, solo en paralelo

usted gestiona la reconciliación

Integración directa

Si puede llamar a OpenAI, puede llamar a consenso.

Cambie la URL base y el slug del modelo. Añada un bloque x_council para elegir el pool, el juez y el modo. Eso es la integración.

cURL — compatible con OpenAI
curl https://tokonomix.ai/api/v1/chat/completions \
  -H "Authorization: Bearer tok_live_…" \
  -d '{
    "model": "tokonomix-consensus",
    "messages": [{"role":"user","content":"…"}],
    "x_council": {
      "mode": "best_of",
      "models": ["claude-opus-4.8","gpt-5.1","gemini-3-pro"],
      "judge_model": "gpt-5.1"
    }
  }'
MCP — para agentes (Claude, Cursor, …)
// tokonomix MCP server
tokonomix_consensus_ask({
  prompt: "…",
  models: ["claude-opus-4.8","gpt-5.1"],
  mode: "full",   // answers + reasoning + verdict
  judge_model: "gpt-5.1"
})

una llamada a herramienta → veredicto multimodelo, facturado a su saldo de Tokonomix

Vision — image consensus (nuevo)
IMG=$(base64 -w0 product-shot.png)
curl https://tokonomix.ai/api/v1/chat/completions \
  -H "Authorization: Bearer tok_live_…" \
  -d '{
    "model": "tokonomix-consensus",
    "stream": false,
    "messages": [{"role":"user","content":[
      {"type":"text","text":"Inspect this image for publication-blocking defects. Verdict: DEFECT or CLEAN + findings."},
      {"type":"image_url","image_url":{"url":"data:image/png;base64,'$IMG'"}}
    ]}]
  }'

Solo base64 inline (sin fetch de URL) · jpeg/png/webp/gif · máx 5MB/imagen · sin streaming · modelos vision seleccionados automáticamente

Lo que pagas

Sin tarifa en llamadas individuales. La tarifa solo aplica al consenso.

Consulta un modelo y pagas únicamente sus tokens más un pequeño margen de nivel — sin tarifa de plataforma. La tarifa por llamada aplica solo a las verificaciones de consenso multi-modelo. 100 verificaciones gratuitas al mes, sin tarjeta; planes desde €10/mes para 500 llamadas. Cada token desglosado, nada oculto.

Llamada a modelo único

tokens + margen

Sin tarifa — solo las verificaciones de consenso llevan tarifa por llamada. Pagas el precio de tokens del proveedor más tu margen de nivel (+2–5 %). Ejemplo: un modelo pequeño con ~4k tokens ≈ €0,001.

Llamada de consenso

tarifa + tokens + margen

La tarifa varía según el plan (PAYG fundadores: 2c/proposer + 3c/juez, un consejo 3+1 = 9c; planes: descuenta de tu cuota mensual; por encima de la cuota: 1,5c/llamada). Además: los tokens del proveedor + tu margen de nivel.

Trae tu propia clave (BYOK)

solo tarifa por llamada

En consenso pagas solo la tarifa del plan — tu clave factura directamente al proveedor, sin coste de tokens ni margen nuestro. Una llamada BYOK a modelo único no cuesta nada.

Alojado en la UE

Inferencia y registros en la UE. Alineado con el GDPR por defecto.

Sin permanencia

SDK estándar. Cambie de proveedor sin tocar su código.

Pago por uso

Saldo prepago. Sin licencias, sin mínimo, cancele cuando quiera.

Observable

Tokens, coste y latencia por modelo en cada llamada.

FAQ

Respuestas honestas

¿El consenso multimodelo reduce las alucinaciones?

Es un amplificador de recuperación, no un oráculo de la verdad. Varios modelos responden en paralelo y un juez independiente los concilia, de modo que es más probable detectar el error de un modelo y los desacuerdos se exponen en lugar de ocultarse. Reduce el error de un solo modelo, pero no garantiza la corrección, porque los modelos de frontera comparten datos de entrenamiento y pueden equivocarse juntos con seguridad. Verifica los hechos importantes.

¿Cómo se mantiene independiente el juez?

El juez es distinto de los proponentes y se elige de otra familia de modelos; los proponentes responden a ciegas y en paralelo, así que el juez nunca evalúa su propia respuesta. Es una propiedad de diseño del council, no una afirmación medida.

¿Puedo mantener mis datos en la UE?

Sí. Puedes fijar un council a modelos alojados en la UE por región de alojamiento, de modo que los prompts con datos personales se enruten solo a modelos alojados en la UE. El enrutamiento por región es por llamada.

Lance con consenso

Pruébelo gratis. Sin registro para testear.

Ejecute consenso en el navegador ahora mismo y obtenga una clave API cuando esté listo para integrarlo.