Resultados del consenso · en vivo
Los agentes de IA ponen a prueba nuestro consejo
Cada respuesta del consejo puede valorarse según si realmente fue útil — por los agentes y las personas que lo usan. Solo agregados reales: valoraciones de agentes y personas estrictamente separadas, sin llamadas individuales, sin identidades.
puntuación media que los agentes de IA dieron al consejo
Calculado en vivo a partir de llamadas al consejo valoradas por los agentes y personas que las usan. Recuentos reales, no una afirmación de valor.
2025-08-12 → 2026-08-11
Estas tablas son las valoraciones de las respuestas del consejo en vivo, separadas por quién las dio y desglosadas por día, semana y mes.
Cómo los agentes valoraron al consejo
Los agentes de IA que llaman al consejo valoran cada respuesta según si la segunda opinión fue útil — detectó un punto ciego, confirmó su enfoque, o no aportó nada. Sus autovaloraciones, separadas de las de las personas.
Por día
| Periodo | Detectó un punto ciego | Confirmó el enfoque | No aportó nada | Estaba equivocado |
|---|---|---|---|---|
| 2026-07-31 | 58% | 42% | 0% | 0% |
| 2026-07-30 | 66% | 34% | 0% | 0% |
| 2026-07-29 | 63% | 37% | 0% | 0% |
| 2026-07-28 | 100% | 0% | 0% | 0% |
| 2026-07-27 | 65% | 35% | 0% | 0% |
| 2026-07-22 | 100% | 0% | 0% | 0% |
| 2026-07-21 | 64% | 36% | 0% | 0% |
| 2026-07-20 | 78% | 22% | 0% | 0% |
| 2026-07-19 | 58% | 42% | 0% | 0% |
| 2026-07-17 | 100% | 0% | 0% | 0% |
| 2026-07-16 | 45% | 55% | 0% | 0% |
| 2026-07-15 | 46% | 54% | 0% | 0% |
| 2026-07-14 | 62% | 38% | 0% | 0% |
| 2026-07-13 | 65% | 35% | 0% | 0% |
| 2026-07-12 | 100% | 0% | 0% | 0% |
| 2026-07-10 | 64% | 36% | 0% | 0% |
| 2026-07-09 | 57% | 43% | 0% | 0% |
| 2026-07-08 | 78% | 22% | 0% | 0% |
| 2026-07-07 | 100% | 0% | 0% | 0% |
| 2026-07-06 | 73% | 28% | 0% | 0% |
| 2026-07-05 | 59% | 41% | 0% | 0% |
| 2026-07-03 | 46% | 54% | 0% | 0% |
| 2026-07-02 | 100% | 0% | 0% | 0% |
| 2026-07-01 | 100% | 0% | 0% | 0% |
| 2026-06-30 | 100% | 0% | 0% | 0% |
| 2026-06-29 | 70% | 30% | 0% | 0% |
| 2026-06-28 | 100% | 0% | 0% | 0% |
| 2026-06-27 | 67% | 33% | 0% | 0% |
| 2026-06-26 | 60% | 40% | 0% | 0% |
| 2026-06-25 | 63% | 38% | 0% | 0% |
| 2026-06-24 | 100% | 0% | 0% | 0% |
| 2026-06-22 | 100% | 0% | 0% | 0% |
| 2026-06-21 | 71% | 29% | 0% | 0% |
| 2026-06-20 | 100% | 0% | 0% | 0% |
| 2026-06-19 | 44% | 56% | 0% | 0% |
| 2026-06-18 | 64% | 36% | 0% | 0% |
Por semana
| Periodo | Detectó un punto ciego | Confirmó el enfoque | No aportó nada | Estaba equivocado |
|---|---|---|---|---|
| 2026-W32 | 100% | 0% | 0% | 0% |
| 2026-W31 | 60% | 35% | 4% | 0% |
| 2026-W30 | 74% | 26% | 0% | 0% |
| 2026-W29 | 59% | 41% | 0% | 0% |
| 2026-W28 | 70% | 30% | 0% | 0% |
| 2026-W27 | 66% | 34% | 0% | 0% |
| 2026-W26 | 65% | 35% | 0% | 0% |
| 2026-W25 | 66% | 34% | 0% | 0% |
Por mes
| Periodo | Detectó un punto ciego | Confirmó el enfoque | No aportó nada | Estaba equivocado |
|---|---|---|---|---|
| 2026-08 | 57% | 43% | 0% | 0% |
| 2026-07 | 64% | 34% | 1% | 0% |
| 2026-06 | 66% | 34% | 0% | 0% |
Valoraciones de usuarios
Feedback de revisores humanos (incluido el feedback transmitido por un agente en nombre de una persona). Nunca se mezcla con las autovaloraciones de los agentes.
Por día
| Periodo | Detectó un punto ciego | Confirmó el enfoque | No aportó nada | Estaba equivocado |
|---|---|---|---|---|
| 2026-07-20 | 100% | 0% | 0% | 0% |
| 2026-07-14 | 100% | 0% | 0% | 0% |
| 2026-07-12 | 100% | 0% | 0% | 0% |
| 2026-07-10 | 100% | 0% | 0% | 0% |
| 2026-07-09 | 100% | 0% | 0% | 0% |
| 2026-07-01 | 100% | 0% | 0% | 0% |
| 2026-06-29 | 100% | 0% | 0% | 0% |
| 2026-06-28 | 100% | 0% | 0% | 0% |
Por semana
| Periodo | Detectó un punto ciego | Confirmó el enfoque | No aportó nada | Estaba equivocado |
|---|---|---|---|---|
| 2026-W30 | 100% | 0% | 0% | 0% |
| 2026-W29 | 100% | 0% | 0% | 0% |
| 2026-W28 | 100% | 0% | 0% | 0% |
| 2026-W27 | 100% | 0% | 0% | 0% |
| 2026-W26 | 100% | 0% | 0% | 0% |
Por mes
| Periodo | Detectó un punto ciego | Confirmó el enfoque | No aportó nada | Estaba equivocado |
|---|---|---|---|---|
| 2026-07 | 91% | 9% | 0% | 0% |
| 2026-06 | 100% | 0% | 0% | 0% |
Rendimiento por modelo en nuestro council
Estas son cifras de rendimiento por modelo de nuestra evaluación por council, separadas de las valoraciones de arriba. Es nuestra propia puntuación sobre llamadas reales, no un benchmark absoluto.
| Modelo | Tasa de acierto ↓ | Puntuación council (0–10) | Puntos ciegos detectados |
|---|---|---|---|
| Claude Opus 4.8 | 95% | 9.7 | 12% |
| Claude Sonnet 4.6 | 93% | 9.7 | 26% |
| Qwen 3.6 Plus | 93% | 9.5 | 33% |
| Qwen 3.7 Max | 91% | 9.4 | 49% |
| gpt-5.4 | 89% | 9.6 | 3% |
| gpt-4o-mini | 88% | 9.4 | 55% |
| Gemini 2.5 Flash | 84% | 9.2 | 16% |
| Claude Haiku 4.5 | 82% | 9.2 | 5% |
| Claude Sonnet 4.5 | 76% | 9.2 | 4% |
| Mistral-Small-3.2-24B-Instruct-2506 | 74% | 9.1 | 24% |
| Gemini 2.5 Pro | 65% | 8.6 | 7% |
| gpt-4.1 | 62% | 8.7 | 4% |
| gpt-4o | 54% | 7.0 | 2% |
| DeepSeek v3.2 | 51% | 7.8 | 6% |
| Llama 4 Maverick | 43% | 7.5 | 13% |
| DeepSeek v4 Pro | 34% | 4.1 | 7% |
| gpt-4o-2024-08-06 | 34% | 5.0 | 4% |
| Claude Opus 5 | 25% | 3.3 | 9% |
| Qwen3.5-397B-A17B | 20% | 3.0 | 20% |
| Claude Fable 5 | 2% | 0.5 | 2% |
Nuestra propia puntuación council sobre llamadas reales en vivo, no un benchmark absoluto. El volumen de llamadas y el tipo de tareas varían por modelo, así que las cifras no son directamente comparables entre modelos; los modelos con muy pocas llamadas no se muestran. Los nombres de los modelos son marcas de sus respectivos propietarios; su uso aquí no implica afiliación ni respaldo.
Composiciones de council — utilidad según las valoraciones
Qué composiciones de council (proponentes + juez) encontraron más útiles las personas y los agentes, ordenadas por una puntuación de utilidad neta derivada de los votos. Las valoraciones de agentes y personas se mantienen separadas.
Valoraciones de personas
| Composición | Utilidad neta | Desglose |
|---|---|---|
| anthropic/claude-haiku-4-5-20251001 + google/gemini-2.5-flash + openai/gpt-4o · ⚖ openai/gpt-4o | +1.00 | Detectó un punto ciego 80% · Confirmó el enfoque 20% · Desacuerdo resuelto 0% · No aportó nada 0% · Estaba equivocado 0% |
Valoraciones de agentes
| Composición | Utilidad neta | Desglose |
|---|---|---|
| anthropic/claude-opus-4-8 + google/gemini-2.5-pro + openai/gpt-5.4 · ⚖ claude-sonnet-4-6 | +1.00 | Detectó un punto ciego 87% · Confirmó el enfoque 13% · Desacuerdo resuelto 0% · No aportó nada 0% · Estaba equivocado 0% |
| anthropic/claude-opus-5 + google/gemini-2.5-pro + openai/gpt-5.4 + ovh/Qwen3.5-397B-A17B · ⚖ claude-sonnet-4-6 | +1.00 | Detectó un punto ciego 31% · Confirmó el enfoque 69% · Desacuerdo resuelto 0% · No aportó nada 0% · Estaba equivocado 0% |
| google/gemini-2.5-pro + openai/gpt-5.4 + openrouter/deepseek/deepseek-v3.2 · ⚖ claude-sonnet-4-6 | +1.00 | Detectó un punto ciego 77% · Confirmó el enfoque 23% · Desacuerdo resuelto 0% · No aportó nada 0% · Estaba equivocado 0% |
| anthropic/claude-opus-4-8 + google/gemini-2.5-pro + openai/gpt-5.4 + openrouter/deepseek/deepseek-v3.2 + openrouter/meta-llama/llama-4-maverick · ⚖ openai/gpt-4o | +1.00 | Detectó un punto ciego 67% · Confirmó el enfoque 33% · Desacuerdo resuelto 0% · No aportó nada 0% · Estaba equivocado 0% |
| anthropic/claude-opus-4-8 + google/gemini-2.5-pro · ⚖ gpt-4.1 | +1.00 | Detectó un punto ciego 75% · Confirmó el enfoque 25% · Desacuerdo resuelto 0% · No aportó nada 0% · Estaba equivocado 0% |
| anthropic/claude-opus-4-8 + google/gemini-2.5-pro + openai/gpt-5.4 · ⚖ openai/gpt-4o | +0.99 | Detectó un punto ciego 50% · Confirmó el enfoque 48% · Desacuerdo resuelto 2% · No aportó nada 0% · Estaba equivocado 0% |
| anthropic/claude-haiku-4-5-20251001 + google/gemini-2.5-flash + openai/gpt-4o · ⚖ openai/gpt-4o | +0.99 | Detectó un punto ciego 47% · Confirmó el enfoque 50% · Desacuerdo resuelto 3% · No aportó nada 0% · Estaba equivocado 0% |
Conjuntos de jueces — utilidad según las valoraciones
Qué composiciones de jueces encontraron más útiles las personas y los agentes, con la misma puntuación de utilidad neta. Separado de las composiciones de council de arriba.
Valoraciones de personas
| Composición | Utilidad neta | Desglose |
|---|---|---|
| openai/gpt-4o | +1.00 | Detectó un punto ciego 86% · Confirmó el enfoque 14% · Desacuerdo resuelto 0% · No aportó nada 0% · Estaba equivocado 0% |
Valoraciones de agentes
| Composición | Utilidad neta | Desglose |
|---|---|---|
| gpt-4.1 | +1.00 | Detectó un punto ciego 71% · Confirmó el enfoque 29% · Desacuerdo resuelto 0% · No aportó nada 0% · Estaba equivocado 0% |
| claude-haiku-4-5-20251001 | +1.00 | Detectó un punto ciego 42% · Confirmó el enfoque 58% · Desacuerdo resuelto 0% · No aportó nada 0% · Estaba equivocado 0% |
| claude-sonnet-4-6 | +1.00 | Detectó un punto ciego 67% · Confirmó el enfoque 32% · Desacuerdo resuelto 1% · No aportó nada 0% · Estaba equivocado 0% |
| openai/gpt-4o | +0.99 | Detectó un punto ciego 51% · Confirmó el enfoque 47% · Desacuerdo resuelto 1% · No aportó nada 0% · Estaba equivocado 0% |
| claude-opus-4-8 | +0.94 | Detectó un punto ciego 53% · Confirmó el enfoque 35% · Desacuerdo resuelto 12% · No aportó nada 0% · Estaba equivocado 0% |
La utilidad neta se deriva de los votos — positivos menos negativos, sobre el total — mostrada con el número de votos y el desglose completo para que sea auditable. Una fórmula inicial, no una puntuación definitiva. Los nombres de los modelos son marcas de sus respectivos propietarios; su uso aquí no implica afiliación ni respaldo.
Solo mostramos cifras reales: cuántas veces se valoraron de cierta manera las respuestas del consejo en vivo, nunca una afirmación de valor que los datos no sostengan. Las celdas pequeñas se suprimen para que ninguna valoración individual pueda aislarse.