Evidencia en vivo
Por qué un solo modelo no es suficiente
Datos reales de cada ejecución del consejo que procesamos — actualizados cada 15 minutos. Sin simulaciones, sin ejemplos seleccionados a mano.
Cobertura de puntos ciegos
Un punto ciego es una vulnerabilidad o error real que un modelo pasa por alto silenciosamente mientras otro modelo en el mismo consejo lo detecta. El gráfico muestra qué modelos proporcionan con más frecuencia el hallazgo único — el resultado que ningún otro modelo del panel había marcado.
Modelo · Tasa de captura única
- 1Gpt 4o Mini54.6%100.0%
- 2Qwen3.7 Max48.7%89.2%
- 3Qwen3.6 Plus33.3%61.0%
- 4Claude Sonnet 4 626.3%48.2%
- 5Mistral Small 3.2 24B Instruct 250623.5%43.0%
- 6Qwen3.5 397B A17B17.5%32.1%
- 7Gemini 2.5 Flash16.1%29.5%
- 8Llama 4 Maverick13.1%24.0%
Ordenado por tasa de captura única. Solo se muestran los modelos con datos suficientes. Las tasas son porcentajes de los propios eventos de un modelo.
Puntuaciones de calidad
Puntuación de calidad promedio (0–100) y tasa ok, calculadas sobre todas las evaluaciones de juez donde el modelo actuó como proponente. Tasa ok = fracción de veredictos calificados como completamente correctos.
| Modelo | Calidad prom. (0–100) | Tasa ok |
|---|---|---|
| Gpt 5.2 Chat Latest | 99.5 | 100.0% |
| Gpt 5.3 Chat Latest | 99.3 | 100.0% |
| Gpt 5 Chat Latest | 99.2 | 98.3% |
| Gpt 5.1 Chat Latest | 99.1 | 100.0% |
| Claude Opus 4 6 | 97.6 | 98.4% |
| Claude Opus 4 1 20250805 | 97.6 | 96.8% |
| Gpt 5.1 | 97.6 | 95.1% |
| Gpt 5.5 2026 04 23 | 97.5 | 97.6% |
Fiabilidad
Tasa de ruido = fracción de respuestas del modelo que el clasificador del consejo marca como fuera del tema o de baja señal. Tasa de error = fracción de llamadas API que devolvieron un error. Ambas son promedios de todos los modelos calificados.
Tasa de ruido prom.
9.09%
Parte de las respuestas marcadas como ruido por el clasificador.
Tasa de error API prom.
1.17%
Parte de las llamadas de modelo que devolvieron un error.
Benchmark de revisión de seguridad y validación del valor del consenso (INT-1929, INT-2126)
Prueba ciega pre-registrada · 12 vulnerabilidades sembradas + 4 controles limpios · evaluador ciego: modelo independiente no en el consejo · costo: €0,43
Creamos una tarea realista de revisión de código con 12 clases de vulnerabilidades reales y 4 controles limpios. Cada brazo funcionó de forma independiente. El evaluador ciego no sabía qué brazo había producido qué resultado.
| Brazo | Recall (de 12) | Falsos positivos (de 4) |
|---|---|---|
| GPT-4o (single) | 7 / 12 | 1 |
| Gemini 2.5 Flash (single) | 11 / 12 | 5 |
| Claude Haiku 4.5 (single) | 12 / 12 | 5 |
| Consejo — consenso | 12 / 12 | 7 |
GPT-4o informó silenciosamente "No se encontraron problemas de seguridad" en 5 de las 12 vulnerabilidades reales — el canal lateral de temporización, el IDOR, la verificación de autorización faltante, el token de restablecimiento predecible y la carrera TOCTOU. Estos son los errores de contexto y lógica, no los del libro de texto. El consejo encontró los cinco.
El recall por modelo único varió del 58% (GPT-4o) al 100% (Claude Haiku) en las mismas tareas. No se sabe de antemano qué modelo es más fuerte para el error en cuestión. El consejo entrega un recall de primer nivel sin ese riesgo.
En una prueba de seguimiento más amplia y preregistrada contra 30 errores reales y externos (no escritos por nosotros), el consejo no superó a una simple segunda revisión, descontando las falsas alarmas — un resultado que medimos y publicamos en su totalidad. Esto confirma el mismo techo honesto que este benchmark de 12 elementos ya mostraba: el consejo iguala al mejor revisor disponible, no lo supera.
Un recall más alto cuesta algo de precisión. Falsos positivos en código limpio: GPT-4o obtuvo 1 (conservador pero perdió 5 errores reales), mientras que el consejo obtuvo 7. Un humano revisa los marcadores adicionales — esa revisión es el costo de no perder el canal lateral de temporización.
Señal creciente
Una señal de retroalimentación de agentes y humanos está creciendo activamente. Publicaremos calificaciones y estadísticas de acuerdo una vez que el conjunto de datos sea lo suficientemente grande como para ser significativo.
Datos en vivo obtenidos a las 28 ago 2026, 18:27