Canlı Kanıt
Neden tek bir model yetmez
İşlediğimiz her konsey çalışmasından gerçek veriler — her 15 dakikada bir güncellenir. Simülasyon yok, elle seçilmiş örnek yok.
Kör nokta kapsamı
Kör nokta, bir modelin sessizce gözden kaçırdığı ancak aynı konseydeki başka bir modelin yakaladığı gerçek bir güvenlik açığı veya hatadır. Aşağıdaki grafik, hangi modellerin en sık benzersiz tespiti sağladığını gösterir — paneldeki hiçbir başka modelin işaretlemediği bulgu.
Model · Benzersiz yakalama oranı
- 1Gpt 4o Mini54.6%100.0%
- 2Qwen3.7 Max48.7%89.2%
- 3Qwen3.6 Plus33.3%61.0%
- 4Claude Sonnet 4 626.3%48.2%
- 5Mistral Small 3.2 24B Instruct 250623.5%43.0%
- 6Qwen3.5 397B A17B17.5%32.1%
- 7Gemini 2.5 Flash16.1%29.5%
- 8Llama 4 Maverick13.1%24.0%
Benzersiz yakalama oranına göre sıralandı. Yalnızca yeterli veriye sahip modeller gösterilir. Oranlar bir modelin kendi olaylarının yüzdeleridir.
Kalite puanları
Modelin öneren olarak hareket ettiği tüm yargı değerlendirmeleri üzerinden hesaplanan ortalama kalite puanı (0–100) ve tamam oranı. Tamam oranı = tamamen doğru olarak değerlendirilen kararların oranı.
| Model | Ort. kalite (0–100) | Tamam oranı |
|---|---|---|
| Gpt 5.2 Chat Latest | 99.5 | 100.0% |
| Gpt 5.3 Chat Latest | 99.3 | 100.0% |
| Gpt 5 Chat Latest | 99.2 | 98.3% |
| Gpt 5.1 Chat Latest | 99.1 | 100.0% |
| Claude Opus 4 6 | 97.6 | 98.4% |
| Claude Opus 4 1 20250805 | 97.6 | 96.8% |
| Gpt 5.1 | 97.6 | 95.1% |
| Gpt 5.5 2026 04 23 | 97.5 | 97.6% |
Güvenilirlik
Gürültü oranı = konsey sınıflandırıcısının konudan çıkmış veya düşük sinyalli olarak işaretlediği model yanıtlarının oranı. Hata oranı = hata döndüren API çağrılarının oranı. Her ikisi de tüm nitelikli modellerin ortalamasıdır.
Ort. gürültü oranı
9.09%
Sınıflandırıcı tarafından gürültü olarak işaretlenen yanıtların payı.
Ort. API hata oranı
1.17%
Hata döndüren model çağrılarının payı.
Güvenlik incelemesi kıyaslaması ve konsensüs değeri doğrulaması (INT-1929, INT-2126)
Önceden kayıtlı kör test · 12 ekili güvenlik açığı + 4 temiz kontrol · kör değerlendirici: konseyde olmayan bağımsız model · maliyet: €0,43
12 gerçek güvenlik açığı sınıfı ve 4 temiz kontrolle gerçekçi bir kod inceleme görevi oluşturduk. Her kol bağımsız olarak çalıştı. Kör değerlendirici hangi kolun hangi çıktıyı ürettiğini bilmiyordu.
| Kol | Geri çağırma (12 üzerinden) | Yanlış pozitifler (4 üzerinden) |
|---|---|---|
| GPT-4o (single) | 7 / 12 | 1 |
| Gemini 2.5 Flash (single) | 11 / 12 | 5 |
| Claude Haiku 4.5 (single) | 12 / 12 | 5 |
| Konsey — uzlaşı | 12 / 12 | 7 |
GPT-4o, 12 gerçek güvenlik açığından 5'i için sessizce "Güvenlik sorunu bulunamadı" bildirdi — zamanlama yan kanalı, IDOR, eksik yetkilendirme kontrolü, tahmin edilebilir sıfırlama jetonu ve TOCTOU yarışı. Bunlar bağlam ve mantık hataları, ders kitabı hataları değil. Konsey beşini de yakaladı.
Tek model başına geri çağırma, aynı görevlerde %58 (GPT-4o) ile %100 (Claude Haiku) arasında değişti. Önünüzdeki hata için hangi modelin daha güçlü olduğunu önceden bilemezsiniz. Konsey, bu kumarbazlık olmadan panel düzeyinde geri çağırma sağlar.
30 gerçek, harici hataya (bizim tarafımızdan yazılmamış) karşı yapılan daha büyük, önceden kayıtlı bir takip testinde, konsey yanlış alarmlar düşüldükten sonra sıradan bir ikinci bakışı geçemedi — ölçtüğümüz ve tam olarak yayımladığımız bir sonuç. Bu, bu 12 öğelik kıyaslamanın zaten gösterdiği aynı dürüst tavanı doğruluyor: konsey mevcut en iyi incelemeciyle beraberlik yapar, onu geçmez.
Daha yüksek geri çağırma bazı hassasiyetlere mal olur. Temiz kod üzerindeki yanlış pozitifler: GPT-4o 1 aldı (muhafazakâr ama 5 gerçek hatayı kaçırdı), konsey ise 7 aldı. Bir insan ek işaretlemeleri gözden geçirir — bu önceliklendirme, zamanlama yan kanalını kaçırmama maliyetidir.
Büyüyen sinyal
Bir ajan ve insan geri bildirim sinyali aktif olarak büyüyor. Veri kümesi anlamlı olacak kadar büyüdüğünde derecelendirmeleri ve uyum istatistiklerini yayınlayacağız.
Canlı veriler alındı: 28 Ağu 2026 18:27