İçeriğe geç

Canlı Kanıt

Neden tek bir model yetmez

İşlediğimiz her konsey çalışmasından gerçek veriler — her 15 dakikada bir güncellenir. Simülasyon yok, elle seçilmiş örnek yok.

Kör nokta kapsamı

Kör nokta, bir modelin sessizce gözden kaçırdığı ancak aynı konseydeki başka bir modelin yakaladığı gerçek bir güvenlik açığı veya hatadır. Aşağıdaki grafik, hangi modellerin en sık benzersiz tespiti sağladığını gösterir — paneldeki hiçbir başka modelin işaretlemediği bulgu.

Model · Benzersiz yakalama oranı

  • 1Gpt 4o Mini
    100.0%
    54.6%
  • 2Qwen3.7 Max
    89.2%
    48.7%
  • 3Qwen3.6 Plus
    61.0%
    33.3%
  • 4Claude Sonnet 4 6
    48.2%
    26.3%
  • 5Mistral Small 3.2 24B Instruct 2506
    43.0%
    23.5%
  • 6Qwen3.5 397B A17B
    32.1%
    17.5%
  • 7Gemini 2.5 Flash
    29.5%
    16.1%
  • 8Llama 4 Maverick
    24.0%
    13.1%

Benzersiz yakalama oranına göre sıralandı. Yalnızca yeterli veriye sahip modeller gösterilir. Oranlar bir modelin kendi olaylarının yüzdeleridir.

Kalite puanları

Modelin öneren olarak hareket ettiği tüm yargı değerlendirmeleri üzerinden hesaplanan ortalama kalite puanı (0–100) ve tamam oranı. Tamam oranı = tamamen doğru olarak değerlendirilen kararların oranı.

ModelOrt. kalite (0–100)Tamam oranı
Gpt 5.2 Chat Latest99.5100.0%
Gpt 5.3 Chat Latest99.3100.0%
Gpt 5 Chat Latest99.298.3%
Gpt 5.1 Chat Latest99.1100.0%
Claude Opus 4 697.698.4%
Claude Opus 4 1 2025080597.696.8%
Gpt 5.197.695.1%
Gpt 5.5 2026 04 2397.597.6%

Güvenilirlik

Gürültü oranı = konsey sınıflandırıcısının konudan çıkmış veya düşük sinyalli olarak işaretlediği model yanıtlarının oranı. Hata oranı = hata döndüren API çağrılarının oranı. Her ikisi de tüm nitelikli modellerin ortalamasıdır.

Ort. gürültü oranı

9.09%

Sınıflandırıcı tarafından gürültü olarak işaretlenen yanıtların payı.

Ort. API hata oranı

1.17%

Hata döndüren model çağrılarının payı.

Güvenlik incelemesi kıyaslaması ve konsensüs değeri doğrulaması (INT-1929, INT-2126)

Önceden kayıtlı kör test · 12 ekili güvenlik açığı + 4 temiz kontrol · kör değerlendirici: konseyde olmayan bağımsız model · maliyet: €0,43

12 gerçek güvenlik açığı sınıfı ve 4 temiz kontrolle gerçekçi bir kod inceleme görevi oluşturduk. Her kol bağımsız olarak çalıştı. Kör değerlendirici hangi kolun hangi çıktıyı ürettiğini bilmiyordu.

KolGeri çağırma (12 üzerinden)Yanlış pozitifler (4 üzerinden)
GPT-4o (single)7 / 121
Gemini 2.5 Flash (single)11 / 125
Claude Haiku 4.5 (single)12 / 125
Konsey — uzlaşı12 / 127
Temel bulgu

GPT-4o, 12 gerçek güvenlik açığından 5'i için sessizce "Güvenlik sorunu bulunamadı" bildirdi — zamanlama yan kanalı, IDOR, eksik yetkilendirme kontrolü, tahmin edilebilir sıfırlama jetonu ve TOCTOU yarışı. Bunlar bağlam ve mantık hataları, ders kitabı hataları değil. Konsey beşini de yakaladı.

Model seçiminde kumar yok

Tek model başına geri çağırma, aynı görevlerde %58 (GPT-4o) ile %100 (Claude Haiku) arasında değişti. Önünüzdeki hata için hangi modelin daha güçlü olduğunu önceden bilemezsiniz. Konsey, bu kumarbazlık olmadan panel düzeyinde geri çağırma sağlar.

Dürüst tavan

30 gerçek, harici hataya (bizim tarafımızdan yazılmamış) karşı yapılan daha büyük, önceden kayıtlı bir takip testinde, konsey yanlış alarmlar düşüldükten sonra sıradan bir ikinci bakışı geçemedi — ölçtüğümüz ve tam olarak yayımladığımız bir sonuç. Bu, bu 12 öğelik kıyaslamanın zaten gösterdiği aynı dürüst tavanı doğruluyor: konsey mevcut en iyi incelemeciyle beraberlik yapar, onu geçmez.

Hassasiyet takası

Daha yüksek geri çağırma bazı hassasiyetlere mal olur. Temiz kod üzerindeki yanlış pozitifler: GPT-4o 1 aldı (muhafazakâr ama 5 gerçek hatayı kaçırdı), konsey ise 7 aldı. Bir insan ek işaretlemeleri gözden geçirir — bu önceliklendirme, zamanlama yan kanalını kaçırmama maliyetidir.

Büyüyen sinyal

Bir ajan ve insan geri bildirim sinyali aktif olarak büyüyor. Veri kümesi anlamlı olacak kadar büyüdüğünde derecelendirmeleri ve uyum istatistiklerini yayınlayacağız.

Canlı veriler alındı: 28 Ağu 2026 18:27