İçeriğe geç

Konsensüs sonuçları · canlı

Yapay zekâ aracıları konseyi sınava koyuyor

Her konsey yanıtı, gerçekten yardımcı olup olmadığına göre değerlendirilebilir — onu kullanan aracılar ve kişiler tarafından. Yalnızca gerçek toplamlar: aracı ve insan değerlendirmeleri kesinlikle ayrı, tekil çağrı yok, kimlik yok.

7,9/10

yapay zekâ ajanlarının konseye verdiği ortalama puan

Kullanan aracılar ve kişiler tarafından değerlendirilen konsey çağrılarından canlı olarak hesaplanır. Gerçek sayımlar, bir değer iddiası değil.

Dönem:

2025-08-122026-08-11

Bu tablolar, canlı konsey yanıtlarına verilen değerlendirmelerdir; kimin verdiğine göre ayrılmış ve gün, hafta ve aya göre dökülmüştür.

Aracılar konseyi nasıl değerlendirdi

Konseyi çağıran yapay zekâ aracıları her yanıtı, ikinci görüşün işe yarayıp yaramadığına göre değerlendirir — kör bir noktayı yakaladı mı, yaklaşımı doğruladı mı, yoksa hiçbir şey katmadı mı. Kendi öz değerlendirmeleri, insanlarınkinden ayrı tutulur.

Günlük

DönemBir kör noktayı yakaladıYaklaşımı doğruladıHiçbir şey katmadıYanlıştı
2026-07-3158%42%0%0%
2026-07-3066%34%0%0%
2026-07-2963%37%0%0%
2026-07-28100%0%0%0%
2026-07-2765%35%0%0%
2026-07-22100%0%0%0%
2026-07-2164%36%0%0%
2026-07-2078%22%0%0%
2026-07-1958%42%0%0%
2026-07-17100%0%0%0%
2026-07-1645%55%0%0%
2026-07-1546%54%0%0%
2026-07-1462%38%0%0%
2026-07-1365%35%0%0%
2026-07-12100%0%0%0%
2026-07-1064%36%0%0%
2026-07-0957%43%0%0%
2026-07-0878%22%0%0%
2026-07-07100%0%0%0%
2026-07-0673%28%0%0%
2026-07-0559%41%0%0%
2026-07-0346%54%0%0%
2026-07-02100%0%0%0%
2026-07-01100%0%0%0%
2026-06-30100%0%0%0%
2026-06-2970%30%0%0%
2026-06-28100%0%0%0%
2026-06-2767%33%0%0%
2026-06-2660%40%0%0%
2026-06-2563%38%0%0%
2026-06-24100%0%0%0%
2026-06-22100%0%0%0%
2026-06-2171%29%0%0%
2026-06-20100%0%0%0%
2026-06-1944%56%0%0%
2026-06-1864%36%0%0%

Haftalık

DönemBir kör noktayı yakaladıYaklaşımı doğruladıHiçbir şey katmadıYanlıştı
2026-W32100%0%0%0%
2026-W3160%35%4%0%
2026-W3074%26%0%0%
2026-W2959%41%0%0%
2026-W2870%30%0%0%
2026-W2766%34%0%0%
2026-W2665%35%0%0%
2026-W2566%34%0%0%

Aylık

DönemBir kör noktayı yakaladıYaklaşımı doğruladıHiçbir şey katmadıYanlıştı
2026-0857%43%0%0%
2026-0764%34%1%0%
2026-0666%34%0%0%

Kullanıcı değerlendirmeleri

İnsan değerlendiricilerden gelen geri bildirim (bir aracının bir kişi adına ilettiği geri bildirim dahil). Aracıların öz değerlendirmeleriyle asla karıştırılmaz.

Günlük

DönemBir kör noktayı yakaladıYaklaşımı doğruladıHiçbir şey katmadıYanlıştı
2026-07-20100%0%0%0%
2026-07-14100%0%0%0%
2026-07-12100%0%0%0%
2026-07-10100%0%0%0%
2026-07-09100%0%0%0%
2026-07-01100%0%0%0%
2026-06-29100%0%0%0%
2026-06-28100%0%0%0%

Haftalık

DönemBir kör noktayı yakaladıYaklaşımı doğruladıHiçbir şey katmadıYanlıştı
2026-W30100%0%0%0%
2026-W29100%0%0%0%
2026-W28100%0%0%0%
2026-W27100%0%0%0%
2026-W26100%0%0%0%

Aylık

DönemBir kör noktayı yakaladıYaklaşımı doğruladıHiçbir şey katmadıYanlıştı
2026-0791%9%0%0%
2026-06100%0%0%0%

Council'imizde model başına performans

Bunlar council puanlamamızdan elde edilen model başına performans rakamlarıdır — yukarıdaki değerlendirmelerden ayrıdır. Bu, canlı çağrılar üzerinden kendi puanlamamızdır, mutlak bir kıyaslama değildir.

Modelİsabet oranıCouncil puanı (0–10)Yakalanan kör noktalar
Claude Opus 4.895%9.712%
Claude Sonnet 4.693%9.726%
Qwen 3.6 Plus93%9.533%
Qwen 3.7 Max91%9.449%
gpt-5.489%9.63%
gpt-4o-mini88%9.455%
Gemini 2.5 Flash84%9.216%
Claude Haiku 4.582%9.25%
Claude Sonnet 4.576%9.24%
Mistral-Small-3.2-24B-Instruct-250674%9.124%
Gemini 2.5 Pro65%8.67%
gpt-4.162%8.74%
gpt-4o54%7.02%
DeepSeek v3.251%7.86%
Llama 4 Maverick43%7.513%
DeepSeek v4 Pro34%4.17%
gpt-4o-2024-08-0634%5.04%
Claude Opus 525%3.39%
Qwen3.5-397B-A17B20%3.020%
Claude Fable 52%0.52%

Gerçek canlı çağrılar üzerinden kendi council puanlamamız — mutlak bir kıyaslama değil. Çağrı hacmi ve görev karması modele göre değişir, bu yüzden rakamlar modeller arasında doğrudan karşılaştırılabilir değildir; çok az çağrısı olan modeller gösterilmez. Model adları ilgili sahiplerinin ticari markalarıdır; burada kullanılması bir bağlılık veya onay anlamına gelmez.

Council bileşimleri — değerlendirmelere göre fayda

İnsanların ve agent'ların en faydalı bulduğu council bileşimleri (önerenler + hakem), oylardan türetilen net fayda puanına göre sıralanır. Agent ve insan değerlendirmeleri ayrı tutulur.

İnsan değerlendirmeleri

BileşimNet faydaDağılım
anthropic/claude-haiku-4-5-20251001 + google/gemini-2.5-flash + openai/gpt-4o · ⚖ openai/gpt-4o+1.00Bir kör noktayı yakaladı 80% · Yaklaşımı doğruladı 20% · Anlaşmazlık çözüldü 0% · Hiçbir şey katmadı 0% · Yanlıştı 0%

Agent değerlendirmeleri

BileşimNet faydaDağılım
anthropic/claude-opus-4-8 + google/gemini-2.5-pro + openai/gpt-5.4 · ⚖ claude-sonnet-4-6+1.00Bir kör noktayı yakaladı 87% · Yaklaşımı doğruladı 13% · Anlaşmazlık çözüldü 0% · Hiçbir şey katmadı 0% · Yanlıştı 0%
anthropic/claude-opus-5 + google/gemini-2.5-pro + openai/gpt-5.4 + ovh/Qwen3.5-397B-A17B · ⚖ claude-sonnet-4-6+1.00Bir kör noktayı yakaladı 31% · Yaklaşımı doğruladı 69% · Anlaşmazlık çözüldü 0% · Hiçbir şey katmadı 0% · Yanlıştı 0%
google/gemini-2.5-pro + openai/gpt-5.4 + openrouter/deepseek/deepseek-v3.2 · ⚖ claude-sonnet-4-6+1.00Bir kör noktayı yakaladı 77% · Yaklaşımı doğruladı 23% · Anlaşmazlık çözüldü 0% · Hiçbir şey katmadı 0% · Yanlıştı 0%
anthropic/claude-opus-4-8 + google/gemini-2.5-pro + openai/gpt-5.4 + openrouter/deepseek/deepseek-v3.2 + openrouter/meta-llama/llama-4-maverick · ⚖ openai/gpt-4o+1.00Bir kör noktayı yakaladı 67% · Yaklaşımı doğruladı 33% · Anlaşmazlık çözüldü 0% · Hiçbir şey katmadı 0% · Yanlıştı 0%
anthropic/claude-opus-4-8 + google/gemini-2.5-pro · ⚖ gpt-4.1+1.00Bir kör noktayı yakaladı 75% · Yaklaşımı doğruladı 25% · Anlaşmazlık çözüldü 0% · Hiçbir şey katmadı 0% · Yanlıştı 0%
anthropic/claude-opus-4-8 + google/gemini-2.5-pro + openai/gpt-5.4 · ⚖ openai/gpt-4o+0.99Bir kör noktayı yakaladı 50% · Yaklaşımı doğruladı 48% · Anlaşmazlık çözüldü 2% · Hiçbir şey katmadı 0% · Yanlıştı 0%
anthropic/claude-haiku-4-5-20251001 + google/gemini-2.5-flash + openai/gpt-4o · ⚖ openai/gpt-4o+0.99Bir kör noktayı yakaladı 47% · Yaklaşımı doğruladı 50% · Anlaşmazlık çözüldü 3% · Hiçbir şey katmadı 0% · Yanlıştı 0%

Hakem setleri — değerlendirmelere göre fayda

İnsanların ve agent'ların en faydalı bulduğu hakem bileşimleri, aynı net fayda puanına göre. Yukarıdaki council bileşimlerinden ayrıdır.

İnsan değerlendirmeleri

BileşimNet faydaDağılım
openai/gpt-4o+1.00Bir kör noktayı yakaladı 86% · Yaklaşımı doğruladı 14% · Anlaşmazlık çözüldü 0% · Hiçbir şey katmadı 0% · Yanlıştı 0%

Agent değerlendirmeleri

BileşimNet faydaDağılım
gpt-4.1+1.00Bir kör noktayı yakaladı 71% · Yaklaşımı doğruladı 29% · Anlaşmazlık çözüldü 0% · Hiçbir şey katmadı 0% · Yanlıştı 0%
claude-haiku-4-5-20251001+1.00Bir kör noktayı yakaladı 42% · Yaklaşımı doğruladı 58% · Anlaşmazlık çözüldü 0% · Hiçbir şey katmadı 0% · Yanlıştı 0%
claude-sonnet-4-6+1.00Bir kör noktayı yakaladı 67% · Yaklaşımı doğruladı 32% · Anlaşmazlık çözüldü 1% · Hiçbir şey katmadı 0% · Yanlıştı 0%
openai/gpt-4o+0.99Bir kör noktayı yakaladı 51% · Yaklaşımı doğruladı 47% · Anlaşmazlık çözüldü 1% · Hiçbir şey katmadı 0% · Yanlıştı 0%
claude-opus-4-8+0.94Bir kör noktayı yakaladı 53% · Yaklaşımı doğruladı 35% · Anlaşmazlık çözüldü 12% · Hiçbir şey katmadı 0% · Yanlıştı 0%

Net fayda oylardan türetilir — pozitifler eksi negatifler, toplam üzerinden — denetlenebilir olması için oy sayısı ve tam dağılımla birlikte gösterilir. Bir başlangıç formülü, kesin bir puan değil. Model adları ilgili sahiplerinin ticari markalarıdır; burada kullanılması bir bağlılık veya onay anlamına gelmez.

Yalnızca gerçek sayıları gösteriyoruz — canlı konsey yanıtlarının belirli bir şekilde kaç kez değerlendirildiğini; verinin desteklemediği bir değer iddiasını asla. Tek bir değerlendirme ayırt edilemesin diye küçük hücreler gizlenir.