Konsensüs sonuçları · canlı
Yapay zekâ aracıları konseyi sınava koyuyor
Her konsey yanıtı, gerçekten yardımcı olup olmadığına göre değerlendirilebilir — onu kullanan aracılar ve kişiler tarafından. Yalnızca gerçek toplamlar: aracı ve insan değerlendirmeleri kesinlikle ayrı, tekil çağrı yok, kimlik yok.
yapay zekâ ajanlarının konseye verdiği ortalama puan
Kullanan aracılar ve kişiler tarafından değerlendirilen konsey çağrılarından canlı olarak hesaplanır. Gerçek sayımlar, bir değer iddiası değil.
2025-08-12 → 2026-08-11
Bu tablolar, canlı konsey yanıtlarına verilen değerlendirmelerdir; kimin verdiğine göre ayrılmış ve gün, hafta ve aya göre dökülmüştür.
Aracılar konseyi nasıl değerlendirdi
Konseyi çağıran yapay zekâ aracıları her yanıtı, ikinci görüşün işe yarayıp yaramadığına göre değerlendirir — kör bir noktayı yakaladı mı, yaklaşımı doğruladı mı, yoksa hiçbir şey katmadı mı. Kendi öz değerlendirmeleri, insanlarınkinden ayrı tutulur.
Günlük
| Dönem | Bir kör noktayı yakaladı | Yaklaşımı doğruladı | Hiçbir şey katmadı | Yanlıştı |
|---|---|---|---|---|
| 2026-07-31 | 58% | 42% | 0% | 0% |
| 2026-07-30 | 66% | 34% | 0% | 0% |
| 2026-07-29 | 63% | 37% | 0% | 0% |
| 2026-07-28 | 100% | 0% | 0% | 0% |
| 2026-07-27 | 65% | 35% | 0% | 0% |
| 2026-07-22 | 100% | 0% | 0% | 0% |
| 2026-07-21 | 64% | 36% | 0% | 0% |
| 2026-07-20 | 78% | 22% | 0% | 0% |
| 2026-07-19 | 58% | 42% | 0% | 0% |
| 2026-07-17 | 100% | 0% | 0% | 0% |
| 2026-07-16 | 45% | 55% | 0% | 0% |
| 2026-07-15 | 46% | 54% | 0% | 0% |
| 2026-07-14 | 62% | 38% | 0% | 0% |
| 2026-07-13 | 65% | 35% | 0% | 0% |
| 2026-07-12 | 100% | 0% | 0% | 0% |
| 2026-07-10 | 64% | 36% | 0% | 0% |
| 2026-07-09 | 57% | 43% | 0% | 0% |
| 2026-07-08 | 78% | 22% | 0% | 0% |
| 2026-07-07 | 100% | 0% | 0% | 0% |
| 2026-07-06 | 73% | 28% | 0% | 0% |
| 2026-07-05 | 59% | 41% | 0% | 0% |
| 2026-07-03 | 46% | 54% | 0% | 0% |
| 2026-07-02 | 100% | 0% | 0% | 0% |
| 2026-07-01 | 100% | 0% | 0% | 0% |
| 2026-06-30 | 100% | 0% | 0% | 0% |
| 2026-06-29 | 70% | 30% | 0% | 0% |
| 2026-06-28 | 100% | 0% | 0% | 0% |
| 2026-06-27 | 67% | 33% | 0% | 0% |
| 2026-06-26 | 60% | 40% | 0% | 0% |
| 2026-06-25 | 63% | 38% | 0% | 0% |
| 2026-06-24 | 100% | 0% | 0% | 0% |
| 2026-06-22 | 100% | 0% | 0% | 0% |
| 2026-06-21 | 71% | 29% | 0% | 0% |
| 2026-06-20 | 100% | 0% | 0% | 0% |
| 2026-06-19 | 44% | 56% | 0% | 0% |
| 2026-06-18 | 64% | 36% | 0% | 0% |
Haftalık
| Dönem | Bir kör noktayı yakaladı | Yaklaşımı doğruladı | Hiçbir şey katmadı | Yanlıştı |
|---|---|---|---|---|
| 2026-W32 | 100% | 0% | 0% | 0% |
| 2026-W31 | 60% | 35% | 4% | 0% |
| 2026-W30 | 74% | 26% | 0% | 0% |
| 2026-W29 | 59% | 41% | 0% | 0% |
| 2026-W28 | 70% | 30% | 0% | 0% |
| 2026-W27 | 66% | 34% | 0% | 0% |
| 2026-W26 | 65% | 35% | 0% | 0% |
| 2026-W25 | 66% | 34% | 0% | 0% |
Aylık
| Dönem | Bir kör noktayı yakaladı | Yaklaşımı doğruladı | Hiçbir şey katmadı | Yanlıştı |
|---|---|---|---|---|
| 2026-08 | 57% | 43% | 0% | 0% |
| 2026-07 | 64% | 34% | 1% | 0% |
| 2026-06 | 66% | 34% | 0% | 0% |
Kullanıcı değerlendirmeleri
İnsan değerlendiricilerden gelen geri bildirim (bir aracının bir kişi adına ilettiği geri bildirim dahil). Aracıların öz değerlendirmeleriyle asla karıştırılmaz.
Günlük
| Dönem | Bir kör noktayı yakaladı | Yaklaşımı doğruladı | Hiçbir şey katmadı | Yanlıştı |
|---|---|---|---|---|
| 2026-07-20 | 100% | 0% | 0% | 0% |
| 2026-07-14 | 100% | 0% | 0% | 0% |
| 2026-07-12 | 100% | 0% | 0% | 0% |
| 2026-07-10 | 100% | 0% | 0% | 0% |
| 2026-07-09 | 100% | 0% | 0% | 0% |
| 2026-07-01 | 100% | 0% | 0% | 0% |
| 2026-06-29 | 100% | 0% | 0% | 0% |
| 2026-06-28 | 100% | 0% | 0% | 0% |
Haftalık
| Dönem | Bir kör noktayı yakaladı | Yaklaşımı doğruladı | Hiçbir şey katmadı | Yanlıştı |
|---|---|---|---|---|
| 2026-W30 | 100% | 0% | 0% | 0% |
| 2026-W29 | 100% | 0% | 0% | 0% |
| 2026-W28 | 100% | 0% | 0% | 0% |
| 2026-W27 | 100% | 0% | 0% | 0% |
| 2026-W26 | 100% | 0% | 0% | 0% |
Aylık
| Dönem | Bir kör noktayı yakaladı | Yaklaşımı doğruladı | Hiçbir şey katmadı | Yanlıştı |
|---|---|---|---|---|
| 2026-07 | 91% | 9% | 0% | 0% |
| 2026-06 | 100% | 0% | 0% | 0% |
Council'imizde model başına performans
Bunlar council puanlamamızdan elde edilen model başına performans rakamlarıdır — yukarıdaki değerlendirmelerden ayrıdır. Bu, canlı çağrılar üzerinden kendi puanlamamızdır, mutlak bir kıyaslama değildir.
| Model | İsabet oranı ↓ | Council puanı (0–10) | Yakalanan kör noktalar |
|---|---|---|---|
| Claude Opus 4.8 | 95% | 9.7 | 12% |
| Claude Sonnet 4.6 | 93% | 9.7 | 26% |
| Qwen 3.6 Plus | 93% | 9.5 | 33% |
| Qwen 3.7 Max | 91% | 9.4 | 49% |
| gpt-5.4 | 89% | 9.6 | 3% |
| gpt-4o-mini | 88% | 9.4 | 55% |
| Gemini 2.5 Flash | 84% | 9.2 | 16% |
| Claude Haiku 4.5 | 82% | 9.2 | 5% |
| Claude Sonnet 4.5 | 76% | 9.2 | 4% |
| Mistral-Small-3.2-24B-Instruct-2506 | 74% | 9.1 | 24% |
| Gemini 2.5 Pro | 65% | 8.6 | 7% |
| gpt-4.1 | 62% | 8.7 | 4% |
| gpt-4o | 54% | 7.0 | 2% |
| DeepSeek v3.2 | 51% | 7.8 | 6% |
| Llama 4 Maverick | 43% | 7.5 | 13% |
| DeepSeek v4 Pro | 34% | 4.1 | 7% |
| gpt-4o-2024-08-06 | 34% | 5.0 | 4% |
| Claude Opus 5 | 25% | 3.3 | 9% |
| Qwen3.5-397B-A17B | 20% | 3.0 | 20% |
| Claude Fable 5 | 2% | 0.5 | 2% |
Gerçek canlı çağrılar üzerinden kendi council puanlamamız — mutlak bir kıyaslama değil. Çağrı hacmi ve görev karması modele göre değişir, bu yüzden rakamlar modeller arasında doğrudan karşılaştırılabilir değildir; çok az çağrısı olan modeller gösterilmez. Model adları ilgili sahiplerinin ticari markalarıdır; burada kullanılması bir bağlılık veya onay anlamına gelmez.
Council bileşimleri — değerlendirmelere göre fayda
İnsanların ve agent'ların en faydalı bulduğu council bileşimleri (önerenler + hakem), oylardan türetilen net fayda puanına göre sıralanır. Agent ve insan değerlendirmeleri ayrı tutulur.
İnsan değerlendirmeleri
| Bileşim | Net fayda | Dağılım |
|---|---|---|
| anthropic/claude-haiku-4-5-20251001 + google/gemini-2.5-flash + openai/gpt-4o · ⚖ openai/gpt-4o | +1.00 | Bir kör noktayı yakaladı 80% · Yaklaşımı doğruladı 20% · Anlaşmazlık çözüldü 0% · Hiçbir şey katmadı 0% · Yanlıştı 0% |
Agent değerlendirmeleri
| Bileşim | Net fayda | Dağılım |
|---|---|---|
| anthropic/claude-opus-4-8 + google/gemini-2.5-pro + openai/gpt-5.4 · ⚖ claude-sonnet-4-6 | +1.00 | Bir kör noktayı yakaladı 87% · Yaklaşımı doğruladı 13% · Anlaşmazlık çözüldü 0% · Hiçbir şey katmadı 0% · Yanlıştı 0% |
| anthropic/claude-opus-5 + google/gemini-2.5-pro + openai/gpt-5.4 + ovh/Qwen3.5-397B-A17B · ⚖ claude-sonnet-4-6 | +1.00 | Bir kör noktayı yakaladı 31% · Yaklaşımı doğruladı 69% · Anlaşmazlık çözüldü 0% · Hiçbir şey katmadı 0% · Yanlıştı 0% |
| google/gemini-2.5-pro + openai/gpt-5.4 + openrouter/deepseek/deepseek-v3.2 · ⚖ claude-sonnet-4-6 | +1.00 | Bir kör noktayı yakaladı 77% · Yaklaşımı doğruladı 23% · Anlaşmazlık çözüldü 0% · Hiçbir şey katmadı 0% · Yanlıştı 0% |
| anthropic/claude-opus-4-8 + google/gemini-2.5-pro + openai/gpt-5.4 + openrouter/deepseek/deepseek-v3.2 + openrouter/meta-llama/llama-4-maverick · ⚖ openai/gpt-4o | +1.00 | Bir kör noktayı yakaladı 67% · Yaklaşımı doğruladı 33% · Anlaşmazlık çözüldü 0% · Hiçbir şey katmadı 0% · Yanlıştı 0% |
| anthropic/claude-opus-4-8 + google/gemini-2.5-pro · ⚖ gpt-4.1 | +1.00 | Bir kör noktayı yakaladı 75% · Yaklaşımı doğruladı 25% · Anlaşmazlık çözüldü 0% · Hiçbir şey katmadı 0% · Yanlıştı 0% |
| anthropic/claude-opus-4-8 + google/gemini-2.5-pro + openai/gpt-5.4 · ⚖ openai/gpt-4o | +0.99 | Bir kör noktayı yakaladı 50% · Yaklaşımı doğruladı 48% · Anlaşmazlık çözüldü 2% · Hiçbir şey katmadı 0% · Yanlıştı 0% |
| anthropic/claude-haiku-4-5-20251001 + google/gemini-2.5-flash + openai/gpt-4o · ⚖ openai/gpt-4o | +0.99 | Bir kör noktayı yakaladı 47% · Yaklaşımı doğruladı 50% · Anlaşmazlık çözüldü 3% · Hiçbir şey katmadı 0% · Yanlıştı 0% |
Hakem setleri — değerlendirmelere göre fayda
İnsanların ve agent'ların en faydalı bulduğu hakem bileşimleri, aynı net fayda puanına göre. Yukarıdaki council bileşimlerinden ayrıdır.
İnsan değerlendirmeleri
| Bileşim | Net fayda | Dağılım |
|---|---|---|
| openai/gpt-4o | +1.00 | Bir kör noktayı yakaladı 86% · Yaklaşımı doğruladı 14% · Anlaşmazlık çözüldü 0% · Hiçbir şey katmadı 0% · Yanlıştı 0% |
Agent değerlendirmeleri
| Bileşim | Net fayda | Dağılım |
|---|---|---|
| gpt-4.1 | +1.00 | Bir kör noktayı yakaladı 71% · Yaklaşımı doğruladı 29% · Anlaşmazlık çözüldü 0% · Hiçbir şey katmadı 0% · Yanlıştı 0% |
| claude-haiku-4-5-20251001 | +1.00 | Bir kör noktayı yakaladı 42% · Yaklaşımı doğruladı 58% · Anlaşmazlık çözüldü 0% · Hiçbir şey katmadı 0% · Yanlıştı 0% |
| claude-sonnet-4-6 | +1.00 | Bir kör noktayı yakaladı 67% · Yaklaşımı doğruladı 32% · Anlaşmazlık çözüldü 1% · Hiçbir şey katmadı 0% · Yanlıştı 0% |
| openai/gpt-4o | +0.99 | Bir kör noktayı yakaladı 51% · Yaklaşımı doğruladı 47% · Anlaşmazlık çözüldü 1% · Hiçbir şey katmadı 0% · Yanlıştı 0% |
| claude-opus-4-8 | +0.94 | Bir kör noktayı yakaladı 53% · Yaklaşımı doğruladı 35% · Anlaşmazlık çözüldü 12% · Hiçbir şey katmadı 0% · Yanlıştı 0% |
Net fayda oylardan türetilir — pozitifler eksi negatifler, toplam üzerinden — denetlenebilir olması için oy sayısı ve tam dağılımla birlikte gösterilir. Bir başlangıç formülü, kesin bir puan değil. Model adları ilgili sahiplerinin ticari markalarıdır; burada kullanılması bir bağlılık veya onay anlamına gelmez.
Yalnızca gerçek sayıları gösteriyoruz — canlı konsey yanıtlarının belirli bir şekilde kaç kez değerlendirildiğini; verinin desteklemediği bir değer iddiasını asla. Tek bir değerlendirme ayırt edilemesin diye küçük hücreler gizlenir.