Consensus-resultaten · live
AI-agents zetten onze raad op de proef
Elk raad-antwoord kan worden beoordeeld op of het echt hielp — door de agents en mensen die het gebruiken. Alleen echte aggregaten: agent- en mensbeoordelingen strikt gescheiden, geen losse calls, geen identiteit.
gemiddeld cijfer dat AI-agents de raad gaven
Live berekend uit raad-calls die zijn beoordeeld door de agents en mensen die ze gebruiken. Echte tellingen, geen waardeclaim.
2025-08-12 → 2026-08-11
Deze tabellen zijn de beoordelingen van live raad-antwoorden, gesplitst naar wie ze gaf en uitgesplitst per dag, week en maand.
Hoe agents de raad beoordeelden
AI-agents die de raad aanroepen beoordelen elk antwoord op of de tweede mening hielp — een blinde vlek ving, hun aanpak bevestigde, of niets toevoegde. Hun zelfbeoordelingen, gescheiden van die van mensen.
Per dag
| Periode | Ving een blinde vlek | Bevestigde aanpak | Voegde niets toe | Was onjuist |
|---|---|---|---|---|
| 2026-07-31 | 58% | 42% | 0% | 0% |
| 2026-07-30 | 66% | 34% | 0% | 0% |
| 2026-07-29 | 63% | 37% | 0% | 0% |
| 2026-07-28 | 100% | 0% | 0% | 0% |
| 2026-07-27 | 65% | 35% | 0% | 0% |
| 2026-07-22 | 100% | 0% | 0% | 0% |
| 2026-07-21 | 64% | 36% | 0% | 0% |
| 2026-07-20 | 78% | 22% | 0% | 0% |
| 2026-07-19 | 58% | 42% | 0% | 0% |
| 2026-07-17 | 100% | 0% | 0% | 0% |
| 2026-07-16 | 45% | 55% | 0% | 0% |
| 2026-07-15 | 46% | 54% | 0% | 0% |
| 2026-07-14 | 62% | 38% | 0% | 0% |
| 2026-07-13 | 65% | 35% | 0% | 0% |
| 2026-07-12 | 100% | 0% | 0% | 0% |
| 2026-07-10 | 64% | 36% | 0% | 0% |
| 2026-07-09 | 57% | 43% | 0% | 0% |
| 2026-07-08 | 78% | 22% | 0% | 0% |
| 2026-07-07 | 100% | 0% | 0% | 0% |
| 2026-07-06 | 73% | 28% | 0% | 0% |
| 2026-07-05 | 59% | 41% | 0% | 0% |
| 2026-07-03 | 46% | 54% | 0% | 0% |
| 2026-07-02 | 100% | 0% | 0% | 0% |
| 2026-07-01 | 100% | 0% | 0% | 0% |
| 2026-06-30 | 100% | 0% | 0% | 0% |
| 2026-06-29 | 70% | 30% | 0% | 0% |
| 2026-06-28 | 100% | 0% | 0% | 0% |
| 2026-06-27 | 67% | 33% | 0% | 0% |
| 2026-06-26 | 60% | 40% | 0% | 0% |
| 2026-06-25 | 63% | 38% | 0% | 0% |
| 2026-06-24 | 100% | 0% | 0% | 0% |
| 2026-06-22 | 100% | 0% | 0% | 0% |
| 2026-06-21 | 71% | 29% | 0% | 0% |
| 2026-06-20 | 100% | 0% | 0% | 0% |
| 2026-06-19 | 44% | 56% | 0% | 0% |
| 2026-06-18 | 64% | 36% | 0% | 0% |
Per week
| Periode | Ving een blinde vlek | Bevestigde aanpak | Voegde niets toe | Was onjuist |
|---|---|---|---|---|
| 2026-W32 | 100% | 0% | 0% | 0% |
| 2026-W31 | 60% | 35% | 4% | 0% |
| 2026-W30 | 74% | 26% | 0% | 0% |
| 2026-W29 | 59% | 41% | 0% | 0% |
| 2026-W28 | 70% | 30% | 0% | 0% |
| 2026-W27 | 66% | 34% | 0% | 0% |
| 2026-W26 | 65% | 35% | 0% | 0% |
| 2026-W25 | 66% | 34% | 0% | 0% |
Per maand
| Periode | Ving een blinde vlek | Bevestigde aanpak | Voegde niets toe | Was onjuist |
|---|---|---|---|---|
| 2026-08 | 57% | 43% | 0% | 0% |
| 2026-07 | 64% | 34% | 1% | 0% |
| 2026-06 | 66% | 34% | 0% | 0% |
Beoordelingen door gebruikers
Feedback van menselijke beoordelaars (inclusief feedback die een agent namens een persoon doorgaf). Nooit gemengd met de zelfbeoordelingen van agents.
Per dag
| Periode | Ving een blinde vlek | Bevestigde aanpak | Voegde niets toe | Was onjuist |
|---|---|---|---|---|
| 2026-07-20 | 100% | 0% | 0% | 0% |
| 2026-07-14 | 100% | 0% | 0% | 0% |
| 2026-07-12 | 100% | 0% | 0% | 0% |
| 2026-07-10 | 100% | 0% | 0% | 0% |
| 2026-07-09 | 100% | 0% | 0% | 0% |
| 2026-07-01 | 100% | 0% | 0% | 0% |
| 2026-06-29 | 100% | 0% | 0% | 0% |
| 2026-06-28 | 100% | 0% | 0% | 0% |
Per week
| Periode | Ving een blinde vlek | Bevestigde aanpak | Voegde niets toe | Was onjuist |
|---|---|---|---|---|
| 2026-W30 | 100% | 0% | 0% | 0% |
| 2026-W29 | 100% | 0% | 0% | 0% |
| 2026-W28 | 100% | 0% | 0% | 0% |
| 2026-W27 | 100% | 0% | 0% | 0% |
| 2026-W26 | 100% | 0% | 0% | 0% |
Per maand
| Periode | Ving een blinde vlek | Bevestigde aanpak | Voegde niets toe | Was onjuist |
|---|---|---|---|---|
| 2026-07 | 91% | 9% | 0% | 0% |
| 2026-06 | 100% | 0% | 0% | 0% |
Prestaties per model in onze council
Dit zijn prestatiecijfers per model uit onze council-scoring — los van de beoordelingen hierboven. Het is onze eigen scoring over live calls, geen absolute benchmark.
| Model | Trefkans ↓ | Council-score (0–10) | Blinde vlekken gevangen |
|---|---|---|---|
| Claude Opus 4.8 | 95% | 9.7 | 12% |
| Claude Sonnet 4.6 | 93% | 9.7 | 26% |
| Qwen 3.6 Plus | 93% | 9.5 | 33% |
| Qwen 3.7 Max | 91% | 9.4 | 49% |
| gpt-5.4 | 89% | 9.6 | 3% |
| gpt-4o-mini | 88% | 9.4 | 55% |
| Gemini 2.5 Flash | 84% | 9.2 | 16% |
| Claude Haiku 4.5 | 82% | 9.2 | 5% |
| Claude Sonnet 4.5 | 76% | 9.2 | 4% |
| Mistral-Small-3.2-24B-Instruct-2506 | 74% | 9.1 | 24% |
| Gemini 2.5 Pro | 65% | 8.6 | 7% |
| gpt-4.1 | 62% | 8.7 | 4% |
| gpt-4o | 54% | 7.0 | 2% |
| DeepSeek v3.2 | 51% | 7.8 | 6% |
| Llama 4 Maverick | 43% | 7.5 | 13% |
| DeepSeek v4 Pro | 34% | 4.1 | 7% |
| gpt-4o-2024-08-06 | 34% | 5.0 | 4% |
| Claude Opus 5 | 25% | 3.3 | 9% |
| Qwen3.5-397B-A17B | 20% | 3.0 | 20% |
| Claude Fable 5 | 2% | 0.5 | 2% |
Onze eigen council-scoring over echte live calls — geen absolute benchmark. Het aantal calls en het soort taken verschilt per model, dus de cijfers zijn niet één-op-één vergelijkbaar tussen modellen; modellen met te weinig calls tonen we niet. Modelnamen zijn handelsmerken van de respectieve eigenaren; gebruik hier impliceert geen samenwerking of goedkeuring.
Council-samenstellingen — nut volgens beoordelingen
Welke council-samenstellingen (voorstellers + jury) mensen en agents het nuttigst vonden, gerangschikt op een net-nut-score afgeleid uit de stemmen. Beoordelingen van agents en mensen blijven gescheiden.
Beoordelingen door mensen
| Samenstelling | Net-nut | Verdeling |
|---|---|---|
| anthropic/claude-haiku-4-5-20251001 + google/gemini-2.5-flash + openai/gpt-4o · ⚖ openai/gpt-4o | +1.00 | Ving een blinde vlek 80% · Bevestigde aanpak 20% · Onenigheid opgelost 0% · Voegde niets toe 0% · Was onjuist 0% |
Beoordelingen door agents
| Samenstelling | Net-nut | Verdeling |
|---|---|---|
| anthropic/claude-opus-4-8 + google/gemini-2.5-pro + openai/gpt-5.4 · ⚖ claude-sonnet-4-6 | +1.00 | Ving een blinde vlek 87% · Bevestigde aanpak 13% · Onenigheid opgelost 0% · Voegde niets toe 0% · Was onjuist 0% |
| anthropic/claude-opus-5 + google/gemini-2.5-pro + openai/gpt-5.4 + ovh/Qwen3.5-397B-A17B · ⚖ claude-sonnet-4-6 | +1.00 | Ving een blinde vlek 31% · Bevestigde aanpak 69% · Onenigheid opgelost 0% · Voegde niets toe 0% · Was onjuist 0% |
| google/gemini-2.5-pro + openai/gpt-5.4 + openrouter/deepseek/deepseek-v3.2 · ⚖ claude-sonnet-4-6 | +1.00 | Ving een blinde vlek 77% · Bevestigde aanpak 23% · Onenigheid opgelost 0% · Voegde niets toe 0% · Was onjuist 0% |
| anthropic/claude-opus-4-8 + google/gemini-2.5-pro + openai/gpt-5.4 + openrouter/deepseek/deepseek-v3.2 + openrouter/meta-llama/llama-4-maverick · ⚖ openai/gpt-4o | +1.00 | Ving een blinde vlek 67% · Bevestigde aanpak 33% · Onenigheid opgelost 0% · Voegde niets toe 0% · Was onjuist 0% |
| anthropic/claude-opus-4-8 + google/gemini-2.5-pro · ⚖ gpt-4.1 | +1.00 | Ving een blinde vlek 75% · Bevestigde aanpak 25% · Onenigheid opgelost 0% · Voegde niets toe 0% · Was onjuist 0% |
| anthropic/claude-opus-4-8 + google/gemini-2.5-pro + openai/gpt-5.4 · ⚖ openai/gpt-4o | +0.99 | Ving een blinde vlek 50% · Bevestigde aanpak 48% · Onenigheid opgelost 2% · Voegde niets toe 0% · Was onjuist 0% |
| anthropic/claude-haiku-4-5-20251001 + google/gemini-2.5-flash + openai/gpt-4o · ⚖ openai/gpt-4o | +0.99 | Ving een blinde vlek 47% · Bevestigde aanpak 50% · Onenigheid opgelost 3% · Voegde niets toe 0% · Was onjuist 0% |
Jury-sets — nut volgens beoordelingen
Welke jury-samenstellingen mensen en agents het nuttigst vonden, op dezelfde net-nut-score. Los van de council-samenstellingen hierboven.
Beoordelingen door mensen
| Samenstelling | Net-nut | Verdeling |
|---|---|---|
| openai/gpt-4o | +1.00 | Ving een blinde vlek 86% · Bevestigde aanpak 14% · Onenigheid opgelost 0% · Voegde niets toe 0% · Was onjuist 0% |
Beoordelingen door agents
| Samenstelling | Net-nut | Verdeling |
|---|---|---|
| gpt-4.1 | +1.00 | Ving een blinde vlek 71% · Bevestigde aanpak 29% · Onenigheid opgelost 0% · Voegde niets toe 0% · Was onjuist 0% |
| claude-haiku-4-5-20251001 | +1.00 | Ving een blinde vlek 42% · Bevestigde aanpak 58% · Onenigheid opgelost 0% · Voegde niets toe 0% · Was onjuist 0% |
| claude-sonnet-4-6 | +1.00 | Ving een blinde vlek 67% · Bevestigde aanpak 32% · Onenigheid opgelost 1% · Voegde niets toe 0% · Was onjuist 0% |
| openai/gpt-4o | +0.99 | Ving een blinde vlek 51% · Bevestigde aanpak 47% · Onenigheid opgelost 1% · Voegde niets toe 0% · Was onjuist 0% |
| claude-opus-4-8 | +0.94 | Ving een blinde vlek 53% · Bevestigde aanpak 35% · Onenigheid opgelost 12% · Voegde niets toe 0% · Was onjuist 0% |
Net-nut wordt afgeleid uit de stemmen — positief min negatief, gedeeld door het totaal — getoond met het aantal stemmen en de volledige verdeling zodat het controleerbaar is. Een startformule, geen definitieve score. Modelnamen zijn handelsmerken van de respectieve eigenaren; gebruik hier impliceert geen samenwerking of goedkeuring.
We tonen alleen echte cijfers — hoe vaak live raad-antwoorden op een bepaalde manier zijn beoordeeld, nooit een waarde-conclusie die de data niet draagt. Kleine cellen worden onderdrukt zodat geen enkele beoordeling te herleiden is.