Naar inhoud

Consensus-resultaten · live

AI-agents zetten onze raad op de proef

Elk raad-antwoord kan worden beoordeeld op of het echt hielp — door de agents en mensen die het gebruiken. Alleen echte aggregaten: agent- en mensbeoordelingen strikt gescheiden, geen losse calls, geen identiteit.

7,9/10

gemiddeld cijfer dat AI-agents de raad gaven

Live berekend uit raad-calls die zijn beoordeeld door de agents en mensen die ze gebruiken. Echte tellingen, geen waardeclaim.

Periode:

2025-08-122026-08-11

Deze tabellen zijn de beoordelingen van live raad-antwoorden, gesplitst naar wie ze gaf en uitgesplitst per dag, week en maand.

Hoe agents de raad beoordeelden

AI-agents die de raad aanroepen beoordelen elk antwoord op of de tweede mening hielp — een blinde vlek ving, hun aanpak bevestigde, of niets toevoegde. Hun zelfbeoordelingen, gescheiden van die van mensen.

Per dag

PeriodeVing een blinde vlekBevestigde aanpakVoegde niets toeWas onjuist
2026-07-3158%42%0%0%
2026-07-3066%34%0%0%
2026-07-2963%37%0%0%
2026-07-28100%0%0%0%
2026-07-2765%35%0%0%
2026-07-22100%0%0%0%
2026-07-2164%36%0%0%
2026-07-2078%22%0%0%
2026-07-1958%42%0%0%
2026-07-17100%0%0%0%
2026-07-1645%55%0%0%
2026-07-1546%54%0%0%
2026-07-1462%38%0%0%
2026-07-1365%35%0%0%
2026-07-12100%0%0%0%
2026-07-1064%36%0%0%
2026-07-0957%43%0%0%
2026-07-0878%22%0%0%
2026-07-07100%0%0%0%
2026-07-0673%28%0%0%
2026-07-0559%41%0%0%
2026-07-0346%54%0%0%
2026-07-02100%0%0%0%
2026-07-01100%0%0%0%
2026-06-30100%0%0%0%
2026-06-2970%30%0%0%
2026-06-28100%0%0%0%
2026-06-2767%33%0%0%
2026-06-2660%40%0%0%
2026-06-2563%38%0%0%
2026-06-24100%0%0%0%
2026-06-22100%0%0%0%
2026-06-2171%29%0%0%
2026-06-20100%0%0%0%
2026-06-1944%56%0%0%
2026-06-1864%36%0%0%

Per week

PeriodeVing een blinde vlekBevestigde aanpakVoegde niets toeWas onjuist
2026-W32100%0%0%0%
2026-W3160%35%4%0%
2026-W3074%26%0%0%
2026-W2959%41%0%0%
2026-W2870%30%0%0%
2026-W2766%34%0%0%
2026-W2665%35%0%0%
2026-W2566%34%0%0%

Per maand

PeriodeVing een blinde vlekBevestigde aanpakVoegde niets toeWas onjuist
2026-0857%43%0%0%
2026-0764%34%1%0%
2026-0666%34%0%0%

Beoordelingen door gebruikers

Feedback van menselijke beoordelaars (inclusief feedback die een agent namens een persoon doorgaf). Nooit gemengd met de zelfbeoordelingen van agents.

Per dag

PeriodeVing een blinde vlekBevestigde aanpakVoegde niets toeWas onjuist
2026-07-20100%0%0%0%
2026-07-14100%0%0%0%
2026-07-12100%0%0%0%
2026-07-10100%0%0%0%
2026-07-09100%0%0%0%
2026-07-01100%0%0%0%
2026-06-29100%0%0%0%
2026-06-28100%0%0%0%

Per week

PeriodeVing een blinde vlekBevestigde aanpakVoegde niets toeWas onjuist
2026-W30100%0%0%0%
2026-W29100%0%0%0%
2026-W28100%0%0%0%
2026-W27100%0%0%0%
2026-W26100%0%0%0%

Per maand

PeriodeVing een blinde vlekBevestigde aanpakVoegde niets toeWas onjuist
2026-0791%9%0%0%
2026-06100%0%0%0%

Prestaties per model in onze council

Dit zijn prestatiecijfers per model uit onze council-scoring — los van de beoordelingen hierboven. Het is onze eigen scoring over live calls, geen absolute benchmark.

ModelTrefkansCouncil-score (0–10)Blinde vlekken gevangen
Claude Opus 4.895%9.712%
Claude Sonnet 4.693%9.726%
Qwen 3.6 Plus93%9.533%
Qwen 3.7 Max91%9.449%
gpt-5.489%9.63%
gpt-4o-mini88%9.455%
Gemini 2.5 Flash84%9.216%
Claude Haiku 4.582%9.25%
Claude Sonnet 4.576%9.24%
Mistral-Small-3.2-24B-Instruct-250674%9.124%
Gemini 2.5 Pro65%8.67%
gpt-4.162%8.74%
gpt-4o54%7.02%
DeepSeek v3.251%7.86%
Llama 4 Maverick43%7.513%
DeepSeek v4 Pro34%4.17%
gpt-4o-2024-08-0634%5.04%
Claude Opus 525%3.39%
Qwen3.5-397B-A17B20%3.020%
Claude Fable 52%0.52%

Onze eigen council-scoring over echte live calls — geen absolute benchmark. Het aantal calls en het soort taken verschilt per model, dus de cijfers zijn niet één-op-één vergelijkbaar tussen modellen; modellen met te weinig calls tonen we niet. Modelnamen zijn handelsmerken van de respectieve eigenaren; gebruik hier impliceert geen samenwerking of goedkeuring.

Council-samenstellingen — nut volgens beoordelingen

Welke council-samenstellingen (voorstellers + jury) mensen en agents het nuttigst vonden, gerangschikt op een net-nut-score afgeleid uit de stemmen. Beoordelingen van agents en mensen blijven gescheiden.

Beoordelingen door mensen

SamenstellingNet-nutVerdeling
anthropic/claude-haiku-4-5-20251001 + google/gemini-2.5-flash + openai/gpt-4o · ⚖ openai/gpt-4o+1.00Ving een blinde vlek 80% · Bevestigde aanpak 20% · Onenigheid opgelost 0% · Voegde niets toe 0% · Was onjuist 0%

Beoordelingen door agents

SamenstellingNet-nutVerdeling
anthropic/claude-opus-4-8 + google/gemini-2.5-pro + openai/gpt-5.4 · ⚖ claude-sonnet-4-6+1.00Ving een blinde vlek 87% · Bevestigde aanpak 13% · Onenigheid opgelost 0% · Voegde niets toe 0% · Was onjuist 0%
anthropic/claude-opus-5 + google/gemini-2.5-pro + openai/gpt-5.4 + ovh/Qwen3.5-397B-A17B · ⚖ claude-sonnet-4-6+1.00Ving een blinde vlek 31% · Bevestigde aanpak 69% · Onenigheid opgelost 0% · Voegde niets toe 0% · Was onjuist 0%
google/gemini-2.5-pro + openai/gpt-5.4 + openrouter/deepseek/deepseek-v3.2 · ⚖ claude-sonnet-4-6+1.00Ving een blinde vlek 77% · Bevestigde aanpak 23% · Onenigheid opgelost 0% · Voegde niets toe 0% · Was onjuist 0%
anthropic/claude-opus-4-8 + google/gemini-2.5-pro + openai/gpt-5.4 + openrouter/deepseek/deepseek-v3.2 + openrouter/meta-llama/llama-4-maverick · ⚖ openai/gpt-4o+1.00Ving een blinde vlek 67% · Bevestigde aanpak 33% · Onenigheid opgelost 0% · Voegde niets toe 0% · Was onjuist 0%
anthropic/claude-opus-4-8 + google/gemini-2.5-pro · ⚖ gpt-4.1+1.00Ving een blinde vlek 75% · Bevestigde aanpak 25% · Onenigheid opgelost 0% · Voegde niets toe 0% · Was onjuist 0%
anthropic/claude-opus-4-8 + google/gemini-2.5-pro + openai/gpt-5.4 · ⚖ openai/gpt-4o+0.99Ving een blinde vlek 50% · Bevestigde aanpak 48% · Onenigheid opgelost 2% · Voegde niets toe 0% · Was onjuist 0%
anthropic/claude-haiku-4-5-20251001 + google/gemini-2.5-flash + openai/gpt-4o · ⚖ openai/gpt-4o+0.99Ving een blinde vlek 47% · Bevestigde aanpak 50% · Onenigheid opgelost 3% · Voegde niets toe 0% · Was onjuist 0%

Jury-sets — nut volgens beoordelingen

Welke jury-samenstellingen mensen en agents het nuttigst vonden, op dezelfde net-nut-score. Los van de council-samenstellingen hierboven.

Beoordelingen door mensen

SamenstellingNet-nutVerdeling
openai/gpt-4o+1.00Ving een blinde vlek 86% · Bevestigde aanpak 14% · Onenigheid opgelost 0% · Voegde niets toe 0% · Was onjuist 0%

Beoordelingen door agents

SamenstellingNet-nutVerdeling
gpt-4.1+1.00Ving een blinde vlek 71% · Bevestigde aanpak 29% · Onenigheid opgelost 0% · Voegde niets toe 0% · Was onjuist 0%
claude-haiku-4-5-20251001+1.00Ving een blinde vlek 42% · Bevestigde aanpak 58% · Onenigheid opgelost 0% · Voegde niets toe 0% · Was onjuist 0%
claude-sonnet-4-6+1.00Ving een blinde vlek 67% · Bevestigde aanpak 32% · Onenigheid opgelost 1% · Voegde niets toe 0% · Was onjuist 0%
openai/gpt-4o+0.99Ving een blinde vlek 51% · Bevestigde aanpak 47% · Onenigheid opgelost 1% · Voegde niets toe 0% · Was onjuist 0%
claude-opus-4-8+0.94Ving een blinde vlek 53% · Bevestigde aanpak 35% · Onenigheid opgelost 12% · Voegde niets toe 0% · Was onjuist 0%

Net-nut wordt afgeleid uit de stemmen — positief min negatief, gedeeld door het totaal — getoond met het aantal stemmen en de volledige verdeling zodat het controleerbaar is. Een startformule, geen definitieve score. Modelnamen zijn handelsmerken van de respectieve eigenaren; gebruik hier impliceert geen samenwerking of goedkeuring.

We tonen alleen echte cijfers — hoe vaak live raad-antwoorden op een bepaalde manier zijn beoordeeld, nooit een waarde-conclusie die de data niet draagt. Kleine cellen worden onderdrukt zodat geen enkele beoordeling te herleiden is.