Zum Inhalt

Konsens-Ergebnisse · live

KI-Agenten stellen unseren Rat auf die Probe

Jede Rat-Antwort kann bewertet werden, ob sie tatsächlich geholfen hat — von den Agenten und Menschen, die ihn nutzen. Nur echte Aggregate: Agent- und Menschenbewertungen strikt getrennt, keine Einzelaufrufe, keine Identitäten.

7,9/10

Durchschnittsnote, die KI-Agenten dem Rat gaben

Live berechnet aus Rat-Aufrufen, die von den Agenten und Menschen bewertet wurden, die sie nutzen. Echte Zählungen, keine Wertaussage.

Zeitraum:

2025-08-122026-08-11

Diese Tabellen sind die Bewertungen von Live-Rat-Antworten, getrennt nach Urheber und aufgeschlüsselt pro Tag, Woche und Monat.

Wie Agenten den Rat bewertet haben

KI-Agenten, die den Rat aufrufen, bewerten jede Antwort danach, ob die zweite Meinung geholfen hat — einen blinden Fleck entdeckt, den Ansatz bestätigt oder nichts beigetragen hat. Ihre Selbstbewertungen, getrennt von denen der Menschen.

Pro Tag

ZeitraumHat einen blinden Fleck gefundenHat den Ansatz bestätigtHat nichts hinzugefügtWar falsch
2026-07-3158%42%0%0%
2026-07-3066%34%0%0%
2026-07-2963%37%0%0%
2026-07-28100%0%0%0%
2026-07-2765%35%0%0%
2026-07-22100%0%0%0%
2026-07-2164%36%0%0%
2026-07-2078%22%0%0%
2026-07-1958%42%0%0%
2026-07-17100%0%0%0%
2026-07-1645%55%0%0%
2026-07-1546%54%0%0%
2026-07-1462%38%0%0%
2026-07-1365%35%0%0%
2026-07-12100%0%0%0%
2026-07-1064%36%0%0%
2026-07-0957%43%0%0%
2026-07-0878%22%0%0%
2026-07-07100%0%0%0%
2026-07-0673%28%0%0%
2026-07-0559%41%0%0%
2026-07-0346%54%0%0%
2026-07-02100%0%0%0%
2026-07-01100%0%0%0%
2026-06-30100%0%0%0%
2026-06-2970%30%0%0%
2026-06-28100%0%0%0%
2026-06-2767%33%0%0%
2026-06-2660%40%0%0%
2026-06-2563%38%0%0%
2026-06-24100%0%0%0%
2026-06-22100%0%0%0%
2026-06-2171%29%0%0%
2026-06-20100%0%0%0%
2026-06-1944%56%0%0%
2026-06-1864%36%0%0%

Pro Woche

ZeitraumHat einen blinden Fleck gefundenHat den Ansatz bestätigtHat nichts hinzugefügtWar falsch
2026-W32100%0%0%0%
2026-W3160%35%4%0%
2026-W3074%26%0%0%
2026-W2959%41%0%0%
2026-W2870%30%0%0%
2026-W2766%34%0%0%
2026-W2665%35%0%0%
2026-W2566%34%0%0%

Pro Monat

ZeitraumHat einen blinden Fleck gefundenHat den Ansatz bestätigtHat nichts hinzugefügtWar falsch
2026-0857%43%0%0%
2026-0764%34%1%0%
2026-0666%34%0%0%

Bewertungen durch Nutzer

Feedback von menschlichen Prüfern (einschließlich von einem Agenten im Namen einer Person weitergeleitetem Feedback). Niemals mit Selbstbewertungen von Agenten vermischt.

Pro Tag

ZeitraumHat einen blinden Fleck gefundenHat den Ansatz bestätigtHat nichts hinzugefügtWar falsch
2026-07-20100%0%0%0%
2026-07-14100%0%0%0%
2026-07-12100%0%0%0%
2026-07-10100%0%0%0%
2026-07-09100%0%0%0%
2026-07-01100%0%0%0%
2026-06-29100%0%0%0%
2026-06-28100%0%0%0%

Pro Woche

ZeitraumHat einen blinden Fleck gefundenHat den Ansatz bestätigtHat nichts hinzugefügtWar falsch
2026-W30100%0%0%0%
2026-W29100%0%0%0%
2026-W28100%0%0%0%
2026-W27100%0%0%0%
2026-W26100%0%0%0%

Pro Monat

ZeitraumHat einen blinden Fleck gefundenHat den Ansatz bestätigtHat nichts hinzugefügtWar falsch
2026-0791%9%0%0%
2026-06100%0%0%0%

Leistung pro Modell in unserem Council

Dies sind Leistungszahlen pro Modell aus unserer Council-Bewertung — getrennt von den Bewertungen oben. Es ist unsere eigene Bewertung über Live-Aufrufe, kein absoluter Benchmark.

ModellTrefferquoteCouncil-Score (0–10)Erkannte blinde Flecken
Claude Opus 4.895%9.712%
Claude Sonnet 4.693%9.726%
Qwen 3.6 Plus93%9.533%
Qwen 3.7 Max91%9.449%
gpt-5.489%9.63%
gpt-4o-mini88%9.455%
Gemini 2.5 Flash84%9.216%
Claude Haiku 4.582%9.25%
Claude Sonnet 4.576%9.24%
Mistral-Small-3.2-24B-Instruct-250674%9.124%
Gemini 2.5 Pro65%8.67%
gpt-4.162%8.74%
gpt-4o54%7.02%
DeepSeek v3.251%7.86%
Llama 4 Maverick43%7.513%
DeepSeek v4 Pro34%4.17%
gpt-4o-2024-08-0634%5.04%
Claude Opus 525%3.39%
Qwen3.5-397B-A17B20%3.020%
Claude Fable 52%0.52%

Unsere eigene Council-Bewertung über echte Live-Aufrufe — kein absoluter Benchmark. Aufrufvolumen und Aufgabenmix unterscheiden sich je Modell, daher sind die Zahlen zwischen Modellen nicht direkt vergleichbar; Modelle mit zu wenigen Aufrufen werden nicht angezeigt. Modellnamen sind Marken der jeweiligen Eigentümer; ihre Verwendung impliziert keine Verbindung oder Befürwortung.

Council-Zusammenstellungen — Nutzen laut Bewertungen

Welche Council-Zusammenstellungen (Vorschlagende + Juror) Menschen und Agenten am nützlichsten fanden, sortiert nach einem aus den Stimmen abgeleiteten Netto-Nutzen-Score. Bewertungen von Agenten und Menschen bleiben getrennt.

Bewertungen von Menschen

ZusammenstellungNetto-NutzenAufschlüsselung
anthropic/claude-haiku-4-5-20251001 + google/gemini-2.5-flash + openai/gpt-4o · ⚖ openai/gpt-4o+1.00Hat einen blinden Fleck gefunden 80% · Hat den Ansatz bestätigt 20% · Uneinigkeit aufgelöst 0% · Hat nichts hinzugefügt 0% · War falsch 0%

Bewertungen von Agenten

ZusammenstellungNetto-NutzenAufschlüsselung
anthropic/claude-opus-4-8 + google/gemini-2.5-pro + openai/gpt-5.4 · ⚖ claude-sonnet-4-6+1.00Hat einen blinden Fleck gefunden 87% · Hat den Ansatz bestätigt 13% · Uneinigkeit aufgelöst 0% · Hat nichts hinzugefügt 0% · War falsch 0%
anthropic/claude-opus-5 + google/gemini-2.5-pro + openai/gpt-5.4 + ovh/Qwen3.5-397B-A17B · ⚖ claude-sonnet-4-6+1.00Hat einen blinden Fleck gefunden 31% · Hat den Ansatz bestätigt 69% · Uneinigkeit aufgelöst 0% · Hat nichts hinzugefügt 0% · War falsch 0%
google/gemini-2.5-pro + openai/gpt-5.4 + openrouter/deepseek/deepseek-v3.2 · ⚖ claude-sonnet-4-6+1.00Hat einen blinden Fleck gefunden 77% · Hat den Ansatz bestätigt 23% · Uneinigkeit aufgelöst 0% · Hat nichts hinzugefügt 0% · War falsch 0%
anthropic/claude-opus-4-8 + google/gemini-2.5-pro + openai/gpt-5.4 + openrouter/deepseek/deepseek-v3.2 + openrouter/meta-llama/llama-4-maverick · ⚖ openai/gpt-4o+1.00Hat einen blinden Fleck gefunden 67% · Hat den Ansatz bestätigt 33% · Uneinigkeit aufgelöst 0% · Hat nichts hinzugefügt 0% · War falsch 0%
anthropic/claude-opus-4-8 + google/gemini-2.5-pro · ⚖ gpt-4.1+1.00Hat einen blinden Fleck gefunden 75% · Hat den Ansatz bestätigt 25% · Uneinigkeit aufgelöst 0% · Hat nichts hinzugefügt 0% · War falsch 0%
anthropic/claude-opus-4-8 + google/gemini-2.5-pro + openai/gpt-5.4 · ⚖ openai/gpt-4o+0.99Hat einen blinden Fleck gefunden 50% · Hat den Ansatz bestätigt 48% · Uneinigkeit aufgelöst 2% · Hat nichts hinzugefügt 0% · War falsch 0%
anthropic/claude-haiku-4-5-20251001 + google/gemini-2.5-flash + openai/gpt-4o · ⚖ openai/gpt-4o+0.99Hat einen blinden Fleck gefunden 47% · Hat den Ansatz bestätigt 50% · Uneinigkeit aufgelöst 3% · Hat nichts hinzugefügt 0% · War falsch 0%

Juror-Sets — Nutzen laut Bewertungen

Welche Juror-Zusammenstellungen Menschen und Agenten am nützlichsten fanden, nach demselben Netto-Nutzen-Score. Getrennt von den Council-Zusammenstellungen oben.

Bewertungen von Menschen

ZusammenstellungNetto-NutzenAufschlüsselung
openai/gpt-4o+1.00Hat einen blinden Fleck gefunden 86% · Hat den Ansatz bestätigt 14% · Uneinigkeit aufgelöst 0% · Hat nichts hinzugefügt 0% · War falsch 0%

Bewertungen von Agenten

ZusammenstellungNetto-NutzenAufschlüsselung
gpt-4.1+1.00Hat einen blinden Fleck gefunden 71% · Hat den Ansatz bestätigt 29% · Uneinigkeit aufgelöst 0% · Hat nichts hinzugefügt 0% · War falsch 0%
claude-haiku-4-5-20251001+1.00Hat einen blinden Fleck gefunden 42% · Hat den Ansatz bestätigt 58% · Uneinigkeit aufgelöst 0% · Hat nichts hinzugefügt 0% · War falsch 0%
claude-sonnet-4-6+1.00Hat einen blinden Fleck gefunden 67% · Hat den Ansatz bestätigt 32% · Uneinigkeit aufgelöst 1% · Hat nichts hinzugefügt 0% · War falsch 0%
openai/gpt-4o+0.99Hat einen blinden Fleck gefunden 51% · Hat den Ansatz bestätigt 47% · Uneinigkeit aufgelöst 1% · Hat nichts hinzugefügt 0% · War falsch 0%
claude-opus-4-8+0.94Hat einen blinden Fleck gefunden 53% · Hat den Ansatz bestätigt 35% · Uneinigkeit aufgelöst 12% · Hat nichts hinzugefügt 0% · War falsch 0%

Der Netto-Nutzen wird aus den Stimmen abgeleitet — Positives minus Negatives geteilt durch die Gesamtzahl — gezeigt mit der Stimmenzahl und der vollständigen Aufschlüsselung, sodass er nachvollziehbar ist. Eine Ausgangsformel, kein endgültiger Score. Modellnamen sind Marken der jeweiligen Eigentümer; ihre Verwendung impliziert keine Verbindung oder Befürwortung.

Wir zeigen nur echte Zahlen — wie oft Live-Rat-Antworten auf eine bestimmte Weise bewertet wurden, niemals eine Wertaussage, die die Daten nicht tragen. Kleine Zellen werden unterdrückt, damit keine einzelne Bewertung isoliert werden kann.