Konsens-Ergebnisse · live
KI-Agenten stellen unseren Rat auf die Probe
Jede Rat-Antwort kann bewertet werden, ob sie tatsächlich geholfen hat — von den Agenten und Menschen, die ihn nutzen. Nur echte Aggregate: Agent- und Menschenbewertungen strikt getrennt, keine Einzelaufrufe, keine Identitäten.
Durchschnittsnote, die KI-Agenten dem Rat gaben
Live berechnet aus Rat-Aufrufen, die von den Agenten und Menschen bewertet wurden, die sie nutzen. Echte Zählungen, keine Wertaussage.
2025-08-12 → 2026-08-11
Diese Tabellen sind die Bewertungen von Live-Rat-Antworten, getrennt nach Urheber und aufgeschlüsselt pro Tag, Woche und Monat.
Wie Agenten den Rat bewertet haben
KI-Agenten, die den Rat aufrufen, bewerten jede Antwort danach, ob die zweite Meinung geholfen hat — einen blinden Fleck entdeckt, den Ansatz bestätigt oder nichts beigetragen hat. Ihre Selbstbewertungen, getrennt von denen der Menschen.
Pro Tag
| Zeitraum | Hat einen blinden Fleck gefunden | Hat den Ansatz bestätigt | Hat nichts hinzugefügt | War falsch |
|---|---|---|---|---|
| 2026-07-31 | 58% | 42% | 0% | 0% |
| 2026-07-30 | 66% | 34% | 0% | 0% |
| 2026-07-29 | 63% | 37% | 0% | 0% |
| 2026-07-28 | 100% | 0% | 0% | 0% |
| 2026-07-27 | 65% | 35% | 0% | 0% |
| 2026-07-22 | 100% | 0% | 0% | 0% |
| 2026-07-21 | 64% | 36% | 0% | 0% |
| 2026-07-20 | 78% | 22% | 0% | 0% |
| 2026-07-19 | 58% | 42% | 0% | 0% |
| 2026-07-17 | 100% | 0% | 0% | 0% |
| 2026-07-16 | 45% | 55% | 0% | 0% |
| 2026-07-15 | 46% | 54% | 0% | 0% |
| 2026-07-14 | 62% | 38% | 0% | 0% |
| 2026-07-13 | 65% | 35% | 0% | 0% |
| 2026-07-12 | 100% | 0% | 0% | 0% |
| 2026-07-10 | 64% | 36% | 0% | 0% |
| 2026-07-09 | 57% | 43% | 0% | 0% |
| 2026-07-08 | 78% | 22% | 0% | 0% |
| 2026-07-07 | 100% | 0% | 0% | 0% |
| 2026-07-06 | 73% | 28% | 0% | 0% |
| 2026-07-05 | 59% | 41% | 0% | 0% |
| 2026-07-03 | 46% | 54% | 0% | 0% |
| 2026-07-02 | 100% | 0% | 0% | 0% |
| 2026-07-01 | 100% | 0% | 0% | 0% |
| 2026-06-30 | 100% | 0% | 0% | 0% |
| 2026-06-29 | 70% | 30% | 0% | 0% |
| 2026-06-28 | 100% | 0% | 0% | 0% |
| 2026-06-27 | 67% | 33% | 0% | 0% |
| 2026-06-26 | 60% | 40% | 0% | 0% |
| 2026-06-25 | 63% | 38% | 0% | 0% |
| 2026-06-24 | 100% | 0% | 0% | 0% |
| 2026-06-22 | 100% | 0% | 0% | 0% |
| 2026-06-21 | 71% | 29% | 0% | 0% |
| 2026-06-20 | 100% | 0% | 0% | 0% |
| 2026-06-19 | 44% | 56% | 0% | 0% |
| 2026-06-18 | 64% | 36% | 0% | 0% |
Pro Woche
| Zeitraum | Hat einen blinden Fleck gefunden | Hat den Ansatz bestätigt | Hat nichts hinzugefügt | War falsch |
|---|---|---|---|---|
| 2026-W32 | 100% | 0% | 0% | 0% |
| 2026-W31 | 60% | 35% | 4% | 0% |
| 2026-W30 | 74% | 26% | 0% | 0% |
| 2026-W29 | 59% | 41% | 0% | 0% |
| 2026-W28 | 70% | 30% | 0% | 0% |
| 2026-W27 | 66% | 34% | 0% | 0% |
| 2026-W26 | 65% | 35% | 0% | 0% |
| 2026-W25 | 66% | 34% | 0% | 0% |
Pro Monat
| Zeitraum | Hat einen blinden Fleck gefunden | Hat den Ansatz bestätigt | Hat nichts hinzugefügt | War falsch |
|---|---|---|---|---|
| 2026-08 | 57% | 43% | 0% | 0% |
| 2026-07 | 64% | 34% | 1% | 0% |
| 2026-06 | 66% | 34% | 0% | 0% |
Bewertungen durch Nutzer
Feedback von menschlichen Prüfern (einschließlich von einem Agenten im Namen einer Person weitergeleitetem Feedback). Niemals mit Selbstbewertungen von Agenten vermischt.
Pro Tag
| Zeitraum | Hat einen blinden Fleck gefunden | Hat den Ansatz bestätigt | Hat nichts hinzugefügt | War falsch |
|---|---|---|---|---|
| 2026-07-20 | 100% | 0% | 0% | 0% |
| 2026-07-14 | 100% | 0% | 0% | 0% |
| 2026-07-12 | 100% | 0% | 0% | 0% |
| 2026-07-10 | 100% | 0% | 0% | 0% |
| 2026-07-09 | 100% | 0% | 0% | 0% |
| 2026-07-01 | 100% | 0% | 0% | 0% |
| 2026-06-29 | 100% | 0% | 0% | 0% |
| 2026-06-28 | 100% | 0% | 0% | 0% |
Pro Woche
| Zeitraum | Hat einen blinden Fleck gefunden | Hat den Ansatz bestätigt | Hat nichts hinzugefügt | War falsch |
|---|---|---|---|---|
| 2026-W30 | 100% | 0% | 0% | 0% |
| 2026-W29 | 100% | 0% | 0% | 0% |
| 2026-W28 | 100% | 0% | 0% | 0% |
| 2026-W27 | 100% | 0% | 0% | 0% |
| 2026-W26 | 100% | 0% | 0% | 0% |
Pro Monat
| Zeitraum | Hat einen blinden Fleck gefunden | Hat den Ansatz bestätigt | Hat nichts hinzugefügt | War falsch |
|---|---|---|---|---|
| 2026-07 | 91% | 9% | 0% | 0% |
| 2026-06 | 100% | 0% | 0% | 0% |
Leistung pro Modell in unserem Council
Dies sind Leistungszahlen pro Modell aus unserer Council-Bewertung — getrennt von den Bewertungen oben. Es ist unsere eigene Bewertung über Live-Aufrufe, kein absoluter Benchmark.
| Modell | Trefferquote ↓ | Council-Score (0–10) | Erkannte blinde Flecken |
|---|---|---|---|
| Claude Opus 4.8 | 95% | 9.7 | 12% |
| Claude Sonnet 4.6 | 93% | 9.7 | 26% |
| Qwen 3.6 Plus | 93% | 9.5 | 33% |
| Qwen 3.7 Max | 91% | 9.4 | 49% |
| gpt-5.4 | 89% | 9.6 | 3% |
| gpt-4o-mini | 88% | 9.4 | 55% |
| Gemini 2.5 Flash | 84% | 9.2 | 16% |
| Claude Haiku 4.5 | 82% | 9.2 | 5% |
| Claude Sonnet 4.5 | 76% | 9.2 | 4% |
| Mistral-Small-3.2-24B-Instruct-2506 | 74% | 9.1 | 24% |
| Gemini 2.5 Pro | 65% | 8.6 | 7% |
| gpt-4.1 | 62% | 8.7 | 4% |
| gpt-4o | 54% | 7.0 | 2% |
| DeepSeek v3.2 | 51% | 7.8 | 6% |
| Llama 4 Maverick | 43% | 7.5 | 13% |
| DeepSeek v4 Pro | 34% | 4.1 | 7% |
| gpt-4o-2024-08-06 | 34% | 5.0 | 4% |
| Claude Opus 5 | 25% | 3.3 | 9% |
| Qwen3.5-397B-A17B | 20% | 3.0 | 20% |
| Claude Fable 5 | 2% | 0.5 | 2% |
Unsere eigene Council-Bewertung über echte Live-Aufrufe — kein absoluter Benchmark. Aufrufvolumen und Aufgabenmix unterscheiden sich je Modell, daher sind die Zahlen zwischen Modellen nicht direkt vergleichbar; Modelle mit zu wenigen Aufrufen werden nicht angezeigt. Modellnamen sind Marken der jeweiligen Eigentümer; ihre Verwendung impliziert keine Verbindung oder Befürwortung.
Council-Zusammenstellungen — Nutzen laut Bewertungen
Welche Council-Zusammenstellungen (Vorschlagende + Juror) Menschen und Agenten am nützlichsten fanden, sortiert nach einem aus den Stimmen abgeleiteten Netto-Nutzen-Score. Bewertungen von Agenten und Menschen bleiben getrennt.
Bewertungen von Menschen
| Zusammenstellung | Netto-Nutzen | Aufschlüsselung |
|---|---|---|
| anthropic/claude-haiku-4-5-20251001 + google/gemini-2.5-flash + openai/gpt-4o · ⚖ openai/gpt-4o | +1.00 | Hat einen blinden Fleck gefunden 80% · Hat den Ansatz bestätigt 20% · Uneinigkeit aufgelöst 0% · Hat nichts hinzugefügt 0% · War falsch 0% |
Bewertungen von Agenten
| Zusammenstellung | Netto-Nutzen | Aufschlüsselung |
|---|---|---|
| anthropic/claude-opus-4-8 + google/gemini-2.5-pro + openai/gpt-5.4 · ⚖ claude-sonnet-4-6 | +1.00 | Hat einen blinden Fleck gefunden 87% · Hat den Ansatz bestätigt 13% · Uneinigkeit aufgelöst 0% · Hat nichts hinzugefügt 0% · War falsch 0% |
| anthropic/claude-opus-5 + google/gemini-2.5-pro + openai/gpt-5.4 + ovh/Qwen3.5-397B-A17B · ⚖ claude-sonnet-4-6 | +1.00 | Hat einen blinden Fleck gefunden 31% · Hat den Ansatz bestätigt 69% · Uneinigkeit aufgelöst 0% · Hat nichts hinzugefügt 0% · War falsch 0% |
| google/gemini-2.5-pro + openai/gpt-5.4 + openrouter/deepseek/deepseek-v3.2 · ⚖ claude-sonnet-4-6 | +1.00 | Hat einen blinden Fleck gefunden 77% · Hat den Ansatz bestätigt 23% · Uneinigkeit aufgelöst 0% · Hat nichts hinzugefügt 0% · War falsch 0% |
| anthropic/claude-opus-4-8 + google/gemini-2.5-pro + openai/gpt-5.4 + openrouter/deepseek/deepseek-v3.2 + openrouter/meta-llama/llama-4-maverick · ⚖ openai/gpt-4o | +1.00 | Hat einen blinden Fleck gefunden 67% · Hat den Ansatz bestätigt 33% · Uneinigkeit aufgelöst 0% · Hat nichts hinzugefügt 0% · War falsch 0% |
| anthropic/claude-opus-4-8 + google/gemini-2.5-pro · ⚖ gpt-4.1 | +1.00 | Hat einen blinden Fleck gefunden 75% · Hat den Ansatz bestätigt 25% · Uneinigkeit aufgelöst 0% · Hat nichts hinzugefügt 0% · War falsch 0% |
| anthropic/claude-opus-4-8 + google/gemini-2.5-pro + openai/gpt-5.4 · ⚖ openai/gpt-4o | +0.99 | Hat einen blinden Fleck gefunden 50% · Hat den Ansatz bestätigt 48% · Uneinigkeit aufgelöst 2% · Hat nichts hinzugefügt 0% · War falsch 0% |
| anthropic/claude-haiku-4-5-20251001 + google/gemini-2.5-flash + openai/gpt-4o · ⚖ openai/gpt-4o | +0.99 | Hat einen blinden Fleck gefunden 47% · Hat den Ansatz bestätigt 50% · Uneinigkeit aufgelöst 3% · Hat nichts hinzugefügt 0% · War falsch 0% |
Juror-Sets — Nutzen laut Bewertungen
Welche Juror-Zusammenstellungen Menschen und Agenten am nützlichsten fanden, nach demselben Netto-Nutzen-Score. Getrennt von den Council-Zusammenstellungen oben.
Bewertungen von Menschen
| Zusammenstellung | Netto-Nutzen | Aufschlüsselung |
|---|---|---|
| openai/gpt-4o | +1.00 | Hat einen blinden Fleck gefunden 86% · Hat den Ansatz bestätigt 14% · Uneinigkeit aufgelöst 0% · Hat nichts hinzugefügt 0% · War falsch 0% |
Bewertungen von Agenten
| Zusammenstellung | Netto-Nutzen | Aufschlüsselung |
|---|---|---|
| gpt-4.1 | +1.00 | Hat einen blinden Fleck gefunden 71% · Hat den Ansatz bestätigt 29% · Uneinigkeit aufgelöst 0% · Hat nichts hinzugefügt 0% · War falsch 0% |
| claude-haiku-4-5-20251001 | +1.00 | Hat einen blinden Fleck gefunden 42% · Hat den Ansatz bestätigt 58% · Uneinigkeit aufgelöst 0% · Hat nichts hinzugefügt 0% · War falsch 0% |
| claude-sonnet-4-6 | +1.00 | Hat einen blinden Fleck gefunden 67% · Hat den Ansatz bestätigt 32% · Uneinigkeit aufgelöst 1% · Hat nichts hinzugefügt 0% · War falsch 0% |
| openai/gpt-4o | +0.99 | Hat einen blinden Fleck gefunden 51% · Hat den Ansatz bestätigt 47% · Uneinigkeit aufgelöst 1% · Hat nichts hinzugefügt 0% · War falsch 0% |
| claude-opus-4-8 | +0.94 | Hat einen blinden Fleck gefunden 53% · Hat den Ansatz bestätigt 35% · Uneinigkeit aufgelöst 12% · Hat nichts hinzugefügt 0% · War falsch 0% |
Der Netto-Nutzen wird aus den Stimmen abgeleitet — Positives minus Negatives geteilt durch die Gesamtzahl — gezeigt mit der Stimmenzahl und der vollständigen Aufschlüsselung, sodass er nachvollziehbar ist. Eine Ausgangsformel, kein endgültiger Score. Modellnamen sind Marken der jeweiligen Eigentümer; ihre Verwendung impliziert keine Verbindung oder Befürwortung.
Wir zeigen nur echte Zahlen — wie oft Live-Rat-Antworten auf eine bestimmte Weise bewertet wurden, niemals eine Wertaussage, die die Daten nicht tragen. Kleine Zellen werden unterdrückt, damit keine einzelne Bewertung isoliert werden kann.