Methodik

Wie wir 13 Dimensionen menschlichen Urteilsvermögens messen — was jede Dimension bedeutet, wie sie bewertet wird und die theoretische Grundlage dahinter. Diese Seite soll verteidigbar sein: Wenn ein skeptischer Vorsitzender, Akademiker oder Datenwissenschaftler das Tool hinterfragt, sollte die Antwort auf dieser Seite stehen.

Warum szenariobasiert statt Selbstbericht

Traditionelle Psychometrie stützt sich auf Likert-Skala-Selbstberichte ("Ich schätze Fairness: 1–5"). Diese sind stark durch den Bias sozialer Erwünschtheit und die Kluft zwischen der Selbstwahrnehmung des Verhaltens und dem tatsächlichen Verhalten kontaminiert.

Agonora versetzt Sie in verzweigte Dilemmata und misst offenbarte Entscheidungen, auch unter Zeitdruck, Framing-Variation und sozialem Druck. Die Maßeinheit ist eine Entscheidung, keine Behauptung.

Die 13 Dimensionen

Ethischer Kern

Fairness

Gleichbehandlung unabhängig vom Gruppen-Zugehörigkeitsstatus.

Was wir messen:
Entscheidungsmuster in Ressourcenverteilungsszenarien, bei denen sich nur die betroffene Gruppe ändert.
Bewertung:
Weighted average of choice values across fairness-tagged dilemmas, normalised to 0–100.
Theoretischer Anker:
Rawls, A Theory of Justice (Schleier des Nichtwissens); Haidts moralische Grundlagen.

Konsistenz

Gleiche Prinzipien über alle Kontexte hinweg, unabhängig vom Oberflächen-Framing.

Was wir messen:
Delta zwischen Antworten auf strukturell identische Szenarien ("Spiegelpaare") mit unterschiedlichen Oberflächenhinweisen.
Bewertung:
1 − mean(|delta|) across paired items, normalised to 0–100.
Theoretischer Anker:
Kahneman, Thinking Fast and Slow (Framing-Effekte); Literatur zur Verhaltenskonsistenz.

Empathie

Echtes Engagement für die menschlichen Auswirkungen hinter abstrakten Entscheidungen.

Was wir messen:
Differenzierte Reaktion auf Szenarien mit benannten menschlichen Geschichten vs. abstrakten Statistiken.
Bewertung:
Weighted average of empathy-tagged choice values.
Theoretischer Anker:
Batsons Empathie-Altruismus-Hypothese; Bloom, Against Empathy (für Leitplanken).

Moralischer Mut

Bereitschaft, nach Prinzipien zu handeln, auch auf persönliche oder reputationsbezogene Kosten.

Was wir messen:
Entscheidungen mit persönlichem Nachteil, die erklärte Werte verteidigen, besonders unter sozialem Druck.
Bewertung:
Weighted average across courage-tagged items, with social-desirability discount.
Theoretischer Anker:
Rushworth Kidder, Moral Courage; Kohlberg-Stufe-5–6-Denken.

Integrität

Übereinstimmung zwischen erklärten Werten und Verhalten unter Druck.

Was wir messen:
Kluft zwischen selbst berichteten Werten (Vor-Bewertung) und offenbarten Entscheidungen (während der Bewertung).
Bewertung:
Weighted average of integrity-tagged choices minus stated-revealed value gap.
Theoretischer Anker:
Selbstkonkordanztheorie; Literatur zur kognitiven Dissonanz.

Selbstwahrnehmung

Genauigkeit der Selbsteinschätzung bezüglich Ihrer eigenen Ergebnisse.

Was wir messen:
Sie sagen Ihr Ergebnis für jede Dimension voraus, bevor Sie die Resultate sehen; wir vergleichen.
Bewertung:
1 − (mean(|predicted − actual|) / 100).
Theoretischer Anker:
Dunning-Kruger-Kalibrierungsforschung.

Kognitive Souveränität

Epistemische Demut

Kalibriertes Vertrauen — wissen, was man nicht weiß.

Was wir messen:
Sie beantworten Sachfragen und geben Ihre Zuversicht an (0–100 %); wir bewerten die Kalibrierung.
Bewertung:
Brier score: 1 − mean((confidence/100 − correct)²).
Theoretischer Anker:
Tetlock, Superforecasting; Brier 1950.

Paradoxietoleranz

Widersprüchliche Wahrheiten gleichzeitig halten, ohne falsche Auflösung zu erzwingen.

Was wir messen:
Offene Antworten auf Dilemmata ohne saubere Lösung; Claude klassifiziert die Auflösungsstrategie.
Bewertung:
AI classification mapped to {0.2, 0.6, 0.8, 1.0}.
Theoretischer Anker:
Cameron & Quinn, Competing Values Framework; Rothenberg zum janusianischen Denken.

Verkörperte Intuition

Genauigkeit der instinktiven Mustererkennung unter Zeitdruck.

Was wir messen:
Genauigkeit spontaner Entscheidungen bei zeitgesteuerten Szenarien vs. überlegte Genauigkeit bei zeitunbegrenzten Varianten.
Bewertung:
0.6 × snap_accuracy + 0.4 × calibration_of_snap_confidence.
Theoretischer Anker:
Gary Klein, Sources of Power; Dual-Prozess-Theorie.

Sinnstiftung

Konstruktion einer kohärenten Erzählung aus mehrdeutigen Informationen.

Was wir messen:
Bewertung offener Antworten hinsichtlich Kohärenz, Tiefe, Originalität und Integration.
Bewertung:
0.3 × coherence + 0.25 × depth + 0.25 × originality + 0.2 × integration.
Theoretischer Anker:
Bruner, Acts of Meaning; Theorie der narrativen Identität.

Relationale und kreative Intelligenz

Relationale Intelligenz

Erkennen von Machtdynamiken, Subtext und Vertrauensstrukturen.

Was wir messen:
Multiple-Choice-Interpretation ambivalenter sozialer Szenen; Vertrauenszuweisungen.
Bewertung:
0.3 × subtext_accuracy + 0.3 × power_reading + 0.4 × trust_calibration.
Theoretischer Anker:
Goleman, Social Intelligence; Theory-of-Mind-Forschung.

Kreative Divergenz

Vorgegebene Rahmen durchbrechen, um neue Optionen zu erfinden.

Was wir messen:
Szenarien, in denen jede aufgeführte Option fehlerhaft ist; Anerkennung für die Generierung neuartiger Alternativen.
Bewertung:
0.5 × frame_breaking + 0.5 × novelty_rating.
Theoretischer Anker:
Guilfords divergentes Denken; de Bono, Lateral Thinking.

Aufmerksamkeitssouveränität

Aufrechterhaltung tiefer Konzentration und Entscheidungsqualität unter Ablenkung.

Was wir messen:
Eingebettete Aufmerksamkeitsprüfungen, Antwortstabilität unter Rauschen, Widerstand gegen Distraktoren.
Bewertung:
0.4 × checks_passed + 0.3 × stability + 0.3 × distractor_resistance.
Theoretischer Anker:
Newport, Deep Work; Theorie der Aufmerksamkeitswiederherstellung.

Wie Ergebnisse berechnet werden

  • Gewichtete Entscheidungsbewertung. Jede Entscheidung in jedem Szenario trägt einen Bewertungsvektor über Dimensionen mit einer Gewichtung. Der Beitrag eines Szenarios zu einer Dimension ist der Entscheidungswert × die Szenariogewichtung auf dieser Dimension.
  • KI-Bewertung von Freitextantworten. Wenn ein Benutzer seine eigene Antwort schreibt, statt eine aufgeführte Option zu wählen, bewertet Claude die Antwort anhand einer Rubrik, die für dieses Szenario und diese Dimension spezifisch ist. Ergebnisse werden zur Nachverfolgbarkeit protokolliert.
  • Konsistenz-Spiegelpaare. Ausgewählte Szenarien haben anderswo in der Sitzung ein "Spiegelbild" mit derselben Struktur, aber unterschiedlichem Oberflächen-Framing. Das absolute Delta zwischen den beiden Antworten ist die Konsistenzmessung.
  • Populationsbenchmarking. Perzentilrangfolgen werden gegen die gesamte Plattformpopulation berechnet (Opt-in). Benchmarks werden wöchentlich aktualisiert.

Einschränkungen

  • Selbstselektion. Personen, die sich für die Bewertung entscheiden, sind keine repräsentative Stichprobe. Benchmarks sollten unter diesem Vorbehalt gelesen werden.
  • Kulturelle Kalibrierung. Szenarien sind im Kontext westlicher / britischer Aufsichtsräte verfasst. Die interkulturelle Validierung ist im Gange.
  • Momentaufnahme. Ein Profil spiegelt wider, wie Sie heute, an diesem Tag, in dieser Stimmung denken. Wiederholungen weichen oft um 10–15 Punkte bei einzelnen Dimensionen ab; das Bild auf Cluster-Ebene ist stabiler.
  • Kein Einstellungsinstrument. Agonora ist ein Instrument zur Selbstreflexion und Entwicklung. Es ist nicht für Einstellung, Beförderung oder formale Bewertungsentscheidungen validiert und sollte nicht als solches verwendet werden.

Referenzen

  • Brier, G. W. (1950). Verification of forecasts expressed in terms of probability.
  • Kahneman, D. (2011). Thinking, Fast and Slow.
  • Tetlock, P. & Gardner, D. (2015). Superforecasting.
  • Kidder, R. (2005). Moral Courage.
  • Cameron, K. & Quinn, R. (2011). Diagnosing and Changing Organizational Culture.
  • Klein, G. (1998). Sources of Power.
  • Guilford, J. P. (1967). The Nature of Human Intelligence.