Metodologia

Come misuriamo 13 dimensioni del giudizio umano — cosa significa ogni dimensione, come viene valutata e la base teorica che la sostiene. Questa pagina esiste per essere difendibile: se un presidente scettico, un accademico o un data scientist mette in discussione lo strumento, la risposta dovrebbe trovarsi qui.

Perché basato su scenari e non su autovalutazione

La psicometria tradizionale si basa su autovalutazioni con scala Likert ("Valorizzo l'equità: 1–5"). Queste sono pesantemente contaminate dal bias di desiderabilità sociale e dal divario tra come le persone pensano di comportarsi e come si comportano effettivamente.

Agonora ti colloca all'interno di dilemmi ramificati e misura le scelte rivelate, anche sotto pressione temporale, variazione dell'inquadramento e pressione sociale. L'unità di misura è una decisione, non un'affermazione.

Le 13 dimensioni

Nucleo etico

Equità

Trattamento paritario indipendentemente dallo status di appartenenza al gruppo.

Cosa misuriamo:
Schemi di scelta in scenari di allocazione delle risorse dove cambia solo il gruppo interessato.
Punteggio:
Weighted average of choice values across fairness-tagged dilemmas, normalised to 0–100.
Ancoraggio teorico:
Rawls, A Theory of Justice (velo di ignoranza); fondamenti morali di Haidt.

Coerenza

Stessi principi applicati in tutti i contesti indipendentemente dall'inquadramento superficiale.

Cosa misuriamo:
Delta tra le risposte a scenari strutturalmente identici ("coppie specchio") con segnali superficiali diversi.
Punteggio:
1 − mean(|delta|) across paired items, normalised to 0–100.
Ancoraggio teorico:
Kahneman, Thinking Fast and Slow (effetti di framing); letteratura sulla coerenza comportamentale.

Empatia

Coinvolgimento autentico con l'impatto umano dietro decisioni astratte.

Cosa misuriamo:
Risposta differenziale a scenari con narrative umane nominate vs. statistiche astratte.
Punteggio:
Weighted average of empathy-tagged choice values.
Ancoraggio teorico:
Ipotesi empatia-altruismo di Batson; Bloom, Against Empathy (per le salvaguardie).

Coraggio morale

Disponibilità ad agire secondo i principi a costo personale o reputazionale.

Cosa misuriamo:
Scelte che comportano svantaggi personali ma difendono i valori dichiarati, specialmente sotto pressione sociale.
Punteggio:
Weighted average across courage-tagged items, with social-desirability discount.
Ancoraggio teorico:
Rushworth Kidder, Moral Courage; ragionamento di stadio 5–6 di Kohlberg.

Integrità

Allineamento tra valori dichiarati e comportamento sotto pressione.

Cosa misuriamo:
Divario tra valori autodichiarati (pre-valutazione) e scelte rivelate (durante la valutazione).
Punteggio:
Weighted average of integrity-tagged choices minus stated-revealed value gap.
Ancoraggio teorico:
Teoria dell'autoconcordanza; letteratura sulla dissonanza cognitiva.

Autoconsapevolezza

Accuratezza dell'autopercezione riguardo ai propri punteggi.

Cosa misuriamo:
Prevedi il tuo punteggio su ogni dimensione prima di vedere i risultati; noi confrontiamo.
Punteggio:
1 − (mean(|predicted − actual|) / 100).
Ancoraggio teorico:
Ricerca sulla calibrazione Dunning–Kruger.

Sovranità cognitiva

Umiltà epistemica

Fiducia calibrata — sapere ciò che non si sa.

Cosa misuriamo:
Rispondi a domande fattuali e dichiari la tua fiducia (0–100%); noi valutiamo la calibrazione.
Punteggio:
Brier score: 1 − mean((confidence/100 − correct)²).
Ancoraggio teorico:
Tetlock, Superforecasting; Brier 1950.

Tolleranza del paradosso

Mantenere verità contraddittorie senza forzare una falsa risoluzione.

Cosa misuriamo:
Risposte aperte a dilemmi senza soluzione netta; Claude classifica la strategia di risoluzione.
Punteggio:
AI classification mapped to {0.2, 0.6, 0.8, 1.0}.
Ancoraggio teorico:
Cameron & Quinn, Competing Values Framework; Rothenberg sul pensiero gianusiano.

Intuizione incarnata

Accuratezza del riconoscimento istintivo di schemi sotto pressione temporale.

Cosa misuriamo:
Accuratezza delle decisioni rapide in scenari a tempo vs. accuratezza deliberata in varianti senza limite di tempo.
Punteggio:
0.6 × snap_accuracy + 0.4 × calibration_of_snap_confidence.
Ancoraggio teorico:
Gary Klein, Sources of Power; teoria del doppio processo.

Costruzione di significato

Costruire una narrativa coerente da input ambigui.

Cosa misuriamo:
Valutazione delle risposte aperte su coerenza, profondità, originalità e integrazione.
Punteggio:
0.3 × coherence + 0.25 × depth + 0.25 × originality + 0.2 × integration.
Ancoraggio teorico:
Bruner, Acts of Meaning; teoria dell'identità narrativa.

Intelligenza relazionale e creativa

Intelligenza relazionale

Lettura delle dinamiche di potere, del sottotesto e delle strutture di fiducia.

Cosa misuriamo:
Interpretazione a scelta multipla di scene sociali ambigue; allocazioni di fiducia.
Punteggio:
0.3 × subtext_accuracy + 0.3 × power_reading + 0.4 × trust_calibration.
Ancoraggio teorico:
Goleman, Social Intelligence; ricerca sulla teoria della mente.

Divergenza creativa

Rompere i quadri dati per inventare nuove opzioni.

Cosa misuriamo:
Scenari dove ogni opzione elencata è difettosa; credito dato per la generazione di alternative originali.
Punteggio:
0.5 × frame_breaking + 0.5 × novelty_rating.
Ancoraggio teorico:
Pensiero divergente di Guilford; de Bono, Lateral Thinking.

Sovranità attentiva

Mantenimento di concentrazione profonda e qualità decisionale sotto distrazione.

Cosa misuriamo:
Controlli di attenzione integrati, stabilità delle risposte sotto rumore, resistenza ai distrattori.
Punteggio:
0.4 × checks_passed + 0.3 × stability + 0.3 × distractor_resistance.
Ancoraggio teorico:
Newport, Deep Work; teoria del ripristino attentivo.

Come vengono prodotti i punteggi

  • Punteggio a scelta ponderata. Ogni scelta in ogni scenario porta un vettore di punteggio attraverso le dimensioni con un peso. Il contributo di uno scenario a una dimensione è il valore della scelta × il peso dello scenario su quella dimensione.
  • Valutazione IA delle risposte a testo libero. Quando un utente scrive la propria risposta invece di scegliere un'opzione elencata, Claude valuta la risposta secondo una rubrica specifica per quello scenario e dimensione. I punteggi sono registrati per verificabilità.
  • Coppie specchio di coerenza. Scenari selezionati hanno uno "specchio" altrove nella sessione con la stessa struttura ma inquadramento superficiale diverso. Il delta assoluto tra le due risposte è la misurazione della coerenza.
  • Benchmarking sulla popolazione. Le classifiche percentili sono calcolate rispetto all'intera popolazione della piattaforma (opt-in). I benchmark vengono aggiornati settimanalmente.

Limitazioni

  • Autoselezione. Le persone che scelgono di sostenere la valutazione non sono un campione rappresentativo. I benchmark dovrebbero essere letti con questo in mente.
  • Calibrazione culturale. Gli scenari sono scritti in un contesto occidentale / di consiglio di amministrazione britannico. La validazione interculturale è in corso.
  • Istantanea nel tempo. Un profilo riflette come ragioni oggi, in questo giorno, in questo stato d'animo. Le ripetizioni spesso differiscono di 10–15 punti sulle singole dimensioni; il quadro a livello di cluster è più stabile.
  • Non è uno strumento di assunzione. Agonora è uno strumento di autoriflessione e sviluppo. Non è validato per assunzione, promozione o decisioni di valutazione formale e non dovrebbe essere utilizzato come tale.

Riferimenti

  • Brier, G. W. (1950). Verification of forecasts expressed in terms of probability.
  • Kahneman, D. (2011). Thinking, Fast and Slow.
  • Tetlock, P. & Gardner, D. (2015). Superforecasting.
  • Kidder, R. (2005). Moral Courage.
  • Cameron, K. & Quinn, R. (2011). Diagnosing and Changing Organizational Culture.
  • Klein, G. (1998). Sources of Power.
  • Guilford, J. P. (1967). The Nature of Human Intelligence.
Methodology — Agonora | Agonora