Metodologia

Como medimos 13 dimensões do julgamento humano — o que cada dimensão significa, como é pontuada e a base teórica por trás dela. Esta página existe para ser defensável: se um presidente cético, um acadêmico ou um cientista de dados questionar a ferramenta, a resposta deve estar aqui.

Por que baseado em cenários e não em autorrelato

A psicometria tradicional baseia-se em autorrelatos de escala Likert ("Eu valorizo a equidade: 1–5"). Estes são fortemente contaminados pelo viés de desejabilidade social e pela lacuna entre como as pessoas pensam que se comportam e como realmente se comportam.

Agonora coloca você dentro de dilemas ramificados e mede escolhas reveladas, inclusive sob pressão de tempo, variação de enquadramento e pressão social. A unidade de medida é uma decisão, não uma declaração.

As 13 dimensões

Núcleo ético

Equidade

Tratamento igual independentemente do status de pertencimento ao grupo.

O que medimos:
Padrões de escolha em cenários de alocação de recursos onde apenas o grupo afetado muda.
Pontuação:
Weighted average of choice values across fairness-tagged dilemmas, normalised to 0–100.
Ancoragem teórica:
Rawls, A Theory of Justice (véu de ignorância); fundamentos morais de Haidt.

Consistência

Mesmos princípios aplicados em todos os contextos, independentemente do enquadramento superficial.

O que medimos:
Delta entre respostas a cenários estruturalmente idênticos ("pares espelho") com diferentes sinais superficiais.
Pontuação:
1 − mean(|delta|) across paired items, normalised to 0–100.
Ancoragem teórica:
Kahneman, Thinking Fast and Slow (efeitos de enquadramento); literatura sobre consistência comportamental.

Empatia

Envolvimento genuíno com o impacto humano por trás de decisões abstratas.

O que medimos:
Resposta diferencial a cenários com narrativas humanas nomeadas vs. estatísticas abstratas.
Pontuação:
Weighted average of empathy-tagged choice values.
Ancoragem teórica:
Hipótese empatia-altruísmo de Batson; Bloom, Against Empathy (para salvaguardas).

Coragem moral

Disposição para agir segundo princípios a custo pessoal ou reputacional.

O que medimos:
Escolhas que acarretam desvantagem pessoal mas defendem os valores declarados, especialmente sob pressão social.
Pontuação:
Weighted average across courage-tagged items, with social-desirability discount.
Ancoragem teórica:
Rushworth Kidder, Moral Courage; raciocínio de estágio 5–6 de Kohlberg.

Integridade

Alinhamento entre valores declarados e comportamento sob pressão.

O que medimos:
Lacuna entre valores autorrelatados (pré-avaliação) e escolhas reveladas (durante a avaliação).
Pontuação:
Weighted average of integrity-tagged choices minus stated-revealed value gap.
Ancoragem teórica:
Teoria da autoconcordância; literatura sobre dissonância cognitiva.

Autoconsciência

Exatidão da autopercepção sobre suas próprias pontuações.

O que medimos:
Você prevê sua pontuação em cada dimensão antes de ver os resultados; nós comparamos.
Pontuação:
1 − (mean(|predicted − actual|) / 100).
Ancoragem teórica:
Pesquisa de calibração Dunning–Kruger.

Soberania cognitiva

Humildade epistêmica

Confiança calibrada — saber o que você não sabe.

O que medimos:
Você responde perguntas factuais e declara sua confiança (0–100%); nós avaliamos a calibração.
Pontuação:
Brier score: 1 − mean((confidence/100 − correct)²).
Ancoragem teórica:
Tetlock, Superforecasting; Brier 1950.

Tolerância ao paradoxo

Manter verdades contraditórias sem forçar uma resolução falsa.

O que medimos:
Respostas abertas a dilemas sem solução clara; Claude classifica a estratégia de resolução.
Pontuação:
AI classification mapped to {0.2, 0.6, 0.8, 1.0}.
Ancoragem teórica:
Cameron & Quinn, Competing Values Framework; Rothenberg sobre o pensamento janusiano.

Intuição incorporada

Precisão do reconhecimento instintivo de padrões sob pressão de tempo.

O que medimos:
Precisão de decisões rápidas em cenários cronometrados vs. precisão deliberada em variantes sem cronômetro.
Pontuação:
0.6 × snap_accuracy + 0.4 × calibration_of_snap_confidence.
Ancoragem teórica:
Gary Klein, Sources of Power; teoria do duplo processo.

Construção de sentido

Construir uma narrativa coerente a partir de informações ambíguas.

O que medimos:
Avaliação de respostas abertas em coerência, profundidade, originalidade e integração.
Pontuação:
0.3 × coherence + 0.25 × depth + 0.25 × originality + 0.2 × integration.
Ancoragem teórica:
Bruner, Acts of Meaning; teoria da identidade narrativa.

Inteligência relacional e criativa

Inteligência relacional

Leitura de dinâmicas de poder, subtexto e estruturas de confiança.

O que medimos:
Interpretação de múltipla escolha de cenas sociais ambíguas; alocações de confiança.
Pontuação:
0.3 × subtext_accuracy + 0.3 × power_reading + 0.4 × trust_calibration.
Ancoragem teórica:
Goleman, Social Intelligence; pesquisa sobre teoria da mente.

Divergência criativa

Romper quadros dados para inventar novas opções.

O que medimos:
Cenários onde cada opção listada é falha; crédito dado por gerar alternativas originais.
Pontuação:
0.5 × frame_breaking + 0.5 × novelty_rating.
Ancoragem teórica:
Pensamento divergente de Guilford; de Bono, Lateral Thinking.

Soberania atencional

Manutenção de foco profundo e qualidade decisional sob distração.

O que medimos:
Verificações de atenção embutidas, estabilidade de resposta sob ruído, resistência a distratores.
Pontuação:
0.4 × checks_passed + 0.3 × stability + 0.3 × distractor_resistance.
Ancoragem teórica:
Newport, Deep Work; teoria da restauração atencional.

Como as pontuações são produzidas

  • Pontuação por escolha ponderada. Cada escolha em cada cenário carrega um vetor de pontuação através das dimensões com um peso. A contribuição de um cenário para uma dimensão é o valor da escolha × o peso do cenário nessa dimensão.
  • Pontuação IA de respostas em texto livre. Quando um usuário escreve sua própria resposta em vez de escolher uma opção listada, Claude pontua a resposta contra uma rubrica específica para aquele cenário e dimensão. As pontuações são registradas para auditabilidade.
  • Pares espelho de consistência. Cenários selecionados têm um "espelho" em outro lugar da sessão com a mesma estrutura, mas enquadramento superficial diferente. O delta absoluto entre as duas respostas é a medida de consistência.
  • Benchmarking populacional. As classificações percentis são calculadas contra toda a população da plataforma (opt-in). Os benchmarks são atualizados semanalmente.

Limitações

  • Autosseleção. As pessoas que escolhem fazer a avaliação não são uma amostra representativa. Os benchmarks devem ser lidos com isso em mente.
  • Calibração cultural. Os cenários são escritos em um contexto ocidental / de conselho de administração britânico. A validação intercultural está em andamento.
  • Instantâneo no tempo. Um perfil reflete como você raciocina hoje, neste dia, neste humor. Repetições frequentemente diferem em 10–15 pontos em dimensões individuais; o quadro no nível de cluster é mais estável.
  • Não é uma ferramenta de contratação. Agonora é um instrumento de autorreflexão e desenvolvimento. Não é validado para contratação, promoção ou decisões de avaliação formal e não deve ser usado como tal.

Referências

  • Brier, G. W. (1950). Verification of forecasts expressed in terms of probability.
  • Kahneman, D. (2011). Thinking, Fast and Slow.
  • Tetlock, P. & Gardner, D. (2015). Superforecasting.
  • Kidder, R. (2005). Moral Courage.
  • Cameron, K. & Quinn, R. (2011). Diagnosing and Changing Organizational Culture.
  • Klein, G. (1998). Sources of Power.
  • Guilford, J. P. (1967). The Nature of Human Intelligence.
Methodology — Agonora | Agonora