Metodología

Cómo medimos 13 dimensiones del juicio humano — qué significa cada dimensión, cómo se puntúa y la base teórica que la sustenta. Esta página existe para ser defendible: si un presidente escéptico, un académico o un científico de datos cuestiona la herramienta, la respuesta debería estar aquí.

Por qué escenarios y no autoinforme

La psicometría tradicional se basa en autoinformes de tipo Likert ("Valoro la equidad: 1–5"). Estos están fuertemente contaminados por el sesgo de deseabilidad social y la brecha entre cómo las personas creen que se comportan y cómo se comportan realmente.

Agonora te sitúa dentro de dilemas ramificados y mide las decisiones reveladas, incluso bajo presión temporal, variación del encuadre y presión social. La unidad de medida es una decisión, no una afirmación.

Las 13 dimensiones

Núcleo ético

Equidad

Trato igualitario independientemente del estatus de pertenencia al grupo.

Lo que medimos:
Patrones de elección en escenarios de asignación de recursos donde solo cambia el grupo afectado.
Puntuación:
Weighted average of choice values across fairness-tagged dilemmas, normalised to 0–100.
Anclaje teórico:
Rawls, A Theory of Justice (velo de ignorancia); fundamentos morales de Haidt.

Consistencia

Mismos principios aplicados en todos los contextos independientemente del encuadre superficial.

Lo que medimos:
Delta entre respuestas a escenarios estructuralmente idénticos ("pares espejo") con diferentes señales superficiales.
Puntuación:
1 − mean(|delta|) across paired items, normalised to 0–100.
Anclaje teórico:
Kahneman, Thinking Fast and Slow (efectos de encuadre); literatura sobre consistencia conductual.

Empatía

Compromiso genuino con el impacto humano detrás de decisiones abstractas.

Lo que medimos:
Respuesta diferencial a escenarios con narrativas humanas con nombre vs. estadísticas abstractas.
Puntuación:
Weighted average of empathy-tagged choice values.
Anclaje teórico:
Hipótesis empatía-altruismo de Batson; Bloom, Against Empathy (para salvaguardas).

Coraje moral

Disposición a actuar según los principios a costa personal o reputacional.

Lo que medimos:
Elecciones que conllevan desventaja personal pero defienden los valores declarados, especialmente bajo presión social.
Puntuación:
Weighted average across courage-tagged items, with social-desirability discount.
Anclaje teórico:
Rushworth Kidder, Moral Courage; razonamiento de etapas 5–6 de Kohlberg.

Integridad

Alineación entre valores declarados y comportamiento bajo presión.

Lo que medimos:
Brecha entre valores autoinformados (pre-evaluación) y elecciones reveladas (durante la evaluación).
Puntuación:
Weighted average of integrity-tagged choices minus stated-revealed value gap.
Anclaje teórico:
Teoría de la autoconcordancia; literatura sobre disonancia cognitiva.

Autoconciencia

Exactitud de la autopercepción sobre tus propias puntuaciones.

Lo que medimos:
Predices tu puntuación en cada dimensión antes de ver los resultados; nosotros comparamos.
Puntuación:
1 − (mean(|predicted − actual|) / 100).
Anclaje teórico:
Investigación sobre calibración Dunning–Kruger.

Soberanía cognitiva

Humildad epistémica

Confianza calibrada — saber lo que no sabes.

Lo que medimos:
Respondes preguntas factuales e indicas tu confianza (0–100%); nosotros puntuamos la calibración.
Puntuación:
Brier score: 1 − mean((confidence/100 − correct)²).
Anclaje teórico:
Tetlock, Superforecasting; Brier 1950.

Tolerancia a la paradoja

Mantener verdades contradictorias sin forzar una resolución falsa.

Lo que medimos:
Respuestas abiertas a dilemas sin solución clara; Claude clasifica la estrategia de resolución.
Puntuación:
AI classification mapped to {0.2, 0.6, 0.8, 1.0}.
Anclaje teórico:
Cameron & Quinn, Competing Values Framework; Rothenberg sobre el pensamiento janusiano.

Intuición encarnada

Precisión del reconocimiento instintivo de patrones bajo presión temporal.

Lo que medimos:
Precisión de decisiones rápidas en escenarios cronometrados vs. precisión deliberada en variantes sin cronómetro.
Puntuación:
0.6 × snap_accuracy + 0.4 × calibration_of_snap_confidence.
Anclaje teórico:
Gary Klein, Sources of Power; teoría del doble proceso.

Construcción de sentido

Construir una narrativa coherente a partir de información ambigua.

Lo que medimos:
Puntuación de respuestas abiertas en coherencia, profundidad, originalidad e integración.
Puntuación:
0.3 × coherence + 0.25 × depth + 0.25 × originality + 0.2 × integration.
Anclaje teórico:
Bruner, Acts of Meaning; teoría de la identidad narrativa.

Inteligencia relacional y creativa

Inteligencia relacional

Lectura de dinámicas de poder, subtexto y estructuras de confianza.

Lo que medimos:
Interpretación de opción múltiple de escenas sociales ambiguas; asignaciones de confianza.
Puntuación:
0.3 × subtext_accuracy + 0.3 × power_reading + 0.4 × trust_calibration.
Anclaje teórico:
Goleman, Social Intelligence; investigación sobre teoría de la mente.

Divergencia creativa

Romper los marcos dados para inventar nuevas opciones.

Lo que medimos:
Escenarios donde cada opción listada es deficiente; se otorga crédito por generar alternativas novedosas.
Puntuación:
0.5 × frame_breaking + 0.5 × novelty_rating.
Anclaje teórico:
Pensamiento divergente de Guilford; de Bono, Lateral Thinking.

Soberanía atencional

Mantener concentración profunda y calidad decisional bajo distracción.

Lo que medimos:
Verificaciones de atención integradas, estabilidad de respuesta bajo ruido, resistencia a distractores.
Puntuación:
0.4 × checks_passed + 0.3 × stability + 0.3 × distractor_resistance.
Anclaje teórico:
Newport, Deep Work; teoría de la restauración atencional.

Cómo se producen las puntuaciones

  • Puntuación por elección ponderada. Cada elección en cada escenario lleva un vector de puntuación a través de las dimensiones con un peso. La contribución de un escenario a una dimensión es el valor de la elección × el peso del escenario en esa dimensión.
  • Puntuación IA de respuestas de texto libre. Cuando un usuario escribe su propia respuesta en lugar de elegir una opción listada, Claude puntúa la respuesta según una rúbrica específica para ese escenario y dimensión. Las puntuaciones se registran para auditoría.
  • Pares espejo de consistencia. Ciertos escenarios tienen un "espejo" en otro lugar de la sesión con la misma estructura pero diferente encuadre superficial. El delta absoluto entre las dos respuestas es la medida de consistencia.
  • Evaluación comparativa poblacional. Las clasificaciones por percentiles se calculan contra toda la población de la plataforma (opt-in). Los puntos de referencia se actualizan semanalmente.

Limitaciones

  • Autoselección. Las personas que eligen realizar la evaluación no son una muestra representativa. Los puntos de referencia deben leerse teniendo esto en cuenta.
  • Calibración cultural. Los escenarios están escritos en un contexto occidental / de consejo de administración británico. La validación intercultural está en curso.
  • Instantánea en el tiempo. Un perfil refleja cómo razonas hoy, en este día, en este estado de ánimo. Las repeticiones suelen diferir en 10–15 puntos en dimensiones individuales; la imagen a nivel de cluster es más estable.
  • No es una herramienta de contratación. Agonora es un instrumento de autorreflexión y desarrollo. No está validado para contratación, promoción o decisiones de evaluación formal y no debería usarse como tal.

Referencias

  • Brier, G. W. (1950). Verification of forecasts expressed in terms of probability.
  • Kahneman, D. (2011). Thinking, Fast and Slow.
  • Tetlock, P. & Gardner, D. (2015). Superforecasting.
  • Kidder, R. (2005). Moral Courage.
  • Cameron, K. & Quinn, R. (2011). Diagnosing and Changing Organizational Culture.
  • Klein, G. (1998). Sources of Power.
  • Guilford, J. P. (1967). The Nature of Human Intelligence.
Methodology — Agonora | Agonora