方法论

我们如何衡量人类判断力的13个维度——每个维度的含义、评分方式及其理论基础。本页面旨在经得起质疑:如果持怀疑态度的主席、学者或数据科学家对此工具提出质疑,答案应在此页面上。

为什么采用情景式而非自我报告式

传统心理测量依赖于Likert量表自我报告(「我重视公平:1–5」)。这些严重受到社会期望偏差的污染,以及人们自认为的行为方式与实际行为之间的差距。

Agonora将您置于分支式困境中,测量您的真实选择,包括在时间压力、框架变化和社会压力下的选择。衡量单位是决策,而非声明。

13个维度

伦理核心

公平

无论群体归属如何,均给予平等对待。

我们测量的内容:
在仅改变受影响群体的资源分配情景中的选择模式。
评分:
Weighted average of choice values across fairness-tagged dilemmas, normalised to 0–100.
理论锚点:
Rawls, A Theory of Justice(无知之幕);Haidt的道德基础理论。

一致性

在各种情境中应用相同原则,不受表面框架影响。

我们测量的内容:
对结构相同但表面线索不同的情景(「镜像对」)的回应差异。
评分:
1 − mean(|delta|) across paired items, normalised to 0–100.
理论锚点:
Kahneman, Thinking Fast and Slow(框架效应);行为一致性文献。

共情

真正关注抽象决策背后的人类影响。

我们测量的内容:
对包含具名人物叙事的情景与抽象统计数据情景的差异化回应。
评分:
Weighted average of empathy-tagged choice values.
理论锚点:
Batson的共情-利他主义假说;Bloom, Against Empathy(作为防护措施)。

道德勇气

愿意以个人或声誉代价坚持原则行事。

我们测量的内容:
承担个人不利后果但坚持所宣称价值观的选择,尤其在社会压力下。
评分:
Weighted average across courage-tagged items, with social-desirability discount.
理论锚点:
Rushworth Kidder, Moral Courage;Kohlberg第5–6阶段推理。

正直

宣称的价值观与压力下行为之间的一致性。

我们测量的内容:
自我报告的价值观(评估前)与真实选择(评估中)之间的差距。
评分:
Weighted average of integrity-tagged choices minus stated-revealed value gap.
理论锚点:
自我一致性理论;认知失调文献。

自我认知

对自身得分的自我感知准确度。

我们测量的内容:
您在查看结果前预测每个维度的得分;我们进行比较。
评分:
1 − (mean(|predicted − actual|) / 100).
理论锚点:
Dunning–Kruger校准研究。

认知主权

认识谦逊

经过校准的信心——知道自己不知道什么。

我们测量的内容:
您回答事实性问题并声明信心水平(0–100%);我们评估校准度。
评分:
Brier score: 1 − mean((confidence/100 − correct)²).
理论锚点:
Tetlock, Superforecasting;Brier 1950。

悖论容忍度

持有矛盾的真相而不强行做出虚假解决。

我们测量的内容:
对没有明确答案的困境的开放式回答;Claude对解决策略进行分类。
评分:
AI classification mapped to {0.2, 0.6, 0.8, 1.0}.
理论锚点:
Cameron & Quinn, Competing Values Framework;Rothenberg关于双面神思维。

具身直觉

在时间压力下本能模式识别的准确性。

我们测量的内容:
限时情景中快速决策的准确性与非限时变体中深思熟虑的准确性。
评分:
0.6 × snap_accuracy + 0.4 × calibration_of_snap_confidence.
理论锚点:
Gary Klein, Sources of Power;双过程理论。

意义建构

从模糊输入中构建连贯叙事。

我们测量的内容:
对开放式回答在连贯性、深度、原创性和整合性方面的评分。
评分:
0.3 × coherence + 0.25 × depth + 0.25 × originality + 0.2 × integration.
理论锚点:
Bruner, Acts of Meaning;叙事身份理论。

关系与创造性智能

关系智能

解读权力动态、言外之意和信任结构。

我们测量的内容:
对模糊社会场景的多选题解读;信任分配。
评分:
0.3 × subtext_accuracy + 0.3 × power_reading + 0.4 × trust_calibration.
理论锚点:
Goleman, Social Intelligence;心智理论研究。

创造性发散

打破既定框架以创造新选项。

我们测量的内容:
所有列出选项均有缺陷的情景;因生成新颖替代方案而获得加分。
评分:
0.5 × frame_breaking + 0.5 × novelty_rating.
理论锚点:
Guilford的发散思维;de Bono, Lateral Thinking。

注意力主权

在干扰下保持深度专注和决策质量。

我们测量的内容:
嵌入式注意力检查、噪音下的回应稳定性、抵抗干扰能力。
评分:
0.4 × checks_passed + 0.3 × stability + 0.3 × distractor_resistance.
理论锚点:
Newport, Deep Work;注意力恢复理论。

评分方式

  • 加权选择评分。 每个情景中的每个选择都带有一个跨维度的评分向量和权重。情景对某一维度的贡献等于选择值乘以该情景在该维度上的权重。
  • AI评估自由文本回答。 当用户自行撰写答案而非选择列出的选项时,Claude根据该情景和维度特定的评分标准对回答进行评分。评分记录留存以供审计。
  • 一致性镜像对。 选定的情景在会话的其他位置有一个结构相同但表面框架不同的「镜像」。两次回应之间的绝对差值即为一致性测量。
  • 人群基准比较。 百分位排名根据整个平台人群计算(需选择参与)。基准每周更新。

局限性

  • 自我选择。 选择参加评估的人并非代表性样本。在阅读基准时应考虑这一点。
  • 文化校准。 情景是在西方/英国董事会背景下编写的。跨文化验证正在进行中。
  • 时间快照。 档案反映的是您今天、此刻、此种心情下的推理方式。重新测试在单个维度上通常会有10–15分的差异;聚类层面的整体画面更为稳定。
  • 非招聘工具。 Agonora是一种自我反思和发展工具。它未经招聘、晋升或正式评估决策的验证,不应被用于此类目的。

参考文献

  • Brier, G. W. (1950). Verification of forecasts expressed in terms of probability.
  • Kahneman, D. (2011). Thinking, Fast and Slow.
  • Tetlock, P. & Gardner, D. (2015). Superforecasting.
  • Kidder, R. (2005). Moral Courage.
  • Cameron, K. & Quinn, R. (2011). Diagnosing and Changing Organizational Culture.
  • Klein, G. (1998). Sources of Power.
  • Guilford, J. P. (1967). The Nature of Human Intelligence.
Methodology — Agonora | Agonora