本页目录

方法 II · 研究方法与测量

心理学的一切结论都取决于两件事:怎么问(研究设计)与怎么量(测量)。本页给这两套规则,以及一张"这个设计能回答什么问题"的对照表——它是你读任何心理学报道时的第一道过滤器。

1. 三类设计与它们的天花板

设计 做法 能得出 不能得出
描述性(观察、调查、个案) 不干预,只记录 现象存在、频率、分布 任何因果
相关研究 测两个变量看是否共变 关联强度 \(r\)、可做预测 因果(第三变量、反向因果)
实验 随机分配 + 操纵自变量 因果 生态效度可能受损

随机分配是因果推断的心脏(🔗 数学站统计线):它让两组在一切已知与未知变量上期望相等,于是组间差异只能归因于操纵。没有随机分配的"实验"(如按自愿分组)叫准实验,结论要打折。

相关不是因果的三个经典陷阱:第三变量(冰淇淋销量与溺水率——夏天)、反向因果(自尊与成绩谁导致谁)、选择效应(读研的人收入高,多少是学历的功劳、多少是本来就会读研的人的特质)。报道里最常见的偷换:"X 与 Y 有关" 写成 "X 会导致 Y"——看到就退回一步查设计。

2. 实验的三个杀手与解药

3. 测量:心理学最难的一关

物理学量长度,心理学量"焦虑""智力""外向"——构念(construct)不能直接观察,只能靠操作化定义("焦虑 = 这份 21 题量表的得分")。两项质量指标必须同时满足:

信度(reliability)= 稳不稳:重测信度、内部一致性(Cronbach's \(\alpha\),>0.7 可用)、评分者间信度。 效度(validity)= 准不准:内容效度、效标效度(能否预测真实结果)、构念效度。

关键关系信度是效度的必要非充分条件——一把总是量出同一个错数的尺子(高信度低效度)比随机乱跳的尺子更危险,因为它看起来很专业。心理学史上大量争议(智力测验、内隐联想测验 IAT、多数人格测评)都发生在"信度尚可、效度存疑"这个区间。

4. 样本:WEIRD 问题

行为科学的经典发现绝大多数来自 WEIRD 样本——Western, Educated, Industrialized, Rich, Democratic(尤其是美国大学本科生)。Henrich 等人的分析指出:这个群体在视错觉敏感度、公平分配行为、自我概念、道德判断等多个维度上恰恰是全人类中的离群值,把他们的结果当"人性"是系统性外推错误。

读文献时的一问:这个结论在什么人群上测的?跨文化复现过吗?——这是本站在多个页面反复出现的追问(第 12、13、15 页尤其)。

5. 统计:够用的一小把

描述:集中趋势、离散度、分布形状(🔗 数学站概率 II)。 推断\(p\) 值 = 在零假设为真的前提下,观察到这么极端数据的概率——它不是"结论为真的概率"(🔗 数学站统计 IV 完整讲这个误读)。

效应量(本站的主刻度):Cohen's \(d = \dfrac{M_1 - M_2}{SD_{\text{pooled}}}\),粗略读法:

\(d\) 定性 直觉
0.2 两组分布重叠约 85%,个体层面几乎看不出
0.5 肉眼可辨
0.8 明显差异

为什么本站坚持报效应量:样本足够大时,任何微小差异都会"显著"。"显著"回答"有没有","效应量"回答"重不重要"——心理学被媒体误读的重灾区就在这里(第 03 页会看到,很多经典效应的问题不是不存在,而是比宣传小一个数量级)。

置信区间与统计功效:小样本研究即使结论正确也会给出宽得没用的区间;低功效研究若报出显著结果,其效应量必然被高估(winner's curse)——这条统计事实是理解复现危机的钥匙,下一页正式开锁。


工具备齐。下一页是这门课的灵魂:当心理学开始系统检查自己,发现了什么。