方法 II · 研究方法与测量
心理学的一切结论都取决于两件事:怎么问(研究设计)与怎么量(测量)。本页给这两套规则,以及一张"这个设计能回答什么问题"的对照表——它是你读任何心理学报道时的第一道过滤器。
1. 三类设计与它们的天花板
| 设计 | 做法 | 能得出 | 不能得出 |
|---|---|---|---|
| 描述性(观察、调查、个案) | 不干预,只记录 | 现象存在、频率、分布 | 任何因果 |
| 相关研究 | 测两个变量看是否共变 | 关联强度 \(r\)、可做预测 | 因果(第三变量、反向因果) |
| 实验 | 随机分配 + 操纵自变量 | 因果 | 生态效度可能受损 |
随机分配是因果推断的心脏(🔗 数学站统计线):它让两组在一切已知与未知变量上期望相等,于是组间差异只能归因于操纵。没有随机分配的"实验"(如按自愿分组)叫准实验,结论要打折。
相关不是因果的三个经典陷阱:第三变量(冰淇淋销量与溺水率——夏天)、反向因果(自尊与成绩谁导致谁)、选择效应(读研的人收入高,多少是学历的功劳、多少是本来就会读研的人的特质)。报道里最常见的偷换:"X 与 Y 有关" 写成 "X 会导致 Y"——看到就退回一步查设计。
2. 实验的三个杀手与解药
- 安慰剂与期望:受试者知道自己在被治疗就会好转 ⇒ 双盲 + 安慰剂对照(心理治疗研究里"双盲"往往做不到——治疗师知道自己在做什么,这是临床线证据强度天然低于药物试验的结构性原因,第 17 页展开);
- 实验者效应:主试的期望泄漏给被试("聪明汉斯"的马会读主人微表情)⇒ 盲法主试、标准化脚本、预注册分析方案;
- 需求特征:被试猜到假设并配合 ⇒ 掩饰任务、事后询问怀疑度。
3. 测量:心理学最难的一关
物理学量长度,心理学量"焦虑""智力""外向"——构念(construct)不能直接观察,只能靠操作化定义("焦虑 = 这份 21 题量表的得分")。两项质量指标必须同时满足:
信度(reliability)= 稳不稳:重测信度、内部一致性(Cronbach's \(\alpha\),>0.7 可用)、评分者间信度。 效度(validity)= 准不准:内容效度、效标效度(能否预测真实结果)、构念效度。
关键关系:信度是效度的必要非充分条件——一把总是量出同一个错数的尺子(高信度低效度)比随机乱跳的尺子更危险,因为它看起来很专业。心理学史上大量争议(智力测验、内隐联想测验 IAT、多数人格测评)都发生在"信度尚可、效度存疑"这个区间。
4. 样本:WEIRD 问题
行为科学的经典发现绝大多数来自 WEIRD 样本——Western, Educated, Industrialized, Rich, Democratic(尤其是美国大学本科生)。Henrich 等人的分析指出:这个群体在视错觉敏感度、公平分配行为、自我概念、道德判断等多个维度上恰恰是全人类中的离群值,把他们的结果当"人性"是系统性外推错误。
读文献时的一问:这个结论在什么人群上测的?跨文化复现过吗?——这是本站在多个页面反复出现的追问(第 12、13、15 页尤其)。
5. 统计:够用的一小把
描述:集中趋势、离散度、分布形状(🔗 数学站概率 II)。 推断:\(p\) 值 = 在零假设为真的前提下,观察到这么极端数据的概率——它不是"结论为真的概率"(🔗 数学站统计 IV 完整讲这个误读)。
效应量(本站的主刻度):Cohen's \(d = \dfrac{M_1 - M_2}{SD_{\text{pooled}}}\),粗略读法:
| \(d\) | 定性 | 直觉 |
|---|---|---|
| 0.2 | 小 | 两组分布重叠约 85%,个体层面几乎看不出 |
| 0.5 | 中 | 肉眼可辨 |
| 0.8 | 大 | 明显差异 |
为什么本站坚持报效应量:样本足够大时,任何微小差异都会"显著"。"显著"回答"有没有","效应量"回答"重不重要"——心理学被媒体误读的重灾区就在这里(第 03 页会看到,很多经典效应的问题不是不存在,而是比宣传小一个数量级)。
置信区间与统计功效:小样本研究即使结论正确也会给出宽得没用的区间;低功效研究若报出显著结果,其效应量必然被高估(winner's curse)——这条统计事实是理解复现危机的钥匙,下一页正式开锁。
工具备齐。下一页是这门课的灵魂:当心理学开始系统检查自己,发现了什么。