Appearance
科学方法论
概念
科学方法论研究的是"怎样才算可靠的知识"。它不问"这个结论对不对",而问:这个结论是靠什么程序得到的,这个程序能不能被检验、被重复、被推翻。
它要对付的其实是人类认识里的两类系统性错误:
| 错误 | 表现 | 对应手段 |
|---|---|---|
| 确认偏误 | 只找支持自己的证据 | 预设假说、预先注册 |
| 事后归因 | 看到结果才编故事 | 先定分析方案再采数据 |
科学方法的基本循环:
| 步骤 | 做什么 | 产出 |
|---|---|---|
| 观察 | 发现问题、收集初步现象 | 研究问题 |
| 假说 | 给出可检验的猜测 | 明确的可证伪陈述 |
| 预测 | 从假说推出可观测结果 | 若假说真,则应看到什么 |
| 实验 | 采集数据做对照 | 数据 |
| 修正 | 保留、修改或放弃假说 | 新的假说或结论 |
波普尔给这个循环加了一条关键限定:可证伪性。 一个陈述要算科学陈述,必须说明什么结果会推翻它。"所有的天鹅都是白的"是可证伪的(找到一只黑天鹅即可推翻);"凡事都有缘由"则不可证伪,因为它不允许任何结果反对它。不可证伪的陈述不是错的,而是不参与这场游戏。
一句话:科学不靠"证明自己对"取胜,靠"说明自己在什么条件下会错"取胜。
原理
一、变量与操作化
一个假说要能被检验,其中的概念必须落到可测量的操作上,这叫操作化定义。
| 变量类型 | 角色 | 例子 |
|---|---|---|
| 自变量 | 被操纵的 | 教学方法 |
| 因变量 | 被测量的 | 考试成绩 |
| 控制变量 | 被固定的 | 教材、课时、教师 |
| 混杂变量 | 没控制住、和自变量一起变的 | 学生的家庭作业时间 |
混杂变量是因果推断的头号敌人。 它与自变量相关、又单独影响因变量,于是"自变量—因变量"的关联被它污染。只有随机分配才能保证(在期望意义上)没有系统性混杂——这正是随机对照试验的分量所在。
二、实验设计:四件套
| 手段 | 防的是什么 |
|---|---|
| 对照组 | 防"时间的自然变化"被算成效应 |
| 随机分配 | 防"参与者之间的差异"造成系统偏差 |
| 盲法 | 防参与者和研究者的期望渗进测量 |
| 安慰剂对照 | 防"被治疗的感觉"本身产生效应 |
1948 年英国医学研究理事会(MRC)的链霉素治肺结核试验一般被认为是第一个公开发表的随机对照试验,统计学家是 Austin Bradford Hill——这是"随机化"作为一种方法正式进入医学的起点。
两种效度必须分开:
- 内部效度:在这批样本、这个实验里,因果结论站得住吗?
- 外部效度:能推广到别的人群、别的情境吗?
两者常常此消彼长:控制得越严,内部效度越高,但环境越不自然,外部效度越低。
三、统计推断:显著性、错误与效应
设原假设为
两类错误:
| 拒绝 | 第一类错误(弃真),概率 | 正确,概率 |
| 不拒绝 | 正确 | 第二类错误(取伪),概率 |
关于 p 值,最需要纠正的一句话:
显著不等于重要。 样本足够大时,任何微小差异都能显著。所以要同时报告效应量(如标准化的均差
常用的经验刻度是
多重比较是隐蔽的陷阱。 做
它随
四、可重复性
一个结论要可信,别的人用别的手段、按描述出来的方法,应当能得到同方向的结果。
2015 年开放科学合作组织(Open Science Collaboration)在《科学》上发表了大规模复制研究:从三本顶级心理学期刊中选取 100 项研究进行高功效复制,原始研究中有 97% 报告了显著结果,而复制中只有 36% 得到显著结果;复制得到的效应量平均约只有原始的一半。 若原始效应为真,预期复制成功率至少应有 89%。细胞生物学领域也有类似的报告,两个工业实验室对标志性成果的复制成功率分别只有 11% 与 25%。
这一类现象统称"可重复性危机"。 它的成因不是单一的造假,而是一整套激励结构:期刊偏好正面结果、研究者有"做出显著结果"的压力、以及若干可疑研究实践(比如先看结果再定假说、反复调分析直到显著)。
对策是可查证的流程:预先注册研究方案、公开数据与代码、报告全部结果而非只报显著的那部分、以及把复制研究本身当作值得发表的成果。
五、从关联到因果
因果关系不能靠相关系数读出来,通常需要几项证据同时成立:
| 判据 | 含义 |
|---|---|
| 时间先后 | 因必须在果之前 |
| 剂量—反应 | 因的强度变化伴随果的强度变化 |
| 排除混杂 | 控制住竞争解释后关联仍在 |
| 机制 | 有说得通的中间环节 |
随机对照试验是"排除混杂"最有力的工具,因此被当作金标准。观察性研究并非无用——很多问题(吸烟与健康、气候影响)无法随机分配——但必须更谨慎地用统计手段去逼近因果,这正是计量经济学的核心工作。
与本章相关的另一条原则是"同一口径比较":两个数要放在一起比,必须来自同一套定义与同一种统计方式。这一点在气象学里关于气候变化的三个口径(十年平均、单年值、不同评估报告)讲得最清楚——口径不同的数字摆在一起比较,是"看起来很科学"的错误。
示例
python
import math
# 例 1:多重比较 —— 检验次数越多,"碰巧显著"的概率越高
for m in (5, 10, 20, 50, 100):
print(f"做 {m:3d} 次检验: P(至少一次假阳性) = {1 - 0.95 ** m:.2%} "
f"Bonferroni 阈值 {0.05 / m:.5f}")
# 例 2:单样本 z 检验(H0: mu = 50)
n, sigma, mu0, xbar = 100, 10, 50, 52
se = sigma / math.sqrt(n)
z = (xbar - mu0) / se
p = 2 * (1 - 0.5 * (1 + math.erf(abs(z) / math.sqrt(2))))
print(f"n={n} SE={se:.4f} z={z:.4f} 双尾 p={p:.4f}")
print(f"95% CI = [{xbar - 1.96 * se:.4f}, {xbar + 1.96 * se:.4f}]")
print(f"Cohen's d = {(xbar - mu0) / sigma:.2f}")
# 例 3:把"能看出差异"翻译成样本量(power = 80%,alpha = 0.05)
za, zb = 1.959964, 0.841621
for delta in (2, 5, 10):
nn = 2 * (za + zb) ** 2 * sigma ** 2 / delta ** 2
print(f"要检出均差 {delta:2d}: n/组 = {nn:.3f} -> {math.ceil(nn)}")
# 例 4:样本量 x4,精度只 x2
for nn in (25, 100, 400, 2500):
print(f"n={nn:5d} -> SE={sigma / math.sqrt(nn):.4f}")做 5 次检验: P(至少一次假阳性) = 22.62% Bonferroni 阈值 0.01000
做 10 次检验: P(至少一次假阳性) = 40.13% Bonferroni 阈值 0.00500
做 20 次检验: P(至少一次假阳性) = 64.15% Bonferroni 阈值 0.00250
做 50 次检验: P(至少一次假阳性) = 92.31% Bonferroni 阈值 0.00100
做 100 次检验: P(至少一次假阳性) = 99.41% Bonferroni 阈值 0.00050
n=100 SE=1.0000 z=2.0000 双尾 p=0.0455
95% CI = [50.0400, 53.9600]
Cohen's d = 0.20
要检出均差 2: n/组 = 392.444 -> 393
要检出均差 5: n/组 = 62.791 -> 63
要检出均差 10: n/组 = 15.698 -> 16
n= 25 -> SE=2.0000
n= 100 -> SE=1.0000
n= 400 -> SE=0.5000
n= 2500 -> SE=0.2000例 1 是"多重比较"最直观的一笔账。 每次检验的假阳性率都是
例 2 是一个"刚好显著"的样本。
但效应量 Cohen's
而且如果这 20 分是"试了 20 个指标才挑出来的那一个",那它其实落在例 1 的陷阱里:单次
例 3 把"能看出差异"翻译成样本量。 同样
这也解释了一个常见现象:"研究了半天没发现显著差异"往往不是"没有效应",而是"样本不够"——统计功效不足时,真有差异也可能测不出来。
例 4 是精度的成本曲线。 标准误从
要点
要点与常见误区
- p 值不是"假说为真的概率"。它是"在原假设为真的前提下观测到当前结果的概率"。混淆这两者是最常见的统计误读。
- 不显著不等于没有效应。样本太小、噪声太大都会导致测不出差异;此时该看置信区间与功效,而不是宣布"无差别"。
- 显著不等于重要。样本足够大,微小差异也会显著;必须同时报效应量与置信区间。
- 多重比较必须校正。20 次检验中至少一次假阳性的概率是 64.15%;反复换角度试出来的"显著"不算发现。
- 相关不等于因果。时间先后、剂量—反应、排除混杂、机制说明,缺一项都要打折。
- 只有随机分配才能系统性排除混杂。观察性研究可以逼近因果,但不能替代随机化。
- 口径不同的数字不能直接比较。同一件事用单年值和十年平均值比,会得到放大的趋势——先对齐定义,再比大小。
- "研究没重复出来"不必然是原研究造假。也可能是样本、条件、测量方法不同;但方法交代不清导致无法重复,本身就是缺陷。
- 可重复性的对策是流程,不是态度。预先注册、公开数据与代码、报告全部结果——这些是可查证的,而"我们会更严谨"不是。
- 单一研究几乎不能定论。结论的可信度来自多次独立复制与元分析的累积,而不是某一篇的 p 值。
小结
- 科学方法是一个循环:观察 → 假说 → 预测 → 实验 → 修正;可证伪性是入场券。
- 实验设计四件套:对照、随机、盲法、安慰剂;内部效度与外部效度常此消彼长。
- 统计推断的三件事:错误的两个方向(
与 )、效应量、置信区间;标准误按 下降。 - 多重比较会制造假阳性,20 次检验的累积假阳性率达 64.15%。
- 因果需要多重证据;随机对照被认为是金标准,观察性研究要靠统计与设计去逼近。
- 可重复性靠流程:预注册、开放数据与代码、报告全部结果。
- 验算锚点:
= 64.15%(Bonferroni 阈值 0.0025); 、 、均值差 时 、 、 、95% 置信区间 、Cohen's = 0.20;检出均差 分别需要 393 / 63 / 16 人每组;样本量从 25 涨到 2500(100 倍)只把标准误从 2.0000 降到 0.2000(十分之一)。 - 官方数字均已核对:开放科学合作组织 2015 年的复制研究(原始显著率 97%、复制显著率 36%、复制效应约为原始的一半)与细胞生物学领域的复制成功率 11% 与 25%;1948 年 MRC 链霉素试验为第一个公开发表的随机对照试验。
- 主线呼应:概率与推断的数学基础来自概率论;因果识别的方法论在计量经济学;"同一口径比较"的原则在气象学有具体教训;"什么算科学"这一问本身属于科学哲学。本章讲判据,下一章讲判据在时间里的实际作用。
下一篇:科技史 —— 方法论决定"单个结论可不可信",而技术史决定"整个方向对不对"。
评论(0)
当前浏览器不允许本地存储,评论无法保存。
还没有评论,来说两句。