通过这一章,你应该学会的东西:
- 潜在结果框架(The Potential Outcome Framework)
- 选择偏差(Selection Bias)
- 平均处理效应(Average Treatment Effect, LATE)
- 随机试验中的回归方法
RCTs在《精通计量》这本书被放到第一章(甚至放在回归之前),足可见它的重要性。那么它可以解决怎样的问题呢?抽象的概念未免有些脱离实际,我们不妨从一个问题入手:医疗保险真的能改善健康吗?
全国健康访谈调查
直观上,有医保的人似乎更健康,但 “有医保” 和 “健康” 之间是因果关系(医保导致健康改善)还是相关关系(健康的人更易买医保 / 有能力买医保)?这需要严谨的方法验证。
全国健康访谈调查(National Health Interview Survey, NHIS) 是一个很好的切入点。这是一项针对美国人口的年度调查,包含有关健康和健康保险的详细信息。
让我们分别构建以 “医保状态” ,即(Some/No HI)为唯一解释变量的OLS 回归,得到如下的结果:
回归是如何进行的?
这个特征的核心是呈现“未调整混杂因素的简单组间比较”,即直接对比有医保与无医保群体在各指标上的均值差异。
很显然,我们不能单纯使用减法得到均值差的数值,因为仅用减法我们无法满足统计推断的核心需求——这个差值是真实存在的效应,还是抽样偶然导致的误差?因此我们需要量化差值的统计显著性。
而单自变量的OLS回归能同时输出系数与标准误,这个标准误就是判断统计显著性的核心指标。
让我们针对表格中每一个待分析指标(如健康指数、年龄、收入等)单独定义变量并进行回归。我们可以注意到,丈夫与妻子的样本是分开回归的(因为表格按“丈夫”“妻子”分组呈现结果)。
因变量(被解释变量):
- 定义:第个个体(为样本编号,如“第1个丈夫”“第1个妻子”)在某一指标上的取值,每个指标对应一个独立的。
例如:
- 若分析“丈夫的健康指数”,则第个丈夫的健康指数(如3.70、3.39等);
- 若分析“丈夫的年龄”,则第个丈夫的年龄(如43.98、41.26等);
- 虚拟变量(如“是否非白人”)同样适用:(非白人)或(白人)。
自变量(核心解释变量):医保状态虚拟变量
- 定义:仅反映第个个体是否有医保,是回归中唯一的解释变量:
- 在丈夫样本中,8114个个体的(有医保),1281个个体的(无医保);妻子样本中,8264个个体的,1131个个体的。
回归方程设定
对任意一个指标的因变量(以“丈夫的健康指数”为例),回归方程为:
其中:
- :截距项,对应无医保组()的因变量均值——当时,;
- :核心回归系数,等于表格中“Difference列”的系数——当时,,因此(即“有医保组均值 - 无医保组均值”);
- :随机误差项,代表未被医保状态解释的随机因素(如个体健康差异、测量误差等),满足(误差项均值为0);
- 下标:贯穿所有变量,均代表“第个个体”,确保变量与样本的一一对应(如对应第1个个体的指标值,对应第1个个体的医保状态)。
如此我们就得到了这个具有统计特征的表格。 表格中A部分核心结果如下:
这一结果支持“医保改善健康”的猜想——无论丈夫还是妻子,有医保群体的健康水平均显著高于无医保群体,且妻子的健康差异(0.39)略大于丈夫(0.31)。然而事实果真如此吗?
表格中的B部分揭示了更核心的信息:两组群体在年龄、教育、收入、就业等关键特征上本就存在显著差异,而这些特征本身就是影响健康的重要因素(即“混杂因素”)。
这揭示了“有医保→更健康”的直观关联背后,隐藏着严重的选择偏差——有医保群体并非“随机选择”的群体,而是本身具备“年龄更大、教育更高、收入更高、就业更稳定”等优势特征的群体,这些特征(而非医保本身)可能才是健康更好的真正原因。
具体来讲:
- 无法排除“反向因果”:并非医保让健康更好,而是健康状况较好、经济条件更优的群体,更有能力和意愿购买医保(即“健康的人更易有医保”);
- 无法区分“因果与相关”:健康指数差异(0.31/0.39)是“医保效应”“年龄效应”“教育效应”“收入效应”等多种因素的混合结果,无法单独剥离出医保的真实因果效应;
为了消除选择偏差带来的影响,我们要先明确:选择偏差的本质是什么?
选择偏差(Selection Bias)
如果当初她/他没有和我分手会怎样?如果我的GPA再高一点会怎样?每一个大学生似乎都会在深夜想到这些。
在计量经济学中当然也有类似的问题:如果这项政策从未实施会怎样?如果他当初没有去医院会怎样?
但现实是,她/他确实和你分了手,政策也确实已经实施。也就是说,我们永远无法知道这些问题的答案。
但我们仍然需要对这些答案做一个估计。因为在计量经济学中,我们之所以能观测到政策(或其他已发生事件)的影响,前提就是我们知道这些“如果”对应的结果。
为了找到这些在现实世界中并不存在的“如果”,我们就需要使用潜在结果框架(The Potential Outcome Framework)了。为了便于理解,我们这里依然选择医疗保险的例子。
潜在结果框架(The Potential Outcome Framework)
定义核心变量:
- :状态虚拟变量,表示第个个体在处理组,表示在对照组;
- :个体接受处理后的潜在结果,即“有医保时的健康水平”;
- :个体未接受处理时的潜在结果,即“无医保时的健康水平”;
在现实世界中,我们能观测到什么?
- 对于接受处理的个体(),我们能观测到其,但不可观测;
- 对于未接受处理的个体(),我们能观测到其,但不可观测。
这其实很好理解:现实世界中,并不存在一个既投了保险,又没投保险的人。
评估处理效应最直接的方式,是比较处理组和未处理组的平均结果(ATE 表示平均处理效应):
等等,这个表达式真的正确吗?
我们可以举个简单的例子来反驳这一点:如果比较 “就医者” 与 “未就医者” 的健康水平,可能发现 “就医者健康更差”,然而这并不能说明就医对健康有害,而是健康差的人更倾向于就医。
因此让我们对ATE进行修改。
这两者的差异是什么?
我们称这个差异为选择偏差——它的核心是“处理组在未接受处理时的潜在结果均值”与“对照组在未接受处理时的潜在结果均值”的差异。
此时先前的公式就可以改写为:
我们可以直观地发现,若有医保群体本身更健康(选择偏差为正),即使医保本身没有效果(),简单比较也会误判“医保能改善健康”,这就是选择偏差的危害。
通过随机分配,我们可以抵消掉选择偏差带来的影响。
随机分配与选择偏差
随机分配的关键操作是:完全通过概率(如抽签、随机数)将个体分入处理组或对照组,不依赖任何个体特征(如年龄、收入、健康状况)。这一操作能确保:
即“处理组未接受处理时的潜在结果均值 = 对照组未接受处理时的潜在结果均值”)。
为什么随机分配能实现这一点?
- 随机分配切断了“个体特征”与“分组结果”的关联:无论是可观测特征(如年龄、教育)还是不可观测特征(如健康意识、生活习惯),都不会影响个体被分入哪一组。
- 大样本下的“概率均衡”:即使单次随机可能有微小差异,但在足够大的样本中,处理组和对照组会自然包含“各种类型的个体”——比如两组中“高收入者比例、老年人比例、健康意识强的人比例”完全相同,最终导致两组在“未处理时的潜在结果()”上均值相等。
当随机分配实现时,可推导出选择偏差趋于0:
- 对处理组(),我们观测到的结果就是其接受处理后的潜在结果,即;
- 对对照组(),我们观测到的结果就是其未接受处理的潜在结果,即。
因此,观测到的组间差异可改写为:
我们设为保险所带来的平均因果效应(其实就是,只不过随机试验使我们不需要像上文那样计算条件期望了)。根据常数因果效应假设,你可以想象医疗保险使每个人的健康水平都提高了一个常数,这个常数就是。
由(有医疗保险的人和没有医疗保险的人之间的差别),可得。将其代入上式:
根据期望的线性性质,。 结合随机分配带来的,可得:
随机分配后,“观测到的组间差异”完全等于“处理的平均因果效应”,选择偏差项”彻底消失——随机分配消除了选择偏差。
回到我们最开始的问题:医疗保险真的能改善健康吗?那么为了解答这个问题,我们或许需要做一个与此相关的随机试验,才能得到一个不被选择偏差影响的答案。兰德健康保险试验就是这样一个试验。
兰德健康保险试验
兰德健康保险实验(RAND Health Insurance Experiment)是美国历史上规模最大、最具影响力的健康政策随机试验,核心是通过随机分配消除选择偏差,首次量化“医疗价格”与“医疗使用、健康结果”的因果关系,为医保政策设计提供了里程碑式的证据。
该试验的初衷并非直接回答“医保是否改善健康”,而是解决经济学核心问题——医疗需求的价格弹性:即“医疗服务价格上升时,人们对医疗的使用会减少多少”。
具体来说,研究者想验证:
- 当医保降低医疗服务的“实际价格”(如减少自付比例、免除费用)时,是否会刺激人们更多使用医疗服务?
- 这种“更多的医疗使用”,最终是否会转化为“更好的健康结果”?
这两个问题本质上是通过“价格弹性”间接评估医保的实际作用——医保的核心功能之一就是降低医疗价格,其效果可通过价格弹性推导。
实验设计
作为一个随机试验(RCTS),兰德实验的核心是通过概率随机将参与者分入不同医保计划,确保各组在基线特征上均衡(消除选择偏差)。具体设计如下:
样本选择:明确纳入与排除标准
- 总样本量:共纳入名参与者,年龄范围岁,覆盖美国6个地区
随机分组:14种保险计划按“费用分担”分类
参与者被随机分配至种医保计划,核心差异在于“费用分担规则”(即参与者自付医疗费用的比例/金额),本质是通过规则差异制造“医疗服务的不同实际价格”。为方便理解,这里将14种计划归纳为4类核心类型:
实验控制
- 参与者无需支付医保保费:避免“保费压力”影响医疗使用决策,确保差异仅来自“费用分担”;
- 固定月付款:参与者可获得与医疗使用无关的固定月付款,作为放弃原有医保的补偿,进一步排除“使用越多付费越多”的干扰;
- 参与时长:家庭需参与年或年,并承诺放弃原有医保,确保长期观测医疗使用与健康的变化。
关键结果
兰德实验的结果分为“预处理基线均衡”和“后处理效应”两部分,前者验证随机分配的有效性,后者回答核心研究问题。
预处理结果
在实验开始前需要做Pre-treatment outcomes comparison(预处理结果比较),核心是验证各组在“实验开始前”的人口特征和健康指标无显著差异——这是随机分配成功消除选择偏差的直接证据。 该表格的“预处理结果”是指实验启动前(未接受任何医保计划干预时) 各组的特征数据,包括两部分:
- Panel A:人口统计特征(如年龄、性别、种族、教育年限等);
- Panel B:基线健康指标(如总胆固醇、收缩压、自我报告健康指数等)。
回归分析的核心目标是:检验“医保计划分组”这一变量,是否对任意一个预处理特征有显著影响。若所有特征的回归系数均无统计显著性,说明各组在基线特征上均衡(),随机分配成功消除选择偏差。
——预处理特征指标
针对表格中每一个待检验的预处理特征,单独定义一个因变量(每个特征运行一次独立回归),例如:
- 若检验“年龄”,则
- 若检验“性别”,则
- 若检验“总胆固醇”,则
- 若检验“非白人比例”,则
医保计划分组虚拟变量
实验将参与者随机分配至14种医保计划,核心按“费用分担类型”分为4类(免费计划、灾难性覆盖计划、免赔额计划、共付比例计划)。我们在回归中需要将“医保计划分组”转化为虚拟变量,步骤如下:
- 选择Reference Group:通常选“极端组”以凸显差异,此处选“灾难性覆盖计划组”(近似“无医保”,医疗价格最高,记为);
- 定义处理组虚拟变量:将剩余3类计划(免费计划、免赔额计划、共付比例计划)分别设为虚拟变量、、,其中:
回归模型
针对每一个因变量(预处理特征),构建以医保计划虚拟变量为核心解释变量的多元线性回归模型(OLS),模型形式如下:
其中:
- :截距项,对应参照组(灾难性覆盖计划组)的因变量均值——当所有(即参与者在参照组)时,;
- ():核心回归系数,表示第类医保计划组与参照组(灾难性组)在因变量上的均值差——例如(免费计划组与灾难性组的特征差异),这一系数对应表格中的“Difference列”数值;
- :随机误差项,代表未被医保计划分组解释的随机因素(如个体特征测量误差),满足;
- 下标:贯穿所有变量,代表“第个参与者”,确保变量与样本的一一对应。
系数显著性检验
回归分析的核心是通过 检验(或检验)判断系数的统计显著性。
表格中“Difference列”的数值,本质是“某医保计划组与参照组(灾难性组)的特征均值差”,而这一差值是回归模型中的系数。
示例:若检验“年龄”这一因变量,以灾难性组为参照,免费计划组的虚拟变量的回归系数(标准误),则表格中“免费计划组与灾难性组的年龄差异”即为,括号内的标准误为。
通过回归输出的值,我们可以判断是否显著(通常以为显著标准):
- 若的值:说明该医保计划组与参照组在该特征上无显著差异,符合基线均衡;
- 若的值:说明两组特征存在显著差异,随机分配可能失效(兰德实验中无此情况)。
例如,表格中“总胆固醇”指标,免费计划组与灾难性组的差异为(mmol/L),回归系数,标准误,计算值,对应值,因此表格中未标注显著性(如*、**),证明两组胆固醇水平无差异。
示例
让我们尝试通过回归得到表格中第2列(某医保计划组)和第5列(另一计划组)的结果,以“年龄”特征为例:
- 因变量:参与者年龄(连续变量);
- 参照组:灾难性覆盖计划组();
- 处理组虚拟变量:
- (Column 2:免费计划组),(否则);
- (Column 5:免赔额计划组),(否则)。
构建回归模型:
回归结果(对应表格Column 2和Column 5):
- 截距:灾难性组的平均年龄();
- 系数:免费计划组与灾难性组的年龄差异(),标准误()——对应表格Column 2的“年龄差异”;
- 系数:免赔额计划组与灾难性组的年龄差异(如),标准误(如)——对应表格Column 5的“年龄差异”;
- 显著性:和的值均,说明Column 2、Column 5与参照组的年龄无显著差异。
结论
兰德实验的回归结果显示:所有预处理特征的均无统计显著性(如年龄差异,;胆固醇差异,),证明,选择偏差已消除,后续后处理结果(医疗使用、健康指标)的差异就可以完全归因于医保计划本身了。
流程总结
- 拆分因变量:针对表格中每一个预处理特征(年龄、性别、胆固醇等),单独定义一个因变量;
- 设定自变量:将医保计划按“费用分担类型”合并为4类,选择灾难性组为参照组,剩余3类设为虚拟变量、、;
- 构建OLS回归:对每个,运行;
- 提取回归结果:将系数填入表格“Difference列”,标准误填入括号内,根据值标注显著性;
- 判断基线均衡:若所有的值>0.05,证明随机分配有效,选择偏差消除。
后处理结果
后处理结果比较分“医疗使用”和“健康结果”两部分:
医疗使用:价格弹性显著,医保降低价格→增加使用(Panel A)
各组因“费用分担”不同(医疗价格不同),医疗使用差异明显,完美验证了价格弹性的存在:
- 免费计划组(价格最低):医疗使用最高——面对面就诊次数次/周期,总医疗费用美元;
- 灾难性覆盖组(价格最高):医疗使用最低——面对面就诊次数次/周期,总医疗费用美元;
- 中间计划组(如免赔额、共付比例计划):医疗使用介于两者之间,且自付比例越低,使用越多。
这说明医疗需求存在显著的价格弹性——当医保降低医疗价格(减少自付)时,人们会显著增加医疗服务的使用,这为“医保影响医疗利用”提供了因果证据。
健康结果:各组无显著差异(Panel B)
与“医疗使用差异”形成对比的是,所有医保计划组的健康指标均无统计显著性差异:
- 生理指标:总胆固醇、收缩压、舒张压等指标,免费计划组与灾难性覆盖组差异极小(如胆固醇差异,标准误);
- 健康评分:自我报告的一般健康指数,免费计划组甚至比灾难性覆盖组低(标准误),无统计显著性;
- 特殊人群:即使针对高血压、糖尿病等慢性病患者,不同计划组的健康控制效果也无差异。
可以说,“更多的医疗使用”不等于“更好的健康结果”——医保降低价格刺激了医疗使用,但这种使用的增加并未转化为可测量的健康改善,打破了“越多医疗越健康”的直观认知。
Remote Work and Employee Productivity
A tech company wants to study the effect of remote work on employees’ productivity. They randomly assign 300 employees into three groups: full remote work (100 employees), hybrid work (3 days in office, 100 employees), and full office work (100 employees). The employees’ quarterly performance scores (0–100 scale) are collected as the outcome variable.
Questions:
Construct a potential outcome framework to define the causal effects of different work arrangements on performance scores. What assumptions are needed for identification?
Answer: Let the three work arrangements be Full (R), Hybrid (H), and Office (O). For employee i, define potential outcomes:
where is the quarterly performance score under each arrangement. Average causal effects of interest include:
Assumptions needed for identification:
- Random assignment (no selection bias): Assignment to R, H, O is independent of .
- SUTVA / no interference: One employee’s assignment does not affect another’s outcome; no hidden versions of treatment.
潜在结果框架是因果推断的基础,RCT 通过随机分配保证 “处理组” 和 “对照组” 的可比性,从而将 “观察到的组间差异” 直接等同于 “因果效应”,避免了 observational data 中的选择偏差。
Using Table 1, evaluate whether the randomization successfully created comparable groups. What statistical evidence supports your conclusion?
随机分配的理想结果是:三组在所有 “预设特征”(即不受处理影响的特征,如年龄、工作经验、历史绩效)上的分布一致。若存在显著差异,说明随机化失败,后续绩效差异可能由初始特征导致,而非工作模式。 检验的核心判断标准是:组间差异的统计显著性
Answer: Table 1 shows small mean differences in predetermined characteristics across groups, and the reported standard errors imply that these differences are not statistically distinguishable from zero (e.g., for Age, the differences are on the order of 0.3–0.7 years with SE about 0.74–0.76; similarly for experience, previous score, and female share).
Hence, the randomization appears to have generated comparable groups; there is no evidence of systematic imbalance.
Write down and estimate the regression equations needed to identify: (1) the effect of full remote work relative to office work, and (2) the effect of hybrid work relative to office work. Interpret the magnitude and significance of these effects using the data provided.
由于是随机分配,处理变量(工作模式)与潜在结果独立,因此可用简单线性回归直接估计因果效应,无需控制其他变量
Answer: Full remote vs office:
Hybrid vs office:
Economic Interpretation: On average, full remote work significantly increases employee performance by 2.8 points (), suggesting substantial productivity gains from complete work flexibility.
The hybrid arrangement shows an average effect of 0.7 points, but its statistical insignificance indicates no clear productivity advantage over traditional office work.
Write down a single regression equation that can produce all the difference estimates in column (4)–(6) of Table 2.
用虚拟变量来解决。选择某方式则为1,反之为0
Answer:
Let
,
,
with Office as the omitted category.
The single regression:
produces:
So after estimating the regression, one can recover column (6) using a linear combination (e.g., lincom Remote - Hybrid in Stata).
将办公室设为基准,是因为它是传统工作模式,是常见的比较基准;每个虚拟变量的系数衡量该组相对于基准组的平均绩效差异;当需要比较 “非基准组之间”(如远程 vs 混合)时,无需单独回归,只需对系数做线性运算,即可得到差异。
The Research Design of Randomized Experiments: What They Cannot Do
There are some research questions in Economics. If the question is suitable for a randomized experiment, please briefly describe the research design. If it is not suitable to conduct a randomized experiment, please explain why. (Open Questions. You may briefly discuss ethical, practical, or feasibility constraints.)
Research Questions:
- Assessing the impact of war and conflict on the accumulation of human capital;
- Evaluating whether micro-credit can help rural households escape poverty;
- Investigating whether having children affects women’s labor supply and other labor market outcomes.
Answer:
-
Not suitable for a randomized experiment: it is unethical and infeasible to randomly assign populations to war or conflict. Researchers typically rely on quasi-experimental designs (e.g., difference-in-differences using timing/geography of conflicts, event studies, or IV strategies based on plausibly exogenous shocks).
-
Suitable for a randomized experiment: randomly assign micro-credit offer/eligibility (or randomized phase-in across villages), then compare outcomes across groups. Key design components include clear randomization, baseline balance checks, and handling noncompliance.
-
Investigating how children affect women’s labor supply is not appropriate for randomized experimentation. Having children is a personal decision influenced by multiple factors, making random assignment both ethically and practically impossible. This question is better studied through observational data or by utilizing policy changes as natural experiments to understand the relationship between fertility and labor market outcomes.
总结
- 因果推断比较的是潜在的结果,潜在结果描述了所有可选路径上的世界。就像甲选择了路径A,乙选择了路径B,但事实上他们可以选择很多条不同的路径,而不只是他们已经选择的那一条。
- 当我们对走上一条路和走上另一条路的人作比较时,往往就会受到选择偏差的干扰。通过随机分配消除选择偏差,是识别因果效应的 “黄金标准”,可有效区分变量间的因果关系与相关关系。
- 在随机试验时,我们在一些步骤上需要用到回归。
检验试验有效性(比较处理组和对照组的基线特征)
若存在多个处理组:
估计试验的影响效应

