内生性与外生性(应该之前就学会了吧?)
工具变量的条件:相关性条件(Relevance Condition)& 排他性约束(Exclusion Restriction)
两阶段最小二乘法(Two-Stage Least Squares, 2SLS)
主分层与依从类型(Principal Stratification and Compliance Types)
意向治疗效应(ITT)/局部平均处理效应(LATE)/处理者平均效应(TOT)
HW说工具变量是一个非必要不使用的工具————是药三分毒,而IV无疑是一剂重药。那么问题来了,为什么考试还要学这些东西??总之还是学吧。
为什么使用工具变量(IV)?
一个示例:教育对工资的影响。
设定模型:
W a g e i = β 0 + β 1 ⋅ E d u i + β 2 ⋅ A b i l i t y i + v i Wage_{i}=\beta_{0}+\beta_{1} \cdot Edu_{i}+\beta_{2} \cdot Ability _{i}+v_{i} Wa g e i = β 0 + β 1 ⋅ E d u i + β 2 ⋅ A bi l i t y i + v i
这是一个我们都熟悉的问题:研究者无法观测到A b i l i t y i Ability _{i} A bi l i t y i (能力),若直接使用OLS在未纳入A b i l i t y i Ability _{i} A bi l i t y i 的情况下进行回归,会出现遗漏变量问题。
考虑错误设定的回归方程:
W a g e i = β 0 + β 1 ⋅ E d u i + u i Wage _{i}=\beta_{0}+\beta_{1} \cdot Edu_{i}+u_{i} Wa g e i = β 0 + β 1 ⋅ E d u i + u i
其中:
u i = β 2 ⋅ A b i l i t y i + v i u_{i}=\beta_{2} \cdot Ability _{i}+v_{i} u i = β 2 ⋅ A bi l i t y i + v i
在该错误设定下,OLS估计量为:
β ^ 1 O L S = c o v ( W a g e i , E d u i ) V a r ( E d u i ) \hat{\beta}_{1_{OLS}}=\frac{cov\left( Wage _{i}, Edu_{i}\right)}{Var\left(Edu_{i}\right)} β ^ 1 O L S = Va r ( E d u i ) co v ( Wa g e i , E d u i )
我猜你已经不熟OLS是什么了。此乃自然之理,因此让我们来温习一下:
OLS的核心思想是最小化残差平方和 (∑ i = 1 n ( W a g e i − W a g e ^ i ) 2 \sum_{i=1}^n (Wage_{i} - \hat{Wage}_{i})^2 ∑ i = 1 n ( Wa g e i − Wa g e ^ i ) 2 ,其中W a g e ^ i = β ^ 0 + β ^ 1 ⋅ E d u i \hat{Wage}_{i} = \hat{\beta}_{0} + \hat{\beta}_{1} \cdot Edu_{i} Wa g e ^ i = β ^ 0 + β ^ 1 ⋅ E d u i 为拟合值),通过求解该最小化问题,最终得到教育水平E d u i Edu_{i} E d u i 的OLS估计量:
β ^ 1 O L S = c o v ( W a g e i , E d u i ) V a r ( E d u i ) \hat{\beta}_{1_{OLS}} = \frac{cov(Wage_{i}, Edu_{i})}{Var(Edu_{i})} β ^ 1 O L S = Va r ( E d u i ) co v ( Wa g e i , E d u i )
分子c o v ( W a g e i , E d u i ) cov(Wage_{i}, Edu_{i}) co v ( Wa g e i , E d u i ) :工资与教育的协方差,衡量两者的线性相关程度,计算公式为:
c o v ( W a g e i , E d u i ) = E [ ( W a g e i − E [ W a g e i ] ) ⋅ ( E d u i − E [ E d u i ] ) ] cov(Wage_{i}, Edu_{i}) = E\left[(Wage_{i} - E[Wage_{i}]) \cdot (Edu_{i} - E[Edu_{i}])\right] co v ( Wa g e i , E d u i ) = E [ ( Wa g e i − E [ Wa g e i ]) ⋅ ( E d u i − E [ E d u i ]) ]
(E [ ⋅ ] E[\cdot] E [ ⋅ ] 表示期望,即总体均值)。
分母V a r ( E d u i ) Var(Edu_{i}) Va r ( E d u i ) :教育水平的方差,衡量教育水平的总体波动程度,计算公式为:
V a r ( E d u i ) = E [ ( E d u i − E [ E d u i ] ) 2 ] Var(Edu_{i}) = E\left[(Edu_{i} - E[Edu_{i}])^2\right] Va r ( E d u i ) = E [ ( E d u i − E [ E d u i ] ) 2 ]
OLS估计量本质是“工资与教育的线性关联强度”除以“教育自身的波动强度”,试图捕捉E d u i Edu_{i} E d u i 每变化1单位时,W a g e i Wage_{i} Wa g e i 的平均变化幅度。
将实际数据生成过程:
W a g e i = β 0 + β 1 ⋅ E d u i + β 2 ⋅ A b i l i t y i + v i Wage_{i}=\beta _{0}+\beta _{1}\cdot Edu_{i}+\beta _{2}\cdot Ability _{i}+v_{i} Wa g e i = β 0 + β 1 ⋅ E d u i + β 2 ⋅ A bi l i t y i + v i
代入,可得:
β ^ 1 O L S = c o v ( β 0 + β 1 E d u i + β 2 A b i l i t y i + v i , E d u i ) V a r ( E d u i ) = β 1 + β 2 ⋅ c o v ( A b i l i t y i , E d u i ) V a r ( E d u i ) + c o v ( v i , E d u i ) V a r ( E d u i ) \begin{aligned}
\hat{\beta}_{1_{OLS}}
&=\frac{cov\left(\beta_{0}+\beta_{1} Edu_{i}+\beta_{2} Ability_{i}+v_{i}, Edu_{i}\right)}{Var\left(Edu_{i}\right)} \\
&=\beta_{1}+\frac{\beta_{2} \cdot cov\left( Ability _{i}, Edu_{i}\right)}{Var\left(Edu_{i}\right)}+\frac{cov\left(v_{i}, Edu_{i}\right)}{Var\left(Edu_{i}\right)}
\end{aligned} β ^ 1 O L S = Va r ( E d u i ) co v ( β 0 + β 1 E d u i + β 2 A bi l i t y i + v i , E d u i ) = β 1 + Va r ( E d u i ) β 2 ⋅ co v ( A bi l i t y i , E d u i ) + Va r ( E d u i ) co v ( v i , E d u i )
在真实模型中,若v i v_{i} v i 与E d u Edu E d u 独立(即v i v_{i} v i 不存在额外内生性问题),则:
E [ β ^ 1 O L S ] = β 1 + β 2 ⋅ E [ C o v ( A b i l i t y i , E d u i ) ] E [ V a r ( E d u i ) ] E\left[\hat{\beta}_{1_{OLS}}\right]=\beta_{1}+\frac{\beta_{2} \cdot E\left[Cov\left( Ability _{i}, Edu_{i}\right)\right]}{E\left[Var\left(Edu_{i}\right)\right]} E [ β ^ 1 O L S ] = β 1 + E [ Va r ( E d u i ) ] β 2 ⋅ E [ C o v ( A bi l i t y i , E d u i ) ]
显然,若A b i l i t y i Ability _{i} A bi l i t y i 与E d u Edu E d u 正相关(例如更有能力的人往往接受更多教育),则E [ β ^ 1 O L S ] ≠ β 1 E[\hat{\beta}_{1_{OLS}}] \neq\beta_{1} E [ β ^ 1 O L S ] = β 1 ,这意味着OLS估计存在偏差和不一致性。
工具变量(IV)的核心思想是什么?
IV的核心思想是寻找一个外生工具变量Z i Z_{i} Z i ,以提供X i X_{i} X i 的“纯净变化”(外生变异,exogenous variation)。直观来看,IV像一个“杠杆”或“筛子”,利用Z i Z_{i} Z i 提取X i X_{i} X i 中与误差项u u u 无关的那部分变化,从而帮助识别X i X_{i} X i 对Y i Y_{i} Y i 的真正因果影响。
有效的IV需满足两个关键条件:
相关性条件(Relevance Condition):工具变量Z i Z_{i} Z i 必须与X i X_{i} X i 显著相关,即C o v ( Z i , X i ) ≠ 0 Cov(Z_{i}, X_{i}) \neq0 C o v ( Z i , X i ) = 0 。这确保Z i Z_{i} Z i 能为X i X_{i} X i 提供有意义的变异。若Z i Z_{i} Z i 与X i X_{i} X i 弱相关,则为无效工具变量(弱工具变量问题,weak instrument problem)。
排他性约束(Exclusion Restriction):工具变量Z i Z_{i} Z i 必须与误差项u i u_{i} u i 不相关,即C o v ( Z i , u i ) = 0 Cov(Z_{i}, u_{i})=0 C o v ( Z i , u i ) = 0 。这意味着Z i Z_{i} Z i 只能通过X i X_{i} X i 影响Y i Y_{i} Y i ,而不能通过其他路径直接影响Y i Y_{i} Y i 。
第一条(相关性)可通过第一阶段回归检验,而第二条(外生性)通常需要理论或情境支持,无法直接通过统计检验验证。
由于外生性难以严格验证,这也是IV方法有时遭受质疑的原因。
工具变量示例
在研究教育对工资的影响时,可使用出生地的教育政策变化(例如义务教育年限的变革)作为工具变量。只要该政策变化能影响教育年限,且不直接影响个体工资(除通过教育途径外),即可视为满足外生性和相关性条件。
IV估计的基本设定
考虑基本模型:
Y i = β 0 + β 1 X i + u i Y_{i}=\beta _{0}+\beta _{1}X_{i}+u_{i} Y i = β 0 + β 1 X i + u i
且
C o v ( X i , u i ) ≠ 0 Cov(X_{i},u_{i}) \neq 0 C o v ( X i , u i ) = 0
若找到满足
C o v ( Z i , X i ) ≠ 0 Cov(Z_{i}, X_{i}) \neq0 C o v ( Z i , X i ) = 0
且
C o v ( Z i , u i ) = 0 Cov(Z_{i}, u_{i})=0 C o v ( Z i , u i ) = 0
的工具变量Z i Z_{i} Z i ,
则IV估计量为:
β ^ I V = C o v ( Z i , Y i ) C o v ( Z i , X i ) \hat{\beta}_{IV}=\frac{Cov\left(Z_{i}, Y_{i}\right)}{Cov\left(Z_{i}, X_{i}\right)} β ^ I V = C o v ( Z i , X i ) C o v ( Z i , Y i )
该比率的直观含义是:用Z i Z_{i} Z i 与Y i Y_{i} Y i 的关系(整体影响)除以Z i Z_{i} Z i 与X i X_{i} X i 的关系(对X i X_{i} X i 的纯影响),即可获得X i X_{i} X i 对Y i Y_{i} Y i 的纯因果效应。
两阶段最小二乘法(Two-Stage Least Squares, 2SLS)
当存在多个控制变量或多个内生变量时,比率形式的IV估计不再便捷,常用方法为两阶段最小二乘法(2SLS):
第一阶段(First Stage) :
X i = π 0 + π 1 Z i + 其他外生控制变量 + η i X_{i}=\pi _{0}+\pi _{1} Z_{i}+ 其他外生控制变量 +\eta_{i} X i = π 0 + π 1 Z i + 其他外生控制变量 + η i
通过该回归得到拟合值X ^ i \hat{X}_{i} X ^ i ,X ^ i \hat{X}_{i} X ^ i 仅包含X i X_{i} X i 中由Z i Z_{i} Z i 和其他外生因素解释的部分,已剔除内生成分。
第二阶段(Second Stage) :
Y i = β 0 + β 1 X ^ i + 其他外生控制变量 + u ~ i Y_{i}=\beta_{0}+\beta_{1} \hat{X}_{i}+ 其他外生控制变量 +\tilde{u}_{i} Y i = β 0 + β 1 X ^ i + 其他外生控制变量 + u ~ i
对该阶段进行OLS估计,可得到β 1 \beta_{1} β 1 的一致估计量。
若将Z i Z_{i} Z i 直接代入主方程:
Y i = δ 0 + δ 1 Z i + 其他外生控制变量 + u i Y_{i}=\delta _{0}+\delta _{1}Z_{i}+其他外生控制变量 +u_{i} Y i = δ 0 + δ 1 Z i + 其他外生控制变量 + u i
则δ 1 \delta_{1} δ 1 为Z Z Z 对Y Y Y 的简化式效应(reduced form effect),而第一阶段的π 1 \pi_{1} π 1 表示Z Z Z 对X X X 的影响。两者的比率可识别X X X 对Y Y Y 的因果效应。
简单来讲,2SLS在第一阶段先对带有内生性的变量进行处理,通过工具变量来消除这个变量的内生性,之后再将消除内生性的变量带入原方程,此时变量与残差项完全正交,我们就可以通过方程识别其中的因果效应。
IV估计结果的解释
在有异质性处理效应(不同个体对处理的反应不同,可能比较难以理解,往下看)时,2SLS估计通常被解释为“局部平均处理效应”(Local Average Treatment Effect, LATE):
LATE指的是那些会因工具变量变化而改变处理状态的个体的平均处理效应,这类人群被称为“依从者”(Compliers)。
简单来说,IV 无法估计 “所有群体” 的平均处理效应,只能精准识别 “受工具变量影响而行动” 的特定群体的效应 —— 这一 “局部” 群体的平均效应,就是 LATE。
因此,IV估计结果的解释需慎重,其外部有效性常常需要额外讨论(例如与OLS结果对比系数大小,或讨论群体中依从者的特征)。
主分层与依从类型(Principal Stratification and Compliance Types)
在存在不完全遵从(noncompliance)的情境下,可根据研究对象在不同激励(或指派)状态下对处理的响应方式进行分类,该分类方式称为主分层(Principal Stratification)。每个个体根据“假设分配”为处理组或对照组时是否会接受处理,被分为以下四类:
依从者(Compliers):有激励时接受处理,无激励时不接受处理。定义为:D i ( 1 ) = 1 D_{i}(1)=1 D i ( 1 ) = 1 且D i ( 0 ) = 0 D_{i}(0)=0 D i ( 0 ) = 0 。
总是接受者(Always-takers):不论是否受到激励,都接受处理。定义为:D i ( 1 ) = D i ( 0 ) = 1 D_{i}(1)=D_{i}(0)=1 D i ( 1 ) = D i ( 0 ) = 1 。
从不接受者(Never-takers):不论是否受到激励,都不接受处理。定义为:D i ( 1 ) = D i ( 0 ) = 0 D_{i}(1)=D_{i}(0)=0 D i ( 1 ) = D i ( 0 ) = 0 。
反向遵从者(Defiers):有激励时不接受处理,无激励时接受处理。定义为:D i ( 1 ) = 0 D_{i}(1)=0 D i ( 1 ) = 0 且D i ( 0 ) = 1 D_{i}(0)=1 D i ( 0 ) = 1 。
上述定义中的D i ( z ) D_{i}(z) D i ( z ) 表示当工具变量(激励)Z i = z Z_{i}=z Z i = z 时,个体i i i 的处理状态D i D_{i} D i 。
然而,根据观测数据(Z i , D i Z_{i}, D_{i} Z i , D i 的组合),我们无法直接辨别个体属于哪一种类型,因为这些类型的定义基于反事实状态下的行为:
所以在没有更多假设的情况下,无法从上述表格中观测到的联合状态唯一识别出四类人群。
意向治疗效应(ITT)的分解
意向治疗效应(ITT effect)可分解为各子群体ITT效应的组合:
I T T = I T T c × P r ( 依从者 ) + I T T a × P r ( 总是接受者 ) + I T T n × P r ( 从不接受者 ) + I T T d × P r ( 反向遵从者 ) ITT=ITT_{c}× Pr(依从者)+ITT_{a}× Pr(总是接受者)+ITT_{n}× Pr(从不接受者)+ITT_{d}× Pr(反向遵从者) I TT = I T T c × P r ( 依从者 ) + I T T a × P r ( 总是接受者 ) + I T T n × P r ( 从不接受者 ) + I T T d × P r ( 反向遵从者 )
其中:
I T T c = E [ Y i ( 1 , D i ( 1 ) ) − Y i ( 0 , D i ( 0 ) ) ∣ D i ( 1 ) = 1 , D i ( 0 ) = 0 ] ITT_{c}=\mathbb{E}\left[Y_{i}\left(1, D_{i}(1)\right)-Y_{i}\left(0, D_{i}(0)\right) | D_{i}(1)=1, D_{i}(0)=0\right] I T T c = E [ Y i ( 1 , D i ( 1 ) ) − Y i ( 0 , D i ( 0 ) ) ∣ D i ( 1 ) = 1 , D i ( 0 ) = 0 ]
I T T a = E [ Y i ( 1 , D i ( 1 ) ) − Y i ( 0 , D i ( 0 ) ) ∣ D i ( 1 ) = D i ( 0 ) = 1 ] ITT_{a}=\mathbb{E}\left[Y_{i}\left(1, D_{i}(1)\right)-Y_{i}\left(0, D_{i}(0)\right) | D_{i}(1)=D_{i}(0)=1\right] I T T a = E [ Y i ( 1 , D i ( 1 ) ) − Y i ( 0 , D i ( 0 ) ) ∣ D i ( 1 ) = D i ( 0 ) = 1 ]
其余类似。
在单调性假设和排他性约束下,该分解可简化为:
I T T = I T T c × P r ( 依从者 ) + I T T a × P r ( 总是接受者 ) + I T T n × P r ( 从不接受者 ) + 0 [ 单调性假设 ] = I T T c × P r ( 依从者 ) + 0 × P r ( 总是接受者 ) + 0 × P r ( 从不接受者 ) [ 排他性约束 ] = I T T c × P r ( 依从者 ) \begin{aligned}
ITT
&=ITT_{c} × Pr(依从者)+ITT_{a} × Pr(总是接受者) \\
&\quad +ITT_{n} × Pr(从不接受者)+0 \quad[单调性假设] \\
&=ITT_{c} × Pr(依从者)+0 × Pr(总是接受者) \\
&\quad +0 × Pr(从不接受者) \quad[排他性约束] \\
&=ITT_{c} × Pr(依从者)
\end{aligned} I TT = I T T c × P r ( 依从者 ) + I T T a × P r ( 总是接受者 ) + I T T n × P r ( 从不接受者 ) + 0 [ 单调性假设 ] = I T T c × P r ( 依从者 ) + 0 × P r ( 总是接受者 ) + 0 × P r ( 从不接受者 ) [ 排他性约束 ] = I T T c × P r ( 依从者 )
因此,I T T c ITT _{c} I T T c 可通过非参数方法识别:
I T T c = I T T P r ( 依从者 ) ITT_{c}=\frac{ITT}{Pr(依从者)} I T T c = P r ( 依从者 ) I TT
I T T c = E [ Y i ∣ Z i = 1 ] − E [ Y i ∣ Z i = 0 ] E [ D i ∣ Z i = 1 ] − E [ D i ∣ Z i = 0 ] = C o v ( Y i , Z i ) C o v ( D i , Z i ) ITT_{c}=\frac{\mathbb{E}\left[Y_{i} | Z_{i}=1\right]-\mathbb{E}\left[Y_{i} | Z_{i}=0\right]}{\mathbb{E}\left[D_{i} | Z_{i}=1\right]-\mathbb{E}\left[D_{i} | Z_{i}=0\right]}=\frac{Cov\left(Y_{i}, Z_{i}\right)}{Cov\left(D_{i}, Z_{i}\right)} I T T c = E [ D i ∣ Z i = 1 ] − E [ D i ∣ Z i = 0 ] E [ Y i ∣ Z i = 1 ] − E [ Y i ∣ Z i = 0 ] = C o v ( D i , Z i ) C o v ( Y i , Z i )
I T T c ITT _{c} I T T c 在单调性假设和排他性约束下,可解释为依从者的局部平均处理效应(LATE):
I T T c = L A T E = E [ Y i ( 1 ) − Y i ( 0 ) ∣ D i ( 1 ) = 1 , D i ( 0 ) = 0 ] ITT_{c}={LATE}={\mathbb {E}}[Y_{i}(1)-Y_{i}(0) | D_{i}(1)=1,D_{i}(0)=0] I T T c = L A TE = E [ Y i ( 1 ) − Y i ( 0 ) ∣ D i ( 1 ) = 1 , D i ( 0 ) = 0 ]
我们称之为Wald估计量 。
如你所见,Wald 估计量是工具变量(IV)框架中简单场景下计算局部平均处理效应(LATE)的核心方法,特指当存在「一个工具变量(Z)、一个内生变量(D)、一个结果变量(Y)」时,通过「简化式效应与第一阶段效应的比值」得到的因果效应估计量,本质是两阶段最小二乘法(2SLS)在单工具变量场景下的特例。
ITT、LATE与TOT的对比
意向治疗效应(ITT):易于识别(衡量指派处理的平均效应),但无法反映仅针对实际接受处理者的效应。
局部平均处理效应(LATE):在标准假设下,通过IV可识别的明确因果效应。它是一个局部参数,不一定等于ATE(整体平均处理效应)或TOT(处理者平均效应),但通常更易解释和识别(仅针对工具变量诱导的依从者群体)。
处理者平均效应(TOT):试图捕捉实际接受处理者的效应,但识别TOT通常需要工具变量和额外假设。在计算TOT并声称其为特定个体的效应时,实际假设处理组内的参与者是随机的,且未处理者不受溢出效应影响。这些假设更为严格:若存在溢出效应或同伴效应,假设可能不成立。
简单来讲,ITT覆盖的群体最广,包括依从者+总是接受+总不接受。它是无偏的保守估计,因此会低估效应,因为会有总不接受的群体将效应冲淡。LATE通过IV进行无偏的识别,只考虑依从者,因此会丢失掉总是接受群体的效应。TOT是理想的精准目标,因为他包括依从者+总是接受者两个群体,涵盖了受原变量影响的所有群体,但我们无法完全无偏估计,因为IV拆不了具有自选择偏差的总是接受者。
Which statement is NOT TRUE?
(a) LATE is determined by the ratio of reduced form to first-stage estimates.
(b) ITT captures the causal effect of being assigned to treatment.
(c) TOT captures the average causal effect for individuals who actually receive the treatment.
(d) LATE equals ITT multiplying the difference in compliance rates between treatment and control groups.
答案
(d)
解析
工具变量(IV)框架中,核心效应指标的关系及关键定义如下:
(a) 正确:局部平均处理效应(LATE)的核心计算逻辑是「简化式效应(Reduced Form)与第一阶段效应(First Stage)的比值」,即通过工具变量诱导的结果差异除以工具变量对内生变量的影响差异,剥离内生性偏差。
(b) 正确:意向性治疗效应(ITT)聚焦「分组分配本身」的因果效应,无论研究对象是否实际接受处理(如是否使用分配的住房券、是否就读中奖的特许学校),仅反映“被分配到处理组”与“被分配到对照组”的结果差异,是无偏的保守估计。
(c) 正确:处理组平均处理效应(TOT)针对「实际接受处理的群体」,衡量该群体从处理中获得的平均收益(需通过IV矫正自选择偏差,否则OLS估计会失真)。
(d) 错误:核心公式为:
L A T E = R e d u c e d F o r m F i r s t S t a g e = I T T P r ( E T = 1 ∣ D = 1 ) − P r ( E T = 1 ∣ D = 0 ) LATE = \frac{Reduced Form}{First Stage} = \frac{ITT}{Pr(ET=1 | D=1) - Pr(ET=1 | D=0)} L A TE = F i rs tSt a g e R e d u ce d F or m = P r ( ET = 1∣ D = 1 ) − P r ( ET = 1∣ D = 0 ) I TT
其中,P r ( E T = 1 ∣ D = 1 ) − P r ( E T = 1 ∣ D = 0 ) Pr(ET=1 | D=1) - Pr(ET=1 | D=0) P r ( ET = 1∣ D = 1 ) − P r ( ET = 1∣ D = 0 ) 表示「处理组依从率与对照组依从率的差异」(即第一阶段效应)。LATE是ITT矫正“不依从稀释效应”后的结果,需用ITT除以依从率差异,而非乘以。
Experienced Teacher and Students’ Academic Performance
Student test scores predict future earnings. Teacher experience is hypothesized to improve test scores.
This section examines whether experienced teachers causally improve students’ standardized test scores (0–100).
Q1
Interpret β ^ 0 = 60 \hat{\beta}_{0}=60 β ^ 0 = 60 and β ^ 1 = 5.0 \hat{\beta}_{1}=5.0 β ^ 1 = 5.0 in the observational regression:
Y i = 60 + 5.0 E T i + ε i Y_{i}=60+5.0 E T_{i}+\varepsilon_{i} Y i = 60 + 5.0 E T i + ε i
(Standard errors for intercept and slope are 20 and 2.5, respectively.)
答案
β ^ 0 = 60 \hat{\beta}_{0}=60 β ^ 0 = 60 :未被经验教师授课(E T i = 0 ET_{i}=0 E T i = 0 )的学生,其标准化考试成绩的预测值为60分(满分100分)。
β ^ 1 = 5.0 \hat{\beta}_{1}=5.0 β ^ 1 = 5.0 :在该观测回归中,被经验教师授课(E T i = 1 ET_{i}=1 E T i = 1 )的学生,平均而言考试成绩比未被经验教师授课的学生高5.0分。
解析
观测回归的系数仅反映“变量关联”而非“因果关系”:
截距项β ^ 0 \hat{\beta}_{0} β ^ 0 对应“解释变量取0时的被解释变量均值预测值”,此处即“无经验教师”组的基准预测成绩;
斜率项β ^ 1 \hat{\beta}_{1} β ^ 1 反映“解释变量每变化1单位,被解释变量的平均变化量”,此处即“经验教师授课”与“非经验教师授课”的成绩均值差,但该差异可能包含自选择偏差(如更优秀的学生更易匹配经验教师),并非严格的因果效应。
Q2
Discuss Alice’s critique about tracking/selection into experienced teachers: Do you agree that β ^ 1 \hat{\beta}_{1} β ^ 1 may not be causal due to tracking/selection?
答案
Yes, β ^ 1 \hat{\beta}_{1} β ^ 1 is likely not a causal effect—tracking/selection leads to omitted-variable bias in OLS estimation.
解析
核心矛盾在于“自选择偏差”(omitted-variable bias):
存在未观测变量(如学生的勤奋程度、家长教育动机、基线能力),这些变量既会提高学生的考试成绩(Y i Y_i Y i ),又会增加学生被经验教师授课的概率(E T i ET_i E T i );
这导致OLS回归的误差项ε i \varepsilon_i ε i 与解释变量E T i ET_i E T i 不满足“均值独立”假设,即E [ ε i ∣ E T i ] ≠ 0 \mathbb{E}[\varepsilon_i | ET_i] \neq 0 E [ ε i ∣ E T i ] = 0 ;
因此,观测回归的斜率项β ^ 1 = 5.0 \hat{\beta}_{1}=5.0 β ^ 1 = 5.0 混淆了“经验教师的真实效应”与“未观测变量的效应”,无法被解读为经验教师对成绩的因果影响。
Q3
Q3(a)
Compute the coefficient on D i D_{i} D i from the first-stage regression of E T i ET_{i} E T i on D i D_{i} D i .
答案
π ^ 1 = 0.75 \hat{\pi}_1 = 0.75 π ^ 1 = 0.75
解析
第一阶段回归的核心是估计“工具变量D i D_i D i 对内生变量E T i ET_i E T i 的影响”,系数计算公式为:
π ^ 1 = E [ E T i ∣ D i = 1 ] − E [ E T i ∣ D i = 0 ] \hat{\pi}_1 = \mathbb{E}[ET_i | D_i=1] - \mathbb{E}[ET_i | D_i=0] π ^ 1 = E [ E T i ∣ D i = 1 ] − E [ E T i ∣ D i = 0 ]
从Table 3提取数据:E [ E T i ∣ D i = 1 ] = 1 \mathbb{E}[ET_i | D_i=1] = 1 E [ E T i ∣ D i = 1 ] = 1 (所有处理组学生均选择经验教师),E [ E T i ∣ D i = 0 ] = 0.25 \mathbb{E}[ET_i | D_i=0] = 0.25 E [ E T i ∣ D i = 0 ] = 0.25 (对照组仅25%学生获得经验教师授课);
代入计算:π ^ 1 = 1 − 0.25 = 0.75 \hat{\pi}_1 = 1 - 0.25 = 0.75 π ^ 1 = 1 − 0.25 = 0.75 ,即处理组比对照组的经验教师授课概率高75个百分点。
Q3(b)
Compute the coefficient on D i D_{i} D i from the reduced-form regression of Y i Y_{i} Y i on D i D_{i} D i .
答案
ρ ^ 1 = 12.5 \hat{\rho}_1 = 12.5 ρ ^ 1 = 12.5
解析
简化式回归的核心是估计“工具变量D i D_i D i 对结果变量Y i Y_i Y i 的直接影响”(即ITT效应),系数计算公式为:
ρ ^ 1 = E [ Y i ∣ D i = 1 ] − E [ Y i ∣ D i = 0 ] \hat{\rho}_1 = \mathbb{E}[Y_i | D_i=1] - \mathbb{E}[Y_i | D_i=0] ρ ^ 1 = E [ Y i ∣ D i = 1 ] − E [ Y i ∣ D i = 0 ]
从Table 3提取数据:E [ Y i ∣ D i = 1 ] = 86.25 \mathbb{E}[Y_i | D_i=1] = 86.25 E [ Y i ∣ D i = 1 ] = 86.25 (处理组观测成绩均值),E [ Y i ∣ D i = 0 ] = 73.75 \mathbb{E}[Y_i | D_i=0] = 73.75 E [ Y i ∣ D i = 0 ] = 73.75 (对照组观测成绩均值);
代入计算:ρ ^ 1 = 86.25 − 73.75 = 12.5 \hat{\rho}_1 = 86.25 - 73.75 = 12.5 ρ ^ 1 = 86.25 − 73.75 = 12.5 ,即处理组比对照组的观测成绩平均高12.5分。
Q3(c)
Compute the Wald estimator for the impact of E T i ET_{i} E T i on Y i Y_{i} Y i using Q3(a) and Q3(b).
答案
L A T E ^ W a l d ≈ 16.67 \hat{LATE}_{Wald} \approx 16.67 L A TE ^ Wa l d ≈ 16.67
解析
Wald估计量是IV框架中LATE的核心计算方法,逻辑为“简化式效应/第一阶段效应”,公式为:
L A T E ^ W a l d = ρ ^ 1 π ^ 1 \hat{LATE}_{Wald} = \frac{\hat{\rho}_1}{\hat{\pi}_1} L A TE ^ Wa l d = π ^ 1 ρ ^ 1
代入Q3(a)和Q3(b)的结果:ρ ^ 1 = 12.5 \hat{\rho}_1=12.5 ρ ^ 1 = 12.5 ,π ^ 1 = 0.75 \hat{\pi}_1=0.75 π ^ 1 = 0.75 ;
计算得:L A T E ^ W a l d = 12.5 0.75 ≈ 16.67 \hat{LATE}_{Wald} = \frac{12.5}{0.75} \approx 16.67 L A TE ^ Wa l d = 0.75 12.5 ≈ 16.67 ,即通过工具变量D i D_i D i 识别的“依从者”群体中,经验教师授课对成绩的平均效应约为16.67分。
Q4
Directly compute L A T E = E [ Y 1 i − Y 0 i ∣ Compliers ] LATE = \mathbb{E}[Y_{1i} - Y_{0i} | \text{Compliers}] L A TE = E [ Y 1 i − Y 0 i ∣ Compliers ] using potential outcomes.
答案
L A T E = 17.5 LATE = 17.5 L A TE = 17.5
解析
依从者的核心特征:E T i ( D = 1 ) = 1 ET_i(D=1)=1 E T i ( D = 1 ) = 1 (处理组时选择经验教师)且E T i ( D = 0 ) = 0 ET_i(D=0)=0 E T i ( D = 0 ) = 0 (对照组时无法获得经验教师)。
从Table 3筛选出依从者ID:{ 1 , 2 , 4 , 6 , 7 , 8 } \{1,2,4,6,7,8\} { 1 , 2 , 4 , 6 , 7 , 8 } (共6人)。
L A T E = 1 6 ∑ i ∈ { 1 , 2 , 4 , 6 , 7 , 8 } ( Y 1 i − Y 0 i ) = 10 + 20 + 20 + 20 + 15 + 20 6 = 105 6 = 17.5 LATE = \frac{1}{6} \sum_{i \in \{1,2,4,6,7,8\}} (Y_{1i} - Y_{0i}) = \frac{10 + 20 + 20 + 20 + 15 + 20}{6} = \frac{105}{6} = 17.5 L A TE = 6 1 i ∈ { 1 , 2 , 4 , 6 , 7 , 8 } ∑ ( Y 1 i − Y 0 i ) = 6 10 + 20 + 20 + 20 + 15 + 20 = 6 105 = 17.5
Q5
Explain why the Wald estimator from Q3 and the LATE in Q4 are different.
答案
The discrepancy arises from finite-sample bias (small sample imbalance in compliance types).
解析
在LATE框架中,满足IV四大假设(独立性、排他性、单调性、非零第一阶段)时,Wald估计量在大样本下会收敛到真实LATE ,但本案例中N = 8 N=8 N = 8 (极小样本),导致实际估计偏差:
样本分配与依从类型失衡:对照组中存在“总是就读者”(Always-taker,如ID=3,E T i ( D = 0 ) = 1 ET_i(D=0)=1 E T i ( D = 0 ) = 1 ),而处理组无“从不就读者”(Never-taker),打破了样本层面的依从类型分布均衡;
简化式与第一阶段的样本差异未完全匹配依从者群体:E [ Y ∣ D = 1 ] − E [ Y ∣ D = 0 ] \mathbb{E}[Y|D=1] - \mathbb{E}[Y|D=0] E [ Y ∣ D = 1 ] − E [ Y ∣ D = 0 ] (12.5)和E [ E T ∣ D = 1 ] − E [ E T ∣ D = 0 ] \mathbb{E}[ET|D=1] - \mathbb{E}[ET|D=0] E [ ET ∣ D = 1 ] − E [ ET ∣ D = 0 ] (0.75)包含了非依从者的干扰(如对照组中总是就读者的成绩),而非纯粹的依从者效应;
最终导致Wald估计量(16.67)与基于潜在结果的真实LATE(17.5)存在微小差异,这一偏差在大样本中会自然消失。
Industrial Air Pollution and Childhood Asthma
Childhood asthma is a growing concern. Estimating the causal impact of pollution is challenging because pollution may correlate with other local characteristics. An IV approach uses coal-fired power plant presence as an instrument for local SO2 concentration.
asthma:儿童哮喘住院率(每千人入院数)
so2:SO2浓度
plant:燃煤电厂存在虚拟变量
income:人均收入(USD)
unemp:失业率(%)
Q1
If IV is consistent for the true causal effect, why could OLS be much smaller in magnitude?
答案
OLS系数存在负向遗漏变量偏差 (negative omitted-variable bias),导致其绝对值小于真实因果效应。
解析
SO2浓度升高会增加儿童哮喘住院率(真实效应为正)。我们会遗漏关键变量:污染缓解行为(mitigation behavior),包括使用空气净化器、佩戴口罩、减少户外活动、地方防控措施等。
污染越严重的地区,居民的缓解行为越强,so2与缓解行为正相关);
缓解行为会降低哮喘住院率(缓解行为与asthma负相关);
这导致OLS回归的误差项u u u 包含缓解行为的影响,且满足C o v ( s o 2 c t , u c t ) < 0 Cov(so2_{ct}, u_{ct}) < 0 C o v ( so 2 c t , u c t ) < 0 ;
负向遗漏变量偏差会“稀释”SO2对哮喘的正向效应,最终使OLS系数(0.062)小于IV估计的真实因果效应(0.185)。
Q2
State the two key IV assumptions for using p l a n t c t plant_{ct} pl an t c t as an instrument for s o 2 c t so2_{ct} so 2 c t . Which can be partially assessed using Table 4?
答案
两个关键IV假设:相关性假设(Relevance)、排他性假设(Exclusion Restriction);
可通过Table 4部分验证的假设:相关性假设。
解析
两个核心IV假设的具体内容:
相关性假设:工具变量p l a n t c t plant_{ct} pl an t c t 能显著预测内生变量s o 2 c t so2_{ct} so 2 c t (即第一阶段效应非零),数学表达为C o v ( p l a n t c t , s o 2 c t ) ≠ 0 Cov(plant_{ct}, so2_{ct}) \neq 0 C o v ( pl an t c t , so 2 c t ) = 0 ;
排他性假设:工具变量p l a n t c t plant_{ct} pl an t c t 仅通过内生变量s o 2 c t so2_{ct} so 2 c t 影响结果变量a s t h m a c t asthma_{ct} a s t hm a c t ,与哮喘的未观测决定因素无关,数学表达为C o v ( p l a n t c t , u c t ) = 0 Cov(plant_{ct}, u_{ct}) = 0 C o v ( pl an t c t , u c t ) = 0 。
Table 4对假设的验证:
相关性假设:Table 4第一阶段结果显示,p l a n t c t plant_{ct} pl an t c t 对s o 2 c t so2_{ct} so 2 c t 的回归系数为5.240,且在1%水平上显著(p < 0.01 p<0.01 p < 0.01 ),说明电厂存在与S O 2 SO_2 S O 2 浓度强相关,直接验证了相关性假设;
排他性假设:无法通过Table 4直接检验,需依赖理论论证(如“电厂存在仅通过污染影响哮喘,与其他因素无关”),数据无法直接证明无其他影响路径。
Q4
Why might an “upwind plant” dummy be a better instrument for local S O 2 SO_2 S O 2 than within-county plant presence?
答案
“上风向电厂”(U p w i n d P l a n t c t UpwindPlant_{ct} U pw in d Pl an t c t )在相关性 和排他性假设合理性 两方面更具优势,能提升IV估计的可信度。
解析
其优势具体如下:
县内电厂的污染可能被本地防控措施(如废气处理设备)削弱,对本地SO2浓度的影响不稳定;
县内电厂的建设和运营可能与本地经济政策、产业规划高度相关(如为促进就业引入电厂),这些因素可能直接影响儿童哮喘住院率(如经济发达县医疗资源更好),导致plant与误差项相关,违反排他性;
上风向电厂(尤其位于其他县的上风向电厂)与目标县的经济政策、本地特征关联度更低,更难通过非污染路径影响哮喘住院率,显著降低了与未观测变量相关的风险,使排他性假设更具说服力。