双重差分法(Difference-in-Differences, DiD)

双重差分法(DiD)通过比较处理组和对照组随时间变化的结果差异来识别因果效应,核心是利用“处理前-处理后”的前后对比与“处理组-对照组”的组间对比,剥离处理的净效应。

双重差分法的核心特征

DiD 采用“处理前-处理后”的纵向研究设计,核心逻辑是:通过对比处理组在处理实施前后的结果变化,再减去对照组在同一时期的自然变化,得到处理的纯因果效应。

其核心公式为: ΔY=(YT,post−YT,pre)−(YC,post−YC,pre)\Delta Y = (Y_{T,post} - Y_{T,pre}) - (Y_{C,post} - Y_{C,pre})

各符号含义:

  • YT,postY_{T,post}:处理组在“处理后”时期的结果变量均值;
  • YT,preY_{T,pre}:处理组在“处理前”时期的结果变量均值;
  • YC,postY_{C,post}:对照组在“处理后”时期的结果变量均值;
  • YC,preY_{C,pre}:对照组在“处理前”时期的结果变量均值;
  • ΔY\Delta Y:DiD 估计的处理净效应(即处理对结果的因果效应)。

在其中,C 是 A 未接受任何处理时的反事实趋势。(A0=C0) 假设其遵循对照组的趋势。

C1−B1=C0−B0C1 - B1 = C0 - B0

于是有:

实际效应=(A1−C1)=A1−(C0−B0+B1)实际效应 = (A1 - C1) = A1 - (C0 - B0 + B1)

=A1−B1−(C0−B0)= A1 - B1 - (C0 - B0)

=(A1−B1)−(A0−B0)= (A1 - B1) - (A0 - B0)

双重差分法的优势与局限性

核心优势

  • 应用灵活:无需依赖明确的处理分配临界值,适用于各类纵向数据(如面板数据)场景;
  • 控制时间不变混淆变量:通过“组间差分”和“时间差分”,自动剥离不随时间变化的混淆变量(如个体天生特征、地区固定环境)的影响,无需额外手动控制。

主要局限性

  • 依赖强假设:平行趋势假设无法通过数据直接验证,仅能通过处理前的趋势拟合间接佐证,若假设不成立(如两组处理前趋势已分歧),估计结果会存在严重偏差;
  • 易受时变混淆变量干扰:若存在随时间变化且同时影响处理分配和结果的变量(如政策实施期间的宏观经济冲击),且未纳入模型控制,会导致估计偏差。

One Mississippi, Two Mississippi

研究问题

大萧条时期,货币政策是否能缓解银行倒闭、稳定金融体系?具体聚焦密西西比州内两个联邦储备区的放贷政策差异,评估宽松货币政策对银行存续数量的因果效应。

DID核心要素界定

DID要素案例具体对应说明
处理组(TREAT)第六联邦储备区(由亚特兰大联储管辖)干预措施: Caldwell银行倒闭后4周内,放贷规模增加约40%(宽松货币政策)
对照组(Control)第八联邦储备区(由圣路易斯联储管辖)干预措施:同期放贷规模下降近10%(紧缩/消极货币政策)
干预时点(POST)1930-1931年1930年为政策实施前(Pre),1931年为政策实施后(Post)
结果变量(Y)各联邦储备区内运营的银行数量核心观测指标:通过银行数量变化反映政策对金融稳定的影响

DID核心逻辑与案例计算过程

DID的核心原理

DID通过“两次差分”剥离处理效应(政策真实影响),剔除组间固有差异和时间共同趋势,公式为: δDD=(处理组Post−处理组Pre)−(对照组Post−对照组Pre)\delta_{DD} = (处理组Post - 处理组Pre)-(对照组Post - 对照组Pre) 其中,δDD\delta_{DD} 即为净因果效应,核心依赖“平行趋势假设”——无政策干预时,处理组与对照组的结果变量趋势一致。

案例中DID效应的数值计算

基础数据提取

  • 处理组(第六区):1930年银行数量 Y6,1930=135Y_{6,1930}=135,1931年 Y6,1931=121Y_{6,1931}=121
  • 对照组(第八区):1930年银行数量 Y8,1930=165Y_{8,1930}=165,1931年 Y8,1931=132Y_{8,1931}=132

分步计算过程

  1. 计算处理组前后差异(政策实施对第六区的直接变化): Y6,1931−Y6,1930=121−135=−14Y_{6,1931} - Y_{6,1930} = 121 - 135 = -14(银行数量减少14家)
  2. 计算对照组前后差异(同期无宽松政策的自然变化): Y8,1931−Y8,1930=132−165=−33Y_{8,1931} - Y_{8,1930} = 132 - 165 = -33(银行数量减少33家)
  3. 计算DID净效应(政策的真实因果影响): δDD=(−14)−(−33)=19\delta_{DD} = (-14) - (-33) = 19

结果解读

宽松货币政策使第六区的银行数量多存续19家,验证了“扩张性货币政策能缓解银行倒闭、稳定金融体系”的核心结论。

平行趋势假设的验证与重要性

假设内涵

DID有效性的核心前提:无政策干预时,处理组(第六区)与对照组(第八区)的银行数量变化趋势一致。若趋势不同,DID效应会混杂其他因素(如区域经济基础差异),导致偏误。

案例中的验证方式

  • 数据支撑:1929-1930年(政策实施前),两组银行数量的时间趋势高度重合(文档图表显示),无显著差异;
  • 逻辑支撑:政策实施前,两区域均受大萧条初期影响,联储政策无差异,经济结构、银行体系特征相似,满足“无干预时趋势一致”的前提。

回归模型构建与系数解读

案例中的DID基础回归方程

Ydt=167−29(8.8)TREATd−49(7.6)POSTt+20.5(10.7)(TREATd×POSTt)+edtY_{dt}=167 - \underset{(8.8)}{29} TREAT_d - \underset{(7.6)}{49} POST_t + \underset{(10.7)}{20.5} (TREAT_d × POST_t) + e_{dt}

变量与系数解读

变量含义系数解读
YdtY_{dt}区域d在时间t的银行数量-
TREATdTREAT_d区域是否为处理组(第六区=1,第八区=0)系数-29:政策实施前,处理组银行数量比对照组少29家(组间固定差异)
POSTtPOST_t是否为政策后时期(1931年=1,1930年=0)系数-49:无政策干预时,两组银行数量在1931年比1930年平均减少49家(时间共同趋势)
TREATd×POSTtTREAT_d × POST_t处理组×政策后交互项系数20.5(与数值计算的19接近,差异源于回归控制误差):DID净效应,即宽松政策使处理组银行数量多存续约20家
edte_{dt}随机误差项未观测到的偶然因素

图表逻辑与DID效应的可视化

  • 实线(实际数据):第六区1931年银行数量为121,第八区为132;
  • 虚线(反事实):若第六区无宽松政策,银行数量会沿第八区趋势下降至约102(135-33=102);
  • 可视化效应:实际值(121)与反事实值(102)的差值(19),即DID净效应,与数值计算、回归结果一致。

案例中DID方法的优势与适配性

  1. 控制组间固定差异:通过TREATdTREAT_d系数剔除“第六区银行数量天然少于第八区”的固有差异,避免将组间初始差距误判为政策效应;
  2. 剥离时间共同趋势:通过POSTtPOST_t系数剔除“大萧条导致全行业银行倒闭增加”的共性影响,聚焦政策的独特作用;
  3. 利用自然实验外生性:两区域的政策差异源于联储管辖范围划分,非人为选择,保证了处理变量的外生性,减少内生性偏误。

事件研究法与交错双重差分法

“事件研究法”用于分析处理随时间变化的动态效应,尤其适用于处理为“交错实施”的场景。

由于交错双重差分(DID)存在负权重问题(Goodman-Bacon等学者指出,两向固定效应DID是2X2 DID的加权平均,已处理单元作控制组时会产生负权重),且2010-2012年AER发表的实证论文中约1/5的DID应用存在问题,事件研究(Event Study)与动态DID近年成为重要替代方法。

事件研究法的核心特征

事件研究法通过对比不同群体在处理前和处理后的结果,追踪处理的动态效应。事件研究法的方程形式如下:

Yit=α+∑k=−K,k≠−1Kδk⋅Ditk+ui+ηt+ϵitY_{it} = \alpha + \sum_{k=-K, k \neq -1}^{K} \delta_{k} \cdot D_{it}^{k} + u_{i} + \eta_{t} + \epsilon_{it} 其中,DitkD_{it}^{k} 是一组与事件发生时间t相关的时期指示变量,δk\delta_{k} 衡量事件发生后第k个时点的处理效应。

7.2 事件研究法的必要假设

  • 平行趋势假设(Parallel Trends Assumption):与DiD类似,该假设要求在不存在处理的情况下,处理组和对照组的结果会遵循相同的变化轨迹。
  • 无处理预期假设(No Anticipation of Treatment):个体不应在预期到处理会发生的情况下改变自身行为(即不存在预期效应)。

7.3 事件研究法的优势与局限性

优势

  • 能够探索处理随时间变化的动态效应。
  • 特别适用于处理在不同个体或群体间交错实施的场景。

局限性

  • 需要多个处理前和处理后时期才能检测到效应。
  • 若处理前的趋势不平行,仍可能因违反平行趋势假设而产生偏差。

交错双重差分(DID)的固有缺陷

  • Goodman-Bacon(2021, Journal of Econometrics)、De Chaisemartin & d'Haultfoeuille(2018, RES; 2020, AER)等指出,两向固定效应DID估计量是所有2X2 DID估计量的加权平均,当“已接受处理的单元”被用作控制组时,其处理效应随时间的变化会被扣除,产生负权重,导致结果严重偏差。
  • 2010-2012年《美国经济评论》(AER)发表的实证论文中,约1/5使用DID方法,但多数存在应用错误;同时,新的DID改进方法尚未被学界广泛接受,事件研究(Event Study)与动态DID成为重要替代方案。

事件研究的核心优势

  • 规避负权重偏差:不将“已处理单元”作为控制组,直接分析处理组在事件前后的动态变化(或处理组与未处理控制组的差异),从根源消除负权重问题。
  • 动态效应可视化:通过纳入事件时间虚拟变量(如t=-4至t=4),可直观展示处理效应的时间异质性(如事前趋势、事件后短期/长期效应),而交错DID难以区分这一特征。
  • 拓展性强:即使缺乏面板数据,拟事件研究可通过横截面数据匹配构建伪面板,突破数据限制。

事件研究与动态DID的基础框架

核心定义与区别

类型控制组存在性分析重点适用场景
普通事件研究无明确控制组处理组自身在事件前后的变化单一政策对同一群体的影响(如全国性生育政策)
动态DID有1个/多个控制组处理组与控制组在事件前后的差异政策仅在部分地区实施(如部分城市养老金调整)
共性-依赖“事件断点”处的显著变化-

开展的前提条件

  1. 明确事件时点:准确定义事件(如政策实施月、首孩出生年)的具体时间(通常设为t=0),确保所有样本的事件时间界定一致(如中国养老金研究需明确各城市的调整月份)。
  2. 合理选择研究窗口:主观确定事件前后的分析时期(如t=-4至t=4),窗口越大虽可观测长期效应,但样本选择偏差越严重(如样本流失),需根据研究问题平衡窗口长度与样本质量。
  3. 平衡/准平衡样本:确保个体、企业或家庭在研究窗口内的观测值完整,避免因样本attrition导致的偏差;若样本不平衡,需在“重采样构建平衡样本”(损失样本)与“重新编码事件时间”(降低准确性)之间权衡。
  4. 控制变量与固定效应:纳入适当控制变量(如年龄、教育、城市特征)及固定效应(个体固定效应、时间固定效应),避免遗漏变量偏差,同时需规避多重共线性(如事件时间虚拟变量与年份固定效应重叠)。

回归模型示例

生育惩罚案例,Kleven 2019

Yit=α′DitEvent+β′DitAge+γ′DitYear+νitY_{i t}=\alpha' D_{i t}^{Event }+\beta' D_{i t}^{Age }+\gamma' D_{i t}^{Year }+\nu_{it }

  • DitEventD_{i t}^{Event }:事件时间虚拟变量向量(如t=−5t=-5至t=20t=20),基准期为t=−1t=-1(首孩出生前1年);
  • α′\alpha':各事件时点的处理效应(如生育对收入的影响系数);
  • 控制变量:年龄趋势(DitAgeD_{i t}^{Age })、年份固定效应(DitYearD_{i t}^{Year })。

动态DID(中国养老金)

yc,i,e,t=∑τ≠−2uτ+δi,e+δc,m+εc,i,e,ty_{c,i,e,t}=\sum _{\tau \neq -2}u_{\tau }+\delta _{i,e}+\delta _{c,m}+\varepsilon _{c,i,e,t}

  • uτu_{\tau }:相对养老金调整时间的虚拟变量(如τ=−4\tau=-4至τ=3\tau=3),基准期为τ=−2\tau=-2(调整前2个月);
  • δi,e\delta _{i,e}:家庭-事件固定效应,δc,m\delta _{c,m}:城市-月份固定效应;
  • 核心逻辑:通过交互项隐含区分处理组(60岁+家庭)与控制组(26-49岁家庭)的差异。

拟事件研究(Pseudo-event Study)的设计与验证

横截面数据构建伪面板

当缺乏面板数据时,将“处理单元”(如已生育父母,事件时间t≥0)与“非处理单元”(如未生育人群,无实际事件时间t<0)匹配年龄、调查年份、个体特征(性别、婚姻状况、教育、种族、所在州),为非处理单元赋予“伪事件时间”(如t=-s,s为匹配的年份差),模拟事件时间序列。

数据来源与验证结果

数据来源

数据类型具体数据时间范围样本量用途
横截面数据Current Population Survey(CPS)1968-2020520万户拟事件研究核心数据
横截面数据American Community Survey(ACS)2000-2019219万户拟事件研究补充数据
面板数据Panel Study of Income Dynamics(PSID)1969-20178073户验证拟事件研究结果
面板数据National Longitudinal Survey of Youth(NLSY)1979-20168770户验证拟事件研究结果

结果验证

  • 核心结论:横截面数据(CPS/ACS)估算的女性“生育惩罚”为31%,面板数据(PSID/NLSY)估算为34%,二者差异极小,证明拟事件研究的可靠性,为缺乏面板数据的场景提供方法支撑。

典型应用案例分析

案例:生育惩罚的事件研究(Kleven, Landais & Søgaard, 2019)

研究问题:生育对男性与女性劳动力市场结果的因果影响(“生育惩罚”)

关键结果

  • 女性:首孩出生(t=0)后收入显著下降,存在长期“生育惩罚”,t=20时收入仍未恢复至t=-1水平;
  • 男性:收入与就业率无显著负效应,甚至因家庭责任增加略有上升;
  • 图形特征:事件时间系数图显示,女性收入在t=0后显著向下偏离男性,事前(t<0)趋势平行,证明外生性。

案例:中国养老金增长对家庭消费的影响

研究问题:养老金永久/临时增长对家庭消费的边际消费倾向(MPC)影响

数据特征

  • 时间范围:2004-2016年(共9年);
  • 样本规模:3000户有养老金家庭,覆盖50+地级市,200+次养老金调整事件;
  • 变量:家庭月度收入(养老金、其他收入)、月度消费(分类支出)。

核心结果(MPC估算)

冲击类型收入效应(系数***)消费效应(系数***)边际消费倾向(MPC)标准误(SE)
临时养老金冲击144.414.80.10收入SE=27.0,消费SE=21.9
永久养老金冲击136.476.90.56***收入SE=21.5,消费SE=32.7
  • 补充发现:60岁以上家庭(养老金主要获得者)的消费反应显著大于26-49岁家庭;养老金收入对消费的拉动作用远高于其他收入类型。

中国生育代价的经济学分析(劳动供给与家户收支视角)

研究背景:中国生育率持续低迷(20世纪70年代后低位,放松政策后未回升),核心解释变量为“生育代价”。

数据来源

数据名称时间范围核心用途
人口普查/抽样调查2000,2005,2010,2015分析生育代价的时间趋势
中国城市家户调查(UHS)1994-2009家户劳动供给与收入分析
中国家户追踪调查(CFPS)2010-2020事件研究与拟事件研究验证

核心发现

生育对劳动供给的影响(分群体对比)
群体维度男性生育后8年平均效应(***)女性生育后8年平均效应(***)女性事前均值女性样本量标准误(SE)
农村户口0.0314-0.1200.828185,998男性SE=0.00329,女性SE=0.00977
城镇户口0.0849-0.09550.714125,240男性SE=0.00500,女性SE=0.00652
2000-2005年0.0571-0.09520.71490,410男性SE=0.00487,女性SE=0.00865
2010-2015年0.0399-0.1940.82863,492男性SE=0.00475,女性SE=0.00830
汉族0.0522-0.1260.778278,680男性SE=0.00406,女性SE=0.00661
少数民族0.0384-0.06660.82432,558男性SE=0.00707,女性SE=0.0125
  • 关键结论:女性生育后就业率显著下降,且2010-2015年的生育惩罚(-0.194*)是2000-2005年(-0.0952***)的2倍以上**;城镇女性、汉族女性的生育惩罚更严重,男性则无负效应。
生育代价对生育率下降的解释
  • 整体解释力:生育惩罚的加重可解释47%的中国生育率下降(回归方程:Y=-0.54X-0.09,R²=0.30)。
  • 分年龄组解释力:
    • 21-25岁女性:75%的生育率下降由生育惩罚解释(Y=-0.35X-0.01,R²=0.20);
    • 26-30岁女性:46%的生育率下降由生育惩罚解释(Y=-0.52X-0.09,R²=0.29);
    • 31-35岁女性:48%的生育率下降由生育惩罚解释(Y=-0.60X-0.09,R²=0.20);
    • 36-40岁女性:40%的生育率下降由生育惩罚解释(Y=-0.70X-0.16,R²=0.18)。
生育对家户收支的影响
  • 收入:家庭工资性收入因女性劳动供给减少而下降,非劳动收入(如转移支付、养老金)无显著补偿作用;
  • 消费:基础消费(衣食)小幅下降,教育消费(尤其是早教)显著上升;
  • 储蓄率:生育后储蓄率显著下降(F统计量=5.963,p<0.001),反映生育的经济压力;
  • 拟事件验证:CFPS数据中,事件研究与拟事件研究对女性就业率的估计一致(生育后1年下降0.169-0.500),证明方法可靠性。

开展事件研究的关键注意事项

  1. 窗口选择的权衡:窗口越大,长期效应越完整,但样本流失导致的偏差越严重;例如养老金研究选择“调整前4个月至调整后3个月”,平衡短期效应与样本质量。
  2. 控制变量的设定:需避免多重共线性(如事件时间虚拟变量与年份固定效应重叠),控制变量需贴合研究问题(如生育研究控制年龄,养老金研究控制城市特征)。
  3. 外生性与事前趋势检验:需确保事件外生性(如养老金调整时间对家庭随机),同时检验事前趋势(事件前处理组与控制组趋势是否平行),若事前趋势显著,需调整模型或重新选择控制组。
  4. 短面板的处理:若事前/事后时期过短(如仅1期事前数据),可选择“重采样构建平衡样本”或“重新编码事件时间”,但需在样本量与准确性间权衡。

总结

  • 事件研究与拟事件研究是交错DID的有效替代,可解决负权重偏差,且拟事件研究突破了面板数据限制,适用场景更广。
  • 事件研究的核心价值在于“动态效应可视化”,可清晰识别处理效应的时间异质性,为因果识别提供更丰富的证据。

关键问题与答案

交错双重差分(DID)的核心缺陷是什么?事件研究为何能规避这一缺陷,成为其重要替代方法?

答案:

交错DID的核心缺陷是负权重偏差,事件研究通过优化控制组选择与分析逻辑规避该问题,具体如下:

  1. 交错DID的负权重偏差:根据Goodman-Bacon(2021)等学者的研究,两向固定效应DID估计量是所有可能2X2 DID估计量的加权平均,当“已接受处理的单元”被误用作控制组时,其处理效应随时间的变化会被从整体估计中扣除,产生负权重,导致估计结果偏离真实因果效应;此外,2010-2012年AER发表的实证论文中,约1/5使用DID方法但存在应用错误,且新的DID改进方法尚未广泛接受。
  2. 事件研究的规避逻辑:
    • 控制组优化:事件研究(含动态DID)仅将“未接受处理的单元”作为控制组,绝不使用“已处理单元”,从根本上消除负权重产生的土壤;
    • 动态效应直接估计:事件研究通过纳入事件时间虚拟变量(如t=-4至t=4),直接估计各时点的处理效应,无需通过2X2 DID加权平均,避免权重偏差;
    • 适用场景广:即使缺乏面板数据,拟事件研究可通过横截面数据匹配构建伪面板,进一步拓展应用范围,成为交错DID的可靠替代。

开展一项规范的事件研究需满足哪些前提条件?动态DID与普通事件研究的核心区别是什么?

答案:

一、规范事件研究的前提条件

  1. 明确事件时点:需准确定义事件(如政策实施、首孩出生、养老金调整)的具体时间(通常设为t=0),确保所有样本的事件时间界定一致(如中国养老金研究需明确各城市的调整月份,避免时点混淆)。
  2. 合理选择研究窗口:确定事件前后的分析时期(如t=-4至t=4),需权衡“窗口长度”与“样本质量”——窗口越大虽可观测长期效应,但样本选择偏差越严重(如样本流失),需根据研究问题确定合理窗口(如短期政策效应选择t=-2至t=2)。
  3. 平衡/准平衡样本:确保个体、企业或家庭在研究窗口内的观测值完整,避免因样本attrition导致的偏差;若样本不平衡,需在“重采样构建平衡样本”(损失样本)与“重新编码事件时间”(降低准确性)之间权衡。
  4. 控制变量与固定效应:纳入适当控制变量(如年龄、教育、城市特征)及固定效应(个体固定效应、时间固定效应),避免遗漏变量偏差,同时需规避多重共线性(如事件时间虚拟变量与年份固定效应重叠)。

二、动态DID与普通事件研究的核心区别

二者的关键差异在于控制组存在性及分析逻辑,具体对比如下:

对比维度普通事件研究动态DID
控制组要求无明确控制组,可仅分析处理组自身必须包含1个/多个“未处理控制组”
分析逻辑关注“处理组自身的前后变化”(如女性生育前后收入差异)关注“处理组与控制组的差异变化”(如60岁+家庭与26-49岁家庭在养老金调整后的消费差异)
回归核心仅纳入事件时间虚拟变量+控制变量必须纳入“处理组虚拟变量×事件时间虚拟变量”交互项,区分组间差异
适用场景单一事件对同一群体的影响(如全国性生育政策)事件仅在部分群体/地区实施(如部分城市先行调整养老金)

RCT、IV、RD、DiD与事件研究法的对比

  • RCT:因果推断最可靠的方法,需满足随机分配假设,假设更简洁直接。
  • IV:适用于解决内生性问题,但需要找到有效工具变量,这往往具有挑战性。
  • RD:提供局部因果效应估计,但依赖连续性假设和无操纵假设;估计结果仅针对临界值附近的个体。
  • DiD:适用于纵向数据,但依赖平行趋势假设,该假设难以验证。
  • 事件研究法:能够分析动态处理效应,尤其适用于交错处理场景;依赖平行趋势假设和充足的处理前数据。

总结

总之,方法的选择取决于研究设计以及对数据所能做出的假设。每种方法都有其优势和局限性:

  • RCT是最稳健的方法,但可能不总是可行或符合伦理;
  • IV是解决内生性问题的理想选择,但需要有效工具变量;
  • RD适用于存在明确临界值的场景,能提供局部因果效应估计;
  • DiD对纵向数据具有灵活性,但需要较强的平行趋势假设;
  • 事件研究法在交错处理场景下分析动态处理效应效果显著,但依赖平行趋势假设和充足的处理前数据。

在选择因果推断的最适方法时,必须仔细考虑假设条件、可用数据和研究背景。

GOOD LUCK!