双重差分法(Difference-in-Differences, DiD)
双重差分法(DiD)通过比较处理组和对照组随时间变化的结果差异来识别因果效应,核心是利用“处理前-处理后”的前后对比与“处理组-对照组”的组间对比,剥离处理的净效应。
双重差分法的核心特征
DiD 采用“处理前-处理后”的纵向研究设计,核心逻辑是:通过对比处理组在处理实施前后的结果变化,再减去对照组在同一时期的自然变化,得到处理的纯因果效应。
其核心公式为:
各符号含义:
- :处理组在“处理后”时期的结果变量均值;
- :处理组在“处理前”时期的结果变量均值;
- :对照组在“处理后”时期的结果变量均值;
- :对照组在“处理前”时期的结果变量均值;
- :DiD 估计的处理净效应(即处理对结果的因果效应)。
在其中,C 是 A 未接受任何处理时的反事实趋势。(A0=C0) 假设其遵循对照组的趋势。
于是有:
双重差分法的优势与局限性
核心优势
- 应用灵活:无需依赖明确的处理分配临界值,适用于各类纵向数据(如面板数据)场景;
- 控制时间不变混淆变量:通过“组间差分”和“时间差分”,自动剥离不随时间变化的混淆变量(如个体天生特征、地区固定环境)的影响,无需额外手动控制。
主要局限性
- 依赖强假设:平行趋势假设无法通过数据直接验证,仅能通过处理前的趋势拟合间接佐证,若假设不成立(如两组处理前趋势已分歧),估计结果会存在严重偏差;
- 易受时变混淆变量干扰:若存在随时间变化且同时影响处理分配和结果的变量(如政策实施期间的宏观经济冲击),且未纳入模型控制,会导致估计偏差。
One Mississippi, Two Mississippi
研究问题
大萧条时期,货币政策是否能缓解银行倒闭、稳定金融体系?具体聚焦密西西比州内两个联邦储备区的放贷政策差异,评估宽松货币政策对银行存续数量的因果效应。
DID核心要素界定
DID核心逻辑与案例计算过程
DID的核心原理
DID通过“两次差分”剥离处理效应(政策真实影响),剔除组间固有差异和时间共同趋势,公式为: 其中, 即为净因果效应,核心依赖“平行趋势假设”——无政策干预时,处理组与对照组的结果变量趋势一致。
案例中DID效应的数值计算
基础数据提取
- 处理组(第六区):1930年银行数量 ,1931年
- 对照组(第八区):1930年银行数量 ,1931年
分步计算过程
- 计算处理组前后差异(政策实施对第六区的直接变化): (银行数量减少14家)
- 计算对照组前后差异(同期无宽松政策的自然变化): (银行数量减少33家)
- 计算DID净效应(政策的真实因果影响):
结果解读
宽松货币政策使第六区的银行数量多存续19家,验证了“扩张性货币政策能缓解银行倒闭、稳定金融体系”的核心结论。
平行趋势假设的验证与重要性
假设内涵
DID有效性的核心前提:无政策干预时,处理组(第六区)与对照组(第八区)的银行数量变化趋势一致。若趋势不同,DID效应会混杂其他因素(如区域经济基础差异),导致偏误。
案例中的验证方式
- 数据支撑:1929-1930年(政策实施前),两组银行数量的时间趋势高度重合(文档图表显示),无显著差异;
- 逻辑支撑:政策实施前,两区域均受大萧条初期影响,联储政策无差异,经济结构、银行体系特征相似,满足“无干预时趋势一致”的前提。
回归模型构建与系数解读
案例中的DID基础回归方程
变量与系数解读
图表逻辑与DID效应的可视化
- 实线(实际数据):第六区1931年银行数量为121,第八区为132;
- 虚线(反事实):若第六区无宽松政策,银行数量会沿第八区趋势下降至约102(135-33=102);
- 可视化效应:实际值(121)与反事实值(102)的差值(19),即DID净效应,与数值计算、回归结果一致。
案例中DID方法的优势与适配性
- 控制组间固定差异:通过系数剔除“第六区银行数量天然少于第八区”的固有差异,避免将组间初始差距误判为政策效应;
- 剥离时间共同趋势:通过系数剔除“大萧条导致全行业银行倒闭增加”的共性影响,聚焦政策的独特作用;
- 利用自然实验外生性:两区域的政策差异源于联储管辖范围划分,非人为选择,保证了处理变量的外生性,减少内生性偏误。
事件研究法与交错双重差分法
“事件研究法”用于分析处理随时间变化的动态效应,尤其适用于处理为“交错实施”的场景。
由于交错双重差分(DID)存在负权重问题(Goodman-Bacon等学者指出,两向固定效应DID是2X2 DID的加权平均,已处理单元作控制组时会产生负权重),且2010-2012年AER发表的实证论文中约1/5的DID应用存在问题,事件研究(Event Study)与动态DID近年成为重要替代方法。
事件研究法的核心特征
事件研究法通过对比不同群体在处理前和处理后的结果,追踪处理的动态效应。事件研究法的方程形式如下:
其中, 是一组与事件发生时间t相关的时期指示变量, 衡量事件发生后第k个时点的处理效应。
7.2 事件研究法的必要假设
- 平行趋势假设(Parallel Trends Assumption):与DiD类似,该假设要求在不存在处理的情况下,处理组和对照组的结果会遵循相同的变化轨迹。
- 无处理预期假设(No Anticipation of Treatment):个体不应在预期到处理会发生的情况下改变自身行为(即不存在预期效应)。
7.3 事件研究法的优势与局限性
优势
- 能够探索处理随时间变化的动态效应。
- 特别适用于处理在不同个体或群体间交错实施的场景。
局限性
- 需要多个处理前和处理后时期才能检测到效应。
- 若处理前的趋势不平行,仍可能因违反平行趋势假设而产生偏差。
交错双重差分(DID)的固有缺陷
- Goodman-Bacon(2021, Journal of Econometrics)、De Chaisemartin & d'Haultfoeuille(2018, RES; 2020, AER)等指出,两向固定效应DID估计量是所有2X2 DID估计量的加权平均,当“已接受处理的单元”被用作控制组时,其处理效应随时间的变化会被扣除,产生负权重,导致结果严重偏差。
- 2010-2012年《美国经济评论》(AER)发表的实证论文中,约1/5使用DID方法,但多数存在应用错误;同时,新的DID改进方法尚未被学界广泛接受,事件研究(Event Study)与动态DID成为重要替代方案。
事件研究的核心优势
- 规避负权重偏差:不将“已处理单元”作为控制组,直接分析处理组在事件前后的动态变化(或处理组与未处理控制组的差异),从根源消除负权重问题。
- 动态效应可视化:通过纳入事件时间虚拟变量(如t=-4至t=4),可直观展示处理效应的时间异质性(如事前趋势、事件后短期/长期效应),而交错DID难以区分这一特征。
- 拓展性强:即使缺乏面板数据,拟事件研究可通过横截面数据匹配构建伪面板,突破数据限制。
事件研究与动态DID的基础框架
核心定义与区别
开展的前提条件
- 明确事件时点:准确定义事件(如政策实施月、首孩出生年)的具体时间(通常设为t=0),确保所有样本的事件时间界定一致(如中国养老金研究需明确各城市的调整月份)。
- 合理选择研究窗口:主观确定事件前后的分析时期(如t=-4至t=4),窗口越大虽可观测长期效应,但样本选择偏差越严重(如样本流失),需根据研究问题平衡窗口长度与样本质量。
- 平衡/准平衡样本:确保个体、企业或家庭在研究窗口内的观测值完整,避免因样本attrition导致的偏差;若样本不平衡,需在“重采样构建平衡样本”(损失样本)与“重新编码事件时间”(降低准确性)之间权衡。
- 控制变量与固定效应:纳入适当控制变量(如年龄、教育、城市特征)及固定效应(个体固定效应、时间固定效应),避免遗漏变量偏差,同时需规避多重共线性(如事件时间虚拟变量与年份固定效应重叠)。
回归模型示例
生育惩罚案例,Kleven 2019
- :事件时间虚拟变量向量(如至),基准期为(首孩出生前1年);
- :各事件时点的处理效应(如生育对收入的影响系数);
- 控制变量:年龄趋势()、年份固定效应()。
动态DID(中国养老金)
- :相对养老金调整时间的虚拟变量(如至),基准期为(调整前2个月);
- :家庭-事件固定效应,:城市-月份固定效应;
- 核心逻辑:通过交互项隐含区分处理组(60岁+家庭)与控制组(26-49岁家庭)的差异。
拟事件研究(Pseudo-event Study)的设计与验证
横截面数据构建伪面板
当缺乏面板数据时,将“处理单元”(如已生育父母,事件时间t≥0)与“非处理单元”(如未生育人群,无实际事件时间t<0)匹配年龄、调查年份、个体特征(性别、婚姻状况、教育、种族、所在州),为非处理单元赋予“伪事件时间”(如t=-s,s为匹配的年份差),模拟事件时间序列。
数据来源与验证结果
数据来源
结果验证
- 核心结论:横截面数据(CPS/ACS)估算的女性“生育惩罚”为31%,面板数据(PSID/NLSY)估算为34%,二者差异极小,证明拟事件研究的可靠性,为缺乏面板数据的场景提供方法支撑。
典型应用案例分析
案例:生育惩罚的事件研究(Kleven, Landais & Søgaard, 2019)
研究问题:生育对男性与女性劳动力市场结果的因果影响(“生育惩罚”)
关键结果
- 女性:首孩出生(t=0)后收入显著下降,存在长期“生育惩罚”,t=20时收入仍未恢复至t=-1水平;
- 男性:收入与就业率无显著负效应,甚至因家庭责任增加略有上升;
- 图形特征:事件时间系数图显示,女性收入在t=0后显著向下偏离男性,事前(t<0)趋势平行,证明外生性。
案例:中国养老金增长对家庭消费的影响
研究问题:养老金永久/临时增长对家庭消费的边际消费倾向(MPC)影响
数据特征
- 时间范围:2004-2016年(共9年);
- 样本规模:3000户有养老金家庭,覆盖50+地级市,200+次养老金调整事件;
- 变量:家庭月度收入(养老金、其他收入)、月度消费(分类支出)。
核心结果(MPC估算)
- 补充发现:60岁以上家庭(养老金主要获得者)的消费反应显著大于26-49岁家庭;养老金收入对消费的拉动作用远高于其他收入类型。
中国生育代价的经济学分析(劳动供给与家户收支视角)
研究背景:中国生育率持续低迷(20世纪70年代后低位,放松政策后未回升),核心解释变量为“生育代价”。
数据来源
核心发现
生育对劳动供给的影响(分群体对比)
- 关键结论:女性生育后就业率显著下降,且2010-2015年的生育惩罚(-0.194*)是2000-2005年(-0.0952***)的2倍以上**;城镇女性、汉族女性的生育惩罚更严重,男性则无负效应。
生育代价对生育率下降的解释
- 整体解释力:生育惩罚的加重可解释47%的中国生育率下降(回归方程:Y=-0.54X-0.09,R²=0.30)。
- 分年龄组解释力:
- 21-25岁女性:75%的生育率下降由生育惩罚解释(Y=-0.35X-0.01,R²=0.20);
- 26-30岁女性:46%的生育率下降由生育惩罚解释(Y=-0.52X-0.09,R²=0.29);
- 31-35岁女性:48%的生育率下降由生育惩罚解释(Y=-0.60X-0.09,R²=0.20);
- 36-40岁女性:40%的生育率下降由生育惩罚解释(Y=-0.70X-0.16,R²=0.18)。
生育对家户收支的影响
- 收入:家庭工资性收入因女性劳动供给减少而下降,非劳动收入(如转移支付、养老金)无显著补偿作用;
- 消费:基础消费(衣食)小幅下降,教育消费(尤其是早教)显著上升;
- 储蓄率:生育后储蓄率显著下降(F统计量=5.963,p<0.001),反映生育的经济压力;
- 拟事件验证:CFPS数据中,事件研究与拟事件研究对女性就业率的估计一致(生育后1年下降0.169-0.500),证明方法可靠性。
开展事件研究的关键注意事项
- 窗口选择的权衡:窗口越大,长期效应越完整,但样本流失导致的偏差越严重;例如养老金研究选择“调整前4个月至调整后3个月”,平衡短期效应与样本质量。
- 控制变量的设定:需避免多重共线性(如事件时间虚拟变量与年份固定效应重叠),控制变量需贴合研究问题(如生育研究控制年龄,养老金研究控制城市特征)。
- 外生性与事前趋势检验:需确保事件外生性(如养老金调整时间对家庭随机),同时检验事前趋势(事件前处理组与控制组趋势是否平行),若事前趋势显著,需调整模型或重新选择控制组。
- 短面板的处理:若事前/事后时期过短(如仅1期事前数据),可选择“重采样构建平衡样本”或“重新编码事件时间”,但需在样本量与准确性间权衡。
总结
- 事件研究与拟事件研究是交错DID的有效替代,可解决负权重偏差,且拟事件研究突破了面板数据限制,适用场景更广。
- 事件研究的核心价值在于“动态效应可视化”,可清晰识别处理效应的时间异质性,为因果识别提供更丰富的证据。
关键问题与答案
交错双重差分(DID)的核心缺陷是什么?事件研究为何能规避这一缺陷,成为其重要替代方法?
答案:
交错DID的核心缺陷是负权重偏差,事件研究通过优化控制组选择与分析逻辑规避该问题,具体如下:
- 交错DID的负权重偏差:根据Goodman-Bacon(2021)等学者的研究,两向固定效应DID估计量是所有可能2X2 DID估计量的加权平均,当“已接受处理的单元”被误用作控制组时,其处理效应随时间的变化会被从整体估计中扣除,产生负权重,导致估计结果偏离真实因果效应;此外,2010-2012年AER发表的实证论文中,约1/5使用DID方法但存在应用错误,且新的DID改进方法尚未广泛接受。
- 事件研究的规避逻辑:
- 控制组优化:事件研究(含动态DID)仅将“未接受处理的单元”作为控制组,绝不使用“已处理单元”,从根本上消除负权重产生的土壤;
- 动态效应直接估计:事件研究通过纳入事件时间虚拟变量(如t=-4至t=4),直接估计各时点的处理效应,无需通过2X2 DID加权平均,避免权重偏差;
- 适用场景广:即使缺乏面板数据,拟事件研究可通过横截面数据匹配构建伪面板,进一步拓展应用范围,成为交错DID的可靠替代。
开展一项规范的事件研究需满足哪些前提条件?动态DID与普通事件研究的核心区别是什么?
答案:
一、规范事件研究的前提条件
- 明确事件时点:需准确定义事件(如政策实施、首孩出生、养老金调整)的具体时间(通常设为t=0),确保所有样本的事件时间界定一致(如中国养老金研究需明确各城市的调整月份,避免时点混淆)。
- 合理选择研究窗口:确定事件前后的分析时期(如t=-4至t=4),需权衡“窗口长度”与“样本质量”——窗口越大虽可观测长期效应,但样本选择偏差越严重(如样本流失),需根据研究问题确定合理窗口(如短期政策效应选择t=-2至t=2)。
- 平衡/准平衡样本:确保个体、企业或家庭在研究窗口内的观测值完整,避免因样本attrition导致的偏差;若样本不平衡,需在“重采样构建平衡样本”(损失样本)与“重新编码事件时间”(降低准确性)之间权衡。
- 控制变量与固定效应:纳入适当控制变量(如年龄、教育、城市特征)及固定效应(个体固定效应、时间固定效应),避免遗漏变量偏差,同时需规避多重共线性(如事件时间虚拟变量与年份固定效应重叠)。
二、动态DID与普通事件研究的核心区别
二者的关键差异在于控制组存在性及分析逻辑,具体对比如下:
RCT、IV、RD、DiD与事件研究法的对比
- RCT:因果推断最可靠的方法,需满足随机分配假设,假设更简洁直接。
- IV:适用于解决内生性问题,但需要找到有效工具变量,这往往具有挑战性。
- RD:提供局部因果效应估计,但依赖连续性假设和无操纵假设;估计结果仅针对临界值附近的个体。
- DiD:适用于纵向数据,但依赖平行趋势假设,该假设难以验证。
- 事件研究法:能够分析动态处理效应,尤其适用于交错处理场景;依赖平行趋势假设和充足的处理前数据。
总结
总之,方法的选择取决于研究设计以及对数据所能做出的假设。每种方法都有其优势和局限性:
- RCT是最稳健的方法,但可能不总是可行或符合伦理;
- IV是解决内生性问题的理想选择,但需要有效工具变量;
- RD适用于存在明确临界值的场景,能提供局部因果效应估计;
- DiD对纵向数据具有灵活性,但需要较强的平行趋势假设;
- 事件研究法在交错处理场景下分析动态处理效应效果显著,但依赖平行趋势假设和充足的处理前数据。
在选择因果推断的最适方法时,必须仔细考虑假设条件、可用数据和研究背景。
GOOD LUCK!

