ARTICLE · INTELLIGENCE

战地情报 · 详情页

来自尧图项目组的一线实战观察与深度解析

伍德里奇第8章STATA异方差:稳健标准误与怀特检验

伍德里奇第8章STATA异方差:稳健标准误与怀特检验 简介围绕伍德里奇《计量经济学导论》第8章计算机习题编写的STATA详解文档面向修读计量经济学课程、需要完成上机作业与考前复盘的本科生及考研备考生。内容集中在异方差性专题方差随性别变化的模型设定、异方差模型参数估计与LM检验、异方差—稳健标准误同通常标准误的对比、完全怀特检验与特殊怀特检验的F统计量及p值计算均配有回归截图、系数与统计量解读并说明结论的推导依据。整包为单个PDF文件约1.12MB按教材习题顺序编排公式、STATA输出与文字解答对照呈现便于逐题核对和打印。已有6686人学习下载该题材在课程作业与复习中需求稳定。读者可据此掌握STATA中回归命令、稳健标准误估计、怀特检验的具体操作路径与结果判读方法也可用作作业自查、期末复习与上机练习的思路参考。1. 从一道第8章习题看STATA里的异方差长什么样伍德里奇《计量经济学导论》第8章的计算机习题很多人卡在同一处跑完reg抄下系数就交卷可题目问的全是异方差——方差怎么随性别变、稳健标准误和普通标准误差多少、怀特检验的辅助回归为什么 R² 会是 0。这份详解的价值不在于给出答案数字而在于把每道小题背后的 STATA 操作链路拆开先估残差、再算残差平方、再做辅助回归、最后读 F 和 p 值。后面按 8.1 到 8.5 的顺序走一遍数据集用习题配套的 dta命令可以直接粘贴参数和判断标准都会给出。2. 用虚拟变量给方差建模8.1 节性别异方差2.1 从同方差假设到方差函数OLS 的无偏性不需要同方差但标准误、t 统计量、F 统计量全部依赖同方差假设。8.1 的思路很直接把方差本身当成一个待估函数令 Var(u|x) α0 α1·male男性取 1 时为 α0 α1女性取 0 时为 α0。这个设定意味着方差不依赖 cigs、parity、faminc 等其他解释变量只随性别跳一档属于最简单的异方差结构。实现上走两步先跑水平值回归拿残差再把残差平方对 male 做回归。残差平方是 u² 的一个观测代理它的条件期望就是条件方差所以第二步回归的截距和斜率正好是 α0 和 α1 的估计。2.2 残差平方辅助回归的 STATA 命令use bwght.dta, clear reg bwght cigs parity faminc motheduc fatheduc male predict ehat, resid // 保存 OLS 残差 gen ehat2 ehat^2 // 残差平方作为方差代理 reg ehat2 male // 辅助回归ehat2 对 malepredict ehat, resid生成的是 y 减拟合值符号方向不影响平方结果。gen ehat2 ehat^2之前要确认 ehat 已存在否则会报 ehat not found。第三步的样本量、R² 都要记下来8.1 的第ⅱ问就是要求把这一行的系数报出来。2.3 系数符号与显著性的判断习题给出的结果是截距 189359.2、male 系数 -28849.63、标准误 20546.36。斜率项为负说明男性组的估计方差比女性低 28849.63女性方差更大。显著性看 t -28849.63 / 20546.36 ≈ -1.40小于 5% 水平双侧临界值 1.96所以不能拒绝男女方差相同的原假设。这里有个常见误读α1 不显著只说明在这份样本里没有足够证据支持性别导致的方差差异并不等于方差真的相等。样本量、残差平方本身的噪声残差平方的方差很大都会压低检验功效。参数估计值标准误t 值结论α0女性方差189359.2——基准组α1男性增量-28849.6320546.36-1.40不显著提示残差平方回归只能用来看方差结构它的 R² 通常很低不要拿这个 R² 去评价模型拟合好坏。3. 异方差-稳健标准误与对数变换8.2 节对比实验3.1 稳健标准误在 STATA 里到底改了什么加, robust之后系数估计值一个字都不变变的只有方差-协方差矩阵。普通 OLS 的 Var(β̂) σ²(XX)⁻¹ 假设所有观测的扰动同方差稳健版本换成 (XX)⁻¹(Σ xᵢxᵢûᵢ²)(XX)⁻¹用每一条观测自己的残差平方去加权相当于允许每条观测的方差不同。所以 8.2 第ⅰ问看到的系数相同、标准误不同正是这个机制的直接结果。对于llotsize这个变量习题里稳健标准误接近普通标准误的两倍0.00122 对 0.00064t 值被直接砍半显著性结论就可能翻转。这是稳健标准误最典型的用途不是修正点估计而是修正推断。3.2 水平值与对数值的两次回归use hprice1.dta, clear reg price lotsize sqrft bdrms // 水平值普通标准误 reg price lotsize sqrft bdrms, robust // 水平值稳健标准误 gen lprice log(price) gen llotsize log(lotsize) gen lsqrft log(sqrft) reg lprice llotsize lsqrft bdrms // 对数形式 reg lprice llotsize lsqrft bdrms, robust // 对数 稳健生成对数变量时要注意 lotsize、sqrft、price 都必须是正数有零值或负值时log()会返回缺失回归样本量会悄悄变少。跑完用count if !missing(lprice)核对样本数。3.3 两类标准误的差距说明了什么方程变量普通标准误稳健标准误倍数水平值 (8.17)lotsize0.000640.001221.91水平值 (8.17)sqrft0.0130.0181.38水平值 (8.17)bdrms9.018.480.94对数 (8.18)llotsize0.0380.0411.08对数 (8.18)lsqrft0.0930.1041.12对数 (8.18)bdrms0.0280.0311.11对数方程的稳健标准误与普通标准误普遍只差 8% 到 12%而水平值方程里lotsize差了近一倍。这印证了 8.2 第ⅲ问的结论对数变换压缩了量纲把随规模放大的方差拉平异方差程度被显著削弱。做房价、工资、销量这类右偏变量时先取对数再回归往往比直接上稳健标准误更接近问题根源。注意对数变换能减轻异方差但不能保证消除。取完对数仍要用estat hettest或辅助回归复查一遍别默认它一定干净。4. 怀特检验与布罗施-帕甘检验8.3 与 8.4 的完整流程4.1 完全怀特检验的辅助回归构型怀特检验的核心是如果同方差成立残差平方应该和所有解释变量、它们的平方、两两交叉项都不相关。8.3 要求做完全怀特检验辅助回归的解释变量包括每个 x 的一次项、平方项以及全部交叉乘积。用whitetst需ssc install whitetst可以一键完成reg lprice llotsize lsqrft bdrms whitetst // 完全怀特检验含交叉项 estat hettest // 对照布罗施-帕甘 / 拟合值检验手工实现也不复杂关键是别漏交叉项reg lprice llotsize lsqrft bdrms predict uhat, resid gen uhat2 uhat^2 gen llotsize2 llotsize^2 gen lsqrft2 lsqrft^2 gen bdrms2 bdrms^2 gen cross1 llotsize*lsqrft gen cross2 llotsize*bdrms gen cross3 lsqrft*bdrms reg uhat2 llotsize lsqrft bdrms llotsize2 lsqrft2 bdrms2 cross1 cross2 cross3辅助回归跑完用 LM n × R² 构造卡方统计量。习题给出的 R² 0.109、n 88算得 LM ≈ 9.59。自由度为辅助回归中除常数项外的变量个数查卡方分布得到 p 0.385远大于 0.05不能拒绝同方差。4.2 布罗施-帕甘检验的三步操作8.4 第ⅱ问用的是 F 形式的 BP 检验步骤固定为三步OLS 估计原模型取残差平方uhat2把uhat2对所有原自变量做回归读该辅助回归的 F 统计量和 p 值。reg y x1 x2 x3 x4 predict uhat, resid gen uhat2 uhat^2 reg uhat2 x1 x2 x3 x4 test x1 x2 x3 x4 // F 检验所有斜率联合为零test给出的是辅助回归中所有斜率同时为零的 F 统计量。习题里 F 2.33、p 0.0581在 5% 水平上刚好不显著在 10% 水平上边缘显著这种卡在边界的结果要如实报告不要为了结论好看擅自改显著性水平。4.3 特殊怀特检验与 R² 为 0 的解释特殊怀特检验只保留拟合值和拟合值的平方reg y x1 x2 x3 x4 predict uhat, resid predict yhat, xb gen uhat2 uhat^2 gen yhat2 yhat^2 reg uhat2 yhat yhat2 test yhat yhat2习题结果 F 2.79、p 0.0645比 BP 检验略强但同样没到 5% 显著。8.4 第ⅰ问里出现R² 0是很多人第一次见会愣住的地方。原因在于uhat2对原自变量回归时样本内的残差平方与解释变量的线性相关被 OLS 的正交条件榨干了OLS 残差与每个解释变量正交残差的平方虽然不完全正交但在数值上相关极弱屏幕默认显示三位小数时就四舍五入成 0。把显示精度调到更高就能看到那个很小的正数format uhat2 %12.8f reg uhat2 x1 x2 x3 x4 display %12.8f e(r2)R² 小只说明线性拟合度低不代表异方差不存在也不代表检验无效。这一步的结论要落在 F 统计量和 p 值上而不是 R² 的大小上。检验辅助回归自变量F / LMp 值判断完全怀特8.3x、x²、交叉项LM ≈ 9.590.385不拒绝同方差BP F 形式8.4ⅱ全部原自变量2.330.0581边缘10% 显著特殊怀特8.4ⅲŷ、ŷ²2.790.0645边缘10% 显著提示三种检验的 p 值不可直接互相比较。完全怀特的自由度最多、功效分布不同BP 与特殊怀特针对的异方差形式也不一样报告时要说清用的是哪一种。5. 线性概率模型下的异方差边界与预测可行性8.5 把异方差问题搬到了二值因变量上。模型是 spread β0 β1·favhome β2·neutral β3·fav25 β4·und25 u因变量是让分是否兑现本质是线性概率模型LPM。LPM 的扰动项天生异方差当 P(y1|x) p 时Var(u|x) p(1-p)方差随 p 变化不可能恒定。所以这一题不是检验有没有异方差而是异方差在这里怎么表现、影响多大。先做描述统计和样本计数第ⅱ问要数中立场地有多少场use vegas.dta, clear count if neutral 1 // 553 个样本中中立场地场次 sum spread favhome neutral fav25 und25再跑普通与稳健两版回归reg spread favhome neutral fav25 und25 reg spread favhome neutral fav25 und25, robust test favhome neutral fav25 und25 // H0: β1β2β3β40习题给出的 F 0.48、p 0.75四个变量联合不显著。R² 0.0034说明赛前公开信息几乎解释不了让分兑现与否。第ⅳ问要求解释在原假设下不存在异方差如果 β1 到 β4 全为零因变量与任何自变量都无关条件均值恒为常数条件方差自然也不随 x 变异方差随之消失。这是一个很好的反直觉点——异方差的来源往往就是被解释变量与解释变量的关系本身。最后落到第ⅵ问的现实判断。稳健标准误已经把推断层面的问题处理掉了但 R² 只有 0.0034、系数最大不到 0.12、F 检验整体不显著这些信号都指向同一个结论靠赛前可得信息系统性地预测让分兑现在统计上找不到支撑。做这类预测项目时如果数据只有赛前几档虚拟变量先算一遍联合 F 和样本外命中率比反复调模型形式更有意义。本文还有配套的精品资源点击获取
RELATED READING

延伸阅读

更多一线实战笔记与深度复盘,助您持续精进