【发布时间】:2021-10-03 16:02:41
【问题描述】:
我有一个城市年级别的数据集,并使用城市固定效应运行以下回归:
reg y x i.city
我认为这相当于为数据中的 300 个城市中的每一个生成一个虚拟变量,并运行(城市 1 作为基准级别):
reg y x city2 ... city300
但是,我还需要包括年份假人。我使用以下方法获得估计值:
reg y x i.city i.year
有谁知道矩阵形式的回归背后的原因是什么?这与每年生成一个虚拟对象并运行以下内容相同吗?
reg y x city2 ... city300 year2 ... year20
我想这样做的原因是尝试使用矩阵运算 (X'X)^{-1}(X'y) 从头开始编写命令,其中 X 包括城市虚拟变量和年份虚拟变量。
【问题讨论】:
-
我建议在 Stata 博客中搜索提及 OLS 的线程。 blog.stata.com/?s=OLS 在那里你会看到比任何人都可能在这里提供的更多的细节。
-
谢谢你,尼克!!这是了解的好资源!
-
一般来说是的。您的基础矩阵 X 仍必须满足可逆性条件,因此换句话说,您的回归量的任何子集都不能完全共线。在您的每个
i.Z固定效应表达式中,一个指示变量被遗漏,否则一组固定效应将与您的截距完全共线。这是一般情况。例如,如果您只有一个特定年份的某个城市的数据,那么 X 中将忽略该年份或该城市的虚拟变量。 -
@JR96 感谢您指出这一点!是的,在小数据集中可能仍然存在共线性。幸运的是,我可以通过从每组中删除一列来恢复估计值。
标签: regression stata categorical-data