面板数据是计量经济学中同时在时间与截面两个维度上取得的二维数据形式,又称时间序列截面数据或混合数据。它由若干个体在多个时点上的重复观测值构成,从横截面看是同一时点上若干个体的观测集合,从纵剖面看则是每个个体各自的时间序列[1]。由于兼具时间与个体两个方向的信息,面板数据可以控制不随时间变化的个体异质性,提高估计精度,是实证经济分析中最常用的数据形式之一[2]。
定义
面板数据是在时间和截面两个方向上同时取得的二维数据。时间序列数据与截面数据都属于一维数据,前者是变量按时间先后得到的数据,后者是变量在某一时点上的截面分布;面板数据把二者融合起来,因而也被称为时间序列截面数据或混合数据[1]。
面板数据用双下标变量表示,记作 $y_{it}$,其中 $i = 1, \cdots, N$ 表示第 $i$ 个个体,$t = 1, \cdots, T$ 表示第 $t$ 个时期,$N$ 为个体总数,$T$ 为时间序列的最大长度。固定 $t$ 时,$y_{it}$ 是横截面上的 $N$ 个观测值;固定 $i$ 时,$y_{it}$ 构成该个体的一个时间序列[1]。
按个体与时期覆盖是否完整,面板数据可分为平衡面板与非平衡面板。全部个体的所有时期都能观测到、没有缺失值的是平衡面板,否则为非平衡面板。按两个维度的相对大小,$N$ 较大而 $T$ 较小的称为短面板,$T$ 较大而 $N$ 较小的称为长面板[3]。若解释变量中包含被解释变量的滞后项,则称为动态面板,否则为静态面板[4]。
原理
面板数据模型的核心任务是把无法观测的个体特征分解出来。影响被解释变量的不可观测因素被分成两类:一类是恒常不变、与时间无关的个体效应,记为 $a_i$;另一类是随时间和个体变动的特异性误差,记为 $u_{it}$[4]。基本形式可写作 $Y_{it} = \alpha_i + \beta_1 X_{it} + u_{it}$,不同个体的回归方程取相同斜率、不同截距,以此反映异质性[3]。
按对个体效应的不同假设,静态面板模型大致分为三类。混合回归模型假定不存在个体或截面的显著差异,把全部数据当作截面数据处理;固定效应模型假定截距差异源于与解释变量相关的不可观测因素,各时期影响固定;随机效应模型则把截距变化视为随机因素造成[5]。若个体效应 $\alpha_i$ 与某个解释变量相关,模型为固定效应模型;若它与所有解释变量都不相关,则为随机效应模型[3]。
模型形式的选择通常依靠两类检验:先用 F 检验在混合模型与固定效应模型之间取舍,再用 Hausman 检验判断应建立随机效应模型还是固定效应模型[6]。Hausman 检验的原假设是随机效应模型成立,若拒绝原假设则选用固定效应模型[5]。
发展历程
面板数据分析的思想源头可追溯到 19 世纪。有文献把面板数据方法的开端归于艾里(George Biddell Airy)在 1861 年出版的天文学研究专著,其后费希尔(Ronald Fisher)在 20 世纪早期提出的方差分析为固定效应与随机效应的区分提供了统计基础[7]。方差成分与随机效应模型此后又被用于动物育种等领域的分析[8]。
计量经济学意义上的面板数据研究兴起于 20 世纪五六十年代。库赫(Edwin Kuh)1959 年、蒙德拉克(Yair Mundlak)1961 年、霍赫(Irving Hoch)1962 年以及巴莱斯特拉(Pietro Balestra)与内尔洛夫(Marc Nerlove)1966 年的论文,把横截面与时间序列数据合并起来分析,被视为这一领域的开创性工作[9]。1977 年,首届国际面板数据会议在巴黎由法国国家统计与经济研究所主办,会议论文以《面板数据计量经济学》为名结集出版[2]。
此后面板数据计量经济学成为计量经济学的重要分支。据一项研究影响力评估,在《计量经济学杂志》被引次数最高的 25 篇论文中,接近四分之一属于面板数据计量经济学领域[2]。在大数据背景下,三维、四维乃至更高维的面板数据集也相继出现,并被用于研究商品、资本与服务的流动[10]。
应用
面板数据被广泛用于宏观经济与微观经济的实证研究,典型场景包括产业结构分析、增长收敛研究、国际贸易与住房市场研究等[6]。在因果推断中,双向固定效应模型同时控制每个个体不随时间变化的特征与每个时期不随个体变化的特征,从而识别处理效应;双重差分设计也以面板结构为基础[11]。
面板数据的信息优势在若干经典问题中体现明显。截面数据没有时间维度,无法观测技术进步;单个企业的时间序列又难以区分效率提高来自规模扩大还是技术进步,面板数据可以同时利用两个维度加以区分。对于失业问题,截面数据只能说明某一时点谁在失业,时间序列只能给出单个人的就业史,二者都无法判断失业者是否为同一批人,面板数据则可以回答[3]。
在实际数据资源方面,美国收入动态面板研究(PSID)于 1968 年在密歇根大学建立,用于评估反贫困政策的效果,此后五十余年间收集了超过 8 万名个人的收入、就业、住房与通勤信息;全国劳动力市场经验纵向调查(NLS)于 1966 年启动,最初包含 5000 多名受访者;欧洲共同体住户面板(ECHP)则于 1994 年建立,用于在住户与个人层面代表欧盟人口[2]。
局限
面板数据的估计结果对模型设定较为敏感。混合回归忽略了个体间不可观测的异质性,若该异质性与解释变量相关,估计将不一致;为每个截面单独估计回归方程则会忽略个体共性,且样本容量可能不足[3]。固定效应估计量依据组内变动识别参数,对随时间变化缓慢的变量会损失大量信息,并可能放大测量误差的影响[12]。
缺失与样本流失是面板数据特有的难题。当个体在部分时期退出样本时形成非平衡面板,退出若与误差项相关,会产生生存者偏差并使估计产生偏误[13]。测量误差也是公认的缺陷,问卷设计不清、受访者记忆偏差与访问员偏差等都可能造成错误应答[14]。
在时间维度上,面板数据常面临异方差、序列相关与截面相关等问题,这些会破坏固定效应估计量的有效性,使推断不可靠[13]。非平稳性在面板数据中同样常见,变量非平稳时均值和方差依赖时间,会使 t 统计量和模型解释力的估计失效[15]。在动态面板中,被解释变量的滞后项与误差项相关,普通最小二乘估计有偏,需要借助工具变量等方法处理[16]。
参见
-
固定效应模型 —— 面板数据模型的一类,假定不可观测的个体效应与解释变量相关。
-
随机效应模型 —— 面板数据模型的另一类,把个体效应视为与解释变量不相关的随机变量。
-
Hausman 检验 —— 用于在固定效应模型与随机效应模型之间作出选择的设定检验。
-
时间序列数据 —— 按时间顺序取得的一维数据,与截面数据共同构成面板数据的两个维度。
-
截面数据 —— 在同一时点上取得的个体观测集合,是面板数据的横截面维度。
参考资料
- 第五章 面板数据分析 . hep.com.cn [引用日期2026-10-02]
- S0304407620301822 . sciencedirect.com [引用日期2026-10-02]
- 本章提纲 . uibe.edu.cn [引用日期2026-10-02]
- 面板数据模型 . uibe.edu.cn [引用日期2026-10-02]
- 面板数据是截面上个体在不同时点的重复观测数据 . sdufe.edu.cn [引用日期2026-10-02]
- 2018中国现代化报告阐述产业结构现代化的系统分析法 . chinagate.cn [引用日期2026-10-02]
- Essays in Panel Data Econometrics . cambridge.org [引用日期2026-10-02]
- * Balestra and Nerlove (1966) Balestra, P . cambridge.org [引用日期2026-10-02]
- Details . mpg.de [引用日期2026-10-02]
- Description . gov.ng [引用日期2026-10-02]
- full_issue . aeaweb.org [引用日期2026-10-02]
- Kumar_Woo(PDF) . bancaditalia.it [引用日期2026-10-02]
- The usage of panel data introduces certain limitations . cbs.dk [引用日期2026-10-02]
- Shahid Amin 2021 Management Sciences IUB(PDF) . gov.pk [引用日期2026-10-02]
- error term (Lewis-Beck 1980: 26; Skog 2004: 236-257) . unit.no [引用日期2026-10-02]
- lu.se 上的文件 . lu.se [引用日期2026-10-02]
浏览次数:1 次
阅读量:0 次 · 阅读完成量:0 次
最近更新:2026-10-02T12:21:26Z
完成率 = 阅读完成量 ÷ 阅读量,分母是阅读量不是浏览次数 —— 关了 JS 的、秒退的都在浏览次数里、不在阅读量里。 详细口径在后台的「数据统计」页。