相关系数矩阵

关注
义项:统计学概念

相关系数矩阵是统计学中由多个变量两两之间的相关系数按行列排列而成的方阵,它的对角线元素均为1,非对角线元素取值在-1到1之间,用来反映变量之间线性关系的方向和强弱。它是多变量数据分析的基础工具,因子分析、结构方程模型、主成分分析等方法都以它为输入,同时也能用来识别回归模型中的多重共线性问题[1]。

百科 图文
目录
  1. 定义
  2. 原理
  3. 发展历程
  4. 应用
  5. 局限
  6. 参见

定义

相关系数矩阵是把一组变量的两两相关系数按行列位置摆放得到的方阵。设由 n 个随机变量构成的随机向量,其任意两个分量之间的相关系数都存在,则以这些系数为元素的 n 阶方阵即为该随机向量的相关系数矩阵,通常记作 R。矩阵第 i 行第 j 列的元素对应第 i 个与第 j 个变量之间的相关系数,对角线上的元素全部等于 1,表示变量与自身完全相关。

对样本数据而言,把每个变量标准化后计算协方差,所得结果就是样本相关系数矩阵;它也可以看成把协方差矩阵的对角线缩放为 1 之后得到的矩阵[2]。变量之间两两独立、完全没有线性关联时,相关系数矩阵退化为单位矩阵[2]。

原理

矩阵中最常使用的元素由皮尔逊相关系数给出。对两个变量 X 与 Y,其总体相关系数定义为二者协方差除以各自标准差的乘积,即 $\rho_{XY}=\frac{\operatorname{Cov}(X,Y)}{\sqrt{D(X)}\sqrt{D(Y)}}$,样本情形下把协方差与方差换成对应的样本估计量即可[3]。这一系数与协方差同号,取正值表示正相关,取负值表示负相关,等于零则称两个变量不相关[3]。

矩阵中的系数并不是彼此独立的取值。从线性代数角度看,相关系数矩阵是主对角线为 1 的对称半正定矩阵,其特征值均非负,且所有特征值之和等于变量个数[2]。由于对称性,矩阵中非对角线元素满足对应位置的数值相等,因此只需写出下三角或上三角部分即可完整表达。对 n 个变量,需要计算的相关系数个数为 n(n-1)/2,例如 10 个变量对应 45 个系数。

逐个变量对的相关系数是逐个计算的,但当变量很多时,把所有成对系数组织成矩阵能一次性呈现整体结构,并让后续的矩阵运算得以进行。除皮尔逊系数外,还可以按变量类型选择斯皮尔曼等级相关系数或肯德尔秩相关系数来填充矩阵,前者基于数据的秩次计算,适用于非正态分布数据或有序分类变量。

发展历程

相关系数及其矩阵形式的理论根植于 19 世纪末至 20 世纪初的相关与回归研究。相关系数被标准化到 -1 与 1 之间,其取值在散点位于一条负斜率直线上时为 -1,位于正斜率直线上时为 1,这一性质奠定了矩阵元素取值范围的基础[4]。

随着多变量统计分析的发展,相关系数矩阵逐渐被当作一个整体对象来研究。2020 年出版的《理解相关系数矩阵》(Understanding Correlation Matrices) 系统讨论了矩阵中单个相关系数取值对其他系数的约束,以及它在假设检验、因子分析和结构方程模型中的作用[1]。数值计算方面,2002 年有研究用 Frobenius 范数定义矩阵之间的接近程度,并给出利用 Dykstra 投影算法求最近相关系数矩阵的方法,此后又出现了针对因子结构与牛顿法的改进结果[5]。

应用

在因子分析和主成分分析中,相关系数矩阵常被直接当作输入数据。若矩阵接近单位矩阵,说明变量之间缺乏共同变异,不适合做因子提取;研究者还会用 KMO 抽样适当性度量和 Bartlett 球形检验来检验数据是否适合做这一类分析,后者的原假设正是相关系数矩阵为单位矩阵[6]。矩阵的行列式也被用作多重共线性的预警指标,数值过小往往提示变量之间存在冗余。

在回归建模中,相关系数矩阵用来判断解释变量之间是否高度相关。若两个变量的相关系数超过 0.90 这一常见经验阈值,把它们同时纳入模型会造成共线性,进而使模型解不稳定,出现没有唯一最优解的情况[7]。这类判断常配合方差膨胀因子等指标一起使用[6]。

在金融与经济分析中,相关系数矩阵用于考察多组时间序列数据之间的联动,并作为资产配置与风险管理的参考。在医学研究中,它被用来观察生物标志物之间的关系;在市场研究中,则用于分析消费者行为与销售业绩的联系。此外,结构方程模型也以相关系数矩阵作为建模与拟合评价的输入数据之一[1]。

在结果呈现上,热图是展示相关系数矩阵的常见方式,可用颜色深浅同时表现系数的方向和大小。探索性数据分析中还有把矩阵转化为图谱的做法,用实线表示正相关、虚线表示负相关,只保留较显著的关联[5]。

局限

相关系数矩阵中的元素通常只刻画线性关系。皮尔逊系数衡量的是两个变量之间的线性关联强度,其数值一般不能完整反映二者的关系,变量之间可能存在很强的非线性关系而线性系数接近于零[8]。这意味着一组变量不相关并不等于相互独立[9]。

矩阵本身不能说明因果方向。相关不等于因果这一提法意味着,仅凭相关系数无法推断变量之间存在因果关系;相关性的成因可能是间接的或未知的,高相关也可能是恒等关系造成的重叠,而不存在任何因果过程[8]。因此,相关系数可以作为可能存在因果关系的线索,但无法指出具体是何种关系[8]。

在实际操作中,判断一个给定的矩阵是否为合法的相关系数矩阵并不容易。有些矩阵虽然对角线为 1、元素都落在 -1 到 1 之间,却因为出现负特征值而不满足半正定要求,此时就需要用最接近的合法相关系数矩阵来替换[2]。此外,从数据中估计相关系数本身也存在困难,在样本量不足或数据不完整时,得到的矩阵可能并不具备合法结构[2]。

参见

  • 协方差矩阵 —— 未标准化的变量离散程度矩阵,将它的对角线缩放为 1 即得到相关系数矩阵。

  • 皮尔逊相关系数 —— 相关系数矩阵中最常用的元素,衡量两个变量的线性关联。

  • 斯皮尔曼等级相关系数 —— 基于秩次的相关度量,可用于非正态数据或有序分类变量。

  • 多重共线性 —— 解释变量高度相关导致回归模型不稳定的现象,常用相关系数矩阵识别。

  • 因子分析 —— 以相关系数矩阵为输入、寻找潜在共同因素的多元统计方法。

  • 单位矩阵 —— 变量之间两两不相关时相关系数矩阵退化为的形式。

参考资料

  1. Understanding Correlation Matrices . sagepub.com [引用日期2026-10-04]
  2. What Is a Correlation Matrix? . nhigham.com [引用日期2026-10-04]
  3. 概率论(1)-第四章课件(part1)(PDF) . tsinghua.edu.cn [引用日期2026-10-04]
  4. Full text of "Introduction To Bayesian Statistics" . archive.org [引用日期2026-10-04]
  5. Corelation . wikipedia.org [引用日期2026-10-04]
  6. core.ac.uk 上的 PDF 文件 . core.ac.uk [引用日期2026-10-04]
  7. Correlation Matrix - Chapters and Articles . sciencedirect.com [引用日期2026-10-04]
  8. Correlation_and_dependence . wikipedia.org [引用日期2026-10-04]
  9. data_analysis(PDF) . mathworks.com [引用日期2026-10-04]
词条评价
词条统计

浏览次数:1 次

阅读量:0 次 · 阅读完成量:0 次

最近更新:2026-10-03T18:02:06Z

历史版本

完成率 = 阅读完成量 ÷ 阅读量,分母是阅读量不是浏览次数 —— 关了 JS 的、秒退的都在浏览次数里、不在阅读量里。 详细口径在后台的「数据统计」页。

本条目引用的词条
单位矩阵 皮尔逊相关系数 斯皮尔曼等级相关系数 协方差矩阵 皮尔逊相关系数 斯皮尔曼等级相关系数 多重共线性 因子分析 单位矩阵
红色的还不存在。红链不是错误——它标出"这个概念被引用了但还没人写"。