SCM论文 | 重归一化样本相关矩阵的特征值研究

蒋倩倩、朱钧芃、李曾
摘要
样本相关矩阵是刻画高维变量依赖结构的基础工具。面对维数远大于样本量的超高维数据, 传统随机矩阵理论不再适用。本文通过构造重归一化样本相关矩阵,建立了同时覆盖高维与超高维情形的渐近谱理论,并进一步提出了适用于超高维数据的独立性检验方法。
研究背景
样本相关矩阵的特征值是高维多元统计中的重要工具,广泛用于总体相关结构推断、独立性检验和谱统计分析。现有随机矩阵理论主要研究维数与样本量同阶的 Marčenko–Pastur 框架,即。在该框架下,样本相关矩阵的极限谱分布、极值特征值以及线性谱统计量的中心极限定理已得到较系统的发展[1, 2]。然而,在的超高维情形下,样本相关矩阵的大部分特征值为零,非零特征值则随维数发散,其谱行为与传统高维情形显著不同。尽管超高维样本协方差矩阵已有一定研究,但样本相关矩阵的标准化过程会引入复杂的非线性依赖,加之总体均值可能非零,使得协方差矩阵的现有方法无法直接应用。因此,有必要对样本相关矩阵进行重新标准化,并建立同时覆盖和的统一谱理论,从而为高维及超高维数据中的独立性检验提供理论基础。
研究成果
我们近期在Science China Mathematics在线发表论文[3],建立了重归一化样本相关矩阵在高维和超高维情形下的统一渐近谱理论,系统推导了其极限谱分布、最大特征值的渐近性质以及线性谱统计量的中心极限定理,特别证明了当时极限谱分布为半圆律,并建立了超高维线性谱统计量的高斯极限。基于上述理论,文章进一步构造了适用于高维和超高维数据的独立性检验统计量,模拟结果验证了理论近似的准确性以及所提检验良好的水平控制和检验功效。
研究意义
本文首次对重归一化样本相关矩阵建立了覆盖的统一谱分析框架,将传统 MP 高维理论与超高维半圆律连接起来,填补了条件下样本相关矩阵谱性质研究的空白。在方法层面,文章提出的预解式等价表示,为研究其他带有自归一化、标准化或比率结构的超高维随机矩阵提供了新的技术路径。统一的线性谱统计量中心极限定理还避免了高维与超高维分析之间的理论割裂。在应用层面,所构造的独立性检验计算简单,且可在维数与样本量同阶甚至维数远大于样本量时使用,为基因表达、金融资产相关性和大规模特征筛选等问题提供了可统一标定的推断工具。
【参考文献】
[1] Tiefeng Jiang. "The limiting distributions of eigenvalues of sample correlation matrices." Sankhyā Ser A, 2004, 66: 35-48
[2] Jiti Gao, Xiao Han, Guangming Pan, Yanrong Yang. "High dimensional correlation matrices: The central limit theorem and its applications." Journal of the Royal Statistical Society Series B, 2017, 79: 677-693
[3] Qianqian Jiang, Junpeng Zhu, Zeng Li. "On eigenvalues of a renormalized sample correlation matrix." Science China Mathematics, 2026, 69,

作者简介

蒋倩倩,德国波鸿鲁尔大学Humboldt博士后研究员,主要从事高维统计推断、随机矩阵理论、变点检验、随机微分方程等领域的研究。

朱钧芃,南京财经大学经济学院讲师,主要从事高维统计推断、 随机矩阵理论、机器学习等领域的研究。

李曾,南方科技大学统计与数据科学系副教授、博士生导师,研究方向包括高维统计分析、随机矩阵理论、机器学习等。

