返回教程列表
文本分析基础教程主成分分析综合评价降维

PCA 主成分降维完整教程:从 KMO 与 Bartlett 检验,到成分矩阵与得分系数,再到综合得分和排名

三十个城市、八项彼此相关的指标,怎样排出一个站得住的综合名次?这篇教程从 Hotelling 的主成分分析讲起,说明 TATOOLS 的【PCA 主成分降维】怎样先做 KMO 与 Bartlett 球形检验,再对标准化后的相关矩阵做特征分解。文中用三项指标手算 KMO 约 0.69 和 Bartlett 卡方 18.83,算出特征值、载荷和共同度;再用四项指标的例子算出主成分得分,按特征值占比加权得到综合得分 0.532,并和只用第一主成分的算法对照。最后讲负向指标怎样处理、报告怎样读、三线表怎样放进论文,并给出方法部分的写法示例。

作者:TATOOLS 研究团队|更新于 2026-09-24|5297 个字符|约 18 分钟读完
pca-dimension-reduction
立即使用

要给三十个城市的发展水平排个名,手里有八项指标,从人均 GDP 和人均可支配收入,到绿化覆盖率和每千人床位数。指标之间彼此相关,人均 GDP 高的城市收入往往也高。直接加总,相关的几项会被重复计入;人为定权重,又说不清为什么是这个数。

主成分分析(Principal Component Analysis,PCA)给出了一个由数据本身决定权重的办法。它把多项彼此相关的指标压成少数几个互不相关的综合维度,叫主成分,每个主成分是原指标的加权组合,再按各主成分解释的差异大小加权,得到每个样本的综合得分和排名。这是经管类综合评价论文里最常用的方法之一。

在 TATOOLS 的【PCA 主成分降维】里【上传文档】,一行是一个样本,每个数值列是一项指标。TATOOLS 先做 KMO 与 Bartlett 球形检验,再对相关矩阵做特征分解,给出每个主成分的特征值和方差贡献率,列出成分矩阵和得分系数,算出每个样本的主成分得分,以及两种算法的综合得分与排名,另出 Word 和 Excel 版的三线表。

这篇教程先讲综合评价为什么用主成分,数据怎样准备,再用两个小例子从前提检验一路手算到综合得分,最后讲报告的读法和论文里的写法。

01

综合评价为什么用主成分

Pearson 1901 年提出用一条直线或一个平面去最贴近地拟合高维空间里的点,Hotelling 1933 年把它发展成主成分分析,找一组相互垂直的新坐标轴,第一根轴沿着数据散开最大的方向。用在综合评价上,第一主成分往往就是那几项一起升降的指标的共同方向,比如经济发展水平。

主成分分析替研究者解决了两件事。一是去掉指标之间的重复信息,几项高度相关的指标被合进同一个主成分,不会被重复计分;二是权重由数据决定,每个主成分的权重等于它解释的差异占比,不需要研究者主观赋权。

TATOOLS 的【PCA 主成分降维】的口径和 SPSS 降维菜单里的主成分法一致,论文里的表格和数值可以直接对照。它处理的是一张数据表,和分析文本片段的【PCA 主成分分析】是两个工具。

02

数据表怎样准备

一行是一个样本,比如一个城市或一家企业;每个数值列是一项指标。工具页的【分析指标列】从表头里选要参与分析的列,至少两列;留空时,TATOOLS 自动挑出能读成数字的列,跳过编号这类几乎每行都不同的整数列。【样本标签列】选一列名称,比如城市名,排名表和散点图里用它标出每个样本,留空时用行号。点【智能填写】,TATOOLS 按表头和前几行样例自动挑好这两项。

所选指标里任何一项缺失的行会被剔除,报告写明剔除了几行。有效样本少于 30 个时,报告会提醒载荷和贡献率换一批样本可能变化较大。

主成分的方向统一为指标越大、得分越高。成本和污染排放这类越小越好的指标,要先取负数或倒数再上传,否则它们会把综合得分往反方向拉。

03

前提检验:KMO 与 Bartlett

主成分分析的前提是指标之间有足够的相关,彼此不相关的指标压不成少数几个综合维度。常用两个检验。

KMO 取样适切性量数由 Kaiser 1974 年提出,比较指标之间的简单相关和偏相关。偏相关是排除其他指标以后两项指标之间的相关,指标之间共享的信息越多,偏相关相对简单相关越小,KMO 越接近 1。

· · ·

KMO = Σ r²ᵢⱼ ÷ (Σ r²ᵢⱼ + Σ p²ᵢⱼ)

r:简单相关系数;p:偏相关系数;对所有 i ≠ j 求和

Bartlett 1950 年提出的球形检验,检验相关矩阵是不是单位矩阵,也就是指标之间是否完全不相关。

· · ·

χ² = −(n − 1 − (2p + 5) ÷ 6) × ln|R|

自由度 = p × (p − 1) ÷ 2

n:样本量;p:指标数;|R|:相关矩阵的行列式

用三项指标、三十个城市手算。三项指标两两相关系数都是 0.5。

· · ·

R = | 1 0.5 0.5 |

    | 0.5 1 0.5 |

    | 0.5 0.5 1 |

R 的逆矩阵:对角线 1.5,其余 −0.5

偏相关 = 0.5 ÷ √(1.5 × 1.5) ≈ 0.333

KMO = 0.25 ÷ (0.25 + 0.111) ≈ 0.69

 

|R| = 0.5,ln|R| ≈ −0.693

χ² = (30 − 1 − 11 ÷ 6) × 0.693 ≈ 18.83

自由度 = 3,p ≈ 0.0003

Kaiser 给 KMO 定了一个常用的分档。

KMO Kaiser 的评价
0.9 以上 极好
0.8 到 0.9 很好
0.7 到 0.8 中等
0.6 到 0.7 一般
0.5 到 0.6 勉强
0.5 以下 不宜做

这个例子 KMO 约 0.69,处在一般的档位;Bartlett 检验显著,说明指标之间确有相关。报告的【KMO 和 Bartlett 球形检验】给出这三个数,论文里通常先报告它们,再报告主成分。

04

标准化与特征分解

各项指标的单位不同,人均 GDP 以元计,绿化率以百分比计。不做处理,数值大的指标会主导结果。TATOOLS 先把每项指标标准化,减去均值再除以标准差,再对相关矩阵做特征分解。

· · ·

z = (x − 均值) ÷ 标准差

R × w = λ × w

λ:特征值,这个主成分解释的方差

w:特征向量,每个分量是一项指标的系数

接着三项指标的例子。

· · ·

特征值:2,0.5,0.5,加起来等于指标数 3

第一主成分的特征向量:(0.577, 0.577, 0.577)

方差贡献率 = 2 ÷ 3 ≈ 66.7%

保留几个主成分,最常用的是 Kaiser 1960 年提出的标准,特征值大于 1 的保留。标准化以后一项指标自己的方差就是 1,特征值不到 1 的主成分,解释的差异还不如一项单独的指标多。这个例子只保留第一个。

工具页的【按特征值大于 1 自动确定主成分个数】默认打开;关掉以后可以在 1 到 15 之间自己指定。【对指标做标准化】默认打开,各指标单位不同时必须打开;关掉时改用协方差矩阵,保留规则改为特征值大于平均特征值。报告的【碎石图与总方差解释】列出全部特征值、方差贡献率和累计贡献率,碎石图上可以看出特征值在哪里突然变平。

05

成分矩阵与共同度

成分矩阵里的每个数叫载荷,等于特征向量乘以特征值的平方根。标准化以后,它就是这项指标和这个主成分的相关系数。

· · ·

载荷 = 特征向量 × √特征值

接三项指标的例子:0.577 × √2 ≈ 0.816

三项指标和第一主成分的相关系数都是 0.816。给主成分起名字,看的是载荷大的那几项指标。

共同度是一项指标在所有保留主成分上载荷的平方和,表示这项指标的方差有多少被保留的主成分解释了。

· · ·

共同度 = 0.816² ≈ 0.667

每项指标有三分之二的信息被第一主成分带走了。共同度偏低的指标,大部分信息没有进入保留的主成分,读结果时要留意它。报告的【成分矩阵(主成分载荷)】列出每项指标在每个保留主成分上的载荷和共同度,旁边的【载荷热力图】用颜色深浅把载荷画出来,一眼能看出每个主成分由哪几项指标撑起。

06

得分系数与主成分得分

每个样本在一个主成分上的得分,是标准化后的指标乘以得分系数再相加。TATOOLS 的得分系数就是特征向量。

· · ·

Fₖ = Σ wₖⱼ × zⱼ

换一个四项指标的例子。人均 GDP 和人均收入的相关是 0.8,绿化率和空气优良天数的相关是 0.6,两组之间不相关。

· · ·

特征值:1.8,1.6,0.4,0.2

保留两个,累计贡献率 = (1.8 + 1.6) ÷ 4 = 85%

F1 的系数:(0.707, 0.707, 0, 0) 经济发展

F2 的系数:(0, 0, 0.707, 0.707) 生态环境

载荷:前两项 0.707 × √1.8 ≈ 0.949

      后两项 0.707 × √1.6 ≈ 0.894

某城市标准化后的四项指标是 (1.0, 0.6, −0.4, 0.2)。

· · ·

F1 = 0.707 × (1.0 + 0.6) ≈ 1.131

F2 = 0.707 × (−0.4 + 0.2) ≈ −0.141

这个城市经济发展明显高于平均,生态环境略低于平均。报告的【样本在第一、第二主成分上的位置】把每个样本画成一个点,横轴是第一主成分得分,纵轴是第二主成分得分,位置最极端的几个样本直接标上名称,鼠标停在其他点上也能看到样本标签。

07

综合得分和排名

综合得分把保留的主成分按特征值占比加权。

· · ·

综合得分 = Σ (λₖ ÷ Σλ) × Fₖ

权重:1.8 ÷ 3.4 ≈ 0.529,1.6 ÷ 3.4 ≈ 0.471

综合得分 = 0.529 × 1.131 + 0.471 × (−0.141) ≈ 0.532

主成分得分以样本均值为 0,综合得分也是。0.532 表示这个城市的综合水平高于平均,负数表示低于平均,比较的是样本之间的相对位置。

另一种常见算法只用第一主成分的得分排名,这个城市的综合得分就是 1.131。两种算法各有用处,加权算法用上了所有保留主成分的信息,只用第一主成分则在第一主成分解释了大部分差异时更简洁。TATOOLS 两种都算,报告里两份得分系数与综合排名并列,加权算法标为主口径,读者可以看两种算法的排名是否一致。

特征向量的正负是任意的,同一个主成分整体取反,数学上完全等价,排名却会整个颠倒。TATOOLS 把每个主成分的方向统一为系数之和为正,指标越大、得分越高,排名不会整体颠倒。

08

工具页上的设置一览

设置 选项或范围 默认 影响什么
分析指标列 从表头选,至少两列,可留空 留空时自动挑数值列 哪些指标参与分析
样本标签列 从表头选,可留空 行号 排名和散点图里怎样标出样本
按特征值大于 1 自动确定主成分个数 开或关 保留几个主成分
保留主成分个数 1 到 15 关掉自动时生效 自己指定个数
对指标做标准化 开或关 用相关矩阵还是协方差矩阵

综合得分的两种算法每次都会全部计算,不需要选择。

09

报告怎么读

区块 先看什么
这份结果说明了什么 有效样本、保留几个主成分、累计贡献率
主成分概况 指标数、保留规则、剔除的缺失行
KMO 和 Bartlett 球形检验 KMO 在哪一档,Bartlett 是否显著
碎石图与总方差解释 各主成分的特征值和贡献率
成分矩阵(主成分载荷) 每个主成分由哪些指标撑起,给它起名
得分系数与综合排名 两种算法的公式、权重和排名
样本在第一、第二主成分上的位置 哪些样本在哪个维度上突出

读的顺序是先看前提检验是否通过,再看保留了几个主成分、累计贡献率多高,然后在成分矩阵里给每个主成分起名,最后看综合排名和散点图。

结果可以下载,Word 文件里是可以直接放进论文的三线表,依次是 KMO 和 Bartlett 检验表,总方差解释表,成分矩阵,以及两种算法各自的得分系数表和排名表;Excel 文件里是同样的表格和完整排名;另有三张表格,分别是成分矩阵,每个样本的主成分得分,以及综合排名。

10

把结果写进论文

下面是一段综合评价论文里常见的写法示例,方括号里换成自己的数字。

本研究使用 TATOOLS 的 PCA 主成分降维,对 [样本数] 个 [样本类型] 的 [指标数] 项指标进行主成分分析。KMO 值为 [KMO],Bartlett 球形检验近似卡方为 [卡方](自由度 [自由度],p < 0.001),适合进行主成分分析。按特征值大于 1 的标准提取 [个数] 个主成分,累计方差贡献率为 [比例]。依据载荷分别命名为 [名称],以各主成分方差贡献率占累计贡献率的比例为权重计算综合得分并排序。

论文里一般依次给出 KMO 与 Bartlett 检验表、总方差解释表、成分矩阵和综合得分排名表,TATOOLS 导出的 Word 文件正好是这几张表。

11

小结

主成分分析把多项相关的指标压成少数几个互不相关的主成分,权重由各主成分解释的差异占比决定。

KMO 看指标之间共享的信息多不多,Bartlett 检验指标是否完全不相关,两者通过才适合做主成分分析。

标准化以后对相关矩阵做特征分解,特征值大于 1 的主成分保留,载荷是指标和主成分的相关系数,共同度是载荷的平方和。

主成分得分是标准化指标乘得分系数相加,综合得分按特征值占比加权,均值为 0,比较的是相对位置。

TATOOLS 两种综合得分算法都算,方向统一为指标越大得分越高,结果直接导出成论文三线表。

想从问卷题目里提炼潜在因子,可以用 TATOOLS 的【探索性因子分析】;想看各项指标两两之间的相关,用【相关分析矩阵】;想把样本按主成分得分分成几类,用【样本聚类】。

12

资料来源

Pearson:On Lines and Planes of Closest Fit to Systems of Points in Space,Philosophical Magazine,第 2 卷第 11 期,1901

Hotelling:Analysis of a Complex of Statistical Variables into Principal Components,Journal of Educational Psychology,第 24 卷第 6 期,1933

Bartlett:Tests of Significance in Factor Analysis,British Journal of Statistical Psychology,第 3 卷第 2 期,1950

Kaiser:The Application of Electronic Computers to Factor Analysis,Educational and Psychological Measurement,第 20 卷第 1 期,1960

Kaiser:An Index of Factorial Simplicity,Psychometrika,第 39 卷第 1 期,1974

Jolliffe:Principal Component Analysis(第 2 版),Springer,2002


END