PCA 主成分分析

把文本按固定词数切成前后重叠的片段,每个片段作为一个样本,以词语的 TF-IDF(本文常用、别处少用的程度)取值作为变量,做 PCA(主成分分析,把大量相关变量压缩成少数互不重叠的方向)。

输出每个主成分解释的方差比例、各词语在主成分上的载荷、每个片段的主成分得分与关键词,并按载荷正负两端的词给每个主成分拟一个可读名称,用来判断片段之间的差异主要由哪些词拉开。上传多个文件时,除各文件单独分析外,还会把所有片段合并起来再做一次。

加载文件上传组件中...

领域术语被切碎、虚词过多或常见词占据载荷图时,可填写自定义词典/停用词后重新分析。

已识别 0 / 500 个词

一行一个词,也可写成 词 词频 词性(空格分隔);逗号、顿号、分号或换行分隔均可。

字典帮助:可使用 搜狗细胞词库 下载你需要的字典 SCEL 文件,并使用辅助工具中的 【搜狗输入法词库 SCEL 转 TXT 字典工具】 转为 txt 后,用上方的导入按钮加入

分词工具碰到不认识的新词常会拆开,比如把“乡村振兴”拆成“乡村”和“振兴”。打开后,会先把你文本里的这类词找出来加进词典,分词时就不容易拆散了。仅支持中文文本。每 10,000 字 5 点。

已识别 0 / 500 个词
2
1000
5
0.95
100

每 10,000 个字符 2 点