文本矩阵分析

把材料切成一个个文档段,分词后统计每个词在每段出现多少次,构成文档—词条矩阵(行是文档段、列是词、格子里是出现次数),再用 TF-IDF(衡量一个词在某段频繁、在其他段落少见的程度)加权,挑出 10 到 50 个最有区分度的词。

挑出的词给出总出现次数、出现在多少个文档段、覆盖率和重要度,并统计任意两个词在同一段一起出现的次数,每一对都附上出现它们的原文段落,可回原文核对这种关联是否成立。可以指定重点关注词,让它们即使频次不高也保留;也可以加载自定义词典和停用词表,或把同一概念的不同写法合并成一种再计数。

加载文件上传组件中...
已识别 0 / 500 个词

一行一个词,也可写成 词 词频 词性(空格分隔);逗号、顿号、分号或换行分隔均可。

字典帮助:可使用 搜狗细胞词库 下载你需要的字典 SCEL 文件,并使用辅助工具中的 【搜狗输入法词库 SCEL 转 TXT 字典工具】 转为 txt 后,用上方的导入按钮加入

分词工具碰到不认识的新词常会拆开,比如把“乡村振兴”拆成“乡村”和“振兴”。打开后,会先把你文本里的这类词找出来加进词典,分词时就不容易拆散了。仅支持中文文本。每 10,000 字 5 点。

已识别 0 / 500 个词

这个选择只影响报告里的阅读顺序和下一步建议,不改变分词、矩阵或共现计算。

填入的词会在分析中优先保留,即使词频不高也不会被自动筛选掉。最多 20 个。

每 10,000 个字符 2 点