整体词频表会把多篇材料合并,只能说明整批材料反复出现什么。文档词项矩阵保留文档边界,分析至少需要2篇有效文档。矩阵中的每个单元格都对应一个词和一篇文档,数值是实际出现次数。热力图颜色越深,表示这个词在对应文档中出现得越多。

矩阵行来自整批材料的高频词。系统先汇总各篇词频,再按总频次选出前N个词,默认20个。矩阵、热力图、文档相似度和下载结果使用同一组词。相似度基于当前所选前N个词的绝对频次向量计算,调整N可能改变结果;数值越接近1说明用词分布越相似,但不代表两篇文档语义相同。

报告还提供两个补充视角。趋势图连接前5个高频词在文档顺序中的次数,用于观察分布变化;页面按TF-IDF权重展示每篇文档前6个特征词,更强调能区分该文档的词。绝对频次、相似度与特征词各回答不同问题,结合阅读比只看单一指标更稳妥。

适用文档

文本长度差异较小时,矩阵最容易横向解释。若一篇材料远长于其他材料,它的绝对词频通常更高。此时可以结合报告中的总词数、唯一词数和词汇丰富度判断,避免把篇幅差异直接解释为主题更重要。

内容应有可比较的分析单位。政策简报、研究摘要、客户反馈汇总和多版文稿都适合逐篇成列。若一个文件内混有多个独立样本,先按研究单位拆分更合适;否则矩阵中的一列会同时包含多个样本,降低比较清晰度。

中文材料的分词口径会直接影响词项。行业专名、机构名和固定搭配若被拆开,可以补充自定义字典。功能词或模板词反复占据高频位置时,可以用自定义停用词或词性过滤排除。英文词会按当前分词结果进入矩阵,报告不会自动合并词形变化。

材料噪声较多时,先统一页眉、模板句和重复说明更有利于比较。停用词、字典和词性过滤应围绕研究目标设置,不宜只为了让图表更整齐而删除有意义的高频词。

使用步骤

第一步:确定文档比较口径。先明确每一列代表一份政策、一名受访者、一批反馈还是一个内容版本。各篇材料最好处于相近层级,避免把摘要、全文和附录直接放在同一比较中。

第二步:设置词项识别方式。精确模式生成互不重叠的词,全模式扫描更多可能组合,搜索模式在精确结果上补充分解词。行业词识别不完整时,可以补充自定义字典;无解释价值的高频词可放入自定义停用词,中文材料还可按词性排除。

第三步:选择矩阵词数。范围为5至60,默认20。数量较少时图表更集中,适合快速查看核心共同词;数量增加后能保留更多局部特征词,但热力图和明细表会更密集。


第四步:先看整体概览和词频热力图。文档数量确认纳入范围,词汇表规模反映去重词总量,平均每篇有效词数用于判断材料长度。热力图横轴是文档、纵轴是词,适合寻找跨文档共同高频词和局部深色单元格。


第五步:比较文档相似度与词汇趋势。相似度矩阵适合寻找用词分布接近的文档组合。趋势图只连接矩阵前5个词,并按当前文档顺序绘制;如果文档没有时间或版本顺序,折线只表示相邻位置变化,不应解释为时间趋势。


第六步:进入文档概览。摘要卡片给出总词数、唯一词数、词汇丰富度和最高词频。下方再列出每篇文档的前10个高频词。总词数用于识别篇幅差异,词汇丰富度等于唯一词数除以总词数,可辅助判断用词重复程度。

第七步:进入词汇概览。表格按词展示总频次、覆盖文档占比和平均每篇出现次数。覆盖率高的词更接近共同表达,覆盖率低但某篇频次高的词更可能是局部特征。页面同时展示每篇前6个TF-IDF特征词;下载矩阵保留词汇 × 文档结构,单元格为绝对词频,可用于后续整理。


参数解析与对比示例

参数说明默认值
矩阵呈现前N个词从整批材料总频次中选择前5至60个词;图表和下载矩阵使用相同数量20
分词模式精确模式、全模式或搜索模式;三种模式产生的词项范围不同精确模式
自定义字典补充行业术语、专名和固定搭配,使其按预期成为完整词项关闭
自定义停用词排除研究中无解释价值的词;匹配时不区分英文大小写关闭
词性过滤启用后排除选中的中文词性,不让这些词进入后续统计关闭
完成后邮件通知控制任务完成后是否发送邮件,不改变矩阵结果关闭

配置一:快速比较核心用词。精确模式、20个词,不额外设置字典和停用词。适合词项边界清楚、篇幅接近的简报,报告重点是共同高频词和局部深色单元格。

配置二:比较行业材料。精确模式、30个词,加入行业专名字典,并排除模板词和无解释价值的功能词。这个口径有助于保留完整术语,但自定义词表需要在不同批次中保持一致。

配置三:探索更多候选表达。搜索模式或全模式、40至60个词。矩阵会包含更多分解词或重叠词,适合探索词项边界,不宜直接与精确模式结果比较。

案例分析

案例一:三份治理简报。分析包含数字治理、生态治理和城市服务3份简报,共25个有效词、13个去重词汇。采用精确口径并选择前8个词后,“治理”总频次为6,覆盖率100%,平均每篇2次;“数据”总频次为4,覆盖率100%,平均每篇1.33次。数字治理简报与城市服务简报的相似度为0.8783,说明在所选高频词上的分布较接近。生态治理简报与数字治理简报的相似度为0.4899,同时保留“生态”“绿色”等词,差异方向更清楚。这个结果适合支持进一步原文复核,不能单独证明政策内容相同或不同。

案例二:四份客户反馈。分析共19个有效词、11个去重词汇,矩阵选择前8个词。“续航”“充电”“屏幕”各出现3次,覆盖率均为50%,平均每篇0.75次。反馈一与反馈三都包含电池、续航和充电,相似度为0.7715;反馈二突出屏幕、清晰、拍照和系统;反馈四以物流为主,与其余三份在所选词频向量上的相似度为0。这个案例说明矩阵既能找到主题接近的反馈,也能识别词汇分布明显不同的材料。

类似功能对比

功能核心问题主要结果
文档词项矩阵同一批高频词分别在哪些文档出现,各篇用词是否接近绝对词频矩阵、热力图、相似度、趋势与特征词
高频词提取整批材料中哪些词出现得最多整体词频排行榜
文本矩阵分析哪些词对文档更有区分度词项权重矩阵,更强调权重而非绝对次数