文档词项矩阵
整体词频会把多篇材料合并成一个结果,难以判断同一个词集中在哪篇文档,也不容易分辨各篇材料的用词侧重。文档词项矩阵以词汇为行、文档为列,保留每个词在每篇文档中的实际出现次数。
系统从整批材料中选择总频次最高的前N个词,生成词频热力图、文档相似度矩阵与高频词趋势图。页面还按文档计算高权重特征词,用于对照共同词与区分词。
用户可在5至60之间设置矩阵词数,默认20;也可选择精确、全模式或搜索模式,并通过自定义字典、停用词和词性过滤统一统计口径。可视化与下载矩阵使用相同的前N个词。
报告展示文档数量、词汇表规模、平均每篇有效词数、逐篇总词数、唯一词数、词汇丰富度、高频词、总词频、文档覆盖率、平均每篇频次、特征词和文档相似度,便于从整体、文档和词汇三个层面解释差异。
加载文件上传组件中...
系统会自动构建“文档 × 词汇”矩阵,X 轴为文档,Y 轴为词汇。可视化矩阵与下载文件均会基于该数量进行展示。
与【高频词】和【文本矩阵】的区别
高频词: 仅统计语料整体的词频排行榜,无法区分不同文档的差异。
文本矩阵: 以 TF-IDF 等权重构建词语的重要性矩阵,更关注词语权重而非绝对频次。
文档-词频矩阵: 针对每篇文档逐一统计词频,生成可下载的 Doc-Term Matrix,便于横向对比。
每 20,000 字 2 点
