KWIC关键词命中矩阵
单看词频只能知道关键词出现多少次,难以判断它集中在哪些段落、不同概念是否经常一起出现。KWIC关键词命中矩阵把段落作为行、关键词作为列,用单元格命中次数呈现主题在整批材料中的分布。
工具默认自动发现候选关键词,并根据段落共现形成概念组;也可手动设置分组,把同义或近义表达纳入统一口径。主矩阵始终按空行切出的段落统计,支持子串或整词匹配、英文大小写控制。
用户可设置自动关键词数量上限与分组上限,也可选择热点列表按整篇、段落或句子汇总。上下文样例支持控制是否保留、左右窗口长度,以及每个关键词在每份材料中的样例数量。
报告展示文件数、段落数、关键词数、分组数、总命中、平均命中关键词种类,并提供文件、关键词、分组三种视角、段落命中热力图、分组共现矩阵、热点单元和上下文样例,适合政策材料、访谈、客户反馈等分段文本的主题覆盖分析。
因为一份文件常常包含多份逻辑文档(一段一份发言、一段一条记录…), 矩阵的"行"是段落而不是文件,单文件也能形成有意义的矩阵。
所以本工具默认不要求用户填写关键词;想看某个词的逐次上下文,请改用 KWIC。
推荐 · 从文本中找出关键词和概念分组
系统会按词频、段落覆盖和共现关系自动选择关键词,并把经常出现在同一批段落里的词归为一组。
矩阵始终按段落(空行 / 双换行)切分,本设置只影响报告底部「热点单元」清单的粒度。
推荐 · 与矩阵口径一致
出现即算(含在词中也命中)
关闭时英文关键词忽略大小写差异(如「China」也会命中「china」)。
开启后,结果页可在抽屉中查看每个关键词 / 单元格的命中原句;关闭则只返回纯统计数据,速度更快。
值越大上下文越完整;越小越紧凑。
完整命中明细会写入导出的 CSV,这里仅控制结果页可直接展示的样例数量。
每 20,000 字 2 点
