普通词频表把同一个词的出现合并成一个数字。KWIC关键词命中矩阵进一步保留段落位置:横轴是关键词,纵轴是按空行切出的段落,单元格记录该段命中该词的次数。单元格颜色越深,表示该段对该词的命中次数越多。同组关键词会排列在同一色块下,因此既能看具体词,也能看概念组。
关键词有两种来源。自动方式从材料中选择有一定频次和区分度的候选词,再根据这些词在相同段落中的共现情况形成分组。手动方式由用户设置分组名和组内关键词,适合把同义词、近义词或固定研究词纳入同一口径。自动分组反映文本位置上的邻近关系,不等同于人工分类,也不直接说明语义关系。
矩阵始终按段落统计。页面中的热点单元粒度是另一项设置,它只决定报告底部按段落、句子列出命中密集的内容,或不输出热点清单,不会改变主矩阵。报告还按同一段落统计分组共现。对角线表示该组出现过的段落数,非对角线表示两个组共同出现的段落数。
适用文档
政策、法规和制度材料通常有清晰的条款或段落,适合比较多个政策概念的覆盖。例如把“数字化转型、智能化升级”归入转型组,把“数据治理、数据标准”归入治理组,就能看到不同概念在哪些条款同时出现。
访谈、开放题和客户反馈适合把每段回答或每条完整反馈保留为一个段落。段落边界越清楚,矩阵行越接近真实的内容单元。若多条回答连成一个长段,命中会被合并到同一行,主题共现也会随之变宽。
媒体、行业简报和学术材料可以用固定概念组观察主题分布。不同批次比较时,关键词、分组、子串或整词、英文大小写应保持一致。否则命中变化可能来自统计口径,而不是材料内容本身。
自动发现更适合内容较长、重复表达较充分的材料。极短文本中的候选词频次有限,自动结果可能不稳定。已有代码表、术语表或业务分类时,手动分组通常更容易保持解释一致。无论采用哪种方式,共现都只表示两个概念位于同一段,仍要结合原文判断关系。
使用步骤
第一步:确定关键词来源。需要先了解材料中的常见表达时使用系统自动识别,并设置最多关键词数和最多分组数。已有明确研究框架时使用手动分组,为每个概念组填写名称和关键词。

第二步:检查段落边界。矩阵按空行或双换行切分内容。可以先确认每条访谈回答、政策条款或客户反馈是否形成独立段落,避免多个无关内容被统计到同一行。
第三步:设置热点与匹配口径。热点单元可按段落、句子展示,也可以不输出热点清单。子串匹配适合扩大召回,整词匹配要求命中范围与词语边界一致。英文关键词还可统一是否区分大小写。
第四步:设置上下文样例。保留样例后,可以调整关键词左右各保留的字数,并限制每个关键词在每份材料中展示的样例数量。上下文用于复核命中的实际语义,不影响命中总数。

第五步:先读结果说明和命中概览。报告会概括总命中、高频词、未命中词、强概念组、最强共现组合和热点段落。概览同时展示文件数、段落数、关键词数、分组数、总命中和每文件平均命中关键词种类。

第六步:比较三种明细视角。文件视角比较每份材料的总命中、命中关键词种类和命中率,其中命中率等于命中关键词种类除以关键词总数;关键词视角比较词级总命中、段落覆盖和文件覆盖;分组视角比较组级总命中、段落覆盖与包含的关键词。

第七步:用矩阵定位并回到上下文。段落矩阵可以只看有命中的段落、全部段落或高频关键词列。分组共现矩阵用于寻找经常同段出现的概念组合。点击关键词或文件可以查看保留样例;点击矩阵单元格时,抽屉展示的是该关键词在同一文件中的样例,并不保证每条样例都来自被点击的具体段落,因此还要结合段落预览核对。
当材料超过800段时,矩阵保留命中较多的前800段;总命中、关键词覆盖、分组覆盖与共现统计仍基于全部段落。此时矩阵适合定位主要热点,不代表全部段落明细。


参数解析与对比示例
| 参数 | 说明 | 默认值 |
|---|---|---|
| 关键词来源 | 系统自动识别,或手动指定概念组 | 系统自动识别 |
| 最多识别关键词数 | 自动方式可在12到80个之间设置,步长为4 | 36个 |
| 最多形成分组数 | 自动方式可在3到12组之间设置 | 8组 |
| 手动概念组 | 每组填写分组名与关键词,同名分组会合并去重 | 空 |
| 热点单元粒度 | 按段落、按句子,或不输出热点清单;不改变主矩阵 | 按段落 |
| 匹配方式 | 子串匹配或整词匹配 | 子串匹配 |
| 区分英文大小写 | 关闭时忽略英文大小写差异 | 关闭 |
| 保留命中上下文样例 | 控制结果页是否展示命中语境 | 开启 |
| 左右上下文窗口 | 左右各保留5到200字,步长为5 | 30字 |
| 每关键词每文档样例数 | 结果页保留1到20条样例 | 5条 |
| 完成后邮件通知 | 任务完成后发送提醒,不改变统计结果 | 关闭 |
配置一:自动探索。关键词上限设为36,分组上限设为8,热点按段落,使用子串匹配。适合先观察材料中哪些词经常出现、哪些词在段落层面靠得较近。得到候选组后,再根据研究问题决定是否改为手动口径。
配置二:固定概念比较。手动建立3到6个概念组,把同义和近义表达放入对应组,热点按段落,保持子串匹配。适合政策口径、客户问题分类或访谈代码表已经明确的分析。
配置三:严格边界复核。沿用同一组手动关键词,把匹配方式改为整词,英文材料统一大小写设置,并保留更长的上下文窗口。适合检查组合词、缩写或英文词形是否带来额外命中。
案例分析
案例一:两份政策材料的概念覆盖。
背景:两份政策材料各保留3个独立段落,共6段。内容涉及数字化转型、智能化升级、数据治理、数据标准、数据安全、隐私保护和风险评估。
配置:手动建立转型、治理、风险3组,共7个关键词。使用子串匹配,不区分大小写,热点按段落,保留30字上下文。
结果:报告总命中20次。风险组命中9次,覆盖5段;治理组命中6次,覆盖全部6段;转型组命中5次,覆盖5段。转型与治理在5个段落里同时出现。命中最密集的段落有5次命中。
结论:治理组的总命中不是最高,但段落覆盖最广;风险组总命中最高,但有1段没有涉及。总命中和段落覆盖需要结合阅读。转型与治理同段5次只说明两组概念经常出现在同一段,不代表关系方向。
案例二:两份客户反馈的自动初筛。
背景:两份反馈材料各有3个独立段落,共6段,内容涉及配送、包装、客服回复、商品质量和售后处理。
配置:使用系统自动识别,关键词上限12,分组上限4,热点按段落,采用子串匹配并保留上下文样例。
结果:系统发现11个关键词并形成2组,总命中30次。自动形成的“包装”组命中25次,覆盖6段;“售后”组命中5次,覆盖2段。两组在2个段落里共同出现,命中最密集的段落有6次命中。
结论:自动结果快速暴露了包装、配送、客服和售后相关表达的集中位置,但“包装”组中也包含只是经常同段出现的其他词。这个结果适合发现线索。若后续要比较固定的产品、物流和服务分类,改用手动分组会更稳妥。
类似功能对比
| 功能 | 核心问题 | 主要结果 |
|---|---|---|
| KWIC关键词命中矩阵 | 多个概念组分布在哪些段落,哪些组经常同段出现 | 段落命中矩阵、覆盖、分组共现、热点单元 |
| KWIC关键词上下文索引 | 一个词每次出现时具体怎么使用 | 左右上下文、位置、密度与同行共现 |
| 高频词提取 | 哪些词在整批材料中出现得多 | 高频词与出现次数 |
| 词语共现分析 | 哪些词在设定范围内形成稳定词对 | 词对关系与共现强度 |
