KWIC是“关键词在上下文中”的索引方式。普通词频表把同一个词的所有出现合并成一个数字,KWIC则把每次命中的左右文字排成一行。纵向阅读这些行,可以观察关键词前后常接哪些词,也可以区分目标、问题、否定、条件等不同用法。

检索时可选择子串匹配或整词匹配。子串匹配只要字符连续出现就计入,因此召回更宽;整词匹配要求命中范围与词语边界一致,更适合排除组合词里的附带命中。英文材料还可控制是否区分大小写。多个关键词会在同一轮检索中处理,每次命中都保留行号、字符位置和在文档中的相对位置。

没有预设研究词时,自动选取会先从材料中找高频词,再按选定词类筛选。页面提供名词、动词、形容词和动名词四类,默认只看名词。自动词适合语料速览;已有明确研究问题时,手动关键词更容易保持不同批次之间的口径一致。

适用文档

政策、法规和制度材料适合用KWIC比较同一概念在不同条款中的表述。材料最好保留清晰的段落或行结构,因为报告会显示原始行号,并按同一行统计关键词共现。若原文整篇只有一行,共现范围会变得过宽。

访谈、开放题和客户反馈适合围绕研究问题检索原话。每条内容应尽量保留完整句子。过短片段缺少左右语境,窗口即使调大也无法补回省略的信息;一条内容同时塞入多个无关议题,也会使同行共现难以解释。

媒体、学术和行业材料适合比较术语的搭配与位置。中文、英文及混合文本都能检索,但英文缩写需要先统一大小写口径。组合词较多时,可先用子串扩大召回,再用整词结果对照,确认额外命中来自哪里。

不同材料长度差异较大时,不能只比较命中数。每千字密度把命中次数按字数归一化,更适合横向观察。短材料的密度容易被一两次命中放大,因此仍要结合总字数、命中数和上下文共同判断。

使用步骤

第一步:确定检索问题和关键词来源。已有概念框架时手动输入关键词;需要先了解材料常见话题时开启自动选取,并选择数量与词类。两种来源在页面中互斥。


第二步:设置上下文和匹配口径。根据句子长度调整左右窗口,再选择子串或整词。英文材料同时确定是否区分大小写,后续对比都保持同一设置。


第三步:设置默认排序和命中上限。按位置排序适合恢复阅读顺序;按左侧词或右侧词排序适合寻找固定搭配。高频词命中过多时,用保留上限控制报告规模。


第四步:先读整体概览和自动洞察。确认关键词数、文档数、总字数、总命中和每千字密度,再看高频词、广泛话题、集中出现、无命中与强共现等提示。


第五步:在逐词明细中选择复核对象。命中数看绝对规模,命中文档数看覆盖,每千字密度看相对集中程度。零命中词也值得检查,它可能说明概念缺席,也可能说明关键词或匹配方式不合适。


第六步:纵向阅读KWIC表。表格按文档和行号展示左右语境,每页20条。可以在报告中切换关键词,也可以临时改为按左侧词或右侧词排序,比较常见搭配。


第七步:结合位置、共现和文档明细复核。位置分布中的每个点代表一次命中;同行共现统计两个词在多少行原文中同时出现;文档明细则给出各文档字数、命中和密度。


参数解析与对比示例

参数说明默认值
手动关键词最多输入50个检索词,自动选取开启时停用
自动选取高频词从材料中按词频选择检索词,与手动关键词互斥关闭
自动选取数量自动方式选择5到50个高频词20个
自动词类可选名词、动词、形容词、动名词;全不选表示不限名词
左右上下文窗口每次命中左右各保留5到200字30字
匹配方式子串匹配或整词匹配子串匹配
区分英文大小写控制英文检索词的大小写是否分别统计关闭
表格默认排序按出现位置、左侧词或右侧词按出现位置
每词命中上限页面可设100到5000条;限制高频词保留规模1000条
完成后邮件通知任务结束后发送提醒,不改变分析结果关闭

配置一:明确概念检索。手动输入研究词,左右窗口设为30字,使用子串匹配,按出现位置排序。适合政策概念、产品名或议题词的完整召回。

配置二:严格词边界对照。使用同一组手动关键词,把匹配方式改为整词,英文材料统一大小写设置。适合排查组合词和缩写是否带来额外命中。

配置三:语料速览。开启自动选取,先取20个词并保留名词筛选,窗口保持30字。报告中找到值得研究的词后,可改为手动关键词再次运行,形成更稳定的比较口径。

案例分析

案例一:两份政策材料的概念交叉检索。

背景:准备两份共134字的短材料,内容涉及数字化转型、数据治理、数据安全、公共服务和数据质量。

配置:手动输入“数字化转型”“数据治理”“数据安全”,左右窗口设为12字,采用子串匹配,不区分大小写,每词命中上限1000条。

结果:总命中11次。“数字化转型”命中4次,“数据治理”命中4次,“数据安全”命中3次。两份材料分别命中6次和5次。“数字化转型”与“数据安全”在3行原文中同时出现,与“数据治理”同行2次,“数据安全”与“数据治理”同行1次。

结论:三个概念在两份材料中都有出现,但同行强度不同。共现最多的一对是“数字化转型”与“数据安全”,这只说明它们在样本文本中更常同处一行,不能据此推断因果或政策关系。134字样本很短,密度会被放大,主要用于演示报告读法。

案例二:子串与整词匹配的口径差异。

背景:一段材料包含两次独立的“AI”,另有一次“AIGC”。研究目标是统计“AI”作为独立缩写出现的次数。

配置:关键词均为“AI”,左右窗口8字,不区分大小写。第一次使用子串匹配,第二次只把匹配方式改为整词。

结果:子串匹配命中3次,包括“AIGC”中的字符;整词匹配命中2次,只保留两个独立词边界上的“AI”。

结论:需要覆盖组合词时,子串匹配提供更宽的召回;研究独立词项时,整词匹配更贴近目标。两组结果的差值本身就是复核线索,适合回到KWIC表查看被过滤的语境。

类似功能对比

功能核心问题主要结果
KWIC关键词上下文索引关键词每次出现时具体在说什么左右语境、命中与覆盖、位置分布、同行共现
高频词提取哪些词整体出现得多高频词及次数
词语共现分析哪些词在设定范围内经常一起出现词对关系与共现强度