语料对比关键词分析图标语料对比关键词分析

用于在一份(想分析的文本)(目标语料)和一份(常见说法的对照)(参考语料)之间做词频对比,识别目标里反复强调的特征词,以及密度明显偏低、相对回避的话题

对每个词构造 2×2 列联表,同时计算 Log-likelihood、Chi-square 与 Log-ratio 三种关键性统计量:前两者衡量"差异显著程度",后者突出"差异倍数",三者互为印证、避免单一指标的偏见。

报告分别给出过度代表不足代表的词表,配 Top N 条形图、可按任一统计量排序的详情表,并附 目标 PMW参考 PMW、期望频次与 p 值;过度代表词可当作特征词或标签,不足代表词可作为话题缺口的检查清单

适合自家品牌评论对照行业评论梳理用户的卖点与槽点,也适合政策文本对照通用新闻提取本期文件的新提法与口径变化。

支持一篇或多篇 txt / csv,自动按句切词后统计词频。

加载文件上传组件中...

上传 txt 文件,或直接把整段参考文本贴到下方文本框;不需要任何额外的内置词频表。

加载文件上传组件中...

建议提供 至少 5 万字 的参考语料,才有足够的统计稳健性;越大越好。

没有参考语料?一键填入下面的示例文本(仅作演示,真实分析请用更大语料)

点击后会自动切换到【直接输入参考文本】模式,并把示例文本填入文本框,可在此基础上修改。

默认同时计算并展示三种关键性统计量: Log-likelihood(Dunning 1993,主流首选)、 Chi-squareLog-ratio(Hardie 2014)。 LL 与 χ² 偏向高频词;log-ratio 更突出"差异倍数"。 报告里三种统计量会分别给出 Top N 条形图,详情表也支持按任一统计量排序。

5 次

过滤"在目标里只出现 1-2 次"的词,避免低频噪声。短文本可调到 2-3,长文本建议 5-10。

200 个

报告分别保留 N 个过度代表词 + N 个不足代表词。

强烈建议开启:否则关键词排行的最前列大概率会被【的、是、和、了、the、of、a】这类高频功能词淹没。 目标语料与参考语料会同步使用这套停用词,保证 keyness 统计前后一致。

系统停用词与自定义停用词会取并集;关闭自定义停用词时会自动清空已上传文件。

每 20,000 字 2 点