停用词挖掘
领域语料中常见高频低信息词在各段近乎均匀散布,仅靠通用停用词表难以盖全本领域特有噪声。
按段落比较各词分布与按段长加权的均匀散布基准;主指标可在Gries DP 或信息熵法中二选一,并保留另一分数互验。中文按词时对照通用语料词稀有度,以降低专业实词误判。
指标卡区分领域特有候选与命中已知通用停用词;表内列出频次、分布率、主副分数与词性,散点图同列频次与得分。可据表收窄自定停用词口径,减轻词频、共现或主题中的背景词干扰。
适用于判决、合同等文书中反复出现的程序性套语,也适用于医学问诊或客服对话里高频但不承载实质信息的口径词。
空行分隔的每个段落算一份小文档(CSV 每个非空单元格算一段),工具靠段落之间的分布差异挑停用词。没有空行的文件会退化成按行切分,整篇挤成一行时只剩 1 段,所有词的分布都变成 100%,结果不可用;这类材料请打开下方的自动分段。
上传一份已分段的 .txt 或 .csv 文件即可。段落数越多统计越稳健,建议 ≥ 30 段;< 5 段时报告会显式提示"样本不足"。
分布离散度 · 推荐。Deviation of Proportions ∈ [0, 1],DP ≈ 0 时词的分布几乎和段落大小分布一致,越像停用词;DP ≈ 1 时高度集中在少数段,是典型的内容词。
本工具相对原论文做了哪些改造?
- 稀疏 DP 加速:Gries 原文按"枚举所有文档"求和,本实现改为 只遍历该词出现过的段落,配合
DP = ½ · [Σ|p_obs−p_exp| + (1−Σp_exp_in)]闭式化简, 百万词级语料也能秒级跑完。 - 段落大小先验:把原文中每个文档"等权 1/N"的零模型替换为按 段落实际词数加权(
p_exp(d) = n_d / N),更贴合中文长短段混合的真实文本。 - 有限样本截断:信息含量法在小语料里会出现
I(w) < 0的数值噪声,本实现统一 clip 到[0, H_null]并归一化为I_norm,让"距离完美停用词还差多少"这件事可读。 - 双指标互验:每行结果同时输出 entropy 与 dispersion 两个分数, 方法切换不影响产物可对比,便于研究者横向验证。
想挖"高频字"(如"的 / 了 / 是"等单字停用候选)才用按字模式;多数场景请保持按词。
DP ∈ [0, 1],越接近 0 越像停用词。推荐 0.3–0.5;调到 0.2 以下通常只剩极少最像 "的 / 是"的词;调到 0.7+ 会把不少主题词也带进来。
过滤"在整份语料里只出现 1–2 次"的偶发词;段落越多可调越高。 注意:只在 1 个段落里出现过的词不参与候选(无分布可言)。
开启后,对超长段落自动按窗口 + 标点优先策略重新切分,确保有足够的段落数供统计使用。 段落数 ≥ 30 时统计最稳健;< 5 段时结果基本不可用。 如果你的文件段落数不足,建议开启此选项。 CSV 文件不受影响(每个非空单元格已视为一段)。
每 20,000 字 2 点
