返回教程列表
文本分析基础教程停用词挖掘中文文本分析Gries DP信息熵

停用词挖掘教程:中文专项优化与双指标筛选

本文以中文停用词挖掘为主线,说明 TATOOLS 在 Gries DP 与信息熵两种分布指标基础上,怎样加入中文分词与词性、通用词常见度、内置停用词表和原文语境筛选。文章保留段落词频表示、DP 与信息含量公式、双路排序交替去重、统一候选池最多 1500 个词、部分待复核词最多 250 个等实际口径,并说明中文按词、中文按字与英文按词的分支差异,帮助读者区分公文套语、功能词、具体实词和研究者仍需判断的保留范围。

作者:TATOOLS 研究团队|更新于 2026-09-09|6378 字|约 22 分钟读完
stopword-mining
立即使用

停用词挖掘不是把出现最多的词全部删掉。它先检查词语在不同段落中的分布,再筛出可供审阅的停用词候选。

TATOOLS 的【停用词挖掘】以 Gries DP 与信息熵两种分布指标为基础,针对中文做了大幅专项优化。 中文按词分析不止于计算分数,还结合中文分词与词性、通用词常见度、内置停用词表和原文语境,形成面向中文词语特点的筛选流程。

这些优化处理的是分布统计本身回答不了的问题:一个常见词是语法功能词,还是承载具体含义的实词?【开展】【推进】是在重复公文套语,还是在描述具体行动?一个高频词是通用表达,还是人名、机构名或专业术语?工具把这些中文区别纳入筛选,而不是直接把低分词当作停用词。

双指标同时运行,后续中文筛选共用一份候选池。输出是候选词表及统计结果,不是已经删除词语的原文。中文专项处理适用于按词模式;按字和英文按词保留分布统计路径。

理解这份结果,需要分清三件事:词出现得多不多,词集中在哪里,以及这个词是否应在你的研究中保留。

一、停用词取决于分析目的

停用词是为某项文本处理任务而排除的词,不是语言中一类天然无意义的词。

在词袋表示中,一段文本被转换成各个词的出现次数,词序不再进入这组计数。若某些词在各段中都反复出现,它们用于区分段落的作用就需要单独考察。但分布上的相似,不等于语义上可以删除。

《信息检索导论》指出,常见词可以被排除在检索词表之外,但同样的处理会影响短语和特定查询的含义。[1] 这说明停用词表必须与使用目的对应。

以政策文本为例,【开展】【推进】可以是重复出现的公文用语;如果研究问题正是政策行动如何表述,它们又是分析对象。否定词也是如此:是否保留,要看研究是否需要区分肯定与否定。

当前工具没有让用户填写研究问题的入口。它能够筛出符合现有分布与语言规则的候选,不能替研究者决定某个词是否与研究无关。

二、用段落词频表示语料

每个段落是一条观测

工具比较词语在有效段落之间的分布。每个段落是一条观测,每个词是一项特征,词在段落中的出现次数构成计数。

这组数据可以表示为段落与词语的频次表:行对应段落,列对应词语,单元格记录该词在该段出现了多少次。它保留了词语分布于哪些段落,却不保留词在段内的先后顺序。

段落包含的有效词次决定其大小。后面的分布指标以这个大小作为比较基准,而不是假定所有段落等长。

先区分词次与词种

同一个词重复出现,会增加词次,但不会增加不同词数。

数量统计对象
总词次所有有效分析单位的出现次数,包含重复
不同词数有效分析单位去重后的数量
某词总频次该词在全部有效段落中的出现次数
某词段落数至少出现过一次该词的有效段落数量

分布分析保留了每个词在每段中的次数,而不是只记这个词出现过没有。后面的 DP 和信息熵都从这组段落词频计算。

分段本身会改变结果

把一篇长文切成短段,会改变段落数量、段落长度以及词语的段落分布。同一份材料采用不同切法,得到不同分值并不矛盾,因为观测单位已经改变。

增加段落数量不等于增加独立材料来源。同一篇材料的多个段落,仍可能共享作者、主题和表达习惯。

当前候选筛选要求一个词至少出现在两个有效段落中。整份材料只有一个有效段落时,即使词频很高,也不能进入候选池。

三、DP 比较的是两个比例

【Gries DP 法】比较一个词实际分布在哪里,以及按段落大小应当分布在哪里。它采用 Gries 提出的比例偏离定义。[2]

设全部有效词次为 N,第 d 段的有效词次为 n_d。对词 w,设它在第 d 段出现 f_d 次,在全部段落中共出现 F 次。

两组比例分别是:

- 段落大小比例 q_d=n_d/N。

- 词语出现比例 p_d=f_d/F。

第一组比例的分母是全部词次,第二组比例的分母是该词的总频次。两个分母不能互换。

DP 的计算是:

DP=½ × 各段中|p_d-q_d|的总和。

DP 越接近零,词语的出现比例越贴近段落大小比例。这里的均匀,不是每段出现相同次数。长段占全部词次的比例更大,按这一基准也应容纳更多该词的出现次数。

一个来自原论文的算例

Gries 用三个各含 200 个词次的语料部分说明这一计算。某词共出现 9 次,两种分布如下。[2]

语料部分大小占比分布甲的出现次数分布乙的出现次数
第一部分三分之一39
第二部分三分之一30
第三部分三分之一30

分布甲的词语出现比例与大小比例完全一致,DP 为零。

分布乙全部集中在第一部分。三个比例差的绝对值分别为三分之二、三分之一、三分之一,求和再除以二,DP 为三分之二。

两种分布的总频次相同,DP 不同。只看词频,会丢掉这种差别。

这个算例用于解释公式,不是工具实跑结果。它也不代表当前默认设置下的入选结果:总频次 9 低于默认最低总频次 10,分布乙还不满足至少出现于两个段落的条件。

DP 不是停用词概率,也不是显著性检验。分值位于零到一之间,不表示越过某条通用界线,就能确认一个词可以删除。固定语料划分下,全部集中在一段时的 DP 也不一定等于一。

四、信息熵法衡量什么

信息熵先把一个词在各段的出现比例压缩成一个数。

仍用 p_d 表示某词在第 d 段的出现比例,它的段落分布熵为:

H(w)=-Σ p_d ln p_d。

求和遍历段落,没有出现该词的段落不贡献这一项。词只出现在一段时,H(w)为零;在出现次数允许的情况下,词越平均地分散到各段,熵越高。

当前工具另外计算段落大小分布的熵:

H基准=-Σ q_d ln q_d。

随后生成报告中的【信息含量】:

I(w)=max{零,H基准-H(w)}。

这里采用自然对数,单位是 nat,页面写作 nats。当前实现把负差值统一记为零。

低信息含量不等于分布完全相同

两组不同的分布可以具有相同的熵。熵只保留一个汇总数,不保留各个比例对应哪一段的信息。

因此,I(w)为零不能证明该词完全按段落大小分布。它既可能来自两项熵相等,也可能来自词语分布熵高于基准、负差值被截为零。

DP 则逐段比较两组比例。若要判断词语出现比例是否贴近段落大小比例,DP 的含义更直接。信息熵法与 DP 法提供的是不同的排序依据,不是两个可以互换的分数。

当前实现不是原论文的完整复现

Gerlach、Shi 与 Amaral 在 2019 年提出的信息论方法,会在保持每个词总频次和每篇文档长度的条件下随机打乱词的位置,再估计随机分布下的平均熵。[3]

原论文的期望熵随词频变化,用于处理有限出现次数带来的影响。当前工具没有执行这一随机化估计,而是用同一个段落大小分布熵作为全部词的基准。

所以,当前【信息含量】应按上面的实际公式解释,不能直接套用原论文的显著性结论、筛选阈值或实验收益。

还有一个容易读反的位置:当 I(w)接近 H基准时,说明 H(w)接近零,词的出现集中在很少的段落;这不是随机散布的表现。

五、TATOOLS 怎样针对中文做专项优化

DP 与信息熵提供分布线索,TATOOLS 在此基础上增加中文词级处理与语境筛选。这不是给原始方法换一个中文名称,而是改变分布排序进入候选表之前的处理过程。

第一步:形成可比较的词池

进入词池需要同时满足两个条件:

1. 总频次达到【最低总频次】。

2. 至少在两个有效段落中出现。

工具会分别建立两份词池:一份按 DP 升序,另一份按信息含量升序。两份词池都要求总频次达到【最低总频次】、至少在两个有效段落中出现;同分时依次优先分布率更高、总频次更高、词本身字典序更靠前的词。

随后按名次从两条排序路线轮流取词并去重,形成统一候选池排名。进入后续规则与语境复核的最多 1500 个词,来自这份统一排名。

因此,最终候选不是全部词语的逐一语义判定。未进入候选,也可能只是未达到频次要求、只出现于一段,或未进入统一词池的前 1500 名。

第二步:用中文词性与通用常见度分流

中文按词模式先分词并记录词性,再结合内置停用词表和中文通用词的常见程度分流。只看本批材料的词频,难以区分通用表达与在专业材料中反复出现的术语;加入这些线索后,两类词不再仅凭相似的分布分数走同一条筛选路径。

处理路径使用的线索对候选表的影响
规则直接收录命中内置停用词表,或符合通用常见度与功能词词性规则进入候选
规则不收录符合参考词表未收录、通用常见度较低或专名词性等规则不进入最终候选
语境复核前两类规则尚未确定的词根据原文片段再筛选

这些是程序的筛选规则,不是对词语本体的证明。参考词表中没有某个词,不意味着它一定是专有名词;词性识别为某一类,也不意味着它在所有句子中都承担同一种作用。

【通用 IDF】用于提供另一套参考文本中的常见程度线索。IDF 较低,表示在相应参考文本中分布较广;较高,表示分布较窄。[4] 它既不是词义的重要程度,也不是本批语料中的词频。

本语料 IDF 是另一项统计:它依据当前有效段落数和该词出现段落数计算,采用加一平滑。两套 IDF 的参考集合和计算口径不同,不能把数值差直接解释为领域专属性。

第三步:回到原句,区分套语与实义词

中文专项处理还针对虚词、公文套语与实义词设置了不同的语境判别规则。【开展】【推进】等动词,以及【工作】【方面】等抽象词,需要结合原句区分空泛用法与具体含义;人名、机构名、学科术语、具体行为和指代具体事物的词,按不纳入停用候选的方向复核,拿不准时不收录。

这一环节使用词在当前材料中的原文片段,而不是只查固定词表。它与前面的分词、词性和通用常见度规则共同构成中文专项优化,不属于 DP 或信息熵原始公式本身。

待复核词中最多有 250 个进入语境复核,优先处理通用常见度位于规则中间区域的词。复核使用抽取的原文片段,不遍历该词在全文中的全部用法。

规则已确定的两类词还会各抽取一部分复核,但抽检意见不直接推翻规则结果。统一词池只进入这条复核路线一次,不按两种分布指标重复复核。因此,最终候选总数不等于语境复核保留数。

候选表中的【判断依据】可能来自规则说明,也可能是统一的判断标签。它不是逐词生成的完整论证,更不是对所有原句的人工审定记录。

语言和切分单位会改变处理路径

分析方式实际使用的主要路径
中文按词分布排序、词表与词性规则、部分词的语境复核
中文按字汉字分布排序,不执行中文词级规则和语境复核,最多返回 50 个统计候选
英文按词拉丁词形转为小写后统计,不执行中文词级规则和语境复核,最多返回 50 个统计候选

当前英文按字会受到单字符过滤,不能形成可用的英文按字挖掘结果。英文材料应使用按词模式。

若中文按词的语境复核未能执行,规则直接收录的候选仍会保留,并从按通用常见度与合并名次排序的待复核词中补入最多 50 个。这部分结果没有完成语境复核,不能与已复核词作同样解释。

六、报告类别按词表命中读取

当前报告把候选表统一分成【全部候选】【内置词表外】和【命中内置词表】,另列【未入选词】。

内置词表外=全部候选中,未命中内置停用词表的词。

这里没有拿其他领域的语料做对照,也没有估计一个词专属于某个领域的程度。【内置词表外】不等于经过跨领域比较确认的专属词,更不等于已经确认应该删除的领域词。

【命中内置词表】表示词表成员匹配。当前流程并不先把这些词从统计中删除;符合词池要求的已知停用词可以进入候选。

【未入选词】最多包含 100 个词,来源包括规则未收录的词、语境复核未选中的词,以及尚未进入完整复核的词。

所以,不能把【未入选词】全部解释成已经被语境复核否决的词,也不能把它当作另一份已确认的保留词表。

候选本质上仍是按词汇总的清单。同一个词在不同句子中可以有不同用法,而词表不记录哪些具体句子应该保留它。

七、语料范围与参数作用

语料需要对应同一个分析目的。若把政策正文、评论和文献目录混在一起,分布指标会共同统计这些内容,不会自动把它们分成不同研究对象。

同一个词在单一主题语料中可以广泛分布,在跨主题语料中又可以集中于其中一类。它的分布分值描述的是相对于本批语料的关系,不是脱离语料仍然成立的固定属性。

分析单位决定比较尺度

按词与按字改变的是特征本身。词级统计保留分词后的词汇单位,字级统计则把不同词中出现的同一个汉字合并计数。字的分布不能直接替代包含它的词的分布。

段落划分改变的是观测尺度。较大的段落会把局部差异汇总,较小的段落会呈现更细的分布差异。比较两次结果时,需要保持语料范围、切分单位和段落划分一致。

最低频次决定哪些词进入比较

【最低总频次】是实际的词池准入条件。提高这一门槛,会排除出现次数较少的词;降低门槛,则让更多低频词进入比较。

低频词可用于描述分布的出现次数有限。因此,最低频次约束与分布分值承担不同作用:前者限制计数基础,后者描述这些计数如何分配。一个词频次足够高,不意味着它分布均匀;分值较低,也不替代最低频次要求。

分布分值与参考线不是同一件事

DP 和信息含量同时用于建立统一词池排名。页面中的【DP 参考线】和【信息含量参考线】只画在对应散点图上,不参与候选硬筛选。 最终候选还取决于词表、词性和语境复核路径,不能仅凭某个点是否位于参考线下判断。

八、结果指标与解释范围

先确认数字的分母

报告内容应按什么口径读取
【语料段落数】实际进入统计的有效段落数
【总词次】过滤后分析单位的全部出现次数,包含重复
【不同词数】去重后的分析单位数量
某词【总频次】该词在有效语料中出现多少次
某词【段落数】与【分布率】出现该词的有效段落数,以及它占全部有效段落的比例
【候选排名】统一词池的名次;历史结果未记录排名时保持原返回顺序,不能反推经过双路合并
【DP】与【信息含量】同一行并列展示的两项分布指标,不是两个独立候选表

段落分布率与 DP 也不能互换。分布率只问多少段出现过这个词;DP 还比较它在各段中出现的次数比例。

同一行中的【来源】说明是否命中内置停用词表,不应读作对这个词领域属性的鉴定。

散点图展示分布,不替代候选判定

报告同时显示两张散点图:一张纵轴为 DP,一张纵轴为信息含量。每个点对应一个词或字。

- 横轴都是总频次加一后的十进制对数。越靠右,出现次数越多。

- 纵轴分别显示 DP 或信息含量。DP 越低,越贴近段落大小比例;信息含量越低,表示截断后的熵差越小。

- 图中的【DP 参考线】和【信息含量参考线】只改变图示位置,不是当前最终候选的划分边界。

信息含量图中的【截断熵差上限】线尤其容易读反。纵轴画的是信息含量,不是词语分布熵;信息含量接近这条线,表示词语分布熵接近零,不能解释成该词分布得最均匀。

词表较大时,两张散点图会保留候选点,并从其他词中抽取部分点。因此,图上点的密度和类别比例不能替代全量词表统计。

参考资料与口径说明

本文的方法说明依据以下原始论文与教材;处理分支和报告口径依据当前实现。文中的三段分布算例来自 Gries 原论文。

1. Manning、Raghavan 与 Schütze,2008,Introduction to Information Retrieval,【Dropping common terms:stop words】。用于说明停用词与处理目的的关系,以及删除常见词对短语含义的影响。教材章节

2. Gries,2008,Dispersions and adjusted frequencies in corporaInternational Journal of Corpus Linguistics,13(4),403—437。DP 定义及三段算例见第 3 节、表 2 与表 3。作者提供的全文

3. Gerlach、Shi 与 Amaral,2019,A universal information theoretic approach to the identification of stopwordsNature Machine Intelligence,1,606—612。随机化基准与信息含量定义见 Model 部分。期刊页面作者机构提供的全文

4. Manning、Raghavan 与 Schütze,2008,Introduction to Information Retrieval,【Inverse document frequency】。用于区分词频、文档频率和 IDF 的参考集合。教材章节