停用词挖掘不是把出现最多的词全部删掉。它先检查词语在不同段落中的分布,再筛出可供审阅的停用词候选。
TATOOLS 的【停用词挖掘】以 Gries DP 与信息熵两种分布指标为基础,针对中文做了大幅专项优化。 中文按词分析不止于计算分数,还结合中文分词与词性、通用词常见度、内置停用词表和原文语境,形成面向中文词语特点的筛选流程。
这些优化处理的是分布统计本身回答不了的问题:一个常见词是语法功能词,还是承载具体含义的实词?【开展】【推进】是在重复公文套语,还是在描述具体行动?一个高频词是通用表达,还是人名、机构名或专业术语?工具把这些中文区别纳入筛选,而不是直接把低分词当作停用词。
双指标同时运行,后续中文筛选共用一份候选池。输出是候选词表及统计结果,不是已经删除词语的原文。中文专项处理适用于按词模式;按字和英文按词保留分布统计路径。
理解这份结果,需要分清三件事:词出现得多不多,词集中在哪里,以及这个词是否应在你的研究中保留。
一、停用词取决于分析目的
停用词是为某项文本处理任务而排除的词,不是语言中一类天然无意义的词。
在词袋表示中,一段文本被转换成各个词的出现次数,词序不再进入这组计数。若某些词在各段中都反复出现,它们用于区分段落的作用就需要单独考察。但分布上的相似,不等于语义上可以删除。
《信息检索导论》指出,常见词可以被排除在检索词表之外,但同样的处理会影响短语和特定查询的含义。[1] 这说明停用词表必须与使用目的对应。
以政策文本为例,【开展】【推进】可以是重复出现的公文用语;如果研究问题正是政策行动如何表述,它们又是分析对象。否定词也是如此:是否保留,要看研究是否需要区分肯定与否定。
当前工具没有让用户填写研究问题的入口。它能够筛出符合现有分布与语言规则的候选,不能替研究者决定某个词是否与研究无关。
二、用段落词频表示语料
每个段落是一条观测
工具比较词语在有效段落之间的分布。每个段落是一条观测,每个词是一项特征,词在段落中的出现次数构成计数。
这组数据可以表示为段落与词语的频次表:行对应段落,列对应词语,单元格记录该词在该段出现了多少次。它保留了词语分布于哪些段落,却不保留词在段内的先后顺序。
段落包含的有效词次决定其大小。后面的分布指标以这个大小作为比较基准,而不是假定所有段落等长。
先区分词次与词种
同一个词重复出现,会增加词次,但不会增加不同词数。
| 数量 | 统计对象 |
|---|---|
| 总词次 | 所有有效分析单位的出现次数,包含重复 |
| 不同词数 | 有效分析单位去重后的数量 |
| 某词总频次 | 该词在全部有效段落中的出现次数 |
| 某词段落数 | 至少出现过一次该词的有效段落数量 |
分布分析保留了每个词在每段中的次数,而不是只记这个词出现过没有。后面的 DP 和信息熵都从这组段落词频计算。
分段本身会改变结果
把一篇长文切成短段,会改变段落数量、段落长度以及词语的段落分布。同一份材料采用不同切法,得到不同分值并不矛盾,因为观测单位已经改变。
增加段落数量不等于增加独立材料来源。同一篇材料的多个段落,仍可能共享作者、主题和表达习惯。
当前候选筛选要求一个词至少出现在两个有效段落中。整份材料只有一个有效段落时,即使词频很高,也不能进入候选池。
三、DP 比较的是两个比例
【Gries DP 法】比较一个词实际分布在哪里,以及按段落大小应当分布在哪里。它采用 Gries 提出的比例偏离定义。[2]
设全部有效词次为 N,第 d 段的有效词次为 n_d。对词 w,设它在第 d 段出现 f_d 次,在全部段落中共出现 F 次。
两组比例分别是:
- 段落大小比例 q_d=n_d/N。
- 词语出现比例 p_d=f_d/F。
第一组比例的分母是全部词次,第二组比例的分母是该词的总频次。两个分母不能互换。
DP 的计算是:
DP=½ × 各段中|p_d-q_d|的总和。
DP 越接近零,词语的出现比例越贴近段落大小比例。这里的均匀,不是每段出现相同次数。长段占全部词次的比例更大,按这一基准也应容纳更多该词的出现次数。
一个来自原论文的算例
Gries 用三个各含 200 个词次的语料部分说明这一计算。某词共出现 9 次,两种分布如下。[2]
| 语料部分 | 大小占比 | 分布甲的出现次数 | 分布乙的出现次数 |
|---|---|---|---|
| 第一部分 | 三分之一 | 3 | 9 |
| 第二部分 | 三分之一 | 3 | 0 |
| 第三部分 | 三分之一 | 3 | 0 |
分布甲的词语出现比例与大小比例完全一致,DP 为零。
分布乙全部集中在第一部分。三个比例差的绝对值分别为三分之二、三分之一、三分之一,求和再除以二,DP 为三分之二。
两种分布的总频次相同,DP 不同。只看词频,会丢掉这种差别。
这个算例用于解释公式,不是工具实跑结果。它也不代表当前默认设置下的入选结果:总频次 9 低于默认最低总频次 10,分布乙还不满足至少出现于两个段落的条件。
DP 不是停用词概率,也不是显著性检验。分值位于零到一之间,不表示越过某条通用界线,就能确认一个词可以删除。固定语料划分下,全部集中在一段时的 DP 也不一定等于一。
四、信息熵法衡量什么
信息熵先把一个词在各段的出现比例压缩成一个数。
仍用 p_d 表示某词在第 d 段的出现比例,它的段落分布熵为:
H(w)=-Σ p_d ln p_d。
求和遍历段落,没有出现该词的段落不贡献这一项。词只出现在一段时,H(w)为零;在出现次数允许的情况下,词越平均地分散到各段,熵越高。
当前工具另外计算段落大小分布的熵:
H基准=-Σ q_d ln q_d。
随后生成报告中的【信息含量】:
I(w)=max{零,H基准-H(w)}。
这里采用自然对数,单位是 nat,页面写作 nats。当前实现把负差值统一记为零。
低信息含量不等于分布完全相同
两组不同的分布可以具有相同的熵。熵只保留一个汇总数,不保留各个比例对应哪一段的信息。
因此,I(w)为零不能证明该词完全按段落大小分布。它既可能来自两项熵相等,也可能来自词语分布熵高于基准、负差值被截为零。
DP 则逐段比较两组比例。若要判断词语出现比例是否贴近段落大小比例,DP 的含义更直接。信息熵法与 DP 法提供的是不同的排序依据,不是两个可以互换的分数。
当前实现不是原论文的完整复现
Gerlach、Shi 与 Amaral 在 2019 年提出的信息论方法,会在保持每个词总频次和每篇文档长度的条件下随机打乱词的位置,再估计随机分布下的平均熵。[3]
原论文的期望熵随词频变化,用于处理有限出现次数带来的影响。当前工具没有执行这一随机化估计,而是用同一个段落大小分布熵作为全部词的基准。
所以,当前【信息含量】应按上面的实际公式解释,不能直接套用原论文的显著性结论、筛选阈值或实验收益。
还有一个容易读反的位置:当 I(w)接近 H基准时,说明 H(w)接近零,词的出现集中在很少的段落;这不是随机散布的表现。
五、TATOOLS 怎样针对中文做专项优化
DP 与信息熵提供分布线索,TATOOLS 在此基础上增加中文词级处理与语境筛选。这不是给原始方法换一个中文名称,而是改变分布排序进入候选表之前的处理过程。
第一步:形成可比较的词池
进入词池需要同时满足两个条件:
1. 总频次达到【最低总频次】。
2. 至少在两个有效段落中出现。
工具会分别建立两份词池:一份按 DP 升序,另一份按信息含量升序。两份词池都要求总频次达到【最低总频次】、至少在两个有效段落中出现;同分时依次优先分布率更高、总频次更高、词本身字典序更靠前的词。
随后按名次从两条排序路线轮流取词并去重,形成统一候选池排名。进入后续规则与语境复核的最多 1500 个词,来自这份统一排名。
因此,最终候选不是全部词语的逐一语义判定。未进入候选,也可能只是未达到频次要求、只出现于一段,或未进入统一词池的前 1500 名。
第二步:用中文词性与通用常见度分流
中文按词模式先分词并记录词性,再结合内置停用词表和中文通用词的常见程度分流。只看本批材料的词频,难以区分通用表达与在专业材料中反复出现的术语;加入这些线索后,两类词不再仅凭相似的分布分数走同一条筛选路径。
| 处理路径 | 使用的线索 | 对候选表的影响 |
|---|---|---|
| 规则直接收录 | 命中内置停用词表,或符合通用常见度与功能词词性规则 | 进入候选 |
| 规则不收录 | 符合参考词表未收录、通用常见度较低或专名词性等规则 | 不进入最终候选 |
| 语境复核 | 前两类规则尚未确定的词 | 根据原文片段再筛选 |
这些是程序的筛选规则,不是对词语本体的证明。参考词表中没有某个词,不意味着它一定是专有名词;词性识别为某一类,也不意味着它在所有句子中都承担同一种作用。
【通用 IDF】用于提供另一套参考文本中的常见程度线索。IDF 较低,表示在相应参考文本中分布较广;较高,表示分布较窄。[4] 它既不是词义的重要程度,也不是本批语料中的词频。
本语料 IDF 是另一项统计:它依据当前有效段落数和该词出现段落数计算,采用加一平滑。两套 IDF 的参考集合和计算口径不同,不能把数值差直接解释为领域专属性。
第三步:回到原句,区分套语与实义词
中文专项处理还针对虚词、公文套语与实义词设置了不同的语境判别规则。【开展】【推进】等动词,以及【工作】【方面】等抽象词,需要结合原句区分空泛用法与具体含义;人名、机构名、学科术语、具体行为和指代具体事物的词,按不纳入停用候选的方向复核,拿不准时不收录。
这一环节使用词在当前材料中的原文片段,而不是只查固定词表。它与前面的分词、词性和通用常见度规则共同构成中文专项优化,不属于 DP 或信息熵原始公式本身。
待复核词中最多有 250 个进入语境复核,优先处理通用常见度位于规则中间区域的词。复核使用抽取的原文片段,不遍历该词在全文中的全部用法。
规则已确定的两类词还会各抽取一部分复核,但抽检意见不直接推翻规则结果。统一词池只进入这条复核路线一次,不按两种分布指标重复复核。因此,最终候选总数不等于语境复核保留数。
候选表中的【判断依据】可能来自规则说明,也可能是统一的判断标签。它不是逐词生成的完整论证,更不是对所有原句的人工审定记录。
语言和切分单位会改变处理路径
| 分析方式 | 实际使用的主要路径 |
|---|---|
| 中文按词 | 分布排序、词表与词性规则、部分词的语境复核 |
| 中文按字 | 汉字分布排序,不执行中文词级规则和语境复核,最多返回 50 个统计候选 |
| 英文按词 | 拉丁词形转为小写后统计,不执行中文词级规则和语境复核,最多返回 50 个统计候选 |
当前英文按字会受到单字符过滤,不能形成可用的英文按字挖掘结果。英文材料应使用按词模式。
若中文按词的语境复核未能执行,规则直接收录的候选仍会保留,并从按通用常见度与合并名次排序的待复核词中补入最多 50 个。这部分结果没有完成语境复核,不能与已复核词作同样解释。
六、报告类别按词表命中读取
当前报告把候选表统一分成【全部候选】【内置词表外】和【命中内置词表】,另列【未入选词】。
内置词表外=全部候选中,未命中内置停用词表的词。
这里没有拿其他领域的语料做对照,也没有估计一个词专属于某个领域的程度。【内置词表外】不等于经过跨领域比较确认的专属词,更不等于已经确认应该删除的领域词。
【命中内置词表】表示词表成员匹配。当前流程并不先把这些词从统计中删除;符合词池要求的已知停用词可以进入候选。
【未入选词】最多包含 100 个词,来源包括规则未收录的词、语境复核未选中的词,以及尚未进入完整复核的词。
所以,不能把【未入选词】全部解释成已经被语境复核否决的词,也不能把它当作另一份已确认的保留词表。
候选本质上仍是按词汇总的清单。同一个词在不同句子中可以有不同用法,而词表不记录哪些具体句子应该保留它。
七、语料范围与参数作用
语料需要对应同一个分析目的。若把政策正文、评论和文献目录混在一起,分布指标会共同统计这些内容,不会自动把它们分成不同研究对象。
同一个词在单一主题语料中可以广泛分布,在跨主题语料中又可以集中于其中一类。它的分布分值描述的是相对于本批语料的关系,不是脱离语料仍然成立的固定属性。
分析单位决定比较尺度
按词与按字改变的是特征本身。词级统计保留分词后的词汇单位,字级统计则把不同词中出现的同一个汉字合并计数。字的分布不能直接替代包含它的词的分布。
段落划分改变的是观测尺度。较大的段落会把局部差异汇总,较小的段落会呈现更细的分布差异。比较两次结果时,需要保持语料范围、切分单位和段落划分一致。
最低频次决定哪些词进入比较
【最低总频次】是实际的词池准入条件。提高这一门槛,会排除出现次数较少的词;降低门槛,则让更多低频词进入比较。
低频词可用于描述分布的出现次数有限。因此,最低频次约束与分布分值承担不同作用:前者限制计数基础,后者描述这些计数如何分配。一个词频次足够高,不意味着它分布均匀;分值较低,也不替代最低频次要求。
分布分值与参考线不是同一件事
DP 和信息含量同时用于建立统一词池排名。页面中的【DP 参考线】和【信息含量参考线】只画在对应散点图上,不参与候选硬筛选。 最终候选还取决于词表、词性和语境复核路径,不能仅凭某个点是否位于参考线下判断。
八、结果指标与解释范围
先确认数字的分母
| 报告内容 | 应按什么口径读取 |
|---|---|
| 【语料段落数】 | 实际进入统计的有效段落数 |
| 【总词次】 | 过滤后分析单位的全部出现次数,包含重复 |
| 【不同词数】 | 去重后的分析单位数量 |
| 某词【总频次】 | 该词在有效语料中出现多少次 |
| 某词【段落数】与【分布率】 | 出现该词的有效段落数,以及它占全部有效段落的比例 |
| 【候选排名】 | 统一词池的名次;历史结果未记录排名时保持原返回顺序,不能反推经过双路合并 |
| 【DP】与【信息含量】 | 同一行并列展示的两项分布指标,不是两个独立候选表 |
段落分布率与 DP 也不能互换。分布率只问多少段出现过这个词;DP 还比较它在各段中出现的次数比例。
同一行中的【来源】说明是否命中内置停用词表,不应读作对这个词领域属性的鉴定。
散点图展示分布,不替代候选判定
报告同时显示两张散点图:一张纵轴为 DP,一张纵轴为信息含量。每个点对应一个词或字。
- 横轴都是总频次加一后的十进制对数。越靠右,出现次数越多。
- 纵轴分别显示 DP 或信息含量。DP 越低,越贴近段落大小比例;信息含量越低,表示截断后的熵差越小。
- 图中的【DP 参考线】和【信息含量参考线】只改变图示位置,不是当前最终候选的划分边界。
信息含量图中的【截断熵差上限】线尤其容易读反。纵轴画的是信息含量,不是词语分布熵;信息含量接近这条线,表示词语分布熵接近零,不能解释成该词分布得最均匀。
词表较大时,两张散点图会保留候选点,并从其他词中抽取部分点。因此,图上点的密度和类别比例不能替代全量词表统计。
参考资料与口径说明
本文的方法说明依据以下原始论文与教材;处理分支和报告口径依据当前实现。文中的三段分布算例来自 Gries 原论文。
1. Manning、Raghavan 与 Schütze,2008,Introduction to Information Retrieval,【Dropping common terms:stop words】。用于说明停用词与处理目的的关系,以及删除常见词对短语含义的影响。教材章节。
2. Gries,2008,Dispersions and adjusted frequencies in corpora,International Journal of Corpus Linguistics,13(4),403—437。DP 定义及三段算例见第 3 节、表 2 与表 3。作者提供的全文。
3. Gerlach、Shi 与 Amaral,2019,A universal information theoretic approach to the identification of stopwords,Nature Machine Intelligence,1,606—612。随机化基准与信息含量定义见 Model 部分。期刊页面;作者机构提供的全文。
4. Manning、Raghavan 与 Schütze,2008,Introduction to Information Retrieval,【Inverse document frequency】。用于区分词频、文档频率和 IDF 的参考集合。教材章节。
