返回教程列表
文本分析基础教程信息熵语料清洗词汇密度

信息价值评估完整教程:从字符信息熵和词汇密度,到综合得分与推荐阈值,再到保留段落的导出

一千条评论里夹着刷屏灌水和广告,怎样先把空洞、重复的段落挑出来?这篇教程从 Shannon 信息论讲起,说明 TATOOLS 的【信息价值评估】怎样按字统计每一段的用字分布,逐项算出信息熵和词汇密度等指标。文中用几段各 8 个字的文字手算信息熵,再把七项指标缩放后加权,完整算出两段文字的综合得分 0.815 和 0.505。最后讲七类文本的推荐阈值、原因标签和临界段落的复核说明,报告里怎样拖动阈值、导出保留段落,并给出论文数据清洗部分的写法示例。

作者:TATOOLS 研究团队|更新于 2026-09-23|4897 个字符|约 17 分钟读完
sentence-info
立即使用

从论坛抓下来一千条评论,准备做主题分析。翻开一看,夹着大量的顶,支持,好好好,哈哈哈哈,还有整段复制粘贴的广告。访谈转写稿也一样,一问一答之间有不少嗯嗯对对和寒暄。这些段落不删,会把词频和主题都拉偏;一条一条手工删,一千条要删一下午。

TATOOLS 的【信息价值评估】给每一段打一个 0 到 1 的综合得分。【上传文档】以后,TATOOLS 逐段计算信息熵和词汇密度等几项指标,合成综合得分,对照所选文本类型的推荐阈值,把段落分成建议保留和建议剔除两部分,并给低分段落写明原因。保留下来的段落可以直接导出,交给后面的分析。

这篇教程先讲怎样用信息论的办法衡量一段文字的信息量,再逐项讲每个指标的算法,配上可以手算的例子,接着讲综合得分和推荐阈值,最后讲报告怎样读、论文里怎样写。

01

一段文字的信息量怎样量

Shannon 1948 年创立信息论时,把信息量和不确定性联系起来。一个消息越难预测,它带来的信息越多;一段文字如果翻来覆去是那几个字,读者读到一半就猜得出后面,它带来的信息就少。1951 年,Shannon 用这个思路估计了英文印刷文本每个字母的信息量。

TATOOLS 的【信息价值评估】沿着这条路,把每一段文字看作一串字,统计这一段里每个字出现的频率,从字的分布上算出几项指标。它衡量的是一段文字在形式上信息是否丰富,重复多不多,实在内容占多少,适合在正式分析之前做语料筛选,把明显空泛或重复的段落先挑出来。

分析单位是段落,一行算一段,空行跳过。整篇文章没有换行,就只会得到一段,段和段之间无法比较;所以提交之前,要先把材料按段落分好行。一条评论一行、一个回答一行,是最常见的做法。上传多个文件时,每个文件单独计算。

02

信息熵:用字有多分散

一段文字里每个字出现的频率是 p₁、p₂……,这一段的信息熵是

· · ·

H = −Σ pᵢ × log₂ pᵢ

单位是比特。所有字各不相同时,H 最大;翻来覆去同一个字时,H 等于 0。手算三段各 8 个字的文字。

· · ·

乡村振兴战略规划 8 个字各出现 1 次

H = 8 × (1/8) × log₂ 8 = 3 比特

 

规划规划规划规划 2 个字各出现 4 次

H = 2 × (1/2) × log₂ 2 = 1 比特

 

的的的的的的的的 1 个字出现 8 次

H = 0 比特

第一段每个字都带来新东西,第二段只在两个字之间来回,第三段读到第二个字就知道后面全是什么。信息熵偏低的段落,往往是在重复刷屏,或者表达单一。

报告里的【困惑度】等于 2 的 H 次方,第一段是 2³ = 8,相当于每读一个字要从 8 个同样可能的字里猜。困惑度只在报告里展示,不计入综合得分。

03

词汇密度:实在内容占多少

词汇密度(Lexical Density)由 Ure 1971 年提出,Halliday 1985 年用它比较口语和书面语,指一段话里实词占全部词语的比例。书面语的词汇密度通常明显高于口语,因为口语里虚词和语气词多,重复也多。

TATOOLS 按字计算,停用词表里的单字算作功能字,其余的字算作实在内容。

· · ·

词汇密度 = 不在停用词表里的字数 ÷ 总字数

例:我们的规划是好的,共 8 个字

假设停用字有 我、的、是

停用字出现 4 次,词汇密度 = 4 ÷ 8 = 0.5

工具页的停用词设置决定哪些单字算功能字,可以用系统停用词,也可以补充自己的。一段话里的和了这类字太多,词汇密度就低,报告会标出实质内容占比偏低。

04

信息密度:平均每个字分到多少

信息熵是一整段的量,长段落的信息熵天然更高,字越多,出现不同字的机会越多。要比较长短不一的段落,还要看平均每个字分到多少信息。

· · ·

信息密度 = 信息熵 ÷ 段落字数

乡村振兴战略规划 3 ÷ 8 = 0.375

一段 400 字的长文,H = 7 7 ÷ 400 = 0.0175

信息熵只随不同字的个数按对数增长,段落越长,信息密度越低。一段文字很长、信息密度又特别低,常常是在反复绕着同一件事说,报告会标出段落较长但单位信息密度偏低,或者表达不够简洁。报告里的【简洁性比率】和信息密度是同一个比值,在综合得分里缩放的幅度更宽,只有特别长的段落才会在这一项上被扣分。

05

稀有信息:独特的字多不多

稀有信息得分看一段话里有多少字只是偶尔出现。TATOOLS 把这一段里所有不同的字按出现次数从少到多排好,取排在四分之一位置的那个次数,出现次数不超过它的字算作稀有字。

· · ·

稀有信息得分 = 稀有字的种数 ÷ 不同字的种数

某段 8 种字,出现次数从少到多是

1,1,1,1,2,2,3,5

四分之一位置是第 3 个,次数为 1

出现 1 次的有 4 种,得分 = 4 ÷ 8 = 0.5

不同的字少于四种时,改为只数出现过一次的字。稀有信息多,说明这段话有不少只提到一次的细节;稀有信息少,说明内容集中在少数几个反复出现的字上,报告会标出独特观点或细节不足。

06

语义信息量和另外几项指标

语义信息量把前两项合起来,信息熵乘以词汇密度。一段话用字分散、实在内容又多,语义信息量才高;用字分散但全是虚字,或者实字很多但翻来覆去,都拿不到高分。

· · ·

语义信息量 = 信息熵 × 词汇密度

H = 3,词汇密度 = 1 语义信息量 = 3

H = 3,词汇密度 = 0.5 语义信息量 = 1.5

新颖性指标由信息熵按固定比例换算而来,信息熵越高,新颖性越高。

KL 散度(Kullback-Leibler 散度,衡量两个概率分布相差多远)由 Kullback 和 Leibler 1951 年提出。TATOOLS 以整份文件的用字分布为参照,看这一段的用字分布和全文差多少。

· · ·

KL(P ‖ Q) = Σ P(字) × log₂ [ P(字) ÷ Q(字) ]

P:这一段的用字分布;Q:全文的用字分布

KL 散度高,说明这一段用的字和全文很不一样,可能是一段独特的内容,也可能是混进来的无关文字。它在报告的指标表里展示,供对照阅读,不计入综合得分。

07

综合得分怎样算

TATOOLS 把七项指标各自缩放到 0 到 1,超过上限的按 1 计,再加权求和。

· · ·

综合得分 = 0.2 × 信息熵 + 0.1 × 词汇密度 + 0.2 × 信息密度

         + 0.1 × 稀有信息 + 0.2 × 语义信息量

         + 0.1 × 新颖性 + 0.1 × 简洁性

缩放方式:信息熵 ÷ 5,信息密度 × 20,语义信息量 ÷ 5

          新颖性 = 信息熵 ÷ 4,简洁性 = 信息密度 × 100

用前面两段各 8 个字的文字手算一遍,假设都没有停用字。

指标 乡村振兴战略规划 规划规划规划规划
信息熵 3 → 0.6 1 → 0.2
词汇密度 1 → 1 1 → 1
信息密度 0.375 → 1 0.125 → 1
稀有信息 1 → 1 0 → 0
语义信息量 3 → 0.6 1 → 0.2
新颖性 0.75 0.25
简洁性 0.375 → 1 0.125 → 1
· · ·

乡村振兴战略规划

0.2×0.6 + 0.1×1 + 0.2×1 + 0.1×1 + 0.2×0.6 + 0.1×0.75 + 0.1×1

= 0.12 + 0.1 + 0.2 + 0.1 + 0.12 + 0.075 + 0.1 = 0.815

 

规划规划规划规划

0.2×0.2 + 0.1×1 + 0.2×1 + 0.1×0 + 0.2×0.2 + 0.1×0.25 + 0.1×1

= 0.04 + 0.1 + 0.2 + 0 + 0.04 + 0.025 + 0.1 = 0.505

按通用文本的推荐阈值 0.75,第一段建议保留,第二段建议剔除。报告顶部的【综合得分计算方式】写着这条公式,【参数详细说明】逐项解释每个指标的含义和权重。

综合得分衡量形式上的信息丰富程度,擅长找出空洞、重复的段落;观点对错和是否切题,要由研究者读了再判断。一段用字独特却与研究无关的广告也可能拿到高分,所以它最适合做第一道粗筛,筛完以后的段落再由研究者细读。

08

推荐阈值和文本类型

不同材料的信息密度差别很大。会议纪要和访谈稿口语多、寒暄多,整体得分偏低;社交评论短小,刷屏的又多。同一个阈值用在不同材料上,要么删得太狠,要么删得太松。工具页的【文本类型阈值模板】为七类材料各给了一个推荐阈值。

文本类型 推荐阈值
通用文本 0.75
新闻/资讯 0.70
社交评论 0.80
访谈/口述 0.65
论文/综述 0.72
政策/公文 0.70
会议纪要 0.65

推荐阈值只是起点。报告里的【综合得分筛选】可以把阈值拖到 0 到 1 之间的任意位置,旁边有回到推荐阈值和几个常用阈值的快捷按钮,保留和剔除的段落随之实时变化。先看剔除列表里有没有不该删的段落,再看保留列表里有没有该删的,来回调几次,找到最合适的位置。

09

原因标签和临界复核说明

每个段落都会带上最多四个原因标签,说明它为什么得分低。

原因标签 说明什么
低于当前文本类型的推荐保留阈值 综合得分没过线
段落过短,难以提供稳定判断 字数太少,指标不稳
信息熵偏低,可能存在重复或表达单一 翻来覆去是那几个字
实质内容占比偏低,功能词或常见字较多 虚字太多
稀有信息较少,独特观点或细节不足 细节太少
语义信息量偏低,实质内容不够集中 用字单一,实字也少
段落较长但单位信息密度偏低 长而空
表达不够简洁,可考虑压缩后再分析 绕着说

接近阈值的段落最难判断,多几分少几分就换了一边。工具页打开【为临界段落生成 AI 复核说明】以后,TATOOLS 挑出得分离阈值最近的一小批段落,结合它们的各项指标和原因标签,各写一句复核理由,帮研究者决定留还是删。报告的指标表里有【临界复核说明】一列,关闭这个开关时只用规则生成的原因标签。

10

报告怎么读

区块 先看什么
这份结果说明了什么 一共多少段,保留了多少
原文总行数、总段落数、保留段落数、平均综合得分 四个总数
综合得分计算方式、分数意义 公式和当前阈值
保留 / 剔除段落对照 两边各有哪些段落,剔除的原因
综合得分筛选和指标表 调阈值,逐段看各项指标
参数详细说明 每个指标的含义和权重

上传多个文件时,报告顶部可以切换文件,每个文件的指标都只和它自己的全文比较。

指标表可以筛选、分页,【导出CSV】导出当前阈值以上的段落和全部指标,【导出保留段落TXT】把保留下来的段落导出成一个文本文件,一行一段,可以直接上传到 TATOOLS 的其他工具继续分析。

11

把结果写进论文

信息价值评估通常放在方法部分的数据清洗里,写明按什么标准剔除了多少段落。下面是一段写法示例,方括号里换成自己的数字。

为剔除重复、空泛和刷屏类内容,本研究使用 TATOOLS 的信息价值评估对 [段落数] 条文本逐段计算字符信息熵、词汇密度、信息密度与稀有信息等指标,合成综合得分。参照 [文本类型] 的推荐阈值 [阈值],并经人工复核剔除段落与临界段落后,保留 [保留数] 条(占 [比例])进入后续分析。

写明阈值和保留比例,再附上几条被剔除段落的例子,读者就能判断这一步删得是否合理。

12

小结

信息价值评估沿用 Shannon 信息论的思路,按字统计每一段的用字分布,衡量它在形式上信息是否丰富。

信息熵看用字有多分散,词汇密度看实在内容占多少,信息密度看平均每个字分到多少,稀有信息看只出现一次的细节多不多。

七项指标缩放到 0 到 1 后加权合成综合得分,KL 散度和困惑度只作对照,不计入得分。

七类文本各有推荐阈值,报告里可以随时拖动阈值,每个低分段落都带有原因标签,临界段落还可以生成一句复核说明。

保留下来的段落可以导出成文本文件,直接交给后续的分析。

筛完段落,想进一步找出意思相近的重复文本,可以用 TATOOLS 的【文本相似度去重雷达】;想把高度接近的内容归组合并,用【重复内容合并】;想看材料的用词丰富程度,用【词汇多样性分析】。

13

资料来源

Shannon:A Mathematical Theory of Communication,Bell System Technical Journal,第 27 卷第 3 期,1948

Shannon:Prediction and Entropy of Printed English,Bell System Technical Journal,第 30 卷第 1 期,1951

Kullback 与 Leibler:On Information and Sufficiency,The Annals of Mathematical Statistics,第 22 卷第 1 期,1951

Ure:Lexical Density and Register Differentiation,收入 Perren 与 Trim 编 Applications of Linguistics,Cambridge University Press,1971

Halliday:Spoken and Written Language,Deakin University Press,1985


END