从论坛抓下来一千条评论,准备做主题分析。翻开一看,夹着大量的顶,支持,好好好,哈哈哈哈,还有整段复制粘贴的广告。访谈转写稿也一样,一问一答之间有不少嗯嗯对对和寒暄。这些段落不删,会把词频和主题都拉偏;一条一条手工删,一千条要删一下午。
TATOOLS 的【信息价值评估】给每一段打一个 0 到 1 的综合得分。【上传文档】以后,TATOOLS 逐段计算信息熵和词汇密度等几项指标,合成综合得分,对照所选文本类型的推荐阈值,把段落分成建议保留和建议剔除两部分,并给低分段落写明原因。保留下来的段落可以直接导出,交给后面的分析。
这篇教程先讲怎样用信息论的办法衡量一段文字的信息量,再逐项讲每个指标的算法,配上可以手算的例子,接着讲综合得分和推荐阈值,最后讲报告怎样读、论文里怎样写。
01
一段文字的信息量怎样量
Shannon 1948 年创立信息论时,把信息量和不确定性联系起来。一个消息越难预测,它带来的信息越多;一段文字如果翻来覆去是那几个字,读者读到一半就猜得出后面,它带来的信息就少。1951 年,Shannon 用这个思路估计了英文印刷文本每个字母的信息量。
TATOOLS 的【信息价值评估】沿着这条路,把每一段文字看作一串字,统计这一段里每个字出现的频率,从字的分布上算出几项指标。它衡量的是一段文字在形式上信息是否丰富,重复多不多,实在内容占多少,适合在正式分析之前做语料筛选,把明显空泛或重复的段落先挑出来。
分析单位是段落,一行算一段,空行跳过。整篇文章没有换行,就只会得到一段,段和段之间无法比较;所以提交之前,要先把材料按段落分好行。一条评论一行、一个回答一行,是最常见的做法。上传多个文件时,每个文件单独计算。
02
信息熵:用字有多分散
一段文字里每个字出现的频率是 p₁、p₂……,这一段的信息熵是
H = −Σ pᵢ × log₂ pᵢ
单位是比特。所有字各不相同时,H 最大;翻来覆去同一个字时,H 等于 0。手算三段各 8 个字的文字。
乡村振兴战略规划 8 个字各出现 1 次
H = 8 × (1/8) × log₂ 8 = 3 比特
规划规划规划规划 2 个字各出现 4 次
H = 2 × (1/2) × log₂ 2 = 1 比特
的的的的的的的的 1 个字出现 8 次
H = 0 比特
第一段每个字都带来新东西,第二段只在两个字之间来回,第三段读到第二个字就知道后面全是什么。信息熵偏低的段落,往往是在重复刷屏,或者表达单一。
报告里的【困惑度】等于 2 的 H 次方,第一段是 2³ = 8,相当于每读一个字要从 8 个同样可能的字里猜。困惑度只在报告里展示,不计入综合得分。
03
词汇密度:实在内容占多少
词汇密度(Lexical Density)由 Ure 1971 年提出,Halliday 1985 年用它比较口语和书面语,指一段话里实词占全部词语的比例。书面语的词汇密度通常明显高于口语,因为口语里虚词和语气词多,重复也多。
TATOOLS 按字计算,停用词表里的单字算作功能字,其余的字算作实在内容。
词汇密度 = 不在停用词表里的字数 ÷ 总字数
例:我们的规划是好的,共 8 个字
假设停用字有 我、的、是
停用字出现 4 次,词汇密度 = 4 ÷ 8 = 0.5
工具页的停用词设置决定哪些单字算功能字,可以用系统停用词,也可以补充自己的。一段话里的和了这类字太多,词汇密度就低,报告会标出实质内容占比偏低。
04
信息密度:平均每个字分到多少
信息熵是一整段的量,长段落的信息熵天然更高,字越多,出现不同字的机会越多。要比较长短不一的段落,还要看平均每个字分到多少信息。
信息密度 = 信息熵 ÷ 段落字数
乡村振兴战略规划 3 ÷ 8 = 0.375
一段 400 字的长文,H = 7 7 ÷ 400 = 0.0175
信息熵只随不同字的个数按对数增长,段落越长,信息密度越低。一段文字很长、信息密度又特别低,常常是在反复绕着同一件事说,报告会标出段落较长但单位信息密度偏低,或者表达不够简洁。报告里的【简洁性比率】和信息密度是同一个比值,在综合得分里缩放的幅度更宽,只有特别长的段落才会在这一项上被扣分。
05
稀有信息:独特的字多不多
稀有信息得分看一段话里有多少字只是偶尔出现。TATOOLS 把这一段里所有不同的字按出现次数从少到多排好,取排在四分之一位置的那个次数,出现次数不超过它的字算作稀有字。
稀有信息得分 = 稀有字的种数 ÷ 不同字的种数
某段 8 种字,出现次数从少到多是
1,1,1,1,2,2,3,5
四分之一位置是第 3 个,次数为 1
出现 1 次的有 4 种,得分 = 4 ÷ 8 = 0.5
不同的字少于四种时,改为只数出现过一次的字。稀有信息多,说明这段话有不少只提到一次的细节;稀有信息少,说明内容集中在少数几个反复出现的字上,报告会标出独特观点或细节不足。
06
语义信息量和另外几项指标
语义信息量把前两项合起来,信息熵乘以词汇密度。一段话用字分散、实在内容又多,语义信息量才高;用字分散但全是虚字,或者实字很多但翻来覆去,都拿不到高分。
语义信息量 = 信息熵 × 词汇密度
H = 3,词汇密度 = 1 语义信息量 = 3
H = 3,词汇密度 = 0.5 语义信息量 = 1.5
新颖性指标由信息熵按固定比例换算而来,信息熵越高,新颖性越高。
KL 散度(Kullback-Leibler 散度,衡量两个概率分布相差多远)由 Kullback 和 Leibler 1951 年提出。TATOOLS 以整份文件的用字分布为参照,看这一段的用字分布和全文差多少。
KL(P ‖ Q) = Σ P(字) × log₂ [ P(字) ÷ Q(字) ]
P:这一段的用字分布;Q:全文的用字分布
KL 散度高,说明这一段用的字和全文很不一样,可能是一段独特的内容,也可能是混进来的无关文字。它在报告的指标表里展示,供对照阅读,不计入综合得分。
07
综合得分怎样算
TATOOLS 把七项指标各自缩放到 0 到 1,超过上限的按 1 计,再加权求和。
综合得分 = 0.2 × 信息熵 + 0.1 × 词汇密度 + 0.2 × 信息密度
+ 0.1 × 稀有信息 + 0.2 × 语义信息量
+ 0.1 × 新颖性 + 0.1 × 简洁性
缩放方式:信息熵 ÷ 5,信息密度 × 20,语义信息量 ÷ 5
新颖性 = 信息熵 ÷ 4,简洁性 = 信息密度 × 100
用前面两段各 8 个字的文字手算一遍,假设都没有停用字。
| 指标 | 乡村振兴战略规划 | 规划规划规划规划 |
|---|---|---|
| 信息熵 | 3 → 0.6 | 1 → 0.2 |
| 词汇密度 | 1 → 1 | 1 → 1 |
| 信息密度 | 0.375 → 1 | 0.125 → 1 |
| 稀有信息 | 1 → 1 | 0 → 0 |
| 语义信息量 | 3 → 0.6 | 1 → 0.2 |
| 新颖性 | 0.75 | 0.25 |
| 简洁性 | 0.375 → 1 | 0.125 → 1 |
乡村振兴战略规划
0.2×0.6 + 0.1×1 + 0.2×1 + 0.1×1 + 0.2×0.6 + 0.1×0.75 + 0.1×1
= 0.12 + 0.1 + 0.2 + 0.1 + 0.12 + 0.075 + 0.1 = 0.815
规划规划规划规划
0.2×0.2 + 0.1×1 + 0.2×1 + 0.1×0 + 0.2×0.2 + 0.1×0.25 + 0.1×1
= 0.04 + 0.1 + 0.2 + 0 + 0.04 + 0.025 + 0.1 = 0.505
按通用文本的推荐阈值 0.75,第一段建议保留,第二段建议剔除。报告顶部的【综合得分计算方式】写着这条公式,【参数详细说明】逐项解释每个指标的含义和权重。
综合得分衡量形式上的信息丰富程度,擅长找出空洞、重复的段落;观点对错和是否切题,要由研究者读了再判断。一段用字独特却与研究无关的广告也可能拿到高分,所以它最适合做第一道粗筛,筛完以后的段落再由研究者细读。
08
推荐阈值和文本类型
不同材料的信息密度差别很大。会议纪要和访谈稿口语多、寒暄多,整体得分偏低;社交评论短小,刷屏的又多。同一个阈值用在不同材料上,要么删得太狠,要么删得太松。工具页的【文本类型阈值模板】为七类材料各给了一个推荐阈值。
| 文本类型 | 推荐阈值 |
|---|---|
| 通用文本 | 0.75 |
| 新闻/资讯 | 0.70 |
| 社交评论 | 0.80 |
| 访谈/口述 | 0.65 |
| 论文/综述 | 0.72 |
| 政策/公文 | 0.70 |
| 会议纪要 | 0.65 |
推荐阈值只是起点。报告里的【综合得分筛选】可以把阈值拖到 0 到 1 之间的任意位置,旁边有回到推荐阈值和几个常用阈值的快捷按钮,保留和剔除的段落随之实时变化。先看剔除列表里有没有不该删的段落,再看保留列表里有没有该删的,来回调几次,找到最合适的位置。
09
原因标签和临界复核说明
每个段落都会带上最多四个原因标签,说明它为什么得分低。
| 原因标签 | 说明什么 |
|---|---|
| 低于当前文本类型的推荐保留阈值 | 综合得分没过线 |
| 段落过短,难以提供稳定判断 | 字数太少,指标不稳 |
| 信息熵偏低,可能存在重复或表达单一 | 翻来覆去是那几个字 |
| 实质内容占比偏低,功能词或常见字较多 | 虚字太多 |
| 稀有信息较少,独特观点或细节不足 | 细节太少 |
| 语义信息量偏低,实质内容不够集中 | 用字单一,实字也少 |
| 段落较长但单位信息密度偏低 | 长而空 |
| 表达不够简洁,可考虑压缩后再分析 | 绕着说 |
接近阈值的段落最难判断,多几分少几分就换了一边。工具页打开【为临界段落生成 AI 复核说明】以后,TATOOLS 挑出得分离阈值最近的一小批段落,结合它们的各项指标和原因标签,各写一句复核理由,帮研究者决定留还是删。报告的指标表里有【临界复核说明】一列,关闭这个开关时只用规则生成的原因标签。
10
报告怎么读
| 区块 | 先看什么 |
|---|---|
| 这份结果说明了什么 | 一共多少段,保留了多少 |
| 原文总行数、总段落数、保留段落数、平均综合得分 | 四个总数 |
| 综合得分计算方式、分数意义 | 公式和当前阈值 |
| 保留 / 剔除段落对照 | 两边各有哪些段落,剔除的原因 |
| 综合得分筛选和指标表 | 调阈值,逐段看各项指标 |
| 参数详细说明 | 每个指标的含义和权重 |
上传多个文件时,报告顶部可以切换文件,每个文件的指标都只和它自己的全文比较。
指标表可以筛选、分页,【导出CSV】导出当前阈值以上的段落和全部指标,【导出保留段落TXT】把保留下来的段落导出成一个文本文件,一行一段,可以直接上传到 TATOOLS 的其他工具继续分析。
11
把结果写进论文
信息价值评估通常放在方法部分的数据清洗里,写明按什么标准剔除了多少段落。下面是一段写法示例,方括号里换成自己的数字。
为剔除重复、空泛和刷屏类内容,本研究使用 TATOOLS 的信息价值评估对 [段落数] 条文本逐段计算字符信息熵、词汇密度、信息密度与稀有信息等指标,合成综合得分。参照 [文本类型] 的推荐阈值 [阈值],并经人工复核剔除段落与临界段落后,保留 [保留数] 条(占 [比例])进入后续分析。
写明阈值和保留比例,再附上几条被剔除段落的例子,读者就能判断这一步删得是否合理。
12
小结
信息价值评估沿用 Shannon 信息论的思路,按字统计每一段的用字分布,衡量它在形式上信息是否丰富。
信息熵看用字有多分散,词汇密度看实在内容占多少,信息密度看平均每个字分到多少,稀有信息看只出现一次的细节多不多。
七项指标缩放到 0 到 1 后加权合成综合得分,KL 散度和困惑度只作对照,不计入得分。
七类文本各有推荐阈值,报告里可以随时拖动阈值,每个低分段落都带有原因标签,临界段落还可以生成一句复核说明。
保留下来的段落可以导出成文本文件,直接交给后续的分析。
筛完段落,想进一步找出意思相近的重复文本,可以用 TATOOLS 的【文本相似度去重雷达】;想把高度接近的内容归组合并,用【重复内容合并】;想看材料的用词丰富程度,用【词汇多样性分析】。
13
资料来源
Shannon:A Mathematical Theory of Communication,Bell System Technical Journal,第 27 卷第 3 期,1948
Shannon:Prediction and Entropy of Printed English,Bell System Technical Journal,第 30 卷第 1 期,1951
Ure:Lexical Density and Register Differentiation,收入 Perren 与 Trim 编 Applications of Linguistics,Cambridge University Press,1971
Halliday:Spoken and Written Language,Deakin University Press,1985
END
