手里有五十篇乡村振兴方面的政策文件,想知道这批文件在用词上有什么特点。按词频排,排在前面的是发展和推进这类在哪里都常见的词,说明不了这批文件的特色。要找的是在这批文件里说得明显更多的词,这就需要一份拿来对照的语料。
语料对比关键词分析做的就是这件事。把想分析的目标语料和一份参考语料放在一起,逐词比较两边的相对频率,目标语料里明显多用的词叫过度代表词,明显少用的叫不足代表词。一个词在两份语料之间的频率差异有多突出,叫这个词的关键性(keyness)。Scott 1997 年把这种做法系统化,此后它成为语料库语言学和话语研究最常用的方法之一。
在 TATOOLS 的【语料对比关键词分析】里【上传文档】作为目标语料,再上传或直接粘贴一份参考语料。TATOOLS 对两份语料用同样的办法分词、过滤停用词,每个词算出两边的出现次数、每百万词频次和期望频次,同时给出对数似然比、卡方和对数比值三项关键性指标,过度代表和不足代表分成两份词表。
这篇教程先讲参考语料怎样选,再用一个例子从四格表手算到三项指标,讲清它们各自回答什么问题,最后讲报告的读法和论文里的写法。
01
关键词是相对参考语料而言的
关键性永远是相对的。同一批乡村振兴文件,拿通用新闻作参考,得到的关键词是这个政策领域的用语;拿前一个五年规划期的同类文件作参考,得到的是这一时期新出现或加重的提法。参考语料决定了关键词回答哪个研究问题。
| 目标语料 | 参考语料 | 关键词说明什么 |
|---|---|---|
| 乡村振兴政策文件 | 通用新闻 | 这个领域特有的用语 |
| 2020 年后的政策文件 | 2020 年前的同类文件 | 前后两个时期用语的变化 |
| 某报对某议题的报道 | 另一家报纸的同议题报道 | 两家媒体的框架差异 |
| 女性受访者的访谈 | 男性受访者的访谈 | 两组人的表达差异 |
参考语料一般要比目标语料大,体裁和时间范围也要和研究问题相称。参考语料太小,许多词在参考语料里一次都没出现,比较就不稳。
TATOOLS 的参考语料有两种给法,【上传参考语料文件】可以多选,【直接输入参考文本】把整段文本贴进文本框。没有现成的参考语料,可以点【中文 · 通用新闻参考】一键填入一段通用新闻,先看看结果长什么样。目标语料上传多个文件时,TATOOLS 把它们合在一起当作一份语料统计,参考语料的多个文件也一样。
02
四格表与期望频次
对每个词,关键性分析先列一张四格表。
| 目标语料 | 参考语料 | 合计 | |
|---|---|---|---|
| 这个词 | a | b | a + b |
| 其他词 | c − a | d − b | |
| 总词数 | c | d | c + d |
如果这个词在两份语料里的用法没有差别,它的 a + b 次出现应当按两份语料的大小分配,这就是期望频次。
E₁ = c × (a + b) ÷ (c + d) 目标语料的期望频次
E₂ = d × (a + b) ÷ (c + d) 参考语料的期望频次
每百万词频次 = 出现次数 × 1000000 ÷ 总词数
为了好算,设目标语料 1 万词,参考语料 10 万词。振兴在目标语料里出现 50 次,在参考语料里出现 100 次。
a = 50,b = 100,c = 10000,d = 100000
E₁ = 10000 × 150 ÷ 110000 ≈ 13.64
E₂ = 100000 × 150 ÷ 110000 ≈ 136.36
目标每百万词 5000 次,参考每百万词 1000 次
振兴在目标语料里实际出现 50 次,比期望的 13.64 次多出许多。下面三项指标都从这几个数算出来,衡量的角度各不相同。
TATOOLS 的【词项明细】给每个词列出两边的出现次数、每百万词频次(PMW)和期望频次,每项指标都能从这几列复核。
03
对数似然比:差异的证据有多强
Dunning 1993 年提出用对数似然比(Log-likelihood,简写 LL)比较词频,Rayson 和 Garside 2000 年把它用到两份语料的比较上,成了关键性分析最常用的指标。
LL = 2 × (a × ln(a ÷ E₁) + b × ln(b ÷ E₂))
接着振兴的例子。
50 × ln(50 ÷ 13.64) ≈ 50 × 1.299 ≈ 64.96
100 × ln(100 ÷ 136.36) ≈ 100 × (−0.310) ≈ −31.02
LL = 2 × (64.96 − 31.02) ≈ 67.9
LL 近似服从自由度为 1 的卡方分布,可以换算成 p 值。
| LL 至少 | p 值小于 |
|---|---|
| 3.84 | 0.05 |
| 6.63 | 0.01 |
| 10.83 | 0.001 |
| 15.13 | 0.0001 |
振兴的 LL 是 67.9,远超 15.13,两边频率的差异非常显著。一次比较成千上万个词,偶然越过 3.84 的词会有很多,语料库研究里常用更严格的 15.13 作门槛。
TATOOLS 给 LL 加上方向号,目标语料的相对频率高于参考语料时为正,低于时为负,正的进过度代表词表,负的进不足代表词表。p 值由 LL 的绝对值换算,写在【词项明细】的最后一列。报告不按 p 值筛词,写论文时可以按自己定的门槛筛选。
04
卡方:同样比较观察和期望
卡方(χ²)同样比较观察次数和期望次数,是更早通行的检验。TATOOLS 的卡方对 a 和 b 这两格求和。
χ² = (a − E₁)² ÷ E₁ + (b − E₂)² ÷ E₂
振兴 (50 − 13.64)² ÷ 13.64 ≈ 96.97
(100 − 136.36)² ÷ 136.36 ≈ 9.70
χ² ≈ 106.7
卡方的前提是期望频次不能太小。Dunning 1993 年指出,文本里的大多数词都是低频词,卡方会高估低频词的显著性,对数似然比在低频时更稳。两项指标在高频词上的排序通常很接近,TATOOLS 两项都算,卡方方便和早期文献对照。
Kilgarriff 2001 年还提醒了另一件事。语言的使用本来就不是随机的,语料一大,几乎所有常用词在两份语料之间的差异都会显著。显著只说明差异存在,差异有多大要看下一项指标。
05
对数比值:两边差了多少倍
Hardie 2014 年提出的对数比值(Log-ratio)直接衡量两边相对频率的倍数。
Log-ratio = log₂((a ÷ c) ÷ (b ÷ d))
振兴 (50 ÷ 10000) ÷ (100 ÷ 100000) = 5
log₂ 5 ≈ 2.32
对数比值每加 1,倍数翻一番。+1 表示目标语料的相对频率是参考语料的 2 倍,+2 是 4 倍,−1 是一半,0 表示两边一样。它的大小和语料规模无关,同一个词在不同研究里算出的对数比值可以直接比较。某个词在参考语料里一次都没出现时,TATOOLS 按 0.5 次算,避免除以零。
对数似然比和对数比值常常给出不同的排序。仍是 1 万词对 10 万词。
农村 a = 200,b = 800
LL ≈ 110.85,Log-ratio ≈ 1.32
宅基地 a = 6,b = 0(按 0.5 算)
LL ≈ 28.77,Log-ratio ≈ 6.91
农村出现得多,差异的证据很强,相对频率却只是参考语料的 2.5 倍;宅基地出现次数少,证据弱一些,却是参考语料里几乎没有的专门用语。LL 和卡方偏向高频词,对数比值更突出倍数差异。
Hardie 建议两者配合使用,先用对数似然比筛掉不显著的词,再按对数比值排序。TATOOLS 的【关键性指标排名】把三项指标分三组画出来,每组按各自的指标独立排序;【词项明细】可以按任何一项排序,也可以按目标频次或参考频次排序。
06
不足代表的词
不足代表词是目标语料里明显少用的词,同样有研究价值,它提示目标语料较少涉及的话题。
市场 a = 10,b = 500
目标每百万词 1000 次,参考每百万词 5000 次
LL ≈ −44.83,Log-ratio ≈ −2.32
市场在政策文件里的相对频率只有通用新闻的五分之一。
TATOOLS 只比较目标语料里出现次数不少于【目标语料最低出现次数】的词,默认 5 次,参考语料里有、目标语料一次都没用过的词不在结果里。想看这类词,把两份语料对调,再跑一次就能看到。
07
两边用同一套预处理
分词和过滤的口径不一致,频率差异就可能是处理方式造成的。TATOOLS 对目标语料和参考语料使用同一套设置。
【使用系统停用词】默认打开,的和是这类功能词不参与统计,还可以在【自定义停用词】里补充;两份停用词取并集。【只统计某些词性】只对中文有效,可以只看名词、动词或形容词这类词性。【词形合并】把同一个词的不同写法并成一个再计数,比如人工智能和 AI。【自动补充词典】从目标语料里找出分词词典不认识的新词,比如乡村振兴,加进词典,参考语料按同一份词典分词。
【文本语言】默认自动检测,按第一份目标语料判断是中文还是英文;英文按单词切分并统一成小写。
08
工具页上的设置一览
| 设置 | 选项或范围 | 默认 | 影响什么 |
|---|---|---|---|
| 参考语料 | 上传参考语料文件,或直接输入参考文本 | 上传文件 | 拿什么作对照 |
| 目标语料最低出现次数 | 1 到 50 | 5 | 目标语料里出现太少的词不比较 |
| 各取前 N 词 | 20 到 1000 | 200 | 报告里每项指标每侧保留多少词 |
| 文本语言 | 自动检测、中文、英文 | 自动检测 | 怎样切词 |
| 自动补充词典 | 开或关 | 关 | 新词是否先加进分词词典 |
| 使用系统停用词 | 开或关 | 开 | 功能词是否参与统计 |
| 只统计某些词性 | 名词、动词、形容词等 | 不过滤 | 只看哪些词性 |
| 词形合并 | 一行一组写法 | 空 | 哪些写法并成一个词 |
三项关键性指标每次都会全部计算,不需要选择。【各取前 N 词】的 N 对每项指标分别生效,TATOOLS 按三项指标各取前 N 个再合并去重,所以明细里的词数可能多于 N。
09
报告怎么读
| 区块 | 先看什么 |
|---|---|
| 这份结果说明了什么 | 过度代表和不足代表排在最前的几个词 |
| 语料与结果规模 | 两份语料各有多少词,两边的关键词各有多少个 |
| 关键性指标排名 | 三项指标下两边排名最前的词,右边多用,左边少用 |
| 词项明细 | 每个词的频次、期望频次、三项指标和 p 值 |
| 指标与口径 | 三项指标的定义和统计范围 |
读的顺序是先看两份语料的词数,确认参考语料比目标语料大;再在【关键性指标排名】里对照对数似然比和对数比值两组,找出既显著、倍数又大的词;最后在【词项明细】里按 p 值和对数比值定下要写进论文的词表。关键词找出来以后,要回到原文看它们是在什么语境里用的,再下结论。
TATOOLS 的过度代表词表和不足代表词表都可以下载,每个词带着全部频次和三项指标。
10
把结果写进论文
下面是一段常见的写法示例,方括号里换成自己的内容。
本研究使用 TATOOLS 的语料对比关键词分析,以 [目标语料]([词数] 词)为目标语料,以 [参考语料]([词数] 词)为参考语料,两份语料采用相同的分词、停用词和词性设置,仅考察在目标语料中出现不少于 [次数] 次的词。以对数似然比(Dunning,1993)检验频率差异,取 LL ≥ 15.13(p < 0.0001)为显著门槛,以对数比值(Hardie,2014)衡量差异大小。结果显示,[词] 等 [数量] 个词在目标语料中显著多用,[词] 等 [数量] 个词显著少用。
论文里的关键词表一般列出每个词两边的频次或每百万词频次,以及 LL 值和对数比值,按对数似然比或对数比值排序,排序依据要写明。
11
小结
关键性分析逐词比较目标语料和参考语料的相对频率,找出目标语料里明显多用和明显少用的词。
参考语料决定关键词回答哪个研究问题,一般要比目标语料大,体裁和时间范围要和研究问题相称。
每个词列一张四格表,按两份语料的大小算出期望频次,三项指标都从观察次数和期望次数算出。
对数似然比和卡方衡量差异的证据有多强,偏向高频词;对数比值衡量两边差了多少倍,和语料规模无关。
TATOOLS 对两份语料使用同一套预处理,三项指标同时给出,过度代表和不足代表分表输出。
想看关键词和哪些词固定搭配,可以用 TATOOLS 的【词语搭配强度分析】;想回到原文找关键词出现的段落,用【语料检索】;想抽出由几个词组成的专门术语,用【领域术语抽取】。
12
资料来源
Scott:PC Analysis of Key Words and Key Key Words,System,第 25 卷第 2 期,1997
Kilgarriff:Comparing Corpora,International Journal of Corpus Linguistics,第 6 卷第 1 期,2001
Hardie:Log Ratio,An Informal Introduction,ESRC Centre for Corpus Approaches to Social Science,2014
END
