研究近十年的政府工作报告,想知道数字化这个词是怎样被谈论的。它常和转型、治理这类词站在一起,还是和经济发展站在一起?光数一起出现的次数不够,发展这类词本来就到处都是,和谁都会碰上几次。真正要找的,是那些和数字化一起出现得远比碰巧更多的词。
这正是语料库语言学里的搭配(Collocation)研究。TATOOLS 的【词语搭配强度分析】统计词对在设定窗口内一起出现了多少次,和两个词各自独立出现时按概率本应碰上的次数相比,一次算出七项关联强度,把固定搭配和碰巧同现区分开。填了节点词,只看这些词身边的搭配伙伴;不填,就跑出整批材料里所有显著的二词组合。
这篇教程先讲搭配研究什么,共现怎样计数,期望频次怎样算,再用一组手算的例子逐项讲七个指标,接着讲两种模式和几项预处理设置,最后讲报告的读法和论文里的写法。
01
搭配研究什么
Firth 1957 年有一句被反复引用的话,要认识一个词,看它和谁做伴。Sinclair 1991 年把这个想法做成了语料库方法,规定了三个基本概念。
| 概念 | 含义 | 例子 |
|---|---|---|
| 节点词 | 要研究的那个词 | 数字化 |
| 搭配词 | 在节点词附近出现的词 | 转型、治理、赋能 |
| 跨度 | 附近指左右各几个词 | 左右各 5 个词 |
搭配能揭示一个词在某批材料里被赋予的意义和立场。政策文本里数字化常和转型、治理搭配,新闻评论里可能更常和焦虑、鸿沟搭配,两批材料对同一个概念的建构就不一样。话语研究和翻译研究大量使用这种方法,二语习得研究也是。
TATOOLS 的【词语搭配强度分析】沿用这套概念,工具页的【节点词】就是要研究的词,【左窗口宽度】和【右窗口宽度】就是跨度。
02
共现怎样计数
TATOOLS 先分词,去掉纯数字和单个英文字母,按设置去掉停用词,再以每个节点词为中心,数它左右窗口里出现了哪些词。
句子分词后:推进 数字化 转型 促进 经济 发展
节点词:数字化,左窗口 2,右窗口 2
左边:推进
右边:转型,促进
这一句贡献三对共现
左右窗口可以分别设在 0 到 10 个词之间,默认各 5 个。只看右窗口,看的是节点词后面接什么;只看左窗口,看的是什么修饰或引出它。
窗口默认不跨句,一句话结束,窗口就截止,上一句末尾的词不会和下一句开头的词算作共现。打开【允许窗口跨句】,整篇文章连成一串来数。【最低共现次数】默认 3,共现次数不到它的词对不进入结果,偶然碰上一两次的组合不会占据排行。
03
期望频次:碰巧会同现多少次
两个词一起出现了 30 次,多还是少,要和碰巧会同现的次数比。
期望频次 E = f(节点词) × f(搭配词) ÷ N
f:词在全部材料里出现的次数;N:参与统计的总词数
一份 1 万个词的材料,数字化出现 100 次。
| 搭配词 | 搭配词出现次数 | 实际共现 O | 期望 E |
|---|---|---|---|
| 转型 | 50 | 30 | 100 × 50 ÷ 10000 = 0.5 |
| 发展 | 800 | 12 | 100 × 800 ÷ 10000 = 8 |
| 孪生 | 3 | 3 | 100 × 3 ÷ 10000 = 0.03 |
发展和数字化一起出现了 12 次,比转型少不了太多,但它自己出现了 800 次,碰巧也该碰上 8 次;转型只出现 50 次,却和数字化一起出现了 30 次,是期望的 60 倍。报告的表格里每一行都同时列出【共现次数】和【期望】。
七项指标都是在比较实际共现 O 和期望 E,只是比较的角度不同。下面用这三组数逐项手算。
04
七项关联强度
PMI 和 MI3
点互信息(PMI)由 Church 和 Hanks 1990 年引入词汇研究,看实际共现是期望的几倍,取以 2 为底的对数。
PMI = log₂(O ÷ E)
转型 log₂(30 ÷ 0.5) = log₂ 60 ≈ 5.91
发展 log₂(12 ÷ 8) = log₂ 1.5 ≈ 0.58
孪生 log₂(3 ÷ 0.03) = log₂ 100 ≈ 6.64
孪生只和数字化一起出现过 3 次,PMI 却最高。PMI 天生偏爱罕见的词对,一个只出现几次的词,只要恰好都在节点词旁边,比值就会很大。
MI3 把实际共现取三次方再比,给共现次数加重分量,缓解 PMI 偏爱低频的毛病,Oakes 1998 年的统计教材把它和 PMI 并列介绍。
MI3 = log₂(O³ ÷ E)
转型 log₂(27000 ÷ 0.5) = log₂ 54000 ≈ 15.72
孪生 log₂(27 ÷ 0.03) = log₂ 900 ≈ 9.81
用 MI3 排,转型重新回到孪生前面。
对数似然比 LL
Dunning 1993 年提出用对数似然比检验两个词的共现是否显著偏离独立,它对低频事件比卡方检验稳健得多。把每一对放进一张 2 × 2 的表里。
| 搭配词出现 | 搭配词没出现 | 合计 | |
|---|---|---|---|
| 节点词出现 | a = 30 | b = 70 | 100 |
| 节点词没出现 | c = 20 | d = 9880 | 9900 |
| 合计 | 50 | 9950 | 10000 |
LL = 2 × Σ O × ln(O ÷ E),对四个格子求和
每格的 E = 行合计 × 列合计 ÷ N
a 格 30 × ln(30 ÷ 0.5) ≈ 122.83
b 格 70 × ln(70 ÷ 99.5) ≈ −24.62
c 格 20 × ln(20 ÷ 49.5) ≈ −18.12
d 格 9880 × ln(9880 ÷ 9850.5) ≈ 29.54
LL = 2 × 109.63 ≈ 219.3
同样算出发展的 LL 约 1.93,孪生约 27.7。LL 服从自由度为 1 的卡方分布,超过 3.84 对应 p < 0.05,超过 10.83 对应 p < 0.001。转型和孪生都极其显著,发展和数字化的共现与碰巧没有显著差别。
LL 同时照顾了强度和证据量,TATOOLS 的排行默认按 LL 从高到低排。
T-score 和 Z-score
两者都是实际共现减去期望,再除以一个标准差的估计。Church、Gale、Hanks 和 Hindle 1991 年用 T-score 找稳定的搭配。
T = (O − E) ÷ √O
Z = (O − E) ÷ √E
转型 T = 29.5 ÷ 5.48 ≈ 5.39 Z = 29.5 ÷ 0.71 ≈ 41.72
发展 T = 4 ÷ 3.46 ≈ 1.15 Z = 4 ÷ 2.83 ≈ 1.41
孪生 T = 2.97 ÷ 1.73 ≈ 1.71 Z = 2.97 ÷ 0.17 ≈ 17.15
T-score 的分母是实际共现的平方根,共现次数少的词对很难拿高分,它偏向出现得多又稳的搭配,惯用的门槛是 2。Z-score 的分母是期望的平方根,期望很小时会被放得很大,和 PMI 一样偏爱罕见组合。
Dice 和 LogDice
Dice 系数来自 Dice 1945 年的生态学研究,看两个词互相召唤的比例。LogDice 由 Rychlý 2008 年提出,是它的对数形式,上限是 14。
Dice = 2O ÷ (f(节点词) + f(搭配词))
LogDice = 14 + log₂ Dice
转型 Dice = 60 ÷ 150 = 0.40 LogDice ≈ 12.68
发展 Dice = 24 ÷ 900 ≈ 0.027 LogDice ≈ 8.77
孪生 Dice = 6 ÷ 103 ≈ 0.058 LogDice ≈ 9.90
Dice 和 LogDice 里没有总词数 N,材料多大都不影响它们的取值,不同规模的语料之间可以直接比较,这是它们最大的长处。
三组数放在一起
| 指标 | 转型 | 发展 | 孪生 | 偏好 |
|---|---|---|---|---|
| PMI | 5.91 | 0.58 | 6.64 | 罕见组合 |
| MI3 | 15.72 | 7.75 | 9.81 | 高频又紧密 |
| LL | 219.3 | 1.93 | 27.7 | 证据充分 |
| T-score | 5.39 | 1.15 | 1.71 | 稳定出现 |
| Z-score | 41.72 | 1.41 | 17.15 | 罕见组合 |
| Dice | 0.40 | 0.027 | 0.058 | 互相召唤 |
| LogDice | 12.68 | 8.77 | 9.90 | 跨语料比较 |
七项指标里只有 PMI 把孪生排在转型前面,Z-score 也把它抬得很高。Evert 2008 年系统比较了这些关联测度,结论是没有哪一个在所有任务上都最好,稳妥的做法是用 LL 排序,再看 LogDice 或 T-score 印证。TATOOLS 一次把七项都算出来,报告里的【多指标对比】把每个指标各自的前 20 名并排列出,哪些搭配在几种口径下都靠前,一眼就看得出。
05
节点模式和全局模式
【节点词】里填了词,TATOOLS 以这些词为中心,只数它们身边的搭配伙伴,每个节点词单独给出一张排行,并画出【搭配关系网络图】,节点词在中间,搭配词围在四周,连线越粗关联越强。节点词本身即使在停用词表里,也不会被去掉。
【节点词】留空,TATOOLS 进入全局模式,以每一个词为中心扫一遍,跑出整批材料里所有显著的二词组合,放在【全局显著搭配】里。这适合在还不知道该研究哪个词的时候,先看看材料里有哪些反复出现的组合。
06
停用词、词形合并和语言
的和是、the 和 of 这类功能词到处都有,会和任何词共现,不去掉它们,排行前面会被占满。工具页的【停用词过滤】默认使用系统停用词,也可以补充自己的;去掉的词既不参与共现,也不计入总词数 N,统计量的分母和候选搭配保持一致。
【词形合并】把几种写法并成一种再计数,比如把 AI 和人工智慧都并到人工智能,同一个概念不会被拆成几个词分摊频次。【文本语言】可以自动检测,也可以指定中文或英文;中文材料还可以打开【自动补充词典】,先把材料里被切碎的新词找出来加进词典再分词。
07
工具页上的设置一览
| 设置 | 范围 | 默认 | 影响什么 |
|---|---|---|---|
| 节点词 | 自己填写,可留空 | 空 | 节点模式或全局模式 |
| 左窗口宽度 | 0 到 10 个词 | 5 | 节点词左边看多远 |
| 右窗口宽度 | 0 到 10 个词 | 5 | 节点词右边看多远 |
| 允许窗口跨句 | 开或关 | 关 | 窗口能否跨过句末 |
| 最低共现次数 | 1 到 20 | 3 | 共现太少的词对不计入 |
| 文本语言 | 自动检测,中文,英文 | 自动检测 | 分词方式 |
| 停用词过滤 | 系统停用词和自定义 | 使用系统停用词 | 哪些词不参与统计 |
| 词形合并 | 自己填写 | 空 | 几种写法并成一种 |
窗口越宽,找到的是越松散的语义关联;窗口越窄,找到的越接近固定短语。研究固定搭配用左右各 1 到 3 个词,研究话题关联用左右各 5 个词左右。
08
报告怎么读
| 区块 | 先看什么 |
|---|---|
| 这份报告能告诉你什么 | 最强的搭配和数据提示 |
| 总体规模 | 分析模式、语种和参与统计的总词数 |
| 节点搭配伙伴 | 每个节点词按 LL 排的搭配排行 |
| 全局显著搭配 | 全局模式下的二词组合排行 |
| 多指标对比 | 七项指标各自的前 20 名 |
| 搭配关系网络图 | 节点词和搭配词的概念地图 |
| 下一步建议 | 按本次结果给出的调整方向 |
排行表里每一行都有共现次数、期望和七项指标,表格上方的【排序指标】可以换成任意一项。读的顺序是先看 LL 排行的前二三十个搭配,再到多指标对比里看它们在 LogDice 和 T-score 下是否仍然靠前,最后在网络图里把几个节点词的搭配放在一起比较。全部搭配都可以下载成表格,不做截断。
09
把结果写进论文
搭配分析的方法部分要写明节点词、窗口、最低共现次数和所用的关联测度。下面是一段写法示例,方括号里换成自己的内容。
本研究使用 TATOOLS 的词语搭配强度分析,以 [节点词] 为节点词,在左右各 [窗口] 个词的跨度内统计共现,窗口不跨句,去除停用词后参与统计的总词数为 [N],最低共现次数设为 [次数]。搭配词按对数似然比排序(Dunning,1993),并以 LogDice(Rychlý,2008)交叉验证,报告 LL 大于 10.83(p < 0.001)的搭配。
报告搭配时,列出前若干个搭配词的共现次数、LL 和 LogDice,读者就能同时看到证据量和关联强度。
10
小结
搭配研究节点词在一定跨度内和谁做伴,关键是和碰巧同现的期望频次比较。
期望频次等于两个词的频次相乘再除以总词数,七项指标从不同角度比较实际共现和期望。
PMI 和 Z-score 偏爱罕见组合,MI3 和 T-score 偏向高频又稳定的搭配,LL 兼顾强度和证据量,LogDice 不受语料规模影响。
TATOOLS 一次算出七项指标,默认按 LL 排序,多指标对比并列各指标的前 20 名。
填了节点词看它们的搭配伙伴并画网络图,留空则跑出整批材料的显著二词组合。
找出搭配以后,想回到原文看每个搭配所在的句子,可以用 TATOOLS 的【语料检索】;想比较两批材料里哪些词显著偏多,用【语料对比关键词分析】;想看句法上反复出现的结构,用【依存句法模式挖掘】。
11
资料来源
Firth:A Synopsis of Linguistic Theory 1930–1955,收入 Studies in Linguistic Analysis,Blackwell,1957
Sinclair:Corpus, Concordance, Collocation,Oxford University Press,1991
Church、Gale、Hanks 与 Hindle:Using Statistics in Lexical Analysis,收入 Zernik 编 Lexical Acquisition,Lawrence Erlbaum,1991
Oakes:Statistics for Corpus Linguistics,Edinburgh University Press,1998
Dice:Measures of the Amount of Ecologic Association Between Species,Ecology,第 26 卷第 3 期,1945
Rychlý:A Lexicographer-Friendly Association Score,Proceedings of Recent Advances in Slavonic Natural Language Processing,2008
Evert:Corpora and Collocations,收入 Lüdeling 与 Kytö 编 Corpus Linguistics: An International Handbook,第 2 卷,De Gruyter,2008
END
