返回教程列表
文本分析基础教程搭配分析语料库语言学对数似然比

词语搭配强度分析完整教程:从节点词与窗口共现,到对数似然比和 LogDice 等七项关联强度

数字化常和转型站在一起,还是和发展站在一起?光数一起出现的次数不够,要和碰巧同现的期望频次比。这篇教程从 Firth 和 Sinclair 的搭配研究讲起,说明 TATOOLS 的【词语搭配强度分析】怎样在左右窗口内统计节点词的共现,再用一份一万词的材料,手算三个搭配词的期望频次和七项关联强度。文中逐项讲清七项指标各自偏好什么样的搭配,哪些偏爱罕见组合,哪些看重证据量,以及为什么排行默认按对数似然比。最后讲节点模式与全局模式、停用词和窗口怎样设,报告怎样读,并给出论文方法部分的写法示例。

作者:TATOOLS 研究团队|更新于 2026-09-23|5472 个字符|约 19 分钟读完
collocation
立即使用

研究近十年的政府工作报告,想知道数字化这个词是怎样被谈论的。它常和转型、治理这类词站在一起,还是和经济发展站在一起?光数一起出现的次数不够,发展这类词本来就到处都是,和谁都会碰上几次。真正要找的,是那些和数字化一起出现得远比碰巧更多的词。

这正是语料库语言学里的搭配(Collocation)研究。TATOOLS 的【词语搭配强度分析】统计词对在设定窗口内一起出现了多少次,和两个词各自独立出现时按概率本应碰上的次数相比,一次算出七项关联强度,把固定搭配和碰巧同现区分开。填了节点词,只看这些词身边的搭配伙伴;不填,就跑出整批材料里所有显著的二词组合。

这篇教程先讲搭配研究什么,共现怎样计数,期望频次怎样算,再用一组手算的例子逐项讲七个指标,接着讲两种模式和几项预处理设置,最后讲报告的读法和论文里的写法。

01

搭配研究什么

Firth 1957 年有一句被反复引用的话,要认识一个词,看它和谁做伴。Sinclair 1991 年把这个想法做成了语料库方法,规定了三个基本概念。

概念 含义 例子
节点词 要研究的那个词 数字化
搭配词 在节点词附近出现的词 转型、治理、赋能
跨度 附近指左右各几个词 左右各 5 个词

搭配能揭示一个词在某批材料里被赋予的意义和立场。政策文本里数字化常和转型、治理搭配,新闻评论里可能更常和焦虑、鸿沟搭配,两批材料对同一个概念的建构就不一样。话语研究和翻译研究大量使用这种方法,二语习得研究也是。

TATOOLS 的【词语搭配强度分析】沿用这套概念,工具页的【节点词】就是要研究的词,【左窗口宽度】和【右窗口宽度】就是跨度。

02

共现怎样计数

TATOOLS 先分词,去掉纯数字和单个英文字母,按设置去掉停用词,再以每个节点词为中心,数它左右窗口里出现了哪些词。

· · ·

句子分词后:推进 数字化 转型 促进 经济 发展

节点词:数字化,左窗口 2,右窗口 2

左边:推进

右边:转型,促进

这一句贡献三对共现

左右窗口可以分别设在 0 到 10 个词之间,默认各 5 个。只看右窗口,看的是节点词后面接什么;只看左窗口,看的是什么修饰或引出它。

窗口默认不跨句,一句话结束,窗口就截止,上一句末尾的词不会和下一句开头的词算作共现。打开【允许窗口跨句】,整篇文章连成一串来数。【最低共现次数】默认 3,共现次数不到它的词对不进入结果,偶然碰上一两次的组合不会占据排行。

03

期望频次:碰巧会同现多少次

两个词一起出现了 30 次,多还是少,要和碰巧会同现的次数比。

· · ·

期望频次 E = f(节点词) × f(搭配词) ÷ N

f:词在全部材料里出现的次数;N:参与统计的总词数

一份 1 万个词的材料,数字化出现 100 次。

搭配词 搭配词出现次数 实际共现 O 期望 E
转型 50 30 100 × 50 ÷ 10000 = 0.5
发展 800 12 100 × 800 ÷ 10000 = 8
孪生 3 3 100 × 3 ÷ 10000 = 0.03

发展和数字化一起出现了 12 次,比转型少不了太多,但它自己出现了 800 次,碰巧也该碰上 8 次;转型只出现 50 次,却和数字化一起出现了 30 次,是期望的 60 倍。报告的表格里每一行都同时列出【共现次数】和【期望】。

七项指标都是在比较实际共现 O 和期望 E,只是比较的角度不同。下面用这三组数逐项手算。

04

七项关联强度

PMI 和 MI3

点互信息(PMI)由 Church 和 Hanks 1990 年引入词汇研究,看实际共现是期望的几倍,取以 2 为底的对数。

· · ·

PMI = log₂(O ÷ E)

转型 log₂(30 ÷ 0.5) = log₂ 60 ≈ 5.91

发展 log₂(12 ÷ 8) = log₂ 1.5 ≈ 0.58

孪生 log₂(3 ÷ 0.03) = log₂ 100 ≈ 6.64

孪生只和数字化一起出现过 3 次,PMI 却最高。PMI 天生偏爱罕见的词对,一个只出现几次的词,只要恰好都在节点词旁边,比值就会很大。

MI3 把实际共现取三次方再比,给共现次数加重分量,缓解 PMI 偏爱低频的毛病,Oakes 1998 年的统计教材把它和 PMI 并列介绍。

· · ·

MI3 = log₂(O³ ÷ E)

转型 log₂(27000 ÷ 0.5) = log₂ 54000 ≈ 15.72

孪生 log₂(27 ÷ 0.03) = log₂ 900 ≈ 9.81

用 MI3 排,转型重新回到孪生前面。

对数似然比 LL

Dunning 1993 年提出用对数似然比检验两个词的共现是否显著偏离独立,它对低频事件比卡方检验稳健得多。把每一对放进一张 2 × 2 的表里。

搭配词出现 搭配词没出现 合计
节点词出现 a = 30 b = 70 100
节点词没出现 c = 20 d = 9880 9900
合计 50 9950 10000
· · ·

LL = 2 × Σ O × ln(O ÷ E),对四个格子求和

每格的 E = 行合计 × 列合计 ÷ N

a 格 30 × ln(30 ÷ 0.5) ≈ 122.83

b 格 70 × ln(70 ÷ 99.5) ≈ −24.62

c 格 20 × ln(20 ÷ 49.5) ≈ −18.12

d 格 9880 × ln(9880 ÷ 9850.5) ≈ 29.54

LL = 2 × 109.63 ≈ 219.3

同样算出发展的 LL 约 1.93,孪生约 27.7。LL 服从自由度为 1 的卡方分布,超过 3.84 对应 p < 0.05,超过 10.83 对应 p < 0.001。转型和孪生都极其显著,发展和数字化的共现与碰巧没有显著差别。

LL 同时照顾了强度和证据量,TATOOLS 的排行默认按 LL 从高到低排。

T-score 和 Z-score

两者都是实际共现减去期望,再除以一个标准差的估计。Church、Gale、Hanks 和 Hindle 1991 年用 T-score 找稳定的搭配。

· · ·

T = (O − E) ÷ √O

Z = (O − E) ÷ √E

转型 T = 29.5 ÷ 5.48 ≈ 5.39 Z = 29.5 ÷ 0.71 ≈ 41.72

发展 T = 4 ÷ 3.46 ≈ 1.15 Z = 4 ÷ 2.83 ≈ 1.41

孪生 T = 2.97 ÷ 1.73 ≈ 1.71 Z = 2.97 ÷ 0.17 ≈ 17.15

T-score 的分母是实际共现的平方根,共现次数少的词对很难拿高分,它偏向出现得多又稳的搭配,惯用的门槛是 2。Z-score 的分母是期望的平方根,期望很小时会被放得很大,和 PMI 一样偏爱罕见组合。

Dice 和 LogDice

Dice 系数来自 Dice 1945 年的生态学研究,看两个词互相召唤的比例。LogDice 由 Rychlý 2008 年提出,是它的对数形式,上限是 14。

· · ·

Dice = 2O ÷ (f(节点词) + f(搭配词))

LogDice = 14 + log₂ Dice

转型 Dice = 60 ÷ 150 = 0.40 LogDice ≈ 12.68

发展 Dice = 24 ÷ 900 ≈ 0.027 LogDice ≈ 8.77

孪生 Dice = 6 ÷ 103 ≈ 0.058 LogDice ≈ 9.90

Dice 和 LogDice 里没有总词数 N,材料多大都不影响它们的取值,不同规模的语料之间可以直接比较,这是它们最大的长处。

三组数放在一起

指标 转型 发展 孪生 偏好
PMI 5.91 0.58 6.64 罕见组合
MI3 15.72 7.75 9.81 高频又紧密
LL 219.3 1.93 27.7 证据充分
T-score 5.39 1.15 1.71 稳定出现
Z-score 41.72 1.41 17.15 罕见组合
Dice 0.40 0.027 0.058 互相召唤
LogDice 12.68 8.77 9.90 跨语料比较

七项指标里只有 PMI 把孪生排在转型前面,Z-score 也把它抬得很高。Evert 2008 年系统比较了这些关联测度,结论是没有哪一个在所有任务上都最好,稳妥的做法是用 LL 排序,再看 LogDice 或 T-score 印证。TATOOLS 一次把七项都算出来,报告里的【多指标对比】把每个指标各自的前 20 名并排列出,哪些搭配在几种口径下都靠前,一眼就看得出。

05

节点模式和全局模式

【节点词】里填了词,TATOOLS 以这些词为中心,只数它们身边的搭配伙伴,每个节点词单独给出一张排行,并画出【搭配关系网络图】,节点词在中间,搭配词围在四周,连线越粗关联越强。节点词本身即使在停用词表里,也不会被去掉。

【节点词】留空,TATOOLS 进入全局模式,以每一个词为中心扫一遍,跑出整批材料里所有显著的二词组合,放在【全局显著搭配】里。这适合在还不知道该研究哪个词的时候,先看看材料里有哪些反复出现的组合。

06

停用词、词形合并和语言

的和是、the 和 of 这类功能词到处都有,会和任何词共现,不去掉它们,排行前面会被占满。工具页的【停用词过滤】默认使用系统停用词,也可以补充自己的;去掉的词既不参与共现,也不计入总词数 N,统计量的分母和候选搭配保持一致。

【词形合并】把几种写法并成一种再计数,比如把 AI 和人工智慧都并到人工智能,同一个概念不会被拆成几个词分摊频次。【文本语言】可以自动检测,也可以指定中文或英文;中文材料还可以打开【自动补充词典】,先把材料里被切碎的新词找出来加进词典再分词。

07

工具页上的设置一览

设置 范围 默认 影响什么
节点词 自己填写,可留空 节点模式或全局模式
左窗口宽度 0 到 10 个词 5 节点词左边看多远
右窗口宽度 0 到 10 个词 5 节点词右边看多远
允许窗口跨句 开或关 窗口能否跨过句末
最低共现次数 1 到 20 3 共现太少的词对不计入
文本语言 自动检测,中文,英文 自动检测 分词方式
停用词过滤 系统停用词和自定义 使用系统停用词 哪些词不参与统计
词形合并 自己填写 几种写法并成一种

窗口越宽,找到的是越松散的语义关联;窗口越窄,找到的越接近固定短语。研究固定搭配用左右各 1 到 3 个词,研究话题关联用左右各 5 个词左右。

08

报告怎么读

区块 先看什么
这份报告能告诉你什么 最强的搭配和数据提示
总体规模 分析模式、语种和参与统计的总词数
节点搭配伙伴 每个节点词按 LL 排的搭配排行
全局显著搭配 全局模式下的二词组合排行
多指标对比 七项指标各自的前 20 名
搭配关系网络图 节点词和搭配词的概念地图
下一步建议 按本次结果给出的调整方向

排行表里每一行都有共现次数、期望和七项指标,表格上方的【排序指标】可以换成任意一项。读的顺序是先看 LL 排行的前二三十个搭配,再到多指标对比里看它们在 LogDice 和 T-score 下是否仍然靠前,最后在网络图里把几个节点词的搭配放在一起比较。全部搭配都可以下载成表格,不做截断。

09

把结果写进论文

搭配分析的方法部分要写明节点词、窗口、最低共现次数和所用的关联测度。下面是一段写法示例,方括号里换成自己的内容。

本研究使用 TATOOLS 的词语搭配强度分析,以 [节点词] 为节点词,在左右各 [窗口] 个词的跨度内统计共现,窗口不跨句,去除停用词后参与统计的总词数为 [N],最低共现次数设为 [次数]。搭配词按对数似然比排序(Dunning,1993),并以 LogDice(Rychlý,2008)交叉验证,报告 LL 大于 10.83(p < 0.001)的搭配。

报告搭配时,列出前若干个搭配词的共现次数、LL 和 LogDice,读者就能同时看到证据量和关联强度。

10

小结

搭配研究节点词在一定跨度内和谁做伴,关键是和碰巧同现的期望频次比较。

期望频次等于两个词的频次相乘再除以总词数,七项指标从不同角度比较实际共现和期望。

PMI 和 Z-score 偏爱罕见组合,MI3 和 T-score 偏向高频又稳定的搭配,LL 兼顾强度和证据量,LogDice 不受语料规模影响。

TATOOLS 一次算出七项指标,默认按 LL 排序,多指标对比并列各指标的前 20 名。

填了节点词看它们的搭配伙伴并画网络图,留空则跑出整批材料的显著二词组合。

找出搭配以后,想回到原文看每个搭配所在的句子,可以用 TATOOLS 的【语料检索】;想比较两批材料里哪些词显著偏多,用【语料对比关键词分析】;想看句法上反复出现的结构,用【依存句法模式挖掘】。

11

资料来源

Firth:A Synopsis of Linguistic Theory 1930–1955,收入 Studies in Linguistic Analysis,Blackwell,1957

Sinclair:Corpus, Concordance, Collocation,Oxford University Press,1991

Church 与 Hanks:Word Association Norms, Mutual Information, and Lexicography,Computational Linguistics,第 16 卷第 1 期,1990

Church、Gale、Hanks 与 Hindle:Using Statistics in Lexical Analysis,收入 Zernik 编 Lexical Acquisition,Lawrence Erlbaum,1991

Dunning:Accurate Methods for the Statistics of Surprise and Coincidence,Computational Linguistics,第 19 卷第 1 期,1993

Oakes:Statistics for Corpus Linguistics,Edinburgh University Press,1998

Dice:Measures of the Amount of Ecologic Association Between Species,Ecology,第 26 卷第 3 期,1945

Rychlý:A Lexicographer-Friendly Association Score,Proceedings of Recent Advances in Slavonic Natural Language Processing,2008

Evert:Corpora and Collocations,收入 Lüdeling 与 Kytö 编 Corpus Linguistics: An International Handbook,第 2 卷,De Gruyter,2008


END