想比较两届学生的议论文,看哪一届用词更丰富;或者比较一位作家早期和晚期的作品,看这位作家的词汇是不是越写越窄。最直接的想法是数一数用了多少个不同的词,再除以总词数。可这样算出来,长文章几乎总是输给短文章,一万字的长篇小说,不同词的比例可能还不如一篇八百字的作文。
用词丰富程度在语言学里叫词汇多样性(Lexical Diversity)。从 1940 年代起,研究者提出了一连串指标,都在想办法绕开文本长度的干扰。TATOOLS 的【词汇多样性分析】一次算出九项通行指标,沿文本位置画出用词重复程度的变化,多份材料一起分析时,把各篇放到同一标准下对照,并比较哪几份的丰富度画像最接近。
这篇教程先讲 TTR 为什么受长度影响,再按几条不同的思路逐个讲下去,每个指标都配上可以手算的例子,最后讲设置、报告的读法和论文里的写法。
01
词汇多样性量什么
一段文字里所有的词,按出现一次算一次,叫形符(Token);不同的词各算一个,叫类符(Type)。
我 喜欢 读书 我 喜欢 写字 他 喜欢 读书 也 喜欢 画画
形符 N = 12
类符 V = 7:我,喜欢,读书,写字,他,也,画画
词汇多样性衡量的是类符相对形符有多少,也就是用词有多不重复。它在二语写作评估和儿童语言发展研究里是基本指标,作者风格和翻译研究也常用,学生作文的词汇多样性常被用来衡量语言水平,同一作者不同时期的词汇多样性可以看出风格的变化。
TATOOLS 的【词汇多样性分析】先对每份材料切词,再在这串词上计算全部九项指标。
02
TTR 和长度陷阱
最朴素的指标是类符形符比(Type-Token Ratio,TTR)。
TTR = V ÷ N
上例 7 ÷ 12 ≈ 0.583
问题出在文本越长,新词出现得越慢。常用词会一遍遍重复,类符的增长越来越跟不上形符。这条规律常用 Heaps 定律描述,V ≈ K × N^β,β 小于 1。取 K = 5,β = 0.6 手算。
N = 100 V ≈ 5 × 100^0.6 ≈ 79 TTR ≈ 0.79
N = 10000 V ≈ 5 × 10000^0.6 ≈ 1256 TTR ≈ 0.13
同一个人用同样的词汇习惯写作,只因为写得长,TTR 就从 0.79 掉到了 0.13。Tweedie 和 Baayen 1998 年系统检验了几十年来提出的各种词汇丰富度常数,发现大多数仍然随文本长度系统地变化。
所以 TTR 只适合比较长度相近的材料。长短不同的材料,要看下面这些专门为消除长度影响设计的指标。
03
分段和滑窗:MSTTR 与 MATTR
Johnson 1944 年提出的办法是把文本切成等长的段,每段算一次 TTR 再取平均,这就是分段平均类符形符比(MSTTR)。段长固定,不同长度的文本就有了可比的基础。
段长 4
第 1 段 我 喜欢 读书 我 3 ÷ 4 = 0.75
第 2 段 喜欢 写字 他 喜欢 3 ÷ 4 = 0.75
第 3 段 读书 也 喜欢 画画 4 ÷ 4 = 1.00
MSTTR = (0.75 + 0.75 + 1.00) ÷ 3 ≈ 0.833
末尾不足一段的词按原版做法丢弃。分段的切点是人为定的,同一段话切在不同位置,结果会有差别。Covington 和 McFall 2010 年提出移动平均类符形符比(MATTR),让一个固定长度的窗口从头到尾每次滑一个词,每个位置算一次 TTR,再取平均。
窗口 4,共 9 个位置
各窗口的类符数:3,3,4,4,3,4,4,3,4
平均 32 ÷ 9 ≈ 3.56
MATTR = 3.56 ÷ 4 ≈ 0.889
MATTR 用到了每一个可能的切点,结果稳定,也不丢掉任何词。工具页的【MATTR 滑窗大小】和【MSTTR 分段大小】都可以在 20 到 500 个词之间设定,默认 100,这也是文献里最常用的值。窗口越小,越容易被短距离的重复拉低。
04
MTLD:用词不重复能延续多长
McCarthy 2005 年提出、McCarthy 和 Jarvis 2010 年系统验证的文本词汇多样性度量(MTLD),换了一个问法,用词要延续多长,TTR 才会跌到一个固定的阈值。
从第一个词开始往后读,一边读一边算累计的 TTR,一旦跌到 0.72 以下,就记为一个因子,清零重新开始。读到最后剩下的一段不满一个因子,按它离 0.72 还差多远折算成部分因子。MTLD 等于总词数除以因子数,因子越少,说明用词越能延续不重复。
我 1/1 = 1
喜欢 2/2 = 1
读书 3/3 = 1
我 3/4 = 0.75
喜欢 3/5 = 0.60 跌破 0.72,记 1 个因子,清零
写字 他 喜欢 读书 也 喜欢 画画
末段 7 个词 6 个类符,TTR ≈ 0.857
部分因子 = (1 − 0.857) ÷ (1 − 0.72) ≈ 0.51
正向 MTLD = 12 ÷ 1.51 ≈ 7.95
TATOOLS 按原作者的做法,正着读一遍,再倒着读一遍,两个结果取平均,这个例子倒着读得到 12,最终 MTLD ≈ 9.97。真实材料的 MTLD 通常在几十到一百多之间。McCarthy 和 Jarvis 的验证研究表明,MTLD 在各种长度的文本上都相当稳定,是目前应用语言学里最常用的指标之一。
05
HD-D 和 vocd-D:抽样的思路
另一条思路是从文本里抽一小段样本,看样本里平均会出现多少个不同的词。
HD-D 用超几何分布精确算出这个期望值,不需要真的去抽。一个出现 f 次的词,在随机抽 s 个词的样本里至少出现一次的概率是
P = 1 − C(N − f, s) ÷ C(N, s)
HD-D = 所有类符的 P 之和 ÷ s
用上面 12 个词、抽 3 个词手算。
C(12, 3) = 220
喜欢 f = 4 P = 1 − C(8, 3) ÷ 220 = 1 − 56 ÷ 220 ≈ 0.745
我、读书 f = 2 P = 1 − C(10, 3) ÷ 220 = 1 − 120 ÷ 220 ≈ 0.455
四个只出现一次的词 P = 1 − C(11, 3) ÷ 220 = 0.25
HD-D = (0.745 + 2 × 0.455 + 4 × 0.25) ÷ 3 ≈ 0.885
HD-D 就是随机抽 3 个词时,样本 TTR 的期望值。TATOOLS 按 McCarthy 和 Jarvis 的惯例取 42 个词作为样本量,所有文本都在同样大的样本上比较。
vocd-D 由 Malvern 和 Richards 等人提出,它用一个参数 D 描述 TTR 随样本量下降的整条曲线。
TTR(N) = (D ÷ N) × (√(1 + 2N ÷ D) − 1)
N = 50 时
D = 60 TTR ≈ 0.760
D = 90 TTR ≈ 0.815
D 越大,曲线整体越高,用词越丰富。TATOOLS 在 35 到 50 个词的样本量上分别算出实际的 TTR,再找一个 D,让理论曲线和实际值贴得最紧。为了结果可以复现,样本用等间隔取出的片段代替随机抽样,同一份材料每次算出的 D 都一样。
06
Yule’s K、Yule’s I 和 Maas a²:看词频分布
前面几个指标都从 TTR 出发,Yule 1944 年换了一个角度,看词频分布有多集中。先数出每个出现次数有几个词,这叫频次谱。
出现 1 次的词:4 个(写字,他,也,画画)
出现 2 次的词:2 个(我,读书)
出现 4 次的词:1 个(喜欢)
Σ f² × V_f = 1 × 4 + 4 × 2 + 16 × 1 = 28
Yule’s K = 10000 × (Σ f² V_f − N) ÷ N²
= 10000 × (28 − 12) ÷ 144 ≈ 1111
Yule’s I = N² ÷ (Σ f² V_f − N) = 144 ÷ 16 = 9
K 越大,词频越集中在少数几个词上,用词越单调;I 是它的倒数形式,越大越多样。K 的一个好性质是在文本长度变化时相对稳定。
Maas 1972 年提出的 a² 同时用到类符和形符的对数。
a² = (ln N − ln V) ÷ (ln N)²
= (ln 12 − ln 7) ÷ (ln 12)² ≈ 0.539 ÷ 6.175 ≈ 0.087
a² 受文本长短的影响较小,但方向和其他指标相反,数值越小,用词越多样。TATOOLS 同时给出它的倒数 1 ÷ a²,方便和其他指标放在一起看。
07
九项指标一览
| 指标 | 思路 | 越大表示 | 受长度影响 |
|---|---|---|---|
| TTR | 类符除以形符 | 越多样 | 很大 |
| MSTTR | 等长分段的 TTR 平均 | 越多样 | 小 |
| MATTR | 滑动窗口的 TTR 平均 | 越多样 | 小 |
| MTLD | 不重复能延续多长 | 越多样 | 小 |
| HD-D | 抽样 TTR 的期望 | 越多样 | 小 |
| vocd-D | 拟合 TTR 曲线的参数 | 越多样 | 小 |
| Yule’s K | 词频集中程度 | 越单调 | 较小 |
| Yule’s I | K 的倒数形式 | 越多样 | 较小 |
| Maas a² | 类符形符的对数关系 | 越单调 | 较小 |
McCarthy 和 Jarvis 2010 年建议,论文里至少同时报告 MTLD、vocd-D 和 HD-D 三个指标,它们从不同角度测量,结论一致时最可靠。TATOOLS 的报告为 MTLD 和 MATTR 各附一句解读,写明这个数值在一般文本里大致处在什么水平。
08
切分单位、停用词和窗口
【切分单位】默认按词,中文先分词,英文按空格切词,这是主流的学术口径;也可以按字,中文按汉字、英文按字母统计,适合古文和字本位的研究。纯数字和单个英文字母不计入。【自定义词典】里的词按整词处理,专名和术语不会被切碎,否则同一个术语被切成两个常见词,会让多样性显得偏低。
【计算前去除停用词】默认关闭,保留原汁原味的语料,符合大多数文献的口径;打开以后,的和了这类功能词不参与计算,看的是实词的丰富程度。两种口径的数值差别很大,论文里要写明用的是哪一种。
【文本语言】可以自动检测,也可以指定中文或英文。材料太短时,指标都不稳定,工具页会在提交前提醒。
09
多份材料怎样对照
上传多份材料时,TATOOLS 对每一份单独计算,再把它们放在一起比较。
【多文件标准化雷达】把每个指标在各份材料之间缩放到 0 到 1,最低的记 0,最高的记 1,Maas 反过来缩放,统一成越往外越多样。
三份材料的 MTLD:60,80,100
缩放后:0,0.5,1
三份材料的 Maas a²:0.020,0.025,0.030
缩放后反向:1,0.5,0
【两两相似度矩阵】用缩放后的九维向量算两份材料的余弦相似度,看它们的丰富度画像像不像。余弦相似度看的是画像的形状,不看高低。
甲 = (1, 1, 0.5) 乙 = (0.5, 0.5, 0.25)
cos = 1.125 ÷ (1.5 × 0.75) = 1
乙在每个指标上都只有甲的一半,两者的余弦相似度却是 1,说明它们各项指标的相对强弱完全一样。想比较谁更丰富,看【多文件指标汇总表】里的原始数值。
10
MATTR 沿位置曲线
一篇长文里,用词重复常常集中在某几段,比如结尾反复总结,或者中间某一节在车轱辘话。【MATTR 沿位置曲线】让滑窗从头走到尾,横轴是窗口所在的位置,纵轴是这个窗口里的 TTR。
曲线在哪里明显下沉,哪一段的用词就开始变得重复;曲线一直平稳,说明全文用词的丰富程度前后一致。TATOOLS 在曲线下方写明最高和最低的位置,每份材料的曲线也可以下载成表格。
11
工具页上的设置一览
| 设置 | 选项或范围 | 默认 | 影响什么 |
|---|---|---|---|
| 文本语言 | 自动检测,中文,英文 | 自动检测 | 切分方式 |
| 切分单位 | 按词,按字 | 按词 | 以词还是以字为单位统计 |
| 计算前去除停用词 | 开或关 | 关 | 是否只看实词 |
| MATTR 滑窗大小 | 20 到 500 | 100 | 滑窗的长度 |
| MSTTR 分段大小 | 20 到 500 | 100 | 每段的长度 |
| 自定义词典 | 自己填写 | 空 | 术语按整词处理 |
九项指标每次都全部计算,不需要选择。
12
报告怎么读
| 区块 | 先看什么 |
|---|---|
| 这份报告能告诉你什么 | 一句话结论 |
| 9 项指标矩阵 | MTLD、MATTR、HD-D 的数值和解读 |
| MATTR 沿位置曲线 | 哪一段开始变得重复 |
| 多文件标准化雷达 | 哪份材料在哪个维度最突出 |
| 多文件指标汇总表 | 各份材料的原始数值 |
| 两两相似度矩阵 | 哪几份的丰富度画像相近 |
| 下一步建议 | 接着可以做的分析 |
读的顺序是先看 MTLD、MATTR 和 HD-D 三个长度不敏感的指标是否一致,再看位置曲线找出重复集中的段落,多份材料时最后到汇总表里比较原始数值。全部指标可以下载成汇总表。
13
把结果写进论文
词汇多样性的方法部分要写明切分单位、是否去除停用词和报告了哪些指标。下面是一段写法示例,方括号里换成自己的内容。
本研究使用 TATOOLS 的词汇多样性分析,以词为单位对 [文件数] 份文本进行切分,[保留 / 去除] 停用词后计算词汇多样性。考虑到类符形符比受文本长度影响,主要报告 MTLD(McCarthy 与 Jarvis,2010)、vocd-D 与 HD-D 三项指标,并以滑窗为 [窗口] 个词的 MATTR(Covington 与 McFall,2010)作为补充。
报告时列出每份材料的形符数、类符数和三项主要指标,读者就能判断比较是否公平。
14
小结
词汇多样性衡量类符相对形符有多少,TTR 最直观,但文本越长越低,只适合比较长度相近的材料。
MSTTR 和 MATTR 用固定长度的分段或滑窗消除长度影响,MATTR 利用了每一个切点。
MTLD 看用词不重复能延续多长,HD-D 和 vocd-D 从抽样和拟合的角度估计丰富度,三者常一起报告。
Yule’s K、Yule’s I 和 Maas a² 从词频分布出发,K 和 a² 越小越多样。
TATOOLS 一次算出九项指标,画出位置曲线,多份材料时给出标准化雷达、原始汇总表和两两相似度。
想看新词随篇幅怎样一个个出现,可以用 TATOOLS 的【词汇增长曲线分析】;想比较两批材料里哪些词用得明显更多,用【语料对比关键词分析】;想从文风上比较几份材料,用【写作风格判定】。
15
资料来源
Yule:The Statistical Study of Literary Vocabulary,Cambridge University Press,1944
Maas:Über den Zusammenhang zwischen Wortschatzumfang und Länge eines Textes,Zeitschrift für Literaturwissenschaft und Linguistik,第 2 卷第 8 期,1972
Heaps:Information Retrieval: Computational and Theoretical Aspects,Academic Press,1978
Malvern、Richards、Chipere 与 Durán:Lexical Diversity and Language Development,Palgrave Macmillan,2004
END
