返回教程列表
文本分析基础教程词汇多样性MTLD语料库语言学

词汇多样性分析完整教程:从 TTR 的长度陷阱,到 MTLD 与 MATTR 等九项指标,再到多份文本的丰富度对照

一万字的长篇小说,不同词的比例可能还不如一篇八百字的作文,用词丰富程度该怎样比?这篇教程从类符和形符讲起,用 Heaps 定律说明 TTR 为什么随文本变长而下降,再用一句十二个词的话,手算 MSTTR 和 MATTR,逐步推出 MTLD 的因子,算出 HD-D 的超几何概率,以及 Yule’s K 和 Maas a²。接着说明 TATOOLS 的【词汇多样性分析】怎样一次算出九项指标,多份材料怎样标准化后放进雷达图,两两相似度看的是画像的形状。最后讲切分单位和停用词的口径、位置曲线和报告的读法,并给出论文方法部分的写法示例。

作者:TATOOLS 研究团队|更新于 2026-09-24|6025 个字符|约 21 分钟读完
lexical-diversity
立即使用

想比较两届学生的议论文,看哪一届用词更丰富;或者比较一位作家早期和晚期的作品,看这位作家的词汇是不是越写越窄。最直接的想法是数一数用了多少个不同的词,再除以总词数。可这样算出来,长文章几乎总是输给短文章,一万字的长篇小说,不同词的比例可能还不如一篇八百字的作文。

用词丰富程度在语言学里叫词汇多样性(Lexical Diversity)。从 1940 年代起,研究者提出了一连串指标,都在想办法绕开文本长度的干扰。TATOOLS 的【词汇多样性分析】一次算出九项通行指标,沿文本位置画出用词重复程度的变化,多份材料一起分析时,把各篇放到同一标准下对照,并比较哪几份的丰富度画像最接近。

这篇教程先讲 TTR 为什么受长度影响,再按几条不同的思路逐个讲下去,每个指标都配上可以手算的例子,最后讲设置、报告的读法和论文里的写法。

01

词汇多样性量什么

一段文字里所有的词,按出现一次算一次,叫形符(Token);不同的词各算一个,叫类符(Type)。

· · ·

我 喜欢 读书 我 喜欢 写字 他 喜欢 读书 也 喜欢 画画

形符 N = 12

类符 V = 7:我,喜欢,读书,写字,他,也,画画

词汇多样性衡量的是类符相对形符有多少,也就是用词有多不重复。它在二语写作评估和儿童语言发展研究里是基本指标,作者风格和翻译研究也常用,学生作文的词汇多样性常被用来衡量语言水平,同一作者不同时期的词汇多样性可以看出风格的变化。

TATOOLS 的【词汇多样性分析】先对每份材料切词,再在这串词上计算全部九项指标。

02

TTR 和长度陷阱

最朴素的指标是类符形符比(Type-Token Ratio,TTR)。

· · ·

TTR = V ÷ N

上例 7 ÷ 12 ≈ 0.583

问题出在文本越长,新词出现得越慢。常用词会一遍遍重复,类符的增长越来越跟不上形符。这条规律常用 Heaps 定律描述,V ≈ K × N^β,β 小于 1。取 K = 5,β = 0.6 手算。

· · ·

N = 100 V ≈ 5 × 100^0.6 ≈ 79 TTR ≈ 0.79

N = 10000 V ≈ 5 × 10000^0.6 ≈ 1256 TTR ≈ 0.13

同一个人用同样的词汇习惯写作,只因为写得长,TTR 就从 0.79 掉到了 0.13。Tweedie 和 Baayen 1998 年系统检验了几十年来提出的各种词汇丰富度常数,发现大多数仍然随文本长度系统地变化。

所以 TTR 只适合比较长度相近的材料。长短不同的材料,要看下面这些专门为消除长度影响设计的指标。

03

分段和滑窗:MSTTR 与 MATTR

Johnson 1944 年提出的办法是把文本切成等长的段,每段算一次 TTR 再取平均,这就是分段平均类符形符比(MSTTR)。段长固定,不同长度的文本就有了可比的基础。

· · ·

段长 4

第 1 段 我 喜欢 读书 我 3 ÷ 4 = 0.75

第 2 段 喜欢 写字 他 喜欢 3 ÷ 4 = 0.75

第 3 段 读书 也 喜欢 画画 4 ÷ 4 = 1.00

MSTTR = (0.75 + 0.75 + 1.00) ÷ 3 ≈ 0.833

末尾不足一段的词按原版做法丢弃。分段的切点是人为定的,同一段话切在不同位置,结果会有差别。Covington 和 McFall 2010 年提出移动平均类符形符比(MATTR),让一个固定长度的窗口从头到尾每次滑一个词,每个位置算一次 TTR,再取平均。

· · ·

窗口 4,共 9 个位置

各窗口的类符数:3,3,4,4,3,4,4,3,4

平均 32 ÷ 9 ≈ 3.56

MATTR = 3.56 ÷ 4 ≈ 0.889

MATTR 用到了每一个可能的切点,结果稳定,也不丢掉任何词。工具页的【MATTR 滑窗大小】和【MSTTR 分段大小】都可以在 20 到 500 个词之间设定,默认 100,这也是文献里最常用的值。窗口越小,越容易被短距离的重复拉低。

04

MTLD:用词不重复能延续多长

McCarthy 2005 年提出、McCarthy 和 Jarvis 2010 年系统验证的文本词汇多样性度量(MTLD),换了一个问法,用词要延续多长,TTR 才会跌到一个固定的阈值。

从第一个词开始往后读,一边读一边算累计的 TTR,一旦跌到 0.72 以下,就记为一个因子,清零重新开始。读到最后剩下的一段不满一个因子,按它离 0.72 还差多远折算成部分因子。MTLD 等于总词数除以因子数,因子越少,说明用词越能延续不重复。

· · ·

我 1/1 = 1

喜欢 2/2 = 1

读书 3/3 = 1

我 3/4 = 0.75

喜欢 3/5 = 0.60 跌破 0.72,记 1 个因子,清零

写字 他 喜欢 读书 也 喜欢 画画

末段 7 个词 6 个类符,TTR ≈ 0.857

部分因子 = (1 − 0.857) ÷ (1 − 0.72) ≈ 0.51

正向 MTLD = 12 ÷ 1.51 ≈ 7.95

TATOOLS 按原作者的做法,正着读一遍,再倒着读一遍,两个结果取平均,这个例子倒着读得到 12,最终 MTLD ≈ 9.97。真实材料的 MTLD 通常在几十到一百多之间。McCarthy 和 Jarvis 的验证研究表明,MTLD 在各种长度的文本上都相当稳定,是目前应用语言学里最常用的指标之一。

05

HD-D 和 vocd-D:抽样的思路

另一条思路是从文本里抽一小段样本,看样本里平均会出现多少个不同的词。

HD-D 用超几何分布精确算出这个期望值,不需要真的去抽。一个出现 f 次的词,在随机抽 s 个词的样本里至少出现一次的概率是

· · ·

P = 1 − C(N − f, s) ÷ C(N, s)

HD-D = 所有类符的 P 之和 ÷ s

用上面 12 个词、抽 3 个词手算。

· · ·

C(12, 3) = 220

喜欢 f = 4 P = 1 − C(8, 3) ÷ 220 = 1 − 56 ÷ 220 ≈ 0.745

我、读书 f = 2 P = 1 − C(10, 3) ÷ 220 = 1 − 120 ÷ 220 ≈ 0.455

四个只出现一次的词 P = 1 − C(11, 3) ÷ 220 = 0.25

HD-D = (0.745 + 2 × 0.455 + 4 × 0.25) ÷ 3 ≈ 0.885

HD-D 就是随机抽 3 个词时,样本 TTR 的期望值。TATOOLS 按 McCarthy 和 Jarvis 的惯例取 42 个词作为样本量,所有文本都在同样大的样本上比较。

vocd-D 由 Malvern 和 Richards 等人提出,它用一个参数 D 描述 TTR 随样本量下降的整条曲线。

· · ·

TTR(N) = (D ÷ N) × (√(1 + 2N ÷ D) − 1)

N = 50 时

D = 60 TTR ≈ 0.760

D = 90 TTR ≈ 0.815

D 越大,曲线整体越高,用词越丰富。TATOOLS 在 35 到 50 个词的样本量上分别算出实际的 TTR,再找一个 D,让理论曲线和实际值贴得最紧。为了结果可以复现,样本用等间隔取出的片段代替随机抽样,同一份材料每次算出的 D 都一样。

06

Yule’s K、Yule’s I 和 Maas a²:看词频分布

前面几个指标都从 TTR 出发,Yule 1944 年换了一个角度,看词频分布有多集中。先数出每个出现次数有几个词,这叫频次谱。

· · ·

出现 1 次的词:4 个(写字,他,也,画画)

出现 2 次的词:2 个(我,读书)

出现 4 次的词:1 个(喜欢)

Σ f² × V_f = 1 × 4 + 4 × 2 + 16 × 1 = 28

· · ·

Yule’s K = 10000 × (Σ f² V_f − N) ÷ N²

         = 10000 × (28 − 12) ÷ 144 ≈ 1111

Yule’s I = N² ÷ (Σ f² V_f − N) = 144 ÷ 16 = 9

K 越大,词频越集中在少数几个词上,用词越单调;I 是它的倒数形式,越大越多样。K 的一个好性质是在文本长度变化时相对稳定。

Maas 1972 年提出的 a² 同时用到类符和形符的对数。

· · ·

a² = (ln N − ln V) ÷ (ln N)²

   = (ln 12 − ln 7) ÷ (ln 12)² ≈ 0.539 ÷ 6.175 ≈ 0.087

a² 受文本长短的影响较小,但方向和其他指标相反,数值越小,用词越多样。TATOOLS 同时给出它的倒数 1 ÷ a²,方便和其他指标放在一起看。

07

九项指标一览

指标 思路 越大表示 受长度影响
TTR 类符除以形符 越多样 很大
MSTTR 等长分段的 TTR 平均 越多样
MATTR 滑动窗口的 TTR 平均 越多样
MTLD 不重复能延续多长 越多样
HD-D 抽样 TTR 的期望 越多样
vocd-D 拟合 TTR 曲线的参数 越多样
Yule’s K 词频集中程度 越单调 较小
Yule’s I K 的倒数形式 越多样 较小
Maas a² 类符形符的对数关系 越单调 较小

McCarthy 和 Jarvis 2010 年建议,论文里至少同时报告 MTLD、vocd-D 和 HD-D 三个指标,它们从不同角度测量,结论一致时最可靠。TATOOLS 的报告为 MTLD 和 MATTR 各附一句解读,写明这个数值在一般文本里大致处在什么水平。

08

切分单位、停用词和窗口

【切分单位】默认按词,中文先分词,英文按空格切词,这是主流的学术口径;也可以按字,中文按汉字、英文按字母统计,适合古文和字本位的研究。纯数字和单个英文字母不计入。【自定义词典】里的词按整词处理,专名和术语不会被切碎,否则同一个术语被切成两个常见词,会让多样性显得偏低。

【计算前去除停用词】默认关闭,保留原汁原味的语料,符合大多数文献的口径;打开以后,的和了这类功能词不参与计算,看的是实词的丰富程度。两种口径的数值差别很大,论文里要写明用的是哪一种。

【文本语言】可以自动检测,也可以指定中文或英文。材料太短时,指标都不稳定,工具页会在提交前提醒。

09

多份材料怎样对照

上传多份材料时,TATOOLS 对每一份单独计算,再把它们放在一起比较。

【多文件标准化雷达】把每个指标在各份材料之间缩放到 0 到 1,最低的记 0,最高的记 1,Maas 反过来缩放,统一成越往外越多样。

· · ·

三份材料的 MTLD:60,80,100

缩放后:0,0.5,1

三份材料的 Maas a²:0.020,0.025,0.030

缩放后反向:1,0.5,0

【两两相似度矩阵】用缩放后的九维向量算两份材料的余弦相似度,看它们的丰富度画像像不像。余弦相似度看的是画像的形状,不看高低。

· · ·

甲 = (1, 1, 0.5) 乙 = (0.5, 0.5, 0.25)

cos = 1.125 ÷ (1.5 × 0.75) = 1

乙在每个指标上都只有甲的一半,两者的余弦相似度却是 1,说明它们各项指标的相对强弱完全一样。想比较谁更丰富,看【多文件指标汇总表】里的原始数值。

10

MATTR 沿位置曲线

一篇长文里,用词重复常常集中在某几段,比如结尾反复总结,或者中间某一节在车轱辘话。【MATTR 沿位置曲线】让滑窗从头走到尾,横轴是窗口所在的位置,纵轴是这个窗口里的 TTR。

曲线在哪里明显下沉,哪一段的用词就开始变得重复;曲线一直平稳,说明全文用词的丰富程度前后一致。TATOOLS 在曲线下方写明最高和最低的位置,每份材料的曲线也可以下载成表格。

11

工具页上的设置一览

设置 选项或范围 默认 影响什么
文本语言 自动检测,中文,英文 自动检测 切分方式
切分单位 按词,按字 按词 以词还是以字为单位统计
计算前去除停用词 开或关 是否只看实词
MATTR 滑窗大小 20 到 500 100 滑窗的长度
MSTTR 分段大小 20 到 500 100 每段的长度
自定义词典 自己填写 术语按整词处理

九项指标每次都全部计算,不需要选择。

12

报告怎么读

区块 先看什么
这份报告能告诉你什么 一句话结论
9 项指标矩阵 MTLD、MATTR、HD-D 的数值和解读
MATTR 沿位置曲线 哪一段开始变得重复
多文件标准化雷达 哪份材料在哪个维度最突出
多文件指标汇总表 各份材料的原始数值
两两相似度矩阵 哪几份的丰富度画像相近
下一步建议 接着可以做的分析

读的顺序是先看 MTLD、MATTR 和 HD-D 三个长度不敏感的指标是否一致,再看位置曲线找出重复集中的段落,多份材料时最后到汇总表里比较原始数值。全部指标可以下载成汇总表。

13

把结果写进论文

词汇多样性的方法部分要写明切分单位、是否去除停用词和报告了哪些指标。下面是一段写法示例,方括号里换成自己的内容。

本研究使用 TATOOLS 的词汇多样性分析,以词为单位对 [文件数] 份文本进行切分,[保留 / 去除] 停用词后计算词汇多样性。考虑到类符形符比受文本长度影响,主要报告 MTLD(McCarthy 与 Jarvis,2010)、vocd-D 与 HD-D 三项指标,并以滑窗为 [窗口] 个词的 MATTR(Covington 与 McFall,2010)作为补充。

报告时列出每份材料的形符数、类符数和三项主要指标,读者就能判断比较是否公平。

14

小结

词汇多样性衡量类符相对形符有多少,TTR 最直观,但文本越长越低,只适合比较长度相近的材料。

MSTTR 和 MATTR 用固定长度的分段或滑窗消除长度影响,MATTR 利用了每一个切点。

MTLD 看用词不重复能延续多长,HD-D 和 vocd-D 从抽样和拟合的角度估计丰富度,三者常一起报告。

Yule’s K、Yule’s I 和 Maas a² 从词频分布出发,K 和 a² 越小越多样。

TATOOLS 一次算出九项指标,画出位置曲线,多份材料时给出标准化雷达、原始汇总表和两两相似度。

想看新词随篇幅怎样一个个出现,可以用 TATOOLS 的【词汇增长曲线分析】;想比较两批材料里哪些词用得明显更多,用【语料对比关键词分析】;想从文风上比较几份材料,用【写作风格判定】。

15

资料来源

Johnson:Studies in Language Behavior: I. A Program of Research,Psychological Monographs,第 56 卷第 2 期,1944

Yule:The Statistical Study of Literary Vocabulary,Cambridge University Press,1944

Maas:Über den Zusammenhang zwischen Wortschatzumfang und Länge eines Textes,Zeitschrift für Literaturwissenschaft und Linguistik,第 2 卷第 8 期,1972

Heaps:Information Retrieval: Computational and Theoretical Aspects,Academic Press,1978

Tweedie 与 Baayen:How Variable May a Constant Be? Measures of Lexical Richness in Perspective,Computers and the Humanities,第 32 卷第 5 期,1998

Malvern、Richards、Chipere 与 Durán:Lexical Diversity and Language Development,Palgrave Macmillan,2004

McCarthy 与 Jarvis:MTLD, vocd-D, and HD-D: A Validation Study of Sophisticated Approaches to Lexical Diversity Assessment,Behavior Research Methods,第 42 卷第 2 期,2010

Covington 与 McFall:Cutting the Gordian Knot: The Moving-Average Type–Token Ratio (MATTR),Journal of Quantitative Linguistics,第 17 卷第 2 期,2010


END