返回教程列表
文本分析基础教程话语标记语篇衔接写作研究

话语标记词分析完整教程:从衔接理论与八类标记词,到句首句中与段落分布,再到多文件对比

两组学生的议论文,衔接词用得多不多,用的是哪几类,放在句子的什么位置?这篇教程从 Halliday 与 Hasan 的衔接理论讲起,说明 TATOOLS 的【话语标记词分析】怎样按八类内置词表检索全文,中文按字面最长匹配,英文按单词边界匹配,并区分句首和句中两种位置。文中用示例讲清句首的判断规则、每段密度的算法、沿段落分布曲线的滑窗,以及多份文件为什么按类别比例对比。最后讲怎样用上下文剔除非衔接用法,报告的阅读顺序和论文方法部分的写法。

作者:TATOOLS 研究团队|更新于 2026-09-24|3623 个字符|约 13 分钟读完
discourse-marker
立即使用

老师读两组学生的议论文,常有一种感觉,一组文章几乎每段都用首先和因此起头,另一组读着顺,却很少看到这些词。衔接词用得多不多,用的是哪几类,放在句子的什么位置,是写作研究和语篇分析里的常见问题,靠人工一篇篇数,既慢又难统一口径。

所以和然而这类词叫话语标记词,也叫衔接词或连接成分。它们本身不增加句子的命题内容,作用是提示前后两段话之间是什么逻辑关系,因果、转折还是递进。统计一批文本里这些词的用量和分布,就能看到作者怎样组织论证。

在 TATOOLS 的【话语标记词分析】里【上传文档】,TATOOLS 按内置的中英文标记词表检索全文,归入因果、转折、递进、列举、举例、总结、让步和澄清八类,统计每类用了多少次、用的是哪些词,区分句首和句中两种位置,沿段落画出各类标记词的疏密变化,多份文件并排对照。

这篇教程先讲话语标记词的理论来源和八个类别,再讲字面匹配怎样工作、句首句中怎样判断,然后用小例子讲清段落密度和多文件对比,最后讲报告的读法和论文里的写法。

01

话语标记词是什么

Halliday 和 Hasan 1976 年在《英语中的衔接》里把连接列为衔接手段之一,连接成分把前后句子在逻辑上串起来,分为增补、转折、因果和时间几大类。Schiffrin 1987 年专门研究了口语里的话语标记,Fraser 1999 年进一步界定,话语标记表示它所引出的话语和前文之间的关系,本身不参与句子的真值。中文研究里,廖秋忠 1986 年系统整理了现代汉语篇章中的连接成分。

· · ·

成本上升了,因此价格也要调整。

去掉因此:成本上升了,价格也要调整。

去掉因此,两句话说的事实没有变,读者却要自己推断前后是因果关系。标记词把这层关系明说出来。

研究里常看三件事,用了多少,用了哪几类,用在什么位置。二语写作研究关注学习者是否过多依赖少数几个句首标记词,学术写作和政策文本研究则看因果和让步用得够不够,列举和总结怎样搭起层次。TATOOLS 把这三件事一次统计出来。

02

八类标记词

TATOOLS 内置中英文两套标记词表,每套按八类组织。

类别 表示什么关系 中文例词
因果 原因和结果 因为,所以,因此,由此可见
转折 前后相反或对比 然而,但是,不过,相比之下
递进 在前文基础上追加 而且,此外,甚至,与此同时
列举 分条或按顺序展开 首先,其次,一是,最后
举例 引出例子 例如,比如,譬如,以下为例
总结 归纳前文 总之,综上所述,总的来说
让步 先承认再转回 虽然,尽管,即使,诚然
澄清 换一种说法 也就是说,换言之,具体来说

【启用的标记类别】默认八类全选,只勾选的类别参与统计。内置词表覆盖学术和政策文本里常见的衔接词,评论和口语里的也收了不少,【自定义标记词】可以按类别补充自己领域的说法,一行写一类,格式是类别英文名加冒号再加几个词,比如 cause: 故而, 因之

03

字面匹配怎样工作

中文标记词在原文里按字面检索,从左往右扫,遇到能匹配的词就记一处,同一位置优先匹配最长的词。

· · ·

原文 综上所述,这一方案可行。

候选 综上所述(总结),综上(总结)

结果 记一处综上所述,不再重复记综上

英文按单词边界匹配,大小写不分,多词短语如 on the other hand 中间的空格可以是任意空白。

同一个词有衔接用法,也有别的用法,Fraser 在界定话语标记时专门讨论过这一点。第一次里的第一,进一步加强里的进一步,按字面都会被数进去,而它们在这里并不连接前后两段话。

TATOOLS 给每个标记词保留几条前后各约 30 字的上下文,报告的【各类标记词频次明细】里可以逐条看。某个词在自己的材料里大多不是衔接用法,把它填进【屏蔽标记词】,内置词和自定义词都能屏蔽,这个词就不再参与统计。

04

句首还是句中

同一个因此,可以领起一句话,也可以嵌在句子中间。

· · ·

成本上升了,因此价格也要调整。 句首

价格因此上调。 句中

TATOOLS 看标记词前面紧挨着的字符。前面是句号或分号这类句末标点,或者是逗号和顿号这类标点,或者是引号,或者就是段落开头,记为句首,这时标记词领起一句或一个分句;前面是普通文字,记为句中。

· · ·

句首占比 = 句首命中数 ÷ 总命中数

句首的标记词把论证的层次明摆出来,读者一眼就能看到这里转折了,那里在总结。句首占比高的文本,组织痕迹更显眼。报告的【句首 vs 句中(按类别)】按类别分开统计,能看出哪几类标记词更常放在句首。

05

段落密度与沿位置分布

TATOOLS 以空行分段,上传前让段与段之间空一行,分段才准。每段密度是总命中数除以段落数。

· · ·

一篇议论文 12 段,共 18 处标记词(示例)

每段密度 = 18 ÷ 12 = 1.5

【当前文件衔接概览】给出总命中数和每段密度,句首占比和主导类别也列在一起,并附一句定性说明。

标记词在文中的位置同样有信息。总结类常集中在结尾几段,列举类常出现在展开论证的段落。【沿段落位置分布曲线】沿段落顺序画出每一类的命中数,【沿位置分布段落滑窗】决定几段合成一个点。

· · ·

12 段,滑窗 3

第 1 到 3 段、第 4 到 6 段、第 7 到 9 段、第 10 到 12 段

共 4 个点,每个点是这 3 段的命中数之和

滑窗为 1 时每段一个点,曲线最细但起伏大;长材料把滑窗调大,曲线更平滑,走势更清楚。

06

多份文件怎样比

几份文件长短不同,直接比命中次数不公平。TATOOLS 按每份文件各类命中数占该文件总命中数的比例来比较。

类别 文件甲(40 处) 文件乙(100 处)
因果 12,30% 30,30%
转折 8,20% 10,10%
列举 10,25% 40,40%
其余五类 10,25% 20,20%

两份文件的因果类都占 30%,乙的命中次数是甲的两倍多,比例却一样;乙更偏重列举,甲的转折用得更多。

报告的【多文件 8 维雷达对比】把每份文件的八个比例画成一个多边形,【多文件汇总】并排列出每份文件的段落数、总命中和每段密度,句首占比和主导类别也在表里,【文件选择】切换当前查看的文件。

07

工具页上的设置一览

设置 选项或范围 默认 影响什么
文本语言 自动检测、中文、英文 自动检测 用哪一套内置词表
启用的标记类别 八类任选 全选 哪些类别参与统计
沿位置分布段落滑窗 1 到 20 段 1 分布曲线几段合成一个点
自定义标记词 一行一类 补充自己领域的标记词
屏蔽标记词 一组词 哪些词不参与统计

自定义标记词旁边有【填入中文示例】和【填入英文示例】两个按钮,TATOOLS 会填入覆盖全部八类的模板,改词或加词即可。

08

报告怎么读

区块 先看什么
这份结果说明了什么 总命中、密度和最突出的类别
当前文件衔接概览 总命中数、每段密度、句首占比、主导类别
8 类标记词分布 八类各占多少
沿段落位置分布曲线 各类标记词在文中哪里密集
句首 vs 句中(按类别) 哪几类常放在句首
各类标记词频次明细 每类用了哪些词,附上下文
多文件 8 维雷达对比 几份文件的类别比例有何不同
多文件汇总 各文件的密度和句首占比

读的顺序是先看类别分布,找出这批文本偏重哪几类关系;再到频次明细里看每类具体用了哪些词,逐条翻一翻上下文,把非衔接用法的词屏蔽后重跑;然后看句首占比和位置曲线;多份文件时最后看雷达图和汇总表。

TATOOLS 下载的结果里有两张表,一张是每份文件每一类的命中数、占比和句首句中数,一张是标记词命中的上下文明细。

09

把结果写进论文

下面是一段常见的写法示例,方括号里换成自己的内容。

本研究使用 TATOOLS 的话语标记词分析,参照 Halliday 与 Hasan(1976)的衔接理论,将话语标记词分为因果、转折、递进、列举、举例、总结、让步、澄清八类,对 [语料] 进行检索统计,并经人工核对上下文剔除 [词] 等非衔接用法。结果显示,[文件或组别] 平均每段使用 [数值] 处标记词,其中 [类别] 占 [比例],句首位置占 [比例]。

论文里列出每类的命中数和占比,说明标记词表的来源和屏蔽了哪些词,比较几组文本时报告每段密度和类别比例,总次数受篇幅影响,单独报告不够。

10

小结

话语标记词提示前后两段话的逻辑关系,本身不改变句子的命题内容。

TATOOLS 按因果、转折、递进、列举、举例、总结、让步、澄清八类检索统计,内置中英文词表,可以补充和屏蔽。

中文按字面最长匹配,英文按单词边界匹配,每个词附上下文,便于剔除非衔接用法。

标记词前面是标点或段落开头记为句首,句首占比反映论证层次的显眼程度。

每段密度和沿段落分布曲线看疏密,多份文件按类别比例对比,长短不同也能比。

想从四十来项统计特征看一篇文章的整体写作风格,可以用 TATOOLS 的【写作风格判定】;想找出一组文本相对另一组明显多用的词,用【语料对比关键词分析】。

11

资料来源

Halliday 与 Hasan:Cohesion in English,Longman,1976

廖秋忠:现代汉语篇章中的连接成分,中国语文,1986 年第 6 期

Schiffrin:Discourse Markers,Cambridge University Press,1987

Fraser:What Are Discourse Markers?,Journal of Pragmatics,第 31 卷第 7 期,1999


END