一篇课程论文交上来,老师说读着像新闻稿,不够学术;一份政策解读写完,同事说太像公文,普通读者读不进去。风格上的差别人人都感觉得到,要说清差在哪里、差多少,就得把感觉落到可以数的东西上。
文体学和计量语言学的做法是先量,再判。句子多长,长短是否参差,问句和感叹句占多少,实词虚词各占几成,逗号和引号用得密不密,第一人称出现得多不多,这些都是可以统计的写作习惯。把它们放在一起看,一篇文本的风格就有了一幅数字画像。
在 TATOOLS 的【写作风格判定】里【上传文档】,TATOOLS 先给每篇文本抽取四十来项统计特征,再把这些数值连同开头、中段和结尾三段节选,交给大语言模型按固定模板判读,给出八个风格维度的打分和文体归属候选,还有风格标签、优势不足和改进建议,每个分数都要引用具体的特征和数值作依据。
这篇教程先讲风格为什么能量化,再用小例子算几项核心特征,然后讲八个维度、文体归属和标签怎样得出,最后讲报告的读法和论文里的写法。
01
风格为什么能量化
用统计描述写作风格有很长的历史。Yule 1939 年研究句长能否作为散文风格的统计特征,发现不同作者的句长分布相当稳定。Leech 和 Short 1981 年为小说文体分析列出一份检查清单,从词汇和语法一路看到修辞与衔接。Biber 1988 年用几十项语言特征的共现关系,把英语的口语和书面语体区分成若干维度,比如交互性与信息性,这就是多维度分析法。
这些研究有一个共同的思路,单个特征说明不了风格,一组特征合起来才构成画像。TATOOLS 的做法沿用这个思路,先把四十来项特征全部算出来,判读时要求每个结论都回到具体的特征数值。
02
四十来项统计特征
特征分五组。
| 特征组 | 包括什么 |
|---|---|
| 句子层 | 平均句长、句长标准差和变异系数,陈述句、疑问句和感叹句比例,被动句和否定句比例 |
| 词汇层 | 平均词长,实词和虚词比例,连词密度 |
| 词性分布 | 名词、动词、形容词和副词等十一类词性的比例 |
| 标点风格 | 逗号、句号和引号等十二类标点每百字的密度 |
| 人称代词 | 第一、第二和第三人称代词每百词的密度 |
句子按句号、问号和叹号这类句末标点切分,句型看句末标点,疑问句以问号结尾,感叹句以叹号结尾。被动句比例是含被和让这类标记词的句子所占比例,否定句比例是含不和没这类否定词的句子所占比例,这两项按字面检索,数值偏宽。中文词性按分词后的词性标注归类,助词、介词和连词这类记为虚词,代词、副词和语气词也算在内,其余记为实词。
TATOOLS 下载的结果里有一张特征表,每篇文本一行,四十来项特征各占一列,可以拿去做进一步的统计。
03
手算几项核心特征
以一段五句话的示例文字为例,五句的长度分别是 12、20、28、16、24 个字。
平均句长 = (12 + 20 + 28 + 16 + 24) ÷ 5 = 20
句长标准差 = √((8² + 0² + 8² + 4² + 4²) ÷ 5)
= √(160 ÷ 5) ≈ 5.66
变异系数 = 5.66 ÷ 20 ≈ 0.28
平均句长反映句子整体是长是短,变异系数反映长短是否参差。两篇平均句长都是 20 字的文章,变异系数 0.1 的一篇句子长短整齐,读起来平稳;0.5 的一篇长短交错,节奏起伏更大。
标点和代词按密度计。
全文 500 字,逗号 40 个
逗号密度 = 40 ÷ 500 × 100 = 8(每百字)
全文 300 词,第一人称代词 6 个
第一人称密度 = 6 ÷ 300 × 100 = 2(每百词)
300 词里虚词 120 个
虚词比例 = 120 ÷ 300 = 0.4
按每百字、每百词换算以后,长短不同的文本可以直接比较。学术论文的第一人称密度通常很低,个人随笔则高得多;公文的虚词比例往往低于口语。
04
八个风格维度
统计特征是一组数字,研究者更关心它们合起来说明什么。TATOOLS 把特征数值和三段节选一起交给大语言模型,按固定模板在八个维度上打 0 到 100 分。
| 维度 | 低分一端 | 高分一端 |
|---|---|---|
| 正式程度 | 口语化 | 书面、正式 |
| 句式复杂度 | 短句直白 | 长句嵌套 |
| 情感强度 | 克制平静 | 激烈强烈 |
| 主观色彩 | 客观冷峻 | 个人立场鲜明 |
| 叙事节奏 | 缓慢铺陈 | 紧凑跳跃 |
| 用词密度 | 稀疏松散 | 信息密集 |
| 修辞丰富度 | 平铺直叙 | 多比喻、排比、反问 |
| 论证严谨度 | 感性叙述 | 逻辑严密 |
模板规定每个分数都要锚定在特征的实际数值上,并写出依据,比如平均句长 42.3,明显长于一般书面文本,所以句式复杂度给高分。多篇文本一起提交时,每项特征还附上这一批文本的均值和范围,判读可以对照同批的其他文本。
报告里每篇文本有一张维度表,列出八个维度的得分和模型给出的依据。论文里引用某个维度分数时,把它依据的特征和数值一并写出,读者就能复核这个判断从哪里来。
05
文体归属、标签与建议
除了八个维度,判读还给出几类结论。
文体归属从十类候选里选出三到五项,每项附置信度和一句依据。
| 候选文体 | |
|---|---|
| 学术论文、研究报告 | 新闻报道、时评 |
| 公文、政策文件 | 商业文案、营销文 |
| 散文、随笔 | 小说、叙事文学 |
| 诗歌、韵文 | 科普、知识普及 |
| 口语、对话、弹幕 | 技术文档、说明书 |
文体归属说的是这篇文本在写法上最像哪一类,和它实际写的题材可以不一致。一篇讨论经济的文章,写法可能更像散文。
风格标签是三到六个短语,概括语气和写作姿态,比如冷静客观和学术严谨。【风格标签规范】可以把同义的标签并成一个,比如把客观和理性都归到冷静客观;【排除词表】里的标签不进入结果。
优势、不足和改进建议同样要落在具体特征上,每条改进建议都写明改哪一方面、怎么改和数据依据,比如句长这一项,建议把超过 60 字的长句拆开,依据是最长句长和句长标准差都明显偏高。最后是一段一百多字的整体小结。
TATOOLS 判读的是写作风格本身,作者是谁、文本是否由机器生成,都在判读范围之外。
06
多篇文本一起比较
上传多篇文本时,TATOOLS 对每篇分别判读,再做跨文件汇总。
【风格维度雷达】把每篇文本的八个维度画成一个多边形,一眼看出哪一面突出、哪一面平淡;【维度横向对比】在同一个维度上并排比较各篇的得分;【文体归属分布】统计每篇排第一的文体,看这批文本最像哪一类;【风格标签热度】统计各篇标签出现的次数,看这批文本反复呈现什么调性。
比较几组文本时,同一批提交的效果最好,每项特征附带的批内均值和范围,让判读有了共同的参照。
07
工具页上的设置一览
| 设置 | 选项或范围 | 默认 | 影响什么 |
|---|---|---|---|
| 文本语言 | 自动检测、中文、英文 | 自动检测 | 用哪一套特征抽取办法 |
| 自定义词典 | 一行一词 | 空 | 专名和术语不被切碎 |
| 排除词表 | 一组词 | 空 | 哪些风格标签不进结果 |
| 风格标签规范 | 一行一组 | 空 | 哪些标签并成同一个 |
TATOOLS 的判读模板是固定的,八个维度和十类候选文体每次都相同,不同批次的结果能按同一套维度对照。
08
报告怎么读
| 区块 | 先看什么 |
|---|---|
| 这份结果说明了什么 | 最突出的维度和最像的文体 |
| 风格维度雷达 | 每篇文本哪一面突出 |
| 文体归属分布 | 这批文本最像什么文体 |
| 风格标签热度 | 反复出现的调性 |
| 维度横向对比 | 同一维度上谁高谁低 |
| 每篇文本的判读 | 小结、标签、维度表、文体候选、优势不足和建议 |
读的顺序是先看每篇的整体小结和风格标签,建立整体印象;再看维度表,重点看最高和最低的几个维度,逐条核对模型给出的依据;然后看文体候选和置信度;最后看改进建议,每条建议都附数据依据。
TATOOLS 下载的结果里有三张表,一张是每篇文本的全部统计特征,一张是多篇文本之间的风格相似度(上传多篇时才有),一张是每篇的维度得分和标签,连同首选文体和小结。
09
把结果写进论文
下面是一段常见的写法示例,方括号里换成自己的内容。
本研究使用 TATOOLS 的写作风格判定,对 [语料] 抽取句长、句型、词性、标点和人称代词五组共四十余项文体统计特征,并据此在正式程度、句式复杂度等八个维度上进行 0 至 100 的量表判读,每项判读均引用对应的特征数值。结果显示,[文本] 的 [维度] 得分为 [分数],依据是 [特征] 为 [数值]。
论文里报告统计特征时写明切句和计数的口径;报告维度分数时,同时列出它依据的特征数值,风格判断就有了可以复核的来源。
10
小结
写作风格可以落到四十来项可数的特征上,句子层、词汇层、词性、标点和人称代词各成一组。
平均句长和变异系数看句子长短与参差,标点和代词按每百字、每百词的密度比较。
TATOOLS 把特征数值和三段节选交给大语言模型,在八个维度上打分,每个分数都引用具体特征作依据。
判读还给出文体归属候选、风格标签、优势与不足、改进建议和整体小结。
多篇文本一起提交时,TATOOLS 附上批内统计作参照,并用雷达图和对比图并排比较。
想只看统计特征,并比较多篇文本的风格有多接近,可以用 TATOOLS 的【文体风格指纹】;想专门统计衔接词的用量和位置,用【话语标记词分析】;想比较几篇文本的用词丰富度,用【词汇多样性分析】。
11
资料来源
Leech 与 Short:Style in Fiction,Longman,1981
Biber:Variation across Speech and Writing,Cambridge University Press,1988
END
