返回教程列表
文本分析基础教程文体学写作风格计量文体

写作风格判定完整教程:从四十来项文体统计特征,到八个风格维度、文体归属与改进建议

一篇文章读着像新闻稿还是像学术论文,差在哪里、差多少?这篇教程从 Yule 和 Biber 等人的文体研究讲起,说明 TATOOLS 的【写作风格判定】怎样先抽取五组四十来项统计特征,再把特征数值和首中尾三段节选交给大语言模型,按固定模板在八个维度上打分,每个分数都引用具体特征作依据。文中手算平均句长 20、变异系数 0.28 和几项密度指标,讲清文体归属、风格标签和改进建议怎样得出,多篇文本怎样比较。最后讲报告的阅读顺序和论文方法部分的写法。

作者:TATOOLS 研究团队|更新于 2026-09-24|3646 个字符|约 13 分钟读完
deep-style-analysis
立即使用

一篇课程论文交上来,老师说读着像新闻稿,不够学术;一份政策解读写完,同事说太像公文,普通读者读不进去。风格上的差别人人都感觉得到,要说清差在哪里、差多少,就得把感觉落到可以数的东西上。

文体学和计量语言学的做法是先量,再判。句子多长,长短是否参差,问句和感叹句占多少,实词虚词各占几成,逗号和引号用得密不密,第一人称出现得多不多,这些都是可以统计的写作习惯。把它们放在一起看,一篇文本的风格就有了一幅数字画像。

在 TATOOLS 的【写作风格判定】里【上传文档】,TATOOLS 先给每篇文本抽取四十来项统计特征,再把这些数值连同开头、中段和结尾三段节选,交给大语言模型按固定模板判读,给出八个风格维度的打分和文体归属候选,还有风格标签、优势不足和改进建议,每个分数都要引用具体的特征和数值作依据。

这篇教程先讲风格为什么能量化,再用小例子算几项核心特征,然后讲八个维度、文体归属和标签怎样得出,最后讲报告的读法和论文里的写法。

01

风格为什么能量化

用统计描述写作风格有很长的历史。Yule 1939 年研究句长能否作为散文风格的统计特征,发现不同作者的句长分布相当稳定。Leech 和 Short 1981 年为小说文体分析列出一份检查清单,从词汇和语法一路看到修辞与衔接。Biber 1988 年用几十项语言特征的共现关系,把英语的口语和书面语体区分成若干维度,比如交互性与信息性,这就是多维度分析法。

这些研究有一个共同的思路,单个特征说明不了风格,一组特征合起来才构成画像。TATOOLS 的做法沿用这个思路,先把四十来项特征全部算出来,判读时要求每个结论都回到具体的特征数值。

02

四十来项统计特征

特征分五组。

特征组 包括什么
句子层 平均句长、句长标准差和变异系数,陈述句、疑问句和感叹句比例,被动句和否定句比例
词汇层 平均词长,实词和虚词比例,连词密度
词性分布 名词、动词、形容词和副词等十一类词性的比例
标点风格 逗号、句号和引号等十二类标点每百字的密度
人称代词 第一、第二和第三人称代词每百词的密度

句子按句号、问号和叹号这类句末标点切分,句型看句末标点,疑问句以问号结尾,感叹句以叹号结尾。被动句比例是含被和让这类标记词的句子所占比例,否定句比例是含不和没这类否定词的句子所占比例,这两项按字面检索,数值偏宽。中文词性按分词后的词性标注归类,助词、介词和连词这类记为虚词,代词、副词和语气词也算在内,其余记为实词。

TATOOLS 下载的结果里有一张特征表,每篇文本一行,四十来项特征各占一列,可以拿去做进一步的统计。

03

手算几项核心特征

以一段五句话的示例文字为例,五句的长度分别是 12、20、28、16、24 个字。

· · ·

平均句长 = (12 + 20 + 28 + 16 + 24) ÷ 5 = 20

句长标准差 = √((8² + 0² + 8² + 4² + 4²) ÷ 5)

           = √(160 ÷ 5) ≈ 5.66

变异系数 = 5.66 ÷ 20 ≈ 0.28

平均句长反映句子整体是长是短,变异系数反映长短是否参差。两篇平均句长都是 20 字的文章,变异系数 0.1 的一篇句子长短整齐,读起来平稳;0.5 的一篇长短交错,节奏起伏更大。

标点和代词按密度计。

· · ·

全文 500 字,逗号 40 个

逗号密度 = 40 ÷ 500 × 100 = 8(每百字)

全文 300 词,第一人称代词 6 个

第一人称密度 = 6 ÷ 300 × 100 = 2(每百词)

300 词里虚词 120 个

虚词比例 = 120 ÷ 300 = 0.4

按每百字、每百词换算以后,长短不同的文本可以直接比较。学术论文的第一人称密度通常很低,个人随笔则高得多;公文的虚词比例往往低于口语。

04

八个风格维度

统计特征是一组数字,研究者更关心它们合起来说明什么。TATOOLS 把特征数值和三段节选一起交给大语言模型,按固定模板在八个维度上打 0 到 100 分。

维度 低分一端 高分一端
正式程度 口语化 书面、正式
句式复杂度 短句直白 长句嵌套
情感强度 克制平静 激烈强烈
主观色彩 客观冷峻 个人立场鲜明
叙事节奏 缓慢铺陈 紧凑跳跃
用词密度 稀疏松散 信息密集
修辞丰富度 平铺直叙 多比喻、排比、反问
论证严谨度 感性叙述 逻辑严密

模板规定每个分数都要锚定在特征的实际数值上,并写出依据,比如平均句长 42.3,明显长于一般书面文本,所以句式复杂度给高分。多篇文本一起提交时,每项特征还附上这一批文本的均值和范围,判读可以对照同批的其他文本。

报告里每篇文本有一张维度表,列出八个维度的得分和模型给出的依据。论文里引用某个维度分数时,把它依据的特征和数值一并写出,读者就能复核这个判断从哪里来。

05

文体归属、标签与建议

除了八个维度,判读还给出几类结论。

文体归属从十类候选里选出三到五项,每项附置信度和一句依据。

候选文体
学术论文、研究报告 新闻报道、时评
公文、政策文件 商业文案、营销文
散文、随笔 小说、叙事文学
诗歌、韵文 科普、知识普及
口语、对话、弹幕 技术文档、说明书

文体归属说的是这篇文本在写法上最像哪一类,和它实际写的题材可以不一致。一篇讨论经济的文章,写法可能更像散文。

风格标签是三到六个短语,概括语气和写作姿态,比如冷静客观和学术严谨。【风格标签规范】可以把同义的标签并成一个,比如把客观和理性都归到冷静客观;【排除词表】里的标签不进入结果。

优势、不足和改进建议同样要落在具体特征上,每条改进建议都写明改哪一方面、怎么改和数据依据,比如句长这一项,建议把超过 60 字的长句拆开,依据是最长句长和句长标准差都明显偏高。最后是一段一百多字的整体小结。

TATOOLS 判读的是写作风格本身,作者是谁、文本是否由机器生成,都在判读范围之外。

06

多篇文本一起比较

上传多篇文本时,TATOOLS 对每篇分别判读,再做跨文件汇总。

【风格维度雷达】把每篇文本的八个维度画成一个多边形,一眼看出哪一面突出、哪一面平淡;【维度横向对比】在同一个维度上并排比较各篇的得分;【文体归属分布】统计每篇排第一的文体,看这批文本最像哪一类;【风格标签热度】统计各篇标签出现的次数,看这批文本反复呈现什么调性。

比较几组文本时,同一批提交的效果最好,每项特征附带的批内均值和范围,让判读有了共同的参照。

07

工具页上的设置一览

设置 选项或范围 默认 影响什么
文本语言 自动检测、中文、英文 自动检测 用哪一套特征抽取办法
自定义词典 一行一词 专名和术语不被切碎
排除词表 一组词 哪些风格标签不进结果
风格标签规范 一行一组 哪些标签并成同一个

TATOOLS 的判读模板是固定的,八个维度和十类候选文体每次都相同,不同批次的结果能按同一套维度对照。

08

报告怎么读

区块 先看什么
这份结果说明了什么 最突出的维度和最像的文体
风格维度雷达 每篇文本哪一面突出
文体归属分布 这批文本最像什么文体
风格标签热度 反复出现的调性
维度横向对比 同一维度上谁高谁低
每篇文本的判读 小结、标签、维度表、文体候选、优势不足和建议

读的顺序是先看每篇的整体小结和风格标签,建立整体印象;再看维度表,重点看最高和最低的几个维度,逐条核对模型给出的依据;然后看文体候选和置信度;最后看改进建议,每条建议都附数据依据。

TATOOLS 下载的结果里有三张表,一张是每篇文本的全部统计特征,一张是多篇文本之间的风格相似度(上传多篇时才有),一张是每篇的维度得分和标签,连同首选文体和小结。

09

把结果写进论文

下面是一段常见的写法示例,方括号里换成自己的内容。

本研究使用 TATOOLS 的写作风格判定,对 [语料] 抽取句长、句型、词性、标点和人称代词五组共四十余项文体统计特征,并据此在正式程度、句式复杂度等八个维度上进行 0 至 100 的量表判读,每项判读均引用对应的特征数值。结果显示,[文本] 的 [维度] 得分为 [分数],依据是 [特征] 为 [数值]。

论文里报告统计特征时写明切句和计数的口径;报告维度分数时,同时列出它依据的特征数值,风格判断就有了可以复核的来源。

10

小结

写作风格可以落到四十来项可数的特征上,句子层、词汇层、词性、标点和人称代词各成一组。

平均句长和变异系数看句子长短与参差,标点和代词按每百字、每百词的密度比较。

TATOOLS 把特征数值和三段节选交给大语言模型,在八个维度上打分,每个分数都引用具体特征作依据。

判读还给出文体归属候选、风格标签、优势与不足、改进建议和整体小结。

多篇文本一起提交时,TATOOLS 附上批内统计作参照,并用雷达图和对比图并排比较。

想只看统计特征,并比较多篇文本的风格有多接近,可以用 TATOOLS 的【文体风格指纹】;想专门统计衔接词的用量和位置,用【话语标记词分析】;想比较几篇文本的用词丰富度,用【词汇多样性分析】。

11

资料来源

Yule:On Sentence-Length as a Statistical Characteristic of Style in Prose,Biometrika,第 30 卷第 3/4 期,1939

Leech 与 Short:Style in Fiction,Longman,1981

Biber:Variation across Speech and Writing,Cambridge University Press,1988


END