一篇公众号稿子读下来,总觉得哪里不对劲。满篇都是【真正的门槛不是技术,而是认知】这样的句子,段落开头常是【值得注意的是】,关键处总有一个破折号等着揭晓答案。每一句单看都通顺,合在一起就是一股说不清的 AI 味。
这股味道可以拆成具体的写法,也可以一项一项数出来。Guo 等人 2023 年整理中英文对照语料 HC3 时就发现,ChatGPT 的回答结构整齐,习惯用连接词把要点串起来,人类专家的回答口语化得多。Reinhart 等人 2025 年在《美国国家科学院院刊》上比较了大模型和人写的英文文本,指令微调后的模型在一整套语法和修辞特征上都和人写文本有系统差异。Kobak 等人同年统计了上千万篇生物医学摘要,发现一批词在大模型普及以后出现频率异常升高,用这种超额频率估计了有多少摘要经过大模型加工。
TATOOLS 的【AI味写作痕迹检测】沿着同样的思路做中文。它整理了十六种常见于大模型中文写作的写法,给其中大部分配上了参考频率,这些频率来自一组 629 篇中文非虚构文章的对照统计,300 篇由五个大模型生成,329 篇出自人手。在 TATOOLS 里【上传文档】,程序先按字面标记逐句找出候选,再由语言模型结合上下文逐条复核,确认下来的次数和同样篇幅下人写、机写各自的平均次数对照,算出一个 0 到 100 的【AI 味指数】,并在原文上用红字标出每一处。
这篇教程先讲为什么数写法能量出 AI 味,再逐个介绍十六种写法,接着讲文本怎样切分,候选怎样查找和复核,文本类型又怎样影响检查范围。AI 味指数的公式放在后半部分,配一个完整的手算例子,最后讲报告的读法、改稿的办法和论文里的写法。
01
为什么数写法能量出 AI 味
人写文章也用顿号列举,也用破折号,也会写【不是……而是……】。区别在于频率。同样一千个汉字,人写文章平均出现 1.78 处顿号串列,五个大模型生成的文章平均出现 3.21 处;破折号人写是 0.80 处,模型写是 2.38 处。单看一处说明不了什么,一篇文章里这类写法整体偏多,读者就会觉出 AI 味。
这种比较频率的办法在文体研究里由来已久。Mosteller 和 Wallace 1964 年研究《联邦党人文集》的作者归属,数的就是 upon、whilst 这类虚词在汉密尔顿和麦迪逊文章里各自出现多少次,再用概率模型比较一篇争议文章更像谁写的。Kobak 等人的超额词汇研究也是同一个逻辑,先确定一个基准频率,再看实际出现的次数超出基准多少。
TATOOLS 的【AI味写作痕迹检测】把这个逻辑用在十六种写法上。每种写法有两个参考频率,人写文章的平均值和大模型文章的平均值,一篇文章的实际次数落在两者之间什么位置,就决定了这类写法贡献多少分。
02
十六种写法
下表按写法的性质分组,列出每种写法的例子和参考频率。参考频率一栏写的是模型写和人写的平均值,没有给出的一侧留空。
| 写法 | 例子 | 参考频率(模型 / 人写) |
|---|---|---|
| 先否定再肯定 | 差距不是价格,而是服务 | 0.73 / 0.22 每千字 |
| 连着几句句式一样 | 相邻句的逗号数、长短都相同 | 9.41 / 4.81 每百段 |
| 修饰语太长 | 一个能够在不增加人力的情况下提升速度的工具 | 0.42 / 无 每千字 |
| 当……时开头 | 当所有人都能用 AI 写作时,…… | 0.26 / 无 每千字 |
| 对于……来说开头 | 对于早期团队来说,招人最难 | 0.22 / 无 每千字 |
| 顿号列一串 | 策划、执行、复盘、迭代 | 3.21 / 1.78 每千字 |
| 破折号 | 答案其实很简单——专注 | 2.38 / 0.80 每千字 |
| 重点是:式提示语 | 一句话总结:成本太高 | 0.29 / 0.08 每千字 |
| 只为引出列表的话 | 我见过的几种典型场景: | 0.29 / 0.03 每千字 |
| 小标题用一二三编号 | 一、二、三、排到底 | 无 |
| 然而、此外开头 | 然而,这个方案并不适用 | 0.18 / 0.03 每千字 |
| 这意味着重复上句 | 留存涨到 72%。这意味着…… | 0.15 / 无 每千字 |
| 段落开头没说评什么 | 值得注意的是,…… | 0.61% / 0.14% 的非首段 |
| 说白了开头 | 说白了,预算不够 | 0.025 / 0.008 每千字 |
| 把工具比作完美的人 | 像一位永不疲倦的智慧导师 | 0.018 / 0.002 每千字 |
| 有数字却说得笼统 | 前文写了 40 分钟,这句只说大幅缩短 | 无 |
几种写法值得多说一句。
先否定再肯定,研究者也叫它翻案腔,先立一个读者并没有的误解,再把它推翻。模型写中文特别爱用这种句式制造转折感,频率是人写的三倍多。文章确实用材料走过了从误解到修正的过程,或者是在更正一个事实,就属于正常写法。
连着几句句式一样,量的是相邻句子是否共用一个骨架。单看每句都通顺,连起来像在填表。
段落开头没说评什么,指新段落一上来就抛出【值得注意的是】【更重要的是】这类评论,句中却没有这和那这样回指上文的词,读者得回上一段去找评论对象。这种写法在模型文章里占非首段的 0.61%,人写只有 0.14%。
有数字却说得笼统,看的是前后文已经给了具体数字、时间或对象,这一句却换成【大幅提升】【大量】这类概括说法,把现成的具体信息盖掉了。
03
文本怎样切成可数的单位
数写法之前,先要确定在哪里数。TATOOLS 逐行读入文本,把每一行归入六类之一,标题、列表项、表格、代码、引用和正文段。只有正文段参与计数,标题和列表项的写法另有两条专门的规则去看。
正文段再按句末标点和分号切成句子,太短的碎片不单独算一句。句子里用引号括起来的部分会被跳过,引用别人的原话,写法算原作者的,不算这篇文章的。
参考频率有三种口径,折算到本文篇幅的方式各不相同。
每千字: 期望次数 = 参考频率 × 本文汉字数 / 1000
每百段: 期望次数 = 参考频率 × 本文正文段数 / 100
非首段比例:期望次数 = 参考频率 × 除第一段外的正文段数 / 100
一篇 3,000 字、40 个正文段的文章,顿号串列的人写期望是 1.78 × 3 = 5.34 处,模型写期望是 3.21 × 3 = 9.63 处;句式同构的人写期望是 4.81 × 0.4 ≈ 1.92 处,模型写期望是 9.41 × 0.4 ≈ 3.76 处。
上传多个文件时,TATOOLS 逐个文件找候选,汉字数和段落数合在一起折算,给出一个总的 AI 味指数。
04
第一步:按字面标记找候选
每种写法都有可以定位的字面标记。TATOOLS 先用这些标记在正文里逐句查找,找到的叫候选。
| 写法 | 字面标记 |
|---|---|
| 先否定再肯定 | 不是……而是、并非……而是、与其说……不如说、看似……实则、你以为……其实 |
| 顿号列一串 | 一个分句里出现两个以上顿号 |
| 破折号 | 正文里的破折号 |
| 然而、此外开头 | 句首的然而、因此、此外、与此同时、换言之、总而言之,后面紧跟逗号 |
| 把工具比作完美的人 | 像、如同、相当于这类比喻词后面跟着导师、秘书、管家、顾问这类职业称呼 |
| 有数字却说得笼统 | 显著提升、大幅增长、大量、众多,而本段或相邻段里有数字 |
| 小标题用一二三编号 | 同一种编号的小标题出现三个以上 |
连着几句句式一样用的是句子的结构指纹。TATOOLS 给每个句子记四样东西。逗号有几个,有没有冒号,有没有括号,长度落在哪一档,长度每 15 个字符一档。相邻句子的四样全部相同,就记为同构。
甲:政策出台后,企业反应积极,市场信心明显回升
乙:措施落地后,居民感受明显,消费意愿逐步增强
丙:我们去问了三家店,老板都说还行
甲 逗号 2 个,无冒号,无括号,21 字,长度档 1
乙 逗号 2 个,无冒号,无括号,21 字,长度档 1
丙 逗号 1 个,无冒号,无括号,15 字,长度档 1
甲、乙指纹相同,记一对同构;乙、丙逗号数不同,不算
计数口径和参考统计保持一致。句式同构按相邻句对数计,甲乙丙丁四句连续同构就是三对;其他写法按研究时的匹配方式数这一句里出现了几处。
05
第二步:逐条复核
字面标记会误抓。【这批货运来的不是小麦,而是玉米,报关单写错了】也有不是……而是,可它是在更正一个事实,算不上翻案腔;一份名单里的顿号,是材料本身要求完整列出。只按字面数,正常写法会被算进去。
TATOOLS 用语言模型逐条复核候选。同一段里的候选合在一起送审,模型能看到上一段、本段和下一段的原文,还有每种写法的完整定义和例外情况,然后对每条候选判断是否真的符合定义,并用一句话写出依据。复核遵守三条纪律。
只判断候选是否符合这种写法的定义,不改写原文,也不评价文章的好坏。
候选落在定义写明的例外里,判为不符合。
拿不准的时候,判为不符合。
两个候选的复核示例。
| 候选 | 复核结果 | 依据 |
|---|---|---|
| 真正的门槛不是技术,而是认知。 | 确认 | 先虚立一个没人提过的误解再推翻 |
| 运来的不是小麦,而是玉米,报关单写错了。 | 排除 | 这是事实更正,属于例外 |
小标题编号和说白了开头这两种写法,字面标记本身就足够明确,TATOOLS 不再复核,找到即确认。个别候选没能完成复核时,它们不计入分数,报告里会单独写明有几处。
用语言模型当评判者的做法近年被系统检验过。Zheng 等人 2023 年的研究发现,强模型的评判和人工评判的一致程度,已经接近人工评判者彼此之间的一致程度。TATOOLS 把复核限定在判断一条候选是否符合一个写明的定义,任务窄、标准清楚,这正是模型评判最擅长的一类工作。
06
文本类型:哪些写法不查
同一种写法放在不同体裁里,意思完全不同。学术论文的章节编号是规范,公文的完整罗列是格式,小说里的排比是风格。工具页的【文本类型】有四个选项,每一种都会关掉几条在该体裁里属于正常写法的规则。
| 文本类型 | 不检查的写法 | 原因 |
|---|---|---|
| 评论、随笔、报道等文章 | 无,十六种都查 | 非虚构文章的通用口径 |
| 学术论文 | 小标题用一二三编号、只为引出列表的话 | 章节编号和如下引出列表是论文惯例 |
| 公文与规章制度 | 小标题用一二三编号、顿号列一串 | 层级编号和完整罗列是公文格式 |
| 小说、散文 | 连着几句句式一样、把工具比作完美的人 | 排比和比喻属于作品风格 |
关掉的规则既不找候选,也不进入分数。复核时模型还会拿到这个体裁的说明,比如学术论文里的术语和长句,还有被动句和名词化,都是正常写法。报告的【这篇查到的 AI 味写法】下方会列出本次没有检查的写法。
07
AI 味指数怎样算
这一节是整个工具的核心。先看一种写法怎样给分,再看十几种写法怎样合在一起。
一种写法:每多出现一次,证据增加多少
假设某种写法在人写文章里平均出现 H 次,在模型文章里平均出现 A 次,这里的 H 和 A 已经按本文篇幅折算过。稀有事件的出现次数常用泊松分布(Poisson Distribution)描述,一篇文章实际出现 n 次时,它更像模型文章的程度可以用对数似然比(Log-Likelihood Ratio)衡量。
P(n | 平均 λ) = λⁿ × e^(−λ) / n!
对数似然比 = ln[P(n | A) / P(n | H)] = n × ln(A / H) − (A − H)
式子里和 n 有关的只有第一项。每多出现一次,对数似然比增加 ln(A / H),这个数就是这种写法的权重。模型写和人写差得越多,权重越大。
顿号列一串:ln(3.21 / 1.78) ≈ 0.590
破折号: ln(2.38 / 0.80) ≈ 1.090
先否定再肯定:ln(0.73 / 0.22) ≈ 1.199
破折号的权重接近顿号串列的两倍,多出一个破折号,比多出一处顿号串列更说明问题。Mosteller 和 Wallace 当年比较虚词频率,用的也是这种按似然比给每个词加权的办法。
十几种写法合成一个分数
TATOOLS 以人写文章的平均水平为 25 分、模型文章的平均水平为 75 分,把各种写法的超额次数按权重加起来,线性放到这两个锚点之间。
w_i = ln(A_i / H_i)
S = 25 + 50 × Σ_i w_i × (n_i − H_i) / Σ_i w_i × (A_i − H_i)
n_i:第 i 种写法确认的次数
H_i、A_i:按本文篇幅折算的人写、模型写期望次数
每种写法都恰好出现人写平均次数时,分子为 0,S = 25;都恰好出现模型平均次数时,分子等于分母,S = 75。最后的分数截到 0 到 100 之间。
手算一个例子
一篇 3,000 字的文章,只拿三种写法演示。
| 写法 | H | A | w | 实际 n |
|---|---|---|---|---|
| 顿号列一串 | 5.34 | 9.63 | 0.590 | 8 |
| 破折号 | 2.40 | 7.14 | 1.090 | 6 |
| 先否定再肯定 | 0.66 | 2.19 | 1.199 | 2 |
分母 = 0.590 × (9.63 − 5.34) + 1.090 × (7.14 − 2.40) + 1.199 × (2.19 − 0.66)
= 2.531 + 5.167 + 1.834 ≈ 9.53
分子 = 0.590 × (8 − 5.34) + 1.090 × (6 − 2.40) + 1.199 × (2 − 0.66)
= 1.569 + 3.924 + 1.607 ≈ 7.10
S = 25 + 50 × 7.10 / 9.53 ≈ 25 + 37.3 = 62.3,显示为 62
三种写法里,破折号贡献最多。它实际出现 6 次,比人写期望多了 3.6 次,权重又最大。顿号串列虽然出现 8 次,人写期望本来就有 5 次多,超出的部分乘上较小的权重,贡献只有破折号的四成。
参与计分的是同时有模型和人写两个参考频率的写法。修饰语太长这类只有模型一侧参考值的写法,以及小标题编号和有数字却说得笼统这两种没有参考频率的写法,照样查找、复核并在报告里列出次数,只是不进入 AI 味指数。
篇幅短,分数会跳
分母 Σ w_i × (A_i − H_i) 随篇幅增长。文章很短时,分母很小,多出现或少出现一两处,分数就会跳好几分。文章大约在两千字以下时,TATOOLS 会在指数下面写明这一点,读这类短文的分数时,看落在哪个区间比看具体数字更有用。
08
报告怎么读
TATOOLS 的报告自上而下有四块。
| 区块 | 看什么 |
|---|---|
| AI 味指数 | 分数落在两个锚点的哪一侧,一句话说明,总字数和确认的处数 |
| 这篇查到的 AI 味写法 | 各种写法按确认次数从多到少排列 |
| 原文标注 | 每一处写法在原文里标红,后面跟着写法名称 |
| AI 味指数怎么算 | 计算方法和每种写法的说明 |
【AI 味指数】画成一条 0 到 100 的横条,25 分处标着【人写的一般在这】,75 分处标着【AI 写的一般在这】,分数旁边用一句话说明它的位置。
| 分数 | 报告的说明 |
|---|---|
| 25 以下 | AI 味比一般人写的文章还淡 |
| 25 到 45 | 读起来接近人写的 |
| 45 到 55 | 介于人写和 AI 写之间 |
| 55 到 75 | 读起来接近 AI 写的 |
| 75 以上 | AI 味比一般 AI 写的文章还重 |
指数描述的是写法离两类文章平均水平有多远,回答这篇文章的写法更像哪一边。判断一篇文章实际由谁写成,要看写作过程和草稿。
【原文标注】只保留出现写法的句子,长句只留标注前后一小段,其余用省略号代替,一眼就能看到问题集中在哪里。标注太多时,页面只列出前面的部分,完整清单在结果文件里。结果文件逐条列出每个候选的文件、行号、写法、命中片段、所在句子、复核结果和复核依据,复核结果分确认、复核排除和未能复核三种,被排除的候选连同排除理由也在里面,可以逐条核对复核是否合理。
09
怎样用结果改稿
报告标出的每一处写法都有对应的改法,改的时候只动命中的部分,事实、数字和观点保持不变。
| 写法 | 改法 | 改前 | 改后 |
|---|---|---|---|
| 先否定再肯定 | 直接从正面下判断 | 真正的壁垒不是技术,而是认知 | 真正的壁垒是认知 |
| 顿号列一串 | 能概括就概括,或改变其中一项的句法 | 采集、存储、展示 | 从采集到展示 |
| 破折号 | 写成完整的句子 | 答案很简单——专注 | 答案是专注 |
| 重点是:式提示语 | 删掉提示语,直接写内容 | 核心是:先解决支付失败 | 先解决支付失败 |
| 然而、此外开头 | 把连接词移到主语后面,或换成更口语的说法 | 此外,成本也要考虑 | 成本也得考虑 |
| 这意味着重复上句 | 并入前一句 | 留存涨到 72%。这意味着找到了方向 | 留存涨到 72%,产品找到了方向 |
| 段落开头没说评什么 | 补一个回指的词 | 听起来像一条功能描述 | 这听起来像一条功能描述 |
| 有数字却说得笼统 | 把已有的数字放到概括词的位置 | 效率显著提升,从两小时缩短到四十分钟 | 处理时间从两小时缩短到四十分钟 |
改完可以重新提交一次,比较 AI 味指数和各类写法的次数有没有降下来。原文标注里被复核排除的地方,本来就是正常写法,用不着改。
10
和 AIGC内容检测怎样搭配
TATOOLS 还有一个【AIGC内容检测】,两个工具看的东西不同,可以配合着用。
| 对比项 | AI味写作痕迹检测 | AIGC内容检测 |
|---|---|---|
| 看什么 | 十六种能叫出名字的写法 | 全文分类器加句长、词汇、节律等统计通道 |
| 分数的依据 | 人写和模型写两个平均水平 | 分类器概率和风格通道投票 |
| 每个结果能指到哪里 | 原文里的具体词句 | 段落和句子片段 |
| 最适合 | 逐句改掉 AI 腔,写作课讲评 | 大批材料排查,定位最模板化的段落 |
先用【AIGC内容检测】找出分数最高的段落,再把这些段落放进【AI味写作痕迹检测】,就能看清是哪几种写法在起作用。
11
把结果写进论文或报告
研究不同群体、不同年份的写作变化时,AI 味指数和各类写法的每千字频率都可以作为写作风格变量。下面是一段方法部分的写法示例,方括号里换成自己的数字。
本研究使用 TATOOLS 的 AI味写作痕迹检测对 [篇数] 篇文本进行写作痕迹统计,文本类型设为 [类型]。该工具按字面标记识别十六类常见于大模型中文写作的写法,经语言模型结合上下文逐条复核后计数,并以一组中文非虚构文章对照语料中人工写作与大模型生成文本的平均频率为参照,按泊松对数似然比加权,将各类写法的超额次数折算为 0 至 100 的 AI 味指数(人工写作平均水平为 25,模型生成平均水平为 75)。本研究报告各样本的指数与各类写法的每千字频率。
报告单篇文章时,可以把原文标注里的典型句子和它的写法名称一起列出,读者能看到分数背后的具体写法。
12
小结
AI 味可以拆成能叫出名字的写法,关键在频率。同样篇幅下,大模型用这些写法的次数明显多于人写。
TATOOLS 的【AI味写作痕迹检测】整理了十六种写法,参考频率来自 629 篇中文非虚构文章的对照统计。
只有正文段参与计数,引号里的原话不算,参考频率按每千字、每百段或非首段比例折算到本文篇幅。
程序先按字面标记找候选,再由语言模型结合上下文逐条复核,拿不准的判为不符合。
四种文本类型会关掉各自体裁里属于正常写法的规则。
每种写法的权重是 ln(A / H),超额次数加权求和后,放到人写 25 分、模型写 75 分两个锚点之间。
报告给出指数、各写法的次数排行和原文标注,结果文件连被排除的候选和理由一起列出。
想从整篇统计特征看一份材料,可以用 TATOOLS 的【AIGC内容检测】;想看一份材料完整的风格画像,可以用【写作风格判定】。
13
资料来源
Reinhart 等:Do LLMs write like humans? Variation in grammatical and rhetorical styles,PNAS,第 122 卷第 8 期,2025
Mosteller 与 Wallace:Inference and Disputed Authorship: The Federalist,Addison-Wesley,1964
Zheng 等:Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena,NeurIPS,2023
END
