一份课程论文交上来,读着处处通顺,段段都有总结句,可就是看不出作者自己的判断落在哪里。老师想知道的往往是哪几段、哪几句的写法最像大模型的套路,好对照着和学生谈,也好让作者自己回去改。AIGC 检测(AI-Generated Content Detection,判断一段文字的写法和机器生成文本有多接近)研究的就是这类问题。
这个领域在 2019 年前后成形。OpenAI 分阶段发布 GPT-2 的过程中放出了一个检测器,用人写文本和模型生成的文本训练分类器(Solaiman 等,2019)。同年 Gehrmann、Strobelt 和 Rush 做了 GLTR,把每个词在语言模型里的预测排名标上颜色,让人一眼看出哪些词在模型看来最容易猜到。ChatGPT 出现以后,Guo 等人 2023 年整理了中英文对照语料 HC3,同一个问题既有人类专家的回答,也有 ChatGPT 的回答,中文检测从此有了公开的训练和评测材料。
在 TATOOLS 的【AIGC内容检测】里【上传文档】,TATOOLS 从整篇、段落和句子片段三层看写法。整篇给出一个 0 到 10 的【AI率参考值】,由一个在人写和机写中文上训练过的全文分类器,加上一组写作风格统计通道共同算出。每个段落和每个句子片段各有一个 0 到 100 的风险分,旁边列出是哪几项写作痕迹抬高了分数,以及可以往哪个方向改。打开【生成改稿提示与灰区复核】,TATOOLS 还会对证据不稳的少量片段再复核一次,并把整份检测结果整理成一段可以直接复制的改稿提示。
这篇教程先讲检测机器写作的几条研究路线,再讲 TATOOLS 怎样切分析单位、每个风格通道量的是什么。接下来讲几个通道怎样合成一个分数,文本类型怎样校准,整篇参考值又是怎样算出来的,最后讲灰区复核和改稿提示,以及报告的读法和论文里的写法。
01
检测机器写作有哪几条路
研究者判断一段文字像不像机器写的,大致沿着四条路走。
第一条是训练分类器。收集一批人写的文本和一批模型生成的文本,各自贴上标签,训练一个模型去区分它们。模型读完一段文字,输出它属于机写一类的概率。
p(机写 | x) = exp(z_机写) / (exp(z_机写) + exp(z_人写))
z:模型对两个类别给出的原始得分
例:z_机写 = 1.2,z_人写 = −0.3
p = e^1.2 / (e^1.2 + e^−0.3) = 3.320 / (3.320 + 0.741) ≈ 0.82
这个式子叫 softmax,把两个原始得分换成加起来等于 1 的两个概率。分类器学到的规律来自训练语料,和训练语料接近的文本判得最稳。
第二条是看语言模型的概率。大模型生成文字时倾向于挑概率高的词,所以机写文本里的词在模型看来普遍好猜。困惑度(Perplexity)把这种好猜的程度写成一个数。
PPL = exp( −(1/N) × Σ_i log p(w_i | w_1 … w_(i−1)) )
N:词数;p(w_i | …):模型根据前文预测第 i 个词的概率
例:三个词的概率依次为 0.5、0.25、0.5
平均对数概率 = (ln 0.5 + ln 0.25 + ln 0.5) / 3 ≈ −0.924
PPL = e^0.924 ≈ 2.52
困惑度越低,文本越好猜。Mitchell 等人 2023 年提出的 DetectGPT 更进一步,把一段文字随机改写几处,看它在模型里的概率降了多少。机写文本通常落在概率的局部高点上,稍一改动概率就明显下降。
第三条是文体计量(Stylometry,用可数的语言特征刻画写作习惯)。这条路比 AIGC 检测老得多。Mosteller 和 Wallace 1964 年研究《联邦党人文集》里 12 篇作者有争议的文章,发现汉密尔顿常用 upon,麦迪逊几乎不用,靠这类虚词的频率把争议篇目归给了麦迪逊。Stamatatos 2009 年的综述把句长和虚词频率,还有标点和用词丰富度这类特征系统整理过。大模型写出来的中文也有自己的习惯,句子长短齐整,连接词多,人称代词却少,这些都能用同样的办法数出来。
第四条是水印(Watermark)。Kirchenbauer 等人 2023 年提出,模型每生成一个词,都按前一个词随机划出一组词,并稍微提高这组词的概率,事后统计这组词出现的比例来检验。水印适用于生成方主动配合的场景,研究者手里的一篇来路未知的文稿,只能靠前三条路。
这些方法的可靠性也有专门研究。Sadasivan 等人 2023 年发现,把机写文本用另一个模型改写一遍,多数检测器的准确率会大幅下降;Liang 等人同年在《Patterns》上报告,几种英文检测器把非母语作者的作文误判为机写的比例远高于母语作者,原因是这些作文用词更简单。所以检测结果最适合用来找出值得人工复核的位置,判断一篇文字的来源,还要看写作过程、草稿和原始记录。
TATOOLS 的【AIGC内容检测】走的是第一条和第三条路。整篇的【AI率参考值】以全文分类器为主,段落和句子片段的风险分来自文体计量式的风格通道。每个高分位置都附着触发它的具体痕迹,报告的用法就是照着这些痕迹回原文复核。
02
整篇、段落、句子片段:三层分析单位
一篇六千字的文章,整体读着像模板,问题可能只集中在引言和结论两段;也可能每一段都工整,毛病分散在几十个句子里。只给一个整篇分数,看不出该改哪里。TATOOLS 把文本拆成三层,每层各有自己的分析单位(Unit of Analysis,一次统计针对的对象)。
| 层级 | 分析单位 | 报告里的分数 |
|---|---|---|
| 整篇 | 全部上传内容合在一起 | AI率参考值,0 到 10 |
| 段落 | 按空行分出的段落,太长的切开 | 本段风险,0 到 100 |
| 句子片段 | 从每一句起往后连续取句子 | 本处风险,0 到 100 |
段落这一层先按空行分段。一个段落的字符数超过工具页【段落切块长度】时,在句号、问号这类句末标点处切成几块,每块不超过设定长度,太短的碎片不单独评分。【段落切块长度】有三档,约 500、900 和 1,500 个字符。短切块适合找局部的热区,长切块能减少段落被切碎以后带来的波动。
句子片段这一层从每一句开始,往后连续取句子,直到总长接近 500 个字符为止,所以相邻的片段互相重叠。拿五个句子举例,字符数依次是 200、150、180、120、90。
从第 1 句起:200 + 150 = 350,再加 180 超过 500,得到片段 1–2
从第 2 句起:150 + 180 + 120 = 450,再加 90 超过 500,得到片段 2–4
从第 3 句起:180 + 120 + 90 = 390,得到片段 3–5
从第 4 句起:120 + 90 = 210,得到片段 4–5
从第 5 句起:90,得到片段 5
五个句子得到五个片段,第 3 句同时出现在片段 2–4 和片段 3–5 里。重叠的好处是,一处句式问题落在哪个位置都能被至少一个片段完整看到,报告里的【句子片段分析】按片段起止的句子编号标出位置。
上传多个文件时,每个文件单独切段落和句子片段,表格里每一行都带着文件名;【AI率参考值】则把全部文件合在一起算。
03
句式规整:句子长短有多整齐
先看两组句子的字符数。
A:20 22 21 19 23
B: 8 35 14 42 6
两组的平均句长都是 21,读起来却完全不同。A 组每句都差不多长,节奏平;B 组长短交错,有短促的判断,也有展开的长句。衡量这种差别最常用的是变异系数(Coefficient of Variation,标准差除以平均数)。
CV = σ / μ
A:离差 −1, 1, 0, −2, 2,σ = √(10/5) ≈ 1.41,CV ≈ 1.41 / 21 ≈ 0.07
B:离差 −13, 14, −7, 21, −15,σ = √(1080/5) ≈ 14.70,CV ≈ 14.70 / 21 ≈ 0.70
人写文章的句长通常起伏较大,大模型生成的说明文字句长更均匀。变异系数越小,句子越整齐。
另一个看点是句首重复。连续几句都用此外或者同时开头,读者很快会觉得在读清单。句首重复率按每句前两个字统计。
句首重复率 = 1 − 不同句首数 / 句首总数
例:五句的开头是 此外 同时 此外 同时 我们
不同句首 3 个,重复率 = 1 − 3/5 = 0.4
TATOOLS 报告里的【句式规整】这一项,把句长变异系数和句首重复率合成一个 0 到 100 的分数,句子越整齐、开头越雷同,分数越高。访谈转写和口语记录的句长本来就起伏大、口头禅多,TATOOLS 会先估计一段文字的口语程度,口语越明显,这一项的分数压得越低。
04
标点:停在哪里、停得多密
写东西的人停顿的位置各有习惯,有人爱用长句一口气说完,有人三五个字就点一个逗号,情绪上来还会连打几个感叹号。大模型生成的中文标点通常很规范,标点占全部字符的比例稳定在一个窄区间里,很少出现连续标点。
TATOOLS 报告里的【标点模式】看三件事。一是标点占全部字符的比例,二是连续重复的标点有几处,三是每千字里有多少个逗号分句。比例落在规范区间中央、又几乎没有随手的连续标点,这一项分数就高;连打的问号叹号和特别密的逗号,都会把分数拉低。这一项同样按口语程度减分。
标点的节拍还有一个更细的检验,放在后面的【节律偏好】里讲。
05
词汇复用:同一批词翻来覆去用了几次
【发展】【推进】【建设】【提升】在一段话里反复出现,读者会觉得这段话在原地打转。衡量用词丰富度最直接的指标是类符形符比(Type-Token Ratio,TTR),不同的词数除以总词数。
TTR = V / N
V:不同的词(类符)数;N:全部的词(形符)数
例:发展 推进 发展 建设 推进 发展
V = 3,N = 6,TTR = 0.5
TTR 有个老问题,文本越长,常用词重复得越多,TTR 自然越低,长短不同的文本没法直接比。后来的研究者给出了几种修正。
Covington 和 McFall 2010 年提出滑动平均类符形符比(MATTR)。取一个固定长度的窗口,从头滑到尾,每个位置算一次 TTR,再取平均。上面六个词取窗口为 3,四个窗口的 TTR 分别是 2/3、1、1、1,平均约 0.917。窗口长度固定,长短不同的文本就能放在一起比。
McCarthy 和 Jarvis 2010 年验证过的 MTLD 换了一个角度。从头往后读,一边读一边算累计 TTR,一旦降到一个固定值就记一段、清零重来。文本总词数除以段数,就是平均每段能撑多少个词才开始明显重复,越大说明用词越丰富。正着读一遍、倒着读一遍,取两次的平均。
Yule 1944 年提出的 K 值从词频分布的集中程度入手。
K = 10⁴ × (Σ_i i² × V_i − N) / N²
V_i:恰好出现 i 次的词有几个
例:10 个词里,5 个词各出现 1 次,1 个词出现 2 次,1 个词出现 3 次
Σ i² × V_i = 1 × 5 + 4 × 1 + 9 × 1 = 18
K = 10000 × (18 − 10) / 100 = 800
少数词出现得越频繁,K 越大,重复越集中。
TATOOLS 报告里的【词汇复用】把三个词汇多样性指标 MATTR、MTLD 和 Yule 的 K,再加上抽象名词的密度,合成一个分数。滑动 TTR 偏低,MTLD 偏短,K 偏大,抽象名词又扎堆,分数就高;具体的数字、人名和地名多,分数会往下走。想单独看一份材料的用词丰富度,可以用 TATOOLS 的【词汇多样性分析】,它一次给出 TTR、MTLD 等九项指标。
06
风格指纹:作者的习惯藏在虚词和人称里
Mosteller 和 Wallace 的研究说明,作者最难伪装的是那些不起眼的词。实词随话题变,虚词、代词和标点跟着人走。Burrows 2002 年提出的 Delta 方法,就是拿最常用的几十个虚词的频率给每位作者画像,再比较文本和各人画像的距离。
大模型写出的中文有一组相当稳定的指纹。陈述句占了绝大多数,很少有问句和感叹句;我和你这样的人称代词少;因此、同时这类连接词多;几乎不直接引用别人的话。TATOOLS 报告里的【风格指纹】逐项数这些特征。
| 特征 | 怎么数 | 偏向机写的方向 |
|---|---|---|
| 句长变异 | 句长的变异系数 | 偏小 |
| 陈述句占比 | 不以问号叹号结尾的句子比例 | 偏大 |
| 人称代词 | 每百词里的你我他 | 偏少 |
| 连接词 | 每百词里的因此、同时等 | 偏多 |
| 引号 | 每百字里的引号 | 偏少 |
举个例子,一段 250 个词的文字里有 3 个人称代词、12 个连接词。
人称代词 = 3 / 250 × 100 = 1.2 个每百词
连接词 = 12 / 250 × 100 = 4.8 个每百词
人称很少、连接词很密,这段话读起来就像一份没有作者的说明书。
【深度风格】在更长的上下文里看语气。TATOOLS 为每段文字估计八个维度的分数,正式度、复杂度、情感强度、主观色彩、叙事节奏、词汇密度、修辞丰富度和严谨度,再按一个方向合成。正式严谨、词汇密度高,同时主观色彩和情感强度都低,这一项的分数就高。想看一份材料完整的风格画像,可以用 TATOOLS 的【写作风格判定】,它给出八个维度的风格打分和文体归属候选。
07
节律偏好:五项看节奏的统计检验
句长整不整齐、标点密不密,看的是一段文字的平均状态。节奏还有另一面,前一句怎样影响后一句,同一个句式隔多久出现一次,新词是一阵一阵冒出来还是匀速出现。TATOOLS 报告里的【节律偏好】是一个合并分数,内部有五项彼此独立的检验,编号 M1 到 M5。
| 编号 | 名称 | 量的是什么 |
|---|---|---|
| M1 | 句长转移熵 | 前一句的长短能不能帮助预测后一句 |
| M2 | 句式重复间距 | 相同句式骨架隔几句重复一次,间距是否均匀 |
| M3 | 词汇新颖度跳跃 | 新出现的实词比例有没有突然的起落 |
| M4 | 标点自相关 | 标点的节拍在多长的距离内还有规律 |
| M5 | 低频虚词偏好 | 亦、颇、倘若这类少见虚词的用法偏离平均多少 |
M1:前一句能不能预测后一句
先把句长分成若干档,比如短句一档、长句一档。信息熵(Entropy,Shannon 1948)量一个变量有多难猜,条件熵量知道了前一句以后,后一句还有多难猜,两者之差就是前一句提供的信息。
H(L) = −Σ p(l) × log₂ p(l)
ΔH = H(L) − H(L_后 | L_前)
用两个六句的序列手算,A 表示短句,B 表示长句。
序列一:A B A B A B
A、B 各占一半,H(L) = 1 比特
A 后面总是 B,B 后面总是 A,条件熵 = 0,ΔH = 1
序列二:A A B B A B
H(L) = 1 比特
A 后面 1 次是 A、2 次是 B,熵 ≈ 0.918;B 后面 A、B 各 1 次,熵 = 1
条件熵 = 3/5 × 0.918 + 2/5 × 1 ≈ 0.951,ΔH ≈ 0.049
序列一里前一句几乎决定了后一句,序列二里前一句几乎不提供信息。M1 把 ΔH 偏低看作句长推进缺少节奏上的呼应。
M2 到 M5
M2 先把每个句子压成一串骨架符号,代词、虚词这类成分和不同长度的实词各用一个记号,再找骨架几乎相同的句子对,看它们隔几句出现。重复的间距过于均匀,说明同一个句式在按固定节拍复用。
M3 用一个滑动窗口沿着文本走,每个窗口算一次此前没出现过的实词占多少。人写的文章里,换一个话题或者举一个新例子,新词比例会突然跳起来;机写文本的新词往往匀速出现。M3 看相邻窗口之间最大的跳跃幅度和跳跃分布的峰度,两者都偏低就计分。
M4 把全文看成一串字符,标点记 1,其他记 0,算这串数字的自相关系数,再找它衰减到开头一半所需的距离,叫半衰期。
ρ(k) = Σ_t (x_t − x̄)(x_(t+k) − x̄) / Σ_t (x_t − x̄)²
例:ρ(1) = 0.30,一半是 0.15
ρ(2) = 0.22,ρ(3) = 0.14,半衰期 τ = 3
半衰期短,说明标点位置之间没什么关联,更像随机撒上去的,缺少由意思驱动的停顿节拍。
M5 数一组少见虚词在文中的比例分布 P,和一个参考分布 Q 比较,用 KL 散度(Kullback 与 Leibler,1951)加上两者之差的绝对值之和。
D = Σ p × ln(p / q) + Σ |p − q|
例:三个虚词,P = (0.5, 0.3, 0.2),Q = (0.4, 0.4, 0.2)
KL = 0.5 × ln 1.25 + 0.3 × ln 0.75 ≈ 0.1116 − 0.0863 ≈ 0.025
L1 = 0.1 + 0.1 + 0 = 0.2,D ≈ 0.225
一个人偏爱的虚词会让 P 明显偏离平均用法,D 较大;D 很小,说明虚词用法向平均值回归,个人习惯的痕迹偏弱。
五项各出一个 0 到 100 的分数,TATOOLS 按固定权重合成【节律偏好】,再按口语程度减分。五项在报告的表格里合成一列显示,报告底部的【方法说明】写了每一项量的是什么。
08
句子片段上的八项专用检查
前面几个通道在段落层面运行,需要足够多的句子才能算出稳定的统计量。句子片段最长只有 500 个字符左右,TATOOLS 为它另配了八项更贴近具体句子的检查。
| 检查项 | 看的是什么 |
|---|---|
| 列举格式 | 片段里的编号和项目符号有多少 |
| 标点过度 | 破折号和分号堆叠的程度 |
| 排比/对偶 | 长度相近、并排出现的短分句 |
| 逗号停顿偏少 | 较长的片段里每百字的逗号数 |
| 句长过于均匀 | 全篇句长整齐,本片段又贴近平均长度 |
| 缺少短句 | 全篇很少有短句,本片段又偏长 |
| 低信息熵 | 相邻两个字的搭配是否容易预测 |
| 句首重复 | 本片段的开头在全篇重复出现的次数 |
低信息熵用的是字符二元组的熵,把相邻两个字当作一个单位,统计它们的分布。
H₂ = −Σ p(ab) × log₂ p(ab)
例一:发展发展发展
二元组 发展、展发、发展、展发、发展,发展 3 次、展发 2 次
H₂ = −(0.6 × log₂ 0.6 + 0.4 × log₂ 0.4) ≈ 0.971
例二:今天下雨了我们
六个二元组各不相同,H₂ = log₂ 6 ≈ 2.585
套话和固定搭配越多,相邻的字越好预测,熵越低。
八项各出一个 0 到 100 的分数,按各自的权重取加权平均,就是这个句子片段的【本处风险】。报告的【句子问题指标】一列把八项分数全部列出,鼠标停在一项上能看到触发它的具体原因,比如破折号几个、逗号密度多少,【修改方向】一列的上方也列出了主要原因。
09
几个通道怎样合成一个分数
每个段落经过六个通道,句式规整、标点模式、词汇复用、风格指纹、深度风格和节律偏好,各得一个 0 到 100 的分数。TATOOLS 先把每个分数换成一个 −1 到 1 之间的信号,50 分对应 0,再做加权投票。
s_i = (分数_i − 50) / 50
S = 50 × (1 + Σ_i w_i × s_i / Σ_i w_i)
w_i:第 i 个通道的权重
三个通道的手算示例,分数分别是 80、40、70,权重分别是 3、1、2。
信号:0.6,−0.2,0.4
Σ w × s = 3 × 0.6 + 1 × (−0.2) + 2 × 0.4 = 2.4
Σ w = 6
S = 50 × (1 + 2.4 / 6) = 50 × 1.4 = 70
权重有两处会变。一是段落长度,TATOOLS 按字数把段落分成几档,每档用一套权重。二是文本类型,下一节细讲。投票以外,TATOOLS 还会看这段文字泛泛而谈的说明腔有多重、具体细节有多少,前者加分,后者减分。算出来的就是报告【段落分析】里的【本段风险】。
10
文本类型怎样校准
政策文件天然多长句和四字格,并列结构和抽象目标也多;学术论文少用第一人称,句子长,术语密;技术文档到处是编号和步骤。拿同一把尺子去量,这些文体会整批被标高。工具页的【文本类型】有六个选项,学术论文、新闻报道、网文小说、政策文件、个人随笔和技术文档,选定以后,TATOOLS 在四个地方按体裁调整。
| 调整的地方 | 怎么调 |
|---|---|
| 通道权重 | 每种体裁给六个通道乘上不同的系数 |
| 分数修正 | 按体裁减去一部分常规写法带来的分数,政策文件的规划套语和章节结构会被识别出来并压低 |
| 灰区复核 | 复核时附上这种体裁的判断标准 |
| 修改建议 | 同一项痕迹,不同体裁给不同的改法 |
举个例子,同样是列举格式偏多,学术论文的建议是只在方法步骤、变量定义这类必须枚举的位置保留编号;政策文件的建议是编号列举属于合规结构,只检查背景描述这类段落里有没有多余的编号;随笔的建议是改成口语化的承接,或者只留一两点。
学术论文、新闻报道和技术文档里,数字、机构名和直接引语越多,分数减得越多,这几种体裁靠事实密度立住。访谈转写和口语记录不管选哪种体裁,都会按口语程度减分。
11
整篇的 AI率参考值怎样算
【AI率参考值】由两部分合成。一部分是全文分类器,一个在人写和机写中文文本上训练过的序列分类模型。TATOOLS 把全文按段落切块,每块送进分类器,用上面那个 softmax 式子算出属于机写一类的概率,再按每块的字符数加权平均。
分类器分 = Σ_j 分数_j × 字符数_j / Σ_j 字符数_j
例:一块 900 字得 80 分,一块 600 字得 40 分
(80 × 900 + 40 × 600) / 1500 = 96000 / 1500 = 64
另一部分是把前面六个通道的加权投票用在整篇文字上得到的分数。两部分按分类器分数的高低换比重。分类器分数达到 60 分时,它占 60%;低于 60 分时,它只占 25%,其余交给风格通道。报告底部的【方法说明】写明了这两个比例。
例一:分类器 64,风格通道 50
参考分 = 0.6 × 64 + 0.4 × 50 = 38.4 + 20 = 58.4,换成 10 分制约 5.8
例二:分类器 40,风格通道 50
参考分 = 0.25 × 40 + 0.75 × 50 = 10 + 37.5 = 47.5,换成 10 分制约 4.8
这样设计有它的道理。分类器给出高分时,它通常抓到了整篇层面的强信号,值得多听它的;分类器分数低时,整篇的问题可能只集中在少数段落,风格通道更能反映出来。
报告按参考值分四档说明,7 分以上写作疑似 AI 生成或重度改写,5.5 到 7 分为灰区,要看具体的段落和句子,4 到 5.5 分为不确定、偏人工,4 分以下更偏人工写作。参考值描述的是整篇写法和生成式文本有多接近,读它的时候看落在哪一档,比看小数点后几位更有用。报告中这个数用 10 分制显示,段落和句子片段的风险分用 100 分制,两种分数分开读,不相互加减。
12
灰区复核:证据不稳的片段再看一遍
投票分落在中间地带的片段最难办,几个通道意见不一,分数上不去也下不来。打开工具页的【生成改稿提示与灰区复核】,TATOOLS 会请一个语言模型当仲裁者,再读一遍这些片段。用语言模型评判文本的做法近年很常见,Zheng 等人 2023 年系统检验过这种评判和人工评判的一致程度。
TATOOLS 的灰区复核分三步。
挑片段。先挑投票分离中间点最近的段落和句子片段,名额不够时再从其余片段里抽样补足,抽样按文本内容确定,同一份材料重跑,抽到的片段相同。
请模型判断。仲裁者拿到片段原文、基础投票分、长度档和所选体裁的判断标准,输出一个标签(机写、人写、混合或不确定)、一个 0 到 100 的分数和最多四条可以在原文里看到的证据。它被要求依据结构、句式、衔接、信息密度和细节是否自然来判断,文字正式、主题宏大本身不作为证据,证据不足时给出不确定、分数靠近 50。
并入分数。段落上,复核分作为一个额外的通道加入投票;句子片段上,复核分和本地分加权合并,复核给出的证据并入这一行的原因列表。
整篇的参考值落在中间地带时,也会做一次同样的复核。
报告的段落表和句子片段表里,每一行都标着【已做灰区复核】或【规则初筛】,筛选框里的【复核状态】可以只看其中一类。
13
改稿提示和可复用改稿规则
检测的最终用处是改稿。同样打开【生成改稿提示与灰区复核】以后,TATOOLS 在检测结束时把结果整理成一个材料包,包括体裁和整篇参考值,段落和句子片段的平均风险,以及风险最高的几个段落和句子片段。每处附上高分检查项和原因,也附上修改建议和原文摘录。
据此生成两样东西,都显示在报告顶部。
【可复制改稿 Prompt】是一段约 300 到 400 个字符的改稿指令。里面写明角色要求和必须保留的内容,交代重点处理的方向和先改哪些位置,最后列出禁止事项,复制到常用的写作工具里就能用。它明确要求保留原文的事实和论点,引用、数据和体裁规范也保持原样,不编造新事实。
【可复用改稿规则】是一份更完整的规则清单,从使用场景和核心原则写起,列出六到八条重点修复模式,再给出操作步骤和输出要求。修复模式优先来自这次报告里分数最高的检查项,比如打散三元并列,删去段尾的总结套句,用具体的主体和过程替换空泛的判断。清单可以保存下来,下一轮修改同一类文章时反复使用。
每一行段落和句子片段的【修改方向】是另一种粒度的建议。TATOOLS 取这一行分数较高的几项检查,按检查项、体裁和严重程度查出对应的改法,最多给三条。
14
报告怎么读
报告自上而下分成几块。
| 区块 | 先看什么 |
|---|---|
| 这份结果说明了什么 | 参考值落在哪一档,重点位置有几个 |
| 可复制改稿 Prompt、可复用改稿规则 | 打开复核开关时出现,可以直接复制 |
| 整体概览 | 参考值、段落平均风险、句子片段平均风险 |
| 段落分析 | 哪几段先改指数最高,是哪几项痕迹 |
| 句子片段分析 | 具体哪几句要细改 |
| 方法说明 | 每个分数和检查项的口径 |
【整体概览】里的两个平均风险按字符数加权,长段落的分量更重。
段落平均风险 = Σ 本段风险 × 字符数 / Σ 字符数
例:一段 600 字 72 分,一段 300 字 40 分
(72 × 600 + 40 × 300) / 900 = 55200 / 900 ≈ 61.3
两个平均风险一起看,能判断问题的分布。句子片段的平均风险明显更高,问题多在句式和节奏上,逐句修改就能改善;段落的平均风险更高,问题多在段内组织,需要调整结构和补充细节。参考值高、两个平均风险也同步偏高,说明整篇写法都要回头看。
【段落分析】和【句子片段分析】两张表的列结构一样,位置、先改指数、为什么关注、文本摘录、主要原因或句子问题指标、修改方向。【先改指数】一列用来决定先打开哪一行,数字下面写着这一行的本段风险或本处风险。表格按原文顺序排列,上方可以按关键词搜索,按分数范围筛出 70 分以上、55 到 69 分或 55 分以下的行,也可以按复核状态筛选。行的颜色表示值不值得先打开,红色优先看,琥珀色抽查,绿色可以后看。任务结果里还能下载三张表,整体汇总、段落明细和句子片段明细。
读一行的顺序是先看主要原因里分数最高的一两项,再回到文本摘录里找对应的写法。比如【句式规整】80 分,就去看这段的句子是不是长短几乎一样;【低信息熵】高,就找找有没有重要意义、充分发挥这类固定搭配。报告里的每一个高分,都能在原文里指出对应的句子,这正是逐条复核的依据。
15
工具页上的设置一览
| 设置 | 选项 | 默认 | 影响什么 |
|---|---|---|---|
| 段落切块长度 | 约 500、900、1,500 个字符 | 约 900 | 段落这一层的切分粒度 |
| 文本类型 | 学术论文、新闻报道、网文小说、政策文件、个人随笔、技术文档 | 个人随笔 | 通道权重、分数修正、复核标准和修改建议 |
| 生成改稿提示与灰区复核 | 开、关 | 开 | 灰区复核、改稿 Prompt 和改稿规则 |
文本类型要按材料的实际体裁选。一份政策文件按个人随笔去量,规范的公文写法就会按随笔的标准计分;选成政策文件,规划套语和章节结构会先被识别出来。拿不准的时候,选和材料最接近的一种,再对照报告里的高分位置读原文。
16
把结果写进论文或报告
研究者用这个工具,常见的有两类场景。一类是教学和编辑,老师审阅作业、编辑处理来稿,用报告定位需要和作者沟通的段落;另一类是研究,比如比较不同年份、不同群体的写作里模板化表达的多少。
研究场景下,报告的指标可以当作写作风格变量来用,写法上把它们表述为写作痕迹的强度。下面是一段方法部分的示例,方括号里换成自己的数字。
本研究使用 TATOOLS 的 AIGC内容检测对 [文件数] 份文本进行写作痕迹分析,文本类型设为 [体裁],段落切块长度约 [字符数] 个字符。该工具结合一个中文全文分类器与六个写作风格统计通道(句式规整、标点模式、词汇复用、风格指纹、深度风格和节律偏好),在整篇、段落与句子片段三个层级给出风险分,并对中间分数的片段进行语言模型复核。本研究以段落平均风险和句子片段平均风险作为写作模板化程度的指标,并对高分段落逐一核对原文。
引用具体段落作为例子时,把报告里这一行的主要原因和原文摘录一起列出,读者能看到分数背后的具体写法。
17
小结
AIGC 检测有训练分类器、语言模型概率、文体计量和水印四条路线。TATOOLS 的【AIGC内容检测】结合了全文分类器和文体计量式的风格通道。
TATOOLS 从整篇、段落和句子片段三层分析。句子片段从每一句起往后取到约 500 个字符,相邻片段互相重叠。
段落上有六个通道,句式规整看句长变异和句首重复,词汇复用用 MATTR、MTLD 和 Yule 的 K,风格指纹数人称和连接词,节律偏好内含 M1 到 M5 五项检验。
句子片段另有八项专用检查,加权平均得到本处风险。
各通道按长度档和文本类型加权投票,文本类型还会修正分数、调整复核标准和修改建议。
AI率参考值由全文分类器和风格通道合成,分类器分数高时比重大,报告按四档说明。
灰区复核只针对投票分居中的片段,改稿 Prompt 和改稿规则从报告里的高分位置整理而来。
报告里每个高分都附着具体的检查项和原文摘录,用法是逐条回原文复核。
想只看大模型常见的句式和标点习惯,可以用 TATOOLS 的【AI味写作痕迹检测】;想看一份材料完整的风格画像,可以用【写作风格判定】。
18
资料来源
Solaiman 等:Release Strategies and the Social Impacts of Language Models,arXiv:1908.09203,2019
Kirchenbauer 等:A Watermark for Large Language Models,ICML,2023
Sadasivan 等:Can AI-Generated Text be Reliably Detected?,arXiv:2303.11156,2023
Liang 等:GPT detectors are biased against non-native English writers,Patterns,第 4 卷第 7 期,2023
Mosteller 与 Wallace:Inference and Disputed Authorship: The Federalist,Addison-Wesley,1964
Stamatatos:A Survey of Modern Authorship Attribution Methods,JASIST,第 60 卷第 3 期,2009
Yule:The Statistical Study of Literary Vocabulary,Cambridge University Press,1944
Shannon:A Mathematical Theory of Communication,Bell System Technical Journal,第 27 卷,1948
Kullback 与 Leibler:On Information and Sufficiency,Annals of Mathematical Statistics,第 22 卷第 1 期,1951
Zheng 等:Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena,NeurIPS,2023
END
