访谈录音转成文字以后,满篇都是那个和就是说这样的口头语,一句话说两遍,意思绕了一圈才落地。几十份这样的转写稿摆在面前,想先通读一遍把握大意,光是在口头语里找内容就很费力。会议记录、座谈发言和口述材料都有同样的问题。
文本简化做的是把这类文字改得更精炼。删去重复的表述,去掉口头语和多余的修饰,把口语说法整理成书面表述,意思保持不变,篇幅明显缩短,读起来顺畅得多。
在 TATOOLS 的【中文文本简化】里【上传文档】,TATOOLS 先整理不规范的换行和标点,再按行或按空行切段,每段单独交给专门的中文文本简化模型改写,最后核对简化前后的数字有没有丢,把各段拼回完整的文档,同时输出一张逐段的原文与简化对照表。
这篇教程先讲口语文本里有哪些可以删减的成分,再讲 TATOOLS 的整理、切段和简化各做了什么,然后用例子讲清简化比例和数字核对,最后讲结果怎样读、怎样用在研究里。
01
口语里有哪些冗余
文本简化是自然语言处理里的一个研究方向,Siddharthan 2014 年的综述把它分成词汇简化、句法简化和语篇简化几类,目标都是在保留原意的前提下让文字更容易读。口语转写材料的简化有它的重点,多余的成分主要来自说话本身的特点。
Shriberg 1994 年研究口语的不流畅现象,归纳出几类典型成分,填充停顿、重复和自我修正。中文口语里对应的是这样一些现象。
| 成分 | 例子 |
|---|---|
| 口头语和填充词 | 那个,就是说,然后呢,你知道吧 |
| 重复 | 提高了,提高了不少 |
| 自我修正 | 我们村,不对,我们乡 |
| 多余修饰和语气 | 确实是,真的是非常,吧,呢 |
| 口语说法 | 挺好的,弄一下,搞了个活动 |
这些成分在说话时帮助说话人组织思路,写成文字就显得拖沓。简化把它们删去或改成书面表述,命题内容保持不变。
TATOOLS 的简化以删为主,删去重复、口头语和多余修饰,并把口语说法整理成书面表述。
02
先把文本整理干净
转写稿和从网页、文档里复制出来的文字,常常带着不规范的换行和标点,直接切段会把一句话切成两半。TATOOLS 在切段前先做三件事。
第一,统一空白。去掉看不见的零宽字符,全角空格、制表符和不换行空格统一成普通空格,去掉行首行尾的空白。
第二,接回被换行断开的句子。有些文本按固定行宽硬换行,一句话被折成好几行。TATOOLS 先判断整份文件是不是这样排版的,再找出这样的行,排满一整行,行尾没有句末标点,下一行也不像新条目,把它和下一行接回成一句。下一行以列表序号、章节号或说话人开头时,算作新条目,不接回。一行一条、行宽参差的材料不会触发接回。
原文(硬换行排版)
这几年村里的变化很大,路修好了,
村民出行方便了很多。
接回后
这几年村里的变化很大,路修好了,村民出行方便了很多。
第三,给几乎没有标点的长行补上标点。语音转写常常整段没有一个标点,TATOOLS 先把这样的行交给补标点服务,补出来的文字和原文逐字对得上才采用,有任何增字、丢字就保留原行。行首的说话人标签原样保留,带小数或千分位数字的行不补,免得数字被拆开。
03
切段与逐段简化
【分段方式】有两种,【按行分段】是默认,整理后的每一行算一段,适合一行一段或一行一条的材料;【按空行分段】把两个空行之间的内容算一段,适合段内有换行、段间空一行的材料。
每一段单独交给简化模型,段与段之间不共享上下文。一段话里指代前文的内容,简化时只看得到这一段本身,所以分段最好让每段意思完整。过长的段落由简化服务自动切块处理。
不含汉字的段落,比如页码、纯数字或英文,不送去简化,原样保留。某一段简化失败或没有得到有效输出时,这一段保留原文,对照表里写明原因。
TATOOLS 把所有段落一次整批提交,由服务统一调度,多份文件也能一起处理。
04
简化前后对比
以一句访谈转写为例(示例)。
原文
那个,我们村里呢,就是说,这几年的收入吧,
确实是提高了,提高了不少。
简化后
我们村这几年的收入确实提高了不少。
去掉的有填充词那个和就是说,语气词呢和吧,重复的提高了,以及多余的是。意思没有变,篇幅少了一半。
原文 34 字,简化后 17 字
简化比例 = 1 − 17 ÷ 34 = 50%
简化比例因材料而异。口头语多、重复多的转写稿,删减幅度大;本来就写得紧凑的书面材料,改动很少。TATOOLS 的对照表逐段列出原文字数和简化后字数,并标明这一段有没有改动。
05
数字核对
简化改写的是说法,数字、日期和比例这类事实不该变。TATOOLS 对每一段改动过的内容做数字核对,把原文里出现的数字和简化后的数字逐一对比,按出现次数计。
原文 去年收入涨了 30%,今年又涨了 12%。
简化后 去年收入涨了 30%,今年继续上涨。
未保留的数字 12%
这一段的 12% 在简化后丢了,对照表的【未保留的数字】一栏会写出来。数字核对只看数字本身有没有保留,发现这类段落,回到原文补上即可。
06
结果怎样读
报告页面直接打开简化后的文档,在线就能通读。TATOOLS 下载的结果里,每份文件有两样东西。
| 文件 | 内容 |
|---|---|
| 简化后的文本 | 各段按原来的顺序拼回,段落结构保持不变 |
| 原文与简化对照表 | 每段一行,原文和简化后并排 |
对照表的各栏如下。
| 栏目 | 说明 |
|---|---|
| 序号 | 第几段 |
| 原文,简化后 | 并排对照 |
| 原文字数,简化后字数 | 两边的篇幅 |
| 是否改动 | 这一段有没有被改写 |
| 已补标点 | 这一段是否先补过标点 |
| 未保留的数字 | 简化后丢掉的数字 |
| 状态 | 正常、失败保留原文、无有效输出或输出被截断 |
读的顺序是先通读简化后的文档把握大意,再打开对照表,按【未保留的数字】和【状态】两栏筛出需要回头核对的段落,最后抽查几段改动较大的,确认意思没有走样。
07
在研究里怎样用
简化后的文本适合用来快速通读、做初步编码和写内容概要,也适合作为后续词频、主题和聚类分析的输入,口头语少了,统计结果更干净。
引用受访者原话时,用对照表里的原文一栏。简化改写了说话人的措辞,质性研究里作为证据引用的应当是原话,简化版本用来帮助阅读和整理。
在论文里可以这样交代。
访谈转写稿使用 TATOOLS 的中文文本简化进行预处理,删去口头语、重复和多余修饰,将口语表述整理为书面表述,用于通读和初步编码;文中引用的受访者表述均取自原始转写稿。
08
工具页上的设置一览
| 设置 | 选项 | 默认 | 影响什么 |
|---|---|---|---|
| 分段方式 | 按行分段、按空行分段 | 按行分段 | 以多大的单位逐段简化 |
TATOOLS 的整理和补标点每次都会自动完成,简化和数字核对也一样,不需要另外设置。
09
小结
口语转写材料里的口头语、重复、自我修正和多余修饰,是简化主要删减的成分。
切段前先统一空白,接回被硬换行断开的句子,给缺标点的长行补标点,补出的文字逐字核对。
按行或按空行切段,每段单独简化,不含汉字的段落原样保留,失败的段落保留原文。
数字核对找出简化后丢掉的数字,对照表逐段列出原文、简化后、字数和状态。
TATOOLS 输出简化后的完整文档和逐段对照表,通读用简化版,引用用原文。
想只给缺标点的文本补上标点和断句,可以用 TATOOLS 的【文本结构还原器】;想清理文本里的表情、网页标签和指定的词,用【文本清洗】;想修正写法不统一或用错的标点,用【标点纠正】。
10
资料来源
Shriberg:Preliminaries to a Theory of Speech Disfluencies,University of California at Berkeley 博士论文,1994
END
