文本清洗按你勾选的规则处理 TXT 和 CSV 材料:删除表情、标点、数字、停用词和过短的行,或把长文本切成长度相近的片段。 每个输入文件生成一个同格式的结果文件 ,并附一份处理报告。
问卷开放题、访谈逐字稿、网页评论这类材料常带有表情、重复标点、不可见字符和网页代码。先清洗,再投入词频、主题、情感等分析。
01
准备材料
支持 TXT 和 CSV。Word、PDF、Excel 等常用文档也可以上传,系统会先转换为 TXT 或 CSV。单个文件不超过 10 MB,不超过 10,000 行。
TXT 按整份文本处理,行的边界默认保留。CSV 逐个文本列处理每个单元格,数字等非文本列不处理,列结构保持不变。
无论勾选哪些规则,所有材料都会先经过一步基础处理:统一换行符,删除零宽字符和控制字符,把行内连续的空格和制表符合并为一个空格,去掉行首行尾的空白。这一步不删除表情,表情由下面的规则控制。
02
选择处理规则
页面上共有七个开关。【清理标点和符号】默认开启,其余默认关闭。 至少选择一项规则才能提交 ;只开启【清理标点和符号】总开关而不勾选具体项,或者只开启分段,都不能提交。
清理标点和符号
开启后只执行勾选的处理项,未勾选的符号保持原样。默认勾选前四项。
| 处理项 | 默认 | 处理内容 |
|---|---|---|
| 移除表情符号 | 勾选 | 删除 😀 🎉 👍 等表情,以及 ★ ☆ ✔ 等符号型字符 |
| 合并连续重复标点 | 勾选 | !!! 合并为 !,。。。 合并为 。;!? 混合连写只保留第一个 |
| 删除停顿标点 | 勾选 | 删除 ,、;: 以及半角的 , ; : |
| 删除连接符和分隔符 | 勾选 | 删除 - — – _ / \ | · … ~ ~ |
| 将常见半角标点转为全角 | 未勾选 | 把 , . ? ! ; : ( ) [ ] < > 换成对应的全角标点 |
| 删除句末标点 | 未勾选 | 删除 。!? 以及半角的 . ! ? |
| 删除括号和引号 | 未勾选 | 删除 ()()【】[]{}《》<> 和中英文引号 |
| 删除其他标点及符号 | 未勾选 | 删除以上各组之外的标点和符号,如 ※ § ¶ → ℃ ± @ # % & * + |
两处需要留意。【将常见半角标点转为全角】会把所有英文句点换成句号,小数点和网址也不例外,3.5 会变成 3。5。
【删除连接符和分隔符】会删掉日期和编号里的横线和斜线,2024-05-01 会变成 20240501。
仅保留中文内容
先从 HTML 中提取可见文字,再只保留汉字、常用中文标点 。,!?、;: 和换行。英文、数字、空格、其他语言文字和其余符号全部删除。适合网页抓取的评论;含编号、日期、英文缩写或外文引文的材料不宜开启。
如果同时勾选了【删除停顿标点】,保留下来的中文标点只剩 。!?。
删除十进制数字
删除文本中的阿拉伯数字,连续数字整体删除;一、二、十等中文数词不受影响。日期、编号、金额和量表分值会随之丢失。
合并换行
把一个或多个换行换成一个空格,再合并相邻的多余空白。TXT 整份文本变成一行,CSV 中每个单元格变成一行。需要保留段落边界的访谈稿和长文应关闭。
移除自定义停用词
需要上传一份 TXT 词表,每行一个词。系统按词表逐项在文本中查找并删除,不做分词, 命中的文字位于更长词语内部时同样被删 。词表含【的】时,【目的】会变成【目】。提交前先核对词表。开关开启但没有上传词表时,这一项不执行。
删除短于阈值的行
在标点、数字和停用词规则执行之后,删除去掉首尾空白后长度小于阈值的行;长度等于阈值的行保留。阈值可设 1 到 10 个字符,默认 5。
因为其他删除先执行,一行【好的。】在勾选【删除句末标点】后只剩 2 个字符,阈值为 5 时会被删除。标题、编号、简短回答和对话短句多的材料应谨慎开启。
按目标长度分段
清洗完成后,把文本切成长度接近目标值的片段,可设 20 到 500 个字符,默认 50。切分位置先在目标长度附近找 。!?;,找不到再找换行,文本较长时再找 ,:,都没有时按字符数直接切。片段不重叠,也不保证等长; 长度不超过 5 个字符的片段会被丢弃 。
TXT 的片段在结果文件中以空行分隔。CSV 只切分每条记录第一个有内容的文本列,每个片段成为一条新记录,其他列的值原样复制,输出记录数因此多于输入。
分段本身不算处理规则,需要同时选择至少一项规则。工具页功能介绍给出的参考值:LDA 约 50 到 200 字,BERTopic 约 100 到 500 字。
规则的执行顺序
删除零宽字符和控制字符;勾选时同时删除表情
半角标点转全角
合并连续重复标点
仅保留中文内容,先提取 HTML 可见文字
删除勾选的标点和符号
删除数字
删除停用词
删除短行
规范空白;勾选合并换行时把换行换成空格
按目标长度分段
03
提交任务
选好规则后点击【提交任务】。需要通知时开启【完成后发送结果通知】并填写邮箱,任务完成后会发送通知;结果仍要在任务详情页查看和下载。
每个输入文件对应一个结果文件,TXT 仍是 TXT,CSV 仍是 CSV。文件以带 BOM 的 UTF-8 保存,Windows 记事本可以直接识别编码。
04
读懂处理报告
任务完成后,报告从上到下分为五块。
这份结果说明了什么
生成的结果文件数,清洗后的字符总数和行数,清洗前后的字符差额及其占输入字符的比例,本次使用的规则。
三张统计卡
【处理范围】记录结果文件数、输出行或记录数和空行数,启用分段或删除短行时还显示片段数和删除的短行数;【字符总量变化】记录输入和输出字符总数、字符变化、输出/输入字符比;【本次设置】列出实际生效的规则。
文件处理详情
每个文件一行,列出输入字符、输出字符、字符变化及其比例、输出行数。
清洗前后对照
每个文件展示前 1000 个字符。左侧是清洗前,红色标出的内容没有出现在右侧;右侧是清洗后。CSV 显示的是文本单元格摘录,不是原始排版。完整内容以下载的结果文件为准。
方法与口径
说明字符和行数的统计方式。
读数字时记住三条口径。TXT 的字符数包含换行;CSV 只统计非空单元格里的内容,不计表头和分隔符。开启分段后,TXT 会增加空行,CSV 会增加记录,输出字符数和行数可能比输入多,此时字符差额不等于删除量。不同格式或不同分段设置的文件,字符变化比例不宜直接比较。
05
几类常见材料的设置
| 材料 | 设置 |
|---|---|
| 网页抓取的评论,夹杂 HTML 标签和代码 | 开启【仅保留中文内容】;英文和数字会一并删除 |
| 访谈逐字稿,需要保留段落和简短回答 | 关闭【合并换行】,不开【删除短于阈值的行】 |
| 含日期、编号、金额、网址 | 不勾选【删除连接符和分隔符】和【将常见半角标点转为全角】,不开【删除十进制数字】 |
| 准备做 LDA 或 BERTopic | 开启【按目标长度分段】,LDA 约 50 到 200 字,BERTopic 约 100 到 500 字 |
