返回教程列表
文本清洗文本分析基础教程

文本清洗工具使用教程:批量去除噪声、标点、停用词,输出干净语料

原始文本里经常混着 HTML 标签、多余标点、emoji、零宽字符这些东西。它们会干扰词频统计、主题建模、情感分析的结果。文本清洗帮你把这些噪声批量去掉,处理完得到干净文本和一份对照预览,方便你确认没有误删。

作者:TATOOLS 研究团队|更新于 2026-08-26|2570 字|约 9 分钟读完
clear-text
立即使用

文本清洗按你勾选的规则处理 TXT 和 CSV 材料:删除表情、标点、数字、停用词和过短的行,或把长文本切成长度相近的片段。 每个输入文件生成一个同格式的结果文件 ,并附一份处理报告。

问卷开放题、访谈逐字稿、网页评论这类材料常带有表情、重复标点、不可见字符和网页代码。先清洗,再投入词频、主题、情感等分析。

01

准备材料

支持 TXT 和 CSV。Word、PDF、Excel 等常用文档也可以上传,系统会先转换为 TXT 或 CSV。单个文件不超过 10 MB,不超过 10,000 行。

TXT 按整份文本处理,行的边界默认保留。CSV 逐个文本列处理每个单元格,数字等非文本列不处理,列结构保持不变。

无论勾选哪些规则,所有材料都会先经过一步基础处理:统一换行符,删除零宽字符和控制字符,把行内连续的空格和制表符合并为一个空格,去掉行首行尾的空白。这一步不删除表情,表情由下面的规则控制。


02

选择处理规则

页面上共有七个开关。【清理标点和符号】默认开启,其余默认关闭。 至少选择一项规则才能提交 ;只开启【清理标点和符号】总开关而不勾选具体项,或者只开启分段,都不能提交。

清理标点和符号

开启后只执行勾选的处理项,未勾选的符号保持原样。默认勾选前四项。

处理项 默认 处理内容
移除表情符号 勾选 删除 😀 🎉 👍 等表情,以及 ★ ☆ ✔ 等符号型字符
合并连续重复标点 勾选 !!! 合并为 。。。 合并为 !? 混合连写只保留第一个
删除停顿标点 勾选 删除 ,、;: 以及半角的 , ; :
删除连接符和分隔符 勾选 删除 - — – _ / \ | · … ~ ~
将常见半角标点转为全角 未勾选 , . ? ! ; : ( ) [ ] < > 换成对应的全角标点
删除句末标点 未勾选 删除 。!? 以及半角的 . ! ?
删除括号和引号 未勾选 删除 ()()【】[]{}《》<> 和中英文引号
删除其他标点及符号 未勾选 删除以上各组之外的标点和符号,如 ※ § ¶ → ℃ ± @ # % & * +

两处需要留意。【将常见半角标点转为全角】会把所有英文句点换成句号,小数点和网址也不例外,3.5 会变成 3。5

【删除连接符和分隔符】会删掉日期和编号里的横线和斜线,2024-05-01 会变成 20240501

仅保留中文内容

先从 HTML 中提取可见文字,再只保留汉字、常用中文标点 。,!?、;: 和换行。英文、数字、空格、其他语言文字和其余符号全部删除。适合网页抓取的评论;含编号、日期、英文缩写或外文引文的材料不宜开启。

如果同时勾选了【删除停顿标点】,保留下来的中文标点只剩 。!?

删除十进制数字

删除文本中的阿拉伯数字,连续数字整体删除;一、二、十等中文数词不受影响。日期、编号、金额和量表分值会随之丢失。

合并换行

把一个或多个换行换成一个空格,再合并相邻的多余空白。TXT 整份文本变成一行,CSV 中每个单元格变成一行。需要保留段落边界的访谈稿和长文应关闭。

移除自定义停用词

需要上传一份 TXT 词表,每行一个词。系统按词表逐项在文本中查找并删除,不做分词, 命中的文字位于更长词语内部时同样被删 。词表含【的】时,【目的】会变成【目】。提交前先核对词表。开关开启但没有上传词表时,这一项不执行。

删除短于阈值的行

在标点、数字和停用词规则执行之后,删除去掉首尾空白后长度小于阈值的行;长度等于阈值的行保留。阈值可设 1 到 10 个字符,默认 5。

因为其他删除先执行,一行【好的。】在勾选【删除句末标点】后只剩 2 个字符,阈值为 5 时会被删除。标题、编号、简短回答和对话短句多的材料应谨慎开启。

按目标长度分段

清洗完成后,把文本切成长度接近目标值的片段,可设 20 到 500 个字符,默认 50。切分位置先在目标长度附近找 。!?;,找不到再找换行,文本较长时再找 ,:,都没有时按字符数直接切。片段不重叠,也不保证等长; 长度不超过 5 个字符的片段会被丢弃

TXT 的片段在结果文件中以空行分隔。CSV 只切分每条记录第一个有内容的文本列,每个片段成为一条新记录,其他列的值原样复制,输出记录数因此多于输入。

分段本身不算处理规则,需要同时选择至少一项规则。工具页功能介绍给出的参考值:LDA 约 50 到 200 字,BERTopic 约 100 到 500 字。

规则的执行顺序

1

删除零宽字符和控制字符;勾选时同时删除表情

2

半角标点转全角

3

合并连续重复标点

4

仅保留中文内容,先提取 HTML 可见文字

5

删除勾选的标点和符号

6

删除数字

7

删除停用词

8

删除短行

9

规范空白;勾选合并换行时把换行换成空格

10

按目标长度分段


03

提交任务

选好规则后点击【提交任务】。需要通知时开启【完成后发送结果通知】并填写邮箱,任务完成后会发送通知;结果仍要在任务详情页查看和下载。

每个输入文件对应一个结果文件,TXT 仍是 TXT,CSV 仍是 CSV。文件以带 BOM 的 UTF-8 保存,Windows 记事本可以直接识别编码。


04

读懂处理报告

任务完成后,报告从上到下分为五块。


这份结果说明了什么

生成的结果文件数,清洗后的字符总数和行数,清洗前后的字符差额及其占输入字符的比例,本次使用的规则。


三张统计卡

【处理范围】记录结果文件数、输出行或记录数和空行数,启用分段或删除短行时还显示片段数和删除的短行数;【字符总量变化】记录输入和输出字符总数、字符变化、输出/输入字符比;【本次设置】列出实际生效的规则。


文件处理详情

每个文件一行,列出输入字符、输出字符、字符变化及其比例、输出行数。


清洗前后对照

每个文件展示前 1000 个字符。左侧是清洗前,红色标出的内容没有出现在右侧;右侧是清洗后。CSV 显示的是文本单元格摘录,不是原始排版。完整内容以下载的结果文件为准。


方法与口径

说明字符和行数的统计方式。

读数字时记住三条口径。TXT 的字符数包含换行;CSV 只统计非空单元格里的内容,不计表头和分隔符。开启分段后,TXT 会增加空行,CSV 会增加记录,输出字符数和行数可能比输入多,此时字符差额不等于删除量。不同格式或不同分段设置的文件,字符变化比例不宜直接比较。


05

几类常见材料的设置

材料 设置
网页抓取的评论,夹杂 HTML 标签和代码 开启【仅保留中文内容】;英文和数字会一并删除
访谈逐字稿,需要保留段落和简短回答 关闭【合并换行】,不开【删除短于阈值的行】
含日期、编号、金额、网址 不勾选【删除连接符和分隔符】和【将常见半角标点转为全角】,不开【删除十进制数字】
准备做 LDA 或 BERTopic 开启【按目标长度分段】,LDA 约 50 到 200 字,BERTopic 约 100 到 500 字