[{"data":1,"prerenderedAt":-1},["ShallowReactive",2],{"cms-guide-article:wen-ben-qing-xi-gong-ju-shi-yong-jiao-cheng-pi-liang-qu-chu-zao-sheng-biao-dian-ting-yong-ci-shu-chu-gan-jing-yu-liao":3},{"article":4},{"id":5,"userId":6,"title":7,"content":8,"type":9,"lang":10,"index":11,"category":12,"tags":13,"coverImages":16,"slug":18,"summary":19,"associatedTaskType":20,"nextSteps":21,"isPublic":42,"createdAt":43,"updatedAt":44},"69ecc478135af239496f85ff","6804358a59ddd2c7c898172e","文本清洗工具使用教程：批量去除噪声、标点、停用词，输出干净语料","\u003Cp>文本清洗做的事情，用一句话概括就是：把原始文本里不该有的东西删掉。\u003C\u002Fp>\u003Cp>具体来说，处理过程分三步走。\u003C\u002Fp>\u003Cp>1. 先做字符级清理。移除 emoji、零宽字符、控制字符，全半角标点统一，连续标点合并。\u003C\u002Fp>\u003Cp>2. 再做内容级过滤。按你勾选的选项删除标点、停用词、数字或换行符。停用词就是\"的\"\"了\"\"是\"这类对分析没什么用的常见词。\u003C\u002Fp>\u003Cp>3. 最后做结构化处理。强力清理会剥离 HTML 标签只保留中文；文本分段会按字数窗口切分长文本。\u003C\u002Fp>\u003Cp>处理完你会看到一份报告：处理了多少文件和行数、删了多少字符、原文和清洗后的对照预览。被删掉的内容用红色高亮标出来，方便你快速判断。\u003C\u002Fp>\u003Cp>\u003Cbr>\u003C\u002Fp>\u003Ch2>适用文档\u003C\u002Fh2>\u003Cp>目前支持两种输入格式。\u003C\u002Fp>\u003Cp>1. TXT 文件。按行处理，每行一条记录。编码建议用 UTF-8，其他编码出现乱码可以先转一下。\u003C\u002Fp>\u003Cp>2. CSV 文件。自动识别文本列清洗，非文本列原样保留。需要带表头。\u003C\u002Fp>\u003Cp>PDF、Word、Excel 暂时不直接支持，可以先使用辅助工具中的转换工具转成 TXT 或 CSV 再用。\u003C\u002Fp>\u003Cp>强力清理会把非中文内容全部删掉，包括英文、数字和空格。文本里有英文术语或金额编号的话，就别开这个。\u003C\u002Fp>\u003Cp>\u003Cbr>\u003C\u002Fp>\u003Ch2>适用情景\u003C\u002Fh2>\u003Cp>1. 爬虫文章。HTML 标签、导航链接、广告代码，用强力清理加过短行过滤和停用词，噪声会少很多。\u003C\u002Fp>\u003Cp>2. 访谈转录稿。\"嗯\"\"然后\"\"就是说\"不少，自定义停用词表加上这些词，配合文本分段，文本会规整不少。\u003C\u002Fp>\u003Cp>3. 主题建模准备。LDA 通常需要先去标点和停用词；BERTopic 取决于模型，可以都试试。\u003C\u002Fp>\u003Cp>4. 中英文混排文档。标点统一后后续分词更准确。\u003C\u002Fp>\u003Cp>\u003Cbr>\u003C\u002Fp>\u003Ch2>使用步骤\u003C\u002Fh2>\u003Cp>第一步：上传文件。上传一个或多个 TXT 或 CSV 文件，系统逐文件独立处理。\u003C\u002Fp>\u003Cp>\u003Cimg src=\"https:\u002F\u002Flatte-api-uploader.oss-cn-chengdu.aliyuncs.com\u002Fanna\u002Fadmin-cms\u002F69ecc478135af239496f85ff\u002Faf87db70aeab69fffddd7319811fd9d7.png\" alt=\"\" data-href=\"\" style=\"\"\u002F>\u003C\u002Fp>\u003Cp>\u003Cbr>\u003C\u002Fp>\u003Chr\u002F>\u003Cp>第二步：查看报告。报告展示处理概览、字符统计、数据解读三个卡片，以及文件详情表和清洗对照预览。\u003C\u002Fp>\u003Cp>\u003Cimg src=\"https:\u002F\u002Flatte-api-uploader.oss-cn-chengdu.aliyuncs.com\u002Fanna\u002Fadmin-cms\u002F69ecc478135af239496f85ff\u002F852f7c730276956ded6d601c018734cb.png\" alt=\"\" data-href=\"\" style=\"\"\u002F>\u003C\u002Fp>\u003Cp>\u003Cimg src=\"https:\u002F\u002Flatte-api-uploader.oss-cn-chengdu.aliyuncs.com\u002Fanna\u002Fadmin-cms\u002F69ecc478135af239496f85ff\u002F421e54121a667ad94ba301a295829bb1.png\" alt=\"\" data-href=\"\" style=\"\"\u002F>\u003C\u002Fp>\u003Cp>第五步：下载结果。在报告页点击下载获取清洗后的文件，建议抽查对照预览确认无误后再用于后续分析\u003C\u002Fp>\u003Cp>\u003Cbr>\u003C\u002Fp>\u003Cp>\u003Cbr>\u003C\u002Fp>\u003Ch2>参数解析与对比示例\u003C\u002Fh2>\u003Cp>标点清理参数：\u003C\u002Fp>\u003Ctable style=\"width: auto;\">\u003Ctbody>\u003Ctr>\u003Cth colSpan=\"1\" rowSpan=\"1\" width=\"auto\">参数\u003C\u002Fth>\u003Cth colSpan=\"1\" rowSpan=\"1\" width=\"auto\">说明\u003C\u002Fth>\u003Cth colSpan=\"1\" rowSpan=\"1\" width=\"auto\">默认值\u003C\u002Fth>\u003C\u002Ftr>\u003Ctr>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">移除 emoji\u003C\u002Ftd>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">删除所有 emoji 表情符号\u003C\u002Ftd>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">开启\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">全半角标点统一\u003C\u002Ftd>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">将英文标点统一为中文全角标点\u003C\u002Ftd>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">关闭\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">连续标点合并\u003C\u002Ftd>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">将重复的标点合并为一个\u003C\u002Ftd>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">开启\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">句末标点\u003C\u002Ftd>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">删除 。！？.!?\u003C\u002Ftd>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">关闭\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">停顿标点\u003C\u002Ftd>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">删除 ，、；：,;:\u003C\u002Ftd>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">开启\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">括号引号\u003C\u002Ftd>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">删除 （）()【】[]{}《》&lt;&gt;\"\"''等\u003C\u002Ftd>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">关闭\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">连接\u002F分隔符\u003C\u002Ftd>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">删除 —、–、_、\u002F、\\、|、·、…、~、～ 等\u003C\u002Ftd>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">开启\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">其他符号\u003C\u002Ftd>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">删除 Unicode 分类为标点或符号的其他字符\u003C\u002Ftd>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">关闭\u003C\u002Ftd>\u003C\u002Ftr>\u003C\u002Ftbody>\u003C\u002Ftable>\u003Cp>其他清洗参数：\u003C\u002Fp>\u003Ctable style=\"width: auto;\">\u003Ctbody>\u003Ctr>\u003Cth colSpan=\"1\" rowSpan=\"1\" width=\"auto\">参数\u003C\u002Fth>\u003Cth colSpan=\"1\" rowSpan=\"1\" width=\"auto\">说明\u003C\u002Fth>\u003Cth colSpan=\"1\" rowSpan=\"1\" width=\"auto\">默认值\u003C\u002Fth>\u003C\u002Ftr>\u003Ctr>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">清除换行\u003C\u002Ftd>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">将记录内部换行符替换为空格，TXT 不同行仍独立处理\u003C\u002Ftd>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">关闭\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">清除数字\u003C\u002Ftd>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">删除所有数字字符\u003C\u002Ftd>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">关闭\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">删除过短行\u003C\u002Ftd>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">删除字数低于指定阈值的行\u003C\u002Ftd>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">关闭\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">过短行阈值\u003C\u002Ftd>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">低于该字数的行会被删除\u003C\u002Ftd>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">5 字\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">文本分段\u003C\u002Ftd>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">按字数窗口切分长文本\u003C\u002Ftd>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">关闭\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">分段窗口大小\u003C\u002Ftd>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">切分片段的字数\u003C\u002Ftd>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">200 字\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">强力清理\u003C\u002Ftd>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">剥离 HTML 标签并仅保留中文\u003C\u002Ftd>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">关闭\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">停用词过滤\u003C\u002Ftd>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">删除内置或自定义停用词表中的词语\u003C\u002Ftd>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">关闭\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">使用内置停用词表\u003C\u002Ftd>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">使用系统预置中文常用停用词表\u003C\u002Ftd>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">需先启用停用词过滤\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">自定义停用词表\u003C\u002Ftd>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">上传自定义停用词文件，每行一个词，与内置词表合并使用\u003C\u002Ftd>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">未上传\u003C\u002Ftd>\u003C\u002Ftr>\u003C\u002Ftbody>\u003C\u002Ftable>\u003Cp>\u003Cbr>\u003C\u002Fp>\u003Cp>\u003Cbr>\u003C\u002Fp>\u003Ch2>典型配置对比：\u003C\u002Fh2>\u003Cp>1. 轻度清洗。移除 emoji + 停顿标点 + 连接符 + 连续标点合并。适合文本较干净、只去多余标点。删除比率一般 5%-10%。\u003C\u002Fp>\u003Cp>2. 标准清洗。加停用词过滤 + 删除过短行（阈值 8 字）+ 文本分段（200 字）。适合 LDA \u002F BERTopic 输入准备。删除比率一般 15%-25%。\u003C\u002Fp>\u003Cp>3. 深度清洗。加强力清理 + 句末标点 + 括号引号。适合纯中文爬虫或 OCR 文本，有英文术语或金额就别开强力清理。删除比率一般 30%-50%，建议看对照预览。\u003C\u002Fp>\u003Cp>比率是经验参考，实际效果受文本类型影响。\u003C\u002Fp>\u003Cp>\u003Cbr>\u003C\u002Fp>\u003Ch2>案例分析\u003C\u002Fh2>\u003Cp>案例一：爬虫数据去噪。\u003C\u002Fp>\u003Cp>背景：某研究团队从新闻网站抓取 200 篇财经报道，文本混杂 HTML 标签和导航链接。\u003C\u002Fp>\u003Cp>配置：强力清理 + 删除过短行（阈值 10 字）+ 移除停用词。\u003C\u002Fp>\u003Cp>结果：保留率约 65%。HTML 标签基本清除，中文正文保留较完整。导航文字等中文噪声还需要结合过短行和停用词处理，建议抽查。\u003C\u002Fp>\u003Cp>结论：清洗后跑 LDA 主题建模，主题词更集中，无关词少了很多。\u003C\u002Fp>\u003Cp>\u003Cbr>\u003C\u002Fp>\u003Cp>\u003Cbr>\u003C\u002Fp>\u003Cp>案例二：访谈转录稿预处理。\u003C\u002Fp>\u003Cp>背景：某社科研究者有 15 份访谈转录稿，口语化填充词不少。\u003C\u002Fp>\u003Cp>配置：自定义停用词表 + 停顿标点删除 + 文本分段（250 字）。\u003C\u002Fp>\u003Cp>结果：保留率约 78%，每份切为 12-20 个片段。\u003C\u002Fp>\u003Cp>结论：清洗后用于 BERTopic 主题聚类，可结合主题词评估口语噪声干扰。\u003C\u002Fp>\u003Cp>\u003Cbr>\u003C\u002Fp>\u003Ch2>类似功能对比\u003C\u002Fh2>\u003Cp>文本清洗与中文文本规范化容易混淆，区别如下：\u003C\u002Fp>\u003Ctable style=\"width: auto;\">\u003Ctbody>\u003Ctr>\u003Cth colSpan=\"1\" rowSpan=\"1\" width=\"auto\">对比维度\u003C\u002Fth>\u003Cth colSpan=\"1\" rowSpan=\"1\" width=\"auto\">文本清洗\u003C\u002Fth>\u003Cth colSpan=\"1\" rowSpan=\"1\" width=\"auto\">中文文本规范化\u003C\u002Fth>\u003C\u002Ftr>\u003Ctr>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">处理目标\u003C\u002Ftd>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">去除噪声，减少无关字符\u003C\u002Ftd>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">统一文字形态，修正不规范用法\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">核心操作\u003C\u002Ftd>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">删除标点、停用词、HTML、emoji\u003C\u002Ftd>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">繁简转换、异体字统一、格式归一\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">典型场景\u003C\u002Ftd>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">爬虫去噪、建模前预处理\u003C\u002Ftd>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">繁体资料整理、历史文献数字化\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">输出结果\u003C\u002Ftd>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">删除后的干净文本 + 删除统计\u003C\u002Ftd>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">替换后的规范文本 + 替换明细\u003C\u002Ftd>\u003C\u002Ftr>\u003C\u002Ftbody>\u003C\u002Ftable>\u003Cp>两者可串联：先规范化统一文字形态，再清洗去除噪声，适用于繁简混排语料。文本清洗不等同于分词或去重，主要负责去除噪声，为后续分析准备输入。\u003C\u002Fp>\u003Cp>\u003Cbr>\u003C\u002Fp>","admin_cms","zh-cn",3,"guide",[14,15],"文本清洗","文本分析基础教程",[17],"https:\u002F\u002Flatte-api-uploader.oss-cn-chengdu.aliyuncs.com\u002Fanna\u002Fadmin-cms\u002F69ecc478135af239496f85ff\u002Fcover\u002F293ee319468feaa66f97d3f7f64820be.png","wen-ben-qing-xi-gong-ju-shi-yong-jiao-cheng-pi-liang-qu-chu-zao-sheng-biao-dian-ting-yong-ci-shu-chu-gan-jing-yu-liao","原始文本里经常混着 HTML 标签、多余标点、emoji、零宽字符这些东西。它们会干扰词频统计、主题建模、情感分析的结果。文本清洗帮你把这些噪声批量去掉，处理完得到干净文本和一份对照预览，方便你确认没有误删。","clear-text",[22,27,32,37],{"taskType":23,"name":24,"shortDesp":25,"_id":26},"text-normalize","中文文本规范化","把繁简、标点、全\u002F半角写法不一的中文统一成出版级样式，并可整篇转写为拼音。","6a251ae1f98a56c7bb0845e8",{"taskType":28,"name":29,"shortDesp":30,"_id":31},"extract-keywords","关键词抽取","从文本里挑出最能代表内容的关键词并按重要度排序，可选三种算法，结果以词云呈现。","6a251ae1f98a56c7bb0845e9",{"taskType":33,"name":34,"shortDesp":35,"_id":36},"pos-tagging","词性标注","逐词标注词性并给出各词类的占比与示例，中文同时输出两种分词方案的对比结果。","6a251ae1f98a56c7bb0845ea",{"taskType":38,"name":39,"shortDesp":40,"_id":41},"bertopic","BERTopic 主题聚类","基于语义聚类重建文本主题结构，自动生成抽象标签并解析主题间距离与层级关系。","6a251ae1f98a56c7bb0845eb",true,"2026-04-25T13:41:12.691Z","2026-06-07T07:38:15.167Z"]