中文文本规范化
用来解决中文文本里繁简混用、引号不统一、全半角混杂等格式问题——统一成出版级规范样式,并可整篇转写为拼音。与文本清洗互补:本工具做无损统一(一字不丢、人能读),文本清洗做降噪减字(给下游模型用),建议先规范化、再清洗。
繁简转换支持 9 种模式(繁↔简、繁↔台湾、繁↔港澳、自动检测),按专业自建词典判断上下文,而不是单字一一替换,可正确处理(头发 / 髮)(干 / 乾)等多义字;标点规范化覆盖 7 项独立规则(全角数字字母转半角、直引号转中文弯引号并配对校验、错配引号修正、省略号统一、破折号统一、多余空白折叠),每项独立计数;数字转正文用大模型智能判断(数字+中文)组合是否为词(地名、线路、楼号等),将数字转为中文写法避免被清洗误删;拼音提供声调符号、声调数字、无声调三种形式,并可按词切分以避开多音字误读。
报告给出规范化总览(繁简变更数、标点修改数、数字转正文数、拼音覆盖字数)、标点子项分布条形图、每份文件的修改统计(原字数、改后字数、各项变更数),以及数字转正文记录表、原文与改后并排的修改样例与无法自动判定的人工复核警告清单;规范化主文件与拼音 CSV 可整批下载。
典型场景:字幕、教材、播报稿、港台稿件出海等发布前的最后一道格式统一;政策文件数字规范化;分词、词频、关键词与聚类等下游分析的预处理步骤。
加载文件上传组件中...
zhōng wén
开启时按 jieba 切词保证多音字正确读音,拼音拼回整行输出;关闭时整段逐字注音。
每 20,000 字 2 点
