[{"data":1,"prerenderedAt":-1},["ShallowReactive",2],{"cms-guide-article:ci-xing-biao-zhu-gong-ju-shi-yong-jiao-cheng-tong-ji-ci-lei-fen-bu-fen-xi-wen-ben-yu-fa-te-zheng":3},{"article":4},{"id":5,"userId":6,"title":7,"content":8,"type":9,"lang":10,"index":11,"category":12,"tags":13,"coverImages":15,"slug":17,"summary":18,"associatedTaskType":19,"nextSteps":20,"isPublic":41,"createdAt":42,"updatedAt":42},"6a25316df98a56c7bb092d91","6804358a59ddd2c7c898172e","词性标注工具使用教程：统计词类分布，分析文本语法特征","\u003Cp>词性标注做的事情是：给文本里的每个词分配一个语法类别，然后从整体上统计各类词性的分布情况。\u003C\u002Fp>\u003Cp>处理过程大致分四步。\u003C\u002Fp>\u003Col>\u003Cli>先做分词和语言识别。中文文本用分词工具切词，英文直接按空格和标点切分。系统会自动判断文本是中文、英文还是中英混排。\u003C\u002Fli>\u003Cli>然后跑标注引擎。中文文本同时用两套引擎：一套基于分词工具，覆盖 60 多种细词性；一套基于句法分析器，覆盖 200 多种细词性。英文只走句法路径。\u003C\u002Fli>\u003Cli>接着做粗类归并。分词路径和句法路径的细粒度标签会分别映射到统一粗类。中文分词路径主要归并为 14 个粗类：名词、动词、形容词、副词、代词、数词、量词、介词、连词、助词、语气词、叹词、方位词、其他。句法路径和英文路径会保留原始细标签，同时提供可对照的粗类统计。这个归并降低了分析门槛，方便横向比较。\u003C\u002Fli>\u003Cli>最后生成报告。包含词性分布柱状图、跨文件热力图、转移概率矩阵、基准语料对比、例词展示，以及按词性筛选的 CSV 导出和实词词典 TXT 导出。\u003C\u002Fli>\u003C\u002Fol>\u003Cp>两套引擎的结果不一定完全一致，这很正常。分词路径更贴近中文分词习惯，句法路径更贴近语法角色。两条路径的标签集合不同，不能直接当一致率解读，但可以互相参照。\u003C\u002Fp>\u003Cp>\u003Cbr>\u003C\u002Fp>\u003Ch2>适用文档\u003C\u002Fh2>\u003Cp>目前支持 TXT 文件输入。编码建议用 UTF-8，其他编码出现乱码可以先转一下。\u003C\u002Fp>\u003Cp>语言方面，中文和英文都支持，中英混排也可以处理。系统会自动识别语言后分别用对应的引擎标注。\u003C\u002Fp>\u003Cp>输出结果包括报告页面、词性明细 CSV、筛选结果 CSV 和实词词典 TXT。\u003C\u002Fp>\u003Cp>\u003Cbr>\u003C\u002Fp>\u003Ch2>适用情景\u003C\u002Fh2>\u003Col>\u003Cli>语料库语言学研究。标注词性分布特征，对比不同语体的语法差异，建立语料库的词性基线。比如对比学术论文和访谈转录稿的名词占比差距。\u003C\u002Fli>\u003Cli>文本风格分析。通过词性占比判断文本偏口语还是偏书面、偏正式还是偏随意。在访谈、对话和评论类文本中，代词和语气词占比偏高，通常有助于判断口语化特征。\u003C\u002Fli>\u003Cli>翻译质量评估。对比原文和译文的词性分布差异，发现翻译中的语法偏移和修饰语冗余。形容词占比异常偏高可能是翻译腔的信号。\u003C\u002Fli>\u003Cli>文本分析预处理。为后续句法分析、实体识别、关系分析等任务提供词性参考。词性标签是很多分析管线的基础输入。\u003C\u002Fli>\u003Cli>教学研究。分析学生作文的词性使用模式，发现语法薄弱点。比如动词形式单一可能说明表达不够丰富。\u003C\u002Fli>\u003C\u002Fol>\u003Cp>\u003Cbr>\u003C\u002Fp>\u003Ch2>使用步骤\u003C\u002Fh2>\u003Cp>第一步：上传文件。你可以上传一个或多个 TXT 文件，系统逐个处理。\u003C\u002Fp>\u003Cp>\u003Cimg src=\"https:\u002F\u002Flatte-api-uploader.oss-cn-chengdu.aliyuncs.com\u002Fanna\u002Fadmin-cms\u002Fdraft\u002Fb45ca92e72c9f6aeb03b71fcb28ce33c.png\" alt=\"\" data-href=\"\" style=\"\"\u002F>\u003C\u002Fp>\u003Cp>\u003Cbr>\u003C\u002Fp>\u003Cp>第二步：确认处理设置。上传后页面会显示处理设置区域，默认配置通常适合一般文本。需要术语识别、停用词过滤或导出筛选时，可以在这里调整，具体含义在下一节展开。\u003C\u002Fp>\u003Cp>\u003Cimg src=\"https:\u002F\u002Flatte-api-uploader.oss-cn-chengdu.aliyuncs.com\u002Fanna\u002Fadmin-cms\u002Fdraft\u002F358d417356badf2f62794cdb465d5dd8.png\" alt=\"\" data-href=\"\" style=\"\"\u002F>\u003C\u002Fp>\u003Cp>\u003Cbr>\u003C\u002Fp>\u003Cp>\u003Cbr>\u003C\u002Fp>\u003Cp>第三步：查看报告。提交后系统自动处理，完成后跳转到报告页。报告包含数据解读卡片、筛选导出区、跨文件热力图、基准对比、分词路径和句法路径的柱状图、转移概率矩阵、示例词等模块。\u003C\u002Fp>\u003Cp>\u003Cimg src=\"https:\u002F\u002Flatte-api-uploader.oss-cn-chengdu.aliyuncs.com\u002Fanna\u002Fadmin-cms\u002Fdraft\u002F81325531c0e66840d502726cd0beebd7.png\" alt=\"\" data-href=\"\" style=\"\"\u002F>\u003C\u002Fp>\u003Cp>\u003Cimg src=\"https:\u002F\u002Flatte-api-uploader.oss-cn-chengdu.aliyuncs.com\u002Fanna\u002Fadmin-cms\u002Fdraft\u002Fafa1a800baf536ba389b391b38b12a09.png\" alt=\"\" data-href=\"\" style=\"\"\u002F>\u003C\u002Fp>\u003Cp>\u003Cimg src=\"https:\u002F\u002Flatte-api-uploader.oss-cn-chengdu.aliyuncs.com\u002Fanna\u002Fadmin-cms\u002Fdraft\u002F5dc69fbe6e9613b57d20d4f83dc8fd39.png\" alt=\"\" data-href=\"\" style=\"\"\u002F>\u003C\u002Fp>\u003Cp>\u003Cimg src=\"https:\u002F\u002Flatte-api-uploader.oss-cn-chengdu.aliyuncs.com\u002Fanna\u002Fadmin-cms\u002Fdraft\u002Fad081fe9caabbbc4cc9725d7da2412c9.png\" alt=\"\" data-href=\"\" style=\"\"\u002F>\u003C\u002Fp>\u003Cp>\u003Cimg src=\"https:\u002F\u002Flatte-api-uploader.oss-cn-chengdu.aliyuncs.com\u002Fanna\u002Fadmin-cms\u002Fdraft\u002F9f7d6a6983a7f435272403559c7195ef.png\" alt=\"\" data-href=\"\" style=\"\"\u002F>\u003C\u002Fp>\u003Cp>\u003Cimg src=\"https:\u002F\u002Flatte-api-uploader.oss-cn-chengdu.aliyuncs.com\u002Fanna\u002Fadmin-cms\u002Fdraft\u002F961c9fbaf9d8838aa3a9a0fe5214454f.png\" alt=\"\" data-href=\"\" style=\"\"\u002F>\u003C\u002Fp>\u003Cp>\u003Cbr>\u003C\u002Fp>\u003Cp>第四步：导出结果。在筛选导出区选择标注路径和要保留的词性类别，可以导出筛选结果 CSV 或实词词典 TXT。下载包里还包含每个文件的词性明细。\u003C\u002Fp>\u003Cp>\u003Cimg src=\"https:\u002F\u002Flatte-api-uploader.oss-cn-chengdu.aliyuncs.com\u002Fanna\u002Fadmin-cms\u002Fdraft\u002F4bee7848eb378d466d6c31f6aa439022.png\" alt=\"\" data-href=\"\" style=\"\"\u002F>\u003C\u002Fp>\u003Cp>\u003Cbr>\u003C\u002Fp>\u003Ch2>参数解析与对比示例\u003C\u002Fh2>\u003Cp>可配置参数如下。\u003C\u002Fp>\u003Ctable style=\"width: auto;\">\u003Ctbody>\u003Ctr>\u003Cth colSpan=\"1\" rowSpan=\"1\" width=\"auto\">参数\u003C\u002Fth>\u003Cth colSpan=\"1\" rowSpan=\"1\" width=\"auto\">说明\u003C\u002Fth>\u003Cth colSpan=\"1\" rowSpan=\"1\" width=\"auto\">默认值\u003C\u002Fth>\u003C\u002Ftr>\u003Ctr>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">文档主要语言\u003C\u002Ftd>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">中文或英文。用于设定默认处理策略，系统会在此基础上识别文本片段中的语言并分别处理。若整篇文档为英文，建议切换为英文\u003C\u002Ftd>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">中文\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">使用自定义字典\u003C\u002Ftd>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">上传自定义词典文件，每行一个词，帮助分词工具识别专有名词和术语\u003C\u002Ftd>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">关闭\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">使用自定义停用词\u003C\u002Ftd>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">上传停用词文件，每行一个词，在分词后、统计前过滤这些词\u003C\u002Ftd>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">关闭\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">分词模式\u003C\u002Ftd>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">精确模式（互不重叠）、全模式（扫描所有可能词语）、搜索引擎模式（精确基础上补充搜索词）\u003C\u002Ftd>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">精确模式\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">智能词汇识别\u003C\u002Ftd>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">自动发现语料中的新词，补充分词词典。比较耗时，仅在前一定字数内启用\u003C\u002Ftd>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">关闭\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">词性过滤\u003C\u002Ftd>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">勾选要排除的词性类别，标注完成后从统计和导出结果中排除这些词性\u003C\u002Ftd>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">关闭\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">基准语料类型\u003C\u002Ftd>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">选择用于对比的参考语料：一般新闻、学术、口语、社媒、电商评论、文学作品\u003C\u002Ftd>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">一般新闻\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">导出标注路径\u003C\u002Ftd>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">选择分词路径或句法路径用于导出\u003C\u002Ftd>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">分词路径\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">导出词性范围\u003C\u002Ftd>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">选择导出时保留的词性类别\u003C\u002Ftd>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">名词、动词\u003C\u002Ftd>\u003C\u002Ftr>\u003C\u002Ftbody>\u003C\u002Ftable>\u003Cp>\u003Cbr>\u003C\u002Fp>\u003Ch2>三组典型配置供参考。\u003C\u002Fh2>\u003Col>\u003Cli>基础标注。语言选中文，其他参数保持默认。适合大多数中文文本的快速标注，两套引擎同时跑，结果可相互参照。\u003C\u002Fli>\u003Cli>术语强化标注。开启自定义字典，上传领域术语词典。适合包含大量专业术语的文本，比如医学、法律、IT 领域文档，能减少术语被错切的情况。\u003C\u002Fli>\u003Cli>内容词聚焦标注。开启词性过滤，勾选介词、连词、助词、语气词等功能词类别。适合只想看实义词分布的场景，过滤后柱状图和导出词表更干净。过滤后，图表和导出结果只反映保留词性的分布，不再代表全文完整词性结构。\u003C\u002Fli>\u003C\u002Fol>\u003Cp>分词模式的选择影响分词路径的结果。精确模式适合一般分析，全模式会产生冗余但覆盖更全，搜索引擎模式介于两者之间。句法路径不受分词模式影响。\u003C\u002Fp>\u003Cp>\u003Cbr>\u003C\u002Fp>\u003Ch2>案例分析\u003C\u002Fh2>\u003Cp>案例一：社科访谈文本语法分析。\u003C\u002Fp>\u003Cp>背景：某团队对 200 份深度访谈转录文本做词性标注，想了解口语语料的语法结构特征。\u003C\u002Fp>\u003Cp>配置：语言选中文，其他参数默认。\u003C\u002Fp>\u003Cp>结果：分词路径显示名词占比约 36%，看起来跟学术语料差不多。但转移矩阵中「代词→动词」的相邻搭配比书面语更常见，语气词和叹词占比高于所选学术参考线。基准对比中选择「口语语料」参考线后，偏差明显缩小。\u003C\u002Fp>\u003Cp>结论：单看词性占比可能会误判语体特征。转移矩阵和功能词占比才是区分口语和书面语的关键指标。\u003C\u002Fp>\u003Cp>\u003Cbr>\u003C\u002Fp>\u003Cp>案例二：中英混排论文语料对比。\u003C\u002Fp>\u003Cp>背景：某语言学实验室上传 50 篇中英混排论文，想比较中英文部分的语法差异。\u003C\u002Fp>\u003Cp>配置：语言选中文，开启自定义字典上传学科术语。\u003C\u002Fp>\u003Cp>结果：系统自动识别语言后分别用两套引擎标注。跨文件热力图显示各文件的词性分布相对一致。基准对比中选择「学术语料」参考线，中文部分的名词占比约 38%，低于英文参考值，但形容词占比偏高。回看原文和译文片段后，团队发现部分句子存在修饰语堆叠现象，这可能解释了形容词占比偏高。\u003C\u002Fp>\u003Cp>结论：中英混排文本可以分别标注后横向比较。中英文部分的词性比例可以在统一粗类下观察趋势，但不建议把百分比差异直接解释为语法强弱差异，需要结合分词粒度和文本类型复核。\u003C\u002Fp>\u003Cp>\u003Cbr>\u003C\u002Fp>\u003Ch2>类似功能对比\u003C\u002Fh2>\u003Cp>词性标注和分词、关键词抽取看起来都跟\"词\"有关，但做的事情不一样。\u003C\u002Fp>\u003Ctable style=\"width: auto;\">\u003Ctbody>\u003Ctr>\u003Cth colSpan=\"1\" rowSpan=\"1\" width=\"auto\">词性标注\u003C\u002Fth>\u003Cth colSpan=\"1\" rowSpan=\"1\" width=\"auto\">分词\u003C\u002Fth>\u003Cth colSpan=\"1\" rowSpan=\"1\" width=\"auto\">关键词抽取\u003C\u002Fth>\u003C\u002Ftr>\u003Ctr>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">给每个词标语法类别，统计分布\u003C\u002Ftd>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">把连续文本切成词语\u003C\u002Ftd>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">提取文本中最重要的词或短语\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">语法结构、词性比例、相邻词性搭配\u003C\u002Ftd>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">词语边界、切分准确性\u003C\u002Ftd>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">词的重要程度、主题相关性\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">词性分布、转移矩阵、基准对比\u003C\u002Ftd>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">分词结果、词表\u003C\u002Ftd>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">关键词列表、权重排序\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">语料库研究、风格分析、翻译评估\u003C\u002Ftd>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">分析预处理、词频统计\u003C\u002Ftd>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">主题分析、标签生成、摘要提取\u003C\u002Ftd>\u003C\u002Ftr>\u003C\u002Ftbody>\u003C\u002Ftable>\u003Cp>三者可以组合使用。词性标注完成后，可以在名词、动词等指定词性范围内做关键词抽取，让结果更聚焦。\u003C\u002Fp>\u003Cp>\u003Cbr>\u003C\u002Fp>","admin_cms","zh-cn",0,"guide",[14],"文本分析基础教程",[16],"https:\u002F\u002Flatte-api-uploader.oss-cn-chengdu.aliyuncs.com\u002Fanna\u002Fadmin-cms\u002Fdraft\u002Fcover\u002F0c7c2a78832a0f13ebcaf924294e129c.png","ci-xing-biao-zhu-gong-ju-shi-yong-jiao-cheng-tong-ji-ci-lei-fen-bu-fen-xi-wen-ben-yu-fa-te-zheng","文本中的名词、动词、形容词比例，会影响我们对文体风格的判断。词性标注会把每个词归入语法类别，再汇总为分布统计、相邻词性转移矩阵和基准语料对比。中文文本同时跑两套标注引擎，结果可以相互参照，帮助发现分词路径和语法角色判断上的差异；英文走句法级路径，标签集更贴近跨语言语法体系。","pos-tagging",[21,26,31,36],{"taskType":22,"name":23,"shortDesp":24,"_id":25},"extract-keywords","关键词抽取","从文本里挑出最能代表内容的关键词并按重要度排序，可选三种算法，结果以词云呈现。","6a25316df98a56c7bb092d92",{"taskType":27,"name":28,"shortDesp":29,"_id":30},"high-frequency-words","高频词提取","统计高频词，并找出由 2–4 个词组成的固定提法，自动归纳焦点说法与多篇间的共性。","6a25316df98a56c7bb092d93",{"taskType":32,"name":33,"shortDesp":34,"_id":35},"dependency","依存句法分析","可视化每句话的主干、修饰与依赖关系，并给整段文本打出句法复杂度评分。","6a25316df98a56c7bb092d94",{"taskType":37,"name":38,"shortDesp":39,"_id":40},"bertopic","BERTopic 主题聚类","基于语义聚类重建文本主题结构，自动生成抽象标签并解析主题间距离与层级关系。","6a25316df98a56c7bb092d95",true,"2026-06-07T08:53:01.366Z"]