[{"data":1,"prerenderedAt":-1},["ShallowReactive",2],{"cms-guide-article:gao-pin-ci-ti-qu-gong-ju-shi-yong-jiao-cheng-tong-ji-ci-pin-he-gu-ding-ci-zu-zhao-chu-wen-ben-zhong-fan-fu-qiang-tiao-de-he-xin-ti-fa":3},{"article":4},{"id":5,"userId":6,"title":7,"content":8,"type":9,"lang":10,"index":11,"category":12,"tags":13,"coverImages":15,"slug":17,"summary":18,"associatedTaskType":19,"nextSteps":20,"isPublic":41,"createdAt":42,"updatedAt":42},"6a27de380d824b2ecc5e90bc","6804358a59ddd2c7c898172e","高频词提取工具使用教程：统计词频和固定词组，找出文本中反复强调的核心提法","\u003Cp>高频词提取做的事情是：按频次统计文本中最常出现的词；当你勾选两个词以上的组合时，也会统计相邻词组成的固定词组。\u003C\u002Fp>\u003Cp>处理过程大致分四步。\u003C\u002Fp>\u003Col>\u003Cli>先做分词。TXT 或 CSV 中的文本会先被切成词。中文默认使用精确模式，也可以切换为全模式或搜索引擎模式；领域词容易被切散时，可以上传自定义字典辅助分词。停用词会在统计前被过滤。\u003C\u002Fli>\u003Cli>然后统计勾选的对象。默认只统计单个词。如果勾选两个词、三个词、四个词组合，系统会继续统计相邻词组成的词组。词组最低频次只对两个词及以上的组合生效，单个词不受这个门槛影响。\u003C\u002Fli>\u003Cli>接着做可选过滤和识别。词性过滤会把选中的词性类型排除在后续分析之外，且只支持中文。智能词汇识别会尝试发现语料中的新词，但这些新词只是作为补充分词词典参与处理，不一定会在最终结果里单独出现。\u003C\u002Fli>\u003Cli>最后生成报告。包含关键发现段落、词云、面积图、Top 20 高频词清单和「核心词 × 长组合」对比表，多文件时还会展示跨文档共有词和单篇独有词的分布。\u003C\u002Fli>\u003C\u002Fol>\u003Cp>关键发现是系统根据统计结果自动生成的一段分析文字，用来概括主导词、稳定搭配和表达集中度。它可以帮助你快速阅读结果，但重要结论仍建议回到原文或 KWIC 上下文中复核。\u003C\u002Fp>\u003Cp>\u003Cbr>\u003C\u002Fp>\u003Ch2>适用文档\u003C\u002Fh2>\u003Col>\u003Cli>高频词提取对文档内容有一定要求，下面从文本长度、文本质量、语言和行业、是否需要预处理、输入格式五个方面说明。\u003C\u002Fli>\u003Cli>文本长度方面，建议单篇至少 300 字以上。低于这个长度，词频统计的样本量不够，排名靠前的词往往只是偶然多出现了一两次，参考价值有限。单篇 1,000 到 10,000 字是比较理想的区间——足够长让高频词浮现，又不至于长到处理太慢。政策文件、财报研报、学术论文通常都在这个范围内；问卷开放题单条可能只有几十字，但按行上传 CSV 后每行独立统计，200 条以上的量也能得到有意义的结果。单个文件大小上限 10MB，多文件一次最多上传 10 个。\u003C\u002Fli>\u003Cli>文本质量方面，工具假设输入文本已经过基本整理。如果文本里混着大量 HTML 标签、URL、emoji、乱码或重复段落，这些噪声会被当成「词」参与统计，拉低有效高频词的排名。从网页抓下来的文本通常需要先用「文本清洗」工具去掉 HTML 和噪声，再做高频词提取。访谈转录稿可能需要去掉说话人标记和语气词。如果文本有明显的繁简混用或标点不统一，建议先用「中文文本规范化」统一写法，避免同一个词因为繁简不同被统计成两个。问卷开放题回答一般比较干净，可以直接用。如果不确定文本质量，可以先直接跑一次看结果，如果发现排名靠前的都是「的」「了」「是」或者乱码片段，再回去做预处理。\u003C\u002Fli>\u003Cli>语言和行业方面，中文和英文都支持，中英混排也可以处理。分词模式（精确、全模式、搜索引擎模式）和词性过滤主要面向中文文本；英文走默认分词策略，词性过滤不生效。行业不限——政策文件、问卷回答、财报研报、新闻通稿、学术论文、访谈转录稿、竞品文案都可以，工具本身不做行业判断。如果领域术语较多（比如医学、法律、金融），建议上传自定义字典，帮助分词器把专业词组切对。\u003C\u002Fli>\u003Cli>预处理建议因文本来源而异。政策文件和新闻通稿一般格式规整，可以直接用。网页抓取数据需要先清洗标签和噪声。访谈转录稿建议去掉说话人标记。问卷回答如果包含大量口语化虚词（「觉得」「一个」「比较」），可以上传自定义停用词表过滤，也可以在参数里按词性排除介词、连词、代词等不希望参与统计的词类。多文件对比时，建议每份文件的文本长度和来源类型尽量接近，否则跨文档共有词的参考意义会打折扣。\u003C\u002Fli>\u003C\u002Fol>\u003Cp>\u003Cbr>\u003C\u002Fp>\u003Ch2>使用步骤\u003C\u002Fh2>\u003Cp>第一步：上传文件。你可以上传一个或多个 TXT 或 CSV 文件，系统逐个处理。\u003C\u002Fp>\u003Cp>\u003Cimg src=\"https:\u002F\u002Flatte-api-uploader.oss-cn-chengdu.aliyuncs.com\u002Fanna\u002Fadmin-cms\u002Fdraft\u002F587c6976d232a9deb4a7fd21b5dcf64d.png\" alt=\"\" data-href=\"\" style=\"\"\u002F>\u003C\u002Fp>\u003Cp>\u003Cbr>\u003C\u002Fp>\u003Cp>第二步：配置参数。上传后页面显示参数配置区域。默认只统计单个词；如果要统计固定词组，需要勾选两个词、三个词或四个词组合。你还可以上传自定义字典、自定义停用词，调整分词模式，按词性排除不想参与统计的词类，或在必要时开启智能词汇识别。具体含义在下一节展开。\u003C\u002Fp>\u003Cp>\u003Cimg src=\"https:\u002F\u002Flatte-api-uploader.oss-cn-chengdu.aliyuncs.com\u002Fanna\u002Fadmin-cms\u002Fdraft\u002F426204ea4a0b3bd59d6754cf4642d731.png\" alt=\"\" data-href=\"\" style=\"\"\u002F>\u003C\u002Fp>\u003Cp>\u003Cbr>\u003C\u002Fp>\u003Cp>第三步：查看报告。提交后系统自动处理，完成后跳转到报告页。报告从上到下通常包括：关键发现段落、词云、面积图、Top 20 高频词清单和「核心词 × 长组合」对比表。\u003C\u002Fp>\u003Cp>\u003Cimg src=\"https:\u002F\u002Flatte-api-uploader.oss-cn-chengdu.aliyuncs.com\u002Fanna\u002Fadmin-cms\u002Fdraft\u002F863f586861ceea7b3306ec2c4234389d.png\" alt=\"\" data-href=\"\" style=\"\"\u002F>\u003C\u002Fp>\u003Cp>\u003Cimg src=\"https:\u002F\u002Flatte-api-uploader.oss-cn-chengdu.aliyuncs.com\u002Fanna\u002Fadmin-cms\u002Fdraft\u002F3df5b87c7f86bc6e0bade8f6933594f1.png\" alt=\"\" data-href=\"\" style=\"\"\u002F>\u003C\u002Fp>\u003Cp>\u003Cimg src=\"https:\u002F\u002Flatte-api-uploader.oss-cn-chengdu.aliyuncs.com\u002Fanna\u002Fadmin-cms\u002Fdraft\u002F17282e0c6023ad088466e79419633ebc.png\" alt=\"\" data-href=\"\" style=\"\"\u002F>\u003C\u002Fp>\u003Cp>\u003Cimg src=\"https:\u002F\u002Flatte-api-uploader.oss-cn-chengdu.aliyuncs.com\u002Fanna\u002Fadmin-cms\u002Fdraft\u002F75b80fbb46d03eec4c30028c8420c1a6.png\" alt=\"\" data-href=\"\" style=\"\"\u002F>\u003C\u002Fp>\u003Cp>\u003Cimg src=\"https:\u002F\u002Flatte-api-uploader.oss-cn-chengdu.aliyuncs.com\u002Fanna\u002Fadmin-cms\u002Fdraft\u002F115d710fc8f4475d0d05d22ec746892c.png\" alt=\"\" data-href=\"\" style=\"\"\u002F>\u003C\u002Fp>\u003Cp>\u003Cimg src=\"https:\u002F\u002Flatte-api-uploader.oss-cn-chengdu.aliyuncs.com\u002Fanna\u002Fadmin-cms\u002Fdraft\u002F52cf78a040b116999f62df9c4958dbd9.png\" alt=\"\" data-href=\"\" style=\"\"\u002F>\u003C\u002Fp>\u003Cp>\u003Cimg src=\"https:\u002F\u002Flatte-api-uploader.oss-cn-chengdu.aliyuncs.com\u002Fanna\u002Fadmin-cms\u002Fdraft\u002F4630512979cfe67678a0841c5cab5637.png\" alt=\"\" data-href=\"\" style=\"\"\u002F>\u003C\u002Fp>\u003Cp>\u003Cbr>\u003C\u002Fp>\u003Cp>\u003Cbr>\u003C\u002Fp>\u003Cp>第四步：跨文档对比。如果上传了多个文件，报告会额外展示跨文档共有词和单篇独有词的分布，看出哪些提法贯穿所有材料、哪些只在某一篇里出现。\u003C\u002Fp>\u003Cp>\u003Cimg src=\"https:\u002F\u002Flatte-api-uploader.oss-cn-chengdu.aliyuncs.com\u002Fanna\u002Fadmin-cms\u002Fdraft\u002F88b0bf95ea9544b280eb65d1d5ef95aa.png\" alt=\"\" data-href=\"\" style=\"\"\u002F>\u003C\u002Fp>\u003Cp>\u003Cbr>\u003C\u002Fp>\u003Cp>第五步：下载结果。点击下载拿到 CSV 结果文件，用于保留词项、词组、频次、占比等明细，方便后续复核或二次分析。\u003C\u002Fp>\u003Cp>\u003Cbr>\u003C\u002Fp>\u003Ch2>参数解析与对比示例\u003C\u002Fh2>\u003Ctable style=\"width: auto;\">\u003Ctbody>\u003Ctr>\u003Cth colSpan=\"1\" rowSpan=\"1\" width=\"auto\">参数\u003C\u002Fth>\u003Cth colSpan=\"1\" rowSpan=\"1\" width=\"auto\">说明\u003C\u002Fth>\u003Cth colSpan=\"1\" rowSpan=\"1\" width=\"auto\">默认值\u003C\u002Fth>\u003C\u002Ftr>\u003Ctr>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">自定义字典\u003C\u002Ftd>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">上传 TXT 词典，每行一个词，用于辅助分词识别领域词；最多 1 个文件，大小不超过 0.2MB\u003C\u002Ftd>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">关闭，未上传\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">自定义停用词\u003C\u002Ftd>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">上传 TXT 停用词表，每行一个停用词，统计前自动过滤；最多 1 个文件，大小不超过 0.2MB\u003C\u002Ftd>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">关闭，未上传\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">智能词汇识别\u003C\u002Ftd>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">自动发现语料中的新词，并作为补充分词词典参与处理；只处理前 20,000 字，耗时较长且会额外消耗算力，新词不一定在最终结果中单独呈现\u003C\u002Ftd>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">关闭\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">分词模式\u003C\u002Ftd>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">中文分词方式，可选精确模式、全模式、搜索引擎模式\u003C\u002Ftd>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">精确模式\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">词性过滤\u003C\u002Ftd>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">选中的词性类型会在分词阶段被过滤掉，不参与后续分析；仅支持中文\u003C\u002Ftd>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">关闭\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">统计对象\u003C\u002Ftd>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">选择要统计的高频类型，可勾选单个词、两个词组合、三个词组合、四个词组合\u003C\u002Ftd>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">单个词\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">词组最低频次\u003C\u002Ftd>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">词组至少出现几次才算高频，范围 1-20；只对两个词及以上的组合生效，单个词不受影响\u003C\u002Ftd>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">2\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">完成后发送邮件通知\u003C\u002Ftd>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">任务完成后通过邮件提醒，适合长文本或多文件任务\u003C\u002Ftd>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">关闭\u003C\u002Ftd>\u003C\u002Ftr>\u003C\u002Ftbody>\u003C\u002Ftable>\u003Cp>报告页默认展示 Top 20 清单；如果需要保留更完整的明细，建议下载 CSV 结果文件。\u003C\u002Fp>\u003Cp>\u003Cbr>\u003C\u002Fp>\u003Ch2>三组典型配置供参考。\u003C\u002Fh2>\u003Col>\u003Cli>快速单词统计。保持默认配置，只统计单个词，词组最低频次保持 2。适合初次使用，先看文本里最常出现的词。\u003C\u002Fli>\u003Cli>固定词组盘点。勾选单个词、两个词组合、三个词组合和四个词组合，词组最低频次设为 2。适合政策文本和通稿分析，能看到更多固定词组。结果更多，需要人工筛选。\u003C\u002Fli>\u003Cli>领域术语统计。上传自定义字典，保持精确模式，勾选单个词和两个词以上组合；如果常规分词明显切不开新词，再开启智能词汇识别。适合财报、研报、行业材料等领域词较多的文本。智能词汇识别耗时较长，不建议默认开启。\u003C\u002Fli>\u003C\u002Fol>\u003Cp>统计对象勾选得越多，报告里的词项越丰富，噪声也会增加。词组最低频次设得越高，结果越稳定，但可能漏掉只出现一两次的重要搭配。词性过滤是排除所选词性，不是保留所选词性；通常更适合排除介词、连词、代词等不希望参与统计的词类。\u003C\u002Fp>\u003Cp>\u003Cbr>\u003C\u002Fp>\u003Ch2>案例分析\u003C\u002Fh2>\u003Cp>案例一：政策文本核心提法分析。\u003C\u002Fp>\u003Cp>背景：某研究团队收集了 10 份地方政府工作报告，想了解哪些提法在多份文件中反复出现。\u003C\u002Fp>\u003Cp>配置：勾选单个词、两个词组合、三个词组合和四个词组合，词组最低频次设为 2，分词模式保持精确模式，并上传政策领域常用词作为自定义字典。\u003C\u002Fp>\u003Cp>结果：报告中的 Top 20 清单显示「高质量发展」「营商环境」「乡村振兴」等提法排在前列。跨文档对比表显示，这些词在多份文件中重复出现，属于共同关注点。单篇独有词方面，沿海城市的报告中「自贸区」「跨境电商」更突出，内陆城市的报告中「脱贫」「基础设施」更突出。「核心词 × 长组合」对比表进一步显示，「数字经济」相关组合经常与「转型」「政府」「乡村」等词一起出现。\u003C\u002Fp>\u003Cp>结论：跨文档共有词反映政策共识，单篇独有词反映地方特色。固定词组和「核心词 × 长组合」对比表能帮助你从单个词频继续追到具体表达。\u003C\u002Fp>\u003Cp>\u003Cbr>\u003C\u002Fp>\u003Cp>\u003Cbr>\u003C\u002Fp>\u003Cp>案例二：用户问卷开放题归纳。\u003C\u002Fp>\u003Cp>背景：某产品团队收集了 200 条用户问卷的开放题回答（CSV 格式，每行一条），想快速归纳用户反复提到的主题。\u003C\u002Fp>\u003Cp>配置：CSV 按行上传，勾选单个词、两个词组合和三个词组合，词组最低频次设为 3，上传自定义停用词表过滤「觉得」「一个」「比较」等口语化虚词。\u003C\u002Fp>\u003Cp>结果：高频词清单显示「价格」「售后」「物流」「质量」「包装」排在前列，合计占可统计词频的比例较高。固定词组中，「发货速度」「客服态度」「性价比」反复出现。关键发现段落指出：用户关注点集中在购买体验的三个环节，也就是价格感知、物流时效和售后保障。\u003C\u002Fp>\u003Cp>结论：关键发现段落把散乱的词频数据归纳成了可读的分析结论，但最终分类仍建议结合原始回答抽样复核。\u003C\u002Fp>\u003Cp>\u003Cbr>\u003C\u002Fp>\u003Ch2>类似功能对比\u003C\u002Fh2>\u003Cp>高频词提取和关键词抽取、词性标注都跟\"词\"有关，但做的事情不一样。\u003C\u002Fp>\u003Ctable style=\"width: auto;\">\u003Ctbody>\u003Ctr>\u003Cth colSpan=\"1\" rowSpan=\"1\" width=\"auto\">对比维度\u003C\u002Fth>\u003Cth colSpan=\"1\" rowSpan=\"1\" width=\"auto\">高频词提取\u003C\u002Fth>\u003Cth colSpan=\"1\" rowSpan=\"1\" width=\"auto\">关键词抽取\u003C\u002Fth>\u003Cth colSpan=\"1\" rowSpan=\"1\" width=\"auto\">词性标注\u003C\u002Fth>\u003C\u002Ftr>\u003Ctr>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">做什么\u003C\u002Ftd>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">按出现次数统计最常见的词和词组\u003C\u002Ftd>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">提取更能代表文本主题的词\u003C\u002Ftd>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">给每个词标语法类别\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">关注点\u003C\u002Ftd>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">词的出现频率和固定搭配\u003C\u002Ftd>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">词的重要程度和代表性\u003C\u002Ftd>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">语法结构和词性分布\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">考虑上下文\u003C\u002Ftd>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">否（主要按出现频次统计）\u003C\u002Ftd>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">是（综合词的代表性和共现关系）\u003C\u002Ftd>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">否（只关注词性）\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">词组支持\u003C\u002Ftd>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">是（可勾选 2-gram 到 4-gram）\u003C\u002Ftd>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">以关键词为主，具体以工具页面配置为准\u003C\u002Ftd>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">否\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">输出\u003C\u002Ftd>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">词频表 + 词组表 + 关键发现 + 核心词 × 长组合对比\u003C\u002Ftd>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">关键词列表 + 权重排序\u003C\u002Ftd>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">词性分布 + 转移矩阵\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">典型场景\u003C\u002Ftd>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">词频统计、语料概览、提法盘点\u003C\u002Ftd>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">主题分析、标签生成、SEO\u003C\u002Ftd>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">语法研究、风格分析\u003C\u002Ftd>\u003C\u002Ftr>\u003C\u002Ftbody>\u003C\u002Ftable>\u003Cp>高频词提取主要看出现次数，「的」「了」「是」这类虚词如果没过滤掉，可能会排在很靠前的位置。关键词抽取会综合代表性和共现关系，结果更接近文本主题。两者可以配合使用：先用高频词提取做初步摸底，再用关键词抽取做深度分析。\u003C\u002Fp>\u003Cp>\u003Cbr>\u003C\u002Fp>","admin_cms","zh-cn",0,"guide",[14],"文本分析基础教程",[16],"https:\u002F\u002Flatte-api-uploader.oss-cn-chengdu.aliyuncs.com\u002Fanna\u002Fadmin-cms\u002Fdraft\u002Fcover\u002F4a58ea32ddd52f888d77aef4992a153e.png","gao-pin-ci-ti-qu-gong-ju-shi-yong-jiao-cheng-tong-ji-ci-pin-he-gu-ding-ci-zu-zhao-chu-wen-ben-zhong-fan-fu-qiang-tiao-de-he-xin-ti-fa","写报告、做分析的时候，你可能想知道一篇文章里哪些词被反复提到、哪些说法经常连在一起出现。靠人工通读很难精确量化，靠AI读也不行——容易有幻觉，遗漏或编造根本不存在的提法。高频词提取解决的就是这个问题：统计单个词的出现次数，也可以在你勾选两个词、三个词、四个词组合后，统计相邻词组成的固定词组。报告会自动给出关键发现，配上词云、面积图、Top 20 清单和「核心词 × 长组合」对比表；多文件时还会展示跨文档共有词和单篇独有词。","high-frequency-words",[21,26,31,36],{"taskType":22,"name":23,"shortDesp":24,"_id":25},"extract-keywords","关键词抽取","提取文本核心关键词,TF-IDF 看稀有度、TextRank 看关联强度，交叉对比看清文本核心语义。","6a27de380d824b2ecc5e90bd",{"taskType":27,"name":28,"shortDesp":29,"_id":30},"deep-keyword","DeepKeyword 深度学习模型关键词发现","用语义模型从完整文章中抽取关键词，综合得分、频次和位置排序，适合单篇长文分析。","6a27de380d824b2ecc5e90be",{"taskType":32,"name":33,"shortDesp":34,"_id":35},"keyword-hit-stats","KWIC关键词命中矩阵","把同义词合并成概念组，统计每个主题在哪些文档里被密集讨论——和 KWIC 互补，看的是「分布」而非「用法」。","6a27de380d824b2ecc5e90bf",{"taskType":37,"name":38,"shortDesp":39,"_id":40},"keyness-analysis","语料对比关键词分析","用 keyness 关键性统计对比两组语料，找出目标里反复强调的特征词与相对回避的话题。","6a27de380d824b2ecc5e90c0",true,"2026-06-09T09:34:48.273Z"]