[{"data":1,"prerenderedAt":-1},["ShallowReactive",2],{"cms-guide-article:deepkeyword-guan-jian-ci-fa-xian-jiao-cheng-yong-zong-he-pai-xu-shai-xuan-he-xin-duan-yu":3},{"article":4},{"id":5,"userId":6,"title":7,"content":8,"type":9,"lang":10,"index":11,"category":12,"tags":13,"coverImages":15,"slug":17,"summary":18,"associatedTaskType":19,"nextSteps":20,"isPublic":36,"createdAt":37,"updatedAt":37},"6a694f81a1f11b798e40fa07","6804358a59ddd2c7c898172e","DeepKeyword关键词发现教程：用综合排序筛选核心短语","\u003Cp>这个功能处理的是完整文章，而不是把每一行孤立分析。长文会优先按句子组织成多个语义窗口，每个窗口分别提取候选，最后把重复短语合并排序。用户设置的窗口长度最高为 500 字符，较大的窗口能保留更多上下文，较小的窗口适合观察局部主题。\u003C\u002Fp>\u003Cp>综合得分来自多项信号。候选来源带有不同权重；短语在原文中的实际出现次数、被多少条证据支持、能否定位以及是否较早出现都会影响排序；短语长度只提供有限加分。得分用于同一批材料内比较先后，不是固定在 0 到 1 的概率。可信度才限制在 0 到 1，两项指标应分开阅读。\u003C\u002Fp>\u003Cp>系统会过滤空片段、纯符号、部分泛化词和超过长度上限的候选。低于“最小文本长度”的内容不会直接跳过，而是继续尝试提取，并在明细中记录依据偏弱提示。超过处理字符数或窗口数限制的长文可能被截取，报告会保留警告。\u003C\u002Fp>\u003Ch2>适用文档\u003C\u002Fh2>\u003Cp>主题相对集中的长篇文章适合使用。研究综述、政策报告和专题文章通常包含重复概念、专有短语与上下位表达，综合排序可以先缩小候选范围，再由人工确认正式术语。\u003C\u002Fp>\u003Cp>用户访谈和需求分析材料也适合使用。像“电池续航”“快充速度”“售后响应”这类表达可能在不同段落反复出现，词云能够显示重复程度，专业排行则结合更多证据判断排序位置。\u003C\u002Fp>\u003Cp>内容过短时，候选依据通常不足。虽然工具仍会提取并给出提示，但一两句话更适合先与同主题材料合并。文本主题过多时，建议先按章节拆分，否则同一份报告中的高分短语可能来自彼此无关的议题。\u003C\u002Fp>\u003Cp>正式命名、政策术语和研究概念仍要回到原文核对。部分候选虽然有综合得分和原文次数，却未必有可用的起止位置；详情中的位置出现无效值时，应以原文命中和具体语境为准。\u003C\u002Fp>\u003Ch2>使用步骤\u003C\u002Fh2>\u003Cp>第一步：确定分析单位。每次材料尽量保持一篇完整文章或一个主题明确的章节，不把互不相关的内容拼在同一份分析里。\u003C\u002Fp>\u003Cp>\u003Cbr>\u003C\u002Fp>\u003Cp>\u003Cbr>\u003C\u002Fp>\u003Cp>第二步：设置单个语义窗口长度。默认 500 字符，范围为 200 到 500。长文需要保留较多上下文时使用较大窗口；希望提高局部主题敏感度时可适当调低。\u003C\u002Fp>\u003Cp>\u003Cimg src=\"https:\u002F\u002Flatte-api-uploader.oss-cn-chengdu.aliyuncs.com\u002Fanna\u002Fadmin-cms\u002Fdraft\u002F041083c2e3774a88d32f6974add59d81.png\" alt=\"\" data-href=\"\" style=\"\"\u002F>\u003C\u002Fp>\u003Cp>\u003Cbr>\u003C\u002Fp>\u003Cp>第三步：设置候选数量与最短长度。最大关键词数量默认 30，范围为 10 到 100；最小关键词长度默认 1，范围为 1 到 5。短片段较多时先提高最短长度，候选仍过多时再降低数量上限。\u003C\u002Fp>\u003Cp>\u003Cbr>\u003C\u002Fp>\u003Cp>第四步：设置最小文本长度。默认 10，范围为 5 到 50。它是提示阈值，不是硬性过滤线；低于阈值的内容仍会尽量分析，但明细会标记依据偏弱。\u003C\u002Fp>\u003Cp>\u003Cbr>\u003C\u002Fp>\u003Cp>第五步：先读结果解读、词云和专业排行。结果解读说明处理数量和命中概况；词云按原文次数显示大小；专业排行按综合得分展示短语、次数和排序。\u003C\u002Fp>\u003Cp>\u003Cimg src=\"https:\u002F\u002Flatte-api-uploader.oss-cn-chengdu.aliyuncs.com\u002Fanna\u002Fadmin-cms\u002Fdraft\u002F88acb8e1c2fad9f990017ab55b6d7072.png\" alt=\"\" data-href=\"\" style=\"\"\u002F>\u003C\u002Fp>\u003Cp>\u003Cbr>\u003C\u002Fp>\u003Cp>第六步：到数据总览和关键词详情复核。重点查看综合得分、原文次数、覆盖、可信度、位置、类型和处理提示。详情每页显示 10 条，可翻页检查尾部候选。\u003C\u002Fp>\u003Cp>\u003Cbr>\u003C\u002Fp>\u003Ch2>\u003C\u002Fh2>\u003Ch2>参数解析与对比示例\u003C\u002Fh2>\u003Cp>工具页可配置参数如下。\u003C\u002Fp>\u003Ctable style=\"width: auto;\">\u003Ctbody>\u003Ctr>\u003Cth colSpan=\"1\" rowSpan=\"1\" width=\"auto\">参数\u003C\u002Fth>\u003Cth colSpan=\"1\" rowSpan=\"1\" width=\"auto\">说明\u003C\u002Fth>\u003Cth colSpan=\"1\" rowSpan=\"1\" width=\"auto\">默认值\u003C\u002Fth>\u003C\u002Ftr>\u003Ctr>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">单个语义窗口长度\u003C\u002Ftd>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">控制每个长文窗口包含的字符数，范围 200 到 500\u003C\u002Ftd>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">500\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">最大关键词数量\u003C\u002Ftd>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">控制每篇最多保留多少个候选，范围 10 到 100\u003C\u002Ftd>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">30\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">最小关键词长度\u003C\u002Ftd>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">过滤过短片段，范围 1 到 5\u003C\u002Ftd>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">1\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">最小文本长度\u003C\u002Ftd>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">低于阈值时继续提取但记录提示，范围 5 到 50\u003C\u002Ftd>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">10\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">完成后发送邮件通知\u003C\u002Ftd>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">任务结束后发送提醒，不改变分析结果\u003C\u002Ftd>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">关闭\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">邮件地址\u003C\u002Ftd>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">开启通知后填写接收地址\u003C\u002Ftd>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">空\u003C\u002Ftd>\u003C\u002Ftr>\u003C\u002Ftbody>\u003C\u002Ftable>\u003Cp>配置一：快速主题概览。窗口设为 500，最大关键词数量设为 10，最小关键词长度设为 2，最小文本长度保持 10。结果数量较少，适合先检查最核心的候选。\u003C\u002Fp>\u003Cp>配置二：默认分析。窗口 500、最大数量 30、最短关键词 1、最小文本 10。它保留更多候选，适合第一次了解材料，但单字或过短片段也可能进入结果。\u003C\u002Fp>\u003Cp>配置三：减少短片段。窗口保持 500，把最小关键词长度提高到 3，最大数量设为 10。它会收紧候选边界，适合默认结果里短片段偏多的材料。\u003C\u002Fp>\u003Cp>做参数对比时应保持原文不变，每次只调整一个主要参数。窗口长度主要影响上下文分段，最大数量影响保留规模，最短关键词长度影响候选边界，最小文本长度只改变提示阈值。\u003C\u002Fp>\u003Ch2>案例分析\u003C\u002Fh2>\u003Cp>案例一：公共数据政策段落。\u003C\u002Fp>\u003Cp>背景：样本文本讨论城市公共数据授权运营、数据安全审查、个人信息保护、收益分配和监督机制。\u003C\u002Fp>\u003Cp>配置：语义窗口 500，最大关键词数量 10，最小关键词长度 2，最小文本长度 10。\u003C\u002Fp>\u003Cp>结果：实际运行保留 10 个候选。综合得分前三项为“数据安全审查个人信息保护”46.1 分、“社会公开授权运营情况”46.0 分、“城市公共数据”45.0 分。三项在原文中的计数均为 1，说明排序不只由重复次数决定。\u003C\u002Fp>\u003Cp>结论：专业排行适合先定位政策概念候选，但较长的组合短语仍需回到原文判断是否应拆分成正式术语。综合得分用于这份材料内部排序，不应用作跨文章质量分数。\u003C\u002Fp>\u003Cp>案例二：用户访谈议题。\u003C\u002Fp>\u003Cp>背景：样本文本讨论电池续航、低温环境、快充速度、充电时间、售后响应、工单周期和配件到货时间。\u003C\u002Fp>\u003Cp>配置：第一次采用默认窗口 500、最大数量 30、最短关键词 1、最小文本 10；第二次把最大数量调到 10、最短关键词调到 3，其余不变。\u003C\u002Fp>\u003Cp>结果：第一次实际得到 11 个候选，“售后响应”和“快充速度”均在原文出现 2 次，综合得分均为 47.8。第二次结果收紧为 9 个，短片段被过滤，两项主要议题仍保留在前列。\u003C\u002Fp>\u003Cp>结论：提高最短关键词长度能够减少短片段，降低数量上限可以压缩复核范围。参数调整并不会替代人工判断，最终标签仍要结合访谈问题和上下文确定。\u003C\u002Fp>\u003Cp>\u003Cbr>\u003C\u002Fp>","admin_cms","zh-cn",0,"guide",[14],"文本分析基础教程",[16],"https:\u002F\u002Flatte-api-uploader.oss-cn-chengdu.aliyuncs.com\u002Fanna\u002Fadmin-cms\u002Fdraft\u002Fcover\u002F14ab3183e16506d6b67359f831f6f638.png","deepkeyword-guan-jian-ci-fa-xian-jiao-cheng-yong-zong-he-pai-xu-shai-xuan-he-xin-duan-yu","DeepKeyword关键词发现面向完整文章提取关键短语。它不把词频直接当作重要性，而是综合候选来源、原文命中次数、覆盖、出现位置和短语长度进行排序。报告同时保留综合得分、0 到 1 的可信度、原文次数和明细信息，方便从高分候选继续回到原文复核。本教程说明四项分析参数、报告阅读顺序和两组实际运行案例。","deep-keyword",[21,26,31],{"taskType":22,"name":23,"shortDesp":24,"_id":25},"kwic-concordance","KWIC关键词上下文索引","列出每个关键词在原文里的左右上下文，纵向对齐看它的用法、搭配与出现位置。","6a694f81a1f11b798e40fa08",{"taskType":27,"name":28,"shortDesp":29,"_id":30},"term-extraction","领域术语抽取","从一批专业文档里自动挑出该领域反复使用的多字术语。","6a694f81a1f11b798e40fa09",{"taskType":32,"name":33,"shortDesp":34,"_id":35},"word-co-occurrence","词语共现分析","找出文本里经常成对出现的词，并用多项统计指标判断这种搭配是否真的稳定。","6a694f81a1f11b798e40fa0a",true,"2026-07-29T00:55:29.612Z"]