[{"data":1,"prerenderedAt":-1},["ShallowReactive",2],{"cms-guide-article:jian-dan-wen-ben-ju-lei-jiao-cheng-cong-zi-dong-fen-zu-dao-zhu-ti-fu-he":3},{"article":4},{"id":5,"userId":6,"title":7,"content":8,"type":9,"lang":10,"index":11,"category":12,"tags":13,"coverImages":15,"slug":17,"summary":18,"associatedTaskType":19,"nextSteps":20,"isPublic":41,"createdAt":42,"updatedAt":42},"6a69506aa1f11b798e40fb99","6804358a59ddd2c7c898172e","简单文本聚类教程：从自动分组到主题复核","\u003Cp>聚类首先把每条文本转换为可比较的数值表示，再根据相似程度分组。短文本方式更关注词语权重，适合评论、开放题和较短反馈；长文本方式会形成句子级表示，适合上下文更完整的段落。两种方式最终都把相近文本归入同一簇。\u003C\u002Fp>\u003Cp>每个簇的关键词来自该组文本中更有代表性的词语，用来帮助用户概括主题。系统还会选择离簇中心较近的代表性文本，并保留最多三条示例。关键词只是命名线索，不等同于已经确定的主题名称。\u003C\u002Fp>\u003Cp>自动分类数会在可用范围内比较不同分法的轮廓系数，并选择得分较高的一项。手动分类数界面允许 1 到 40，但实际至少为 2，并且不能超过有效文本数量减 1。分类数过大时，容易出现只有一条文本的小组。\u003C\u002Fp>\u003Cp>预处理会影响文本之间的相似关系。自定义字典可以保留业务词，停用词和词性过滤可以减少无关特征，分词模式会改变词语边界。完全重复文本还可以先移除，避免某一条重复内容对聚类中心产生过大影响。\u003C\u002Fp>\u003Ch2>适用文档\u003C\u002Fh2>\u003Cp>用户反馈、评论和问卷开放题适合使用短文本方式。每条内容最好表达一个相对完整的问题或观点。只有“很好”“不行”这类极短表达时，向量区分度通常不足，分组结果容易受个别词影响。\u003C\u002Fp>\u003Cp>访谈片段和较长段落可以使用长文本方式。材料应按语义片段拆分，每条不宜同时包含多个无关议题。若一条文本同时讨论价格、物流和售后，它可能落入任何一个相关簇，增加主题边界的模糊程度。\u003C\u002Fp>\u003Cp>样本量会影响质量指标。报告方法说明提示，少于约 50 条时，轮廓系数和类间相似度容易波动。小样本仍可用于演示和初步探索，但不宜把一次聚类结果直接当作稳定分类体系。\u003C\u002Fp>\u003Cp>专有名词较多的材料可以补充自定义字典。若常见套话占据关键词，可使用停用词或词性过滤。预处理调整后应重新运行，并比较关键词、示例句和三项指标是否同时改善。\u003C\u002Fp>\u003Ch2>使用步骤\u003C\u002Fh2>\u003Cp>第一步：整理分析单位。让每条文本围绕一个相对明确的观点或问题，删除空白内容；完全重复内容较多时开启重复文本移除。\u003C\u002Fp>\u003Cp>第二步：选择短文本或长文本方式。评论、开放题和短反馈优先使用短文本方式；较完整的段落或长反馈使用长文本方式。\u003C\u002Fp>\u003Cp>\u003Cimg src=\"https:\u002F\u002Flatte-api-uploader.oss-cn-chengdu.aliyuncs.com\u002Fanna\u002Fadmin-cms\u002Fdraft\u002F25a546ffcdd13eb41063ce8d36cf09b6.png\" alt=\"\" data-href=\"\" style=\"\"\u002F>\u003C\u002Fp>\u003Cp>\u003Cbr>\u003C\u002Fp>\u003Cp>第三步：决定分类数。不确定主题数量时先开启自动选择；已有编码框架时手动设置，但分类数应明显小于有效文本数量。\u003C\u002Fp>\u003Cp>第四步：调整预处理。按需使用自定义字典、停用词、智能词汇识别、分词模式和词性过滤。每次只改一个主要设置，便于判断差异来自哪里。\u003C\u002Fp>\u003Cp>第五步：先看聚类概览和三类质量指标。确认实际分类数和有效状态，再按“轮廓系数越高、戴维斯-布尔丁指数越低、卡林斯基-哈拉巴斯指数越高”的方向综合判断。\u003C\u002Fp>\u003Cp>\u003Cimg src=\"https:\u002F\u002Flatte-api-uploader.oss-cn-chengdu.aliyuncs.com\u002Fanna\u002Fadmin-cms\u002Fdraft\u002Fa419cc3a9ab6d622ae4b1c642afff362.png\" alt=\"\" data-href=\"\" style=\"\"\u002F>\u003C\u002Fp>\u003Cp>\u003Cbr>\u003C\u002Fp>\u003Cp>第六步：查看规模、散点、热力图和逐簇详情。找出超大组、单条组和相似度过高的簇，最后展开关键词、示例文本和代表性片段确认主题是否一致。\u003C\u002Fp>\u003Cp>\u003Cimg src=\"https:\u002F\u002Flatte-api-uploader.oss-cn-chengdu.aliyuncs.com\u002Fanna\u002Fadmin-cms\u002Fdraft\u002Fc3ebf7ff6313be39bea56ce064ee55c1.png\" alt=\"\" data-href=\"\" style=\"\"\u002F>\u003C\u002Fp>\u003Cp>\u003Cimg src=\"https:\u002F\u002Flatte-api-uploader.oss-cn-chengdu.aliyuncs.com\u002Fanna\u002Fadmin-cms\u002Fdraft\u002F88334217407a0026e76239603b787cab.png\" alt=\"\" data-href=\"\" style=\"\"\u002F>\u003C\u002Fp>\u003Cp>\u003Cimg src=\"https:\u002F\u002Flatte-api-uploader.oss-cn-chengdu.aliyuncs.com\u002Fanna\u002Fadmin-cms\u002Fdraft\u002Ffbd455f63af32a6e8c0e5010cfc648be.png\" alt=\"\" data-href=\"\" style=\"\"\u002F>\u003C\u002Fp>\u003Cp>\u003Cimg src=\"https:\u002F\u002Flatte-api-uploader.oss-cn-chengdu.aliyuncs.com\u002Fanna\u002Fadmin-cms\u002Fdraft\u002Fecec4ad1be2cdbd1d2a04b8e6bfa8bf7.png\" alt=\"\" data-href=\"\" style=\"\"\u002F>\u003C\u002Fp>\u003Cp>\u003Cimg src=\"https:\u002F\u002Flatte-api-uploader.oss-cn-chengdu.aliyuncs.com\u002Fanna\u002Fadmin-cms\u002Fdraft\u002Fcb0cd293a4ee1960e507ea1f80b71859.png\" alt=\"\" data-href=\"\" style=\"\"\u002F>\u003C\u002Fp>\u003Ch2>\u003C\u002Fh2>\u003Ch2>参数解析与对比示例\u003C\u002Fh2>\u003Cp>工具页提供的主要配置如下。\u003C\u002Fp>\u003Ctable style=\"width: auto;\">\u003Ctbody>\u003Ctr>\u003Cth colSpan=\"1\" rowSpan=\"1\" width=\"auto\">参数\u003C\u002Fth>\u003Cth colSpan=\"1\" rowSpan=\"1\" width=\"auto\">说明\u003C\u002Fth>\u003Cth colSpan=\"1\" rowSpan=\"1\" width=\"auto\">默认值\u003C\u002Fth>\u003C\u002Ftr>\u003Ctr>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">自动选择分类数\u003C\u002Ftd>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">比较候选分类数的轮廓系数并选择较高者\u003C\u002Ftd>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">关闭\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">手动分类数\u003C\u002Ftd>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">界面范围 1 到 40；实际至少 2，且不超过有效文本数减 1\u003C\u002Ftd>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">5\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">文本聚类方式\u003C\u002Ftd>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">在短文本方式和长文本方式之间选择\u003C\u002Ftd>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">短文本方式\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">移除重复文本\u003C\u002Ftd>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">完全相同的文本只保留一次\u003C\u002Ftd>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">关闭\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">自定义字典\u003C\u002Ftd>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">在分词时保留业务词语\u003C\u002Ftd>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">关闭\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">自定义停用词\u003C\u002Ftd>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">在向量形成前过滤指定词语\u003C\u002Ftd>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">关闭\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">智能词汇识别\u003C\u002Ftd>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">把识别到的新词补充到分词阶段，不保证单独出现在结果中\u003C\u002Ftd>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">关闭\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">分词模式\u003C\u002Ftd>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">精确、全量或搜索式三种词语边界\u003C\u002Ftd>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">精确模式\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">词性过滤\u003C\u002Ftd>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">过滤选择的词性，不参与后续聚类\u003C\u002Ftd>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">关闭\u003C\u002Ftd>\u003C\u002Ftr>\u003Ctr>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">完成后发送邮件通知\u003C\u002Ftd>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">任务结束后发送提醒，不改变聚类结果\u003C\u002Ftd>\u003Ctd colSpan=\"1\" rowSpan=\"1\" width=\"auto\">关闭\u003C\u002Ftd>\u003C\u002Ftr>\u003C\u002Ftbody>\u003C\u002Ftable>\u003Cp>配置一：未知主题数量。开启自动选择分类数，使用短文本方式，其他预处理保持默认。适合先建立基线，再根据关键词和代表文本判断主题是否可读。\u003C\u002Fp>\u003Cp>配置二：已有三类业务框架。关闭自动选择，把手动分类数设为 3。适合明确要对照产品、物流、客服等既有口径的材料。\u003C\u002Fp>\u003Cp>配置三：重复和套话较多。开启重复文本移除，补充停用词；如果专有名词被拆开，再加入自定义字典。预处理目标是改善文本表示，不是追求某一个指标单独变好。\u003C\u002Fp>\u003Ch2>案例分析\u003C\u002Fh2>\u003Cp>案例一：固定三类的用户反馈。\u003C\u002Fp>\u003Cp>背景：准备 18 条反馈，电池续航、物流配送和客服售后各 6 条。每条只围绕一个主要议题，并采用相同分词预处理。\u003C\u002Fp>\u003Cp>配置：短文本方式，关闭自动选择，手动分类数设为 3，不移除重复文本。\u003C\u002Fp>\u003Cp>结果：实际得到 6 \u002F 6 \u002F 6 三组。三组关键词分别以“续航、电池、充电”“物流、快递、包裹”“客服、售后、处理”为主。轮廓系数为 0.0858，戴维斯-布尔丁指数为 2.1567，卡林斯基-哈拉巴斯指数为 2.2151。\u003C\u002Fp>\u003Cp>结论：关键词和规模符合预设的三类结构，但轮廓系数仍低，不能因为分组数量整齐就判定质量良好。18 条样本只适合演示报告读法，仍需查看代表文本。\u003C\u002Fp>\u003Cp>案例二：自动选择与过度分组对比。\u003C\u002Fp>\u003Cp>背景：使用同一批 18 条反馈，比较自动选择和手动设为 5 类的差异。\u003C\u002Fp>\u003Cp>配置：第一次开启自动选择，候选范围为 2 到 5 类；第二次关闭自动选择并手动设为 5 类。\u003C\u002Fp>\u003Cp>结果：自动比较时，2、3、4、5 类的轮廓系数依次为 0.0576、0.0858、0.0694、-0.0031，最终选择 3 类。手动设为 5 类后，规模变为 6 \u002F 7 \u002F 1 \u002F 3 \u002F 1，轮廓系数为 0.0558，卡林斯基-哈拉巴斯指数降为 1.6332，同时出现两个单条小组。\u003C\u002Fp>\u003Cp>结论：增加分类数没有带来更清晰的结构，反而把少数文本拆成孤立小组。自动结果仍要与业务预期对照，但可作为手动分类数的起点。\u003C\u002Fp>\u003Cp>\u003Cbr>\u003C\u002Fp>","admin_cms","zh-cn",0,"guide",[14],"文本分析基础教程",[16],"https:\u002F\u002Flatte-api-uploader.oss-cn-chengdu.aliyuncs.com\u002Fanna\u002Fadmin-cms\u002Fdraft\u002Fcover\u002F846f62781715ec85dd178ee82301c403.png","jian-dan-wen-ben-ju-lei-jiao-cheng-cong-zi-dong-fen-zu-dao-zhu-ti-fu-he","简单文本聚类把内容相近的文本归到同一主题簇，用于在人工编码前快速观察材料结构。用户可以手动指定分类数，也可以让系统比较多个候选分类数后自动选择。报告不仅给出每条文本的分组，还提供三类质量指标、类别规模、二维投影、类间相似度、关键词、示例句和代表性片段。下面结合参数和实测数据说明如何阅读结果。","simple-cluster",[21,26,31,36],{"taskType":22,"name":23,"shortDesp":24,"_id":25},"lda","LDA 主题模型","从文本中发现若干主题，展示主题词、文档分布及主题之间的关系。","6a69506aa1f11b798e40fb9a",{"taskType":27,"name":28,"shortDesp":29,"_id":30},"bertopic","BERTopic 主题聚类","基于语义聚类重建文本主题结构，自动生成抽象标签并解析主题间距离与层级关系。","6a69506aa1f11b798e40fb9b",{"taskType":32,"name":33,"shortDesp":34,"_id":35},"deep-senti-v3","高级情感分析","逐句解释文本为何偏正负面，给出证据词和推理逻辑。","6a69506aa1f11b798e40fb9c",{"taskType":37,"name":38,"shortDesp":39,"_id":40},"high-frequency-words","高频词提取","统计词频和固定词组，包括 2–4 个词组成的搭配，自动归纳焦点说法与多篇间的共性。","6a69506aa1f11b798e40fb9d",true,"2026-07-29T00:59:22.556Z"]