聚类首先把每条文本转换为可比较的数值表示,再根据相似程度分组。短文本方式更关注词语权重,适合评论、开放题和较短反馈;长文本方式会形成句子级表示,适合上下文更完整的段落。两种方式最终都把相近文本归入同一簇。
每个簇的关键词来自该组文本中更有代表性的词语,用来帮助用户概括主题。系统还会选择离簇中心较近的代表性文本,并保留最多三条示例。关键词只是命名线索,不等同于已经确定的主题名称。
自动分类数会在可用范围内比较不同分法的轮廓系数,并选择得分较高的一项。手动分类数界面允许 1 到 40,但实际至少为 2,并且不能超过有效文本数量减 1。分类数过大时,容易出现只有一条文本的小组。
预处理会影响文本之间的相似关系。自定义字典可以保留业务词,停用词和词性过滤可以减少无关特征,分词模式会改变词语边界。完全重复文本还可以先移除,避免某一条重复内容对聚类中心产生过大影响。
适用文档
用户反馈、评论和问卷开放题适合使用短文本方式。每条内容最好表达一个相对完整的问题或观点。只有“很好”“不行”这类极短表达时,向量区分度通常不足,分组结果容易受个别词影响。
访谈片段和较长段落可以使用长文本方式。材料应按语义片段拆分,每条不宜同时包含多个无关议题。若一条文本同时讨论价格、物流和售后,它可能落入任何一个相关簇,增加主题边界的模糊程度。
样本量会影响质量指标。报告方法说明提示,少于约 50 条时,轮廓系数和类间相似度容易波动。小样本仍可用于演示和初步探索,但不宜把一次聚类结果直接当作稳定分类体系。
专有名词较多的材料可以补充自定义字典。若常见套话占据关键词,可使用停用词或词性过滤。预处理调整后应重新运行,并比较关键词、示例句和三项指标是否同时改善。
使用步骤
第一步:整理分析单位。让每条文本围绕一个相对明确的观点或问题,删除空白内容;完全重复内容较多时开启重复文本移除。
第二步:选择短文本或长文本方式。评论、开放题和短反馈优先使用短文本方式;较完整的段落或长反馈使用长文本方式。

第三步:决定分类数。不确定主题数量时先开启自动选择;已有编码框架时手动设置,但分类数应明显小于有效文本数量。
第四步:调整预处理。按需使用自定义字典、停用词、智能词汇识别、分词模式和词性过滤。每次只改一个主要设置,便于判断差异来自哪里。
第五步:先看聚类概览和三类质量指标。确认实际分类数和有效状态,再按“轮廓系数越高、戴维斯-布尔丁指数越低、卡林斯基-哈拉巴斯指数越高”的方向综合判断。

第六步:查看规模、散点、热力图和逐簇详情。找出超大组、单条组和相似度过高的簇,最后展开关键词、示例文本和代表性片段确认主题是否一致。





参数解析与对比示例
工具页提供的主要配置如下。
| 参数 | 说明 | 默认值 |
|---|---|---|
| 自动选择分类数 | 比较候选分类数的轮廓系数并选择较高者 | 关闭 |
| 手动分类数 | 界面范围 1 到 40;实际至少 2,且不超过有效文本数减 1 | 5 |
| 文本聚类方式 | 在短文本方式和长文本方式之间选择 | 短文本方式 |
| 移除重复文本 | 完全相同的文本只保留一次 | 关闭 |
| 自定义字典 | 在分词时保留业务词语 | 关闭 |
| 自定义停用词 | 在向量形成前过滤指定词语 | 关闭 |
| 智能词汇识别 | 把识别到的新词补充到分词阶段,不保证单独出现在结果中 | 关闭 |
| 分词模式 | 精确、全量或搜索式三种词语边界 | 精确模式 |
| 词性过滤 | 过滤选择的词性,不参与后续聚类 | 关闭 |
| 完成后发送邮件通知 | 任务结束后发送提醒,不改变聚类结果 | 关闭 |
配置一:未知主题数量。开启自动选择分类数,使用短文本方式,其他预处理保持默认。适合先建立基线,再根据关键词和代表文本判断主题是否可读。
配置二:已有三类业务框架。关闭自动选择,把手动分类数设为 3。适合明确要对照产品、物流、客服等既有口径的材料。
配置三:重复和套话较多。开启重复文本移除,补充停用词;如果专有名词被拆开,再加入自定义字典。预处理目标是改善文本表示,不是追求某一个指标单独变好。
案例分析
案例一:固定三类的用户反馈。
背景:准备 18 条反馈,电池续航、物流配送和客服售后各 6 条。每条只围绕一个主要议题,并采用相同分词预处理。
配置:短文本方式,关闭自动选择,手动分类数设为 3,不移除重复文本。
结果:实际得到 6 / 6 / 6 三组。三组关键词分别以“续航、电池、充电”“物流、快递、包裹”“客服、售后、处理”为主。轮廓系数为 0.0858,戴维斯-布尔丁指数为 2.1567,卡林斯基-哈拉巴斯指数为 2.2151。
结论:关键词和规模符合预设的三类结构,但轮廓系数仍低,不能因为分组数量整齐就判定质量良好。18 条样本只适合演示报告读法,仍需查看代表文本。
案例二:自动选择与过度分组对比。
背景:使用同一批 18 条反馈,比较自动选择和手动设为 5 类的差异。
配置:第一次开启自动选择,候选范围为 2 到 5 类;第二次关闭自动选择并手动设为 5 类。
结果:自动比较时,2、3、4、5 类的轮廓系数依次为 0.0576、0.0858、0.0694、-0.0031,最终选择 3 类。手动设为 5 类后,规模变为 6 / 7 / 1 / 3 / 1,轮廓系数为 0.0558,卡林斯基-哈拉巴斯指数降为 1.6332,同时出现两个单条小组。
结论:增加分类数没有带来更清晰的结构,反而把少数文本拆成孤立小组。自动结果仍要与业务预期对照,但可作为手动分类数的起点。
