聚类首先把每条文本转换为可比较的数值表示,再根据相似程度分组。短文本方式更关注词语权重,适合评论、开放题和较短反馈;长文本方式会形成句子级表示,适合上下文更完整的段落。两种方式最终都把相近文本归入同一簇。

每个簇的关键词来自该组文本中更有代表性的词语,用来帮助用户概括主题。系统还会选择离簇中心较近的代表性文本,并保留最多三条示例。关键词只是命名线索,不等同于已经确定的主题名称。

自动分类数会在可用范围内比较不同分法的轮廓系数,并选择得分较高的一项。手动分类数界面允许 1 到 40,但实际至少为 2,并且不能超过有效文本数量减 1。分类数过大时,容易出现只有一条文本的小组。

预处理会影响文本之间的相似关系。自定义字典可以保留业务词,停用词和词性过滤可以减少无关特征,分词模式会改变词语边界。完全重复文本还可以先移除,避免某一条重复内容对聚类中心产生过大影响。

适用文档

用户反馈、评论和问卷开放题适合使用短文本方式。每条内容最好表达一个相对完整的问题或观点。只有“很好”“不行”这类极短表达时,向量区分度通常不足,分组结果容易受个别词影响。

访谈片段和较长段落可以使用长文本方式。材料应按语义片段拆分,每条不宜同时包含多个无关议题。若一条文本同时讨论价格、物流和售后,它可能落入任何一个相关簇,增加主题边界的模糊程度。

样本量会影响质量指标。报告方法说明提示,少于约 50 条时,轮廓系数和类间相似度容易波动。小样本仍可用于演示和初步探索,但不宜把一次聚类结果直接当作稳定分类体系。

专有名词较多的材料可以补充自定义字典。若常见套话占据关键词,可使用停用词或词性过滤。预处理调整后应重新运行,并比较关键词、示例句和三项指标是否同时改善。

使用步骤

第一步:整理分析单位。让每条文本围绕一个相对明确的观点或问题,删除空白内容;完全重复内容较多时开启重复文本移除。

第二步:选择短文本或长文本方式。评论、开放题和短反馈优先使用短文本方式;较完整的段落或长反馈使用长文本方式。


第三步:决定分类数。不确定主题数量时先开启自动选择;已有编码框架时手动设置,但分类数应明显小于有效文本数量。

第四步:调整预处理。按需使用自定义字典、停用词、智能词汇识别、分词模式和词性过滤。每次只改一个主要设置,便于判断差异来自哪里。

第五步:先看聚类概览和三类质量指标。确认实际分类数和有效状态,再按“轮廓系数越高、戴维斯-布尔丁指数越低、卡林斯基-哈拉巴斯指数越高”的方向综合判断。


第六步:查看规模、散点、热力图和逐簇详情。找出超大组、单条组和相似度过高的簇,最后展开关键词、示例文本和代表性片段确认主题是否一致。

参数解析与对比示例

工具页提供的主要配置如下。

参数说明默认值
自动选择分类数比较候选分类数的轮廓系数并选择较高者关闭
手动分类数界面范围 1 到 40;实际至少 2,且不超过有效文本数减 15
文本聚类方式在短文本方式和长文本方式之间选择短文本方式
移除重复文本完全相同的文本只保留一次关闭
自定义字典在分词时保留业务词语关闭
自定义停用词在向量形成前过滤指定词语关闭
智能词汇识别把识别到的新词补充到分词阶段,不保证单独出现在结果中关闭
分词模式精确、全量或搜索式三种词语边界精确模式
词性过滤过滤选择的词性,不参与后续聚类关闭
完成后发送邮件通知任务结束后发送提醒,不改变聚类结果关闭

配置一:未知主题数量。开启自动选择分类数,使用短文本方式,其他预处理保持默认。适合先建立基线,再根据关键词和代表文本判断主题是否可读。

配置二:已有三类业务框架。关闭自动选择,把手动分类数设为 3。适合明确要对照产品、物流、客服等既有口径的材料。

配置三:重复和套话较多。开启重复文本移除,补充停用词;如果专有名词被拆开,再加入自定义字典。预处理目标是改善文本表示,不是追求某一个指标单独变好。

案例分析

案例一:固定三类的用户反馈。

背景:准备 18 条反馈,电池续航、物流配送和客服售后各 6 条。每条只围绕一个主要议题,并采用相同分词预处理。

配置:短文本方式,关闭自动选择,手动分类数设为 3,不移除重复文本。

结果:实际得到 6 / 6 / 6 三组。三组关键词分别以“续航、电池、充电”“物流、快递、包裹”“客服、售后、处理”为主。轮廓系数为 0.0858,戴维斯-布尔丁指数为 2.1567,卡林斯基-哈拉巴斯指数为 2.2151。

结论:关键词和规模符合预设的三类结构,但轮廓系数仍低,不能因为分组数量整齐就判定质量良好。18 条样本只适合演示报告读法,仍需查看代表文本。

案例二:自动选择与过度分组对比。

背景:使用同一批 18 条反馈,比较自动选择和手动设为 5 类的差异。

配置:第一次开启自动选择,候选范围为 2 到 5 类;第二次关闭自动选择并手动设为 5 类。

结果:自动比较时,2、3、4、5 类的轮廓系数依次为 0.0576、0.0858、0.0694、-0.0031,最终选择 3 类。手动设为 5 类后,规模变为 6 / 7 / 1 / 3 / 1,轮廓系数为 0.0558,卡林斯基-哈拉巴斯指数降为 1.6332,同时出现两个单条小组。

结论:增加分类数没有带来更清晰的结构,反而把少数文本拆成孤立小组。自动结果仍要与业务预期对照,但可作为手动分类数的起点。