简单文本聚类图标简单文本聚类

一批评论、开放题或访谈片段往往包含多个议题,人工逐条归类既慢,也容易先入为主。分类数设得太少会把不同问题混在一起,设得太多又会产生只有一两条文本的小组。简单文本聚类先按内容相似性形成主题簇,再把结果交给用户复核。

核心能力是手动或自动选择分类数、短文本与长文本两种处理方式,以及三类聚类质量指标。自动模式比较候选分类数的轮廓系数;手动分类数实际至少为 2,并受有效文本数量限制。用户还可移除完全重复文本,减少重复条目造成的偏斜。

预处理阶段支持自定义字典、停用词、智能词汇识别、分词模式和词性过滤。材料中的专有名词未被保留时,主题关键词可能偏泛;样本很少或文本极短时,指标和二维投影也容易波动,因此参数调整应与原文检查配合。

报告展示聚类数量三类质量指标各类别文本量二维投影散点图类间相似度热力图各类关键词词云逐簇详情。每个簇可查看规模、占比、关键词、示例文本、代表性片段、主题聚焦度和改进建议,便于决定是否调整分类数或重新整理材料。

加载文件上传组件中...

字典帮助:可使用 搜狗细胞词库 下载你需要的字典 SCEL 文件,并使用辅助工具中的 【搜狗输入法词库 SCEL 转 TXT 字典工具】 转为 txt 上传到这里

每 20,000 字 2 点