简单文本聚类
一批评论、开放题或访谈片段往往包含多个议题,人工逐条归类既慢,也容易先入为主。分类数设得太少会把不同问题混在一起,设得太多又会产生只有一两条文本的小组。简单文本聚类先按内容相似性形成主题簇,再把结果交给用户复核。
核心能力是手动或自动选择分类数、短文本与长文本两种处理方式,以及三类聚类质量指标。自动模式比较候选分类数的轮廓系数;手动分类数实际至少为 2,并受有效文本数量限制。用户还可移除完全重复文本,减少重复条目造成的偏斜。
预处理阶段支持自定义字典、停用词、智能词汇识别、分词模式和词性过滤。材料中的专有名词未被保留时,主题关键词可能偏泛;样本很少或文本极短时,指标和二维投影也容易波动,因此参数调整应与原文检查配合。
报告展示聚类数量、三类质量指标、各类别文本量、二维投影散点图、类间相似度热力图、各类关键词词云和逐簇详情。每个簇可查看规模、占比、关键词、示例文本、代表性片段、主题聚焦度和改进建议,便于决定是否调整分类数或重新整理材料。
加载文件上传组件中...
每 20,000 字 2 点
