简单文本聚类

把一批评论、开放题或短文本按内容相似性分成若干组,给出每组的规模、占比、代表关键词和示例文本,并附三项聚类质量指标供判断分组是否合理。

分类数可以手动指定,也可以交给程序比较各候选分类数的轮廓系数(衡量同组是否紧凑、不同组是否分得开的指标)后自动选定,实际分组数至少为 2。比较文本的方式可选按词频权重,适合短评论和问卷开放题;或按词向量,适合成段的长文本。

加载文件上传组件中...
已识别 0 / 500 个词

一行一个词,也可写成 词 词频 词性(空格分隔);逗号、顿号、分号或换行分隔均可。

字典帮助:可使用 搜狗细胞词库 下载你需要的字典 SCEL 文件,并使用辅助工具中的 【搜狗输入法词库 SCEL 转 TXT 字典工具】 转为 txt 后,用上方的导入按钮加入

分词工具碰到不认识的新词常会拆开,比如把“乡村振兴”拆成“乡村”和“振兴”。打开后,会先把你文本里的这类词找出来加进词典,分词时就不容易拆散了。仅支持中文文本。每 10,000 字 5 点。

已识别 0 / 500 个词

每 10,000 个字符 2 点