高级文本聚类
把材料按句切成片段,再按内容相似度把片段聚成若干主题簇,输出每簇的关键词、由关键词拼成的簇名、规模占比和代表片段,并给出聚类质量指标。
分类数可以自己指定,也可以用肘部法则、轮廓系数或间隔统计三种方法之一自动选定;另可改用按疏密自动成组的算法,不预先设定类数。开启参数敏感性对比后,会把分类数上下各调 1 再各聚一次,比较各簇的关键词是否随之改变。
加载文件上传组件中...
政策、教育、评论等材料如果包含专有名词,建议填写专业词表;若多个簇反复出现泛词,可填写停用词后重跑。
已识别 0 / 500 个词
一行一个词,也可写成 词 词频 词性(空格分隔);逗号、顿号、分号或换行分隔均可。
字典帮助:可使用 搜狗细胞词库 下载你需要的字典 SCEL 文件,并使用辅助工具中的 【搜狗输入法词库 SCEL 转 TXT 字典工具】 转为 txt 后,用上方的导入按钮加入
分词工具碰到不认识的新词常会拆开,比如把“乡村振兴”拆成“乡村”和“振兴”。打开后,会先把你文本里的这类词找出来加进词典,分词时就不容易拆散了。仅支持中文文本。每 10,000 字 5 点。
已识别 0 / 500 个词
先选一个接近你材料用途的模板,系统会自动填入一组稳妥参数;仍可在下方继续微调。
需要保留参数、质量指标和敏感性说明。
5
每 10,000 个字符 2 点
