BERTopic 主题聚类

用 BERTopic(按语义把相近文本聚到一起形成主题的方法)分析一批材料:先把原始文本清洗并切成片段,再把语义相近的片段聚成若干主题,每个主题给出关键词、一个概括出来的主题名和最有代表性的原文摘录。

主题数可以固定,也可以交给程序按语料结构自行判定。除主题清单外,还会比较主题两两之间的相似度、整理出主题的层级关系,标出相似度过高、适合合并的主题,并按主题整理出一份章节提纲。原文中能识别出时间时,会给出各主题随时间的消长;对识别不到时间的文档,可以另设一个时间基准兜底。

结果不是一次定死:可以把分得过细的主题合并、把混在一起的主题拆开、删掉无关的主题,每改一次生成新的一版,之前的版本仍然保留。也可以就这批材料继续追问,回答只依据你上传的原文并附上出处。

请直接上传未清洗的原始文本

本工具自带文本清洗和分段,已经清洗过的文本反而会影响分段结果。

提交前请删除目录、致谢和参考文献,这些内容会被当作正文一起参与聚类。

任务完成后可在报告页对这批材料追问,回答只依据这次任务的原文和分析汇总并附出处;每个任务前 3 次免费,之后每次 1 算力。

加载文件上传组件中...

只有在文档原文中找不到任何绝对时间时,本基准才会作为兜底使用。

分词工具碰到不认识的新词常会拆开,比如把“乡村振兴”拆成“乡村”和“振兴”。打开后,会先把你文本里的这类词找出来加进词典,分词时就不容易拆散了。仅支持中文文本。每 10,000 字 5 点。

已识别 0 / 500 个词

文本向量化时过滤这些词,避免它们出现在主题关键词中。留空时,中文使用系统内置停用词表,英文使用 scikit-learn(常用的机器学习工具包)内置英文停用词表。

自动发现会先评估语料的主结构与细分结构,再按上方预设选择更稳妥或更细致的主题数。

自动发现 · 平衡
300

在主结构与细分主题间折中

自定义参数

请先在上方选择【自定义参数】预设以启用此处的参数调整

产生平衡、自然的主题边界,适合大多数场景

15
5
0.1
1
10
自动
0
1-2
1
推荐范围: 1-50 (数值越大主题越聚焦)
10000
推荐范围: 5,000-20,000
0.1

每 10,000 个字符 5 点