经典LDA主题建模图标经典LDA主题建模

经典 LDA 面向需要复现传统概率主题模型的研究与教学场景。工具将所有上传文件按段落、行或整篇文件切分为文档,并合并到同一语料空间,依次完成分词、词典过滤、词袋表示和变分贝叶斯训练。结果包括主题—词概率、文档—主题分布、主题规模、困惑度、一致性及完整词表,建模参数和过滤过程均可追溯。

区别于现有 LDA 工具,本工具不使用语义向量或 Word2Vec,不自动选择主题数,也不按文件分别训练模型;它强调教材式流程、跨文件统一主题空间和参数可复现性,适合方法验证、参数实验、论文研究与课程演示。

加载文件上传组件中...

选择最接近你材料的一类,系统会一键填好这类材料的推荐参数;选完仍可在下方逐项微调。不确定就按材料的单条/单篇字数对号入座。

切分出的每个单元会作为一个独立文档参与主题估计。

5

经典做法由研究者自行指定 K,再用困惑度和一致性比较不同 K 的结果。有效文档数必须不少于 K。

字典帮助:可使用 搜狗细胞词库 下载你需要的字典 SCEL 文件,并使用辅助工具中的 【搜狗输入法词库 SCEL 转 TXT 字典工具】 转为 txt 上传到这里

系统停用词与自定义停用词取并集;英文语料的系统停用词使用通用英文清单。

2 字符

短于该长度的词不参与建模。中文设为 2 可过滤单字词;英文常用 2-3。

开启后由纯数字构成的词不参与建模。

10 字符

去掉空白后短于该长度的文档单元会被剔除,剔除数量会在报告中列出。设为 0 表示不剔除。

2 个文档

词至少要在这么多个文档中出现才保留。文档数少时建议 1-2,语料大时可到 5 以上。

80%

出现于超过该比例文档的词会被移除。100% 表示不启用该项过滤。

100,000

频率过滤后只保留出现频次最高的前 N 个词。填 0 表示不限制。

10

整个语料被完整训练的遍数。语料小、文档少时适当加大。

50

推断单个文档主题分布时的最大迭代次数,常用 50-100。

2000

每批送入训练的文档数量,超过语料规模时等价于一次处理全部文档。

对称
对称
0.5

仅在线训练使用。控制旧批次信息被遗忘的速度,取值范围 0.5-1。

1

仅在线训练使用。减缓前几个批次对参数的影响。

42

固定随机种子可使同一份数据、同一组参数的结果可复现。

15 个

报告中每个主题展示的高权重词数量;下载文件中每主题固定导出前 50 个词。

每 20,000 字 5 点