经典LDA主题建模
经典 LDA 面向需要复现传统概率主题模型的研究与教学场景。工具将所有上传文件按段落、行或整篇文件切分为文档,并合并到同一语料空间,依次完成分词、词典过滤、词袋表示和变分贝叶斯训练。结果包括主题—词概率、文档—主题分布、主题规模、困惑度、一致性及完整词表,建模参数和过滤过程均可追溯。
区别于现有 LDA 工具,本工具不使用语义向量或 Word2Vec,不自动选择主题数,也不按文件分别训练模型;它强调教材式流程、跨文件统一主题空间和参数可复现性,适合方法验证、参数实验、论文研究与课程演示。
选择最接近你材料的一类,系统会一键填好这类材料的推荐参数;选完仍可在下方逐项微调。不确定就按材料的单条/单篇字数对号入座。
切分出的每个单元会作为一个独立文档参与主题估计。
经典做法由研究者自行指定 K,再用困惑度和一致性比较不同 K 的结果。有效文档数必须不少于 K。
字典帮助:可使用 搜狗细胞词库 下载你需要的字典 SCEL 文件,并使用辅助工具中的 【搜狗输入法词库 SCEL 转 TXT 字典工具】 转为 txt 上传到这里
系统停用词与自定义停用词取并集;英文语料的系统停用词使用通用英文清单。
短于该长度的词不参与建模。中文设为 2 可过滤单字词;英文常用 2-3。
开启后由纯数字构成的词不参与建模。
去掉空白后短于该长度的文档单元会被剔除,剔除数量会在报告中列出。设为 0 表示不剔除。
词至少要在这么多个文档中出现才保留。文档数少时建议 1-2,语料大时可到 5 以上。
出现于超过该比例文档的词会被移除。100% 表示不启用该项过滤。
频率过滤后只保留出现频次最高的前 N 个词。填 0 表示不限制。
整个语料被完整训练的遍数。语料小、文档少时适当加大。
推断单个文档主题分布时的最大迭代次数,常用 50-100。
每批送入训练的文档数量,超过语料规模时等价于一次处理全部文档。
仅在线训练使用。控制旧批次信息被遗忘的速度,取值范围 0.5-1。
仅在线训练使用。减缓前几个批次对参数的影响。
固定随机种子可使同一份数据、同一组参数的结果可复现。
报告中每个主题展示的高权重词数量;下载文件中每主题固定导出前 50 个词。
每 20,000 字 5 点
