词汇增长曲线分析图标词汇增长曲线分析

用于判断一份或多份文本是不断引入新词还是收敛到固定词表、词频是否符合自然语言分布,比单看词频表更能区分公文模板、自然写作与疑似机器生成。

按累计 token 逐段统计词表增长,用 Heaps' Law(V = K · Nβ)拟合得出用词开放度 β;高频词按降序在双对数坐标下做最小二乘拟合,得出 Zipf 分布的陡峭度 s,并附 R² 作可信度参考。

β、s 会被投影到公文 / 散文 / 新闻 / 百科的公开语料带,可一眼定位语料风格;可外推再读多少文本能新增多少词以及未来 1M / 10M token 时的词表规模;多文件页指出最开放与最封闭的文件和偏离自然语言的离群文件。

常用于教材与学术写作的用词稳定性评估,也常用于识别评论与访谈中疑似机器生成的模板化文本。

加载文件上传组件中...

自动模式按文中中英文字符占比判断;混排建议手动指定。

仅用于过滤报告里的 Top 高频词展示,不影响 Heaps 曲线、β、Zipf 指数 s、R² 等拟合结果。

系统停用词与自定义停用词会取并集;关闭自定义停用词时会自动清空已上传文件。

主流计量语言学默认

每 100 token 记一次

步长越小曲线越精细但点越多;万字级语料用 100 即可,十万字级建议 500。

5000 个

只用前 N 个高频词做 log-log 拟合,避免长尾低频词的统计噪声拉低 R²。

每 20,000 字 2 点