词汇增长曲线分析
用于判断一份或多份文本是不断引入新词还是收敛到固定词表、词频是否符合自然语言分布,比单看词频表更能区分公文模板、自然写作与疑似机器生成。
按累计 token 逐段统计词表增长,用 Heaps' Law(V = K · Nβ)拟合得出用词开放度 β;高频词按降序在双对数坐标下做最小二乘拟合,得出 Zipf 分布的陡峭度 s,并附 R² 作可信度参考。
β、s 会被投影到公文 / 散文 / 新闻 / 百科的公开语料带,可一眼定位语料风格;可外推再读多少文本能新增多少词以及未来 1M / 10M token 时的词表规模;多文件页指出最开放与最封闭的文件和偏离自然语言的离群文件。
常用于教材与学术写作的用词稳定性评估,也常用于识别评论与访谈中疑似机器生成的模板化文本。
加载文件上传组件中...
自动模式按文中中英文字符占比判断;混排建议手动指定。
仅用于过滤报告里的 Top 高频词展示,不影响 Heaps 曲线、β、Zipf 指数 s、R² 等拟合结果。
系统停用词与自定义停用词会取并集;关闭自定义停用词时会自动清空已上传文件。
主流计量语言学默认
每 100 token 记一次
步长越小曲线越精细但点越多;万字级语料用 100 即可,十万字级建议 500。
5000 个
只用前 N 个高频词做 log-log 拟合,避免长尾低频词的统计噪声拉低 R²。
每 20,000 字 2 点
