文本质量评估器
对每份文本整体统计:字数、词数、句数、段数、唯一词数,句子长度分布,词汇丰富度(TTR、MTLD、HD-D,三种衡量用词是否重复单调的指标),中文、英文、数字、标点、表情各占多少字符,以及整行、单词和连续词组的重复率。综合这些指标给出 0~100 的得分与 good / fair / poor(好 / 一般 / 差)三档评价。
另外逐项判断这份材料能否用于聚类、LDA 主题模型、BERTopic 主题模型、命名实体识别、情感分析和抽取式摘要。这里只检查是否达到各项分析的最低输入条件,达标不代表分析结果一定可用。多份材料一起评估时给出横向对比。
每个文件按一篇完整文本评分
- 每个文件整体评一次分。要分别评估多篇文本,请拆成多个文件上传。
- 段落只按空行切分,单个换行不分段。整篇没有空行的文件会被算作一段,平均段落长度超过 2000 个字符要扣分。
- 任务适用性只检查文件是否达到各任务的最低输入条件,通过门槛不等于适合直接建模。
加载文件上传组件中...
每 10,000 个字符 1 点
