返回教程列表
文本分析基础教程词汇等级HSK教学材料

词汇等级评估:看整篇难度,也找出词表外的词

以虚构社区图书馆短文的实测报告为例,讲解 HSK 词表选择、整体等级的 90% 累计口径、词表覆盖率与未分级词的区别,并展示任务页和报告页。

作者:TATOOLS 研究团队|更新于 2026-09-27|1346 个字符|约 5 分钟读完
vocab-level
立即使用

准备教学材料或分级读物时,光看篇幅很难知道用词是否超出读者的词汇范围。词汇等级评估会把文本切成词,对照中文 HSK 或英文 CEFR、Oxford 词表,给出各等级的词次分布、整篇等级和未分级词。下文用一篇虚构的社区图书馆短文,展示从任务页到报告的读法。

01

分析单位是词次,整篇等级来自累计覆盖

词次指一个词在正文中出现一次。同一个词出现三次,就贡献三个词次;【不同词】只计一次。TATOOLS 先分词,再给能在所选词表中查到的词标等级。词表覆盖率的分母是全部词次:若 10 个词次中有 8 个查到等级,覆盖率就是 8 ÷ 10=80%。没有查到的词单列为【未分级词】,不会被强行判为最高等级。

整篇等级采用另一分母:已分级词次。从最低等级逐级累加,第一次覆盖至少 90% 已分级词次的等级,就是整篇等级。举个便于手算的例子:已分级词次共 10 个,低级词 7 次、中级词 2 次、高级词 1 次;累加到中级达到 9 ÷ 10=90%,整篇就定为中级。这个判定描述的是普通词汇分布。分词边界和词表范围会改变结果,报告里的未分级词需要回原文检查。

02

上传材料并选定评估口径

打开 词汇等级评估 上传文档。任务页可以自动判断语言,也可以手动指定中文或英文;中文可选 HSK 九级新标准或旧六级,英文可选 CEFR 或 Oxford。下图为当前页面的默认设置。

TATOOLS 使用教程配图

词汇等级评估任务页:语言、词表标准、目标等级和命名实体设置

1

先按材料语言选择词表。本次示例使用中文和 HSK 九级新标准,保留默认的【自动检测】。

2

如果要找出超过某个教学目标的词,再设置【目标等级】。本次没有设置,先观察整体等级。

3

按需决定是否跳过命名实体,以及【未分级词保留数量】。本次保持默认设置,上传文档后提交任务。

这些选项对应不同问题:整篇等级描述已分级词的总体分布;目标等级用于筛出超纲词;未分级词是没有在所选词表中查到的词,需单独核对。

03

用已完成报告读懂三个数字

示例短文讲述社区图书馆的阅读活动和借阅安排。报告统计了 165 个词次、120 个不同词,其中 146 个词次查到 HSK 等级,词表覆盖率为 88.5%;另有 19 个词次进入未分级词。报告把整篇判为 HSK4。

TATOOLS 使用教程配图

社区图书馆示例的词汇等级报告:165 词次、覆盖率 88.5%、整体等级 HSK4

整篇等级按已分级词次从低到高累加确定。示例累计到 HSK4 时覆盖了已分级词次的 93.2%,首次达到报告采用的 90% 门槛,因此显示 HSK4。88.5% 则是词表覆盖率,分母是全部 165 个词次;两项百分比回答的问题不同。

本次没有设置目标等级,报告中的【超纲词数】显示横线。若想检查面向 HSK3 读者的材料,应在任务页选 HSK3 后重新分析。报告底部的未分级词清单包括【工作人员】等词,也可能混有分词产生的片段;先回到原文检查,再决定是否补充自定义词典。

04

用在教学材料审阅中

把同一批材料分别运行,先比较所选词表下的整体等级与覆盖率,再查看高频未分级词和超纲词。报告中的等级基于词表和分词结果;句子长短、篇章结构等阅读门槛,可以再用文本可读性分析核对。

小结:

•

在 TATOOLS 里先选语言和词表,目标等级只在需要筛超纲词时设置。

•

分清覆盖率的全部词次分母,以及整篇等级的已分级词次分母。

•

先核对未分级词,再把整体等级用于同一标准下的材料比较;句子难度可接着用文本可读性分析查看。


END