手里有三百篇绿色金融方面的政策文件和研究报告,想整理出这个领域的术语表,看看绿色金融产品和碳减排支持工具这些说法各出现了多少次,在什么语境里出现。一个词一个词地读,读不完;按词频排,排在前面的是发展和推进这类单词,真正的术语大多由两三个词组成,被拆散在词频表里。
从文本里自动识别多词术语,叫自动术语识别(Automatic Term Recognition)。TATOOLS 的【领域术语抽取】先按词性模板取出 2 到 8 个词的候选组合,再算两项得分,C-value 看一个候选是不是稳固的术语,并扣掉那些只作为更长术语一部分出现的片段;NC-value 在 C-value 之上加入上下文的权重。每条术语附出现次数、嵌套关系和原文用例,并产出一份可以直接当分词词典用的术语表。
这篇教程先讲术语和普通词组的区别,再讲候选怎样用词性模板取出来,然后用一组绿色金融的例子手算 C-value 和 NC-value,最后讲领域词表和多文件合并,以及报告的读法和论文里的写法。
01
术语和普通词组有什么不同
Kageura 和 Umino 1996 年总结自动术语识别的研究时,区分了两个性质。一是成词性(Unithood),几个词是不是稳定地组合在一起;二是术语性(Termhood),这个组合是不是指称一个领域里的专门概念。
| 组合 | 成词性 | 术语性 |
|---|---|---|
| 绿色金融产品 | 高,总是一起出现 | 高,指一类专门的金融工具 |
| 进一步推进 | 高,常常一起出现 | 低,是通用的公文说法 |
| 金融产品 | 中,常常嵌在更长的说法里 | 视语境而定 |
一个好的术语抽取方法,两个性质都要看。只看频次,进一步推进会排在前面;只看成词性,一些总是嵌在长术语里的片段也会混进来。
社会科学里,术语表可以用来梳理一个政策领域的概念体系,比较不同时期或不同机构的用语变化,也可以加进分词词典,让后续的词频、主题和网络分析不再把术语拆散。TATOOLS 的【领域术语抽取】适合处理一批同一领域的材料,材料越多,统计越稳。
02
候选怎样来:词性模板
术语大多是名词性的短语。Justeson 和 Katz 1995 年分析了多个领域的术语表,发现绝大多数技术术语符合几种固定的词性序列,比如名词加名词、形容词加名词。TATOOLS 先分词并标注词性,再按词性序列模板在每句话里滑动,取出命中模板的连续词组作为候选。
分好的词和词性(示意)
发行/v 绿色/a 金融/n 产品/n
命中的候选
a+n 绿色 金融
n+n 金融 产品
a+n+n 绿色 金融 产品
【词性序列模板】默认勾选名词加名词、形容词加名词、名名名、形名名和动词加名词五种,还有名动名等三种可以加上,也可以自己输入模板。模板里的 n 能匹配所有细分的名词,人名、地名和机构名都算。词性模板只对中文有效,英文按词形猜词性,模板基本不影响结果。
候选还要过几道筛选。【最短词数】和【最长词数】限定候选由几个词组成,默认 2 到 5 个;【候选首尾停用词过滤】默认开启,的、和这类词不能出现在候选的开头或结尾;【最低出现次数】默认 3,出现太少的候选不进入打分。
03
C-value:长度、频次和嵌套
Frantzi、Ananiadou 和 Mima 2000 年提出的 C-value 方法,是自动术语识别里最常用的统计方法之一。它的公式有两种情况。
候选 a 没有嵌在更长的候选里
C-value(a) = log₂|a| × f(a)
候选 a 嵌在更长的候选里
C-value(a) = log₂|a| × ( f(a) − Σ f(b) ÷ P(Tₐ) )
|a|:a 由几个词组成
f(a):a 出现的次数
Tₐ:包含 a 的更长候选的集合;P(Tₐ):这个集合里有几个候选
log₂|a| 给长一点的候选加分,两个词的系数是 1,三个词是 1.585。第二种情况减去的,是包含它的那些长候选平均出现了多少次,扣掉 a 作为别人一部分出现的那部分次数。
用绿色金融的一组候选手算。
| 候选 | 词数 | 出现次数 | 嵌在哪些长候选里 |
|---|---|---|---|
| 绿色金融产品 | 3 | 8 | 无 |
| 绿色金融债券 | 3 | 6 | 无 |
| 绿色金融 | 2 | 20 | 绿色金融产品,绿色金融债券 |
| 金融产品 | 2 | 8 | 绿色金融产品 |
| 普惠金融 | 2 | 12 | 无 |
绿色金融产品 1.585 × 8 ≈ 12.68
绿色金融债券 1.585 × 6 ≈ 9.51
绿色金融 1 × (20 − (8 + 6) ÷ 2) = 13
金融产品 1 × (8 − 8 ÷ 1) = 0
普惠金融 1 × 12 = 12
按 C-value 排,绿色金融、绿色金融产品、普惠金融排在前面,金融产品得 0。
04
嵌套扣减为什么重要
金融产品出现了 8 次,和绿色金融产品一样多,也就是说它每一次出现,都是作为绿色金融产品的一部分出现的,自己从来没有单独出现过。它只是长术语的一个片段,C-value 把它扣到了 0。
绿色金融出现了 20 次,其中有一部分嵌在两个长术语里,扣掉长术语的平均次数 7 以后还剩 13,说明它大量地单独使用,是一个独立的术语。
没有嵌套扣减,按频次排,一个长术语的每一个片段都会跟着排进前列,前几十名里会塞满同一个术语的各种切法。TATOOLS 的报告里,嵌在更长术语里的术语标着【嵌套】,【嵌套上位词】一栏列出包含它的长术语;【嵌套关系】一块把这些短术语和包含它们的长术语放在一起,一眼能看出哪些短术语的分数被长术语分走了。
05
NC-value:把上下文算进来
术语周围常常有一些固定的伴随词,比如发行、推广、创新。NC-value 在 C-value 的基础上,给经常出现在术语周围的上下文词加权。
weight(w) = 出现在 w 周围的已接受术语数 ÷ 已接受术语总数
NC-value(a) = 0.8 × C-value(a) + 0.2 × Σ f_a(w) × weight(w)
f_a(w):w 出现在 a 周围的次数
已接受术语是 C-value 大于 0 的那些。接着上面的例子,已接受的有四个,发行出现在其中三个的周围,推广出现在其中两个的周围。
weight(发行) = 3 ÷ 4 = 0.75
weight(推广) = 2 ÷ 4 = 0.5
绿色金融债券周围:发行 4 次,推广 1 次
上下文加成 = 4 × 0.75 + 1 × 0.5 = 3.5
NC-value = 0.8 × 9.51 + 0.2 × 3.5 ≈ 8.31
一个上下文词出现在越多术语的周围,它越像一个术语指示词,权重越高。NC-value 让那些出现在典型术语语境里的候选排得更靠前。
工具页的【排序算法】可以选 C-value 或 NC-value,默认 C-value,算得更快;NC-value 结合了上下文,更准但稍慢。两项分数每次都会同时计算,报告的表格里都有。
06
领域术语、排除词表和实体别名
研究者往往已经知道一些术语。【领域术语】里填的词作为必收词,只要在材料里出现,就一定进入结果,不受词性模板和最低出现次数的限制;材料里没有出现的,不会凭空生成。【排除词表】里填的词不进入结果,适合去掉已经确认不是术语的组合。【实体别名】把同一术语的几种写法并成一种再统计,比如把 ESG 投资和环境社会治理投资并到一起。
07
多个文件怎样合并
上传多个文件时,TATOOLS 对每个文件分别抽取和打分,再把结果合并成一张跨文件的总表。
| 字段 | 合并方式 |
|---|---|
| 出现次数 | 各文件相加 |
| C-value、NC-value | 取各文件中的最大值 |
| 出现在几个文件里 | 计数 |
| 上位词 | 各文件合并去重 |
【输出术语数】决定跨文件总表列出前多少条,默认 200,可以在 50 到 1000 之间调;每个文件自己的术语表不做截断。一条术语出现在多个文件里,说明它是这个领域通用的说法;只出现在一两个文件里,可能是某个机构或某段时期特有的提法。
08
工具页上的设置一览
| 设置 | 范围 | 默认 | 影响什么 |
|---|---|---|---|
| 排序算法 | C-value,NC-value | C-value | 按哪一项排序 |
| 词性序列模板 | 八种可选,也可自定义 | 五种常用模板 | 哪些词性组合算候选 |
| 最短词数 | 2 到 6 | 2 | 候选至少几个词 |
| 最长词数 | 2 到 8 | 5 | 候选至多几个词 |
| 最低出现次数 | 1 到 20 | 3 | 出现太少的不打分 |
| 输出术语数 | 50 到 1000 | 200 | 跨文件总表列多少条 |
| 文本语言 | 自动检测,中文,英文 | 自动检测 | 分词和词性方式 |
| 候选首尾停用词过滤 | 开或关 | 开 | 首尾能否是停用词 |
| 领域术语、排除词表、实体别名 | 自己填写 | 空 | 必收、排除和合并写法 |
09
报告怎么读
| 区块 | 先看什么 |
|---|---|
| 这份报告告诉了你什么 | 抽出多少条术语,最强的是哪几条 |
| 总体规模 | 文件数、分词后的词数、候选数 |
| 术语候选表 | 按得分排序的术语,出现次数和嵌套情况 |
| 上下文示例 | 点一行看这条术语的三句原文 |
| 嵌套关系 | 哪些短术语嵌在长术语里 |
| 词性模板分布 | 哪种构词模式贡献了最多术语 |
| 下一步建议 | 术语表接着可以做什么 |
统计方法在材料太少时容易抓到偶然的搭配,总体规模里分词后的词数少于一千时,结果要格外谨慎。【术语候选表】可以按任一列排序,勾上【仅嵌套术语】只看嵌套的术语,点一行就能在下方看到它在原文里的三个句子,判断是不是真的术语。【词性模板分布】显示每种模板贡献了多少条术语,下次可以据此增减模板。
【术语候选表】里勾选若干条,可以一键导出成分词词典。下载的结果里,每个文件都有一份完整术语表和一份分词词典,词典加进其他工具的【自定义词典】,术语就不会再被拆散。
10
把结果写进论文
下面是一段方法部分的写法示例,方括号里换成自己的内容。
本研究使用 TATOOLS 的领域术语抽取,对 [文件数] 份 [材料类型] 进行分词和词性标注,以 [模板] 等词性序列模板取出 [最短]–[最长] 个词的候选,保留出现至少 [次数] 次的候选,采用 C-value/NC-value 方法(Frantzi 等,2000)计算术语得分。按 [排序算法] 排序取前 [条数] 条,经人工核对上下文后得到 [条数] 条领域术语。
报告术语时,列出前若干条术语的出现次数、C-value 和它们的上位词,再说明人工核对的标准,读者就能判断术语表的质量。
11
小结
术语既要成词,几个词稳定地组合在一起,又要有术语性,指称领域里的专门概念。
TATOOLS 按词性序列模板取出 2 到 8 个词的候选,首尾停用词和出现次数过滤掉明显不是术语的组合。
C-value 给长候选加分,并扣掉只作为长术语一部分出现的次数,总是嵌在长术语里的片段会被扣到 0。
NC-value 在 C-value 上加入上下文词的权重,一个上下文词出现在越多术语周围,权重越高。
领域术语必收,排除词表里的不收,多个文件的结果合并成一张总表,术语表可以直接当分词词典用。
抽出术语以后,想看某个术语和哪些词固定搭配,可以用 TATOOLS 的【词语搭配强度分析】;想先把被切碎的新词找回来,用【智能发现新词】;想比较两批材料里哪些词用得明显更多,用【语料对比关键词分析】。
12
资料来源
Kageura 与 Umino:Methods of Automatic Term Recognition: A Review,Terminology,第 3 卷第 2 期,1996
END
