返回教程列表
文本分析基础教程术语抽取C-value语料库语言学

领域术语抽取完整教程:从词性模板与候选枚举,到 C-value 的嵌套扣减和 NC-value 的上下文加权

三百篇绿色金融文件,按词频排出来的是发展和推进,真正的术语被拆散在词频表里,怎样把多词术语找出来?这篇教程从成词性和术语性讲起,说明 TATOOLS 的【领域术语抽取】怎样按词性序列模板取出候选,再用一组绿色金融的候选手算 C-value,看总是嵌在长术语里的片段怎样被扣到 0。接着手算 NC-value 的上下文权重,说明领域术语、排除词表和实体别名怎样使用,多个文件的结果怎样合并。最后讲报告怎样读、术语表怎样导出成分词词典,并给出论文方法部分的写法示例。

作者:TATOOLS 研究团队|更新于 2026-09-24|4519 个字符|约 16 分钟读完
term-extraction
立即使用

手里有三百篇绿色金融方面的政策文件和研究报告,想整理出这个领域的术语表,看看绿色金融产品和碳减排支持工具这些说法各出现了多少次,在什么语境里出现。一个词一个词地读,读不完;按词频排,排在前面的是发展和推进这类单词,真正的术语大多由两三个词组成,被拆散在词频表里。

从文本里自动识别多词术语,叫自动术语识别(Automatic Term Recognition)。TATOOLS 的【领域术语抽取】先按词性模板取出 2 到 8 个词的候选组合,再算两项得分,C-value 看一个候选是不是稳固的术语,并扣掉那些只作为更长术语一部分出现的片段;NC-value 在 C-value 之上加入上下文的权重。每条术语附出现次数、嵌套关系和原文用例,并产出一份可以直接当分词词典用的术语表。

这篇教程先讲术语和普通词组的区别,再讲候选怎样用词性模板取出来,然后用一组绿色金融的例子手算 C-value 和 NC-value,最后讲领域词表和多文件合并,以及报告的读法和论文里的写法。

01

术语和普通词组有什么不同

Kageura 和 Umino 1996 年总结自动术语识别的研究时,区分了两个性质。一是成词性(Unithood),几个词是不是稳定地组合在一起;二是术语性(Termhood),这个组合是不是指称一个领域里的专门概念。

组合 成词性 术语性
绿色金融产品 高,总是一起出现 高,指一类专门的金融工具
进一步推进 高,常常一起出现 低,是通用的公文说法
金融产品 中,常常嵌在更长的说法里 视语境而定

一个好的术语抽取方法,两个性质都要看。只看频次,进一步推进会排在前面;只看成词性,一些总是嵌在长术语里的片段也会混进来。

社会科学里,术语表可以用来梳理一个政策领域的概念体系,比较不同时期或不同机构的用语变化,也可以加进分词词典,让后续的词频、主题和网络分析不再把术语拆散。TATOOLS 的【领域术语抽取】适合处理一批同一领域的材料,材料越多,统计越稳。

02

候选怎样来:词性模板

术语大多是名词性的短语。Justeson 和 Katz 1995 年分析了多个领域的术语表,发现绝大多数技术术语符合几种固定的词性序列,比如名词加名词、形容词加名词。TATOOLS 先分词并标注词性,再按词性序列模板在每句话里滑动,取出命中模板的连续词组作为候选。

· · ·

分好的词和词性(示意)

发行/v 绿色/a 金融/n 产品/n

命中的候选

a+n 绿色 金融

n+n 金融 产品

a+n+n 绿色 金融 产品

【词性序列模板】默认勾选名词加名词、形容词加名词、名名名、形名名和动词加名词五种,还有名动名等三种可以加上,也可以自己输入模板。模板里的 n 能匹配所有细分的名词,人名、地名和机构名都算。词性模板只对中文有效,英文按词形猜词性,模板基本不影响结果。

候选还要过几道筛选。【最短词数】和【最长词数】限定候选由几个词组成,默认 2 到 5 个;【候选首尾停用词过滤】默认开启,的、和这类词不能出现在候选的开头或结尾;【最低出现次数】默认 3,出现太少的候选不进入打分。

03

C-value:长度、频次和嵌套

Frantzi、Ananiadou 和 Mima 2000 年提出的 C-value 方法,是自动术语识别里最常用的统计方法之一。它的公式有两种情况。

· · ·

候选 a 没有嵌在更长的候选里

C-value(a) = log₂|a| × f(a)

 

候选 a 嵌在更长的候选里

C-value(a) = log₂|a| × ( f(a) − Σ f(b) ÷ P(Tₐ) )

 

|a|:a 由几个词组成

f(a):a 出现的次数

Tₐ:包含 a 的更长候选的集合;P(Tₐ):这个集合里有几个候选

log₂|a| 给长一点的候选加分,两个词的系数是 1,三个词是 1.585。第二种情况减去的,是包含它的那些长候选平均出现了多少次,扣掉 a 作为别人一部分出现的那部分次数。

用绿色金融的一组候选手算。

候选 词数 出现次数 嵌在哪些长候选里
绿色金融产品 3 8
绿色金融债券 3 6
绿色金融 2 20 绿色金融产品,绿色金融债券
金融产品 2 8 绿色金融产品
普惠金融 2 12
· · ·

绿色金融产品 1.585 × 8 ≈ 12.68

绿色金融债券 1.585 × 6 ≈ 9.51

绿色金融 1 × (20 − (8 + 6) ÷ 2) = 13

金融产品 1 × (8 − 8 ÷ 1) = 0

普惠金融 1 × 12 = 12

按 C-value 排,绿色金融、绿色金融产品、普惠金融排在前面,金融产品得 0。

04

嵌套扣减为什么重要

金融产品出现了 8 次,和绿色金融产品一样多,也就是说它每一次出现,都是作为绿色金融产品的一部分出现的,自己从来没有单独出现过。它只是长术语的一个片段,C-value 把它扣到了 0。

绿色金融出现了 20 次,其中有一部分嵌在两个长术语里,扣掉长术语的平均次数 7 以后还剩 13,说明它大量地单独使用,是一个独立的术语。

没有嵌套扣减,按频次排,一个长术语的每一个片段都会跟着排进前列,前几十名里会塞满同一个术语的各种切法。TATOOLS 的报告里,嵌在更长术语里的术语标着【嵌套】,【嵌套上位词】一栏列出包含它的长术语;【嵌套关系】一块把这些短术语和包含它们的长术语放在一起,一眼能看出哪些短术语的分数被长术语分走了。

05

NC-value:把上下文算进来

术语周围常常有一些固定的伴随词,比如发行、推广、创新。NC-value 在 C-value 的基础上,给经常出现在术语周围的上下文词加权。

· · ·

weight(w) = 出现在 w 周围的已接受术语数 ÷ 已接受术语总数

NC-value(a) = 0.8 × C-value(a) + 0.2 × Σ f_a(w) × weight(w)

f_a(w):w 出现在 a 周围的次数

已接受术语是 C-value 大于 0 的那些。接着上面的例子,已接受的有四个,发行出现在其中三个的周围,推广出现在其中两个的周围。

· · ·

weight(发行) = 3 ÷ 4 = 0.75

weight(推广) = 2 ÷ 4 = 0.5

绿色金融债券周围:发行 4 次,推广 1 次

上下文加成 = 4 × 0.75 + 1 × 0.5 = 3.5

NC-value = 0.8 × 9.51 + 0.2 × 3.5 ≈ 8.31

一个上下文词出现在越多术语的周围,它越像一个术语指示词,权重越高。NC-value 让那些出现在典型术语语境里的候选排得更靠前。

工具页的【排序算法】可以选 C-value 或 NC-value,默认 C-value,算得更快;NC-value 结合了上下文,更准但稍慢。两项分数每次都会同时计算,报告的表格里都有。

06

领域术语、排除词表和实体别名

研究者往往已经知道一些术语。【领域术语】里填的词作为必收词,只要在材料里出现,就一定进入结果,不受词性模板和最低出现次数的限制;材料里没有出现的,不会凭空生成。【排除词表】里填的词不进入结果,适合去掉已经确认不是术语的组合。【实体别名】把同一术语的几种写法并成一种再统计,比如把 ESG 投资和环境社会治理投资并到一起。

07

多个文件怎样合并

上传多个文件时,TATOOLS 对每个文件分别抽取和打分,再把结果合并成一张跨文件的总表。

字段 合并方式
出现次数 各文件相加
C-value、NC-value 取各文件中的最大值
出现在几个文件里 计数
上位词 各文件合并去重

【输出术语数】决定跨文件总表列出前多少条,默认 200,可以在 50 到 1000 之间调;每个文件自己的术语表不做截断。一条术语出现在多个文件里,说明它是这个领域通用的说法;只出现在一两个文件里,可能是某个机构或某段时期特有的提法。

08

工具页上的设置一览

设置 范围 默认 影响什么
排序算法 C-value,NC-value C-value 按哪一项排序
词性序列模板 八种可选,也可自定义 五种常用模板 哪些词性组合算候选
最短词数 2 到 6 2 候选至少几个词
最长词数 2 到 8 5 候选至多几个词
最低出现次数 1 到 20 3 出现太少的不打分
输出术语数 50 到 1000 200 跨文件总表列多少条
文本语言 自动检测,中文,英文 自动检测 分词和词性方式
候选首尾停用词过滤 开或关 首尾能否是停用词
领域术语、排除词表、实体别名 自己填写 必收、排除和合并写法

09

报告怎么读

区块 先看什么
这份报告告诉了你什么 抽出多少条术语,最强的是哪几条
总体规模 文件数、分词后的词数、候选数
术语候选表 按得分排序的术语,出现次数和嵌套情况
上下文示例 点一行看这条术语的三句原文
嵌套关系 哪些短术语嵌在长术语里
词性模板分布 哪种构词模式贡献了最多术语
下一步建议 术语表接着可以做什么

统计方法在材料太少时容易抓到偶然的搭配,总体规模里分词后的词数少于一千时,结果要格外谨慎。【术语候选表】可以按任一列排序,勾上【仅嵌套术语】只看嵌套的术语,点一行就能在下方看到它在原文里的三个句子,判断是不是真的术语。【词性模板分布】显示每种模板贡献了多少条术语,下次可以据此增减模板。

【术语候选表】里勾选若干条,可以一键导出成分词词典。下载的结果里,每个文件都有一份完整术语表和一份分词词典,词典加进其他工具的【自定义词典】,术语就不会再被拆散。

10

把结果写进论文

下面是一段方法部分的写法示例,方括号里换成自己的内容。

本研究使用 TATOOLS 的领域术语抽取,对 [文件数] 份 [材料类型] 进行分词和词性标注,以 [模板] 等词性序列模板取出 [最短]–[最长] 个词的候选,保留出现至少 [次数] 次的候选,采用 C-value/NC-value 方法(Frantzi 等,2000)计算术语得分。按 [排序算法] 排序取前 [条数] 条,经人工核对上下文后得到 [条数] 条领域术语。

报告术语时,列出前若干条术语的出现次数、C-value 和它们的上位词,再说明人工核对的标准,读者就能判断术语表的质量。

11

小结

术语既要成词,几个词稳定地组合在一起,又要有术语性,指称领域里的专门概念。

TATOOLS 按词性序列模板取出 2 到 8 个词的候选,首尾停用词和出现次数过滤掉明显不是术语的组合。

C-value 给长候选加分,并扣掉只作为长术语一部分出现的次数,总是嵌在长术语里的片段会被扣到 0。

NC-value 在 C-value 上加入上下文词的权重,一个上下文词出现在越多术语周围,权重越高。

领域术语必收,排除词表里的不收,多个文件的结果合并成一张总表,术语表可以直接当分词词典用。

抽出术语以后,想看某个术语和哪些词固定搭配,可以用 TATOOLS 的【词语搭配强度分析】;想先把被切碎的新词找回来,用【智能发现新词】;想比较两批材料里哪些词用得明显更多,用【语料对比关键词分析】。

12

资料来源

Justeson 与 Katz:Technical Terminology: Some Linguistic Properties and an Algorithm for Identification in Text,Natural Language Engineering,第 1 卷第 1 期,1995

Kageura 与 Umino:Methods of Automatic Term Recognition: A Review,Terminology,第 3 卷第 2 期,1996

Frantzi、Ananiadou 与 Mima:Automatic Recognition of Multi-Word Terms: The C-value/NC-value Method,International Journal on Digital Libraries,第 3 卷第 2 期,2000


END