【知识图谱】功能把上传的文本整理成一张有向图。图中的点是实体,边是关系。每条关系是一个三元组:主体、关系谓词、客体,并尽量附带一句原文证据。
这里的知识图谱不是百科式的权威知识库。它只记录当前这批文本被识别出的内容。实体名、谓词和证据都来自本次抽取,不来自外部资料。
这个功能可讲的内容较多,教程分上下两篇。上篇讲文本怎样变成三元组,以及报告中的基础区块怎样读。下篇讲网络结构指标、主题板块、自动生成的摘要、追问核对、手动合并和导出。
01
研究对象与分析单位
一次任务只产生一张图。上传的 1 至 5 个文件会按上传顺序拼接成一段全文,再进入同一轮抽取。多文件不会分别生成各自的图,报告也不提供按文件比较的区块。
图的基本单位有三种:
| 单位 | 含义 | 在报告中的位置 |
|---|---|---|
| 实体 | 一个名称字符串,如人物、组织、概念 | 节点、【实体概览】表 |
| 关系 | 主体、谓词、客体组成的三元组 | 边、【关系三元组】表 |
| 证据 | 支持该关系的一句原文引文 | 【关系三元组】表的【证据回溯】列 |
实体以名称为唯一标识。两处文本都写【生态环境部】,就是同一个节点。写法不同的同一对象会先成为两个节点,只有开启同义合并后才可能合成一个。
同名不同义的情况不会被区分。一篇材料里【苹果】既指水果又指公司,仍然只有一个节点。
02
文本怎样进入抽取
当前工具页接受 TXT 文件。上传 DOC、DOCX、PDF、PPTX、XLSX、EPUB、RTF 等常见格式时,系统先把它们转写为 TXT 再使用。进入抽取的是转写得到的纯文本。
上传限制如下:
| 限制 | 当前取值 |
|---|---|
| 文件数 | 1 至 5 个 |
| 单文件大小 | 不超过 10 MB |
| 合并后总字符数 | 至少约 500,至多 500,000 |
程序不做分句、分词、去停用词或任何清洗。拼接时会在每个文件正文前插入一行来源标记,格式是【来源文件:文件名】。这一行会和正文一起进入抽取。
03
抽取框架约束什么
【抽取框架】决定抽取时优先考虑哪些实体类目和关系谓词。当前提供 5 个预设框架和 1 个自定义框架。
| 框架 | 优先实体类目 | 优先关系谓词 |
|---|---|---|
| 通用知识图谱 | 人物、组织、地点、概念、事件、作品、方法、对象 | 包含、影响、导致、支持、反对、属于、发生于、使用、关联 |
| 文献综述 | 理论、概念、研究对象、研究方法、变量、数据来源、研究结论、学者或文献 | 提出、使用、解释、影响、验证、支持、反驳、扩展、适用于 |
| 政策分析 | 政策主体、治理对象、政策工具、目标任务、实施场景、约束条件、评价指标 | 发布、要求、支持、约束、促进、监管、服务于、适用于、协同 |
| 访谈/田野材料 | 受访者、组织、地点、事件、问题、需求、态度、行动、资源 | 经历、提到、评价、影响、参与、依赖、冲突于、需要、改变 |
| 教材/课程知识点 | 核心概念、子概念、人物、案例、方法、原理、阶段、应用场景 | 包含、解释、依赖、对比、应用于、发展为、举例、导致、属于 |
框架是偏好,不是硬性过滤。抽取指令要求优先选择符合这些类目的实体、优先使用这组谓词,同时明确规定文本不支持时不得强套。因此报告里可以出现框架之外的谓词。
框架里的实体类目不会成为报告中的标签。抽取只返回实体名,不返回它属于哪个类目。报告中的【角色】另有来源,下文单独说明。
选择【自定义框架】后,可以各输入最多 20 个实体类目和关系谓词。页面提供 3 个预置模板作为起点,点击后填入,仍可增删:
| 模板 | 实体类目 | 关系谓词 |
|---|---|---|
| 政策工具三维 | 政策主体、供给型工具、需求型工具、环境型工具、目标群体、政策目标、实施保障 | 运用、作用于、服务于、配套、约束、激励、协同 |
| 府际关系网络 | 中央部委、省级政府、市级政府、联合发文机构、政策文件、协作机制 | 联合发文、转发、落实、督导、授权、报送、协作 |
| 概念谱系 | 概念、提出者、学派、文献、时期、语境 | 提出、继承、修正、批判、融合、应用于、流行于 |
自定义框架下留空类目时,程序沿用通用知识图谱的类目。
04
分块、批次与两阶段抽取
全文先按【分块大小】切成片段。分块大小可在 1,000 至 10,000 字符之间按 1,000 调节,默认 6,000。
每个片段再按句号、问号、感叹号、分号或换行切成批次,每批不超过 1,500 字符。抽取以批次为单位分两个阶段进行:
实体阶段:每个批次单独识别实体,每批最多 80 个。指令要求返回具体的命名实体或领域术语,不把单独的数字、费用、评价维度或形容词当作实体。
关系阶段:每个批次在本批识别出的实体之间抽取三元组,每批最多 80 条。指令要求只返回该批文本明确支持的关系,并为每条关系附一句原文证据。
这个结构决定了三件事。
第一,关系抽取的窗口不超过 1,500 字符。分块大小设为 1,000 时窗口就是 1,000 字符;设为 2,000 以上时,窗口由批次上限决定。相隔更远的两个实体不会进入同一次关系抽取。
第二,实体跨批次按名称合并。同一个名称在第 1 批和第 7 批都被识别,最终只有一个节点,两批各自的关系都挂在它上面。图的连通主要靠这种同名合并形成。
第三,来源标记只出现在每个文件正文的开头。只有包含该标记的批次能读到文件名,其余批次抽出的关系可能没有来源文件。多文件任务中,【来源文件】徽章为空是正常现象。
个别批次的输出无法解析时,程序会跳过该批次的实体或关系,只保留能解析的部分。报告不单独提示哪些批次被跳过。
05
同义合并怎样进行
【聚类优化】开关默认开启。开启后,程序在全部批次抽取完成之后,分别对实体名和关系谓词做同义合并。
合并流程如下:
把所有实体名按字符顺序排序,每 120 个为一批交给模型判断。
模型只把明确指同一对象的名称归为一组,并指定一个代表名。
代表名不在本批名单中时,程序改用组内最短的名称作代表。
同一个名称只能属于一组。后出现的冲突组会被丢弃。
所有关系中的别名都替换为代表名,谓词同理。
不在同一批的名称不会被比较。首字相差很远的两个写法,可能因为落在不同批次而没有被合并。
合并结果出现在两个地方。【聚类合并详情】表列出每组的代表实体和被合并的同义表达。【实体概览】表和节点详情中的【同簇实体】列出同组的其他写法,最多显示 8 个。
关闭聚类后,每种写法各成一个节点,关系分散在这些节点上。
06
实体角色从哪里来
报告中每个实体有一个【角色】,取值为核心实体、主体、客体、关联实体或独立实体。角色由该实体在三元组中的位置计算,不来自抽取框架。
计算只用两个数:该实体作为主体出现的次数,以及作为客体出现的次数。两者之和是连接度。
| 角色 | 判定条件 |
|---|---|
| 独立实体 | 连接度为 0 |
| 核心实体 | 连接度不低于门槛,门槛取 3 与全图平均连接度 1.5 倍中的较大者 |
| 主体 | 主体次数超过客体次数的 1.5 倍 |
| 客体 | 客体次数超过主体次数的 1.5 倍 |
| 关联实体 | 其余情况 |
判定按表中顺序进行。一个实体先看是否孤立,再看是否达到核心门槛,然后才比较主客体方向。
角色只描述结构位置。【主体】不表示它在文本里是行动者,只表示它更多出现在三元组的左侧。同一实体在另一批材料里可以得到不同角色。
【实体概览】表允许直接修改某个实体的角色标签。修改只作用于当前页面显示,刷新后恢复,也不会写入导出文件。
07
置信度是什么
【关系三元组】表的【置信度】按固定公式计算,不来自模型对自己输出的评估,也不等于证据条数。
置信度 = 0.5 + 0.25 × 谓词频次比 + 0.25 × 端点度数比
谓词频次比等于该谓词出现次数除以出现最多的谓词次数。端点度数比等于主体连接度与客体连接度之和,除以最高连接度的 2 倍。结果保留三位小数,页面显示为百分比。
按这个公式,置信度总在 50% 以上。最高频谓词连接两个最高连接度实体时得到 100%。
一个可复现的例子:某图最高频谓词出现 10 次,最高连接度为 20。一条只出现 1 次的谓词,连接两个连接度都为 1 的实体,其置信度为 0.5 + 0.025 + 0.0125,约 54%。
页面用三种徽章区分区间:80% 及以上、60% 至 80%、60% 以下。徽章只反映谓词是否常见和端点是否活跃。低置信度的关系可能恰好是文本中独特的细节。
08
证据回溯怎样使用
每条关系在抽取时会带回一句原文引文,以及可能的来源文件名。相同文本和来源的证据去重后,每条关系最多保留 3 条。
【关系三元组】表显示第一条证据的前两行,以及来源文件徽章。证据是模型从批次文本中摘出的句子,用于定位原文,不用于证明关系成立。
核对时应回到原文检查三件事:引文是否确实出现在材料中;主体和客体是否就是引文所指的对象;谓词方向是否与原文一致。
09
报告的基础区块怎样读
统计概要
四个数字分别是实体数量、关系数量、关系谓词种类和聚类合并组数。关系数量按三元组计数,同一对实体之间的多条不同谓词分别计入。
下方【摘要】徽章列出合并组数、最多 5 组合并示例和最多 5 个高频谓词及其次数。
力导图
节点大小按连接度绘制,箭头由主体指向客体。没有主题板块时,颜色表示实体角色;有主题板块时颜色表示所属板块,下篇说明。
点击节点只显示它的直接关联,点击空白恢复全图。右侧节点详情列出该实体的同簇实体和全部相关关系。
实体不少于 10 个时出现筛选条。滑块标注为【前 N 个主题】,实际按连接度保留前 N 个实体及它们的直接关联。搜索框按实体名包含匹配。
实体概览
表格列出实体名称、角色、连接度和同簇实体。可以按角色筛选,按连接度、名称或角色排序,点击行打开节点详情。
关系三元组
表格列出主体、谓词、客体、置信度和证据回溯。可以按谓词筛选,也可以按实体名或谓词搜索。这是核对证据的主要入口。
关系谓词分布
表格列出每种谓词的出现次数和占比,占比的分母是关系数量。上方的说明按最高频谓词的占比给出一个集中程度标签:
| 最高频谓词占比 | 标签 |
|---|---|
| 45% 及以上 | 高度集中 |
| 25% 至 45% | 相对集中 |
| 25% 以下 | 较分散 |
说明还会给出前三类谓词的合计占比,以及只出现 1 次的谓词种数。高频谓词占比高时,应检查它是否过于笼统,例如【关联】或【包含】。
节点连接度排名
表格按连接度排序,占比等于该实体连接度除以关系数量。每条关系同时计入主体和客体,所以全部实体的占比之和是 200%。
上方说明给出最高连接度实体的占比、前 5 个实体覆盖的去重关系比例和孤立实体数。前 5 个实体覆盖的关系是去重计数,与逐个实体的占比相加不同。
关键词锚定
输入若干关键词后,页面按包含匹配列出命中的实体和关系。匹配范围包括实体名、角色名和同簇实体,关系按主体名、客体名和谓词匹配。页面同时提供核心实体、高频谓词和角色作为可点选的候选词。
10
在工具页怎样准备与提交
先决定这批材料要回答什么问题,再选择对应的抽取框架。框架影响优先类目和谓词,不改变分块和合并规则。
把材料整理成叙述完整的段落。清单、目录和并列名单会产生很多没有关系的实体。
让需要建立关系的对象出现在同一段落内。相隔超过 1,500 字符的两个实体不会进入同一次关系抽取。
上传 1 至 5 个文件,合计不超过 500,000 字符。
保留默认的 6,000 字符分块,除非需要把窗口压到 1,000 字符。
保持【聚类优化】开启。需要保留原始写法差异时再关闭。
提交任务。相同文件与相同设置重复提交时,系统直接复用已完成的结果,不重新抽取。
11
上篇的结果不能直接推出什么
抽取到的三元组不等于事实成立。它只表示模型认为某句原文支持这条关系。
没有抽到的关系不等于原文没有。窗口限制、批次跳过和指令约束都会造成遗漏。
同名实体一律合并,不同写法未必合并。实体数量不能直接当作对象数量。
谓词是自由文本。即使选择了框架,同一种关系仍可能被写成不同谓词。
置信度描述谓词和端点的结构位置,不描述关系是否正确。
角色描述实体在三元组中的方向,不描述它在事件中的作用。
多文件任务生成一张合并图。来源文件只在部分关系上可见,不能据此比较文件。
下篇从这张图出发,说明网络结构指标、主题板块和自动生成的摘要各自能说明什么,以及怎样用追问和手动合并核对与修正结果。
12
资料来源
Ji 等:A Survey on Knowledge Graphs: Representation, Acquisition, and Applications,IEEE TNNLS,2022
Niklaus 等:A Survey on Open Information Extraction,COLING,2018
END
