返回教程列表
文本分析基础教程知识图谱网络分析主题板块证据核对

知识图谱抽取教程(下):网络指标、主题板块与追问核对

本教程区分知识图谱报告中的有向多重图与无向简单图,解释网络密度、中心性、中心势、主题板块、模块度和综合评分的计算范围,并说明自动文字、实体速查、材料追问、手动合并及导出结果怎样回到原文证据核对。

作者:TATOOLS 研究团队|更新于 2026-09-02|6329 字|约 22 分钟读完
knowledge-extraction
立即使用

上篇说明了文本怎样变成实体、关系与证据。下篇说明报告怎样把这张图变成数字和文字,其中哪些数字可以写进论文,哪些文字只是回到原文的线索。

下篇涉及的区块包括【这份结果说明了什么】【向这份材料提问】【网络结构指标】【知识图谱深度分析】、力导图中的主题板块、【实体关系速查】【手动合并同义实体】以及导出文件。

01

报告里有两套图口径

同一份报告在两种图上计算数字。读任何一个比例之前,先确认它来自哪一种。

第一种是有向多重图。每个实体是一个点,每条三元组是一条从主体指向客体的边。同一对实体之间可以有多条不同谓词的边,两个方向各自计数。力导图、【关系三元组】【关系谓词分布】【节点连接度排名】【知识图谱深度分析】【实体关系速查】和 GraphML 文件都使用这种图。

第二种是无向简单图。同一对实体之间的全部关系合并为一条边,不区分方向,去掉自环。每条边带一个权重,等于这对实体之间全部关系的证据条数之和,没有证据的关系记 1。【网络结构指标】和主题板块使用这种图。

两种图给出的数字不同。以一张 20 个实体、30 条关系的图为例,其中两对实体各有 2 条关系,其余每对只有 1 条,合并后得到 28 条边:

数字 有向多重图 无向简单图
网络密度 30 ÷ (20 × 19) = 7.9% 2 × 28 ÷ (20 × 19) = 14.7%
平均度 2 × 30 ÷ 20 = 3.0 2 × 28 ÷ 20 = 2.8

【知识图谱深度分析】卡显示的是左列,【网络结构指标】卡显示的是右列。写进论文的数字应取自【网络结构指标】卡,并同时报告实体数和边数。

02

网络结构指标逐项说明

【网络结构指标】卡只在较新的任务中出现。实体数不足 10 时,卡片顶部会提示指标仅供参考。

指标 计算范围 回答的问题
网络密度 无向简单图,不计边权 实际边数占所有可能边数的比例
平均度 无向简单图 每个实体平均连接几条边
聚类系数 无向简单图,全图平均 一个实体的邻居之间也互相连接的比例
连通分量 无向简单图 互不连通的子网个数、最大子网实体数和孤立实体数
平均路径长度、直径 最大连通分量 任意两个实体的平均最短步数与最远步数
度中心性 全图,归一化 直接连接最多的实体
接近中心性 全图,Wasserman–Faust 修正 到其他实体平均距离最短的实体
中介中心性 最大连通分量,归一化 位于最多最短路径上的实体
中心势 对应中心性 整个网络围绕少数实体集中的程度
模块度 Q 主题板块分区 板块内部连接相对随机预期的富余程度

中介中心性在实体超过 2,000 个时改用 500 个源点抽样近似,方法说明会注明本次是否抽样。

三个中心性各有一个标签页,列出前 10 个实体和一行中心势。中心势按 Freeman 公式计算,以度中心势为例:

度中心势 = Σ(最高连接度 − 各实体连接度) ÷ [(n − 1)(n − 2)]

n 是实体数。0 表示所有实体连接度相同,1 表示一个实体连接其余全部实体而其余实体互不相连。

卡片下方的解读句按固定参照区间生成:

指标 页面参照
网络密度 0.5% 至 5% 为文本抽取网络的常见区间
平均度 2 以上表示多数实体不止出现在一条陈述里
聚类系数 高于密度的 3 倍表示实体倾向抱团
模块度 Q 0.4 以上表示板块划分较清晰

这些区间是页面给出的经验参照,不是统计检验。它们帮助判断当前图偏稀疏还是偏集中,不能替代与具体研究问题相关的比较基线。

03

主题板块与模块度

主题板块由 Leiden 算法在无向加权图上划分,分辨率固定为 1.0,随机种子固定为 42。同一张图重复计算会得到相同划分。

板块按实体数从大到小编号。实体数不足 3 个的板块统一归入【零散实体】,在图例中以虚线胶囊显示,不生成摘要。

实体数达到 3 个的板块会得到一个不超过 8 个字的板块名和一段 80 至 120 字的摘要。板块名和摘要由模型根据该板块内部的前 15 个实体、前 20 条关系和最多 5 句证据写成,指令要求只使用这些内容。生成失败的板块显示为【主题 N】,没有摘要。

板块在力导图卡片中以色块条呈现,最多先显示 12 个,其余折叠。色块条同时是图例和筛选器:点击一个板块,图中只保留该板块的实体和板块内部的关系;再点一次恢复全图。选中后会显示该板块的摘要和最多 8 个核心实体。

模块度 Q 与板块来自同一次划分。Q 越高,板块内部的连接越多于随机预期。页面以 0.4 作为参照,高于 0.4 时说明板块划分较清晰,低于 0.4 时建议只把板块当作粗略分组线索。

板块是对这张图的一次完整划分,每个实体只属于一个板块。同时涉及两个议题的概念会被放进其中一个。板块名是模型对实体和关系的概括,不是抽取框架里的类目。

通过手动合并生成的新版本不重新计算板块,页面会在原位置显示一行提示。

04

顶部卡片说明了什么

【这份结果说明了什么】卡由页面根据网络结构自动组装,不做新的抽取。开头一句写明本次的实体数和关系数,随后的条目按以下规则出现:

条目 内容 出现与措辞规则
整体 实体数、关系数,是一张完整网络还是分成几个子域 总是显示
集中度 度中心势及其含义 有度中心势时显示;0.4 及以上写围绕少数实体,否则写多实体共同支撑
主题 板块数、靠前的 3 个板块名、Q 与 0.4 的比较 存在主题板块
谓词 谓词种类数、最高频谓词占比 总是显示;占比 45% 及以上时提示检查谓词是否笼统
缺口或覆盖 孤立实体数及占比,或没有孤立实体 总是显示其一
设置 本次框架名和同义合并组数 有框架记录时显示

卡片末尾的【怎么继续看】固定指向力导图、【关系三元组】表和【网络结构指标】卡。

05

深度分析卡与综合评分

【知识图谱深度分析】卡在页面内按有向多重图计算,所有任务都会显示。四个方块分别是网络密度、平均连接度、知识子域和关系类型。

网络密度按 15% 和 5% 两个门槛标为密集型、中等密度或稀疏型。知识子域等于连通分量数。关系类型等于谓词种类数,旁边注明孤立实体数。

右上角的【综合评分】和雷达图来自五个 0 至 100 的分数:

维度 计算方式
密度 √网络密度 × 150,上限 100
连通性 最大连通分量实体数 ÷ 实体数 × 100
关系多样性 √谓词种类数 × 30,上限 100
推理深度 最长有向链步数 × 25,上限 100
覆盖度 (1 − 孤立实体数 ÷ 实体数) × 100

综合评分 = 0.15 × 密度 + 0.25 × 连通性 + 0.2 × 多样性 + 0.2 × 深度 + 0.2 × 覆盖度

沿用前文的 20 个实体、30 条关系的例子,再假设最大连通分量含 18 个实体、谓词 9 种、最长有向链 3 步、孤立实体 1 个。五个分数依次为 42、90、90、75、95,综合评分为 81。

雷达图标注为【图谱质量】,但五个维度都只描述图的形状:边够不够多、连成一片还是几片、谓词种类多不多、顺着箭头能走多远、有多少实体没有关系。没有任何一项衡量三元组是否正确。一批关系全部抽错但彼此连通的图,同样可以得到高分。

分数条按 70 和 40 两个门槛变色,只是显示区间。

卡片其余部分的口径如下:

【核心实体】列出连接度最高的 5 个实体,条形按最高连接度的比例绘制。

【关系模式】列出最高频的 5 个谓词、次数和占全部关系的比例,并统计各角色的实体数。

【信息枢纽】列出邻居角色种类达到 2 种、连接度达到 2 的实体,最多 3 个。这里的类型指上篇说明的结构角色。

【最长推理链】从连接度最高的 3 个实体出发,顺着箭头方向不重复地向外走,最多 5 步,取找到的最长一条。它是一条有向路径,不是推理过程,每一跳都需要单独核对。

【间接关系链】列出按表格顺序找到的前 3 条两跳链,未做排序。

【洞察解读】把上述数字拼成句子,密度高于 15% 或低于 3%、存在孤立实体、存在枢纽时各加一句。

06

三段自动生成的文字

报告中有三段由模型写成的文字。它们都以图谱摘要为输入,不重新读取原文,也不能提供图谱之外的事实。

【工作提纲】按框架命名,例如文献综述框架对应【文献综述提纲】,政策分析框架对应【政策分析提纲】。输入是连接度最高的 12 个实体和 40 条关系。指令要求写 4 至 6 个小节,每节 2 至 3 条不超过 30 字的要点,只使用给定的实体和关系。页面按两列显示,每节先显示 3 条,可展开。

【要点速览】位于【实体关系速查】卡的底部,列出 6 至 8 条问答,每条附一句适用场景。输入是一份不超过 2,800 字的图谱摘要,包含框架名、数量统计、前 10 个谓词、前 18 个实体、最多 60 条代表关系及其证据摘录和最多 8 组同义合并。问题不超过 24 字,回答不超过 80 字。前 4 个问题会作为【向这份材料提问】的起手问题。

【图谱质量诊断】是一段 200 至 300 字的文字,围绕实体覆盖度、关系粒度、连通性和改写建议展开。它的输入只有实体数、关系数、谓词种类数、前 10 个谓词和孤立实体数。它既没有读过原文,也没有读过具体的三元组,因此关于缺失了哪些重要实体的判断没有原文依据。

这三段文字中的每一个判断,都应能回指到【关系三元组】表中的某条关系。找不到对应关系的句子,不应当作结果引用。

07

实体关系速查

【实体关系速查】只查询已经抽出的图,不调用模型,也不消耗算力。先选一个【查询实体】,默认是连接度最高的实体;可以再选一个【对比实体】。

只选一个实体时,可查五个角度:

角度 返回内容
它是什么实体 角色、连接度、作为主体和客体的次数
直接关联了谁 全部直接关系,超过 10 条时只列前 10 条并给出总数
有没有同义表达 同簇实体,仅在存在时出现
常见关系类型 该实体最常见的 5 个谓词及次数
可推导哪些间接关系 以它为起点的两跳链,最多 3 条

选了对比实体后,可查两者分别是什么实体、是否有直接关系、有哪些共同关联,以及最短路径。最短路径不区分方向,最多找 5 跳,找不到时提示两者可能属于不同子域。

08

向这份材料提问

【向这份材料提问】允许用自然语言追问,回答附原文出处。它只对任务创建者开放,且要求任务已完成并在完成时建好了索引。较早的任务没有索引,不显示这张卡。

索引在任务完成时构建。原文按句末标点切成不超过 800 字的段落,每段记录来源文件;每段和每个实体名各计算一条语义向量;实体名和同簇别名在哪些段落里出现,也会被记录。

每次提问按以下步骤进行:

1

找出问题里点到的实体。匹配包括实体名和别名的包含匹配、4 字以上名称的部分重合,以及向量相似度最高的 8 个实体。

2

取命中实体的直接关系作为已知事实,最多 30 条。

3

检索段落。先取命中实体名下的段落,再按相似度补足;一次最多 6 段,为覆盖多份来源时最多 12 段,合计不超过 2,800 字。

4

生成回答。回答只依据这些段落和已知事实,第一句给结论,用方括号编号标出处,不超过 500 字。材料里确实没有相关信息时才说明没有。

一次也没检索到材料时,页面回复没有检索到相关材料,这次不扣算力也不计次。

每次提问相互独立,不带上一轮对话。问题里不要用它、这个之类的指代,直接写实体名。

当前额度是每个任务前 3 次免费,之后每次 1 算力,单个任务最多 200 次。次数按任务累计,切换版本不重置;只有回答成功生成才扣费。对话历史按版本保存最近 20 条。

能问到的只有索引里的原文段和图谱里的关系。用代词或简称提到某实体的段落不挂在该实体名下,只能靠相似度检索到。隔了两跳以上的关系不会自动带入已知事实。

09

手动合并生成新版本

自动合并可能漏掉同义实体。【手动合并同义实体】卡允许在当前报告上指定合并组,生成一份新报告,原报告保持不变。

操作顺序如下:

1

在【实体概览】表首列勾选两个及以上指向同一对象的实体。

2

在【保留为代表实体】中选择代表,默认取连接度最高的实体。

3

点击【加入待合并列表】。一个实体只能出现在一组中。

4

重复以上步骤,单次最多 50 组。

5

点击【提交合并】,页面显示本次消耗的算力,提交后跳转到新任务。

新任务只做数据变换,不重新抽取,也不调用模型。程序把各组成员的名称替换为代表名,合并重复的边,把成员的同簇实体并入代表实体,重新计算【统计概要】和【网络结构指标】,并把追问索引中的实体表按合并结果重映射。

新报告的【聚类合并详情】会注明有多少组来自上一份报告的手动合并。新报告不重新计算主题板块。新报告仍可继续合并,形成多个版本。

手动合并改变的只是名称归并。它不改变任何关系的方向、谓词或证据。

10

导出文件与论文写法

任务完成后可下载结果包。其中的表格文件包括:

文件 内容
nodes 实体、角色和同簇实体
relationships 三元组、置信度、证据和来源文件
cluster_merges 代表实体与每个被合并的别名
edge_type_distribution 每种谓词的出现次数
domain_insights 【统计概要】中的摘要条目
metadata 实体数、关系数等统计
graph_metrics 网络指标及其计算范围和参数
centrality 每个实体的度、中介和接近中心性
citations 每项指标对应的推荐文献

【图谱导出】卡提供 GraphML 文件,文件名为知识图谱加任务名。文件是有向图,节点带名称和角色,边带谓词和置信度,可导入 Gephi、yEd 或 Cytoscape。

GraphML 保存的是有向多重图。在外部软件中直接重算密度,得到的是【知识图谱深度分析】卡的口径,不是【网络结构指标】卡的口径。要复现后者,需要先忽略方向并合并平行边。

写进论文时,从【网络结构指标】卡取实体数、边数、密度、平均度、聚类系数、连通分量、中心性和模块度,并写明计算口径:无向简单图、边权为证据条数、密度不计边权、接近中心性经 Wasserman–Faust 修正、中介中心性在最大连通分量上计算、中心势按 Freeman 公式、Leiden 分辨率 1.0 与随机种子 42。

卡片内的【方法说明与推荐引用】列出每项指标的推荐文献和一句平台引用句式,均可一键复制。导出的 citations 表还包含大语言模型辅助抽取的披露参考。实体与关系由模型辅助抽取,论文中应说明所用框架类目,并报告抽样人工校验的一致率。

11

下篇的结果不能直接推出什么

网络指标描述抽取出的图,不描述原文,更不描述现实中的关系网络。

主题板块是对图的一次划分,每个实体只属于一个板块;板块名是模型概括,不是分类框架。

模块度 0.4 与密度 0.5% 至 5% 等参照值是页面给出的经验区间,不是统计检验。

综合评分与五维分数描述图的形状,不度量抽取是否正确。

工作提纲、要点速览、质量诊断和追问回答是对已有图谱的改写,不能提供图谱之外的新证据。

追问回答中没有被出处编号支持的句子,应视为未核对。

手动合并改变名称归并,不改变任何关系的方向、谓词或证据。

12

资料来源

Freeman:Centrality in Social Networks: Conceptual Clarification,Social Networks,197990021-7)

Freeman:A Set of Measures of Centrality Based on Betweenness,Sociometry,1977

Wasserman、Faust:Social Network Analysis: Methods and Applications,Cambridge University Press,1994

Watts、Strogatz:Collective Dynamics of Small-World Networks,Nature,1998

Newman:Modularity and Community Structure in Networks,PNAS,2006

Traag、Waltman、van Eck:From Louvain to Leiden: Guaranteeing Well-Connected Communities,Scientific Reports,2019

Borgatti、Everett、Freeman:Ucinet for Windows: Software for Social Network Analysis,Analytic Technologies,2002

刘军:整体网分析:UCINET 软件实用指南(第三版),格致出版社


END