上篇说明了文本怎样变成实体、关系与证据。下篇说明报告怎样把这张图变成数字和文字,其中哪些数字可以写进论文,哪些文字只是回到原文的线索。
下篇涉及的区块包括【这份结果说明了什么】【向这份材料提问】【网络结构指标】【知识图谱深度分析】、力导图中的主题板块、【实体关系速查】【手动合并同义实体】以及导出文件。
01
报告里有两套图口径
同一份报告在两种图上计算数字。读任何一个比例之前,先确认它来自哪一种。
第一种是有向多重图。每个实体是一个点,每条三元组是一条从主体指向客体的边。同一对实体之间可以有多条不同谓词的边,两个方向各自计数。力导图、【关系三元组】【关系谓词分布】【节点连接度排名】【知识图谱深度分析】【实体关系速查】和 GraphML 文件都使用这种图。
第二种是无向简单图。同一对实体之间的全部关系合并为一条边,不区分方向,去掉自环。每条边带一个权重,等于这对实体之间全部关系的证据条数之和,没有证据的关系记 1。【网络结构指标】和主题板块使用这种图。
两种图给出的数字不同。以一张 20 个实体、30 条关系的图为例,其中两对实体各有 2 条关系,其余每对只有 1 条,合并后得到 28 条边:
| 数字 | 有向多重图 | 无向简单图 |
|---|---|---|
| 网络密度 | 30 ÷ (20 × 19) = 7.9% | 2 × 28 ÷ (20 × 19) = 14.7% |
| 平均度 | 2 × 30 ÷ 20 = 3.0 | 2 × 28 ÷ 20 = 2.8 |
【知识图谱深度分析】卡显示的是左列,【网络结构指标】卡显示的是右列。写进论文的数字应取自【网络结构指标】卡,并同时报告实体数和边数。
02
网络结构指标逐项说明
【网络结构指标】卡只在较新的任务中出现。实体数不足 10 时,卡片顶部会提示指标仅供参考。
| 指标 | 计算范围 | 回答的问题 |
|---|---|---|
| 网络密度 | 无向简单图,不计边权 | 实际边数占所有可能边数的比例 |
| 平均度 | 无向简单图 | 每个实体平均连接几条边 |
| 聚类系数 | 无向简单图,全图平均 | 一个实体的邻居之间也互相连接的比例 |
| 连通分量 | 无向简单图 | 互不连通的子网个数、最大子网实体数和孤立实体数 |
| 平均路径长度、直径 | 最大连通分量 | 任意两个实体的平均最短步数与最远步数 |
| 度中心性 | 全图,归一化 | 直接连接最多的实体 |
| 接近中心性 | 全图,Wasserman–Faust 修正 | 到其他实体平均距离最短的实体 |
| 中介中心性 | 最大连通分量,归一化 | 位于最多最短路径上的实体 |
| 中心势 | 对应中心性 | 整个网络围绕少数实体集中的程度 |
| 模块度 Q | 主题板块分区 | 板块内部连接相对随机预期的富余程度 |
中介中心性在实体超过 2,000 个时改用 500 个源点抽样近似,方法说明会注明本次是否抽样。
三个中心性各有一个标签页,列出前 10 个实体和一行中心势。中心势按 Freeman 公式计算,以度中心势为例:
度中心势 = Σ(最高连接度 − 各实体连接度) ÷ [(n − 1)(n − 2)]
n 是实体数。0 表示所有实体连接度相同,1 表示一个实体连接其余全部实体而其余实体互不相连。
卡片下方的解读句按固定参照区间生成:
| 指标 | 页面参照 |
|---|---|
| 网络密度 | 0.5% 至 5% 为文本抽取网络的常见区间 |
| 平均度 | 2 以上表示多数实体不止出现在一条陈述里 |
| 聚类系数 | 高于密度的 3 倍表示实体倾向抱团 |
| 模块度 Q | 0.4 以上表示板块划分较清晰 |
这些区间是页面给出的经验参照,不是统计检验。它们帮助判断当前图偏稀疏还是偏集中,不能替代与具体研究问题相关的比较基线。
03
主题板块与模块度
主题板块由 Leiden 算法在无向加权图上划分,分辨率固定为 1.0,随机种子固定为 42。同一张图重复计算会得到相同划分。
板块按实体数从大到小编号。实体数不足 3 个的板块统一归入【零散实体】,在图例中以虚线胶囊显示,不生成摘要。
实体数达到 3 个的板块会得到一个不超过 8 个字的板块名和一段 80 至 120 字的摘要。板块名和摘要由模型根据该板块内部的前 15 个实体、前 20 条关系和最多 5 句证据写成,指令要求只使用这些内容。生成失败的板块显示为【主题 N】,没有摘要。
板块在力导图卡片中以色块条呈现,最多先显示 12 个,其余折叠。色块条同时是图例和筛选器:点击一个板块,图中只保留该板块的实体和板块内部的关系;再点一次恢复全图。选中后会显示该板块的摘要和最多 8 个核心实体。
模块度 Q 与板块来自同一次划分。Q 越高,板块内部的连接越多于随机预期。页面以 0.4 作为参照,高于 0.4 时说明板块划分较清晰,低于 0.4 时建议只把板块当作粗略分组线索。
板块是对这张图的一次完整划分,每个实体只属于一个板块。同时涉及两个议题的概念会被放进其中一个。板块名是模型对实体和关系的概括,不是抽取框架里的类目。
通过手动合并生成的新版本不重新计算板块,页面会在原位置显示一行提示。
04
顶部卡片说明了什么
【这份结果说明了什么】卡由页面根据网络结构自动组装,不做新的抽取。开头一句写明本次的实体数和关系数,随后的条目按以下规则出现:
| 条目 | 内容 | 出现与措辞规则 |
|---|---|---|
| 整体 | 实体数、关系数,是一张完整网络还是分成几个子域 | 总是显示 |
| 集中度 | 度中心势及其含义 | 有度中心势时显示;0.4 及以上写围绕少数实体,否则写多实体共同支撑 |
| 主题 | 板块数、靠前的 3 个板块名、Q 与 0.4 的比较 | 存在主题板块 |
| 谓词 | 谓词种类数、最高频谓词占比 | 总是显示;占比 45% 及以上时提示检查谓词是否笼统 |
| 缺口或覆盖 | 孤立实体数及占比,或没有孤立实体 | 总是显示其一 |
| 设置 | 本次框架名和同义合并组数 | 有框架记录时显示 |
卡片末尾的【怎么继续看】固定指向力导图、【关系三元组】表和【网络结构指标】卡。
05
深度分析卡与综合评分
【知识图谱深度分析】卡在页面内按有向多重图计算,所有任务都会显示。四个方块分别是网络密度、平均连接度、知识子域和关系类型。
网络密度按 15% 和 5% 两个门槛标为密集型、中等密度或稀疏型。知识子域等于连通分量数。关系类型等于谓词种类数,旁边注明孤立实体数。
右上角的【综合评分】和雷达图来自五个 0 至 100 的分数:
| 维度 | 计算方式 |
|---|---|
| 密度 | √网络密度 × 150,上限 100 |
| 连通性 | 最大连通分量实体数 ÷ 实体数 × 100 |
| 关系多样性 | √谓词种类数 × 30,上限 100 |
| 推理深度 | 最长有向链步数 × 25,上限 100 |
| 覆盖度 | (1 − 孤立实体数 ÷ 实体数) × 100 |
综合评分 = 0.15 × 密度 + 0.25 × 连通性 + 0.2 × 多样性 + 0.2 × 深度 + 0.2 × 覆盖度
沿用前文的 20 个实体、30 条关系的例子,再假设最大连通分量含 18 个实体、谓词 9 种、最长有向链 3 步、孤立实体 1 个。五个分数依次为 42、90、90、75、95,综合评分为 81。
雷达图标注为【图谱质量】,但五个维度都只描述图的形状:边够不够多、连成一片还是几片、谓词种类多不多、顺着箭头能走多远、有多少实体没有关系。没有任何一项衡量三元组是否正确。一批关系全部抽错但彼此连通的图,同样可以得到高分。
分数条按 70 和 40 两个门槛变色,只是显示区间。
卡片其余部分的口径如下:
【核心实体】列出连接度最高的 5 个实体,条形按最高连接度的比例绘制。
【关系模式】列出最高频的 5 个谓词、次数和占全部关系的比例,并统计各角色的实体数。
【信息枢纽】列出邻居角色种类达到 2 种、连接度达到 2 的实体,最多 3 个。这里的类型指上篇说明的结构角色。
【最长推理链】从连接度最高的 3 个实体出发,顺着箭头方向不重复地向外走,最多 5 步,取找到的最长一条。它是一条有向路径,不是推理过程,每一跳都需要单独核对。
【间接关系链】列出按表格顺序找到的前 3 条两跳链,未做排序。
【洞察解读】把上述数字拼成句子,密度高于 15% 或低于 3%、存在孤立实体、存在枢纽时各加一句。
06
三段自动生成的文字
报告中有三段由模型写成的文字。它们都以图谱摘要为输入,不重新读取原文,也不能提供图谱之外的事实。
【工作提纲】按框架命名,例如文献综述框架对应【文献综述提纲】,政策分析框架对应【政策分析提纲】。输入是连接度最高的 12 个实体和 40 条关系。指令要求写 4 至 6 个小节,每节 2 至 3 条不超过 30 字的要点,只使用给定的实体和关系。页面按两列显示,每节先显示 3 条,可展开。
【要点速览】位于【实体关系速查】卡的底部,列出 6 至 8 条问答,每条附一句适用场景。输入是一份不超过 2,800 字的图谱摘要,包含框架名、数量统计、前 10 个谓词、前 18 个实体、最多 60 条代表关系及其证据摘录和最多 8 组同义合并。问题不超过 24 字,回答不超过 80 字。前 4 个问题会作为【向这份材料提问】的起手问题。
【图谱质量诊断】是一段 200 至 300 字的文字,围绕实体覆盖度、关系粒度、连通性和改写建议展开。它的输入只有实体数、关系数、谓词种类数、前 10 个谓词和孤立实体数。它既没有读过原文,也没有读过具体的三元组,因此关于缺失了哪些重要实体的判断没有原文依据。
这三段文字中的每一个判断,都应能回指到【关系三元组】表中的某条关系。找不到对应关系的句子,不应当作结果引用。
07
实体关系速查
【实体关系速查】只查询已经抽出的图,不调用模型,也不消耗算力。先选一个【查询实体】,默认是连接度最高的实体;可以再选一个【对比实体】。
只选一个实体时,可查五个角度:
| 角度 | 返回内容 |
|---|---|
| 它是什么实体 | 角色、连接度、作为主体和客体的次数 |
| 直接关联了谁 | 全部直接关系,超过 10 条时只列前 10 条并给出总数 |
| 有没有同义表达 | 同簇实体,仅在存在时出现 |
| 常见关系类型 | 该实体最常见的 5 个谓词及次数 |
| 可推导哪些间接关系 | 以它为起点的两跳链,最多 3 条 |
选了对比实体后,可查两者分别是什么实体、是否有直接关系、有哪些共同关联,以及最短路径。最短路径不区分方向,最多找 5 跳,找不到时提示两者可能属于不同子域。
08
向这份材料提问
【向这份材料提问】允许用自然语言追问,回答附原文出处。它只对任务创建者开放,且要求任务已完成并在完成时建好了索引。较早的任务没有索引,不显示这张卡。
索引在任务完成时构建。原文按句末标点切成不超过 800 字的段落,每段记录来源文件;每段和每个实体名各计算一条语义向量;实体名和同簇别名在哪些段落里出现,也会被记录。
每次提问按以下步骤进行:
找出问题里点到的实体。匹配包括实体名和别名的包含匹配、4 字以上名称的部分重合,以及向量相似度最高的 8 个实体。
取命中实体的直接关系作为已知事实,最多 30 条。
检索段落。先取命中实体名下的段落,再按相似度补足;一次最多 6 段,为覆盖多份来源时最多 12 段,合计不超过 2,800 字。
生成回答。回答只依据这些段落和已知事实,第一句给结论,用方括号编号标出处,不超过 500 字。材料里确实没有相关信息时才说明没有。
一次也没检索到材料时,页面回复没有检索到相关材料,这次不扣算力也不计次。
每次提问相互独立,不带上一轮对话。问题里不要用它、这个之类的指代,直接写实体名。
当前额度是每个任务前 3 次免费,之后每次 1 算力,单个任务最多 200 次。次数按任务累计,切换版本不重置;只有回答成功生成才扣费。对话历史按版本保存最近 20 条。
能问到的只有索引里的原文段和图谱里的关系。用代词或简称提到某实体的段落不挂在该实体名下,只能靠相似度检索到。隔了两跳以上的关系不会自动带入已知事实。
09
手动合并生成新版本
自动合并可能漏掉同义实体。【手动合并同义实体】卡允许在当前报告上指定合并组,生成一份新报告,原报告保持不变。
操作顺序如下:
在【实体概览】表首列勾选两个及以上指向同一对象的实体。
在【保留为代表实体】中选择代表,默认取连接度最高的实体。
点击【加入待合并列表】。一个实体只能出现在一组中。
重复以上步骤,单次最多 50 组。
点击【提交合并】,页面显示本次消耗的算力,提交后跳转到新任务。
新任务只做数据变换,不重新抽取,也不调用模型。程序把各组成员的名称替换为代表名,合并重复的边,把成员的同簇实体并入代表实体,重新计算【统计概要】和【网络结构指标】,并把追问索引中的实体表按合并结果重映射。
新报告的【聚类合并详情】会注明有多少组来自上一份报告的手动合并。新报告不重新计算主题板块。新报告仍可继续合并,形成多个版本。
手动合并改变的只是名称归并。它不改变任何关系的方向、谓词或证据。
10
导出文件与论文写法
任务完成后可下载结果包。其中的表格文件包括:
| 文件 | 内容 |
|---|---|
| nodes | 实体、角色和同簇实体 |
| relationships | 三元组、置信度、证据和来源文件 |
| cluster_merges | 代表实体与每个被合并的别名 |
| edge_type_distribution | 每种谓词的出现次数 |
| domain_insights | 【统计概要】中的摘要条目 |
| metadata | 实体数、关系数等统计 |
| graph_metrics | 网络指标及其计算范围和参数 |
| centrality | 每个实体的度、中介和接近中心性 |
| citations | 每项指标对应的推荐文献 |
【图谱导出】卡提供 GraphML 文件,文件名为知识图谱加任务名。文件是有向图,节点带名称和角色,边带谓词和置信度,可导入 Gephi、yEd 或 Cytoscape。
GraphML 保存的是有向多重图。在外部软件中直接重算密度,得到的是【知识图谱深度分析】卡的口径,不是【网络结构指标】卡的口径。要复现后者,需要先忽略方向并合并平行边。
写进论文时,从【网络结构指标】卡取实体数、边数、密度、平均度、聚类系数、连通分量、中心性和模块度,并写明计算口径:无向简单图、边权为证据条数、密度不计边权、接近中心性经 Wasserman–Faust 修正、中介中心性在最大连通分量上计算、中心势按 Freeman 公式、Leiden 分辨率 1.0 与随机种子 42。
卡片内的【方法说明与推荐引用】列出每项指标的推荐文献和一句平台引用句式,均可一键复制。导出的 citations 表还包含大语言模型辅助抽取的披露参考。实体与关系由模型辅助抽取,论文中应说明所用框架类目,并报告抽样人工校验的一致率。
11
下篇的结果不能直接推出什么
网络指标描述抽取出的图,不描述原文,更不描述现实中的关系网络。
主题板块是对图的一次划分,每个实体只属于一个板块;板块名是模型概括,不是分类框架。
模块度 0.4 与密度 0.5% 至 5% 等参照值是页面给出的经验区间,不是统计检验。
综合评分与五维分数描述图的形状,不度量抽取是否正确。
工作提纲、要点速览、质量诊断和追问回答是对已有图谱的改写,不能提供图谱之外的新证据。
追问回答中没有被出处编号支持的句子,应视为未核对。
手动合并改变名称归并,不改变任何关系的方向、谓词或证据。
12
资料来源
Freeman:Centrality in Social Networks: Conceptual Clarification,Social Networks,197990021-7)
Freeman:A Set of Measures of Centrality Based on Betweenness,Sociometry,1977
Wasserman、Faust:Social Network Analysis: Methods and Applications,Cambridge University Press,1994
Watts、Strogatz:Collective Dynamics of Small-World Networks,Nature,1998
Newman:Modularity and Community Structure in Networks,PNAS,2006
Borgatti、Everett、Freeman:Ucinet for Windows: Software for Social Network Analysis,Analytic Technologies,2002
刘军:整体网分析:UCINET 软件实用指南(第三版),格致出版社
END
