BERT+知识图谱：北大-腾讯联合推出知识赋能的K-BERT模型

最新推荐文章于 2025-03-10 11:30:07 发布

PaperWeekly

最新推荐文章于 2025-03-10 11:30:07 发布

阅读量3.4k

点赞数 3

本文链接：https://blog.csdn.net/c9Yv2cf9I06K2A9E/article/details/103790278

版权

K-BERT模型通过结合知识图谱，解决了预训练语言模型在特定领域知识驱动任务上的不足。该模型在开放领域任务上略有提升，但在需要背景知识的任务上表现出色，特别是在金融问答、法律问答等特定领域。论文已被AAAI-2020收录，源码已开源。

摘要生成于 C知道，由 DeepSeek-R1 满血版支持，前往体验 >

作者丨周鹏

单位丨腾讯

研究方向丨自然语言处理、知识图谱

背景

近两年，谷歌 BERT 等无监督预训练语言表示模型在多个 NLP 任务中均取得了可喜的成果。这些模型在大规模开放域语料库上进行了预训练，以获得通用的语言表示形式，然后在特定的下游任务中进行了微调，以吸收特定领域的知识。但是，由于预训练和微调之间的领域差异，这些模型在知识驱动的任务上表现不佳。例如，在医疗领域处理电子病历（EMR）分析任务时，经过 Wikipedia 预训练的 Google BERT 无法充分发挥其价值。

当阅读特定领域文本时，普通人只能根据其上下文理解单词，而专家则可以利用相关领域知识进行推断。目前公开的 BERT、GPT、XLNet 等预训练模型均是在开放领域语料预训练得到的，其就像一个普通人，虽然能够读懂通用文本，但是对于专业领域文本时却缺乏一定的背景知识。

解决这一问题的一个方法是使用专业语料预训练模型，但是预训练的过程是十分耗时和耗计算资源的，普通研究者通常难以实现。例如，如果我们希望模型获得“扑热息痛可以治疗感冒”的知识，则在训练语料库中需要大量同时出现“扑热息痛”和“感冒”的句子。不仅如此，通过领域语料预训练的方式引入专家知识，其可解释性和可控性较差。

除了以上策略，我们还能做些什么来使模型成为领域专家？知识图谱（Knowledge Graph，KG）是一个很好的解决方案。

随着知识细化为结构化形式，许多领域的 KG 都被构建起来，例如，医学领域的 SNOMED-CT，中国概念的 HowNet。如果 KG 可以集成到预训练语言模型中，它将为模型配备领域知识，从而提高模型在特定领域任务上的性能，同时降低大规模的预训练成本。此外，知识图谱具有很高的可解释性，因为可以手动编辑注入的知识。

目前，将知识图谱与语言模型结合的研究有哪些呢？最具代表性的就是清华的 ERNIE，其使用一个独立的 TransE 算法获得实体向量，然后再将实体向量嵌入到 BERT 中。清华 ERNIE 的工作很有借鉴意义，但是仍然存在一些可改进的地方，例如：

1. 知识图谱中的关系信息没有被用到；

2. 实体向量和词向量是使用不同的方法得到的，可能存在空间的不一致；

3. 对于实体数量巨大的大规模知识图谱，实体向量表将占据很大的内存。

另外，将过多的知识引入到语言表示模型中，可能会改变原来句子的含义，本文称为知识噪声问题。为了解决以上问题，本文的研究人员尝试不区分实体向量和词向量，使用统一的向量空间将知识注入语言表示模型中。

方法

基于以上想法，研究人员对 Google BERT 进行了一定的改进，提出了 K-BERT 模型。下面介绍 K-BERT 的具体思想，图 1 是 K-BERT 的总体架构图。

▲ 图1. K-BERT总体架构图

当一个句子“Tim Cook is currently visiting Beijing now”输入时，首先会经过一个知识层（Knowledge Layer），知识层将知识图谱中关联到的三元组信息（Apple-CEO-Tim Cook、Beijing-capital-China 等）注入到句子中，形成一个富有背景知识的句子树（Sentence tree）。

可以看出，通过知识层，一个句子序列被转换成了一个树结构或图结构，其中包含了句子中原本没有的背景知识，即我们知道“苹果的 CEO 现在在中国”。

得到了句子树以后，问题出现了。传统的 BERT 类模型，只能处理序列结构的句子输入，而图结构的句子树是无法直接输入到 BERT 模型中的。如果强行把句子树平铺成序