基于知识库的自动问答：seq2seq模型实践

最新推荐文章于 2024-07-02 10:02:18 发布

datayx

最新推荐文章于 2024-07-02 10:02:18 发布

阅读量1.6k

点赞数

原文链接：https://loveai.tech

版权

640?wx_fmt=gif

向AI转型的程序员都关注了这个号👇👇👇

机器学习AI算法工程公众号：datayx

问题描述

基于知识图谱的自动问答（Question Answering over Knowledge Base, 即 KBQA）问题的大概形式是，预先给定一个知识库（比如Freebase），知识库中包含着大量的先验知识数据，然后利用这些知识资源自动回答自然语言形态的问题（比如“肉夹馍是江苏的美食吗”，“虵今年多大了”等人民群众喜闻乐见的问题）。

什么是知识库

知识库（Knowledge Base），或者叫的比较烂俗点，知识图谱（Knowledge Graph），是以知识为主要单位，实体为主要载体，包含着现实生活中人们对万千事物的认知与各类事实的庞大数据库。一般来说，知识（或者事实）主要以三元组形式呈现：<头实体，关系，尾实体>，其中实体即人、地点、或特定概念等万物。举例来说，<虵，改变了，中国> 就是一条简单的三元组示例，其中头尾皆为知识库中固有的实体单元。

方法框架

先放个图

640?wx_fmt=png

对着图说：假设要回答“Where was Leslie Cheung born”这个问题，主要分四步：

实体识别（Named Entity Recognition），即把问题中的主要实体的名字从问题中抽出来，这样才知道应该去知识库中搜取哪个实体的信息来解决问题，即图中把“Leslie Cheung”这个人名抽出来；
实体链接（Entity Linking），把抽取出来的实体名和知识库中具体的实体对应起来，做这一步是因为，由于同名实体的存在，名字不是实体的唯一标识，实体独一无二的编号（id）才是，找到了实体名没卵用，必须要对应到知识库中具体的实体id，才能在知识库中把具体实体找到，获取相关信息。即图中将“Leslie Cheung”映射到“m.sdjk1s”这个 id 上（Freebase 的实体 id 是这个格式的）。这一步会存在一些问题，比如直接搜“姓名”叫“Leslie Cheung”的实体是搜不到的，因为“Leslie Cheung”其实是某个实体的“外文名”，他的“姓名”叫“张国荣”，以及有时候还会有多个叫“Leslie Cheung”的人。具体解决方式后面再说。
关系预测（Relation Prediction），根据原问句中除去实体名以外的其他词语预测出应该从知识库中哪个关系去解答这个问题，是整个问题中最主要的一步。即图中从“Where was <e> born”预测出“people.person.place_of_birth”（Freebase 的关系名格式，翻译过来就是“出生地”）这个关系应该连接着问题的主要实体“Leslie Cheung”与这个问题的答案。
找到了实体与关系，直接在知识库中把对应的三元组检索出来，即 “<m.sdjk1s,
people.person.place_of_birth, m.s1kjds>”，那么这条三元组的尾实体，即“m.s1kjds”就是问题的答案，查询其名字，就是“Hong Kong”。

数据集与工具

源代码与数据下载：

其中 data/origin 目录下是问答数据集的原始数据，鉴于实体识别与链接做起来比较麻烦，所以直接给出中间数据，data/seq2seq 目录下是已经经过前两步，可以直接用于训练 seq2seq 模型的数据。

本文项目代码方式：

关注微信公众号 datayx 然后回复问答即可获取。

AI项目体验地址 https://loveai.tech

数据集：

SimpleQuestions & WebQuestions 学术界问答领域比较喜闻乐见的两个数据集了，相当权威，当然都是英文，别问为什么不是中文
另外，知识库用的是 Freebase ，业界最权威的知识库之一了，当然也是英文的，别问为什么不是中文

工具：

Pytorch

依照惯例，还是先上结论

从 tensorflow 转过来发现，pytorch 真好用
问答问题目前的解决方法，框架基本都是上面说那四步，但是具体做法五花八门，模型各式各样，文中所用的 seq2seq 也只是一个简单实践，效果上比较如下图（out-of-state now 是业界目前最好结果，APVA-TURBO 是我最近在做的一篇论文）

640?wx_fmt=png

简单的 seq2seq 效果还不错，虽然跟学术界目前最好成绩有很大差距，但是还不错。后来我又加入了一些比如 KB embedding，turbo training 等一言难尽的补丁上去，变成现在的 APVA-TURBO 模型，在 WebQuestions 上已经快领先 8 个点了，但是文章里不提了，太乱了，直接发一个论文链接，感兴趣的可以深入研究

The APVA-TURBO Approach To Question Answering in Knowledge Base. Yue Wang, Richong Zhang, Cheng Xu and Yongyi Mao. Published 2018 in COLING

https://www.aclweb.org/anthology/C18-1170/

下面正式开编，详细讲一下用 seq2seq 模型做问答问题的过程以及 pytorch 的实现，个人浅见。

1 数据处理（包括实体识别与链接）

先贴一下数据集的原始数据形态，拿 SimpleQuestions 的数据贴一下，WebQuestions 的数据要比这个丑陋一些，就不提了。数据量方面，SimpleQuestions 的 train/test 是 75910/21687 ，WebQuestions 是 3778/2032

640?wx_fmt=png

SimpleQuestions 的原始数据中，每一行一个数据，分四列，中间用“\t”隔开，四列分别是头实体id，关系，尾实体id与问句内容

1.1 实体识别

首先训练实体识别模型，目标是给一个问题，能把问题中的实体名（entity mention）找到，方法就是喜闻乐见的 BIO 序列标注方法，模型用简单 LSTM 可以解决，或者再堆个 CRF 增强效果，序列标注在上一篇文章说过，“B” 即实体名的开始单词，“I” 为实体名的中间单词（或结尾词），“O” 为不是实体名的单词，输入一串单词序列，输出一串长度相同的由 BIO 组成的字母序列

640?wx_fmt=png

训练数据有了，开始训练模型，不是主要内容不细说了，放一个模型图

640?wx_fmt=png

这里 char-BiGRU 是从字母维度上的的 word embedding，以及 CRF layer，都是为了增强效果，简单做可以都省略

1.2 实体链接

找到了实体名，然后就是对应到 KB 中的具体实体。这一步做法比较简单，但是对最终效果的影响还是比较大的，包括在 KB 中能不能找到对应的实体，以及找到多个实体怎么排序的问题。直接说方法，首先收集 KB 中所有实体的名称（包括“name”“外文名”“别名”等等的），然后构建单词到实体 id 的反向 map 表，举个例子

640?wx_fmt=png

这里 Leslie 可以链接到两个实体，因为两个实体的名字中都含有 Leslie 这个单词。注意每一个括号里的数字，代表词（或词组）链接到这个实体的打分，计算方式就是这个词组的单词个数除以这个实体完整实体名的单词个数。

这里打分也可以适当考虑实体的知名度进去，比如“Leslie Cheung Kwok-wing”这个实体知名度更高，“Uncle Leslie”没怎么听说过，所以用户提这个问题更有可能是问关于前者的，所以前者的打分也要适当提高一些。具体操作方式可以很灵活，不细说了。

1.3 关系预测（seq2seq模型）

终于进入正题了。经过之前两步的数据处理，现在的数据基本是这个样子

640?wx_fmt=png

上面是输入下面是期望输出，输入中每条数据就是一个问句，由若干个单词组成的序列，其中已经把实体名拿走，用“<e>”这个标记词进行替换。输出是一个关系名，虽然由于 Freebase 的关系格式定义，一个关系名由三个用“.”拼接的单词组成，但是这里只把他当成一个完整的单词看待。其实关系预测本质上就是一个文本分类问题，给定所有的关系列表，输入一个文本，分类到一个最可能的关系上。

在这一步结束后，得到了预测出的关系名，再加上上一步实体链接得到的具体实体，就能从知识库中找到三元组，找到答案，从而解决问题了。下面具体讲关系预测的模型及实现代码细节。

2 模型搭建

先上一个模型图

640?wx_fmt=png

最简单的没有任何添加剂的纯天然的 seq2seq 模型，即 encoder-decoder 模型（当然也可以再加 attention 什么的上去，就不提了），左边（绿色）是一个双向 GRU（或 LSTM）（双向即两层，一层正向走一层反向走，然后把两层的最后结果加到一起，只用单向也可以，区别不大）作为 encoder，能把整个问题压缩成一个向量 u，右边是一个单向 GRU ，把向量 u 解压缩成一个关系，或关系序列，_GO 是表示序列开始生成的标记词，_EOS 是表示序列生成完毕的标记词。下面详细说一下为什么会是关系序列。这也是本来一个简单的多分类任务为什么不用简单的 RNN 分类模型而用 seq2seq 这种序列生成模型的原因。

有时候仅靠一个关系（一跳）并不能找到最终答案，比如“张国荣曾在哪个国家留学”，为了回答这个问题需要输出两个关系（两跳），第一跳是从“张国荣”通过“毕业院校”这个关系找到“英国里兹大学”这个实体，第二跳是从“英国里兹大学”通过“所属国家”这个关系找到“英国”这个最终答案。所以原来“张国荣出生在哪里”这个问题对应的输出序列是“出生地，_EOS”，而“张国荣曾在哪个国家留学”对应的输出序列就变成了“毕业院校，所属国家，_EOS”，需要输出的关系序列长度是不一样的，这也是 seq2seq 模型解决问答问题的优势所在。

Encoder

好了，编完了，下面上代码，首先是 Encoder

640?wx_fmt=png

source_vocab_size 是所有数据中涉及到的单词词表大小，hidden_size 是单词被压缩成的词向量维度，设 batch 的大小为 B，batch 内每个输入序列长度为 S，首先是形状 S*B 的张量进来，然后经过 embedding 得到 S*B*D 的张量，然后直接进 GRU ，得到结果 outputs 以及 hidden，这里因为使用了双向 GRU 所以 outputs 出来是 S*B*2D 的，hidden 出来是 2*B*D 的，需要压缩一下，outputs 在模型后面没有用到可以无所谓。这里再细说一下这个 pack_padded_sequence 的作用，这个函数机制真的是让我只想双击666

对于使用了 batch 的 GRU（或LSTM）来说，要求输入的 batch 中的每一个序列长度相同。但是一个 batch 里的问题有长有短，怎么可能都相同呢，所以就需要用一个没有意义的标记词（“_PAD”）把所有问题填充（Padding）到相同的长度，举个例子

640?wx_fmt=png

在这个大小为 3 的 batch 里，后两个问题因为长度不足都被 padding 到了 5 个单词，但是在推到 GRU 里运行的时候，我们只希望它们前面有效的单词进去就可以了，后面的 _PAD 填充过多时会严重影响最后出来的效果，bucket 机制或许可以适当解决这个问题，但是 pytorch 提供的这个 pack_padded_sequence 非常完美，它可以自动保证 _PAD 不会真正进入到 GRU 中影响效果，只需要你事先把 input_seqs 先按长度从大到小排列一下，然后把排序后每个序列的真正长度 input_lengths 传进来，比如这个例子里 input_lengths 就是 [5,4,3]，然后包装好放进 GRU 里， GRU 运行完了再用 pad_packed_sequence 这个函数解包一下，就 OK 了

Decoder

640?wx_fmt=png

Decoder 也比较简单，但是跟上面 Encoder 有个很大的区别就是这里 Decoder 一次只处理一个单词，假设期望输出序列长度是 M，需要运行 M 次，而上面 Encoder 是一次就把长度为 N 的序列都处理完。Decoder 不能这么做的原因是在它的下一次输入是上一次输出，只有先运行一遍得到第一个单词才能再去得到第二个单词，而不像 Encoder 一开始就知道整个输入序列。

run_epoch

encoder 和 decoder 搭完了，下面就是怎么把他们拼起来了，一个 S*D 的 batch 来了，先跑 encoder，得到 1*S*D 的 encoder_hidden，就是模型图中最重要的 u，然后设最长输出序列长度为 t，分 t 次运行 decoder 模型，一次输入一个单词，最初的输入单词为标记词“_GO”，并将 u 作为初始隐层塞到 decoder 里。

640?wx_fmt=png

先定义好参数优化器 optimizer，这里使用随机梯度下降算法（SGD），然后每输入一个 batch，运行一次 run_epoch 函数，计算一次 loss，更新一次参数，然后结束，返回这次 loss 的值；当 TRAIN=False，也就是测试的时候，不计算 loss 也不更新参数，直接对比真实输出与期望输出，返回准确度。

这里计算 loss 用了 masked_cross_entropy 这个函数。

他这个 loss 计算有一个很大的好处是什么呢，这就又涉及到 padding 的问题了，刚才说输入序列需要 padding，并且通过 pack_padded_sequence 避免了 _PAD 带来的影响，而输出序列也需要 padding，也需要一种措施避免影响，还是举个例子

640?wx_fmt=png

在这个大小为 3 的 batch 中，最长输出序列 t=3，后两条数据因为长度不足被加入了 _PAD 标记词，但是计算 loss 并更新参数的时候，我们只希望计算除 _PAD 以外的位置上的 loss，并不想关心 _PAD 上的 loss，因为没有意义，且会给效果带来影响。masked_cross_entropy 这个函数就通过一个 mask 矩阵把 _PAD 位置上的 loss 过滤掉了，非常流弊。具体不再细说了，可以看源码。

3 训练及测试

终于一切基础都搭完可以开始训练了，也没啥可以说的，直接放代码吧

640?wx_fmt=png

一共训练 num_epoch 轮，每轮通过 get_batch 这个函数制作一个 batch，运行一次 run_epoch 函数，更新一次模型，然后每隔 print_every 轮进行一次测试并打印结果，每隔 save_every 轮保存一次模型。get_batch 这个函数具体细节不写了，可以看源码。

问答问题目前的解决方法，框架基本都是上面说那四步，但是具体做法五花八门，模型各式各样，文中所用的 seq2seq 也只是一个简单实践，效果上比较如下图。简单的 seq2seq 效果还不错，虽然跟学术界目前最好成绩有很大差距，但是还不错。

原文地址 https://zhuanlan.zhihu.com/p/34585912

阅读过本文的人还看了以下文章：