基于BERT的知识库问答系统
简介
知识库问答可以主要分为两个模块,问题实体识别模块和属性匹配模块,系统整体流程图如下:
![在这里插入图片描述](https://i-blog.csdnimg.cn/blog_migrate/b075fab63d09ee4f93dfc264ee4c73c9.png)
数据
此次使用的数据集来自NLPCC ICCPOL 2016 KBQA 任务集,其包含 14 609 个问答对的训练集和包含 9 870 个问答对的测试集。 并提供一个知识库,包含 6 502 738 个实体、 587 875 个属性以及 43 063 796 个 三元组。知识库文件中每行存储一个事实( fact) ,即三元组 ( 实体、属性、属性值) 。
知识库样例如下,共有43063796行:
![image](https://i-blog.csdnimg.cn/blog_migrate/9057a2c34eadaa78620b1d734c10ddb9.png)
训练NER的数据格式如下:
![在这里插入图片描述](https://i-blog.csdnimg.cn/blog_migrate/6a9c68234c32fe43579f86b06675fcfa.png)
训练BERT二分类的数据如下:
![在这里插入图片描述](https://i-blog.csdnimg.cn/blog_migrate/5e580e4687c5f1723de39fb9d862292f.png)