关键短语抽取及使用BERT-CRF的技术实践

最新推荐文章于 2024-06-10 09:31:57 发布

火星种萝卜

最新推荐文章于 2024-06-10 09:31:57 发布

阅读量922

点赞数

分类专栏：知识图谱

原文链接：https://zhuanlan.zhihu.com/p/148502336?from_voters_page=true

版权

知识图谱专栏收录该内容

62 篇文章 1 订阅

订阅专栏

BERT[23]是非常优质的预训练模型，包含了很多预训练语料中蕴含的外部知识和信息。我们以此为基础，训练BERT-CRF模型，作为candidate generation中重要的一路召回。另外的召回路包括基于模板（pattern）和基于POS tags的NP抽取系统。CRF[12]是序列标注的经典方法，其核心思想是在进行序列标注时，把序列上的各个点当做一个整体来处理，而不是一个个独立的点，各个点的标注结果是有一定依赖关系的，以路径为单位进行训练。因此，通过训练，模型能在理解文本以外，还能理解输出序列的规则性知识，比如，使用BIO标注模式时，O后面不能直接接I。如果直接使用BERT进行序列标注，最后一层的softmax，本质上是n个k分类问题；而BERT-CRF由于CRF layer的存在，本质上是1个k^n分类问题[24]。

Figure 9 BERT与BERT-CRF的对比[24]

为了验证BERT-CRF确实能够提供我们需要的鲁棒的关键短语抽取能力，我们在NER和概念图谱（抽取该应用下定义的keyphrase）两个数据集上进行了以下的实验。

NER
▫ 来源：https://github.com/zjy-ucas/ChineseNER (PER, LOC, OR)
▫ 特点：标准明确且基本固定
概念图谱中的关键短语抽取
▫ 来源
▪ 自有的标注数据（标准按照前述的两个特点：用户视角 & 精准和泛化）
▪ 训练集：来自于sourceA (网络爬取文章)
▪ 测试集：来自于sourceB (平安自有文章)

▫ 特点：存在前述的概念飘移问题

对于概念图谱的关键短语抽取，我们希望在sourceA上训练的模型，能够更好地适应于sourceB（当然，我们最终的系统是在sourceA + sourceB + all other sources训练得到的）。实验设定中训练和测试集采用不同来源，是为了在开发阶段，检验搭建的模块是否能够提供我们需要的鲁棒性。

NER数据集上的实验

https://zhuanlan.zhihu.com/p/148502336?from_voters_page=true

火星种萝卜

关注

0
点赞
踩
1

收藏

觉得还不错? 一键收藏
0
评论
关键短语抽取及使用BERT-CRF的技术实践

BERT[23]是非常优质的预训练模型，包含了很多预训练语料中蕴含的外部知识和信息。我们以此为基础，训练BERT-CRF模型，作为candidate generation中重要的一路召回。另外的召回路包括基于模板（pattern）和基于POS tags的NP抽取系统。CRF[12]是序列标注的经典方法，其核心思想是在进行序列标注时，把序列上的各个点当做一个整体来处理，而不是一个个独立的点，各个点的标注结果是有一定依赖关系的，以路径为单位进行训练。因此，通过训练，模型能在理解文本以外，还能理解输出序列的规则
复制链接

扫一扫

专栏目录

火星种萝卜 CSDN认证博客专家 CSDN认证企业博客

码龄17年

303: 原创

2万+: 周排名

196万+: 总排名

431万+: 访问

: 等级

3万+: 积分

427: 粉丝

740: 获赞

323: 评论

2021: 收藏

私信

关注

热门文章

分类专栏

最新评论

jupyter|魔法函数问题| UsageError: Line magic function `%` not found
Song9177: 还真是一下就解决了，感谢
tensorflow1.0代码迁移到2.0官方指导
ivy__w: 请问下把代码改为您文中写的之后报错 tensorflow 中的 disable_resource_variables 函数（位于 D:\Users\anaconda\envs\randlanet\lib\site-packages\tensorflow\python\compat\v2_compat.py 文件的第 96 行）已被弃用，将来会被移除，并给出了更新的指导说明，即长期来看不支持非资源变量。是为什么呀？要怎么解决才行？
假设训练数据集中有10万个词，四元语法需要存储多少词频和多词相邻频率？《动手学深度学习李沐》转
Laughing Man.: 个人见解是：计算机在最开始计算多词相邻概率（包括 n=2 ,n = 3 ,n = 4）的过程是相互独立的，就是计算机分别及计算以上三者并存储，这样考虑根据排列组合的理解就变成了 10万*10万， 10万*10万*10万，10万* 10万*10万*10万(因为可能存在相同的词语相邻) ，所以最后的大小就是 10**2 + 10**3 +10**4 你的理解是在语料库已经建立完毕的情况下，对一条特定的语句需要用到的相邻概率的数量（只有在这种情况下，才会考虑词语已经使用过的情况）
如何理解：先减1后取反和先取反后加1得到的结果是一样的，故仍可采用取反加1的方法，即对于机器数为负数，则有［X］原=［［X］补］补。
做而论道_CS: 求负数 (X < 0) 的 n 位补码，公式是：　[ X ]补＝ 2^n － | X | －－－－－－－－－－－－－－－－－－－－－按照公式来求补码，是非常简单的事。　根本也不涉及什么：符号位原码反码取反加一。例：－31 的八位补码是多少？解： 2^8 － |－31 | 　= 256 － 31 = 225 = 1110 0001 (二进制) 这不就求出来了嘛！但是，有人偏要找麻烦，鼓吹什么 “取反加一” ！那就慢慢算吧。－－－－－－－－－－－－－－－－－－－－－先看，2^n 的二进制，是多少呢？　是：111 ... 1 + 1。（共有 n 个 1，后面再加上一个 1。）再看，| X | 的二进制，又是多少呢？取绝对值后，就是 n 位的正数。可写成：| X | = 0xx ... x。　（共有 n－1 个 x 。）其中的 x，是一位二进制数，即 0 或 1。－－－－－－－－－－－－－－－－－－－－－所以，公式 2^n － | X | 的二进制形式，就是：　　111 ... 1 ＋ 1 － 0xx ... x 。此公式，还可以改写为以下两种形式：　（111 ... 1 － 0xx ... x）＋ 1　　　（1）　　111 ... 1 －（0xx ... x － 1）　　（2）由小学所学的知识，可知：　方程(1) 和方程(2)，是等效的。－－－－－－－－－－－－－－－－－－－－－另外：1 － 0 ＝ 1、1 － 1 ＝ 0。因此：1 － x，　就是对 x 取反。－－－－－－－－－－－－－－－－－－－－－那么，方程 (1)，就是：先取反、后加一；　而，方程 (2)，就是：先减一、后取反。至此，就证明了：　取反加一、减一取反，功能是相同的。证明这个命题，只需用到小学的知识。　根本就不用：原码反码这些乱七八糟的事！
如何理解：先减1后取反和先取反后加1得到的结果是一样的，故仍可采用取反加1的方法，即对于机器数为负数，则有［X］原=［［X］补］补。
做而论道_CS: 先减1后取反、先取反后加1，确实是一样的。但是，证明方法、过程，却不是你写的这些。

最新文章

目录

评论

被折叠的条评论为什么被折叠?

到【灌水乐园】发言

查看更多评论

添加红包

成就一亿技术人!

hope_wisdom

发出的红包

实付元

使用余额支付

点击重新获取

扫码支付

钱包余额 0

抵扣说明：

1.余额是钱包充值的虚拟货币，按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载，可以购买VIP、付费专栏及课程。