WordPiece、BPE详解及代码

BPE(Byte-Pair Encoding)是一种通过合并常见字符对减少词汇表大小的自然语言处理技术,常用于解决OOV问题。本文详细介绍了BPE算法的作用、工作原理、代码实现及其适用范围,特别指出BPE在欧美语言处理中的应用,而中文通常使用分词或分字方法。
摘要由CSDN通过智能技术生成

1.BPE是干什么用的?

WordPiece字面理解是把word拆成piece一片一片,其实就是这个意思。
WordPiece的一种主要的实现方式叫做BPE(Byte-Pair Encoding)双字节编码。
“loved”,“loving”,“loves"这三个单词。其实本身的语义都是“爱”的意思,但是如果我们以单词为单位,那它们就算不一样的词,在英语中不同后缀的词非常的多,就会使得词表变的很大,训练速度变慢,训练的效果也不是太好。
BPE算法通过训练,能够把上面的3个单词拆分成"lov”,“ed”,“ing”,"es"几部分,这样可以把词的本身的意思和时态分开,有效的减少了词表的数量。

BPE的作用如下:

1.传统词表示方法无法很好的处理未知或罕见的词汇(OOV问题:out of vocabulary)

2.传统词tokenization方法不利于模型学习词缀之前的关系

3.Character embedding作为OOV的解决方法粒度太细

4.Subword粒度在词与字符之间,能够较好的平衡OOV问题

2.BPE算法

1.准备足够大的训练语料

2.确定期望的subword词表大小

3.将单词拆分为字符序列并在末尾添加后缀“ </ w>”,统计单词频率。本阶段的subword的粒度是字符。例如,“ low”的频率为5,那么我们将其改写为“ l o w </ w>”:5
(备注:为什么加入"< /w >"在解码阶段有说明)

4.统计每一个连续字节对的出现频率,选择最高频者合并成新的subword

5.重复第4步直到达到第2步设定的subword词表大小或下一个最高频的字节对出现频率为1

例子

{
   'l o w </w>': 5, 'l o w e r </w>': 2, 'n e w e s t </w>': 6, 'w i d e s t </w>': 3}

Iter 1, 最高频连续字节对"e""s"出现了6+3=9次,合并成"es"。输出:
{
   'l o w </w>': 5, 'l o w e r </w>': 2, 'n e w es t </w>': 6, 'w i d es t </w>': 3}

Iter 2, 最高频连续字节对"es""t"出现了6+3=9, 合并成&#
  • 3
    点赞
  • 19
    收藏
    觉得还不错? 一键收藏
  • 0
    评论
BPE是字节对编码(Byte Pair Encoding)的缩写。它是一种学习提供的空格分隔文本的词汇和字节对编码的方法。该方法通常在生产用例中使用。可以使用以下命令行代码进行安装和导入: ``` $ python3 -m pip install --user bpe from bpe import Encoder ``` 引用提供了一个示例,并展示了如何使用BPE进行文本编码。 引用展示了如何使用统计词频的方法来获取文本的词汇表。代码会根据空格将文本分割成单词,并统计每个单词出现的次数。 引用则提示我们可以使用基本的BPE代码进行实践,从最基本的数据预处理开始,到最后实现一句话的简单分词。 所以,通过使用Python中的BPE库,我们可以进行字节对编码,并通过统计词频来获取文本的词汇表。这些方法可以帮助我们实现文本的编码和分词任务。<span class="em">1</span><span class="em">2</span><span class="em">3</span> #### 引用[.reference_title] - *1* [python-bpe:Python的字节对编码!](https://download.csdn.net/download/weixin_42166626/15015483)[target="_blank" data-report-click={"spm":"1018.2226.3001.9630","extra":{"utm_source":"vip_chatgpt_common_search_pc_result","utm_medium":"distribute.pc_search_result.none-task-cask-2~all~insert_cask~default-1-null.142^v93^chatsearchT3_2"}}] [.reference_item style="max-width: 50%"] - *2* *3* [彻底搞懂BPE(Byte Pair Encode)原理(附代码实现)](https://blog.csdn.net/qq_41020633/article/details/123622667)[target="_blank" data-report-click={"spm":"1018.2226.3001.9630","extra":{"utm_source":"vip_chatgpt_common_search_pc_result","utm_medium":"distribute.pc_search_result.none-task-cask-2~all~insert_cask~default-1-null.142^v93^chatsearchT3_2"}}] [.reference_item style="max-width: 50%"] [ .reference_list ]

“相关推荐”对你有帮助么?

  • 非常没帮助
  • 没帮助
  • 一般
  • 有帮助
  • 非常有帮助
提交
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值