恒源云(GPUSHARE)_BPE算法详解

置顶

AI酱油君

已于 2022-02-23 15:38:01 修改

阅读量714

点赞数 2

分类专栏：深度学习 AI行业新思文章标签：算法自然语言处理深度学习

于 2022-01-20 17:54:11 首次发布

本文链接：https://blog.csdn.net/weixin_53977063/article/details/122606874

版权

文章来源 | 恒源云社区

原文地址 | BPE 算法详解

原文作者 | Mathor

Byte Pair Encoding

在NLP模型中，输入通常是一个句子，例如"I went to New York last week."，一句话中包含很多单词（token）。传统的做法是将这些单词以空格进行分隔，例如['i', 'went', 'to', 'New', 'York', 'last', 'week']。然而这种做法存在很多问题，例如模型无法通过old, older, oldest之间的关系学到smart, smarter, smartest之间的关系。如果我们能使用将一个token分成多个subtokens，上面的问题就能很好的解决。本文将详述目前比较常用的subtokens算法——BPE（Byte-Pair Encoding）

现在性能比较好一些的NLP模型，例如GPT、BERT、RoBERTa等，在数据预处理的时候都会有WordPiece的过程，其主要的实现方式就是BPE（Byte-Pair Encoding）。具体来说，例如['loved', 'loving', 'loves']这三个单词。其实本身的语义都是"爱"的意思，但是如果我们以词为单位，那它们就算不一样的词，在英语中不同后缀的词非常的多，就会使得词表变的很大，训练速度变慢，训练的效果也不是太好。BPE算法通过训练，能够把上面的3个单词拆分成["lov","ed","ing","es"]几部分，这样可以把词的本身的意思和时态分开，有效的减少了词表的数量。算法流程如下：

设定最大subwords个数 $V$
将所有单词拆分为单个字符，并在最后添加一个停止符</w>，同时标记出该单词出现的次数。例如，"low"这个单词出现了5次，那么它将会被处理为{'l o w </w>': 5}
统计每一个连续字节对的出现频率，选择最高频者合并成新的subword
重复第3步直到达到第1步设定的subwords词表大小或下一个最高频的字节对出现频率为1

例如

{'l o w </w>': 5, 'l o w e r </w>': 2, 'n e w e s t </w>': 6, 'w i d e s t </w>': 3}

出现最频繁的字节对是** e和s **，共出现了6+3=9次，因此将它们合并

{'l o w </w>': 5, 'l o w e r </w>': 2, 'n e w es t </w>': 6, 'w i d es t </w>': 3}

出现最频繁的字节对是** es和t**，共出现了6+3=9次，因此将它们合并

{'l o w </w>': 5, 'l o w e r </w>': 2, 'n e w est </w>': 6, 'w i d est </w>': 3}

出现最频繁的字节对是** est和</w> **，共出现了6+3=9次，因此将它们合并

{'l o w </w>': 5, 'l o w e r </w>': 2, 'n e w est</w>': 6, 'w i d est</w>': 3}

出现最频繁的字节对是** l和o**，共出现了5+2=7次，因此将它们合并

{'lo w </w>': 5, 'l

最低0.47元/天解锁文章

AI酱油君

关注

2
点赞
踩
1

收藏

觉得还不错? 一键收藏
0
评论
恒源云(GPUSHARE)_BPE算法详解

文章来源 | 恒源云社区原文地址 | BPE 算法详解原文作者 | MathorByte Pair Encoding在NLP模型中，输入通常是一个句子，例如"I went to New York last week."，一句话中包含很多单词（token）。传统的做法是将这些单词以空格进行分隔，例如['i', 'went', 'to', 'New', 'York', 'last', 'week']。然而这种做法存在很多问题，例如模型无法通过old, older, oldest之间的关系学到smart
复制链接

扫一扫