【推荐系统中的Hash 3】Deep Hash：Learning to Embed Categorical Features without Embedding Tables KDD‘21

最新推荐文章于 2023-12-12 20:49:28 发布

chad_lee

最新推荐文章于 2023-12-12 20:49:28 发布

阅读量1.2k

点赞数

分类专栏：论文解读推荐系统 CTR 文章标签：哈希算法机器学习自然语言处理

版权声明：本文为博主原创文章，遵循 CC 4.0 BY-SA 版权协议，转载请附上原文出处链接和本声明。

本文链接：https://blog.csdn.net/yanguang1470/article/details/126457356

版权

三、深度哈希（id——embedding）

《Learning to Embed Categorical Features without Embedding Tables for Recommendation》Google KDD 2021 Research Track

文章以 NLP的视角切入推荐系统中embedding的问题：

NLP中存在分词的机制，所以词表大小远远小于推荐中纯ID类的词表；
NLP中的词表是静态的（因为词语是固定的），而推荐中词表需要经常更新（因为有新用户等进入）；
推荐中的高度偏移的数据分布，也就是如何处理长尾数据的embedding

文章提出Deep Hash Embeddings (DHE) 的方式来缓解以上问题，AUC相等的情况下模型参数量更少。

现有方法

One-hot full embedding

在这里插入图片描述

这种方式就是最常见的方法，即把所有类别特征进行编号，假设共 n 个特征。特征s 首先通过one-hot进行编码 $E(s)=b=\{0,1\}^n$ , 其中只有第 $b_s$ 项为1，其他都为0。接着通过一个可学习的线性变换矩阵（说白了就是embedding table，可以看作一层神经网络，但没有bias项）得到对应的embedding表示： $e=W^Tb$ 。

这种方法的缺点：1、embedding table随特征数量线性增长（即内存问题）；2、无法处理新出现的特征（OOV）。

One-hot Hash Embedding

为了解决One-hot Full Embedding中的内存消耗巨大的问题，可以使用**「哈希函数」对类别特征进行「映射分桶」**，将原始的 n 维的 one-hot 特征编码映射为 m 维的 one-hot 特征编码（即m个桶， $m << n$ ）。这样，embedding table只用存储m项，大大降低了参数量。

相比One-hot Full Embedding，编码部分变为：

最低0.47元/天解锁文章

关注

0
点赞
踩
2

收藏

觉得还不错? 一键收藏
0
评论
【推荐系统中的Hash 3】Deep Hash：Learning to Embed Categorical Features without Embedding Tables KDD‘21

作者也觉得他这种方法不能满足同质性Equal Similarity，因此提出对于物品ID、用户ID，在encode之后再拼接上属性（年龄、性别、品牌等），然后在输入到DHE中解码，为最终生成的embedding补充同质性。项为1，其他都为0。，即一个特征分别落到了k个桶中，分别从embedding table取出向量，并且把最后的结果concat到一起或者做avg-pooling。作者说，这里是受到GAN网络的启发，用服从高斯分布的随机变量做GAN网络的输入。2、无法处理新出现的特征（OOV）。
复制链接

扫一扫

专栏目录

评论

被折叠的条评论为什么被折叠?

到【灌水乐园】发言

查看更多评论

添加红包

成就一亿技术人!

hope_wisdom

发出的红包

实付元

使用余额支付

点击重新获取

扫码支付

钱包余额 0

抵扣说明：

1.余额是钱包充值的虚拟货币，按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载，可以购买VIP、付费专栏及课程。