推荐之用户画像【1】–概述
本文主要对构建用户画像(处理海量用户非结构化文本)的方法做大致汇总,整体结构参考刑无刀大佬,详细原理及代码持续更新ing
知乎链接:推荐之用户画像【1】–概述 - LynneS的文章 - 知乎
- 第一类 使用原始数据。
如注册资料等人口统计学信息,或者购买历史,阅读历史等,除了数据清洗等工作,数据本身并没有做任何抽象和归纳。跟查户口一样,没什么技术含量,但通常对于用户冷启动等场景非常有用。
- 第二类就是堆历史数据。
做统计工作,这是最常见的用户画像数据,常见的兴趣标签,就是这一类,就是从历史行为数据中去挖掘出标签,然后在标签维度上做数据统计,用统计结果作为量化结果。这一类数据贡献了常见的酷炫用户画像。
- 第三类用机器学习方法
学习出人类无法直观理解的稠密向量,也最不被非技术人员重视,但实际上在推荐系统中承担的作用非常大。比如使用潜语义模型构建用户阅读兴趣,或者使用矩阵分解得到的隐因子,或者使用深度学习模型学习用户的 Embedding 向量。这一类用户画像数据因为通常是不可解释,不能直接被人看懂。