**
Datawhale 零基础入门NLP赛事-Task 1 赛题理解
这个赛题是一个字符识别问题,要求选手对新闻文本进行分类。
赛题数据已经被匿名化处理,训练集中有20w条样本,测试集A包括5w条样本,测试集B包括5w条样本。数据集中标签的对应关系为{‘科技’: 0, ‘股票’: 1, ‘体育’: 2, ‘娱乐’: 3, ‘时政’: 4, ‘社会’: 5, ‘教育’: 6, ‘财经’: 7, ‘家居’: 8, ‘游戏’: 9, ‘房产’: 10, ‘时尚’: 11, ‘彩票’: 12, ‘星座’: 13}。
对于这道题,我们可以从特征提取和分类模型两个部分着手。
解题思路:TF-IDF+机器学习分类器;FastText;WordVec+深度学习分类器;Bert词向量