音乐数据集汇总

本文汇总了多个音乐数据集,包括Million Song Dataset、Lastfm数据集、HetRec 2011以及其它来源的数据集,可用于音乐推荐系统的算法研究和工程实现。数据集包含歌曲信息、用户收听历史、标签、相似歌曲等丰富数据。
摘要由CSDN通过智能技术生成

接下来会研究一下音乐推荐系统,需要数据来进行算法及工程代码的演示,遂汇总一下网上开源的音乐数据集。

Million Song Dataset

说到音乐数据集第一位肯定是MSD,它包含了100万首歌曲的信息,总量有280GB大小。由于数据量的确较大,它使用了h5的文件压缩格式,并提供了一些code用于读这种文件。

每首歌对应一个文件,字段包括歌曲的方方面面,如 artist_mbidartist_nametitletempo 等等,所有字段在这里列出。 路径是奇怪的,Q&A中解释说,实在无法把所有文件都放到同一个目录下,目录的组织方式为: 某首歌曲所在位置为它的The Echo Nest track IDs的第三、第四、第五位形成的层级目录,比如 MillionSong/data/A/D/H/TRADHRX12903CD3866.h5

此外,在MSD的基础上,社区还贡献了不少补充数据集,方便对MSD做各方面的研究。在首页可以很容易找到它们。

  • 5
    点赞
  • 37
    收藏
    觉得还不错? 一键收藏
  • 0
    评论
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值