数据中心开源数据集及相关论文整理
近些年,随着云计算的快速兴起,各大公司都纷纷建立自己的数据中心,微软在数据中心方面的投入超过了 150 亿,阿里巴巴仅在张北的数据中心就投入了 180 亿。在数据中心的高额投入下,机器的资源使用效率却面临了很大的问题。以 Google 的数据中心为例,其生产环境下机器的平均 CPU 利用率只有 20%,Amazon 的 AWS EC2 平均 CPU 利用率只有 7%~17%。
为了更好的解决数据中心所面临的挑战,各大公司纷纷开始公开自己集群的数据集,希望通过数据集的方式,让研究者更好的了解在大规模的场景下所遇到的问题。
以下为整理的部分公司开源的数据集和传送门,会在慢慢的更新。
- 传送门:https://github.com/google/cluster-data
- 公开时间:2011年
- 数据集时间跨度:30天
Microsoft Azure
- 传送门:https://github.com/Azure/AzurePublicDataset
- 公开时间:2017年
- 数据集时间跨度:30天
Alibaba Co-located cluster
- 传送门: