- 博客(3)
- 收藏
- 关注
翻译 Clickhouse入门
我们先获取一些开源数据样本集,我们将使用美国1987到2015年的民用航班数据,很难称这个样本为大数据(只包含1亿6千6百万行数据,未压缩时有63GB),但我们能用它很快地开干。数据可以从这里下载,你也可以从原地址下载,戳这里.首先,我们将在单台服务器上部署Clickhouse,之后,我们再来搞搞如何部署到支持分片和复制的集群上。在Ubuntu和Debian上,Clickhouse可以通过包安装。在
2017-08-29 22:28:45 5859
翻译 Clickhouse是什么?
Clickhouse是一个用于联机分析处理(OLAP)的列式数据库管理系统(columnar DBMS)。在通常的按行存储的数据库中,数据是按照如下顺序存储的:5123456789123456789 1 Eurobasket - Greece - Bosnia and Herzegovina - example.com 1 2011-09-01 01:03:02
2017-08-29 22:26:01 10803 1
翻译 用pandas处理大数据———减少90%内存消耗的小贴士
用pandas处理大数据———减少90%内存消耗的小贴士一般来说,用pandas处理小于100兆的数据,性能不是问题。当用pandas来处理100兆至几个G的数据时,将会比较耗时,同时会导致程序因内存不足而运行失败。当然,像Spark这类的工具能够胜任处理100G至几个T的大数据集,但要想充分发挥这些工具的优势,通常需要比较贵的硬件设备。而且,这些工具不像pandas那样具有丰富的进行高质
2017-08-29 21:54:51 15016 1
空空如也
空空如也
TA创建的收藏夹 TA关注的收藏夹
TA关注的人