大家都知道,由于集群资源有限,我们一般都会针对数据文件的「存储结构」和「压缩形式」进行配置优化。在我实际查看以后,发现集群的文件存储格式为Parquet,一种列式存储引擎,类似的还有ORC。而文件的压缩形式为Snappy。具体的操作形式如下:
① 创建Parquet结构的表(Hive 0.13 and later):
CREATE TABLE CRM.DEMO(A INT) STORED AS PARQUET ;
② 确认表的文件存储格式:
desc formatted crm.demo;
结果输出如下
# Storage Information
SerDe Library: org.apache.hadoop.hive.ql.io.parquet.serde.ParquetHiveSerDe
InputFormat: org.apache.hadoop.hive.ql.io.parquet.MapredParquetInputFormat
OutputFormat: org.apache.hadoop.hive.ql.io.parquet.MapredParquetOutputFormat
③ 创建Snappy压缩格式的Parquet结构的表(待考察):
ALTER TABLE crm.demo SET TBLPROPE