- Hive 是一个建立在hadoop文件系统上的数据仓库架构,可以用其对hdfs上数据进行分析与管理。
- 实际上是将hdfs上的文件映射成table(按文件格式创建table,然后hive的数据仓库会生成对应的目录,默认的仓库路径:user/hive/warehouse/tablename,目录名与这个表名相同,这时只要将符合table定义的文件加载到该目录便可通过Hql对整个目录的文件进行查询了。
- 将数据加载到该目录可以用hdfs dfs -put 命令直接添加到该目录;
- 也可以通过load data local inpath ‘user/test.txt’ into table
tableName,通过load命令加载数据与通过put命令加载文件的结果是一样的,即在user/hive/warehouse/tablename
目录下都会有加载进来的文件,如果用load命令加载的是hdfs上的文件则会将原hdfs目录下对应的文件移动至hive的仓库目录下),并将这些元数据保存到关系型数据库中,元数据存储着表所对应的文件路径,表的列与分区,表创建时间,文件大小等属性; - 同时支持用户运用类sql对文件进行操作,这个操作主要是查询。
hive 与 hdfs 文件的关系
最新推荐文章于 2025-04-05 22:15:39 发布