大数据开发
·2024-04-08浅浅的聊一下近一周的情况
清明三天假期(主要是学习ETL工具kettle、调度工具oozie,毕竟难得放个假,还是要干点自己喜欢的事情),kettle在一定程度上减少了脚本(如python脚本)开发来处理数据,并不绝对,对于较脏的数据来说,正则(后面还要强化) 脚本可能是一种不错的选择。kettle目前还没有学完,想着后面慢慢运用到公司数据录入这一块。公司这边用navicat比较多,于是我有个想法:后面搞个数据比较一下navicat和kettle的数据处理性能(刨除navicat与sql相关的,使用navicat本身的数据处理方式)。
目前公司使用CDH来管理大数据平台,数仓有以下几层:ods层(分区)、dwd层(分桶,根据某些字段排序,有一张表是多表合并而成,去除重复值等)、ads层(有一张ES外部表),整个数仓的数据供内部渗透组使用。最近我在使用oozie来定时调度数仓的每一层,我的思路是这样的:使用一个workflow来协调多个shell(一层一个shell),然后使用coordinate定时,目前状况百出,各种各样的坑,目前还在解决。同时我也有个疑问:oozie也可以执行hive脚本,oozie执行shell脚本和oozie执行hive脚本性能一样吗?哪种方式更好?整个数仓都是json数据,除了采用创建es外部表的方式,还能采用哪些方式提高查询速度呢?
目前也是在骑驴找马,一来小公司不是很稳定,制度也不是很完善,二来也想自己未来有更好的发展。当然了,以上可能还有很多描述不当的地方,请大家谅解。
12
0
分享
操作
评论
相关内容
0个评论
全部评论
点击登录,快来和大家讨论吧~
表情
图片
暂无评论
