8/8

围绕Oozie作业调度和Hive数据仓库基础展开,同时热词采集项目也进入了批量抓取阶段。在Oozie部署过程中,我遇到了MySQL驱动缺失导致coordinator无法记录任务状态的故障,将mysql-connector-java复制到Oozie的lib目录后解决,随后我编写了第一个workflow.xml,成功将MR任务和Shell脚本串联成一个顺序执行的工作流,并通过coordinator配置了每小时定时调度。Hive的学习则是从建表语句开始,我创建了外部表指向HDFS上的服务器日志目录,使用分区表按日期划分数据,随后执行了多组聚合查询,包括GROUP BY配合COUNT、AVG等函数,感受了Hive将SQL转为MR作业的底层过程。为了拓宽视野,我还对比了Pig Latin的ETL风格,发现Pig在数据清洗阶段更加灵活,而Hive在结构化分析上更胜一筹。爬虫方面本周收获颇丰,累计采集了CSDN和知乎专栏中带有“大数据/人工智能”标签的文章2000余篇,存储为JSON格式,为后续的分词和分类打下了数据基础。时间投入统计如下:总学习时长13小时,代码编写(Oozie XML、HiveQL、Python爬虫)合计6.5小时,而问题排查占2.5小时,其中Hive元数据初始化因未启动metastore服务而报错,启动后恢复正常;另外Oozie的时区设置与系统不一致导致调度时间偏移,通过修改oozie-site.xml中的时区参数校正。本周遇到的最大挑战是Hive对嵌套JSON的解析效率很低,使用get_json_object函数逐字段提取时性能不佳,我准备下周引入自定义UDF来解决,同时计划学习Shark和Tez来对比不同计算引擎对查询速度的提升效果,并开始对采集的热词进行jieba分词和停用词过滤。

posted @ 2026-08-20 19:59  hhxyb  阅读(2)  评论(0)    收藏  举报