随笔分类 -  大数据

摘要:在Hive中支持窗口函数,Mysql在8.0版本后也支持使用,用好之后犹如开挂! Window Function又称为窗口函数、分析函数。聚合函数可以将多行数据按照规定聚合为一行,一般来讲聚集后的行数要少于聚集前的行数。但是有时我们想要既显示聚集前的数据,又要显示聚集后的数据,这时便引入了窗口函数。 阅读全文
posted @ 2020-06-13 01:05 吕二口 阅读(935) 评论(0) 推荐(0)
摘要:1.获取当前日期 如2020-13-22 current_date() 或者current_date 获取当前时间:from_unixtime(unix_timestamp()) -->返回格式:yyyy-MM-dd HH:mm:ss :current_timestamp() -->返回格式:yyy 阅读全文
posted @ 2020-06-12 15:58 吕二口 阅读(1866) 评论(0) 推荐(0)
摘要:先看下如何创建数据表 create [external] table if not exists 表名 (列名数据类型 [comment 本列注释],...) [comment 表注释] [partitioned by (列名数据类型 [comment 本列注释],...)] [clustered 阅读全文
posted @ 2020-06-12 14:21 吕二口 阅读(1161) 评论(0) 推荐(0)
摘要:结合其他同学和自己的笔记总结如下 什么是hive? 基于Hadoop的开源的数据仓库工具,用于处理海量结构化数据。 Hive把HDFS中结构化的数据映射成表。 Hive通过把HiveSQL进行解析和转换,最终生成一系列在hadoop上运行的mapreduce任务,通过执行这些任务完成数据分析与处理。 阅读全文
posted @ 2020-06-04 17:43 吕二口 阅读(856) 评论(0) 推荐(0)
摘要:在本地搭建好伪分布式环境,打开虚拟机进入linux系统,如果是在root用户下则需要切换至Hadoop用户 su - hadoop 按需输入hadoop密码 在hadoop家目录下启动Hadoop集群 start-all.sh 查看进程,检查是否正常启动 jps 进入Hive安装目录 (具体目录可能 阅读全文
posted @ 2020-06-04 16:55 吕二口 阅读(609) 评论(0) 推荐(0)
摘要:打开虚拟机进入linux系统 进入Hadoop目录下 多用tab键 它可以自动补齐命令 1. 启动Hadoop集群 start-all.sh 等价于 start-dfs.sh 和 start-yarn.sh 2. 关闭Hadoop集群 stop-all.sh 3. 查看启动的服务进程 jps 4. 阅读全文
posted @ 2020-06-04 00:35 吕二口 阅读(699) 评论(0) 推荐(0)
摘要:什么叫大数据,“大”,说的并不仅是数据的“多”!不能用数据到了多少TB ,多少PB 来说。 对于大数据,可以用四个词来表示:大量,多样,实时,不确定。 也就是数据的量庞大,数据的种类繁杂多样话,数据的变化飞快,数据的真假存疑。 大量:这个大家都知道,想百度,淘宝,腾讯,Facebook,Twitte 阅读全文
posted @ 2020-06-03 18:23 吕二口 阅读(3159) 评论(0) 推荐(1)