欢迎来到田晓东的博客

人生三从境界:昨夜西风凋碧树,独上高楼,望尽天涯路。 衣带渐宽终不悔,为伊消得人憔悴。 众里寻他千百度,蓦然回首,那人却在灯火阑珊处。
扩大
缩小

随笔分类 -  大数据相关

1

阿里数据质量体系学习
摘要:一、数据质量保障原则 如何评估数据质量的好坏,业界有不同的标准,阿里主要从 4 个方面进行评估:完整性、准确性、一致性、及时性; 1、完整性 数据完整性是数据最基础的保障; 完整性:指数据的记录和信息是否完整,是否存在缺失的情况; 数据缺失:主要包括记录的缺失和记录中某个字段信息的缺失; 记录的丢失 阅读全文

posted @ 2022-04-15 14:26 匍匐的仰望者 阅读(540) 评论(0) 推荐(0)

Hive构成及工作原理简介
摘要:Hive是基于Hadoop的一个数据仓库工具,使用hive的优点是学习成本低,可以通过类SQL语句快速实现简单的MapReduce统计,不必开发专门的MapReduce应用,十分适合数据仓库的统计分析(可加强具体了解统计目标和分析方法)。 可以将结构化的数据文件映射为一张数据库表,并提供类SQL查询 阅读全文

posted @ 2021-09-11 11:36 匍匐的仰望者 阅读(740) 评论(0) 推荐(0)

牛客练习
摘要:hive练习题: size是计算hive数组元素数量的方法 SQL查询语句中HAVING子句的作用是:指出限定分组的条件 例子:SELECT store_name, SUM(sales) FROM Store_Information GROUP BY store_name HAVING SUM(sa 阅读全文

posted @ 2021-09-10 10:26 匍匐的仰望者

oracle 之表分区详解
摘要:此文从以下几个方面来整理关于分区表的概念及操作: 1.表空间及分区表的概念 2.表分区的具体作用 3.表分区的优缺点 4.表分区的几种类型及操作方法 5.对表分区的维护性操作. (1.) 表空间及分区表的概念 表空间: 是一个或多个数据文件的集合,所有的数据对象都存放在指定的表空间中,但主要存放的是 阅读全文

posted @ 2021-09-09 18:05 匍匐的仰望者 阅读(197) 评论(0) 推荐(0)

yarn 工作原理及 yarn application操作命令
摘要:YARN: Apache Hadoop YARN (Yet Another Resource Negotiator,另一种资源协调者)是一种新的 Hadoop 资源管理器,它是一个通用资源管理系统,可为上层应用提供统一的资源管理和调度,它的引入为集群在利用率、资源统一管理和数据共享等方面带来了巨大好 阅读全文

posted @ 2021-09-08 10:15 匍匐的仰望者 阅读(2007) 评论(0) 推荐(0)

sqlserver 分区表总结
摘要:一些结论: 1、分区字段不一定需要建立索引 2、分区字段可建索引:clustered 、noclustered 3、不论分区字段的索引方式,若重建为clustered且没有关联分区方案时,分区表就变成了非分区表 4、普通表转换为分区表,只要在该表创建一个clustered索引,并在该clustere 阅读全文

posted @ 2021-09-06 19:25 匍匐的仰望者 阅读(965) 评论(0) 推荐(1)

SQLServer 管理常用SQL命令
摘要:SQLServer 管理常用SQL命令: 1. 查看数据库的版本 select @@version 2. 查看数据库所在机器操作系统参数 exec master..xp_msver 3. 查看数据库启动的参数 sp_configure 4. 查看数据库启动时间 select convert(varc 阅读全文

posted @ 2021-09-03 11:19 匍匐的仰望者 阅读(689) 评论(0) 推荐(0)

sqlserver 常用整理
摘要:1、创建数据库 create database stuDB on primary -- 默认就属于primary文件组,可省略,直接写on ( /*--数据文件的具体描述--*/ name='stuDB', -- 主数据文件的逻辑名称 filename='D:\stuDB.mdf', -- 主数据文 阅读全文

posted @ 2021-08-31 17:09 匍匐的仰望者 阅读(104) 评论(0) 推荐(0)

greenplum 常用整理
摘要:创建表: DROP TABLE IF EXISTS "ff"."newtable"; CREATE TABLE "ff"."newtable" ( "id" int4, "name" varchar(64) COLLATE "pg_catalog"."default", "fdate" varcha 阅读全文

posted @ 2021-08-31 17:08 匍匐的仰望者 阅读(235) 评论(0) 推荐(0)

postgresql 常用整理
摘要:1.postgresql创建分区表 CREATE TABLE test_part ( date_key date, hour_key smallint, client_key integer, item_key integer, account integer, expense numeric ); 阅读全文

posted @ 2021-08-31 15:19 匍匐的仰望者 阅读(105) 评论(0) 推荐(0)

数据源整理
摘要:数据源列表 MYSQL SQL Server Oracle Hive PostgreSQL FTP Hbase HDFS Elasticsearch Imapala Kafka Kudu Greenplum Clickhouse Kylin MongoDB DB2 阅读全文

posted @ 2021-08-31 15:14 匍匐的仰望者 阅读(54) 评论(0) 推荐(0)

hive 以like方式建表(携带表结构)
摘要:hive建表语句: CREATE TABLE `hive_ttt_999`( `id` bigint COMMENT 'ID,主键', `name` string COMMENT '姓名', `address` string COMMENT '地址', `mobile` string COMMENT 阅读全文

posted @ 2021-08-31 14:50 匍匐的仰望者 阅读(1807) 评论(0) 推荐(0)

kudu 常用整理
摘要:进入终端,输入Impala-shell,进入impala数据库命令窗口 impala-shell 创建库: create database kudu_test_txd; kudu内部表: create table multi_kudu_table3 ( id BIGINT, name STRING, 阅读全文

posted @ 2021-08-31 14:43 匍匐的仰望者 阅读(377) 评论(0) 推荐(0)

Oracle 之表分析
摘要:1.oracle 删除大量数据后整理表(analyze table xxx compute statistics) DELETE 后 TRUNCATE TABLE ; 然后重新分析一下 analyze table tablename compute statistics 查看表信息 select N 阅读全文

posted @ 2021-08-31 11:52 匍匐的仰望者 阅读(9703) 评论(0) 推荐(0)

Clickhouse常用整理& linux操作clickhouse命令
摘要:进入click(不加上-m的话,进入之后只能一次写一行,不能建表) clickhouse client -m 查看数据库 show databases; 创建一个数据库 create database db_doit; 删除数据库 drop database db_doit; 查看表 show ta 阅读全文

posted @ 2021-08-31 11:34 匍匐的仰望者 阅读(2661) 评论(0) 推荐(0)

orale 命令行创建&删除数据库
摘要:创建数据库文件 CREATE TABLESPACE MyDataBase LOGGING DATAFILE 'D:\Oracle\database\MyDataBase.dbf' SIZE 00M AUTOEXTEND ON NEXT 3M MAXSIZE 500M EXTENT MANAGEMEN 阅读全文

posted @ 2021-08-31 11:13 匍匐的仰望者 阅读(98) 评论(0) 推荐(0)

oracle 建表、主键、分区
摘要:1.创建表: create table student( s_name nvarchar2(20), s_sex nchar(2), s_age int); 消除重复 select distinct 删除表 drop table student; 查看表 select * from student; 阅读全文

posted @ 2021-08-31 11:07 匍匐的仰望者 阅读(758) 评论(0) 推荐(0)

Hive 分区表&分区字段
摘要:一、分区表及作用: 数据分区的概念以及存在很久了,通常使用分区来水平分散压力,将数据从物理上移到和使用最频繁的用户更近的地方,以及实现其目的。 hive中有分区表的概念,我们可以看到分区具重要性能优势,而且分区表还可以将数据以一种符合逻辑的方式进行组织,比如分层存储,分区表分别有静态分区和动态分区。 阅读全文

posted @ 2021-08-30 16:48 匍匐的仰望者 阅读(5510) 评论(0) 推荐(0)

校正oracle,mysql,hive,postgresql,greenplum 记录数分析命令
摘要:oracle: analyze table TEST_ORACLE_PARTITION compute statistics; mysql: 1.从information_schema表中查询相关字段行数等信息 select t.TABLE_NAME as `name`,t.TABLE_ROWS a 阅读全文

posted @ 2021-08-30 10:34 匍匐的仰望者 阅读(113) 评论(0) 推荐(0)

kafka及hdfs常用命令
摘要:1.kafka常用命令: 首先获取集群节点kafka相关位置,我用了比较原始的搜索办法: find . -name 'kafka*' >kafka_path 找到并进入kafka根目录相关目录后执行kafka命令: 查看topic数: bin/kafka-topics.sh --zookeeper 阅读全文

posted @ 2021-08-23 09:35 匍匐的仰望者 阅读(220) 评论(0) 推荐(0)

1

导航