01 2021 档案

摘要:os.system 这个调用相当直接,且是同步进行的,程序需要阻塞并等待返回。返回值是依赖于系统的,直接返回系统的调用返回值. os.popen() os.popen(command[,mode[,bufsize]]),图中是一个例子. 可以看出,popen方法通过p.read()获取终端输出,而且 阅读全文
posted @ 2021-01-25 20:42 foolangirl 阅读(263) 评论(0) 推荐(0)
摘要:inline 前情提要:inline无法作用于map,array(map) 关于inline:在横表纵表转换一节已经试过,map无法使用inline; 在这里将map转成array,发现还是无法用inline,看来inline只适用array(struct)格式; # map转array,还是不能用 阅读全文
posted @ 2021-01-25 20:18 foolangirl 阅读(2383) 评论(0) 推荐(0)
摘要:json文件hive解析落表 不同于Hive学习小记-(5)表字段变动频繁时用json格式 那种简单存成string再解析,参考: https://www.cnblogs.com/30go/p/8328869.html https://blog.csdn.net/lsr40/article/deta 阅读全文
posted @ 2021-01-25 19:04 foolangirl 阅读(1037) 评论(0) 推荐(0)
摘要:可以参考的一些帖子: https://www.imooc.com/article/50825 https://blog.csdn.net/lidongmeng0213/article/details/110878902 https://www.cnblogs.com/songweideboke/p/ 阅读全文
posted @ 2021-01-24 15:12 foolangirl 阅读(750) 评论(0) 推荐(0)
摘要:平均数中位数众数 平均数、中位数、众数都是度量一组数据集中趋势的统计量。所谓集中趋势是指一组数据向某一中心值靠拢的倾向,测度集中趋势就是寻找数据一般水平的代表值或中心值。而这三个特征数又各有特点,能够从不同的角度提供信息。 平均数 特点:计算用到所有的数据,它能够充分利用数据提供的信息,它具有优秀的 阅读全文
posted @ 2021-01-23 19:58 foolangirl 阅读(10942) 评论(0) 推荐(0)
摘要:14丨数据可视化:掌握数据领域的万金油技能 可视化视图超过 20 种,分别包括:文本表、热力图、地图、符号地图、饼图、水平条、堆叠条、并排条、树状图、圆视图、并排圆、线、双线、面积图、双组合、散点图、直方图、盒须图、甘特图、靶心图、气泡图等 15丨一次学会Python数据可视化的10种技能 散点图、 阅读全文
posted @ 2021-01-19 22:47 foolangirl 阅读(199) 评论(0) 推荐(0)
摘要:13 数据变换:考试成绩要求正态分布合理么? 数据变换是数据准备的重要环节,它通过数据平滑、数据聚集、数据概化和规范化等方式将数据转换成适用于数据挖掘的形式。 常见的变换方法: 1)数据平滑;2)数据聚集;3)数据概化;4)数据规范化;5)属性构造 其中数据规范化可以通过sklearn库实现 阅读全文
posted @ 2021-01-18 23:08 foolangirl 阅读(572) 评论(0) 推荐(0)
摘要:12 数据集成:这些大号一共20亿粉丝? kettle:将各种数据放到一个壶里,然后以一种指定的格式流出 DataX :DataX 可以实现跨平台、跨数据库、不同系统之间的数据同步及交互,它将自己作为标准,连接了不同的数据源,以完成它们之间的转换 Apache 的 Sqoop:Hadoop 和关系型 阅读全文
posted @ 2021-01-16 16:12 foolangirl 阅读(467) 评论(0) 推荐(0)
摘要:11 数据科学家80%时间都花费在了这些清洗任务上? 没有高质量的数据,就没有高质量的数据挖掘,而数据清洗是高质量数据的一道保障。 数据质量的准则——完全合一 完整性:单条数据是否存在空值,统计的字段是否完善。 全面性:观察某一列的全部数值,比如在 Excel 表中,我们选中一列,可以看到该列的平均 阅读全文
posted @ 2021-01-16 15:42 foolangirl 阅读(713) 评论(0) 推荐(0)
摘要:08 数据采集:如何自动化采集数据? 重点介绍爬虫做抓取 1.Python 爬虫 1)使用 Requests 爬取内容。我们可以使用 Requests 库来抓取网页信息。Requests 库可以说是 Python 爬虫的利器,也就是 Python 的 HTTP 库,通过这个库爬取网页中的数据,非常方 阅读全文
posted @ 2021-01-16 12:22 foolangirl 阅读(1641) 评论(0) 推荐(0)
摘要:06 学数据分析要掌握哪些基本概念 商业智能 BI、数据仓库 DW、数据挖掘 DM ​: 三者之间的关系开头中的百货商店利用数据预测用户购物行为属于商业智能, 他们积累的顾客的消费行为习惯会存储在数据仓库中, 通过对个体进行消费行为分析总结出来的规律属于数据挖掘。 07 用户画像:标签化就是数据的抽 阅读全文
posted @ 2021-01-15 20:17 foolangirl 阅读(378) 评论(0) 推荐(0)
摘要:本讲内容: 1.Pandas 两个数据结构:Series 和 DataFrame。 2.数据处理。 1)数据导入与输出 2)数据清洗操作 3)数据统计函数 4)数据表join合并 5)在 Pandas 中使用 SQL 对数据表更方便地进行操作 数据结构:Series 和 DataFrame Seri 阅读全文
posted @ 2021-01-14 23:01 foolangirl 阅读(606) 评论(0) 推荐(0)
摘要:开篇:数据分析学习方法、框架、内容与目标 高效的学习方法: MAS 方法 Multi-Dimension:想要掌握一个事物,就要从多个角度去认识它。 Ask:不懂就问,程序员大多都很羞涩,突破这一点,不懂就问最重要。 Sharing:最好的学习就是分享。用自己的语言讲出来,是对知识的进一步梳理 技术 阅读全文
posted @ 2021-01-13 23:42 foolangirl 阅读(329) 评论(0) 推荐(0)
摘要:主要讲了numpy的struct格式、ufunc运算、ndarray统计函数、排序 代码: 阅读全文
posted @ 2021-01-13 23:41 foolangirl 阅读(111) 评论(0) 推荐(0)
摘要:参考:https://i.cnblogs.com/posts/edit;postId=14193982沿用Hive学习小记-(5)表字段变动频繁时用json格式一篇场景: 可见直接存成map类型比string类型的json串方便很多: 阅读全文
posted @ 2021-01-12 21:25 foolangirl 阅读(152) 评论(0) 推荐(0)
摘要:需求说明:这是一个横表转纵表与纵表转横表的故事,有点类似行列转换 行转列:一个字段的多行数据合进一个列,通常可用collect_set+concat_ws;列转行:一个字段的一列数据拆到多个行,通常用explode 横表转纵表: 1.原横表数据: cust_id1,jijin_bal,baoxian 阅读全文
posted @ 2021-01-11 22:16 foolangirl 阅读(2183) 评论(0) 推荐(0)
摘要:map阶段 1.hive.vectorized.execution.enabled 默认false. map方法逐行处理数据,开启之后hive构造一个批量输入的数组,一次处理1万条数据。(数据量不大,或计算不复杂是不是没必要开启? MapReduce只支持map端向量化执行,TEZ和SPARK支持m 阅读全文
posted @ 2021-01-10 15:34 foolangirl 阅读(2274) 评论(0) 推荐(0)
摘要:先在我的集群上安装python3: [root@hadoop02 module]# yum install python3 再安装jupyter: pip3 install jupyter -i http://pypi.douban.com/simple --trusted-host pypi.do 阅读全文
posted @ 2021-01-10 02:11 foolangirl 阅读(3338) 评论(1) 推荐(0)
摘要:参考:spark连接外部Hive应用 如果想连接外部已经部署好的Hive,需要通过以下几个步骤。 1) 将Hive中的hive-site.xml拷贝或者软连接到Spark安装目录下的conf目录下。 2) 打开spark shell,注意带上访问Hive元数据库的JDBC客户端(找到连接hive元m 阅读全文
posted @ 2021-01-09 22:42 foolangirl 阅读(5323) 评论(0) 推荐(0)
摘要:摘自阿里大数据之路 什么是数据漂移 通常我们把从源系统同步进入数仓的第一层数据称为 ODS或者staging层数据,接入层 。 数据漂移是接入层数据的一个顽疾。 数据漂移定义:接入层ODS表同一个业务日期数据中包含前一天或者后一天凌晨附近的数据或者丢失当天的变更数据。 数据漂移出现的原因 通常落地数 阅读全文
posted @ 2021-01-09 15:00 foolangirl 阅读(3792) 评论(0) 推荐(0)
摘要:本文记录木东居士bilibili-数仓主题分享内容 P5.数据模型对比 1.范式建模 优点:节约存储、结构清晰、易于理解、适合关系型数据库 缺点:构建比较繁琐、查询复杂、不适合构建在大数据分布式环境下 业务数据往往是根据主键更新,范式建模更新比维度建模更新更简单 2.维度建模 优点:方便使用、适合大 阅读全文
posted @ 2021-01-05 23:48 foolangirl 阅读(519) 评论(0) 推荐(0)
摘要:本文记录木东居士bilibili-数仓主题分享内容 P1课程介绍 1.课程目标:独立从0到1建数仓;规划数仓发展路径;带好数仓团队 2.数据岗位的要求: 3.本课程内容: P2什么是数据仓库 1.数据仓库发展历史 2.什么是数据仓库 3.为什么建数据仓库 4.数据仓库 VS 数据中台 P3基础概念讲 阅读全文
posted @ 2021-01-05 22:48 foolangirl 阅读(307) 评论(0) 推荐(0)
摘要:本文记录木东居士bilibili-数仓主题分享内容 P1企业级数据仓库介绍 1. 数仓痛点 2. 数仓模型 类似ODS -> DW( DWD ->DWS) ->TDM ->ADS 调用原则:(跨层指APP不要直接调ODS 数仓规范 1.表命名规范: 业务域指业务范围划分,如银行的零售业务、对公业务; 阅读全文
posted @ 2021-01-04 23:13 foolangirl 阅读(796) 评论(0) 推荐(0)
摘要:本文记录木东居士数仓主题分享内容 分享地址:https://www.bilibili.com/video/av96469217 导读 技能干货:主题域划分规则;数据集市与主题域如何衔接;数据治理之数据标准化;数据中台;实时数仓;传统数仓与互联网数仓异同 职业发展:数仓困境-善战者无赫赫战功;除了技术 阅读全文
posted @ 2021-01-03 22:13 foolangirl 阅读(783) 评论(0) 推荐(0)
摘要:Schema是什么 DataFrame中的数据结构信息,即为schema。DataFrame中提供了详细的数据结构信息,从而使得SparkSQL可以清楚地知道该数据集中包含哪些列,每列的名称和类型各是什么。 自动推断生成schema 使用spark的示例文件people.json, 查看数据: [r 阅读全文
posted @ 2021-01-03 16:43 foolangirl 阅读(2913) 评论(0) 推荐(0)
摘要:转载: https://blog.csdn.net/HappyRocking/article/details/79885071?utm_medium=distribute.pc_relevant.none-task-blog-BlogCommendFromBaidu-2.control&depth_ 阅读全文
posted @ 2021-01-03 11:02 foolangirl 阅读(396) 评论(0) 推荐(0)
摘要:场景 有一张明细事务级别的流水表,主键是事件流水号srl_id, 该表每天采集当天新增及变化的事件下发,上游下发文件分区日期prt_dt. 存在这样的情况,某个流水号srl_id在20210101发生,会在prt_dt=20200101的分区首次下发,若之后在20200105发生改变,在prt_dt 阅读全文
posted @ 2021-01-02 15:19 foolangirl 阅读(1320) 评论(0) 推荐(0)