09 2017 档案

摘要:SparkSQL和DataFrame SparkSQL简介 Spark SQL是Spark用来处理结构化数据的一个模块,它提供了一个编程抽象叫做DataFrame并且作为分布式SQL查询引擎的作用。它是将Spark SQL转换成RDD,然后提交到集群执行,执行效率非常快! SparkSQL的特性 1 阅读全文
posted @ 2017-09-28 22:36 LSPZ 阅读(1313) 评论(0) 推荐(0)
摘要:SparkRDD简介/常用算子/依赖/缓存 RDD简介 RDD(Resilient Distributed Dataset)叫做分布式数据集,是Spark中最基本的数据抽象,它代表一个不可变、可分区、里面的元素可并行计算的集合。RDD是一个类 RDD的属性 1.一个列表,存储存取每个Partitio 阅读全文
posted @ 2017-09-27 09:56 LSPZ 阅读(724) 评论(0) 推荐(0)
摘要:Spark简介安装和简单例子 Spark简介 Spark是一种快速、通用、可扩展的大数据分析引擎,目前,Spark生态系统已经发展成为一个包含多个子项目的集合,其中包含SparkSQL、Spark Streaming、GraphX、MLlib等子项目,Spark是基于内存计算的大数据并行计算框架。简 阅读全文
posted @ 2017-09-26 09:02 LSPZ 阅读(505) 评论(0) 推荐(0)
摘要:1.定义一个类 class Person{ //用val修饰的变量是只读属性,有getter但是没有setter val id ="111" //用var修饰的变量既有getter又有setter var age:Int =18 //类私有字段,只能在类的内部使用,只有伴生对象内可以使用 priva 阅读全文
posted @ 2017-09-20 22:45 LSPZ 阅读(644) 评论(0) 推荐(0)
摘要:scala 基本语法 1.声明变量 (1)val i = 1 使用val声明的变量值是不可变的,相当于java里final修饰的变量,推荐使用。 (2)var i = "hello" 使用var声明的变量值是可变的 (3)val s = "hi" scala编译器会自动推断变量的类型,必要的时候可以 阅读全文
posted @ 2017-09-19 10:08 LSPZ 阅读(2125) 评论(0) 推荐(0)