随笔分类 -  Spark

摘要:import java.util.HashMap import org.apache.kafka.clients.producer.{KafkaProducer, ProducerConfig, ProducerRecord} object KafkaWordProducer { def main( 阅读全文
posted @ 2020-02-18 09:47 后山前堂客 阅读(1314) 评论(0) 推荐(0)
摘要:下载依赖 https://mvnrepository.com/artifact/org.apache.spark/spark-streaming-kafka-0-8_2.11/2.1.0, 放到 $SPARK_HOME/jars/kafka 目录中 下载 spark-streaming-kafka- 阅读全文
posted @ 2020-02-17 15:51 后山前堂客 阅读(286) 评论(0) 推荐(0)
摘要:通过spark-shell启动StreamingContext,实时监控文件夹 1 打开terminal 1,输入如下: import org.apache.spark.streaming._ // SparkStreaming将输入流数据按照5秒钟进行数据切分 val ssc = new Stre 阅读全文
posted @ 2020-02-17 10:40 后山前堂客 阅读(168) 评论(0) 推荐(0)
摘要:import org.apache.spark.{SparkConf, SparkContext} import scala.util.parsing.json.JSON object JSONParse { def main(args: Array[String]): Unit = { val i 阅读全文
posted @ 2020-02-16 23:57 后山前堂客 阅读(1279) 评论(0) 推荐(0)
摘要:默认是INFO级别,输出内容太多,影响真正输出结果的查找,需要修改成 WARN 或 ERROR 级别 1 spark根目录conf/log4j.properties.template拷贝到工程的resources目录下,并改名成 log4j.properties 2 修改log4j.properti 阅读全文
posted @ 2020-02-16 23:25 后山前堂客 阅读(1595) 评论(0) 推荐(0)
摘要:scala> val rdd1 = sc.textFile("file:///Users/***/spark/test_data/word.txt")scala> rdd1.filter(x=>x.contains("huahua")) foreach printlnhuahua hadoop sp 阅读全文
posted @ 2020-02-16 22:22 后山前堂客 阅读(338) 评论(0) 推荐(0)
摘要:通过文件系统加载数据创建RDD textFile(URI) URI:可以使 本地文件系统、HDFS、Amazon S3 通过并行集合(数组)创建RDD val rdd = sc.parallize(array) 阅读全文
posted @ 2020-02-16 18:18 后山前堂客 阅读(208) 评论(0) 推荐(0)
摘要:粗粒度:针对整个数据集进行转换操作,而不是针对数据集中的某个元素进行转换操作 细粒度:针对数据集中的某个元素进行转换操作 Spark中: 读操作:可以是粗粒度,也可以是细粒度 写操作:粗粒度 https://www.jianshu.com/p/c43cd6a5538d 阅读全文
posted @ 2020-02-15 21:24 后山前堂客 阅读(691) 评论(0) 推荐(0)
摘要:安装Scala 下载和解压scala安装文件 配置scala环境变量 export SCALA_HOME=/usr/local/Cellar/scala@2.11/2.11.12/ export PATH=.$PATH:$JAVA_HOME/bin:$MAVEN_HOME/bin:$MYSQL_HO 阅读全文
posted @ 2020-02-01 19:59 后山前堂客 阅读(426) 评论(0) 推荐(0)