随笔分类 - Spark
摘要:import java.util.HashMap import org.apache.kafka.clients.producer.{KafkaProducer, ProducerConfig, ProducerRecord} object KafkaWordProducer { def main(
阅读全文
摘要:下载依赖 https://mvnrepository.com/artifact/org.apache.spark/spark-streaming-kafka-0-8_2.11/2.1.0, 放到 $SPARK_HOME/jars/kafka 目录中 下载 spark-streaming-kafka-
阅读全文
摘要:通过spark-shell启动StreamingContext,实时监控文件夹 1 打开terminal 1,输入如下: import org.apache.spark.streaming._ // SparkStreaming将输入流数据按照5秒钟进行数据切分 val ssc = new Stre
阅读全文
摘要:import org.apache.spark.{SparkConf, SparkContext} import scala.util.parsing.json.JSON object JSONParse { def main(args: Array[String]): Unit = { val i
阅读全文
摘要:默认是INFO级别,输出内容太多,影响真正输出结果的查找,需要修改成 WARN 或 ERROR 级别 1 spark根目录conf/log4j.properties.template拷贝到工程的resources目录下,并改名成 log4j.properties 2 修改log4j.properti
阅读全文
摘要:scala> val rdd1 = sc.textFile("file:///Users/***/spark/test_data/word.txt")scala> rdd1.filter(x=>x.contains("huahua")) foreach printlnhuahua hadoop sp
阅读全文
摘要:通过文件系统加载数据创建RDD textFile(URI) URI:可以使 本地文件系统、HDFS、Amazon S3 通过并行集合(数组)创建RDD val rdd = sc.parallize(array)
阅读全文
摘要:粗粒度:针对整个数据集进行转换操作,而不是针对数据集中的某个元素进行转换操作 细粒度:针对数据集中的某个元素进行转换操作 Spark中: 读操作:可以是粗粒度,也可以是细粒度 写操作:粗粒度 https://www.jianshu.com/p/c43cd6a5538d
阅读全文
摘要:安装Scala 下载和解压scala安装文件 配置scala环境变量 export SCALA_HOME=/usr/local/Cellar/scala@2.11/2.11.12/ export PATH=.$PATH:$JAVA_HOME/bin:$MAVEN_HOME/bin:$MYSQL_HO
阅读全文

浙公网安备 33010602011771号