阿飞飞飞

学而时习之

导航

随笔分类 -  spark

python环境下使用pyspark读取hive表
摘要:python环境 导入pyspark.sql 1.linux系统下,spark读取hive表 配置文件: 先将hive-site.xml放入linux spark内的conf内 //hive和linux下的spark连接 将jar包 mysql-connector-java.jar放入linux s 阅读全文

posted @ 2020-12-24 12:26 阿飞飞飞 阅读(5384) 评论(0) 推荐(1)

SparkGraphX中的PR算法和pregel迭代算法
摘要:PR算法(佩奇等级) PR算法是早期构建搜索系统的链接分析算法,用于衡量特定网页相对于搜索引擎索引中其他网页而言的重要程度 一个页面的PR值越高,则对于其他网页则越重要 如图: 由图通过迭代公式Vn=T·Vn-1,得到一个稳定的PR,矩阵如下: 但是有的点只有入度,没有出度,或者存在自环现象,引入公 阅读全文

posted @ 2020-10-16 10:06 阿飞飞飞 阅读(375) 评论(0) 推荐(0)

Spark GraphX
摘要:一、图的概念 图是由顶点集合(vertex)以及顶点间的关系集合——边(edge)组成的一种网状数据结构,通常表示为二元组:Graph=(V,E) 图按方向可分为有向图和无向图(spak通常为有向图) 度:一个顶点所有边的数量 出度:指从当前顶点指向其他顶点的边的数量 入度:其他顶点指向当前顶点的边 阅读全文

posted @ 2020-10-11 19:23 阿飞飞飞 阅读(204) 评论(0) 推荐(0)

spark访问mysql、spark访问hive
摘要:spark访问mysql: 导入依赖 <dependency> <groupId>org.apache.spark</groupId> <artifactId>spark-core_2.11</artifactId> <version>2.3.4</version> </dependency> <! 阅读全文

posted @ 2020-10-11 00:04 阿飞飞飞 阅读(249) 评论(0) 推荐(0)