随笔分类 - 每日总结
摘要:CONDA常用命令 管理自身 1.查看conda版本 conda create -n env_name python=3.8 获取版本号 conda -V conda --version 获取环境相关的命令的帮助 conda env -h 关于环境 1.创建虚拟环境 conda create -n
阅读全文
摘要:vue相关 路径配置 1.根目录下的vite.config.js import {fileURLToPath, URL} from 'node:url' import {defineConfig} from 'vite' import vue from '@vitejs/plugin-vue' im
阅读全文
摘要:寒假第二十五天 一、实验目的(1)通过实验掌握Spark SQL的基本编程方法。(2)熟悉RDD到DataFrame的转化方法。(3)熟悉利用Spark SQL管理来自不同数据源的数据。 二、实验平台操作系统:LinuxSpark版本:2.4.5scala版本:2.11.8 三、实验内容和要求1.S
阅读全文
摘要:寒假第二十三天 RDD练习 # coding:utf8 from pyspark import SparkConf, SparkContext import json if __name__ == '__main__': conf = SparkConf().setAppName("test").s
阅读全文
摘要:寒假第二十二天 import requests from bs4 import BeautifulSoup # 定义要爬取的网页的 URL url = "https://example.com" # 发送 GET 请求获取页面内容 response = requests.get(url) # 检查请
阅读全文
摘要:寒假第二十一天 继续python爬虫练习 Requests库 requests库是一个常用于http请求的模块,可以方便的对网页进行爬取,是学习python爬虫比较好的http请求模块,比urllib库更加简洁,并且自带json解析器。 request提供的方法 get(url,params,**k
阅读全文
摘要:寒假第二十天 urllib.openurl:返回对象的方法 # 设置一个url对象 url = "百度一下,你就知道" #发送请求,打开url up = urllib.request.urlopen(url) print(type(up)) #返回对象 >>> <class 'http.client
阅读全文
摘要:第十九天 python爬虫学习 主要使用Urllib库 Urllib是Python中请求url连接的官方标准库,在Python2中主要为urllib和urllib2,在Python3中整合成了urllib。 主要包含以下4个模块 urllib.request:用于打开和阅读URL urllib.er
阅读全文
摘要:第十八天 代码JDBC连接 Pycharm软件连接ThriftServer 通过yum命令安装依赖 yum install zlib-devel bzip2-devel openssl-devel ncurses-devel sqlite-devel readline-devel tk-devel
阅读全文
摘要:第十七天 第六章:Spark On Hive 6.1 原理 6.2 配置 6.3 在代码中集成
阅读全文
摘要:第十六天 今日实验 # coding:utf8 from pyspark.sql import SparkSession from pyspark.sql.types import StructType, StringType, IntegerType import pandas as pd fro
阅读全文
摘要:第十五天 今天继续进行了练习 # coding:utf8 from pyspark.sql import SparkSession from pyspark.sql.types import StructType, StringType, IntegerType import pandas as p
阅读全文
摘要:第十四天 今天进行了sparksql练习 # coding:utf8 from pyspark.sql import SparkSession from pyspark.sql.types import StructType, StringType, IntegerType if __name__
阅读全文
摘要:第十三天 基于RDD方式2-通过StructType对象 # coding:utf8 from pyspark.sql import SparkSession from pyspark.sql.types import StructType, StringType, IntegerType if _
阅读全文
摘要:第十二天 第三章:DataFrame入门 3.1 DataFrame的组成 3.2 DataFrame的代码构建 基于RDD方式1-通过createDataFrame方法 # coding:utf8 from pyspark.sql import SparkSession if __name__ =
阅读全文
摘要:第十一天 今天开始学习spark sql 第二章:SparkSQL概述 SparkSQL和Hive的异同 SparkSQL的数据抽象 SparkSQL数据抽象的发展 DataFrame数据抽象 SparkSession对象 SparkSQL HelloWorld # coding:utf8 # Sp
阅读全文
摘要:第十天 实验5 Spark SQL 编程初级实践一、实验目的(1)通过实验掌握Spark SQL的基本编程方法。(2)熟悉RDD到DataFrame的转化方法。(3)熟悉利用Spark SQL管理来自不同数据源的数据。 二、实验平台操作系统:LinuxSpark版本:2.4.5scala版本:2.1
阅读全文
摘要:第九天 Spark内核调度(重点理解) DAG DAG的宽窄依赖和阶段划分 内存迭代计算 Spark并行度 Spark任务调度 DAG调度器 Task调度器 拓展-Spark概念名称大全
阅读全文
摘要:第八天。 共享变量 广播变量 累加器 广播变量累加器综合案例 # coding:utf8 import time from pyspark import SparkConf, SparkContext from pyspark.storagelevel import StorageLevel imp
阅读全文

浙公网安备 33010602011771号