随笔分类 -  数据分析

摘要:在python中sql=“xxxxxxxx”cursor.execute(sql)execute提交的是 个字符串,所以考虑格式化字符串传参 insert into (%s,%s,%s,%s、、、、)values(%s,%s,%s、、、)1这样的结果就是当字段特别大的时候能累死,而且我又很懒最重要的 阅读全文
posted @ 2022-06-09 14:47 傻白甜++ 阅读(301) 评论(0) 推荐(0)
摘要:一、写入到多个sheet中 这个就和之前写过的“解决pandas中to_excel 数据覆盖sheet表问题”是差不多的,如果要实现同时写多个sheet的话,加一个循环或者判断就好。现在下面给“解决pandas中to_excel 数据覆盖sheet表问题”的代码。可以针对sheet_name做修改或 阅读全文
posted @ 2022-06-09 14:38 傻白甜++ 阅读(3973) 评论(0) 推荐(0)
摘要:前言 RPA 设计器版本: 2020.2 Python 读取三种不同存储格式 Excel 文件 Excel 文件的存储格式有多种, 有我们平常熟知的二进制格式,也有 HTML 格式,还有 XML 格式的等。 目前,小编接触到 RPA 项目的 Excel 文件格式主要是上述说的三种格式(二进制、HTM 阅读全文
posted @ 2021-12-30 15:42 傻白甜++ 阅读(1602) 评论(0) 推荐(0)
摘要:import datetimeimport numpy as np def func(x): try: return str(datetime.datetime.strptime(str(x)[:14], '%Y%m%d%H%M%S')) except: return np.NaN df['交易时间 阅读全文
posted @ 2021-12-30 15:11 傻白甜++ 阅读(749) 评论(0) 推荐(0)
摘要:在学习Pandas时,当对一个Series或者DataFrame进行重新索引时,需要用到pandas.Series.reindex()或者pandas.DataFrame.reindex()。当某个索引值不存在时,会直接引入缺失值NaN。我们可以通过填充的方式,使Series或者DataFrame中 阅读全文
posted @ 2021-09-09 14:38 傻白甜++ 阅读(607) 评论(0) 推荐(0)
摘要:阅读提示 本文将提到Pandas数据合并方法merge()、concat()、combine_first()方法,数据的重塑和矩阵转置等操作的实现 目录 阅读提示 一、数据合并 1、pandas.merge() 方法 以列名为连接键 以索引作为连接键 2、pandas.concat() 方法 3、c 阅读全文
posted @ 2021-07-06 10:16 傻白甜++ 阅读(2116) 评论(0) 推荐(0)
摘要:针对单列条件: #常规方式 import pandas as pd df = pd.DataFrame({'one':['a', 'a', 'b', 'c'], 'two':[3,1,2,3], 'three':['C','B','C','A']}) print(df) df.loc[df['two 阅读全文
posted @ 2021-06-24 16:31 傻白甜++ 阅读(1606) 评论(0) 推荐(0)
摘要:expand表示是否把series类型转化为DataFrame类型 下面代码中的n表示去掉下划线"_"的数量 代码如下: import numpy as np import pandas as pd s2 = pd.Series(['a_b_c_f_j', 'c_d_e_f_h', np.nan, 阅读全文
posted @ 2020-10-12 11:21 傻白甜++ 阅读(1609) 评论(0) 推荐(1)
摘要:pandas中,这三种方法都是用来对表格进行重排的,其中stack()是unstack()的逆操作。某种意义上,unstack()方法和pivot()方法是很像的,主要的不同在于,unstack()方法是针对索引或者标签的,即将列索引转成最内层的行索引;而pivot()方法则是针对列的值,即指定某列 阅读全文
posted @ 2020-10-12 11:20 傻白甜++ 阅读(1555) 评论(0) 推荐(0)
摘要:数据分组 分组统计 - groupby功能 ① 根据某些条件将数据拆分成组 ② 对每个组独立应用函数 ③ 将结果合并到一个数据结构中 Dataframe在行(axis=0)或列(axis=1)上进行分组,将一个函数应用到各个分组并产生一个新值,然后函数执行结果被合并到最终的结果对象中。 df.gro 阅读全文
posted @ 2020-10-10 13:53 傻白甜++ 阅读(12382) 评论(0) 推荐(0)
摘要:数据清洗是一项复杂且繁琐的工作,同时也是整个数据分析过程中最为重要的环节。 在python中空值被显示为NaN。首先,我们要构造一个包含NaN的DataFrame对象。 >>> import numpy as np >>> import pandas as pd >>> from pandas im 阅读全文
posted @ 2020-10-10 13:45 傻白甜++ 阅读(4509) 评论(0) 推荐(0)
摘要:Action 操作 collect() ,返回值是一个数组,返回dataframe集合所有的行 collectAsList() 返回值是一个java类型的数组,返回dataframe集合所有的行 count() 返回一个number类型的,返回dataframe集合的行数 describe(cols 阅读全文
posted @ 2020-09-24 11:35 傻白甜++ 阅读(1105) 评论(0) 推荐(0)
摘要:在处理数据的时候,很多时候会遇到批量替换的情况,如果一个一个去修改效率过低,也容易出错。replace()是很好的方法。 源数据 1、替换全部或者某一行 replace的基本结构是:df.replace(to_replace, value) 前面是需要替换的值,后面是替换后的值。 例如我们要将南岸改 阅读全文
posted @ 2020-09-24 11:32 傻白甜++ 阅读(5165) 评论(0) 推荐(0)
摘要:时间序列(time series)数据是一种重要的结构化数据形式,应用于多个领域,包括金融学、经济学、生态学、神经科学、物理学等。在多个时间点观察或测量到的任何事物都可以形成一段时间序列。很多时间序列是固定频率的,也就是说,数据点是根据某种规律定期出现的(比如每15秒、每5分钟、每月出现一次)。时间 阅读全文
posted @ 2020-09-18 10:36 傻白甜++ 阅读(727) 评论(0) 推荐(0)
摘要:对数据集进行分组并对各组应用一个函数(无论是聚合还是转换),通常是数据分析工作中的重要环节。在将数据集加载、融合、准备好之后,通常就是计算分组统计或生成透视表。pandas提供了一个灵活高效的gruopby功能,它使你能以一种自然的方式对数据集进行切片、切块、摘要等操作。 关系型数据库和SQL(St 阅读全文
posted @ 2020-09-18 10:35 傻白甜++ 阅读(1409) 评论(0) 推荐(0)
摘要:在许多应用中,数据可能分散在许多文件或数据库中,存储的形式也不利于分析。本章关注可以聚合、合并、重塑数据的方法。 首先,我会介绍pandas的层次化索引,它广泛用于以上操作。然后,我深入介绍了一些特殊的数据操作。在第14章,你可以看到这些工具的多种应用。 层次化索引 层次化索引(hierarchic 阅读全文
posted @ 2020-09-18 10:33 傻白甜++ 阅读(751) 评论(0) 推荐(0)
摘要:numpy.linspace()等差数列函数 返回在指定范围内的均匀间隔的数字(组成的数组),也即返回一个等差数列 start - 起始点, stop - 结束点 num - 元素个数,默认为50, endpoint - 是否包含stop数值,默认为True,包含stop值;若为False,则不包含 阅读全文
posted @ 2019-03-11 17:05 傻白甜++ 阅读(1059) 评论(0) 推荐(0)
摘要:# 导包 import numpy as np import matplotlib.pyplot as plt from sklearn.neighbors import KNeighborsClassifier # 获取数据 feature = [] target = [] for i in range(10): for j in range(1,501): img_... 阅读全文
posted @ 2019-03-11 16:26 傻白甜++ 阅读(424) 评论(0) 推荐(0)
摘要:导引: 如何进行电影分类 众所周知,电影可以按照题材分类,然而题材本身是如何定义的?由谁来判定某部电影属于哪 个题材?也就是说同一题材的电影具有哪些公共特征?这些都是在进行电影分类时必须要考虑的问 题。没有哪个电影人会说自己制作的电影和以前的某部电影类似,但我们确实知道每部电影在风格 上的确有可能会 阅读全文
posted @ 2019-03-08 20:38 傻白甜++ 阅读(789) 评论(0) 推荐(0)
摘要:s1 = ma5 < ma30 T->F金叉 F->T死叉 s2 = ma5 >= ma30 s1 T T F F T T F F s2 F F T T F F T T T F T T T F T F T F F F T F ~(s1 | s2.shift(1)) 问题:如果我从假如我从2010年1 阅读全文
posted @ 2019-03-08 20:20 傻白甜++ 阅读(896) 评论(0) 推荐(0)

TOP