数据质量分析
本文对读取的csv文件,进行了求最大值、最小值、平均值等处理,最后绘制了箱式图。
1、导入文件,并输出数据集的基本信息:
import pandas as pd import matplotlib.pyplot as plt df = pd.read_csv(r'C:\Users\12044\Desktop\catering_sale.csv') print(df.describe()) ''' count:样本总数量 mean:平均值 std:标准差 min:最小数 25%:第一个四分之一位数 50%:中位数 75%:第一个四分之三位数 max:最大数 '''
输出结果:

2、统计缺失的变量和样本个数:
print('缺失的变量的个数:', df['销量'].isnull().sum()) # 统计数据中缺失的总个数 df.fillna(0, inplace = True) # 将缺失值改为0 count = 0 for x in df['销量']: if x == 0: print('缺失的变量的日期为:', df['日期'][count]) count += 1 print('样本的总个数为:', len(df)-1)
输出结果:

3、通过箱式图判断异常点:
plt.rcParams['font.sans-serif']=['SimHei'] #用来正常显示中文标签,默认中文为乱码 fig, axes = plt.subplots() ''' 用来创建 总画布/figure“窗口”的,有figure就可以在上边(或其中一个子网格/subplot上)作图了,(fig:是figure的缩写)。 相当于: fig = plt.figure() axes = fig.add_subplot(1,1,1) ''' df['销量'][df.销量 < 10000].plot(kind='box',ax=axes) # kind='box'箱式图;ax=axes,可理解为坐标轴 axes.set_ylabel('销量数量') # y轴标示 plt.show() # 显示图像
输出结果:

判断异常点的方法:

浙公网安备 33010602011771号