数据质量分析

本文对读取的csv文件,进行了求最大值、最小值、平均值等处理,最后绘制了箱式图。

1、导入文件,并输出数据集的基本信息:

import pandas as pd
import matplotlib.pyplot as plt

df = pd.read_csv(r'C:\Users\12044\Desktop\catering_sale.csv')
print(df.describe())
'''
    count:样本总数量
    mean:平均值
    std:标准差
    min:最小数
    25%:第一个四分之一位数
    50%:中位数
    75%:第一个四分之三位数
    max:最大数
'''

输出结果:

 

 

 2、统计缺失的变量和样本个数:

print('缺失的变量的个数:', df['销量'].isnull().sum())
# 统计数据中缺失的总个数
df.fillna(0, inplace = True)
# 将缺失值改为0
count = 0
for x in df['销量']:
    if x == 0:
        print('缺失的变量的日期为:', df['日期'][count])
    count += 1
print('样本的总个数为:', len(df)-1)

输出结果:

 

 3、通过箱式图判断异常点:

plt.rcParams['font.sans-serif']=['SimHei']
#用来正常显示中文标签,默认中文为乱码
fig, axes = plt.subplots()
'''
用来创建 总画布/figure“窗口”的,有figure就可以在上边(或其中一个子网格/subplot上)作图了,(fig:是figure的缩写)。
相当于:
    fig = plt.figure()
    axes = fig.add_subplot(1,1,1)
'''
df['销量'][df.销量 < 10000].plot(kind='box',ax=axes)
# kind='box'箱式图;ax=axes,可理解为坐标轴
axes.set_ylabel('销量数量')
# y轴标示
plt.show()
# 显示图像

输出结果:

 

判断异常点的方法:

 

 

posted @ 2021-03-12 22:03  二师弟_k  阅读(115)  评论(1)    收藏  举报