python可视化:第九次作业,数据清洗

 1 #
 2  8. (其它)
 3 # 导入Pandas模块
 4 # 获取数据
 5 # 要求:导入待处理的数据demo.xls,并显示前5行。
 6 import pandas as pd
 7 
 8 pd.set_option('display.unicode.east_asian_width',True)
 9 # 将此表另存为csv类型数据后,导入并显示前5行
10 print('## 导入并显示前5行\n')
11 df=pd.read_excel(r'C:\Users\11059\Desktop\python 可视化作业文件\第九次作业文件\demo.xls',header=0,nrows =5)
12 pff=pd.DataFrame(df)
13 print(pff)
14 
15 
16 
17 # 3.分析数据
18 # (1)查看数据的描述信息。通过结果查看记录条数、每个字段的均值和方差。
19 import pandas as pd
20 
21 data = pd.read_excel(r'C:\Users\11059\Desktop\python 可视化作业文件\第九次作业文件\demo.xls', header=0)
22 print(data.describe())
23 
24 
25 
26 
27 # (2)显示聚餐时间段time的不重复值。找出有拼写错误的行。
28 import pandas as pd
29 
30 data = pd.read_excel(r'C:\Users\11059\Desktop\python 可视化作业文件\第九次作业文件\demo.xls', header=0)
31 print(data.drop_duplicates(["time"]))
32 
33 
34 
35 
36 
37 # (3)修改拼写错误的字段值。
38 import pandas as pd
39 
40 data = pd.read_excel(r'C:\Users\11059\Desktop\python 可视化作业文件\第九次作业文件\demo.xls', header=0)
41 data["time"].replace("Dinnerr", "Dinner", inplace=True)
42 print(data.drop_duplicates(["time"]))
43 
44 
45 
46 # (4)检测数据中的缺失值。
47 import pandas as pd
48 
49 data = pd.read_excel(r'C:\Users\11059\Desktop\python 可视化作业文件\第九次作业文件\demo.xls', header=0)
50 print(data.isnull().sum())
51 
52 
53 
54 
55 # (5)删除sex或time为空的行。
56 import pandas as pd
57 
58 data = pd.read_excel(r'C:\Users\11059\Desktop\python 可视化作业文件\第九次作业文件\demo.xls', header=0)
59 data.dropna(subset=["sex", "time"], axis=0, how="any", inplace=True)
60 print(data.head())
61 
62 
63 
64 
65 # (6)对剩余有空缺的数据用平均值替换。
66 import pandas as pd
67 
68 data = pd.read_excel(r'C:\Users\11059\Desktop\python 可视化作业文件\第九次作业文件\demo.xls', header=0)
69 print(data.head())
70 data["total_bill"].fillna(int(data["total_bill"].mean()), inplace=True)
71 print(data.head())

 

posted @ 2021-11-28 22:20  Bruce_Sun  阅读(158)  评论(0)    收藏  举报