1 #
2 8. (其它)
3 # 导入Pandas模块
4 # 获取数据
5 # 要求:导入待处理的数据demo.xls,并显示前5行。
6 import pandas as pd
7
8 pd.set_option('display.unicode.east_asian_width',True)
9 # 将此表另存为csv类型数据后,导入并显示前5行
10 print('## 导入并显示前5行\n')
11 df=pd.read_excel(r'C:\Users\11059\Desktop\python 可视化作业文件\第九次作业文件\demo.xls',header=0,nrows =5)
12 pff=pd.DataFrame(df)
13 print(pff)
14
15
16
17 # 3.分析数据
18 # (1)查看数据的描述信息。通过结果查看记录条数、每个字段的均值和方差。
19 import pandas as pd
20
21 data = pd.read_excel(r'C:\Users\11059\Desktop\python 可视化作业文件\第九次作业文件\demo.xls', header=0)
22 print(data.describe())
23
24
25
26
27 # (2)显示聚餐时间段time的不重复值。找出有拼写错误的行。
28 import pandas as pd
29
30 data = pd.read_excel(r'C:\Users\11059\Desktop\python 可视化作业文件\第九次作业文件\demo.xls', header=0)
31 print(data.drop_duplicates(["time"]))
32
33
34
35
36
37 # (3)修改拼写错误的字段值。
38 import pandas as pd
39
40 data = pd.read_excel(r'C:\Users\11059\Desktop\python 可视化作业文件\第九次作业文件\demo.xls', header=0)
41 data["time"].replace("Dinnerr", "Dinner", inplace=True)
42 print(data.drop_duplicates(["time"]))
43
44
45
46 # (4)检测数据中的缺失值。
47 import pandas as pd
48
49 data = pd.read_excel(r'C:\Users\11059\Desktop\python 可视化作业文件\第九次作业文件\demo.xls', header=0)
50 print(data.isnull().sum())
51
52
53
54
55 # (5)删除sex或time为空的行。
56 import pandas as pd
57
58 data = pd.read_excel(r'C:\Users\11059\Desktop\python 可视化作业文件\第九次作业文件\demo.xls', header=0)
59 data.dropna(subset=["sex", "time"], axis=0, how="any", inplace=True)
60 print(data.head())
61
62
63
64
65 # (6)对剩余有空缺的数据用平均值替换。
66 import pandas as pd
67
68 data = pd.read_excel(r'C:\Users\11059\Desktop\python 可视化作业文件\第九次作业文件\demo.xls', header=0)
69 print(data.head())
70 data["total_bill"].fillna(int(data["total_bill"].mean()), inplace=True)
71 print(data.head())