pandas用法(1)
(1)pandas简介
pandas是一个开源的,BSD许可的库,为python编程语言提供高性能,易于使用的数据结构和数据分析工具。
pandas提供了两种易于使用的重要数据类型,Series和DataFrame,可以使用如下语句调用;
from pandas import Series,DataFrame
Series可以由一个数组的数据构成
import pandas as pd
s1=pd.Series([150,80,67,60])
查看
s1.index
s1.values
(2)Series用法
1、创建Series的时候,指定index关键字的方式创建带有自定义索引的Series
s2=pd.Series([100,79,65,77],index=["chinese","english","history","maths"])
查看s2
s2[["english","history"]]
2、由字典直接转化而来
d1={"name":"张三","Gender":"男","age":20,"height":180,"weight":66}
查看:
d1
d1[["name","height","weight"]]
(3)DataFrame用法
DataFrame是类似于电子表格的数据结构,有行和列的索引,可以被看做一个Series的字典
使用字典创建DataFrame
import pandas as pd
dfPerson={"name":["tom","jack",'kitty","eric"],"age":[20,19,21,22],"height":[180,178,170,182],"weight":[66,65,52,75]}
personSheet=pd.DataFrame(dfPerson)
查看
personSheet.head() 获取前5行数据
personSheet.columns
personSheet.values
personSheet.age
2、通过numpy创建DataFrame
a=np.random.randn(10,5)
创建10行5列正则化的随机数
ss=pd.DataFrame(a)
ss.info()
ss.dtypes
(4)数据操作
将excel和csv中的数据导入进来
读取csv中的数据
personInfo=pd.read_csv("datalab/28496/pesonInfo.csv",header=None,names=["name","age","height","weight"])
personInfo 查看
personInfoed=personInfo.groupby(["age"])
personInfoed.count()
读取excel中的数据
personInfo=pd.read_excel("datalab/28496/pesonInfo.xslx",header=None,names=["name","age","height","weight"])
常用操作方法
1、shape可以获取excel文件的行和列,以元组形式返回
2、info()获取数据类型
3、isnull()判断哪个值是缺失值
4、head()传入的参数代表获取前几行
5、describe()掌握数值的分布情况,如均值。最值、方差,分位数
6、drop()是否将原索引删掉,设置参数inplace来确认是否修改原数据表
7、dropna()删除有缺失值的行,返回删除后的数据,传入参数how=all,要全为控制才会删除
8、fillna()括号内可直接填入要填充的值,也可指定列填充,以字典形式传参
(5)排序
sort_index排序方法: 对于Series
dataSort=pd.Series(range(5),index=['a','b','e','c','d'])
dataSort.sort_index()
sort_index()方法默认升序排序,但可以通过指定参数ascending=False来降序排序
dataSort.sort_index(ascending=False)
对于DataFrame,可以通过axis=0|1来根据轴索引进行排序
-----------------------------------------------------------
(6)分组与合并
groupby() pd.concat()
DataFrame的合并 。。。。。。。。。。。。。。。
---------------------------------------------------------------

浙公网安备 33010602011771号