随笔分类 -  pandas

利用numpy select 和numpy where 做pandas数据处理
摘要:还是最近的那个项目,最后收尾阶段遇到这样一个问题:根据表格每一行某几列的数据进行条件筛选后并生成新的一列数据。 像下面这个示例一样👇: 需要根据每一行的“ 生日”,“地址”,“保险”是否有值来生成新的一列字段,比如叫“完整度”字段。 就拿王佳来说,因为他的 “保险”字段是空值,但是“地址”和“生日 阅读全文

posted @ 2022-07-07 18:57 多一点 阅读(299) 评论(0) 推荐(0)

pandas 实现sql row number over 功能
摘要:1. pandas 实现sql row number over() 功能 padnas 链接: https://pandas.pydata.org/pandas-docs/stable/getting_started/comparison/comparison_with_sql.html 阅读全文

posted @ 2021-04-27 22:26 多一点 阅读(451) 评论(0) 推荐(0)

Mercari Price Suggestion in Kaggle
摘要:Mercari Price Suggestion 最近看到了一个竞赛,竞赛的内容是根据已知的商品的描述,品牌,品类,物品的状态等特征来预测商品的价格 最后的评估标准为 平均算术平方根误差 "Root Mean Squared Logarithmic Error" . $$ \epsilon = \s 阅读全文

posted @ 2019-06-25 22:39 多一点 阅读(803) 评论(0) 推荐(0)

pandas pivot_table或者groupby实现sql 中的count distinct 功能
摘要:pandas pivot_table或者groupby实现sql 中的count distinct 功能 .dataframe tbody tr th:only of type { vertical align: middle; } .dataframe tbody tr th { vertical 阅读全文

posted @ 2019-03-28 11:47 多一点 阅读(4083) 评论(0) 推荐(1)

pandas功能使用rename, reindex, set_index 详解
摘要:pandas rename 功能 在使用 pandas 的过程中经常会用到修改列名称的问题,会用到 rename 或者 reindex 等功能,每次都需要去查文档 当然经常也可以使用 df.columns重新赋值为某个列表 用 rename 则可以轻松应对 pandas 中修改列名的问题 导入常用的 阅读全文

posted @ 2019-02-23 22:51 多一点 阅读(7179) 评论(0) 推荐(0)

pandas replace 替换功能function
摘要:<! vscode markdown toc 1. "list like replace method" 2. " dict like replace method" 3. "regex expression" <! vscode markdown toc config numbering=true 阅读全文

posted @ 2018-12-22 15:22 多一点 阅读(2286) 评论(0) 推荐(0)

pandas 处理文本数据
摘要:常规的字符串操作 0 A 1 B 2 C 3 AaBa 4 Baca 5 NaN 6 dog 7 cat dtype: object 0 a 1 b 2 c 3 aaba 4 baca 5 NaN 6 dog 7 cat dtype: object 0 A 1 B 2 C 3 AABA 4 BACA 阅读全文

posted @ 2018-12-11 23:42 多一点 阅读(1951) 评论(0) 推荐(0)

pandas 基础操作 更新
摘要:<! TOC "创建一个Series,同时让pandas自动生成索引列" "创建一个DataFrame数据框" "查看数据" "数据的简单统计" "数据的排序" "选择数据(类似于数据库中sql语句)" "另外可以使用标签来选择" "通过位置获取数据" "布尔值索引" "设定数值(类似于sql up 阅读全文

posted @ 2018-12-09 20:42 多一点 阅读(504) 评论(0) 推荐(0)

pandas 基础
摘要:<! TOC "创建一个Series ,同时让pandas自动生成索引列" "创建一个DataFrame数据框" "查看数据" "数据的简单统计" "数据的排序" "选择数据(类似于数据库中sql语句)" "另外可以使用标签来选择" "通过位置获取数据" "布尔值索引" "设定数值(类似于sql u 阅读全文

posted @ 2018-11-18 21:48 多一点 阅读(355) 评论(1) 推荐(1)

kaggle竞赛-保险转化-homesite
摘要:<! TOC "时间格式的转化" "查看数据类型" "查看DataFrame的详细信息" "填充缺失值" "category 数据类型转化" "模型参数设定" "结论" <! /TOC 该项目是针对kaggle中的 "homesite" 进行的算法预测,使用xgboost的sklearn接口,进行数 阅读全文

posted @ 2018-10-12 16:06 多一点 阅读(875) 评论(0) 推荐(0)

加州房价预测数据预处理
摘要:<! @import "[TOC]" {cmd="toc" depthFrom=1 depthTo=6 orderedList=false} <! code_chunk_output "本文是该系列读书笔记的第二章数据预处理部分" "获取数据" "数据的初步分析,数据探索" "地理分布" "数据特征 阅读全文

posted @ 2018-09-07 09:45 多一点 阅读(4058) 评论(0) 推荐(0)

numpy 中不常用的一些方法
摘要:作者:代码律动链接:https://zhuanlan.zhihu.com/p/36303821来源:知乎著作权归作者所有。商业转载请联系作者获得授权,非商业转载请注明出处。 挑战 1:引入 numpy 并查看 numpy 的版本。 要求:这是第一步,以后我们使用 numpy 时都将用别名 np。 # 阅读全文

posted @ 2018-08-27 14:17 多一点 阅读(1388) 评论(0) 推荐(0)

pandas.DataFrame对行和列求和及添加新行和列
摘要:pandas.DataFrame对行和列求和及添加新行和列 导入模块: 生成DataFrame数据 计算各列数据总和并作为新列添加到末尾 计算各行数据总和并作为新行添加到末尾 最终数据结果: 阅读全文

posted @ 2018-08-27 13:49 多一点 阅读(8811) 评论(0) 推荐(1)

numpy中数据合并,stack ,concentrate,vstack,hstack
摘要:在python的numpy库中有一个函数np.stack(), 看过一些博文后觉得别人写的太复杂,然后自己有了一些理解之后做了一些比较简单的解释 np.stack 首先stack函数用于堆叠数组,其调用方式如下所示: np.stack(arrays,axis=0) 其中arrays即需要进行堆叠的数 阅读全文

posted @ 2018-08-27 13:44 多一点 阅读(11567) 评论(0) 推荐(0)

sohu_news搜狐新闻类型分类
摘要:数据获取 数据是从搜狐新闻开放的新闻xml数据,经过一系列的处理之后,生成的一个excel文件 该xml文件的处理有单独的处理过程,就是用pandas处理,该过程在此省略 读取新闻文本文件,查看文本的长度 去掉长度小于50的文本 查看新闻类型的分布,共9类 health 30929 news 276 阅读全文

posted @ 2018-08-24 17:16 多一点 阅读(956) 评论(1) 推荐(0)

pandas pivot_table 活学活用实例教程
摘要:<! TOC "pandas pivot_table 活学活用实例教程" " 导入相关数据分析的库 " " 首先进行commentTime时间进行数据预处理 " " 查看数据类型信息 " " 最简单的透视表 " " 直接敲击该函数 , 在notebook中可以查看该函数的参数 " " 多个索引列 " 阅读全文

posted @ 2018-08-20 23:51 多一点 阅读(3925) 评论(4) 推荐(4)

基于pandas python的美团某商家的评论销售数据分析(可视化)
摘要:基于pandas python的美团某商家的评论销售数据分析 第一篇 "数据初步的统计" 本文是该可视化系列的第二篇 第三篇 "数据中的评论数据用于自然语言处理" 导入相关库 数据清洗与简单统计 评论数据,其中包括一下几个字段 是否匿名,均价,评价(以去掉,后续会做一些关于这些评论的更为深入的分析) 阅读全文

posted @ 2018-08-11 23:37 多一点 阅读(3221) 评论(1) 推荐(1)

基于pandas python的美团某商家的评论销售(数据分析)
摘要:数据初步的分析 本文是该系列的第一篇 数据清洗 数据初步的统计 第二篇 "数据可视化" 第三篇 "数据中的评论数据用于自然语言处理" .dataframe tbody tr th:only of type { vertical align: middle; } .dataframe tbody tr 阅读全文

posted @ 2018-08-08 23:52 多一点 阅读(4240) 评论(4) 推荐(1)

pandas category数据类型
摘要:实际应用pandas过程中,经常会用到category数据类型,通常以string的形式显示,包括颜色(红,绿,蓝),尺寸的大小(大,中,小),还有地理信息等(国家,省份),这些数据的处理经常会有各种各样的问题,pandas以及scikit learn两个包可以将category数据转化为合适的数值 阅读全文

posted @ 2018-08-02 15:53 多一点 阅读(10691) 评论(1) 推荐(2)

pandas 数据类型转换
摘要:数据处理过程的数据类型 当利用pandas进行数据处理的时候,经常会遇到数据类型的问题,当拿到数据的时候,首先需要确定拿到的是正确类型的数据,一般通过数据类型的转化,这篇文章就介绍pandas里面的数据类型(data types也就是常用的dtyps),以及pandas与numpy之间的数据对应关系 阅读全文

posted @ 2018-08-02 00:14 多一点 阅读(159711) 评论(12) 推荐(12)

导航