04 2018 档案

摘要:# 过滤式特征选择法的原理 使用发散性或相关性指标对各个特征进行评分,选择分数大于阈值的特征或者选择前K个分数最大的特征。具体来说,计算每个特征的发散性,移除发散性小于阈值的特征/选择前k个分数最大的特征;计算每个特征与标签的相关性,移除相关性小于阈值的特征/选择前k个分数最大的特征。 # 过滤式特征选择法的特点 特征选择过程与学习器无关,相当于先对初始特征... 阅读全文
posted @ 2018-04-30 15:00 wanglei5205 阅读(8682) 评论(0) 推荐(1)
摘要:数据和特征决定了机器学习的上限,而模型和算法只是逼近这个上限而已。特征选择是特种工程的重要组成部分,在现实任务中,获得数据之后通常先进性特征选择,用相关特征训练学习器。 特征选择的概念 相关特征:与当前学习任务相关的特征 无关特征:与当前学习任务无关的特征 特征选择:在不丢失重要特征的前提下,从给定的特征集合中选择出相关特征子集的过程(相关性) 特征选择的原因 1... 阅读全文
posted @ 2018-04-30 14:23 wanglei5205 阅读(640) 评论(0) 推荐(0)
摘要:原创博文,转载请注明出处! # 题目 # 思路 设置两个辅助变量small和big,small表示序列的最小值,big表示序列的最大值。如果sum(small ~ big) > s,则增大small的值。如果sum(small ~ big) #include using namespace std; class Solution { public: vector > ... 阅读全文
posted @ 2018-04-30 13:59 wanglei5205 阅读(369) 评论(0) 推荐(0)
摘要:生日转年龄 阅读全文
posted @ 2018-04-29 15:23 wanglei5205 阅读(1135) 评论(0) 推荐(0)
摘要:标准时间格式:2012-12-21 时间转换函数:pandas.to_datatime() # -*- coding: utf-8 -*- # 生成数据 import pandas as pd data = {'birth':['2011/12/01','2012/12/02','2012/12/03','2012/12/04','2012/12/05']} frame = pd.DataFr... 阅读全文
posted @ 2018-04-29 14:35 wanglei5205 阅读(4610) 评论(0) 推荐(0)
摘要:Vovan 3AG46-JJ48E-CEACC-8E6EW-ECUAW 阅读全文
posted @ 2018-04-27 16:08 wanglei5205 阅读(226) 评论(0) 推荐(0)
摘要:原创博文,转载请注明出处! 本文代码的github地址 series中的元素均为字符串时,通过str.split可将字符串按指定的分隔符拆分成若干列的形式。 例子: 拆分以逗号为分隔符的字符串 1 # -*- coding: utf-8 -*- 2 # 创建dataframe 3 import pandas as pd 4 s = pd.DataFrame(... 阅读全文
posted @ 2018-04-26 19:07 wanglei5205 阅读(12352) 评论(0) 推荐(0)
摘要:原创博文,转载请注明出处! # 题目 # 思路 首先定义两个指针,第一个指针p指向数组的第一个数字,第二个指针q指向数组的最后一个数字。如果p+q=s,则找到要找的数字;如果p+qs,则q向前移动一个数字。 # 代码 #include #include using namespace std; /* 输入一个递增排序的数组和一个数字s,在数组中查找两个数,使得他们的和正好是s。... 阅读全文
posted @ 2018-04-24 15:53 wanglei5205 阅读(337) 评论(0) 推荐(0)
摘要:原创博文,转载请注明出处! 本题牛客网地址 代码github地址 其他面试题索引地址 # 题目 # 思路 数组中有一个元素出现一次 如果从头到尾依次异或数组中的每一个数字,结果是只出现一次的数字,因为根据异或运算的性质,任何数字和自身做异或运算的结果是0。 举例:{4,5,5},数组中第一个元素的二 阅读全文
posted @ 2018-04-24 15:22 wanglei5205 阅读(422) 评论(0) 推荐(0)
摘要:原创博文,转载请注明出处! # 题目 # 举例 下图二叉树的深度为4,最长路径为1-2-5-7. # 思路(递归) 如果一个树只有一个节点,它的深度为1; 如果根节点只有左子树而没有右子树,那么树的深度应该是其左子树的深度+1; 如果根节点只有右子树而没有左子树,那么树的深度应该是其右子树的深度+1; 如果根节点既有左子树又有... 阅读全文
posted @ 2018-04-23 14:51 wanglei5205 阅读(2914) 评论(0) 推荐(0)
摘要:原创博文,转载请注明出处! # 题目 # 举例 # 思路 由平衡二叉树的定义可知,判断二叉树是否是平衡二叉树的关键在于判断任意结点是否是平衡结点。后序遍历二叉树,判断节点的子树是否平衡并计算节点的子树高度,判断结点是否平衡。如果按后序遍历的顺序,遍历到根节点后,根节点也是平衡结点,则二叉树是平衡二叉树。注意:叶子节点是平衡节点,叶子结点高度为1。 # 代码 1 //后续遍历二... 阅读全文
posted @ 2018-04-23 13:41 wanglei5205 阅读(1206) 评论(0) 推荐(0)
摘要:原创博文,转载请注明出处!# 题目# 思路 利用二分查找法,查找元素k在排序数组中第一次出现的位置m及最后一次出现的位置n,m-n+1即为元素k再排序数组中出现的次数。 二分查找法在数组中找到第一个k的思路:先拿数组中间元素mid和查找元素k比较,如果kmid,则第一个k只可能出现在数组的后半段;如果k=mid,则先判断中间元素是不是第一个k(如果mid前的元素不是k,则中间元... 阅读全文
posted @ 2018-04-22 17:14 wanglei5205 阅读(1329) 评论(0) 推荐(0)
摘要:原创文章,转载请注明出处! 博客文章索引地址 # 题目 #举例 如果两个单向链表有公共的节点,那么这两个链表从第一个公共结点开始,之后所有结点都是重合的,不可能再出现分叉。拓扑结构如下图所示: # 思路 第一次遍历两个链表得到两个链表的长度,以及两个链表长度的差值error;第二次遍历两个链表时,先 阅读全文
posted @ 2018-04-20 21:26 wanglei5205 阅读(630) 评论(0) 推荐(0)
摘要:原创文章,转载请注明出处!博客文章索引地址博客文章中代码的github地址# 题目# 思路 基于归并排序的思想统计逆序对:先把数组分割成子数组,再子数组合并的过程中统计逆序对的数目。统计逆序对时,先统计子数组内部的逆序对的数目,再统计相邻子数组的逆序对数目。1.基于归并思想统计逆序对的过程2.合并子数组统计逆序对的过程 把长度为2的子数组合并、排序并统计逆序对的过程。# 代码 ... 阅读全文
posted @ 2018-04-20 21:22 wanglei5205 阅读(4292) 评论(0) 推荐(0)
摘要:1.使用APScheduler教程参考博客地址 阅读全文
posted @ 2018-04-19 09:32 wanglei5205 阅读(210) 评论(0) 推荐(0)
摘要:转载自https://blog.csdn.net/blackyuanc/article/details/77892784问题场景: 在读取CSV文件后,在新增一个特征列并根据已有特征修改新增列的值,结果在修改的过程中碰到SettingWithCopyWarning警告。报错的做法: 1 import pandas as pd 2 import numpy as np 3 4 a... 阅读全文
posted @ 2018-04-18 21:45 wanglei5205 阅读(4174) 评论(0) 推荐(0)
摘要:原创博文,转载请注明出处!本题牛客网地址博客文章索引地址博客文章中代码的github地址1.题目2.思路3.代码 1 class Solution { 2 public: 3 int InversePairs(vector data) { 4 if(data.size() == 0){ 5 return 0; 6 } 7... 阅读全文
posted @ 2018-04-17 13:56 wanglei5205 阅读(1440) 评论(0) 推荐(0)
摘要:原创博文,转载请注明出处!本题牛客网地址博客文章索引地址博客文章中代码的github地址1.题目2.思路 空间换时间。建立一个哈希表,第一次扫描字符串时,统计每个字符的出现次数。第二次扫描字符串时,返回第一个只出现一次字符的位置。3.代码 1 class Solution { 2 public: 3 int FirstNotRepeatingChar(string str)... 阅读全文
posted @ 2018-04-17 10:41 wanglei5205 阅读(242) 评论(0) 推荐(0)
摘要:原创博文,转载请注明出处!本题牛客网地址博客文章索引地址博客文章中代码的github地址1. 题目2. 思路 空间换时间的方法。由于题目要求按序查找丑数,可以采用辅助容器vector按序存储丑数,返回指定位置丑数的策略。用辅助容器vector按序存储丑数的关键在于怎么按序计算丑数。按序计算丑数的方法:设辅助变量t2为一个丑数在vector中的索引,t2位置之前的丑数*2之后小于等于最大丑... 阅读全文
posted @ 2018-04-16 18:47 wanglei5205 阅读(1876) 评论(2) 推荐(0)
摘要:原创博文,转载请注明出处!本题牛客网地址 博客文章索引地址 博客文章中代码的github地址 # 题目 # 思路 1.排序 寻找数组元素排序规则,使得数组根据这个规则排序之后,数组元素能排成一个最小的数。排序规则如下: 若ab > ba, 则 a 大于 b, 若ab < ba ,则 a 小于 b, 阅读全文
posted @ 2018-04-15 11:03 wanglei5205 阅读(281) 评论(0) 推荐(0)
摘要:原创博文,转载请注明出处!本题牛客网地址 博客文章索引地址 博客文章中代码的github地址 # 题目 # 思路 分析1在数字中出现的规律。设数字N = abcde ,其中abcde分别为十进制中各位上的数字。如果要计算百位上1出现的次数,它要受到3方面的影响:百位上的数字,百位以下(低位)的数字, 阅读全文
posted @ 2018-04-14 09:16 wanglei5205 阅读(437) 评论(0) 推荐(0)
摘要:原创博文,转载请注明出处!本题牛客网地址 博客文章索引地址 博客文章中代码的github地址 # 题目 输入一个整形数组,数组里有正数也有负数。数组中的一个或连续多个整数组成一个子数组。求所有子数组的和的最大值,时间复杂度为O(n)。 # 思路 分析计算连续子数组最大和的规律。下图是我们计算数组(1 阅读全文
posted @ 2018-04-13 22:12 wanglei5205 阅读(1594) 评论(0) 推荐(0)
摘要:原创博文,转载请注明出处! http://github.com/wanglei5205 http://cnblogs.com/wanglei5205 # 题目 输入n个整数,找出其中最小的K个数。例如输入4,5,1,6,2,7,3,8这8个数字,则最小的4个数字是1,2,3,4 # 思路 基于Par 阅读全文
posted @ 2018-04-13 21:15 wanglei5205 阅读(1838) 评论(0) 推荐(0)
摘要:原创博文,转载请注明出处! # 题目 数组中有一个数字出现的次数超过数组长度的一半,请找出这个数字。例如输入一个长度为9的数组{1,2,3,2,2,2,5,4,2}。由于数字2在数组中出现了5次,超过数组长度的一半,因此输出2。如果不存在则输出0。 举例:输入一个长度为9的数组{1,2,3,2,2, 阅读全文
posted @ 2018-04-12 11:27 wanglei5205 阅读(805) 评论(0) 推荐(0)
摘要:原创博文,转载请注明出处! 本题代码github地址 题目 输入一个字符串,按字典序打印出该字符串中字符的所有排列。例如输入字符串abc,则打印出由字符a,b,c所能排列出来的所有字符串abc,acb,bac,bca,cab和cba。 思路(递归) 分两步求字符串的全排列:首先求所有可能出现在第一个 阅读全文
posted @ 2018-04-11 11:26 wanglei5205 阅读(391) 评论(0) 推荐(0)
摘要:二叉搜索树转换成一个排序的双向链表 阅读全文
posted @ 2018-04-10 16:15 wanglei5205 阅读(2271) 评论(0) 推荐(0)
摘要:原创博文,转载请注明出处!# OneHotEncoder编码 OneHotEncoder编码称为“哑编码”或“独热编码”,是将表示分类的数据扩维度,由列向量扩展为稀疏矩阵# OneHotEncoder例子 1 # -*- coding: utf-8 -*- 2 from sklearn.preprocessing import OneHotEncoder 3 ohe = OneHo... 阅读全文
posted @ 2018-04-08 19:39 wanglei5205 阅读(681) 评论(0) 推荐(0)
摘要:原创博文,转载请注明出处!# LabelEncoder介绍 LabelEncoder是对不连续的数字或文本编号。# LabelEncoder例子 1 # -*- coding: utf-8 -*- 2 from sklearn.preprocessing import LabelEncoder 3 le = LabelEncoder().fit([1,111,122,188,999... 阅读全文
posted @ 2018-04-08 19:30 wanglei5205 阅读(7919) 评论(0) 推荐(0)
摘要:原创文章,转载请注明出处! 博客文章索引地址 博客文章中代码的github地址 # 基本思想(分治法) 归并排序中, “归”代表递归的意思,即递归的将数组通过折半的方式分离为单个数组。 “并”代表合并的意思,即将分开的数据按照从小到大或从大到小的顺序合并。运用分治法进行归并排序的过程如下: # 合并 阅读全文
posted @ 2018-04-07 16:18 wanglei5205 阅读(1348) 评论(0) 推荐(0)
摘要:原创文章,转载请注明出处! 博客文章索引地址 博客文章中代码的github地址 # 预备知识 堆是一种特殊的树形数据结构,即完全二叉树。堆分为大根堆和小根堆,大根堆为根节点的值大于两个子节点的值;小根堆为根节点的值小于两个子节点的值,同时根节点的两个子树也分别是一个堆。 # 基本思路 步骤一:建立大 阅读全文
posted @ 2018-04-07 15:51 wanglei5205 阅读(36059) 评论(3) 推荐(6)
摘要:原创博文,转载请注明出处! 本文代码的github地址 # 基本思想 ”快速排序“是对”冒泡排序“的改进。 基本原理:基于分治法,在待排线性表中取一个元素pivot作为枢轴值,通过一趟排序将待排线性表划分为独立的两部分,第一部分的所有元素小于pivot,第二部分的所有元素大于等于pivot,pivo 阅读全文
posted @ 2018-04-07 10:08 wanglei5205 阅读(1053) 评论(0) 推荐(0)
摘要:原创博文,转载请注明出处! 本文代码的github地址 # 基本思路 希尔排序是”直接插入排序“的改进版,也称为“缩小增量排序”。基本原理:先将待排序的数组元素分成多个序列,然后对每个子序列分别进行直接插入排序,最后再对所有元素进行一次直接插入排序。 # C++代码 阅读全文
posted @ 2018-04-06 12:26 wanglei5205 阅读(2973) 评论(0) 推荐(1)
摘要:原创文章,转载请注明出处! 博客文章索引地址 博客文章中代码的github地址 # 基本思想(从小到大排序) 对于给定的n个元素,从第一个元素开始,依次对相邻的两个元素进行比较,当前面的记录大于后面的元素,交换位置,进行一轮比较和移动后,n个元素中最大的元素位于第n位;然后对前n-1个元素进行第二轮 阅读全文
posted @ 2018-04-05 22:13 wanglei5205 阅读(715) 评论(0) 推荐(0)
摘要:# 基本思想 每一趟从待排序的数据元素中选择最小(或最大)的一个元素作为首元素,直到所有元素排完为止。 排序实例 初始关键字 [49 38 65 97 76 13 27 49] 第一趟排序后 13 [38 65 97 76 49 27 49] 第二趟排序后 13 27 [65 97 76 49 38 阅读全文
posted @ 2018-04-05 21:19 wanglei5205 阅读(1377) 评论(0) 推荐(0)
摘要:# 基本思想 每一步将一个待排序的记录,插入到前面已经排好序的有序序列中去,直到插完所有元素为止。 # C++代码 #性能分析 阅读全文
posted @ 2018-04-05 20:34 wanglei5205 阅读(1292) 评论(0) 推荐(0)
摘要:# lightgbm和xgboost对比: 模型精度:lightgbm≈xgboost 收敛速度:lightgbm>xgboost# 阅读全文
posted @ 2018-04-05 14:19 wanglei5205 阅读(871) 评论(0) 推荐(0)
摘要:lightgbm使用leaf_wise tree生长策略,leaf_wise_tree的优点是收敛速度快,缺点是容易过拟合。# lightgbm关键参数# lightgbm调参方法cv代码github地址 1 # -*- coding: utf-8 -*- 2 """ 3 # 作者:wanglei5205 4 # 邮箱:wanglei5205@126.com 5 # 博客:htt... 阅读全文
posted @ 2018-04-05 13:38 wanglei5205 阅读(17915) 评论(3) 推荐(2)
摘要:问题:win和mac平台运行相同的xgboost代码,效果不同?解决:xgboost的参数colsample_bytree设置为1。 阅读全文
posted @ 2018-04-05 12:51 wanglei5205 阅读(493) 评论(0) 推荐(0)
摘要:官方文档 github地址 例子: 创建DataFrame 1 ### 导入模块 2 import numpy as np 3 import pandas as pd 4 import matplotlib.pyplot as plt 5 6 test = pd.DataFrame({'a':[11,22,33],'b':[44,55,66]}) 7 """ ... 阅读全文
posted @ 2018-04-04 15:34 wanglei5205 阅读(11356) 评论(0) 推荐(0)
摘要:复杂链表的复制 阅读全文
posted @ 2018-04-02 19:11 wanglei5205 阅读(381) 评论(0) 推荐(0)
摘要:原创文章,转载请注明出处! 博客文章索引地址 1.题目 输入一颗二叉树和一个整数,打印出二叉树中结点值的和为输入整数的所有路径。路径由结点和有向边组成,从根结点到叶节点。 举例: 二叉树中有两条和为22的路径:{10,5,7}和{10,12} 2.思路 本题使用前序遍历的方式访问节点,使用二维向量r 阅读全文
posted @ 2018-04-01 15:40 wanglei5205 阅读(2210) 评论(0) 推荐(0)

levels of contents