1.对于《python机器学习基础教程》的调用各类函数,库之前,一定要先对原案例进行分析,这样子做最主要就是喂数据给函数,库的数据类型是什么要搞清楚,之前一直用dataframe,闹出不少笑话,还有要通过打印这些数据集,查看这些sklearn等库对于数据的适用范围大小。
同时应当指出的是make_blobs数据集只有100个,数据容纳度比较小,至少从目前来看,机器学习基础教程这本书到这里运用的数据集都比较小,但是适用,采用的特征都比较多,这反而却是在分析股票过程中所缺少的。
2.make_blobs的数据集中的random_state不是太懂
3.由于make_blobs数据集对应的特征值y有明显的距离,所以在区分的过程中有明显的分类效果。
3.1这是书本的效果

3.2这个是通过600006中,通过df.corr(),找出数据关联度高的数据集,选择了vol,money,通过对于大于3,小于0以及在此区间的涨跌幅进行特征标识中显示出来的效果,结果非常不明显。
这里就要思考几个问题:
如果将行情也就是涨幅进行了特征处理,那么对于vol,money也就意味着,vol,money可能存在缩量对应涨跌平的情况,放量对应涨跌平的情况,平量对应涨跌停的情况。也就是说,vol,money的距离不明显划分的情况下,很容易使得对应特征上出现交叉,从而无法完成分类。
因此,对于这种情况,还需要对vol,money进行进一步的分类和特征处理.


浙公网安备 33010602011771号