05 2020 档案

摘要:13-垃圾邮件分类2 1.读取 2.数据预处理 3.数据划分—训练集和测试集数据划分 from sklearn.model_selection import train_test_split x_train,x_test, y_train, y_test = train_test_split(dat 阅读全文
posted @ 2020-05-25 19:57 longlog 阅读(206) 评论(0) 推荐(0)
摘要:1. 读邮件数据集文件,提取邮件本身与标签。 列表 numpy数组代码: import csv file_path =r"SMSSpamCollection" sms= open(file_path,'r',encoding='utf-8') data=csv.reader(sms,delimite 阅读全文
posted @ 2020-05-20 15:28 longlog 阅读(190) 评论(0) 推荐(0)
摘要:1.理解分类与监督学习、聚类与无监督学习。 简述分类与聚类的联系与区别。 简述什么是监督学习与无监督学习。 简述分类与聚类的联系与区别: 聚类分析是研究如何在没有训练的条件下把样本划分为若干类。 在分类中,已知存在哪些类,即对于目标数据库中存在哪些类是知道的,要做的就是将每一条记录分别属于哪一类标记 阅读全文
posted @ 2020-05-11 18:02 longlog 阅读(207) 评论(0) 推荐(0)
摘要:一、用自己的话描述出其本身的含义: 1、特征选择:从一组特征中挑选出一些最有效的特征来降低特征空间维数。去除不相关的特征,可以降低学习任务的难度,只留下关键特征,往往可以更容易看清真相。 2、PCA:主成分分析PCA是一种分析、简化数据集的技术,经常用于减少数据集的维数,同时保持数据集中的对方差贡献 阅读全文
posted @ 2020-05-01 17:55 longlog 阅读(169) 评论(0) 推荐(0)
摘要:用过滤法对以下数据进行特征选择: [[0,2,0,3], [0,1,4,3], [0,1,1,3]] 要求: 1、Variance Threshold(threshold =1.0) 2、将结果截图放上来(没有条件的备注说明原因)注意:每个人的电脑ID是不一样的 阅读全文
posted @ 2020-05-01 17:46 longlog 阅读(159) 评论(0) 推荐(0)

ヾ(≧O≦)〃嗷~