05 2020 档案
摘要:13-垃圾邮件分类2 1.读取 2.数据预处理 3.数据划分—训练集和测试集数据划分 from sklearn.model_selection import train_test_split x_train,x_test, y_train, y_test = train_test_split(dat
阅读全文
摘要:1. 读邮件数据集文件,提取邮件本身与标签。 列表 numpy数组代码: import csv file_path =r"SMSSpamCollection" sms= open(file_path,'r',encoding='utf-8') data=csv.reader(sms,delimite
阅读全文
摘要:1.理解分类与监督学习、聚类与无监督学习。 简述分类与聚类的联系与区别。 简述什么是监督学习与无监督学习。 简述分类与聚类的联系与区别: 聚类分析是研究如何在没有训练的条件下把样本划分为若干类。 在分类中,已知存在哪些类,即对于目标数据库中存在哪些类是知道的,要做的就是将每一条记录分别属于哪一类标记
阅读全文
摘要:一、用自己的话描述出其本身的含义: 1、特征选择:从一组特征中挑选出一些最有效的特征来降低特征空间维数。去除不相关的特征,可以降低学习任务的难度,只留下关键特征,往往可以更容易看清真相。 2、PCA:主成分分析PCA是一种分析、简化数据集的技术,经常用于减少数据集的维数,同时保持数据集中的对方差贡献
阅读全文
摘要:用过滤法对以下数据进行特征选择: [[0,2,0,3], [0,1,4,3], [0,1,1,3]] 要求: 1、Variance Threshold(threshold =1.0) 2、将结果截图放上来(没有条件的备注说明原因)注意:每个人的电脑ID是不一样的
阅读全文

浙公网安备 33010602011771号