05 2020 档案
摘要:1.读取 2.数据预处理 3.数据划分—训练集和测试集数据划分 from sklearn.model_selection import train_test_split x_train,x_test, y_train, y_test = train_test_split(data, target,
阅读全文
摘要:1. 读邮件数据集文件,提取邮件本身与标签。 列表 numpy数组 import csv file_path = r".\SMSSpamCollection" sms = open(file_path, 'r', encoding='utf-8') csv_reader = csv.reader(s
阅读全文
摘要:1.理解分类与监督学习、聚类与无监督学习。 简述分类与聚类的联系与区别。 分类是按照标签进行分类 聚类是将相似的放在一起 简述什么是监督学习与无监督学习。 监督学习:从标记的训练数据来判断一个功能,从正确的例子进行学习。 无监督学习:没有足够的先验知识,需要机器自己学习。 2.朴素贝叶斯分类算法 实
阅读全文
摘要:一、用自己的话描述出其本身的含义: 1、特征选择 从事物的特征中选择出一些最有效特征来降低数据集维度。 2、PCA 在减少信息损失的情况下进行降低数据维度。 二、并用自己的话阐述出两者的主要区别 特征选择后的特征还是原来特征的子集; PCA改变了特征形式,特征抽取后的新特征是原来特征的一个映射。
阅读全文
浙公网安备 33010602011771号