05 2020 档案
摘要:1.读取 # 1、导入数据 sms=open(r'D:\Download\SMSSpamCollection','r',encoding='utf-8')#读取文件 sms_data = [] sms_lable = [] csv_reader = csv.reader(sms, delimiter
阅读全文
摘要:1.读取 2.数据预处理 3.数据划分—训练集和测试集数据划分 from sklearn.model_selection import train_test_split x_train,x_test, y_train, y_test = train_test_split(data, target,
阅读全文
摘要:1. 读邮件数据集文件,提取邮件本身与标签。 列表 numpy数组 读取文件,提取邮件信息成列表信息输出。 2.邮件预处理 邮件分句 句子分词 大小写,标点符号,去掉过短的单词 词性还原:复数、时态、比较级 连接成字符串 2.1 传统方法来实现 2.2 nltk库的安装与使用 pip install
阅读全文
摘要:1.理解分类与监督学习、聚类与无监督学习。 简述分类与聚类的联系与区别。 简述什么是监督学习与无监督学习。 分类和聚类的联系:都对输入的数据集进行分类。 分类和聚类的区别: 分类是通过学习找出描述并区分数据类的模型,以该模型应用于预测标记未知的输入数据。 聚类将本身没有类别的样本聚集成不同的对象集合
阅读全文

浙公网安备 33010602011771号