05 2020 档案
摘要:1.读取 2.数据预处理 3.数据划分—训练集和测试集数据划分 from sklearn.model_selection import train_test_split x_train,x_test, y_train, y_test = train_test_split(data, target,
阅读全文
摘要:1. 读邮件数据集文件,提取邮件本身与标签。 列表 numpy数组 代码以及部分结果截图如下: 2.邮件预处理 邮件分句句子分词大小写,标点符号,去掉过短的单词词性还原:复数、时态、比较级连接成字符串2.1 传统方法来实现 2.2 nltk库的安装与使用 pip install nltk impor
阅读全文
摘要:1.理解分类与监督学习、聚类与无监督学习。 简述分类与聚类的联系与区别。 联系:分类与聚类都是通过预处理使得数据能基于一个分析目标而被整理。 区别:分类是有监督,靠的是学习; 聚类无监督,靠的是启发式搜索。 简述什么是监督学习与无监督学习。 有监督学习:事先知道训练样本的标签,通过挖掘将属于不同类别
阅读全文

浙公网安备 33010602011771号