2020 年 5月随笔档案 - Rick00

13-垃圾邮件分类2

摘要：1.读取 2.数据预处理 3.数据划分—训练集和测试集数据划分 from sklearn.model_selection import train_test_split x_train,x_test, y_train, y_test = train_test_split(data, target, 阅读全文

posted @ 2020-05-22 11:32 Rick00 阅读(150) 评论(0) 推荐(0)

12.朴素贝叶斯-垃圾邮件分类

摘要：1. 读邮件数据集文件，提取邮件本身与标签。列表 numpy数组代码以及部分结果截图如下： 2.邮件预处理邮件分句句子分词大小写，标点符号，去掉过短的单词词性还原：复数、时态、比较级连接成字符串2.1 传统方法来实现 2.2 nltk库的安装与使用 pip install nltk impor 阅读全文

posted @ 2020-05-15 19:47 Rick00 阅读(185) 评论(0) 推荐(0)

11.分类与监督学习，朴素贝叶斯分类算法

摘要：1.理解分类与监督学习、聚类与无监督学习。简述分类与聚类的联系与区别。联系：分类与聚类都是通过预处理使得数据能基于一个分析目标而被整理。区别：分类是有监督，靠的是学习；聚类无监督，靠的是启发式搜索。简述什么是监督学习与无监督学习。有监督学习：事先知道训练样本的标签，通过挖掘将属于不同类别阅读全文

posted @ 2020-05-08 23:14 Rick00 阅读(179) 评论(0) 推荐(0)

Rick00

05 2020 档案

公告