Python中的人工智能入门:在scikit-learn中的建模

鸢尾花数据集 (The Iris Flower dataset) 是目前仍在使用的最古老的机器学习数据集之一。它由Ronald Fisher在1936年发表,用于说明线性判别分析。问题是根据萼片和花瓣宽度和长度的测量结果对三种鸢尾花中的一种进行分类。

 

虽然这是一个非常简单的问题,但基本工作流程如下:

 

  1. 加载数据集

  2. 可视化数据

  3. 对数据进行预处理和转换

  4. 选择要使用的模型

  5. 检查模型的性能

  6. 解释和理解模型(这个阶段通常是可选的)

     

这是一个标准的流程模板,通常情况下,对于工业规模的问题,步骤1和2可能会比对于Kaggle竞赛或UCI机器学习资源库中的一个已经预处理过的数据集花费更长的时间(有时估计需要95%左右的时间)。我们将在后面的食谱和章节中深入探讨这些步骤中每一个步骤的复杂性。

 

我们将假设你已经在前面安装了这三个库,并且你的Jupyter Notebook或Colab实例已经运行。此外,我们将使用seaborn和scikit-plot库进行可视化,所以我们也将安装它们。

posted @ 2021-06-03 10:40  蔡春爽  阅读(183)  评论(0)    收藏  举报
https://www.cnblogs.com/ccsydd0113/