谷歌高级数据分析-V-笔记-全-
谷歌高级数据分析 V 笔记(全)
001:简化复杂数据关系》课程介绍 🎯

在本节课中,我们将要学习回归分析的基础知识,这是一种用于探索和量化数据变量间关系的核心统计技术。我们将了解回归模型如何帮助数据专业人员从数据中提取洞察,讲述有力的数据故事,并影响决策。
欢迎回到您作为数据专业人员的进阶之旅。我很高兴能与您同行。我们将讨论回归模型和更多的假设检验,以便您能够探索数据中的关系。
我们将一起学习的工具将使您能够揭示关于数据的强大洞察,讲述引人入胜的故事,并影响决策和战略制定。
我们在本课程中探讨的建模基础将为您在数据职业领域寻求入门级工作以及未来处理更高级的主题(如机器学习)奠定更坚实的基础。
我渴望将您迄今为止学到的所有知识串联起来。从数据科学基础和Python基础,到探索性数据分析和统计学,您已经学习了大量关于数据领域的知识。我们将一起把您当前的技能应用到您的第一个模型——回归模型中。
我叫Tiffany,是谷歌的一名营销科学主管,我的工作处于数据科学与营销的交叉点。我从小就对数学有浓厚兴趣。在大学期间,我最初并不确定主修什么专业,但被定量领域所吸引。和你们许多人可能经历的一样,我并非一开始就热爱自己的选择,并有机会尝试了几个专业,这让我接触到了各种各样的分析职业机会。在我的职业生涯中,在加入谷歌之前,我曾在金融、统计研究和数据科学咨询领域担任过职位。我处理过各种数据,包括专利、欺诈、硬件销售以及现在的营销数据。
数据专业人员的优势在于,它在大多数行业都有很高的需求,这意味着您可以在各种各样的公司、产品和国家中找到有趣的问题来解决。我喜欢这种灵活性,既能找到适合自己的位置,又能确保为我所在的任何团队创造价值。我在职业生涯中学到了很多,很高兴能与您分享我的经验。
在本课程中,我们将讨论变量之间的建模关系。为此,我们将重点介绍回归分析。回归分析或回归模型是一组统计技术,它们利用现有数据来估计一个因变量与一个或多个自变量之间的关系。我们将在后续课程中一起详细解读这个定义。
我们在本课程中学到的技术将帮助您回答各种问题,并提供可操作的步骤来实现组织目标。例如,回归模型可以帮助您理解哪些变量会影响销售额。它们还可以帮助您理解导致客户订阅新闻稿的因素。回归模型甚至可以帮助您理解用户为何持续浏览公司网站。
在我们一起学习课程的过程中,我们将继续讨论数据专业人员在做出负责任决策方面所扮演的角色,从数据处理到建模。无论一个潜在的数据故事有多好,我们如何得出这个故事才是成为诚实和有效的故事讲述者的首要任务。
Python编程对于运行和测试复杂模型、可视化数据以及传达结果至关重要。严谨的探索性数据分析将决定我们选择哪些模型以及我们如何处理建模过程。统计学将在帮助我们理解模型如何工作方面发挥重要作用,并使我们能够向利益相关者呈现可操作的结果。我们的统计工具包将使我们能够构建我们将要讨论的回归模型。
回归分析是一项相关且具有市场价值的技能。回归模型非常灵活,您可以根据拥有的数据来设计它们。此外,回归模型的结果为解释和沟通提供了机会。数据专业人员可以从这些模型中提供与可操作步骤清晰一致的见解。

例如,我们能够构建回归模型来识别网站上的哪些行为是高价值客户的指标。例如,访问促销页面、观看视频或注册电子邮件的客户,有很大可能在一年内进行多次购买。其中一些指标可能看起来很明显,但拥有一个能够识别和量化这种关系的回归分析是非常强大的。我们能够在营销活动中利用这些信息来吸引新客户。
我们将一起探索回归分析,将其作为构建更复杂机器学习模型的坚实基础。我很高兴向您展示回归工具包中的每一个工具。您将获得大量的Python实践。我们将解释如何确定模型是否适合数据、如何运行模型以及如何理解计算机的结果。我们还将讨论一些数学知识,并逐步回顾概念。您也可以随时复习课程资源。我非常高兴能开始学习回归分析,让我们开始吧。
本节课总结
在本节课中,我们一起学习了回归分析课程的基本介绍。我们了解了回归分析的核心目标——量化变量间关系,以及它在数据科学领域的重要性。课程讲师Tiffany分享了她的职业背景,并阐述了回归模型的灵活性和应用价值,例如识别高价值客户行为。我们明确了本课程将结合Python编程、探索性数据分析和统计学知识,为后续构建和解释回归模型打下坚实基础。
002:通过回归模型获得可操作的见解 📊

在本节课中,我们将跟随谷歌营销科学主管Tiffany,学习如何构建和解读回归模型,以从复杂数据中提取可操作的商业见解。我们将了解回归模型在预测客户价值、优化营销预算等方面的强大应用。
大家好,我是Tiffany,是谷歌的营销科学主管。
我从小就对数学和统计学充满热爱。这可能是因为这是我学生时代为数不多擅长的科目。我记得,在我大约一年级时,比我大两岁的哥哥为数学作业发愁,我会坐下来帮助他。
在我的职位上,我构建了许多回归模型来预测各种情况,例如谁将成为高价值客户,或者如何在不同营销活动间最佳地分配预算。回归模型是非常重要的强大工具,使用不同类型的回归模型,你将能够回答各种各样的问题。
最近,我一直在构建模型并尝试解读系数。具体来说,我构建了许多回归模型来识别诸如高价值客户,或一年内会进行多次购买的用户。这是通过分析网站行为实现的。
我们真正希望深入探究的是,用户在网站上访问的哪些页面或采取的哪些行为,能够表明他们是高价值客户或会在一年内多次购买。
我热爱处理大量数据并解决重大问题。最近,我与一位客户合作,他希望了解如何优化其数百万美元的营销预算在不同渠道间的分配。
通过构建一个回归模型,我们能够帮助他们优化支出,从而提升销售额。
我们当前面临的一些机遇是第三方Cookie即将消失。我相信你们都曾在互联网上遇到过跟踪式广告。这功能正是由第三方Cookie实现的。
随着第三方Cookie的消失,我们迎来了一个全新的机遇,去开发不同类型的模型和不同的分析方法,以完成那些过去借助第三方Cookie和追踪系统能轻易实现的事情。因此,目前在营销分析领域存在着巨大的创新机会。
事物在不断变化,外界信息如此之多,你永远无法知晓所有需要知道的知识。因此,保持开放的心态和持续学习的态度至关重要。要知道,有大量资源可供你研究学习,你可以在实践中不断进步。

本节课中,我们一起学习了回归模型在商业分析中的核心应用。我们了解到,回归分析不仅能预测像客户价值这样的关键指标,还能指导像预算分配这样的重大决策。面对数据追踪方式的变化,回归分析等建模技术为我们提供了持续创新的基础。保持学习和探索的心态,是应对这个快速变化领域的关键。
003:03_01_05_欢迎来到模块1


概述
在本节课中,我们将一起学习回归分析。我们将了解数据专业人员如何运用回归分析技术,从问题出发,最终获得可执行的见解。
回归分析简介
回归分析的核心在于理解变量之间的关系。我们将使用 PACE 框架来指导整个课程的学习。PACE 代表 计划(Plan)、分析(Analyze)、构建(Construct)和执行(Execute)。
简单线性回归
上一节我们介绍了回归分析的基本概念,本节中我们来看看第一个要深入探讨的模型:简单线性回归。
我们将有机会应用 PACE 框架来处理简单线性回归问题。我们会使用不同的场景和数据,从头到尾走完整个分析流程。
简单线性回归的模型公式如下:
y = β₀ + β₁x + ε
其中,y 是因变量,x 是自变量,β₀ 是截距,β₁ 是斜率,ε 是误差项。
多元线性回归
接下来,我们将仔细研究多元线性回归。
多元线性回归在很大程度上扩展了简单线性回归的概念,使我们能够解决更多样化的问题。我们将重点关注一些更细致的主题,例如变量选择和模型解释。
以下是多元线性回归模型:
y = β₀ + β₁x₁ + β₂x₂ + ... + βₙxₙ + ε
假设检验
此外,我们还会考虑一些假设检验,例如卡方检验和方差分析(ANOVA)。
这些检验将帮助我们探索数据中的不同分组,从而获得有价值的见解。
逻辑回归基础
最后,我们将回顾逻辑回归的基础知识。这是最后一个也是最复杂的模型,它将为你学习后续的机器学习课程打下良好的基础。
逻辑回归用于处理分类问题,其核心公式为:
p = 1 / (1 + e^-(β₀ + β₁x))
其中,p 是事件发生的概率。


总结
本节课中,我们一起学习了回归分析的课程概述。我们介绍了 PACE 框架,并预览了即将深入学习的简单线性回归、多元线性回归、相关假设检验以及逻辑回归。准备好后,我们就可以开始观看下一个视频了。
004:回归分析中的节奏 🧩

在本节课中,我们将学习回归分析的基本概念,并介绍一个用于组织分析工作的结构化框架——PACE。我们将了解回归模型的目标,并预览PACE框架的四个阶段:计划、分析、构建与执行。
你可能听说过机器学习模型或回归分析这些术语。如果没有,本课程正适合你。接下来,我们将开启学习之旅。
首先,我们将讨论几个关键术语和定义。回归模型建立在统计学基础之上。数据职业领域使用的模型是一系列技术,它们依赖现有信息或数据点来预测其他数据点的可能情况。
其核心目标始终是揭示数据中变量之间的关系,并以此讲述一个“故事”。这个故事将帮助利益相关者调整其业务战略和决策。
建模是一个迭代的过程。你可能熟悉其他框架,例如数据生命周期或探索性数据分析的六个步骤。在本课程中,我们将使用本课程前面概述的PACE框架来介绍建模过程的每一步。
PACE——计划、分析、构建与执行——为我们进行回归分析提供了基础框架。让我们花点时间预览一下PACE在回归分析中是如何运作的。
计划阶段 📋
在回归建模中,计划阶段是关于理解你的数据和问题背景。你从行业或其他地方带来的知识在计划阶段至关重要。通过考虑你可以访问哪些数据、数据是如何收集的以及业务需求是什么,你将能够战略性地分析、构建和执行后续工作。计划阶段将指导PACE的其他三个阶段。

分析阶段 🔍
计划之后,你必须进行分析。在这个阶段,你需要更仔细地检查数据,以便选择一个或几个你认为可能合适的模型。
在进行回归分析时,你需要在此阶段使用Python执行探索性数据分析,并根据需要检查模型假设。模型假设是关于数据的陈述,必须为真才能证明使用特定数据技术的合理性。作为数据专业人士,你将使用统计学来检查模型假设是否得到满足。对统计学的深入理解,赋予数据专业人士构建有意义模型的能力。
构建阶段 ⚙️

分析之后,你必须进行构建。对于回归分析,这就是你实际使用Python或你选择的编程语言构建模型的地方。
此步骤涉及选择变量、根据需要转换数据以及编写代码。尽管你在构建模型之前检查了模型假设,但许多模型假设需要在模型构建后重新检查。因此,你将在构建阶段根据需要完成这项工作。
构建阶段的最后一部分是评估模型结果。此时,你正在回答这个问题:我的模型有多好?你将选择评估指标、比较模型并获得初步结果。然后,基于你的评估,你可以利用探索性数据分析来相应地优化模型。
执行阶段 📤

当然,作为数据专业人士,你首先必须是一个诚实的故事讲述者。😊
研究回归产生的结果将揭示数据内部的关系,并帮助你发现洞察,以讲述完整的故事。这引出了PACE的最后一部分:执行。你将解释从分析和构建中学到的一切,以分享这个故事。
你将准备正式的结果和可视化图表,并与利益相关者分享。😊

为此,你需要将模型统计量转化为描述数据中变量之间关系的陈述。这些描述必须考虑计划阶段的背景和初始问题。
一切的核心都是数据,而PACE框架帮助数据专业人士保持条理。数据专业人士产生的洞察必须是数据驱动且准确的,并且在给定的业务或社区背景下必须言之成理。
我们将在课程后面的示例中详细介绍这些步骤,但PACE是迭代的。随着你成长为一名数据专业人士,你的经验将帮助你决定何时在PACE的各阶段之间转换。根据具体情况,你可能会调整顺序或重复某些步骤。
既然我们已经理清了建模拼图的各个部分,接下来可以讨论相关性与回归是如何关联的。然后,我们将探索两个基础的回归模型:线性回归和逻辑回归。这些模型将在后续视频中更深入地讲解,本次概述将为你打下坚实的理解基础。😊
是时候开始拼凑我们的拼图了。别忘了带上你的统计语法工具,你会需要它们的。
本节课总结:我们一起学习了回归分析的目标是揭示数据关系并讲述故事,并掌握了组织回归分析工作的PACE框架,该框架包含计划、分析、构建与执行四个迭代阶段,为后续深入学习具体回归模型奠定了基础。
005:线性回归介绍 📈

在本节课中,我们将要学习回归分析中的第一个建模技术:线性回归。我们将了解它的基本概念、核心术语,以及如何在现实世界中识别和应用线性关系。
上一节我们介绍了回归分析是用于估计一个因变量与一个或多个自变量之间关系的技术。本节中,我们来看看第一种具体的建模方法:线性回归。
许多你在日常生活中观察到的模式都可以用线性回归模型来表达。例如:
- 随着某个软件版本变旧,其在线搜索量可能会下降。
- 随着一位社交媒体名人粉丝数量的增加,其书籍销量也会上升。
这些关系都可以用线性回归来建模。“线性”一词指的是我们可以在图表上可视化的那种关系:一条直线。直线是向两个相反方向延伸的无限多个点的集合。在图表中,这些点呈现为一条线,而我们通常只看到这条线的一部分。
线性回归是一种用于估计一个连续型因变量 Y 与一个或多个自变量 X 之间线性关系的技术。例如,我们可以建模产品价格与销量之间的关系。我们的 Y 变量是销量,X 变量是价格。
在之前的课程中,你学习了连续型变量和分类型变量的区别。作为回顾:
- 连续型变量是指在其最小值和最大值之间可以取任何实数值的变量。例如,产品销量、车辆速度和网页停留时间都是连续型变量。
- 分类型变量则具有有限数量的可能值,例如产品类型和教育水平。

线性回归允许我们数据分析师估计连续型因变量。当然,也存在其他回归模型用于估计分类型变量,我们将在后续课程中学习。
在本课程中,我们将频繁讨论因变量和自变量:
- 因变量是给定模型所要估计的变量,有时也称为响应变量或结果变量,通常用字母 Y 表示。我们假设因变量的变化通常基于自变量的值。
- 自变量也被称为解释变量或预测变量,通常用 X 表示。
例如,假设你在蛋糕店工作,试图了解影响蛋糕销量的因素。那么,因变量 Y 就是任何一天售出的蛋糕切片数量。一个自变量 X 可以是当天售出的咖啡杯数。也许随着购买的咖啡增多,购买的蛋糕也会增多。
在线性回归中,你可能会遇到另外两个术语:斜率和截距。
- 斜率指的是当自变量 X 每增加一个单位时,我们预期因变量 Y 增加或减少的量。
- 截距指的是当自变量 X 等于 0 时,因变量 Y 的值。
回到蛋糕和咖啡的例子:
- 斜率就是每售出一杯咖啡,预期会售出多少片蛋糕。
- 截距就是当咖啡销量为 0 杯时,售出的蛋糕切片数量。
当两个变量 X 和 Y 以线性方式相关时,我们说它们是相关的。利用统计学,我们实际上可以计算 X 和 Y 之间线性关系的强度。
有两种类型的相关性:正相关和负相关。
- 正相关是指两个变量倾向于一同增加或减少的关系。例如,售出的咖啡杯数越多,售出的蛋糕切片也越多。
- 负相关则是指两个变量之间的反向关系。当一个变量增加时,另一个变量倾向于减少,反之亦然。
例如,假设你仍在蛋糕店工作,正在估算需要多久补充一次冰咖啡。你可以建模热咖啡销量和冰咖啡销量之间的关系。随着热咖啡销量增加,你可能会注意到冰咖啡销量趋于减少。或者,假设你在媒体公司工作,分析读者阅读完成率。随着新闻文章长度的增加,读完文章的人数可能会减少,这也是负相关的一个例子。
识别这些关系在工作场所和日常生活中都非常有用。确定线性关系有助于我们回答诸如以下问题:
- 哪些因素与产品销量的增加或减少相关?
- 哪些因素促使社会服务提供商在特定地区增加资源?
- 哪些因素导致公共交通需求增多或减少?
在上述情况下,回归线的斜率大小告诉我们销量、资源分配和公共交通需求增加或减少的程度。使用线性回归,你可以在任何行业帮助回答类似的问题。
然而,必须注意:相关性不等于因果性。例如,在你的蛋糕店,人们购买咖啡并不导致蛋糕销量增加。在建模变量关系时,数据科学家必须注意其结论的限度。因果性描述的是一种直接的因果关系,其中一个变量以特定方式直接导致另一个变量发生变化。从统计学上证明因果性需要比证明相关性更严格的方法和数据收集。
对于数据专业人士来说,在呈现结果时,区分相关性和因果性尤为重要。例如,虽然我们可以说随着一个人年龄增长,其去过的地方数量趋于上升,但我们不能必然地说一个人的年龄导致了其去过的地方数量增加。可能还有其他因素(例如探访家人或因公出差增多)促使旅行更多,这些因素恰好与年龄增长相关,但很难说是年龄还是其他因素导致了旅行。
阐明“相关性不等于因果性”是数据专业人士最佳实践和道德工具箱的一部分。相关关系和因果关系都能提供有用的见解,回归分析帮助数据分析师讲述细致入微的故事,而无需证明因果性。

以上是对你的第一个建模技术的高层次概述。总结一下:
- 线性回归是一种对线性关系进行建模的方法。
- 因变量根据自变量的变化而变化。
- 斜率标识了自变量每变化一个单位,因变量变化多少。
- 正相关和负相关描述了变量之间的线性关系。
- 在解释回归结果时,务必注意相关性不等于因果性。

世界上和各行各业中存在许多线性关系。本视频仅提供了几个例子,但还有更多。本节内容到此结束,接下来我们将探讨线性回归背后的数学原理。你不断增长的统计学基础将帮助你以最清晰的方式解释回归结果。
006:线性回归的数学原理 📈

在本节课中,我们将要学习线性回归的数学基础。我们将探讨如何利用样本数据来估计总体关系,并理解回归方程中各个参数的含义及其计算方法。
总体与样本
在理想情况下,你会希望拥有与你试图回答的问题相关的每一个数据点。在之前的课程中,你了解到数据专业人士将此称为总体。
让我们假设你在一家出版公司工作。你想了解作者的社交媒体粉丝数与他们的图书销量之间的关系。为此,你将需要每一位图书作者、所有社交媒体粉丝账户以及有史以来每一笔图书销售的数据。这是一个不可能完成的任务。
但幸运的是,你实际上并不需要整个总体来进行有意义的回归分析。你可以通过一个具有代表性的样本获得合理的估计。
样本是总体的一部分,这只是统计学的说法,意味着样本是你可能拥有的部分数据。
观测值与变量
如果你有一组样本数据,每个数据点都可以用其自身的一组属性或 X 和 Y 值来表示。在这种情况下,样本并不包含数据总体中所有可能的值。
观测值或实际值是现有的数据样本。该样本中的每个数据点都由一个因变量的观测值和一个自变量的观测值表示。
在出版公司的例子中,因变量是图书销量,自变量是作者在社交媒体上的粉丝数。你的数据集中可能有一个观测值是:X(粉丝数)= 10,000,Y(图书销量)= 500。
回归分析的目标是从数学上定义样本 Y 和 X 之间的关系,以理解这两个变量如何相互作用。
线性关系的核心:均值、斜率和截距
你可以想象,在每个 X 值处,Y 都可能取许多不同的值。为了简化理解,线性回归分析关注的是给定特定 X 值时的 Y 的均值。
这个 Y 的均值就是线性回归直线上的值,用一个看起来像小写字母 m 的希腊字母表示。你可以记住 M 代表均值。这个希腊符号是 μ。
如前所述,为了定义线性关系,我们需要一个斜率和一个截距。在统计学中,我们将截距写作 β₀(有时称为 beta not),将斜率写作 β₁。
μ 和 β 有时被称为参数。参数是总体的属性,而不是样本的属性,因此我们永远无法知道它们的真实值,因为我们无法观测整个总体。但是,我们可以使用样本数据来计算参数的估计值。
为了区分总体参数和参数估计值,我们用“帽子”符号(^)来表示估计值。计算结果是 β̂₀、β̂₁ 和 μ̂,它们都是参数估计值。
尽管认识到 μ 的符号很有价值,但在本课程的剩余部分,我们将使用一个简化的符号:Y = β₀ + β₁ * X。
回归系数与预测
例如,假设我们估计 β₀ 为 -1,β₁ 为 5。现在,让我们输入一些 X 值:
- 如果 X = 0,我们得到 Y = -1,这就是 Y 轴截距 β₀。
- 如果 X = 1,我们得到 Y = 4。
- 如果 X = 2,我们得到 Y = 9。
- 如果 X = 3,我们得到 Y = 14。
仅从四个数据点,就出现了一个模式:X 每增加 1 个单位,Y 就增加 5 个单位。回想我们的方程,5 就是我们的斜率 β₁。斜率告诉我们,X 每增加一个单位,Y 会增加多少。
这些估计的 β 值也被称为回归系数。所以,现在每当你看到帽子符号(^),你就知道这是在估计 β,也就是回归系数。
在上面的公式中,回归系数是斜率和截距。它们描述了在样本数据中发现的线性关系。
如何找到最佳直线:普通最小二乘法
为了输入 X 值并获得 Y 的估计值,我们假设了 β₀ 为 -1,β₁ 为 5。但我们是如何得出这些回归系数的呢?
计算线性回归系数最常用的方法之一是普通最小二乘估计,简称 OLS。我们将在课程后面讲解 OLS 背后的数学原理,不过现在,让我们讨论一下 OLS 的工作原理概述。
在线性回归分析中,我们作为数据专业人士,试图最小化一个叫做损失函数的东西。损失函数是一个衡量观测值与模型估计值之间距离的函数。
理论上,我们可以画出无数条线来模拟我们拥有的数据。但我们不想找到任意一条线,我们想找到最佳拟合线,因此我们希望最小化损失函数。

总结与展望
有了关于线性回归如何工作的基础理解,我们将能够讨论之前提到的线性回归分析中的“PACE”框架。
在本节课中,我们一起学习了:
- 总体与样本的区别,以及为何样本足以进行回归分析。
- 如何用观测值表示数据点。
- 线性关系的核心是均值(μ)、截距(β₀) 和斜率(β₁)。
- 我们使用带“帽子”(^)的符号来表示根据样本数据计算出的参数估计值(回归系数)。
- 回归方程 Y = β₀ + β₁ * X 允许我们进行预测。
- 寻找最佳拟合线的核心方法是普通最小二乘法,其目标是最小化损失函数。
在接下来的课程中,我们将基于视频中涵盖的概念,进一步学习回归的工作原理、何时使用线性回归、其方差以及在 Python 中实现 OLS。
007:简化复杂数据关系》 - 逻辑回归介绍 🎯

在本节课中,我们将要学习逻辑回归的基础知识。逻辑回归是一种用于处理分类问题的强大统计方法,它可以帮助我们理解不同因素如何影响一个特定事件发生的概率。我们将从简单的例子入手,逐步理解其核心概念,并将其与之前学过的线性回归进行比较。
从抛硬币到数据建模 🪙
我仍然记得在运动队时,需要通过抛硬币来决定哪支队伍先攻或先守。硬币出现正面的概率是多少?出现反面的概率又是多少?每个事件发生的概率都是0.5或50%。这是一个经典的概率问题。
在数据分析领域,我们可以使用一种名为逻辑回归的技术来建模更为复杂的概率问题。例如:
- 哪些因素会导致某人订阅或不订阅新闻简报?
- 在什么情况下,某人会在在线视频或社交媒体帖子下发表评论?
- 给定某些因素,某人续订组织会员资格的可能性有多大?
所有这些问题都在处理离散事件或分类数据。存在一组特定的可能结果:订阅或不订阅、评论或不评论、续订或不续订。为了回答这类问题,数据专业人员会使用一种名为逻辑回归的模型。
什么是逻辑回归? 🤔
逻辑回归是一种基于一个或多个自变量对分类变量进行建模的技术。因变量可以有两个或更多可能的离散值。
假设你的公司有一份新闻简报,并希望增加读者数量。在公司网站上,用户有机会订阅该简报。与订阅相关的一个因素可能是用户在离开网页前停留的分钟数。
- 我们的因变量 Y 有两种可能性:用户不订阅(用0表示)或用户订阅(用1表示)。
- 我们的自变量 X 是连续的,衡量用户在离开网页前停留的分钟数。
让我们像进行探索性数据分析(EDA)时那样,将假设的数据绘制在散点图上。我们可以观察到数据点大致分布在两条水平线上。
- 较高的那条线表示用户订阅了(此时 y = 1)。
- 较低的那条线表示用户没有订阅(此时 y = 0)。
- X轴表示用户在网站上停留的分钟数。
由于X和Y之间的关系不是一条简单的直线,我们需要一种新的数学方法来表达X和Y之间的关系。逻辑回归将允许我们建模用户订阅新闻简报的概率。
核心概念:概率与均值 🔑
关键概念是:给定X时Y的均值,等于给定X时Y等于1的概率。
让我们探讨一下这个想法。目前,我们观察到的y值只是一堆0和1。为了求均值,我们会将所有观测值相加,然后除以观测总数。因为有些观测数据是0,所以在求和时,所有的0加起来还是0。因此,所有观测值的总和等于1的总数。然后我们除以观测总数,这就等于y等于1的概率,即某人成为订阅者的概率。
在这种情况下,我们知道 给定X时Y的均值 = 给定X时Y等于某个结果的概率。有时,给定X时Y的概率被写作 P,以强调概率的概念。为了帮助你记忆,可以认为 P代表概率。
现在,我们希望了解哪些变量有助于解释这些概率。从数学上讲,我们需要一种方法将X变量与y等于1的概率联系起来。
想象我们只有一个自变量,那么我们需要将 y等于1的概率 与 β₀ + β₁X 联系起来。在逻辑回归中,我们使用一个连接函数来表达X与y等于某个结果的概率之间的关系。连接函数是一个非线性函数,它在数学上将因变量与自变量连接或“链接”起来。
我们将在后面更详细地讨论逻辑回归和连接函数的工作原理,但现在只需知道,这是线性回归模型和逻辑回归模型之间的一个区别示例。
线性回归与逻辑回归的异同 📊
上一节我们介绍了逻辑回归的核心概念,本节中我们来看看它与线性回归的异同。以下是两种建模方法的一些异同点:
首先,线性回归涉及一个连续的y,例如图书销量;而逻辑回归涉及一个分类的y,例如新闻简报订阅。选择哪种模型取决于你拥有的数据类型。你都可以回答关于哪些因素影响感兴趣结果的类似问题。
其次,由于线性回归对连续变量建模,我们估计的是y的均值。但逻辑回归对分类变量建模,因此我们建模的是某个结果的概率,例如y等于1或y等于0的概率。

最后,对于线性回归,我们可以直接将Y表达为X的函数。但对于逻辑回归,我们需要一个连接函数来将Y的概率与X联系起来。
总结与展望 🚀
本节课中我们一起学习了逻辑回归的基础知识。我们主要关注只有两个类别的逻辑回归(如订阅问题),但也存在更复杂的逻辑回归版本,可以建模多个结果或类别,例如人们购买的护肤品类型或人们接受的服务类型。
在本视频中,我们涵盖了逻辑回归的基础知识,并比较和对比了线性和逻辑回归模型。在本课程后面,我们将介绍一种用于逻辑回归的估计技术,称为最大似然估计,并会揭示更多的数学原理。目前,只需知道计算机非常强大,使我们作为数据从业者能够更少地关注数学,更多地关注数据故事的讲述。

课程的其余部分将为你提供扎实的理解,让你知道你那台强大的机器内部正在发生什么。
008:课程总结 1


概述 📋
在本节课中,我们将对已学习的高阶回归分析概念进行总结。我们已经涵盖了许多重要内容,你应该为自己掌握了这些新概念而感到自豪。开启回归分析的学习之旅是一个令人兴奋的起点。
知识回顾与连接 🔗
在之前的课程中,你学习了数据职业领域、数据驱动工作中沟通的重要性、数据管理的考量、Python编程作为数据工具的价值,以及探索性数据分析和统计学知识。
在本课程中,我们开始将这些概念联系起来,为你构建第一个模型做好准备。
PACE框架与回归分析 🧩
到目前为止,我们讨论了PACE框架和回归分析。
- 规划阶段:让你能够考量数据是如何收集的,以及在特定场景下的业务需求是什么。
- 分析阶段:你执行探索性数据分析,这有助于你在构建模型时判断一个模型是否比另一个更合适。
- 构建阶段:你会惊叹于计算机和Python编程语言的力量。通过模型构建,你将在数据可视化和回归模型可视化中发挥创造力。
- 执行阶段:你必须再次依靠统计学和数学来评估遇到的任何模型。最后,在执行阶段,当你解释模型结果时,必须专注于沟通。
通过结合PACE的四个步骤,你将很快开始创建数据驱动的故事。
两种核心回归模型 📊
我们简要介绍了两种模型:线性回归和逻辑回归。


这些模型能够估计我们在个人和职业生活中观察到的变量之间的常见关系。回归模型帮助我们回答关于哪些因素与感兴趣的变量相关,以及相关程度如何的问题。数据始终引导我们提出可以询问和回答的问题。
以下是两种模型的核心区别:
- 线性回归需要一个连续的因变量,因此它可以帮助对任何可测量和可量化的东西进行建模。其公式通常表示为:
Y = β₀ + β₁X₁ + β₂X₂ + ... + βₙXₙ + ε
其中Y是连续型因变量。 - 逻辑回归需要一个分类的因变量,因此它可以确定某事发生的概率。其核心公式涉及逻辑函数:
P(Y=1) = 1 / (1 + e^-(β₀ + β₁X₁ + ... + βₙXₙ))
其中P(Y=1)是事件发生的概率。
线性回归关注正相关或负相关。逻辑回归模型使用一个连接函数来关联自变量X和分类因变量Y。
后续学习路径 🚀
之后,我们将学习如何在Python中使用真实数据进行估计技术,并探讨更多的回归用例。
尽管在学习过程中你会遇到许多公式,但请记住,最终目标是弄清楚数据试图讲述的故事。
本课程为你提供了许多可用的资源。
总结 🎯
在本节课中,我们一起回顾了回归分析的核心概念,将PACE框架与建模过程相结合,区分了线性回归与逻辑回归的应用场景与数学基础,并展望了后续的实践学习。
祝你顺利完成本部分剩余内容,对自己保持耐心。非常高兴下次能再次与你一同学习。😊


009:09_02_01_欢迎来到模块2


📚 课程概述
在本节课中,我们将学习如何设置、构建、评估和解释我们的第一个回归模型。我们将回顾模型假设、构建、评估和解释的过程。课程将遵循PACE框架(计划、分析、构建、执行),并通过具体示例引导你完成整个过程。
🔄 回顾与引入
欢迎回到谷歌的回归模型课程。很高兴再次与你一起学习。
上一节我们概述了回归分析以及两个核心的基础回归模型:线性回归和逻辑回归。在本节课程中,我们将深入探讨如何设置、构建、评估和解释我们的第一个回归模型。
我们之前定义了许多新概念,如果你需要重新梳理思路,请记住PACE框架:计划、分析、构建、执行。PACE的每个部分都对应回归分析过程的一个环节。有时我们需要重复某些步骤,但这些是需要牢记的阶段。我们将一起通过具体示例来学习这个过程。
📈 线性回归核心概念
首先,我们来回顾线性回归。线性回归是一种估计连续因变量与一个或多个自变量之间线性关系的技术。
自变量是其趋势与因变量相关的变量,通常用字母 X 表示。因变量是模型试图估计的变量,也称为结果变量,通常用字母 Y 表示。
本节课我们将重点学习简单线性回归。简单线性回归是一种估计一个自变量 X 与一个连续因变量 Y 之间线性关系的技术。
我们在这里回顾的模型假设、代码、评估指标和解释技巧,将直接延伸到更复杂的模型,如多元线性回归。通过巩固简单线性回归的基础,你将准备好应对更高级的模型,以回答不同行业和商业背景中更复杂的问题。
🛠️ 你将运用的技能
在学习简单线性回归的过程中,你将综合运用之前掌握的多种技能,包括Python编程、探索性数据分析(EDA)和统计学。
这些工具将使你能够构建一个简单的线性回归模型,帮助你在任何公司或组织中影响战略和决策。我们在这些视频中一起探讨的关键术语、活动和学习资源,在本课程后续部分也将非常重要,届时会回顾我们对简单线性回归的讨论。
🗺️ 学习路径规划
我们将按照PACE的所有阶段来学习回归建模。
以下是本模块的主要学习步骤:
- 计划阶段:我们将首先回顾线性回归方程,然后学习使用普通最小二乘法估计参数。
- 分析阶段:我们将定义简单线性回归的四个关键假设,并使用Python和EDA来验证我们的数据是否满足这些假设。
- 构建阶段:我们将一起在Python中构建你的第一个回归模型。你也将有机会独立练习Python和EDA。
- 执行阶段:我们将学习几种评估指标和一种帮助你量化模型好坏的技术。最后,我们将使用这些指标来练习向利益相关者和非技术受众解释我们的结果。
我已经迫不及待要开始简单线性回归建模了,让我们开始吧!


🎯 本节总结

本节课中,我们一起回顾了线性回归的核心概念,明确了简单线性回归的定义,并规划了遵循PACE框架的学习路径。我们了解到,掌握简单线性回归是理解更复杂模型的基础,并且将综合运用编程、数据分析和统计技能来完成模型的构建与评估。
010:导师制的巨大价值 👨🏫

在本节课中,我们将学习导师制在职业发展中的重要作用,并探讨如何主动寻找和建立有意义的导师关系。
我的名字是杰罗德,我是YouTube分析与决策支持团队的首席负责人。我们团队专注于为YouTube业务组织构建商业智能与分析能力。
导师制一直是我职业生涯发展的重要组成部分。在我的职业生涯中,无论是在谷歌内部还是外部,无论是在学校还是偶然结识,我都有幸遇到了许多导师。他们每个人都给予了我一些东西,这些东西要么是激励因素,要么是鼓励我更加相信自己,或者仅仅是愿意倾听我倾诉某些事情不顺利的烦恼。
上一节我们介绍了导师制的普遍价值,本节中我们来看看如何主动寻找导师。
以下是寻找导师群体的具体方法:
- 寻找兴趣领域的专业社群:如果我们考虑商业智能和分析领域,有很多由商业智能专业人士组成的社群。此外,还有专注于数据科学或预测分析等细分领域的社群。
- 主动联系他人:我也曾主动联系他人,无论是通过电子邮件、熟人介绍还是LinkedIn。我通常会寻找那些正在从事我感兴趣的事情、或拥有我所不具备的技能的人。我会直接联系他们说:“你好,我很想就某某事情进行一次交流,听听你的看法。”
实际上,我发现LinkedIn是一个非常强大的工具。这需要付出努力,但它是建立人脉的一个非常简单的切入点。当我提到“建立人脉”时,我指的不仅仅是闲聊,而是真正地联系那些可能也希望被联系到的人,并且非常明确地你想从那些做过你想做的事情的人身上学到什么。

最后,要依靠自己。因为很可能没有那么多人和你做同样的事情,但你越是展示和证明你的能力、你的坚持性(或任何你能想到的形容词),就会有越多的人愿意在你身上下注,你也会因此获得更多的机会。

本节课中,我们一起学习了导师制对职业发展的激励与支持作用,并探讨了通过寻找专业社群和主动联系来建立有意义导师关系的具体策略。关键在于明确学习目标并主动展示自身价值。
011:普通最小二乘估计 📊

在本节课中,我们将学习简单线性回归的核心概念,并深入探讨如何通过普通最小二乘法找到数据的最佳拟合线。我们将理解误差的衡量方式,以及计算机如何自动计算出最优的回归参数。
回顾简单线性回归
在之前的视频中,我们提到了简单线性回归。这是一种回归技术,用于估计一个自变量 X 和一个连续因变量 Y 之间的线性关系。
“线性”一词指的是当数据绘制在 X-Y 坐标平面上时,呈现为一条直线。在简单线性回归中,我们只关注两个变量:一个 X 和一个 Y。
回归线的方程是:
y = 截距 + 斜率 × x
用数学符号表示为:
y = β₀ + β₁ × x
由于任何给定问题都有多个数据点,我们可以画出许多可能拟合数据的直线。然而,我们的目标是找到最佳拟合线,即通过最小化损失函数或误差来最贴合数据的直线。
衡量误差:残差
为了找到最佳拟合线,我们需要测量误差。我们可以将误差视为我们拥有的数据(观测值)与给定模型生成的预测值之间的差异。
预测值是模型为每个 x 计算出的估计 y 值。观测值(或实际值)与回归线预测值之间的差异称为残差。
残差值的公式是:
残差 = 观测值 - 预测值
每个数据点都有一个残差。使用数学符号,单个数据点的残差方程为:
εᵢ = yᵢ - ŷᵢ
(其中 ε 是一个希腊字母,类似于字母 E,代表 Error/误差)
我们可以为每个数据点计算单独的残差,但需要注意一个重要特性:对于 OLS 估计量,残差之和始终等于零。
为了捕捉模型中总误差的汇总,我们将每个残差平方,然后对所有数据点的残差求和。这被称为残差平方和。
残差平方和(SSR)是每个观测值与其相关预测值之间平方差的总和。
普通最小二乘法
对于线性回归,我们将使用一种称为普通最小二乘法的技术来获得最佳拟合线。
普通最小二乘法,也称为 OLS,是一种通过最小化残差平方和来估计线性回归模型中参数的方法。
使用 OLS,我们可以利用样本数据的特性来计算 β₀̂ 和 β₁̂。请记住,“帽子”符号(^)表示它是参数的估计值。我们永远无法知道确切的参数。参数(或 β)是总体的特征,由于我们永远只有样本数据,我们的目标是获得参数的合理估计。
寻找最佳拟合线的过程
假设我们有一个特定的数据样本,现在想确定一条拟合数据的线。
-
第一次尝试:我们设斜率为 1,截距为 2.5。
- 要计算残差平方和,首先计算每个 x 的预测值。
- 然后,我们可以找到图上每个 X 观测值的残差。残差是每个观测值与直线预测值之间的差异。
- 这条线还可以,但让我们尝试更接近数据点。
-
第二次尝试:这次,我们设斜率等于 1.25,截距等于 3。
- 同样,我们必须绘制残差并从图中计算残差平方和。
- 从图上看,我们似乎更接近了,但很难判断是否得到了最好的线。
我们可以继续尝试不同的线,通过反复试验,挑选一条我们认为最接近数据点的线。但这非常耗时。
好消息是,在 Python 中,计算机将使用 OLS 估计技术来测试许多条线,并识别出哪一条是最佳拟合线。
通过 OLS 估计,我们发现 β₀̂ = 1.5,β₁̂ = 3.2。
我们估计的直线代表了模型对数据的最佳拟合。稍后,我们将讨论使用 P 值和置信区间的不确定性,以帮助解释结果。

总结与过渡
现在我们已经介绍了什么是简单线性回归以及如何通过 OLS 找到最佳拟合线,我们将回归到回归分析框架的节奏中。
接下来,我们将检验模型假设,即数据需要满足哪些条件,我们才能在回归工具箱中使用这个强大的新工具。
012:建立线性回归假设 📊

在本节课中,我们将要学习线性回归分析的核心前提——模型假设。我们将了解四种关键假设的含义,并学习如何使用数据可视化来检验这些假设是否成立。理解并验证这些假设是确保模型有效性和结果可靠性的关键步骤。
检查模型假设:PACE框架的分析阶段
上一节我们介绍了PACE框架,本节中我们来看看在分析阶段的首要任务:检查简单线性回归模型的假设。
除了模型的技术要求,你还需要考虑所处理问题的商业背景。这将在后续的“计划”阶段进行。之前,我将模型假设定义为关于数据必须为真的陈述,以证明使用特定建模技术的合理性。确保我们根据现有数据使用了正确的模型,能使我们对模型产生的结果充满信心。
可以将模型假设视为PACE框架中“分析”阶段和“构建”阶段之间的桥梁。换句话说,尽可能在构建阶段之前检查假设。某些假设只能在模型构建后才能检查,因此请确保在应用模型后检查这些假设,以确认模型是否有效。
数据可视化可以作为判断模型假设是否满足的工具。幸运的是,Python将在生成这些可视化方面为你提供巨大帮助,我也会在此全程指导你。
以下是简单线性回归的四个关键假设:
- 线性
- 正态性
- 观测值独立性
- 同方差性
目前,我们将重点理解每个假设的含义,以及如何使用数据可视化进行检查。
假设一:线性关系 📈
线性回归的第一个假设恰好是最容易检查的,即线性假设。你已经知道,线性回归中的“线性”源于数据在XY坐标平面上绘制时的样子——一条直线。
为了检测此假设是否满足,你只需确保散点图上的点看起来大致沿一条直线分布。如果可视化图像看起来像一团随机云朵或更接近一条曲线而非直线,那么该假设被视为不成立,意味着该模型不能很好地拟合数据。对于这个数据集,你可能需要一个不同或更复杂的模型。
相反,如果散点图显示数据点聚集在一条线周围,则表明线性回归是代表X和Y之间关系的合适模型。
假设二:误差正态性 🔔
接下来检查列表中的是正态性假设。该假设认为残差值(即误差)是正态分布的。
由于这个假设是关于残差的,你只能在模型构建后才能检查它。但一旦模型构建完成,你可以创建一个特定的图形,称为残差的分位数-分位数图。
如果图上的点看起来形成一条笔直的对角线,那么你可以认为满足正态性,并将此假设从列表中勾选掉。
假设三:观测值独立性 🔗
第三个是观测值独立性假设,它声明数据中的每个观测值都是独立的。
在这里,利用关于数据收集和所使用变量的背景信息来确定这一点是否成立会很有帮助。如果假设成立,我们期望拟合值与残差的散点图类似于一团随机的数据点云。如果存在任何模式,那么我们可能需要重新检查数据。
假设四:同方差性 ⚖️
最后但同样重要的是列表上的第四个假设:同方差性。这个听起来很复杂,但了解其字面含义会有所帮助——同方差性意味着具有相同的散布。
在检查同方差性时,散点图再次派上用场。回到拟合值与残差的散点图,沿着因变量的值应该具有恒定的方差。如果你在散点图中没有观察到清晰的模式,那么这个假设就成立。
有时你会听到这被描述为一团随机的数据点云。例如,如果你观察到一个锥形图案,那么该假设就不成立。
总结与展望
本节课中我们一起学习了简单线性回归的四个核心假设:线性、正态性、观测值独立性和同方差性。在继续前进之前,不必觉得需要立即记住所有这些材料。请记住,数据分析是一个迭代的过程。你可以回顾这些概念,检查假设是否与你的数据相符,然后继续推进回归过程。在本课程中,你将有很多机会来练习和磨练这些技能。

现在,让我们应用你在这里学到的一切,尝试使用Python在一个数据集上进行实践。😊
013:使用Python探索线性回归 🐧📈

在本节课中,我们将学习如何将简单的线性回归理论应用于实际数据。我们将使用Python,通过一个关于企鹅体重的具体案例,来实践从数据探索到模型构建与评估的完整流程。
概述
我们将从一个实际问题出发:动物园管理员希望了解企鹅的某些身体特征(如喙长)是否与其体重相关,以便更好地安排喂养计划。我们将使用Python的pandas、seaborn和statsmodels库,通过以下步骤完成分析:数据导入与探索、可视化线性关系、构建线性回归模型、检查模型假设,并最终解释结果。
数据导入与初步探索
首先,我们需要导入必要的Python包并加载数据集。
import pandas as pd
import seaborn as sns
Python的seaborn等库内置了一些数据集,方便我们直接调用而无需下载文件。现在,我们加载企鹅数据集并将其保存为一个名为penguins的变量。
penguins = sns.load_dataset('penguins')
load_dataset函数返回一个数据框(DataFrame),因此penguins现在是一个数据框。我们可以使用head函数查看前几行数据。
数据集中包含几个连续变量(以毫米为单位的喙长、喙深、鳍肢长度,以及以克为单位的体重)和几个离散变量(物种、岛屿、性别)。由于我们进行简单线性回归,因此将重点关注连续变量。
为了简化分析,我们对数据进行了清理:只保留两个企鹅物种,并删除了几行缺失数据。清理后的数据保存在名为penguins_final的数据框中。
可视化变量关系
在构建模型前,我们需要通过可视化来识别变量之间是否存在线性关系。
以下是创建散点图矩阵的代码:
sns.pairplot(penguins_final)
seaborn的pairplot函数会创建一系列散点图,展示每对变量之间的关系。对角线则显示每个连续变量的分布情况,这有助于我们验证数据是否满足线性回归的线性假设。
通过观察散点图矩阵,我们发现了几个看似存在线性关系的变量对:
- 喙长与体重似乎呈正相关。
- 鳍肢长度与喙长似乎呈正相关。
- 体重与鳍肢长度似乎也相关。
检查线性回归假设
上一节我们通过可视化初步观察了变量关系。本节中,我们将更系统地检查构建线性回归模型所需满足的假设。
我们已知满足了第一个假设——线性。幸运的是,散点图矩阵的对角线也显示了每个变量的分布。我们观察到喙长和体重都接近正态分布,这暗示着模型的残差很可能也是正态分布的,从而满足正态性假设。
第三个假设是观测值独立。由于每一行数据都来自不同的企鹅,我们没有理由认为一只企鹅的喙长或体重与其他企鹅相关。
最后一个关于同方差性的假设,我们可以在构建模型后通过绘制残差图来确认。
现在,让我们进一步提取出我们感兴趣的两个变量:喙长和体重。
penguins_subset = penguins_final[['bill_length_mm', 'body_mass_g']]
请注意使用双括号,这告诉Python我们想要选择哪些列。
构建线性回归模型
现在我们已经准备好数据和目标变量,可以开始构建线性回归模型了。
首先,以计算机能理解的格式写出回归公式,并将其保存为名为formula的变量。请仔细注意列名,必须精确指定以便计算机运行回归模型。
formula = 'body_mass_g ~ bill_length_mm'
公式中,~符号让计算机知道其后的变量是我们的自变量X。空格不是必需的,但有助于提高清晰度。
接下来,我们使用statsmodels模块中的OLS函数创建一个OLS对象。
import statsmodels.formula.api as smf
ols = smf.ols(formula=formula, data=penguins_subset)
然后,使用OLS对象的fit方法将线性回归模型拟合到数据上,并将结果保存为变量model。
model = ols.fit()
最后,打印出普通最小二乘估计的结果,该方法是OLS函数用于构建线性回归模型的技术。我们使用模型的summary方法,它将打印出一个包含许多不同统计量的表格。
print(model.summary())
这个表格包含大量信息。在本课程中,我们将先关注表格底部详细说明模型确定的最佳拟合线系数的部分。
由于我们使用的是简单线性回归模型,因此有两个系数:一个截距(β₀)和一个斜率(β₁)。
- 你可以在系数列(表中缩写为
coef)的Intercept行找到最佳拟合线的Y轴截距。在本例中,它是-1707.2919。 - 你可以在系数列的
bill_length_mm行找到斜率。最佳拟合线的斜率是141.1904。
让我们将其重写为一个线性方程,这将有助于我们后续解释结果。
首先,将变量代入线性方程:y = 截距 + 斜率 * x。其中,y是企鹅的体重(克),x是企鹅的喙长(毫米)。
将截距和斜率四舍五入到小数点后两位,我们得到方程:
体重 = -1707.29 + 141.19 * 喙长
这意味着,平均而言,喙长每增加一毫米,企鹅的体重就会增加141.19克。请记住,我们仍然需要检查关于残差的一些假设来双重验证这个结论。
评估模型与检查残差
我们已经成功将线性回归模型拟合到数据上。为了完成对模型假设的检查,现在需要计算并分析残差。
首先,使用模型的predict方法计算一些拟合值。然后,你可以通过模型变量访问残差。残差是指使用模型的resid属性得到的实际值与拟合值之间的差异。
fitted_values = model.predict(penguins_subset['bill_length_mm'])
residuals = model.resid
接下来,创建几个图表来确认我们的发现。
-
回归拟合图:使用
seaborn的regplot函数绘制带有最佳拟合回归线的数据图。你可以观察到变量之间的线性关系、最佳拟合线以及线周围表示模型估计不确定性的小阴影区域。 -
残差与拟合值散点图:创建拟合值相对于残差的散点图。这是处理线性回归时检查各种假设非常常见的图形。从这个图中,你可以观察到残差似乎是随机分布的,这意味着可以假设同方差性。一个看起来随机的散点图表明独立性假设未被违反,但这并非我们相信其成立的唯一原因。你可以检查输入并进行更高级的统计测试来确认这一点。
-
残差直方图:创建残差的直方图,以确定残差是否服从正态分布。如果残差呈正态分布,遵循经典的钟形曲线形状,那么你就可以确认正态性假设也得到了满足。在本例的直方图中,残差略有偏斜。
-
Q-Q图:为了进一步验证正态性,你可以使用
statsmodels的qqplot函数创建Q-Q图。图中有一条向上的直线对角线,在极端值处有轻微弯曲。你可能想进一步探索这一点,但就目前而言,这很好地确认了正态性假设。

总结
本节课中,我们一起学习了使用Python进行简单线性回归分析的完整流程。我们从导入和探索企鹅数据集开始,通过可视化初步识别了变量间的线性关系。接着,我们系统地检查了线性回归的假设,并成功构建了一个预测体重与喙长关系的模型。最后,我们通过分析残差图评估了模型的有效性,并确认了关键假设基本得到满足。
现在你已经确认所有假设基本满足,可以说回归模型的结果很可能是合理的。请记住,你随时可以回顾我们所涵盖的内容以及代码和文档。做得很好!😊
014:评估回归分析中的不确定性 📊

在本节课中,我们将要学习如何评估回归分析中的不确定性。我们将探讨如何解读模型结果中的关键指标,如P值和置信区间,并理解它们如何帮助我们负责任地报告模型的局限性。
到目前为止,在处理本地动物园的企鹅问题时,我们已使用数据分析流程像数据专家一样思考。
我们通过仔细思考问题并适当筛选可用数据来完成了规划阶段。
我们如何更好地理解企鹅解剖结构与体重之间的关系?
在分析阶段,我们进行了探索性数据分析并检查了模型假设。
然后进入构建阶段,作为提醒,该阶段包含两个部分。
我们构建了模型,并能够提取出一些参数估计值。
现在,我们将专注于构建阶段的下一步:模型评估。
模型评估是数据分析中的重要实践。仔细评估和解释回归模型有助于理解其性能和准确性。
回顾模型结果
上一节我们介绍了模型的构建,本节中我们来看看如何评估其不确定性。
首先,让我们回顾一下回归模型的结果。根据结果摘要,我们知道普通最小二乘法已确定最佳拟合线的截距为 -1707.29,斜率为 141.19。
然而,随机性和不可预测性是每个回归模型的特征,这使得我们难以以100%的确定性预测结果。毕竟,观测值与预测值之间仍然存在差异。
你刚刚找到的是你最确定的模型。为了进一步探讨不确定性的概念,让我们将注意力转向OLS摘要表中关于截距和喙长的其余行。
理解P值与置信区间
摘要表中有一列标记为 P > |t|。这表示与系数估计值相关的P值。
P值列右侧的两列表示围绕系数估计值的95%置信区间。
以下是评估简单线性回归结果时的关键点:
- 在评估简单线性回归结果时,你会较少关注截距行,而更多地关注涉及你感兴趣的独立变量的行。在本例中,即“喙长”。
- 因此,你可以说喙长的系数估计值为 141.19,P值为 0.000,置信区间为 [131.788, 150.592]。
置信区间的含义
之前学习假设检验时,置信区间被定义为一个描述估计值周围不确定性的数值范围。
在线性回归的情况下,我们估计的是参数。因此,95%置信区间意味着该区间有95%的几率包含斜率的真实参数值。
如果斜率和截距略有不同会怎样?让我们在图上画出几条斜率和截距都略有不同、但都在置信区间内的线。
我们会在回归线周围得到一个区域,该区域在中心附近较窄,并向线的两端略微展开。这个形状可能看起来很熟悉,你之前使用Seaborn的regplot函数绘制过它。
这些线构成了回归线周围的阴影区域。本质上,参数估计值周围的置信区间揭示了我们所说的置信带。

置信带是围绕回归线的区域,描述了在每个x值处预测结果的不确定性,通常以散点图上最佳拟合线周围的阴影区域表示。置信带揭示了回归线上每个点的置信区间。
置信带只是负责任地报告你发现的另一种方式。
总结与反思
本节课中我们一起学习了如何评估回归分析中的不确定性。
简单线性回归是任何数据专家工具箱中的强大工具。无论你是在分析流媒体服务价格上涨的财务影响,还是在为时装精品店预测销售额,回归分析都可以帮助你发现并理解数据背后的关系。
但我们必须记住,数据是嘈杂的,在使用简单线性回归等回归模型时,结果可能具有不确定性。即使是最好的数据也无法讲述完整的故事。
作为一名数据分析专家,你的目标不仅应该是评估模型的性能和准确性,还应该报告不确定性。沟通置信区间和置信带是成为一名负责任的数据专家的一部分。这些指标也将帮助你理解模型在多大程度上能够揭示数据背后的故事。
015:模型评估指标 📊

在本节课中,我们将学习如何评估线性回归模型的质量。我们将重点介绍一个核心评估指标——R平方,并探讨如何使用“保留样本”来测试模型的泛化能力。理解这些评估方法对于确保你的分析结果可靠、可信至关重要。
模型评估的重要性
到目前为止,我们已经完成了回归建模PACE框架中的“计划”和“分析”阶段。我们甚至通过实际构建一个线性回归模型,开始了“构建”阶段。
上一节我们介绍了模型的构建,本节中我们来看看如何评估这个模型。我很高兴能继续指导你进行模型评估。我们离“执行”阶段越来越近了,届时你将分享数据背后的故事。
使用多种评估指标可以增强数据专业人士对其分析所产生见解的信心。这些指标是负责任地传达结果的关键。如果模型不准确或不精确,那么基于这些见解所做的决策也可能不准确。
以下是三种你可能会遇到的评估指标:
- R平方
- 均方误差
- 平均绝对误差
学术界、研究人员和数据专业人士在评估回归模型时使用的主要指标是决定系数,或称 R平方。所以我们将重点讨论它。
核心指标:R平方
你可能已经注意到,在你之前构建的OLS模型输出中,有一个部分标记为“R-squared”,这就是我们要讨论的。
R平方衡量的是因变量 y 的变化中,有多少比例可以由自变量 x 来解释。为了更透彻地解释这个指标,让我们再次思考一下关于企鹅和线性回归的例子。
你已识别出企鹅的喙长(毫米)与其体重(克)之间存在线性关系。根据你的回归分析,你找到了最佳拟合线:
体重(克) = -1707.30 + 141.19 * 喙长(毫米)
但是,数据点只是聚集在这条最佳拟合线周围。许多数据点实际上并不在线上。这意味着喙长只能解释体重变化的一部分。
R平方帮助数据专业人士确定X变量的变化在多大程度上解释了Y变量的变化。
- R平方最大可以等于 1,这意味着x解释了y中100%的方差。
- 如果R平方等于 0,则意味着x解释了y中0%的方差。
OLS汇总表显示该模型的R平方为 0.769。这意味着喙长解释了体重中约 77% 的方差。体重中仍有约 23% 的方差是模型无法解释的。这种差异可能归因于其他因素,或是企鹅个体间自然存在的、无法解释的差异。
R平方没有一个必须达到的基准值,但一般来说,R平方越高越好,因为它能增强你基于分析所提建议的有效性。
提升评估:使用保留样本
R平方是一个有用的指标,可以帮助你评估模型,但还有一些流程可以加强模型的评估。
通常,当我们有一个数据集时,我们会使用至少一部分数据来构建和测试回归模型。计算机使用数据来计算实际值与预测值之间的差异度量,例如残差平方和。然后,基于计算机的计算,它可以找到最佳拟合线。
但有时,我们希望我们的模型能够很好地预测我们尚未收集或尚不存在的数据。例如,让我们回到当地动物园的企鹅。他们迎来了一群新的企鹅加入他们的“不会飞的鸟类”栖息地。如果能了解新企鹅的结构测量值与其体重的关系,将会很有帮助。
因此,在这些情况下,我们想知道我们构建的模型在它学习过的数据上表现如何,以及它在尚未见过的数据上表现如何。
在这种情况下,我们需要在构建模型之前保存一个保留样本。保留样本是观测数据的一个随机样本,不用于拟合模型。然后,你可以评估模型对用于构建模型的数据的拟合程度,也可以评估模型对保留样本的拟合程度。

总结
本节课中我们一起学习了评估线性回归模型的不同方法。我们重点探讨了R平方这一核心指标,它量化了模型解释数据变异的比例。我们还介绍了使用保留样本来测试模型泛化能力的重要性。掌握R平方和保留样本将在许多情况下为你提供帮助,使你能自信地分享你所发现的见解。我很期待很快能讨论“执行”阶段以及如何沟通模型发现。😊
016:解释和展示线性回归结果 📊

在本节课中,我们将学习如何解释线性回归模型的结果,并以清晰、易懂的方式向非技术背景的利益相关者展示这些发现。我们将重点讨论如何理解回归系数和P值,如何负责任地报告结果,以及如何利用可视化工具有效地传达数据背后的故事。
回顾与过渡
在课程的前期,我们构建了一个满足简单线性回归所有四项假设的模型。残差图确认了线性关系,并且我们成功地使用几个常见指标评估了模型的性能。
现在,我们进入PACE框架的“执行”阶段。在这个阶段,你的沟通能力至关重要。接下来,我们将一起回顾如何解释回归模型的结果,探索将这些见解转化为正式可视化的方法,并与利益相关者沟通一个有意义的叙事。
沟通的重要性:一个案例
在我之前的一个职位中,我受雇帮助一家新成立的移动电话服务提供商减少他们收到的欺诈订单数量。构建好模型后,便是向利益相关者展示模型见解和建议的时候了。
这些利益相关者是非技术背景的业务伙伴,因此我知道,使用数据专业术语不会引起他们的兴趣。事实上,过于技术化的内容会让他们很快失去兴趣,从而导致他们不支持这个项目。
对我的业务伙伴来说,重要的是阻止欺诈订单。因此,我以简洁明了的方式讲述了故事,阐明了模型能检测出多少欺诈订单,以及这对公司的利润意味着什么。结果,模型立即得到了实施。
我记得那一刻我感到非常有成就感,因为在构建模型的所有辛勤工作之后,我终于能让模型投入生产。模型投入运行后,欺诈订单数量大幅下降。
向正确的人讲述正确的故事需要时间和练习。这是我们整个职业生涯中都需要持续磨练的技能。了解你的受众并调整你的表达方式和故事内容,以产生最大的影响,这一点至关重要。
回归我们的案例:动物园的企鹅
现在,让我们回到我们一直在探讨的例子:你在当地动物园工作,试图理解企鹅的结构测量数据与其体重之间的关系。
在你创建的回归模型中,你观察到企鹅的喙长与体重之间存在正相关关系。
让我们利用该模型的结果,为利益相关者解读这些统计发现。回归模型的解释依赖于系数和P值。
- 系数决定了自变量(X)的变化与因变量(Y)的变化如何关联。
- P值则表明系数是否具有统计显著性。
回想一下,斜率用于确定当X每增加一个单位时,你预期Y会增加或减少多少。
让我们仔细看看OLS摘要表中给出的数字,以便更好地理解。
我们的回归方程是:
体重 = 截距 + 斜率 × 喙长
- 斜率是正的,为 141.19。
- 截距是负的,为 -1707.29。
接下来,让我们回顾一下P值。喙长系数的P值为 0.000。这个P值检验的是“系数为0”的原假设。如果我们观察到一个很小的P值,那么原假设很可能不成立。
因此,我们拒绝原假设,并得出结论:该系数不为0,这意味着X和Y之间存在强相关关系。
相关性与因果性
必须理解的是,你观察到的喙长与体重之间的正相关关系,并不一定反映因果关系。
因果关系描述的是一种直接的因果关系,其中一个变量直接导致另一个变量以特定方式改变。喙的大小与体重之间的正相关可能是多种因素共同作用的结果。
因此,尽管我们不能断言存在因果关系,但我们仍然可以提供关于企鹅的有价值的见解。
解读与报告结果
根据我们的回归分析,我们可以说:对于喙长每增加1毫米的企鹅,其体重预计会增加 141.19 克。
这些结果具有统计显著性,其P值为 0.000,置信区间为 [131.79, 150.59],R平方值为 0.77。
通过提供我们估计值周围的不确定性度量,我们是在负责任地报告我们的结果。基于对这些数字的解读,你可以为你所在的动物园社区做出贡献。
团队协作与背景沟通
动物园团队的每个成员都带来了不同的经验和知识。你同事的输入为模型讲述的故事增添了更丰富的细节。如果没有其他鸟类饲养员提供的专业视角,鸟类部门就无法有力地论证增加食物储备以维持足够库存的必要性,从而支持动物园的企鹅和其他鸟类。
作为数据分析专业人士,在分享见解时,你需要确保你的发现能够被快速理解并正确解读。
负责任地报告数据的一种方式是沟通数据的背景。例如,如果你的结果仅适用于特定的企鹅种群,请明确指出,人们应谨慎地将结论推广到更大或不同的企鹅群体。
利用可视化进行沟通
数据可视化是让他人理解统计数据的绝佳方式。
在可视化中呈现“系数”和“P值”等术语时需要谨慎。要考虑到并非每个人都能立即完全理解这些术语的重要性。
有许多有用的库可以帮助创建可视化,例如 Matplotlib 和 Seaborn。像 Tableau、PowerPoint 或 Google Slides 这样的程序则允许创建高质量的演示文稿,帮助你提供与业务问题相关的背景信息。
无论你选择哪种可视化工具,在整个PACE流程的各个阶段,与你周围的人进行清晰沟通对你的成功都至关重要。

总结
在本节课中,我们一起学习了如何解释线性回归模型的核心结果,包括系数和P值。我们强调了相关性与因果性的区别,并探讨了如何负责任地向非技术背景的利益相关者报告和展示这些发现。关键在于将复杂的统计结果转化为清晰、有影响力的故事,并利用适当的可视化工具来支持你的沟通。作为数据分析专业人士,清晰的沟通能力能使你的工作在整个团队和组织中产生真正的影响。
017:简化复杂数据关系》📊

概述
在本节课中,我们将总结简单线性回归分析的核心内容,并回顾你已经掌握的关键技能。我们将从模型构建、假设检验、评估方法到结果呈现,系统梳理整个分析流程。
回顾分析流程与工具
上一节我们完成了第一个回归模型的构建。现在,我们来总结你已添加到数据分析工具箱中的核心技能。
线性回归分析是数据科学的基础技术。目前你已经熟悉了在简单线性回归分析中遵循的 PA 流程:计划、分析、构建和执行。
以下是你在本阶段掌握的主要步骤:
- 计划:明确分析目标和变量。
- 分析:进行探索性数据分析并检验假设。
- 构建:使用Python和OLS方法构建模型。
- 执行:评估模型并解释结果。
掌握核心建模方法
在构建模型环节,你使用了普通最小二乘法进行估计。
你在Python中应用了OLS来获得最佳拟合线,这条线最小化了预测值与实际值之间的误差。其核心目标是找到参数,使得残差平方和最小,公式表示为:
min Σ(y_i - ŷ_i)²
理解并检验模型假设
接下来,你学习了简单线性回归的四个主要模型假设。
以下是需要满足的四个关键假设:

- 线性:自变量和因变量之间存在线性关系。
- 残差的正态性:模型的残差应近似服从正态分布。
- 观测值独立:各个观测值之间相互独立。
- 同方差性:残差的方差应保持恒定。
你通过探索性数据分析和Python实践,检验了数据是否满足这些假设,从而判断线性回归模型的适用性。
评估模型性能
你使用Python构建了模型,并学习了如何评估模型拟合优度。
评估主要依赖以下几个工具:
- R平方:衡量模型解释数据变异的比例。
- 保留样本:通过将数据分为训练集和测试集来验证模型的泛化能力。
- 不确定性度量:如置信区间和P值,用于评估估计值的可靠性和显著性。
将分析结果转化为洞察
最后,你将数字和统计结果转化成了有说服力的故事。
你探索了企鹅数据集,展示了数据分析专业人员如何用清晰、简单的术语向他人呈现发现。你学习了在Python中创建可视化图表的价值,以便向利益相关者传达简单线性回归模型的结果。这是一项宝贵的技能,你将在整个数据分析旅程中持续使用。
总结与展望
本节课中,我们一起学习了简单线性回归的完整PA流程。你取得了长足的进步,应该为自己感到骄傲。
目前,我们已经完成了一次简单线性回归的完整循环,但学习并未止步。接下来,我们将把简单线性回归的知识扩展到多元线性回归模型。
简单线性回归非常适合处理只有一个自变量的问题。然而,问题越复杂,可能产生影响的因素就越多。这正是多元线性回归发挥作用的地方。
你取得了惊人的进步,正在成长为一名未来的数据分析专业人士。😊
018:模块3导览


概述 📋
在本节课中,我们将要学习多元线性回归。我们将回顾回归建模的PACE框架,并探讨如何将简单线性回归的概念扩展到处理多个自变量的情况。
课程内容
大家好。很高兴再次与您一同踏上成为数据分析专业人士的旅程。
自本课程开始以来,您已经取得了长足的进步。我们一起涵盖了回归建模的PACE框架,并概述了两种基础的回归模型:线性回归和逻辑回归。我们运用您的统计学知识讨论了简单线性回归的工作原理及其适用场景。您学习了模型评估。您还学习了如何有效且准确地解释和传达回归结果。
所有这些技能都将迁移到其他回归和机器学习模型中。随着您成长为一名数据专业人士,您将能够运用这些技能发现许多数据驱动的洞见。
简单线性回归是一种优秀的基础技术,但作为一种技术,它可能感觉有限,因为它只允许一个自变量。在许多情况下,您可能对两个、三个或四个自变量感兴趣。例如,在特定月份中,可能有许多因素与产品销量相关,例如节假日、新产品发布、零售网站变更或营销活动调整。我们需要一种新技术来弄清楚这些变量中的每一个如何与产品销量相关联。这就是多元线性回归的用武之地。
在接下来的视频中,我们将探索多元线性回归的世界,通常简称为多元回归。正如我们按照计划、分析、构建和执行(PACE)的步骤处理简单线性回归一样,我们也将以同样的方式处理多元回归。
首先,我们将讨论多元回归。简单线性回归只允许一个自变量X,而多元回归允许我们拥有许多与一个连续因变量Y的变化相关联的自变量。
在方程中添加更多自变量会使数学计算复杂化,但我们所涵盖的一切都只是简单线性回归概念的延伸。因此,我们将回到我们的统计学基础,并重新审视PACE框架。由于这不是您的第一个模型,我们将从分析(Analyze)阶段开始。我们将回顾多元线性回归的模型假设。探索性数据分析(EDA)将继续帮助我们判断假设是否成立。
然后,我们将专注于构建(Construct)阶段,在此阶段我们将学习如何构建模型,并且您将获得更多Python实践机会。
接下来,在执行(Execute)阶段,我们将专注于解释和从多元线性回归中讲述故事。随着自变量增多,我们必须更仔细地思考我们得出的见解以及如何传达我们的结果。
之后,我们将迭代回到构建阶段,并更深入地学习多元线性回归的细微差别。作为数据分析专业人士,最重要的技能之一就是为每个用例找到最佳模型,这又回到了计划和PACE框架。为了寻找最佳模型,并且随着模型变得更加复杂,我们需要新的方法来有效地评估它们。作为寻找最佳模型的一部分,我们将学习变量选择和正则化。


在您作为数据分析专业人士的职业生涯中,您很可能会遇到一些非常大的数据集,仅通过查看数据来找出哪些变量具有统计重要性可能具有挑战性。但您在这里学到的工具将允许您的计算机为给定的模型输出和评估指标计算一组可能的变量。尽管计算机正在执行令人难以置信的数学运算,但作为数据专业人士的您需要解读输出,以便理解和传达计算机揭示的关系。
现在,是时候让我们了解更多关于多元回归的知识,以及我们如何使用不同的自变量来估计因变量。让我们继续拼凑回归的拼图。
总结 ✨
本节课中我们一起学习了多元线性回归的引入及其重要性。我们了解到,与简单线性回归相比,多元回归能够处理多个自变量,从而更全面地分析复杂数据关系。课程回顾了PACE框架在多元回归中的应用路径,并预告了后续将深入学习的模型构建、评估及变量选择等关键技能。这些知识将为您处理更复杂的现实世界数据分析问题奠定坚实基础。
019:多元回归介绍 📊

在本节课中,我们将要学习多元线性回归的基本概念。我们将了解它如何扩展简单线性回归,以处理多个自变量,并初步探讨如何将分类变量和变量间的交互作用纳入模型。
上一节我们介绍了简单线性回归,它用于分析一个连续因变量与一个自变量之间的关系。例如,公司使用的广告数量越多,其网站获得的点击量就越多。网站点击量是一个连续的因变量,广告数量是自变量。
但公司可能希望探索每个广告的特征,以确定哪些类型的广告与更多的网站点击量相关。例如,较短的广告是否与更多点击相关?或者包含“捐赠”或“订阅”等行动号召的广告是否与更多点击相关?多元线性回归可以帮助我们回答这类问题。
多元线性回归,也称为多重回归,是一种用于估计一个连续因变量与两个或更多自变量之间线性关系的技术。
让我们重新审视简单线性回归的方程:
y = β₀ + β₁x
回顾一下,β₀ 称为截距,β₁ 称为斜率。假设 Y 代表网站点击量,X 代表广告中出现的人数。
现在,让我们将广告时长加入方程:
y = β₀ + β₁x₁ + β₂x₂
其中,X₁ 代表广告中出现的人数,X₂ 代表广告的时长。请注意,由于我们现在有两个 X 变量,我们添加了下标以区分它们。这种表示法在多元分析中很常见。
从基本层面看,多元回归允许我们添加任意数量的自变量。因此,一个完整的多元回归方程可能是:
y = β₀ + β₁x₁ + β₂x₂ + … + βₙxₙ
其中,你关注 n 个自变量。
尽管我们只是添加了更多的 β 系数和自变量,但我们仍然可以获得线性回归的好处。与简单线性回归一样,多元线性回归也能产生高度可解释和可传达的结果。但由于其背后的数学稍微复杂一些,我们必须注意如何传达我们的结果以及系数的含义。
为了确保我们尽可能清晰且合乎伦理地传达结果,我们将介绍两个概念:独热编码和交互项。
以下是关于这两个核心概念的简要说明:

独热编码 允许我们在多元线性回归中使用分类自变量。例如,我们可能有印刷广告和数字广告。这是一个分类变量,独热编码将允许我们将其纳入回归模型。
交互项 用于解释两个自变量如何共同影响 Y 变量。
这两个主题都很重要,因为它们将改变我们解释模型系数的方式。我们将在接下来的视频中一起学习如何操作。

本节课中,我们一起学习了多元线性回归的基础。我们了解到它是简单线性回归的扩展,可以纳入多个自变量来预测一个连续结果。我们还初步认识了处理分类变量的独热编码,以及分析变量间共同作用的交互项,这些都将影响对回归系数的解释。在后续课程中,我们将深入探讨这些技术的具体应用。
020:表示分类变量 📊

在本节课中,我们将要学习如何处理回归分析中的分类变量。具体来说,我们将探讨一种名为“独热编码”的数据转换技术,它能够将非数值型的分类数据转换为计算机可以理解的数值形式,从而将其纳入回归模型进行分析。
作为数据分析专业人员,你可能会遇到一些场景,其中感兴趣的变量不是连续的。这些变量可能是分类变量。例如,在分析网站点击量和广告效果时,一些广告是黑白的,而另一些是彩色的;或者一些广告包含行动号召,而另一些没有;又或者产品广告投放在不同的流媒体服务上。这些都是可能与网站收到的点击量相关的分类变量。
当我们有一个分类自变量时,必须将类别表示为数字,以便计算机理解数据。处理分类数据主要有两种方法:独热编码和标签编码。在本视频中,我们将学习独热编码。
什么是独热编码? 🔢
独热编码是一种数据转换技术,它将一个分类变量转换为几个二元变量。
让我们以广告是否包含行动号召为例。我们会在数据中创建一个新变量,称之为 action,在数学上我们将其表示为 X_action。如果一则广告包含行动号召,则 X_action = 1。如果一则广告不包含行动号召,则 X_action = 0。
我们的回归方程将变为:
y = β_0 + β_1 * X_1 + β_2 * X_2 + β_action * X_action
其中,X_1 衡量广告中的人数,X_2 衡量广告的长度。现在,假设我们有两则广告,它们的 X_1 和 X_2 相同,但一则包含行动号召,另一则不包含。那么我们可以推断,包含行动号召的广告比不包含的广告多带来 β_action 次网站点击。
处理多类别变量 🧩
现在,让我们移除行动号召变量。如果我们感兴趣的是广告投放在哪个流媒体平台上呢?假设公司在三个服务上投放广告:A、B 和 C。同时假设广告一次只能在一个平台上播放。所以,如果一个广告在服务 A 上,它就不在服务 B 或 C 上。
现在我们有一个具有三种可能性的分类变量 X。为了表示两种可能性(有行动号召 vs 没有行动号召),我们使用了一个二元变量。为了表示三种可能性,我们需要两个二元变量。让我们看看这是如何运作的。
想象我们有一个二元变量 X_service_A。如果 X_service_A = 1,我们知道广告在服务 A 上播放。但我们也知道另外两条信息:广告不在服务 B 上播放,也不在服务 C 上播放。
如果 X_service_A = 0,我们只知道广告不在流媒体服务 A 上。广告可能在服务 B 或 C 上播放。由于信息缺失,我们需要另一个二元变量来帮助我们和计算机弄清楚情况。
让我们添加一个变量 X_service_B。如果 X_service_A = 1,我们已经掌握了所有信息:广告在服务 A 上播放,所以 X_service_B 必须等于 0(广告不在服务 B 上播放),我们也知道它不在服务 C 上播放。
但如果 X_service_A = 0,我们可以从 X_service_B 获取更多信息。如果 X_service_B = 1,那么我们知道广告在服务 B 上播放,进而知道广告不在服务 C 上播放。
最后,如果 X_service_A = 0 且 X_service_B = 0,那么我们知道广告既不在服务 A 也不在服务 B 上播放,所以广告必须在服务 C 上播放。现在,我们仅用两个变量就获得了所需的全部信息。
更新回归方程 📝
让我们再次修订方程。现在我们有了:
y = β_0 + β_1 * X_1 + β_2 * X_2 + β_service_A * X_service_A + β_service_B * X_service_B

你会注意到方程中没有变量 X_service_C,因为它不会为我们提供更多信息。但解释略有不同。我们可以将服务 C 视为默认的流媒体服务。
因此,β_service_A 表示两则完全相同的广告在网站点击量上的差异,其中一则广告在服务 C 上播放,另一则在服务 A 上播放。类似地,β_service_B 表示两则完全相同的广告在网站点击量上的差异,其中一则广告在服务 C 上播放,另一则在服务 B 上播放。
总结与展望 🎯

在本视频中,你学习了独热编码如何允许我们将一个分类变量转换为几个二元变量。现在,我们可以开始根据广告相关的变量来估计网站将获得多少点击量。
接下来,我们将介绍如何使用 Python 对分类变量进行独热编码。我们将一起重温回归建模的整个过程,包括模型假设、模型构建、模型评估和模型解释。

到目前为止做得很好,期待在下一个视频中与你相见!
021:多元线性回归假设的建立 🧮

在本节课中,我们将学习多元线性回归模型的假设。我们将回顾简单线性回归中已熟悉的假设,并介绍一个专属于多元线性回归的新假设。
概述 📋
上一节我们介绍了简单线性回归的模型假设。本节中,我们来看看多元线性回归的假设。简单线性回归与多元回归共享四个基本假设,同时多元回归引入了一个关于自变量关系的新假设。
回顾共享的四个假设 🔄
以下是简单线性回归和多元回归共有的四个核心假设,其诊断工具也相同,主要包括散点图分析和模型构建后的残差图分析。
-
线性关系
该假设指出每个预测变量 X_i 与结果变量 Y 之间存在线性关系。通过绘制每个 X 变量与 Y 变量的散点图,我们可以判断哪些变量可能与 Y 呈线性关系。 -
观测值独立
该假设要求数据集中的每个观测值都是独立的。我们只能通过检查数据收集过程来验证此假设。例如,如果我们收集家庭收入数据,来自同一家庭的个体可能彼此不独立。 -
正态性
该假设要求模型的残差服从正态分布。 -
同方差性
该假设要求残差的变异(误差)在整个模型中保持恒定或相似。
多元回归的新假设:无多重共线性 🆕
当我们处理多元回归时,会遇到一个全新的假设:数据不应存在多重共线性。
无多重共线性假设 指出,任何两个自变量 X_i 和 X_j 之间不能高度相关。这意味着 X_i 和 X_j 彼此之间不能存在线性关系。
例如,假设你在一个音乐会场馆工作,想要预测演唱会门票销量。影响因素可能包括:社交媒体粉丝数、音乐平台播放量、艺人出道年份、票价、距离演唱会的天数等。虽然票价和剩余天数可能都是销量的强预测因子,但票价很可能与剩余天数相关(例如,演唱会前一周可能有促销,导致销量激增)。
如果在回归模型中同时保留这两个变量,将难以厘清各自的影响。此外,模型可能无法显著解释更多销量方差。
通过探索性数据分析验证想法 🔍
我们可以进行探索性数据分析来验证初步想法。
我们可以使用Python代码创建散点图矩阵来展示变量对之间的关系。散点图矩阵为每一对变量创建一个散点图。
如果我们观察到某个自变量与因变量之间存在线性关系,则应考虑将其纳入多元回归模型。如果我们观察到两个自变量之间存在线性关系,却仍将两者都纳入模型,则很可能违反无多重共线性假设。
量化多重共线性:方差膨胀因子 📊
在演唱会门票的例子中,数据包含六个变量:一个因变量(演唱会门票销量)和五个自变量(社交媒体粉丝数、音乐平台播放量、艺人出道年份、票价、距离演唱会的天数)。根据背景,我们可能预期社交媒体粉丝数与播放量高度相关,但在绘制散点图之前无法确认。
探索性数据分析和可视化是强大的工具,但它们无法检测出所有关系,因此我们需要借助数学方法。计算机可以方便地计算方差膨胀因子。
VIF量化了每个自变量与所有其他自变量的相关程度。VIF的最小值为1,其值可以非常大。VIF越大,模型中的多重共线性越严重。
处理多重共线性 🛠️
一旦识别出多重共线性,一个解决方案是剔除一个或多个存在共线性的变量。另一个可能的解决方案是利用现有数据创建新变量。

然后,你可以重新计算VIF,再次检查多重共线性假设。请记住,如有疑问,请探索你的数据。探索性数据分析和可视化对于理解潜在趋势和讲述有说服力的故事至关重要。
总结 🎯
本节课中,我们一起学习了多元线性回归的模型假设。我们回顾了线性关系、观测值独立、正态性和同方差性这四个共享假设,并重点学习了多元回归特有的无多重共线性假设。我们了解了如何使用散点图矩阵进行初步判断,以及如何利用方差膨胀因子量化并诊断多重共线性问题。通过遵循这些步骤,你可以确保模型与数据拟合良好,并且结果是合理的。到目前为止做得很好,请继续保持!
022:解释多元回归系数 📊

在本节课中,我们将学习如何构建多元线性回归模型,并详细解释其系数的含义。我们将从简单的线性回归入手,逐步过渡到包含多个变量以及变量间交互作用的复杂模型。
从简单线性回归开始
上一节我们介绍了简单线性回归的基本概念。本节中,我们来看看如何将其原理扩展到多个变量。
简单线性回归用于分析两个变量之间的关系。例如,我们绘制了气温与冰咖啡销量的数据,散点图显示数据点大致沿一条向上的对角线分布。
我们可以用一个简单的方程来描述这种关系:
销量 = -44 + 2.2 * 气温
这个结果可以解释为:气温每升高1度,冰咖啡的销量预计会增加2.2份。这个模型很好,可能解释了销量在大部分情况下的变化。
引入第二个变量:多元回归
但是,影响销量的因素不止气温。如果你在一家大型咖啡公司工作,你可能还想研究那些可控的因素,比如店铺选址或广告投放。
幸运的是,我们现在正在学习多元线性回归。作为数据分析师,你可以帮助公司回答这些问题。因此,我们在方程中增加一个变量:店铺附近是否有广告。
我们相应地修改方程:
销量 = β₀ + β_气温 * X_气温 + β_广告 * X_广告
这里的广告变量是一个二元变量,它只有两种可能的情况。
以下是两种具体场景的计算:
-
场景一:附近有广告(X_广告 = 1)
假设气温是75华氏度。方程变为:
销量 = β₀ + β_气温 * 75 + β_广告 * 1
我们估计,广告的存在与销量的某个增长量(β_广告)相关。 -
场景二:附近没有广告(X_广告 = 0)
在同样75华氏度的气温下,方程变为:
销量 = β₀ + β_气温 * 75 + β_广告 * 0
简化后得到:销量 = β₀ + β_气温 * 75
此时,β_广告项因为乘以0而消失。没有广告时,销量仅仅是气温的函数。
解释连续变量的系数
现在,我们移除广告变量,引入一个新问题:店铺与公共交通站点的距离。
变量“交通距离”将衡量咖啡店距离公交、火车或地铁站有多少公里。方程变为:
销量 = β₀ + β_气温 * X_气温 + β_交通距离 * X_交通距离
其中,气温和交通距离都是连续变量。
对于这个模型,系数的解释需要遵循一个关键原则:
- 在保持交通距离不变的情况下,气温每升高1度,我们预计冰咖啡销量会增加 β_气温 份。
- 在保持气温不变的情况下,店铺离公共交通每远1公里,我们预计冰咖啡销量会减少 β_交通距离 份。
注意:在解释多元回归中某个变量的系数时,必须假设其他变量保持不变。 后面的数学原理会解释为什么必须这样做。
引入变量间的交互作用
到目前为止,我们讨论了如何处理几个独立的变量。但在某些情况下,我们可能预期两个变量会相互影响。
例如,在气温和交通距离的例子中,我们可能预期,在天气较凉时,交通距离对销量的影响会有所不同。如果我们想考虑两个变量的值如何共同影响结果,就需要引入一个交互项。
交互项代表了两个自变量之间的关系如何与因变量均值的变化相关联。通常,交互项用两个相关自变量的乘积来表示。
回到咖啡店销量的例子,如果我们怀疑交通距离对销量的影响会因气温不同而不同,就可以加入交互项“气温 × 交通距离”。
最初的方程是:
销量 = β₀ + β_气温 * X_气温 + β_交通距离 * X_交通距离
如果我们想包含气温和交通距离的交互作用,可以将方程修订为:
销量 = β₀ + β_气温 * X_气温 + β_交通距离 * X_交通距离 + β_交互 * (X_气温 * X_交通距离)
其中,交互作用用乘号 * 表示。

在这个例子中,我们通过加入交互项,考虑到了自变量之间的相互作用。在本课程中,我们将继续学习如何解读回归模型和系数的这些细微差别。

总结
本节课中我们一起学习了多元线性回归系数的解释方法。
我们从简单的单变量回归出发,理解了如何解释一个变量的系数。接着,我们引入了第二个变量,学习了在解释其中一个变量的系数时,必须保持其他变量恒定的原则。最后,我们探讨了更复杂的情况,即变量之间可能存在交互作用,并通过在模型中加入交互项(变量的乘积)来捕捉这种关系。
我们已经涵盖了很多内容,练习将帮助你建立对这些概念的信心。请花时间利用本课程提供的资源,帮助你使用多元回归、解释结果并讲述数据故事。接下来,我们将继续深入探讨多元回归。
023:使用Python解释多元回归结果 🐧📊

在本节课中,我们将学习如何使用Python来运行和解释多元回归模型的结果。我们将以企鹅数据集为例,探索如何预测企鹅的体重,并理解模型中各个变量的影响。
我们已经探讨了多元回归能帮助我们回答的一些有趣且更复杂的问题,并概述了如何解释多元回归模型。现在,让我们转向Python。
与简单线性回归类似,我们将通过最小化残差平方和(一种误差度量)来找到最佳拟合线。虽然我们可以花大量时间一步步执行普通最小二乘估计,但Python有一些内置函数可以帮助我们构建模型。这样,作为数据分析专业人员,我们可以将时间用于探索数据和传达从计算中获得的见解。
我们将重新使用之前的企鹅数据集,看看是否能了解更多关于企鹅体重的信息。我们已经完成了一些探索性数据分析和数据清洗,并将数据保存为名为 penguins 的变量。
数据概览
首先,使用pandas的 head 函数快速查看数据摘要。
数据集包含四个不同的变量:以克为单位的体重、以毫米为单位的喙长、性别和物种。对于本问题,数据相对干净,你将尝试基于其他变量来预测体重。
准备数据
接下来,将数据划分为自变量(X)和因变量(Y)。这一步有助于为你将用于创建训练集和测试集的函数准备数据。
使用Scikit-learn库中的 train_test_split 函数来创建训练数据集和测试(或保留)数据集。首先导入该函数。
from sklearn.model_selection import train_test_split
现在,使用准备好的数据将数据划分为训练集和测试集。
X_train, X_test, y_train, y_test = train_test_split(X, y, test_size=0.3, random_state=42)
请注意,test_size 变量是你随机分配给测试数据集的数据比例。在本例中,你保留了30%的数据来测试模型。根据具体情况,保留更多或更少的数据可能是合适的。
random_state 变量不一定需要设置,但你将其赋值为42,以便可以复现我们的结果。你会在代码文档中经常遇到数字42。这个数字在一部流行的科幻小说中具有重要意义,并被计算机科学界广泛采用。如果你为 random_state 变量输入不同的值,你会得到不同的结果。输入什么数字并不重要,但设置 random_state 允许他人复现你的工作。
构建多元回归模型
现在,我们需要考虑我们的多元回归公式。我们的自变量是喙长、性别和物种。
我们将使用statsmodels模块来运行回归,就像你对简单线性回归所做的那样。statsmodels的普通最小二乘函数(OLS)需要知道你的回归公式。将其保存为一个变量。
import statsmodels.formula.api as smf
ols_formula = 'body_mass_g ~ bill_length_mm + C(sex) + C(species)'
请注意,我们在性别和物种周围添加了大写字母C和括号。这种表示法让statsmodels的OLS函数知道性别和物种是分类变量。然后,该函数将对变量进行编码。
如果你尚未导入OLS函数,请使用以下代码行导入。数据已保存为名为 ols_data 的DataFrame。你可以将公式和DataFrame输入到OLS函数中。最后,使用OLS对象的 fit 方法将模型实际拟合到数据。
model = smf.ols(formula=ols_formula, data=ols_data).fit()
解释回归结果
使用statsmodels的OLS函数的好处之一是,它为我们提供了一个相关统计量的紧凑摘要表。我们可以轻松找到每个自变量的系数、标准误差、t统计量、p值和置信区间。
这些值让我们能够快速、轻松地解释回归结果。使用 summary 函数访问OLS摘要表。
print(model.summary())
以下是摘要表中关键部分的解读:
解读系数与显著性
让我们探索“系数”列下的“male”变量。有一行标记为 C(sex)[T.male]。变量的编码方式是:雄性为1,雌性为0。这意味着基线或参考点是雌性企鹅。因此,该系数表示仅在性别上不同的两只企鹅的体重差异。
假设雄性和雌性企鹅属于同一物种且具有相同的喙长,我们预计雄性企鹅的体重大约比雌性企鹅多528.95克。p值非常小,因此该系数具有统计显著性。
现在,考虑“bill_length_mm”所在的行。假设两只企鹅性别和物种相同,如果喙长增加1毫米,我们预计喙较长的企鹅体重大约会增加35.55克。p值非常小,因此该估计值具有统计显著性。
评估模型拟合度

OLS摘要表还提供了模型评估指标,如R平方。这里的R平方是0.85,表明你的模型解释了体重中约85%的方差。这看起来是合理的,但我们稍后将在处理多元线性回归时讨论除R平方之外的其他指标的重要性。
总结与探索
现在,你已经知道如何将模型拟合到数据并获取统计摘要表,并且探索了系数和p值。表中还有很多内容,因此你可以研究本课程中尚未涉及的任何指标。我们鼓励你仔细阅读本课的阅读材料,并亲自尝试代码。所有这些统计量构成了解释结果和与利益相关者沟通的基础。
到目前为止,做得很好。我们下次再见。
024:过拟合问题 🎯

在本节课中,我们将要学习回归分析中的一个核心挑战——过拟合问题。我们将了解什么是过拟合,它为何会产生,以及如何通过调整R平方和留出样本等方法来评估和预防它,从而构建更稳健的回归模型。
到目前为止,我们已经将简单线性回归扩展到了多元回归。多元回归是一个强大的工具,因为它允许我们回答各种各样的问题。每当我们使用几个不同的自变量来估计一个连续变量时,多元回归都是一个很好的第一步。
但是,每个工具都有其局限性。当我们最初讨论简单线性回归时,我们重点关注R平方,将其作为评估线性回归的最常用指标。
回顾一下,R平方是因变量y的方差中,由自变量x(或多个x)解释的比例。这似乎是一个合理且高度可解释的指标,用于确定线性回归模型的好坏。
如果你还记得,当我们检查多元回归模型的输出时,R平方仍然是列出的指标之一。但是,当我们开始向方程中添加更多自变量时,R平方就变得复杂了。
每当你向多元回归模型添加另一个自变量时,R平方都会无一例外地增加。但并非所有添加到模型中的变量都对理解y的变化有同等贡献。这是一个问题,因为高R平方可能具有误导性。
如果我们只是为了获得高R平方而不考虑每个变量的贡献,那么模型就会变得非常特定于构建它时所使用的数据。因此,该模型不再适用于更广泛的总体。作为数据分析专业人士,我们称这种现象为过拟合。
现在,既然我们了解了过拟合,我们将重点关注如何处理它。
理解过拟合 🧩
上一节我们介绍了R平方在多元回归中的局限性,本节中我们来看看什么是过拟合。
在数据领域,过拟合是指模型过于具体地拟合了观测数据或训练数据,以至于无法为总体生成合适的估计。回归模型的结论不再适用于我们试图得出结论的总体,而仅适用于用于构建模型的数据。
过拟合往往发生在模型过于复杂或包含过多变量时。
预防过拟合的策略 🛡️
了解了过拟合的定义后,我们需要知道如何预防它。以下是两种关键的评估技术。
留出抽样
防止过拟合的原因之一是我们使用像留出抽样这样的模型评估技术。留出抽样是指我们预留一部分已有的数据,但不用于拟合模型。通过使用留出样本,我们可以观察模型在尚未接触过的数据上是否表现同样良好。
调整R平方
除了留出抽样,我们还可以使用另一个称为调整R平方的指标来评估多元回归模型。调整R平方是R平方回归评估指标的一个变体,它会惩罚不必要的解释变量。就像R平方一样,调整R平方的取值范围也是0到1。
调整R平方用于比较不同复杂度的多个模型。而R平方在解释回归模型的结果时更有用,因为你可以确定因变量的变化有多少是由模型解释的。

总结与展望 📈
本节课中,我们一起学习了过拟合问题及其对回归模型的危害。我们探讨了使用留出抽样来验证模型泛化能力,以及使用调整R平方来更合理地评估包含多个变量的模型。
现在我们已经回顾了过拟合问题以及一些更好地评估多元回归模型的方法,我们可以转向变量选择。毕竟,我们需要一种方法来确定在模型中包含和排除哪些变量。我们将在本课后续部分兴奋地探索变量选择及其他技术。
025:顶级变量选择方法 🎯

在本节课中,我们将学习如何为多元回归模型选择最合适的自变量。我们将重点介绍两种基于统计检验的逐步变量选择方法:前向选择与后向消除,并解释其背后的核心统计概念——额外平方和F检验。掌握这些方法能帮助你构建更简洁、更强大的预测模型。
模型评估与过拟合回顾
在之前的课程中,我们将过拟合定义为模型对观测数据或训练数据拟合得过于具体,以至于无法对总体生成合适估计的问题。
为了更好地评估模型质量并考虑过拟合,一种方法是使用调整后R平方。该指标会惩罚模型中不必要的变量。当我们需要比较使用不同自变量子集的多个模型时,调整后R平方最为有效。
上一节我们介绍了模型评估指标,本节中我们来看看如何系统性地选择进入模型的变量。
变量选择简介
变量选择,也称为特征选择,是确定在给定模型中应包含哪些变量或特征的过程。与本课程中讨论的许多过程一样,变量选择是迭代进行的。随着你成长为数据分析专业人士,你将培养出如何进行变量选择的更强直觉。
在本视频中,我们将介绍基于额外平方和F检验的前向选择和后向消除。这些简单的技术将使你能够继续探索多元回归的世界,并为后面将介绍的更高级技术做好准备。
前向选择 🚀
前向选择和后向消除本质上从问题的两个相反方向进行工作。我们知道,一个没有自变量的模型(零模型)可能不是最佳选择。同样,一个包含所有可能自变量的模型(全模型)也可能不是最佳选择。
前向选择是一种逐步变量选择过程。它从零模型(没有自变量)开始,并考虑所有可能添加的变量。根据所选指标和阈值,它将对模型解释力贡献最大的自变量纳入模型。该过程一次添加一个变量,直到没有更多变量可以添加到模型中。
以下是前向选择的核心步骤逻辑:
- 从零模型开始。
- 对于每个未被纳入的变量,计算将其加入模型后的统计量(如F检验的p值)。
- 选择贡献最显著(如p值最小)的变量。
- 如果该变量的显著性超过预设阈值,则将其加入模型。
- 重复步骤2-4,直到没有变量满足加入条件。
后向消除 🔙
后向消除是一种逐步变量选择过程,它从全模型(包含所有可能的自变量)开始,根据所选指标和阈值,移除对模型解释力贡献最小的自变量。该过程一次移除一个变量,直到没有更多变量可以从模型中移除。
以下是后向消除的核心步骤逻辑:
- 从包含所有候选变量的全模型开始。
- 计算模型中每个变量的统计量(如p值)。
- 找到贡献最不显著(如p值最大)的变量。
- 如果该变量的显著性低于预设阈值,则将其从模型中移除。
- 重复步骤2-4,直到所有剩余变量都满足保留条件。
额外平方和F检验 📊
前向选择和后向消除都需要一个截止点或阈值来决定何时添加或移除变量。一个常见的检验是额外平方和F检验。
该检验量化了全模型所解释的方差与简化模型(比全模型更简单的模型)未解释的方差之间的差异。公式的核心思想是评估增加或减少一个变量所带来的解释力变化是否具有统计显著性。

与其他假设检验一样,数据专业人员通常基于 P值 进行评估。如果与变量相关的P值很小(例如小于0.05),我们就有相当把握认为该变量解释了重要的方差。
我们将在本课程后面讨论假设检验和估计分类变量时,再次深入探讨F检验。
总结与展望
本节课中我们一起学习了变量选择的基础方法。我们涵盖了前向选择、后向消除以及额外平方和F检验。这为变量选择和在构建多元回归模型时做出有意识的决策提供了一个良好的开端。

接下来,我们将介绍如何使用Python执行变量选择,并继续探索控制过拟合的方法。
026:正则化-Lasso、岭回归和弹性网络回归 🎯

在本节课中,我们将要学习线性回归模型中的一个重要概念:正则化。我们将探讨模型过拟合问题、偏差-方差权衡,并介绍三种常见的正则化技术——Lasso回归、岭回归和弹性网络回归,以帮助我们构建更稳健的预测模型。
模型过拟合与偏差-方差权衡 ⚖️
上一节我们介绍了线性回归模型在影响商业决策和策略方面的多功能性。但没有任何工具是完美的。之前,我们介绍了当回归模型与训练数据拟合过于紧密,因而难以正确估计总体数据时,会出现过拟合问题。
过拟合问题与偏差-方差权衡有关,这是统计学和机器学习的核心概念。
偏差-方差权衡平衡了模型的两种特性:偏差和方差。为了最小化未观测数据的总体误差,理想的模型应具有一定偏差和一定方差。
- 偏差通过假设变量关系来简化模型预测。一个高偏差的模型可能会过度简化关系,导致对观测数据欠拟合,并产生不准确的估计。例如,给定一些数据,我们可以假设
y = 2,这就是一个高偏差模型。 - 方差允许模型具有灵活性和复杂性,使模型能够从现有数据中学习。但一个高方差的模型可能会对观测数据过拟合,并对未见数据产生不准确的估计。请注意,此处的方差不应与数据分布的方差混淆。
我们可以将偏差和方差想象成天平的两端。我们不希望偏差或方差过大。因此,作为数据专业人员,我们必须问自己:如何平衡一定的偏差和方差,以最小化误差并获得尽可能好的模型。
数据专业人员的持续学习之路 📚
谈到平衡,作为数据分析专业人员,我们必须平衡认知,即使随着经验增长,也总有更多东西需要学习。始终保持学习并避免自满至关重要,就像大家目前正在做的一样。
就个人而言,我每年至少参加两次会议,以了解行业动态并与其他数据专业人士建立联系。我也非常喜欢协作和提问,并发现通过这种方式从同事那里学到了很多。
要知道,在现阶段,大家已经拥有了非常扎实的基础,我们希望继续与大家合作,进一步扩展词汇量和工具包。
正则化回归简介 🛡️
现在,是时候学习正则化回归了。
正则化是一组回归技术,它将回归系数估计值向0收缩,通过缩小估计值来引入偏差以降低方差。正则化有助于避免模型过拟合的风险。
以下是三种常见的正则化技术:
- Lasso回归
- 岭回归
- 弹性网络回归

我们不会深入探讨这些技术的所有数学基础,但本课程和网上有很多资源可供感兴趣的同学进一步探索。
三种正则化技术详解 🔧
对于所有三种正则化回归,都会引入一些偏差以降低模型方差。
- Lasso回归:完全移除对预测目标变量
Y不重要的变量。 - 岭回归:最小化相关性较低变量的影响,但所有变量都不会从方程中剔除。如果你想包含所有变量,岭回归是一个很好的选择。
- 弹性网络回归:在处理大型数据集时,我们并不总能确定是否希望变量从模型中剔除。此时,我们可以使用弹性网络回归,一次性测试Lasso、岭回归以及两者混合回归的益处。
每种正则化回归技术都试图帮助我们更好地拟合模型,但请记住,与简单线性回归或多元回归相比,其估计参数的解读要困难得多。
总结与展望 🌟
本节课中,我们一起学习了正则化和偏差-方差权衡的基础知识。我们了解到,正则化技术通过平衡模型的偏差和方差,可以有效防止过拟合,提升模型的泛化能力。
现在大家已经了解了正则化和偏差-方差权衡的基础知识,可以继续学习如何找到最佳的回归模型。请继续保持出色的学习状态,我期待与大家继续回归分析的探索之旅。
027:总结与回顾 📊

在本节课中,我们将对多元线性回归的核心内容进行总结,并深入探讨模型评估、过拟合问题及其解决方案。我们将从简单线性回归的扩展开始,逐步过渡到多元回归的假设检验、模型解释,最后重点讨论如何通过变量选择和正则化技术来提升模型的泛化能力。
从简单到多元:回归模型的扩展 🔄
上一节我们介绍了简单线性回归的基础。本节中我们来看看如何将其扩展到多元线性回归。
简单线性回归模型描述了一个自变量 X 和一个连续型因变量 Y 之间的线性关系,其公式为:
Y = β₀ + β₁X + ε
而多元线性回归则建模了两个或更多自变量与一个因变量之间的线性关系,公式扩展为:
Y = β₀ + β₁X₁ + β₂X₂ + ... + βₙXₙ + ε
允许使用多个自变量使数据分析师能够提出更多样化的问题。
多元线性回归的模型假设 ✅
我们回顾了简单线性回归的模型假设,并将其延伸至多元回归。以下是适用于多元线性回归的模型假设:
以下是需要检验的五个核心假设:
- 线性关系:因变量与每个自变量之间存在线性关系。
- 观测独立性:各个观测值之间相互独立。
- 残差正态性:模型的残差近似服从正态分布。
- 同方差性:残差的方差在所有预测值水平上保持恒定。
- 无多重共线性:自变量之间不应存在高度相关性。
我们展示了如何使用数学方法、Python内置函数或探索性数据分析中的可视化方法来检验这些假设。其中,多重共线性是多元回归特有的重要假设,需要特别关注。
在Python中实现与解读多元回归 🐍
我们随后提供了一些在Python中编写多元回归代码的示例。编码多元回归与简单线性回归有相似之处,但也存在一些关键差异。
接下来,我们将重点放在如何解读和评估多元回归的结果上。由于现在涉及多个自变量,理解计算机输出对于提供准确、细致的分析叙事至关重要。
作为模型解释和评估的一部分,我们回顾了过拟合问题及其应对方法。

理解与应对过拟合问题 ⚖️
当模型与训练数据集或观测数据匹配得过于紧密,以至于无法预测未见数据或推广到总体时,就会发生过拟合。
为了对抗过拟合,我们讨论了两种变量选择技术:
以下是两种基于统计检验的变量选择方法:
- 前向选择:从一个空模型开始,逐步添加最显著的变量。
- 后向消除:从包含所有变量的模型开始,逐步移除最不显著的变量。
这两种方法都使用额外平方和F检验来决定是否添加或移除一个变量。
正则化:控制模型复杂度 🛡️
在总结变量选择之后,我们概述了正则化技术,它有助于防止过拟合。要理解正则化,需要先定义偏差-方差权衡,这是许多数据科学和机器学习模型决策的核心。
- 具有高偏差的模型可能欠拟合数据,使模型过于简化。
- 具有高方差的模型可能过拟合数据,使模型过于复杂。
我们介绍了三种正则化技术:
以下是三种通过增加偏差来减少方差的常用正则化方法:
- Lasso回归:在损失函数中添加回归系数绝对值之和作为惩罚项。
- 岭回归:在损失函数中添加回归系数平方和作为惩罚项。
- 弹性网络回归:结合了Lasso和岭回归的惩罚项。
在处理大型数据集时,正则化尤其有用,因为预先确定哪些变量重要或不重要可能很困难。
课程总结 🎯
本节课中我们一起学习了多元线性回归的完整流程。我们从简单线性回归的扩展出发,深入探讨了多元回归的模型假设、Python实现、结果解读与评估。我们重点分析了过拟合这一关键挑战,并学习了通过变量选择(如前向选择、后向消除)和正则化技术(如Lasso、岭回归、弹性网络)来提升模型泛化能力的方法。理解偏差-方差权衡是掌握这些模型优化技术的核心。
到目前为止,我们涵盖了许多概念。所有我们一起学习的内容都可供您随时复习。祝您好运,我们下次课再见。😊
028:28_04_01_欢迎来到模块4


📊 课程概述
在本节课中,我们将学习如何扩展数据分析工具包,以处理分类变量。我们将重点介绍假设检验,特别是卡方检验,并预览方差分析等高级方法,从而能够探索更广泛的数据关系问题。
🔄 从回归分析到分类变量分析
上一节我们介绍了用于分析连续变量的线性和多元回归模型。这些工具能帮助我们探索诸如数字视频广告和平面广告如何共同影响产品销量等问题。
本节中,我们将开始更多地关注分类变量,通过引入更多假设检验方法来扩展我们的分析工具。这使我们能够提出并解答不同类型的问题。
以下是我们可以开始探索的新问题类型:
- 三个或更多组别之间的差异是否具有统计显著性?
- 观测数据的分布是否与我们的预期不同?
🧪 假设检验的核心作用
假设检验是一种统计程序,它使用样本数据来评估关于总体参数的假设。你通过检验关于总体的假设,来判断是否存在显著差异。
例如,在进行网站用户研究时,你可以使用假设检验来确定,使用不同网站布局的几个组别之间的用户参与度是否存在差异。你可以测试这样的假设:更改订阅按钮的颜色或图片的位置,可能会改变用户在网站上花费的时间。
🧰 组合使用分析工具
你可以利用数据工具箱中的不同模型和检验来回答各种问题。你也可以将一些技术结合使用。
例如,有时你可能希望将回归模型与假设检验或一系列假设检验结合起来使用。数据分析的核心原则适用于每一种技术:我们都希望探索并更好地理解不同变量之间的关系,并利用所学知识讲述关于数据的引人入胜的故事。
📈 选择合适的方法
根据我们拥有的数据类型,我们可以确定哪种检验或模型最合适。但有时,在确定回答问题的最佳方法之前,我们必须使用多种检验和模型。
🎯 本节重点:卡方检验
在本视频中,我们将从卡方分布和卡方检验开始。卡方是希腊字母表中的第22个字母,看起来很像英文中花体的大写X。我们的讨论将建立在之前关于T检验和假设检验的学习基础上。
卡方检验将帮助我们确定两个分类变量是否相互关联,以及一个分类变量是否遵循预期的分布。
例如,如果我们多次抛掷一枚两面硬币,我们预期大约有一半的次数某一面朝上,另一半的次数另一面朝上。
🔮 后续内容预览
接下来,我们将研究方差分析(ANOVA)及其变体:协方差分析(ANCOVA)、多变量方差分析(MANOVA)和多变量协方差分析(MANCOVA)。
通过重点分析分类数据来剖析变量关系,我们将能够扩展可有效使用的数据类型,从而为行业中的各种决策、策略和实践得出结论。


📝 本节总结


本节课中,我们一起学习了如何将分析重点从连续变量回归扩展到分类变量假设检验。我们回顾了假设检验的核心概念,介绍了卡方检验的用途,并预览了后续将学习的方差分析系列方法。这为我们使用更丰富的数据类型来支持决策奠定了基础。
029:卡方假设检验 🧮

在本节课中,我们将学习两种用于分析分类数据的假设检验方法:卡方拟合优度检验和卡方独立性检验。我们将了解它们如何帮助我们比较观测数据与期望数据,并判断变量之间是否存在关联。
从T检验到卡方检验 🔄
上一节我们介绍了单尾和双尾T检验形式的假设检验。T检验帮助我们判断两个不同群体的均值是否存在显著差异。
本节中,我们将探讨如何判断我们的数据是否符合预期。我们将引入两种假设检验:卡方拟合优度检验和卡方独立性检验。这些检验将帮助我们比较期望数据和观测数据。
与T检验类似,在定义卡方检验时,我们也会重温零假设和备择假设的概念。
为何需要卡方检验? 🤔
在使用线性回归时,我们主要关注连续变量。但如果我们的变量不是连续的呢?卡方检验可以处理涉及分类变量的问题。
例如,假设你在一个电影院工作,该影院销售小、中、大和超大份的爆米花。你有一份关于每种尺寸预期销售量的预测或图表。
仅凭观察,很难确定预期销量在统计上是否与观测销量相同。但你可以运行卡方拟合优度检验来回答这个问题。
卡方拟合优度检验 📊
卡方拟合优度检验用于确定一个观测到的分类变量是否遵循预期的分布。
作为前述电影院的数据从业者,你正在处理爆米花销售问题。一名员工声称,在任何一天,每种尺寸的订单都占25%。
现在,你可以根据某一天购买爆米花的人数创建一个计数表。假设昨天有100人购买了爆米花。那么你可以将百分比乘以总数,计算出表格中每个单元格的期望计数。
100的25%是25。因此,你预期有25人购买了每种尺寸的爆米花。
对于卡方拟合优度检验,零假设陈述为:在任何一天,每种尺寸的爆米花都有25人购买。基本上,零假设表明变量遵循预期分布。
如果我们接受零假设,那么我们可以说观测到的爆米花销售分布与员工声称的一致。
备择假设陈述为:变量不遵循预期分布。基本上,观测数据的分布与我们预期的分布存在显著差异。这意味着在任何一天,购买每种尺寸爆米花的人数不同。
在这种情况下,卡方统计量等于观测值减去期望值的平方,再除以期望值后的总和。
公式:
χ² = Σ [ (观测值 - 期望值)² / 期望值 ]
一旦你收集了关于爆米花销售的观测数据,就可以使用卡方统计量来计算P值,并在给定的置信水平下判断是否可以拒绝零假设。
卡方独立性检验 🔗
下一个检验称为卡方独立性检验,有时也称为同质性检验。卡方独立性检验用于确定两个分类变量是否相互关联。
例如,假设你想知道天气是否与爆米花销量有关。也许下雨时,人们更可能购买黄油爆米花。
为了陈述假设,你首先需要确定爆米花案例中的变量。第一个变量可以是是否下雨。第二个变量可以是购买爆米花的人数是否超过100人,或者是否少于或等于100人。
现在我们准备好陈述假设了。
独立性检验中的零假设是:变量是独立的,彼此没有关联。备择假设是:变量不是独立的,彼此有关联。
对于卡方检验,构建一个2x2的计数表以查看每个类别下有多少观测值非常重要。
假设我们拥有夏季和秋季爆米花销售的数据。共收集了275天的数据,包括83个下雨天和192个非下雨天。在135天里,超过100人购买了爆米花;在140天里,少于100人购买了爆米花。
然后,你可以用每个类别的天数计数来填充表格中的每个单元格。
接着,你可以使用以下公式计算2x2表格中每个单元格的期望值。
公式:
期望值(第i行, 第j列) = (第i行总计 × 第j列总计) / 表格总计数
这个公式源于独立性的定义:如果两个事件是独立的,那么它们同时发生的概率 P(A 且 B) 等于 P(A) × P(B)。
观测值就是第i行第j列单元格的计数。
然后,你可以使用与拟合优度检验相同的公式来计算卡方统计量。

与拟合优度检验一样,你可以使用卡方统计量来计算P值,并判断这两个分类变量是否独立。
总结 📝
本节课中,我们一起学习了两种重要的卡方假设检验。
- 卡方拟合优度检验:用于判断单个分类变量的观测分布是否符合某个预期分布。
- 卡方独立性检验:用于判断两个分类变量之间是否存在关联。
我们了解了如何根据问题建立零假设和备择假设,并介绍了计算卡方统计量的核心公式。这些检验将数据分析的能力从连续变量扩展到了分类变量,是数据分析师工具包中的重要组成部分。

在接下来的阅读材料中,我们将更深入地介绍卡方检验的一些假设条件以及如何执行这些检验。关键是将你已学过的假设检验概念与这些卡方检验联系起来。很快,你将能回答更多关于分类变量的问题。
030:方差分析介绍 📊

在本节课中,我们将要学习方差分析。这是一种用于检验三个或更多组之间均值差异的统计方法。我们将了解其基本概念、类型以及如何构建假设。
充分了解我们的数据有助于我们确定能用数据做什么。它帮助我们理解可以运行哪些检验、不能运行哪些检验,以及如果我们对数据进行一些转换后可能可以运行哪些检验。
在之前的视频中,我们展示了连续变量和分类变量之间的区别。到目前为止,本课程的大部分内容都在讨论线性回归,它可以估计我们感兴趣的连续变量。但现实中存在大量的分类数据。此前,我们已经学习了卡方拟合优度检验和独立性检验。这两种检验都用于检查分类变量之间的关系。
现在,我们将重点介绍方差分析,它有助于检验分类变量与连续变量之间的关系。
什么是方差分析?🔍
方差分析通常被称为 ANOVA,是一组用于检验三个或更多组之间均值差异的统计技术。
如果这听起来很熟悉,你可能会想起 T 检验,这是一种常见的统计检验。方差分析是 T 检验的扩展。T 检验检验两组之间的均值差异,而方差分析可以检验多个组之间的均值。
假设你在一个植物园工作,你想知道不同种类的蝴蝶是否有不同的寿命。方差分析测试在这种情况下可以提供帮助。
方差分析的类型 📝
方差分析主要有两种类型:单因素方差分析和双因素方差分析。
单因素方差分析
单因素方差分析比较一个连续因变量在三个或更多组中的均值,我们将使用一个分类变量来代表这些分组。
以下是使用方差分析时的步骤:
- 建立假设:我们有一个原假设和一个备择假设。
- 设定场景:假设你正在测量三种不同蝴蝶物种的寿命:帝王蝶、晨衣蝶和燕尾蝶。
- 提出原假设:你的同事认为,无论蝴蝶种类如何,寿命可能都是相同的。由于原假设是寿命相等,因此单因素方差分析是合适的。这意味着帝王蝶的寿命等于晨衣蝶的寿命,也等于燕尾蝶的寿命。
我们可以将原假设 H₀ 写作:μ_帝王蝶 = μ_晨衣蝶 = μ_燕尾蝶。
概括来说,当原假设声明每个组的均值相等时,我们可以使用单因素方差分析。
备择假设则是:这三种蝴蝶物种的寿命并不完全相同。用数学符号表达这一点有些困难,因此你可以在原假设前直接写上“并非”,即:并非 μ_帝王蝶 = μ_晨衣蝶 = μ_燕尾蝶。
只要有一个平均寿命不同,就足以拒绝原假设。我们将备择假设表示为 H₁。
双因素方差分析
单因素方差分析是一个很好的工具,但有时你可能会遇到这样的情况:有两个因素与连续因变量相关联。
在植物园的例子中,假设你想研究蝴蝶的寿命是否与蝴蝶的种类和蝴蝶的体型有关。想象一下,蝴蝶可以分为小、中、大三种体型。
现在,数据根据两个因素变化:种类和体型。双因素方差分析测试基于两个分类变量,比较一个连续因变量的均值。
以下是双因素方差分析中需要同时检验的三组假设:

- 第一组假设:关注物种与寿命之间的关系。原假设声明三种蝴蝶物种之间的寿命没有差异。备择假设声明三种蝴蝶物种之间的寿命存在差异。
- 第二组假设:关注我们的第二个新分类变量——体型。原假设是基于蝴蝶体型,寿命没有差异。备择假设是基于蝴蝶体型,寿命存在差异。
- 第三组假设:检验两个变量之间的交互作用。这个概念可能在我们进行多元回归时就很熟悉了。原假设声明物种对寿命的影响独立于蝴蝶体型的影响,反之亦然。备择假设声明蝴蝶体型和物种对寿命存在交互影响。
总结与过渡 🎯
在本节中,我们一起学习了方差分析的基本概念及其两种主要类型:单因素和双因素方差分析。我们还学习了如何为蝴蝶场景中的每种检验陈述原假设和备择假设。
回归分析让你理解自变量如何影响因变量。方差分析则允许你聚焦于其中的一些关系,通过以成对的方式解析关系来讲述一个完整的故事。
做得很好。在下一个视频中,我们将学习计算机和 Python 如何帮助我们运行方差分析检验。
031:简化复杂数据关系》📊

在本节课中,我们将学习如何使用Python进行单因素与双因素方差分析检验。我们将通过一个钻石价格的数据集,探索不同变量(如颜色、切工)如何影响价格,并理解方差分析与回归分析在讲述数据故事时的不同作用。
概述:回归分析与方差分析的核心
我们所有回归分析和统计的核心是讲述数据故事。我们希望理解不同变量之间的关系。
虽然回归分析和方差分析可以帮助回答相似的问题,但在特定情况下,其中一种方法可能更有用。回归分析有助于全面了解多个不同变量是否以及如何影响一个结果变量。另一方面,方差分析有助于解构这些变量子集之间的成对比较,以更好地理解推动回归分析的各元素之间的细微差别。
方差分析就像一个放大镜,可以聚焦于回归故事的特定部分。
使用Python探索单因素方差分析
现在,让我们使用一个关于钻石的数据集子集来在Python中探索方差分析。您可以通过Seaborn库加载原始数据集。我们已经清理了数据并转换了一些变量。我们有两个变量:钻石价格的对数和每个钻石的颜色等级。
以下是加载和初步探索数据的步骤:
- 使用pandas加载CSV文件。
import pandas as pd df = pd.read_csv('diamonds_cleaned.csv') - 加载数据集后,检查数据。导入seaborn包并绘制箱线图,以确定价格如何随颜色等级变化。
数据集中有几种不同的颜色等级:D、E、F、H和I。价格的对数似乎存在一些差异,但尚不清楚是否基于颜色等级存在显著差异。import seaborn as sns sns.boxplot(x='color', y='log_price', data=df)
因此,让我们使用单因素方差分析进行检验。您将使用StatsModels模块。
首先,使用OLS函数创建一个回归模型,然后使用fit方法将模型拟合到数据。这将允许您使用Anova函数来查看组间价格是否存在统计学上的显著差异。
请注意:在OLS公式中,必须在color周围添加大写字母C和括号,以指示color是一个分类变量。
import statsmodels.api as sm
from statsmodels.formula.api import ols
# 拟合模型
model = ols('log_price ~ C(color)', data=df).fit()
基于模型结果,您可以观察到钻石颜色和价格之间存在统计学上的显著关系,但尚不清楚不同颜色之间的价格是否存在差异。为了了解更多信息,您可以运行单因素方差分析检验。
您可以使用statsmodels的anova_lm函数创建方差分析表。该表将为您提供关于颜色变量的统计信息。
回想一下,单因素方差分析检验基于一个连续因变量,比较一个分类自变量的三个或更多组。
让我们陈述零假设和备择假设:
- 零假设:基于颜色等级的钻石价格没有差异。
- 备择假设:基于颜色等级的钻石价格存在差异。
请注意:方差分析有不同类型(1型、2型和3型),您可以在文档中阅读相关内容。
from statsmodels.stats.anova import anova_lm
anova_table = anova_lm(model, typ=2)
print(anova_table)
方差分析表为您提供了颜色变量及其残差的平方和与自由度,以及颜色变量的F统计量和P值。
从结果来看,P值非常小,这意味着您可以拒绝“所有钻石颜色等级的价格均值相同”的零假设。
探索双因素方差分析
现在,让我们在分析中添加另一个分类变量:钻石的切工。数据中包含三种切工类型:理想、优质和非常好。
您可以加载已经清理好的数据。您将执行与之前相同的操作,首先拟合一个回归模型,但方程将处理切工和颜色之间可能的交互效应。
冒号表示颜色和切工这两个分类变量之间的交互作用。
# 加载包含切工的数据
df_with_cut = pd.read_csv('diamonds_with_cut.csv')
# 拟合包含交互项的双因素模型
model_two_way = ols('log_price ~ C(color) + C(cut) + C(color):C(cut)', data=df_with_cut).fit()
在运行双因素方差分析检验之前,让我们回顾一下将要检验的三对假设:
- 第一对是关于基于颜色的钻石价格的零假设和备择假设。
- 第二对是关于基于切工的钻石价格的假设。
- 最后一对是关于颜色和切工对钻石价格的交互作用的假设。
现在,使用相同的anova_lm函数获取双因素方差分析检验的结果。
anova_table_two_way = anova_lm(model_two_way, typ=2)
print(anova_table_two_way)
该表包含两行,分别对应两个分类变量,以及一行对应切工和颜色之间的交互作用。
由于所有三者的P值都非常小,因此您可以拒绝所有三个零假设。
总结与结论 🎯

在本节课中,我们一起学习了单因素和双因素方差分析的差异、零假设与备择假设,以及如何在Python中编写代码并解释结果。
总结如下:
- 价格的对数对于不同的颜色并不相同。
- 价格的对数对于不同的钻石切工也不相同。
- 最后,颜色和切工之间存在影响钻石价格的交互效应。
到目前为止,我们已经涵盖了很多内容。在接下来的视频和阅读材料中,我们将继续探索方差分析检验的强大功能。
032:使用Python进行方差分析事后检验 🧪

在本节课中,我们将要学习如何在进行方差分析后,进一步使用事后检验来确定具体是哪些组之间存在显著差异。我们将重点介绍Tukey HSD检验,并使用Python代码来实现它。
概述
上一节我们介绍了方差分析,它可以帮助我们判断一个分类变量是否对一个连续变量有显著影响。然而,ANOVA的结果只能告诉我们“至少有一组是不同的”,但无法指明具体是哪几组不同。本节中,我们来看看如何使用事后检验来解决这个问题。
为什么需要事后检验?
当我们对三个或更多组进行比较时,ANOVA的零假设(H₀)是:所有组的均值都相等。如果结果显著,我们只能拒绝这个零假设,得知并非所有均值都相等。
公式表示零假设:
H₀: μ₁ = μ₂ = ... = μₖ
但在实际应用中,我们往往需要知道具体是哪些组之间存在差异。例如,在比较多种建筑材料的强度时,工程师需要确切知道材料A是否强于材料B。
直接进行多次两两t检验会带来一个问题:多重比较谬误。每进行一次检验,都有一个小概率(如5%)犯第一类错误(错误地拒绝真实的零假设)。检验次数越多,至少犯一次错误的总体概率就会迅速增加。
事后检验(如Tukey HSD)在一次性比较所有组对的同时,会控制这个整体错误率。
实施Tukey HSD检验
以下是使用Python进行Tukey HSD检验的步骤。我们继续使用钻石数据集,探究颜色对价格的影响。
首先,确保你已经导入了必要的包并加载了数据。
# 假设已从之前课程导入包和数据
# diamonds = pd.read_csv(...)
# 创建线性模型
import statsmodels.api as sm
from statsmodels.formula.api import ols
model = ols('price ~ C(color)', data=diamonds).fit()
步骤一:执行单因素方差分析
在进行事后检验前,必须先确认ANOVA结果是显著的。
# 执行ANOVA
anova_table = sm.stats.anova_lm(model, typ=2)
print(anova_table)
如果输出的P值(PR(>F))远小于0.05,则结果显著,可以拒绝“所有颜色等级钻石均价相同”的零假设。
步骤二:导入并运行Tukey HSD检验
接下来,我们从statsmodels模块中导入函数并进行事后检验。
# 导入Tukey HSD函数
from statsmodels.stats.multicomp import pairwise_tukeyhsd
# 运行Tukey HSD检验
tukey_results = pairwise_tukeyhsd(endog=diamonds['price'], # 连续变量(因变量)
groups=diamonds['color'], # 分类变量(组别)
alpha=0.05) # 显著性水平
参数说明:
endog: 需要比较的连续变量(本例中是价格)。groups: 定义组别的分类变量(本例中是颜色)。alpha: 显著性水平,通常设为0.05,对应95%的置信度。
步骤三:解读结果
你可以通过两种方式查看检验结果。
方法一:使用摘要函数
print(tukey_results.summary())
方法二:直接打印结果(更直观的表格)
print(tukey_results)
输出结果将包含所有颜色等级之间的两两比较。以下是需要关注的核心列:
group1&group2: 正在比较的两个组。meandiff: 两组均值的差值。p-adj: 调整后的P值。这是控制了多重比较后的P值,是我们做判断的依据。lower&upper: 均值差值的95%置信区间。reject: 最重要的列。如果显示True,则可以在0.05的显著性水平上拒绝零假设,认为这两组的均值存在显著差异。如果显示False,则不能拒绝零假设,认为两组均值无显著差异。
结果解读示例:
假设比较H级和I级钻石,reject列为True,且p-adj为0.001。这意味着我们可以拒绝“H级和I级钻石价格相同”的零假设,结论是这两种颜色等级的钻石价格存在统计上的显著差异。

总结
本节课中我们一起学习了方差分析的事后检验。我们了解到,当ANOVA结果显示显著时,可以进一步使用像Tukey HSD这样的检验方法来精确找出具体是哪些组对之间存在差异。这种方法通过控制整体错误率,解决了多重比较带来的问题。我们使用Python代码完整演示了从ANOVA到Tukey HSD检验的流程,并学会了如何解读输出结果中的调整后P值和拒绝决策列。
掌握这些组合工具,能让你更深入、更准确地分析分类变量对结果的影响。
033:职业发展各阶段的发现 🧭

在本节课中,我们将跟随经济学家伊格纳西奥的分享,了解数据分析师在职业生涯不同阶段的学习与成长路径。我们将探讨如何持续学习新技能,以及如何将所学应用于实际工作,从而推动职业发展。
个人背景与职业轨迹
我的名字是伊格纳西奥,我是首席经济学家团队的一名高级经济学家。我出生在阿根廷。出生在阿根廷的一个中产阶级家庭意味着,在我成长的关键岁月里,我经历了所有你能想象到的经济危机。这可能让我对经济学产生了兴趣,有些人称经济学为“最初的数据科学”。我开始在公共政策领域工作,试图帮助卫生和教育领域的决策者利用数据来为他们必须做出的艰难决策提供信息。
在从事了五年公共政策工作后,我转入了科技行业,开始在谷歌工作。在这里,我使用同样的工具包来为商业决策提供信息。

持续学习的重要性
如果你要进入这个领域,职业发展将是你生活中始终存在的一部分。
当我完成博士学位时,我认为自己已经掌握了工具包,可以去回答任何问题了。但事实并非如此。在我开始第一份政策研究工作后不久,我记得一位资深的统计学家来找我,他说我做的工作很棒,但如果使用一些不同的工具,效果会好得多。我很快意识到,有些东西是我可以在工作中学习,但在研究生院没有学到的,这些知识能帮助我把工作做得更好。
我做出了投资自己的决定。这基本上意味着,在周末我会早起,观看别人推荐给我的YouTube讲座,或者阅读别人推荐的书。一旦我学会了我想学的东西,我记得当时和我的老板说:我们刚刚为客户做了这件事,但现在我想用不同的方式再做一次。我也想展示给他们看,看看他们的想法如何。
到我离开上一份工作时,我100%的工作都在使用我在工作期间学会的新工具包。我预计,五年后我将要使用的工具,很可能几乎全是我现在还没学过的东西。
给学习者的建议
所以,你可能即将完成你的高级数据分析认证,并且正在问自己接下来该做什么。我的猜测是,你是一个自我驱动的人,可以自学。如今做到这一点相当容易,因为资源可以在网上免费获取。
以下是你可以利用的资源和方法:
- 你可以在家参加虚拟会议。
- 你可以在YouTube上观看讲座。
- 你可以关注经济学领域的推特,了解方法论上的最新创新,这些可能有助于你解决当天正在处理的商业问题。
一旦你开始进入这个世界,你就可以深入探索,学习越来越多的知识。
总结

本节课中,我们一起学习了数据分析师职业发展的核心:持续学习。从伊格纳西奥的经历中我们看到,学术教育只是起点,真正的专业成长来自于在工作中主动学习新工具和方法。利用丰富的在线资源,保持好奇心并深入探索,是适应快速变化的领域、保持职业竞争力的关键。请记住,你今天掌握的工具可能在未来被更新、更好的工具所取代,因此,将学习视为一项终身事业至关重要。
034:协方差分析 📊

在本节课中,我们将要学习一种名为“协方差分析”的统计方法。它可以帮助我们在控制其他变量影响的前提下,更准确地比较不同组别之间的差异。
从方差分析到协方差分析
上一节我们介绍了方差分析,它用于比较不同分组下连续型因变量的均值差异。然而,现实中的数据关系往往更复杂。
本节中我们来看看协方差分析。这是一种统计技术,用于在控制一个或多个协变量影响的同时,检验三个或更多组别之间的均值差异。
协变量是指那些并非我们直接研究兴趣所在,但可能对结果变量产生影响的其他变量。通过控制协变量,我们可以更清晰地分离出我们感兴趣的分类自变量与连续型因变量之间的关系,从而得出更准确的结论。
为何使用协方差分析?🤔
你可能会问,既然我们已经有了线性回归分析,为何还需要协方差分析?两者确实有许多相似之处。
例如,两者都允许包含连续型和分类型的自变量,都关注一个连续型的因变量,并且都致力于理解变量间的关系。
但它们的使用场景取决于我们最想理解哪个变量:
- 在协方差分析中,我们并不聚焦于协变量本身,而是通过纳入协变量来更清晰地理解分类自变量的效应。
- 在回归分析中,我们可能对所有自变量都感兴趣,或者专注于利用模型对未知数据进行预测。
协方差分析实例:书店销售
让我们通过一个例子来具体理解协方差分析能帮助我们回答什么问题。
假设你在一家书店工作,想研究图书体裁与销量之间的关系。新书往往因为作者宣传而获得更多关注,因此出版年份可能是一个干扰因素。
以下是该分析中的关键要素:
- 分类自变量:图书体裁
- 协变量:书籍自出版以来的年数
- 连续型因变量:过去一个月的图书销量
在进行任何假设检验前,明确假设至关重要:
- 零假设:在控制出版年份后,所有体裁的图书销量均值相等。
- 备择假设:在控制出版年份后,并非所有体裁的图书销量均值都相等。
运行检验后(例如使用Python),我们主要关注P值。通常,如果P值小于0.05,我们就有足够的证据拒绝零假设,即认为在控制协变量后,不同体裁的销量存在显著差异。
总结与回顾
本节课中我们一起学习了协方差分析。我们了解到,它是方差分析的扩展,通过控制协变量来更精确地评估分类变量对结果的影响,避免得出有偏差的结论。
我们已经涵盖了单因素方差分析、双因素方差分析、协方差分析以及各种线性回归模型。这些都是数据分析专业人员需要掌握的重要概念。请记住,你无需死记硬背所有公式和细节。关键在于理解其核心思想与应用场景。在实际项目中,你可以随时回顾课程、搜索资料或请教他人来解决问题。


祝你学习顺利!继续探索有趣的问题,并用数据讲述引人入胜的故事吧!🚀
035:MANOVA与MANCOVA 🧮

在本节课中,我们将学习如何将分析模型从单一因变量扩展到多个因变量。我们将介绍多元方差分析(MANOVA)和多元协方差分析(MANCOVA),了解它们与之前学过的ANOVA和ANCOVA的关系,并探索其应用场景。
回顾你的数据分析学习之旅,你已经从最基本的模型和检验出发,逐步构建并扩展了它们,使其能够包含更多变量和不同类型的数据。在探索各种模型的过程中,你遇到了可以回答的不同问题以及每种模型的不同用例。
上一节我们介绍了从ANOVA到ANCOVA的转变,这类似于将简单线性回归扩展到多元回归。我们通过添加更多自变量来帮助分离每个X变量对Y变量的影响。本节中,我们将添加更多因变量,以便进行全新且不同类型的比较分析。
我们将要介绍的两种检验是MANOVA和MANCOVA。从名称上你可能已经猜到它们与ANOVA和ANCOVA的关系。
MANOVA:多元方差分析 📊
MANOVA,即多元方差分析,是ANOVA的扩展。它用于比较两个或多个连续结果变量如何根据分类自变量的不同而变化。与ANOVA类似,MANOVA最常见的两种形式涉及一个或两个分类自变量,分别被称为单因素和双因素MANOVA。
以下是使用MANOVA的关键前提:
- 自变量必须是分类变量。
- 结果变量必须是连续变量。
由于我们仍在处理假设检验,因此需要一些假设来进行检验。让我们回到书店的例子,生成并检验关于影响图书销售因素的新假设。
假设我们有一个分类变量:图书类型。两个连续的因变量可以是:每月售出的图书数量和图书销售的利润。
如果我们进行的是单因素MANOVA检验,那么:
- 零假设(H0)是:对于每一种图书类型,两个连续变量的均值都相等。即,每种图书类型的月销量相同,且每种图书类型的销售利润也相同。
- 备择假设(H1)是:对于每一种图书类型,两个连续变量的均值并不都相等。这表明,在我们所考察的结果变量中,至少有一个变量在不同图书类型间存在差异。
例如,自助类书籍的利润可能与科幻类书籍的利润不同,或者每月售出的图像小说数量可能与历史小说不同。无论哪种情况,你都可以拒绝零假设。
MANOVA允许我们将每个数据点视为具有多个特征(即我们想要理解的连续Y变量),这些特征基于我们关心的一组或两组分类(即一个或两个分类X变量)。
MANCOVA:多元协方差分析 🎯
然而,如果我们只对一个分类变量感兴趣,但希望控制另一个变量的影响,我们可以使用MANCOVA。
MANCOVA,即多元协方差分析,是ANCOVA和MANOVA的扩展。它在控制一个或多个协变量的同时,比较两个或多个连续结果变量如何根据分类自变量的不同而变化。
假设你仍然关心图书类型是否与销量和利润有关,但你想控制作者知名度的影响。那么你可以使用MANCOVA。
以下是MANCOVA的变量设置:
- 分类X变量仍然是:图书类型。
- 但现在你增加了一个协变量:作者在各大社交媒体平台上的粉丝数量(这是你正在控制的变量)。
- 两个Y结果变量保持不变:每月售出的图书数量和月利润。
在这种情况下:
- 零假设(H0)是:在控制作者社交媒体粉丝数的情况下,所有图书类型的销量和月利润均相等。
- 备择假设(H1)是:在控制作者社交媒体粉丝数的情况下,所有图书类型的销量和月利润并不都相等。
总结与展望 🚀

本节课中,我们一起学习了如何通过引入多个因变量来扩展我们的分析工具。我们探讨了MANOVA和MANCOVA,理解了它们作为ANOVA/ANCOVA的多元版本,在同时分析多个连续结果变量时的应用。
随着你继续扩展你的数据分析工具包,你会遇到更多相互构建的检验、工具和模型。作为一名数据专业人士,识别这些方法之间的关联及其适用场景至关重要。期待你继续检验各种假设,探索数据的奥秘。
036:分类变量分析总结 📊

在本节课中,我们将总结关于分类变量分析的一系列方法。我们回顾了如何利用不同的统计工具探索分类变量,从而从数据中揭示更丰富的信息。
到目前为止,我们所涵盖的内容让我们能够以多种方式探索分类变量。我们充分利用了与分类变量相关的各种工具。我们将能够在数据中讲述更多样化的故事。毕竟,我们是科学家。有时我们需要尝试多种检验,才能弄清数据所蕴含的故事。
从理解单个分类变量开始,我们研究了卡方拟合优度检验。该检验用于确定一个变量是否符合理论分布。
接着,独立性检验帮助我们判断两个分类变量是否相互独立。
在超越卡方分布后,我们发现了方差分析。方差分析构成了本节所涵盖的所有其他检验的基础。
单因素方差分析是一种强大的方法,用于确定您感兴趣的组别之间,在一个连续结果变量上是否存在差异。其核心思想是比较组间方差与组内方差。
双因素方差分析让您能获得类似的洞察,同时还能纳入另一组分组因素。
协方差分析在方差分析的基础上,允许我们控制另一个变量,从而将分组效应与协变量的影响分离开来。
多元协方差分析则在方差分析和协方差分析的基础上,允许对多个感兴趣的结果变量进行检验。

与任何假设检验一样,所有这些检验都有原假设和备择假设。陈述这些假设有助于阐明您希望通过运行这些检验学到什么。
我鼓励您继续使用假设检验来处理各种场景。您提出的问题越多,数据揭示的信息就越多。请记住每种检验的数据要求,并且始终存在出错的空间。通过练习和时间,您很快就能讲述令人印象深刻的故事。
下次课程再见。
037:37_05_01_欢迎来到模块5


📚 课程概述
在本节课中,我们将学习逻辑回归分析。我们将探讨如何使用逻辑回归来建模事件发生的概率,并理解其与线性回归的区别。课程将涵盖逻辑回归的基本概念、适用场景以及分析流程。
很高兴再次与大家相聚。当我们学习线性回归时,我们开始思考回归分析能帮助我们回答的各种问题。例如,我们可以考虑影响企鹅体重的因素,或者影响网站点击率的因素。
现在,我们将扩展所能提出的问题类型。本次课程将重点放在建模事件发生的概率上。
有许多问题值得我们探索。例如,哪些因素会影响客户再次从公司购买产品的几率?什么会影响员工获得高绩效评级的可能性?什么因素促使用户对视频发表评论或不发表评论?

逻辑回归可以在这些情况下帮助我们。

🔍 逻辑回归核心概念
上一节我们回顾了回归分析的应用范围,本节中我们来看看逻辑回归的具体定义。
请记住,逻辑回归是一种基于一个或多个自变量 X 来建模分类因变量 Y 的技术。因变量可以有两个或更多可能的离散值。
我们将主要关注二项逻辑回归。它基于一个或多个自变量,对观测值落入两个类别之一的概率进行建模。我们使用一个二元变量 Y 来指示类别。
例如,假设你是一名为篮球队工作的数据专业人员,你想了解球队中任何一名球员在一场比赛中得分超过10分的概率。
你可能需要考虑许多变量。例如,该球员上赛季表现如何?他们的平均上场时间是多少?他们本赛季得了多少分?
这看起来可能像一个多元线性回归问题,但请考虑结果变量:球员在一场篮球比赛中得分是否会超过10分。这是一个二元结果变量。
由于只有两种可能的结果,我们无法像线性回归那样绘制最佳拟合线。
例如,如果你绘制上场时间与球员得分是否超过10分的关系图,你的数据看起来会是两条水平线:一条在 y = 0 处,一条在 y = 1 处。这与你在先前场景中观察到的线性关系非常不同。
在后续课程中,我们将更深入地学习二项逻辑回归,并回顾回归分析的阶段和步骤。
我们将通过尽可能理解模型假设来分析数据,并确保我们有一个二元结果变量。我们将构建模型并使用几种不同的指标对其进行评估。然后,我们将执行分析并与利益相关者和其他团队成员分享结果。

🚀 课程启动
逻辑回归是一个多功能且强大的模型,我很高兴能与大家一起探讨。让我们开始吧。


📝 本节总结

本节课中,我们一起学习了逻辑回归的引入和基本概念。我们明确了逻辑回归适用于对二元或多元分类结果进行概率建模的场景,并指出了其与线性回归在处理分类变量时的根本区别。下一节我们将开始深入逻辑回归模型的具体构建与评估方法。
038:为数据寻找最佳逻辑回归模型 📈

在本节课中,我们将要学习二项逻辑回归模型的核心假设,并了解如何为给定数据集寻找最佳的模型参数。我们将重点讨论线性关系、观测独立性、多重共线性以及异常值处理等关键概念,并介绍最大似然估计这一核心方法。
逻辑回归的基本假设
上一节我们介绍了逻辑回归是一种用于建模二元结果概率的方法。本节中,我们来看看为了确保模型结果可靠,数据需要满足哪些主要假设。这些假设有些与线性回归相似,有些则不同。
以下是逻辑回归的四个核心假设:
- 线性关系假设:每个自变量
x与因变量y发生概率的 Logit 值之间存在线性关系。 - 观测独立性假设:数据中的各个观测值之间是相互独立的。
- 无多重共线性假设:模型中的多个自变量之间不应存在高度相关性。
- 无极端异常值假设:数据中不应包含对模型有过度影响的极端异常值。
深入理解线性关系与Logit
第一个也是最重要的假设是线性关系假设。要理解它,我们必须先定义几个核心概念。


几率 是指某个事件发生的概率与不发生的概率之比。其公式为:
几率 = P / (1 - P)
其中 P 是事件发生的概率。
Logit函数,或称 对数几率,是几率的自然对数。其公式为:
logit(P) = ln( P / (1 - P) )
Logit函数是将自变量 x 与事件发生概率 P 线性连接起来的最常用“链接函数”。
因此,线性关系假设具体指的是:每个自变量 x 与 logit(P) 之间存在线性关系。我们可以将此关系表达为一个线性方程:
logit(P) = β₀ + β₁*x₁ + β₂*x₂ + ... + βₙ*xₙ
其中,β 是模型需要估计的系数,n 是自变量的数量。
寻找最佳模型:最大似然估计
与线性回归类似,我们并非随意选择一组系数 β,而是要找到能最好地拟合数据的那一组。在逻辑回归中,我们通常使用 最大似然估计 来寻找最佳模型。
最大似然估计 是一种估计参数 β 的技术,其目标是找到能使模型 生成当前观测数据的可能性最大化 的那组参数。我们可以将“似然”理解为:在给定一组特定参数 β 的条件下,观测到实际数据的概率。
这里用到了第二个假设——观测独立性。由于观测值相互独立,观测到整个数据集的联合概率就等于每个数据点概率的乘积。因此,我们可以计算所有样本数据的整体似然值。
最佳的逻辑回归模型,就是能最大化这个整体似然值的、带有特定 β 系数集的模型。
其他重要假设
在理解了最大似然估计的工作原理后,我们再来看看另外两个假设。
无多重共线性:如果我们模型中包含多个自变量,它们之间不应高度相关。这与线性回归的要求一致。
无极端异常值:异常值在回归建模中是一个复杂的话题,通常可以在模型拟合后进行检测。有时可以通过转换或调整变量来维持模型有效性,有时则可能需要移除异常数据。

总结

本节课中,我们一起学习了二项逻辑回归的主要假设,包括自变量与Logit值的线性关系、观测独立性、无多重共线性和无极端异常值。我们还深入探讨了如何通过 最大似然估计 方法来拟合出最佳的模型参数。下一节,我们将探索如何在Python中使用真实数据来构建和评估一个逻辑回归模型。
039:使用Python构建逻辑回归模型 🐍

在本节课中,我们将学习如何使用Python的scikit-learn库构建一个逻辑回归模型。我们将通过一个关于老年人运动检测的实际数据集示例,一步步完成数据准备、模型构建和初步可视化。
概述
上一节我们回顾了逻辑回归的理论基础。本节我们将进入构建阶段,动手使用Python实现一个二项逻辑回归模型。我们将使用一个包含老年人垂直方向加速度和是否躺下状态的数据集,目标是构建一个模型,根据加速度来预测人是否处于躺下状态。
数据准备与探索
首先,我们需要加载并了解我们将要使用的数据。数据集已被加载到一个名为activity的DataFrame中。
以下是了解数据基本统计信息的方法:
activity.describe()
执行上述代码会显示数据集中每个变量的统计信息,包括行数、均值、标准差、最小值、最大值以及各分位数值。当前数据集包含494行数据。
接下来,我们可以查看数据的前几行以了解其结构:
activity.head()
数据集中包含两个变量:
- 第一个变量测量垂直方向的加速度。
- 第二个变量是一个指示变量,标记一个人是否躺下。
我们的目标是使用逻辑回归,根据垂直加速度来预测人是否躺下。
分割数据集
为了遵循良好的数据实践,我们需要将数据分割为训练集和测试集(或称保留集)。测试集将用于后续评估模型性能。
首先,导入必要的函数:
from sklearn.model_selection import train_test_split
from sklearn.linear_model import LogisticRegression
接着,将DataFrame分割为特征变量(X)和目标变量(y)。在本例中,我们只使用一个特征变量:垂直加速度。
X = activity[['AC(vertical)']] # 特征
y = activity['lying_down'] # 目标
现在,使用train_test_split方法分割数据:
X_train, X_test, y_train, y_test = train_test_split(X, y, random_state=42)
我们设定了random_state参数以确保结果可复现。如果使用不同的随机状态,得到的数据分割结果会有所不同。
构建逻辑回归模型
数据准备就绪后,我们可以开始构建逻辑回归模型。
创建一个逻辑回归分类器实例,通常将其变量名命名为clf(classifier的缩写):
clf = LogisticRegression()
接下来,使用训练数据来拟合(训练)这个模型:
clf.fit(X_train, y_train)
模型训练完成后,我们可以查看其参数估计值,即回归系数(β1)和截距(β0):
coefficient = clf.coef_
intercept = clf.intercept_
对于当前模型,系数β1的估计值约为-0.118,截距β0的估计值约为6.102。
可视化模型结果
为了更直观地理解模型,我们可以将逻辑回归曲线可视化。这里我们使用seaborn绘图库。
首先,确保已导入seaborn(通常别名为sns):
import seaborn as sns
然后,使用regplot函数绘制逻辑回归曲线:
sns.regplot(x='AC(vertical)', y='lying_down', data=activity, logistic=True)
在函数调用中,我们需要指定:
x参数:特征变量所在的列,即‘AC(vertical)’。y参数:目标变量所在的列。data参数:数据来源。logistic=True参数:声明绘制逻辑回归曲线。
生成的图表将显示一条清晰的S形曲线。曲线周围的阴影区域表示置信带。图中数据点会形成两条水平线:一条对应目标变量为1(躺下)的情况,另一条对应目标变量为0(未躺下)的情况。
总结与下节预告
本节课中,我们一起完成了使用Python构建逻辑回归模型的实践。我们指导计算机根据垂直加速度数据,找到了预测某人是否躺下的最佳似然估计方法。我们还初步学习了如何解读模型参数(系数和截距),并成功将模型结果可视化。

在接下来的课程中,我们将探讨多种评估模型质量的方法,并学习如何围绕数据讲述一个有意义的故事。
040:评估二项逻辑回归模型 📊

在本节课中,我们将学习如何评估一个二项逻辑回归模型的质量。我们将重点介绍混淆矩阵,这是一种直观展示模型分类准确性的工具,并学习如何在Python中生成和解读它。
你已经构建了你的第一个二项逻辑回归模型,并能够计算参数估计值和绘制回归曲线。在本视频中,我们将利用Python生成的指标和图表来评估你的模型实际表现如何。
回顾一下,你正在处理测量加速度以及人员是否躺下的活动数据。你之前已将数据保存为训练集和保留集,并将逻辑回归模型保存为变量 clf。
生成预测结果
现在,将保留数据集输入到模型的 predict 方法中,以获取模型预测的标签。将这些预测保存为一个名为 y_pred 的变量。
请注意,机器学习模型预测的是一个观测值属于0类或1类的概率。而 scikit-learn 中的 predict 函数实际上会为每个观测值分配一个0或1的标签。该函数的工作原理是假设阈值为 0.5。因此,如果模型预测的概率值 >= 0.5,predict 函数会将该观测值标记为1。如果预测值 < 0.5,则标记为0。
另一方面,predict_proba 函数允许你查看为每个数据点预测的具体概率值。
理解混淆矩阵
现在你有了每个观测值是0或1的预测,可以创建一个混淆矩阵,它能快速概述你的模型对保留数据集中每个数据点的分类效果。
混淆矩阵是一种图形化表示,展示了分类器在预测分类变量标签时的准确性。它显示了分类器为每个类别准确分类的数据点数量,网格中的其他方格则传达了被错误分类的数据点数量。
接下来,我们将构建你自己的混淆矩阵,并一起回顾图的每个部分。
在Python中构建混淆矩阵
使用 scikit-learn 的 metrics 模块来创建混淆矩阵。为了绘制混淆矩阵,你可以使用 metrics 模块中的两个方法:confusion_matrix 和 ConfusionMatrixDisplay。
首先,使用 confusion_matrix 生成矩阵的值,并将输出保存为变量 cm。
from sklearn.metrics import confusion_matrix, ConfusionMatrixDisplay
cm = confusion_matrix(y_true, y_pred)
然后,使用 ConfusionMatrixDisplay 方法将图形保存为变量 disp。
disp = ConfusionMatrixDisplay(confusion_matrix=cm, display_labels=[0, 1])
最后,通过绘制混淆矩阵显示函数的输出来展示混淆矩阵。
disp.plot()
解读混淆矩阵
从左上角到右下角的对角线显示了分类器为每个类别准确分类的数据点数量。网格中的其他方格则显示了被错误分类的数据点数量。
在混淆矩阵的坐标轴上,有标签指示数据点的类别为0或1。
- 0 表示在该观测中,人员被标记为“未躺下”。数据专业人士将标记为0的数据点称为负例。
- 1 表示在该观测中,人员被标记为“躺下”。标记为1的数据点称为正例。
以下是混淆矩阵中各个部分的详细说明:
- 左上角(True Negatives, 真阴性):分类器预测为“未躺下”(0),且实际也“未躺下”的观测数量。
- 右下角(True Positives, 真阳性):分类器预测为“躺下”(1),且实际也“躺下”的观测数量。
现在,让我们看看模型预测错误的地方:
- 右上角(False Positives, 假阳性):分类器预测人员“躺下”,但实际“未躺下”的观测数量。
- 左下角(False Negatives, 假阴性):分类器预测人员“未躺下”,但实际“躺下”的观测数量。

在一个优秀的模型中,我们应该观察到高比例的真阳性和真阴性,以及低比例的假阳性和假阴性。

课程总结
在本节课中,我们一起学习了如何评估二项逻辑回归模型。我们重点介绍了混淆矩阵这一强大工具,它可以帮助你更深入地解读和讲述逻辑回归模型的故事。通过混淆矩阵,我们可以清晰地量化模型的分类性能,识别出模型在哪些情况下容易出错。
在接下来的视频中,我们将讨论更多评估逻辑回归模型质量的方法。


041:评估逻辑回归结果的关键指标 📊

在本节课中,我们将学习如何评估逻辑回归模型的性能。我们将介绍几个关键的评估指标,它们能帮助我们量化模型预测的准确性,并理解模型在不同方面的表现。
上一节我们介绍了混淆矩阵,它能直观地展示和量化逻辑回归模型的预测结果。本节中,我们来看看如何用几个具体的指标来总结混淆矩阵中的信息。
核心评估指标
我们将讨论三个核心指标:精确率、召回率和准确率。您可以通过Scikit-Learn库的metrics模块来使用计算这些指标的函数。我们将继续使用活动数据的例子进行分析。
精确率
精确率衡量的是模型预测为正例的样本中,真正为正例的比例。
其计算公式为:
精确率 = 真阳性 / (真阳性 + 假阳性)
在我们的例子中,精确率告诉我们,在所有被模型预测为“躺下”的人中,实际有多少人真的在“躺下”。Scikit-Learn的metrics库提供了一个便捷的函数来为我们计算。
以下是使用代码计算精确率的示例:
from sklearn.metrics import precision_score
precision = precision_score(y_true, y_pred)
我们向函数输入测试集中的真实y值,以及模型根据测试集X值预测出的y值。精确率的范围是0到1,得分0.97表示模型性能非常出色。
召回率
召回率衡量的是模型在所有实际为正例的样本中,能正确识别出的比例。
其计算公式为:
召回率 = 真阳性 / (真阳性 + 假阴性)
请记住,假阴性是指那些实际为“躺下”但模型未能检测出来的情况。因此,召回率衡量的是,在所有实际“躺下”的人中,模型正确识别出的比例。
我们使用与计算精确率相同的数据,但调用Scikit-Learn的recall_score函数:
from sklearn.metrics import recall_score
recall = recall_score(y_true, y_pred)
我们得到的召回率约为0.98。由于召回率范围也是0到1,这个模型的表现相当好。
准确率
准确率衡量的是所有数据点中被正确分类的比例。
其计算公式为:
准确率 = (真阳性 + 真阴性) / 预测总数
在我们的活动例子中,准确率将衡量模型正确识别出“躺下”和“未躺下”的人的比例。我们可以使用Scikit-Learn的accuracy_score函数:
from sklearn.metrics import accuracy_score
accuracy = accuracy_score(y_true, y_pred)
在这个案例中,我们的模型获得了0.97的准确率得分。但请注意,大多数时候,精确率、召回率和准确率不会都这么高,这是正常现象。
其他评估技术:ROC曲线与AUC
除了上述指标,在处理分类器时,还有两种常见且有用的评估技术:ROC曲线和AUC(曲线下面积)。这些概念与分类阈值、真阳性率和假阳性率相关。
虽然我们通常使用0.5作为阈值来生成预测,但有时阈值需要根据具体场景来确定。请注意,当我们降低阈值时,真阳性率会上升(因为我们预测更多的观测值为正例),但假阳性率也会随之增加。模型的真阳性率和假阳性率在每个阈值下都会变化。
对于一个理想的模型,会存在一个阈值,使得真阳性率很高而假阳性率很低。我们可以使用ROC曲线和AUC来检查在每个阈值下,真阳性率和假阳性率是如何一起变化的。

数据专业人士在比较不同分类模型时可能会使用ROC曲线和AUC,我们将在本课程的后续部分深入探讨它们。
本节课中我们一起学习了评估逻辑回归模型的几个关键指标:精确率、召回率和准确率,并简要了解了ROC曲线与AUC的概念。这些概念彼此相似且相互关联,不要期望在第一次学习时就掌握所有细节。请给自己一些额外的时间和练习,以理解如何最好地应用这些测量工具,来支撑你用数据讲述的故事。

接下来,我们将开始构建可以用逻辑回归来分享的各种数据分析故事。
042:解释逻辑回归结果 📊

在本节课中,我们将学习如何解释逻辑回归模型的结果。我们将重点理解模型系数的含义,探讨如何将其转化为可解释的指标,并讨论在不同应用场景下应如何选择合适的评估指标。
解释逻辑回归系数
上一节我们讨论了如何将逻辑回归应用于数据。我们已经通过理解模型假设、确保结果为二元变量、构建模型并创建评估指标分析了数据。现在,我们可以开始执行并分享结果。
与线性回归类似,逻辑回归也有系数。这些系数是通过最大似然估计技术找到的、能最佳拟合数据的值,但其解释略有不同。
让我们通过一个例子来回顾逻辑回归中“Logit”的作用。简单回顾一下,我们想了解垂直加速度的变化如何与一个人是否躺下相关联。我们现在的重点是方程中 beta 系数的含义。
在这种情况下,垂直加速度每增加一个单位,与 P 的对数几率(log odds)增加 beta 1 个单位相关联。
公式: log(odds) = beta0 + beta1 * x
但是,如果我们将对数几率进行指数化,就可以确定垂直加速度变化时,几率变化的百分比。
公式: E^(beta1) 表示垂直加速度每增加一个单位,p 的几率将增加或减少的倍数。
我们从输出中得知系数是 -0.118,现在我们可以将其指数化。
计算: E^(-0.118) = 0.89
我们可以说,垂直加速度每增加一个单位,我们预计一个人躺下的几率会降低 11%。这是合理的,因为如果一个人在垂直方向上移动得更快,他很可能不是躺着的。
鉴于我们已经找到了预测一个人是否躺下的强有力指标,我们可以考虑更大的应用场景。例如,对运动进行分类有助于检测跌倒或疑似受伤。我们的强预测指标可以成为为老年人提供护理的更大故事中的一部分。
不同场景下的系数解释
接下来,让我们看看在不同场景下解释会如何变化。
我们尝试一个系数为正数的例子。假设系数是 0.25。
然后我们进行指数化计算:E^(0.25) ≈ 1.28(四舍五入到十分位)。
那么我们可以说,对于 x 每增加一个单位,我们预计 y 为 1 的几率会增加 28%。
现在,假设模型中还有其他因素,例如其他方向的加速度。当逻辑回归模型中有多个自变量时,就像在线性回归模型中一样,我们必须在保持其他变量不变的情况下报告系数。
因此,我们可以说:对于 x 每增加一个单位,在保持其他变量不变的情况下,我们预计 y 为 1 的几率会增加 28%。
报告统计显著性
除了系数之外,陈述 P 值和置信区间总是有帮助的,这可以提供关于结果偶然发生的可能性的额外信息。
PsyCitLear 没有内置的方法来获取 P 值或置信区间,但 statsmodels 有。这是一个很好的例子,说明了不同的工具和包可以提供不同类型的信息。
作为数据从业者,你必须根据你的优先级来选择工具。
选择与呈现模型评估指标
在呈现结果时,包含混淆矩阵以及关于精确率、召回率、准确率和/或 ROC/AUC 的一些统计数据会很有帮助。然而,根据具体情况,你可能希望包含所有指标,或者只关注其中的一个子集。
考虑到某些行业或组织可能根据其管理建模过程的方式而有偏好的指标。作为一名数据分析专业人士,在开始时与你的团队核实这一点非常重要。
以下是不同评估指标的侧重点:
- 精确率:衡量被模型标记为阳性的样本中,真正是阳性的比例。它关注的是预测结果的质量。
- 召回率:衡量所有实际为阳性的样本中,被模型正确识别出来的比例。它关注的是模型的检出能力。
- 准确率:衡量所有预测中正确的比例。
以检测垃圾短信为例。垃圾短信是发送给许多收件人的未经请求的消息。你收到的短信中只有一小部分可能是垃圾短信。
如果你的目标是准确分类垃圾短信,以免泄露私人信息或点击恶意链接,那么你真正关注的只是你检测垃圾短信的能力。事实上,在这种情况下,准确率并不是一个好指标。
假设只有 3% 的短信是垃圾短信,这意味着 97% 是你想从朋友、家人或服务提供商那里收到的短信。
所以,如果一个模型预测 100% 的消息都不是垃圾邮件,那么该模型的准确率将达到 97%,这看起来很棒。
但在此背景下,它并没有那么好,因为该模型根本没有检测到任何垃圾邮件,尽管实际上有 3% 的消息是垃圾邮件。
在垃圾邮件的情况下,召回率可能是一个更有意义的指标。召回率会告诉我们模型实际能够检测到的垃圾邮件的比例。
另一方面,精确率会告诉我们被标记为垃圾邮件的数据点中,实际是垃圾邮件的比例。精确率本质上衡量的是我们垃圾邮件标签的质量。
你还可以探索其他指标,例如 AIC 和 BIC,它们可以帮助在考虑模型复杂性的同时确定模型的优劣。

总结与展望
本节课中,我们一起学习了如何解释逻辑回归的结果。我们理解了如何解释系数及其指数化后的几率比,探讨了在多元回归中“保持其他变量不变”的条件,并强调了根据具体业务场景(如垃圾邮件检测)选择合适的评估指标(如召回率与精确率)的重要性。
与本课程涵盖的许多主题一样,我们回顾了许多概念,现在理解了与数据领域工作相关的术语。数据工作是动态的,没有一种放之四海而皆准的解决方案。数据专业人员不断学习并思考更好的方法。我们必须始终将数据、问题和可用解决方案置于具体情境中。
接下来,我们将重点比较你到目前为止学到的一些模型和测试。我们下一课见。
043:简化复杂数据关系》📊

课程概述
在本节课中,我们将学习如何根据具体的数据分析问题,选择合适的统计模型或检验方法。我们将回顾线性回归、假设检验和逻辑回归等核心工具,并通过三个不同行业的实际案例,演示如何运用PACE框架来指导分析决策。
模型回顾与问题匹配 🔍
上一节我们介绍了二项逻辑回归及其适用场景。本节中,我们来看看如何将已学的多种分析技术,与工作中遇到的实际问题相匹配。
截至目前,你已经学习了以下核心方法:
- 线性回归模型
- 假设检验(特别是卡方检验和方差分析)
- 逻辑回归
同时,你也使用了PACE框架(计划、分析、构建、执行)来指导工作流程。你从“计划”阶段开始,理解需要优先处理的需求,并根据被提出的问题以及可获取的数据,决定哪种模型或检验最为合适。
案例一:音乐流媒体分析 🎵
想象你是一家录音工作室的数据分析师。在一次团队会议中,大家讨论每首歌曲的播放次数。提出的问题包括:
- 哪些因素会影响音乐的流媒体播放量?
- 每个因素对播放量的影响程度有多大?
由于“音乐流媒体播放量”是结果变量,且它是一个连续变量,你可以考虑使用线性回归或假设检验。但因为问题明确询问“每个因素的影响程度”,线性回归是回答此问题的更好模型。
记住,线性回归允许通过系数和R平方值进行直观解释,从而说明哪些因素影响结果变量以及影响的程度。
公式: y = β₀ + β₁x₁ + β₂x₂ + ... + ε
但你需要确保模型假设得到满足,以增强结论和见解的有效性。
案例二:咖啡馆销售分析 ☕️
假设你为一家咖啡馆工作。他们正在品尝来自不同国家的咖啡豆,并想弄清楚哪种咖啡豆更畅销。团队已经对豆子的销售情况做了一些预测,但他们好奇咖啡豆的销售是否独立于糕点销售。咖啡豆的原产国是一个已知的区分因素,而糕点销售更像是一个协变量。
在这种情况下,虽然结果变量“销售额”仍然是连续的,但问题的焦点在于比较不同组别(例如不同种类的咖啡豆、不同的原产国)。因此,你应该更侧重于假设检验,这是进行A/B测试的好方法。
零假设:咖啡馆售出的每种咖啡豆类型的袋数大致相同。
备择假设:咖啡馆售出的每种咖啡豆类型的袋数并不相同。
通过进行一系列检验,你可以根据特定的P值接受或拒绝零假设,从而帮助理解模型对趋势的解释程度。团队将能更好地了解应该订购哪种咖啡豆,以便在咖啡馆卖出更多咖啡。
案例三:社交媒体内容预测 📱
考虑最后一个例子,你在一个社交媒体公司工作,有兴趣探索为什么有些帖子会走红而有些不会。你确定了一个问题:我如何预测一个帖子是否会走红?
由于结果变量是二元的(帖子要么走红,要么不走红),二项逻辑回归可能是你首先考虑的模型。
确定逻辑回归是否合适的最佳方法是构建并评估模型。幸运的是,你可以使用许多评估指标,包括:
- P值
- 混淆矩阵
- 精确率
- 召回率
- 准确率
- ROC曲线下面积
- AIC和BIC
选择最佳指标将取决于具体情况。在解释逻辑回归模型的系数时,请记住要将其取指数。
代码示例(Python逻辑回归系数取指数):
import numpy as np
# 假设 model.coef_ 是逻辑回归模型的系数
odds_ratios = np.exp(model.coef_)
回忆一下,在分享结果时,逻辑回归系数以百分比形式报告,说明某个因素增加或减少结果发生可能性的程度。

总结与展望 🚀
本节课中,我们一起学习了如何作为一名数据分析师,针对不同业务场景下的具体问题,选择合适的分析模型。我们通过录音室、咖啡馆和社交媒体公司的案例,实践了如何运用线性回归回答影响程度问题,使用假设检验进行组间比较,以及采用逻辑回归处理二元分类预测。

记住,通过专注于每种模型的核心优势,你将能够在实践中找到运用这些工具的方法。未来面对复杂的数据关系时,这种问题驱动的模型选择思路将帮助你更高效、更准确地获得洞察。
044:简化复杂数据关系》课程总结 🎯

在本节课中,我们将回顾并总结整个课程的核心内容,特别是关于二项逻辑回归的知识点。我们将梳理从基础概念到实际应用的关键步骤,帮助你巩固所学。
课程回顾 📚
我们已经到达了课程的终点。祝贺你。
你应该为自己所学到的知识以及未来作为数据分析专业人士所能应用的能力感到自豪。
在结束之前,让我们回顾一下你所学到的内容。
二项逻辑回归的定义与核心概念 🔍
上一节我们介绍了回归分析的整体框架,本节中我们来看看二项逻辑回归的具体定义。
我们将二项逻辑回归定义为基础的数据技术,用于模拟一个或两个结果发生的概率。
在学习二项逻辑回归时,我们重点关注了Logit函数的重要性。
它既是逻辑回归的一个假设,也关系到如何解释结果。
其核心公式可以表示为:
logit(p) = ln(p / (1 - p))
其中 p 代表事件发生的概率。
模型构建与参数估计 ⚙️
在理解了基础概念后,接下来我们探讨如何构建模型并估计参数。
你学习了最大似然估计,这是一种常用的技术,用于估计最佳参数,以最大化观察到的、用于构建逻辑回归模型的数据的可能性。
然后,你学习了如何使用 Scikit-learn 库在 Python 中构建逻辑回归模型。
以下是一个简单的代码示例:
from sklearn.linear_model import LogisticRegression
model = LogisticRegression()
model.fit(X_train, y_train)
模型评估与指标解读 📊
构建模型后,评估其性能至关重要。以下是常用的评估方法。
你考虑了一些评估指标,包括混淆矩阵、精确率、召回率和准确率。
Scikit-learn 提供了许多便捷的函数来帮助你评估和解释逻辑回归模型。
但有时你可能需要其他 Python 库或包。例如,在学习线性回归、卡方检验和方差分析时使用过的 Statsmodels 库可能会很有帮助。
像回归模型这样的 Python 包各有其优缺点。
你作为数据专业人士的持续经验将帮助你为每种情况选择最合适的工具。
结果解释与场景应用 💡
最后,我们来看看如何解释模型结果并将其应用于实际问题。
你还学习了如何解释逻辑回归的系数,以及根据你试图回答的问题选择指标和图表时应考虑哪些因素。

最后,你回顾了示例场景,以弄清楚为什么某些模型或测试在每种情况下可能是最合适的。
总结与展望 🌟
在本节课中,我们一起学习了二项逻辑回归从理论定义、模型构建、参数估计、评估验证到结果解释的全过程。你掌握了Logit函数、最大似然估计等核心概念,并学会了使用Python工具进行实践。
到目前为止,你工作非常努力。请珍视你所学到的一切,并思考在整个学习旅程中提出和回答的许多问题。

你已经走上了正轨,请继续保持良好的工作状态。
045:简化复杂数据关系》📊

概述
在本节课中,我们将学习如何将课程所学应用于实际项目,特别是如何利用回归分析技能完成一个作品集项目,以展示给潜在雇主。
大家好,我是Tiffany。很高兴再次与大家见面。
我将与大家进一步探讨作品集构思,以及如何在求职中运用它。
完成本课程的项目是向潜在雇主展示你在数据相关任务方面的知识和经验的绝佳方式。
本次项目将展示你在回归分析方面的学习成果。
我们准备开始。正如你在先前的课程中所学到的,每个作品集项目都提供了一个机会,让你完成能够展示课程所学内容的任务,并创建可以添加到作品集的作品。
在完成这个作品集项目的同时,你也将锻炼你的面试技能。
在求职面试时,我建议你讨论适用于数据专业工作的具体经验。
你也可以在这些场合利用这个作品集项目来展示和解释你的可迁移技能。
此外,一些雇主可能会要求你评估一个需要多元线性回归模型的业务场景。
本项目旨在帮助你练习这些技能。
为了完成项目,你将获得一个商业案例的详细信息。
请按照说明,在你的PACE策略文档中完成一个新条目,并创建一个经过方差分析(ANOVA)测试的多元线性回归模型。
你还将使用你的PACE策略文档,继续记录你处理数据项目的方法和考量。
请记住,如果你想复习任何材料,可以随时回顾本课程中的其他视频和资源。
我们开始吧。
总结
本节课中,我们一起学习了如何将回归分析知识转化为一个具体的作品集项目。我们了解了该项目在求职面试中的价值,并明确了完成项目所需的步骤,包括使用PACE策略文档和构建多元线性回归模型。
046:分享模型和建模技术的策略

概述
在本节课中,我们将学习如何有效地向他人(特别是面试官)展示你的数据模型和建模经验。课程将分享如何清晰、简洁地介绍你的工作,以及如何通过个人项目来展示你的热情与技能。
主讲人介绍
我是Leah,一名数据架构师。我的工作是为数据科学家和数据分析师构建数据模型,帮助他们从数据中获得洞察。
我的背景非常规。我并非来自计算机科学领域。我曾在法国学习社会学和哲学,之后回到美国,获得了一份知识工程师的工作。这份工作让我真正进入了知识工程领域。
面试中如何展示数据模型
上一节我们介绍了主讲人的背景,本节中我们来看看在求职面试中展示数据模型的关键策略。
在面试时,谈论你曾参与构建的数据模型并以简洁的方式向面试官解释你的工作,这一点非常重要。
当你介绍自己的数据建模经验时,可以从以下几个方面展开:
以下是你可以谈论的三个核心方面:
- 解决的问题:阐述你通过模型旨在解决的具体业务或分析问题。
- 使用的技术:说明你采用了哪些建模技术和工具(例如,线性回归模型
y = β₀ + β₁x₁ + ... + βₙxₙ + ε)。 - 如何向利益相关者传达结果:解释你如何将复杂的模型结果转化为易于理解的洞察,并传达给非技术背景的利益相关者。这是一个至关重要的步骤。
构建你的作品集
仅仅谈论经验还不够,拥有可视化的成果更能证明你的能力。接下来,我们探讨如何构建一个吸引人的作品集。
你可以将本课程中完成的项目成果,以及其他你真正充满热情的事物结合起来,着手创建一个网站、一个Jupyter Notebook、一个GitHub页面或类似的东西,并分享其链接。这非常重要。
当我在数据分析领域进行面试时,我非常乐于看到候选人拥有个人网站、GitHub链接、证书等。这些能向我展示,即使在工作之外,他们也致力于其他项目,并且对此充满热情,乐于分享。
我可以访问他们的网站,看到一个展示精良的项目。他们会在高层次上解释所涉及的概念或要解决的问题,然后逐步深入细节。
找到你的热情所在
一个成功的作品集往往源于真正的兴趣。本节将讨论如何围绕你的热情构建项目。
找到一个你喜欢的特定领域、某个你感兴趣的数据集或你偏爱的数据类型,并专注于它。我注意到,我对自己的兴趣项目会感到非常兴奋,并且愿意投入更多精力。这帮助我真正推进项目并使其充满趣味,因为我本身对此就充满热情。

总结

本节课中,我们一起学习了如何有效地展示数据建模技能。关键点包括:在面试中结构化地介绍你的模型(问题、技术、传达),积极构建在线作品集(如网站、GitHub)来展示你的项目,以及围绕个人热情领域深耕,这能让你的工作和展示更具感染力和深度。记住,清晰的表达和可见的成果是证明你能力的最佳方式。
047:简化复杂数据关系》📊

课程概述
在本节课中,我们将介绍课程5的期末作品集项目。你将了解到该项目的目的、结构,以及如何运用你在本课程中学到的回归分析技能来完成它。
项目背景与目标
在之前的课程中,你学习了回归模型,包括它们的工作原理、如何在Python中构建它们以及如何解释结果。同时,你也练习了用于分析和解读数据的统计技能。
你所学到的一切都将帮助你完成这个新的作品集项目。
为了完成此项目,你将面对一个商业场景和一个数据集。该项目的核心目标是运用多元线性回归来解决一个独特的商业挑战。
你的项目策略文档将指导你完成项目,并鼓励你像数据专家一样思考。
数据专家的角色
正如你在本课程和其他课程中学到的,数据专家通过发现并解释数据中变量之间的关系来解决问题。
他们基于这些关系讲述故事,从而让利益相关者能够据此调整其商业策略。
作为一名数据专家,你的工作具有深远的影响,并能塑造组织做出明智决策的方式。
项目价值与技能展示
作品集的这一部分是展示你技术技能的绝佳机会。
以下是你可以通过本项目展示的核心能力:
- 解决复杂问题的能力:应用回归模型应对实际商业挑战。
- 有效沟通解决方案的能力:清晰地向利益相关者解释你的发现和建议。
请记住,这些技能的培养需要时间。你完成的作品集项目越多,你就越能为应对未来求职面试中的难题以及数据专家角色中的挑战做好准备。
课程总结

本节课中,我们一起学习了课程5期末作品集项目的概况。我们回顾了回归分析的核心应用,明确了项目的商业场景与目标(即使用多元线性回归),并探讨了完成该项目如何帮助你展示作为数据专家所需的关键技能。现在,你可以开始运用所学知识,着手解决这个实际的数据问题了。
048:期末项目总结与持续职业成功建议 📊


在本节课中,我们将回顾你在课程项目中的进展与成就,并为你未来的数据职业生涯提供准备建议。
再次问候。我回来查看你目前的进展。
你已经完成了许多工作。除了构建和分析A/B测试、整理有序数据集以及创作数据可视化图表。
你还构建了一个多元线性回归模型。
花点时间反思我们每个作品集项目,这创造了一个真正认可你迄今为止所学、所练和所获成就的机会。
这些项目共同为你开始探索数据职业领域、应对未来面试做准备。你的项目策略文档包含了供你参考的关于流程、考量和完成作品集中这些成果的步骤的笔记。
这些都是你在面试期间与潜在雇主和招聘经理讨论时需要的内容。
到目前为止,你认识到了理解线性回归假设的重要性。你练习了评估模型,并且学会了认识到在运用回归模型时解释自身流程的重要性。
当你开始准备面试时,你需要思考可能会被问到的问题,例如:我们对线性回归有哪些假设?如果存在异常值,我们应该怎么做?我们如何确定异常值是否为有影响力的点?


你如何检查多重共线性?如果存在多重共线性,应该怎么做?当然,在你的面试中还会有其他问题需要你回答。
你甚至可能会遇到这样的情况:潜在雇主和招聘经理要求你描述,在几乎没有领域知识的情况下,你将如何着手一个项目。
这个作品集项目要求你评估一个独特的商业场景。作为回应,你构建了一个包含方差分析(Anova)测试的多元线性回归模型。
除了展示你的建模技能,你还在专业报告中展示了有效沟通发现的能力,其中包括数据可视化、模型的评估与解读以及关键的商业洞察。
接下来,你将全面学习机器学习模型。然后你将有机会通过构建自己的模型来解决问题。
你在整合作品集方面做得非常出色。
课程总结
本节课中我们一起回顾了课程项目成果,总结了在构建多元线性回归模型过程中掌握的技能,并为即将到来的数据职业面试提供了实用的准备建议。核心收获包括:理解并应用线性回归的统计假设、掌握模型评估与解释的方法,以及学会如何通过作品集有效展示你的分析能力和商业洞察力。
049:简化复杂数据关系》课程总结 🎯

在本节课中,我们将对《回归分析:简化复杂数据关系》这门课程的核心内容进行回顾与总结。我们将梳理从数据分析框架到多种回归模型的关键知识点,并展望后续的学习路径。
课程内容回顾 📚
恭喜你完成这门课程的学习。这是一项了不起的成就。
希望你花一点时间来庆祝,并回顾在整个课程乃至整个项目中学习和完成的所有内容。
从PACE框架到基础模型
你首先应用了PACE框架——计划、分析、构建和执行——来建模变量之间的关系,并学习了两个基础模型:线性回归和逻辑回归。
上一节我们介绍了数据分析的起点,本节中我们来看看你是如何深入实践这些模型的。
简单线性回归的实践
接着,你学习了如何检验假设,以及如何使用实例来构建、评估和解释一个简单线性回归模型。
以下是你在该阶段掌握的核心技能:
- 使用Python对真实数据进行建模练习。
- 应用简单线性回归的核心概念。
扩展到多元线性回归
你将简单线性回归的理解扩展到了多元线性回归。
随着变量增多,模型的解释变得更为复杂,需要考虑的因素也增加了。然而,你能够提出和解答的问题范围也随之大大扩展。
分类变量与假设检验
接下来,你将焦点转向了涉及分类变量的假设检验。
你学习了t检验、卡方检验和方差分析。这使你能够探究不同组别之间的差异。
二项逻辑回归

最后,你学习了二项逻辑回归,该模型专注于某一特定结果发生的概率。
技能总结与展望 🚀
希望你为自己写下的每一行代码、提出的每一个问题感到自豪。能够谈论并应用我们所涵盖的概念,无论你在哪个行业工作,或是在数据分析职业生涯中担任何种角色,都将使你受益。
你现在拥有了一个更庞大的技能组合,其中包括回归模型、评估指标和假设检验。
在后续的项目学习中,你将能够运用统计学和回归建模来建立联系。
在下一门课程中,你将向谷歌同事Susila学习机器学习概览。你将探索监督式和非监督式机器学习。你将学习许多新颖有趣的技术,并解决大数据问题。
我非常感激能陪伴你完成这段回归分析的学习之旅。希望你对自身的数据专业知识更有信心,并已准备好持续提升你的技能。
你已经准备好,作为一名数据分析专业人士,迈向职业生涯的下一步。

本节课中我们一起学习了:从应用PACE框架和掌握线性与逻辑回归基础开始,到构建、评估回归模型,进行假设检验,最终建立起一个包含回归模型、评估指标和假设检验的完整数据分析技能体系。这门课程为你后续深入机器学习领域奠定了坚实的统计与建模基础。

浙公网安备 33010602011771号