摘要:
读完这本书回过头才发现, 第一篇笔记居然是 2012年8月发的, 将近一年半的时间才看完这本书(汗!!!).为了方便以后查看, 做个《Linux内核设计与实现》读书笔记 的目录:《Linux内核设计与实现》读书笔记(一)-内核简介《Linux内核设计与实现》读书笔记(二)- 内核开发的准备《Linu... 阅读全文
posted @ 2014-01-11 09:56
wang_yb
阅读(34227)
评论(12)
推荐(24)
刚入行数据科学,面对成堆的数据和模型,往往最先卡在“算个平均值都要翻文档”这一步。 别急,Python 标准库 statistics 模块 就能帮你搞定 80% 的日常统计需求。 本文挑选了 10 个最常用的统计函数,每个都配上核心代码片段,让你看完就能上手,快速搭起自己的数据分析小工具。 为什么要 阅读全文
写给数据科学新手的完整实战指南 本文将介绍如何将一个在 Jupyter Notebook 中训练好的机器学习模型,转化为一个真正的 Web 应用,以便与同事或老板在线分享和体验。 接下来,我会用 Python + scikit-learn + FastAPI,从零构建一个 “每日工作效率预测器”。* 阅读全文
机器学习的模型训练中,特征不是越多越好,而是要找到那个 "刚刚好"的子集。 今天介绍的方法 "简单粗暴",通过递归的方式,不断淘汰一个个特征,直到找到那个最优的 "特征子集"。 核心思想 核心思想用一句话来说,就是用"淘汰赛"选出最强特征组合。 递归消除的思路特别像公司搞末位淘汰: 1. 把所有"员 阅读全文
前几篇介绍了使用方差阈值,相关性分析以及统计检验等方式来过滤特征,这些方法都有一个共同点,就是由人来决定如何打分。 今天介绍一种让模型自己给特征“打分”的方式,也就是让模型自己判断哪些特征重要,哪些特征是无关紧要的。 与其我自己猜,不如让模型告诉我。 核心思路 这种特征选择方式的核心思想总结起来就一 阅读全文
在做机器学习建模的时候,经常遇到一个让人头疼的问题:手上有几十甚至上百个特征,到底哪些该留、哪些该丢? 之前两篇介绍了通过 方差阈值 和 相关性分析 来过滤特征,今天这篇介绍一种新的过滤特征的方式,也就是用统计检验来判断一个特征到底跟目标变量有没有关系。 核心思路很简单 说白了,统计检验做特征选择的 阅读全文
刚开始学机器学习时,我也像大部分人 一样,有个很朴素的想法:特征越多,模型能学到的信息就越多,效果自然越好。 所以每次拿到数据,我就拼命往模型里塞特征——能算出来的统计量全加上,能衍生出来的比率全拼上。 一个原本 20 列的数据集,经常被我搞到七八十列。 然后我就发现事情不太对劲了: 训练时间明显变 阅读全文
在机器学习实战中,我们常常把精力花在调参和选模型上,却忽略了一个更基础的问题:喂给模型的数据里,有多少特征是真正有用的? 刚开始学机器学习那会儿,我特别喜欢堆特征,不管有用没用先一股脑全塞进去,总觉得特征越多模型越聪明。 直到有一次跑练习数据集,X_train.shape 直接干到了 (50000, 阅读全文
错误处理往往是优秀代码中最薄弱的环节。 像缺失主键、请求失败、函数运行时间过长等问题在实际项目中频繁出现。 Python 自带的 try-except 块虽然有用,但单靠它并不能覆盖许多实际场景。 你需要将常见的失败情形封装成小型、可复用的函数,以支持带限制的重试、输入验证,以及防止代码运行超时的保 阅读全文
从散点图的局限说起 在数据分析的工作中,我们经常会遇到这样一个问题:如何把数据的“样子”展示给别人看? 如果数据只有两个维度,事情很简单——画一张散点图就好了。 横轴一个变量,纵轴一个变量,每个点代表一条数据,分布一目了然。 如果数据有三个维度呢?也还行——散点图加上颜色,用不同颜色代表第三个维度的 阅读全文
大家好,今天要解决一个痛点是关于 因式分解公式 的。 直接说问题: 用 Manim 展示 $ x2 + 5x + 6 = (x+2)(x+3) $ 的“十字相乘”面积模型,你需要先想好怎样把大矩形拆成四块$ (x^2)、(2x)、(3x)、(6) $,再手动计算每一块的边长和位置。 换成 $ x^2 阅读全文