摘要: 读完这本书回过头才发现, 第一篇笔记居然是 2012年8月发的, 将近一年半的时间才看完这本书(汗!!!).为了方便以后查看, 做个《Linux内核设计与实现》读书笔记 的目录:《Linux内核设计与实现》读书笔记(一)-内核简介《Linux内核设计与实现》读书笔记(二)- 内核开发的准备《Linu... 阅读全文
posted @ 2014-01-11 09:56 wang_yb 阅读(34240) 评论(12) 推荐(24)
摘要: 如何对稀疏数据的场景进行分析 稀疏数据指数据点中大部分为零或空值的数据集。 典型应用场景包括:Netflix用户评分(大部分电影未被观看)、社交媒体连接(每人只认识一小部分用户)、电商用户与产品的交互记录。 本文以模拟社交平台的数据为示例,演示如何分析稀疏数据的场景。 想象一下:一个拥有 100 万用户的社交平台,每人平均只关注 阅读全文
posted @ 2026-08-16 17:49 wang_yb 阅读(91) 评论(0) 推荐(0)
摘要: Python 中 10 个最常用的统计函数 刚入行数据科学,面对成堆的数据和模型,往往最先卡在“算个平均值都要翻文档”这一步。 别急,Python 标准库 statistics 模块 就能帮你搞定 80% 的日常统计需求。 本文挑选了 10 个最常用的统计函数,每个都配上核心代码片段,让你看完就能上手,快速搭起自己的数据分析小工具。 为什么要 阅读全文
posted @ 2026-08-13 15:01 wang_yb 阅读(256) 评论(0) 推荐(1)
摘要: 如何快速构建一个数据科学应用?从零到上线 写给数据科学新手的完整实战指南 本文将介绍如何将一个在 Jupyter Notebook 中训练好的机器学习模型,转化为一个真正的 Web 应用,以便与同事或老板在线分享和体验。 接下来,我会用 Python + scikit-learn + FastAPI,从零构建一个 “每日工作效率预测器”。* 阅读全文
posted @ 2026-08-11 12:55 wang_yb 阅读(143) 评论(2) 推荐(1)
摘要: 用递归消除法优化“特征子集” 机器学习的模型训练中,特征不是越多越好,而是要找到那个 "刚刚好"的子集。 今天介绍的方法 "简单粗暴",通过递归的方式,不断淘汰一个个特征,直到找到那个最优的 "特征子集"。 核心思想 核心思想用一句话来说,就是用"淘汰赛"选出最强特征组合。 递归消除的思路特别像公司搞末位淘汰: 1. 把所有"员 阅读全文
posted @ 2026-08-09 15:02 wang_yb 阅读(93) 评论(0) 推荐(0)
摘要: 基于模型的重要性评分进行“特征排序” 前几篇介绍了使用方差阈值,相关性分析以及统计检验等方式来过滤特征,这些方法都有一个共同点,就是由人来决定如何打分。 今天介绍一种让模型自己给特征“打分”的方式,也就是让模型自己判断哪些特征重要,哪些特征是无关紧要的。 与其我自己猜,不如让模型告诉我。 核心思路 这种特征选择方式的核心思想总结起来就一 阅读全文
posted @ 2026-08-08 10:54 wang_yb 阅读(55) 评论(0) 推荐(3)
摘要: 用统计检验来确定“重要特征” 在做机器学习建模的时候,经常遇到一个让人头疼的问题:手上有几十甚至上百个特征,到底哪些该留、哪些该丢? 之前两篇介绍了通过 方差阈值 和 相关性分析 来过滤特征,今天这篇介绍一种新的过滤特征的方式,也就是用统计检验来判断一个特征到底跟目标变量有没有关系。 核心思路很简单 说白了,统计检验做特征选择的 阅读全文
posted @ 2026-08-04 13:04 wang_yb 阅读(83) 评论(0) 推荐(1)
摘要: 用相关性分析消除“冗余特征” 刚开始学机器学习时,我也像大部分人 一样,有个很朴素的想法:特征越多,模型能学到的信息就越多,效果自然越好。 所以每次拿到数据,我就拼命往模型里塞特征——能算出来的统计量全加上,能衍生出来的比率全拼上。 一个原本 20 列的数据集,经常被我搞到七八十列。 然后我就发现事情不太对劲了: 训练时间明显变 阅读全文
posted @ 2026-08-01 18:35 wang_yb 阅读(115) 评论(0) 推荐(0)
摘要: 用方差阈值过滤掉“惰性特征” 在机器学习实战中,我们常常把精力花在调参和选模型上,却忽略了一个更基础的问题:喂给模型的数据里,有多少特征是真正有用的? 刚开始学机器学习那会儿,我特别喜欢堆特征,不管有用没用先一股脑全塞进去,总觉得特征越多模型越聪明。 直到有一次跑练习数据集,X_train.shape 直接干到了 (50000, 阅读全文
posted @ 2026-07-29 16:57 wang_yb 阅读(81) 评论(0) 推荐(0)
摘要: 5 个实用的Python错误处理函数 错误处理往往是优秀代码中最薄弱的环节。 像缺失主键、请求失败、函数运行时间过长等问题在实际项目中频繁出现。 Python 自带的 try-except 块虽然有用,但单靠它并不能覆盖许多实际场景。 你需要将常见的失败情形封装成小型、可复用的函数,以支持带限制的重试、输入验证,以及防止代码运行超时的保 阅读全文
posted @ 2026-07-22 16:32 wang_yb 阅读(103) 评论(0) 推荐(0)
摘要: 当散点图不够用时:用 t-SNE 可视化多维数据 从散点图的局限说起 在数据分析的工作中,我们经常会遇到这样一个问题:如何把数据的“样子”展示给别人看? 如果数据只有两个维度,事情很简单——画一张散点图就好了。 横轴一个变量,纵轴一个变量,每个点代表一条数据,分布一目了然。 如果数据有三个维度呢?也还行——散点图加上颜色,用不同颜色代表第三个维度的 阅读全文
posted @ 2026-07-21 20:28 wang_yb 阅读(110) 评论(0) 推荐(1)