1 2 3 4 5 ··· 75 下一页
摘要: 读完这本书回过头才发现, 第一篇笔记居然是 2012年8月发的, 将近一年半的时间才看完这本书(汗!!!).为了方便以后查看, 做个《Linux内核设计与实现》读书笔记 的目录:《Linux内核设计与实现》读书笔记(一)-内核简介《Linux内核设计与实现》读书笔记(二)- 内核开发的准备《Linu... 阅读全文
posted @ 2014-01-11 09:56 wang_yb 阅读(34227) 评论(12) 推荐(24)
摘要: Python 中 10 个最常用的统计函数 刚入行数据科学,面对成堆的数据和模型,往往最先卡在“算个平均值都要翻文档”这一步。 别急,Python 标准库 statistics 模块 就能帮你搞定 80% 的日常统计需求。 本文挑选了 10 个最常用的统计函数,每个都配上核心代码片段,让你看完就能上手,快速搭起自己的数据分析小工具。 为什么要 阅读全文
posted @ 2026-08-13 15:01 wang_yb 阅读(191) 评论(0) 推荐(1)
摘要: 如何快速构建一个数据科学应用?从零到上线 写给数据科学新手的完整实战指南 本文将介绍如何将一个在 Jupyter Notebook 中训练好的机器学习模型,转化为一个真正的 Web 应用,以便与同事或老板在线分享和体验。 接下来,我会用 Python + scikit-learn + FastAPI,从零构建一个 “每日工作效率预测器”。* 阅读全文
posted @ 2026-08-11 12:55 wang_yb 阅读(136) 评论(2) 推荐(1)
摘要: 用递归消除法优化“特征子集” 机器学习的模型训练中,特征不是越多越好,而是要找到那个 "刚刚好"的子集。 今天介绍的方法 "简单粗暴",通过递归的方式,不断淘汰一个个特征,直到找到那个最优的 "特征子集"。 核心思想 核心思想用一句话来说,就是用"淘汰赛"选出最强特征组合。 递归消除的思路特别像公司搞末位淘汰: 1. 把所有"员 阅读全文
posted @ 2026-08-09 15:02 wang_yb 阅读(88) 评论(0) 推荐(0)
摘要: 基于模型的重要性评分进行“特征排序” 前几篇介绍了使用方差阈值,相关性分析以及统计检验等方式来过滤特征,这些方法都有一个共同点,就是由人来决定如何打分。 今天介绍一种让模型自己给特征“打分”的方式,也就是让模型自己判断哪些特征重要,哪些特征是无关紧要的。 与其我自己猜,不如让模型告诉我。 核心思路 这种特征选择方式的核心思想总结起来就一 阅读全文
posted @ 2026-08-08 10:54 wang_yb 阅读(48) 评论(0) 推荐(3)
摘要: 用统计检验来确定“重要特征” 在做机器学习建模的时候,经常遇到一个让人头疼的问题:手上有几十甚至上百个特征,到底哪些该留、哪些该丢? 之前两篇介绍了通过 方差阈值 和 相关性分析 来过滤特征,今天这篇介绍一种新的过滤特征的方式,也就是用统计检验来判断一个特征到底跟目标变量有没有关系。 核心思路很简单 说白了,统计检验做特征选择的 阅读全文
posted @ 2026-08-04 13:04 wang_yb 阅读(78) 评论(0) 推荐(1)
摘要: 用相关性分析消除“冗余特征” 刚开始学机器学习时,我也像大部分人 一样,有个很朴素的想法:特征越多,模型能学到的信息就越多,效果自然越好。 所以每次拿到数据,我就拼命往模型里塞特征——能算出来的统计量全加上,能衍生出来的比率全拼上。 一个原本 20 列的数据集,经常被我搞到七八十列。 然后我就发现事情不太对劲了: 训练时间明显变 阅读全文
posted @ 2026-08-01 18:35 wang_yb 阅读(107) 评论(0) 推荐(0)
摘要: 用方差阈值过滤掉“惰性特征” 在机器学习实战中,我们常常把精力花在调参和选模型上,却忽略了一个更基础的问题:喂给模型的数据里,有多少特征是真正有用的? 刚开始学机器学习那会儿,我特别喜欢堆特征,不管有用没用先一股脑全塞进去,总觉得特征越多模型越聪明。 直到有一次跑练习数据集,X_train.shape 直接干到了 (50000, 阅读全文
posted @ 2026-07-29 16:57 wang_yb 阅读(80) 评论(0) 推荐(0)
摘要: 5 个实用的Python错误处理函数 错误处理往往是优秀代码中最薄弱的环节。 像缺失主键、请求失败、函数运行时间过长等问题在实际项目中频繁出现。 Python 自带的 try-except 块虽然有用,但单靠它并不能覆盖许多实际场景。 你需要将常见的失败情形封装成小型、可复用的函数,以支持带限制的重试、输入验证,以及防止代码运行超时的保 阅读全文
posted @ 2026-07-22 16:32 wang_yb 阅读(98) 评论(0) 推荐(0)
摘要: 当散点图不够用时:用 t-SNE 可视化多维数据 从散点图的局限说起 在数据分析的工作中,我们经常会遇到这样一个问题:如何把数据的“样子”展示给别人看? 如果数据只有两个维度,事情很简单——画一张散点图就好了。 横轴一个变量,纵轴一个变量,每个点代表一条数据,分布一目了然。 如果数据有三个维度呢?也还行——散点图加上颜色,用不同颜色代表第三个维度的 阅读全文
posted @ 2026-07-21 20:28 wang_yb 阅读(109) 评论(0) 推荐(1)
摘要: 用SymPy自动因式分解:从面积拼图到代数恒等式 大家好,今天要解决一个痛点是关于 因式分解公式 的。 直接说问题: 用 Manim 展示 $ x2 + 5x + 6 = (x+2)(x+3) $ 的“十字相乘”面积模型,你需要先想好怎样把大矩形拆成四块$ (x^2)、(2x)、(3x)、(6) $,再手动计算每一块的边长和位置。 换成 $ x^2 阅读全文
posted @ 2026-06-13 19:05 wang_yb 阅读(155) 评论(0) 推荐(0)
1 2 3 4 5 ··· 75 下一页