摘要: 读完这本书回过头才发现, 第一篇笔记居然是 2012年8月发的, 将近一年半的时间才看完这本书(汗!!!).为了方便以后查看, 做个《Linux内核设计与实现》读书笔记 的目录:《Linux内核设计与实现》读书笔记(一)-内核简介《Linux内核设计与实现》读书笔记(二)- 内核开发的准备《Linu... 阅读全文
posted @ 2014-01-11 09:56 wang_yb 阅读(34283) 评论(12) 推荐(24)
摘要: 面向数据工程师的正则表达式:从日志清洗到字段提取 数据工程师每天打交道的东西,很大一部分是文本: 应用日志 Nginx access log CSV 里混着脏数据的字段 API 返回的 JSON 片段 配置文件 爬下来的 HTML 这些文本往往不是完全结构化的,或者格式五花八门,用传统的 split、replace 处理起来很累,写一堆条件判断也不 阅读全文
posted @ 2026-10-05 17:00 wang_yb 阅读(85) 评论(0) 推荐(1)
摘要: 时间序列分解:从噪声中提取有效信号 时间序列数据里,趋势、周期和随机波动经常是混在一起的。 直接看原始曲线,很容易被短期波动带偏,比如把一次促销当成长期增长,或者把季节性回落当成业务衰退。 时间序列分解要解决的就是这个问题,把一条看起来乱七八糟的曲线拆成几个更有解释性的部分,让我们分别看: 长期方向 重复周期 剩下的随机噪声。 本文的 阅读全文
posted @ 2026-10-04 11:50 wang_yb 阅读(85) 评论(0) 推荐(1)
摘要: 使用 SciPy 库进行时间序列分析 时间序列分析听起来有点学术,但其实干起来挺直接的。 你有一串按时间排列的数据,想知道里面有没有趋势、有没有周期性、噪声有多大,或者两个序列之间有没有延迟关系。 SciPy 这个库在信号处理、统计检验方面提供了不少现成的工具,配合 Matplotlib 画图,基本能覆盖日常分析的大部分需求。 本文不是 阅读全文
posted @ 2026-10-02 23:43 wang_yb 阅读(124) 评论(0) 推荐(1)
摘要: 如何比较你不同学科成绩的好坏? 如果你看到语文78分、数学83分,第一反应可能是数学考得更好。 但不同学科的试卷难度、平均分、分数分散程度都不一样,原始分放在一起直接比,很多时候并不靠谱。 本文想聊的是:如何用描述性统计里的Z分数来比较不同学科成绩的好坏。 1. 先看问题:不同学科的原始分为什么不能直接比? 假设某次考试里,一个学 阅读全文
posted @ 2026-09-30 17:44 wang_yb 阅读(163) 评论(0) 推荐(3)
摘要: 用Pandas+Pydantic搭建数据清洗与验证管道 数据清洗是每个和数据打交道的人都绕不开的日常。 无论是做分析、跑模型,还是给业务方出报表,拿到的原始数据往往都带着重复记录、缺失值、格式错误,甚至一些明显违背常识的条目。 我以前习惯每次遇到问题就临时写几行 drop_duplicates() 或 fillna(),但下次换一份数据,同样的脏法又得重 阅读全文
posted @ 2026-09-29 12:46 wang_yb 阅读(222) 评论(1) 推荐(1)
摘要: 手把手带你走一遍:机器学习模型如何用FastAPI和Docker部署 你大概用过不少健康管理类的App——输入年龄、性别、BMI、血压,再填几项血液指标,它就能给出一个风险评分或健康提示。 这个评分背后,往往是一个训练好的机器学习模型在实时计算。 但模型在Jupyter Notebook里跑通,和让它变成成千上万用户都能调用的服务,中间隔着一条不小的鸿沟。 今天我们就 阅读全文
posted @ 2026-09-28 15:44 wang_yb 阅读(233) 评论(0) 推荐(1)
摘要: 检测数据异常值的五种统计技术 处理数据的时候,最让人头大的往往不是复杂的模型调参,而是那些藏在角落里的异常值。 你是不是也遇到过这种糟心事:明明业务逻辑看着没毛病,一跑统计指标就飘红;或者模型效果突然断崖式下跌,排查半天发现是几个极端值在捣乱。 今天我们来聊聊最常用的 5 种异常值检测方法:Z-Score、IQR、LOF、Iso 阅读全文
posted @ 2026-09-26 22:50 wang_yb 阅读(142) 评论(0) 推荐(2)
摘要: 在 DuckDB 中执行假设检验 你有没有想过,用 SQL 就能做假设检验? 今天我们就来聊聊,如何用 DuckDB 快速完成数据分析中的两个经典任务: 对分类变量做卡方检验 对连续变量做相关性分析 整个流程非常丝滑: 用 DuckDB 直接读取 CSV 或 Parquet 文件 用熟悉的 SQL 做聚合计算 把精简后的结果交给 P 阅读全文
posted @ 2026-09-24 12:18 wang_yb 阅读(109) 评论(3) 推荐(1)
摘要: 使用 DuckDB 计算描述性统计量 大家好!在本文中,我们将一起探索如何使用 DuckDB 对 CSV 数据进行常见的描述性统计计算。 无需导入库、无需创建表格,直接使用 SQL 语句就能快速对数据集进行初步分析。 我们会一起学习如何: 直接读取并查询 CSV 文件 计算数据的平均值和中位数 求出标准差与方差 找出最小值、最大值以及数 阅读全文
posted @ 2026-09-23 13:04 wang_yb 阅读(122) 评论(0) 推荐(1)
摘要: 使用 DuckDB 分析 CSV 文件 CSV 这种格式太常见了。银行导出的流水、购物平台导出的订单、自己记的账、各种后台导出的报表,基本都是 CSV。 想分析一下,用 Excel 打开大文件容易卡,用数据库又得先建表、导入,折腾一圈可能就为了看几个数。 DuckDB 可以直接读 CSV,自动推断列名和类型,然后用 SQL 查。 装完就能 阅读全文
posted @ 2026-09-22 20:15 wang_yb 阅读(199) 评论(3) 推荐(1)