摘要:
读完这本书回过头才发现, 第一篇笔记居然是 2012年8月发的, 将近一年半的时间才看完这本书(汗!!!).为了方便以后查看, 做个《Linux内核设计与实现》读书笔记 的目录:《Linux内核设计与实现》读书笔记(一)-内核简介《Linux内核设计与实现》读书笔记(二)- 内核开发的准备《Linu... 阅读全文
posted @ 2014-01-11 09:56
wang_yb
阅读(34283)
评论(12)
推荐(24)
数据工程师每天打交道的东西,很大一部分是文本: 应用日志 Nginx access log CSV 里混着脏数据的字段 API 返回的 JSON 片段 配置文件 爬下来的 HTML 这些文本往往不是完全结构化的,或者格式五花八门,用传统的 split、replace 处理起来很累,写一堆条件判断也不 阅读全文
时间序列数据里,趋势、周期和随机波动经常是混在一起的。 直接看原始曲线,很容易被短期波动带偏,比如把一次促销当成长期增长,或者把季节性回落当成业务衰退。 时间序列分解要解决的就是这个问题,把一条看起来乱七八糟的曲线拆成几个更有解释性的部分,让我们分别看: 长期方向 重复周期 剩下的随机噪声。 本文的 阅读全文
时间序列分析听起来有点学术,但其实干起来挺直接的。 你有一串按时间排列的数据,想知道里面有没有趋势、有没有周期性、噪声有多大,或者两个序列之间有没有延迟关系。 SciPy 这个库在信号处理、统计检验方面提供了不少现成的工具,配合 Matplotlib 画图,基本能覆盖日常分析的大部分需求。 本文不是 阅读全文
如果你看到语文78分、数学83分,第一反应可能是数学考得更好。 但不同学科的试卷难度、平均分、分数分散程度都不一样,原始分放在一起直接比,很多时候并不靠谱。 本文想聊的是:如何用描述性统计里的Z分数来比较不同学科成绩的好坏。 1. 先看问题:不同学科的原始分为什么不能直接比? 假设某次考试里,一个学 阅读全文
数据清洗是每个和数据打交道的人都绕不开的日常。 无论是做分析、跑模型,还是给业务方出报表,拿到的原始数据往往都带着重复记录、缺失值、格式错误,甚至一些明显违背常识的条目。 我以前习惯每次遇到问题就临时写几行 drop_duplicates() 或 fillna(),但下次换一份数据,同样的脏法又得重 阅读全文
你大概用过不少健康管理类的App——输入年龄、性别、BMI、血压,再填几项血液指标,它就能给出一个风险评分或健康提示。 这个评分背后,往往是一个训练好的机器学习模型在实时计算。 但模型在Jupyter Notebook里跑通,和让它变成成千上万用户都能调用的服务,中间隔着一条不小的鸿沟。 今天我们就 阅读全文
处理数据的时候,最让人头大的往往不是复杂的模型调参,而是那些藏在角落里的异常值。 你是不是也遇到过这种糟心事:明明业务逻辑看着没毛病,一跑统计指标就飘红;或者模型效果突然断崖式下跌,排查半天发现是几个极端值在捣乱。 今天我们来聊聊最常用的 5 种异常值检测方法:Z-Score、IQR、LOF、Iso 阅读全文
你有没有想过,用 SQL 就能做假设检验? 今天我们就来聊聊,如何用 DuckDB 快速完成数据分析中的两个经典任务: 对分类变量做卡方检验 对连续变量做相关性分析 整个流程非常丝滑: 用 DuckDB 直接读取 CSV 或 Parquet 文件 用熟悉的 SQL 做聚合计算 把精简后的结果交给 P 阅读全文
大家好!在本文中,我们将一起探索如何使用 DuckDB 对 CSV 数据进行常见的描述性统计计算。 无需导入库、无需创建表格,直接使用 SQL 语句就能快速对数据集进行初步分析。 我们会一起学习如何: 直接读取并查询 CSV 文件 计算数据的平均值和中位数 求出标准差与方差 找出最小值、最大值以及数 阅读全文
CSV 这种格式太常见了。银行导出的流水、购物平台导出的订单、自己记的账、各种后台导出的报表,基本都是 CSV。 想分析一下,用 Excel 打开大文件容易卡,用数据库又得先建表、导入,折腾一圈可能就为了看几个数。 DuckDB 可以直接读 CSV,自动推断列名和类型,然后用 SQL 查。 装完就能 阅读全文