随笔分类 - databook
数据采集
摘要:
你有没有想过,用 SQL 就能做假设检验? 今天我们就来聊聊,如何用 DuckDB 快速完成数据分析中的两个经典任务: 对分类变量做卡方检验 对连续变量做相关性分析 整个流程非常丝滑: 用 DuckDB 直接读取 CSV 或 Parquet 文件 用熟悉的 SQL 做聚合计算 把精简后的结果交给 P
阅读全文
你有没有想过,用 SQL 就能做假设检验? 今天我们就来聊聊,如何用 DuckDB 快速完成数据分析中的两个经典任务: 对分类变量做卡方检验 对连续变量做相关性分析 整个流程非常丝滑: 用 DuckDB 直接读取 CSV 或 Parquet 文件 用熟悉的 SQL 做聚合计算 把精简后的结果交给 P
阅读全文
摘要:
大家好!在本文中,我们将一起探索如何使用 DuckDB 对 CSV 数据进行常见的描述性统计计算。 无需导入库、无需创建表格,直接使用 SQL 语句就能快速对数据集进行初步分析。 我们会一起学习如何: 直接读取并查询 CSV 文件 计算数据的平均值和中位数 求出标准差与方差 找出最小值、最大值以及数
阅读全文
大家好!在本文中,我们将一起探索如何使用 DuckDB 对 CSV 数据进行常见的描述性统计计算。 无需导入库、无需创建表格,直接使用 SQL 语句就能快速对数据集进行初步分析。 我们会一起学习如何: 直接读取并查询 CSV 文件 计算数据的平均值和中位数 求出标准差与方差 找出最小值、最大值以及数
阅读全文
摘要:
CSV 这种格式太常见了。银行导出的流水、购物平台导出的订单、自己记的账、各种后台导出的报表,基本都是 CSV。 想分析一下,用 Excel 打开大文件容易卡,用数据库又得先建表、导入,折腾一圈可能就为了看几个数。 DuckDB 可以直接读 CSV,自动推断列名和类型,然后用 SQL 查。 装完就能
阅读全文
CSV 这种格式太常见了。银行导出的流水、购物平台导出的订单、自己记的账、各种后台导出的报表,基本都是 CSV。 想分析一下,用 Excel 打开大文件容易卡,用数据库又得先建表、导入,折腾一圈可能就为了看几个数。 DuckDB 可以直接读 CSV,自动推断列名和类型,然后用 SQL 查。 装完就能
阅读全文
摘要:
做技术的应该都遇到过这种场景:服务器每分钟收到多少请求?接口一天报错几次?网站一小时来多少访客? 这些问题的共同点是:在一段固定时间里,某个事件发生了多少次。 这类数据有个特点:单次看是随机的,但拉长周期会有一个稳定的平均值。 这种场景下,泊松分布就是最合适的建模工具。 今天咱们不扯虚的,直接把这个
阅读全文
做技术的应该都遇到过这种场景:服务器每分钟收到多少请求?接口一天报错几次?网站一小时来多少访客? 这些问题的共同点是:在一段固定时间里,某个事件发生了多少次。 这类数据有个特点:单次看是随机的,但拉长周期会有一个稳定的平均值。 这种场景下,泊松分布就是最合适的建模工具。 今天咱们不扯虚的,直接把这个
阅读全文
摘要:
上周朋友发我一个小餐馆的订单文件:restaurant_orders.parquet。 他说是外卖平台导出的,想看看总共多少单、赚了多少钱、哪个菜卖得好、大家怎么付款。 文件几百 MB,不算大,但也不想为了看几个数去折腾数据库。 我直接用了 DuckDB,它有几个好处: 不用建表,不用导入,直接 r
阅读全文
上周朋友发我一个小餐馆的订单文件:restaurant_orders.parquet。 他说是外卖平台导出的,想看看总共多少单、赚了多少钱、哪个菜卖得好、大家怎么付款。 文件几百 MB,不算大,但也不想为了看几个数去折腾数据库。 我直接用了 DuckDB,它有几个好处: 不用建表,不用导入,直接 r
阅读全文
摘要:
你有没有过这样的经历?从某个 API 抓下来一堆 JSON,或者从 App 里导出了自己的数据,想分析一下,结果发现 JSON 嵌套得像个迷宫。 用 Python 写脚本?可以,但写起来麻烦,调试也费劲。 用 Excel?它连嵌套的 JSON 都打不开。 这时候,DuckDB + SQL 就像一把瑞
阅读全文
你有没有过这样的经历?从某个 API 抓下来一堆 JSON,或者从 App 里导出了自己的数据,想分析一下,结果发现 JSON 嵌套得像个迷宫。 用 Python 写脚本?可以,但写起来麻烦,调试也费劲。 用 Excel?它连嵌套的 JSON 都打不开。 这时候,DuckDB + SQL 就像一把瑞
阅读全文
摘要:Manim Community Edition 发布了 v0.21.0 版本(2026 年 8 月 10 日),这是继 v0.20.1 之后的又一次功能型版本更新。 本次更新包含 2 项破坏性变更,以及多项值得关注的新特性和性能优化。 其中 Cairo 渲染器在动画密集场景下提速超过一倍,NumPy
阅读全文
摘要:
你可能经历过这样的场景:拿到一个 CSV,以为只是删几行、改几列,结果打开一看:空值、重复、负金额、Windows 换行符,全挤在一起。 别急着打开 Python,很多时候终端里的 Bash 已经能先帮你把这团乱麻冲开。 数据清洗不一定非要一开始就上重型武器(Python), 把 head、cut、
阅读全文
你可能经历过这样的场景:拿到一个 CSV,以为只是删几行、改几列,结果打开一看:空值、重复、负金额、Windows 换行符,全挤在一起。 别急着打开 Python,很多时候终端里的 Bash 已经能先帮你把这团乱麻冲开。 数据清洗不一定非要一开始就上重型武器(Python), 把 head、cut、
阅读全文
摘要:
在日常工作和生活中,我们经常会遇到各种各样的数据:每月的外卖账单、每天的步数记录、工作时长与咖啡消耗量……如果只看一堆密密麻麻的数字表格,很容易让人眼花缭乱。 俗话说 “一图胜千言” 。 统计图表就像是数据的“显微镜”和“翻译官”,能帮我们快速发现隐藏在数据背后的规律、偏好甚至“异常”。 下面将结合
阅读全文
在日常工作和生活中,我们经常会遇到各种各样的数据:每月的外卖账单、每天的步数记录、工作时长与咖啡消耗量……如果只看一堆密密麻麻的数字表格,很容易让人眼花缭乱。 俗话说 “一图胜千言” 。 统计图表就像是数据的“显微镜”和“翻译官”,能帮我们快速发现隐藏在数据背后的规律、偏好甚至“异常”。 下面将结合
阅读全文
摘要:
先别被“数据科学”这几个字吓到。异常值 其实天天出现在我们身边: 你平时电费300块,这个月突然变成1500块; 你每天走8000步,某天微信运动显示50000步(而你那天明明在家躺平); 班里同学考60~80分,突然冒出个100分和20分。 这些“画风突变”的数据点,就是我们今天要抓的“显眼包”—
阅读全文
先别被“数据科学”这几个字吓到。异常值 其实天天出现在我们身边: 你平时电费300块,这个月突然变成1500块; 你每天走8000步,某天微信运动显示50000步(而你那天明明在家躺平); 班里同学考60~80分,突然冒出个100分和20分。 这些“画风突变”的数据点,就是我们今天要抓的“显眼包”—
阅读全文
摘要:
你有没有遇到过这样的怪事? 平时上班通勤只要 30 分钟,但上个月有一次居然堵了 2 个小时。 你们部门 10 个人的平均工资是 5 万,但因为老板拿了 200 万,平均值瞬间变成了“人均 24 万”,而你实际只拿 1 万。 如果你用我们熟悉的正态分布(钟形曲线) 来套这些场景,它会告诉你:“堵车
阅读全文
你有没有遇到过这样的怪事? 平时上班通勤只要 30 分钟,但上个月有一次居然堵了 2 个小时。 你们部门 10 个人的平均工资是 5 万,但因为老板拿了 200 万,平均值瞬间变成了“人均 24 万”,而你实际只拿 1 万。 如果你用我们熟悉的正态分布(钟形曲线) 来套这些场景,它会告诉你:“堵车
阅读全文
摘要:
想象一下这个场景:明天你要去一家新开的网红餐厅。你翻开点评软件,看到过去 10 个人里,有 7 个人给了好评。 那么,你明天去吃到美食的概率到底是多少? 是 70% 吗?不一定。 如果你只看这 10 条评论,你的信心其实很脆弱——万一这 10 个人都是老板请来的托呢?但如果这家店有 1000 条评论
阅读全文
想象一下这个场景:明天你要去一家新开的网红餐厅。你翻开点评软件,看到过去 10 个人里,有 7 个人给了好评。 那么,你明天去吃到美食的概率到底是多少? 是 70% 吗?不一定。 如果你只看这 10 条评论,你的信心其实很脆弱——万一这 10 个人都是老板请来的托呢?但如果这家店有 1000 条评论
阅读全文
摘要:
你有没有过这样的经历? 在游戏里抽卡,抽了多少次才终于出货? 站在路边等公交车,第几辆来的才是你要坐的那一路? 给客户打电话,打到第几个才终于接通? 刷短视频时,刷了多少条才刷到自己想看的内容? 这些场景背后,都藏着一个共同的概率模型——几何分布(Geometric Distribution)。 几
阅读全文
你有没有过这样的经历? 在游戏里抽卡,抽了多少次才终于出货? 站在路边等公交车,第几辆来的才是你要坐的那一路? 给客户打电话,打到第几个才终于接通? 刷短视频时,刷了多少条才刷到自己想看的内容? 这些场景背后,都藏着一个共同的概率模型——几何分布(Geometric Distribution)。 几
阅读全文
摘要:
前言 概率论听起来像是数学课本里枯燥的公式,但实际上它无处不在——你早上出门前纠结“要不要带伞”,本质上就是在做一次概率判断。 今天我们要聊的联合概率和条件概率,是概率论中最基础也最实用的两个概念。 联合概率和条件概率到底是什么? 联合概率 联合概率,简单来说,就是两件事同时发生的概率。 比如:今天
阅读全文
前言 概率论听起来像是数学课本里枯燥的公式,但实际上它无处不在——你早上出门前纠结“要不要带伞”,本质上就是在做一次概率判断。 今天我们要聊的联合概率和条件概率,是概率论中最基础也最实用的两个概念。 联合概率和条件概率到底是什么? 联合概率 联合概率,简单来说,就是两件事同时发生的概率。 比如:今天
阅读全文
摘要:
稀疏数据指数据点中大部分为零或空值的数据集。 典型应用场景包括:Netflix用户评分(大部分电影未被观看)、社交媒体连接(每人只认识一小部分用户)、电商用户与产品的交互记录。 本文以模拟社交平台的数据为示例,演示如何分析稀疏数据的场景。 想象一下:一个拥有 100 万用户的社交平台,每人平均只关注
阅读全文
稀疏数据指数据点中大部分为零或空值的数据集。 典型应用场景包括:Netflix用户评分(大部分电影未被观看)、社交媒体连接(每人只认识一小部分用户)、电商用户与产品的交互记录。 本文以模拟社交平台的数据为示例,演示如何分析稀疏数据的场景。 想象一下:一个拥有 100 万用户的社交平台,每人平均只关注
阅读全文
摘要:
刚入行数据科学,面对成堆的数据和模型,往往最先卡在“算个平均值都要翻文档”这一步。 别急,Python 标准库 statistics 模块 就能帮你搞定 80% 的日常统计需求。 本文挑选了 10 个最常用的统计函数,每个都配上核心代码片段,让你看完就能上手,快速搭起自己的数据分析小工具。 为什么要
阅读全文
刚入行数据科学,面对成堆的数据和模型,往往最先卡在“算个平均值都要翻文档”这一步。 别急,Python 标准库 statistics 模块 就能帮你搞定 80% 的日常统计需求。 本文挑选了 10 个最常用的统计函数,每个都配上核心代码片段,让你看完就能上手,快速搭起自己的数据分析小工具。 为什么要
阅读全文
摘要:
写给数据科学新手的完整实战指南 本文将介绍如何将一个在 Jupyter Notebook 中训练好的机器学习模型,转化为一个真正的 Web 应用,以便与同事或老板在线分享和体验。 接下来,我会用 Python + scikit-learn + FastAPI,从零构建一个 “每日工作效率预测器”。*
阅读全文
写给数据科学新手的完整实战指南 本文将介绍如何将一个在 Jupyter Notebook 中训练好的机器学习模型,转化为一个真正的 Web 应用,以便与同事或老板在线分享和体验。 接下来,我会用 Python + scikit-learn + FastAPI,从零构建一个 “每日工作效率预测器”。*
阅读全文
摘要:
机器学习的模型训练中,特征不是越多越好,而是要找到那个 "刚刚好"的子集。 今天介绍的方法 "简单粗暴",通过递归的方式,不断淘汰一个个特征,直到找到那个最优的 "特征子集"。 核心思想 核心思想用一句话来说,就是用"淘汰赛"选出最强特征组合。 递归消除的思路特别像公司搞末位淘汰: 1. 把所有"员
阅读全文
机器学习的模型训练中,特征不是越多越好,而是要找到那个 "刚刚好"的子集。 今天介绍的方法 "简单粗暴",通过递归的方式,不断淘汰一个个特征,直到找到那个最优的 "特征子集"。 核心思想 核心思想用一句话来说,就是用"淘汰赛"选出最强特征组合。 递归消除的思路特别像公司搞末位淘汰: 1. 把所有"员
阅读全文
摘要:
前几篇介绍了使用方差阈值,相关性分析以及统计检验等方式来过滤特征,这些方法都有一个共同点,就是由人来决定如何打分。 今天介绍一种让模型自己给特征“打分”的方式,也就是让模型自己判断哪些特征重要,哪些特征是无关紧要的。 与其我自己猜,不如让模型告诉我。 核心思路 这种特征选择方式的核心思想总结起来就一
阅读全文
前几篇介绍了使用方差阈值,相关性分析以及统计检验等方式来过滤特征,这些方法都有一个共同点,就是由人来决定如何打分。 今天介绍一种让模型自己给特征“打分”的方式,也就是让模型自己判断哪些特征重要,哪些特征是无关紧要的。 与其我自己猜,不如让模型告诉我。 核心思路 这种特征选择方式的核心思想总结起来就一
阅读全文
摘要:
在做机器学习建模的时候,经常遇到一个让人头疼的问题:手上有几十甚至上百个特征,到底哪些该留、哪些该丢? 之前两篇介绍了通过 方差阈值 和 相关性分析 来过滤特征,今天这篇介绍一种新的过滤特征的方式,也就是用统计检验来判断一个特征到底跟目标变量有没有关系。 核心思路很简单 说白了,统计检验做特征选择的
阅读全文
在做机器学习建模的时候,经常遇到一个让人头疼的问题:手上有几十甚至上百个特征,到底哪些该留、哪些该丢? 之前两篇介绍了通过 方差阈值 和 相关性分析 来过滤特征,今天这篇介绍一种新的过滤特征的方式,也就是用统计检验来判断一个特征到底跟目标变量有没有关系。 核心思路很简单 说白了,统计检验做特征选择的
阅读全文

浙公网安备 33010602011771号