使用 DuckDB 计算描述性统计量
大家好!在本文中,我们将一起探索如何使用 DuckDB 对 CSV 数据进行常见的描述性统计计算。 无需导入库、无需创建表格,直接使用 SQL 语句就能快速对数据集进行初步分析。 我们会一起学习如何: 直接读取并查询 CSV 文件 计算数据的平均值和中位数 求出标准差与方差 找出最小值、最大值以及数 ...
读数据架构知识体系指南04数据湖(下)
1. 数据湖设计的最佳实现方案 1.1. 设计数据湖应该是一个耗时的过程 1.1.1. 通常公司在设计数据湖时没有花足够的时间考虑所有用例,后来不得不重新设计和重建 1.1.2. 公司必须仔细考虑现在和将来使用的所有数据源,并了解数据的大小、类型和速度 1.1.3. 尽可能多地了解有关数据湖设计的信 ...
使用 DuckDB 分析 CSV 文件
CSV 这种格式太常见了。银行导出的流水、购物平台导出的订单、自己记的账、各种后台导出的报表,基本都是 CSV。 想分析一下,用 Excel 打开大文件容易卡,用数据库又得先建表、导入,折腾一圈可能就为了看几个数。 DuckDB 可以直接读 CSV,自动推断列名和类型,然后用 SQL 查。 装完就能 ...
读数据架构知识体系指南03数据湖(上)
1. 数据湖 1.1. 因为传感器、视频和社交媒体等数据源的增加,产生了半结构化和非结构化的数据,所以大数据在21世纪10年代初以前所未有的规模出现 1.1.1. 关系数据仓库*不适合存储这些类型的数据 1.1.1.1. 数据仓库中的数据更加结构化和并且经过处理,就像仓库里的瓶装或包装商品一样 1. ...
Redis 数据结构:从五种基础到四种高级
Redis 表面上是九种数据类型,底层实际由更少的编码结构组合而成。Redis 会根据数据量和元素大小自动选择编码,小数据用紧凑结构省内存,大数据切换到高效结构保性能。 ...
MySQL InnoDB Cluster节点告警Instance has 'offline_mode' enabled小结
案例描述 测试环境,一套版本为MySQL 8.4.8的InnoDB Cluster集群,由于一些操作,导致MySQL InnoDB Cluster中备节点出现错误.解决问题后,发现集群的从节点虽然状态联机(ONLINE)了,但是报实例错误:"WARNING: Instance has 'offlin ...
CentOS7 全新安装 Hadoop3.3.4 伪分布式超详细零基础教程
CentOS7 全新安装 Hadoop3.3.4 伪分布式超详细零基础教程、虚拟机配置网络→下载YUM源、下载JDK→配置环境→下载Hadoop与相关文件配置 ...
使用 DuckDB 分析 Parquet 文件
上周朋友发我一个小餐馆的订单文件:restaurant_orders.parquet。 他说是外卖平台导出的,想看看总共多少单、赚了多少钱、哪个菜卖得好、大家怎么付款。 文件几百 MB,不算大,但也不想为了看几个数去折腾数据库。 我直接用了 DuckDB,它有几个好处: 不用建表,不用导入,直接 r ...
读数据架构知识体系指南02关系数据仓库(下)
1. 优点 1.1. 使用关系数据仓库(RDW)可以更轻松地构建任何类型的BI解决方案,因为BI解决方案可以直接从RDW中提取数据,而无须创建复杂的逻辑从多个源系统中提取数据 1.2. 无须清洗或合并数据,因为RDW已经完成了这些工作 1.3. 使用RDW构建的BI解决方案可以是一个数据集市 1.4 ...
读数据架构知识体系指南01关系数据仓库(上)
1. 关系数据仓库 1.1. 关系数据仓库(RDW)是一个集中存储和管理来自多个数据源的大量结构化数据的地方,用于生成历史和趋势分析报表,为公司的商业决策提供帮助 1.2. 被称为关系(数据仓库),是因为它是基于关系模型的,这是一种广泛应用于数据库的数据表示和组织的方法 1.3. 在关系模型中,数 ...
DuckDB + SQL 高效分析 JSON 数据
你有没有过这样的经历?从某个 API 抓下来一堆 JSON,或者从 App 里导出了自己的数据,想分析一下,结果发现 JSON 嵌套得像个迷宫。 用 Python 写脚本?可以,但写起来麻烦,调试也费劲。 用 Excel?它连嵌套的 JSON 都打不开。 这时候,DuckDB + SQL 就像一把瑞 ...
德州市鲁劲减速机有限公司联系方式
德州市鲁劲减速机有限公司坐落于素有“中国减速机产业基地”美誉的山东德州,是一家专业从事齿轮减速机、蜗轮蜗杆减速机、丝杆升降机、机械传动设备研发、生产、销售及售后技术服务为一体的现代化实体企业。公司深耕传动机械行业多年,凭借扎实的生产实力、成熟的制造工艺、完善的质检体系以及贴心的售前售后服务,在矿山、 ...
[MY-013360] [Server] Plugin sha256_password reported: ''sha256_password' is deprecated and will be removed in a future release. Please use caching_sha2_password instead'
案例描述 一套MySQL 8.0.39数据库的错误日志突然出现大量下面错误,导致短时间内收到大量告警 2026-09-14T03:53:17.269079Z 336775 [Warning] [MY-013360] [Server] Plugin sha256_password reported: ...
[20260901]表exp_head$的exp_id如何计算.txt
[20260901]表exp_head$的exp_id如何计算.txt--//实际上如何计算表sys.exp_head$的exp_id并不重要,主要目的学习bpftrace脚本,以及那些信息参与运算。1.环境:SCOTT@book01p> @ ver2 PORT_STRING : x86_64/Li ...
读数据可视化18时变数据(下)
1. 流数据可视化 1.1. 流数据是一类特殊的时变型数据,输入数据(全部或部分)并不存储在可随机访问的磁盘或内存中,而是以一个或多个“连续数据流”的形式到达 1.2. 常见的流数据 1.2.1. 移动通信日志 1.2.2. 网络数据(日志、传输数据包、警报等) 1.2.3. 高性能集群平台日志 1 ...
读数据可视化17时变数据(上)
1. 时变数据 1.1. 时间是一个非常重要的维度和属性 1.2. 随时间变化、带有时间属性的数据称为时变型数据 1.2.1. Time-varying Data 1.2.2. Temporal Data 1.3. 时变型数据的处理方法与顺序型数据(Sequential Data)有相通之处 1.4 ...
[20260824]数字字典对象hash的计算.txt
[20260824]数字字典对象hash的计算.txt--//前几天探究row cache时,好奇对应的hash值如何计算,经过多次尝试,大致知道算法。1.环境:SYS@book> @ ver2 PORT_STRING : x86_64/Linux 2.4.xxVERSION : 21.0.0.0. ...
Gaussdb数据库备份与恢复
一、GaussDB介绍 GaussDB 是华为自主创新研发的分布式关系型数据库,属于华为云数据库产品。具备高可用、高性能、高安全、高弹性、高智能、易部署、易迁移等关键能力,是企业核心业务数字化转型升级的坚实数据底座。 二、命令介绍 在 Linux 命令行下,使用 gs_dump 命令备份当前库的所 ...
Zvec v0.7.0 正式发布
Zvec 0.7.0 版本已发布!
本次围绕「生态扩展 + 索引算法 + 部署体验 + 易用性」做了一轮升级,欢迎大家更新试用~✨ ...
读数据可视化10数据(下)
1. 数据挖掘 1.1. 指设计特定算法,从大量的数据集中去探索发现知识或者模式的理论和方法,是知识工程学科中知识发现的关键步骤 1.2. 直观的定义是通过自动或半自动的方法探索与分析数据,从大量的、不完全的、有噪声的、模糊的、随机的数据中提取隐含在其中的、人们事先不知道的、潜在有用的信息和知识的过 ...


