读数据架构知识体系指南09设计方法
1. 设计方法 1.1. 数据设计和数据建模是一对容易混淆的概念 1.2. 数据设计看作在建造一座城市 1.2.1. 涉及决定建筑物的位置、连接城市不同部分的道路以及交通流量的规划 1.3. 数据建模更像是在设计单个建筑物 1.3.1. 涉及决定房间的布局、房间如何连接以及每个房间的用途 2. 联机 ...
YashanDB 一把定位引起SWAP空间异常的会话和SQL语句
Oracle 运维靠 TEMP;YashanDB 中间结果换出主要落在 SWAP。SWAP 水位上涨或会话卡在 swapping vm block 时,先用 ytop -f swap.sql 收齐参数、页、水位、段与会话,再 ytop -f sql.sql 看文本和计划。文中用临时 LOB 与 HA... ...
读数据架构知识体系指南08架构设计会议
1. 架构设计会议 1.1. 架构设计会议是由技术专家主导,业务和技术利益相关者共同参与的结构化讨论 1.1.1. 其核心目的在于为特定的商业机会定义并规划收集数据解决方案的高层设计 1.2. 第一次架构设计会议是架构过程的开始,并将引发更多的讨论(很可能包括其他ADS),以支持数据解决方案项目 ...
软删除和唯一索引冲突:把 deleted_at 加进唯一索引,为什么反而不唯一了
软删除(逻辑删除)和唯一索引放在同一张表上,几乎是每个后端项目都会遇到的冲突:用户注销了账号,过两天想用同一个邮箱重新注册,结果插入报 Duplicate entry。因为那条"已删除"的记录还在表里,唯一索引可不管它删没删。 网上最常见的解法是"把 deleted_at 加进唯一索引"。这个解法有 ...
读数据架构知识体系指南07大数据
1. 大数据 1.1. 构建数据架构的公司数量在21世纪20年代出现了爆炸式增长 1.1.1. 主要原因是现在可用的数据比以往任何时候都多,数据可能来自社交媒体、物联网(IoT)设备、内部应用程序和第三方软件等 1.2. 在整个商业世界,企业都在争分夺秒地建立数据架构 1.2.1. 核心在于,在正确 ...
[20260925]21c数字对象是什么(补充).txt
[20260925]21c数字对象是什么(补充).txt--//2024年8月事情记得第1次在21c跟踪执行sql语句library cache lock/library cache pin,有点点吃惊.直到现在不理解,现在大部分--//数字对象都知道来自那里,前段时间写了[20260901]表ex ...
游标分页改完反而慢了一倍:OR 展开和行值比较差了三个数量级
列表页翻到很后面越来越慢,是 LIMIT ... OFFSET ... 分页最常见的毛病。标准答案大家都知道:换成游标分页(keyset pagination)。 但我这次在本机实测时踩了一个坑:照着网上最常见的写法改成游标分页,深页反而比 OFFSET 还慢一倍。这篇把测量过程和原因都摊开,代码是 ...
读数据架构知识体系指南06数据处理
1. 主数据管理 1.1. 存储数据只是解决问题的一部分 1.2. 主数据管理(MDM)可以理解为一套技术、工具和流程,使用户能够创建和维护一致且准确的主数据列表 1.3. 涉及从内部和外部数据源及应用程序中为业务中的每个人、地点或事物创建单一的主记录 1.4. 可以使用这些主记录来构建更准确的报告 ...
读数据架构知识体系指南05数据存储
1. 数据存储 1.1. 在数字时代,数据已成为组织的血液 1.1.1. 仅仅拥有数据是不够的 1.1.2. 如何有效地管理、存储和处理这些数据才是真正的价值所在 1.2. 数据管理的各个组件就像复杂机器中的齿轮,每个组件都发挥着独特的作用,但它们又协同工作以实现共同的目标 1.3. 虽然数据集市提 ...
在 DuckDB 中执行假设检验
你有没有想过,用 SQL 就能做假设检验? 今天我们就来聊聊,如何用 DuckDB 快速完成数据分析中的两个经典任务: 对分类变量做卡方检验 对连续变量做相关性分析 整个流程非常丝滑: 用 DuckDB 直接读取 CSV 或 Parquet 文件 用熟悉的 SQL 做聚合计算 把精简后的结果交给 P ...
使用 DuckDB 计算描述性统计量
大家好!在本文中,我们将一起探索如何使用 DuckDB 对 CSV 数据进行常见的描述性统计计算。 无需导入库、无需创建表格,直接使用 SQL 语句就能快速对数据集进行初步分析。 我们会一起学习如何: 直接读取并查询 CSV 文件 计算数据的平均值和中位数 求出标准差与方差 找出最小值、最大值以及数 ...
读数据架构知识体系指南04数据湖(下)
1. 数据湖设计的最佳实现方案 1.1. 设计数据湖应该是一个耗时的过程 1.1.1. 通常公司在设计数据湖时没有花足够的时间考虑所有用例,后来不得不重新设计和重建 1.1.2. 公司必须仔细考虑现在和将来使用的所有数据源,并了解数据的大小、类型和速度 1.1.3. 尽可能多地了解有关数据湖设计的信 ...
使用 DuckDB 分析 CSV 文件
CSV 这种格式太常见了。银行导出的流水、购物平台导出的订单、自己记的账、各种后台导出的报表,基本都是 CSV。 想分析一下,用 Excel 打开大文件容易卡,用数据库又得先建表、导入,折腾一圈可能就为了看几个数。 DuckDB 可以直接读 CSV,自动推断列名和类型,然后用 SQL 查。 装完就能 ...
读数据架构知识体系指南03数据湖(上)
1. 数据湖 1.1. 因为传感器、视频和社交媒体等数据源的增加,产生了半结构化和非结构化的数据,所以大数据在21世纪10年代初以前所未有的规模出现 1.1.1. 关系数据仓库*不适合存储这些类型的数据 1.1.1.1. 数据仓库中的数据更加结构化和并且经过处理,就像仓库里的瓶装或包装商品一样 1. ...
Redis 数据结构:从五种基础到四种高级
Redis 表面上是九种数据类型,底层实际由更少的编码结构组合而成。Redis 会根据数据量和元素大小自动选择编码,小数据用紧凑结构省内存,大数据切换到高效结构保性能。 ...
MySQL InnoDB Cluster节点告警Instance has 'offline_mode' enabled小结
案例描述 测试环境,一套版本为MySQL 8.4.8的InnoDB Cluster集群,由于一些操作,导致MySQL InnoDB Cluster中备节点出现错误.解决问题后,发现集群的从节点虽然状态联机(ONLINE)了,但是报实例错误:"WARNING: Instance has 'offlin ...
CentOS7 全新安装 Hadoop3.3.4 伪分布式超详细零基础教程
CentOS7 全新安装 Hadoop3.3.4 伪分布式超详细零基础教程、虚拟机配置网络→下载YUM源、下载JDK→配置环境→下载Hadoop与相关文件配置 ...
使用 DuckDB 分析 Parquet 文件
上周朋友发我一个小餐馆的订单文件:restaurant_orders.parquet。 他说是外卖平台导出的,想看看总共多少单、赚了多少钱、哪个菜卖得好、大家怎么付款。 文件几百 MB,不算大,但也不想为了看几个数去折腾数据库。 我直接用了 DuckDB,它有几个好处: 不用建表,不用导入,直接 r ...
读数据架构知识体系指南02关系数据仓库(下)
1. 优点 1.1. 使用关系数据仓库(RDW)可以更轻松地构建任何类型的BI解决方案,因为BI解决方案可以直接从RDW中提取数据,而无须创建复杂的逻辑从多个源系统中提取数据 1.2. 无须清洗或合并数据,因为RDW已经完成了这些工作 1.3. 使用RDW构建的BI解决方案可以是一个数据集市 1.4 ...
读数据架构知识体系指南01关系数据仓库(上)
1. 关系数据仓库 1.1. 关系数据仓库(RDW)是一个集中存储和管理来自多个数据源的大量结构化数据的地方,用于生成历史和趋势分析报表,为公司的商业决策提供帮助 1.2. 被称为关系(数据仓库),是因为它是基于关系模型的,这是一种广泛应用于数据库的数据表示和组织的方法 1.3. 在关系模型中,数 ...


