读数据架构知识体系指南17数据网格(下)
1. 数据域 1.1. 设计面向领域架构的过程被称为领域驱动设计(DDD),是一个非常困难和耗时的过程 1.2. 分析数据应由与之关系最密切的业务领域拥有,领域分为数据源或主要消费者 1.3. 面向源领域的数据 1.3.1. 是与数据来源的业务源头密切对应的分析数据 1.3.2. 数据从源应用程序的 ...
[20261001]oracle Semaphore Arrays Key值的计算.txt
[20261001]oracle Semaphore Arrays Key值的计算.txt--//尝试计算ipcs -s输出的Semaphore Arrays Key值的计算。1.问题提出:--//关闭数据库重新启动:--//修改/etc/sudoers建立加入如下:# grep oracle /e ...
读数据架构知识体系指南16数据网格(上)
1. 数据网格 1.1. Zhamak Dehghani创造了数据网格(data mesh)一词 1.1.1. 数据网格是一个概念,而不是一种技术 1.1.2. 关系到公司内部组织和文化的转变 1.1.3. 自从2019年被首次引入以来,数据网格就吸引了很多注意 1.2. 数据网格是去中心化数据结构 ...
MySQL 间隙锁 (Gap Lock) 与 Next-Key Lock 导致的线上死锁分析实战
本文深入剖析 MySQL InnoDB 引擎在 RR 隔离级别下,非唯一索引引发的 Gap Lock 与 Next-Key Lock 锁冲突导致的线上死锁问题。结合 SHOW ENGINE INNODB STATUS 死锁日志,手把手还原并发场景下的锁升级链路,并给出从数据库隔离级别调整到 Jav... ...
读数据架构知识体系指南15数据湖仓
1. 数据湖仓 1.1. 数据湖仓是数据湖和数据仓库概念的调和物 1.1.1. 仅使用数据湖保存数据,而不是使用一个独立的关系数据仓库 1.1.2. 数据湖需要更多功能来取代RDW的功能 1.1.2.1. Databricks的Delta Lake发挥作用的地方 1.1.3. 几年前,从架构中省略R ...
读数据架构知识体系指南14数据编织
1. 数据编织 1.1. 数据编织是现代数据仓库构架(MDW)的进化 1.1.1. 构建在MDW上的更高级层,其提高了数据的可访问性、安全性、可发现性和可用性 1.2. 数据编织贯穿整个公司,累积了所有数据,将其提供给所有需要的人 1.3. 无论数据的大小、速度或类型如何,这种架构都能使用数据 1. ...
读数据架构知识体系指南13现代数据仓库
1. 现代数据仓库 1.1. 每天,各个组织都必须梳理海量数据,以获取深刻见解、做出决策并推动业务增长 1.2. 融合了关系数据仓库的结构化优势和数据湖的灵活性优势 1.3. 处于我们快速发展的数据生态系统的核心位置,使各组织能够利用所需信息来实现创新并参与竞争 1.4. 数据不仅仅是数字,更是通往 ...
向量数据库选型与踩坑实录:Milvus vs Qdrant vs pgvector 生产横评
本文针对千万级企业 RAG 知识库场景,从写入吞吐、HNSW 索引构建、内存占用、标量过滤及运维复杂度等维度,深度横评 Milvus、Qdrant 与 pgvector,并提供 Spring Boot 3.x 实战集成方案与生产避坑指南。 ...
开源埋点分析系统能否上线?先做演示、接收、入库三层验收
开源埋点分析系统的部署不等于真实事件已入库。用 SensorFlow 的演示、许可证激活、神策 SDK 测试事件和 ClickHouse SQL,逐层验收数据链路与看板口径。 ...
读数据架构知识体系指南12数据导入方法
1. 数据采集策略 1.1. 选择合适的数据采集策略是一项重大的业务决策,它在一定程度上决定了企业用其数据进行业务决策和运营的水平 1.2. 风险很高:错误的策略可能会导致数据质量差、性能问题、成本增加,甚至违反监管合规性 1.3. 要谨慎考虑数据采集方法,不仅是技术必需,也是业务必需 2. ETL ...
读数据架构知识体系指南11数据建模方法(下)
1. Kimball模型 1.1. 更适合数据需求较简单的组织 1.2. Kimball的自底向上方法 1.2.1. 都是先将原始数据从每个OLTP源系统提取到临时关系暂存表中,不进行转换或清理 1.2.2. 数据集市通过DW总线(有时也称为信息总线)进行整合,以实现数据一致性 1.2.3. 为了在 ...
ClickHouse 漏斗 SQL 实测:毫秒事件、窗口边界与真实埋点表
用可运行的合成事件和 SensorFlow 真实事件表,验证 ClickHouse windowFunnel 的毫秒时间、严格递增、窗口边界和漏斗口径。 ...
为什么所有数据库都在用B树?5分钟让你豁然开朗
想象一下,你的数据库里有1000万条用户记录。你只想查其中一个人的信息。数据库只用了3毫秒就给出了结果。它是怎么做到的? 如果它傻乎乎地一条一条扫描过去,那可能需要好几秒甚至几分钟。但数据库不会这么干,它会用一个叫“索引”的东西。而这个索引,十有八九就是 B树。 MySQL、PostgreSQL、S ...
MySQL Router遭遇Too many open files错误引起监听端口异常案例.md
这个是几天前遇到的一个案例,MySQL Router的6446端口突然连接不上. 检查的时候,发现telnet 6446端口不通,而且MySQL Router服务正常,但是端口6446不见了.当时的现象如下所示: # netstat -ntlp | grep mysqlrouter tcp 0 0 ...
读数据架构知识体系指南10数据建模方法(上)
1. 数据建模方法 1.1. 数据建模是一种高级概念技术,用于设计数据库 1.2. 涉及识别需要存储的数据,然后创建这些数据及其之间关系的结构化表示,并将其组织成表格和列 1.3. 将这些表格和列视为数据库的逻辑表示,而存储在这些表格和列中的物理数据可以位于关系数据库产品或数据湖中 1.4. 将数据 ...
读数据架构知识体系指南09设计方法
1. 设计方法 1.1. 数据设计和数据建模是一对容易混淆的概念 1.2. 数据设计看作在建造一座城市 1.2.1. 涉及决定建筑物的位置、连接城市不同部分的道路以及交通流量的规划 1.3. 数据建模更像是在设计单个建筑物 1.3.1. 涉及决定房间的布局、房间如何连接以及每个房间的用途 2. 联机 ...
YashanDB 一把定位引起SWAP空间异常的会话和SQL语句
Oracle 运维靠 TEMP;YashanDB 中间结果换出主要落在 SWAP。SWAP 水位上涨或会话卡在 swapping vm block 时,先用 ytop -f swap.sql 收齐参数、页、水位、段与会话,再 ytop -f sql.sql 看文本和计划。文中用临时 LOB 与 HA... ...
读数据架构知识体系指南08架构设计会议
1. 架构设计会议 1.1. 架构设计会议是由技术专家主导,业务和技术利益相关者共同参与的结构化讨论 1.1.1. 其核心目的在于为特定的商业机会定义并规划收集数据解决方案的高层设计 1.2. 第一次架构设计会议是架构过程的开始,并将引发更多的讨论(很可能包括其他ADS),以支持数据解决方案项目 ...
软删除和唯一索引冲突:把 deleted_at 加进唯一索引,为什么反而不唯一了
软删除(逻辑删除)和唯一索引放在同一张表上,几乎是每个后端项目都会遇到的冲突:用户注销了账号,过两天想用同一个邮箱重新注册,结果插入报 Duplicate entry。因为那条"已删除"的记录还在表里,唯一索引可不管它删没删。 网上最常见的解法是"把 deleted_at 加进唯一索引"。这个解法有 ...
读数据架构知识体系指南07大数据
1. 大数据 1.1. 构建数据架构的公司数量在21世纪20年代出现了爆炸式增长 1.1.1. 主要原因是现在可用的数据比以往任何时候都多,数据可能来自社交媒体、物联网(IoT)设备、内部应用程序和第三方软件等 1.2. 在整个商业世界,企业都在争分夺秒地建立数据架构 1.2.1. 核心在于,在正确 ...


