数据底座 数据工程-新BI时代-
--数据基建-AI 数据基座--存储-计算-管理-开发
数据形态 从结构化转向占比 80% 以上的非结构化数据
参考阿里和火山-
-- Lakebase OceanBase Lakebase
MetaLake
-- DataStudio:数据治理的工作台
旧时代基石——Airflow Spark Flink-老项目的维持
换一个词语:Apache Spark、Apache Flink 和 Apache Airflow 构成了现代大数据栈的核心
Airflow诞生于2014年 数据传递靠XCom,Airflow的DAG模型
Airflow不会死。它的插件生态、Operator库、社区规模,在可见的未来依然是最大的
新时代的-新项目的选型-让数据工程化
搭一个:DuckDB + Dagster + dbt + dlt
开发提验降低了一个数量级--边界点
MiniO RustFS
Duckdb
dlt : 做EL dlt(data load tool)
dbt dbt(Data Build Tool) 做模型 定义了一组资产,Dagster自动理解这些资产的依赖关系,决定什么时候刷新谁
dbt 是整个现代数据栈里使用率最高的工具之一
dbt(数据生成工具)是一个通过编写 select 语句来转换数据的开发环境
Kestra "先用YAML声明结构,关键计算节点再用代码
Kestra一个二进制文件就能跑,自带数据库(H2/Postgres)
Dagster 软件定义资产"(Software-Defined Assets,SDA)产出层
prefect 执行层
Fast MCP访问层
Flight
未来时代-新需求的解决
数据agent
AI已来,BI-到AI时代
数据agent-数据新动能
基础设施的使用方从工程师变成 Agent
数据使用者 从人变成 Agent(高频调用、并行执行、7×24 运行)
LLM:
Deepseek
智谱
agent 控制框架-代理
Zoo Code
Claude Code
nanobot-ai --ReAct范式 --用文本轨迹描述任务
用DAG描述任务--图演化历史-依赖感知执行--最小子图修复
IDE 集成开发环境(IDE,Integrated Development Environment )
传统桌面 IDE
Eclipse NetBeans 传统桌面 IDE 以代码编辑为中心,以项目为访问对象
1997年 (2022 年)是微软 Visual Studio 诞生 25 周年
2001年,IBM将Eclipse贡献给开源社区。它以插件化架构为核心
2016 年发布 VS Code 1.0 并开源
Visual Studio Code :轻量级但功能强大的文本编辑器 以文本编辑为中心,以文件和目录为访问对象
IntelliJ IDEA、IntelliJ IDEA :专业的Java开发工具
PyCharm: 专业的 Python集成开发环境
WebStorm:专业的 JavaScript和前端开发 工具
WebIDE 服务 - 随时随地编码,可管理可控制编码
开发者提供软件开发工具-云和 IDE 的厂商持续加强其工具和云服务的联系
原生智能IDE
GitHub Copilot
CodeArts 华为 CodeArts IDE
底层基于 Electron 框架,结合了 Web 技术(JavaScript/Node.js)与本地应用的高性能。
它采用了与 VS Code 相似的 模块化多进程架构
Qoder 阿里巴巴最新推出的 Qoder AI IDE
组成:
项目模型(Project Model) 二、索引(Index 三、语法(Syntax) 四、 语义(Semantics)
editplus
阶段 :辅助式代码编写--对话式重构-自主编程
数据资产
-数据要素
--数据标准和数据集和数据应用
--数据生产-数据流通-数据应用
---标品数据生产--伴生数据生产--个性数据生产
数据质量评估系统
质量评估通过完整性、准确性、一致性、唯一性、时效性、规范性等六个维度构建数据质量指标体系
数据质量管理 (Data Quality Management,简称DQM)
数据质量评估系统是用于监控、度量和保障企业数据资产准确性与可用性
数据质量的测量、评估、改善和保证
数据质量评级(DQR
高质量数据集 high-quality dataset
database
traditional client-server :I didn’t abandon PostgreSQL. I just stopped reaching for it first.
将重心转移到以问题为导向的工程设计时,不再是仅仅编写一次性脚本,而是开始构建系统
--- 通过建设来学习
日常工作充满了结构性瓶颈
数据应用-数据异常检测方法
异常检测方法:贝叶斯分析应作为探索性数据分析的一部分,
与其他方法(如Z-score检测异常值、重复值分析、时间序列分解等)结合使用,构建更全面的数据
数据隐私
数据失真风险
数据造假通常是为了欺骗人类,而数据投毒则是为了欺骗机
有目标(targeted)和无目标(non-targeted)两种
数据造假 反作弊系统 数据投毒
恶意数据
数据窃取
数据的随机不确定性
Agent 评估体系
数据服务 可观测性-运维管理
可观测性(Observability) 业务复杂度与”1-5-10"(1分钟内发现问题,5分钟内定位问题原因,10分钟内恢复故障)可用性保障目标
核心三大支柱 (Three Pillars)--从开发视角
tracing metric logging 可观测体系
链路 (Traces) 指标 (Metrics) 日志 (Logs)
从业务视角--明确数据观测目的与意义-生产可持续
日志、指标、链路、变更事件以及告警
定义监控链路和告警消息配置
固化排障路径 通过告警入口的下钻串联,搭建了 “告警通知→问题详情→业务看板→关联拓扑” 的通用问题排障路径
浙公网安备 33010602011771号