做数据这行,有时候觉得自己在追一列已经开动的火车。
昨天又有几件事发生,值得记一下。
国际动态
dbt 宣布支持 Apache Flink,批流终于用同一套工具了
长期以来,数据工程师的日子有点分裂:批处理用 dbt,流处理用另一套框架,两个工具链,两种思维方式,两拨代码评审。
这件事上周有了变化。
技术博主 Kai Waehner 在 3 月 26 日详细记录了 dbt 接入 Apache Flink 的进展——通过 dbt-flink adapter,工程师可以用同一份 dbt 项目文件,同一套 ref() 依赖解析,同一组测试和文档命令,同时跑批处理和流式管道。
适配的平台包括 Snowflake、BigQuery、Databricks 和 Confluent。
这不是小事。流批统一喊了好几年,以前靠架构升级,现在靠工具层收口,对中小团队来说门槛低了很多。不用再为"要不要招一个懂 Flink 的人"纠结了——会写 SQL + dbt 就够入门。
当然,能不能在生产环境跑稳,还得等社区反馈。
Databricks:80% 的新数据库,是 AI Agent 建的
这个数字有点让人发愣。
Databricks 最近披露,平台上超过 80% 的新数据库,现在由 AI Agent 自动创建,而不是人工操作。
这说明了一件事:数据工程的"体力活"正在被快速代理掉。建库、建表、写初始 DDL——这类工作的价值在下降。
不过这条新闻有个背面:Agent 建的库,出了问题谁来查?数据血缘怎么追踪?治理的复杂度并没有消失,只是从"建"转移到了"管"。
从 ETL 工具人到 Agent 的审计员,可能是下一段职业转型。
PAR²-RAG:多跳问答准确率最高提升 23.5%
(稍微技术一点,可以跳过)
RAG 是什么:一种让大模型先检索相关文档再回答的技术,通俗说就是"先查资料再开口"。多跳问答就是需要查好几步才能得出结论的问题,比如"A 公司的 CEO 的前一家公司的主要产品是什么"——需要连跳好几个知识节点。
最新研究提出的 PAR²-RAG 方法,把检索拆成"先广撒网、再逐层收敛"两个阶段,避免传统方式过早卡死在错误路径上,在四个基准测试上明显领先,最高准确率提升 23.5%。
对数据人的意义:如果你在做内部知识库或数据资产搜索,这类方法的迭代值得关注。
国内动态
2026 年定调:这是"数据要素价值释放年"
国家发改委对今年数据工作做出了明确部署,核心定调是:2026 年是数据要素价值释放年。
8 项重点任务里,几个值得关注的方向:
- 数据赋能 AI 发展:高质量数据集的建设被列为重点,政府在推动医疗、工业等领域的标注数据规范化
- 一体化数据市场培育:数据交易规模目标是增长 1 倍,全国数据市场互联互通在推进
- 数据基础设施:底层管道要跟上,不只是算法和模型
配套的量化目标:数据产业年均增速超 20%,打造 300 个以上典型应用场景。
这是政策层面的信号,不等于市场会立刻跟上。但如果你在找数据相关的政府项目或 ToG 机会,这个方向的需求会比较确定。
另一个背景数据:2025 年全国数据生产总量已突破 50ZB,七大数据标注基地完成标注规模 17282TB,医疗、工业等领域高质量数据集超 300 个。
数据的量不是问题,怎么用才是问题。
简评
昨天这几条新闻放在一起,隐约有一个共同的主题:
"人做的事正在被工具和政策接管,真正稀缺的是判断力。"
dbt 统一批流——工具变简单了,但架构决策没人替你做。
Agent 建库——创建的活儿自动化了,但数据质量和治理的判断还在人这里。
数据要素政策——数据交易的市场在长,但谁的数据值钱、怎么定价,没有标准答案。
这不是坏消息。只是在提醒:你的价值,往往藏在工具搞不定、政策覆盖不到的那些角落里。
来源:Kai Waehner 技术博客(2026-03-26)、Databricks 官方报告、DataPipe AI早报(2026-04-01)、国家发改委 2026 年数据工作部署、数据智能研究报告(2025)
浙公网安备 33010602011771号