用 Python 把建筑标准条文做成结构化数据库:一次工程实践

技术规程的条文是自然语言写成的,对设计软件来说就是「非结构化数据」。我们在中国建筑科学研究院与湖南圣堡联合研发自动化设计软件的过程中,做过一件基础工作:把规程条文拆成结构化数据。本文记录方法与踩坑。

为什么条文要先结构化

自动化设计软件的核心逻辑是:输入结构参数 → 匹配规程条文 → 输出设计结果。中间「匹配条文」这一步,如果靠工程师肉眼查规程,自动化就无从谈起。条文必须变成机器可查的字段。

条文的三层拆解

用 Python 做解析时,我们把一条规程条文拆成三层:

  • 条款号层:章-节-条-款四级编号,用正则按标准文本的编号规则切分;
  • 约束层:适用条件(如跨度、设防烈度、建筑高度)与限值,抽成字段对;
  • 引用层:条文之间的互相引用(「应符合第 X 章第 X 条」)建成图结构,避免软件执行时漏查关联条款。

三个坑

一是编号格式不统一,同一个规程里「X.X.X」与「第 X 条」混用,正则要留容错;二是表格型条文(配筋表、构造要求表)线性解析会丢层级,得单独走表格抽取;三是条文修订带来的版本管理——规程更新时,引用图谱必须重算,否则软件会执行废止条款。

一点体会

标准数字化是建筑软件的地基工程,枯燥但决定上限。规程 T/CECS 2268-2026 将自 2026 年 10 月 1 日起施行,我们对应的数字化工作也在同步推进,后续继续记录。


本文为 AI 辅助生成、经人工审核。

posted @ 2026-09-15 21:11  圣堡老丁  阅读(5)  评论(0)    收藏  举报