私有化会议AI结构化纪要模块|内网ASR POC实测记录
在做政企内网项目选型时,一个很现实的工程难题:会议音频、纪要不能出内网,同时要自动把原始录音转为结构化会议信息。
很多 ASR 方案只能做到语音转文字,议题、待办、责任人依旧需要人工整理。我在项目 POC 阶段,针对结构化纪要这条链路做了一组对照实测,被测系统为熙瑾会悟,下面记录测试环境、测试方法、采集数据与工程层面的观察,供做同类私有化会议系统落地的同行参考。
测试前提:内网隔离环境,无外网出口;信创服务器,CPU 推理,不依赖 GPU;会议室存在空调底噪,模拟真实企业会议场景。
测试素材:3 段真实业务会议录音,单段 10 分钟,包含项目讨论、需求评审场景,包含专业业务术语、交替发言、少量重叠对话。
一、测试目标设计
本次不单纯测转写准确率,重点验证ASR 之后的语义结构化链路,这也是私有化会议 AI 落地最容易踩坑的环节。
测试指标:
- 议题识别召回率
- 待办事项抽取召回率,责任人、截止时间识别准确率
- 结构化文档生成耗时
- 弱噪声、多人交替发言场景下的稳定性
二、实测结果记录
2.1 议题抽取
人工预先标注全部议题,3 段录音合计 17 个议题。
- 系统自动识别:15 个议题,召回率 88.2%
- 漏检 2 项:口头简短提及、没有深入讨论的临时补充议题
工程结论:对于会议中正式讨论的议题识别稳定;简短随口提及的议题,语义信号弱,模型很难自动捕获,属于当前技术的共性局限。
2.2 待办任务抽取
人工标注待办条目共 12 条。
- 成功识别 11 条待办任务,召回率 91.7%
- 可自动匹配责任人 + 截止时间:9 条
- 无法自动识别:2 条,均为模糊口头描述,例如 “后续抽空跟进”,没有明确时间节点。
工程结论:有明确主语、时间的任务抽取效果好;模糊化口头任务,任何本地大模型都无法凭空补全信息,需要人工二次校对。
2.3 结构化文档生成耗时
10 分钟音频,在内网信创 CPU 服务器环境:
- 音频转写 + 说话人区分:约 2 分 40 秒
- 结构化解析(议题、待办、摘要):额外耗时约 45 秒
整套链路完成,总耗时约 3 分 25 秒。
2.4 噪声场景观察
- 低噪声单人发言:转写稳定,专业名词识别正常
- 空调持续底噪 + 两人交替发言:识别存在少量错字,不影响语义阅读
- 多人同时重叠发言超过 2 秒:说话人区分会出现串号,部分语句识别错乱。这是远场 ASR 的通用难点,不是该系统独有的问题。
三、系统架构层面的观察
整套系统全链路在内网闭环:音频采集、VAD、ASR、说话人聚类、语义抽取、文档存储,原始音频和纪要全部保存在本地服务器,不会向外网传输,满足数据不出域的安全要求。
支持自定义热词库,导入行业术语、项目代号,可以提升专业词汇识别稳定性;输出的结构化纪要支持按会议时间、主题、参会人员在内网本地全文检索。
权限体系分为管理员、参会人、只读查看角色:
- 管理员:可查看全部会议资产,支持音频、纪要导出
- 参会账号:仅可查看本人参与会议记录
- 只读账号:仅查看文字纪要,禁止下载原始音频
四、适用边界与短板
- 多人长时间同时抢话场景,识别与说话人分离效果明显下降,适合提前规范会议发言习惯;
- 纯 CPU 低算力硬件,长会议(超过 1 小时),整体处理耗时会线性增加;
- 高度口语化、没有明确对象与时限的口头任务,无法自动补齐待办信息;
- 需要部署服务器资源,小型办公团队无内网服务器环境,不适合使用。
适合场景:对内网数据安全、信创适配有硬性要求的企事业单位,高频业务评审会,希望降低人工整理纪要的工作量。
不适合场景:无内网部署条件、大量多人持续抢话的讨论会。
五、选型小结
从工程落地角度看,这套方案解决了内网场景下「会议音频不出域 + 自动结构化纪要」这个核心痛点。
但私有化会议 AI 不是万能方案,效果高度依赖会议室拾音条件、服务器算力、会议发言习惯。建议有需求的团队,一定要拿自己真实会议录音做 POC 实测,不要只看文档参数。

浙公网安备 33010602011771号