20260804 基于多视角匹配的中文问答对自动生成框架
20260804 基于多视角匹配的中文问答对自动生成框架
阅读目的:学习多视角匹配模型和BERT阅读理解模型的应用方式,为CDSS研究中的问答生成提供方法参考
核心贡献:提出三阶段问答对生成框架——关键词抽取(NER+规则)→问题生成(多视角匹配)→答案生成(BERT阅读理解),能过滤80%不匹配问答对
1. 文献档案 (Metadata)
引用格式:尹文峰,黄莉,顾进广.基于多视角匹配的中文问答对自动生成框架[J].计算机应用与软件,2024,41(3):163-168.
- 题目:基于多视角匹配的中文问答对自动生成框架
- 英文题目:Automatic Generation Framework of Chinese Question and Answer Pair Based on Multi-View Matching
- 作者:尹文峰,黄莉,顾进广
- 机构:
- 1.武汉科技大学计算机科学与技术学院,湖北武汉430065
- 2.武汉科技大学大数据科学与工程研究院,湖北武汉430065
- 3.湖北省智能信息处理与实时计算重点实验室,湖北武汉430065
- 期刊/会议:计算机应用与软件
- 级别:北大核心
- 链接:https://kns.cnki.net/kcms2/article/abstract?v=xC-_u-weiHuBSiQGa5GUmgFGhmL3tm67raESTdMd_01tKgkYa501U1UrRtsALehbGy9Z2bSeDvrfJI_JRsCUb_se-3Xd_j1jVb-ZQyzkn4VzYrzGtFYlMF0YMdl6CvbV6fUjkpAr89XfV0C2Cusob-mF9-GhCijr1ELHn_9mhDuBtNaD2I8p8w==&uniplatform=NZKPT&language=CHS
- DOI:10.3969/j.issn.1000-386x.2024.03.025
- 收稿日期:2020-12-25
- 基金:国家自然科学基金项目(61671304);国家自然科学基金重大研究计划(118A0189);湖北省自然科学基金项目(2018CFB594)
- 标签:#问答生成 #多视角匹配 #BERT #关键词抽取 #NER
2. 文章框架与思路 (Structure)
2.1 整体结构
摘要:问题→方法(三阶段)→结果(过滤80%不匹配)
↓
0 引言(5段):意义→分类→演进→进展→gap
↓
1 相关研究(6段):模板方法→神经网络→答案抽取→问题生成→代词消解→gap+本文
↓
2 问答对生成
├── 2.1 模型架构(三阶段流程图)
├── 2.2 关键词抽取(NER+规则)
├── 2.3 问题生成(多视角匹配)
└── 2.4 答案生成(BERT阅读理解)
↓
3 实验与结果分析
├── 3.1 数据集(军事智能机器阅读挑战赛)
├── 3.2 实验设置
└── 3.3 实验结果(5个实验/验证)
↓
4 结语:贡献+未来方向
2.2 每章思路
引言:
- 段1:问题生成的意义(教育、评估理解、扩充数据集)
- 段2:现有方法两大类(模板 vs 神经网络)
- 段3:神经网络方法演进(无答案→有答案→段落级别)
- 段4:具体技术进展(多视角匹配、代词消解)
- 段5:中文领域空白(gap推导)+ 本文三阶段方法
第1节 相关研究:
- 段1:模板方法起源(1976年Wolfe),依赖手工规则
- 段2:神经网络方法优势,两阶段任务分解(答案抽取+问题生成)
- 段3:答案抽取方法(实体选择、指针网络)
- 段4:问题生成方法(Seq2Seq、多视角匹配),本文借鉴Song等
- 段5:代词消解(Du等),解决"他""这"等代词问题
- 段6:中文领域gap + 本文三阶段方法
第2节 方法:
- 2.1:三阶段流程图(关键词→问题→答案)
- 2.2:NER+规则抽取关键词(不用TF-IDF/TextRank)
- 2.3:多视角匹配生成问题(全匹配+注意力匹配+最大值匹配)
- 2.4:BERT阅读理解抽取答案(最大化P(A|C,Q))
第3节 实验:
- 3.1:军事智能机器阅读挑战赛数据(24,844条→21,396条有效)
- 3.2:实验设置(Jieba+HanLP+BERT+TensorFlow+PyTorch)
- 3.3:5个实验/验证(关键词抽取、问题生成、答案置信度、阅读理解、过滤效果)
第4节 结语:
- 贡献:三阶段框架、过滤80%不匹配问答对
- 未来:更多问题类型、推理型问题
2.3 逻辑主线
问题:问答对生成中问题与答案不匹配
↓
现有方法不足:
- 模板方法泛化差
- 神经网络方法忽略答案匹配
- 中文问题生成研究少
↓
本文方案:三阶段框架
第1阶段:NER+规则抽取关键词(确定问什么)
第2阶段:多视角匹配生成问题(怎么问)
第3阶段:BERT阅读理解生成答案(验证答案存在)
↓
验证:过滤80%不匹配问答对
3. 核心概念与疑问 (Concept & Q&A)
Q1:这个课题为什么值得研究?
问题生成对语言学习、教育、评估理解和扩充问答数据集有重要意义。但现有方法大多在英文数据集(SQuAD)上训练,直接用于中文效果不好。中文领域已有的方法要么依赖手工模板(Zheng等),要么抽取的答案只是关键词而非真正答案(Kumar等)。此外,现有方法普遍存在问题与答案不匹配的问题。因此,需要一种适合中文的、能保证问答对匹配的方法。
Q2:目前正在用什么方法处理问题?已经做到了哪一步?
| 阶段 | 代表方法 | 当前状态 |
|---|---|---|
| 模板方法 | 手工编写规则(1976年Wolfe) | 已有,泛化差 |
| 神经网络(无答案输入) | Du等(2017) Seq2Seq | 问题发散 |
| 神经网络(有答案输入) | 答案作为特征 | 比无答案好 |
| 多视角匹配 | Song等(2017) | 优化长文本匹配 |
| 代词消解 | Du等(2017) | 解决代词问题 |
| 阅读理解辅助 | BERT | 用于答案验证 |
中文领域的研究还比较薄弱,Zheng等用规则方法,Kumar等用跨语言迁移,效果都不够好。
Q3:为什么现有的成果还不够?
| 不足 | 说明 |
|---|---|
| 问答不匹配 | 只关注问题质量,忽略答案是否匹配 |
| 中文效果差 | 英文方法直接用于中文不理想 |
| 答案不准确 | Kumar等抽取的答案只是关键词,不是真正答案 |
| 依赖模板 | 基于模板的方法泛化能力差 |
| 无法验证 | 没有机制过滤不匹配的问答对 |
Q4:现在认为的问题成因、机制是什么?
- 关键词≠答案:关键词抽取不准确,生成的问题可能偏离主题
- 缺乏验证机制:生成问题后没有验证原文中是否真的有对应答案
- 两步方法的缺陷:先抽答案再生成问题,但抽取的答案可能只是关键词
- 中文领域特殊性:英文方法的语义特征在中文上不适用
本文解决方案:三阶段框架,第3阶段用BERT阅读理解验证答案是否存在,过滤不匹配的问答对。
Q5:成因、机制的理论基础是什么?
| 理论 | 在本研究中的应用 |
|---|---|
| 命名实体识别(NER) | 从文本中抽取关键词(ORG、PER、LOC),确定问题主题 |
| 多视角匹配 | 全匹配+注意力匹配+最大值匹配互补,让关键词和文本充分匹配 |
| Seq2Seq模型 | 将匹配信息解码为自然语言问题 |
| BERT阅读理解 | 从原文中抽取答案,验证问答对是否匹配 |
Q6:论文作者建议的未来研究方向是什么?
- 更多问题类型:用模板方法构建更丰富的问题类型,增强数据多样性
- 推理型问题:将多个问答对链接起来,生成需要多步推理才能回答的复杂问题
Q7:综合以上,你的研究需要填补的真正空白是什么?
这篇论文展示了三阶段框架的设计思路(关键词抽取→问题生成→答案生成),以及多视角匹配和BERT阅读理解的应用方式。但它在军事领域验证,且实验设计有明显不足(无消融实验、无细粒度分析、答案置信度实验模糊)。对于CDSS研究:
- 三阶段框架思路可套用:指南实体识别→指南问题生成→指南答案抽取
- 多视角匹配方法可用于指南文本中关键信息的匹配
- BERT阅读理解可用于从指南文本中抽取临床建议
- 应避免它的实验设计不足(无消融实验、无细粒度分析)
4. 痛点与动机 (Motivation)
-
现有问题:
- 问答对生成中问题与答案不匹配
- 基于模板的方法泛化能力差
- 中文问题生成研究较少
- 现有中文方法答案不准确(只是关键词)
-
本文思路:
- 三阶段框架:关键词抽取→问题生成→答案生成
- 关键词抽取用NER+规则,确定主题
- 问题生成用多视角匹配模型
- 答案生成用BERT阅读理解验证
5. 核心方法 (Methodology)
5.1 三阶段模型架构
文本输入
↓
第1阶段:关键词抽取
→ NER识别实体(ORG、PER、LOC)
→ 规则标注(书名号标LW)
→ Jieba分词+词性标注
→ 连续关键词连接成短语
↓
第2阶段:问题生成
→ 关键词 + 上下文输入多视角匹配模型
→ 三种匹配:全匹配、注意力匹配、最大值匹配
→ 余弦相似度计算匹配程度
→ 双向LSTM解码生成问题
↓
第3阶段:答案生成
→ 文章C + 问题Q输入BERT
→ 最大化P(A|C,Q)
→ 从文章中抽取连续子序列作为答案
5.2 关键词抽取(NER+规则)
| 步骤 | 做法 |
|---|---|
| 步骤1 | 根据规则将书名号内容标注为LW |
| 步骤2 | 使用NER识别组织机构名(ORG)、人名(PER)、地名(LOC) |
| 步骤3 | 使用Jieba分词进行词性标注 |
| 步骤4 | 通过词性规则将连续关键词连接成短语 |
5.3 多视角匹配(三种方式)
| 匹配方式 | 做法 | 特点 |
|---|---|---|
| 全匹配 | 答案每个词与文章每个词匹配 | 精确定位位置 |
| 注意力匹配 | 答案向量加权求和后与文章匹配 | 关注整体语义 |
| 最大值匹配 | 文章向量逐个选最大值匹配 | 捕获最强信号 |
最终匹配向量:m = [m^full, m^att, m^max](三种方式拼接)
解码层:带注意力机制的双向LSTM,逐字生成问题
5.4 BERT阅读理解
- 输入:文章C + 问题Q
- 任务:预测答案在文章中的起始和结束索引
- 目标:最大化条件概率P(A|C,Q)
- 输出:连续子序列作为答案
6. 实验与结果 (Experiments)
6.1 数据集
| 维度 | 内容 |
|---|---|
| 来源 | 翰典全国第二届"军事智能机器阅读"挑战赛 |
| 原始数据 | 24,844条(5篇文档+1个问题) |
| 有效数据 | 21,396条(去除无法支持答案的段落) |
| 划分 | 训练集16,237个,验证集4,639个,测试集2,320个 |
6.2 实验设置
| 模块 | 工具/参数 |
|---|---|
| 关键词抽取 | Jieba + HanLP + BERT + BiLSTM-CRF |
| 问题生成 | TensorFlow 1.14.0 + 中文词向量 |
| 答案生成 | PyTorch 1.4.0 + BERT-wm |
6.3 实验结果
实验1:关键词抽取(表2)
| 方法 | 召回率(%) | 准确率(%) | F1(最优关键词) |
|---|---|---|---|
| TextRank | 43 | 72 | 28 |
| NER+规则 | 67 | 20 | 61 |
关键发现:NER+规则虽然准确率低,但最优关键词F1远超TextRank(61 vs 28)。
实验2:问题生成(表3)
| 方法 | Bleu1 | Bleu2 | Bleu3 | Bleu4 | Rouge |
|---|---|---|---|---|---|
| HAS | 38.50 | 22.80 | 15.52 | 11.18 | 30.98 |
| 英文Seq2Seq | 43.02 | 27.40 | 19.40 | 14.30 | 41.50 |
| 中文Seq2Seq | 55.39 | 48.84 | 44.24 | 40.69 | 55.42 |
关键发现:中文Seq2Seq在所有指标上都最优,Bleu1比HAS高44%。
实验3:答案置信度(表4)
| 方法 | Unigram | Bigram | Trigram |
|---|---|---|---|
| HAS | 841.39 | 608.21 | 213.34 |
| ACOG | 654.28 | 418.46 | 166.53 |
| Seq2Seq | 445.69 | 908.95 | 310.89 |
关键发现:Seq2Seq在Bigram和Trigram上最优,生成的问题更流畅、更自然。
实验4:阅读理解
| 数据集 | F1 |
|---|---|
| CMRC2018 | 87.4 |
| 本文数据集 | 82.6 |
实验5:过滤效果
从10万篇军事新闻中生成问答对,过滤80%不匹配问答对。
6.4 实验设计评价
| 优点 | 不足 |
|---|---|
| 按阶段验证(每个阶段单独实验) | 无消融实验 |
| 有对比方法(TextRank、HAS、ACOG) | 无细粒度分析 |
| 多指标(Bleu1-4、Rouge、F1) | 答案置信度实验描述模糊 |
| 实验设置详细 | 过滤效果实验太粗 |
7. 思考与评价 (Comments)
-
优点:
- 三阶段框架设计清晰,逻辑完整
- NER+规则的关键词抽取在最优关键词上效果好(F1=61%)
- 多视角匹配三种方式互补,设计合理
- 能过滤80%不匹配问答对,实用性强
- 引言的gap推导逻辑清晰(英文→中文→现有方法不足→本文)
-
不足:
- 无消融实验:不知道三个阶段各自贡献了多少
- 答案置信度实验描述模糊:公式没写、分数含义不清
- 阅读理解实验太简单:只有一个F1值,没有和其他方法对比
- 过滤效果实验太粗:只说"过滤80%",数字表述有矛盾
- 无细粒度分析:不知道哪类问题生成得好,哪类不好
- 结语缺少局限性分析:没有承认方法的不足
- 数据集来自军事领域,泛化性未验证
-
启发:
- 三阶段框架思路可借鉴到CDSS:指南实体识别→指南问题生成→指南答案抽取
- 多视角匹配方法可用于指南文本中关键信息的匹配
- BERT阅读理解在医学文本上的应用值得尝试
- gap推导方法值得学习:英文→中文→现有不足→本文
- 实验设计应避免:一定要做消融实验、细粒度分析、误差分析
- 引入LLMs:作者这篇文章是2020年写的,现在如果做可以考虑用LLM技术实现
记录时间:20260804

浙公网安备 33010602011771号