论文阅读:《Chinese Relation Extraction with Multi-Grained Information and External Linguistic Knowledge》
Li Z, Ding N, Liu Z, et al. Chinese relation extraction with multi-grained information and external linguistic knowledge[C]//Proceedings of the 57th Annual Meeting of the Association for Computational Linguistics. 2019: 4377-4386.
该方法的 github 实现
引言
针对现有方法的分割错误和多义歧义问题,提出一种多粒度框架(MG lattice):
(1)该模型采用基于格子的结构,将词级特征动态集成到基于字符的方法中,从而避免分割错误。
(2)借助外部语言知识HowNet对多义词的多重意义进行建模,以减轻多义歧义
传统上,根据粒度的差异,现有的大多数中文RE方法可以分为两种:基于字符的RE和基于单词的RE。
(1)基于字符的RE:将每个输入的句子视为一个字符序列。不能充分利用单词级信息。
(2)基于单词的RE:首先先进行分词,然后派生一个词序列到神经网络模型中。会受到分词质量的显著影响。如:“达尔文研究所有杜鹃” -> “达尔文/研究/所有/杜鹃” 和 “达尔文/研究所/有/杜鹃”
模型框架

(1)输入:包含两个目标实体的中文句子。模型同时利用单词级和字符级信息。
(2)编码器:使用晶格结构LSTM网络为每个输入实例构建分布式表示,将外部知识纳入词义消歧中。
(3)关系分类器。在学习了隐藏状态后,将调整字符级机制以合并特征。然后将最后的句子引用输入到 softmax 分类器中以预测关系。
输入
同时利用字符级和单词级信息。
字符级信息
(1)将基于字符的句子作为直接输入,即将每个输入句子视为一个字符序列。
(2)此外,利用位置嵌入来指定实体对,这些实体对被定义为从当前字符到头部和尾部实体的相对距离。
(3)最后每个字符xci的输入表示为该字符的字符嵌入和两个位置嵌入的连接。
(4)最终的输入序列为所有字符的输入表示xc = {xc1, ... ,xcM}
单词级信息
(1)单词级信息为与词典 D 中的单词匹配的任何字符子序列。并用word2vec表示。
(2)word2vec忽略了单词的语义信息,因此将HowNet作为外部知识库纳入模型中。
编码器
编码器的直接输入是一个字符序列字符级信息,以及词典 D 中所有潜在的单词单词级信息。训练后,编码器的输出是输入句子的隐藏状态向量 h。
Basic Lattice LSTM Encoder
传统的LSTM由4个基本的门结构组成:
(1)输入门ij:控制哪些信息进入模型
(2)输出门oj:控制模型输出哪些信息
(3)遗忘门fj:控制模型中哪些信息将被移除
(4)当前单元格状态 cj 记录到当前时间的所有历史信息流
传统的LSTM可以处理单词级信息,但无法处理其多义性。
MG Lattice LSTM Encoder
对于与词典 D 匹配的每个单词,将其所有意义表示纳入计算。然后将所有感官合并到一个综合表示中。
分类器
(1)首先采用字符级注意力机制将隐藏状态向量 h 合并到句子级特征向量 h* 中。(句子的表示 h∗ 被计算为 h 中所有字符特征向量的加权和)
(2)为了计算每个关系的条件概率,将句子 S 的特征向量 h∗ 输入到 softmax 分类器中。
(3)最后,给定所有训练样本,使用交叉熵定义目标函数。
(4)为了避免隐藏单元的共同适应,在前向传播过程中使用dropout。

浙公网安备 33010602011771号