论文阅读:《Chinese Relation Extraction with Multi-Grained Information and External Linguistic Knowledge》

Li Z, Ding N, Liu Z, et al. Chinese relation extraction with multi-grained information and external linguistic knowledge[C]//Proceedings of the 57th Annual Meeting of the Association for Computational Linguistics. 2019: 4377-4386.
该方法的 github 实现

引言

针对现有方法的分割错误和多义歧义问题,提出一种多粒度框架(MG lattice):

(1)该模型采用基于格子的结构,将词级特征动态集成到基于字符的方法中,从而避免分割错误。
(2)借助外部语言知识HowNet对多义词的多重意义进行建模,以减轻多义歧义

传统上,根据粒度的差异,现有的大多数中文RE方法可以分为两种:基于字符的RE和基于单词的RE。

(1)基于字符的RE:将每个输入的句子视为一个字符序列。不能充分利用单词级信息。
(2)基于单词的RE:首先先进行分词,然后派生一个词序列到神经网络模型中。会受到分词质量的显著影响。如:“达尔文研究所有杜鹃” -> “达尔文/研究/所有/杜鹃” 和 “达尔文/研究所/有/杜鹃”

模型框架

(1)输入:包含两个目标实体的中文句子。模型同时利用单词级和字符级信息。
(2)编码器:使用晶格结构LSTM网络为每个输入实例构建分布式表示,将外部知识纳入词义消歧中。
(3)关系分类器。在学习了隐藏状态后,将调整字符级机制以合并特征。然后将最后的句子引用输入到 softmax 分类器中以预测关系。

输入

同时利用字符级和单词级信息。

字符级信息

(1)将基于字符的句子作为直接输入,即将每个输入句子视为一个字符序列。
(2)此外,利用位置嵌入来指定实体对,这些实体对被定义为从当前字符到头部和尾部实体的相对距离。
(3)最后每个字符xci的输入表示为该字符的字符嵌入和两个位置嵌入的连接。
(4)最终的输入序列为所有字符的输入表示xc = {xc1, ... ,xcM}

单词级信息

(1)单词级信息为与词典 D 中的单词匹配的任何字符子序列。并用word2vec表示。
(2)word2vec忽略了单词的语义信息,因此将HowNet作为外部知识库纳入模型中。

编码器

编码器的直接输入是一个字符序列字符级信息,以及词典 D 中所有潜在的单词单词级信息。训练后,编码器的输出是输入句子的隐藏状态向量 h。

Basic Lattice LSTM Encoder

传统的LSTM由4个基本的门结构组成:

(1)输入门ij:控制哪些信息进入模型
(2)输出门oj:控制模型输出哪些信息
(3)遗忘门fj:控制模型中哪些信息将被移除
(4)当前单元格状态 cj 记录到当前时间的所有历史信息流

传统的LSTM可以处理单词级信息,但无法处理其多义性。

MG Lattice LSTM Encoder

对于与词典 D 匹配的每个单词,将其所有意义表示纳入计算。然后将所有感官合并到一个综合表示中。

分类器

(1)首先采用字符级注意力机制将隐藏状态向量 h 合并到句子级特征向量 h* 中。(句子的表示 h∗ 被计算为 h 中所有字符特征向量的加权和)
(2)为了计算每个关系的条件概率,将句子 S 的特征向量 h∗ 输入到 softmax 分类器中。
(3)最后,给定所有训练样本,使用交叉熵定义目标函数。
(4)为了避免隐藏单元的共同适应,在前向传播过程中使用dropout。

posted @ 2024-06-17 11:07  Barn  阅读(118)  评论(0)    收藏  举报