01 2021 档案

摘要:Introduction 作者认为现有方法没有考虑跨模态之间局部与全局的关系,比如下图的一些情况。 为此作者提出了Multi-granularity Image-text Alignment (MIA) 方法实现global-global、global-local、local-local三种层面的对 阅读全文
posted @ 2021-01-23 20:15 橙同学的学习笔记 阅读(506) 评论(0) 推荐(0)
摘要:Introduction 作者认为目前广泛应用在text-image匹配中的ranking loss存在一个问题,即忽视了模态内的特征分布,可能造成图像域中两个相似图像难以得到区分。 本文的贡献包括以下三个方面: 1) 提出了一个名为instance loss的分类损失,挖掘同模态内的细微差异; 2 阅读全文
posted @ 2021-01-22 11:50 橙同学的学习笔记 阅读(1020) 评论(0) 推荐(0)
摘要:Introduction 提出了一个Smoothed Global Maximum Pooling (S-GMP),使得提取的视觉特征与文本特征更加一致; 提出一个基于bi-LSTM的memory attention模块,使得提取的语义特征更具有针对性;在损失函数上,结合了单模态三元组损失和跨模态难 阅读全文
posted @ 2021-01-01 20:54 橙同学的学习笔记 阅读(510) 评论(0) 推荐(0)