基于文本感知和非重复单词生成的图像语义理解

杨晨露; 万旺根; 王旭智; 孙学涛; 张振

摘要

在描述图像时，阅读视觉场景中的文本对于理解关键信息至关重要。传统的视觉语言预训练任务都无法指导模型关注图像中的文本信息，以及图像中的文本信息和图像内容的关系。针对此问题，提出基于图像文本信息的预训练任务，包括掩模语言建模（MLM）、图像-文本匹配（ITM）以及相对空间位置预测（RPP）。在解码过程中，为解决生成语句冗余问题，提出重复掩码模块，以避免预测语句中出现重复的单词。最后在Textcaps数据集上的实验结果表明，所提的方法可以有效地提高生成描述语句的准确率。

单位
上海大学; 通信与信息工程学院; 上海交通大学医学院附属仁济医院

收藏分享被引浏览

更新时间：2024-03-15 17:23

基于文本感知和非重复单词生成的图像语义理解

摘要

产品服务

站内浏览

服务支持

联系方式

科研之友