基于物体检测及关系推理的视觉问答方法研究

邱真娜; 张丽红<sup>*</sup>; 陶云松

摘要

大多数图像描述及视觉问答任务中,主要工作是对图像数据的拟合分类,而缺乏图像中物体之间的关系推理,导致描述图像或回答问题时准确率不高.为解决该问题,本文提出一种基于物体检测及关系推理的视觉问答模型.该模型由上游网络和下游网络两部分组成,上游网络采用极快速区域卷积神经网络,下游网络由多层感知机组成的多模态特征融合推理网络构成.上游网络对图像进行物体检测与特征提取,利用长短期记忆网络对提问的问题进行信息提取以嵌入下游网络;下游网络对问题和图像的特征进行融合和推理,进而得出答案.采用数据集CLEVR进行模型训练与视觉问答测试,实验结果表明,本模型与其他已有模型相比,图像中物体之间关系推理的准确率获得了提高,达到98.96%.

单位
电子工程学院

收藏分享被引浏览

更新时间：2024-04-12 11:28

基于物体检测及关系推理的视觉问答方法研究

摘要

产品服务

站内浏览

服务支持

联系方式

科研之友