摘要
针对文本生成图像任务中文本信息与生成图像的语义一致性,以及图像细节模糊、图像要素空间搭配合理性问题,提出了融合BERT文本编码模型和AttnGAN生成对抗网络模型的文本生成图像方法。首先,在文本与图像语义一致性训练中,借助预训练BERT模型对文本进行句、字级别的特征编码,充分利用其在NLP任务中的优秀文本编码与强泛化能力深度匹配文本语义和图像区域的特征一致性;然后,在图像生成网络的第一阶段图像生成模块之前添加空间注意力模块,提高最终生成图像的语义一致性和空间位置的布局合理性。融合优化后的模型所生成的图像相比原AttnGAN模型,IS指标提升了0.17,FID指标降低了1.15,整体视觉效果更加细腻逼真,模型成功地在阿里天池服装数据集上应用,表明其具有良好的跨领域生成能力。
- 单位