利用全局与局部帧级特征进行基于共享注意力的视频问答
视频问答是视觉理解领域中非常重要且具有挑战性的任务.目前的视觉问答(VQA)方法主要关注单个静态图片的问答,而现实生活中的数据是立体动态的视频.此外,由于问题的复杂性,视频问答任务必须根据问答问题恰当地处理多种视觉特征才能获得高质量的答案.文中提出了一个通过利用局部和全局帧级别的视觉信息来进行视频问答的多共享注意力网络.具体来说,以不同帧率提取视频帧,并以此提取帧级的全局与局部视觉特征,这两种特征包含了多个帧级别特征,用于对视频时间动态建模,再以共享注意力的形式建模全局与局部视觉特征的相关性,然后结合文本问题来推断答案.在天池视频问答数据集上进行了大量的实验,验证了所提方法的有效性.
视频问答;共享注意力机制;全局和局部帧级特征
48
TP391(计算技术、计算机技术)
科技部重点研发计划;中央高校基本科研业务费专项资金
2021-08-20(万方平台首次上网日期,不代表论文的发表时间)
共5页
145-149