视觉问答(VQA)是一项人工智能任务,要求系统回答关于图像的自然语言问题。它处于计算机视觉和自然语言处理的交叉领域,要求模型不仅能识别图像中的物体、场景和活动,还要理解问题的语义,并基于视觉内容进行推理以给出正确答案。VQA被视为更高层次视觉理解与推理的基准,超越了简单的图像分类或图像描述任务。
该任务通常涉及输入一张图像和一个自由格式文本形式的问题,预期输出为简洁的答案,通常是单个单词或短语。VQA系统必须应对多种问题类型,包括关于物体存在性、颜色、数量、空间关系的问题,甚至包括超出直接可见内容的常识推理。该领域在2010年代中期随着大规模数据集的出现和深度学习技术的应用而获得显著发展,此后已成为多模态AI模型的标准评估方式。
数据集与基准
VQA数据集于2015年由弗吉尼亚理工大学和微软的研究人员首次发布,成为该任务的事实标准基准。最初的VQA数据集包含来自Microsoft COCO数据集的超过20万张图像和60万个问题,每个问题都与人类标注者收集的多个真实答案配对。该数据集旨在要求多种技能,包括物体识别、计数和空间推理。后续版本(如VQA 2.0)平衡了答案分布,以减少语言偏差,即模型可以仅根据问题模式猜测答案而无需查看图像。其他值得注意的基准包括Visual Genome,它提供物体、属性和关系的密集标注,以及CLEVR,这是一个合成数据集,通过生成简单3D形状的图像并提出需要多步逻辑的问题来测试组成性推理能力。
方法与架构
早期VQA系统使用卷积神经网络(CNN)用于图像特征提取,以及循环神经网络(RNN)或长短期记忆网络(LSTM)用于问题编码。这些特征随后被融合,通常通过逐元素乘法或连接,并传递给分类器以预测答案。注意机制的引入带来了重大突破,使模型能够根据问题聚焦于图像的相关区域。2017年提出的Transformer架构进一步革命化了该领域,通过统一处理视觉和文本索引。现代VQA模型,例如基于视觉-语言预训练的模型,在大规模图像-文本对上预训练的大型Transformer模型,并在VQA数据集上进行微调。这些模型通常与大型语言模型集成,能够生成自由形式的答案并进行复杂推理,有时甚至无需对VQA数据显式微调。
挑战与局限
尽管取得了显著进展,VQA仍然是一个具有挑战性的任务。一个主要问题是语言偏差:模型可能利用训练数据中的统计规律来回答问题,而无需真正理解图像。例如,模型可能对以“有多少”开头的问题回答“2”,因为这在该数据集中是最常见的答案。为此,创建了VQA 2.0数据集,确保每个问题都有不同答案的补充图像,以缓解这一问题。另一个挑战是组合泛化,即模型难以回答需要已知概念新组合的问题。此外,VQA系统通常无法回答需要外部知识或常识推理的问题,例如“为什么这个人在微笑?”或“接下来会发生什么?”对对抗样本和分布外图像的鲁棒性也是一个问题,因为模型可能容易受到微小扰动的影响。
应用
VQA在各个领域都有实际应用。在无障碍领域,它可以辅助视障人士回答关于周围环境的问题,例如阅读标志或识别物体。在人机交互中,VQA支持更自然的接口,允许用户在聊天或搜索系统中询问图像相关问题。在医疗领域,VQA可以辅助放射科医生回答医学图像相关的问题,尽管这需要专门的训练和仔细的验证。在电商领域,VQA可驱动力视觉搜索和产品推荐系统。该技术还应用于自动驾驶,系统必须理解和推理视觉场景,以回答诸如“交通信号灯是红色吗?”或“是否有行人正在过马路?”等问题。
近期发展
大规模多模态模型的兴起,例如由OpenAI、Google DeepMind及其他研究实验室开发的模型,已大幅推进VQA能力。这些模型通常基于Transformer架构,并在大规模图像和文本数据上训练,能够以高准确度回答问题,甚至提供解释。例如,GPT-4V和Gemini等模型在标准VQA基准上表现出强劲性能,某些任务上有时接近人类水平。然而,这些模型并非没有局限性,仍可能表现出偏差或生成错误。该领域持续发展,研究重点在于改进推理能力、抗扰动、并增强可解释性和鲁棒性。截至2025年,VQA仍是活跃的研究领域,新的基准和挑战不断涌现,以推动视觉理解的边界。