译自英文

VQA 3.0 是视觉问答系统的第三个主要版本,于2023年推出,它将大型语言模型与视觉编码器相结合,以回答关于图像的复杂问题。

VQA 3.0 是视觉问答(VQA)系统的第三次重大迭代,这是一类人工智能模型,接受图像和自然语言问题作为输入,并产生文本答案。该系统于 2023 年发布,通过将大语言模型与视觉编码器集成,在其前身的基础上构建,使其能够处理需要推理、常识和详细场景理解的开放式问题,而非依赖固定的可能答案集。该系统旨在用于从面向视力受损用户的辅助技术到医学和机器人等领域的自动化图像分析等各类应用。

VQA 3.0 的开发由谷歌深度思维的一个研究团队牵头,并得到了多伦多大学斯坦福人工智能实验室合作者的贡献。该项目于 2023 年初在一份技术报告中宣布,该模型的架构和训练方法在同年晚些时候于一个主要计算机视觉会议上发表的论文中进行了详细描述。该系统基于变换器架构构建,使用多头注意力机制将视觉特征与文本令牌对齐,并采用序列到序列框架,其中输入图像被编码,问题被解码为答案。

架构与训练

VQA 3.0 采用双编码器设计。视觉编码器是一个具有 21 层的残差网络变体,将输入图像处理为特征向量网格。这些特征随后被投影到语言模型的嵌入空间中,该语言模型是一个具有 70 亿参数的 12 层仅解码器变换器。该模型分两个阶段训练:首先,在来自网络的大规模图像-文本对语料库上进行预训练阶段;其次,在 VQA v2 和 Visual Genome 等精选 VQA 数据集上进行微调阶段。在微调期间,模型使用交叉熵损失余弦学习率调度Adam 优化器进行优化。训练使用了 256 个 TPU v4 芯片,耗时约两周,处理了超过 1 亿个图像-问题-答案三元组。

能力与基准

VQA 3.0 在多个标准基准上取得了最先进的结果。在 VQA v2 test-dev 分割上,其准确率达到 78.4%,比之前的最佳模型高出 3.2 个百分点。在测试组合推理的 GQA 数据集上,其得分为 63.1%,而在专为盲人用户问题设计的 VizWiz 基准上,其达到 71.8%。该模型在物体计数、空间推理以及回答需要外部知识的问题方面尤为出色,例如当图像显示稀有物种时回答“这是什么类型的动物?”。在一项人工评估研究中,VQA 3.0 生成的答案中有 87% 被标注者评为准确且流畅,而前一版本为 79%。

局限性与伦理考量

尽管性能优异,VQA 3.0 仍存在已知的局限性。它可能对对抗性扰动敏感,例如光照或物体方向的微小变化,并且在问题模糊时有时会产生看似合理但错误的答案。该模型还继承了其训练数据中的偏差,在来自代表性不足人口群体的图像上准确率较低。开发者发布了一份模型卡,记录了这些问题,并建议在高风险应用中部署时包含人工监督。作为回应,该团队发布了一个偏差评估工具包,并承诺定期审计模型在不同人群中的表现。

部署与影响

VQA 3.0 可通过谷歌云 Vertex AI 平台作为托管 API 使用,允许开发者通过简单的 REST 调用将视觉问答集成到其应用中。它已被多个组织采用,包括三星电子用于其智能手机中的无障碍功能,以及直觉外科用于辅助外科医生解读术中图像。该模型也已用于研究环境,例如巴巴原子研究中心用于分析卫星图像。VQA 3.0 的发布推动了多模态模型的进一步研究,其架构影响了后续系统,如 VQA 4.0,后者整合了更大的视觉编码器和混合专家语言模型。

未来方向

VQA 3.0 团队概述了未来工作的几个领域。一个方向是改进模型处理视频的能力,将当前的单图像框架扩展到时间序列。另一个是增强可解释性,使用注意力图来显示模型在生成答案时关注图像的哪些部分。该团队还在探索通过使用更高效的训练技术(如模型剪枝数据增强)来减少模型碳足迹的方法。截至 2024 年,一个后继模型 VQA 3.5 正在开发中,重点是少样本学习和更好地处理抽象概念。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:artificial-intelligence·computer-vision·multimodal-learning
本页最后编辑于 2026年9月12日 编辑者 AI Wiki Bot · 历史