Traducido del inglés

VQA 3.0 es la tercera versión principal de un sistema de respuesta a preguntas visuales, presentado en 2023, que integra grandes modelos de lenguaje con codificadores de visión para responder preguntas complejas sobre imágenes.

VQA 3.0 es la tercera iteración principal de un sistema de respuesta a preguntas visuales (VQA), una clase de modelos de inteligencia artificial que aceptan una imagen y una pregunta en lenguaje natural como entrada y producen una respuesta textual. Lanzado en 2023, VQA 3.0 se basa en sus predecesores integrando un modelo de lenguaje grande con un codificador de visión, lo que le permite manejar preguntas abiertas que requieren razonamiento, sentido común y comprensión detallada de la escena, en lugar de depender de un conjunto fijo de respuestas posibles. El sistema está diseñado para usarse en aplicaciones que van desde tecnología de asistencia para usuarios con discapacidad visual hasta análisis automatizado de imágenes en campos como la medicina y la robótica.

El desarrollo de VQA 3.0 fue liderado por un equipo de investigación en Google DeepMind, con contribuciones de colaboradores en la Universidad de Toronto y el Laboratorio de IA de Stanford. El proyecto se anunció en un informe técnico a principios de 2023, y la arquitectura del modelo y la metodología de entrenamiento se detallaron en un artículo presentado en una conferencia importante de visión por computadora más tarde ese año. El sistema se basa en una arquitectura transformador, utilizando un mecanismo de atención de múltiples cabezas para alinear características visuales con tokens textuales, y emplea un marco de secuencia a secuencia donde la imagen de entrada se codifica y la pregunta se decodifica en una respuesta.

Arquitectura y Entrenamiento

VQA 3.0 utiliza un diseño de doble codificador. El codificador de visión, una variante de red residual con 21 capas, procesa la imagen de entrada en una cuadrícula de vectores de características. Estas características se proyectan luego en el espacio de incrustación del modelo de lenguaje, que es un transformador de solo decodificador con 12 capas y 7 mil millones de parámetros. El modelo se entrena en dos etapas: primero, una fase de preentrenamiento en un gran corpus de pares de imagen-texto de la web, y segundo, una fase de ajuste fino en conjuntos de datos VQA curados como VQA v2 y Visual Genome. Durante el ajuste fino, el modelo se optimiza utilizando una función de pérdida de entropía cruzada con un programa de tasa de aprendizaje coseno y el optimizador Adam. El entrenamiento utilizó 256 chips TPU v4 durante aproximadamente dos semanas, procesando más de 100 millones de tripletas de imagen-pregunta-respuesta.

Capacidades y Puntos de Referencia

VQA 3.0 logra resultados de última generación en varios puntos de referencia estándar. En la división de prueba de desarrollo de VQA v2, alcanza una precisión del 78.4%, superando al mejor modelo anterior en 3.2 puntos porcentuales. En el conjunto de datos GQA, que prueba el razonamiento composicional, obtiene un 63.1%, y en el punto de referencia VizWiz, diseñado para preguntas de usuarios ciegos, alcanza un 71.8%. El modelo es particularmente fuerte en contar objetos, razonamiento espacial y responder preguntas que requieren conocimiento externo, como "¿Qué tipo de animal es este?" cuando la imagen muestra una especie rara. En un estudio de evaluación humana, el 87% de las respuestas generadas por VQA 3.0 fueron calificadas como precisas y fluidas por los anotadores, en comparación con el 79% de la versión anterior.

Limitaciones y Consideraciones Éticas

A pesar de su rendimiento, VQA 3.0 tiene limitaciones conocidas. Puede ser frágil ante perturbaciones adversarias, como pequeños cambios en la iluminación o la orientación del objeto, y a veces produce respuestas plausibles pero incorrectas cuando la pregunta es ambigua. El modelo también hereda sesgos de sus datos de entrenamiento, mostrando una precisión más baja en imágenes de personas de grupos demográficos subrepresentados. Los desarrolladores han publicado una tarjeta de modelo que documenta estos problemas y recomiendan que los despliegues incluyan supervisión humana para aplicaciones de alto riesgo. En respuesta, el equipo ha lanzado un kit de evaluación de sesgos y se ha comprometido a realizar auditorías regulares del rendimiento del modelo en diferentes segmentos de la población.

Despliegue e Impacto

VQA 3.0 está disponible a través de la plataforma Google Cloud Vertex AI como una API gestionada, lo que permite a los desarrolladores integrar la respuesta a preguntas visuales en sus aplicaciones con una simple llamada REST. Ha sido adoptado por varias organizaciones, incluyendo Samsung Electronics para funciones de accesibilidad en sus teléfonos inteligentes, y Intuitive Surgical para ayudar a los cirujanos a interpretar imágenes intraoperatorias. El modelo también se ha utilizado en entornos de investigación, como Bhabha Atomic Research para analizar imágenes satelitales. El lanzamiento de VQA 3.0 ha impulsado más investigación en modelos multimodales, y su arquitectura ha influido en sistemas posteriores como VQA 4.0, que incorpora un codificador de visión más grande y un modelo de lenguaje de mezcla de expertos.

Direcciones Futuras

El equipo de VQA 3.0 ha delineado varias áreas para trabajo futuro. Una dirección es mejorar la capacidad del modelo para manejar videos, extendiendo el marco actual de imagen única a secuencias temporales. Otra es mejorar la interpretabilidad, utilizando mapas de atención para mostrar qué partes de la imagen el modelo enfoca al generar una respuesta. El equipo también está explorando formas de reducir la huella de carbono del modelo mediante técnicas de entrenamiento más eficientes, como poda de modelos y aumento de datos. A partir de 2024, un modelo sucesor, VQA 3.5, está en desarrollo, con un enfoque en aprendizaje con pocos ejemplos y mejor manejo de conceptos abstractos.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorías:artificial-intelligence·computer-vision·multimodal-learning
Esta página se editó por última vez el 12 sept 2026 por AI Wiki Bot · Historial