VizWiz est un ensemble de données et un banc d'essai à grande échelle pour la réponse à des questions visuelles (VQA), issu de requêtes réelles posées par des personnes aveugles ou malvoyantes. Contrairement aux ensembles de données VQA conventionnels, qui contiennent souvent des images provenant d'Internet et des questions posées par des annotateurs voyants, VizWiz capture des besoins utilisateurs authentiques en collectant des images et des questions parlées de la part d'utilisateurs aveugles dans leur environnement quotidien. L'ensemble de données a été introduit en 2018 par des chercheurs de l'Université Carnegie Mellon et de Microsoft Research, et il est depuis devenu un ensemble d'évaluation standard pour les systèmes d'IA axés sur l'accessibilité.
L'objectif principal de VizWiz est de faire progresser les systèmes d'Artificial intelligence capables d'aider les utilisateurs aveugles à comprendre le contenu visuel. Le banc d'essai comprend non seulement la tâche de réponse aux questions, mais aussi une tâche associée visant à prédire si une question peut être répondue à partir de l'image, reflétant la réalité pratique selon laquelle de nombreuses images soumises par les utilisateurs sont floues, mal cadrées ou autrement insuffisantes. VizWiz a été utilisé pour former et évaluer des modèles dans des contextes académiques et industriels, et il a stimulé les progrès en apprentissage multimodal, en particulier dans l'intégration de modèles de vision et de langage.
Composition et collecte de l'ensemble de données
L'ensemble de données VizWiz a été collecté via une application mobile permettant aux utilisateurs aveugles de prendre une photo et d'enregistrer une question parlée à son sujet. Chaque échantillon se compose d'une image, d'une question parlée transcrite en texte et de plusieurs réponses annotées par des humains. La version initiale de 2018 contenait plus de 31 000 questions visuelles provenant de plus de 8 000 utilisateurs aveugles, chaque question recevant 10 réponses d'annotateurs voyants. Un ensemble de validation et un ensemble de test distincts ont été créés pour garantir une évaluation équitable, l'ensemble de test étant réservé à une évaluation publique.
Une caractéristique distinctive de VizWiz est l'inclusion de questions sans réponse. Environ 30 % des questions de l'ensemble de données sont jugées sans réponse par les annotateurs humains en raison d'une mauvaise qualité d'image ou d'un contexte manquant. Cet aspect rend VizWiz plus difficile que les ensembles de données VQA typiques et souligne la nécessité pour les modèles de reconnaître leurs propres limites, une capacité critique pour les applications d'assistance réelles.
Tâches du banc d'essai et évaluation
La tâche principale de VizWiz est la réponse à des questions visuelles, où un modèle doit générer une réponse correcte à partir d'une image et d'une question. L'évaluation utilise la métrique de précision VQA standard, qui considère une réponse comme correcte si elle correspond à au moins trois des dix réponses fournies par les humains. De plus, VizWiz a introduit une tâche de classification binaire pour la possibilité de réponse, où les modèles doivent prédire si une question peut être répondue à partir de l'image. Cette configuration à double tâche encourage le développement de systèmes capables à la fois de fournir des réponses précises et de s'abstenir lorsque nécessaire.
Depuis sa publication, VizWiz a été un banc d'essai clé dans la communauté du Machine learning, avec de nombreux articles rapportant des résultats à son sujet. Les premiers modèles basés sur des architectures de Neural network et des techniques de Deep learning ont atteint une précision modeste, mais l'avènement des modèles basés sur les Transformer (architecture) et des Large language models a conduit à des améliorations significatives. En 2025, les systèmes de pointe utilisant des transformateurs multimodaux peuvent répondre correctement à plus de 70 % des questions répondables, bien que la performance sur les questions sans réponse reste un défi.
Impact sur l'accessibilité et les technologies d'assistance
VizWiz a eu un impact direct sur le développement de technologies d'assistance pour les utilisateurs aveugles. L'ensemble de données a été utilisé pour former des modèles qui alimentent des applications mobiles capables de lire du texte, d'identifier des objets et de décrire des scènes en temps réel. Des entreprises telles que Google DeepMind et OpenAI ont cité VizWiz dans leurs recherches sur l'IA multimodale, et le banc d'essai est souvent inclus dans les évaluations des systèmes commerciaux de vision-langage.
L'ensemble de données a également stimulé la création de ressources connexes, telles que VizWiz-VQA-Grounding, qui ajoute des annotations de localisation spatiale pour soutenir les tâches de localisation d'objets. Cette extension permet aux modèles non seulement de répondre aux questions, mais aussi de pointer vers les régions pertinentes d'une image, améliorant encore l'utilisabilité pour les utilisateurs aveugles qui dépendent de lecteurs d'écran ou de retour haptique.
Défis et limites
Malgré son utilité, VizWiz présente des limites. L'ensemble de données est biaisé envers les utilisateurs anglophones et refl principalement les données démographiques de la période de collecte initiale. Les images sont souvent de basse résolution et bruitées, ce qui peut entraver la performance des modèles mais reflète également les conditions réelles. De plus, la tâche de possibilité de réponse est subjective, car différents annotateurs peuvent être en désaccord sur la possibilité de répondre à une question, ce qui entraîne un bruit d'étiquetage.
Les chercheurs ont également noté que VizWiz ne capture pas entièrement la diversité des déficiences visuelles ni l'éventail des besoins d'assistance. Les travaux futurs visent à étendre l'ensemble de données avec plus de langues, des conditions d'image variées et des annotations plus riches. Néanmoins, VizWiz reste une ressource fondamentale pour évaluer les systèmes d'IA dans des contextes d'accessibilité, et son accent sur les requêtes réelles des utilisateurs continue d'influencer la conception d'une IA centrée sur l'humain.
Orientations futures
À mesure que la Generative AI et les modèles multimodaux évoluent, VizWiz est susceptible de rester un banc d'essai critique. L'intégration des Large language models avec des encodeurs de vision a déjà amélioré la qualité des réponses, et la recherche en cours se concentre sur la robustesse de ces systèmes aux entrées bruitées et sur une meilleure gestion des questions sans réponse. Le banc d'essai encourage également le développement de modèles capables d'expliquer leur raisonnement, ce qui est important pour instaurer la confiance avec les utilisateurs qui dépendent de l'IA pour des tâches quotidiennes.
Les collaborations entre le monde académique et l'industrie, telles que celles impliquant Carnegie Mellon University et microsoft-research, continuent de stimuler les améliorations de l'IA d'accessibilité. VizWiz rappelle que les bancs d'essai d'IA doivent refléter les besoins humains réels, et pas seulement la nouveauté technique, et il a inspiré des efforts similaires dans d'autres domaines, tels que le sous-titrage audio et la détection tactile. En 2025, VizWiz reste un point de référence standard pour mesurer les progrès en réponse à des questions visuelles à des fins d'assistance.