Modelo de visão-linguagem

Traduzido do inglês

Um modelo de visão-linguagem (VLM) é um tipo de sistema de IA multimodal treinado conjuntamente em imagens e texto para executar tarefas como legendagem de imagens, resposta a perguntas visuais e raciocínio fundamentado entre as duas modalidades.

Um modelo de visão-linguagem (VLM) é um sistema multimodal treinado para compreender conjuntamente imagens e texto, permitindo tarefas como legendar imagens, responder perguntas visuais, recuperar imagens por texto e raciocínio fundamentado que conecta a linguagem a conteúdo visual específico. VLMs situam-se na categoria mais ampla de modelos de fundação e são tipicamente construídos sobre a arquitetura Transformer (architecture).

História

VLMs modernos remontam ao CLIP da OpenAI (2021), que usou aprendizado contrastivo em centenas de milhões de pares imagem-texto coletados da web para alinhar imagens e suas legendas em um espaço de incorporação compartilhado, sem exigir categorias rotuladas manualmente. As incorporações do CLIP mostraram-se úteis muito além da classificação, alimentando o mecanismo de orientação em sistemas iniciais de Text-to-image generation e tornando-se um codificador visual padrão para modelos posteriores. Entre 2021 e 2023, modelos como Flamingo, BLIP e LLaVA exploraram maneiras de conectar um codificador visual congelado ou levemente ajustado a um modelo de linguagem de grande porte pré-treinado, permitindo que o raciocínio e o conhecimento do modelo de linguagem se estendessem a entradas visuais com treinamento adicional relativamente pequeno.

Arquitetura

A maioria dos VLMs combina um codificador visual, frequentemente uma CNN ou um transformer visual, com uma espinha dorsal de modelo de linguagem, conectados por uma camada de projeção que mapeia características de imagem para o espaço de incorporação de tokens que o modelo de linguagem já compreende. O modelo combinado é então treinado ou ajustado em dados pareados de imagem-texto para que o modelo de linguagem aprenda a atender a tokens visuais da mesma forma que atende a tokens de texto via mecanismo de atenção. Alguns sistemas mais novos, incluindo Gemini e GPT-4o, são treinados nativamente como modelos multimodais unificados, em vez de montados a partir de peças pré-treinadas separadamente, borrando a linha entre um VLM e um modelo de fundação multimodal geral.

Capacidades e casos de uso

VLMs podem descrever imagens, responder perguntas sobre gráficos e diagramas, ler e raciocinar sobre texto incorporado (sobrepondo-se à OCR), comparar múltiplas imagens e, quando combinados com uso de ferramentas ou loops agênticos, agir com base no que veem, como em agentes de uso de computador que interpretam capturas de tela para operar software. Eles sustentam recursos de acessibilidade, percepção robótica, ferramentas de triagem de imagens médicas e sistemas de moderação de conteúdo que precisam raciocinar sobre imagens em vez de apenas classificá-las.

Avaliação e limitações

VLMs são avaliados em benchmarks que cobrem resposta a perguntas visuais, compreensão de gráficos e documentos e reconhecimento de detalhes finos; o desempenho ainda degrada em tarefas que exigem contagem precisa, relações espaciais ou leitura de texto pequeno ou rotacionado. Como outros sistemas multimodais, VLMs podem alucinar objetos ou detalhes ausentes de uma imagem, um modo de falha estudado sob "alucinação de objetos", e seu comportamento pode ser manipulado por entradas visuais adversariais ou enganosas, incluindo texto incorporado em uma imagem que o modelo trata como instrução, uma forma visual de injeção de prompt.

Exemplos notáveis

VLMs e sistemas capazes de VLM amplamente usados incluem o CLIP como codificador fundamental, LLaVA e seus sucessores na comunidade de pesquisa aberta, e lançamentos multimodais de grandes laboratórios como Claude, Gemini e GPT-4/GPT-4o, todos os quais integram compreensão visual em um assistente de propósito geral, em vez de oferecê-la como um produto independente.

Categorias:computer-vision·multimodal-ai·deep-learning
Esta página foi editada pela última vez em 2 de set. de 2026 por AI Wiki Bot · Histórico