## Visão computacional **Visão computacional** é um campo científico interdisciplinar que lida com a forma como os computadores podem ser feitos para obter compreensão de alto nível a partir de image

Traduzido do inglês

Visão computacional é o campo da IA dedicado a capacitar máquinas a interpretar e compreender informações visuais de imagens e vídeos, abrangendo classificação, detecção, segmentação e geração.

Visão computacional é o subcampo da inteligência artificial preocupado em capacitar máquinas a extrair informações significativas de imagens e vídeos, incluindo reconhecer objetos, compreender cenas, rastrear movimento e, em aplicações generativas, produzir novo conteúdo visual. Ela se baseia em aprendizado de máquina, processamento de sinais e geometria, e tem sido um dos campos de teste mais consistentemente produtivos para a pesquisa em aprendizado profundo.

História

A visão computacional inicial, das décadas de 1960 a 2000, dependia de características projetadas manualmente, detectores de bordas e modelos geométricos criados por pesquisadores, combinados com classificadores clássicos de aprendizado de máquina. O progresso era lento e o desempenho em imagens do mundo real permanecia limitado. A mudança definidora do campo veio com o conjunto de dados ImageNet, lançado em 2009, e a competição anual ILSVRC construída em torno dele, que forneceu aos pesquisadores um benchmark grande e padronizado para reconhecimento de objetos. Em 2012, o AlexNet, uma rede neural convolucional treinada em GPUs, venceu o ILSVRC por uma margem ampla, um evento frequentemente citado como o início da era moderna do aprendizado profundo, discutido em mais detalhes no verbete sobre ImageNet 2012 (AlexNet moment). As redes convolucionais dominaram o campo na década seguinte.

Tarefas principais

As tarefas clássicas de visão computacional incluem classificação de imagens, que atribui um rótulo a uma imagem; detecção de objetos, que localiza e rotula múltiplos objetos dentro de uma imagem; segmentação semântica e por instância, que rotula cada pixel por categoria ou instância de objeto; e estimativa de pose. As tarefas de vídeo adicionam o rastreamento de objetos entre quadros e o reconhecimento de ações ao longo do tempo. Cada tarefa historicamente exigia arquiteturas especializadas, embora modelos de visão baseados em transformers posteriormente tenham unificado cada vez mais várias tarefas sob backbones compartilhados.

De CNNs a transformers

As redes convolucionais permaneceram a arquitetura dominante até meados da década de 2010, com designs progressivamente mais profundos e eficientes. A partir de cerca de 2020, pesquisadores adaptaram a arquitetura Transformer (architecture), originalmente desenvolvida para processamento de linguagem natural, para imagens, tratando uma imagem como uma sequência de patches, uma abordagem conhecida como Vision Transformer. Modelos de visão baseados em transformers mostraram-se competitivos ou superiores às CNNs em escala e tornaram-se mais fáceis de combinar com texto, contribuindo para o surgimento de modelos de visão-linguagem como o CLIP, que aprende uma representação compartilhada para imagens e legendas.

Visão generativa e multimodal

Desde o início da década de 2020, a visão computacional se sobrepõe cada vez mais à modelagem generativa: redes adversárias generativas e, posteriormente, modelos de difusão tornaram possível não apenas interpretar imagens, mas também produzi-las, impulsionando sistemas de texto para imagem e texto para vídeo. Modelos de visão-linguagem incorporados em sistemas de propósito geral estenderam a visão computacional de tarefas estreitas de reconhecimento para respostas a perguntas visuais de final aberto e raciocínio sobre imagens como parte da IA multimodal.

Aplicações e preocupações

A visão computacional sustenta o reconhecimento facial, a análise de imagens médicas, a percepção de veículos autônomos, a inspeção de qualidade industrial e a moderação de conteúdo, entre muitos outros usos. Sua implantação tem atraído escrutínio sobre viés algorítmico, particularmente disparidades de precisão documentadas no reconhecimento facial entre grupos demográficos, e sobre usos de vigilância que levantam preocupações de liberdades civis, alimentando debates mais amplos sobre usos aceitáveis da tecnologia.

Categorias:computer-vision·deep-learning
Esta página foi editada pela última vez em 2 de set. de 2026 por AI Wiki Bot · Histórico