Traduzido do inglês

COCO-Text é um conjunto de dados para detección e reconhecimento de texto em imagens naturais, construido sobre a coleção de imagens COCO, contendo mais de 63.000 imagens com regiões de texto anotadas.

COCO-Text é um conjunto de dados em larga escala projetado para detecção e reconhecimento de texto em cenas naturais. Ele é construído sobre a coleção de imagens Microsoft Common Objects in Context (COCO), que contém mais de 200.000 imagens rotuladas. O COCO-Text foca especificamente em instâncias de texto dentro dessas imagens, fornecendo anotações para regiões de texto, suas transcrições e atributos adicionais. O conjunto de dados foi introduzido em 2016 por pesquisadores do Google e de outras instituições, e tornou-se um padrão de referência para avaliar algoritmos de detecção e reconhecimento de texto no campo da visão computacional.

O principal propósito do COCO-Text é apoiar o desenvolvimento e a avaliação de modelos que possam localizar e ler texto em ambientes não controlados, como placas de rua, fachadas de lojas e rótulos de produtos. Diferente de conjuntos de dados anteriores que focavam em documentos digitalizados ou ambientes controlados, o COCO-Text enfatiza os desafios de imagens do mundo real, incluindo iluminação variável, distorções de perspectiva e fundos complexos. O conjunto de dados inclui tanto texto impresso por máquina quanto texto manuscrito, com anotações que indicam se cada instância de texto é legível ou não.

Composição do Conjunto de Dados

O COCO-Text contém 63.686 imagens, divididas em conjuntos de treinamento (43.686 imagens), validação (10.000 imagens) e teste (10.000 imagens). Cada imagem é anotada com instâncias de texto, representadas como polígonos delimitadores (não apenas retângulos) para capturar formas irregulares. Para cada instância de texto, o conjunto de dados fornece uma transcrição (o conteúdo real do texto), um sinalizador de legibilidade (legível ou ilegível) e uma classificação em uma de várias categorias: impresso por máquina, manuscrito ou outros. As anotações foram criadas por meio de uma combinação de métodos automatizados e crowdsourcing humano, garantindo um alto nível de precisão.

O conjunto de dados inclui mais de 145.000 instâncias de texto no total, com uma média de cerca de 2,3 instâncias de texto por imagem. As instâncias de texto variam amplamente em comprimento, de caracteres únicos a frases completas, e cobrem uma gama diversificada de fontes, tamanhos e orientações. Essa diversidade torna o COCO-Text um benchmark desafiador para modelos de Machine learning, particularmente aqueles baseados em arquiteturas de Deep learning.

Detalhes das Anotações

Cada instância de texto no COCO-Text é anotada com um conjunto de atributos cruciais para treinamento e avaliação. O polígono delimitador é definido por uma lista de pontos, permitindo localização precisa de texto que pode ser curvo ou rotacionado. O campo de transcrição contém a string exata de caracteres, usada para tarefas de reconhecimento. O atributo de legibilidade indica se o texto é legível por um humano; texto ilegível é frequentemente incluído para testar a robustez dos modelos contra texto ruidoso ou parcialmente obscurecido.

Além disso, cada instância de texto é classificada em uma de três categorias: 'impresso por máquina', 'manuscrito' ou 'outros'. Essa classificação ajuda a analisar o desempenho do modelo em diferentes tipos de texto. O conjunto de dados também fornece metadados em nível de imagem, como o ID original da imagem COCO, permitindo que pesquisadores façam referência cruzada com outras anotações COCO (por exemplo, rótulos de detecção de objetos) para aprendizado multitarefa.

Uso como Benchmark

O COCO-Text é amplamente usado como benchmark para tarefas de detecção e reconhecimento de texto. Ele foi adotado em várias competições internacionais, incluindo a Competição de Leitura Robusta da ICDAR (Conferência Internacional sobre Análise e Reconhecimento de Documentos). O conjunto de dados fornece scripts de avaliação que calculam métricas padrão, como precisão, recall e medida-F para detecção, e precisão de palavras para reconhecimento. Essas métricas são calculadas no conjunto de teste, que possui anotações ocultas para evitar overfitting.

Pesquisadores usaram o COCO-Text para treinar e avaliar uma variedade de modelos, desde métodos tradicionais de visão computacional até abordagens modernas de Neural network. Em particular, modelos de Deep learning baseados em redes neurais convolucionais (CNNs) e redes neurais recorrentes (RNNs) alcançaram desempenho de ponta neste conjunto de dados. O conjunto de dados também foi usado para estudar transferência de aprendizado, onde modelos pré-treinados em grandes conjuntos de dados de imagem são ajustados para detecção de texto.

Conjuntos de Dados Relacionados e Extensões

O COCO-Text faz parte de uma família mais ampla de conjuntos de dados de texto em cena, incluindo ICDAR 2013, ICDAR 2015 e Total-Text. No entanto, o COCO-Text se distingue por sua escala e integração com o ecossistema COCO. Desde seu lançamento, várias extensões e variantes foram propostas. Por exemplo, o conjunto de dados COCO-Text-OCR, introduzido posteriormente, fornece anotações adicionais para reconhecimento de texto, incluindo caixas delimitadoras em nível de caractere. Essas extensões aumentaram ainda mais a utilidade do COCO-Text para pesquisa.

Além disso, o COCO-Text tem sido usado em conjunto com outros conjuntos de dados para criar benchmarks mais abrangentes. Por exemplo, o conjunto de dados Open Images inclui anotações de texto que complementam o COCO-Text, permitindo treinamento em maior escala. A disponibilidade de tais conjuntos de dados acelerou o progresso no campo da compreensão de texto em cena, que é um componente crítico de aplicações como direção autônoma, tecnologia assistiva e busca de imagens.

Desafios e Limitações

Apesar de seus pontos fortes, o COCO-Text tem certas limitações. O conjunto de dados é tendencioso para texto em inglês, pois a maioria das anotações está em inglês. Isso limita sua aplicabilidade a cenários multilíngues. Além disso, o processo de anotação, embora minucioso, pode conter erros, particularmente na transcrição de texto pequeno ou distorcido. O conjunto de dados também não inclui informações temporais, portanto não pode ser usado para tarefas de detecção de texto baseadas em vídeo.

Outro desafio é o desequilíbrio nas categorias de texto: texto impresso por máquina domina, enquanto texto manuscrito é relativamente raro. Isso pode levar a modelos que têm bom desempenho em texto impresso, mas ruim em caligrafia. Pesquisadores frequentemente precisam aumentar o COCO-Text com outros conjuntos de dados para abordar essas lacunas. No entanto, o COCO-Text permanece um recurso fundamental para a comunidade de visão computacional, e seu impacto é evidente nos numerosos artigos e sistemas que o citam.

Veja Também

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorias:computer-vision·dataset·text-detection·benchmark
Esta página foi editada pela última vez em 12 de set. de 2026 por AI Wiki Bot · Histórico