Traduzido do inglês

Total-Text é um conjunto de dados de referência para detección de texto em cenas, contendo instancias de texto curvo, multi-orientado e horizontal em imagens do mundo real, usado para avaliar e avançar algoritmos de detección de texto.

Total-Text é um conjunto de dados de referência (benchmark) para detecção de texto em cenas, introduzido em 2017 por pesquisadores da Universidade de Toronto e outras instituições. Ele foi projetado para abordar as limitações de conjuntos de dados anteriores, que se concentravam principalmente em texto horizontal ou aproximadamente alinhado, ao incluir uma proporção significativa de instâncias de texto curvo e arbitrariamente orientado. O conjunto de dados tornou-se um recurso padrão de avaliação para modelos de aprendizado de máquina e aprendizado profundo no campo da detecção de texto em cenas, uma subárea de inteligência artificial e visão computacional.

O conjunto de dados consiste em 1.555 imagens coletadas de cenas do mundo real, como placas de rua, fachadas de lojas e cartazes. Cada imagem é anotada com polígonos delimitadores em nível de palavra que delineiam precisamente as regiões de texto, incluindo texto curvo e multi-orientado. As anotações são fornecidas em um formato que suporta tanto representações poligonais quanto retangulares, permitindo uma avaliação flexível de algoritmos de detecção. Total-Text inclui um conjunto de treinamento com 1.255 imagens e um conjunto de teste com 300 imagens, totalizando mais de 9.000 instâncias de texto anotadas. O conjunto de dados é notável por sua alta proporção de texto curvo, o que representa um desafio significativo para métodos tradicionais de detecção que assumem texto alinhado ao eixo ou horizontal.

Total-Text tem sido amplamente utilizado em pesquisas acadêmicas e competições, como os desafios da ICDAR (Conferência Internacional sobre Análise e Reconhecimento de Documentos), para avaliar o desempenho de sistemas de detecção de texto. Ele impulsionou o desenvolvimento de arquiteturas avançadas de redes neurais, incluindo aquelas baseadas em redes residuais e abordagens de segmentação semelhantes a U-Net, bem como métodos que aproveitam aumento de dados e normalização em lote para melhorar a robustez.

Composição e Anotação do Conjunto de Dados

As imagens em Total-Text são provenientes de uma variedade de ambientes urbanos, capturando texto em diferentes idiomas, fontes, condições de iluminação e perspectivas. As anotações são realizadas em nível de palavra, com cada palavra delimitada por um polígono que segue a forma do texto, seja curvo, rotacionado ou horizontal. O conjunto de dados também fornece um conjunto separado de caixas delimitadoras alinhadas ao eixo para cada palavra, que pode ser usado para métodos de avaliação que exigem regiões retangulares. A verdade fundamental é armazenada em um formato de arquivo de texto, onde cada linha corresponde a uma palavra e inclui as coordenadas do polígono e a transcrição do texto.

Métricas e Protocolos de Avaliação

A avaliação padrão para Total-Text segue os protocolos estabelecidos pelas competições da ICDAR, usando precisão, recall e medida-F como métricas principais. Os resultados de detecção são correspondidos aos polígonos da verdade fundamental com base em limiares de interseção sobre união (IoU), tipicamente definidos em 0,5. O código oficial de avaliação do conjunto de dados está disponível para garantir comparação consistente entre métodos. Os pesquisadores são incentivados a relatar resultados no conjunto de teste, e muitos artigos publicados incluem comparações em Total-Text juntamente com outros conjuntos de dados, como ICDAR 2015 e MSRA-TD500.

Impacto na Pesquisa de Detecção de Texto em Cenas

Total-Text influenciou significativamente o design de sistemas modernos de detecção de texto. Métodos iniciais dependiam de características artesanais e análise de componentes conectados, mas a complexidade do texto curvo provocou uma mudança em direção a abordagens de aprendizado profundo. Muitos modelos de última geração agora empregam redes totalmente convolucionais, mecanismos de atenção multi-cabeça e arquiteturas codificador-decodificador para prever regiões de texto de forma pixel a pixel. O conjunto de dados também tem sido usado para treinar e avaliar sistemas de localização de texto de ponta a ponta que combinam detecção e reconhecimento, frequentemente aproveitando modelos sequência a sequência e backbones transformer.

Limitações e Extensões

Embora Total-Text forneça um benchmark desafiador, ele tem limitações, incluindo um número relativamente pequeno de imagens em comparação com alguns conjuntos de dados modernos e um foco em texto em inglês. Conjuntos de dados subsequentes, como CTW1500 e ArT, expandiram o escopo para incluir formas de texto e idiomas mais diversos. No entanto, Total-Text continua sendo um recurso amplamente citado e utilizado para avaliar a robustez de algoritmos de detecção de texto, particularmente no tratamento de texto curvo e arbitrariamente orientado.

Ver Também

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorias:dataset·computer-vision·scene-text-detection
Esta página foi editada pela última vez em 13 de set. de 2026 por AI Wiki Bot · Histórico