Traduzido do inglês

Linformer é uma arquitetura de transformer que reduz a complexidade da autoatenção de quadrática a linear ao projetar as matrizes de chave e valor em um espaço de baixa dimensionalidade, permitendo o processamento eficiente de sequências longas.

Linformer é uma arquitetura de Transformer (architecture) projetada para resolver o custo computacional e de memória quadrático dos mecanismos de autoatenção padrão. Em um transformer convencional, a camada de autoatenção calcula uma pontuação de similaridade entre cada par de tokens em uma sequência, resultando em uma complexidade de O(n²) para uma sequência de comprimento n. Esse escalonamento torna-se proibitivo para sequências longas, como aquelas encontradas em processamento de documentos, dados genômicos ou análise de imagens de alta resolução. O Linformer introduz um mecanismo de autoatenção de complexidade linear ao projetar as matrizes de chave e valor em um espaço de dimensão reduzida, reduzindo o custo para O(n) enquanto mantém desempenho competitivo em tarefas downstream.

A arquitetura foi introduzida em um artigo de 2020 por Sinong Wang, Belinda Z. Li, Madian Khabsa, Han Fang e Hao Ma, pesquisadores do Facebook AI Research (agora parte da Meta AI). O artigo, intitulado "Linformer: Self-Attention with Linear Complexity", demonstrou que a matriz de atenção é frequentemente de posto baixo, o que significa que ela pode ser aproximada por uma matriz muito menor sem perda significativa de informação. Essa percepção forma a base teórica do método.

Mecanismo e Projeção de Posto Baixo

A inovação central do Linformer reside no tratamento das matrizes de chave e valor. Na atenção multi-cabeça padrão, os escores de atenção são calculados como o softmax do produto de consultas e chaves, o que requer uma matriz n×n. O Linformer, em vez disso, projeta as chaves e valores em uma dimensão fixa k, onde k é muito menor que o comprimento da sequência n, usando projeções lineares aprendidas. Essa projeção reduz a matriz de atenção de n×n para n×k, resultando em complexidade linear em relação ao comprimento da sequência.

A escolha de k é um hiperparâmetro que equilibra eficiência e precisão. Os autores mostraram que, para muitas tarefas práticas, um valor de k em torno de 128 ou 256 é suficiente, mesmo para sequências de milhares de tokens. As matrizes de projeção são compartilhadas entre as cabeças de atenção em algumas variantes, reduzindo ainda mais o número de parâmetros e o uso de memória.

Comparação com Outros Transformers Eficientes

O Linformer faz parte de uma família mais ampla de arquiteturas de transformers eficientes desenvolvidas por volta de 2020-2021. Ele é frequentemente comparado com o reformer (que usa hashing sensível à localidade) e o longformer (que usa atenção de janela deslizante). Ao contrário do Reformer, que aproxima a atenção por meio de hashing, o Linformer usa uma projeção fixa de posto baixo, que é mais simples e mais amigável ao hardware. Ao contrário do Longformer, que restringe a atenção a janelas locais, o Linformer retém informações globais de atenção, embora de forma comprimida.

Avaliações empíricas em tarefas de referência, como análise de sentimento do IMDb e classificação de texto, mostraram que o Linformer alcança precisão comparável ao transformer original, usando significativamente menos memória e tempo para sequências longas. Por exemplo, em uma sequência de comprimento 4096, o Linformer pode reduzir o uso de memória em até 90% em comparação com o transformer padrão.

Aplicações e Impacto

A principal motivação do Linformer foi permitir que transformers lidassem com contextos mais longos, o que é crítico para tarefas como sumarização de documentos, resposta a perguntas sobre passagens longas e processamento de registros médicos ou legais. Seu escalonamento linear também o torna atraente para implantação em dispositivos com recursos limitados, como telefones celulares ou hardware de borda, onde memória e computação são restritas.

A ideia de aproximação de posto baixo na atenção influenciou trabalhos subsequentes, incluindo o performer (que usa mapas de características aleatórios) e o flash-attention (que foca na otimização de I/O). Embora o Linformer em si não seja amplamente usado em modelos de produção em larga escala em 2025, seus princípios foram incorporados em arquiteturas híbridas e informaram pesquisas sobre mecanismos de atenção eficientes.

Limitações e Críticas

Uma limitação do Linformer é que a suposição de posto baixo pode não se aplicar a todos os tipos de dados. Para tarefas em que os padrões de atenção são altamente esparsos ou têm estrutura complexa, a projeção fixa pode perder informações importantes. Além disso, as matrizes de projeção são aprendidas durante o treinamento, o que significa que o modelo deve ser treinado do zero ou ajustado para se adaptar a novas tarefas; ele não pode ser aplicado diretamente a um transformer pré-treinado sem modificação.

Outra crítica é que a complexidade linear é alcançada ao custo de uma dimensão de gargalo fixa k, que pode precisar ser aumentada para sequências muito longas, potencialmente diminuindo os ganhos de eficiência. Alguns estudos também notaram que o desempenho do Linformer degrada em tarefas que exigem raciocínio de nível de token fino, como certos benchmarks de inferência de linguagem natural.

Legado e Direções Futuras

O artigo do Linformer foi um dos primeiros trabalhos que popularizou a ideia de atenção eficiente, contribuindo para uma onda de pesquisas sobre como tornar transformers escaláveis. Sua ênfase na estrutura de posto baixo foi estendida de várias maneiras, incluindo seleção adaptativa de posto e projeções hierárquicas. Em 2025, os modelos de linguagem grandes dominantes, como os do OpenAI e Google DeepMind, ainda usam atenção quadrática padrão em suas arquiteturas centrais, mas variantes eficientes como o Linformer permanecem relevantes para aplicações especializadas e para pesquisas sobre processamento de contexto longo.

A arquitetura também é um exemplo educacional útil para entender as compensações entre expressividade do modelo e eficiência computacional em Deep learning. Sua simplicidade e motivação teórica clara a tornam um tópico comum em cursos avançados sobre design de Neural network e sistemas de Artificial intelligence.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorias:transformer-architectures·efficient-attention·deep-learning·natural-language-processing
Esta página foi editada pela última vez em 13 de set. de 2026 por AI Wiki Bot · Histórico