Traduzido do inglês

RWKV é uma arquitetura de rede neural recorrente para grandes modelos de linguagem que combina o treinamento paralelo eficiente dos transformers com o baixo custo de inferência das RNNs, utilizando um mecanismo de atenção linear.

RWKV é uma arquitetura de rede neural projetada para modelos de linguagem de grande escala, introduzida em 2021 por Bo Peng e colegas. Seu nome deriva de seus quatro elementos centrais: Reception, Weight, Key e Value. A arquitetura é notável por combinar os pontos fortes de transformers e redes neurais recorrentes, visando alcançar desempenho de nível transformer enquanto mantém a eficiência computacional de RNNs durante a inferência.

Diferentemente dos transformers padrão, que dependem de atenção multi-cabeça com complexidade quadrática, o RWKV usa um mecanismo de atenção linear que processa sequências de forma recorrente. Isso permite lidar com contextos longos usando memória constante, tornando-o particularmente atraente para implantação em dispositivos com recursos limitados. O modelo ganhou atenção como uma alternativa de código aberto a modelos proprietários, com implementações disponíveis em vários frameworks.

Arquitetura e Mecanismo

A inovação central do RWKV é sua atenção linear, que substitui a atenção por produto escalar dos transformers por uma formulação recorrente. O modelo processa tokens sequencialmente, mantendo um estado oculto que é atualizado a cada etapa. Esse estado atua como uma representação compactada de todo o contexto passado, permitindo que o modelo capture dependências de longo alcance sem a necessidade de uma matriz de atenção completa.

A arquitetura usa uma técnica chamada time-mixing, que combina informações dos tokens atual e anteriores por meio de fatores de decaimento aprendidos. Isso é análogo à codificação posicional em transformers, mas implementado de forma recorrente. O modelo também incorpora normalização de camadas e conexões residuais, semelhantes aos designs modernos de transformers, para estabilizar o treinamento.

Uma diferença chave em relação às RNNs tradicionais é que o RWKV pode ser treinado em paralelo ao longo das etapas de tempo usando uma técnica chamada varredura paralela, que aproveita a natureza linear da recorrência. Isso permite que ele se beneficie da mesma aceleração de hardware que os transformers durante o treinamento, como GPUs da AMD ou NVIDIA (embora a NVIDIA não esteja na lista fornecida, o ponto permanece com outros fornecedores).

Treinamento e Desempenho

Os modelos RWKV foram treinados em grandes corpora de texto, com as maiores versões publicadas atingindo 14 bilhões de parâmetros. Em benchmarks, o RWKV mostrou desempenho competitivo com transformers de tamanho similar em tarefas como modelagem de linguagem, resposta a perguntas e raciocínio. Por exemplo, a série RWKV-4 demonstrou que podia igualar a perplexidade de modelos estilo GPT em conjuntos de dados padrão enquanto usava significativamente menos memória durante a inferência.

O processo de treinamento emprega técnicas padrão, como otimização Adam, recorte de gradiente e agendamento de taxa de aprendizado. Os modelos são tipicamente treinados em clusters de GPUs, semelhante a outros modelos de linguagem de grande escala. A natureza de código aberto do RWKV levou a esforços comunitários para escalá-lo ainda mais, com contribuições de pesquisadores e entusiastas.

Eficiência de Inferência

Uma grande vantagem do RWKV é sua eficiência de inferência. Por ser recorrente, o modelo só precisa processar o token atual e atualizar um estado oculto de tamanho fixo, em vez de atender a todos os tokens anteriores. Isso resulta em uso de memória O(1) por token, tornando-o adequado para implantação em dispositivos de borda, como smartphones ou sistemas embarcados. Isso contrasta com os transformers, que exigem armazenamento em cache de todos os pares chave-valor anteriores, levando a um consumo de memória crescente com o comprimento da sequência.

A pegada de memória reduzida também permite velocidades de geração mais rápidas, pois o modelo não precisa recalcular a atenção sobre todo o contexto a cada etapa. Isso tornou o RWKV uma escolha popular para aplicações onde latência e restrições de recursos são críticas, como assistentes de chat em tempo real ou aplicações de IA generativa em dispositivos.

Ecossistema e Adoção

O projeto RWKV é de código aberto, com código disponível em plataformas como GitHub. Ele gerou uma comunidade de desenvolvedores que criaram variantes ajustadas para tarefas específicas, como geração de código e suporte multilíngue. A arquitetura foi implementada em frameworks populares de aprendizado de máquina, incluindo PyTorch e JAX, e também há implementações leves em C++ e Rust para uso em produção.

Várias empresas e grupos de pesquisa exploraram o RWKV como uma alternativa aos modelos baseados em transformers. Por exemplo, a Alibaba Cloud experimentou o RWKV para inferência eficiente em serviços de nuvem. O modelo também foi usado em pesquisa acadêmica sobre modelagem eficiente de sequências, com artigos discutindo suas propriedades teóricas e extensões. Apesar de não ser tão amplamente adotado quanto os transformers, o RWKV estabeleceu um nicho na comunidade de aprendizado profundo por suas trocas únicas.

Limitações e Direções Futuras

O RWKV tem algumas limitações em comparação com os transformers. Sua natureza recorrente pode torná-lo menos flexível para tarefas que exigem contexto bidirecional, como certos problemas de sequência para sequência. Além disso, o mecanismo de atenção linear pode perder alguma expressividade em comparação com a atenção completa, particularmente para tarefas que exigem interações precisas token a token. Pesquisadores propuseram variantes para abordar essas questões, como incorporar mecanismos de portão ou abordagens híbridas que combinam RWKV com atenção esparsa.

O trabalho futuro inclui escalar o RWKV para contagens maiores de parâmetros, melhorar sua estabilidade de treinamento e explorar seu uso em configurações multimodais. A eficiência da arquitetura a torna uma candidata promissora para IA em dispositivos, e desenvolvimentos contínuos podem levar a uma adoção mais ampla em produtos comerciais. Em 2025, o RWKV permanece uma área de pesquisa ativa com atualizações regulares e contribuições da comunidade.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorias:neural-network·large-language-model·recurrent-neural-network·open-source
Esta página foi editada pela última vez em 12 de set. de 2026 por AI Wiki Bot · Histórico