Em aprendizado de máquina, a Rede de Rodovia (Highway Network) é uma arquitetura de rede neural feedforward profunda que foi a primeira a treinar com sucesso redes com centenas de camadas, superando em muito as 20 a 30 camadas típicas dos modelos de última geração em 2014. Foi introduzida em maio de 2015 por pesquisadores que buscavam superar o problema de "degradação", em que empilhar muitas camadas causava uma redução acentuada na precisão do treinamento. A arquitetura usa mecanismos de portas aprendidas para regular o fluxo de informações entre as camadas, inspirada nas redes neurais recorrentes de memória de longo prazo (LSTM). Essas portas criam "rodovias de informação" que permitem que os gradientes se propaguem mais facilmente, mitigando o problema do gradiente desaparecendo e melhorando a otimização.
A Rede de Rodovia foi desenvolvida simultaneamente com a rede neural residual (ResNet), publicada em dezembro de 2015. A ResNet pode ser vista como um caso especial da Rede de Rodovia em que as portas estão sempre abertas (ativação 1.0). As Redes de Rodovia encontraram aplicações práticas em tarefas de rotulagem de sequências de texto e reconhecimento de fala.
Modelo e Mecanismo de Portas
A Rede de Rodovia estende uma camada feedforward padrão adicionando duas portas junto com a função de transformação principal \(H(W_H, x)\): uma porta de transformação \(T(W_T, x)\) e uma porta de transporte \(C(W_C, x)\). Ambas as portas são tipicamente funções sigmoides, produzindo valores entre 0 e 1. A porta de transporte é definida como \(C(W_C, x) = 1 - T(W_T, x)\), garantindo que os caminhos de transformação e transporte somem um.
A saída de uma camada de Rodovia é calculada como:
\(y = H(x, W_H) \cdot T(x, W_T) + x \cdot C(x, W_C)\)
ou equivalentemente:
\(y = H(x, W_H) \cdot T(x, W_T) + x \cdot (1 - T(x, W_T))\)
Essa formulação permite que a camada passe a entrada inalterada (quando a porta de transformação está próxima de 0) ou aplique uma transformação não linear (quando a porta está próxima de 1). A ativação das portas é aprendida durante o treinamento, permitindo que a rede controle dinamicamente quanto de informação flui por cada camada.
Relação com LSTM e ResNet
A Rede de Rodovia se inspira diretamente nas redes neurais recorrentes LSTM. Sepp Hochreiter analisou o problema do gradiente desaparecendo em 1991, atribuindo-o à dificuldade de treinar redes profundas. A LSTM original (1997) introduziu um carrossel de erro constante, uma conexão residual com peso fixo de 1.0, permitindo que gradientes fluíssem através de longos passos de tempo. Uma variante posterior da LSTM (2000) adicionou "portas de esquecimento" aprendíveis que modulam essas conexões de identidade, abordando o problema do gradiente desaparecendo de forma mais flexível.
A Rede de Rodovia aplica esses princípios a redes feedforward. Ela é análoga a uma LSTM com portas de esquecimento desdobradas no tempo, onde as portas são aprendidas. Em contraste, a ResNet, publicada posteriormente em dezembro de 2015, não tem equivalente às portas de esquecimento; suas conexões de salto estão sempre abertas, assemelhando-se à LSTM original de 1997. Se as portas em uma Rede de Rodovia forem mantidas abertas (ativação 1.0), ela se torna uma ResNet.
A conexão residual é um caso especial do conceito mais amplo de "conexão de atalho" ou "conexão de salto", que remonta a Rosenblatt (1961) e Lang & Witbrock (1988). Essas conexões assumem a forma \(x \mapsto F(x) + Ax\), onde \(A\) é uma matriz de pesos. Em uma conexão residual, \(A\) é a matriz identidade, mas em conexões de salto gerais, \(A\) pode ser arbitrária. Assim, toda conexão residual é uma conexão de salto, mas nem toda conexão de salto é residual.
Treinamento e Desempenho
O artigo original da Rede de Rodovia relatou experimentos com redes de 20, 50 e 100 camadas, e mencionou trabalhos em andamento com até 900 camadas. O mecanismo de portas permitiu que essas redes muito profundas fossem treinadas de forma eficaz, alcançando melhor otimização do que redes profundas simples. Ao regular o fluxo de informações, as portas ajudam a prevenir o problema do gradiente desaparecendo, onde os gradientes se tornam pequenos demais para atualizar os pesos nas camadas anteriores.
Comparadas a outras arquiteturas de aprendizado profundo, as Redes de Rodovia oferecem a vantagem de melhor treinabilidade para modelos muito profundos. No entanto, elas exigem parâmetros adicionais para as portas, aumentando o custo computacional. O sucesso das Redes de Rodovia e das ResNets demonstrou que arquiteturas muito profundas poderiam ser treinadas de forma eficaz, abrindo caminho para avanços subsequentes no aprendizado profundo.
Aplicações e Legado
As Redes de Rodovia foram aplicadas à rotulagem de sequências de texto e reconhecimento de fala, onde arquiteturas profundas são benéficas para capturar padrões complexos. Elas também influenciaram o desenvolvimento de arquiteturas posteriores, como a ResNet, que se tornou um bloco de construção fundamental na visão computacional. O conceito de conexões de salto com portas foi adotado em várias formas no aprendizado profundo moderno, incluindo em transformadores e modelos de linguagem de grande escala.
As ideias por trás das Redes de Rodovia fazem parte da evolução mais ampla do aprendizado profundo, que tem sido impulsionada por contribuições de instituições como a Universidade de Toronto e pesquisadores como Sepp Hochreiter e Jürgen Schmidhuber. Embora as Redes de Rodovia em si sejam menos usadas hoje em dia, seus princípios permanecem relevantes para entender como treinar redes neurais muito profundas.