Uma máquina de Boltzmann é um tipo de rede neural recorrente estocástica que aprende a representar e amostrar distribuições de probabilidade sobre estados de saída binários. Ela recebe esse nome em homenagem à distribuição de Boltzmann da mecânica estatística, que governa a probabilidade de cada estado da rede com base em sua energia. O modelo também é classificado como um campo aleatório de Markov e é uma instância específica do modelo de Sherrington-Kirkpatrick com um campo externo, também conhecido como modelo de Ising estocástico. Foi amplamente promovido nas comunidades de ciência cognitiva e aprendizado de máquina por Geoffrey Hinton, Terry Sejnowski e Yann LeCun como parte da classe mais ampla de modelos baseados em energia, onde o hamiltoniano de um vidro de spin serve como função de energia que define a tarefa de aprendizado.
As máquinas de Boltzmann são teoricamente notáveis pela localidade e natureza hebbiana de seu algoritmo de treinamento, que segue a regra de Hebb, e por seu paralelismo e semelhança com processos físicos simples. No entanto, máquinas de Boltzmann com conectividade irrestrita não se mostraram úteis para problemas práticos em aprendizado de máquina ou inferência. Quando a conectividade é devidamente restringida, como em máquinas de Boltzmann restritas, o aprendizado se torna eficiente o suficiente para aplicações práticas.
Estrutura
Uma máquina de Boltzmann consiste em uma rede de unidades binárias, cada uma produzindo um estado de 0 ou 1. A rede como um todo tem uma função de energia global, idêntica em forma à das redes de Hopfield e modelos de Ising, definida como:
E = - (soma sobre i<j de w_ij s_i s_j + soma sobre i de theta_i * s_i)
Aqui, w_ij é a força de conexão entre a unidade j e a unidade i, s_i é o estado binário da unidade i, e theta_i é o viés da unidade i, com -theta_i representando o limiar de ativação. Os pesos são frequentemente representados como uma matriz simétrica W com zeros ao longo da diagonal.
Probabilidade do Estado da Unidade
A diferença na energia global resultante de uma única unidade i estar desligada versus ligada, denotada como Delta E_i, é dada pela soma dos pesos das unidades conectadas mais o viés. Essa diferença de energia se relaciona com as probabilidades dos dois estados através do fator de Boltzmann, onde a probabilidade de um estado é proporcional a exp(-E / (k_B T)), com k_B sendo a constante de Boltzmann e T um parâmetro de temperatura artificial. Essa relação permite que a rede atualize unidades estocasticamente, favorecendo configurações de menor energia.
Algoritmo de Treinamento
O treinamento de uma máquina de Boltzmann visa ajustar os pesos e vieses para que a distribuição de equilíbrio da rede corresponda a uma distribuição alvo sobre unidades visíveis. A regra de aprendizado é local e hebbiana: a mudança em um peso é proporcional à diferença entre a correlação das duas unidades quando a rede está fixada nos dados e quando está em execução livre. Esse procedimento de aprendizado contrastivo depende da amostragem da distribuição do modelo, frequentemente usando métodos de Monte Carlo por cadeia de Markov. A localidade do algoritmo o torna biologicamente plausível, mas redes irrestritas sofrem de convergência lenta e escalabilidade ruim.
Variantes Práticas
Para lidar com a ineficiência das máquinas de Boltzmann totalmente conectadas, pesquisadores introduziram máquinas de Boltzmann restritas (RBMs), que restringem a conectividade a duas camadas - visível e oculta - sem conexões intra-camada. Essa restrição permite um treinamento mais eficiente usando divergência contrastiva. RBMs empilhadas formam a base das redes de crença profundas, que foram influentes no desenvolvimento inicial do aprendizado profundo. Essas variantes foram aplicadas a tarefas como redução de dimensionalidade, aprendizado de características e filtragem colaborativa, embora tenham sido amplamente superadas por outras arquiteturas em muitos domínios.
Legado e Influência
A máquina de Boltzmann contribuiu com conceitos fundamentais para a IA generativa e modelos baseados em energia. Sua dinâmica estocástica e interpretação probabilística influenciaram desenvolvimentos posteriores na pesquisa de redes neurais, incluindo o uso de variáveis latentes e inferência baseada em amostragem. Embora não seja amplamente usada em sistemas contemporâneos de grande escala, como grandes modelos de linguagem, seus insights teóricos permanecem relevantes para a compreensão de modelos gráficos probabilísticos e aprendizado não supervisionado. O nome do modelo persiste na literatura como um exemplo canônico de rede recorrente estocástica e uma ponte entre a física estatística e a inteligência artificial.