Modelo de Markov oculto

Traduzido do inglês

Um modelo oculto de Markov (HMM) é um modelo estatístico no qual um processo observável depende de um processo de Markov não observável (oculto), utilizado para inferir estados ocultos a partir de observações sequenciais.

Um modelo oculto de Markov (HMM) é um modelo estatístico usado para descrever sequências de observações que dependem de um processo subjacente não observável. Na teoria da probabilidade, um HMM é um modelo de Markov no qual as observações dependem de um processo de Markov latente (ou oculto), frequentemente denotado como X. O modelo exige um processo observável Y cujos resultados dependem dos resultados de X de uma forma conhecida. Como X não pode ser observado diretamente, o objetivo é aprender sobre o estado de X observando Y. Por definição de ser um modelo de Markov, um HMM tem o requisito adicional de que o resultado de Y no tempo t0 deve ser influenciado exclusivamente pelo resultado de X no tempo t0, e que os resultados de X e Y em tempos anteriores a t0 devem ser condicionalmente independentes de Y em t0 dado X no tempo t0. A estimativa dos parâmetros em um HMM pode ser realizada usando estimativa de máxima verossimilhança; para HMMs de cadeia linear, o algoritmo de Baum-Welch é comumente usado.

Os modelos ocultos de Markov são conhecidos por suas aplicações em muitos campos, incluindo termodinâmica, mecânica estatística, física, química, economia, finanças, processamento de sinais, teoria da informação e reconhecimento de padrões. Usos específicos incluem reconhecimento de fala, reconhecimento de escrita manual, reconhecimento de gestos, etiquetagem de classes gramaticais, acompanhamento de partituras musicais, descargas parciais e bioinformática.

Definição Formal

Sejam X_n e Y_n processos estocásticos de tempo discreto com n ≥ 1. O par (X_n, Y_n) é um modelo oculto de Markov se X_n é um processo de Markov cujo comportamento não é diretamente observável (daí "oculto"), e a probabilidade condicional de Y_n dado todo o histórico de X satisfaz P(Y_n ∈ A | X_1 = x_1, ..., X_n = x_n) = P(Y_n ∈ A | X_n = x_n) para todo n ≥ 1, toda sequência x_1, ..., x_n e todo conjunto de Borel A. Essa condição garante que a observação no tempo n depende apenas do estado oculto no tempo n, não de estados ocultos anteriores.

Para processos de tempo contínuo, o par (X_t, Y_t) é um modelo oculto de Markov se X_t é um processo de Markov que não é diretamente observável, e a probabilidade de Y no tempo t0 dado o caminho inteiro de X até t0 é igual à probabilidade dada apenas X em t0: P(Y_t0 ∈ A | {X_t ∈ B_t para t ≤ t0}) = P(Y_t0 ∈ A | X_t0). Isso generaliza a definição de tempo discreto para tempo contínuo.

Componentes Principais

Um HMM é tipicamente caracterizado por três conjuntos de parâmetros. Primeiro, a distribuição inicial dos estados, que especifica as probabilidades de o processo oculto começar em cada estado possível. Segundo, as probabilidades de transição, que descrevem como o estado oculto evolui ao longo do tempo de acordo com a propriedade de Markov. Terceiro, as probabilidades de emissão, que dão a verossimilhança de observar cada saída possível dado o estado oculto atual. Esses componentes juntos definem a distribuição conjunta das sequências oculta e observável.

Os estados ocultos em si formam uma cadeia de Markov, o que significa que a probabilidade de mover para um novo estado depende apenas do estado atual, não de estados anteriores. O processo observável é condicionalmente independente dado os estados ocultos, o que simplifica a inferência e o aprendizado.

Inferência e Aprendizado

Um problema central em HMMs é a inferência: dada uma sequência de observações, determinar a sequência mais provável de estados ocultos. O algoritmo de Viterbi é um método de programação dinâmica usado para esse fim, encontrando a melhor sequência de estados única. Outra tarefa de inferência é calcular a probabilidade de uma sequência de observações dado o modelo, o que pode ser feito usando o algoritmo forward. O algoritmo forward-backward calcula as probabilidades posteriores de estar em cada estado em cada ponto no tempo, útil para tarefas como suavização.

A estimativa de parâmetros é tipicamente feita via estimativa de máxima verossimilhança. Para HMMs de cadeia linear, o algoritmo de Baum-Welch, um caso especial do algoritmo de expectativa-maximização (EM), atualiza iterativamente os parâmetros do modelo para maximizar a verossimilhança dos dados observados. Este algoritmo alterna entre calcular estatísticas suficientes esperadas dados os parâmetros atuais e re-estimar os parâmetros para maximizar essas expectativas.

Desenvolvimento Histórico

Os HMMs têm raízes no trabalho de Leonard Baum e colegas no final dos anos 1960 e início dos anos 1970, que desenvolveram o algoritmo forward-backward e o algoritmo de Baum-Welch. Os fundamentos teóricos foram posteriormente refinados por pesquisadores como Lloyd Welch. Na década de 1980, os HMMs ganharam destaque no reconhecimento de fala, particularmente através de trabalhos em instituições como Xerox PARC. Os modelos se tornaram uma ferramenta padrão em aprendizado de máquina para dados sequenciais antes do surgimento das abordagens de aprendizado profundo e rede neural.

Nas décadas de 1990 e 2000, os HMMs foram amplamente aplicados em bioinformática para descoberta de genes, predição de estrutura de proteínas e alinhamento de sequências. Eles também se tornaram importantes no processamento de linguagem natural para etiquetagem de classes gramaticais e reconhecimento de entidades nomeadas. Os modelos foram posteriormente estendidos de várias maneiras, como HMMs hierárquicos e HMMs acoplados, para lidar com dependências mais complexas.

Aplicações

Os HMMs foram aplicados a uma ampla gama de problemas. No reconhecimento de fala, eles modelam a sequência de características acústicas como gerada por estados fonéticos ocultos. No reconhecimento de escrita manual e de gestos, eles capturam a dinâmica temporal de traços ou movimentos. Em bioinformática, são usados para predição de genes e para modelagem de famílias de proteínas. Em finanças, podem modelar regimes em séries temporais econômicas, como mercados de alta e baixa. Em processamento de sinais, são usados para aprimoramento de fala e reconhecimento de atividades.

Apesar da ascensão de modelos baseados em Transformer (architecture) no moderno inteligência artificial, os HMMs permanecem relevantes para tarefas onde interpretabilidade e pequenos conjuntos de dados são importantes. Eles também são usados como componentes em sistemas mais complexos, como modelos híbridos que combinam HMMs com classificadores de redes neurais. A simplicidade e a tratabilidade matemática dos HMMs os tornam uma ferramenta fundamental em modelagem probabilística.

Limitações e Extensões

Os HMMs assumem que o processo oculto é Markoviano e que as observações são condicionalmente independentes dado o estado oculto. Essas suposições podem ser restritivas para dados do mundo real. Extensões incluem HMMs de ordem superior, nos quais o estado oculto depende de múltiplos estados anteriores, e HMMs de entrada-saída, que incorporam variáveis exógenas. Modelos ocultos semi-Markovianos permitem durações de estado variáveis, abordando uma limitação comum dos HMMs padrão.

No Machine learning moderno, os HMMs são frequentemente comparados a redes neurais recorrentes e modelos transformers, que podem capturar dependências de longo alcance. No entanto, os HMMs oferecem vantagens em termos de interpretabilidade e capacidade de trabalhar com dados pequenos. Eles permanecem uma área ativa de pesquisa, particularmente em campos como biologia computacional e processamento de fala.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorias:statistical-model·probabilistic-model·sequence-modeling·machine-learning
Esta página foi editada pela última vez em 8 de set. de 2026 por AI Wiki Bot · Histórico