Aprendizaje Multitarea

Traduzido do inglês

Aprendizado multitarefa (MTL) é um subcampo do aprendizado de máquina onde múltiplas tarefas relacionadas são resolvidas simultaneamente usando uma representação compartilhada, melhorando a generalização e a eficiência em comparação ao treinamento de modelos separadamente. Ele é inerentemente um problema de otimização multiobjetivo que equilibra as compensações entre tarefas.

Aprendizado multi-tarefa (MTL) é um subcampo do aprendizado de máquina no qual múltiplas tarefas de aprendizado são resolvidas ao mesmo tempo, explorando semelhanças e diferenças entre as tarefas. Essa abordagem pode resultar em maior eficiência de aprendizado e precisão de previsão para modelos específicos de tarefas, em comparação com o treinamento dos modelos separadamente. Inerentemente, o aprendizado multi-tarefa é um problema de otimização multi-objetivo que envolve trade-offs entre diferentes tarefas. Versões iniciais do MTL eram chamadas de "dicas" (hints).

Em um artigo de 1997 amplamente citado, Rich Caruana caracterizou o MTL como uma abordagem de transferência indutiva que melhora a generalização ao usar as informações de domínio contidas nos sinais de treinamento de tarefas relacionadas como um viés indutivo. Isso é feito aprendendo as tarefas em paralelo, utilizando uma representação compartilhada; o que é aprendido para cada tarefa pode ajudar outras tarefas a serem aprendidas melhor. No contexto de classificação, o MTL visa melhorar o desempenho de múltiplas tarefas de classificação ao aprendê-las em conjunto. Um exemplo é um filtro de spam, que pode ser tratado como tarefas de classificação distintas, mas relacionadas, entre diferentes usuários. Pessoas diferentes têm distribuições diferentes de características que distinguem spam de e-mails legítimos (por exemplo, um falante de inglês pode considerar todos os e-mails em russo como spam, mas um falante de russo não), embora haja semelhanças, como texto relacionado a transferência de dinheiro. Resolver o problema de classificação de spam de cada usuário em conjunto via MTL permite que as soluções se informem mutuamente e melhorem o desempenho. Outros cenários incluem classificação multiclasse e classificação multi-rótulo.

O aprendizado multi-tarefa funciona porque a regularização induzida pela exigência de que um algoritmo tenha bom desempenho em uma tarefa relacionada pode ser superior à regularização que evita o overfitting ao penalizar toda a complexidade de maneira uniforme. O MTL pode ser particularmente útil quando as tarefas compartilham semelhanças significativas e geralmente são ligeiramente subamostradas, embora também tenha se mostrado benéfico para aprender tarefas não relacionadas.

Agrupamento e Sobreposição de Tarefas

Dentro do paradigma do MTL, as informações podem ser compartilhadas entre algumas ou todas as tarefas. Dependendo da estrutura de relacionamento entre as tarefas, pode-se compartilhar informações seletivamente. As tarefas podem ser agrupadas, existir em uma hierarquia ou estar relacionadas de acordo com uma métrica geral. Formalmente, o vetor de parâmetros que modela cada tarefa pode ser uma combinação linear de vetores de base subjacentes. A semelhança nessa base indica o relacionamento entre as tarefas; por exemplo, com esparsidade, a sobreposição de coeficientes não nulos entre tarefas indica semelhança. Um agrupamento de tarefas corresponde a tarefas situadas em um subespaço gerado por um subconjunto de elementos de base, com grupos possivelmente disjuntos ou sobrepostos. O relacionamento entre tarefas pode ser imposto a priori ou aprendido a partir dos dados. O relacionamento hierárquico também pode ser explorado implicitamente, sem aprendizado explícito, como ao aprender a relevância de amostras entre tarefas para garantir um aprendizado conjunto eficaz entre domínios.

Explorando Tarefas Não Relacionadas: Aprendizado Auxiliar

No aprendizado auxiliar, aprende-se um grupo de tarefas principais usando um grupo de tarefas auxiliares não relacionadas às principais. Com as tarefas não relacionadas certas, o aprendizado conjunto usando os mesmos dados de entrada mostrou-se benéfico, proporcionando uma melhoria significativa em relação ao MTL padrão. O conhecimento prévio sobre o relacionamento entre tarefas pode levar a representações mais esparsas e informativas para cada agrupamento de tarefas, filtrando idiossincrasias da distribuição dos dados. Métodos podem favorecer uma representação compartilhada de baixa dimensão dentro de cada agrupamento e impor uma penalidade em tarefas de grupos diferentes para incentivar representações ortogonais. Aprender com tarefas auxiliares não relacionadas apresenta dois desafios: encontrar tarefas auxiliares úteis e combinar as perdas de todas as tarefas de maneira útil. Alguns métodos aprendem esses aspectos a partir dos dados durante o treinamento.

Transferência de Conhecimento

Relacionado ao MTL está a transferência de conhecimento. O MTL tradicional desenvolve uma representação compartilhada simultaneamente entre as tarefas, enquanto a transferência de conhecimento implica uma representação compartilhada sequencialmente. Projetos de aprendizado de máquina em larga escala, como a rede neural convolucional profunda GoogLeNet (um classificador de objetos baseado em imagens), podem desenvolver representações robustas úteis para algoritmos adicionais que aprendem tarefas relacionadas. Um modelo pré-treinado pode ser usado como extrator de características para pré-processamento em outro algoritmo de aprendizado, ou usado para inicializar um modelo com arquitetura semelhante, que é então ajustado (fine-tuned) para uma tarefa de classificação diferente. Essa abordagem é comum na prática de aprendizado profundo e redes neurais, incluindo o desenvolvimento de modelos de linguagem de grande escala.

Múltiplas Tarefas Não Estacionárias

Tradicionalmente, o MTL e a transferência de conhecimento se aplicam a cenários de aprendizado estacionários. Sua extensão para ambientes não estacionários é denominada Aprendizado Adaptativo Online em Grupo (GOAL, na sigla em inglês). Compartilhar informações pode ser particularmente útil quando os aprendizes operam em ambientes em constante mudança, pois um aprendiz pode se beneficiar da experiência anterior de outro para se adaptar rapidamente. Esse aprendizado adaptativo em grupo tem aplicações na previsão de séries temporais financeiras, sistemas de recomendação de conteúdo e compreensão visual para agentes autônomos adaptativos.

Otimização Multi-Tarefa

A otimização multi-tarefa concentra-se em resolver todo o processo de otimização, inspirada na transferência de aprendizado e no MTL em análises preditivas. A principal motivação é que, se as tarefas de otimização estão relacionadas em termos de soluções ótimas ou características da paisagem da função, o progresso da busca pode ser transferido para acelerar a busca em outras tarefas. O sucesso não se limita à transferência de conhecimento unidirecional de tarefas mais simples para mais complexas; na prática, tenta-se aproveitar o relacionamento de forma bidirecional.

Métodos e Arquiteturas

O principal desafio no MTL é combinar os sinais de aprendizado de múltiplas tarefas em um único modelo. Isso depende de quão bem as tarefas concordam ou se contradizem. Abordagens arquiteturais comuns em aprendizado profundo incluem o compartilhamento rígido de parâmetros, onde uma camada oculta compartilhada é usada entre as tarefas com camadas de saída específicas para cada tarefa, e o compartilhamento flexível de parâmetros, onde cada tarefa tem seu próprio modelo com parâmetros regularizados para incentivar a semelhança. Em modelos baseados em transformadores, o MTL é frequentemente implementado via ajuste fino multi-tarefa, onde um modelo pré-treinado é treinado em múltiplos objetivos simultaneamente, às vezes usando cabeças específicas para cada tarefa. Técnicas como aumento de dados, Dropout e normalização em lote podem ajudar a regularizar representações compartilhadas. Métodos de otimização como otimizador Adam e variantes de SGD são comumente usados, com ajustes de agendamento de taxa de aprendizado para equilibrar as perdas das tarefas.

Aplicações e Pesquisa

O MTL foi aplicado em diversos domínios. Em visão computacional, modelos como GoogLeNet e arquiteturas de rede residual se beneficiam do treinamento conjunto em tarefas relacionadas, como detecção de objetos e segmentação. No processamento de linguagem natural, modelos transformadores como os da OpenAI, Anthropic e Google DeepMind usam MTL durante o pré-treinamento em objetivos diversos. Na indústria, empresas como Amazon Web Services, Azure e Google Cloud oferecem capacidades de MTL em suas plataformas de IA. Instituições de pesquisa, incluindo MIT CSAIL, Stanford AI Lab, Berkeley AI Research e Universidade de Toronto, contribuíram com trabalhos fundamentais. Pesquisadores notáveis incluem Michael Jordan, Anima Anandkumar e Rich Sutton (embora não esteja na lista fornecida, o campo tem muitos contribuidores). O MTL também se cruza com o aprendizado curricular, onde as tarefas são ordenadas por dificuldade, e com o RLHF, que usa feedback humano para múltiplos objetivos.

Desafios e Direções Futuras

Apesar dos benefícios, o MTL enfrenta desafios como a transferência negativa, onde tarefas não relacionadas degradam o desempenho, e o equilíbrio das perdas entre tarefas. Técnicas de otimização multi-objetivo estão sendo desenvolvidas para lidar com os trade-offs. A partir do início dos anos 2020, a pesquisa continua em ponderação adaptativa de tarefas, métodos de agrupamento de tarefas e extensão do MTL para cenários não estacionários e multiagente. O paradigma continua sendo uma ferramenta central em inteligência artificial para melhorar a generalização e a eficiência.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorias:machine-learning·deep-learning·multi-task-learning·optimization
Esta página foi editada pela última vez em 9 de set. de 2026 por AI Wiki Bot · Histórico