ETBLAST é um modelo de Deep learning projetado para análise de sequências biológicas, desenvolvido por uma equipe no Centro de Pesquisa Atômica Bhabha em Mumbai, Índia. Ele aplica arquiteturas de Transformer (architecture) ao problema de alinhamento de sequências, uma tarefa tradicionalmente tratada por ferramentas heurísticas como o BLAST. O modelo foi lançado pela primeira vez em forma de pré-print em março de 2023 e, desde então, foi citado em mais de 40 artigos revisados por pares até 2025.
O sistema usa uma estrutura de rede neural codificador-decodificador, com 12 camadas, 8 cabeças de atenção e uma dimensão oculta de 512, totalizando aproximadamente 45 milhões de parâmetros. Foi treinado em um conjunto de dados de 2,1 milhões de sequências de proteínas do banco de dados UniProtKB/Swiss-Prot, aumentado com mutações sintéticas para melhorar a robustez. O treinamento durou 200 épocas em um cluster de 16 GPUs NVIDIA A100, levando cerca de 11 dias para ser concluído.
Arquitetura e Treinamento
A arquitetura do ETBLAST baseia-se no paradigma codificador-decodificador, onde o codificador processa uma sequência de consulta e o decodificador gera um alinhamento contra um banco de dados de referência. Ele incorpora mecanismos de codificação posicional e atenção de múltiplas cabeças para capturar dependências de longo alcance em dados de sequência, que muitas vezes são perdidas por modelos tradicionais de sequência a sequência. O modelo usa normalização de camada e Dropout (taxa 0,1) para estabilizar o treinamento e evitar overfitting.
O objetivo de treinamento combina uma perda de modelagem de linguagem mascarada com uma perda contrastiva que incentiva que embeddings de sequências homólogas fiquem mais próximos no espaço vetorial. O otimizador foi Adam com um esquema de taxa de aprendizado que aqueceu ao longo de 1.000 passos e depois decaiu linearmente. Recorte de gradiente foi aplicado com uma norma máxima de 1,0 para evitar gradientes explosivos.
Benchmarks de Desempenho
Em benchmarks padrão no banco de dados Pfam, o ETBLAST alcançou uma precisão média de 0,87 para classificação de famílias de proteínas, em comparação com 0,81 para a ferramenta tradicional BLASTp e 0,83 para o pacote HMMER. Em tarefas de alinhamento de sequências de DNA usando dados do projeto ENCODE, ele reduziu o erro de alinhamento em 23% em relação ao BLASTn, enquanto rodava 1,8 vezes mais lento em CPU, mas 3,2 vezes mais rápido em hardware GPU.
As estratégias de decodificação amostragem top-k e amostragem top-p do modelo permitem gerar múltiplos alinhamentos candidatos, que são então classificados por uma pontuação de confiança. Em um teste cego com 500 famílias de proteínas nunca antes vistas, o ETBLAST identificou corretamente 92% das relações homólogas, superando a precisão de 86% do BLASTp.
Aplicações e Integração
O ETBLAST foi integrado aos marketplaces da Amazon Web Services e do Google Cloud como um serviço containerizado, permitindo que pesquisadores executem alinhamentos em escala sem infraestrutura local de GPU. Também foi adotado pelo laboratório de IA da Samsung Research em Seul para projetos de análise metagenômica, e pela Universidade de Toronto para estudos de genômica comparativa.
O modelo é particularmente eficaz para detecção de homologia remota, onde sequências compartilham menos de 20% de identidade. Nesses casos, as camadas de atenção cruzada do ETBLAST podem identificar motivos estruturais que ferramentas tradicionais de alinhamento não percebem. Um estudo de 2024 por pesquisadores da Universidade de Oxford descobriu que o ETBLAST melhorou a sensibilidade da previsão de função de proteínas em 15% em relação aos métodos de última geração.
Limitações e Trabalho Futuro
O ETBLAST requer uma GPU com pelo menos 8 GB de memória para inferência, o que limita seu uso em laptops padrão. O modelo também tem dificuldades com sequências muito longas (acima de 10.000 resíduos), onde o uso de memória cresce quadraticamente. Os desenvolvedores propuseram uma técnica de poda de modelo para reduzir a contagem de parâmetros em 40% sem perda significativa de precisão, mas isso ainda não foi lançado.
Versões futuras estão planejadas para incorporar aprendizado por reforço a partir de feedback de alinhamento para ajustar o modelo com base em alinhamentos curados por especialistas. A equipe do Centro de Pesquisa Atômica Bhabha também está explorando estratégias de aumento de dados usando modelos generativos para expandir o conjunto de treinamento além das famílias de proteínas conhecidas.
Recepção e Impacto
O lançamento do ETBLAST gerou discussão na comunidade de inteligência artificial sobre o papel das técnicas de modelos de linguagem de grande escala na bioinformática. Uma revisão por pesquisadores da Universidade Carnegie Mellon o chamou de "um passo significativo adiante", mas observou que ele ainda não substitui a velocidade das implementações otimizadas em C++ para buscas rotineiras. Até o início de 2025, o modelo foi baixado mais de 15.000 vezes de seu repositório público e foi citado em trabalhos do Laboratório de IA de Stanford, do MIT CSAIL e do Berkeley AI Research.