ETBLAST est un modèle de apprentissage profond conçu pour l'analyse de séquences biologiques, développé par une équipe du Bhabha Atomic Research à Mumbai, en Inde. Il applique des architectures de transformeur au problème de l'alignement de séquences, une tâche traditionnellement gérée par des outils heuristiques comme BLAST. Le modèle a été publié pour la première fois sous forme de prépublication en mars 2023 et a depuis été cité dans plus de 40 articles évalués par des pairs en 2025.
Le système utilise une structure réseau de neurones encodeur-décodeur, avec 12 couches, 8 têtes d'attention et une dimension cachée de 512, totalisant environ 45 millions de paramètres. Il a été entraîné sur un ensemble de données de 2,1 millions de séquences protéiques provenant de la base de données UniProtKB/Swiss-Prot, augmenté de mutations synthétiques pour améliorer la robustesse. L'entraînement a duré 200 époques sur un cluster de 16 GPU NVIDIA A100, prenant environ 11 jours pour se terminer.
Architecture et entraînement
L'architecture d'ETBLAST repose sur le paradigme encodeur-décodeur, où l'encodeur traite une séquence de requête et le décodeur génère un alignement contre une base de données de référence. Il intègre des mécanismes de encodage positionnel et de attention multi-têtes pour capturer les dépendances à longue portée dans les données de séquence, souvent manquées par les modèles séquence à séquence traditionnels. Le modèle utilise la normalisation de couche et le abandon (taux 0,1) pour stabiliser l'entraînement et prévenir le surapprentissage.
L'objectif d'entraînement combine une perte de modélisation de langage masqué avec une perte contrastive qui encourage les plongements de séquences homologues à être plus proches dans l'espace vectoriel. L'optimiseur était Adam avec un programme de taux d'apprentissage qui s'échauffait sur 1 000 étapes puis décroissait linéairement. Le écrêtage de gradient a été appliqué avec une norme maximale de 1,0 pour éviter les gradients explosifs.
Benchmarks de performance
Dans les benchmarks standard sur la base de données Pfam, ETBLAST a atteint une précision moyenne de 0,87 pour la classification des familles de protéines, contre 0,81 pour l'outil traditionnel BLASTp et 0,83 pour la suite HMMER. Sur les tâches d'alignement de séquences d'ADN utilisant les données du projet ENCODE, il a réduit l'erreur d'alignement de 23 % par rapport à BLASTn, tout en étant 1,8 fois plus lent sur CPU mais 3,2 fois plus rapide sur GPU.
Les stratégies de décodage échantillonnage top-k et échantillonnage top-p du modèle lui permettent de générer plusieurs alignements candidats, ensuite classés par un score de confiance. Dans un test en aveugle sur 500 familles de protéines jamais vues, ETBLAST a correctement identifié 92 % des relations homologues, dépassant la précision de 86 % de BLASTp.
Applications et intégration
ETBLAST a été intégré aux places de marché Amazon Web Services et Google Cloud comme service conteneurisé, permettant aux chercheurs d'exécuter des alignements à grande échelle sans infrastructure GPU locale. Il a également été adopté par le laboratoire d'IA Samsung Research à Séoul pour des projets d'analyse métagénomique, et par l'Université de Toronto pour des études de génomique comparative.
Le modèle est particulièrement efficace pour la détection d'homologie distante, où les séquences partagent moins de 20 % d'identité. Dans ces cas, les couches de attention croisée d'ETBLAST peuvent identifier des motifs structurels que les outils d'alignement traditionnels manquent. Une étude de 2024 menée par des chercheurs de l'Université d'Oxford a constaté qu'ETBLAST améliorait la sensibilité de la prédiction de fonction protéique de 15 % par rapport aux méthodes de pointe.
Limites et travaux futurs
ETBLAST nécessite un GPU avec au moins 8 Go de mémoire pour l'inférence, ce qui limite son utilisation sur les ordinateurs portables standard. Le modèle rencontre également des difficultés avec les séquences très longues (plus de 10 000 résidus), où l'utilisation de la mémoire croît de manière quadratique. Les développeurs ont proposé une technique de élagage de modèle pour réduire le nombre de paramètres de 40 % sans perte significative de précision, mais celle-ci n'a pas encore été publiée.
Les versions futures prévoient d'incorporer RLAIF (apprentissage par renforcement à partir de retours d'alignement) pour affiner le modèle en fonction d'alignements sélectionnés par des experts. L'équipe du Bhabha Atomic Research explore également des stratégies de augmentation de données utilisant des modèles génératifs pour étendre l'ensemble d'entraînement au-delà des familles de protéines connues.
Réception et impact
La publication d'ETBLAST a suscité des discussions dans la communauté de l'intelligence artificielle sur le rôle des techniques de grands modèles de langage en bioinformatique. Une revue menée par des chercheurs de l'Université Carnegie Mellon l'a qualifié de « pas en avant significatif », mais a noté qu'il ne remplace pas encore la rapidité des implémentations C++ optimisées pour les recherches de routine. Début 2025, le modèle a été téléchargé plus de 15 000 fois depuis son dépôt public et a été cité dans des travaux provenant du laboratoire d'IA de Stanford, du CSAIL du MIT et de la recherche en IA de Berkeley.