ETBLAST ist ein Deep-Learning-Modell zur Analyse biologischer Sequenzen, das von einem Team am Bhabha-Atomforschungszentrum in Mumbai, Indien, entwickelt wurde. Es wendet Transformer-Architekturen auf das Problem des Sequenzabgleichs an, eine Aufgabe, die traditionell von heuristischen Werkzeugen wie BLAST übernommen wird. Das Modell wurde erstmals im März 2023 als Vorabdruck veröffentlicht und wurde seitdem bis 2025 in über 40 begutachteten Fachartikeln zitiert.
Das System verwendet eine neuronale-Netzwerk-Encoder-Decoder-Struktur mit 12 Schichten, 8 Aufmerksamkeitsköpfen und einer verborgenen Dimension von 512, was insgesamt etwa 45 Millionen Parametern entspricht. Es wurde mit einem Datensatz von 2,1 Millionen Proteinsequenzen aus der UniProtKB/Swiss-Prot-Datenbank trainiert, der durch synthetische Mutationen ergänzt wurde, um die Robustheit zu verbessern. Das Training lief über 200 Epochen auf einem Cluster von 16 NVIDIA-A100-GPUs und dauerte etwa 11 Tage.
Architektur und Training
Die Architektur von ETBLAST baut auf dem Encoder-Decoder-Paradigma auf, bei dem der Encoder eine Abfragesequenz verarbeitet und der Decoder einen Abgleich gegen eine Referenzdatenbank erzeugt. Es integriert positionale Kodierung und Multi-Head-Aufmerksamkeit-Mechanismen, um langreichweitige Abhängigkeiten in Sequenzdaten zu erfassen, die von traditionellen Sequenz-zu-Sequenz-Modellen oft übersehen werden. Das Modell verwendet Schichtnormalisierung und Dropout (Rate 0,1), um das Training zu stabilisieren und Überanpassung zu verhindern.
Das Trainingsziel kombiniert einen Verlust für maskierte Sprachmodellierung mit einem kontrastiven Verlust, der die Einbettungen homologer Sequenzen im Vektorraum näher zusammenbringt. Der Optimierer war Adam mit einem Lernratenplan, der über 1.000 Schritte aufwärmte und dann linear abnahm. Gradienten-Clipping wurde mit einer maximalen Norm von 1,0 angewendet, um explodierende Gradienten zu vermeiden.
Leistungsbenchmarks
In Standard-Benchmarks auf der Pfam-Datenbank erreichte ETBLAST eine mittlere durchschnittliche Präzision von 0,87 für die Klassifizierung von Proteinfamilien, verglichen mit 0,81 für das traditionelle BLASTp-Werkzeug und 0,83 für die HMMER-Suite. Bei DNA-Sequenzabgleichsaufgaben mit Daten des ENCODE-Projekts reduzierte es den Abgleichsfehler um 23 % relativ zu BLASTn, lief jedoch auf der CPU 1,8-mal langsamer, auf GPU-Hardware jedoch 3,2-mal schneller.
Die Top-k-Sampling- und Top-p-Sampling-Dekodierungsstrategien des Modells ermöglichen die Erzeugung mehrerer Kandidatenabgleiche, die anschließend nach einem Konfidenzwert eingestuft werden. In einem Blindtest mit 500 zuvor unbekannten Proteinfamilien identifizierte ETBLAST 92 % der homologen Beziehungen korrekt und übertraf damit die 86 % Genauigkeit von BLASTp.
Anwendungen und Integration
ETBLAST wurde als containerisierter Dienst in die Marktplätze von Amazon Web Services und Google Cloud integriert, sodass Forscher Abgleiche ohne lokale GPU-Infrastruktur in großem Maßstab durchführen können. Es wurde auch vom KI-Labor Samsung Research in Seoul für metagenomische Analyseprojekte sowie von der Universität Toronto für vergleichende Genomikstudien übernommen.
Das Modell ist besonders effektiv bei der Erkennung entfernter Homologien, bei denen Sequenzen weniger als 20 % Identität aufweisen. In solchen Fällen können die Cross-Attention-Schichten von ETBLAST strukturelle Motive identifizieren, die traditionelle Abgleichswerkzeuge übersehen. Eine Studie von Forschern der Universität Oxford aus dem Jahr 2024 ergab, dass ETBLAST die Sensitivität der Proteinfunktionsvorhersage um 15 % gegenüber modernsten Methoden verbesserte.
Einschränkungen und zukünftige Arbeiten
ETBLAST erfordert für die Inferenz eine GPU mit mindestens 8 GB Speicher, was die Nutzung auf Standard-Laptops einschränkt. Das Modell hat außerdem Schwierigkeiten mit sehr langen Sequenzen (über 10.000 Reste), bei denen der Speicherverbrauch quadratisch wächst. Die Entwickler haben eine Modellbereinigung-Technik vorgeschlagen, um die Parameteranzahl ohne signifikanten Genauigkeitsverlust um 40 % zu reduzieren, diese wurde jedoch noch nicht veröffentlicht.
Zukünftige Versionen sollen RLAlF (Verstärkungslernen aus Abgleichsfeedback) integrieren, um das Modell auf der Grundlage von fachlich kuratierten Abgleichen feinabzustimmen. Das Team am Bhabha-Atomforschungszentrum untersucht außerdem Datenanreicherung-Strategien mit generativen Modellen, um den Trainingssatz über bekannte Proteinfamilien hinaus zu erweitern.
Rezeption und Auswirkungen
Die Veröffentlichung von ETBLAST löste in der Künstliche-Intelligenz-Gemeinschaft Diskussionen über die Rolle von Large-Language-Model-Techniken in der Bioinformatik aus. Eine Rezension von Forschern der Carnegie Mellon University nannte es "einen bedeutenden Schritt nach vorn", merkte jedoch an, dass es für Routine-Suchen die Geschwindigkeit optimierter C++-Implementierungen noch nicht ersetzt. Bis Anfang 2025 wurde das Modell über 15.000 Mal aus seinem öffentlichen Repository heruntergeladen und in Arbeiten von Stanford AI Lab, MIT CSAIL und Berkeley AI Research zitiert.