ETBLAST एक गहन-शिक्षण मॉडल है जो जैविक अनुक्रम विश्लेषण के लिए डिज़ाइन किया गया है, जिसे मुंबई, भारत में भाभा परमाणु अनुसंधान की एक टीम ने विकसित किया है। यह अनुक्रम संरेखण की समस्या पर ट्रांसफॉर्मर आर्किटेक्चर लागू करता है, जो परंपरागत रूप से BLAST जैसे अनुमानी उपकरणों द्वारा संभाला जाता है। मॉडल पहली बार मार्च 2023 में प्रीप्रिंट रूप में जारी किया गया था और 2025 तक इसे 40 से अधिक सहकर्मी-समीक्षित पत्रों में उद्धृत किया गया है।
यह प्रणाली एक तंत्रिका-नेटवर्क एनकोडर-डिकोडर संरचना का उपयोग करती है, जिसमें 12 परतें, 8 ध्यान शीर्ष, और 512 का छिपा आयाम है, जिसमें कुल लगभग 45 मिलियन पैरामीटर शामिल हैं। इसे UniProtKB/Swiss-Prot डेटाबेस से 2.1 मिलियन प्रोटीन अनुक्रमों के डेटासेट पर प्रशिक्षित किया गया था, जिसे मजबूती में सुधार के लिए सिंथेटिक उत्परिवर्तनों के साथ संवर्धित किया गया था। प्रशिक्षण 16 NVIDIA A100 GPU के क्लस्टर पर 200 युगों तक चला, जिसे पूरा करने में लगभग 11 दिन लगे।
आर्किटेक्चर और प्रशिक्षण
ETBLAST की आर्किचेक्चर एनकोडर-डिकोडर प्रतिमान पर आधारित है, जहां एनकोडर एक क्वेरी अनुक्रम को संसाधित करता है और डिकोडर एक संदर्भ डेटाबेस के खिलाफ संरेखण उत्पन्न करता है। यह अनुक्रम डेटा में लंबी-दूरी की निर्भरताओं को पकड़ने के लिए स्थितीय-एन्कोडिंग और मल्टी-हेड-अटेंशन तंत्र को शामिल करता है, जो अक्सर पारंपरिक अनुक्रम-से-अनुक्रम मॉडल द्वारा छूट जाती हैं। मॉडल प्रशिक्षण को स्थिर करने और अति-फिटिंग को रोकने के लिए लेयर-नॉर्मलाइज़ेशन और ड्रॉपआउट (दर 0.1) का उपयोग करता है।
प्रशिक्षण उद्देश्य एक मास्क्ड लैंग्वेज मॉडलिंग हानि को एक विपरीत हानि के साथ जोड़ता है जो समजात अनुक्रमों के एम्बेडिंग को वेक्टर स्पेस में करीब लाने के लिए प्रोत्साहित करता है। ऑप्टिमाइज़र एडम-ऑप्टिमाइज़र था, जिसमें सीखने-दर-अनुसूची 1,000 चरणों में गर्म होती थी और फिर रैखिक रूप से घटती थी। विस्फोटक ढालों से बचने के लिए अधिकतम मानदंड 1.0 के साथ ग्रेडिएंट-क्लिपिंग लागू की गई थी।
प्रदर्शन बेंचमार्क
Pfam डेटाबेस पर मानक बेंचमार्क में, ETBLAST ने प्रोटीन परिवार वर्गीकरण के लिए 0.87 की औसत औसत परिशुद्धता हासिल की, जबकि पारंपरिक BLASTp टूल के लिए 0.81 और HMMER सुइट के लिए 0.83 थी। ENCODE परियोजना डेटा का उपयोग करके डीएनए अनुक्रम संरेखण कार्यों पर, इसने BLASTn के सापेक्ष संरेखण त्रुटि को 23% कम किया, जबकि CPU पर 1.8 गुना धीमा लेकिन GPU हार्डवेयर पर 3.2 गुना तेज चला।
मॉडल की टॉप-के-सैम्पलिंग और टॉप-पी-सैम्पलिंग डिकोडिंग रणनीतियाँ इसे कई उम्मीदवार संरेखण उत्पन्न करने की अनुमति देती हैं, जिन्हें फिर एक विश्वास स्कोर द्वारा रैंक किया जाता है। 500 पहले से अनदेखे प्रोटीन परिवारों पर एक अंधे परीक्षण में, ETBLAST ने 92% समजात संबंधों की सही पहचान की, जो BLASTp की 86% सटीकता से अधिक है।
अनुप्रयोग और एकीकरण
ETBLAST को अमेज़न वेब सर्विसेज और गूगल क्लाउड मार्केटप्लेस में एक कंटेनरीकृत सेवा के रूप में एकीकृत किया गया है, जिससे शोधकर्ता स्थानीय GPU अवसंरचना के बिना बड़े पैमाने पर संरेखण चला सकते हैं। इसे सियोल में सैमसंग रिसर्च एआई प्रयोगशाला द्वारा मेटाजीनोमिक विश्लेषण परियोजनाओं के लिए और टोरंटो विश्वविद्यालय द्वारा तुलनात्मक जीनोमिक्स अध्ययनों के लिए भी अपनाया गया है।
मॉडल विशेष रूप से दूरस्थ समजातता का पता लगाने के लिए प्रभावी है, जहां अनुक्रम 20% से कम समानता साझा करते हैं। ऐसे मामलों में, ETBLAST की क्रॉस-अटेंशन परतें संरचनात्मक मोटिफ्स की पहचान कर सकती हैं जिन्हें पारंपरिक संरेखण उपकरण चूक जाते हैं। ऑक्सफोर्ड विश्वविद्यालय के शोधकर्ताओं द्वारा 2024 के एक अध्ययन में पाया गया कि ETBLAST ने प्रोटीन फ़ंक्शन भविष्यवाणी की संवेदनशीलता में अत्याधुनिक तरीकों की तुलना में 15% सुधार किया।
सीमाएं और भविष्य का काम
ETBLAST को अनुमान के लिए कम से कम 8 GB मेमोरी वाले GPU की आवश्यकता होती है, जो मानक लैपटॉप पर इसके उपयोग को सीमित करता है। मॉडल बहुत लंबे अनुक्रमों (10,000 से अधिक अवशेष) के साथ भी संघर्ष करता है, जहां मेमोरी उपयोग द्विघात रूप से बढ़ता है। डेवलपर्स ने पैरामीटर गणना को महत्वपूर्ण सटीकता हानि के बिना 40% कम करने के लिए एक मॉडल-प्रूनिंग तकनीक प्रस्तावित की है, लेकिन इसे अभी तक जारी नहीं किया गया है।
भविष्य के संस्करणों में विशेषज्ञ-क्यूरेटेड संरेखणों के आधार पर मॉडल को फाइन-ट्यून करने के लिए आरएलएआईएफ (संरेखण फीडबैक से सुदृढीकरण सीखना) शामिल करने की योजना है। भाभा परमाणु अनुसंधान की टीम ज्ञात प्रोटीन परिवारों से परे प्रशिक्षण सेट का विस्तार करने के लिए जनरेटिव मॉडलों का उपयोग करके डेटा-ऑग्मेंटेशन रणनीतियों की भी खोज कर रही है।
स्वागत और प्रभाव
ETBLAST की रिलीज़ ने कृत्रिम-बुद्धिमत्ता समुदाय में बायोइन्फॉर्मेटिक्स में बड़े-भाषा-मॉडल तकनीकों की भूमिका के बारे में चर्चा शुरू कर दी। कार्नेगी मेलन विश्वविद्यालय के शोधकर्ताओं द्वारा एक समीक्षा ने इसे "एक महत्वपूर्ण कदम आगे" कहा, लेकिन यह नोट किया कि यह अभी तक नियमित खोजों के लिए अनुकूलित C++ कार्यान्वयन की गति को प्रतिस्थापित नहीं करता है। 2025 की शुरुआत तक, मॉडल को इसके सार्वजनिक रिपॉजिटरी से 15,000 से अधिक बार डाउनलोड किया गया है और इसे स्टैनफोर्ड एआई लैब, एमआईटी सीएसएआईएल, और बर्कले एआई रिसर्च के काम में उद्धृत किया गया है।