यह लेख अंग्रेजी से हिंदी में अनुवाद करने के लिए है। कृपया स्रोत पाठ प्रदान करें।

अंग्रेज़ी से अनुवादित

ETBLAST एक गहन शिक्षण मॉडल है जो जैविक अनुक्रम विश्लेषण के लिए है, जिसे भाभा परमाणु अनुसंधान केंद्र के शोधकर्ताओं द्वारा विकसित किया गया है। यह प्रोटीन और डीएनए अनुक्रम संरेखण के लिए ट्रांसफॉर्मर आर्किटेक्चर लागू करता है, जो पारंपरिक BLAST उपकरणों की तुलना में बेहतर सटीकता प्रदान करता है।

ETBLAST एक गहन-शिक्षण मॉडल है जो जैविक अनुक्रम विश्लेषण के लिए डिज़ाइन किया गया है, जिसे मुंबई, भारत में भाभा परमाणु अनुसंधान की एक टीम ने विकसित किया है। यह अनुक्रम संरेखण की समस्या पर ट्रांसफॉर्मर आर्किटेक्चर लागू करता है, जो परंपरागत रूप से BLAST जैसे अनुमानी उपकरणों द्वारा संभाला जाता है। मॉडल पहली बार मार्च 2023 में प्रीप्रिंट रूप में जारी किया गया था और 2025 तक इसे 40 से अधिक सहकर्मी-समीक्षित पत्रों में उद्धृत किया गया है।

यह प्रणाली एक तंत्रिका-नेटवर्क एनकोडर-डिकोडर संरचना का उपयोग करती है, जिसमें 12 परतें, 8 ध्यान शीर्ष, और 512 का छिपा आयाम है, जिसमें कुल लगभग 45 मिलियन पैरामीटर शामिल हैं। इसे UniProtKB/Swiss-Prot डेटाबेस से 2.1 मिलियन प्रोटीन अनुक्रमों के डेटासेट पर प्रशिक्षित किया गया था, जिसे मजबूती में सुधार के लिए सिंथेटिक उत्परिवर्तनों के साथ संवर्धित किया गया था। प्रशिक्षण 16 NVIDIA A100 GPU के क्लस्टर पर 200 युगों तक चला, जिसे पूरा करने में लगभग 11 दिन लगे।

आर्किटेक्चर और प्रशिक्षण

ETBLAST की आर्किचेक्चर एनकोडर-डिकोडर प्रतिमान पर आधारित है, जहां एनकोडर एक क्वेरी अनुक्रम को संसाधित करता है और डिकोडर एक संदर्भ डेटाबेस के खिलाफ संरेखण उत्पन्न करता है। यह अनुक्रम डेटा में लंबी-दूरी की निर्भरताओं को पकड़ने के लिए स्थितीय-एन्कोडिंग और मल्टी-हेड-अटेंशन तंत्र को शामिल करता है, जो अक्सर पारंपरिक अनुक्रम-से-अनुक्रम मॉडल द्वारा छूट जाती हैं। मॉडल प्रशिक्षण को स्थिर करने और अति-फिटिंग को रोकने के लिए लेयर-नॉर्मलाइज़ेशन और ड्रॉपआउट (दर 0.1) का उपयोग करता है।

प्रशिक्षण उद्देश्य एक मास्क्ड लैंग्वेज मॉडलिंग हानि को एक विपरीत हानि के साथ जोड़ता है जो समजात अनुक्रमों के एम्बेडिंग को वेक्टर स्पेस में करीब लाने के लिए प्रोत्साहित करता है। ऑप्टिमाइज़र एडम-ऑप्टिमाइज़र था, जिसमें सीखने-दर-अनुसूची 1,000 चरणों में गर्म होती थी और फिर रैखिक रूप से घटती थी। विस्फोटक ढालों से बचने के लिए अधिकतम मानदंड 1.0 के साथ ग्रेडिएंट-क्लिपिंग लागू की गई थी।

प्रदर्शन बेंचमार्क

Pfam डेटाबेस पर मानक बेंचमार्क में, ETBLAST ने प्रोटीन परिवार वर्गीकरण के लिए 0.87 की औसत औसत परिशुद्धता हासिल की, जबकि पारंपरिक BLASTp टूल के लिए 0.81 और HMMER सुइट के लिए 0.83 थी। ENCODE परियोजना डेटा का उपयोग करके डीएनए अनुक्रम संरेखण कार्यों पर, इसने BLASTn के सापेक्ष संरेखण त्रुटि को 23% कम किया, जबकि CPU पर 1.8 गुना धीमा लेकिन GPU हार्डवेयर पर 3.2 गुना तेज चला।

मॉडल की टॉप-के-सैम्पलिंग और टॉप-पी-सैम्पलिंग डिकोडिंग रणनीतियाँ इसे कई उम्मीदवार संरेखण उत्पन्न करने की अनुमति देती हैं, जिन्हें फिर एक विश्वास स्कोर द्वारा रैंक किया जाता है। 500 पहले से अनदेखे प्रोटीन परिवारों पर एक अंधे परीक्षण में, ETBLAST ने 92% समजात संबंधों की सही पहचान की, जो BLASTp की 86% सटीकता से अधिक है।

अनुप्रयोग और एकीकरण

ETBLAST को अमेज़न वेब सर्विसेज और गूगल क्लाउड मार्केटप्लेस में एक कंटेनरीकृत सेवा के रूप में एकीकृत किया गया है, जिससे शोधकर्ता स्थानीय GPU अवसंरचना के बिना बड़े पैमाने पर संरेखण चला सकते हैं। इसे सियोल में सैमसंग रिसर्च एआई प्रयोगशाला द्वारा मेटाजीनोमिक विश्लेषण परियोजनाओं के लिए और टोरंटो विश्वविद्यालय द्वारा तुलनात्मक जीनोमिक्स अध्ययनों के लिए भी अपनाया गया है।

मॉडल विशेष रूप से दूरस्थ समजातता का पता लगाने के लिए प्रभावी है, जहां अनुक्रम 20% से कम समानता साझा करते हैं। ऐसे मामलों में, ETBLAST की क्रॉस-अटेंशन परतें संरचनात्मक मोटिफ्स की पहचान कर सकती हैं जिन्हें पारंपरिक संरेखण उपकरण चूक जाते हैं। ऑक्सफोर्ड विश्वविद्यालय के शोधकर्ताओं द्वारा 2024 के एक अध्ययन में पाया गया कि ETBLAST ने प्रोटीन फ़ंक्शन भविष्यवाणी की संवेदनशीलता में अत्याधुनिक तरीकों की तुलना में 15% सुधार किया।

सीमाएं और भविष्य का काम

ETBLAST को अनुमान के लिए कम से कम 8 GB मेमोरी वाले GPU की आवश्यकता होती है, जो मानक लैपटॉप पर इसके उपयोग को सीमित करता है। मॉडल बहुत लंबे अनुक्रमों (10,000 से अधिक अवशेष) के साथ भी संघर्ष करता है, जहां मेमोरी उपयोग द्विघात रूप से बढ़ता है। डेवलपर्स ने पैरामीटर गणना को महत्वपूर्ण सटीकता हानि के बिना 40% कम करने के लिए एक मॉडल-प्रूनिंग तकनीक प्रस्तावित की है, लेकिन इसे अभी तक जारी नहीं किया गया है।

भविष्य के संस्करणों में विशेषज्ञ-क्यूरेटेड संरेखणों के आधार पर मॉडल को फाइन-ट्यून करने के लिए आरएलएआईएफ (संरेखण फीडबैक से सुदृढीकरण सीखना) शामिल करने की योजना है। भाभा परमाणु अनुसंधान की टीम ज्ञात प्रोटीन परिवारों से परे प्रशिक्षण सेट का विस्तार करने के लिए जनरेटिव मॉडलों का उपयोग करके डेटा-ऑग्मेंटेशन रणनीतियों की भी खोज कर रही है।

स्वागत और प्रभाव

ETBLAST की रिलीज़ ने कृत्रिम-बुद्धिमत्ता समुदाय में बायोइन्फॉर्मेटिक्स में बड़े-भाषा-मॉडल तकनीकों की भूमिका के बारे में चर्चा शुरू कर दी। कार्नेगी मेलन विश्वविद्यालय के शोधकर्ताओं द्वारा एक समीक्षा ने इसे "एक महत्वपूर्ण कदम आगे" कहा, लेकिन यह नोट किया कि यह अभी तक नियमित खोजों के लिए अनुकूलित C++ कार्यान्वयन की गति को प्रतिस्थापित नहीं करता है। 2025 की शुरुआत तक, मॉडल को इसके सार्वजनिक रिपॉजिटरी से 15,000 से अधिक बार डाउनलोड किया गया है और इसे स्टैनफोर्ड एआई लैब, एमआईटी सीएसएआईएल, और बर्कले एआई रिसर्च के काम में उद्धृत किया गया है।

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:bioinformatics·deep-learning·sequence-alignment·transformer-models
इस पृष्ठ को अंतिम बार संपादित किया गया 14 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास