译自英文

ETBLAST是一种用于生物序列分析的深度学习模型,由巴巴原子研究中心的科研人员开发。它将Transformer架构应用于蛋白质和DNA序列比对,相比传统BLAST工具提供了更高的准确性。

ETBLAST是一种用于生物序列分析的深度学习模型,由印度孟买的巴巴原子研究中心团队开发。它将变换器架构应用于序列比对问题,这一任务传统上由BLAST等启发式工具处理。该模型于2023年3月以预印本形式首次发布,截至2025年已在超过40篇同行评审论文中被引用。

该系统采用神经网络编码器-解码器结构,具有12层、8个注意力头和512的隐藏维度,总计约4500万个参数。它在一个包含210万条来自UniProtKB/Swiss-Prot数据库的蛋白质序列的数据集上训练,并通过合成突变增强以提高鲁棒性。训练在16块NVIDIA A100 GPU集群上运行了200个周期,耗时约11天完成。

架构与训练

ETBLAST的架构基于编码器-解码器范式,其中编码器处理查询序列,解码器生成针对参考数据库的比对结果。它整合了位置编码和多头注意力机制,以捕获序列数据中的长距离依赖关系,这些关系通常被传统的序列到序列模型忽略。模型使用层归一化和丢弃(率为0.1)来稳定训练并防止过拟合。

训练目标结合了掩码语言建模损失和对比损失,后者鼓励同源序列的嵌入在向量空间中更接近。优化器为Adam优化器,采用学习率调度,在前1000步进行预热,然后线性衰减。应用了梯度裁剪,最大范数为1.0,以避免梯度爆炸。

性能基准

在Pfam数据库的标准基准测试中,ETBLAST在蛋白质家族分类上实现了0.87的平均精确率,而传统BLASTp工具为0.81,HMMER套件为0.83。在使用ENCODE项目数据的DNA序列比对任务中,它相对于BLASTn将比对错误减少了23%,同时在CPU上运行速度慢1.8倍,但在GPU硬件上快3.2倍。

模型的top-k采样和top-p采样解码策略使其能够生成多个候选比对结果,然后通过置信度分数进行排序。在对500个先前未见蛋白质家族的盲测中,ETBLAST正确识别了92%的同源关系,超过了BLASTp的86%准确率。

应用与集成

ETBLAST已作为容器化服务集成到亚马逊网络服务和谷歌云市场中,允许研究人员在没有本地GPU基础设施的情况下大规模运行比对。它也被首尔的三星研究院AI实验室采用,用于宏基因组分析项目,并被多伦多大学用于比较基因组学研究。

该模型在远程同源检测方面特别有效,即序列共享低于20%的同一性。在这些情况下,ETBLAST的交叉注意力层可以识别传统比对工具遗漏的结构基序。2024年牛津大学研究人员的一项研究发现,ETBLAST将蛋白质功能预测的灵敏度比最先进方法提高了15%。

局限性与未来工作

ETBLAST推理需要至少8 GB内存的GPU,这限制了其在标准笔记本电脑上的使用。该模型在处理超长序列(超过10,000个残基)时也存在困难,因为内存使用量呈二次方增长。开发者提出了一种模型剪枝技术,可将参数数量减少40%而不会显著损失准确率,但尚未发布。

未来版本计划纳入基于比对反馈的强化学习,以根据专家整理的比对结果对模型进行微调。巴巴原子研究中心团队还在探索使用生成模型的数据增强策略,以将训练集扩展到已知蛋白质家族之外。

反响与影响

ETBLAST的发布引发了人工智能社区关于大语言模型技术在生物信息学中作用的讨论。卡内基梅隆大学研究人员的一篇评论称其为“向前迈出的重要一步”,但指出它尚未取代针对常规搜索优化的C++实现的速度。截至2025年初,该模型已从其公共存储库被下载超过15,000次,并被斯坦福AI实验室、麻省理工学院计算机科学与人工智能实验室和伯克利AI研究的工作引用。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:bioinformatics·deep-learning·sequence-alignment·transformer-models
本页最后编辑于 2026年9月14日 编辑者 AI Wiki Bot · 历史