Jpred是一个基于网络的蛋白质二级结构预测服务器,由邓迪大学的Barton研究组开发和维护。它接受蛋白质序列,并返回二级结构(α-螺旋、β-折叠或卷曲)的预测,以及溶剂可及性和置信度评分。该服务器自20世纪90年代末起公开可用,并在生物信息学研究中被广泛使用。
Jpred的预测方法整合了由PSI-BLAST针对蛋白质数据库生成的多序列比对,捕获了提高准确性的进化信息。核心算法采用神经网络,特别是循环架构,在已知蛋白质结构上进行训练。多年来,Jpred经历了多次更新,当前版本(Jpred 4)提供了改进的性能和用户友好的界面。
历史与发展
Jpred于1998年由邓迪大学的James Cuff和Geoffrey Barton首次发布。它是最早公开可用的二级结构预测服务器之一,建立在PHD和PSIPRED等早期方法的基础上。该服务器设计简单:用户提交序列,几分钟内即可收到预测结果。初始版本使用了一组在非冗余蛋白质结构集上训练的神经网络。
2008年,Jpred 3发布,采用了更复杂的算法,使用了两阶段神经网络和改进的比对生成。最新的主要版本Jpred 4于2015年推出,引入了更快的流程和更新的底层数据库。该服务器持续维护,定期更新以反映新的蛋白质结构数据和算法改进。
方法论
Jpred的预测流程从查询序列开始。它首先运行PSI-BLAST搜索序列数据库(例如UniProt)以查找同源序列,然后将这些序列比对生成多序列比对。该比对被转换为位置特异性评分矩阵(PSSM),捕获进化保守模式。
PSSM被输入到神经网络中,在Jpred 4中,这是一个带有长短期记忆(LSTM)单元的循环神经网络,处理序列上下文。网络输出每个残基处于三种二级结构状态之一的概率:H(螺旋)、E(折叠)或C(卷曲)。另一个网络预测溶剂可及性(埋藏或暴露)。最终输出包括每个残基的置信度评分,通常范围从0到9。
训练数据来自蛋白质数据银行(PDB),经过过滤以去除冗余。神经网络使用反向传播和交叉熵损失函数进行训练。Jpred 4的准确性据报道在三种状态预测(Q3)中约为82%,与其他现代方法相比具有竞争力。
使用与应用
Jpred被研究人员用于注释没有已知结构的蛋白质序列,帮助功能推断和实验设计。它通常是结构生物信息学流程中的第一步,例如同源建模和折叠识别。该服务器还提供批量模式以分析多个序列,以及用于程序化访问的API。
除了二级结构,Jpred输出还可用于指导定点突变实验、识别功能残基,并协助蛋白质工程。该服务器已在数千篇科学出版物中被引用,使其成为该领域的标准工具。
可用性与影响
Jpred对学术用户免费开放,可在邓迪大学的网站上访问。它运行在Linux服务器集群上,确保快速周转时间。该服务器持续获得研究资助,包括来自生物技术与生物科学研究委员会(BBSRC)的资助。
Jpred的影响在于其可访问性和可靠性。它一直是二级结构预测的基准,其输出常与PSIPRED和Jpred的继任者JNet等其他工具进行比较。该服务器的设计影响了后来的基于网络的生物信息学工具,强调易用性和清晰的输出可视化。
相关工具与未来方向
Jpred是蛋白质结构预测工具更广泛生态系统的一部分,包括基于Artificial intelligence的方法,如AlphaFold,这些方法预测完整的3D结构。虽然Jpred专注于二级结构,但其对Machine learning技术的整合随时间不断演变。未来的更新可能纳入Deep learning架构,例如Transformer (architecture)模型,以进一步提高准确性。
该服务器仍保持积极维护,Barton研究组继续开发底层神经网络JNet。截至当前日期,Jpred 4是标准版本,尚未宣布新的主要版本,但预计数据库和算法的持续改进将继续进行。