Jpred est un serveur web de prédiction de structure secondaire des protéines, développé et maintenu par le groupe Barton à l'Université de Dundee. Il accepte une séquence protéique et renvoie une prédiction de la structure secondaire (hélice alpha, brin bêta ou boucle), ainsi que l'accessibilité au solvant et des scores de confiance. Le serveur est accessible au public depuis la fin des années 1990 et est largement utilisé dans la recherche en bioinformatique.
La méthode de prédiction de Jpred intègre des alignements de séquences multiples générés par PSI-BLAST contre des bases de données de protéines, capturant des informations évolutives qui améliorent la précision. L'algorithme principal utilise un réseau de neurones, plus précisément une architecture récurrente, entraîné sur des structures protéiques connues. Au fil des ans, Jpred a subi plusieurs mises à jour, la version actuelle (Jpred 4) offrant des performances améliorées et une interface conviviale.
Historique et développement
Jpred a été publié pour la première fois en 1998 par James Cuff et Geoffrey Barton à l'Université de Dundee. Il a été l'un des premiers serveurs de prédiction de structure secondaire accessibles au public, s'appuyant sur des méthodes antérieures comme PHD et PSIPRED. Le serveur a été conçu pour être simple : les utilisateurs soumettent une séquence et reçoivent une prédiction en quelques minutes. La version initiale utilisait un jury de réseaux de neurones entraînés sur un ensemble non redondant de structures protéiques.
En 2008, Jpred 3 a été publié, intégrant un algorithme plus sophistiqué utilisant un réseau de neurones en deux étapes et une génération d'alignements améliorée. La dernière version majeure, Jpred 4, lancée en 2015, a introduit un pipeline plus rapide et des bases de données sous-jacentes mises à jour. Le serveur a été continuellement maintenu, avec des mises à jour périodiques pour refléter les nouvelles données de structures protéiques et les améliorations algorithmiques.
Méthodologie
Le pipeline de prédiction de Jpred commence par une séquence requête. Il exécute d'abord PSI-BLAST pour rechercher dans une base de données de séquences (par exemple, UniProt) des séquences homologues, qui sont ensuite alignées pour créer un alignement de séquences multiples. Cet alignement est converti en une matrice de scores spécifiques à la position (PSSM) qui capture les motifs de conservation évolutive.
La PSSM est introduite dans un réseau de neurones, plus précisément un réseau de neurones récurrent avec des unités de mémoire à long terme (LSTM) dans Jpred 4, qui traite le contexte de la séquence. Le réseau produit des probabilités pour chaque résidu d'être dans l'un des trois états de structure secondaire : H (hélice), E (brin) ou C (boucle). Un réseau séparé prédit l'accessibilité au solvant (enfoui ou exposé). La sortie finale comprend un score de confiance par résidu, généralement compris entre 0 et 9.
Les données d'entraînement proviennent de la Protein Data Bank (PDB), filtrées pour éliminer la redondance. Le réseau de neurones est entraîné à l'aide de la rétropropagation et d'une fonction de perte d'entropie croisée. La précision de Jpred 4 est rapportée à environ 82 % pour la prédiction à trois états (Q3), ce qui est compétitif avec d'autres méthodes modernes.
Utilisation et applications
Jpred est utilisé par les chercheurs pour annoter des séquences protéiques sans structures connues, facilitant l'inférence fonctionnelle et la conception expérimentale. Il est souvent une première étape dans les pipelines de bioinformatique structurale, tels que la modélisation par homologie et la reconnaissance de repliements. Le serveur propose également un mode batch pour analyser plusieurs séquences et une API pour un accès programmatique.
Au-delà de la structure secondaire, la sortie de Jpred peut être utilisée pour guider des expériences de mutagenèse dirigée, identifier des résidus fonctionnels et assister dans l'ingénierie des protéines. Le serveur a été cité dans des milliers de publications scientifiques, en faisant un outil standard dans le domaine.
Disponibilité et impact
Jpred est librement accessible aux utilisateurs académiques sur le site web de l'Université de Dundee. Il fonctionne sur un cluster de serveurs Linux, garantissant des temps de réponse rapides. Le serveur a été continuellement financé par des subventions de recherche, notamment du Biotechnology and Biological Sciences Research Council (BBSRC).
L'impact de Jpred réside dans son accessibilité et sa fiabilité. Il a été une référence pour la prédiction de structure secondaire, et ses sorties sont souvent comparées à d'autres outils comme PSIPRED et le successeur de Jpred, JNet. La conception du serveur a influencé les outils bioinformatiques web ultérieurs, mettant l'accent sur la facilité d'utilisation et une visualisation claire des résultats.
Outils connexes et orientations futures
Jpred fait partie d'un écosystème plus large d'outils de prédiction de structure protéique, y compris des méthodes basées sur l'intelligence artificielle comme AlphaFold, qui prédisent des structures 3D complètes. Alors que Jpred se concentre sur la structure secondaire, son intégration de techniques de apprentissage automatique a évolué au fil du temps. Les futures mises à jour pourraient incorporer des architectures de apprentissage profond, telles que des modèles transformers, pour améliorer encore la précision.
Le serveur reste activement maintenu, le groupe Barton continuant à développer JNet, le réseau de neurones sous-jacent. À la date actuelle, Jpred 4 est la version standard, et aucune nouvelle version majeure n'a été annoncée, mais des améliorations continues des bases de données et des algorithmes sont attendues.