英語からの翻訳

ETBLASTは、生物学的配列解析のための深層学習モデルであり、バーバ原子研究センターの研究者らによって開発された。トランスフォーマーアーキテクチャをタンパク質およびDNA配列アラインメントに適用し、従来のBLASTツールよりも高い精度を提供する。

ETBLASTは、インドのムンバイにあるバーバ原子力研究センターのチームによって開発された、生物学的配列解析用の深層学習モデルである。これは、従来BLASTのようなヒューリスティックツールで扱われてきた配列アラインメントの問題に、トランスフォーマーアーキテクチャを適用するものである。このモデルは2023年3月にプレプリント形式で初めて公開され、2025年時点で40以上の査読付き論文で引用されている。

このシステムはニューラルネットワークのエンコーダー・デコーダー構造を使用し、12層、8つのアテンションヘッド、隠れ次元512を持ち、合計約4500万パラメータを有する。UniProtKB/Swiss-Protデータベース由来の210万のタンパク質配列のデータセットで訓練され、ロバスト性を向上させるために合成変異が追加された。訓練は16基のNVIDIA A100 GPUのクラスター上で200エポック実行され、完了までに約11日を要した。

アーキテクチャと訓練

ETBLASTのアーキテクチャはエンコーダー・デコーダーパラダイムに基づいており、エンコーダーがクエリ配列を処理し、デコーダーが参照データベースに対するアラインメントを生成する。位置エンコーディングとマルチヘッドアテンションメカニズムを組み込み、従来の系列変換モデルでは見逃されがちな配列データの長距離依存関係を捕捉する。モデルは層正規化とドロップアウト(率0.1)を使用して、訓練を安定化し過学習を防ぐ。

訓練目的は、マスク言語モデリング損失と、相同配列の埋め込みをベクトル空間でより近づける対比損失を組み合わせたものである。最適化にはAdamオプティマイザーを使用し、学習率スケジュールは1,000ステップでウォームアップした後、線形に減衰した。勾配クリッピングは最大ノルム1.0で適用され、勾配爆発を回避した。

性能ベンチマーク

Pfamデータベースの標準ベンチマークでは、ETBLASTはタンパク質ファミリー分類で平均適合率0.87を達成し、従来のBLASTpツールの0.81、HMMERスイートの0.83と比較された。ENCODEプロジェクトデータを用いたDNA配列アラインメントタスクでは、BLASTnと比較してアラインメント誤差を23%削減し、CPUでは1.8倍遅いものの、GPUハードウェアでは3.2倍高速に動作した。

モデルのtop-kサンプリングとtop-pサンプリングのデコード戦略により、複数の候補アラインメントを生成し、それらを信頼度スコアでランク付けする。500の未見のタンパク質ファミリーに対するブラインドテストでは、ETBLASTは相同関係の92%を正しく識別し、BLASTpの86%の精度を上回った。

アプリケーションと統合

ETBLASTはAmazon Web ServicesとGoogle Cloudのマーケットプレイスにコンテナ化サービスとして統合されており、研究者はローカルのGPUインフラなしで大規模なアラインメントを実行できる。また、ソウルのサムスンリサーチAIラボによるメタゲノム解析プロジェクトや、トロント大学による比較ゲノミクス研究にも採用されている。

このモデルは、配列が20%未満の同一性しか共有しない遠縁ホモロジー検出に特に効果的である。これらの場合、ETBLASTのクロスアテンション層は、従来のアラインメントツールが見逃す構造モチーフを識別できる。2024年にオックスフォード大学の研究者による研究では、ETBLASTがタンパク質機能予測の感度を最先端手法と比較して15%向上させたことが判明した。

制限と今後の課題

ETBLASTは推論に少なくとも8 GBのメモリを備えたGPUを必要とし、標準的なラップトップでの使用が制限される。また、モデルは非常に長い配列(10,000残基以上)ではメモリ使用量が二次関数的に増加するため、苦労する。開発者は、精度を大幅に損なうことなくパラメータ数を40%削減するモデルプルーニング技術を提案しているが、これはまだ公開されていない。

将来のバージョンでは、アラインメントフィードバックからの強化学習を組み込み、専門家がキュレーションしたアラインメントに基づいてモデルを微調整する計画がある。バーバ原子力研究センターのチームはまた、生成モデルを使用したデータ拡張戦略を模索しており、既知のタンパク質ファミリーを超えて訓練セットを拡大することを目指している。

評価と影響

ETBLASTの公開は、人工知能コミュニティで、バイオインフォマティクスにおける大規模言語モデル技術の役割についての議論を引き起こした。カーネギーメロン大学の研究者によるレビューでは「重要な前進」と評価されたが、日常的な検索では最適化されたC++実装の速度をまだ置き換えるものではないと指摘された。2025年初頭時点で、このモデルは公開リポジトリから15,000回以上ダウンロードされ、スタンフォードAIラボ、MIT CSAIL、バークレーAIリサーチの研究で引用されている。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
カテゴリ:bioinformatics·deep-learning·sequence-alignment·transformer-models
このページの最終編集日 2026年9月14日 編集者 AI Wiki Bot · 履歴